Claude
claude-fable-5-1
Anthropic
Ngữ cảnh1M
Giá đầu vào
$3.4000/Tr$10.0000/Tr
Giá đầu ra
$17.0000/Tr$50.0000/Tr
A flagship long-context model for demanding, long-running knowledge work, coding projects, and multi-step agentic tasks. It accepts text, images, and PDFs, making it a strong fit for cross-file analysis, complex research, and sustained tool use. It prioritizes reasoning depth and long-horizon execution over speed and cost, so it is best reserved for tasks where reliable completion matters.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingLong Context
Qwen
qwen3.8-flash
Qwen
Ngữ cảnh1M
Giá đầu vào$0.1492/Tr
Giá đầu ra$0.4476/Tr
An efficient multimodal workhorse in the Qwen family, with a native million-token context window and strong support for coding assistance, agentic workflows, and visual understanding such as charts. It fits long documents, codebases, high-concurrency applications, and tool-assisted tasks.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Zhipu
glm-5.3-flash
Zhipu AI
Ngữ cảnh1.31M
Giá đầu vào$0.1190/Tr
Giá đầu ra$0.4200/Tr
The efficiency-focused Flash model in the GLM-5 family, with native multimodal support and a design aimed at long-context, high-frequency execution. It is a strong fit for coding, agentic workflows, and complex tasks that require image-and-text understanding, especially when production cost matters.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
DeepSeek
deepseek-v4-flash-vision-exp
DeepSeek
Ngữ cảnh1.05M
Giá đầu vào$0.1490/Tr
Giá đầu ra$0.2980/Tr
An experimental multimodal variant of DeepSeek-V4-Flash for image understanding alongside text. A practical choice for visual Q&A, screenshot and document analysis, while its experimental status makes it better suited to evaluation and flexible workflows than strict production-critical paths.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Z.ai
coding-glm-5.3-free
Free channel
Ngữ cảnh1M
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Free models are for learning and trial purposes only and may be removed at any time. Premium models have limited quotas with 5 requests per minute, and their availability is not guaranteed.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Zhipu
glm-5.3
Zhipu AI
Ngữ cảnh1M
Giá đầu vào
$1.0115/Tr$1.1900/Tr
Giá đầu ra
$3.5275/Tr$4.1500/Tr
A flagship workhorse for complex software engineering and long-horizon agent tasks. It uses the same base model as GLM-5.2, with improvements driven by post-training, delivering a 50% gain on Z.ai Code Bench alongside stronger terminal-operation and vulnerability-discovery capabilities. It offers a 1M-token context window, up to 128K output, always-on reasoning with low, high, and max effort levels, function calling, and structured outputs. It currently accepts text only and is not intended for tasks requiring visual understanding.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Gemini
gemini-3.7-flash-free
Free channel
Ngữ cảnh1.05M
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Free models are for learning and trial purposes only and may be removed at any time. Premium models have limited quotas with 5 requests per minute, and their availability is not guaranteed.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Gemini
gemini-3.7-flash
Google
Ngữ cảnh1.05M
Giá đầu vào$0.7500/Tr
Giá đầu ra$3.7500/Tr
A new fast multimodal model in the Gemini 3 family, released in August 2026, built for low-cost, high-throughput multimodal understanding. It accepts text, image, video, audio and document inputs with a 1M-token context, suited to large-scale processing, batch workloads and real-time interactions.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Grok
grok-4.6
xAI
Ngữ cảnh500K
Giá đầu vào$0.8400/Tr
Giá đầu ra$2.5200/Tr
A flagship general-purpose model for high-quality coding, agentic execution, and knowledge work. It fits tasks that need sustained planning, tool collaboration, and complex problem solving; for simple calls where latency or cost matters most, choose a lighter model.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Qwen
qwen3.8-max
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4200/Tr$1.7750/Tr
Giá đầu ra
$4.2640/Tr$5.3300/Tr
Qwen's most capable flagship multimodal reasoning model, built for long-horizon coding, professional work, and multi-stage agent tasks. It accepts text, images, and video, offers a 1M-token context window with up to 128K output, and supports function calling, structured outputs, web search, and a code interpreter. It is best used as a high-quality workhorse for complex tasks rather than for the lowest-cost, lowest-latency batch workloads.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Minimax
MiniMax-H3
MiniMax
MỖI GIÂY$0.0800/s
An omni-modal video generation model that can combine text with image, video, and audio references to create video assets with synchronized audio. It is suited to short-form video, advertising, and reference-driven character or camera work; it is not a general chat model, so prioritize visual consistency, motion, and audio-visual quality.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Claude
claude-opus-5
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
A premium model for complex agentic coding and enterprise knowledge work, emphasizing long-horizon planning, sustained execution, self-checking, and reliable delivery. With a million-token context window, it is suited to large codebases, complex documents, and multi-step projects that need limited human oversight.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Gemini
gemini-3.6-flash
Google
Ngữ cảnh1.05M
Giá đầu vào$1.5000/Tr
Giá đầu ra$7.5000/Tr
The workhorse of the Gemini Flash line, balancing efficiency with coding, knowledge work, and multimodal understanding. Compared with 3.5 Flash, it is designed to complete multi-step tasks with fewer output tokens, reasoning steps, and tool calls, making it a good fit for production agents, document and chart analysis, and frequent complex workflows.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Gemini
gemini-3.5-flash-lite
Google
Ngữ cảnh1.05M
Giá đầu vào$0.3000/Tr
Giá đầu ra$2.5000/Tr
The fastest and most cost-effective model in the Gemini 3.5 line, built for high-throughput, low-latency work such as translation, classification, document processing, and lightweight agentic workflows. It supports multimodal inputs and up to a 1M-token context, while demanding reasoning, long-horizon planning, or high-quality code changes are better handled by a higher-tier Flash model.
Kiểu đầu vào:
Kiểu đầu ra:
Long Context
MoonshotAI
kimi-k3
Moonshot
Ngữ cảnh1.05M
Giá đầu vào
$2.7000/Tr$3.0000/Tr
Giá đầu ra
$13.5000/Tr$15.0000/Tr
Mô hình hàng đầu của Moonshot với tầm nhìn tự nhiên và cửa sổ ngữ cảnh lên tới 1 triệu mã thông báo. Nó hiện đang chạy với nỗ lực suy luận tối đa và phù hợp với mã hóa dài hạn, công việc tri thức và các nhiệm vụ phức tạp phối hợp các công cụ đầu cuối. Để sử dụng ổn định, hãy lưu giữ toàn bộ lịch sử lý luận và bắt đầu phiên mới trong khai thác tác nhân tương thích.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
MoonshotAI
coding-kimi-k3-free
Free channel
Ngữ cảnh1.05M
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Free models are for learning and trial purposes only and may be removed at any time. Premium models have limited quotas with 5 requests per minute, and their availability is not guaranteed.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
OpenAI
gpt-5.6-terra
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.4000/Tr$2.0000/Tr
Giá đầu ra
$2.4000/Tr$12.0000/Tr
The balanced workhorse tier of GPT-5.6, combining capability and cost. Well suited to production work involving image understanding, tool use, and large source material; choose Sol for the hardest quality-first work or Luna for cost-controlled high volume.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
OpenAI
gpt-5.6-sol
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$1.0000/Tr$5.0000/Tr
Giá đầu ra
$6.0000/Tr$30.0000/Tr
The flagship GPT-5.6 tier for complex professional work and quality-first delivery. It supports image input, function calling, structured outputs, and an exceptionally large context window; consider Terra or Luna when latency or unit cost is the primary constraint.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Doubao
doubao-seedream-5-0-pro
Doubao
MỖI GIÂY$0.0450/s
Một mô hình tạo hình ảnh đa phương thức để tạo hình ảnh chuyên nghiệp. Nó có thể tạo hình ảnh từ văn bản và thực hiện các chỉnh sửa chính xác với hình ảnh tham chiếu và chú thích không gian, với thế mạnh về đồ họa thông tin dày đặc, kiểu chữ, ánh sáng chân thực và hiển thị văn bản đa ngôn ngữ.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Grok
grok-4.5
xAI
Ngữ cảnh500K
Giá đầu vào$2.1000/Tr
Giá đầu ra$6.3000/Tr
Một mô hình lý luận biên giới cho mã hóa, công việc tri thức và các nhiệm vụ STEM. Nó hỗ trợ đầu vào hình ảnh, gọi hàm và đầu ra có cấu trúc; Bối cảnh mã thông báo 500K của nó phù hợp với phân tích tệp chéo và tài liệu nguồn dài. Thích một mô hình chi phí thấp hơn khi lý luận biên giới là không cần thiết.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Claude
claude-fable-5
Anthropic
Ngữ cảnh1M
Giá đầu vào
$3.4000/Tr$10.0000/Tr
Giá đầu ra
$17.0000/Tr$50.0000/Tr
Mô hình được phát hành rộng rãi có khả năng nhất của Anthropic, được xây dựng cho công việc tác nhân dài hạn và lý luận đòi hỏi khắt khe nhất. Cung cấp cửa sổ ngữ cảnh 1M mã thông báo với đầu ra tối đa 128k và tư duy thích ứng luôn sẵn sàng, vượt trội trong việc tự động khám phá các nhiệm vụ, lập kế hoạch chưa được xác định và thực hiện mã hóa dài hạn và điều phối đa tác nhân hơn nữa trước khi cần đầu vào của con người.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Gemini
gemini-3.1-flash-lite-image
Google
MỖI LẦN
$0.0120/call$0.0200/call
A high-efficiency image generation and editing model for frequent visual drafts, social assets, posters, and iterative revisions. It supports multimodal inputs and a million-token context, favoring speed and scaled usage; choose Pro Image when complex creative control is the priority.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Claude
claude-sonnet-5
Anthropic
Ngữ cảnh1M
Giá đầu vào
$0.6800/Tr$2.0000/Tr
Giá đầu ra
$3.4000/Tr$10.0000/Tr
Mô hình cấp Sonnet trình điều khiển hàng ngày nhằm mục đích mang lại khả năng làm việc tri thức, mã hóa và đại lý gần biên giới với chi phí vận hành thấp hơn. Bối cảnh mã thông báo 1M mặc định và tư duy thích ứng của nó phù hợp với các tài liệu dài, cơ sở mã và quy trình làm việc của công cụ nhiều bước; đối với lý do sâu sắc nhất hoặc công việc bảo mật có rủi ro cao bị hạn chế, hãy đánh giá các mô hình cấp cao hơn hoặc chuyên biệt.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Doubao
doubao-seedance-2.5-260628
Doubao
Giá đầu vào
$3.6594/Tr$3.8520/Tr
Giá đầu ra
$3.6594/Tr$3.8520/Tr
A next-generation Seedance model for long-form storytelling and complex creative workflows, with more flexible multimodal references, video extension, and precise editing. It is well suited to advertising, short films, and production work that must preserve character, scene, and audio-visual continuity.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
doubao-seed-2-1-pro
Doubao
Ngữ cảnh256K
Giá đầu vào$0.9700/Tr
Giá đầu ra$4.8800/Tr
Được xây dựng dành cho các tác vụ mã hóa, tác nhân và năng suất phức tạp, vượt xa Doubao Seed 2.0 trong bối cảnh dài, đầu ra dài và quy trình làm việc hướng đến công cụ. So với các công ty ngang hàng Qwen, GLM và DeepSeek, đây là một lựa chọn tiết kiệm chi phí cho công việc văn phòng, mã hóa và tự động hóa nhiều bước của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Qwen
happyhorse-1.1-t2v
阿里巴巴
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển văn bản thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
happyhorse-1.1-r2v
阿里巴巴
MỖI GIÂY$0.1350/s
Được xây dựng để tham chiếu đến video, với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
happyhorse-1.1-i2v
阿里巴巴
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển hình ảnh thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
dreamina-seedance-2-0-mini-filter-off
Doubao
Giá đầu vào$1.5750/Tr
Giá đầu ra$1.5750/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Zhipu
glm-5.2
Zhipu AI
Ngữ cảnh1M
Giá đầu vào
$0.9690/Tr$1.1400/Tr
Giá đầu ra
$3.4000/Tr$4.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa và tác nhân ngữ cảnh dài, cải thiện so với GLM-5.1 về độ dài ngữ cảnh, cách sử dụng công cụ và quy trình công việc gồm nhiều bước phức tạp. So với các công ty hàng đầu của Trung Quốc như Qwen, DeepSeek và Kimi, nó phù hợp với tự động hóa doanh nghiệp, phân tích mã cấp dự án và công việc tri thức bằng tiếng Trung.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Doubao
doubao-seedance-2.0-mini-260615
Doubao
Giá đầu vào
$0.3150/Tr$0.6300/Tr
Giá đầu ra
$0.3150/Tr$0.6300/Tr
A lightweight Seedance 2.0 variant that retains reference-driven video generation with text, images, and video. It is better suited to rapid iteration, batch drafts, and cost-sensitive workflows; choose the standard model when complex motion control, camera work, or final quality matters more.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
MoonshotAI
kimi-k2.7-code-highspeed
Moonshot
Ngữ cảnh256K
Giá đầu vào$1.9000/Tr
Giá đầu ra$7.9999/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2.6. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseFunction CallingStructured OutputLong Context
MoonshotAI
kimi-k2.7-code
Moonshot
Ngữ cảnh256K
Giá đầu vào
$0.8775/Tr$0.9750/Tr
Giá đầu ra
$3.6450/Tr$4.0500/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2.6. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseFunction CallingStructured OutputLong Context
Grok
grok-imagine-video-1-5-preview
xAI
MỖI GIÂY$0.1400/s
Được xây dựng để tạo, chỉnh sửa và mở rộng dựa trên hình ảnh/video, với tính nhất quán chuyển động mạnh hơn và sản xuất nội dung xã hội nhanh hơn Grok Imagine 1.0. So với Veo, Kling và Runway, nó phù hợp với các video dạng ngắn, ý tưởng quảng cáo và nội dung theo xu hướng trong hệ sinh thái xAI.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
qwen3.7-plus
Qwen
Ngữ cảnh1M
Giá đầu vào
$0.2400/Tr$0.3000/Tr
Giá đầu ra
$0.9600/Tr$1.2000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Minimax
minimax-m3-free
Free channel
Ngữ cảnh1M
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Free models are for learning and trial purposes only and may be removed at any time. Premium models have limited quotas with 5 requests per minute, and their availability is not guaranteed.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Minimax
MiniMax-M3
MiniMax
Ngữ cảnh1M
Giá đầu vào$0.3150/Tr
Giá đầu ra$1.2600/Tr
Được xây dựng để mã hóa trong thời gian dài, sử dụng công cụ và cộng tác sản xuất nhiều lượt, mở rộng ra ngoài MiniMax M2.7 với đầu vào đa phương thức trong khi vẫn giữ cửa sổ ngữ cảnh mã thông báo 1M. So với các mô hình tác nhân ngữ cảnh dài Claude, Gemini và GLM-5.2, việc đưa các tài liệu văn bản, hình ảnh và video vào một quy trình làm việc sẽ tốt hơn.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Claude
claude-opus-4-8
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn Claude Opus 4.7 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Gemini
gemini-omni-video
Google
MỖI GIÂY$0.2450/s
Được xây dựng để tạo đa phương thức từ bất kỳ đầu vào vào video nào, nhấn mạnh hơn quy trình làm việc video của Gemini trước đó vào việc phối hợp thống nhất các tài liệu văn bản, hình ảnh, âm thanh và video. So với Veo, Kling và Runway, việc tích hợp các nội dung đa phương thức phức tạp vào một quy trình làm việc sáng tạo sẽ tốt hơn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
gemini-3.5-flash
Google
Ngữ cảnh1M
Giá đầu vào$1.5000/Tr
Giá đầu ra$9.0000/Tr
Được xây dựng để hiểu đa phương thức, mã hóa và các tác vụ theo ngữ cảnh dài, cải thiện so với Gemini 3.1 về thông lượng, ngữ cảnh và khả năng của công cụ. So với các mô hình GPT, Claude và Qwen, nó mạnh mẽ cho quy trình phân tích thống nhất trên văn bản, hình ảnh, âm thanh, video và tài liệu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Qwen
qwen3.7-max
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4400/Tr$1.8000/Tr
Giá đầu ra
$4.3200/Tr$5.4000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Qwen
happyhorse-1.0-video-edit
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Để chỉnh sửa video, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
happyhorse-1.0-t2v
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Wensheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
happyhorse-1.0-r2v
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Việc tạo video để tham khảo, so với các mẫu video ban đầu, nổi bật hơn trong việc tạo âm thanh gốc và hoàn thành đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về nhân vật. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
happyhorse-1.0-i2v
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Tusheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
DeepSeek
deepseek-v4-pro
DeepSeek
Ngữ cảnh1M
Giá đầu vào
$1.5390/Tr$1.7100/Tr
Giá đầu ra
$3.0869/Tr$3.4299/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
DeepSeek
deepseek-v4-flash
DeepSeek
Ngữ cảnh1M
Giá đầu vào
$0.1278/Tr$0.1420/Tr
Giá đầu ra
$0.2574/Tr$0.2860/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
OpenAI
gpt-5.5
OpenAI
Ngữ cảnh1M
Giá đầu vào
$1.0000/Tr$5.0000/Tr
Giá đầu ra
$6.0000/Tr$30.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.4. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
XiaomiMiMo
mimo-v2.5-tts-voicedesign
Xiaomi MiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được xây dựng để thiết kế giọng nói một câu và chuyển văn bản thành giọng nói, với khả năng tạo giọng nói ngôn ngữ tự nhiên mạnh mẽ hơn dòng V2.5, kiểm soát nhịp độ/cảm xúc/giọng điệu chi tiết và tạo ra giọng nói ma sát thấp hơn MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất hữu ích cho việc thiết kế giọng nói nhân vật không có tham chiếu, thuyết minh quảng cáo, tường thuật video ngắn và khám phá giọng nói đa phong cách.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
mimo-v2.5-tts-voiceclone
Xiaomi MiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được thiết kế để sao chép giọng nói ít mẫu, với khả năng tái tạo âm sắc có độ trung thực cao dòng V2.5 mạnh mẽ hơn, tính nhất quán của giọng nói và khả năng tổng quát hóa nhiều văn bản so với MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất phù hợp với lồng tiếng ký tự tiếng Trung, tường thuật video ngắn, sao chép giọng nói podcast và sản xuất giọng nói đa ngôn ngữ cần duy trì giọng nói mục tiêu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
mimo-v2.5-tts
Xiaomi MiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được xây dựng để chuyển văn bản thành giọng nói, thiết kế giọng nói và sao chép giọng nói, với khả năng tổng hợp giọng nói tự nhiên mạnh mẽ hơn dòng V2.5, kiểm soát nhịp độ/cảm xúc/giọng điệu chi tiết và tạo giọng nói ít ma sát hơn MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất phù hợp với tường thuật tiếng Trung, lồng tiếng nhân vật, âm thanh video ngắn và sản xuất giọng nói đa ngôn ngữ.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
mimo-v2.5-pro
Xiaomi MiMo
Ngữ cảnh1M
Giá đầu vào$1.1700/Tr
Giá đầu ra$3.5000/Tr
Được xây dựng cho các tác nhân, mã hóa và các tác vụ theo ngữ cảnh dài, cung cấp sự hiểu biết đa phương thức hoàn chỉnh hơn, cửa sổ ngữ cảnh có hàng triệu mã thông báo và khả năng suy luận theo chiều dài hơn MiMo V2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và DeepSeek, điểm mạnh của nó là các kịch bản tự động hóa kỹ thuật và phù hợp với hệ sinh thái Xiaomi.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
XiaomiMiMo
mimo-v2.5
Xiaomi MiMo
Ngữ cảnh1M
Giá đầu vào$0.4700/Tr
Giá đầu ra$2.3600/Tr
Được xây dựng cho các tác nhân, mã hóa và các tác vụ theo ngữ cảnh dài, cung cấp sự hiểu biết đa phương thức hoàn chỉnh hơn, cửa sổ ngữ cảnh có hàng triệu mã thông báo và khả năng suy luận theo chiều dài hơn MiMo V2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và DeepSeek, điểm mạnh của nó là các kịch bản tự động hóa kỹ thuật và phù hợp với hệ sinh thái Xiaomi.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
OpenAI
gpt-image-2-text-to-image
OpenAI
Ngữ cảnh128K
MỖI ẢNH$0.0300/image
Đây là một tuyến thử nghiệm giảm giá. Quá trình tạo có thể mất nhiều thời gian hơn và có khoảng 10% khả năng thất bại. Tốt nhất là dành cho các thử nghiệm tạo hình ảnh có chi phí nhạy cảm trong đó có thể chấp nhận được việc xếp hàng và lỗi không thường xuyên; để sử dụng sản xuất ổn định hơn, hãy chọn lộ trình thông thường.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
OpenAI
gpt-image-2-image-to-image
OpenAI
Ngữ cảnh128K
MỖI ẢNH$0.0200/image
Đây là một tuyến thử nghiệm giảm giá. Quá trình tạo có thể mất nhiều thời gian hơn và có khoảng 10% khả năng thất bại. Tốt nhất là dành cho các thử nghiệm tạo hình ảnh có chi phí nhạy cảm trong đó có thể chấp nhận được việc xếp hàng và lỗi không thường xuyên; để sử dụng sản xuất ổn định hơn, hãy chọn lộ trình thông thường.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
OpenAI
gpt-image-2
OpenAI
Ngữ cảnh128K
MỖI ẢNH$0.0670/image
Được xây dựng để tạo và chỉnh sửa hình ảnh chất lượng cao, cải tiến so với GPT Image 1.x về khả năng hiển thị văn bản, chỉnh sửa cục bộ và tính nhất quán nhiều lượt. So với các mô hình hình ảnh Gemini, Qwen Image và Seedream, nó rất phù hợp với hình ảnh thương hiệu, thiết kế quảng cáo, hình ảnh sản phẩm và quy trình làm việc sáng tạo được kiểm soát chặt chẽ.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Claude
claude-opus-4-7
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn Claude Opus 4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Minimax
MiniMax-M2.7-highspeed
MiniMax
Ngữ cảnh200K
Giá đầu vào$0.6300/Tr
Giá đầu ra$2.5200/Tr
Được xây dựng để tạo văn bản, lý luận và sử dụng công cụ, với độ ổn định quy trình làm việc tác nhân và ngữ cảnh dài 200K mạnh hơn so với các phiên bản MiniMax M2.x trước đó. So với các công ty cùng ngành của Trung Quốc như Kimi, GLM và Qwen, nó phù hợp hơn về năng suất, hỗ trợ mã hóa và xử lý tài liệu dài.
Kiểu đầu vào:
Kiểu đầu ra:
Reasoning
Minimax
MiniMax-M2.7
MiniMax
Ngữ cảnh200K
Giá đầu vào$0.3150/Tr
Giá đầu ra$1.2600/Tr
Được xây dựng để tạo văn bản, lý luận và sử dụng công cụ, với độ ổn định quy trình làm việc tác nhân và ngữ cảnh dài 200K mạnh hơn so với các phiên bản MiniMax M2.x trước đó. So với các công ty cùng ngành của Trung Quốc như Kimi, GLM và Qwen, nó phù hợp hơn về năng suất, hỗ trợ mã hóa và xử lý tài liệu dài.
Kiểu đầu vào:
Kiểu đầu ra:
Reasoning
OpenAI
gpt-5.4-mini
OpenAI
Ngữ cảnh400K
Giá đầu vào$0.7500/Tr
Giá đầu ra$4.5000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.3. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
OpenAI
gpt-5.4
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.5000/Tr$2.5000/Tr
Giá đầu ra
$3.0000/Tr$15.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.3. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
Qwen
qwen-image-2.0-pro
Qwen
Giá đầu vào$2.2000/Tr
Giá đầu ra$2.2000/Tr
Được xây dựng để tạo và chỉnh sửa hình ảnh, cải tiến so với Qwen Image 1.x trong khả năng hiển thị văn bản tiếng Trung, làm theo hướng dẫn và bố cục phức tạp. So với GPT Image, mô hình hình ảnh Gemini và Seedream, nó rất phù hợp với áp phích, hình ảnh thương mại điện tử, đồ họa thông tin và sáng tạo hình ảnh lặp đi lặp lại của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
qwen-image-2.0
Qwen
Giá đầu vào$2.2000/Tr
Giá đầu ra$2.2000/Tr
Được xây dựng để tạo và chỉnh sửa hình ảnh, cải tiến so với Qwen Image 1.x trong khả năng hiển thị văn bản tiếng Trung, làm theo hướng dẫn và bố cục phức tạp. So với GPT Image, mô hình hình ảnh Gemini và Seedream, nó rất phù hợp với áp phích, hình ảnh thương mại điện tử, đồ họa thông tin và sáng tạo hình ảnh lặp đi lặp lại của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
gemini-3.1-flash-image-preview
Google
Ngữ cảnh131K
MỖI ẢNH$0.0672/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Gemini
gemini-3.1-flash-image
Google
MỖI ẢNH
$0.0198/image$0.0330/image
An efficient Gemini image tier that balances quality and speed for text-to-image generation, image editing, multi-image composition, and workflows that need fast, scalable output. It offers flexible composition and text rendering, while complex professional design may be better served by Gemini 3 Pro Image.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
gemini-3.1-pro-preview
Google
Ngữ cảnh1.05M
Giá đầu vào$2.0000/Tr
Giá đầu ra$12.0000/Tr
Được xây dựng để hiểu đa phương thức, mã hóa và các tác vụ có ngữ cảnh dài, cải thiện so với Gemini 3.0 / 2.5 về thông lượng, ngữ cảnh và khả năng của công cụ. So với các mô hình GPT, Claude và Qwen, nó mạnh mẽ cho quy trình phân tích thống nhất trên văn bản, hình ảnh, âm thanh, video và tài liệu.
Kiểu đầu vào:
Kiểu đầu ra:
Long Context
Claude
claude-sonnet-4-6
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.0200/Tr$3.0000/Tr
Giá đầu ra
$5.1000/Tr$15.0000/Tr
Đối với các tác vụ tác nhân và mã hóa hiệu quả, nó còn tiến xa hơn phiên bản đặt hàng trước của Claude 4.5/4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Doubao
doubao-seed-2-0-pro
Doubao
Ngữ cảnh256K
Giá đầu vào$0.5000/Tr
Giá đầu ra$2.5300/Tr
Được xây dựng dành cho các tác vụ mã hóa, tác nhân và năng suất phức tạp, vượt xa Doubao Seed 2.0 trong bối cảnh dài, đầu ra dài và quy trình làm việc hướng đến công cụ. So với các công ty ngang hàng Qwen, GLM và DeepSeek, đây là một lựa chọn tiết kiệm chi phí cho công việc văn phòng, mã hóa và tự động hóa nhiều bước của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong Context
Doubao
doubao-seedream-5.0-lite
Doubao
MỖI ẢNH$0.0350/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với hướng dẫn tiếng Trung mạnh mẽ hơn, lý luận trực quan và sản xuất sáng tạo tần suất cao hơn Seedream 4.x. So với GPT Image, mô hình hình ảnh Gemini và Qwen Image, nó rất phù hợp với thiết kế quảng cáo hệ sinh thái ByteDance, nội dung thương mại điện tử và sản xuất hình ảnh đa kịch bản.
Kiểu đầu vào:
Kiểu đầu ra:
Web SearchMultimodal Output
Minimax
MiniMax-M2.5
MiniMax
Ngữ cảnh205K
Giá đầu vào$0.3020/Tr
Giá đầu ra$1.2077/Tr
Một mô hình tiết kiệm chi phí dành cho các tác nhân có năng suất thực sự, mạnh mẽ nhất về mã hóa, sử dụng công cụ, tìm kiếm và cung cấp các sản phẩm theo phong cách văn phòng thay vì chỉ trò chuyện thông thường. Nó phù hợp với các tác nhân lập kế hoạch và thực hiện các thay đổi trên nhiều tệp, truy xuất nghiên cứu và quy trình làm việc về tài liệu/bảng tính/trình bày; so với những chiếc điện thoại cao cấp đắt tiền hơn, sự đánh đổi chính là chi phí thấp hơn để đạt được hiệu quả thực thi gần biên giới.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Doubao
doubao-seedance-2-0-filter-off
Doubao
Ngữ cảnh13K
Giá đầu vào$3.1500/Tr
Giá đầu ra$3.1500/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
doubao-seedance-2-0-fast-filter-off
Doubao
Ngữ cảnh13K
Giá đầu vào$2.5200/Tr
Giá đầu ra$2.5200/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Claude
claude-opus-4-6
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn phiên bản đặt hàng trước của Claude 4.5/4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Kling
kling-v3-omni
kling
MỖI GIÂY$0.0900/s
Được xây dựng để tạo văn bản/hình ảnh thành video và chụp nhiều ảnh, cải thiện so với Kling 2.x về độ ổn định chuyển động, ngôn ngữ máy ảnh và tính nhất quán tham chiếu. So với Veo, Runway và Seedance, nó rất phù hợp với phim truyền hình ngắn, nội dung quảng cáo và sản xuất video xã hội chất lượng cao của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Kling
kling-v3
kling
MỖI GIÂY$0.0900/s
Được xây dựng để tạo văn bản/hình ảnh thành video và chụp nhiều ảnh, cải thiện so với Kling 2.x về độ ổn định chuyển động, ngôn ngữ máy ảnh và tính nhất quán tham chiếu. So với Veo, Runway và Seedance, nó rất phù hợp với phim truyền hình ngắn, nội dung quảng cáo và sản xuất video xã hội chất lượng cao của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
doubao-seedance-2.0-fast-260128
Doubao
Giá đầu vào
$1.4566/Tr$1.7136/Tr
Giá đầu ra
$1.4566/Tr$1.7136/Tr
The speed-prioritized Seedance 2.0 variant for low-latency generation and rapid iteration. It fits batch look development, creative exploration, and workflows that need usable video drafts quickly; choose the standard model when complex reference fusion, motion stability, and final polish are the priority.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
doubao-seedance-2.0-260128
Doubao
Giá đầu vào
$2.1606/Tr$2.2743/Tr
Giá đầu ra
$2.1606/Tr$2.2743/Tr
The standard Seedance 2.0 model for controllable video creation from combined text, image, audio, and video references. It balances complex motion, multi-subject interaction, camera control, and joint audio-video generation, making it a solid default for ads, short films, and high-quality production assets.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
gemini-3-flash-preview
Google
Ngữ cảnh1M
Giá đầu vào$0.5000/Tr
Giá đầu ra$3.0000/Tr
Mô hình tư duy tốc độ cao của Google được thiết kế cho quy trình làm việc tổng thể, trò chuyện nhiều lượt và hỗ trợ mã hóa. Hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và PDF với cửa sổ ngữ cảnh mã thông báo 1M. Có các cấp độ tư duy có thể định cấu hình, cách sử dụng công cụ và kết quả đầu ra có cấu trúc. Cải tiến chất lượng rộng rãi so với Gemini 2.5 Flash về lý luận, hiểu biết đa phương thức và độ tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Gemini
gemini-3-pro-image-preview
Google
Ngữ cảnh66K
MỖI ẢNH$0.1340/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Gemini
gemini-3-pro-image
Google
MỖI ẢNH
$0.0318/image$0.0530/image
A reasoning-driven image generation and editing model for professional creative work, including complex graphic design, high-fidelity product mockups, infographics, and visuals that require accurate text rendering. Compared with the faster Flash Image tier, it prioritizes fine control, grounded content, and polished output.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Claude
claude-opus-4-5
Anthropic
Ngữ cảnh200K
Giá đầu vào$5.0000/Tr
Giá đầu ra$25.0000/Tr
Nhằm mục đích lý luận hàng đầu và các nhiệm vụ tác nhân phức tạp, nó tiến xa hơn các phiên bản đặt hàng trước của dòng Claude 4 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Gemini
veo3.1-lite
Google
MỖI LẦN$0.1100/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định. Cấp Lite ưu tiên các bản nháp có thông lượng cao, chi phí thấp hơn so với cấp tiêu chuẩn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
veo3.1-fast
Google
MỖI LẦN$0.2211/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định. Bậc Nhanh phù hợp để xác thực khái niệm nhanh hơn bậc tiêu chuẩn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
veo3.1
Google
MỖI LẦN$1.6544/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
gemini-2.5-flash-image
Google
Ngữ cảnh66K
MỖI ẢNH$0.0585/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
Structured OutputMultimodal Output
Claude
claude-haiku-4-5
Anthropic
Ngữ cảnh200K
Giá đầu vào
$0.3400/Tr$1.0000/Tr
Giá đầu ra
$1.7000/Tr$5.0000/Tr
Đối với các tác vụ tác nhân và mã hóa hiệu quả, nó còn vượt xa Claude Haiku 3.5 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Qwen
wan3.0-video-prime
Qwen
MỖI GIÂY$0.4500/s
The speed-first variant of Alibaba's Wan 3.0 line (early access). It shortens generation latency while retaining high-quality video output, making it a good fit for low-latency previews, batch drafts and fast-iterating short-video workflows. If ultimate visual control matters more than speed, the standard version is a better choice.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
wan3.0-video
Qwen
MỖI GIÂY$0.3000/s
The standard video generation model of Alibaba's Wan 3.0 line (early access). It supports text-to-video, image-to-video and multi-modal reference inputs, generating clips up to roughly 30 seconds with synchronized audio in a single pass — suitable for ads, short drama and narrative content. Official release date not yet announced.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Zhipu
glm-image
Zhipu AI
Giá đầu vào$0.8800/Tr
Giá đầu ra$3.5500/Tr
Được xây dựng để tạo và chỉnh sửa hình ảnh, với trọng tâm mạnh mẽ hơn các khả năng thị giác GLM trước đó về lời nhắc tiếng Trung, hiểu văn bản hình ảnh và tạo có thể kiểm soát. So với Hình ảnh GPT, mô hình hình ảnh Gemini và Hình ảnh Qwen, nó phù hợp với tài sản tiếp thị của Trung Quốc, hình ảnh giải thích và chỉnh sửa hình ảnh lặp đi lặp lại.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
dreamina-seedance-2-5-filter-off
Doubao
Giá đầu vào$75.0000/Tr
Giá đầu ra$75.0000/Tr
WhatsApp