Claude
Ngữ cảnh1M
Giá đầu vào
$0.1700/Tr$0.5000/Tr
Giá đầu ra
$0.8500/Tr$2.5000/Tr
The Claude option for high-volume, latency-sensitive work such as classification, extraction, routing, and subagent tasks. Compared with Haiku 4.5, it expands the context window to 1M tokens and adds adaptive thinking; consider Sonnet or Opus for harder work.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Ngữ cảnh131K
MỖI GIÂY$0.0530/s
A fast choice for image creation and conversational editing. Compared with Nano Banana 2, it improves visual quality, text and infographic layout, wide-format images, and character consistency across edits. It supports multiple reference images and 1K, 2K, or 4K output; consider Nano Banana Pro for the most demanding brand and precision work.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchLong ContextMultimodal Output
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.4000/Tr$2.0000/Tr
Giá đầu ra
$2.0000/Tr$10.0000/Tr
For complex coding, computer use, and professional document work. It improves on GPT-6 Sol in demanding tasks and approaches Astra at a lower cost; choose Astra when maximum quality is the priority.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$0.6800/Tr$2.0000/Tr
Giá đầu ra
$3.4000/Tr$10.0000/Tr
A strong workhorse balancing speed and intelligence: a 1M-token context window, text and image input, text output, adaptive thinking, and tool use for project-level coding, multi-step tasks, and knowledge work. Its main advantage over Sonnet 5 is faster, more token-efficient execution; choose Opus 5.5 when maximum quality for harder tasks matters more.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$1.3600/Tr$4.0000/Tr
Giá đầu ra
$6.8000/Tr$20.0000/Tr
Built for long-running agentic coding and knowledge work, especially cross-file refactors, codebase audits, and complex multi-step tasks. Its 1M-token context, always-on adaptive thinking, and text/image input favor high-quality long-horizon execution; compared with Sonnet 5, it prioritizes depth at higher cost and latency.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Thử mô hình
OpenAI
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.4000/Tr$2.0000/Tr
Giá đầu ra
$2.0000/Tr$10.0000/Tr
Built for complex coding and agentic workflows, including project-level programming, long-horizon planning, and multi-step tool use. Its 1.05M-token context, text/image input, reasoning, function calling, and structured outputs make it the workhorse choice; it costs more than GPT-6 Luna when quality and execution stability matter most.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.0200/Tr$0.1000/Tr
Giá đầu ra
$0.1000/Tr$0.5000/Tr
Designed for focused, high-volume work such as batch summarization, classification, rewriting, and frequent agent calls. It still offers a 1.05M-token context, text/image input, reasoning, function calling, and structured outputs, but trades depth for much lower cost; prefer GPT-6 Sol for the hardest long-horizon tasks.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
DeepSeek
Ngữ cảnh1M
Giá đầu vào
$0.2700/Tr$0.3000/Tr
Giá đầu ra
$1.0800/Tr$1.2000/Tr
A strong high-throughput, lower-cost default for general and agentic work: it natively understands images and supports a 1M-token context, optional thinking and non-thinking modes, tool calls, and JSON output. Compared with the higher-tier V4 Pro, it is positioned around speed, throughput, and cost efficiency, making it practical for long documents, coding/agents, and image-text analysis; enable thinking when deeper reasoning is needed.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Ngữ cảnh400K
MỖI ẢNH$0.0080/image
The discounted-price route for GPT Image 2.5 Sunburst, mapped by the current channel to Sunburst. Sale indicates a special-price route and does not change Sunbursts role in high-precision image generation and editing. Best for cost-sensitive professional visual work that still needs reference-image editing and detail control; use regular gpt-image-2.5-sunburst when you want the standard route.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal OutputLong Context
Thử mô hình
Ngữ cảnh400K
MỖI ẢNH
$0.0336/image$0.0480/image
Built for premium visual workflows where editing precision and finished-image quality matter most: a better fit for production campaign creative, polished product imagery, and multi-turn edits that need to preserve the subject, composition, and visual treatment. It accepts text and reference-image inputs and produces images, with longer generation times than Flare.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal OutputLong Context
Thử mô hình
Ngữ cảnh400K
MỖI ẢNH$0.0080/image
The discounted-price route for GPT Image 2.5 Flare, mapped by the current channel to Flare. Sale indicates a special-price route and does not change Flares role in fast, high-quality everyday image generation and editing. Best for cost-sensitive, frequent image tasks; use regular gpt-image-2.5-flare when you want the standard route.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal OutputLong Context
Thử mô hình
Ngữ cảnh400K
MỖI ẢNH
$0.0336/image$0.0480/image
A strong default for high-quality image generation and editing: optimized for faster iteration across creator and social content, product experiences, visual search, rapid prototyping, and high-volume generation. It accepts text and reference-image inputs and produces images; choose Sunburst when tighter editing control matters more than speed.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal OutputLong Context
Thử mô hình
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$2.0000/Tr$10.0000/Tr
Giá đầu ra
$10.0000/Tr$50.0000/Tr
A flagship end-to-end model for complex reasoning, software engineering, computer use, deep research, and document work. It offers about a 1.05M-token context window, accepts text, images, and documents, returns text, and supports reasoning, search, function calling, structured outputs, code execution, and tool orchestration. Choose it over lower-tier models for long-horizon task quality and execution stability, with higher usage cost as the trade-off.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
Gemini
Ngữ cảnh1.05M
Giá đầu vào$0.7874/Tr
Giá đầu ra$3.9370/Tr
The flagship Flash model for long-horizon software engineering, autonomous agents, and complex enterprise workflows. It keeps the speed and cost profile of Flash while adding stronger reasoning and tool orchestration. It accepts text, images, video, audio, and PDF input, with about a 1.05M-token context window, search grounding, function calling, code execution, structured outputs, and tunable thinking. Prefer it over Flash-Lite for harder tasks, at higher usage cost.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$3.4000/Tr$10.0000/Tr
Giá đầu ra
$17.0000/Tr$50.0000/Tr
A flagship long-context model for demanding, long-running knowledge work, coding projects, and multi-step agentic tasks. It accepts text, images, and PDFs, making it a strong fit for cross-file analysis, complex research, and sustained tool use. It prioritizes reasoning depth and long-horizon execution over speed and cost, so it is best reserved for tasks where reliable completion matters.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingLong Context
Thử mô hình
Ngữ cảnh1M
Giá đầu vào$0.1492/Tr
Giá đầu ra$0.4476/Tr
An efficient multimodal workhorse in the Qwen family, with a native million-token context window and strong support for coding assistance, agentic workflows, and visual understanding such as charts. It fits long documents, codebases, high-concurrency applications, and tool-assisted tasks.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Zhipu
Ngữ cảnh1.31M
Giá đầu vào$0.1190/Tr
Giá đầu ra$0.4200/Tr
The efficiency-focused Flash model in the GLM-5 family, with native multimodal support and a design aimed at long-context, high-frequency execution. It is a strong fit for coding, agentic workflows, and complex tasks that require image-and-text understanding, especially when production cost matters.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Ngữ cảnh1.05M
Giá đầu vào$0.1490/Tr
Giá đầu ra$0.2980/Tr
An experimental multimodal variant of DeepSeek-V4-Flash for image understanding alongside text. A practical choice for visual Q&A, screenshot and document analysis, while its experimental status makes it better suited to evaluation and flexible workflows than strict production-critical paths.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Thử mô hình
MỖI GIÂY$0.0675/s
The speed-first variant of Alibaba's Wan 3.0 line (early access). It shortens generation latency while retaining high-quality video output, making it a good fit for low-latency previews, batch drafts and fast-iterating short-video workflows. If ultimate visual control matters more than speed, the standard version is a better choice.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Zhipu
Zhipu AI
Ngữ cảnh1M
Giá đầu vào
$1.0115/Tr$1.1900/Tr
Giá đầu ra
$3.5275/Tr$4.1500/Tr
A flagship workhorse for complex software engineering and long-horizon agent tasks. It uses the same base model as GLM-5.2, with improvements driven by post-training, delivering a 50% gain on Z.ai Code Bench alongside stronger terminal-operation and vulnerability-discovery capabilities. It offers a 1M-token context window, up to 128K output, always-on reasoning with low, high, and max effort levels, function calling, and structured outputs. It currently accepts text only and is not intended for tasks requiring visual understanding.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Gemini
Ngữ cảnh1.05M
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Free models are for learning and trial purposes only and may be removed at any time. Premium models have limited quotas with 5 requests per minute, and their availability is not guaranteed.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Thử mô hình
Gemini
Ngữ cảnh1.05M
Giá đầu vào$0.7500/Tr
Giá đầu ra$3.7500/Tr
A new fast multimodal model in the Gemini 3 family, released in August 2026, built for low-cost, high-throughput multimodal understanding. It accepts text, image, video, audio and document inputs with a 1M-token context, suited to large-scale processing, batch workloads and real-time interactions.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Thử mô hình
Grok
Ngữ cảnh500K
Giá đầu vào$0.8400/Tr
Giá đầu ra$2.5200/Tr
A flagship general-purpose model for high-quality coding, agentic execution, and knowledge work. It fits tasks that need sustained planning, tool collaboration, and complex problem solving; for simple calls where latency or cost matters most, choose a lighter model.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Qwen
MỖI GIÂY$0.0450/s
The standard video generation model of Alibaba's Wan 3.0 line (early access). It supports text-to-video, image-to-video and multi-modal reference inputs, generating clips up to roughly 30 seconds with synchronized audio in a single pass — suitable for ads, short drama and narrative content. Official release date not yet announced.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4200/Tr$1.7750/Tr
Giá đầu ra
$4.2640/Tr$5.3300/Tr
Qwen's most capable flagship multimodal reasoning model, built for long-horizon coding, professional work, and multi-stage agent tasks. It accepts text, images, and video, offers a 1M-token context window with up to 128K output, and supports function calling, structured outputs, web search, and a code interpreter. It is best used as a high-quality workhorse for complex tasks rather than for the lowest-cost, lowest-latency batch workloads.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
Giá đầu vào
$3.0865/Tr$3.2490/Tr
Giá đầu ra
$3.0865/Tr$3.2490/Tr
A better fit for moving from a single clip toward a complete audiovisual story: it can generate up to 30 seconds in one pass, supports multiple extensions, accepts image, video, and audio references, and adds timestamp-level editing, green-screen, and camera control. It suits ads and short films that need continuity, while complex multi-subject motion still deserves human review.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Minimax
MiniMax
MỖI GIÂY$0.0800/s
An omni-modal video generation model that can combine text with image, video, and audio references to create video assets with synchronized audio. It is suited to short-form video, advertising, and reference-driven character or camera work; it is not a general chat model, so prioritize visual consistency, motion, and audio-visual quality.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Giá đầu vào$3.3042/Tr
Giá đầu ra$3.3042/Tr
A route variant of Seedance 2.5; evaluate it by the underlying model rather than the route suffix. It is suited to ads, branded content, and narrative shorts, with up to 30-second audio-video generation, multi-round extension, text/image/audio/video references, R2V control, and timestamp-level editing. Complex motion and multi-subject physical consistency still benefit from human review.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Claude
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
A premium model for complex agentic coding and enterprise knowledge work, emphasizing long-horizon planning, sustained execution, self-checking, and reliable delivery. With a million-token context window, it is suited to large codebases, complex documents, and multi-step projects that need limited human oversight.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Ngữ cảnh1.05M
Giá đầu vào$0.3000/Tr
Giá đầu ra$2.5000/Tr
The fastest and most cost-effective model in the Gemini 3.5 line, built for high-throughput, low-latency work such as translation, classification, document processing, and lightweight agentic workflows. It supports multimodal inputs and up to a 1M-token context, while demanding reasoning, long-horizon planning, or high-quality code changes are better handled by a higher-tier Flash model.
Kiểu đầu vào:
Kiểu đầu ra:
Long Context
Thử mô hình
MỖI GIÂY
$0.0024/s$0.0030/s
A quality-first image generation and editing model: it supports text-to-image and edits from 1–3 reference images, accepts prompts of up to about 4.5K tokens, and is aimed at dense layouts, fine 10px-scale text, 12 languages, and multiple fonts. Choose it over the standard variant when complex composition and detail fidelity matter more than speed or cost; use the standard variant for a faster, more economical workflow.
Kiểu đầu vào:
Kiểu đầu ra:
MỖI GIÂY
$0.0024/s$0.0030/s
The balanced standard tier of Qwen-Image 3.0 for image generation and editing: it supports text-to-image and edits from 1–3 reference images, prompts of up to about 4.5K tokens, up to six outputs, and 2K-class resolution. It fits everyday posters, interfaces, infographics, and repeated creative work; move to Pro when complex layouts and fine text fidelity matter more, and use this tier when speed and cost efficiency are the priority.
Kiểu đầu vào:
Kiểu đầu ra:
MoonshotAI
Moonshot
Ngữ cảnh1.05M
Giá đầu vào
$2.7000/Tr$3.0000/Tr
Giá đầu ra
$13.5000/Tr$15.0000/Tr
Mô hình hàng đầu của Moonshot với tầm nhìn tự nhiên và cửa sổ ngữ cảnh lên tới 1 triệu mã thông báo. Nó hiện đang chạy với nỗ lực suy luận tối đa và phù hợp với mã hóa dài hạn, công việc tri thức và các nhiệm vụ phức tạp phối hợp các công cụ đầu cuối. Để sử dụng ổn định, hãy lưu giữ toàn bộ lịch sử lý luận và bắt đầu phiên mới trong khai thác tác nhân tương thích.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
Thử mô hình
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.4000/Tr$2.0000/Tr
Giá đầu ra
$2.4000/Tr$12.0000/Tr
The balanced workhorse tier of GPT-5.6, combining capability and cost. Well suited to production work involving image understanding, tool use, and large source material; choose Sol for the hardest quality-first work or Luna for cost-controlled high volume.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Thử mô hình
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$1.0000/Tr$5.0000/Tr
Giá đầu ra
$6.0000/Tr$30.0000/Tr
The flagship GPT-5.6 tier for complex professional work and quality-first delivery. It supports image input, function calling, structured outputs, and an exceptionally large context window; consider Terra or Luna when latency or unit cost is the primary constraint.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Thử mô hình
OpenAI
Ngữ cảnh1.05M
Giá đầu vào$0.2000/Tr
Giá đầu ra$1.2000/Tr
The cost-sensitive, high-volume tier of GPT-5.6. A good fit for summarization, classification, rewriting, and batch automation; choose the Sol sibling for complex professional judgment or quality-first multi-step work.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Thử mô hình
MỖI GIÂY$0.0450/s
Một mô hình tạo hình ảnh đa phương thức để tạo hình ảnh chuyên nghiệp. Nó có thể tạo hình ảnh từ văn bản và thực hiện các chỉnh sửa chính xác với hình ảnh tham chiếu và chú thích không gian, với thế mạnh về đồ họa thông tin dày đặc, kiểu chữ, ánh sáng chân thực và hiển thị văn bản đa ngôn ngữ.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Thử mô hình
Grok
Ngữ cảnh500K
Giá đầu vào$2.1000/Tr
Giá đầu ra$6.3000/Tr
Một mô hình lý luận biên giới cho mã hóa, công việc tri thức và các nhiệm vụ STEM. Nó hỗ trợ đầu vào hình ảnh, gọi hàm và đầu ra có cấu trúc; Bối cảnh mã thông báo 500K của nó phù hợp với phân tích tệp chéo và tài liệu nguồn dài. Thích một mô hình chi phí thấp hơn khi lý luận biên giới là không cần thiết.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$3.4000/Tr$10.0000/Tr
Giá đầu ra
$17.0000/Tr$50.0000/Tr
Mô hình được phát hành rộng rãi có khả năng nhất của Anthropic, được xây dựng cho công việc tác nhân dài hạn và lý luận đòi hỏi khắt khe nhất. Cung cấp cửa sổ ngữ cảnh 1M mã thông báo với đầu ra tối đa 128k và tư duy thích ứng luôn sẵn sàng, vượt trội trong việc tự động khám phá các nhiệm vụ, lập kế hoạch chưa được xác định và thực hiện mã hóa dài hạn và điều phối đa tác nhân hơn nữa trước khi cần đầu vào của con người.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$0.6800/Tr$2.0000/Tr
Giá đầu ra
$3.4000/Tr$10.0000/Tr
Mô hình cấp Sonnet trình điều khiển hàng ngày nhằm mục đích mang lại khả năng làm việc tri thức, mã hóa và đại lý gần biên giới với chi phí vận hành thấp hơn. Bối cảnh mã thông báo 1M mặc định và tư duy thích ứng của nó phù hợp với các tài liệu dài, cơ sở mã và quy trình làm việc của công cụ nhiều bước; đối với lý do sâu sắc nhất hoặc công việc bảo mật có rủi ro cao bị hạn chế, hãy đánh giá các mô hình cấp cao hơn hoặc chuyên biệt.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Ngữ cảnh256K
Giá đầu vào$0.9700/Tr
Giá đầu ra$4.8800/Tr
Được xây dựng dành cho các tác vụ mã hóa, tác nhân và năng suất phức tạp, vượt xa Doubao Seed 2.0 trong bối cảnh dài, đầu ra dài và quy trình làm việc hướng đến công cụ. So với các công ty ngang hàng Qwen, GLM và DeepSeek, đây là một lựa chọn tiết kiệm chi phí cho công việc văn phòng, mã hóa và tự động hóa nhiều bước của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển văn bản thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
MỖI GIÂY$0.1350/s
Được xây dựng để tham chiếu đến video, với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển hình ảnh thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Giá đầu vào$0.6300/Tr
Giá đầu ra$0.6300/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Zhipu
Zhipu AI
Ngữ cảnh1M
Giá đầu vào
$0.9690/Tr$1.1400/Tr
Giá đầu ra
$3.4000/Tr$4.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa và tác nhân ngữ cảnh dài, cải thiện so với GLM-5.1 về độ dài ngữ cảnh, cách sử dụng công cụ và quy trình công việc gồm nhiều bước phức tạp. So với các công ty hàng đầu của Trung Quốc như Qwen, DeepSeek và Kimi, nó phù hợp với tự động hóa doanh nghiệp, phân tích mã cấp dự án và công việc tri thức bằng tiếng Trung.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
MoonshotAI
Ngữ cảnh256K
Giá đầu vào$1.9000/Tr
Giá đầu ra$7.9999/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2.6. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseFunction CallingStructured OutputLong Context
Thử mô hình
MoonshotAI
Ngữ cảnh256K
Giá đầu vào
$0.8775/Tr$0.9750/Tr
Giá đầu ra
$3.6450/Tr$4.0500/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2.6. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseFunction CallingStructured OutputLong Context
Thử mô hình
MỖI GIÂY$0.1400/s
Được xây dựng để tạo, chỉnh sửa và mở rộng dựa trên hình ảnh/video, với tính nhất quán chuyển động mạnh hơn và sản xuất nội dung xã hội nhanh hơn Grok Imagine 1.0. So với Veo, Kling và Runway, nó phù hợp với các video dạng ngắn, ý tưởng quảng cáo và nội dung theo xu hướng trong hệ sinh thái xAI.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
Ngữ cảnh1M
Giá đầu vào
$0.2400/Tr$0.3000/Tr
Giá đầu ra
$0.9600/Tr$1.2000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Minimax
Free channel
Ngữ cảnh1M
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Free models are for learning and trial purposes only and may be removed at any time. Premium models have limited quotas with 5 requests per minute, and their availability is not guaranteed.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Minimax
MiniMax
Ngữ cảnh1M
Giá đầu vào$0.3150/Tr
Giá đầu ra$1.2600/Tr
Được xây dựng để mã hóa trong thời gian dài, sử dụng công cụ và cộng tác sản xuất nhiều lượt, mở rộng ra ngoài MiniMax M2.7 với đầu vào đa phương thức trong khi vẫn giữ cửa sổ ngữ cảnh mã thông báo 1M. So với các mô hình tác nhân ngữ cảnh dài Claude, Gemini và GLM-5.2, việc đưa các tài liệu văn bản, hình ảnh và video vào một quy trình làm việc sẽ tốt hơn.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn Claude Opus 4.7 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Gemini
MỖI GIÂY$0.2450/s
Được xây dựng để tạo đa phương thức từ bất kỳ đầu vào vào video nào, nhấn mạnh hơn quy trình làm việc video của Gemini trước đó vào việc phối hợp thống nhất các tài liệu văn bản, hình ảnh, âm thanh và video. So với Veo, Kling và Runway, việc tích hợp các nội dung đa phương thức phức tạp vào một quy trình làm việc sáng tạo sẽ tốt hơn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4400/Tr$1.8000/Tr
Giá đầu ra
$4.3200/Tr$5.4000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Để chỉnh sửa video, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Wensheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Việc tạo video để tham khảo, so với các mẫu video ban đầu, nổi bật hơn trong việc tạo âm thanh gốc và hoàn thành đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về nhân vật. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Tusheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
DeepSeek
Ngữ cảnh1M
Giá đầu vào
$1.5390/Tr$1.7100/Tr
Giá đầu ra
$3.0869/Tr$3.4299/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
Thử mô hình
DeepSeek
Ngữ cảnh1M
Giá đầu vào
$0.1278/Tr$0.1420/Tr
Giá đầu ra
$0.2574/Tr$0.2860/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
Thử mô hình
OpenAI
OpenAI
Ngữ cảnh1M
Giá đầu vào
$1.0000/Tr$5.0000/Tr
Giá đầu ra
$6.0000/Tr$30.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.4. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
XiaomiMiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được xây dựng để thiết kế giọng nói một câu và chuyển văn bản thành giọng nói, với khả năng tạo giọng nói ngôn ngữ tự nhiên mạnh mẽ hơn dòng V2.5, kiểm soát nhịp độ/cảm xúc/giọng điệu chi tiết và tạo ra giọng nói ma sát thấp hơn MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất hữu ích cho việc thiết kế giọng nói nhân vật không có tham chiếu, thuyết minh quảng cáo, tường thuật video ngắn và khám phá giọng nói đa phong cách.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được thiết kế để sao chép giọng nói ít mẫu, với khả năng tái tạo âm sắc có độ trung thực cao dòng V2.5 mạnh mẽ hơn, tính nhất quán của giọng nói và khả năng tổng quát hóa nhiều văn bản so với MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất phù hợp với lồng tiếng ký tự tiếng Trung, tường thuật video ngắn, sao chép giọng nói podcast và sản xuất giọng nói đa ngôn ngữ cần duy trì giọng nói mục tiêu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
Xiaomi MiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được xây dựng để chuyển văn bản thành giọng nói, thiết kế giọng nói và sao chép giọng nói, với khả năng tổng hợp giọng nói tự nhiên mạnh mẽ hơn dòng V2.5, kiểm soát nhịp độ/cảm xúc/giọng điệu chi tiết và tạo giọng nói ít ma sát hơn MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất phù hợp với tường thuật tiếng Trung, lồng tiếng nhân vật, âm thanh video ngắn và sản xuất giọng nói đa ngôn ngữ.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
Xiaomi MiMo
Ngữ cảnh1M
Giá đầu vào$1.1700/Tr
Giá đầu ra$3.5000/Tr
Được xây dựng cho các tác nhân, mã hóa và các tác vụ theo ngữ cảnh dài, cung cấp sự hiểu biết đa phương thức hoàn chỉnh hơn, cửa sổ ngữ cảnh có hàng triệu mã thông báo và khả năng suy luận theo chiều dài hơn MiMo V2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và DeepSeek, điểm mạnh của nó là các kịch bản tự động hóa kỹ thuật và phù hợp với hệ sinh thái Xiaomi.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
XiaomiMiMo
Xiaomi MiMo
Ngữ cảnh1M
Giá đầu vào$0.4700/Tr
Giá đầu ra$2.3600/Tr
Được xây dựng cho các tác nhân, mã hóa và các tác vụ theo ngữ cảnh dài, cung cấp sự hiểu biết đa phương thức hoàn chỉnh hơn, cửa sổ ngữ cảnh có hàng triệu mã thông báo và khả năng suy luận theo chiều dài hơn MiMo V2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và DeepSeek, điểm mạnh của nó là các kịch bản tự động hóa kỹ thuật và phù hợp với hệ sinh thái Xiaomi.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
OpenAI
Ngữ cảnh400K
MỖI ẢNH$0.0080/image
The discounted-price route for GPT Image 2, mapped by the current channel to the same underlying model. Sale indicates a special-price route, not a separate capability tier. A good fit for cost-sensitive everyday generation and reference-image editing; choose regular gpt-image-2 when route consistency matters more.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal OutputLong Context
Thử mô hình
OpenAI
Ngữ cảnh128K
MỖI ẢNH
$0.0196/image$0.0280/image
Được xây dựng để tạo và chỉnh sửa hình ảnh chất lượng cao, cải tiến so với GPT Image 1.x về khả năng hiển thị văn bản, chỉnh sửa cục bộ và tính nhất quán nhiều lượt. So với các mô hình hình ảnh Gemini, Qwen Image và Seedream, nó rất phù hợp với hình ảnh thương hiệu, thiết kế quảng cáo, hình ảnh sản phẩm và quy trình làm việc sáng tạo được kiểm soát chặt chẽ.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn Claude Opus 4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
Ngữ cảnh200K
Giá đầu vào$0.6300/Tr
Giá đầu ra$2.5200/Tr
Được xây dựng để tạo văn bản, lý luận và sử dụng công cụ, với độ ổn định quy trình làm việc tác nhân và ngữ cảnh dài 200K mạnh hơn so với các phiên bản MiniMax M2.x trước đó. So với các công ty cùng ngành của Trung Quốc như Kimi, GLM và Qwen, nó phù hợp hơn về năng suất, hỗ trợ mã hóa và xử lý tài liệu dài.
Kiểu đầu vào:
Kiểu đầu ra:
Minimax
Ngữ cảnh200K
Giá đầu vào$0.3150/Tr
Giá đầu ra$1.2600/Tr
Được xây dựng để tạo văn bản, lý luận và sử dụng công cụ, với độ ổn định quy trình làm việc tác nhân và ngữ cảnh dài 200K mạnh hơn so với các phiên bản MiniMax M2.x trước đó. So với các công ty cùng ngành của Trung Quốc như Kimi, GLM và Qwen, nó phù hợp hơn về năng suất, hỗ trợ mã hóa và xử lý tài liệu dài.
Kiểu đầu vào:
Kiểu đầu ra:
OpenAI
Ngữ cảnh400K
Giá đầu vào$0.2000/Tr
Giá đầu ra$1.2500/Tr
Built for reasoning, coding, visual understanding, and agent tasks, with stronger long context, tool use, and scalable reliable output than GPT-5.3. Compared with Claude, Gemini, and Qwen flagship models, it is a strong general-purpose base for reliable automation and complex knowledge workflows.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseStructured OutputLong Context
Thử mô hình
OpenAI
Ngữ cảnh400K
Giá đầu vào$0.7500/Tr
Giá đầu ra$4.5000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.3. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
Thử mô hình
OpenAI
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.5000/Tr$2.5000/Tr
Giá đầu ra
$3.0000/Tr$15.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.3. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
Thử mô hình
Ngữ cảnh131K
MỖI ẢNH
$0.0280/image$0.0400/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Thử mô hình
Ngữ cảnh1.05M
Giá đầu vào
$1.4000/Tr$2.0000/Tr
Giá đầu ra
$8.4000/Tr$12.0000/Tr
Được xây dựng để hiểu đa phương thức, mã hóa và các tác vụ có ngữ cảnh dài, cải thiện so với Gemini 3.0 / 2.5 về thông lượng, ngữ cảnh và khả năng của công cụ. So với các mô hình GPT, Claude và Qwen, nó mạnh mẽ cho quy trình phân tích thống nhất trên văn bản, hình ảnh, âm thanh, video và tài liệu.
Kiểu đầu vào:
Kiểu đầu ra:
Long Context
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$1.0200/Tr$3.0000/Tr
Giá đầu ra
$5.1000/Tr$15.0000/Tr
Đối với các tác vụ tác nhân và mã hóa hiệu quả, nó còn tiến xa hơn phiên bản đặt hàng trước của Claude 4.5/4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
Ngữ cảnh256K
Giá đầu vào$0.5000/Tr
Giá đầu ra$2.5300/Tr
Được xây dựng dành cho các tác vụ mã hóa, tác nhân và năng suất phức tạp, vượt xa Doubao Seed 2.0 trong bối cảnh dài, đầu ra dài và quy trình làm việc hướng đến công cụ. So với các công ty ngang hàng Qwen, GLM và DeepSeek, đây là một lựa chọn tiết kiệm chi phí cho công việc văn phòng, mã hóa và tự động hóa nhiều bước của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong Context
Thử mô hình
MỖI ẢNH$0.0350/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với hướng dẫn tiếng Trung mạnh mẽ hơn, lý luận trực quan và sản xuất sáng tạo tần suất cao hơn Seedream 4.x. So với GPT Image, mô hình hình ảnh Gemini và Qwen Image, nó rất phù hợp với thiết kế quảng cáo hệ sinh thái ByteDance, nội dung thương mại điện tử và sản xuất hình ảnh đa kịch bản.
Kiểu đầu vào:
Kiểu đầu ra:
Web SearchMultimodal Output
Thử mô hình
Minimax
Ngữ cảnh205K
Giá đầu vào$0.3020/Tr
Giá đầu ra$1.2077/Tr
Một mô hình tiết kiệm chi phí dành cho các tác nhân có năng suất thực sự, mạnh mẽ nhất về mã hóa, sử dụng công cụ, tìm kiếm và cung cấp các sản phẩm theo phong cách văn phòng thay vì chỉ trò chuyện thông thường. Nó phù hợp với các tác nhân lập kế hoạch và thực hiện các thay đổi trên nhiều tệp, truy xuất nghiên cứu và quy trình làm việc về tài liệu/bảng tính/trình bày; so với những chiếc điện thoại cao cấp đắt tiền hơn, sự đánh đổi chính là chi phí thấp hơn để đạt được hiệu quả thực thi gần biên giới.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Ngữ cảnh13K
Giá đầu vào$2.1606/Tr
Giá đầu ra$2.1606/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Ngữ cảnh13K
Giá đầu vào$1.5465/Tr
Giá đầu ra$1.5465/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Claude
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn phiên bản đặt hàng trước của Claude 4.5/4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
Kling
MỖI GIÂY$0.0900/s
Được xây dựng để tạo văn bản/hình ảnh thành video và chụp nhiều ảnh, cải thiện so với Kling 2.x về độ ổn định chuyển động, ngôn ngữ máy ảnh và tính nhất quán tham chiếu. So với Veo, Runway và Seedance, nó rất phù hợp với phim truyền hình ngắn, nội dung quảng cáo và sản xuất video xã hội chất lượng cao của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Kling
MỖI GIÂY$0.0900/s
Được xây dựng để tạo văn bản/hình ảnh thành video và chụp nhiều ảnh, cải thiện so với Kling 2.x về độ ổn định chuyển động, ngôn ngữ máy ảnh và tính nhất quán tham chiếu. So với Veo, Runway và Seedance, nó rất phù hợp với phim truyền hình ngắn, nội dung quảng cáo và sản xuất video xã hội chất lượng cao của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh8K
Giá đầu vào
$1.7039/Tr$2.0046/Tr
Giá đầu ra
$1.7039/Tr$2.0046/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể nhanh sẽ tốt hơn cho việc lặp lại nhanh và sản xuất hàng loạt so với cấp tiêu chuẩn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Ngữ cảnh8K
Giá đầu vào
$2.0309/Tr$2.1378/Tr
Giá đầu ra
$2.0309/Tr$2.1378/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Zhipu
Zhipu AI
Giá đầu vào$0.8800/Tr
Giá đầu ra$3.5500/Tr
Được xây dựng để tạo và chỉnh sửa hình ảnh, với trọng tâm mạnh mẽ hơn các khả năng thị giác GLM trước đó về lời nhắc tiếng Trung, hiểu văn bản hình ảnh và tạo có thể kiểm soát. So với Hình ảnh GPT, mô hình hình ảnh Gemini và Hình ảnh Qwen, nó phù hợp với tài sản tiếp thị của Trung Quốc, hình ảnh giải thích và chỉnh sửa hình ảnh lặp đi lặp lại.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh1M
Giá đầu vào$0.5000/Tr
Giá đầu ra$3.0000/Tr
Mô hình tư duy tốc độ cao của Google được thiết kế cho quy trình làm việc tổng thể, trò chuyện nhiều lượt và hỗ trợ mã hóa. Hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và PDF với cửa sổ ngữ cảnh mã thông báo 1M. Có các cấp độ tư duy có thể định cấu hình, cách sử dụng công cụ và kết quả đầu ra có cấu trúc. Cải tiến chất lượng rộng rãi so với Gemini 2.5 Flash về lý luận, hiểu biết đa phương thức và độ tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Ngữ cảnh66K
MỖI ẢNH
$0.0938/image$0.1340/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Thử mô hình
Claude
Ngữ cảnh200K
Giá đầu vào
$3.5000/Tr$5.0000/Tr
Giá đầu ra
$17.5000/Tr$25.0000/Tr
Nhằm mục đích lý luận hàng đầu và các nhiệm vụ tác nhân phức tạp, nó tiến xa hơn các phiên bản đặt hàng trước của dòng Claude 4 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Gemini
MỖI LẦN$0.1100/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định. Cấp Lite ưu tiên các bản nháp có thông lượng cao, chi phí thấp hơn so với cấp tiêu chuẩn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Gemini
MỖI LẦN$0.2211/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định. Bậc Nhanh phù hợp để xác thực khái niệm nhanh hơn bậc tiêu chuẩn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Gemini
Google
MỖI LẦN$1.6544/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Claude
Ngữ cảnh200K
Giá đầu vào
$0.3400/Tr$1.0000/Tr
Giá đầu ra
$1.7000/Tr$5.0000/Tr
Đối với các tác vụ tác nhân và mã hóa hiệu quả, nó còn vượt xa Claude Haiku 3.5 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
Giá đầu vào
$0.5922/Tr$1.1844/Tr
Giá đầu ra
$0.5922/Tr$1.1844/Tr
A lighter, throughput-oriented variant in the Seedance 2.0 family for short-video drafts, batch assets, and cost-sensitive iteration. Its value is the lighter generation tier; choose the standard model when maximum fidelity, complex motion, or higher output specifications matter more.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Gemini
MỖI ẢNH$0.0300/image
Đây là một tuyến thử nghiệm giảm giá. Quá trình tạo có thể mất nhiều thời gian hơn và có khoảng 10% khả năng thất bại. Tốt nhất là dành cho các thử nghiệm tạo hình ảnh có chi phí nhạy cảm trong đó có thể chấp nhận được việc xếp hàng và lỗi không thường xuyên; để sử dụng sản xuất ổn định hơn, hãy chọn lộ trình thông thường.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
MỖI LẦN$0.0200/call
Đây là một tuyến thử nghiệm giảm giá. Quá trình tạo có thể mất nhiều thời gian hơn và có khoảng 10% khả năng thất bại. Tốt nhất là dành cho các thử nghiệm tạo hình ảnh có chi phí nhạy cảm trong đó có thể chấp nhận được việc xếp hàng và lỗi không thường xuyên; để sử dụng sản xuất ổn định hơn, hãy chọn lộ trình thông thường.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
MỖI ẢNH$0.0300/image
Đây là một tuyến thử nghiệm giảm giá. Quá trình tạo có thể mất nhiều thời gian hơn và có khoảng 10% khả năng thất bại. Tốt nhất là dành cho các thử nghiệm tạo hình ảnh có chi phí nhạy cảm trong đó có thể chấp nhận được việc xếp hàng và lỗi không thường xuyên; để sử dụng sản xuất ổn định hơn, hãy chọn lộ trình thông thường.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output