Zhipu
glm-5.3
Zhipu AI
Ngữ cảnh1M
Giá đầu vào
$1.0115/Tr$1.1900/Tr
Giá đầu ra
$3.5275/Tr$4.1500/Tr
A flagship workhorse for complex software engineering and long-horizon agent tasks. It uses the same base model as GLM-5.2, with improvements driven by post-training, delivering a 50% gain on Z.ai Code Bench alongside stronger terminal-operation and vulnerability-discovery capabilities. It offers a 1M-token context window, up to 128K output, always-on reasoning with low, high, and max effort levels, function calling, and structured outputs. It currently accepts text only and is not intended for tasks requiring visual understanding.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Qwen
qwen3.8-max
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4200/Tr$1.7750/Tr
Giá đầu ra
$4.2640/Tr$5.3300/Tr
Qwen's most capable flagship multimodal reasoning model, built for long-horizon coding, professional work, and multi-stage agent tasks. It accepts text, images, and video, offers a 1M-token context window with up to 128K output, and supports function calling, structured outputs, web search, and a code interpreter. It is best used as a high-quality workhorse for complex tasks rather than for the lowest-cost, lowest-latency batch workloads.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
MoonshotAI
kimi-k3
Moonshot
Ngữ cảnh1.05M
Giá đầu vào
$2.7000/Tr$3.0000/Tr
Giá đầu ra
$13.5000/Tr$15.0000/Tr
Mô hình hàng đầu của Moonshot với tầm nhìn tự nhiên và cửa sổ ngữ cảnh lên tới 1 triệu mã thông báo. Nó hiện đang chạy với nỗ lực suy luận tối đa và phù hợp với mã hóa dài hạn, công việc tri thức và các nhiệm vụ phức tạp phối hợp các công cụ đầu cuối. Để sử dụng ổn định, hãy lưu giữ toàn bộ lịch sử lý luận và bắt đầu phiên mới trong khai thác tác nhân tương thích.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseLong Context
OpenAI
gpt-5.6-terra
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.4000/Tr$2.0000/Tr
Giá đầu ra
$2.4000/Tr$12.0000/Tr
The balanced workhorse tier of GPT-5.6, combining capability and cost. Well suited to production work involving image understanding, tool use, and large source material; choose Sol for the hardest quality-first work or Luna for cost-controlled high volume.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
OpenAI
gpt-5.6-sol
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$1.0000/Tr$5.0000/Tr
Giá đầu ra
$6.0000/Tr$30.0000/Tr
The flagship GPT-5.6 tier for complex professional work and quality-first delivery. It supports image input, function calling, structured outputs, and an exceptionally large context window; consider Terra or Luna when latency or unit cost is the primary constraint.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
OpenAI
gpt-5.6-luna
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.0400/Tr$0.2000/Tr
Giá đầu ra
$0.2400/Tr$1.2000/Tr
The cost-sensitive, high-volume tier of GPT-5.6. A good fit for summarization, classification, rewriting, and batch automation; choose the Sol sibling for complex professional judgment or quality-first multi-step work.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Grok
grok-4.5
xAI
Ngữ cảnh500K
Giá đầu vào$2.1000/Tr
Giá đầu ra$6.3000/Tr
Một mô hình lý luận biên giới cho mã hóa, công việc tri thức và các nhiệm vụ STEM. Nó hỗ trợ đầu vào hình ảnh, gọi hàm và đầu ra có cấu trúc; Bối cảnh mã thông báo 500K của nó phù hợp với phân tích tệp chéo và tài liệu nguồn dài. Thích một mô hình chi phí thấp hơn khi lý luận biên giới là không cần thiết.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningFunction CallingStructured OutputLong Context
Claude
claude-fable-5
Anthropic
Ngữ cảnh1M
Giá đầu vào
$3.4000/Tr$10.0000/Tr
Giá đầu ra
$17.0000/Tr$50.0000/Tr
Mô hình được phát hành rộng rãi có khả năng nhất của Anthropic, được xây dựng cho công việc tác nhân dài hạn và lý luận đòi hỏi khắt khe nhất. Cung cấp cửa sổ ngữ cảnh 1M mã thông báo với đầu ra tối đa 128k và tư duy thích ứng luôn sẵn sàng, vượt trội trong việc tự động khám phá các nhiệm vụ, lập kế hoạch chưa được xác định và thực hiện mã hóa dài hạn và điều phối đa tác nhân hơn nữa trước khi cần đầu vào của con người.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Claude
claude-sonnet-5
Anthropic
Ngữ cảnh1M
Giá đầu vào
$0.6800/Tr$2.0000/Tr
Giá đầu ra
$3.4000/Tr$10.0000/Tr
Mô hình cấp Sonnet trình điều khiển hàng ngày nhằm mục đích mang lại khả năng làm việc tri thức, mã hóa và đại lý gần biên giới với chi phí vận hành thấp hơn. Bối cảnh mã thông báo 1M mặc định và tư duy thích ứng của nó phù hợp với các tài liệu dài, cơ sở mã và quy trình làm việc của công cụ nhiều bước; đối với lý do sâu sắc nhất hoặc công việc bảo mật có rủi ro cao bị hạn chế, hãy đánh giá các mô hình cấp cao hơn hoặc chuyên biệt.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
LongCat
LongCat-2.0
美团
Ngữ cảnh1M
Giá đầu vào$0.3000/Tr
Giá đầu ra$1.2000/Tr
Một công cụ hỗ trợ LongCat 2.0 dành cho các tác vụ tác nhân dài hạn và mã hóa quy mô dự án, với bối cảnh mã thông báo 1M gốc cùng với lệnh gọi công cụ và lý luận nhiều bước. Tốt nhất là khi bạn cần giữ các kho lưu trữ lớn, tài liệu dài hoặc quy trình làm việc tự động hóa trong phạm vi; đối với phần Hỏi & Đáp nhẹ nhàng hoặc trò chuyện có độ trễ thấp, kiểu máy kiểu Flash/Lite nhỏ hơn thường rẻ hơn.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingLong Context
Doubao
doubao-seed-2-1-pro
Doubao
Ngữ cảnh256K
Giá đầu vào$0.9700/Tr
Giá đầu ra$4.8800/Tr
Được xây dựng dành cho các tác vụ mã hóa, tác nhân và năng suất phức tạp, vượt xa Doubao Seed 2.0 trong bối cảnh dài, đầu ra dài và quy trình làm việc hướng đến công cụ. So với các công ty ngang hàng Qwen, GLM và DeepSeek, đây là một lựa chọn tiết kiệm chi phí cho công việc văn phòng, mã hóa và tự động hóa nhiều bước của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Qwen
happyhorse-1.1-t2v
阿里巴巴
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển văn bản thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
happyhorse-1.1-r2v
阿里巴巴
MỖI GIÂY$0.1350/s
Được xây dựng để tham chiếu đến video, với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
happyhorse-1.1-i2v
阿里巴巴
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển hình ảnh thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
doubao-seedance-2-0-mini
Doubao
Giá đầu vào
$0.7560/Tr$1.5120/Tr
Giá đầu ra
$0.7560/Tr$1.5120/Tr
Built for video generation and multi-asset video creation, improving on Seedance 1.x with more complete motion stability, audiovisual generation, and reference inputs. Compared with Veo, Kling, and Runway, it is better suited to Chinese creative workflows driven by mixed text, image, audio, and video inputs. The Mini tier is positioned for lower-cost, high-frequency testing compared with standard Seedance 2.0. Useful for short drama, ads, e-commerce, and social assets.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
dreamina-seedance-2-0-mini-filter-off
Doubao
Giá đầu vào$1.5750/Tr
Giá đầu ra$1.5750/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Zhipu
glm-5.2
Zhipu AI
Ngữ cảnh1M
Giá đầu vào
$0.9690/Tr$1.1400/Tr
Giá đầu ra
$3.4000/Tr$4.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa và tác nhân ngữ cảnh dài, cải thiện so với GLM-5.1 về độ dài ngữ cảnh, cách sử dụng công cụ và quy trình công việc gồm nhiều bước phức tạp. So với các công ty hàng đầu của Trung Quốc như Qwen, DeepSeek và Kimi, nó phù hợp với tự động hóa doanh nghiệp, phân tích mã cấp dự án và công việc tri thức bằng tiếng Trung.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
MoonshotAI
kimi-k2.7-code
Moonshot
Ngữ cảnh256K
Giá đầu vào
$0.8775/Tr$0.9750/Tr
Giá đầu ra
$3.6450/Tr$4.0500/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2.6. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseFunction CallingStructured OutputLong Context
Grok
grok-imagine-video-1-5-preview
xAI
MỖI GIÂY$0.1400/s
Được xây dựng để tạo, chỉnh sửa và mở rộng dựa trên hình ảnh/video, với tính nhất quán chuyển động mạnh hơn và sản xuất nội dung xã hội nhanh hơn Grok Imagine 1.0. So với Veo, Kling và Runway, nó phù hợp với các video dạng ngắn, ý tưởng quảng cáo và nội dung theo xu hướng trong hệ sinh thái xAI.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Minimax
MiniMax-M3
MiniMax
Ngữ cảnh1M
Giá đầu vào$1.2600/Tr
Giá đầu ra$5.0400/Tr
Được xây dựng để mã hóa trong thời gian dài, sử dụng công cụ và cộng tác sản xuất nhiều lượt, mở rộng ra ngoài MiniMax M2.7 với đầu vào đa phương thức trong khi vẫn giữ cửa sổ ngữ cảnh mã thông báo 1M. So với các mô hình tác nhân ngữ cảnh dài Claude, Gemini và GLM-5.2, việc đưa các tài liệu văn bản, hình ảnh và video vào một quy trình làm việc sẽ tốt hơn.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Claude
claude-opus-4-8
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn Claude Opus 4.7 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Gemini
gemini-omni-video
Google
MỖI GIÂY$0.2450/s
Được xây dựng để tạo đa phương thức từ bất kỳ đầu vào vào video nào, nhấn mạnh hơn quy trình làm việc video của Gemini trước đó vào việc phối hợp thống nhất các tài liệu văn bản, hình ảnh, âm thanh và video. So với Veo, Kling và Runway, việc tích hợp các nội dung đa phương thức phức tạp vào một quy trình làm việc sáng tạo sẽ tốt hơn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
gemini-3.5-flash
Google
Ngữ cảnh1M
Giá đầu vào$1.5000/Tr
Giá đầu ra$9.0000/Tr
Được xây dựng để hiểu đa phương thức, mã hóa và các tác vụ theo ngữ cảnh dài, cải thiện so với Gemini 3.1 về thông lượng, ngữ cảnh và khả năng của công cụ. So với các mô hình GPT, Claude và Qwen, nó mạnh mẽ cho quy trình phân tích thống nhất trên văn bản, hình ảnh, âm thanh, video và tài liệu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Qwen
qwen3.7-max
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4400/Tr$1.8000/Tr
Giá đầu ra
$4.3200/Tr$5.4000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Qwen
qwen3.6-max-preview
Qwen
Ngữ cảnh262K
Giá đầu vào$1.3300/Tr
Giá đầu ra$8.0000/Tr
Alibaba Qwen 3.6 Max Preview, một mô hình gồm nhiều chuyên gia thưa thớt với ~1 nghìn tỷ thông số. Được tối ưu hóa cho mã hóa tác nhân, sử dụng công cụ và lý luận theo ngữ cảnh dài với chế độ tư duy tích hợp giúp duy trì dấu vết lý luận trong các cuộc hội thoại nhiều lượt. Cửa sổ ngữ cảnh 262K, có sẵn thông qua API Alibaba Cloud Model Studio.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Qwen
happyhorse-1.0-video-edit
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Để chỉnh sửa video, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Qwen
happyhorse-1.0-t2v
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Wensheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Qwen
happyhorse-1.0-r2v
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Việc tạo video để tham khảo, so với các mẫu video ban đầu, nổi bật hơn trong việc tạo âm thanh gốc và hoàn thành đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về nhân vật. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Qwen
happyhorse-1.0-i2v
Qwen
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Tusheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
DeepSeek
deepseek-v4-pro
DeepSeek
Ngữ cảnh1M
Giá đầu vào
$1.5390/Tr$1.7100/Tr
Giá đầu ra
$3.0869/Tr$3.4299/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
DeepSeek
deepseek-v4-flash
DeepSeek
Ngữ cảnh1M
Giá đầu vào
$0.1278/Tr$0.1420/Tr
Giá đầu ra
$0.2574/Tr$0.2860/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
OpenAI
gpt-5.5
OpenAI
Ngữ cảnh1M
Giá đầu vào
$1.0000/Tr$5.0000/Tr
Giá đầu ra
$6.0000/Tr$30.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.4. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
XiaomiMiMo
mimo-v2.5-tts-voicedesign
Xiaomi MiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được xây dựng để thiết kế giọng nói một câu và chuyển văn bản thành giọng nói, với khả năng tạo giọng nói ngôn ngữ tự nhiên mạnh mẽ hơn dòng V2.5, kiểm soát nhịp độ/cảm xúc/giọng điệu chi tiết và tạo ra giọng nói ma sát thấp hơn MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất hữu ích cho việc thiết kế giọng nói nhân vật không có tham chiếu, thuyết minh quảng cáo, tường thuật video ngắn và khám phá giọng nói đa phong cách.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
mimo-v2.5-tts-voiceclone
Xiaomi MiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được thiết kế để sao chép giọng nói ít mẫu, với khả năng tái tạo âm sắc có độ trung thực cao dòng V2.5 mạnh mẽ hơn, tính nhất quán của giọng nói và khả năng tổng quát hóa nhiều văn bản so với MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất phù hợp với lồng tiếng ký tự tiếng Trung, tường thuật video ngắn, sao chép giọng nói podcast và sản xuất giọng nói đa ngôn ngữ cần duy trì giọng nói mục tiêu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
XiaomiMiMo
mimo-v2.5-tts
Xiaomi MiMo
Giá đầu vào$0.0000/Tr
Giá đầu ra$0.0000/Tr
Được xây dựng để chuyển văn bản thành giọng nói, thiết kế giọng nói và sao chép giọng nói, với khả năng tổng hợp giọng nói tự nhiên mạnh mẽ hơn dòng V2.5, kiểm soát nhịp độ/cảm xúc/giọng điệu chi tiết và tạo giọng nói ít ma sát hơn MiMo V2 TTS. So với ElevenLabs, OpenAI TTS và Azure Speech, nó rất phù hợp với tường thuật tiếng Trung, lồng tiếng nhân vật, âm thanh video ngắn và sản xuất giọng nói đa ngôn ngữ.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
OpenAI
gpt-image-2-text-to-image
OpenAI
Ngữ cảnh128K
MỖI ẢNH$0.0300/image
Đây là một tuyến thử nghiệm giảm giá. Quá trình tạo có thể mất nhiều thời gian hơn và có khoảng 10% khả năng thất bại. Tốt nhất là dành cho các thử nghiệm tạo hình ảnh có chi phí nhạy cảm trong đó có thể chấp nhận được việc xếp hàng và lỗi không thường xuyên; để sử dụng sản xuất ổn định hơn, hãy chọn lộ trình thông thường.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
OpenAI
gpt-image-2-image-to-image
OpenAI
Ngữ cảnh128K
MỖI ẢNH$0.0200/image
Đây là một tuyến thử nghiệm giảm giá. Quá trình tạo có thể mất nhiều thời gian hơn và có khoảng 10% khả năng thất bại. Tốt nhất là dành cho các thử nghiệm tạo hình ảnh có chi phí nhạy cảm trong đó có thể chấp nhận được việc xếp hàng và lỗi không thường xuyên; để sử dụng sản xuất ổn định hơn, hãy chọn lộ trình thông thường.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
OpenAI
gpt-image-2
OpenAI
Ngữ cảnh128K
MỖI ẢNH$0.0670/image
Được xây dựng để tạo và chỉnh sửa hình ảnh chất lượng cao, cải tiến so với GPT Image 1.x về khả năng hiển thị văn bản, chỉnh sửa cục bộ và tính nhất quán nhiều lượt. So với các mô hình hình ảnh Gemini, Qwen Image và Seedream, nó rất phù hợp với hình ảnh thương hiệu, thiết kế quảng cáo, hình ảnh sản phẩm và quy trình làm việc sáng tạo được kiểm soát chặt chẽ.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
MoonshotAI
kimi-k2.6
Moonshot
Giá đầu vào
$0.8370/Tr$0.9300/Tr
Giá đầu ra
$3.4740/Tr$3.8600/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2.5. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseReasoning
Claude
claude-opus-4-7
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn Claude Opus 4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Minimax
MiniMax-M2.7-highspeed
MiniMax
Ngữ cảnh200K
Giá đầu vào$0.6300/Tr
Giá đầu ra$2.5200/Tr
Được xây dựng để tạo văn bản, lý luận và sử dụng công cụ, với độ ổn định quy trình làm việc tác nhân và ngữ cảnh dài 200K mạnh hơn so với các phiên bản MiniMax M2.x trước đó. So với các công ty cùng ngành của Trung Quốc như Kimi, GLM và Qwen, nó phù hợp hơn về năng suất, hỗ trợ mã hóa và xử lý tài liệu dài.
Kiểu đầu vào:
Kiểu đầu ra:
Reasoning
Minimax
MiniMax-M2.7
MiniMax
Ngữ cảnh200K
Giá đầu vào$0.3150/Tr
Giá đầu ra$1.2600/Tr
Được xây dựng để tạo văn bản, lý luận và sử dụng công cụ, với độ ổn định quy trình làm việc tác nhân và ngữ cảnh dài 200K mạnh hơn so với các phiên bản MiniMax M2.x trước đó. So với các công ty cùng ngành của Trung Quốc như Kimi, GLM và Qwen, nó phù hợp hơn về năng suất, hỗ trợ mã hóa và xử lý tài liệu dài.
Kiểu đầu vào:
Kiểu đầu ra:
Reasoning
OpenAI
gpt-5.4-mini
OpenAI
Ngữ cảnh400K
Giá đầu vào
$0.1500/Tr$0.7500/Tr
Giá đầu ra
$0.9000/Tr$4.5000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.3. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
OpenAI
gpt-5.4
OpenAI
Ngữ cảnh1.05M
Giá đầu vào
$0.5000/Tr$2.5000/Tr
Giá đầu ra
$3.0000/Tr$15.0000/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa, hiểu biết trực quan và tác nhân, với ngữ cảnh dài hơn, khả năng sử dụng công cụ mạnh hơn và đầu ra đáng tin cậy có thể mở rộng so với GPT-5.3. So với các mẫu hàng đầu của Claude, Gemini và Qwen, đây là nền tảng đa năng mạnh mẽ cho quy trình làm việc kiến ​​thức phức tạp và tự động hóa đáng tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
Gemini
gemini-3.1-flash-image-preview
Google
Ngữ cảnh131K
MỖI ẢNH$0.0672/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Gemini
gemini-3.1-pro-preview
Google
Ngữ cảnh1.05M
Giá đầu vào$2.0000/Tr
Giá đầu ra$12.0000/Tr
Được xây dựng để hiểu đa phương thức, mã hóa và các tác vụ có ngữ cảnh dài, cải thiện so với Gemini 3.0 / 2.5 về thông lượng, ngữ cảnh và khả năng của công cụ. So với các mô hình GPT, Claude và Qwen, nó mạnh mẽ cho quy trình phân tích thống nhất trên văn bản, hình ảnh, âm thanh, video và tài liệu.
Kiểu đầu vào:
Kiểu đầu ra:
Long Context
Claude
claude-sonnet-4-6-thinking
Anthropic
Ngữ cảnh1M
Giá đầu vào$3.0000/Tr
Giá đầu ra$15.0000/Tr
Biến thể tư duy mở rộng của Anthropic Claude Sonnet 4.6, cho phép suy luận theo chuỗi suy nghĩ cho các vấn đề phức tạp. Vượt trội về mã hóa, điều hướng cơ sở mã, quản lý dự án, tạo tài liệu và các tác vụ tác nhân với đầu vào văn bản và hình ảnh. Cửa sổ ngữ cảnh 1M, hoạt động tốt hơn phiên bản tiêu chuẩn trong các tác vụ yêu cầu suy luận sâu, lý tưởng cho công nghệ phần mềm phức tạp và lập kế hoạch nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Claude
claude-sonnet-4-6
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.0200/Tr$3.0000/Tr
Giá đầu ra
$5.1000/Tr$15.0000/Tr
Đối với các tác vụ tác nhân và mã hóa hiệu quả, nó còn tiến xa hơn phiên bản đặt hàng trước của Claude 4.5/4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Minimax
MiniMax-M2.5
MiniMax
Ngữ cảnh205K
Giá đầu vào$0.3020/Tr
Giá đầu ra$1.2077/Tr
Một mô hình tiết kiệm chi phí dành cho các tác nhân có năng suất thực sự, mạnh mẽ nhất về mã hóa, sử dụng công cụ, tìm kiếm và cung cấp các sản phẩm theo phong cách văn phòng thay vì chỉ trò chuyện thông thường. Nó phù hợp với các tác nhân lập kế hoạch và thực hiện các thay đổi trên nhiều tệp, truy xuất nghiên cứu và quy trình làm việc về tài liệu/bảng tính/trình bày; so với những chiếc điện thoại cao cấp đắt tiền hơn, sự đánh đổi chính là chi phí thấp hơn để đạt được hiệu quả thực thi gần biên giới.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Doubao
doubao-seedance-2-0-filter-off
Doubao
Ngữ cảnh13K
Giá đầu vào$3.1500/Tr
Giá đầu ra$3.1500/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
doubao-seedance-2-0-fast-filter-off
Doubao
Ngữ cảnh13K
Giá đầu vào$2.5200/Tr
Giá đầu ra$2.5200/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể lọc ra này giữ nguyên mức khả năng tạo như Seedance 2.0 tiêu chuẩn trong khi áp dụng tính năng lọc nội dung lỏng lẻo hơn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Claude
claude-opus-4-6
Anthropic
Ngữ cảnh1M
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn phiên bản đặt hàng trước của Claude 4.5/4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Kling
kling-v3-omni
kling
MỖI GIÂY$0.0900/s
Được xây dựng để tạo văn bản/hình ảnh thành video và chụp nhiều ảnh, cải thiện so với Kling 2.x về độ ổn định chuyển động, ngôn ngữ máy ảnh và tính nhất quán tham chiếu. So với Veo, Runway và Seedance, nó rất phù hợp với phim truyền hình ngắn, nội dung quảng cáo và sản xuất video xã hội chất lượng cao của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Kling
kling-v3
kling
MỖI GIÂY$0.0900/s
Được xây dựng để tạo văn bản/hình ảnh thành video và chụp nhiều ảnh, cải thiện so với Kling 2.x về độ ổn định chuyển động, ngôn ngữ máy ảnh và tính nhất quán tham chiếu. So với Veo, Runway và Seedance, nó rất phù hợp với phim truyền hình ngắn, nội dung quảng cáo và sản xuất video xã hội chất lượng cao của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
doubao-seedream-5.0-lite
Doubao
MỖI ẢNH$0.0350/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với hướng dẫn tiếng Trung mạnh mẽ hơn, lý luận trực quan và sản xuất sáng tạo tần suất cao hơn Seedream 4.x. So với GPT Image, mô hình hình ảnh Gemini và Qwen Image, nó rất phù hợp với thiết kế quảng cáo hệ sinh thái ByteDance, nội dung thương mại điện tử và sản xuất hình ảnh đa kịch bản.
Kiểu đầu vào:
Kiểu đầu ra:
Web SearchMultimodal Output
Doubao
doubao-seedance-2-0-fast
Doubao
Ngữ cảnh8K
Giá đầu vào$2.4192/Tr
Giá đầu ra$2.4192/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Biến thể nhanh sẽ tốt hơn cho việc lặp lại nhanh và sản xuất hàng loạt so với cấp tiêu chuẩn. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
Doubao
doubao-seedance-2-0
Doubao
Ngữ cảnh8K
Giá đầu vào
$2.5927/Tr$2.7292/Tr
Giá đầu ra
$2.5927/Tr$2.7292/Tr
Được xây dựng để tạo video và tạo video đa nội dung, cải tiến trên Seedance 1.x với độ ổn định chuyển động hoàn chỉnh hơn, tạo hình ảnh nghe nhìn và đầu vào tham chiếu. So với Veo, Kling và Runway, nó phù hợp hơn với quy trình làm việc sáng tạo của Trung Quốc được thúc đẩy bởi các đầu vào văn bản, hình ảnh, âm thanh và video hỗn hợp. Hữu ích cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tài sản xã hội.
Kiểu đầu vào:
Kiểu đầu ra:
MoonshotAI
kimi-k2.5
Moonshot
Ngữ cảnh256K
Giá đầu vào
$0.5400/Tr$0.6000/Tr
Giá đầu ra
$2.8350/Tr$3.1500/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoning
Gemini
gemini-3-flash-preview
Google
Ngữ cảnh1M
Giá đầu vào$0.5000/Tr
Giá đầu ra$3.0000/Tr
Mô hình tư duy tốc độ cao của Google được thiết kế cho quy trình làm việc tổng thể, trò chuyện nhiều lượt và hỗ trợ mã hóa. Hỗ trợ đầu vào văn bản, hình ảnh, âm thanh, video và PDF với cửa sổ ngữ cảnh mã thông báo 1M. Có các cấp độ tư duy có thể định cấu hình, cách sử dụng công cụ và kết quả đầu ra có cấu trúc. Cải tiến chất lượng rộng rãi so với Gemini 2.5 Flash về lý luận, hiểu biết đa phương thức và độ tin cậy.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
DeepSeek
DeepSeek-V3.2-Thinking
DeepSeek
Ngữ cảnh128K
Giá đầu vào$0.3100/Tr
Giá đầu ra$0.4700/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.1. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
Long ContextTool UseReasoningStructured Output
Gemini
gemini-3-pro-image-preview
Google
Ngữ cảnh66K
MỖI ẢNH$0.1340/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Claude
claude-opus-4-5
Anthropic
Ngữ cảnh200K
Giá đầu vào$5.0000/Tr
Giá đầu ra$25.0000/Tr
Nhằm mục đích lý luận hàng đầu và các nhiệm vụ tác nhân phức tạp, nó tiến xa hơn các phiên bản đặt hàng trước của dòng Claude 4 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Gemini
veo3.1-lite
Google
MỖI LẦN$0.1100/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định. Cấp Lite ưu tiên các bản nháp có thông lượng cao, chi phí thấp hơn so với cấp tiêu chuẩn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
veo3.1-fast
Google
MỖI LẦN$0.2211/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định. Bậc Nhanh phù hợp để xác thực khái niệm nhanh hơn bậc tiêu chuẩn.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
veo3.1
Google
MỖI LẦN$1.6544/call
Được xây dựng để tạo video có độ trung thực cao, với quy trình làm việc về âm thanh gốc, điều khiển máy ảnh và đầu vào tham chiếu hoàn thiện hơn Veo 2/3. So với Kling, Runway và Seedance, nó phù hợp hơn với phim ngắn, bảng phân cảnh quảng cáo và video yêu cầu chuyển động vật lý ổn định.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Gemini
gemini-2.5-flash-image
Google
Ngữ cảnh66K
MỖI ẢNH$0.0585/image
Được xây dựng để tạo và chỉnh sửa hình ảnh, với khả năng hiểu đa phương thức mạnh mẽ hơn, chỉnh sửa đàm thoại và tạo nguyên mẫu trực quan nhanh chóng so với các khả năng hình ảnh trước đây của Gemini. So với GPT Image, Qwen Image và Seedream, nó rất hữu ích khi kết hợp các tài liệu, hình ảnh và lời nhắc trong một quy trình làm việc trực quan.
Kiểu đầu vào:
Kiểu đầu ra:
Structured OutputMultimodal Output
Claude
claude-haiku-4-5
Anthropic
Ngữ cảnh200K
Giá đầu vào
$0.3400/Tr$1.0000/Tr
Giá đầu ra
$1.7000/Tr$5.0000/Tr
Đối với các tác vụ tác nhân và mã hóa hiệu quả, nó còn vượt xa Claude Haiku 3.5 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Gemini
gemini-3.6-flash
Google
Giá đầu vào$1.5000/Tr
Giá đầu ra$7.5000/Tr
Gemini
gemini-3.5-flash-lite
Google
Giá đầu vào$0.3000/Tr
Giá đầu ra$2.5000/Tr
Gemini
gemini-3.1-flash-lite-image
Google
MỖI LẦN
$0.0120/call$0.0200/call
Gemini
gemini-3.1-flash-image
Google
MỖI ẢNH
$0.0198/image$0.0330/image
Gemini
gemini-3-pro-image
Google
MỖI ẢNH
$0.0318/image$0.0530/image
Claude
claude-opus-5
Anthropic
Giá đầu vào
$1.7000/Tr$5.0000/Tr
Giá đầu ra
$8.5000/Tr$25.0000/Tr
Claude
claude-opus-4-7-thinking
Anthropic
Ngữ cảnh1M
Giá đầu vào$5.0000/Tr
Giá đầu ra$25.0000/Tr
Đối với các tác vụ tác nhân phức tạp và lý luận hàng đầu, nó còn tiến xa hơn Claude Opus 4.6 về ngữ cảnh dài, mã, cách sử dụng công cụ và lập kế hoạch phức tạp; so với các mô hình hàng đầu như GPT, Gemini và Qwen, nó phù hợp hơn với các đại lý có độ tin cậy cao, bảo trì cơ sở mã và quy trình nghiên cứu chuyên sâu.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Doubao
doubao-seedream-5-0-pro
Doubao
MỖI GIÂY$0.0450/s
Một mô hình tạo hình ảnh đa phương thức để tạo hình ảnh chuyên nghiệp. Nó có thể tạo hình ảnh từ văn bản và thực hiện các chỉnh sửa chính xác với hình ảnh tham chiếu và chú thích không gian, với thế mạnh về đồ họa thông tin dày đặc, kiểu chữ, ánh sáng chân thực và hiển thị văn bản đa ngôn ngữ.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningMultimodal Output
Doubao
doubao-seedance-2.5
Doubao
Giá đầu vào
$3.4200/Tr$3.6000/Tr
Giá đầu ra
$3.4200/Tr$3.6000/Tr
Được xây dựng cho tác phẩm video chuyên nghiệp như quảng cáo, nội dung có thương hiệu và phim ngắn tường thuật, tập trung vào các cảnh dài hơn, định hướng đa nội dung và tinh chỉnh lặp đi lặp lại. Nó hỗ trợ tạo văn bản và hình ảnh theo hướng cộng với điều khiển tham chiếu R2V, kết hợp nội dung đa phương thức, tạo ra tối đa 30 giây ở chế độ tiêu chuẩn và có thể sửa đổi các vùng đã chọn mà không cần tạo lại toàn bộ clip. Những lý do chính để chọn nó thay vì Seedance 2.0 là các cảnh quay liên tục dài hơn, đầu vào tham chiếu phong phú hơn và các bản sửa lỗi sau thế hệ dễ kiểm soát hơn.
Doubao
doubao-seed-2-0-pro
Doubao
Ngữ cảnh256K
Giá đầu vào$0.5000/Tr
Giá đầu ra$2.5300/Tr
Được xây dựng dành cho các tác vụ mã hóa, tác nhân và năng suất phức tạp, vượt xa Doubao Seed 2.0 trong bối cảnh dài, đầu ra dài và quy trình làm việc hướng đến công cụ. So với các công ty ngang hàng Qwen, GLM và DeepSeek, đây là một lựa chọn tiết kiệm chi phí cho công việc văn phòng, mã hóa và tự động hóa nhiều bước của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong Context
Qwen
qwen3.7-plus
Qwen
Ngữ cảnh1M
Giá đầu vào
$0.2400/Tr$0.3000/Tr
Giá đầu ra
$0.9600/Tr$1.2000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Qwen
qwen3.6-plus
Qwen
Ngữ cảnh1M
Giá đầu vào
$0.9120/Tr$1.1400/Tr
Giá đầu ra
$5.4880/Tr$6.8599/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.5. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Qwen
qwen3.6-flash
Qwen
Ngữ cảnh1M
Giá đầu vào$0.1785/Tr
Giá đầu ra$1.0605/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.5. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Qwen
qwen-image-2.0-pro
Qwen
Giá đầu vào$2.2000/Tr
Giá đầu ra$2.2000/Tr
Được xây dựng để tạo và chỉnh sửa hình ảnh, cải tiến so với Qwen Image 1.x trong khả năng hiển thị văn bản tiếng Trung, làm theo hướng dẫn và bố cục phức tạp. So với GPT Image, mô hình hình ảnh Gemini và Seedream, nó rất phù hợp với áp phích, hình ảnh thương mại điện tử, đồ họa thông tin và sáng tạo hình ảnh lặp đi lặp lại của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
qwen-image-2.0
Qwen
Giá đầu vào$2.2000/Tr
Giá đầu ra$2.2000/Tr
Được xây dựng để tạo và chỉnh sửa hình ảnh, cải tiến so với Qwen Image 1.x trong khả năng hiển thị văn bản tiếng Trung, làm theo hướng dẫn và bố cục phức tạp. So với GPT Image, mô hình hình ảnh Gemini và Seedream, nó rất phù hợp với áp phích, hình ảnh thương mại điện tử, đồ họa thông tin và sáng tạo hình ảnh lặp đi lặp lại của Trung Quốc.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Minimax
MiniMax-H3
MiniMax
MỖI GIÂY$0.0800/s
XiaomiMiMo
mimo-v2.5-pro
Xiaomi MiMo
Ngữ cảnh1M
Giá đầu vào$1.1700/Tr
Giá đầu ra$3.5000/Tr
Được xây dựng cho các tác nhân, mã hóa và các tác vụ theo ngữ cảnh dài, cung cấp sự hiểu biết đa phương thức hoàn chỉnh hơn, cửa sổ ngữ cảnh có hàng triệu mã thông báo và khả năng suy luận theo chiều dài hơn MiMo V2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và DeepSeek, điểm mạnh của nó là các kịch bản tự động hóa kỹ thuật và phù hợp với hệ sinh thái Xiaomi.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
XiaomiMiMo
mimo-v2.5
Xiaomi MiMo
Ngữ cảnh1M
Giá đầu vào$0.4700/Tr
Giá đầu ra$2.3600/Tr
Được xây dựng cho các tác nhân, mã hóa và các tác vụ theo ngữ cảnh dài, cung cấp sự hiểu biết đa phương thức hoàn chỉnh hơn, cửa sổ ngữ cảnh có hàng triệu mã thông báo và khả năng suy luận theo chiều dài hơn MiMo V2. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và DeepSeek, điểm mạnh của nó là các kịch bản tự động hóa kỹ thuật và phù hợp với hệ sinh thái Xiaomi.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
MoonshotAI
kimi-k2.7-code-highspeed
Moonshot
Ngữ cảnh256K
Giá đầu vào$1.9000/Tr
Giá đầu ra$7.9999/Tr
Được xây dựng để sử dụng theo ngữ cảnh dài, nhiều bước và quy trình làm việc mã/tài liệu, với khả năng ngữ cảnh và độ ổn định của tác vụ kỹ thuật mạnh hơn Kimi K2.6. So với Qwen, GLM và DeepSeek, nó rất phù hợp với phân tích tài liệu dài của Trung Quốc, Hỏi đáp dự án và lập trình tác nhân hàng ngày.
Kiểu đầu vào:
Kiểu đầu ra:
Tool UseFunction CallingStructured OutputLong Context
Grok
grok-4.3
xAI
Ngữ cảnh1M
Giá đầu vào$1.3100/Tr
Giá đầu ra$2.6200/Tr
Được xây dựng cho các tác vụ lý luận, mã hóa và ngữ cảnh dài theo thời gian thực, với khả năng xử lý ngữ cảnh dài mạnh mẽ hơn và phản hồi nhanh hơn các phiên bản Grok 4.x trước đó. So với GPT, Claude và Gemini, nó rất hữu ích cho việc phân tích xu hướng, hỗ trợ mã hóa và quy trình làm việc thông tin được kết nối trong hệ sinh thái xAI.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Zhipu
glm-image
Zhipu AI
Giá đầu vào$0.8800/Tr
Giá đầu ra$3.5500/Tr
Được xây dựng để tạo và chỉnh sửa hình ảnh, với trọng tâm mạnh mẽ hơn các khả năng thị giác GLM trước đó về lời nhắc tiếng Trung, hiểu văn bản hình ảnh và tạo có thể kiểm soát. So với Hình ảnh GPT, mô hình hình ảnh Gemini và Hình ảnh Qwen, nó phù hợp với tài sản tiếp thị của Trung Quốc, hình ảnh giải thích và chỉnh sửa hình ảnh lặp đi lặp lại.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Doubao
dreamina-seedance-2-0-mini
Doubao
Giá đầu vào$75.0000/Tr
Giá đầu ra$75.0000/Tr
Cấp Seedance 2.0 nhẹ hơn để tạo video, hữu ích để nhanh chóng chuyển văn bản hoặc hình ảnh tham chiếu thành nội dung video ngắn cho các bản nháp xã hội, thương mại điện tử và sáng tạo. Nó được định hướng theo hướng lặp lại nhanh chóng và sản xuất tài sản; xem xét chuyển động, hành vi của máy ảnh và tính nhất quán của chủ thể trước khi lựa chọn cuối cùng.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
DeepSeek
deepseek-v4-flash-vision-exp
DeepSeek
Giá đầu vào$0.1490/Tr
Giá đầu ra$0.2980/Tr
An experimental multimodal variant of DeepSeek-V4-Flash for image understanding alongside text. A practical choice for visual Q&A, screenshot and document analysis, while its experimental status makes it better suited to evaluation and flexible workflows than strict production-critical paths.
DeepSeek
deepseek-v3.2
DeepSeek
Giá đầu vào$0.2100/Tr
Giá đầu ra$0.3200/Tr
Được xây dựng để sử dụng công cụ lý luận, mã hóa và tác nhân, với bối cảnh dài, chế độ tư duy và thực thi tác vụ phức tạp mạnh hơn DeepSeek V3.1. So với các công ty cùng ngành của Trung Quốc như Qwen, GLM và Kimi, nó đặc biệt cạnh tranh trong các nhiệm vụ toán học, lập trình và suy luận logic.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool Use
WhatsApp