Giá API LLM

Mô hình Qwen

Xem tất cả 15 mô hình Qwen có trên TokenHot.

Một API key cho phép truy cập 15 mô hình Qwen, với giá theo thời gian thực và không cần tài khoản nhà cung cấp riêng.

Ngữ cảnh1M
Giá đầu vào$0.1492/Tr
Giá đầu ra$0.4476/Tr
An efficient multimodal workhorse in the Qwen family, with a native million-token context window and strong support for coding assistance, agentic workflows, and visual understanding such as charts. It fits long documents, codebases, high-concurrency applications, and tool-assisted tasks.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseStructured OutputLong Context
Thử mô hình
MỖI GIÂY$0.0675/s
The speed-first variant of Alibaba's Wan 3.0 line (early access). It shortens generation latency while retaining high-quality video output, making it a good fit for low-latency previews, batch drafts and fast-iterating short-video workflows. If ultimate visual control matters more than speed, the standard version is a better choice.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Thử mô hình
Qwen
MỖI GIÂY$0.0450/s
The standard video generation model of Alibaba's Wan 3.0 line (early access). It supports text-to-video, image-to-video and multi-modal reference inputs, generating clips up to roughly 30 seconds with synchronized audio in a single pass — suitable for ads, short drama and narrative content. Official release date not yet announced.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4200/Tr$1.7750/Tr
Giá đầu ra
$4.2640/Tr$5.3300/Tr
Qwen's most capable flagship multimodal reasoning model, built for long-horizon coding, professional work, and multi-stage agent tasks. It accepts text, images, and video, offers a 1M-token context window with up to 128K output, and supports function calling, structured outputs, web search, and a code interpreter. It is best used as a high-quality workhorse for complex tasks rather than for the lowest-cost, lowest-latency batch workloads.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningWeb SearchTool UseFunction CallingStructured OutputLong ContextCode Execution
Thử mô hình
MỖI GIÂY
$0.0024/s$0.0030/s
A quality-first image generation and editing model: it supports text-to-image and edits from 1–3 reference images, accepts prompts of up to about 4.5K tokens, and is aimed at dense layouts, fine 10px-scale text, 12 languages, and multiple fonts. Choose it over the standard variant when complex composition and detail fidelity matter more than speed or cost; use the standard variant for a faster, more economical workflow.
Kiểu đầu vào:
Kiểu đầu ra:
MỖI GIÂY
$0.0024/s$0.0030/s
The balanced standard tier of Qwen-Image 3.0 for image generation and editing: it supports text-to-image and edits from 1–3 reference images, prompts of up to about 4.5K tokens, up to six outputs, and 2K-class resolution. It fits everyday posters, interfaces, infographics, and repeated creative work; move to Pro when complex layouts and fine text fidelity matter more, and use this tier when speed and cost efficiency are the priority.
Kiểu đầu vào:
Kiểu đầu ra:
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển văn bản thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
MỖI GIÂY$0.1350/s
Được xây dựng để tham chiếu đến video, với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
MỖI GIÂY$0.1350/s
Được xây dựng để chuyển hình ảnh thành video với quy trình làm việc dựa trên âm thanh mạnh mẽ hơn HappyHorse 1.0, tạo hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần truyền. So với Veo, Kling và Runway, điểm khác biệt của nó là quá trình tạo nghe nhìn được đồng bộ hóa và quy trình làm việc nhất quán với nhân vật cho phim truyền hình ngắn, quảng cáo, thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Qwen
Ngữ cảnh1M
Giá đầu vào
$0.2400/Tr$0.3000/Tr
Giá đầu ra
$0.9600/Tr$1.2000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Qwen
Ngữ cảnh1M
Giá đầu vào
$1.4400/Tr$1.8000/Tr
Giá đầu ra
$4.3200/Tr$5.4000/Tr
Được thiết kế cho khối lượng công việc tác nhân, mã hóa và năng suất văn phòng, với sự tập trung kết hợp mạnh mẽ hơn vào ngữ cảnh dài, cách gọi công cụ và đầu ra có cấu trúc so với Qwen3.6. So với các mô hình hàng đầu như GPT, Claude và Gemini, đây là một giải pháp thay thế hiệu quả về mặt chi phí cho quy trình làm việc của công cụ tiếng Trung, mã hóa và nhiều bước.
Kiểu đầu vào:
Kiểu đầu ra:
ReasoningTool UseFunction CallingStructured OutputLong Context
Thử mô hình
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Để chỉnh sửa video, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Wensheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Việc tạo video để tham khảo, so với các mẫu video ban đầu, nổi bật hơn trong việc tạo âm thanh gốc và hoàn thành đoạn hội thoại, hiệu ứng âm thanh và nhạc nền trong một lần; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về nhân vật. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output
Ngữ cảnh8K
MỖI GIÂY$0.1350/s
Đối với video Tusheng, so với các mẫu video đời đầu, nó chú trọng hơn vào việc tạo âm thanh gốc, hoàn thiện đoạn hội thoại, hiệu ứng âm thanh và nhạc nền cùng một lúc; so với Veo, Kling và Runway, ưu điểm khác biệt của nó nằm ở sự đồng bộ hóa âm thanh-hình ảnh và quy trình làm việc nhất quán về ký tự. Thích hợp cho các bộ phim truyền hình ngắn, quảng cáo, video thương mại điện tử và tiếp thị thương hiệu.
Kiểu đầu vào:
Kiểu đầu ra:
Multimodal Output