Claude
上下文1M
输入
$0.1700/M$0.5000/M
输出
$0.8500/M$2.5000/M
Claude 系列中面向高频、低延迟调用的选择,适合分类、信息抽取、请求路由和子智能体任务。相比 Haiku 4.5,上下文扩至 100 万 token,并支持自适应思考;复杂任务可考虑 Sonnet 或 Opus。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
上下文131K
按秒$0.0530/s
适合需要快速出图和反复对话修改的设计工作。相较 Nano Banana 2,它提升了画面质量、文字与信息图排版、宽幅图像及多轮角色一致性;支持多张参考图和 1K、2K、4K 输出。复杂品牌视觉和最高精度控制可考虑 Nano Banana Pro。
输入模态:
输出模态:
深度思考联网搜索长上下文多模态输出
OpenAI
上下文1.05M
输入
$0.4000/M$2.0000/M
输出
$2.0000/M$10.0000/M
适合复杂编程、计算机操作和专业文档工作。相比 GPT-6 Sol,复杂任务能力更强;接近 Astra 的表现,调用成本更低。需要最高质量时仍可选择 Astra。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
Claude
上下文1M
输入
$0.6800/M$2.0000/M
输出
$3.4000/M$10.0000/M
更适合作为速度与智能的均衡主力:1M 上下文、文本与图像输入、文本输出,支持自适应思考和工具调用,适合项目级代码、多步任务和知识工作。相比 Sonnet 5,重点优势是更快、更省 token;若追求最高质量或更复杂任务,可考虑 Opus 5.5。
输入模态:
输出模态:
深度思考工具调用长上下文
试用模型
Claude
上下文1M
输入
$1.3600/M$4.0000/M
输出
$6.8000/M$20.0000/M
面向长时程智能体编程和知识工作,适合跨文件重构、代码库审计与复杂多步任务;1M 上下文、始终开启的自适应思考和文本/图像输入使它偏向高质量长链路执行,相比 Sonnet 5 更重质量,代价是更高的成本与延迟。
输入模态:
输出模态:
深度思考工具调用长上下文
试用模型
OpenAI
OpenAI
上下文1.05M
输入
$0.4000/M$2.0000/M
输出
$2.0000/M$10.0000/M
面向复杂代码与智能体工作流,适合项目级编程、长链路规划和多步工具执行;1.05M 上下文、文本/图像输入、推理、函数调用与结构化输出构成完整主力能力,代价是比 GPT-6 Luna 更高的调用成本,适合质量与执行稳定性优先的任务。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
OpenAI
上下文1.05M
输入
$0.0200/M$0.1000/M
输出
$0.1000/M$0.5000/M
面向聚焦型、高吞吐任务,适合批量摘要、分类、改写和高频智能体调用;同样提供 1.05M 上下文、文本/图像输入、推理、函数调用与结构化输出,但以显著更低的成本换取与 Sol 不同的质量/深度取舍,复杂长链路任务优先考虑 GPT-6 Sol。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
DeepSeek
上下文1M
输入
$0.2700/M$0.3000/M
输出
$1.0800/M$1.2000/M
适合作为高吞吐、低成本的通用与 Agent 主力:原生支持图像理解和 1M 上下文,并可在思考与非思考模式间切换,支持工具调用与 JSON 输出。相比更高档的 V4 Pro,定位更偏向速度、吞吐和成本效率,适合长文档、代码/Agent 及图文分析;需要更深推理时再开启思考模式。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
上下文400K
按张$0.0080/image
GPT Image 2.5 Sunburst 的特价模型,按当前渠道映射使用 Sunburst;sale 仅表示特价线路,不改变其高精度生图与编辑的定位。适合价格敏感、仍需要参考图编辑和细节控制的专业视觉任务;需要常规线路时选择 gpt-image-2.5-sunburst。
输入模态:
输出模态:
多模态输出长上下文
试用模型
上下文400K
按张
$0.0336/image$0.0480/image
面向对编辑精度和成片质量要求更高的高级视觉工作流:适合生产级活动创意、精修产品图,以及需要在多轮修改中保持主体、构图和视觉处理一致的任务;支持文本与参考图输入、图像输出,但生成时间通常比 Flare 更长。
输入模态:
输出模态:
多模态输出长上下文
试用模型
上下文400K
按张$0.0080/image
GPT Image 2.5 Flare 的特价模型,按当前渠道映射使用 Flare;sale 仅表示特价线路,不改变其高质量、快速日常生图与编辑的定位。适合价格敏感的高频图片任务;需要常规线路时选择 gpt-image-2.5-flare。
输入模态:
输出模态:
多模态输出长上下文
试用模型
上下文400K
按张
$0.0336/image$0.0480/image
更适合作为高质量图像生成与编辑的默认主力:速度更快,适合创作者与社媒内容、产品体验、视觉搜索、快速原型和高频批量生成;支持文本与参考图输入、图像输出。若更看重精细编辑控制并能接受更长等待,可选 Sunburst。
输入模态:
输出模态:
多模态输出长上下文
试用模型
OpenAI
上下文1.05M
输入
$2.0000/M$10.0000/M
输出
$10.0000/M$50.0000/M
旗舰级端到端模型,适合复杂推理、软件工程、计算机操作、深度研究与文档工作;约 105 万 token 上下文、文本/图像/文档输入和文本输出,并支持推理、搜索、函数调用、结构化输出、代码执行与工具编排。相比更低档位模型,选择它主要是为了长链路任务的完成质量与执行稳定性,代价是更高的调用成本。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
Gemini
上下文1.05M
输入$0.7874/M
输出$3.9370/M
Flash 档旗舰,面向长链路软件工程、自治智能体和复杂企业工作流,在保持 Flash 速度与成本取向的同时提供更强推理和工具编排。支持文本、图像、视频、音频与 PDF 输入、约 105 万 token 上下文、搜索 grounding、函数调用、代码执行、结构化输出和可调思考;相比 Flash-Lite,更适合复杂任务,但调用成本更高。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
Claude
上下文1M
输入
$3.4000/M$10.0000/M
输出
$17.0000/M$50.0000/M
旗舰级长上下文模型,面向高难度、长周期的知识工作、代码项目和多步智能体任务;支持文本、图像与 PDF 输入,适合跨文件分析、复杂研究和持续工具调用。它更偏向质量、推理深度与长链路执行,速度较慢、成本较高,适合需要稳定完成复杂任务的场景。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用长上下文
试用模型
上下文1M
输入$0.1492/M
输出$0.4476/M
Qwen 系列的高效多模态主力模型,原生支持百万级上下文,并兼顾代码辅助、智能体工作流和图表等视觉理解;适合长文档、代码库、高并发应用与需要工具协作的任务。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
Zhipu
上下文1.31M
输入$0.1190/M
输出$0.4200/M
GLM-5 系列中兼顾前沿能力与调用效率的 Flash 模型:原生支持多模态,面向长上下文和高频执行,适合代码、智能体以及需要图文理解的复杂任务;相比更大档位,更适合作为成本敏感的生产主力。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
上下文1.05M
输入$0.1490/M
输出$0.2980/M
DeepSeek-V4-Flash 的实验性多模态变体,支持在文本交互中理解图像。适合视觉问答、截图和文档分析;由于处于实验阶段,更适合评估和灵活工作流,关键生产链路需谨慎使用。
输入模态:
输出模态:
深度思考工具调用长上下文
试用模型
按秒$0.0675/s
通义万相 3.0 系列的速度优先版本(早期访问阶段),在保持高质量视频生成的同时缩短出片等待,适合低延迟预览、批量试做和需要快速迭代的短视频工作流;若更看重极致画面控制而非出片速度,可选择标准版。
输入模态:
输出模态:
多模态输出
试用模型
Zhipu
Zhipu AI
上下文1M
输入
$1.0115/M$1.1900/M
输出
$3.5275/M$4.1500/M
面向复杂软件工程和长周期智能体任务的旗舰主力模型:沿用 GLM-5.2 基座,能力提升来自后训练,官方 Z.ai Code Bench 相比 GLM-5.2 提升 50%,并强化终端操作与漏洞发现。它提供 1M 上下文、最长 128K 输出,始终启用推理并支持 low、high、max 三档强度、函数调用和结构化输出;当前仅支持文本输入,不适合需要图像理解的任务。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
Gemini
上下文1.05M
输入$0.0000/M
输出$0.0000/M
免费模型仅供学习和体验,随时可能下架,高级模型设有每分钟5次请求的限制,且其可用性不作保证。
输入模态:
输出模态:
深度思考工具调用长上下文
试用模型
Gemini
上下文1.05M
输入$0.7500/M
输出$3.7500/M
Gemini 3 系列的新一代快速多模态模型,2026 年 8 月发布,主打低成本、高吞吐与多模态理解;支持文本、图像、视频、音频和文档输入,百万级上下文,适合大规模信息处理、批量任务和实时交互场景。
输入模态:
输出模态:
深度思考工具调用长上下文
试用模型
Grok
上下文500K
输入$0.8400/M
输出$2.5200/M
旗舰级通用模型,优先用于高质量代码、智能体执行和知识工作;适合需要持续规划、工具协作与复杂问题处理的任务。若只追求低延迟或低成本的简单调用,应优先选更轻量的模型。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
Qwen
按秒$0.0450/s
阿里通义万相 3.0 系列的标准视频生成模型(早期访问阶段),支持文生视频、图生视频及多模态参考输入,单次可生成最长约 30 秒的视频并同步生成音频,适合广告、短剧和叙事短片的快速出片;正式发布日期尚未公布,规格以官方为准。
输入模态:
输出模态:
多模态输出
Qwen
上下文1M
输入
$1.4200/M$1.7750/M
输出
$4.2640/M$5.3300/M
千问当前能力最强的旗舰多模态推理模型,适合长程编程、专业工作与多阶段智能体任务。它可处理文本、图片和视频,提供 1M 上下文、最长 128K 输出,并支持函数调用、结构化输出、联网搜索与代码解释器;更适合作为高质量复杂任务主力,而不是追求最低成本和最低延迟的批量调用。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
输入
$3.0865/M$3.2490/M
输出
$3.0865/M$3.2490/M
更适合从单个片段走向完整叙事的音视频模型:单次可生成最长 30 秒并支持多轮延长,还能参考多张图片、视频和音频,提供时间戳级编辑、绿幕和镜头控制;适用于广告、短片和需要连续镜头的创作,但复杂多主体运动仍需人工检查。
输入模态:
输出模态:
多模态输出
试用模型
Minimax
MiniMax
按秒$0.0800/s
面向视频创作的全模态生成模型,可结合文本、图像、视频和音频参考生成带同步音频的视频素材;适合短视频、广告和参考驱动的角色与镜头创作。它不是通用聊天模型,选择时应重点看视频一致性、运动表现与音画效果。
输入模态:
输出模态:
多模态输出
输入$3.3042/M
输出$3.3042/M
这是 Seedance 2.5 的站内路由变体,能力判断按底层模型而不是后缀:适合广告、品牌内容和叙事短片,支持最长 30 秒单次音视频生成、多轮延长、文本/图像/音频/视频参考、R2V 与时间戳级编辑;复杂运动和多主体物理一致性仍需人工复核。
输入模态:
输出模态:
多模态输出
试用模型
Claude
Anthropic
上下文1M
输入
$1.7000/M$5.0000/M
输出
$8.5000/M$25.0000/M
面向复杂智能体编程和企业级知识工作的高端模型,强调长链路规划、持续执行、自我校验和稳定交付;拥有百万级上下文,适合大型代码库、复杂文档以及需要较少人工监督的多步骤项目。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
上下文1.05M
输入$0.3000/M
输出$2.5000/M
Gemini 3.5 系列中速度最快、成本最低的模型,适合高并发、低延迟任务,以及翻译、分类、文档处理和轻量智能体工作流;支持多模态输入和最高 1M 上下文,但复杂推理、长链路规划或高质量代码修改应优先选择更高档 Flash 模型。
输入模态:
输出模态:
长上下文
试用模型
按秒
$0.0024/s$0.0030/s
质量优先的专业生图与编辑模型:支持文生图和基于 1–3 张参考图的图像编辑,最长可接收约 4.5K token 指令,适合报纸、故事板、菜单、试卷等复杂版面,以及 10px 级细小文字、12 种语言和多字体渲染。相较标准版,更适合把复杂布局和细节还原放在首位;若更看重速度与成本,选标准版。
输入模态:
输出模态:
按秒
$0.0024/s$0.0030/s
兼顾质量与速度的 Qwen-Image 3.0 标准档,支持文生图与基于 1–3 张参考图的图像编辑,最长约 4.5K token 指令、最多 6 张输出和 2K 级分辨率,适合日常海报、界面、信息图与批量创作。复杂版面、细小文字和质量优先的成片可切换到 Pro;高频调用则优先选标准版。
输入模态:
输出模态:
MoonshotAI
Moonshot
上下文1.05M
输入
$2.7000/M$3.0000/M
输出
$13.5000/M$15.0000/M
月之暗面的旗舰模型,原生支持视觉理解和最高 100 万 token 上下文;当前以 max 推理强度运行,适合长链路编码、知识工作及需要终端工具协作的复杂任务。为保持稳定性,建议保留完整推理历史,并在兼容的 Agent 框架中新开会话使用。
输入模态:
输出模态:
深度思考工具调用长上下文
试用模型
OpenAI
上下文1.05M
输入
$0.4000/M$2.0000/M
输出
$2.4000/M$12.0000/M
GPT-5.6 中兼顾能力与成本的主力档位。适合需要图像理解、工具调用和较长材料处理的生产任务;若任务难度和交付质量优先,选择 Sol;若重在高并发成本控制,选择 Luna。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
试用模型
OpenAI
上下文1.05M
输入
$1.0000/M$5.0000/M
输出
$6.0000/M$30.0000/M
GPT-5.6 系列的旗舰档位,面向复杂专业工作与高质量交付。支持图像输入、函数调用和结构化输出,并可承载超长上下文;对时延或单位成本敏感的高频任务,可考虑 Terra 或 Luna。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
试用模型
OpenAI
上下文1.05M
输入$0.2000/M
输出$1.2000/M
GPT-5.6 的高并发、成本敏感档位。适合摘要、分类、改写和批量自动化;需要复杂专业判断或质量优先的多步任务时,优先选同系列 Sol。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
试用模型
按秒$0.0450/s
面向专业视觉创作的多模态图像生成模型,支持从文本生成图像,并结合参考图和空间标注进行精准编辑;擅长高密度信息图、文字排版、真实光影与多语言图文生成。
输入模态:
输出模态:
深度思考多模态输出
试用模型
Grok
上下文500K
输入$2.1000/M
输出$6.3000/M
面向代码、知识工作和 STEM 问题的旗舰推理模型。支持图像输入、函数调用和结构化输出,50 万 token 上下文适合跨文件分析与长材料处理;不需要高难度推理时可选成本更低的模型。
输入模态:
输出模态:
深度思考函数调用结构化输出长上下文
试用模型
Claude
上下文1M
输入
$3.4000/M$10.0000/M
输出
$17.0000/M$50.0000/M
Anthropic 迄今最强的公开发布模型,专为高难度推理与长周期智能体(agentic)任务打造。原生支持 100 万 token 超长上下文与 128k 输出,自适应思考默认常开;擅长在任务欠明确时自主探索环境、制定计划并持续推进长程编码与多智能体编排,需要人工介入前能把任务推进得更远。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
Claude
上下文1M
输入
$0.6800/M$2.0000/M
输出
$3.4000/M$10.0000/M
Sonnet 档位的日常主力模型,重点是在较低成本下提供接近旗舰的智能体、编码和知识工作能力。默认 100 万 token 上下文与自适应思考适合长文档、代码库和多步工具任务;需要最深推理或受限高风险安全研究时,仍应评估更高档或专用模型。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
上下文256K
输入$0.9700/M
输出$4.8800/M
面向代码、代理和复杂生产力任务,相比 Doubao Seed 2.0 在长上下文、长输出和工具任务上更进一步;对比 Qwen、GLM、DeepSeek 等同类国产旗舰,它适合作为中文办公、代码和多步自动化场景的高性价比选择。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
按秒$0.1350/s
面向文生视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
按秒$0.1350/s
面向参考生成视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
按秒$0.1350/s
面向图生视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
输入$0.6300/M
输出$0.6300/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。该 filter-off 版本相比普通 Seedance 2.0 保持同档生成能力,但内容过滤更宽松;适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
多模态输出
试用模型
Zhipu
Zhipu AI
上下文1M
输入
$0.9690/M$1.1400/M
输出
$3.4000/M$4.0000/M
面向推理、代码和长上下文代理任务,相比 GLM-5.1 在上下文长度、工具调用和复杂多步任务上更进一步;对比 Qwen、DeepSeek、Kimi 等国产旗舰,它更适合中文企业自动化、项目级代码分析和知识工作流。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
MoonshotAI
上下文256K
输入$1.9000/M
输出$7.9999/M
面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2.6 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。
输入模态:
输出模态:
工具调用函数调用结构化输出长上下文
试用模型
MoonshotAI
上下文256K
输入
$0.8775/M$0.9750/M
输出
$3.6450/M$4.0500/M
面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2.6 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。
输入模态:
输出模态:
工具调用函数调用结构化输出长上下文
试用模型
按秒$0.1400/s
面向图像/视频驱动的生成、编辑和延展,相比 Grok Imagine 1.0 更强调运动一致性和快速社交内容产出;对比 Veo、Kling、Runway,它更适合 xAI 生态里的短视频、广告创意和实时趋势素材。
输入模态:
输出模态:
多模态输出
Qwen
上下文1M
输入
$0.2400/M$0.3000/M
输出
$0.9600/M$1.2000/M
面向代理式工作负载、代码和办公生产力,相比 Qwen3.6 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
Minimax
Free channel
上下文1M
输入$0.0000/M
输出$0.0000/M
免费模型仅供学习和体验,随时可能下架,高级模型设有每分钟5次请求的限制,且其可用性不作保证。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
Minimax
MiniMax
上下文1M
输入$0.3150/M
输出$1.2600/M
面向长周期编码、工具使用和多轮生产协作,相比 MiniMax M2.7 进一步扩展到多模态输入并保留 100 万 token 上下文;对比 Claude、Gemini、GLM-5.2 等长上下文代理模型,它更适合把文本、图像、视频资料放入同一工作流。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
Claude
上下文1M
输入
$1.7000/M$5.0000/M
输出
$8.5000/M$25.0000/M
Anthropic 当前的 Opus 旗舰模型,适合最复杂的推理、长链路代理和高自主编码任务;支持 1M 上下文与自适应思考。质量和可靠性优先于速度与成本时选它。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
Gemini
按秒$0.2450/s
面向任意输入到视频的多模态创作,相比 Gemini 早期视频能力更强调文本、图像、音频和视频资料的统一编排;对比 Veo、Kling、Runway,它更适合把复杂多模态素材整合进同一创意工作流。
输入模态:
输出模态:
多模态输出
试用模型
Qwen
上下文1M
输入
$1.4400/M$1.8000/M
输出
$4.3200/M$5.4000/M
面向代理式工作负载、代码和办公生产力,相比 Qwen3.6 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
上下文8K
按秒$0.1350/s
面向视频编辑,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
上下文8K
按秒$0.1350/s
面向文生视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
上下文8K
按秒$0.1350/s
面向参考生成视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
上下文8K
按秒$0.1350/s
面向图生视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。
输入模态:
输出模态:
多模态输出
DeepSeek
上下文1M
输入
$1.5390/M$1.7100/M
输出
$3.0869/M$3.4299/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.2 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
试用模型
DeepSeek
上下文1M
输入
$0.1278/M$0.1420/M
输出
$0.2574/M$0.2860/M
面向推理、代码和智能体工具使用,相比 DeepSeek V3.2 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
试用模型
OpenAI
OpenAI
上下文1M
输入
$1.0000/M$5.0000/M
输出
$6.0000/M$30.0000/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.4 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
XiaomiMiMo
输入$0.0000/M
输出$0.0000/M
面向一句话音色设计和文本转语音,相比 MiMo V2 TTS 更强调 V2.5 系列的自然语言音色创建、语速/情绪/语气细粒度控制和低门槛声音生产;对比 ElevenLabs、OpenAI TTS 和 Azure Speech,它更适合无需参考音频的角色音色设计、广告配音、短视频旁白和多风格语音探索。
输入模态:
输出模态:
多模态输出
XiaomiMiMo
输入$0.0000/M
输出$0.0000/M
面向少量样本声音克隆,相比 MiMo V2 TTS 更强调 V2.5 系列的高保真音色复刻、音色特征一致性和跨文本泛化稳定性;对比 ElevenLabs、OpenAI TTS 和 Azure Speech,它更适合中文角色配音、短视频旁白、播客复刻和需要保留目标音色的多语言语音生产。
输入模态:
输出模态:
多模态输出
XiaomiMiMo
Xiaomi MiMo
输入$0.0000/M
输出$0.0000/M
面向文本转语音、Voice Design 和声音克隆,相比 MiMo V2 TTS 更强调 V2.5 系列的自然语音合成、细粒度语速/情绪/音调控制和低门槛音色创建;对比 ElevenLabs、OpenAI TTS 和 Azure Speech,它更适合中文旁白、角色配音、短视频音频和多语言语音生产。
输入模态:
输出模态:
多模态输出
XiaomiMiMo
Xiaomi MiMo
上下文1M
输入$1.1700/M
输出$3.5000/M
面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
XiaomiMiMo
Xiaomi MiMo
上下文1M
输入$0.4700/M
输出$2.3600/M
面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
OpenAI
上下文400K
按张$0.0080/image
GPT Image 2 的特价模型,按当前渠道映射使用同一底层模型;sale 仅表示特价线路,不代表独立的能力差异。适合价格敏感、可接受特价线路差异的日常生图与参考图编辑;更看重常规线路一致性时选择 gpt-image-2。
输入模态:
输出模态:
多模态输出长上下文
试用模型
OpenAI
上下文128K
按张
$0.0196/image$0.0280/image
面向高质量图像生成与编辑,相比 GPT Image 1.x 在文字渲染、局部编辑和多轮一致性上更进一步;对比 Gemini 图像模型、Qwen Image 和 Seedream,它更适合品牌视觉、广告设计、产品图和需要精细控制的创意工作流。
输入模态:
输出模态:
多模态输出
试用模型
Claude
上下文1M
输入
$1.7000/M$5.0000/M
输出
$8.5000/M$25.0000/M
面向复杂、长时间运行的软件工程和代理任务;相比 Opus 4.6 更强调严格遵循指令、高分辨率视觉理解、持续执行和自我验证。适合大型代码库、复杂调试、文档分析与多步工具协作。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
上下文200K
输入$0.6300/M
输出$2.5200/M
面向文本生成、推理和工具调用,相比 MiniMax M2.x 早期版本更强调 200K 长上下文和代理式工作流稳定性;对比 Kimi、GLM、Qwen 等同类中文模型,它适合办公、代码辅助和长文档处理。
输入模态:
输出模态:
深度思考
试用模型
Minimax
上下文200K
输入$0.3150/M
输出$1.2600/M
面向文本生成、推理和工具调用,相比 MiniMax M2.x 早期版本更强调 200K 长上下文和代理式工作流稳定性;对比 Kimi、GLM、Qwen 等同类中文模型,它适合办公、代码辅助和长文档处理。
输入模态:
输出模态:
深度思考
试用模型
OpenAI
上下文400K
输入$0.2000/M
输出$1.2500/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
工具调用结构化输出长上下文
试用模型
OpenAI
上下文400K
输入$0.7500/M
输出$4.5000/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
试用模型
OpenAI
OpenAI
上下文1.05M
输入
$0.5000/M$2.5000/M
输出
$3.0000/M$15.0000/M
面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。
输入模态:
输出模态:
长上下文工具调用深度思考结构化输出
试用模型
上下文131K
按张
$0.0280/image$0.0400/image
面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。
输入模态:
输出模态:
深度思考多模态输出
试用模型
上下文1.05M
输入
$1.4000/M$2.0000/M
输出
$8.4000/M$12.0000/M
面向多模态理解、代码和长上下文任务,相比 Gemini 3.0 / 2.5 在吞吐、上下文和工具能力上更进一步;对比 GPT、Claude、Qwen 等模型,它更适合把文本、图像、音频、视频和文档放进统一分析工作流。
输入模态:
输出模态:
长上下文
试用模型
Claude
上下文1M
输入
$1.0200/M$3.0000/M
输出
$5.1000/M$15.0000/M
Claude 系列的综合主力模型,在速度、智能和成本之间取得平衡;支持 1M 上下文与自适应思考,适合日常编码、文档分析、数据处理和代理式工具调用。大多数高质量生产任务可从它开始,极复杂任务再升级到 Opus。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
上下文256K
输入$0.5000/M
输出$2.5300/M
面向代码、代理和复杂生产力任务,相比 Doubao Seed 2.0 在长上下文、长输出和工具任务上更进一步;对比 Qwen、GLM、DeepSeek 等同类国产旗舰,它适合作为中文办公、代码和多步自动化场景的高性价比选择。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文
试用模型
按张$0.0350/image
面向图像生成与编辑,相比 Seedream 4.x 更强调中文指令理解、视觉推理和高频创意产出;对比 GPT Image、Gemini 图像模型和 Qwen Image,它更适合字节生态内的广告设计、电商素材和多场景视觉生产。
输入模态:
输出模态:
联网搜索多模态输出
试用模型
Minimax
上下文205K
输入$0.3020/M
输出$1.2077/M
面向真实生产力智能体的高性价比模型,强项在代码、工具调用、搜索和办公交付,而不只是聊天。它适合让代理规划并执行跨文件修改、研究检索、文档/表格/演示类任务;相比更贵的旗舰模型,核心取舍是用更低成本换取接近前沿的执行效率。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
上下文13K
输入$2.1606/M
输出$2.1606/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。该 filter-off 版本相比普通 Seedance 2.0 保持同档生成能力,但内容过滤更宽松;适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
多模态输出
试用模型
上下文13K
输入$1.5465/M
输出$1.5465/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。该 filter-off 版本相比普通 Seedance 2.0 保持同档生成能力,但内容过滤更宽松;适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
多模态输出
试用模型
Claude
上下文1M
输入
$1.7000/M$5.0000/M
输出
$8.5000/M$25.0000/M
面向复杂推理、代理式编码和大型代码库工作的 Opus 模型;相比 Opus 4.5 更强调长时间规划、代码审查、调试、自主执行以及文档和表格等知识工作,并支持 1M 上下文与自适应思考。新项目优先评估更新的 Opus 4.7 或 4.8。
输入模态:
输出模态:
深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
试用模型
Kling
按秒$0.0900/s
面向文本/图像到视频和多镜头创作,相比 Kling 2.x 在运动稳定性、镜头语言和参考图一致性上更进一步;对比 Veo、Runway、Seedance,它更适合中文短剧、广告素材和高质量社交视频生产。
输入模态:
输出模态:
多模态输出
Kling
按秒$0.0900/s
面向文本/图像到视频和多镜头创作,相比 Kling 2.x 在运动稳定性、镜头语言和参考图一致性上更进一步;对比 Veo、Runway、Seedance,它更适合中文短剧、广告素材和高质量社交视频生产。
输入模态:
输出模态:
多模态输出
上下文8K
输入
$1.7039/M$2.0046/M
输出
$1.7039/M$2.0046/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。高速版本相比标准档更适合快速迭代和批量产出;适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
多模态输出
试用模型
上下文8K
输入
$2.0309/M$2.1378/M
输出
$2.0309/M$2.1378/M
面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。适合短剧、广告、电商和社交素材。
输入模态:
输出模态:
多模态输出
试用模型
Zhipu
Zhipu AI
输入$0.8800/M
输出$3.5500/M
面向图像生成与编辑,相比早期 GLM 视觉能力更专注于中文提示词、图文理解和可控生成;对比 GPT Image、Gemini 图像模型和 Qwen Image,它更适合中文营销素材、知识图解和多轮视觉修改。
输入模态:
输出模态:
多模态输出
上下文1M
输入$0.5000/M
输出$3.0000/M
Google 高速推理模型,专为 Agent 工作流、多轮对话和代码辅助而设计。支持文本、图像、音频、视频和 PDF 输入,100 万 token 上下文窗口。支持可配置推理级别、工具调用和结构化输出。比前代 Gemini 2.5 Flash 在推理、多模态理解和可靠性方面全面提升。
输入模态:
输出模态:
深度思考工具调用函数调用结构化输出长上下文
试用模型
上下文66K
按张
$0.0938/image$0.1340/image
面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。
输入模态:
输出模态:
深度思考多模态输出
试用模型
Claude
上下文200K
输入
$3.5000/M$5.0000/M
输出
$17.5000/M$25.0000/M
Claude 4 系列较早的 Opus 模型,重点覆盖高难度编码、代理、电脑操作、深度研究以及幻灯片和表格处理。适合需要 Opus 级能力且必须兼容 4.5 的工作流;没有版本约束时优先评估更新的 Opus 4.6 或 4.7。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
Gemini
按次$0.1100/call
面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。Lite 档相较标准档更偏向高吞吐和低成本草稿。
输入模态:
输出模态:
多模态输出
试用模型
Gemini
按次$0.2211/call
面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。Fast 档相较标准档更适合快速概念验证。
输入模态:
输出模态:
多模态输出
试用模型
Gemini
Google
按次$1.6544/call
面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。
输入模态:
输出模态:
多模态输出
试用模型
Claude
上下文200K
输入
$0.3400/M$1.0000/M
输出
$1.7000/M$5.0000/M
Claude 系列中速度最快、成本更友好的模型,提供接近前沿水平的能力并支持 200K 上下文与思考。适合实时交互、批量处理、轻量代理和成本敏感的生产链路;最难的推理或代码修改应升级到 Sonnet 或 Opus。
输入模态:
输出模态:
深度思考工具调用结构化输出长上下文
试用模型
输入
$0.5922/M$1.1844/M
输出
$0.5922/M$1.1844/M
偏轻量与高吞吐的 Seedance 2.0 变体:适合短视频草稿、批量素材和成本敏感的快速迭代;它的价值在于更轻量的生成档位,若任务强调最高画质、复杂运动或更高规格输出,优先标准版。
输入模态:
输出模态:
多模态输出
试用模型
Gemini
按张$0.0300/image
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出
Gemini
按次$0.0200/call
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出
Gemini
按张$0.0300/image
这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。
输入模态:
输出模态:
多模态输出