Claudeclaude-fable-5-1Anthropic上下文1M输入$3.4000/M$10.0000/M输出$17.0000/M$50.0000/M旗舰级长上下文模型,面向高难度、长周期的知识工作、代码项目和多步智能体任务;支持文本、图像与 PDF 输入,适合跨文件分析、复杂研究和持续工具调用。它更偏向质量、推理深度与长链路执行,速度较慢、成本较高,适合需要稳定完成复杂任务的场景。输入模态: 输出模态: 深度思考联网搜索工具调用函数调用长上下文
Qwenqwen3.8-flashQwen上下文1M输入$0.1492/M输出$0.4476/MQwen 系列的高效多模态主力模型,原生支持百万级上下文,并兼顾代码辅助、智能体工作流和图表等视觉理解;适合长文档、代码库、高并发应用与需要工具协作的任务。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Zhipuglm-5.3-flashZhipu AI上下文1.31M输入$0.1190/M输出$0.4200/MGLM-5 系列中兼顾前沿能力与调用效率的 Flash 模型:原生支持多模态,面向长上下文和高频执行,适合代码、智能体以及需要图文理解的复杂任务;相比更大档位,更适合作为成本敏感的生产主力。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
DeepSeekdeepseek-v4-flash-vision-expDeepSeek上下文1.05M输入$0.1490/M输出$0.2980/MDeepSeek-V4-Flash 的实验性多模态变体,支持在文本交互中理解图像。适合视觉问答、截图和文档分析;由于处于实验阶段,更适合评估和灵活工作流,关键生产链路需谨慎使用。输入模态: 输出模态: 深度思考工具调用长上下文
Z.aicoding-glm-5.3-freeFree channel上下文1M输入$0.0000/M输出$0.0000/M免费模型仅供学习和体验,随时可能下架,高级模型设有每分钟5次请求的限制,且其可用性不作保证。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Zhipuglm-5.3Zhipu AI上下文1M输入$1.0115/M$1.1900/M输出$3.5275/M$4.1500/M面向复杂软件工程和长周期智能体任务的旗舰主力模型:沿用 GLM-5.2 基座,能力提升来自后训练,官方 Z.ai Code Bench 相比 GLM-5.2 提升 50%,并强化终端操作与漏洞发现。它提供 1M 上下文、最长 128K 输出,始终启用推理并支持 low、high、max 三档强度、函数调用和结构化输出;当前仅支持文本输入,不适合需要图像理解的任务。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Geminigemini-3.7-flash-freeFree channel上下文1.05M输入$0.0000/M输出$0.0000/M免费模型仅供学习和体验,随时可能下架,高级模型设有每分钟5次请求的限制,且其可用性不作保证。输入模态: 输出模态: 深度思考工具调用长上下文
Geminigemini-3.7-flashGoogle上下文1.05M输入$0.7500/M输出$3.7500/MGemini 3 系列的新一代快速多模态模型,2026 年 8 月发布,主打低成本、高吞吐与多模态理解;支持文本、图像、视频、音频和文档输入,百万级上下文,适合大规模信息处理、批量任务和实时交互场景。输入模态: 输出模态: 深度思考工具调用长上下文
Grokgrok-4.6xAI上下文500K输入$0.8400/M输出$2.5200/M旗舰级通用模型,优先用于高质量代码、智能体执行和知识工作;适合需要持续规划、工具协作与复杂问题处理的任务。若只追求低延迟或低成本的简单调用,应优先选更轻量的模型。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Qwenqwen3.8-maxQwen上下文1M输入$1.4200/M$1.7750/M输出$4.2640/M$5.3300/M千问当前能力最强的旗舰多模态推理模型,适合长程编程、专业工作与多阶段智能体任务。它可处理文本、图片和视频,提供 1M 上下文、最长 128K 输出,并支持函数调用、结构化输出、联网搜索与代码解释器;更适合作为高质量复杂任务主力,而不是追求最低成本和最低延迟的批量调用。输入模态: 输出模态: 深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
MinimaxMiniMax-H3MiniMax按秒$0.0800/s面向视频创作的全模态生成模型,可结合文本、图像、视频和音频参考生成带同步音频的视频素材;适合短视频、广告和参考驱动的角色与镜头创作。它不是通用聊天模型,选择时应重点看视频一致性、运动表现与音画效果。输入模态: 输出模态: 多模态输出
Claudeclaude-opus-5Anthropic上下文1M输入$1.7000/M$5.0000/M输出$8.5000/M$25.0000/M面向复杂智能体编程和企业级知识工作的高端模型,强调长链路规划、持续执行、自我校验和稳定交付;拥有百万级上下文,适合大型代码库、复杂文档以及需要较少人工监督的多步骤项目。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Geminigemini-3.6-flashGoogle上下文1.05M输入$1.5000/M输出$7.5000/MGemini Flash 系列的主力模型,强调效率、代码、知识工作和多模态理解;相比 3.5 Flash,它用更少的输出 token、推理步骤和工具调用完成多步任务,适合生产级智能体、文档与图表分析以及高频复杂工作流。输入模态: 输出模态: 深度思考工具调用长上下文
Geminigemini-3.5-flash-liteGoogle上下文1.05M输入$0.3000/M输出$2.5000/MGemini 3.5 系列中速度最快、成本最低的模型,适合高并发、低延迟任务,以及翻译、分类、文档处理和轻量智能体工作流;支持多模态输入和最高 1M 上下文,但复杂推理、长链路规划或高质量代码修改应优先选择更高档 Flash 模型。输入模态: 输出模态: 长上下文
MoonshotAIkimi-k3Moonshot上下文1.05M输入$2.7000/M$3.0000/M输出$13.5000/M$15.0000/M月之暗面的旗舰模型,原生支持视觉理解和最高 100 万 token 上下文;当前以 max 推理强度运行,适合长链路编码、知识工作及需要终端工具协作的复杂任务。为保持稳定性,建议保留完整推理历史,并在兼容的 Agent 框架中新开会话使用。输入模态: 输出模态: 深度思考工具调用长上下文
MoonshotAIcoding-kimi-k3-freeFree channel上下文1.05M输入$0.0000/M输出$0.0000/M免费模型仅供学习和体验,随时可能下架,高级模型设有每分钟5次请求的限制,且其可用性不作保证。输入模态: 输出模态: 深度思考工具调用长上下文
OpenAIgpt-5.6-terraOpenAI上下文1.05M输入$0.4000/M$2.0000/M输出$2.4000/M$12.0000/MGPT-5.6 中兼顾能力与成本的主力档位。适合需要图像理解、工具调用和较长材料处理的生产任务;若任务难度和交付质量优先,选择 Sol;若重在高并发成本控制,选择 Luna。输入模态: 输出模态: 深度思考函数调用结构化输出长上下文
OpenAIgpt-5.6-solOpenAI上下文1.05M输入$1.0000/M$5.0000/M输出$6.0000/M$30.0000/MGPT-5.6 系列的旗舰档位,面向复杂专业工作与高质量交付。支持图像输入、函数调用和结构化输出,并可承载超长上下文;对时延或单位成本敏感的高频任务,可考虑 Terra 或 Luna。输入模态: 输出模态: 深度思考函数调用结构化输出长上下文
Doubaodoubao-seedream-5-0-proDoubao按秒$0.0450/s面向专业视觉创作的多模态图像生成模型,支持从文本生成图像,并结合参考图和空间标注进行精准编辑;擅长高密度信息图、文字排版、真实光影与多语言图文生成。输入模态: 输出模态: 深度思考多模态输出
Grokgrok-4.5xAI上下文500K输入$2.1000/M输出$6.3000/M面向代码、知识工作和 STEM 问题的旗舰推理模型。支持图像输入、函数调用和结构化输出,50 万 token 上下文适合跨文件分析与长材料处理;不需要高难度推理时可选成本更低的模型。输入模态: 输出模态: 深度思考函数调用结构化输出长上下文
Claudeclaude-fable-5Anthropic上下文1M输入$3.4000/M$10.0000/M输出$17.0000/M$50.0000/MAnthropic 迄今最强的公开发布模型,专为高难度推理与长周期智能体(agentic)任务打造。原生支持 100 万 token 超长上下文与 128k 输出,自适应思考默认常开;擅长在任务欠明确时自主探索环境、制定计划并持续推进长程编码与多智能体编排,需要人工介入前能把任务推进得更远。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Geminigemini-3.1-flash-lite-imageGoogle按次$0.0120/call$0.0200/call偏高效率和快速迭代的图像生成与编辑模型,适合高频视觉草稿、社媒素材、海报和多轮改图;支持多模态输入与百万级上下文,在速度和规模化调用上更有优势,但复杂创作控制优先选择 Pro Image。输入模态: 输出模态: 多模态输出
Claudeclaude-sonnet-5Anthropic上下文1M输入$0.6800/M$2.0000/M输出$3.4000/M$10.0000/MSonnet 档位的日常主力模型,重点是在较低成本下提供接近旗舰的智能体、编码和知识工作能力。默认 100 万 token 上下文与自适应思考适合长文档、代码库和多步工具任务;需要最深推理或受限高风险安全研究时,仍应评估更高档或专用模型。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Doubaodoubao-seedance-2.5-260628Doubao输入$3.6594/M$3.8520/M输出$3.6594/M$3.8520/MSeedance 系列面向长叙事和复杂创作工作流的新一代模型:支持更灵活的多模态参考、视频延展与精细编辑,适合广告、影视短片和需要保持角色、场景与音画连续性的内容生产。输入模态: 输出模态: 多模态输出
Doubaodoubao-seed-2-1-proDoubao上下文256K输入$0.9700/M输出$4.8800/M面向代码、代理和复杂生产力任务,相比 Doubao Seed 2.0 在长上下文、长输出和工具任务上更进一步;对比 Qwen、GLM、DeepSeek 等同类国产旗舰,它适合作为中文办公、代码和多步自动化场景的高性价比选择。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Qwenhappyhorse-1.1-t2v阿里巴巴按秒$0.1350/s面向文生视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。输入模态: 输出模态: 多模态输出
Qwenhappyhorse-1.1-r2v阿里巴巴按秒$0.1350/s面向参考生成视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。输入模态: 输出模态: 多模态输出
Qwenhappyhorse-1.1-i2v阿里巴巴按秒$0.1350/s面向图生视频,相比 HappyHorse 1.0 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。输入模态: 输出模态: 多模态输出
Doubaodreamina-seedance-2-0-mini-filter-offDoubao输入$1.5750/M输出$1.5750/M面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。该 filter-off 版本相比普通 Seedance 2.0 保持同档生成能力,但内容过滤更宽松;适合短剧、广告、电商和社交素材。输入模态: 输出模态: 多模态输出
Zhipuglm-5.2Zhipu AI上下文1M输入$0.9690/M$1.1400/M输出$3.4000/M$4.0000/M面向推理、代码和长上下文代理任务,相比 GLM-5.1 在上下文长度、工具调用和复杂多步任务上更进一步;对比 Qwen、DeepSeek、Kimi 等国产旗舰,它更适合中文企业自动化、项目级代码分析和知识工作流。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Doubaodoubao-seedance-2.0-mini-260615Doubao输入$0.3150/M$0.6300/M输出$0.3150/M$0.6300/MSeedance 2.0 的轻量版本,保留文本、图像、视频等参考驱动的视频生成能力,更适合快速试做、批量草稿和对成本敏感的工作流;需要更复杂的运动控制、镜头表现或更高完成度时,优先选择标准版。输入模态: 输出模态: 多模态输出
MoonshotAIkimi-k2.7-code-highspeedMoonshot上下文256K输入$1.9000/M输出$7.9999/M面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2.6 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。输入模态: 输出模态: 工具调用函数调用结构化输出长上下文
MoonshotAIkimi-k2.7-codeMoonshot上下文256K输入$0.8775/M$0.9750/M输出$3.6450/M$4.0500/M面向长上下文、多步工具调用和代码/文档工作流,相比 Kimi K2.6 更强调工程任务稳定性和上下文承载能力;对比 Qwen、GLM、DeepSeek,它更适合中文长文档分析、项目问答和日常智能体编程。输入模态: 输出模态: 工具调用函数调用结构化输出长上下文
Grokgrok-imagine-video-1-5-previewxAI按秒$0.1400/s面向图像/视频驱动的生成、编辑和延展,相比 Grok Imagine 1.0 更强调运动一致性和快速社交内容产出;对比 Veo、Kling、Runway,它更适合 xAI 生态里的短视频、广告创意和实时趋势素材。输入模态: 输出模态: 多模态输出
Qwenqwen3.7-plusQwen上下文1M输入$0.2400/M$0.3000/M输出$0.9600/M$1.2000/M面向代理式工作负载、代码和办公生产力,相比 Qwen3.6 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Minimaxminimax-m3-freeFree channel上下文1M输入$0.0000/M输出$0.0000/M免费模型仅供学习和体验,随时可能下架,高级模型设有每分钟5次请求的限制,且其可用性不作保证。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
MinimaxMiniMax-M3MiniMax上下文1M输入$0.3150/M输出$1.2600/M面向长周期编码、工具使用和多轮生产协作,相比 MiniMax M2.7 进一步扩展到多模态输入并保留 100 万 token 上下文;对比 Claude、Gemini、GLM-5.2 等长上下文代理模型,它更适合把文本、图像、视频资料放入同一工作流。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Claudeclaude-opus-4-8Anthropic上下文1M输入$1.7000/M$5.0000/M输出$8.5000/M$25.0000/MAnthropic 当前的 Opus 旗舰模型,适合最复杂的推理、长链路代理和高自主编码任务;支持 1M 上下文与自适应思考。质量和可靠性优先于速度与成本时选它。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Geminigemini-omni-videoGoogle按秒$0.2450/s面向任意输入到视频的多模态创作,相比 Gemini 早期视频能力更强调文本、图像、音频和视频资料的统一编排;对比 Veo、Kling、Runway,它更适合把复杂多模态素材整合进同一创意工作流。输入模态: 输出模态: 多模态输出
Geminigemini-3.5-flashGoogle上下文1M输入$1.5000/M输出$9.0000/M面向多模态理解、代码和长上下文任务,相比 Gemini 3.1 在吞吐、上下文和工具能力上更进一步;对比 GPT、Claude、Qwen 等模型,它更适合把文本、图像、音频、视频和文档放进统一分析工作流。输入模态: 输出模态: 深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
Qwenqwen3.7-maxQwen上下文1M输入$1.4400/M$1.8000/M输出$4.3200/M$5.4000/M面向代理式工作负载、代码和办公生产力,相比 Qwen3.6 更强调长上下文、工具调用和结构化输出的稳定组合;对比 GPT、Claude、Gemini 等旗舰模型,它更适合作为中文、代码和多步工具任务里的高性价比替代。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Qwenhappyhorse-1.0-video-editQwen上下文8K按秒$0.1350/s面向视频编辑,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。输入模态: 输出模态: 多模态输出
Qwenhappyhorse-1.0-t2vQwen上下文8K按秒$0.1350/s面向文生视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。输入模态: 输出模态: 多模态输出
Qwenhappyhorse-1.0-r2vQwen上下文8K按秒$0.1350/s面向参考生成视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。输入模态: 输出模态: 多模态输出
Qwenhappyhorse-1.0-i2vQwen上下文8K按秒$0.1350/s面向图生视频,相比 早期视频模型 更突出音频原生生成,一次完成对白、音效和背景音乐;对比 Veo、Kling、Runway,它的差异化优势在声画同步和角色一致性工作流。适合短剧、广告、电商和品牌营销视频。输入模态: 输出模态: 多模态输出
DeepSeekdeepseek-v4-proDeepSeek上下文1M输入$1.5390/M$1.7100/M输出$3.0869/M$3.4299/M面向推理、代码和智能体工具使用,相比 DeepSeek V3.2 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。输入模态: 输出模态: 长上下文工具调用深度思考结构化输出
DeepSeekdeepseek-v4-flashDeepSeek上下文1M输入$0.1278/M$0.1420/M输出$0.2574/M$0.2860/M面向推理、代码和智能体工具使用,相比 DeepSeek V3.2 更强调长上下文、思考模式和复杂任务执行;对比 Qwen、GLM、Kimi 等国产模型,它在数学、编程和逻辑推理场景中更具竞争力,适合严肃代码与分析任务。输入模态: 输出模态: 长上下文工具调用深度思考结构化输出
OpenAIgpt-5.5OpenAI上下文1M输入$1.0000/M$5.0000/M输出$6.0000/M$30.0000/M面向推理、代码、视觉理解和智能体任务,相比 GPT-5.4 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
XiaomiMiMomimo-v2.5-tts-voicedesignXiaomi MiMo输入$0.0000/M输出$0.0000/M面向一句话音色设计和文本转语音,相比 MiMo V2 TTS 更强调 V2.5 系列的自然语言音色创建、语速/情绪/语气细粒度控制和低门槛声音生产;对比 ElevenLabs、OpenAI TTS 和 Azure Speech,它更适合无需参考音频的角色音色设计、广告配音、短视频旁白和多风格语音探索。输入模态: 输出模态: 多模态输出
XiaomiMiMomimo-v2.5-tts-voicecloneXiaomi MiMo输入$0.0000/M输出$0.0000/M面向少量样本声音克隆,相比 MiMo V2 TTS 更强调 V2.5 系列的高保真音色复刻、音色特征一致性和跨文本泛化稳定性;对比 ElevenLabs、OpenAI TTS 和 Azure Speech,它更适合中文角色配音、短视频旁白、播客复刻和需要保留目标音色的多语言语音生产。输入模态: 输出模态: 多模态输出
XiaomiMiMomimo-v2.5-ttsXiaomi MiMo输入$0.0000/M输出$0.0000/M面向文本转语音、Voice Design 和声音克隆,相比 MiMo V2 TTS 更强调 V2.5 系列的自然语音合成、细粒度语速/情绪/音调控制和低门槛音色创建;对比 ElevenLabs、OpenAI TTS 和 Azure Speech,它更适合中文旁白、角色配音、短视频音频和多语言语音生产。输入模态: 输出模态: 多模态输出
XiaomiMiMomimo-v2.5-proXiaomi MiMo上下文1M输入$1.1700/M输出$3.5000/M面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
XiaomiMiMomimo-v2.5Xiaomi MiMo上下文1M输入$0.4700/M输出$2.3600/M面向代理、代码和长上下文任务,相比 MiMo V2 在多模态理解、百万级上下文和长程推理上更完整;对比 Qwen、GLM、DeepSeek 等国产模型,它的优势在小米生态适配和工程自动化场景。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
OpenAIgpt-image-2-text-to-imageOpenAI上下文128K按张$0.0300/image这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。输入模态: 输出模态: 多模态输出
OpenAIgpt-image-2-image-to-imageOpenAI上下文128K按张$0.0200/image这是特价体验线路,生成等待时间较长,大概有 10% 的机率生成失败。适合对成本敏感、可以接受排队和偶发失败的图片生成体验;如需更稳定的生产使用,建议选择常规线路。输入模态: 输出模态: 多模态输出
OpenAIgpt-image-2OpenAI上下文128K按张$0.0670/image面向高质量图像生成与编辑,相比 GPT Image 1.x 在文字渲染、局部编辑和多轮一致性上更进一步;对比 Gemini 图像模型、Qwen Image 和 Seedream,它更适合品牌视觉、广告设计、产品图和需要精细控制的创意工作流。输入模态: 输出模态: 多模态输出
Claudeclaude-opus-4-7Anthropic上下文1M输入$1.7000/M$5.0000/M输出$8.5000/M$25.0000/M面向复杂、长时间运行的软件工程和代理任务;相比 Opus 4.6 更强调严格遵循指令、高分辨率视觉理解、持续执行和自我验证。适合大型代码库、复杂调试、文档分析与多步工具协作。输入模态: 输出模态: 深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
MinimaxMiniMax-M2.7-highspeedMiniMax上下文200K输入$0.6300/M输出$2.5200/M面向文本生成、推理和工具调用,相比 MiniMax M2.x 早期版本更强调 200K 长上下文和代理式工作流稳定性;对比 Kimi、GLM、Qwen 等同类中文模型,它适合办公、代码辅助和长文档处理。输入模态: 输出模态: 深度思考
MinimaxMiniMax-M2.7MiniMax上下文200K输入$0.3150/M输出$1.2600/M面向文本生成、推理和工具调用,相比 MiniMax M2.x 早期版本更强调 200K 长上下文和代理式工作流稳定性;对比 Kimi、GLM、Qwen 等同类中文模型,它适合办公、代码辅助和长文档处理。输入模态: 输出模态: 深度思考
OpenAIgpt-5.4-miniOpenAI上下文400K输入$0.7500/M输出$4.5000/M面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。输入模态: 输出模态: 长上下文工具调用深度思考结构化输出
OpenAIgpt-5.4OpenAI上下文1.05M输入$0.5000/M$2.5000/M输出$3.0000/M$15.0000/M面向推理、代码、视觉理解和智能体任务,相比 GPT-5.3 更强调长上下文、工具调用和规模化稳定输出;对比 Claude、Gemini、Qwen 等旗舰模型,它更适合作为通用高可靠自动化和复杂知识工作流底座。输入模态: 输出模态: 长上下文工具调用深度思考结构化输出
Qwenqwen-image-2.0-proQwen输入$2.2000/M输出$2.2000/M面向图像生成与编辑,相比 Qwen Image 1.x 在中文文字渲染、指令遵循和复杂版式上更进一步;对比 GPT Image、Gemini 图像模型和 Seedream,它更适合中文海报、电商图、信息图和多轮视觉创作。输入模态: 输出模态: 多模态输出
Qwenqwen-image-2.0Qwen输入$2.2000/M输出$2.2000/M面向图像生成与编辑,相比 Qwen Image 1.x 在中文文字渲染、指令遵循和复杂版式上更进一步;对比 GPT Image、Gemini 图像模型和 Seedream,它更适合中文海报、电商图、信息图和多轮视觉创作。输入模态: 输出模态: 多模态输出
Geminigemini-3.1-flash-image-previewGoogle上下文131K按张$0.0672/image面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。输入模态: 输出模态: 深度思考多模态输出
Geminigemini-3.1-flash-imageGoogle按张$0.0198/image$0.0330/imageGemini 图像模型中兼顾质量与速度的高效档位,适合文本生图、图像编辑、多图融合和需要快速规模化产出的工作流;支持更灵活的构图与文字渲染,复杂专业设计可考虑 Gemini 3 Pro Image。输入模态: 输出模态: 多模态输出
Geminigemini-3.1-pro-previewGoogle上下文1.05M输入$2.0000/M输出$12.0000/M面向多模态理解、代码和长上下文任务,相比 Gemini 3.0 / 2.5 在吞吐、上下文和工具能力上更进一步;对比 GPT、Claude、Qwen 等模型,它更适合把文本、图像、音频、视频和文档放进统一分析工作流。输入模态: 输出模态: 长上下文
Claudeclaude-sonnet-4-6Anthropic上下文1M输入$1.0200/M$3.0000/M输出$5.1000/M$15.0000/MClaude 系列的综合主力模型,在速度、智能和成本之间取得平衡;支持 1M 上下文与自适应思考,适合日常编码、文档分析、数据处理和代理式工具调用。大多数高质量生产任务可从它开始,极复杂任务再升级到 Opus。输入模态: 输出模态: 深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
Doubaodoubao-seed-2-0-proDoubao上下文256K输入$0.5000/M输出$2.5300/M面向代码、代理和复杂生产力任务,相比 Doubao Seed 2.0 在长上下文、长输出和工具任务上更进一步;对比 Qwen、GLM、DeepSeek 等同类国产旗舰,它适合作为中文办公、代码和多步自动化场景的高性价比选择。输入模态: 输出模态: 深度思考联网搜索工具调用函数调用结构化输出长上下文
Doubaodoubao-seedream-5.0-liteDoubao按张$0.0350/image面向图像生成与编辑,相比 Seedream 4.x 更强调中文指令理解、视觉推理和高频创意产出;对比 GPT Image、Gemini 图像模型和 Qwen Image,它更适合字节生态内的广告设计、电商素材和多场景视觉生产。输入模态: 输出模态: 联网搜索多模态输出
MinimaxMiniMax-M2.5MiniMax上下文205K输入$0.3020/M输出$1.2077/M面向真实生产力智能体的高性价比模型,强项在代码、工具调用、搜索和办公交付,而不只是聊天。它适合让代理规划并执行跨文件修改、研究检索、文档/表格/演示类任务;相比更贵的旗舰模型,核心取舍是用更低成本换取接近前沿的执行效率。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Doubaodoubao-seedance-2-0-filter-offDoubao上下文13K输入$3.1500/M输出$3.1500/M面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。该 filter-off 版本相比普通 Seedance 2.0 保持同档生成能力,但内容过滤更宽松;适合短剧、广告、电商和社交素材。输入模态: 输出模态: 多模态输出
Doubaodoubao-seedance-2-0-fast-filter-offDoubao上下文13K输入$2.5200/M输出$2.5200/M面向视频生成和多素材视频创作,相比 Seedance 1.x 在运动稳定性、音视频联合生成和参考输入上更完整;对比 Veo、Kling、Runway,它更适合需要文本、图像、音频、视频混合驱动的中文创意工作流。该 filter-off 版本相比普通 Seedance 2.0 保持同档生成能力,但内容过滤更宽松;适合短剧、广告、电商和社交素材。输入模态: 输出模态: 多模态输出
Claudeclaude-opus-4-6Anthropic上下文1M输入$1.7000/M$5.0000/M输出$8.5000/M$25.0000/M面向复杂推理、代理式编码和大型代码库工作的 Opus 模型;相比 Opus 4.5 更强调长时间规划、代码审查、调试、自主执行以及文档和表格等知识工作,并支持 1M 上下文与自适应思考。新项目优先评估更新的 Opus 4.7 或 4.8。输入模态: 输出模态: 深度思考联网搜索工具调用函数调用结构化输出长上下文代码执行
Klingkling-v3-omnikling按秒$0.0900/s面向文本/图像到视频和多镜头创作,相比 Kling 2.x 在运动稳定性、镜头语言和参考图一致性上更进一步;对比 Veo、Runway、Seedance,它更适合中文短剧、广告素材和高质量社交视频生产。输入模态: 输出模态: 多模态输出
Klingkling-v3kling按秒$0.0900/s面向文本/图像到视频和多镜头创作,相比 Kling 2.x 在运动稳定性、镜头语言和参考图一致性上更进一步;对比 Veo、Runway、Seedance,它更适合中文短剧、广告素材和高质量社交视频生产。输入模态: 输出模态: 多模态输出
Doubaodoubao-seedance-2.0-fast-260128Doubao输入$1.4566/M$1.7136/M输出$1.4566/M$1.7136/MSeedance 2.0 的速度优先版本,面向低延迟生成和快速迭代;适合批量试镜、素材探索和需要尽快得到可用视频草稿的场景。若更看重复杂参考融合、动作稳定性和最终画面完成度,应选择标准版。输入模态: 输出模态: 多模态输出
Doubaodoubao-seedance-2.0-260128Doubao输入$2.1606/M$2.2743/M输出$2.1606/M$2.2743/MSeedance 2.0 标准版,适合把文本、图像、音频和视频参考组合成可控的视频创作;在复杂运动、多主体互动、镜头控制和音画联合生成之间取得平衡,适合作为广告、短片和高质量素材生产的常规主力。输入模态: 输出模态: 多模态输出
Geminigemini-3-flash-previewGoogle上下文1M输入$0.5000/M输出$3.0000/MGoogle 高速推理模型,专为 Agent 工作流、多轮对话和代码辅助而设计。支持文本、图像、音频、视频和 PDF 输入,100 万 token 上下文窗口。支持可配置推理级别、工具调用和结构化输出。比前代 Gemini 2.5 Flash 在推理、多模态理解和可靠性方面全面提升。输入模态: 输出模态: 深度思考工具调用函数调用结构化输出长上下文
Geminigemini-3-pro-image-previewGoogle上下文66K按张$0.1340/image面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。输入模态: 输出模态: 深度思考多模态输出
Geminigemini-3-pro-imageGoogle按张$0.0318/image$0.0530/image面向专业创作的推理型图像生成与编辑模型,适合复杂平面设计、高保真产品样机、信息图和需要准确文字渲染的视觉内容;相比更快的 Flash Image 档位,更强调精细控制、事实依据与成片质量。输入模态: 输出模态: 多模态输出
Claudeclaude-opus-4-5Anthropic上下文200K输入$5.0000/M输出$25.0000/MClaude 4 系列较早的 Opus 模型,重点覆盖高难度编码、代理、电脑操作、深度研究以及幻灯片和表格处理。适合需要 Opus 级能力且必须兼容 4.5 的工作流;没有版本约束时优先评估更新的 Opus 4.6 或 4.7。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Geminiveo3.1-liteGoogle按次$0.1100/call面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。Lite 档相较标准档更偏向高吞吐和低成本草稿。输入模态: 输出模态: 多模态输出
Geminiveo3.1-fastGoogle按次$0.2211/call面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。Fast 档相较标准档更适合快速概念验证。输入模态: 输出模态: 多模态输出
Geminiveo3.1Google按次$1.6544/call面向高保真视频生成,相比 Veo 2/3 在原生音频、镜头控制和参考输入工作流上更成熟;对比 Kling、Runway、Seedance,它更适合电影感短片、广告分镜和需要稳定物理运动的视频创作。输入模态: 输出模态: 多模态输出
Geminigemini-2.5-flash-imageGoogle上下文66K按张$0.0585/image面向图像生成与编辑,相比 Gemini 早期图像能力更强调多模态理解、对话式修改和快速视觉原型;对比 GPT Image、Qwen Image 和 Seedream,它更适合把文档、图片和提示词合并到同一视觉工作流。输入模态: 输出模态: 结构化输出多模态输出
Claudeclaude-haiku-4-5Anthropic上下文200K输入$0.3400/M$1.0000/M输出$1.7000/M$5.0000/MClaude 系列中速度最快、成本更友好的模型,提供接近前沿水平的能力并支持 200K 上下文与思考。适合实时交互、批量处理、轻量代理和成本敏感的生产链路;最难的推理或代码修改应升级到 Sonnet 或 Opus。输入模态: 输出模态: 深度思考工具调用结构化输出长上下文
Qwenwan3.0-video-primeQwen按秒$0.4500/s通义万相 3.0 系列的速度优先版本(早期访问阶段),在保持高质量视频生成的同时缩短出片等待,适合低延迟预览、批量试做和需要快速迭代的短视频工作流;若更看重极致画面控制而非出片速度,可选择标准版。输入模态: 输出模态: 多模态输出
Qwenwan3.0-videoQwen按秒$0.3000/s阿里通义万相 3.0 系列的标准视频生成模型(早期访问阶段),支持文生视频、图生视频及多模态参考输入,单次可生成最长约 30 秒的视频并同步生成音频,适合广告、短剧和叙事短片的快速出片;正式发布日期尚未公布,规格以官方为准。输入模态: 输出模态: 多模态输出
Zhipuglm-imageZhipu AI输入$0.8800/M输出$3.5500/M面向图像生成与编辑,相比早期 GLM 视觉能力更专注于中文提示词、图文理解和可控生成;对比 GPT Image、Gemini 图像模型和 Qwen Image,它更适合中文营销素材、知识图解和多轮视觉修改。输入模态: 输出模态: 多模态输出