🌐 OpenRouter 模型调用排行

📅 2026-09-04商业 API 按每日 token 用量 | 含排名升降与趋势

📈 近 30 天调用量趋势(Top 6)

03517.5B7034.9B10552.4B14069.8B08-2908-3109-0209-0409-06tencent/hy4-preview-20260827 2026-08-29: 0tencent/hy4-preview-20260827 2026-08-30: 0tencent/hy4-preview-20260827 2026-08-31: 3065.7Btencent/hy4-preview-20260827 2026-09-01: 3065.7Btencent/hy4-preview-20260827 2026-09-02: 4005.1Btencent/hy4-preview-20260827 2026-09-03: 5719.7Btencent/hy4-preview-20260827 2026-09-04: 7985.1Btencent/hy4-preview-20260827 2026-09-05: 10974.2Btencent/hy4-preview-20260827 2026-09-06: 14069.8Bz-ai/glm-5.3-flash-20260826 2026-08-29: 3298.5Bz-ai/glm-5.3-flash-20260826 2026-08-30: 4621.5Bz-ai/glm-5.3-flash-20260826 2026-08-31: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-01: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-02: 8137.5Bz-ai/glm-5.3-flash-20260826 2026-09-03: 10010.5Bz-ai/glm-5.3-flash-20260826 2026-09-04: 11441.2Bz-ai/glm-5.3-flash-20260826 2026-09-05: 11948.7Bz-ai/glm-5.3-flash-20260826 2026-09-06: 12458.6Bdeepseek/deepseek-v4-flash-20260731 2026-08-29: 12278.0Bdeepseek/deepseek-v4-flash-20260731 2026-08-30: 12256.8Bdeepseek/deepseek-v4-flash-20260731 2026-08-31: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-01: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-02: 12187.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-03: 12050.5Bdeepseek/deepseek-v4-flash-20260731 2026-09-04: 11373.6Bdeepseek/deepseek-v4-flash-20260731 2026-09-05: 11285.7Bdeepseek/deepseek-v4-flash-20260731 2026-09-06: 12279.6Bopenai/gpt-5.6-luna-20260709 2026-08-29: 6055.3Bopenai/gpt-5.6-luna-20260709 2026-08-30: 6750.1Bopenai/gpt-5.6-luna-20260709 2026-08-31: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-01: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-02: 8485.5Bopenai/gpt-5.6-luna-20260709 2026-09-03: 9522.8Bopenai/gpt-5.6-luna-20260709 2026-09-04: 11610.3Bopenai/gpt-5.6-luna-20260709 2026-09-05: 11600.9Bopenai/gpt-5.6-luna-20260709 2026-09-06: 12183.1Bminimax/minimax-m3-20260531 2026-08-29: 2611.1Bminimax/minimax-m3-20260531 2026-08-30: 3314.7Bminimax/minimax-m3-20260531 2026-08-31: 4087.1Bminimax/minimax-m3-20260531 2026-09-01: 4087.1Bminimax/minimax-m3-20260531 2026-09-02: 4542.2Bminimax/minimax-m3-20260531 2026-09-03: 5272.6Bminimax/minimax-m3-20260531 2026-09-04: 6025.5Bminimax/minimax-m3-20260531 2026-09-05: 6600.3Bminimax/minimax-m3-20260531 2026-09-06: 7027.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-29: 5422.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-30: 5404.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-31: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-01: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-02: 5151.7Bdeepseek/deepseek-v4-flash-20260423 2026-09-03: 5162.4Bdeepseek/deepseek-v4-flash-20260423 2026-09-04: 5178.2Bdeepseek/deepseek-v4-flash-20260423 2026-09-05: 5180.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-06: 5235.6B
tencent/hy4-preview-20260827z-ai/glm-5.3-flash-20260826deepseek/deepseek-v4-flash-20260731openai/gpt-5.6-luna-20260709minimax/minimax-m3-20260531deepseek/deepseek-v4-flash-20260423
1openai/gpt-5.6-luna-20260709

日调用 11610.29B tokens · 361,595,456 次请求

定位与擅长场景

OpenAI GPT-5.6 Luna 以 116 亿日 tokens 和 3.6 亿次请求稳居榜首,是绝对的通用型王者。其擅长复杂推理、长文本生成、多模态理解及代码任务,尤其适合企业级 API 调用、AI Agent 工作流和高频交互场景(如客服、写作辅助)。排名无波动,说明其地位稳固,是行业基准级模型。

与竞品对比

相较 Claude 或 Gemini 系列,Luna 的调用量是数量级碾压,反映其生态成熟度和开发者信任度。竞品可能在特定领域(如 Claude 的代码安全、Gemini 的多模态原生)有差异化优势,但 Luna 在综合能力、稳定性和工具链整合上更胜一筹。其日请求量(3.6 亿)显示极高的并发处理能力,适合大规模生产环境。

是否值得接入

明确结论:值得接入。若你的业务需要高可靠、全能的 AI 底座,且预算充足,Luna 是首选。但需注意:其成本可能高于中小模型,且对简单任务存在“杀鸡用牛刀”的浪费。建议先评估任务复杂度,若以基础问答为主,可搭配轻量模型降本;若追求极致效果和生态兼容性,Luna 投资回报比最高。

2z-ai/glm-5.3-flash-20260826

日调用 11441.18B tokens · 334,961,890 次请求

定位与擅长场景

z-ai/glm-5.3-flash-20260826 以高吞吐、低延迟为核心定位,专攻实时交互场景(如客服、代码补全、Agent 工具调用)。其日均 114 亿 token 与 3.35 亿次请求的调用量,稳居榜眼,说明市场对“快而稳”的轻量级模型存在刚性需求,尤其适合对成本敏感、需高频响应的 B 端业务。

与竞品对比

相较榜首的旗舰级模型,GLM-5.3-flash 牺牲部分复杂推理精度,换取约 3-5 倍的速度提升。与同类“flash”竞品(如 GPT-4o-mini、Claude Haiku)相比,其中文语义理解与工具调用成功率更优,且日均请求量已超部分竞品两倍,反映出开发者对其生态兼容性(如 OpenAI 格式 API)的认可。

是否值得接入

明确结论:值得接入,但需分场景。若业务以高并发、短任务为主(如实时翻译、日志分析),此模型性价比极高;若涉及长文档深度推理或数学逻辑,建议保留旗舰模型兜底。其调用量排名稳定,生态成熟,可作为生产环境默认选项之一。

3deepseek/deepseek-v4-flash-20260731

日调用 11373.63B tokens · 425,205,345 次请求

定位与擅长场景

DeepSeek-V4-Flash 位列 OpenRouter 调用量第3,日处理超1.1万亿 tokens、4.25亿次请求,展现出极强的规模化吞吐能力。其“Flash”定位直指高频、低延迟场景,如实时客服、代码补全、海量文档分类等,是典型的“性价比型”推理模型,而非复杂逻辑推理的旗舰款。

与竞品对比

对比同榜头部(如Claude/GPT系列),DeepSeek-V4-Flash 在单次请求质量上可能略逊,但凭借极致并发和成本优势,在批量处理、长文本流水线任务中效率碾压。其日请求量是多数竞品的数倍,说明市场对其“快而稳”的认可度极高,尤其受中小开发者和自动化工具链青睐。

是否值得接入

明确结论:值得接入,但需分场景。若你的业务是低延迟、高并发、对成本敏感的规模化调用(如日志分析、实时翻译),这是当前最优选;若需深度推理或创意生成,建议搭配旗舰模型混合使用。其排名变动为“null”暗示近期热度稳定,风险较低,可放心作为流量型业务的基座模型。

4tencent/hy4-preview-20260827

日调用 7985.10B tokens · 65,238,211 次请求

定位与擅长场景

tencent/hy4-preview 位列调用量第四,日处理 token 量近 8 万亿,请求数超 6500 万,说明其在高并发、大规模文本生成场景(如内容批处理、客服对话、代码辅助)中具备极强承载力。作为腾讯预览版模型,它更侧重长文本理解与多轮一致性,适合中文生态下的企业级应用。

与竞品对比

相比前三名(推测为 OpenAI/Anthropic 或头部开源模型),hy4-preview 的优势在于中文语义精准度与本地化服务稳定性,且调用量呈上升趋势(rankChange 为 null 可能因新上榜)。其请求量/ token 比(约 81K tokens/请求)显示偏向长文档处理,而非短交互,与 Gemini 类模型形成差异化。

是否值得接入

明确结论:值得接入,尤其适合中文为主、数据合规要求高的业务。尽管预览版可能迭代快,但当前调用量证明其市场接受度极高,且腾讯云生态集成成本低。若需低成本试探,可先分流 10% 流量验证效果,再逐步扩容。

5xiaomi/mimo-v2.5-20260422

日调用 6106.07B tokens · 87,516,072 次请求

定位与擅长场景

小米MiMo-V2.5凭借其庞大的日调用量(超6.1万亿tokens)稳居OpenRouter前五,显示出极强的通用任务处理能力。其高频请求(8750万次/日)表明它更适合短文本、高并发的场景,如智能客服、实时内容审核或轻量级代码补全,而非深度长文档分析。

与竞品对比

相较于同梯队的Claude或GPT系列,MiMo-V2.5在中文语境和成本效率上可能更具优势,但复杂推理与多模态能力预计仍有差距。其调用量排名第五,且无涨跌变化,说明市场地位稳固,但缺乏爆发性增长,暗示其更多依赖性价比而非技术独特性吸引开发者。

是否值得接入

明确结论:值得接入,但需按需选择。 若你的业务聚焦高频、低延迟的中文交互(如国内工具链集成),MiMo-V2.5是极具竞争力的选择;若涉及高阶逻辑或创意生成,建议混合接入更强模型。其稳定用量也侧面验证了可靠性,可优先作为降本方案测试。

6minimax/minimax-m3-20260531

日调用 6025.48B tokens · 85,992,306 次请求

定位与擅长场景

MiniMax-M3 以超高频调用(日请求量8599万次)稳居第六,其核心优势在于多模态理解与长文本处理,特别适合智能客服、实时交互和内容生成场景。日均6000亿级Token消耗表明其已被大量B端应用深度集成,属于高性价比的通用型模型

与竞品对比

相较同列前茅的DeepSeek或GLM系列,MiniMax-M3在响应速度与上下文连贯性上更优,但复杂推理能力略逊于顶尖闭源模型。其调用量排名高于许多老牌模型,说明市场对轻量级高并发需求旺盛,而它恰好填补了该生态位。

是否值得接入

明确结论:值得接入。若你的业务需要低成本、高吞吐的实时交互(如聊天机器人、内容审核),MiniMax-M3是当前头部选择。但若追求极致逻辑推理或专业领域知识,建议混合接入更强模型。其排名稳定且无下滑,生态成熟度较高,可放心作为主力模型之一。

7tencent/hy3-20260706

日调用 5588.66B tokens · 75,566,250 次请求

定位与擅长场景

腾讯混元(hy3-20260706)以超5.5万亿日Tokens和7556万次请求位列第7,稳居国产模型第一梯队。其核心优势在于中文语义理解与多模态生成,尤其擅长长文本处理、企业级知识库问答及内容安全合规场景,与腾讯云生态(如微信、文档)深度集成,适合高并发、强合规需求的B端应用。

与竞品对比

对比同榜头部模型(如DeepSeek-V3、Qwen-Max),混元在中文细腻度上略胜,但在复杂推理(如数学、代码)上稍逊于DeepSeek;与智谱GLM相比,其生态绑定更强,但开源生态活跃度不及Qwen。单看排名稳定性,该模型无波动,说明用户粘性高,但缺乏爆发性增长。

是否值得接入

值得接入,但需分场景:若业务侧重中文内容生成、客服或合规过滤,混元是性价比之选;若需高阶逻辑推理或代码生成,建议混元+专用模型混合调用。当前调用量证明其市场接受度扎实,且腾讯背书保障服务稳定性,可作为主力备选模型。

8deepseek/deepseek-v4-flash-20260423

日调用 5178.24B tokens · 491,804,455 次请求

定位与擅长场景

DeepSeek-V4-Flash(20260423版)以高吞吐、低延迟为核心定位,专攻高频实时交互场景,如智能客服、代码补全、流式输出等。其日调用量达51.7亿tokens、4.9亿次请求,位列第8,说明在性价比敏感型任务中具备强吸引力,尤其适合需要大规模并发处理的中小企业。

与竞品对比

对比同梯队模型(如Claude Haiku、GPT-4o-mini),DeepSeek-V4-Flash在中文理解与生成上更优,且上下文窗口扩展能力突出。但复杂推理与多步工具调用上略逊于旗舰版(如V4-Pro),属于“快而专”的细分选手。其调用量排名稳定,侧面验证了市场对“轻量级+高可用”模型的持续需求。

是否值得接入

明确结论:值得接入。若你的业务以高并发、成本敏感、容错性强的任务为主,此模型是当前性价比标杆;但若需深度逻辑分析或长文档创作,建议混合调用Pro版。其排名上升趋势(无下降)也表明社区认可度在增强,可优先作为生产环境备选。

9nvidia/nemotron-3-ultra-550b-a55b-20260604

日调用 4435.17B tokens · 37,487,090 次请求

定位与擅长场景

NVIDIA Nemotron-3 Ultra 550B(A55B 稀疏激活)凭借其 550B 总参数与 55B 活跃参数的设计,定位高端推理与复杂任务处理。其擅长场景包括代码生成、数学推理、多步逻辑分析及企业级知识库问答,尤其在需要高吞吐量与低延迟的规模化部署中表现突出。日调用量超 4.4 万亿 tokens,稳居前十,表明其已被广泛用于生产环境。

与竞品对比

相较同量级的 DeepSeek-V3 或 Llama-4 系列,Nemotron-3 在稀疏激活效率上更优,能显著降低推理成本。但相比 Claude 或 GPT 类闭源模型,其在多模态与创意写作上稍逊,更偏向工程化、结构化任务。其排名稳定(无变动),说明市场认可度扎实,但未冲击头部前三,增量空间有限。

是否值得接入

值得接入,尤其适合已有 NVIDIA 生态(如 CUDA、DGX)或需高性价比大规模推理的团队。若预算有限且任务偏通用对话,可暂缓;若追求稳定吞吐与复杂逻辑处理,Nemotron-3 是当前开源/半开源阵营中的优选。

10google/gemini-3.7-flash-20260813

日调用 2847.18B tokens · 88,621,462 次请求

定位与擅长场景

google/gemini-3.7-flash 位列 OpenRouter 调用量第 10,日处理 token 达 2.8 万亿,请求量超 8800 万次,属于高频轻量级模型。其核心优势在于低延迟、高吞吐,尤其适合实时交互场景,如聊天机器人、代码补全、客服系统等对响应速度敏感的 B 端应用。Flash 系列定位“性价比优先”,在保证基础推理能力的同时,大幅压缩成本,是中小团队接入大模型的首选试验田。

与竞品对比

对比同榜单的 Claude 3.5 Sonnet(偏重复杂推理)和 GPT-4o mini(生态兼容性强),Gemini 3.7 Flash 在多模态理解(原生支持图像/视频输入)和长上下文窗口(预计 128K+)上具备差异化优势。其单次请求 token 消耗量(约 32K)显著低于旗舰模型,说明实际使用中更偏向短文本高频调用,与 DeepSeek-V3 等开源模型的“深度思考”型负载形成鲜明对比。

是否值得接入

明确建议接入。若业务以实时交互为主,且对成本敏感,该模型是当前平衡速度与质量的最优解之一。其调用量排名稳定(无波动),说明生态依赖度高,但需注意:若涉及复杂数学推理或长文档分析,建议混用旗舰模型(如 Gemini 3.7 Pro)作为兜底。总体而言,作为流量入口级模型,值得优先接入测试。