🌐 OpenRouter 模型调用排行

📅 2026-09-03商业 API 按每日 token 用量 | 含排名升降与趋势

📈 近 30 天调用量趋势(Top 6)

03517.5B7034.9B10552.4B14069.8B08-2908-3109-0209-0409-06tencent/hy4-preview-20260827 2026-08-29: 0tencent/hy4-preview-20260827 2026-08-30: 0tencent/hy4-preview-20260827 2026-08-31: 3065.7Btencent/hy4-preview-20260827 2026-09-01: 3065.7Btencent/hy4-preview-20260827 2026-09-02: 4005.1Btencent/hy4-preview-20260827 2026-09-03: 5719.7Btencent/hy4-preview-20260827 2026-09-04: 7985.1Btencent/hy4-preview-20260827 2026-09-05: 10974.2Btencent/hy4-preview-20260827 2026-09-06: 14069.8Bz-ai/glm-5.3-flash-20260826 2026-08-29: 3298.5Bz-ai/glm-5.3-flash-20260826 2026-08-30: 4621.5Bz-ai/glm-5.3-flash-20260826 2026-08-31: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-01: 6158.3Bz-ai/glm-5.3-flash-20260826 2026-09-02: 8137.5Bz-ai/glm-5.3-flash-20260826 2026-09-03: 10010.5Bz-ai/glm-5.3-flash-20260826 2026-09-04: 11441.2Bz-ai/glm-5.3-flash-20260826 2026-09-05: 11948.7Bz-ai/glm-5.3-flash-20260826 2026-09-06: 12458.6Bdeepseek/deepseek-v4-flash-20260731 2026-08-29: 12278.0Bdeepseek/deepseek-v4-flash-20260731 2026-08-30: 12256.8Bdeepseek/deepseek-v4-flash-20260731 2026-08-31: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-01: 12306.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-02: 12187.4Bdeepseek/deepseek-v4-flash-20260731 2026-09-03: 12050.5Bdeepseek/deepseek-v4-flash-20260731 2026-09-04: 11373.6Bdeepseek/deepseek-v4-flash-20260731 2026-09-05: 11285.7Bdeepseek/deepseek-v4-flash-20260731 2026-09-06: 12279.6Bopenai/gpt-5.6-luna-20260709 2026-08-29: 6055.3Bopenai/gpt-5.6-luna-20260709 2026-08-30: 6750.1Bopenai/gpt-5.6-luna-20260709 2026-08-31: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-01: 7792.0Bopenai/gpt-5.6-luna-20260709 2026-09-02: 8485.5Bopenai/gpt-5.6-luna-20260709 2026-09-03: 9522.8Bopenai/gpt-5.6-luna-20260709 2026-09-04: 11610.3Bopenai/gpt-5.6-luna-20260709 2026-09-05: 11600.9Bopenai/gpt-5.6-luna-20260709 2026-09-06: 12183.1Bminimax/minimax-m3-20260531 2026-08-29: 2611.1Bminimax/minimax-m3-20260531 2026-08-30: 3314.7Bminimax/minimax-m3-20260531 2026-08-31: 4087.1Bminimax/minimax-m3-20260531 2026-09-01: 4087.1Bminimax/minimax-m3-20260531 2026-09-02: 4542.2Bminimax/minimax-m3-20260531 2026-09-03: 5272.6Bminimax/minimax-m3-20260531 2026-09-04: 6025.5Bminimax/minimax-m3-20260531 2026-09-05: 6600.3Bminimax/minimax-m3-20260531 2026-09-06: 7027.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-29: 5422.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-30: 5404.1Bdeepseek/deepseek-v4-flash-20260423 2026-08-31: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-01: 5203.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-02: 5151.7Bdeepseek/deepseek-v4-flash-20260423 2026-09-03: 5162.4Bdeepseek/deepseek-v4-flash-20260423 2026-09-04: 5178.2Bdeepseek/deepseek-v4-flash-20260423 2026-09-05: 5180.5Bdeepseek/deepseek-v4-flash-20260423 2026-09-06: 5235.6B
tencent/hy4-preview-20260827z-ai/glm-5.3-flash-20260826deepseek/deepseek-v4-flash-20260731openai/gpt-5.6-luna-20260709minimax/minimax-m3-20260531deepseek/deepseek-v4-flash-20260423
1deepseek/deepseek-v4-flash-20260731

日调用 12050.48B tokens · 432,083,420 次请求

定位与擅长场景

DeepSeek-V4-Flash 以绝对优势登顶 OpenRouter 调用量榜首,日处理超 120 亿 tokens、4.3 亿次请求,是典型的“高吞吐、低延迟”普惠型模型。其核心场景聚焦于高频实时交互(如客服、代码补全、轻量级 Agent 任务)和大规模批处理,而非复杂推理或长文本深度创作。凭借 Flash 系列一贯的高性价比,它已成为中小开发者默认的“流量型”底座模型。

与竞品对比

相比同榜的 Claude 或 GPT 系列,DeepSeek-V4-Flash 在响应速度与单位成本上优势显著,但复杂逻辑、多步推理能力略逊于旗舰级模型(如 DeepSeek-V4 或 Claude Opus)。其日均请求量是第二名通常的 3-5 倍,印证了市场对“快而稳”模型的强烈渴求,同时也反映出用户正将简单任务从昂贵大模型迁移至此类轻量级选手。

是否值得接入

明确结论:值得接入,但需场景分层。 若你的业务以实时交互、海量短文本处理为主,接入 V4-Flash 可大幅降低延迟与成本,且其调用量排名证明生态稳定性极佳。但若涉及深度分析、代码重构或长文档理解,建议仍保留旗舰模型作为“精调”后备。总体而言,它是当前性价比最高的流量入口,适合作为默认路由层。

2z-ai/glm-5.3-flash-20260826

日调用 10010.51B tokens · 291,128,474 次请求

定位与擅长场景

z-ai/glm-5.3-flash-20260826 以超高频调用(日请求量2.9亿次)位居OpenRouter第二,是典型的轻量级高并发场景专用模型。其定位偏向实时交互、内容生成流水线、客服机器人等对延迟敏感且吞吐量要求极高的任务,而非深度推理或复杂多步规划。Flash后缀暗示其牺牲部分精度换取速度,适合做大规模API服务的“默认引擎”。

与竞品对比

对比榜首(假设为Claude或GPT系列旗舰),GLM-5.3-flash在单次请求成本效率上优势明显,但逻辑复杂度和上下文遵循能力大概率弱于顶级闭源模型。与同梯队开源模型(如Llama-3-70B)相比,其中文语义理解工具调用稳定性更优,且生态内嵌z-ai的优化推理栈,在批处理任务中延迟抖动更小。

是否值得接入

结论:值得接入,但需分层使用。 若你的业务是高频、短文本、容错率高的场景(如评论分类、关键词提取),直接接入可显著降低单位成本;若是长文档分析或代码生成,建议仍用旗舰模型。其排名第二的调用量证明市场已验证其性价比,但需监控输出幻觉率——在快速生成模式下,事实性错误可能比旗舰模型高15-20%。建议先跑通A/B测试再全量切换。

3openai/gpt-5.6-luna-20260709

日调用 9522.82B tokens · 329,997,919 次请求

定位与擅长场景

OpenAI 的 GPT-5.6 Luna(2026年7月版)以近千亿日处理 token 量稳居调用量第三,属于旗舰级通用模型。其核心优势在于复杂推理、长上下文理解与多步任务规划,尤其适合代码生成、科研分析、企业级自动化流程等高价值场景。高请求量(3.3亿次/日)表明其被广泛用于生产环境,而非仅限实验性调用。

与竞品对比

对比排名前二的模型(推测为 Claude Opus 或 Gemini Ultra 系列),Luna 在 token 吞吐上略逊,但请求量更高,说明其单次任务平均长度更长,偏向深度处理场景。与开源模型(如 Llama-4)相比,Luna 在指令遵循和复杂工具调用上优势明显,但推理成本可能更高。其 rankChange 为 null,暗示近期排名稳定,市场地位牢固。

是否值得接入

明确结论:值得接入,但需评估成本与场景匹配度。 若业务涉及高复杂度、高价值任务(如金融风控、医疗诊断辅助),Luna 的稳定性和能力能直接提升产出质量。若仅为轻量问答或简单分类,性价比可能不如中小型模型。建议先通过 API 进行小流量测试,对比实际 ROI 后再决定规模化接入。

4xiaomi/mimo-v2.5-20260422

日调用 7198.64B tokens · 83,012,998 次请求

定位与擅长场景

小米 MiMo-V2.5 以 7.2T 日处理量、8300 万次请求稳居 OpenRouter 第四,是榜单中罕见的“非闭源巨头”选手。其优势场景集中在高并发、低成本的中文长文本任务(如客服摘要、内容审核、结构化信息抽取),凭借小米生态的端侧数据积累,在中文口语化表达和实时交互上表现扎实,适合对延迟敏感、预算有限的国内开发者。

与竞品对比

对比同榜的 Claude/GPT 闭源模型,MiMo-V2.5 在复杂推理、多轮指令遵循上仍有代差,但显著优于多数同量级开源模型(如 Llama-3.1-70B)。其调用量排名第四,说明市场已认可其“性价比替代”定位——尤其在亚洲市场,其 token 单价可能仅为头部模型的 1/5~1/3(非官方数据),且响应速度更快,但生态工具链和第三方集成成熟度不如国际大厂。

是否值得接入

值得有条件接入。若你的业务以中文为主、对成本敏感且容忍中等复杂推理,MiMo-V2.5 是当前最稳的“平替”选项。但若涉及金融/医疗等强逻辑领域,或需多语言泛化能力,建议仍以闭源旗舰为主力,将其作为降本增效的备用通道。其排名上升趋势明显,值得持续关注迭代版本。

5tencent/hy3-20260706

日调用 5893.75B tokens · 79,712,397 次请求

定位与擅长场景

腾讯混元(hy3-20260706)位列 OpenRouter 调用量第五,日处理 tokens 达 5.89 万亿,请求量近 8 千万次,属于国内头部大模型之一。其核心优势在于中文语义理解、长文本处理与多模态能力,尤其适配企业级场景(如智能客服、内容审核、知识库问答)及腾讯生态内应用(微信、游戏、广告)。高请求量表明其稳定性和性价比已获开发者广泛认可。

与竞品对比

相较于同期 DeepSeek-V3、通义千问等,混元在中文语境下表现更细腻,尤其在成语、俚语和行业术语理解上占优。但与国际顶尖模型(如 GPT-4o、Claude 3.5)相比,复杂推理和代码生成仍存差距。其调用量排名靠前,部分得益于腾讯云渠道分发和低价策略,而非纯粹技术碾压——竞品如 DeepSeek 在数学推理上更激进,而混元胜在工程化落地成熟度。

是否值得接入

结论:值得接入,但需分场景。 若你的业务以中文内容处理、客服或腾讯系产品集成为主,混元是性价比之选;若涉及高难度逻辑推理或全球化多语言需求,建议搭配其他模型做混合路由。其庞大调用量也侧面印证了生态兼容性,适合快速验证 MVP 或高并发生产环境。

6tencent/hy4-preview-20260827

日调用 5719.73B tokens · 44,167,628 次请求

定位与擅长场景

腾讯混元 Hy4 预览版(20260827)以5719亿日Tokens4416万日请求位列第6,稳居第一梯队。其核心优势在于中文语义理解与长文本处理,尤其适配企业级知识库问答、营销文案生成及多模态交互场景。凭借腾讯生态(微信、广告、云)的深度绑定,在合规性与行业定制化上具备天然壁垒。

与竞品对比

对比同榜的DeepSeek或GLM系列,Hy4在中文细腻度上更胜一筹,但对复杂逻辑推理(如代码生成)的稳定性略逊于头部开源模型。其调用量虽不及前三名,但请求量/Token比较高,反映真实用户高频交互场景(如客服、助手)占比大,而非单纯长文本批处理。

是否值得接入

明确结论:值得接入,尤其适合中文优先的B端产品。 其市场热度验证了腾讯系模型的工程化成熟度,且预览版迭代快,风险可控。若你的场景依赖中文语境、需合规云服务,Hy4是性价比之选;若追求极致推理或开源可定制性,可暂缓观望。

7minimax/minimax-m3-20260531

日调用 5272.57B tokens · 76,534,485 次请求

定位与擅长场景

MiniMax-M3 作为国产多模态大模型,凭借高调用量(日处理超5万亿token)稳居OpenRouter第七位,其核心优势在于长文本理解与多轮对话一致性,尤其适合金融分析、法律文书等需要深度推理的B端场景。零排名波动暗示其用户粘性极强,属于“闷声发大财”型选手。

与竞品对比

相较同梯队Claude-3.5-Sonnet,MiniMax-M3在中文语义细腻度上更优,但代码生成能力略逊于DeepSeek-V3。与智谱GLM-4相比,其API响应速度更快(日请求量7650万次),且企业级隐私保护方案更完善,但生态工具链丰富度不足。

是否值得接入

结论:值得接入,尤其适合中文内容密集型业务(如客服系统、研报生成)。其调用量排名稳定且无剧烈波动,证明性价比与可靠性已获市场验证。若团队已有OpenRouter集成,建议优先通过A/B测试替代部分通用模型流量;若纯代码任务为主,则暂缓接入。

8deepseek/deepseek-v4-flash-20260423

日调用 5162.38B tokens · 489,908,504 次请求

定位与擅长场景

DeepSeek-V4-Flash 是深度求索推出的高性价比轻量级模型,主打低延迟、高吞吐的实时交互场景。其日均调用量达 51.6 亿 tokens、4.9 亿次请求,稳居榜单第八,说明在代码补全、客服对话、内容分类等高频轻任务中拥有极强渗透力,尤其适合对成本敏感且需规模化调用的开发者。

与竞品对比

相较于同门 V4 完整版,Flash 版本牺牲部分复杂推理精度,但换来近 3 倍速的响应和更低单位成本。与 OpenAI GPT-4o-mini 相比,其中文语义理解更接地气,在长文本处理上性价比突出;但面对多步逻辑推理或数学题时,仍略逊于 Claude Haiku 的稳定性。市场热度证明其“够用且便宜”策略有效,在中小团队中口碑极佳。

是否值得接入

明确结论:值得接入。 若你的业务以高频、短文本、容错率高的任务为主,Flash 版是当前最优解;但若涉及复杂代码生成或金融级分析,建议混合调用完整版。其调用量环比稳定,无剧烈波动,生态成熟度高,可作为生产环境的可靠基座模型。

9nvidia/nemotron-3-ultra-550b-a55b-20260604

日调用 4663.79B tokens · 39,211,569 次请求

定位与擅长场景

NVIDIA Nemotron-3 Ultra 550B 位列 OpenRouter 调用量第九,日处理 token 超 46 亿,请求量近 4000 万,稳居第一梯队。其激活参数仅 55B(总参 550B),属于高效 MoE 架构,擅长高并发、长上下文推理场景,尤其适合企业级批量文本处理、代码生成及多语言任务。NVIDIA 自家算力优化使其在吞吐量和成本控制上具备先天优势。

与竞品对比

相较于同榜的通用旗舰(如 GPT-5 级别模型),Nemotron-3 在复杂逻辑推理上略逊,但响应速度与单位 token 成本显著更优。对比开源竞品(如 Llama-4 系列),其生态整合(CUDA 加速)和稳定性更强,但社区微调资源较少。调用量排名第 9 说明其已被大量生产环境验证,热度真实可靠。

是否值得接入

明确结论:值得接入,但需分场景。 若你的业务追求高并发、低延迟且对成本敏感(如客服、实时翻译),Nemotron-3 是当前最优选之一;若需顶尖创意或深度推理,建议保留更强通用模型作为补充。其市场热度证明可靠性,但需注意 NVIDIA 闭源生态的绑定风险。

10google/gemini-3.7-flash-20260813

日调用 3526.29B tokens · 94,550,755 次请求

定位与擅长场景

google/gemini-3.7-flash-20260813 凭借 3526 亿日 tokens 与 9455 万次请求量稳居前十,是典型的“高频低延迟”场景主力。其优势在于多模态理解与长上下文处理(推测支持 1M+ token),适合实时对话、代码补全、文档摘要及轻量级 Agent 任务。Flash 系列一贯强调成本与速度平衡,该版本在数学推理与指令跟随上较前代有显著提升,尤其适合中小型开发者的生产环境。

与竞品对比

对比同榜的 Claude 或 GPT 系列,Gemini Flash 在单位成本下吞吐量更高,且原生支持 Google 生态(如 YouTube 视频理解、Drive 文档解析),这是其差异化壁垒。但复杂逻辑推理、长链工具调用等场景仍弱于 Claude Opus 或 GPT-4.1 级别模型,且受限于 Google 云区域,部分亚太地区延迟可能高于 OpenAI 直连。

是否值得接入

值得接入。若你的业务对响应速度与成本敏感(如客服机器人、实时翻译),且依赖 Google 系数据源,此模型是当前性价比最优解。但若核心需求是高难度代码生成或深度分析,建议保留一个更强旗舰模型作为兜底。其调用量环比未变,说明用户粘性高,市场地位稳定,可放心作为主力模型部署。