先看数字,再看这数字是怎么来的
按 OpenRouter 的数据测算,8 月 31 号到 9 月 6 号这一周,全球大模型总调用量 115 万亿 Token,环比涨 1.77%。其中中国模型 56.72 万亿,环比涨 2.83%;美国模型 16.54 万亿,环比跌 3.1%。中国模型周调用量已经连续十九周超过美国。
前五名里四款是中国模型:腾讯混元 Hy4 preview 以 14.7 万亿 Token 登顶,环比暴涨 379%;OpenAI 的 GPT-5.6 Luna 12.9 万亿第二,涨 66%;智谱 GLM-5.3 Flash 12.4 万亿第三,涨 101%;DeepSeek-V4-Flash 正式版 12.4 万亿第四;DeepSeek-V4-Flash 预览版 5.19 万亿第五。MiniMax M3 隔了近一个月重回榜单,5.02 万亿第六,涨 95%。
跌出去的也有:上周第三的小米 MiMo-V2.5、第九的 Gemini 3.7 Flash,这周都不在榜上了。
先泼一盆冷水:这不是全球市场份额
OpenRouter 是一个第三方模型路由平台,统计的是平台内的文本请求量。它有三个天然偏差,不弄清楚就会误读:
第一,样本偏差。会绕道 OpenRouter 调模型的,主要是海外开发者、独立开发者和小团队。大企业直连官方 API 的那部分,这里完全统计不到。所以这份榜单衡量的是"开源与低价模型在全球开发者长尾里的受欢迎程度",不是"谁在全球 AI 市场赚得多"。
第二,免费额度会放大数字。榜单第六的 MiniMax M3 后面直接标了 (free)——8 月 24 号到 9 月 6 号,开发者可以通过 GMI Cloud 和 OpenRouter 免费用它。免费的东西调用量涨得快,这是常识,不是能力证明。
第三,Token 数不等于商业价值。跑一百万 Token 的批量数据清洗,和跑一百万 Token 的高价值合同审查,在这份榜单里权重相同,在账本上差着一个数量级。
另外还有一份按厂商口径的占比表:DeepSeek 23.8%、OpenAI 20.0%、谷歌 19.8%、智谱 9.7%、阿里 5.6%、腾讯 3.8%、Anthropic 2.9%。注意这里腾讯只有 3.8%,跟它在单模型榜上登顶并不冲突——混元这一款涨得猛,但腾讯的盘子还小。看榜单要先问一句:这是按模型算还是按厂商算。
冷水泼完,说真信号
去掉噪音,这份榜单至少说明三件事。
第一,开源加低价的打法确实在被全球开发者用脚投票。Hy4 preview 8 月 28 号发布并开源,总参数 770B、激活 49B、上下文超过 1M,面向 Agent、编程和生产力场景。9 月 1 号又出了轻量版,把权重从 1.5TB 压到约 214GB,官方称长文理解能力几乎与原始模型持平。从发布到登顶只用了一周,靠的就是"能自己部署、够便宜、能力不差"这三件事叠加。
第二,中国模型的角色在变。沙特公共投资基金旗下的 AI 公司 HUMAIN 基于 MiniMax M3 训练出了首个阿拉伯语大模型。过去中国模型出海主要是卖 API 或者做应用产品,这一次是直接当别人家本土模型的基础模型。这条路一旦走通,商业模式的性质就变了——从卖调用变成卖底座。
第三,榜单的流动性极高。GLM-5.3 Flash 一周涨 101%,MiMo-V2.5 一周就从第三跌没了。这个市场里没有什么位置是坐得稳的,上周的赢家这周可能就查无此人。
跟你有啥关系
如果你要做模型选型,"调用量大"这个指标该怎么用?
该用的地方:调用量大通常意味着生态成熟。踩过的坑有人踩过,第三方工具的适配会先做它,社区里能搜到的解决方案多。对于工程能力不强的小团队,这个价值可能比评测分数高两三分更实在。
不该用的地方:别把它当性能排行榜。榜单里混着免费模型、促销模型和长尾场景,排名变化更多反映的是价格和渠道策略,不是能力排序。真要选型,拿你自己的实际任务跑一遍,比看任何榜单都准。
还有个务实的建议:既然榜单这么不稳定,架构上就别把身家押在某一款模型上。把调用层抽象出来,能换模型,比选对模型更重要。
