一个没名字的模型,8 月 20 号突然冒出来,24 小时内进了生产环境
8 月 20 号,OpenRouter 上多了一个叫 "stealth/ox-alpha" 的匿名模型。没公司名、没发布会、没定价,先给一周免费预览。
结果它一上来,写代码就把 GPT-5.6 Sol 按在地上摩擦。
分数有多狠
DeepSWE Pass@1 拿到 80%,把一众知名模型甩在后面:GPT-5.6 Sol 才 52%,Claude Fable 5 是 65%,智谱 GLM-5.3 是 62%。上下文窗口 104 万 token,最大输出 13.1 万,全模态——文本、图片、原生视频理解都支持。
工具调用、结构化 JSON 输出、智能体工作流,出厂就带。换句话说,它不是个"聊天玩具",是能直接干活的生产级底座。
诡异的是采纳速度
匿名模型通常活不过一周。这个不一样:上线 24 小时内,Nous Research 的 Hermes Agent 和 Zed 代码编辑器就把它接进了生产环境。
一个没名没姓的模型,能被两个知名工具当天接入,要么它强得离谱,要么背后的人脉和资源不一般。普通开源模型从发布到被主流工具集成,往往要几周甚至几个月。
圈内几乎认定它来自智谱
独立研究者 Ben Davis 做了一套技术指纹比对,给出的结论是 99% 确定:OX Alpha 属于智谱还没发布的 GLM-5.x 多模态旗舰。证据包括视频编码器的 token 消耗特征完全对得上。
如果真是智谱,那就是中国大模型第一次用"匿名空降"的方式在全球榜单上抢位——不走官方发布,先让社区和开发者用脚投票。这打法本身比模型还值得玩味:用神秘感制造话题,用实力留人。
放在 8 月这波模型洪流里看
OX Alpha 不是孤立事件。整个 8 月,模型发布密集到测不过来:阿里 Qwen3.8-Max(2.4 万亿参数)开源、DeepSeek V4 Pro 转 GA、Meta 的 Muse Spark 回到开源、腾讯 Hy3、智谱 GLM-5.3 靠后训练拉升。20 天里 5 家以上厂商发了 11 个模型。OX Alpha 是这股洪流里最野的一个——连名字都懒得给。
这恰恰说明一个趋势:前沿模型的能力差距在收拢,谁先露面不再决定胜负,露面的方式和口碑才开始算数。
这事儿该泼点冷水
匿名 + 免费预览,意味着没有独立复测、没有服务条款兜底。你现在去用,体验是好,但一周后它可能涨价、可能限流、可能直接消失。别拿它跑核心业务,也别把它写进生产架构当长期依赖。
另外,单点 coding 分数领先,不代表综合能力领先。GPT-5.6 和 Fable 5 在更多维度上仍是全能选手。OX Alpha 更像一枚"精准投放的威慑弹",逼对手重新看中国开源阵营的实力,而不是已经全面超越。
跟你有啥关系
你做开发的,可以拿 OX Alpha 当一周的免费玩具,试试它的代码和视频理解能力,但别依赖。真正值得盯的是这股信号:中国模型的打法从"开发布会"变成了"空降抢榜",说明能力和底气都上来了。对你选模型的影响是——别只盯着美国那几家,智谱、千问、DeepSeek 这一波,越来越能打,而且往往更便宜。多一个选项,永远是好事。等它真身浮出水面(无论是不是智谱),记得回去重新比一遍分数。
