你接外包,一个月出十几个项目,选哪个 coding 模型?
以前这题只有 OpenAI 和 Anthropic 两个选项。现在 Meta 带着 Muse Spark 1.1 杀进来了,coding 这条线第一次变成三强混战。
三强各自占的山头
Muse Spark 1.1(Meta,7 月 9 日):在 MCP Atlas、JobBench、人类终极测试、金融 Agent 这几个 agentic 基准上拿第一;法律 Agent 基准 Harvey 它 20% 胜率,Claude Fable 5 才 11%。100 万上下文、能操作电脑。定价 $1.25 / $4.25(每百万 token)。扎克伯格亲自出山宣布,合作方是 Replit、Cline、Box。
GPT-5.6 Sol(OpenAI,6 月 26 日):广度强。Coding Agent Index 80 对 Fable 5 的 77.2,Terminal-Bench 88.8 对 83.1。输出价 $30 / 百万 token。
Claude Fable 5(Anthropic,6 月 9 日,7 月 1 日恢复全球):深度仓库级重构最猛,SWE-Bench Pro 80% 对 Sol 的 64.6%。写长文、复杂代码也是它的强项。输出价 $50 / 百万 token,最贵。
把价格摊开看:Muse Spark 输出 $4.25,Sol $30,Fable 5 $50。同样写一万行代码,Meta 这价比另外两家便宜了快一个数量级。这不是"便宜一点",是把门槛砸了。
翻车点先说清
Muse Spark 是闭源、没有开放权重——Meta 从"开源福音派"转向双轨了,社区改不了它。而且它的亮眼基准多是 Meta 自己和合作方(Replit 等)测的,独立验证还得等。
Fable 5 有过黑历史:6 月 12 日被美国出口管制令关停,7 月 1 日才恢复全球使用。企业真要用,得把这种供应链中断风险算进去。
Sol 生态最成熟,但贵档明显;便宜的能力你未必全用得上。
站队结论:别和稀泥
- 重度 agentic、多工具调用、预算紧的小团队 → Muse Spark 1.1,agent 基准最强还最便宜
- 深度仓库重构、长文复杂逻辑 → Claude Fable 5,这块它还是王
- 要广度、要生态、不想换供应商 → GPT-5.6 Sol,均衡牌
- 接外包的老板 → 优先试 Muse Spark,性价比炸裂;但闭源意味着接受锁定
跟你有啥关系
三强混战对写代码的人是好消息:价格被 Muse Spark 这一脚踩下来了。以前这种 agentic coding 能力,输出价要 $30–50;现在 $4.25 就能拿到第一梯队的水平。
但别盲目追便宜——你是做"调几个 API 的脚本"还是"重构十万行老仓库",答案不一样。先想清楚自己的活儿长啥样,再选模型,比盯着榜单排名实在。
