先说结论:没有通杀
“写代码”不是一个单一能力。你拿哪把尺子量,结论就翻一倍。
GPT-5.6 的顶档是 Sol,Claude 这边是 Fable 5。这俩是目前最常被拿来比的“贵价打工人”。
跑分摆出来
几个公开榜单,直接看数字:
- Coding Agent Index v1.1:GPT-5.6 Sol 80,Claude Fable 5 77.2——Sol 略胜
- SWE-Bench Pro(真实 GitHub issue):Claude Fable 5 80.0%,GPT-5.6 Sol 64.6%——Fable 领先15点
- Terminal-Bench 2.1(命令行工作流):GPT-5.6 Sol 88.8%,Claude Fable 5 83.1%——Sol 胜
同一个 pair,两个榜能讲出两个完全不同的故事。这就是关键。
写代码,谁强
Sol 赢在“广”:agent 自主跑、终端操作、跨文件改代码,它更顺,而且输出价格差不多是 Fable 的一半(每百万 token $30 vs $50)。
Fable 赢在“深”:真实仓库里的 PR、多文件重构、长链路 bug,SWE-Bench Pro 领先的那15点不是四舍五入能抹掉的。Anthropic 自己放出的客户反馈也一致——Cursor、GitHub 都说它在长程工程上更稳。
写长文和文案呢
这一项 Claude 一直占优。不是它文笔更华丽,而是它更“懂人话”:意图识别准、纠错轮次少、代码审查更挑刺。
GPT-5.6 长文不差,但如果你写的是要给人看的东西——方案、报告、产品文案——Claude 的“人味儿”更足。
选型建议(别和稀泥)
跑 agent、终端脚本、预算敏感 → 选 Sol,便宜一半还更宽。
修真实仓库、写长文、重质量轻价格 → 选 Fable,那15点差距在你这种活上真能省工程师两小时。
最重要一条:benchmark 只是入围名单,不是结婚证。拿你自己的任务跑一遍,比看任何榜单都准。
延伸阅读
同系列的 GPT-5.6 各档对比、以及 Midjourney vs 国产出图工具,我们在 ainspiro 都有单独拆解。
