AInspiro
EN

DeepSeek V4-Flash 正式版:小模型反杀大模型,Agent 能力把 Pro 踩在脚下

工具测评
🤖 本文由 AI 生成,内容仅供参考。

同一副骨架,重新练了一遍,成绩直接翻倍。这不是升级,是把"越大越强"这条铁律当面撕了。

你公司要上一套 AI 编程助手,预算卡得死。按老逻辑,你得买最贵的那个——参数大、名声响。7 月 31 日 DeepSeek 把 V4-Flash 正式版 API 放出来公测,干了一件反直觉的事:这个"小模型"(激活参数 130 亿)在 Agent 能力上,把自家还没正式发布的"大模型"V4-Pro 预览版按在地上摩擦。

数字摆出来,自己看

V4-Flash-0731 的模型结构和 4 月预览版完全一致——总参数 2840 亿,激活参数 130 亿,没多一个参数。变的是后训练。结果:

  • Terminal-Bench 2.1(终端操作):82.7%,比 4 月预览版的 61.8% 涨了 20 多个点,也超过了 V4-Pro 预览版的 72.1%。
  • Cybergym(网络安全攻防模拟):76.7%
  • Toolathlon Verified(工具调用综合):70.3%
  • DSBench-FullStack(全栈开发):68.7%;DSBench-Hard(高难度编码):59.6%

翻译成人话:一个激活参数只有 130 亿的模型,干自主写代码、调工具、跑终端的活儿,比自家 490 亿激活的 Pro 预览版还猛。这在过去是违背常识的——大家默认"大模型干难活"。DeepSeek 用一套后训练策略证明:同样的肉身,练法对了,表现能质变大跨越。

价格才是真正的杀招

性能反超就算了,定价才是让闭源同行坐不住的地方:

输入 0.14 美元 / 百万 token,输出 0.28 美元 / 百万 token。缓存命中价降到 0.0028 美元,相当于打 98 折里的骨折——1 折都不到。

对比一下:Anthropic 的 Fable 5 输出价是 50 美元 / 百万 token。DeepSeek 用不到对方 0.6% 的价格,给出了"接近前沿"的 Agent 能力。一个中小型团队如果用 Flash 跑客服、跑代码审查、跑数据 pipeline,每月成本可能从几千刀压到几十刀。MIT 开源权重也即将上 HuggingFace——想自己部署也行。

泼盆冷水:别高兴太早

几个坑得说清楚:

第一,公测只限 API。你手机里的 DeepSeek App、网页端,暂时用不上这套新能力。想体验得走接口,对纯 C 端用户没感知。

第二,V4-Pro 正式版推迟到 8 月 10–20 日。DeepSeek 在等自家的 Harness 编程工具做完封闭测试——说明他们把"生产级可靠"看得比"抢发榜"重。但这也意味着,真要冲最难的自主编程,还得等 Pro。

第三,旧接口要退休。legacy 的 deepseek-chat 和 deepseek-reasoner 端点已弃用,迁移截止 2026 年 10 月 24 日。还在用老端点的公司,记得排期迁移。

第四,这波成绩是"后训练缩放"的样本,不是免费午餐。它证明方向对,不代表你拿个开源权重就能复现——DeepSeek 的研究人才和训练方法论才是护城河,中小团队抄不来。

跟你有啥关系

如果你是开发者或技术负责人:Flash 正式版是今年性价比最高的 Agent 底座之一,先接 API 跑通内部工具链(客服、代码审查、数据清洗),别急着囤卡。等 Pro GA 再评估最难的自主编程场景。

如果你是中小团队老板:这条新闻的本质是"前沿能力的单价被打下来了"。以前只有大厂用得起的自主 Agent,现在小团队用几十刀月费就能试。先想清楚你公司哪三个重复活儿最费人,拿 Flash 跑一遍。

如果你看 AI 行业:参数竞赛可能正在让位给"后训练竞赛"。当 130 亿激活的模型能干 490 亿激活的活儿,堆参数的边际收益在下降,练法的权重在上升——这对算力紧、人才强的团队是结构性利好。

DeepSeek 用一份成绩单说了一句话:下一步的前沿,不在更大的模型里,在更聪明的训练里。