AInspiro
AI工具

DeepSeek 上线 V4-Flash-Vision-Exp:给 Flash 装上眼睛,价格不变

AInspiro 编辑部·
部分内容由 AI 辅助创作。

给便宜的 Flash 装了双眼睛

8月21日,DeepSeek 在 API 上悄悄挂了个新模型:V4-Flash-Vision-Exp。

名字老长,还带个 Exp(实验性)。但它干的事特别直白——让 7月31日发的那个便宜版 V4-Flash,终于能看图了。

不是新模型,是块视觉补丁

得说清楚:这不是又炼了一个大模型。

它就是在原版 V4-Flash 上加了视觉能力。纯文本那部分——agent、推理、世界知识——跟原版一模一样,一点没丢。多出来的,是读图、读截图、分析图表。

对做 agent 的人,这意味着你的机器人能"看屏幕"了。以前想干这个,得切到 Opus 4.8 那种贵价模型,现在便宜的 Flash 自己就能凑合上。

把视野拉远点看,这件事不小。2026 年八月,模型们不约而同开始给自己的便宜档加视觉:不是为秀生成图多漂亮,而是让 agent 能读屏幕、读图表、读票据。能"看"的 agent,才能真正接手那些重复又繁琐的后台活儿。DeepSeek 这步,是顺着这股潮水流的。

数字翻译一下

1M 上下文、384K 输出,跟 Flash 和 Pro 一个水准,没缩水。

图片按输入 token 计费,每张最多 384 token。一张产品截图算下来成本几乎可以忽略;但你一次塞 600 张图、总图顶到 64MB,边界就到了——别觉得"看图免费"就猛灌。

价格:跟 Flash 一模一样,但高峰坑人

定价跟原版 V4-Flash 完全一个价。

高峰时段 $0.44 / $1.32(每百万 token 入/出),低谷直接对半。看起来很良心对吧?重点在高峰时段是哪段:UTC 01:00 到 04:00,以及 06:00 到 10:00。换算成北京时间是早上 9 点到下午 6 点。

你干活最猛的那八个钟头,正好是最贵的时候。

这点必须记牢,不然月底对账会懵。

翻车点:接近,不是超越

DeepSeek 自己报了一串数:11 项公开 benchmark 里,V4-Flash-Vision-Exp 在 3 项上赢了 Opus 4.8,比如 Agents Last Exam 27.3 对 25.7。

但说"接近 Opus 4.8"比"超越"诚实得多。

在硬核的仓库级代码推理 NL2Repo 上,它 57.7,Opus 4.8 是 69.7,差了整整 12 分——而且 DeepSeek 也没试图绕开这个数。更关键的是,这一串全是它自己测的,没有独立复测,信几分自己掂量。另外它只放 API、不放权重,想本地部署、自己微调的,先歇着。

能看图,不等于看得懂。agent 要的是"看懂屏幕后还干得对",这块才是分水岭。

配套还顺手扔了个免费的 Files API:图片传一次,拿个 file_id 反复引用,省带宽。DeepSeek Harness 0.1.1 也原生支持这个新模型,agent 框架这边接起来不费劲。

跟你有啥关系

如果你已经在用 DeepSeek API、又想让 agent 读个截图或图表,这个模型现在就能试,不换供应商、不多花钱,何乐不为。

但真要做"看着整个代码仓库截图写代码"那种重活,Opus 4.8 和 GPT-5.6 Sol 还压它一头。轻量看屏 agent 你闭眼冲,重视觉编码再等等。

我的判断:它是个称职的"眼睛配件",不是端到端的视觉编码主力。定位摆清楚,就不会失望。