过去一年大家默认一个逻辑:模型越大越能打。Google 这周把这套思路拧了过来——它没再堆一个更大的旗舰,而是把 Gemini 拆成三种"速度档",让不同活儿用不同的模型。
你如果正跑一个 7×24 小时的客服 Agent,每个月 token 账单就是实打实的成本。这时候你要的不是"最聪明",是"够聪明而且便宜、快、不卡循环"。Google 这波三款轻量模型,全是冲着 Agent 工作流来的。
三款模型,各管一摊
- Gemini 3.6 Flash:通用干将,coding、知识工作、多模态都接。已经 GA(8 月 2 日),定价 $1.50 / 百万输入、$7.50 / 百万输出 token。
- Gemini 3.5 Flash-Lite:最快最便宜的一档,官方标称 350 输出 token/秒,专接高吞吐、重复类任务,还直接塞进了 Google Search。
- Gemini 3.5 Flash Cyber:干安全活儿的,找漏洞、打补丁,但目前只给政府和"可信伙伴"试点,普通人摸不到。
数字翻译成人话
3.6 Flash 比上一代 3.5 Flash 少吐约 17% 的输出 token。听着不多?Agent 一次任务往往要走十几二十步循环,每步都省一成多,一个月跑下来账单能砍掉一截。加上 Flash-Lite 的 350 token/秒,意味着一个"查天气—比价—下单"的自动流程,响应快到用户几乎感觉不到停顿。
模型竞赛从"谁参数多"拐向了"谁每块钱能干更多活"。这对跑 Agent 的小团队是实打实的好事。
冷静一下
三款里最香的 Flash Cyber 只给政府试点,等于把"AI 自己修漏洞"这道菜先锁在玻璃柜里。Robotics ER 2 也还只是 public preview,真要上产线等基建、等价格、等案例。还有个尴尬的对照:我们之前写过的 Gemini 3.5 Pro 因为编程不达标跳票,到现在还在跟合作方测——旗舰掉链子,轻量线反而先铺开了。
另外 sampling 参数 temperature、top_p、top_k 这一轮被 Google 标成弃用。老代码里写死这些参数的,迁移时得改。
跟你有啥关系
做海外业务、用 Agent 跑流程的小团队:3.6 Flash 的定价基本把"用前沿模型跑自动化"的门槛压到了能算清账的水平。比起闭眼调最贵的旗舰,按任务分档选型(重活 Flash、流水活 Flash-Lite)能直接省成本。做硬件/机器人方向的,ER 2 的 early-access 名单现在开着,想卡位的可以去排。
一句话:Google 这步不是在秀肌肉,是在铺水管。模型多到能按需接,Agent 生意才好做。
