35天又发一版,但这次换了活法
8月12日,SpaceXAI(原xAI)把 Grok 4.6 甩了出来。距离上一版 Grok 4.5,才过去五周。
有意思的不是它又变聪明了。
是它彻底换了定位——从陪你聊天的机器人,变成了一个能自己跑长活的企业级 agent 平台。这步棋,比分数本身更值得看。
没换基座,靠后训练把分硬拉上来
Grok 4.6 沿用的还是 4.5 那套约 1.5 万亿参数的老基座。Artificial Analysis 智能指数从 56 涨到 61,基本全靠后训练堆出来:精选模型自己生成的推理数据、重做的微调轨迹,再在长程 agent 任务上猛做强化学习。
说白了,没重新炼丹,只在成品上反复打磨。
这条路几家都在走,但 Grok 是第一个把"后训练 Scaling"直接写进发布稿、挑明说"我们不炼新模型了,就磨老模型"的。底气够足,也够诚实。
而且它真不是孤例。同一个八月,Google 的 Gemini 3.7 隔 23 天就发新版,靠的也是后训练。前沿实验室集体从"堆参数"转到"磨老模型",这才是 2026 年八月最该记住的趋势。
500K 上下文,到底有多大
50万 token 的上下文窗口。
翻译成人话:差不多能把一整套企业代码库、或者你一整年的客户聊天记录,一次性塞进去做一遍。之前 AI 干活总翻车,很大一个原因就是上下文不够、被迫把任务切成碎片,切着切着就忘了前头说了啥。Grok 这下把这道墙拆掉一大半。
当然,代价是钱——这事儿后面说。
价格:便宜,但埋了个坑
API 定价 $2/$6 每百万 token,输入和输出,前提是你的提示词低于 20 万 token。
一旦超过 20 万,价格直接翻倍,变成 $4/$12。
缓存输入只要 $0.5,反复读同一份文档能省 75%——做客服知识库、天天喂同一堆产品手册的老板,会懂这个香。便宜是真的便宜,但你真让 agent 连跑几个钟头的长任务,账单可能悄悄翻一倍,别被开头的低价晃了眼。
翻车点:别被榜单糊弄了
分数好看,软肋也得摊开说。
一是它压根不公布 SWE-bench——就是写代码那块最硬、行业最认的基准。二是长程终端操作 Terminal-Bench 3.0 只拿了 26%,说明让它真去操作系统、跑一串命令,还是容易翻车。三是目前所有数都是 SpaceXAI 自己报的,独立第三方还没复测,信几分得打折扣。
榜单第一和第二之间,差的往往不是能力,是敢不敢把短板也亮出来。
跟它一起发的 Grok Bot 也才进早期 beta:每个 bot 配一台独立虚拟机,能自己登录你的销售、财务、工程系统跑任务。听着是真香,但审计日志和安全管控都还没文档化。企业真要上生产环境,这块得掂量。
还有个细节值得玩味:给每个 agent 一台独立虚拟机,不是随便设计的。企业最怕 agent 互相串数据、出了事查不清谁干的。隔离运行环境等于把责任边界划清了。这思路跟 Anthropic 的 Claude Agents、OpenAI 的 operator 模式是一个方向——大家都不约而同认定,下一步主战场是"能自己干活的持久化 agent",不是聊天框。
马斯克顺手撂了句:更大的 Grok 4.7 数周内就到。按这个节奏,八月这波更新潮怕是刚开头。
跟你有啥关系
如果你是开发者或技术负责人,Grok 4.6 最该看的不是榜单,是"价格加长上下文"这套组合拳。
做长程 agent、读大代码库、知识密集型研究,它现在是最便宜的前沿档之一,比 Opus 4.8、GPT-5.6 Sol 那几个贵价选手友好得多。但你要写严肃代码、尤其要跨整个仓库做推理的,先等等——Opus 4.8 和 GPT-5.6 Sol 在那块还压它一头。
我的判断:把它当"便宜的长工"用,别当"全能的首席"用。位置摆对,这波更新就值。
