黄仁勋把 Rubin 定义成了"智能体 AI 工厂"的底座
在 GTC 2026 上讲完后,Vera Rubin 平台已经全面量产,2026 下半年开始交付。官方给出的最刺眼的数字:相比上一代 Blackwell,每百万 token 的推理成本降到十分之一,每兆瓦吞吐提升 10 倍。这次英伟达卖的不是单颗芯片,而是一整套"为智能体设计"的机架级系统。
一台机架就是一台超级计算机
Vera Rubin NVL72 不是一块新显卡,而是 72 颗 Rubin GPU 加 36 颗 Vera CPU,用第六代 NVLink 连成一个"巨型 GPU"。英伟达说它训练混合专家模型只需 Blackwell 四分之一的 GPU,推理 token 成本是其十分之一。
配上 Groq 3 LPX 推理机架后,对万亿参数模型能做到每兆瓦吞吐最高 35 倍。Vera CPU 机架单独能跑 2.25 万个并发强化学习或智能体沙箱环境。CMX 上下文存储把 KV 缓存从显存卸到专用存储层,吞吐和能效最高再翻 5 倍。整套平台由七颗芯片、五种机架拼成,作为一个 AI 超级计算机协同运转。
为什么是现在讲"每兆瓦"
2026 年推理已经超过训练,成了 AI 算力的主导消耗类别。智能体一次对话吃的 token,可能是传统应用的 15 倍。黄仁勋的逻辑很直接:在同样的电力 footprint 里塞进更多智能,always-on agent 才有消费级价格的可能。
英伟达把这套平台对准"四个缩放定律":预训练、后训练、测试时缩放,以及 agentic 缩放。换句话说,它赌的是未来算力消耗大头在推理和智能体,而不是训练。80 多家 MGX 生态伙伴在造这代机架,CoreWeave、Google Cloud、Microsoft Azure、Oracle 都已经部署或在跑,机架级供应链横跨 30 个国家、350 多座工厂。
但要把厂商数字当厂商数字看
"token 成本降到十分之一"是基于特定模型(Kimi-K2-Thinking)和固定输入输出长度配置测出来的,别当成所有负载的通用数字。那些 10 倍、35 倍也都是"projected"(预估),会随模型、批大小、网络拓扑变。训练端"四分之一 GPU"同样依赖 MoE 架构和特定配置。
更现实的约束在电力和供应链。再漂亮的每兆瓦数字,落地也要看数据中心的供电和交付节奏。Rubin 量产是真的,但"明天全行业就便宜十倍"不是。主权 AI 云(沙特 HUMAIN、阿联酋 G42、印度 E2E 等)排队部署,也说明这一代产能是稀缺资源,不是敞开供应。
一个被忽视的拐点
当推理成本按数量级下降,受影响的不只是价格。那些因为贵而一直没做的实时、长上下文、多智能体场景,突然有了可行性。换句话说,Rubin 这类底座的意义不在"更快",而在"让之前不划算的事变成日常"。这才是代际切换最该被盯着的地方。
跟你有啥关系
技术趋势的落点很简单:AI 竞争从"单 GPU 谁快"变成了"机架级系统谁省"。推理经济性下降,直接决定你用的那些 Agent 产品能不能把价格打下来、把响应提上去。作为用 AI 的企业,你不用懂 NVLink,但值得关心"他们跑在哪代基础设施上",这往往比模型名更能解释你付的价。基础设施代际差,才是 2026 年 AI 成本曲线的真正开关。
