AInspiro
技术趋势

300 亿参数跑进手机里:端侧大模型这个秋天跨过了一条线

AInspiro 编辑部·
部分内容由 AI 辅助创作。

先把话说准:是 300 亿总参数,每次只用 20 亿

9 月 7 号,华为在广州发布 Mate XT 2 三折叠,顺手把麒麟 9050 Pro 也发了。发布会上最抓人的一句是"行业首个端侧 MoE 全模态大模型入端,总参数 300 亿,激活参数 20 亿"。

这两个数得放在一起看。MoE(混合专家)的意思就是:池子里有 300 亿参数,但每处理一个 token 只唤醒其中一小部分,这里是 20 亿。也就是说,真正参与一次推理的规模是总参数的十五分之一。这不是贬低,这恰恰是它能塞进手机的原因。但如果你只记"300 亿"这个数,会对它的实际能力产生错误期待。

具体能干啥?官方演示的场景是:断网状态下,本地跑盘古 30B-A2B,说一句话就能整理相册。这种"不联网也能用、数据不出手机"的事,就是端侧最实在的价值。

它是怎么塞进去的

麒麟 9050 Pro 走的是"逻辑折叠"路线。说人话:过去芯片里的逻辑单元是平铺在一层上的,像平层;现在把它们分层叠起来,像复式,层与层之间加垂直通道,相当于给房子装了电梯。信号要走的路短了,时延低了,同样的时间能干更多活。

这条路子的学名叫"韬定律"(τ 定律),华为半导体业务部负责人何庭波 2026 年 5 月在 IEEE ISCAS 会议上首次系统提出。核心思路是拿"时间缩微"替代"几何缩微"——不依赖 EUV 光刻机,在现有 DUV 设备上把逻辑单元垂直堆叠,让成熟制程做出接近先进制程的表现。

实测数据:晶体管密度从每平方毫米约 1.55 亿个提到约 2.38 亿个,一代之内涨了 55%。何庭波说,这个增幅相当于此前三年靠几何尺寸缩小取得的成果总和。

更反常识的是功耗。在性能对齐的条件下跑真实负载:NPU 降 66%、GPU 降 58%、CPU 性能核降 41%。常识里晶体管变密必然更烫,这里的解释是:现代芯片大部分能量不是花在计算上,而是花在搬数据上,逻辑折叠把长距离的水平走线换成了短距离的垂直跳跃。同样的 29 TOPS 算力下,NPU 时钟频率可以下调 63%,供电电压从 0.85V 降到 0.55V,功率密度下降 73%。

其余参数:CPU 九核超线程,单核峰值提升 24%、多核并发提升 52%;自研马良 GPU 渲染性能提升 142%,4K 视频多轨导出提速 40%。整机性能比上一代提升 42%。这是 2020 年 Mate 40 之后,华为时隔六年再一次在旗舰发布会上详解新麒麟。

同一周,另一条线也在推进

端侧这波不是一家的事。中兴努比亚的 NaviX Ultra 拿到了工信部入网许可,搭载豆包手机助手,官方定位是"全球首款 AI 智能体手机",9 月 16 号发布,本月开售。它主打的不是跑多大模型,而是把交互逻辑反过来——不是人去迁就手机的菜单,而是手机主动理解你要办什么事。

存储这边也在配合。长鑫在上市后首次半年度业绩说明会上宣布自主 LPDDR6 正式量产商用,峰值速率 12800Mbps;10667Mbps 的 LPDDR5X 会进 NaviX Ultra。端侧大模型最吃的就是内存带宽,这个环节跟不上,模型跑不起来。

还有一条更远的路:扩散语言模型(dLLM)开始被推向端侧,有团队声称能把端侧智能体提速 5 倍。这条目前缺少可验证的公开数据,先标记待核实,别当结论。

冷静看:跨过的这条线,和没跨过的那条

跨过去的是"能不能跑"。300 亿总参数、20 亿激活,在手机上实时响应,一年前做不到。这带来的三个好处是实打实的:不联网可用、数据不出设备、没有每次调用的 token 费用。

没跨过去的是"跑得多好"。手机上的模型在长文理解、复杂推理、多步工具调用上,跟云端旗舰还差着代际。指望手机本地跑出云端效果,短期内不现实。更现实的形态是分工:简单、私密、高频的事在端上做,重的活扔给云。

还有一个容易被忽略的点:端侧能力越强,厂商越有理由把数据留在本地,这对你我未必全是好事。数据不出手机意味着隐私更好,也意味着你在手机上的行为数据更难被第三方审计工具检查到。好处和代价常常长在同一根茎上。

跟你有啥关系

如果你在评估要不要把某个 AI 功能放到本地,就看三个条件:断网时是否需要它、数据是否敏感、调用是否高频。三条里中两条,就值得考虑端侧方案。三条都不中,老实走云,成本更低、效果更好。

如果你只是普通用户,近期最值得留意的是价格。Mate XT 2 起售价 19999 元,顶配 24999 元,9 月 12 号开售。这是三折叠旗舰的价位,不是给所有人准备的。真正让端侧大模型普及的,会是后面那批两三千元的中端机——Mate 90 系列据说 9 月下旬发布,用的也是这颗芯片。想等等看的,可以等那一波。