AInspiro
工具测评

Meta 扔了颗价格炸弹:20 人同场说话也能分清,千分钟只要 3 美元

AInspiro 编辑部·
部分内容由 AI 辅助创作。

一场 20 人的会,会一散纪要就是一团乱麻

销售、研发、市场三方同时开麦,远程接入的同事也在抢话。会开完,整理纪要的人面对的是“谁说了什么”的一团乱麻。这不是段子,是全球每天数亿场会议反复上演的真实成本。

9 月 1 号,Meta 给出一份出人意料的答卷:不是一个更贵的硬件,而是一个 API,每千分钟音频只收 3 美元,折合每小时 0.18 美元,约等于人民币一块二。

它是什么:把三套系统压进一个模型

这是 Meta 超智能实验室(MSL)第一个实时音频感知模型,叫 Muse Voice Transcribe。多数生产级语音栈是把三件事拼起来的:一个负责转写、一个负责区分谁在说话、一个负责判断一句话说完了没有。每接一次手就多一点延迟、多一点出错点。

Muse 反过来,把流式语音识别、说话人分离(20 人以上)、端点检测塞进同一个自回归模型里。音频以 80 毫秒为块进来,每块转成一个 soft token,模型每处理完一块就决定:继续听,还是把字吐出来。这种“自适应延迟”是用强化学习训出来的——难词多听一会儿,清楚的词早点出,而不是给每句话套同一个固定等待时间。

成绩和价格

语言覆盖:训练数据 70 多种语言,发布时 25 种完成验证;单段音频支持超过 1 小时,支持句内或句间的自然语言切换。开发者还能用关键词和上下文偏置,把特定术语的识别率往上拉。

评测上,它在 Artificial Analysis 流式语音转文本榜排第一。截至 2026 年 9 月 1 号,最终转写词错误率(WER)3.1%,领先 Cartesia 的 3.4%、ElevenLabs 的 3.6%;说话人分离错误率 17.5%,也压过同场对比的几家。

价格上直接对标 OpenAI GPT-4o Mini Transcribe 的同价位档,但流式说话人分离是它真正的差异化。模型已经上线,在 Mac 的全局听写和 Muse Code 里跑着,也通过 Meta Model API 以 muse-voice-transcribe-1.0 开放调用。

得说清楚的边界

它不是市场上最便宜的——Soniox 同口径费率更低。说话人分离也不是支持最多的:Speechmatics 标到 100 人、Amazon 到 30 人,都比它的 20+ 高。Meta 的卖点不是某一项单点第一,而是“高容量分离 + 低延迟 + 低价”打包进同一个模型。

另一个诚实点:3.1% 的 WER 是评测集上的数字。你的口音、你的行业术语、你的嘈杂会议室,得自己拿真实音频跑一遍才知道。流式 80 毫秒延迟对实时字幕够用,但强实时场景要压测,别直接信宣传口径。

跟你有啥关系

做会议、客服、访谈转写类产品的,这套 API 值得排进测试清单。同样的钱,以前只能买到不带说话人标签的转写,现在能拿到分轨带时间戳的结果,产品体验能上一个台阶。

但别一上来就全量切。先用你们自己的录音测三个东西:中文人和地名的识别、多人抢话时的分离准确度、以及 80 毫秒延迟在你们场景里是不是真的够。这三关过了,再谈替换。

它和竞品到底差在哪

把 Muse 和 OpenAI、ElevenLabs、Google 摆一起看,单看转写准确率大家都在 3% 到 4% WER 的窄区间里,差距不大。真正的分水岭是“说话人分离 + 流式 + 低价”被塞进同一个模型。过去你要堆三家服务:一家转写、一家做 diarization、一家做端点检测,三家各自收费、各自延迟。现在一家全包,账单从三张变一张。

对中文用户还有个隐藏利好:Meta 的训练语料覆盖 70 多种语言,中文是基本面,不是边缘语种。但口音和专有名词仍要自己测,别因为“排第一”就直接上线。

3 美元这个数得这么看

每千分钟 3 美元是处理音频的标价,不是你真实成本的天花板。长时间静音、重叠说话、反复重试,照样消耗分钟数。对会议密集的团队,拿你们真实的录音模式先算一遍,因为真正该看的是“每有用转录小时的成本”,不是“每原始分钟的成本”。