界面不再是一份设计稿,而是一段正在生成的视频
8 月 31 号,Runway 丢出 Solaris。它的定义不是"又一个帮你写前端的 AI",而是第一个"界面世界模型"(Interface World Models)。差别在哪?写前端的 AI 输出代码,代码再渲染成页面;Solaris 输出的就是画面本身,底下没有 DOM、没有 CSS、没有 JavaScript。
你点一下、拖一下,模型直接生成下一帧。你在一家居电商里把衬衫拖到自己照片上,衣服就穿上去了。你在家居应用里说一句"把桌子挪开让我看看",画面接着就动。整个过程像在播一段视频,只不过这段视频是你现点现生成的。
它是怎么做到的
底座是 Runway 自家的 Gen-4.5 视频模型,路线延续此前的 GWM-1 世界模型。架构上分成两拨:一个语言模型负责理解你想干啥、判断场景该发生什么变化,然后写出提示;世界模型拿着这个提示把变化渲染成画面,并持续往下生成帧。
三处改动把"生成一段视频要几秒甚至几分钟"压成了实时:逐帧自回归、多步去噪蒸馏、以及拿模型自己的输出回头继续训练它(这一条是为了长时间跑不跑偏)。官方给出的指标是 720p 分辨率下约 37 毫秒一帧,也就是说一秒钟差不多 27 帧,肉眼基本连贯。
数字:人真的更喜欢它,但别急着欢呼
Runway 自己组织了一次用户研究:250 名参与者、30 个交互示例、近 7500 次成对比较。结果是,在"是否准确听懂了指令"这一项上,Solaris 拿到 61% 的偏好,代码方案 24%,剩下 13% 认为两者差不多;在"行为是否自然"这一项,Solaris 71%,代码方案 21%。
这个差距不小。但同时要记住两件事:第一,这是 Runway 自己办的研究,样本和示例都是它挑的;第二,61% 意味着还有接近四成的时候人更想要那个老老实实的、按钮位置固定的界面。有自媒体转述称 Solaris 在界面重建任务上超过了 GPT-4o、Gemini 2.5 Pro 和 Claude Opus 5,但这个说法目前没有独立第三方验证,先当传闻听。
三个还没解决的硬伤
Runway 自己也没藏着,把问题摆在明面上:
第一是文字。界面里全是字,而 Solaris 是视频模型,生成稳定、清晰、可读的文字恰恰是视频生成最难的一块。按钮上的标签歪一点、糊一点,这个界面就没法用。
第二是长时间一致性。跑久了画面会漂移,你刚才拖过去的那件衬衫,三分钟后可能变了颜色。官方说持续自我训练就是冲着这个去的,但目前没有长时实测数据。
第三是无障碍。屏幕阅读器、无障碍 API 这整套软件栈,Solaris 现在接不上。对一个"要取代界面"的东西来说,这一条几乎是致命的——真实产品上线过不了这一关。
还有个更隐蔽的:生成出来的界面看着挺像回事,但显示的信息可能是错的。Runway 说正在做"锚定到已验证的产品信息和参考资料"的机制。这句话换个说法就是:现在还没锚定住。
那它现在能干啥
Solaris 目前是研究系统,没有公开发布,Runway 只面向核心合作伙伴开放抢先体验申请。所以短期别想着拿它做生产环境。
真正被看好的用法有两个。一个是快速原型:想法到可交互的画面之间不再隔着设计稿和前端开发,改个方向就是换句话的事。另一个更有意思——给 Computer Use 类智能体当训练场。现在的智能体只能记住固定页面上的按钮位置,换个没见过的网页就抓瞎;如果有一个能源源不断生成千变万化界面的环境,智能体的泛化能力就有地方练了。
跟你有啥关系
如果你是设计师或者前端,别慌,也别当没看见。慌不至于,因为生产级界面要的东西——按钮的身份唯一、交易的完整性、无障碍合规——恰恰是生成式方案目前保证不了的,代码天生就能保证。这些不是"再迭代两版"能补上的,是路线差异。
但"从想法到可点可拖的演示"这一段,确实要被压缩了。过去你需要画稿、切图、写原型,现在可能只需要说清楚你想要什么。真正值钱的会往前挪:判断什么值得做、把需求说清楚、以及定义什么算"对"。
建议就一条:把原型环节先拿出来试。真要上线的东西,老老实实写代码。
