DevDay 上最显眼的动作,是给智能体发了一台电脑
9月29日旧金山 DevDay,OpenAI 发布 Dots。它最反直觉的地方不是「更聪明」,而是每个 Dots 实例都运行在自己专属的云端 Linux 虚拟机里。不是嵌个浏览器,也不是连你的本地 Mac,是实打实的一台云上电脑,能跑完整桌面应用、能操作文件系统、能开终端。
Altman 在 keynote 上举的例子很接地气:在一个旧 API 停用前把 App 迁出去。这类活难在依赖关系散落整个代码库,改完哪里会崩并不明显。Dots 负责追出依赖、找出所有要改的地方、写好代码、跑完测试,再把 PR 交给团队审。它还能串接 ChatGPT 上 4000 多个 App,权限沿用你已连的外挂。
陪跑的廉价模型:GPT-6.1 Sol
Dots 背后是 GPT-6.1 Sol,一个为计算机操作调过的中档模型。OpenAI 的说法是它整体成本约为 Astra 的五分之一,在计算机使用这类任务上能压到七分之一。它带 105 万 token 上下文,API 定价每百万输入 2 美元、输出 10 美元——和 Astra 同价但便宜在「够用的活不用上旗舰」。
真实提速数字挺夸张:Weinstein 举了个自己配置复杂餐备订单的例子,人工要两小时,Dots 用 Sol 15 分钟干完,相当于八倍速。Altman 还演示 OpenAI 自己的团队「每天用 Dots 修掉几十个 bug」:它从 Slack 抓到反馈、自己查、自己开 PR。
工程上真正有意思的三处
一是「App Shots」,它抓的不只是截图,还有应用的原始文本和可访问性树,给模型更省 token 的上下文。二是混合管线:把可访问性树、DOM、Playwright 和模型生成的 JavaScript 叠在一起,让 agent 能「写一段 JS 一次做多步」而不是一步步点界面,速度因此大幅提上来。
三是 Decisions API:用更小的 Luna 模型封装,砍掉推理换延迟,用来做分类、路由、选下一步。它在一周内克隆了 Jev 的架构做出来的,目标是毫秒级决策。代价是它接不住长程复杂推理,所以和主干模型是分开的两套。
同时也把边界说清楚了
OpenAI 自己承认了权衡:Decisions API 靠去掉推理换来的超低延迟,注定接不住长程复杂任务,得和持久的多模态云智能体分开部署。Agents API 把 Codex 同款 harness 当服务开放,意味着你不用自己造轮子,但也把控制权交给了 OpenAI 的训练假设。
权限和信任被反复强调:支付、敏感操作必须请求用户同意,agent 只能访问必要的站点与应用。常驻不等于放任。
常驻环境是把双刃剑
每个 Dot 一台永不关机的云上 Linux VM,好处是跨会话保留状态、半夜接着干;代价是算力账单和攻击面都随实例数线性涨。你接的 App 越多、权限越宽,一旦账号或 Dot 出问题,波及面就越大。所以 OpenAI 让权限沿用你自己的范围、关键动作要你确认,这套克制不是怕你用,是怕出事时没人兜。
自检闭环才是投产关键
Dots 最有价值的工程思想是让 agent 测自己写的软件。过去你是 agent 的 QA,现在它写完代码自己跑测试、自己看截图找布局问题。这套写-执行-验证闭环,比单纯一个更聪明的模型更决定它能不能进生产。你接 agent 时,优先找能自己验证产出的,而不是只会给答案的。
跟你有啥关系
Agent 从原型走向生产,关键一跃就是「持久环境加自检闭环」——给它能一直待着的工位,再让它写完代码自己测。这套思路你现在就能借鉴:把长任务拆给一个带固定环境、能读写文件、能跑测试的 agent,比每次从零开会话省太多。但权限边界一定要你定,别让它默认能碰你所有的东西。
