洞察
实用分析与指南,帮助你更高效地采购、构建和使用 AI。
代码智能体榜单前两名只差 0.4 分:这场仗已经不是比聪明
榜单前两名,只差 0.4 分。这已经不是谁更聪明的问题 8 月 21 号一份 Terminal-Bench 2.1 的独立跑分出来了。代码智能体这个赛道,第一和第二的差距小到可以忽略:GPT-5.6 Sol 拿了 89.5%,Claude Opus 5 拿了 89.1%。 你花大价钱追的"最强模型",跟第二名之间,可能就差你喝杯咖啡的时间。 真实数字长这样 GPT-5.6 Sol(xhigh
Grok 4.6 来了:马斯克不卷参数,改卷能干活的长工
35天又发一版,但这次换了活法 8月12日,SpaceXAI(原xAI)把 Grok 4.6 甩了出来。距离上一版 Grok 4.5,才过去五周。 有意思的不是它又变聪明了。 是它彻底换了定位——从陪你聊天的机器人,变成了一个能自己跑长活的企业级 agent 平台。这步棋,比分数本身更值得看。 没换基座,靠后训练把分硬拉上来 Grok 4.6 沿用的还是 4.5 那套约 1.5 万亿参数的老基座。
中国开源大模型这一波:Qwen 放出 2.4 万亿,DeepSeek 改峰谷计价
一周,两次刷屏 八月初这一周,两个中国模型先后占满头条。一个把"最大开源"的门槛直接抬到 2.4 万亿参数,另一个悄悄改了计价方式,结果让亚洲时区的开发者账单集体变厚。 你想自己部署一个顶级模型,不走 API、数据不出本地机房。两个月前你还觉得这是大厂才玩得起的奢侈。现在权重开源了——但先别急着下载,因为你能下到的,和榜单上跑分的,很可能不是同一个东西。 阿里 Qwen:最大开源,但有减配 Qw
Gemini 3.7 Flash 发布(2026):编程逼近生产级,Token 成本砍半的真相
一句话先说 8月13日,Google 发了 Gemini 3.7 Flash。它的定位很明确:不是最聪明的那个,是性价比最高的那个——专门给"要跑在生产环境里的 Agent"用的。如果你做 AI 应用、自动化、批量调用,这款才是你该盯的型号。 它强在哪,用数字说 这一代的提升不是挤牙膏,是编程能力实打实跳了一截: FrontierCode 1.1 从 34.4% 跳到 43.6%,Dee
Supabase Evals 实测(2026):编程智能体差距不在模型,在上下文
你换顶级模型写代码,可能和用中端模型差不多 Supabase 在8月1日开源了一个基准叫 Evals,让 Claude Code、Codex、OpenCode 在真实后端任务上跑——建数据库表、修坏的 Edge Function、改 RLS 权限策略。结果有点反直觉,最强的模型开箱就满分,中端模型只要加载平台的"技能文件",也能从七八十分追到满分。 模型名字排后面,排前面的是它懂不懂你的项目。
Qwen3.8 vs Kimi K3(2026):国产开源大模型实测对比,谁更适合中小企业
8月第一周,国产大模型连放两颗卫星 阿里把 Qwen3.8-Max 堆到了2.4万亿参数,月之暗面更早一周就把 Kimi K3 的2.8万亿全量权重甩到了 Hugging Face。 一个"即将开源",一个"已经开源"。 但中小企业老板真正该问的,不是"谁更猛",是"我到底能不能用得起、跑得动"。 先把账算清楚 Qwen3.8-Max(阿里,8月3日发布) 2.4万亿稀疏MoE,每次激活950
Google 把 Gemini 拆成三档速度:3.6 Flash 上线,机器人 ER 2 也来了
过去一年大家默认一个逻辑:模型越大越能打。Google 这周把这套思路拧了过来——它没再堆一个更大的旗舰,而是把 Gemini 拆成三种"速度档",让不同活儿用不同的模型。 你如果正跑一个 7×24 小时的客服 Agent,每个月 token 账单就是实打实的成本。这时候你要的不是"最聪明",是"够聪明而且便宜、快、不卡循环"。Google 这波三款轻量模型,全是冲着 Agent 工作流来的。
Kimi K3 全量权重今天上线:全球最大开源模型,但有一半时候在编
今天,月之暗面的 Kimi K3 把完整权重甩到了 HuggingFace 上。2.8 万亿参数,Modified MIT 许可,任何人能下载、改、自己部署。 这是目前人类放出过的最大开源模型,没有之一。但有个数字你得先记住:在独立幻觉测试里,它一半以上的时候在编。 下半夜能下,但你的硬盘扛不住 权重文件大约 594 GB。什么概念?一部 4K 电影也就几 GB,这等于你下了一百
AMD Helios 机架级AI系统亮剑,微软入伙正面刚英伟达
AMD 把压箱底的家伙亮出来了 7月20日,AMD 第一次正式向媒体展示它的首款机架级 AI 系统 Helios。不是又一张显卡,是整柜——把 GPU、CPU、网络和软件平台打包成一整套,计划今年就开始大规模部署。 更关键的是客户名单:微软当天宣布要在 Azure 里部署 Helios。这下 AMD 的阵营里已经有了 Meta、OpenAI、甲骨文,还有印度的塔塔咨询服务。等于几家最缺算力的巨
谷歌 Gemini 3.5 Pro 三度跳票:编程卡壳,Alphabet 两日跌近 6%
从“再给我们一个月”到“coming soon” 5月19日 Google I/O,皮查伊在台上说:再给我们一个月。 大家都信了。一个月后没来,改口“7月17日”。等到7月17日,官方页面上只剩五个字:coming soon。 三次延期。这已经不是跳票,是习惯性跳票了。 根子在哪:编程能力没过关 彭博社7月16日的报道点得很直白——根因是代码生成能力没达到谷歌内部预期。 原计划其实是今
Mira Murati创业首秀:Inkling开放9750亿参数,音频原生
Mira Murati的第一张牌 前OpenAI CTO Mira Murati创立的Thinking Machines Lab,7月17号掏出了第一款基础模型——Inkling。 9750亿参数,MoE架构,激活410亿,完整开放权重。这不是个PPT,是真能下载跑的模型。 有意思的是,Inkling没去卷"最大最强"那个榜单,主打的是一个均衡和可定制。 原生音频,是个亮点 Inklin
Kimi K3凌晨炸场:2.8万亿参数,全球最大开源模型什么水平?
2.8万亿,开源模型的天花板又捅破了 7月17号凌晨,月之暗面把Kimi K3放出来了。 2.8万亿参数,MoE架构,每token激活16个专家——全球第一个总参数跨过2万亿门槛的开源模型。在这个意义上,它确实是个节点。 先说结论:综合智能水平,官方测评里仅次于Claude Fable 5和GPT-5.6 Sol。换句话说,开源阵营第一次摸到了闭源前沿的屁股。 不只是堆参数 这次月之暗面
