昨晚,硅谷经历了AI诸神之战

2026-09-02 21:25:28 · chineseheadlinenews.com · 来源: 01Founder

昨天夜里的发生了三件大事。

Google 发布了 Gemini 3.8 Flash,Meta 发布了 Muse Spark 1.3,一家此前没人讨论过的初创公司 Mostik 则登上了权威媒体 WIRED 的专访。

如果只看前两件,这很像又一个普通的 AI 刷榜之夜。

Google 刚刚把 Gemini 推上 DeepSWE 榜首,几个小时之后,Meta 又公布了更高的成绩,世界第一的头衔甚至只维持了几个小时。

这种事情到了 2026 年,大家甚至已经快麻木了。

模型发布、benchmark 刷新、X 上庆祝几个小时,然后等待下一家公司继续刷新。

但如果把昨天晚上这三件事连起来看,我觉得真正值得关注的东西完全不在那些榜单上。

AI 的经济学正在发生突变。

过去几年,我们讨论 AI 成本,最常看的数字都是每百万 token 多少钱。

但 Agent 出现以后,这套计量方式正在变得越来越不够用。

未来真正重要的问题可能不是“一百万 token 多少钱”,而是修好一个 Bug 多少钱、完成一份研究多少钱、让一个 Agent 连续工作三个小时到底多少钱。

而昨天晚上,推理成本正在从几个完全不同的方向同时往下降。

Google 在把 frontier 级别的能力塞进越来越便宜的模型,Meta 在让 Agent 用更少的 token 和工具调用完成同一个任务,而 Mostik 更进一步,他们开始质疑:

如果通信的双方本来都是 AI,模型之间为什么还需要用为人类设计的语言交流?

01

Gemini 杀回来了

先看 Google。

Google发布了他们全新的旗舰模型Gemini 3.8 Flash ,官方称之为这是他们迄今为止最强大的推理与代码模型。

这也是 Google 在六周时间内对 Flash 系列的第三次更新,从 3.6 到 3.7,再到现在的 3.8。

过去 Flash 给人的印象一直非常简单:更快、更便宜,但能力会比最强模型差一些。

Google 现在正在一点点改变这个定义。

这一次 3.8 Flash 最核心的提升集中在 long-horizon coding 和 agentic workflow。

在衡量 AI 长周期软件工程能力的 DeepSWE v1.1 上,它拿到了约 74% 的成绩。

DeepSWE 和传统代码 benchmark 最大的区别在于,它不是扔给模型一道算法题,而是真的把 Agent 放进一个代码仓库里。

模型需要理解问题、搜索代码、修改文件、调用工具、运行测试,失败以后继续寻找原因。

一个完整任务可能持续几十甚至上百步。

在这样的测试里,Gemini 3.8 Flash 一度登上世界第一。

Claude Opus 5 同样大约是 74%,GPT-5.6 Sol 大约 73%,此前领先的 Fable 5 大约 70%。

如果只看能力,这几个最强模型之间已经没有特别巨大的差距。

真正恐怖的是另外一个数字:钱。

Gemini 3.8 Flash 的 API 首发价格依然保持在输入 0.75 美元 / 1M token、输出 3.75 美元 / 1M token。

在 DeepSWE 上完成一道完整任务,它的平均成本只有 2.36 美元。

作为对比,同样约 74% 的 Claude Opus 5,单任务平均成本达到 11.84 美元;GPT-5.6 Sol 约 73%,平均成本也要 6.46 美元。

也就是说,同一级别的软件工程能力,执行成本已经可以差几倍。

这在 Agent 时代会变得非常重要。

聊天机器人时代,一次回答贵几分钱还是便宜几分钱,普通用户基本没有感知。

但 Agent 完全不一样,一个 coding agent 可能连续运行 100 步,一个 research agent 可能搜索几十个网页、读取几百页资料,未来企业里的 Agent 甚至可能连续工作几个小时。

Google 官方甚至提到,3.8 Flash 遇到复杂任务时会主动 work harder,进行更多推理和工具调用。

Google 没有为了省钱让模型“少思考”,而是因为 token 已经足够便宜,所以可以允许它跑更长的 loop。

所以我觉得 3.8 Flash 真正重要的地方不是又拿了一次世界第一。

而是它正在把过去只有最昂贵 frontier model 才能提供的能力,硬生生压进 Flash 的价格区间。

02

三个半小时后Meta杀回来了

正在 Google 众人为 Gemini 3.8 Flash 的发布庆祝时,Meta 突然杀回来了。

Meta 突然发布了Muse Spark 1.3 模型。

按 Meta 公布的评测,Muse Spark 1.3 在 DeepSWE v1.1 上的成绩达到了 75.4%。

这个数字超过了 Gemini 3.8 Flash、Claude Opus 5 和 GPT-5.6 Sol。

更夸张的是,Muse Spark 1.2 在这个测试上的成绩还只有约 55%。

从 1.2 到 1.3,一个小版本更新直接提升了约 20 个百分点。

但我觉得 Meta 这次真正值得看的同样不是 75.4%。

还有两个数字:工具调用减少约 20%,token 消耗减少约 25%。

这件事很容易被忽略,但它其实非常接近 Agent 真正商业化以后最重要的问题。

一个 Agent 最浪费钱的地方,很多时候不是正常思考,而是跑偏。

比如 coding agent 在第 20 步错误理解了需求,它可能继续修改五个文件、运行三轮测试、搜索大量代码,最后才发现路线错了,然后全部重来。

几十次 tool call 和几万 token 就这么浪费掉了。

所以一个模型如果能够更早发现任务存在歧义、更早知道自己做不下去、更早询问用户,实际上就是在直接降低成本。

Muse Spark 1.3 这次强化的很多能力都属于这一类:它能在长 thread 里同时维护多个 workflow,遇到模糊任务主动询问,解决不了的问题主动请求帮助,涉及不可逆操作先确认,而且长任务运行很多轮以后也更不容易忘记最开始的约束。

Meta 甚至开始强调模型对自己能力边界的认识:知道自己会什么,也知道自己不会什么。

这些能力放在 Chatbot 时代可能没有 benchmark 涨 20 分那么性感,但到了 Agent 时代,它们都可以直接换算成钱。

Agent 少犯一次错误,本身就是一次推理优化。

所以把 Google 和 Meta 放在一起看,大模型竞争的计量单位正在悄悄发生变化。

以后大家可能越来越少关心“一百万 token 多少钱”,而越来越关心另一个数字:

把一个真实任务从头跑到尾,到底多少钱。

03

Mostik,一个颠覆性的突破

如果 Google 和 Meta 还在研究如何用更便宜、更少的 token 完成任务,那么 Mostik 开始碰一个更加底层的问题:

这些 token 为什么一定要存在?

Mostik 在俄语里的意思是“桥”。

CEO Sasha Malysheva 是这套方法的主要开发者,它的首席科学家则是日内瓦大学教授、2010 年菲尔兹奖得主 Stanislav Smirnov。

他们正在尝试做一件听起来很简单、实际上极其困难的事情:让两个 AI 模型不再通过自然语言互相交流。

今天绝大多数 Multi-Agent 系统都是这么工作的:

Model A 得到一些信息以后,先生成几百甚至几千个 token,把自己的结论用自然语言说出来;Model B 再把这些文字全部读进去,重新理解并建立自己的内部表示,然后继续推理。

但问题在于,大模型内部真正进行计算的东西,本来就不是中文或者英文,而是:

高维连续的数学表示。

这就相当于两台电脑明明可以直接传数据,电脑 A 却先把文件打印成几百页纸,再让电脑 B 用摄像头一页一页 OCR 回去。

大家过去一直在研究怎么把打印费降下来,Mostik 想干脆把打印机扔掉。

他们试图在不同模型的内部表示之间建立一座 Bridge,让模型直接交换 latent representation,而不是先生成自然语言。

硅谷权威媒体 WIRED 披露的一个实验非常有意思。

Mostik 把完整版的 GLM-5.2 753B 和只有 4B、可以运行在移动设备上的 Qwen 3.5 进行了桥接。

最后得到的混合系统,能力落在两个模型之间,但推理成本只有完整 GLM-5.2 的 1/20。

当然,现在就说 Mostik 已经解决了模型通信肯定太早。

Latent communication 本身也不是昨天第一次出现,过去几年已经有不少研究尝试交换 embedding、hidden state、KV cache 等内部表示。

真正困难的是,不同模型的架构、参数、训练数据和内部坐标系都不一样,怎么让两个模型真正理解彼此的 latent space,本身就是一个非常困难的问题。

Smirnov 自己也承认,目前甚至还缺少成熟的数学语言来描述不同模型之间的共同表示。

但 1/20 这个数字还是让我非常兴奋。

因为它让我开始认真思考一种完全不同的未来 AI 架构。

04

未来你只需要一个零点几B模型

过去两年讨论端侧 AI,我们一直在研究怎么把更大的模型塞进手机:7B、4B、3B、1B,不断蒸馏、量化、压缩。

但如果 Mostik 这条路线最后真的能够跑通,我觉得未来的手机也许根本不需要一个“什么都会”的大模型。

你的设备里可能只需要运行一个 0.xB 或几 B 的小模型。

它很便宜,可以持续运行,负责理解你当前在哪个 App、刚刚做过什么、设备是什么状态,并且处理绝大多数简单、高频的任务。

真正碰到困难的问题,再通过潜空间的通信调用远程的大模型。

但关键区别在于,它不用像今天这样,把十万 token 的 Context 全部重新发送到云端,让远端模型从头读一遍。

它可能只需要传输一段高度压缩的 latent state。

远端的大模型完成复杂推理以后,也不一定需要再生成几千 token 的自然语言解释给本地模型,而是直接把新的内部表示传回来。

这样一来,本地的小模型负责高频、廉价、持续运行,云端 frontier model 只负责低频但真正困难的推理,中间再用某种 Bridge 高效通信。

如果未来真的能做到这一点,推理成本下降的幅度可能就远不只是今天模型 API 降价 30% 或者 50%。

它可能会改变我们组织 AI 计算本身的方式。

05

结语

所以回头看昨天晚上,表面上是三条完全不同的新闻。

Google 发布 Gemini 3.8 Flash,把 frontier 级别的能力压进了 Flash 的价格区间;

Meta 发布 Muse Spark 1.3,让 Agent 用更少的 token 和 tool call 完成更多事情;

Mostik 则更进一步,开始尝试让模型之间的一部分 token 从一开始就不要产生。

它们其实都指向同一个变化:

智能正在以非常夸张的速度变得便宜。

而且这种降价已经不只是 API 单价下降。

模型价格在下降,完成任务所需要的计算量在下降,现在甚至连模型之间交换信息的方式都开始被重新设计。

这件事最后可能带来的影响,比 benchmark 又涨几个百分点大得多。

因为很多技术真正爆发,从来不是发生在“第一次能用”的时候,而是发生在“终于便宜到可以随便用”的时候。

今天让一个 Agent 花几十美元去完成一件普通人的小任务,也许完全不划算。

如果未来只需要几毛钱,很多现在根本不会有人考虑的应用突然就成立了。

今天我们不可能让几十个 Agent 24 小时围绕一个人持续运行,如果推理成本再下降一两个数量级,它可能就会成为默认状态。

现在已经早上七点了,我本来几个小时前就应该睡了。

结果 Gemini 发完,Meta 几个小时之后又追了上来,然后我又看到了 Mostik 那个 1/20 的实验。

我躺到床上以后脑子里一直在想这几件事,想到手机里的 0.xB 模型,想到云端的大模型,想到它们也许根本不需要再用自然语言互相说话。

越想越睡不着,最后还是爬起来,把这篇文章写完了。

Gemini 的 74%、Muse 的 75.4%,过几天可能就会出现新的数字把它们覆盖掉。

但我现在确实很难平复这种兴奋。

因为比起谁又拿了一次世界第一,我越来越在意另一个问题:

这么聪明的 AI,最后到底可以便宜到什么程度?

一旦强大的智能真的便宜到可以被随意调用,我觉得很多今天看起来还非常疯狂的 AI 产品,可能才刚刚开始。


    24小时新闻排行榜更多>>
  1. 超级圣婴现象强化,纽约今年迎暖冬
  2. 赵世勇张忠押解刘建洋 习近平储君“抢滩”陆家嘴
  3. 中国农业多厉害,人均农业GDP超美
  4. 习近平时隔十年再访埃及
  5. “赛考斯”,为什么要加引号?
  6. 《富爸爸》作者自爆"负债12亿":有钱人都这样玩
  7. 49岁曾黎回老家种地,晨跑被骂不雅
  8. 习近平怕军队借机造反?中共救灾迟缓引质疑
  9. 中国最惨的一代人!从月入4-5万 到街头摆摊卖水果!
  10. 孙割把胡锡进和舆论算得死死的
  11. 德国财长被迫滞留美国
  12. 习近平健康有问题?央视剪掉舷梯上的17秒
  13. 中国人不穿皮鞋了,皮鞋厂怎么自救?
  14. 台风“沙德尔”重创福建 洪灾汹涌有人在泥水中挣扎
  15. 尼泊尔6岁女孩被埋废墟60小时后获救,首次开口了
  16. 180度大反转!在被美国驱逐后,他彻底改口了
  17. 西交利物浦大学两所新学院亮相
  18. 苹果与Google联手更名安大略湖 美民众真实反应强烈
  19. 马克龙继女官宣新恋 男友小20岁 “和妈一样”引热议
  20. “SaaS末日”幸存者数量惊人
  21. 浑身是泥:朱琳在老山“被三名越军追击”
  22. 老公战死伊朗,遗孀被克扣福利:因美国没宣战
  23. 汇丰警告:这次亚洲“风暴眼”不在汇市
  24. 中国记者到了尼泊尔以后,采访能力突然"恢复"了?
  25. 又一中国男子ICE拘留后死亡
  26. 首届全球治理天津论坛举行
  27. 德州野火已烧毁9万英亩,恢复恐需三年
  28. 黄之锋:从学运领袖到国安法囚犯,重获自由未有期
  29. 马克龙妻42岁女儿恋小20岁鲜肉!母女都谈"姐弟恋"
  30. “两边阵营都很愤怒,川普情况不太妙”
  31. 地底惊现异常,火星再添谜团
  32. 不吃晚饭的人,最后都怎样了?
  33. 景甜保卫战?大佬纷纷下场对战孙宇晨 她人缘这么好?
  34. 黄仁勋:英伟达今年在美投入近万亿美元
  35. 马斯克预言:AI一年半内“碾压”人类
  36. 美军已完成新一轮对伊打击
  37. 能“光合作用”的生物?罕见的盗食质体
  38. 乌克兰离奇“特工内战” 两大情报机构竟在街头火拼
  39. 幸存者讲述在大峡谷洪水中的生死5小时
  40. 美财长警告各界“闪远点”!下一轮制裁瞄准3大领域
  41. 3天4尸,警察离奇结案,恐惧笼罩韩国济州岛
  42. 中国书画名家——苏葆桢
  43. 黄之锋被关押六年:从学运领袖到国安法囚犯
  44. 说Hello太正式?美国人这样打招呼最地道!
  45. 黄之锋身形消瘦出庭认罪 已服刑多年 原本明年出狱
  46. 政府专机又趴窝 德国副总理兼财长被迫滞留美国
  47. 贝森特指G20中仅中方反对提“廉价出口”不可持续
  48. 月之暗面秘密交表,正式启动IPO
  49. 炸药无人机闯德机场,欧盟召见俄特使
  50. 高盛:AI淘汰赛开打,赢家通吃数据与工作流
  51. 告别Chatbot,AI同事时代开启
  52. 张又侠被免职 引发军方新一轮愤怒 爆退休将领不接电话
  53. 油管还没拔 加油车竟开走了 纽约机场柄航客机受损
  54. 谷歌上新两款Gemini 3.8
  55. 日本拟向菲印转让老旧军舰 借防务网络制衡中共
  56. 苹果新CEO薪酬曝光,比库克还高
  57. 伊朗袭击致“多名美方人员死亡”
  58. 邵氏时期武打巨星陈观泰逝世 疑因脑出血抢救不治
  59. 阿联酋走出了最矛盾的一步棋
  60. 刺杀查理·柯克嫌疑人不认罪,或判死刑