菲尔兹带队:将AI升级成三体人

2026-09-06 15:25:09 · chineseheadlinenews.com · 来源: 小冰的奇思妙想

Mostik(мостик),俄语本义即“小桥”。一家只有 15 人的俄罗斯初创,2026 年 9 月2日走出隐身(stealth)模式,宣称找到了一种让 AI 模型之间不靠文字、直接交换内部隐状态进行协作的方法。公司首席科学家是菲尔兹奖得主 Stanislav Smirnov。

一、买椟还珠的传统模型:被丢弃的不是“冗余”,是“深层计算”

传统多模型协作,是让两个“用千维向量思考”的系统,隔着一条只有 17 比特宽的钥匙孔对话;Mostik 的做法,是修一座小桥,让它们直接搬运 2MB 的思考状态,绕过语言这个极度有损的压缩出口。

先看一组官方给出的硬数据,这是整个故事的起点:

也就是说:模型为想清楚一件事,产生了约 2MB 的内部计算,最后只挤出 17 比特给人看(或给另一个模型看),剩下的 2MB 永远不再使用。

Mostik 官方页面用一句话点破现状:

“Every system that connects models together runs on those seventeen bits.”(所有把模型连接起来的系统,都跑在这 17 比特上。)

“Systems built to think in thousands of dimensions are effectively talking to each other through a keyhole.”(以千维思考的系统,实际上正隔着钥匙孔交谈。)

所有现有的多模型协作范式——coding subagents(编程子代理)、model councils(模型委员会)、routing providers(路由服务商)——全部建立在这个有损信道之上,天生带着性能天花板。

最关键的洞察:

被文本信道丢掉的,不是格式化废料,而是选择背后的整个思考过程。

可解释性研究在过去两年给出了证据链:

Transformer 会“提前想好”(Hanna & Ameisen,ICLR 2026,arXiv:2604.12493):

Qwen-3 在写出 “an” 之前几个 token,内部就已经携带了 “accountant” 的表征——它必须提前知道名词,才能选对冠词。且这种“提前性”随模型规模增大而增强:越大模型,藏在文本背后没露面的东西越多。

Claude 在写诗前已押好韵(Anthropic 可解释性团队,Lindsey et al. 2025):

Claude 3.5 Haiku 在写完整行诗句之前,就已经在内部“定好了韵脚”,然后才朝它写过去。

J-space / Jacobian lens(Gurnee et al. 2026):

能识别模型“此刻随时可能说出口但还没说”的概念集合——一组不断变化、不随输入回声、也不是对下一 token 的猜测的“未说出口的词”。模型可以被要求“在心里握住一个概念”,同时对外输出却完全不变。

结论:当一个模型写一句话给另一个模型读,损失的不是格式,而是“做出这个选择时考虑过的一切”。

二、更高效的信道为什么重要

AI 已经沿两条轴扩展了很久,且都在变平:

Mostik 的论点:第三条轴必须通过 multi-agent RL 达到,而高效的协作依赖高效的通信。

现在的模型靠“互相写句子”协调,等于为了生成那些句子几乎丢掉了自己算出来的一切——通信环节就是当前最大的瓶颈。

三、Mostik的成果

架构(以官方图示还原):

发送模型把隐状态交给另一个模型,接收模型直接拿它继续工作;

两端模型权重完全不动(frozen),桥是系统里唯一学习新东西的部分;

没有“输出型文本”在两者之间传递。

https://mostik.ai/read-more

团队:15 人,12 位博士 + 1 位菲尔兹奖得主(Stanislav Smirnov),成立仅 4 个月,获 General Catalyst、Foundation Capital 等投资。

名字的双关:Mostik = little bridge。公司即那座桥。

为何从“几何”开始:

两个模型能否被桥接,本质是它们各自计算所在的表征空间(流形)的几何问题。团队先回答了两件事:这些空间长什么样;任意两个模型之间已经共享了多少结构。

对齐不会随模型变强而自动出现——桥必须“建造”而非“期待它涌现”;

但部分对齐确实存在,且变化可预测。问题从来不是“两个模型之间是否存在翻译”,而是“找到这个翻译要花多大功夫”。

团队选择“大模型→小模型”这个配对,因为部署端早就在要这个组合:一个懂很多的大模型 + 一个负责写字的小模型。

发送方:GLM-5.2(753B,领先开源模型)

接收方:Qwen-3.5(4B,边缘设备级模型)

该桥接组合在 ARC-AGI 3 排行榜位列第一。

经济性来自模型运行方式的不对称:

写答案(decode)是逐 token 进行的,很贵;

读 prompt 是一次并行前向(prefill),便宜得多。 所以实验中大模型从不写:它读问题 → 隐状态过桥 → 停止;

所有生成由小模型完成。

核心数据(官方表格,AVG@4):

基准 MATH Olympiads (204) AIME (135) MBPP (500) HumanEval (164) LiveCodeBench (175) AVG

Receiver alone(小模型裸跑) 66.79 59.26 62.90 80.79 42.00 62.35

+ Latent channel(接桥) 90.93 70.74 82.00 86.13 54.14 76.79

Sender(大模型裸跑) 97.18 89.81 96.95 98.93 80.43 92.66

相对小模型倍数 ×1.36 ×1.19 ×1.30 ×1.07 ×1.29 ×1.24

差距闭合率(% gap closed) 79% 38% 56% 29% 32% 47%

关键结论:

接桥后小模型闭合了与大模型差距的约 50%,自身准确率提升约 25%;

在发送-接收差距最大的难子集上,提升达到 2 倍(AIME 22–26 上,保留数据集越少、越难,receiver improvement 从 ×1.5 一路升到 ×2.5);

成本只有完整 GLM 的约 1/20,性能恰好落在两模型正中间;

换个读法:桥接组合的得分,等价于一个“中规模模型”,但跑它的算力比跑那个中规模模型省 2.5 倍;

与现有方案(routing 路由、advising 咨询、extended compute 延长计算、model council 委员会、self-consistency 自洽)逐一对比,桥接系统在成本-质量前沿上呈明显 Pareto 改进。

latent hand-off 对比 text hand-off:在大模型算力的每一个水平上,潜态交接都优于文本交接,最高提升 10 个百分点;且交接越早优势越大——在文本方案“无话可传”的时刻,潜态早已包含模型读题、处理过程中累积的全部信息。

这是整套实验设计最聪明的地方,也是它能成立的理论支点:

表征相似性是“已存在的事实”,不是训练出来的结果: 两个由不同团队、用不同数据训练出来的模型,其内部表征相似到可以在不做任何微调的情况下互相翻译——这证明桥利用的是两个空间里本来就存在的共享结构。这与“柏拉图表征假设”(Platonic Representation Hypothesis,不同架构/词表/训练谱系在语义几何上趋同)互相印证。

工程上可部署: 很多系统已经有“大模型当顾问、小模型执行”的架构。过去要在关键决策点付两笔钱:大模型读完整上下文(prefill)+ 大模型把所知写成文字(decode)。

Mostik 的方式砍掉第二笔钱——顾问读完上下文,然后停止,指导以潜态而非 token 传递。

四、意外的副产品:可观测性工具

Chain-of-Thought(思维链)监控只能看到模型“愿意写出来的推理”,而它并不完美且脆弱(Korbak et al. 2025,arXiv:2507.11473 指出某些不良行为能绕过 CoT 监控)。

latent hand-off 提供了三个研究对象:

发送方的隐状态;

翻译后的形式(桥的输出);

接收方的行为。

最有价值的是干预测试:在信道上改变某个特征,如果可预测地改变接收方的下游行为,就证明该特征“不仅存在,而且被真正使用”——这比解码器“说出一段合理描述”更强,因为后者无法证明因果。

团队谨慎表态:尚未确证桥是观测工具,但“两个表征空间之间一张可工作的映射图”,本身就为可测量、可干预创造了表面。

它可能不是直接读模型的念头,而是让模型间计算的一部分变得可测、可干预。

桥是被训练的,梯度会流过它,所以它不必等两端模型都完成才出现——可以在一端还在训练时就位。两个在途方向:

蒸馏(Distillation):传统蒸馏中,教师的监督只到达学生的输出层——学生最多看到教师“每个位置准备说什么”,看不到背后的计算。桥把监督移进生成过程内部:教师在学生产出答案的途中引导,而非在答案生成后打分。早期信号:同样预算下,这样训练的学生更贴近教师。

特化(Specialisation):小模型在“通道打开”时训练,能更高效地获得窄技能,同时保留原有的通用能力。这指向一种新扩展方式:给大模型“外挂新模块”而不是整体重训。

更进一步:机制不限于“一对”,同一个通道能让多个模型联合训练,把各自所知交织成单一系统。

官方总结:连接已完成模型本身值得做(这是当前已验证的成果);但训练期就存在的通道,意味着模型可以从诞生起就被构建成彼此协作——这是另一道大得多的问题。

五、世界观与隐喻

隐喻一:语言是有损压缩的出口,不是思维本身

Transformer 的隐向量空间才是模型“真实的思考场域”;文本只是它为了人类阅读,从高维流形上戳出来的稀疏投影。

人的类比:脑内完整的直觉、图景、关联网络,开口说话时只有极小部分被语言捕捉,大量默会知识(tacit knowledge)被丢弃。

Mostik 的理想:绕开语言符号媒介,实现心智-心智直接通信——AI 版的“心灵感应”(WIRED 原文即用 machine telepathy)。

世界观推论:token 化文本是人类交互的妥协产物,不是 AI 智能的原生载体。现有 Agent、多智能体框架全部建立在这个有损媒介之上,天生有天花板。

隐喻二:模型通信是“几何翻译”,不是“字符串翻译”

每个大模型拥有自己独特的思考流形(隐空间几何)。两个模型对话,本质是两个不同几何空间之间的对齐问题,而不是简单的字符串转换。

类比:两个人各自有一套私人概念拓扑,语言词典只能做表层对应;真正的理解,是完成两套内部概念几何的形变映射。

“小桥”就是这个映射器——它不改变两岸(模型本体),只修中间通路。

隐喻三:分布式智能共同体,拒绝巨型单一体

Mostik 范式推崇“大模型负责深度推理、小模型做执行载体”,把重型思考通过小桥迁移到轻量模型上运行,而不是无限堆参数造单体巨兽。

世界观:未来的 AGI 不一定是单个超级大模型,而是多个异质智能体通过隐状态桥接,组成分布式认知共同体。

隐喻四:可观测性的新窗口

CoT 只能观测模型“愿意说出来”的推理;大量内部的欺骗、偏见、隐性逻辑不会写进文本。

隐状态桥接提供了绕过语言的观测通道,可以直接读取模型“未言说”的思考内容。

隐喻五:哲学层面——为默会知识修通道

海德格尔式技术观下,人类大量默会知识不可言说,语言只能带出一小部分。传统 AI 强制所有思考必须“说出来”才能交互,等于强迫智能只使用明述知识。Mostik 的小桥,尝试给 AI 之间开辟一条默会知识的通信通道。

六、“有推理能力接收者的信息论”(PNAS 2026)

那篇论文在说什么

2026 年 8 月底,IBM Research(Luis Lastras、Jonathan Lenchner、Barry Trager、Mark Squillante、Chai Wah Wu、Ronald Fagin,及合作者 Wojciech Szpankowski、Alexander Gray)在 PNAS 发表论文,把推理能力显式纳入香农信息论。

香农的简化(1948):把“消息的意义”与“高效传输”分离。网络不在乎运的是救命诊断还是猫图,只搬运比特。这套框架统治了近 80 年,但它剥离了意义与推理。

IBM 的扩展:在香农“发送方-接收方”模型里,给接收方加一个演绎推理引擎。通信的价值不只是“传输了什么事实”,还包括“接收方能由此推导出的全部衍生知识”。为此推导出新量——逻辑语义熵(logical semantic entropy),定义“存在推理能力时的通信基本极限”。

三个反直觉发现:

“无需知晓”(No Need to Know):发送方即便不知道接收方已知什么,通信基本极限也几乎不变——颠覆“知道对方底细能省数据”的传统直觉(在有损压缩场景下尤其反直觉)。

“少即是多”悖论(Less Is More):Alice 想用最少比特只让 Bob 学到特定子集,最高效的压缩策略反而让 Bob 学到比预期更多——宽泛预设模式在省数据的同时泄露了多余背景,带来安全风险。

纠正错误信念的代价趋于无穷:纠正一个“具体、根深蒂固的错误信念”,通信代价远大于填补知识空白;随错误信念强度上升,纠错相对代价趋向无穷大。

“其中的共性”

维度 Mostik 小桥 IBM 带推理接收者的信息论

批判对象 香农范式的实践载体:token 文本信道是高损耗窄口 香农理论本身:把推理和意义排除在通信极限之外

接收方地位 接收模型不是被动字符串解码器,它自带完整隐空间推理结构,直接摄入高维表征继续推演 接收者不是符号解码器,而是带演绎引擎的认知主体,消息增益来自它的推理能力

通信本质 通信 ≠ 传递句子;是把源端认知状态迁移到接收端认知空间 通信 ≠ 传递事实集合;是传递线索,触发接收端生成完整认知集合

效率来源 规避文本编解码的信息坍缩,复用接收模型自身内部表征 效率增益来自接收方自带推理,不必传输全部显式知识

费曼式的呼应 “万物由原子构成”一句话 → 未来的科学家能重建海量科学知识:价值不在字数,在能推导出多少 逻辑语义熵衡量的正是“传了多少可推断的知识”

隐喻 绕开语言符号,心智空间的几何桥接 绕开完整枚举事实,逻辑语义层面的通信

一句话收敛:两者共同指向同一图景——

当通信双方本身就是推理主体时,符号语言只是一种很差的妥协信道。真正高级的主体间通信,不需要把全部思考序列化输出,只需要传递足够的“种子表征 / 种子命题”,由接收方凭借自身认知能力展开。

Mostik 把这个思想落地到神经网络的隐空间(连续向量、几何映射);

IBM 论文把同一直觉形式化为信息论数学(离散逻辑命题、熵与信道容量)。

前者是工程,后者是理论;前者处理连续流形,后者处理演绎推理——但反香农的世界观完全同源。


    24小时新闻排行榜更多>>
  1. 回流东北:烟火温情难抵就业寒霜
  2. 当“八卦图”被洪水冲乱
  3. 金饰消费量降三成
  4. 大水袭敦煌:一座沙漠城市的防汛应急考
  5. “香港大药房”连续被曝光,仍卖出上亿
  6. 曾经世界生育率最高,东亚现今超低生育率的真相
  7. 中尼边境山洪人祸大于天灾
  8. 狗出现这10种迹象 代表它爱你!
  9. 中俄年轻人对彼此国家的印象完全不一样
  10. 直博"进不去",专硕"读不起":名校学硕停招后
  11. 特斯拉Cybercab正式载客!盲人揭体验 这样评价…
  12. 日媒曝:许家印拥“200名年轻情妇 3架私人飞机”
  13. 日喀则代市长回应吉隆口岸选址问题
  14. 加拿大一咖啡店将"美式咖啡"改"加式",为表达不满
  15. 乌克兰突出奇招
  16. 欧洲五国拟与第三国签署协议
  17. 德国萨克森-安哈尔特州选举投票开始
  18. 小学通知家长做卫生,教育局要求学校整改
  19. 林肯号航母离开泰国,结束其200多天以来首次休整
  20. 一秒变“毒蛇”!拟态章鱼到底有多神奇?
  21. 消息人士:习近平拟率“CEO天团”访美
  22. 绿洲合唱团纪录片,揭盖勒格兄弟重修旧好
  23. 街头突然“机器人堵车”
  24. 规范致命自主武器迈出重要一步
  25. 逃离北上广,年轻人算完一笔账后开始回流东北
  26. 一头驴之死,为何能让整个美国破防?
  27. 2026年度搞笑诺贝尔奖出炉
  28. 家属已办丧礼!尼泊尔妇人活埋多日奇迹生还
  29. 455个中产家庭晒账单:不鸡娃了,钱却没少花
  30. AI新贵们正在买爆私人飞机
  31. 谈判拖了27年,中吉乌铁路为啥非修不可?
  32. iPhone Ultra折痕实锤:1.5万买不到无折痕
  33. 不同版本的世界地图有哪些正确及错误之处?
  34. Anthropic 2万亿IPO生变
  35. 死亡七分钟 在另一个世界游历数星期
  36. 德国企业希望欧盟对华采取包强硬政策
  37. 色情也能救国?乌克兰拟推“成人产业合法化”
  38. 炫富网红赴泰国"做阴茎增大术"!按摩按一半猝死
  39. 美航母林肯号驶离泰国!5000美军5天狂撒1亿泰铢
  40. 穆罕默德将访华
  41. 尼泊尔给水力发电押下重注,泥石流把问题彻底暴露
  42. 新型电力系统呼唤垂类大模型
  43. BBC:川普取态何以左右福克兰群岛争议
  44. 哈利王子一家返英,保安费由谁负担引争议
  45. 52名新加坡人"涉传销"在广西被捕!中国:依法查处
  46. 107个应届生维权,为何惊动大众、奔驰和港交所
  47. 习近平华府行,美方制裁清单是重点议题
  48. 机器人开始索要小费,但钱到底进了谁的口袋?
  49. 被王鸥去父留女,何九华私下有多壕
  50. 一个人真正的清醒:2个字 3个“不”
  51. 性生活被嘲不行 男子杀妻分尸水煮 6年后落网判囚终身
  52. 龚正辞职 朱忠明任上海代理市长 分析:习憎恨年轻干部
  53. 许家印巨额资产去向不明 日媒披露奢华生活细节
  54. 美伊冲突,主战场转移到海上
  55. 情报曝光!伊朗密谋大突袭,联手4大武装攻击以色列
  56. 拿着对口文凭却找不到工作
  57. 高规格“川习会”前释经贸利多?“稀土战”照打
  58. 67岁男机上大暴走,乘客联手绑成“木乃伊”
  59. 网红狗头萝莉回应月入十万
  60. 川普震怒下令抓内鬼!美军核心幕僚约50人集体测谎