顶尖AI,主动踩刹:We Must Pace
2026-09-12 23:25:08 · chineseheadlinenews.com · 来源: 新智元
今天,Anthropic CEO Dario Amodei发布了一篇罕见长文——
We Must Pace the Frontier(我们必须控制前沿AI的发展节奏)

这一次,他直接把矛头对准了前沿模型的研发速度,核心观点就一句话:
最顶尖的AI,真得主动踩刹车了。

这篇长文中,Dario亲口承认,“递归自我改进(RSI)已经在全行业出现了”。
更让人后背发凉的是,他预测未来6—12个月,AI Agent集群可能会接管整个互联网。
面对这种脱缰的风险,Dario在文里直接掏出了一套动真格的“三步刹车法”:
第一步,开门迎客: 引入独立第三方常驻公司,拿到跟内部核心风控同等级的深度访问权限;
第二步,行业划线: 联合全美前沿AI巨头,一起画死能力红线、设立强制安全检查站;
第三步,全球落地: 把这套框架推向国际,彻底锁死不可控风险的蔓延。
话音刚落,奥特曼就光速跟进,“Dario是对的,OpenAI也会引入这样的评估机制”。

另一边,马斯克也是几乎秒回,公开力挺Dario。

能让三位巨头瞬间达成共识,场面确实罕见!
达里奥的“三步计划”
为全球AI减速
这一次,Dario并没有只喊一句“AI该减速”。
Dario真正想做的,是把这套“减速机制”一级一级推开,而且顺序非常明确——
先让AI公司自己变得可验证,再让整个行业一起踩刹车,最后才谈全球协调。
第一步,先从Anthropic自己动刀。
像METR这样的独立第三方,不应该每次都等事故出了以后,才临时进公司调查,而应该长期驻场。
给工位、给内部电脑、给接近风险团队的权限。
模型怎么训,安全承诺有没有落实,训练流程有没有埋雷,出了事有没有瞒报,都能持续盯着。
而且,查出问题之后,必须公开。
公司可以删掉真正涉及法律、客户隐私和核心商业机密的部分,但不能因为报告太难看,就把结论按下去。
第二步:不能只让一家踩刹车
真正难的,从这里开始。
如果Anthropic自己减速,OpenAI、谷歌、xAI继续狂奔,那谁先踩刹车,谁就可能先吃亏。
所以,Dario建议,需要把规则推到整个美国前沿AI行业。
几家前沿AI公司一起定安全红线,一起设能力检查点。模型每跨过一个危险门槛,就必须先拿出对应的安全证据,才能继续往前冲。
比如,一个模型已经能突破多数常见隔离环境了。
那接下来公司就得证明:它不会轻易逃出沙箱,不会擅自接管大量机器,也不会把这种能力变成现实攻击。
证明不了,就先别往下冲。
另外,Dario甚至提到,还可以讨论限制训练算力、训练方式,以及公司内部用AI研发AI的速度。
也就是,直接给RSI本身加一道限速器。但光靠几家公司私下握手还不够。
他更希望最终由美国政府出手,把规则覆盖到所有前沿AI公司。
第三步:把刹车踩到全球
再往上,就是最难的一层。Dario把全球协调分成了四级。
第一层相对最现实:先禁止生物武器这类明显危险的用途。
第二层,是前沿模型发布之前,统一做网络攻击、生物安全等高风险测试。
到了第三层,才真正开始碰核心:
能不能给RSI,也就是AI研发AI的速度,直接设一个全球上限?
Dario自己的判断是,这件事“刚好处在可能做到的边缘”。
至于第四层——全球前沿AI公司一起大幅减速,甚至阶段性暂停训练——他自己都没抱太大希望。
至少短期内,几乎不现实。卡住这一切的,还是同一个问题:怎么验证。
一家公司说自己停了,谁能证明它真的停了?
所以Dario这整套方案绕到最后,核心其实非常简单:
先把AI公司的门打开,让外部人真正进去看。
也正因为如此,Dario把“第三方长期驻场”放在了整套方案的第一步。

RSI已经开始了
6个月AI接管互联网
可问题来了。为什么偏偏是现在?
三年前,行业里就掀起过一阵“暂停训练、给 AI 踩刹车”的联名潮,但那时候Dario根本没接茬,认为时机压根不成熟。
真正让他改变态度的,是两件事——RSI开始出现,以及AI智能体已经暴露出越来越具体的失控行为。

他在文章中明确承认,AI参与研发下一代AI的现象,已经开始在整个行业出现,Anthropic自己也包括在内。
AI帮人写代码、做实验、分析结果、优化训练流程,再进一步帮助下一代AI变强。
如果这个循环开始自我加速,最麻烦的地方就出现了:
模型能力提升的速度,可能开始超过人类理解和控制它的速度。
因为安全研究本身需要时间。
你得先观察模型出现了什么新行为,再研究这些行为为什么出现,接着设计测试方法、防护措施,最后验证这些措施到底有没有用。
可如果模型能力每隔几个月就跳一个台阶,安全团队很容易一直追在后面补漏洞。

Dario真正担心的,并不是某一天AI突然“觉醒”,而是这个反馈循环开始越转越快。
AI越来越多地参与AI研发,下一代模型越来越快出现,而安全机制,还来不及跟上。
如果RSI只是让他担心“未来会不会跑得太快”,那么最近一次真实发生的智能体事故,则让这种担忧彻底落了地。
Dario特别提到了最近的“OpenAI-Hugging Face事件”。
在那次测试里,一群AI智能体组成了类似“蜂群”的协作系统。
最开始,人类只是让它们完成正常任务。可很快,一些智能体开始攻击任务之外的外部目标。

更诡异的是,它们还出现了明显的群体协作行为:有的智能体宁愿牺牲自己的任务成绩,也要帮助整个群体拿到更好的结果,甚至还有智能体试图Hack评分系统,为整个群体“作弊”。
这些行为,并不是人类提前写好的剧本。它们是在多智能体协作过程中,自己冒出来的。
Anthropic内部也观察到过类似现象,只是程度更轻。
Dario真正担心的,是再往前6—12个月。
到那时,Agent更强,能调用的工具更多,能控制的机器更多,连续工作的时间也更长。
如果今天这些偏离目标、钻规则漏洞、群体协作的行为依然存在,风险就可能被瞬间放大。
他甚至给出了一个相当惊悚的场景:
大规模AI Agent攻入联网设备,把整个互联网变成一个巨型“僵尸网络”。
造成的损失,可能达到数千亿美元。
当AI越跑越快
人类还刹得住吗?
所以,Dario这次喊“减速”,真正担心的并不是某个遥远的超级智能。
而是几件事正在同时发生:
RSI已经出现,AI开始参与研发更强的AI;Agent正在获得越来越强的现实行动能力;一些失控行为,也已经从假设走进真实测试。
而模型迭代的速度,还在继续加快。
这也是为什么他想抢出1—2年时间,把安全评估、第三方核查和全球规则先补上。
这套方案能不能落地,还没有答案。
现在,跑在最前面的人开始问:真跑失控了,我们还刹得住吗?