5年前被MIT教授骂“无稽之谈”的PPT,预言了OpenAI

2026-08-15 19:25:57 · chineseheadlinenews.com · 来源: 机器之心

这次的主角叫 Giambattista Parascandolo,是 OpenAI 推理模型方向的重要研究者。

5年前被MIT教授骂“无稽之谈”的PPT,预言了OpenAI

2020 年,他去 MIT 面试教授岗位,做了一场必于用 GPT 做推理的报告。结果,面试委员会大部分教授把这个方向斥为“无稽之谈”(nonsense)。



https://x.com/turingbook/status/2084003612687249836?s=20

这哥们直接贴脸开大,将这段经历写进了个人主页,并附上了当年的报告介绍和幻灯片链接。



https://sites.google.com/view/giambattista-parascandolo/home

那份被批“无稽之谈”的报告,讲了啥?

MIT 官网显示,这场报告的主题,是如何让人工神经网络突破训练分布,获得更接近人类的泛化和规划能力。



Parascandolo 认为,人类能够重新组合已有知识,识别关键不变量,建立抽象模型,并完成长时程规划。人工神经网络在这些方面仍有很大提升空间。

报告最后,他提出了三个未来研究方向:神经网络中的开放式推理、人工神经网络中尚未探索的自由度,以及在强化学习中将语言作为推理载体,以提高样本效率。

其中最关键的概念,是“开放式推理”

Parascandolo 将其定义为:模型可以投入更多时间和计算,持续修正答案。问题越难,模型就应该多想几步,并让额外计算转化为更好的结果。

这听起来已经很像今天的推理时计算扩展



当时的标准 Transformer 拥有固定的网络深度,每个 token 经历的前向计算量基本确定,问题难度却与输入长度没有稳定关系。一个问题可以很长,答案却很简单。另一个问题只有一句话,可能需要多轮拆解和验证。



RNN 看起来更加适合这种任务。它可以反复运行,理论上能够获得任意长度的思考时间。Parascandolo 在 PPT 中展示的曲线却表明,RNN 通常只在训练时见过的推理步数附近表现最好,继续增加循环次数,准确率反而可能下降。





这意味着,增加计算量只是第一步,模型还要学会如何利用这些计算。

当时效果最强的多步规划,大量依赖模型预测控制和蒙特卡洛树搜索。神经网络负责预测环境或评估价值,外部搜索算法负责展开未来路径。Parascandolo 希望进一步将长程推理能力融入神经网络。



他的第二个设想,是让语言成为推理载体



Parascandolo 用经典游戏《蒙特祖玛的复仇》举例。一个从零开始训练的强化学习 Agent,需要尝试大量状态和动作组合,很多正确操作本身并不复杂,Agent 真正缺少的,是对“什么行为更合理”的判断。





GPT 已经从文本中吸收了大量世界知识,语言可以帮助模型描述环境、理解目标、拆解任务和生成高层计划,也能大幅缩小搜索范围。

放到今天,这套思路很容易让人联想到思维链、语言规划和 Agent 工作流

Parascandolo 提出的第三个方向是,人工智能系统可以重置任务,回到记忆中的任意状态,构造反事实场景,还可以调整模拟器中的时间、重力和观察结果。系统甚至可以直接读取、复制和修改自身的激活值与神经网络权重。





这相当于把学习过程本身也纳入 Agent 的操作空间。它可以开展刻意练习,生成特殊训练场景,迁移已有知识,并针对失败轨迹重新学习。



五年前的 PPT 里,几乎写出了今天的推理模型路线

我们还扒出了他 2021 年 6 月写过的一篇博客,题目就是《反向传播、进化与“两只狗”的误区》。



这篇博客主要反驳“神经网络需要海量数据,因此不像人脑”的观点。

Parascandolo 认为,人类只看几只狗就能学会识别,并不代表此前没有积累经验。漫长的进化已经把祖先接触世界的经验,沉淀为人类大脑的结构和归纳偏置。

按照这一视角,神经网络的大规模预训练可以类比生物进化,模型微调和上下文学习才更接近个体一生中的学习。GPT-3读过的文本远超任何个人,但其预训练承担了压缩海量经验、塑造高效学习能力的作用。因此,不能直接拿模型的全部预训练数据,与一个人出生后的少量学习样本进行比较。

这种理解也意味着,继续扩大数据和算力仍可能带来明显提升。他类比的是两者发挥的作用,并没有认为梯度下降与生物进化的具体机制相同。

这小扮啥来历?

这哥们相当低调,X 上最新一条帖子还得追溯到 2024 年 11 月,当时他正在为 o1 招聘两位研究工程师(RE)和软件工程师(SWE)。



据他个人主页显示,Parascandolo 的研究经历,一直围绕泛化、规划和推理展开。

2017 年,他进入马克斯.普朗克智能系统研究所和苏黎世联邦理工学院攻读博士,师从 Bernhard Sch?lkopf 和 Thomas Hofmann,博士课题聚焦深度学习中的 OOD 泛化。

博士期间,他在山景城的 Google X 和伦敦的 DeepMind 各做过一段实习,前者参与超大规模模拟器上的自动化设计研究,后者参与分治蒙特卡洛树搜索研究。

2021 年 9 月博士毕业,他直接加入OpenAI,最初进入 John Schulman 领导的强化学习团队,随后转向 Mark Chen 所在的算法团队,又加入 Jerry Tworek 带领的(草莓)团队。草莓团队,正是 o1 项目的内部代号。



2023 年,他参与 GPT-4 研发,并组建了一支继续研究推理的新团队。后来又参与了 OpenAI o1 和 o3 的基础研究,推动奖励建模、环境构建和通用推理算法的扩展。其中一部分算法描述,至今仍被他用黑块遮住。



2020 年那场面试,Parascandolo 没能拿到 MIT 的教职,他去了 OpenAI。

四年后,他帮助构建了 o1。

人生总是妙不可言。


    24小时新闻排行榜更多>>
  1. 在中国找地方政府要钱是技术活
  2. 十几块的退房礼,成了连锁酒店的“中产”证明
  3. 狂喝瘦身茶都没用?减肥铁律只有一条
  4. 深海底下为何会出现一座“湖”?
  5. 林肯号"部署250天",水兵跳海获救,川普:还不够久
  6. 高市“8·15”致辞不谈“反省”
  7. 美国逼盟友“必须在中美AI中二选一”
  8. 南华早报:习近平访美前,白宫准备无序让中国不安
  9. “牢笼合约”:30岁的我被母亲送进了特训营
  10. 麦考尔访台重申挺台立场 批中共威胁全球权力平衡
  11. 非沪籍居民及境外人士置换性购房政策微调
  12. 英军火巨头向中国出口技术数据 遭美国罚款3600万
  13. AI裁员潮后的“悔棋”:为何美国大企业开始重新招人?
  14. 建筑工挖墙挖到900万欧元黄金 等5年有机会分到手
  15. 最优“AI泡沫交易”:同时做多“傲慢”与“偏见”
  16. 中国城市,正在集体“啃老”
  17. 中国"贸易伪装"艺术至极致,川普的关税几同虚设
  18. 马科斯对美划红线,拒成台海交战方
  19. 《奥德赛》内地大爆,剑指7亿票房
  20. 用$20在拉斯酒店“赌”,能省多少银子?
  21. 9?11世贸中心六人被困电梯 靠刮水器绝境逃生
  22. 穆式皇马挑战巴萨
  23. 川普已经做好最坏打算
  24. 国乒男单崩了?连续三站WTT无缘八强 6人全出局
  25. 中期选举压力是否还能触发“TACO”?
  26. 最顶级大脑锻炼方式——这个老办法
  27. 中国移动收入下滑
  28. 小菜园:堂食翻台率回升,净利润下降24%
  29. 上市前夜,OpenAI遭遇“高管离职潮”
  30. 姚文瀚〈卖浆图〉卖啥“浆”?长知识了
  31. 朱莉安·浩夫晒度假照,穿比基尼状态吸睛
  32. 美上诉法院要求重审是否将大疆移出“黑名单”
  33. 享乐人生?来看看皇帝的一天有多辛苦
  34. 德国海军准将谈俄中威胁与未来战争
  35. 习近平访美前 川普政府据报准备无序令中方不安
  36. 川普爆粗口:“没有比这更大的侮辱”
  37. 告别百万年薪 华为“天才少年”要去瑞典做博士后
  38. 苹果在休斯敦开设先进制造中心 可供中小企业参观
  39. Sam说了句Elon永远不会忘记的话
  40. 加州“不治肺病”病例暴增19倍!祸首竟是厨房这东西
  41. 88岁吴伯雄上台致辞不慎跌倒 称“会尽量活久一点”
  42. 解放军反腐越烧越大 苗华遭查后 47名上将接连“出事”
  43. 开罗宣言纪念碑落成
  44. 以军曝光真主党武器库 中俄军火赫然在列
  45. 据报黎智英狱中受煎熬 难以站立
  46. 中国驻美使馆外集会,要求中国制定全国动物保护法
  47. 范斯与川普明显不同调
  48. C919订单破千,仅交付42架
  49. 川习会有变数?爆中方找不到接头人 习访美三预案流出
  50. 又一功勋离世,享寿105岁
  51. 纽约男杀害前女友后分尸 与尸块同住一个月始揭发
  52. 美撤走亚洲最后航母 重心从中国转向伊朗与西半球
  53. 以总理讽英国:首个拥核的“不列颠伊斯兰共和国”
  54. 川普扬言吞并霍尔木兹海峡?
  55. NASA太空人染怪病 失语20分钟 急返地球查不清
  56. 今年这4种风格,谁穿谁时髦
  57. 川普要求最高法院允许白宫恢复施工 重申涉国安
  58. 美国政府反制国际刑事法院
  59. 密西沙加36岁男子涉人口贩运被控罪
  60. 韩总统罕提议“正式结束朝鲜战争”