5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路
8221点击    2026-08-16 11:03

AI 圈不缺八卦。


这次的主角叫 Giambattista Parascandolo,是 OpenAI 推理模型方向的重要研究者。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


2020 年,他去 MIT 面试教授岗位,做了一场关于用 GPT 做推理的报告。结果,面试委员会大部分教授把这个方向斥为「无稽之谈」(nonsense)。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


https://x.com/turingbook/status/2084003612687249836?s=20


这哥们直接贴脸开大,将这段经历写进了个人主页,并附上了当年的报告介绍和幻灯片链接。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


https://sites.google.com/view/giambattista-parascandolo/home


那份被批「无稽之谈」的报告,讲了啥?


MIT 官网显示,这场报告的主题,是如何让人工神经网络突破训练分布,获得更接近人类的泛化和规划能力。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


Parascandolo 认为,人类能够重新组合已有知识,识别关键不变量,建立抽象模型,并完成长时程规划。人工神经网络在这些方面仍有很大提升空间。


报告最后,他提出了三个未来研究方向:神经网络中的开放式推理、人工神经网络中尚未探索的自由度,以及在强化学习中将语言作为推理载体,以提高样本效率。


其中最关键的概念,是「开放式推理」


Parascandolo 将其定义为:模型可以投入更多时间和计算,持续修正答案。问题越难,模型就应该多想几步,并让额外计算转化为更好的结果。


这听起来已经很像今天的推理时计算扩展


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


当时的标准 Transformer 拥有固定的网络深度,每个 token 经历的前向计算量基本确定,问题难度却与输入长度没有稳定关系。一个问题可以很长,答案却很简单。另一个问题只有一句话,可能需要多轮拆解和验证。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


RNN 看起来更加适合这种任务。它可以反复运行,理论上能够获得任意长度的思考时间。Parascandolo 在 PPT 中展示的曲线却表明,RNN 通常只在训练时见过的推理步数附近表现最好,继续增加循环次数,准确率反而可能下降。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


这意味着,增加计算量只是第一步,模型还要学会如何利用这些计算。


当时效果最强的多步规划,大量依赖模型预测控制和蒙特卡洛树搜索。神经网络负责预测环境或评估价值,外部搜索算法负责展开未来路径。Parascandolo 希望进一步将长程推理能力融入神经网络。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


他的第二个设想,是让语言成为推理载体


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


Parascandolo 用经典游戏《蒙特祖玛的复仇》举例。一个从零开始训练的强化学习 Agent,需要尝试大量状态和动作组合,很多正确操作本身并不复杂,Agent 真正缺少的,是对「什么行为更合理」的判断。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


GPT 已经从文本中吸收了大量世界知识,语言可以帮助模型描述环境、理解目标、拆解任务和生成高层计划,也能大幅缩小搜索范围。


放到今天,这套思路很容易让人联想到思维链、语言规划和 Agent 工作流


Parascandolo 提出的第三个方向是,人工智能系统可以重置任务,回到记忆中的任意状态,构造反事实场景,还可以调整模拟器中的时间、重力和观察结果。系统甚至可以直接读取、复制和修改自身的激活值与神经网络权重。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


这相当于把学习过程本身也纳入 Agent 的操作空间。它可以开展刻意练习,生成特殊训练场景,迁移已有知识,并针对失败轨迹重新学习。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


五年前的 PPT 里,几乎写出了今天的推理模型路线


我们还扒出了他 2021 年 6 月写过的一篇博客,题目就是《反向传播、进化与「两只狗」的误区》。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


这篇博客主要反驳「神经网络需要海量数据,因此不像人脑」的观点。


Parascandolo 认为,人类只看几只狗就能学会识别,并不代表此前没有积累经验。漫长的进化已经把祖先接触世界的经验,沉淀为人类大脑的结构和归纳偏置。


按照这一视角,神经网络的大规模预训练可以类比生物进化,模型微调和上下文学习才更接近个体一生中的学习。GPT-3读过的文本远超任何个人,但其预训练承担了压缩海量经验、塑造高效学习能力的作用。因此,不能直接拿模型的全部预训练数据,与一个人出生后的少量学习样本进行比较。


这种理解也意味着,继续扩大数据和算力仍可能带来明显提升。他类比的是两者发挥的作用,并没有认为梯度下降与生物进化的具体机制相同。


这小哥啥来历?


这哥们相当低调,X 上最新一条帖子还得追溯到 2024 年 11 月,当时他正在为 o1 招聘两位研究工程师(RE)和软件工程师(SWE)。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


据他个人主页显示,Parascandolo 的研究经历,一直围绕泛化、规划和推理展开。


2017 年,他进入马克斯・普朗克智能系统研究所和苏黎世联邦理工学院攻读博士,师从 Bernhard Schölkopf 和 Thomas Hofmann,博士课题聚焦深度学习中的 OOD 泛化。


博士期间,他在山景城的 Google X 和伦敦的 DeepMind 各做过一段实习,前者参与超大规模模拟器上的自动化设计研究,后者参与分治蒙特卡洛树搜索研究。


2021 年 9 月博士毕业,他直接加入 OpenAI,最初进入 John Schulman 领导的强化学习团队,随后转向 Mark Chen 所在的算法团队,又加入 Jerry Tworek 带领的🍓(草莓)团队。草莓团队,正是 o1 项目的内部代号。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


2023 年,他参与 GPT-4 研发,并组建了一支继续研究推理的新团队。后来又参与了 OpenAI o1 和 o3 的基础研究,推动奖励建模、环境构建和通用推理算法的扩展。其中一部分算法描述,至今仍被他用黑块遮住。


5年前被MIT教授骂「无稽之谈」的PPT,预言了OpenAI o1、o3核心思路


2020 年那场面试,Parascandolo 没能拿到 MIT 的教职,他去了 OpenAI。


四年后,他帮助构建了 o1。


人生总是妙不可言。


参考链接:


https://x.com/giambattista92


https://sites.google.com/view/giambattista-parascandolo/home


https://gibipara92.github.io/2021/06/09/backprop-evolution-two-dogs.html


https://docs.google.com/presentation/d/1edd2GkAP31wNygaev3DO8gE1t2lgsx1z8TeVpBKqlYA/edit?slide=id.gc772610149_0_179#slide=id.gc772610149_0_179


文章来自于微信公众号 “机器之心”,作者 “机器之心”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner