全球竞逐RSI,这支华人团队已跑通规模化闭环
全球竞逐RSI,这支华人团队已跑通规模化闭环10 月 6 日,OpenAI 公开了 AI 产出的 722 篇数学论文,包括准黎曼猜想的相关证明。前 Google 科学家、xAI 联合创始人 Christian Szegedy 表示,数学家穷尽一生攀登的险峰,机器可乘飞机直接抵达。但 Szegedy 认为,数学不是走向终结,而是探索方式的改变 —— 人们可以借助飞机,抵达更多未境之地,他自己对此兴奋不已。
搜索
10 月 6 日,OpenAI 公开了 AI 产出的 722 篇数学论文,包括准黎曼猜想的相关证明。前 Google 科学家、xAI 联合创始人 Christian Szegedy 表示,数学家穷尽一生攀登的险峰,机器可乘飞机直接抵达。但 Szegedy 认为,数学不是走向终结,而是探索方式的改变 —— 人们可以借助飞机,抵达更多未境之地,他自己对此兴奋不已。
Hinton等22位作者在首篇RSI论文中指出,AI全面参与下一代AI研发可能形成递归自我改进并引发智能爆炸,但现阶段证据不足以证明智能爆炸已经发生。
Google等提出RRSI,通过正则化Agent Harness自我改进中的Proposal与Selection,减少过拟合与复杂度累积,并提升未见基准上的迁移表现、降低Token成本。
给定一个基座模型、一个目标能力和算力预算,RSI Agent 自己设计后训练算法、收集和整理数据、写代码、跑实验、迭代改进,最终交出一个训练好的模型,全程无人介入。在自主后训练基准 PostTrain
AI 确实在帮 AI 变强,但收益正逐轮递减。当前 AI 自我改进回路的实际强度,仅为触发“智能爆炸”所需理论阈值的 10% 到 20%;若要实现自我维持式的加速进化,这条回路必须再增强 5 到 10 倍。而在巨额过程损耗面前,眼下的系统连维持匀速进步都已十分吃力。
RSI(Recursive Self-Improvement,递归自我改进)最近成为了行业内关注的新热点。 简单说来,模型参与训练和提升模型自己,在业界已经开始成为一种惯例。Anthropic 在六月
三星与上海交通大学提出RoboICL具身上下文学习方法,通过冻结GPT-6 Astra模型并在推理时提供少量示范与机器人自身交互记忆,在RoboDojo 30项机器人操控评测中以50.64分全面领先PhysicalRSI等现有方法,并公开了929条可逐布局核查的执行记录及真实机械臂实验结果。
谷歌正式发布前沿AI模型Gemini 4 Argon,其在Text Arena排名第一、Vals RSI指数超越GPT-6 Astra达30%,单任务成本仅1.99美元,单次输出上限升至100万Token,并在谷歌内部以Rust安全语言重写了80万行系统内核代码。
诺因(Knowin)发布生成式学习框架GLOW,在RoboDojo、LIBERO-Pro、Embodied Arena三大具身智能榜单斩获第一,性能显著超越GPT-6,其原生自回归架构、Harness闭环反馈系统与RSI递归自我改进机制共同推动机器人实现"一教就会"的个性化家庭服务能力。
DeepSeek联合清华大学发布论文公开Agent训练沙盒基础设施DSec,梁文锋署名,论文第6节揭示DeepSeek已部分实现RSI(递归自我改进)闭环,Agent可在沙盒中自主构建训练环境,标志着Agent沙盒成为下一代云基础设施的新战场。