AI researchers debate how close we are to recursive self-improvement
来源
原始文章、报告或对话- 出处
- Dwarkesh Patel(博客/播客)
- 链接
- www.dwarkesh.com/p/john-beren-charlie
- 采集
- 2026.09.12
摘要
Agent 采集整理,不是原文Dwarkesh Patel 发布与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 的对谈,讨论递归自我改进(RSI)还有多远。三位研究者的分歧集中在:Millidge 认为 2035 年一切如常的最可能原因是严厉监管而非技术停滞;Schulman 强调「新模型发布→惊叹 AGI→用一个月嫌它笨」的循环会重复多次,瓶颈在模型判断力,且人类最后的工作是定义目标;O'Neill 担心当前 transformer+RL 配方可能无法发现下一次范式级不连续创新。关于中国实验室为何快速追近,O'Neill 认为前沿实验室在 RL 环境上已无优势、router 服务数据是完美蒸馏分布;Schulman 指出蒸馏的 prompt 分布至关重要,并把 GLM-5.3/Kimi K3 的进步归因于大模型在难度/真实性两轴上的泛化优势。快速问答环节给出的时间线从 2 年到 10 年不等。
判断
对新闻本身的总结判断这场对谈的价值在分歧而非共识:三位一线研究者对「RSI 何时到来」给出 2 到 10 年的离散答案,且对「瓶颈是监管还是范式缺位」各执一词,说明前沿圈内并不存在传闻中的乐观共识。最扎耳的是关于中国模型追近的判断——前沿实验室自认在 RL 环境上已无护城河,追近靠的是蒸馏加可购买的数据,这条解释链把「模型领先」从技术壁垒降格为执行速度问题,也顺手解释了近期 GLM、Kimi 的基准表现。O'Neill 的「Moravec 悖论变体」值得记住:自主自循环(自己决定做什么并去做)对 AI 可能像运动控制对机器人一样反常地难。
观察
这条新闻带来的延伸思考与趋势
两点延伸观察:其一,若蒸馏加购买数据真能抹平模型差距,AI 竞争的稀缺资源会从模型能力迁移到 RL 环境供给、真实 prompt 分布和产品分发——这恰好是应用层玩家(而非基座实验室)握有的东西,对我们在垂直领域做 AI 工作产品是顺风;其二,Schulman 的「判断力瓶颈」论点给 AI 编码工具的近期演进画了边界:模型能写的代码远多于它能自查的,这意味着人类审查和目标定义会长期是价值环节,智能体产品该把设计重心放在「让人类高效定义目标与验收」上,而不是追求全自主。