#AI #递归自我改进 #强化学习 #AI研究自动化 #Dwarkesh-Podcast
“我们离上限还远得很。”
[

](https://substack.com/@dwarkesh)
2026 年 9 月 12 日
135
29
14
分享
文字稿
新一期节目邀请了 John Schulman、Beren Millidge 和 Charlie O’Neill。
我约了几位我认识的、最有洞察力的 AI 研究者,他们都在相对开放一些的公司里,因为我想听听前沿到底正在发生什么,以及接下来会发生什么。
在 YouTube 上观看;在 Apple Podcasts 或 Spotify 上收听。
(00:00:00):为反对 RSI 的观点做最强辩护
(00:18:39):中国实验室进展背后的驱动力
(00:28:06):自动化 AI 研究者将如何被训练
(00:33:51):长周期 RL 会诱发 AGI 吗?
(00:45:24):仿真到现实的差距
(01:00:33):有多少进展可以由数据解释?
(01:18:03):为什么 RL 效果这么好?
(01:24:54):第 37 手与熵坍缩
(01:28:32):快速问答:时间线
Dwarkesh Patel
今天,我要和三位 AI 研究者朋友聊天。每次和他们聊,我都能学到很多东西。他们也刚好都在某种比较开放的实验室和公司里,所以你们确实可以公开说一些话。今天加入我的有 Beren Millidge,他是 Zyphra 的 CTO,Zyphra 正在开发开源模型。John Schulman 是 Thinking Machines 的首席科学家,此前是 OpenAI 的联合创始人,并且领导了促成 ChatGPT 的 RLHF 工作。还有 Charlie O’Neill,他是 Baseten 的模型训练负责人。
我的第一个问题是:如果到了 2036 年,我们并没有看到数十亿个疯狂的超级智能到处运行、彻底改变世界,最可能是什么原因导致这种情况没有发生?除了外生的政治冲击,比如爆发战争,或者他们禁止 AI 之类的情况之外。最可能的技术原因是什么,导致 2036 年并没有变成一个疯狂的外星超级智能世界?
Beren Millidge
这里有一个经典现象,有点像 Moravec 悖论。我们会这样想 AI:“如果它能做到这件事,那就太惊人了。”如果它能解出这些困难的数学题,如果它能下赢国际象棋,等等等等。然后它真的解决了这些问题,但影响并没有那么大。当然,它确实有一些影响,但不是全部。
如果这种情况以某种方式延续下去,而且始终没有出现真正的泛化火花,我认为这可能会导致 AI 只是极其擅长人们放进 benchmark 或环境里的所有事情。但仍然存在某种持续的仿真到现实差距,以某种方式阻碍了一切。我觉得这种情况不太可能。实际上,即使在实践中的 RL 里,我们已经确实看到了这种泛化。但如果泛化元学习就是离谱地困难,再加上我们没有解决持续学习,而且它就是超级困难、根本不可能,那么在这种情况下,这会是我的默认场景。
John Schulman
我同意这一点。现在人类相对于模型仍然有很多优势。每当一个新模型出来,它都会在其中一些领域追上来。但你最终还是会被模型较弱、判断力较差的地方卡住,或者被模型还不能足够好地自我检查这件事卡住。
有一个循环一直在重复:一个新模型出来,人们被震住了,然后说:“就是它了。这就是 AGI。”但他们用了一阵之后,大概一个月左右,它就开始显得有点笨。这个循环可能会一直持续下去。很难预测它会重复多少次。
现在,能力上没有出现爆炸式增长,是因为当你试图做研究和工程时,仍然会被足够多的瓶颈卡住。即使模型能写出比人多得多的代码,它也不会让你的生产力提高 100 倍。所以也许这种循环只是比我们预期的还要多。
Charlie O’Neill
对我来说,问题在于“一个你可以放在芯片上的学习者”的全局最优,和 Transformer 加 RL,也就是当前配方之间,到底差了多远。人们会想象,一旦你拥有一个在 AI 研究上强于所有人类的 agent,哪怕它只比所有人类强 0.1%,那么你可以并行运行几十万个,甚至几百万个这样的 agent,而且随着芯片速度提升,你还可以让它们运行得快得多,这一点就会压过其他所有瓶颈。最终,你会达到这种非常快速起飞的状态,至少就自我改进而言。
我可以想象,如果我们继续沿着当前这个范式前进,也就是基本上依靠自注意力、RL、扩大 RL 环境等等。想想摩尔定律发生了什么。我们曾经有一条非常漂亮的直线,而且这条线维持了非常非常长的时间。但为了让那条缩放定律继续成立,中间必须发生非常多离散的不连续点和创新。LLM 也发生了同样的事情。我们曾经有这个预训练缩放定律,然后它开始遭遇收益递减。接着我们想出了 RL,并解决了这个问题,然后我们又碰到了一条新的收益递减曲线,而这让它继续看起来像一条向上的直线。
所以,如果还需要另一种这样的不连续点才能解决问题,我不确定当前这种用 RL 环境训练 LLM 的方法,哪怕是面向 RSI 的 RL 环境,是否能够发现那个不连续点。如果不能,我们很可能会撞上这条渐近曲线。
Dwarkesh Patel
但你认为那个不连续点会比 2012 年以来出现过的任何东西都更难吗?
Charlie O’Neill
如果我们知道这个问题的答案,那我们差不多也就有能力把它实现出来了。但也许我们应该区分两种不连续点:一种是在当前范式上继续叠加,是累积性的,也就是在 RL 之外还有某个东西需要我们发现,而也许它们有能力把那条直线上的点连接起来。另一种则是,再次回到那个问题:我们离全局最优到底有多远?我们是否必须回过头,把梯度下降和一般意义上的神经网络都丢掉?我不认为,如果你继续扩展当前范式,一个 LLM,不管你运行多少个 LLM,在那个东西离得太远的情况下,就一定有能力发现它。
Dwarkesh Patel
真正唯一的希望是,深度学习就是无法把我们带到这样一种 AI:它至少能够主导人类研究和人类开发,包括人类提出新范式等等的能力。或者,我也不知道,也许人类本来也永远发现不了下一个学习架构。但只要人类最终有可能发现它,这件事就显得……如果你只是看从 2012 年到现在已经发生的进展,然后把这条线继续延伸下去,我知道它背后只是由巨量算力扩展等等推动的,但如果它就是到不了至少能在人类 R&D 上占据主导的位置,尤其是在接下来几年里,那会很奇怪。
Ryan Greenblatt 最近上过这个播客。他提出了一个观点,我很好奇你们怎么看。你可以想象,随着 AI 越来越强,它们能够在一些仿真上取得进展,而这些仿真会激励它们不仅在 AI R&D 上变得更强,也在一般科学上变得更强。这是所有实验室都在瞄准的东西,很多创业公司也在瞄准。
另一个帮助直觉的例子是,如果你看 80 年代以来 Elo 分数在国际象棋 bot上的变化。随着时间推移,Elo 有一个非常线性的增长。但当它们跨过人类区间时,会出现一个巨大的不连续性:从人类专家总是能赢 AI,到人类专家再也赢不了 AI,而这一切发生在 Elo 线性增长的过程中。
我同意你的观点,到目前为止,就 AI 能力对现实世界最终经济影响而言,它们还没有那么了不得。但那是因为相对于人类而言,它们的 Elo 正在缓慢上升。
Beren Millidge
我同意,那会非常令人意外。要让这件事不发生,唯一的方式就是像你说的,它以某种方式刚好在到达之前进入渐近状态。因为在我看来,我们已经相当接近开始跨过人类 Elo 分数的位置了。所以我们必须在那之前进入渐近状态。我认为,在你提出的这个场景里,也就是我们不知怎么到了 2035 年还坐在这里,一切都很正常,这就是它发生的唯一方式。唯一另一个方式是对 AI 出现某种剧烈监管。实际上,我认为这才是这个场景最可能发生的原因,而不是某个技术因素。
Charlie O’Neill
我认为研究有不同类型。有一种是 autoresearch 风格的研究,目标已经被非常清楚地指定好了,你只是在优化那个目标。我觉得每个人想象的是,如果我们继续沿着这条路走,让预训练 loss 下降,让环境里的 reward 上升,那就会带来改进。
但也许 Ryan 说的是一种更开放式的科学,这是范式转变所需要的。在那里,我们无法指定目标,而 AI 显然也不能指定那个目标。对于这些事情中的任何一个,我们都必须非常非常小心地指定目标。
Dwarkesh Patel
也许你的观点是,2012 年以来发生的那些突破,其性质在于我们发现了……在 2012 年,人们并不是在说……我猜是这样,我也不知道,你们当时在场。或者至少 John,你当时在场。但我不在。
Charlie O’Neill
我那时还在上小学。
Dwarkesh Patel
其实,John,我很好奇你来自岁月沉淀的智慧,或者说来自当年一线战壕里的智慧。大概一个重大突破是意识到下一个 token 预测就是那个……你不会在 2014 年就觉得 nanoGPT 速通是应该优化的东西。但现在我们已经走到了这个新范式,你确实会想到在这上面做速通,并让 AI 在这件事上变得非常强。
但也许还有下一个要优化的内循环,是 AI 不会预料到的。外层循环可能是收入之类的东西,最终应该会很强,但那是一个非常缓慢的外层循环。
John Schulman
事实上,我记得在 OpenAI 早期,我有一种直觉,认为仅仅最小化对数损失不会让你获得智能。因为重要的部分在损失中占比太小,会被噪声淹没。所以,只靠下一个词元预测来训练语言模型,并不会学到你希望它学到的那些有趣东西。我们需要设计更好的目标,让重要的东西得到更多强调。
你可以为这个观点提出各种各样的论证。你可以说:“哦,人类大概也不会学习如何给环境中的一切建模。大多数人没法把自己看过的某个场景逼真地复现出来。所以我们一定需要一个更好的目标。”但后来结果证明,它就这么奏效了。
Dwarkesh Patel
就像你刚才指出的,即使在当前的 AI 研究里,后训练基准之类的内循环,也不一定能转化成用户喜欢的东西。
John Schulman
哦,是的。整个领域在很大程度上依赖泛化,而你很难预测什么时候会得到泛化,或者什么时候会得到某种分布外泛化。我们知道,如果你在你关心的任务上训练,效果会更好。但最重要的进展,往往是那些我们本来没有理由期待会出现的泛化类型。
比如说,只是在这个非常朴素的下一个词元预测目标上做预训练,却能泛化到各种需要以某种深层方式理解输入的目标任务上,或者从预训练中学到某种非常罕见、在数据里并不大量出现的技能。还有从这些可验证任务泛化到不那么可验证的任务,这同样是一种事先没有理由期待的泛化。
Dwarkesh Patel
这是个有意思的问题,因为有一种直觉泵可以解释为什么你会看到某种非常快速的奇点式变化:甚至不需要扩大那些不只是 AI 劳动力的、推动 AI 进展的投入,而是在你运行每一个七位数成本的实验之前,先把等量的算力花在 AI 劳动力上。也就是说,你会有自动化版本的你们,花上一个世纪思考最优实验应该是什么,做小规模消融实验,发展出整整一个世纪量级的理论,甚至回溯到深度学习之前。
在你决定运行什么实验之前,你会以极其优化的方式来设置这个实验。然后在实验结束之后,你又花一个世纪来思考,分析发生了什么,以及下一个应该运行的实验是什么。
John Schulman
如果你想得足够深,你大概本来就能事先预料到其中一些事情。可能存在某种非常巧妙的小规模实验,能让你建立起一种理论,然后这种理论会泛化到大规模实验。所以我会认为,我们离“研究能做得多好”的上限还差得很远。
我可以想象一个未来,AI 会做大量分析和理论建构,花费与你在实验本身上投入的算力相当的计算量,进行各种分析,并围绕我们迄今看到的东西建立理论。
Charlie O’Neill
我觉得当目标被明确定义时,这里确实有非常具体的例子。思考所能做的一切,就是根据你形成先验之后得到的那些比特来更新你的后验。你不能只靠思考获得任何新的比特。但当目标被明确定义,而且已经有这些数据摆在那里时,我可以想象,在我们当前所处的范式里会出现很大的加速。
一个很好的例子是,如果你让一个 AI 去思考 Kaplan 缩放定律。这个阶段的 AI 会注意到:“哦,他们只是取了这些中间检查点,却没有考虑退火,所以这是错的。”这本来会早几年就被发现。仅仅凭借 AI 的这个观察,我们就能少走一两年的弯路。
再说一次,一旦目标被明确定义,比如降低预训练损失之类,就会有非常非常多很好的例子表明,如果你只是多想一点,就能大幅减少你已经做过的事情。所以 muP,以及学习率 如何随模型规模缩放,还有意识到模型宽度在其中也很重要。我感觉你确实可以反推出很多这类东西,砍掉很多唾手可得的机会。如果我们的目标只是“最大化我们当前正在优化的目标”,我会想象有 10 倍的加速。
但我完全看不出这如何泛化到一开始就提出正确目标。光靠思考,不一定能让你一开始就得到正确目标。
Beren Millidge
我认为,对当前 AI 产生任何非常快速的 RSI 来说,这确实是关键问题。AI 在学习自身目标方面能够泛化到什么程度?要形成任何一种自我推进的自动化循环,我们需要 AI 提出目标、优化目标、弄清楚问题、再提出新目标,并且让这一切在很长很长的时间里任何时候都不偏离轨道。
回到 Moravec’s paradox,这里可能会出现一种 Moravec’s paradox:我们觉得这种自主性和自我封装,也就是我们能够自己思考该做什么,然后去做,并维持这个循环,是超级容易的,因为我们一直都在做这件事。显然,进化需要创造出能够独自存活很长时间的生物。而这可能只是某种出于某些原因对 AI 来说真的很难的事情,就像运动能力之类的东西真的很难,但数学超级容易,尽管对我们来说数学超级难。
Dwarkesh Patel
但时间跨度正在变长这件事,不是在暗示那就是……
Beren Millidge
对,没错。这是另一种可能性,不过我同意,目前没有明显证据支持这一点。事实上,我们的智能体现在已经非常持久,而且做到这一点相当容易,这在某种程度上反而是反对这个说法的证据。但如果这件事很难,那么它可能会是我们没有立刻出现起飞的原因之一。
Dwarkesh Patel
如果你回头看,从 2012 年到现在,或者也许从你开始做研究到现在,在这段时间发生的所有创新中,包括纯工程上的创新,也包括纯概念上的创新,哪一部分看起来会是在人类必须完成、然后 AI 才能完全自动化 AI R&D 之前的最后一件事?
Beren Millidge
可能就是不断迭代地提出正确问题。如果你能让 AI 做任何实验,你仍然需要决定该做哪些实验。现在我觉得,和给实验写代码相比,AI 在这方面还不是很擅长。每当我们谈研究时,它们会提出一堆杂七杂八的东西,都是非常非常小的步骤。
Charlie O’Neill
或者甚至是从 DeepMind 那种“我们要通过学习以超人水平玩游戏来解决智能”的路线,转到像 Radford 这样某个研究者说:“我要试着只去预测非常广泛数据里的下一个词元”……即使 Radford 发现了这一点,人们也过了一段时间才决定把它扩大规模,因为我们还必须提出缩放定律这个想法,并认识到你可以非常可靠地预测这些事情。
John Schulman
我会说,人类最后的工作,或者会持续最久的人类角色,是定义目标,并决定我们真正想要什么。从这个角度看,像决定 AI 助手应该如何表现,或者“有帮助”意味着什么,或者当我们做人类反馈 RL 时目标是什么,这就是其中一类事情。再往后,定义宪法和模型规范是另一类事情。即使 AI 能完成所有技术工作,我们仍然必须做大量这类事情,并决定我们真正想要什么。
Dwarkesh Patel
对齐是最后的工作。
John Schulman
对齐某种程度上就是答案。但对齐本身可以被分解为对目标的规格说明,或者弄清正确目标应该是什么,然后才是实际达成或优化你已经定义的目标。我认为前者短期内不会消失。
如果我想想一个后训练团队,以及为什么团队里需要很多人,原因其实只是有很多不同领域都需要你弄清模型应该如何表现。要把整件事自动化会非常困难,因为总得有人思考模型在这个领域里应该如何表现。
Dwarkesh Patel
为什么模型提供商没有出现大规模整合,这背后的故事是什么?这里有太多因素都指向中心化。如果你从几年的尺度往后看,有什么东西会阻止这种情况吗?
John Schulman
我认为蒸馏是对抗中心化力量的主要因素。基本上,任何能通过 RL 学到的东西,都可以很容易地被蒸馏,因为它只包含少量比特。它是可以从少量数据中学到的东西。如果你能从模型那里获得展示某种行为的轨迹,就可以轻松蒸馏它。我认为蒸馏是对抗中心化的因素之一。
还有一种可能性是,会出现公司专属模型,也就是说可以从部署中学习,让一家公司持续改进自己的模型。这样的系统可能由当前模型提供商寡头中的某一家提供,也可能由某个目前规模更小的公司提供。但我认为这会稍微改变游戏规则。
Beren Millidge
我还想指出,老实说,持续学习并不会阻止蒸馏。即使你的模型每天都在改进,人们也可以每天蒸馏它。这些循环完全可以以同样的速度运转。
Dwarkesh Patel
这说得通。所以复制模型行为……我猜,为了得到相关的模型行为,你自己需要知道该用什么正确的分布来提示模型?
John Schulman
哦,是的。只说用监督学习来做蒸馏的话,提示分布极其重要。蒸馏一个模型非常不简单,即使你拥有对它的完整访问权限,有思维链以及所有东西,也并不简单。要把它所有有用能力都蒸馏出来并不简单,因为你必须用某些东西去提示这个模型。你需要用真实的提示。你需要拥有一个非常宽的真实提示分布。
最近出现的一件事是,一些中国公司可能正在使用这些路由服务,它们的设计目的,是让中国境内的人能够使用美国前沿模型,而这些模型否则会在中国被封锁。有各种这样的路由或代理服务,让中国境内的人能够使用这些模型,主要用于编程。而这些路由服务正在收集并出售其中一些数据。对蒸馏来说,这是一个非常有用的数据集,因为它给了你完美的提示分布。
Beren Millidge
我认为这就是 AI 能帮上大忙的事情之一。如果你真的去看前沿流程,或者中国模型在论文里实际写出来的流程,它们会从某个地方拿到种子提示词,也就是人类和这类数据的某种组合。然后它们用自己现有的模型或其他前沿模型,从这些种子提示词合成出覆盖面极广的数据。提示词分布的收集和环境创建中,有非常多东西是可以自动化的。随着模型变得更好,人类需要提供的信息位会越来越少。
Dwarkesh Patel
但看起来你仍然会受限于是否有一个用户实际在使用的服务。
Beren Millidge
不一定。那显然非常有帮助,但从理论上讲,你完全可以直接思考用户想要什么。
Dwarkesh Patel
但重点就在于,用户会说:“给我做一个这样的应用。哦,那个不行。我其实想让你做这个新功能。不过,还是退一步,我们做另一件事吧。”捕捉这一整条轨迹才是关键。或者说,如果你本来就能做到这一点,那你就已经有 RSI 了。
Beren Millidge
最终,如果你有这个完全自动化的循环,那基本上就是 RSI。AI 在决定数据,它在决定训练。这就是那个循环。但这取决于你需要多少人类信息。到某个时候,如果你只是说:“我想要看起来像这样的轨迹”,你把它作为提示词给模型,模型就能给出一个相当好的近似。
Dwarkesh Patel
但如果你想做的是“给我造一个非常优秀的政治家”,然后它必须从零预判参议院大厅里的讨论会如何展开之类的事情呢?我只是觉得会有很多事情会是……
Beren Millidge
讽刺的是,对蒸馏方来说,这其实比对前沿实验室更容易。蒸馏方只要说:“我想要一个优秀的政治家。”他们去找前沿模型。前沿模型已经知道怎样做一个优秀的政治家,所以它直接生成那些轨迹。相反,如果你真的想构建第一个能做到这件事的模型,你必须以某种方式拿到政治家每天都在做什么的数据,然后把它做出来。实际上,说“我想要类似这样的东西”,然后让 AI 生成十亿种变体,要比一开始就真的创造出这样的东西容易得多。
Charlie O’Neill
我觉得基于这个观察,其实可以做出一个非常具体的预测:中国实验室有这些路由器数据。最初引出这件事的是,我当时在说:“Sonnet 5 和 Opus 5 几乎客观上比 GLM-5.3 和 Kimi K3 更差,这难道不奇怪吗?尽管它们不仅能做蒸馏,还能做 logit 蒸馏,蒸馏自 Mythos?”反驳意见是,提示词分布真的非常非常重要。你需要看到用户在做什么,这样才能把这些行为和能力蒸馏进去。
我认为由此得到的预测是,前沿实验室现在在 RL 环境上未必有什么优势,甚至可能完全没有。没错,用户分布对一般行为等方面很重要,但衡量一种能力的最佳方式,是你在前沿构建出来的那些非常非常困难的 RL 环境。如果你作为 Anthropic 能接触到那些 RL 环境,也能接触到 logit 蒸馏,但你做出来的模型仍然更差,那么也许……
Dwarkesh Patel
那就是现实世界部署比环境更重要。这真的很有意思。
但他们一开始必须在 Fable,或者说前沿模型里,激励出那些能力。所以奇怪的是,他们为什么不能用一个更小的模型之类的东西再次激励出这些能力。
Charlie O’Neill
也许我们只是处在这个奇怪的恐怖谷里:试图过度复制那个前沿模型时,学生与教师之间的差距,不管具体是什么,就是太大了。有人用 Opus 提过这一点。Opus 4.6 和 Opus 5 的区别在于,Opus 5 真的让人感觉里面有一个 AI-as-a-judge,在检查它所做的每一件可能的事情。这就是为什么它会用那么多 token。它试图思考所有这些事情,但它未必有 Fable 的那种大模型味道,知道什么时候该停,或者什么时候该沿着一条好路径走下去。
Dwarkesh Patel
能想到的超出了能做到的。
John Schulman
我会提出一个稍微不同的假设。我会说,你能创建的环境有几个不同的轴。其中一个是难度,另一个是真实性。
创建大量困难环境相对容易,这些环境涉及完成复杂得多的任务,或者完成某些需要高得多巧思的事情。你可以说这是 benchmaxxing 分布,因为很多最突出的基准测试只是要求做一些非常困难、类似谜题、且容易验证的任务。然后还有真实性这个轴,在这个轴上,你希望模型在现实的 coding agent 场景中表现出色,那里有多轮与人类的来回互动,也有多个目标。
那些第一次塑造模型行为的实验室,需要在两个方向上推进。为了获得好的模型行为,你需要真正推动真实性这个轴,并且要有评分标准,或者某种人类反馈,来告知你在那里使用的奖励函数。但如果你天真地尝试做蒸馏,最后就只是在 benchmaxxing 分布上匹配教师模型。如果你没有足够多真正能在这些更棘手的现实场景中锻炼能力的环境,那你就无法把这些能力放进你的学生模型里。
我觉得也许正在发生的一件事是,大模型能更好地从那些棘手的狭窄任务泛化到这些更现实的任务。如果你有一个非常好的现实提示词分布用于蒸馏,你就能很好地匹配大模型。但如果你只有这种容易验证任务的分布,那么你可以在所有基准上匹配大模型,但在这个更广泛的分布上表现更差。
这甚至可能解释 Anthropic 一些较小模型的情况,比如 Sonnet 5,虽然很难准确预测他们到底是怎么对这些模型做后训练的。也可能是他们一直在改变自己的后训练栈,而在这些模型中的某几个地方就是搞错了。我不知道……他们把某个东西调得太高,制造出了一些人们真的不喜欢的怪癖。后训练非常容易在某种方式上搞砸,而这种问题不会体现在基准测试里。
Beren Millidge
还有一个非常基本的点是,前沿 AI 实验室会从大型数据公司购买所有数据。中国人也完全可以从数据公司购买同样的数据。
Dwarkesh Patel
而且他们确实在买,对吧?
Beren Millidge
他们确实在买。没错。有很多人对此很恼火,但如果他们拥有完全相同的数据,并且可以买到这些数据,他们也可以做蒸馏。这意味着要跟上其实相当容易。
Dwarkesh Patel
我还有另一个问题,就是第一批能够自动化 AI 研发的模型实际上会怎样被训练出来。有一个玩具版本,也就是 Ryan 当时谈到的东西。你让 GPT-8 尝试构建 GPT-3 规模的模型,这些模型非常擅长内循环类型的挑战:打赢需要持续学习的视频游戏,或者用最少的算力达到某个损失值,等等。
但 John,我觉得你有一个很有意思的观点:也许在实践中事情并不会真的那样发生。所以我很好奇,到你拥有真正能够自动化 AI 研发的 AI 时,它们大概率是怎么被训练出来的?
John Schulman
我们大概会把几种东西结合起来:一方面通过从人类反馈中学习来吸收研究员的品味,另一方面创建大量练习环境,其中涉及完成多步骤研究项目。实际中,人们会把这两类方法组合起来,并且每一轮都修补上一轮里看起来最坏的问题。研究员会大量使用 AI,并注意到它们有一些持续存在的弱点。这些东西要么会通过收集人类反馈来修补,要么会通过创建环境来修补。
Charlie O’Neill
也许一个有用的思考方式是,我们把谱系回滚多远,然后从那里开始让它自我博弈。在极限情况下,你想象的是只给它们一块 GPU,也许再给神经网络之类的东西,然后说:“好,想办法训练出一个模型来完成这些特定任务。”目前的做法是,我们一直走到谱系的最前沿,然后说:“好,这是 Anthropic 在过去几个月里在训练栈中发现的 bug。我们会把这些变成环境。”你需要在前沿上训练并变得更好。所以你显然会锁定谱系之前的全部历史。
但你可以想象一个世界,在那里你回滚到 GRPO 之前之类的地方。然后你有一些环境,试图让它发现对模型做 RL 的最佳形式,接着也许你会越滚越远……但我觉得我们仍然会受到算力的强烈限制,所以人们会继续停留在前沿,本质上对比上一个模型版本以来他们发现的 bug 和各种改进,把这些东西变成训练环境。
Dwarkesh Patel
这也非常有利于在模型世代之间拥有不过时的新数据。再说一遍,这基本上就是 AI 实验室内部的持续学习,把过去三个月的 AI 研究进展通过环境和 RLHF 类的东西蒸馏回模型本身。
Charlie O’Neill
而且这确实是蒸馏。也许这就是为什么我们中有些人觉得它是渐近的。你总是在试图拿到过去三个月的进展。当然,这些进展有 AI 的贡献,但也仍然有人类在环。感觉就像你只是在不断一点点接近人类研究员正在发现、并且有能力做到的东西。
Beren Millidge
不过,我要说的一点是,显然,如果你只是对轨迹做蒸馏,你永远不可能超过它。但环境可以远远超过人类所能做到的东西。设计一个没有人类能解决、但 AI 显然仍然可以尝试解决的环境,是非常容易的。那会是一条走到仅仅复现人类 AI 研究之外的路径。
Charlie O’Neill
从 RSI 的角度看,你有没有一个例子,说明那会是什么样的训练集?
Dwarkesh Patel
Nanochat 速通,但要比人类速通玩家做得更快。
Beren Millidge
我觉得尤其在 AI 研究里,定义目标非常容易。你可以说损失需要达到 1.3 之类的,现在没有人类能做到。但那是一个极其可衡量、可验证的任务。如果 AI 做到了,那就很好。
Dwarkesh Patel
或者我也不知道,构建一个能打赢 Minecraft 的 1 亿参数模型。这也许太简单了,但可以是打赢一个复杂得多的游戏之类的东西。
Charlie O’Neill
1 亿参数模型打赢 Minecraft 这件事难道不疯狂吗?我们居然说这太简单了?想象一下,如果你五年前这么说会怎样。
John Schulman
不过我会说,很多研究并不完全是那样,也就是说,不是在一个定义清楚的目标上做爬山法。它更像是:我们对模型应该以某种方式变得更好有一个直觉。我们也有一个算法想法,看起来能稍微朝这个方向推进一点。所以我们设计一个任务,专门用来看看这种方法有没有生命迹象,然后观察是否真的出现这些迹象。如果有,我们就可以做出一版又一版更接近现实的任务。
Dwarkesh Patel
它更多是由直觉引导的。内层循环是在检验那个直觉,而不是测试本身引出洞见。
John Schulman
对。你不是在直接优化你最终关心的目标,或者实际生产中的目标。你是在稍微放松你的目标。你是在说:“我们先在真实性这个轴上稍微放松一点,找到一些确实有效的方法,然后等方法稍微成熟之后,再尝试回到真实性上。”
还有一些研究更偏向于解释事物和发展理论。在机器学习里,我们通常没有那么有预测力的数学理论。但我们有很多更非正式的理论,用来解释正在发生什么。
Beren Millidge
可以推测,模型会在这些任务的某种组合上训练。有些任务会非常容易验证,有些会是 LLM-as-a-judge,或者只是问人类:“这看起来合理吗?”希望这些能力都能泛化到那些困难得多、更含糊、更模糊的任务上。在某种程度上,它大概会泛化。至于它能不能泛化到足以让这个循环在完全没有人类参与的情况下自我闭合,目前还不清楚。
Dwarkesh Patel
也许我们可以退一步看。在我看来,未来 AI 研究的计划大概是这样。你告诉我你觉得它会不会奏效,或者你是否同意这种描述。这个赌注是,我们会在数百万个多样化环境中、跨数百种不同领域扩展 RLVR 训练。最终出现的会是一个 agent,它学会了这些基本技能,或者说还算不上基本的技能,比如坚持不懈、能够分拣信息和上下文,最终能够对与其他 agent 协作之类的事情做端到端优化。
这样的 agent 在上下文内会有很高的样本效率,你研究过如何扩展上下文学习,让它可以任意变长,但你还会继续扩大它。最终出来的东西,基本上会像一个可以直接接入的远程员工,能在一周或一个月的时间尺度上工作。
首先,你是否同意这就是实验室正在押注的方向?第二,这够吗?基本上是在数据中心里的这些仿真环境中学习如何学习,然后被部署到真实世界,但并不真正从真实世界部署中学习……只是从数据中心里的模拟环境中学习这些元技能。
Charlie O’Neill
我觉得现在已经很难区分,实验室的努力有多少是在直接面向 RSI,又有多少是在打造通用智能模型,然后继续部署它们来获得收入,用这些收入资助下一次大型训练运行。
对后者来说,是的,那大概就是他们正在押注的东西。过去几年这些环境的发展模式非常清楚。Anthropic 的环境谱系就是一个非常清楚的例子。一开始,我们只是专注于编程,而且要在这件事上变得非常非常好。然后,从我们通过编程获得的任务时长出发,编程在可用于创建环境的互联网数据方面可能是最容易摘到的果实,再加上他们自己内部可以转成环境的东西,接着我们就会去泛化。
下一步我们会转向金融,RL 训练里真的会有大量 Excel 数据以及所有那类东西。然后是 PowerPoint。它是工作经济中的这条长尾。这似乎非常有效。很多其他实验室,甚至开源实验室,现在也意识到这是正确的赌注。
Dwarkesh Patel
但这意味着什么?我请 Dario 上播客时,问他的问题是,如果你真的预期模型会像人类一样有在工作中学习的能力,那你为什么还要把使用 PowerPoint 之类的所有这些技能都烘焙进去?你难道不该预期模型在部署之后自己就能学会吗?
有好几种不同解释。一种只是说,我们预期模型很快会到那里,但现在还没到,所以为什么不把这些技能摊入模型训练中呢?另一种是,我们并不是专注于让它非常擅长那些广泛部署的工作。我们只是想让它非常擅长 RSI。这只是我们获得收入的一种方式,这样我们就能把收入再投入到一个真正非常擅长做 RSI 开发的模型中。然后一旦奇点发生,最终出现的东西会非常擅长所有那些看起来像是当前一代模型瓶颈的事情。
John,如果路径是这种泛化,我不知道你怎么看,我们应该如何理解为什么这些模型里会有这么多任务特定知识。
John Schulman
如果模型足够擅长在上下文中学习,那么理论上,你就不需要在金融上训练它们。它们可以即时阅读所有书籍,并弄清楚如何在相应司法管辖区内做所有事情。你可以说,你需要做大量这种领域特定训练,只是为了让它们更高效。即使它们足够聪明,能即时弄清楚这些事,你可能仍然想做一堆 RL,把所有这些直觉都烘焙进权重里,这样模型在运行时会更高效。
在实践中,模型提供商确实似乎是在一个领域一个领域地推进,试图在价值最高的领域强化模型。我会说,这就是为什么模型变好了这么多的答案之一。原因只是模型提供商已经覆盖了很多高价值领域和最常见的技能类型。
Beren Millidge
另一个原因是,同时做这两件事并没有那么昂贵。模型非常庞大。从参数角度看,它们完全负担得起学习一切。很可能也存在一些迁移。即使金融不是专门针对 RSI 的,其中的信息对 RSI 也很重要。只是这种关于如何弄清楚什么重要、如何有品味、如何做长程工作的总体元学习,就有可能是可泛化的。
世界上也没有那么多 RSI 数据。它很难生成,而且需要大量努力。所以如果你能把其他数据摊进去,你就能从中获得一些迁移。你已经有大量算力和大量参数空间,所以为什么不也这么做呢?当然,还包括直接销售模型的商业意图。
John Schulman
我还要补充一点:当前这种做 sim-to-real 的范式是否会永远占主导地位,这是一个问题。你观察真实世界任务是什么样的。然后你尝试创建一堆可以在数据中心里模拟的环境,并且可以在它们上面做 RL。显然,这已经非常成功。但它也有很多弱点,因为很多事情就是很难模拟,尤其是当它们涉及与一群人实时互动的时候。所以 sim-to-real 是否会永远是主导框架,这是有疑问的。
Beren Millidge
我认为,只要样本效率还很低,sim-to-real 就必须是主导框架,因为现在你需要与人类进行成千上万次互动。没有哪个人会坐在那里参与 RL 训练循环。所以我们现在必须模拟它,才能获得所需样本。但显然,如果样本效率大幅提高,你会预期从部署中学习会成为其中更大的一部分。
John Schulman
不过你也可以做其他事情。你可以做离策略学习,所以你可以拿到所有轨迹,即使不重新模拟所有东西,也有可能从中学到一些东西。
Dwarkesh Patel
我想多问一点这件事,因为有 50% 的算力花在推理上,却没有直接帮助模型变得更好,这很奇怪。你会预期数字心智最终拥有的一个关键优势是,不同于一个人类只能有 50 年真实世界经验,一个模型可以通过它的所有实例,在各种经济相关工作中获得数百万年的部署经验。现在,这些数据在有意义的层面上并没有帮助模型变得更好。
很明显,模型最终应该能够从这些数据中学习。一旦它们能做到这一点,你就会得到某种几乎像是广泛部署的智能爆炸的东西,因为模型正在吸收横跨所有这些已部署实例的大量信息。你预计这种蜂巢思维式的疯狂东西什么时候会开始发生?
Beren Millidge
我认为宽泛地说,在一个非常基本的层面上,这已经在发生了……只是发生在下一代模型里。现在,你显然可以拿到你的部署数据,把它放进未来模型的预训练或中期训练里,尤其是如果你做某种过滤,或者某种判断、标注、合成的话。
Dwarkesh Patel
你觉得这在多大程度上解释了每一代之间的改进?
Beren Millidge
我觉得它解释了相当一部分。我不知道这些实验室是否这么做,因为理论上,他们声称不会用人们的数据训练。但中国人 100% 会这么做。他们肯定得到了这个优势。这基本上就是蒸馏。他们拿到模型,通过 ping 模型获取某一部分部署数据,然后用它来训练下一代模型。他们当然也可以在自己的模型上这么做。完全没有任何理由不这么做。
Charlie O’Neill
我完全同意这一点。如果你把视角拉得足够远,这肯定正在发生。我们所有人想象中的持续学习圣杯,是一种非常有机的、实时的循环:一个单独模型获得一次经验,然后当场实时更新并从中学习。当你放大到那个粒度层级时,很多东西都会出问题。但大型实验室正在这么做。闭源模型正在这么做。
也已经有一些早期迹象显示,使用开源模型的人在以快得多的节奏做这件事。一个很好的例子可能是 Composer。Harvey 也在法律 agent 上做同样的事。你有某种模型,你会从你针对那个特定任务所拥有的数据里,得到非常具体的环境,还有用户抱怨的东西,以及你以某种方式从特定部署中提取出来的所有反馈。很多这类公司相对于大型实验室的优势在于,它们可以非常非常好地使用这些数据。
然后它们会创建环境。它们会对 Kimi K3 做一次大型后训练。它们会去部署它。它们可能也会做一些在线学习,就像 Composer 在线做过的那样……基本上是很长时间的 REINFORCE。
这里面仍然有人在环路中。仍然有人在说:“好,这些是我们关心的信号。我们要这样根据手头的数据来创建环境。”它的节奏可能还是比你想象的更长,但这件事确实正在发生。最终,这个环路会变得越来越快。
Dwarkesh Patel
Composer 这件事很有意思,因为在 Cursor 里,人们会按 Tab,或者不按 Tab,来接受或拒绝模型建议的下一个补全。基于这个信号,Composer 每天都会更擅长预测下一个……
Charlie O’Neill
那是旧的 Tab 模型。他们实际上不只是对 Tab 模型这么做,也对真正的生成模型做了同样的事。
Dwarkesh Patel
哦,明白了。有意思。
Charlie O’Neill
难点在于,当你做在线强化学习时,你没有分组。你只有一个用户说了一句话,然后你得到一次 rollout。所以你会有一个很大的方差降低问题。
Cursor 对这个问题的模糊回答是:“我们有非常好的启发式方法,能够估计这个回答比平均水平好多少,或者比平均水平差多少。”然后他们会做一次很大的 REINFORCE 更新。至于模型是不是变差了,他们的解决办法是,如果它在 CursorBench 上提升了,他们就每五个小时部署一次新模型。如果没有提升,他们就把那个版本丢掉。
John Schulman
我觉得你最大的问题其实只是你不知道自然数据的奖励函数应该是什么。如果你用某种表面的信号,比如他们是否接受了编辑,那它可能会以某种方式被奖励黑客化。
Dwarkesh Patel
但这不正是 sim-to-real 这件事里更大的问题吗?任务的时间跨度越长,就越难在数据中心里模拟。对我来说,哪怕是在写代码这件事上,我们似乎也已经到了这样一个阶段:不存在某个持续一年的编码任务,最后完全不需要你跟客户沟通,或者跟公司互动,或者跟用户互动。
如果你想想我们希望 AI 能够胜任的那整套事情,最终超级智能应该能够经营一家企业,或者创办一家新企业并让它盈利,或者在市场里做一天盈利的日内交易,或者赢下一场官司。这些都是很难在数据中心里模拟的事情。其中学习的一个内在部分,就是与真实世界互动。
也许它们可以通过从 sim-to-real 的迁移中学会如何把这些事情做得更好。但另一种可能是,也许你确实需要从这类互动中进行权重更新,才能在这些事情上变得更好。如果是这样,如果迁移还不够强,而你确实需要权重更新,那么模型相当样本低效这一点,也许就是一个更深层的问题。
我之所以对这个问题好奇,是因为在默认情况下,我看不出为什么未来 10 年内不会出现某种疯狂的递归自我改进。但它可能不会发生的一个原因是,从权重更新的样本效率来看,模型似乎远远落后于人类。一个人从出生到成年看到的数据量,和一个模型从冷启动到完成训练看到的数据量相比,模型在数据需求上可能落后人类一百万倍。
这一切总结起来就是:首先,在模拟和那些我们希望 AI 在真实世界中完成的、时间跨度极长、极其复杂的真实破事之间,会有良好的迁移吗?如果没有,这是否真的意味着这些模型缺乏样本效率的问题会反过来咬我们一口?
Charlie O’Neill
也许我会这样拆分两类任务:一类是模型会变得擅长的任务,另一类是模型仍然会继续吃力的任务。关键在于,这个任务是不是累积性的,还是说你面对的是一个非平稳分布,必须不断学习,并且反复重新争论一堆东西。
累积性任务的一个例子可能是 RSI。从理论上说,可能存在一个不到一百万 token 的 Python 文件,它能从零开始训练出一个能够递归自我改进的模型。你做出的每一个发现都是一条已经划下的界线,你会守住它。如果对 RSI 来说,我们不需要发现一种新的注意力变体之类的东西,那么一旦你发现了注意力,一旦你发现了专家混合,一旦你发现了 GRPO,你就把它加入训练栈,然后它就在那里了。
一个很好的例子是 5.6 Sol 训练,5.6 Terra,或者 OpenAI 告诉我们它训练过的那个模型。它不需要回头重新发现注意力。它基本上会调用一堆脚本,比如 pre-training.sh 和 post-training.sh,然后把这件事做完。这就是一个累积性任务的例子。
我认为真实世界不是一个真正的累积性任务,这也是为什么人们现在非常关注持续学习。想象一下,在一家律师事务所里,你有一个 agent 扮演法律助理。那是一个非常非平稳的分布。你必须能够把那家公司所有重要人物之间的关系都装进上下文里,而这些关系也一直在变化。还有所有这些隐性的做事方式、信息在哪里找,等等。它不像 RSI 那样是一个干净的累积性任务例子。
我认为不同任务之间会出现这样的分化。但如果实验室意识到这一点,而且他们确实相信 RSI 在这个意义上是累积性的,也就是说我们不需要回头发现某种全新的架构之类的东西,那么也许越来越多的努力和算力会集中到 RSI 上,而不是其他任务上。
Dwarkesh Patel
真不幸,RSI 偏偏比当律师助理更容易。
John Schulman
我会说,今天的模型在很多不同方面都比人类弱。其中一些可能和某个特定场景下的样本效率有关。在某些场景下,模型非常样本高效,比如上下文内学习。但也许存在某个中等长度的场景,在那里它们的样本效率较低,因为人类能以比模型更高效的方式做某种权重更新。我认为在某些场景下样本效率较低,可能是模型弱点的来源之一。
但我认为还有其他弱点,和样本效率完全不同。比如,相比人类,它们思维多样性更低,或者不擅长某些长期判断。我认为人们所谓的品味,很大一部分是关于某种长期有效的行为,而且人们已经意识到它长期有效。不是全部,但品味的某些方面是这样。尤其是像软件工程这样的事情,我认为很多品味都在于:“什么样的系统在这个项目的长期过程中会可维护,并且运行良好?”
模型有各种各样的弱点,它们和其他因素一起限制了 RSI。其中一些和样本效率有关,另一些则无关。
Charlie O’Neill
也许一个有意思的思想实验是这样。假设你能给一个模型一个一万亿 token 的上下文窗口,或者无论需要多大,足以装下你在比如 RLHF 之前的全部经验。它的上下文窗口里有所有这些经验,并且它在一万亿 token 时的样本效率和上下文内学习能力,和它在一百万 token 时一样。你觉得这样品味问题就解决了吗?它能做出和你当年一样的判断吗?还是说,除了更长的上下文窗口以及同样的样本效率之外,还有某种根本缺失的东西?
John Schulman
它必须被训练成能够从那个上下文中学习。要么它必须被训练成能从那个上下文中学到应该做出的正确更新,要么它必须能够泛化。
Charlie O’Neill
所以你不觉得可以直接把所有东西都塞进去,把你的一生、你的研究经验都塞进去?
Beren Millidge
你仍然需要用来训练长上下文的数据。即使理论上你能得到一万亿上下文,你也需要一万亿长度的数据来训练它。现在你有 10k 上下文,但你不能直接塞进一百万。
Charlie O’Neill
对,我只是在问,如果你有那个的话。
Beren Millidge
理论上,我认为可以。这其实归根到底是一个问题:品味在多大程度上可以从较短时域的片段中被元学习出来。我觉得没有明显理由认为它一定非常长,因为人类不知怎么就在没有多少长片段的情况下发展出了品味。我们并不会活到一万岁。我们发展得相当快。
如果你甚至想想一个 PhD,一年级 PhD 学生和毕业年级学生或博士后之间的差别,也许就是五年。他们总共可能只做过 10 到 30 个研究项目。但不知怎么地,他们通过相对短的一连串小事情,很快就发展出了品味。从理论上说,像这样发展出品味是可能的。
AI 显然会有多得多的经验来发展品味,来对它进行元学习。然后问题就是,这能多好地泛化到真正长时域的事情上。我认为这一点现在真的还没有解决。我们不知道。
Dwarkesh Patel
回到这个问题,最终应该会出现一种机制,在这种机制下,AI 会从每一个单独的部署实例中学到大量东西。现在你可以说,有一个模糊的元过程,让模型确实会从部署中改进。但我感觉这是一个非常弱的反馈环。你觉得这种事情已经在地平线上了吗?也就是某种蜂群智能式的学习,非常快速。如果是的话,它具体会怎么发生?
John Schulman
我会说,我们是否会得到一个从所有部署经验中学习的蜂群智能,很大程度上取决于激励,而不是一个技术问题。公司不会希望模型提供商从它们的所有部署中学习,因为那可能只会削弱它们业务的优势。
Charlie O’Neill
我认为这件事的经济学会施加压力,未必是对一个大型共同共享模型做权重更新,而是把一些模块插进去。一个非常明显的例子是 LoRA,但也可能是别的东西。
已经有很多工作试图把任意长度的上下文塞进一个固定大小里。这就是所有线性注意力相关的东西。还有 cartridges,它们本质上是经过训练、压缩得非常非常厉害的 KV 缓存,可以装进大量信息。这是另一个公司可能愿意接受的例子,如果它被插入到模型中,而并没有真正改变底层基础模型本身。
实时从你的数据中学习有很多不同版本。后面这些版本并不能真正帮助大型实验室,因为它们只是这些模块。但我认为经济压力会迫使实验室先走这条路,然后才能开始这件事……
Beren Millidge
不过,是哪种经济压力?我觉得即使你有一堆 cartridges、LoRA 或者诸如此类的东西,你仍然可以直接拿走所有这些轨迹,把它们倒进下一代模型的预训练里。
Charlie O’Neill
是的。大型实验室得到的学习形式可能会更加间接。那显然对他们仍然非常有价值。但我无法想象这样一个世界:我们一开始就说,“我们要直接用我们拿到的所有精确数据,来训练这一个大模型。”
Beren Millidge
不,我觉得它肯定会经历几个阶段,因为这种说法假设存在一个不连续事件:突然之间,我们就能连续地修正权重更新。实践中,我觉得更可能的情况是,那些卡匣之类的东西让你能针对部署场景做专门化。然后你生成轨迹,把它们放进模型里,三个月后推出一个在这些事情上更强的模型。你再一次专门化它,再一次巩固它,最后我们只是会把这个跃迁做得越来越快。
不再是每三个月发布一个模型,而是每周一次,然后每天一次,然后每小时一次。到那个时候,我们基本上就把这个问题解决了。
Charlie O’Neill
我觉得这也是一个很好的点,因为你问的是,当前范式离能够做到这件事还有多远。我们对此做过一些研究,其他人也做了很多研究。在非常大的规模上,当你冲掉了足够多噪声,并且批量足够大时,这种把数据放进中期训练、创造我们自己的环境的外循环过程,确实可以在某种持续学习机制下运作。
但问题是,当你在微观层面放得足够近来看时,比如我有一个模型,我试图为一家律所之类的客户再次更新它,并且试图用相对少量的数据非常连续地做这件事,所有方法都会有点崩掉。如果我只用成功轨迹对模型做 SFT,无论是离策略还是同策略,最终在那种非常迭代的机制里,当你做上百次这样的微更新时,你会看到灾难性遗忘。你会看到模型忘掉之前在基础模型之上学到的信息,也就是更早的时候学到的信息,同时也会看到通用能力退化。
同策略蒸馏似乎能把这个边界往外推一点,但最终还是会败给同样的问题。RL 很擅长把能力灌进去,但它不那么擅长把知识灌进去,也就是这种非常明确的知识:“啊,好,这个人在这家律所是这么做的,而这是我们发现的一个非常具体的流程。”你必须投入大量计算,去创造合适的环境,才能用 RL 把知识放进去。
Dwarkesh Patel
你觉得这里的根本问题,也就是为什么模型在其他技能上会变差,或者为什么会遗忘,本质上是容量问题,还是技术问题?
Charlie O’Neill
两者都有一点。我觉得 SFT,甚至同策略蒸馏,都可能太具有破坏性。RL 之所以这么好,是因为它对模型改动的量非常非常小。有很多证据说明为什么会这样。它只是把模型在一个非常非常小的损失谷里稍微调整一下,让它到达正确的位置。但这也限制了你能用 RL 做什么,限制了你实际能多大程度上改变模型。
Dwarkesh Patel
所以你的意思是,这件事之所以可能不是赢者通吃,是因为要把那么多信息蒸馏进基础模型里实在非常难?
Charlie O’Neill
在迭代的方式下,还不能破坏别的东西。
Beren Millidge
把它蒸馏进另一个基础模型里是容易的。这就是为什么我觉得它主要是技术问题。绝对不是容量不够。如果你有某个模型,拿到了所有这些数据,然后你用完全相同大小的模型,把中期训练里的所有东西都放进去,从零开始预训练,它会更好。我觉得这就是今天很多事情正在发生的情况。
有一个非常明显的瓶颈,阻止我们永远持续训练同一个模型,而不是从旧模型那里拿到所有数据,然后从零开始训练一个新模型。这正如 Charlie 刚才所说,是可塑性和灾难性遗忘的某种组合。如果你只是天真地在非平稳数据上训练,因为你一边走一边加入新数据,这会扰乱数据分布,所以旧东西就被遗忘了。我们其实没有很好的方法来阻止这种事情发生。
Dwarkesh Patel
所以也许到极限处,你只是受限于要用所有这些新信息从零重新训练模型。
Beren Millidge
是的,而这当然非常昂贵。从零训练一个模型很贵。
Dwarkesh Patel
但你反正会这么做。
Beren Millidge
不一定。也许最终,如果你有持续学习,你就永远不训练新模型。你只是有一个模型,它持续学习并扩展。
Dwarkesh Patel
但也许有某种深层技术原因,使得这件事非常困难。
Charlie O’Neill
这就是问题所在。我觉得我们已经把需要从零开始的程度往后推了。现在确实可以拿预训练基础模型,在上面做非常好的中期训练,而且可以某种程度上连续地做,再加上从训练后期不同检查点出发做一些 RL。这看起来更像持续学习,但它当然还不是那种拿最新模型,应用几个非常小的更新,然后迭代下去并且永远不丢失任何东西的情况。
Dwarkesh Patel
抱歉,我有点困惑,因为这不就是训练期间字面上会发生的事吗?在后训练之类的阶段,你有一个已经经历过大量训练的模型,然后你蒸馏某个经过进一步 RL 的分叉。这不就是字面上正在发生的吗?
Charlie O’Neill
但我觉得它仍然处在足够大的规模上,所以你冲掉了很多噪声,而且你不是只专注在一个分布上。正如 Beren 所说,这才是问题。如果你只是专注在一个任务上……
Dwarkesh Patel
但在最终机制里,你会做的是……会有数十亿个已部署实例。你会同时从所有这些实例中学习,所以希望那里会有一些噪声被冲掉。
Charlie O’Neill
也许在那个规模上,是的。
Beren Millidge
正如 Charlie 所说,你确实可以做很长时间的持续中期训练,也可以回滚到某个检查点,然后给它新的中期训练数据。但与此同时,你不能无限期地这么做。如果你只是永远持续训练同一个基础模型,它会在某个点渐近到上限。你不能只是在那个基础模型里不断学新东西。这就是为什么人们最后会训练新的基础模型。否则你就会永远对同一个基础模型做中期训练。
Dwarkesh Patel
现在我们来聊聊数据。我总体上对这个问题很感兴趣:AI 的进展有多少只是由数据进展解释的?这并不意味着它一定很难自动化,但那是另一个问题。有没有某种数据分布,如果你用当前架构在它上面训练,就会得到一个在每一个领域都完全压倒人类专家的超级智能?
Charlie O’Neill
我们说的是预训练加后训练数据,也包括环境吗?我觉得这种东西存在是显然的。问题只是我们能不能创造出正确的环境来到达那里。
Beren Millidge
在平凡情形下,我们可以直接训练它输出那个会训练真正超级智能的 Python 文件。直接把它记在权重里就行。
Charlie O’Neill
是的,可能存在一架 RL 环境的梯子,可以被构造出来,使你得到一个至少和人类研究员一样好的 AI 研究员。但攀爬每一级后续梯级所需的努力,会以某种指数方式增长。关于我们多快会抵达最终那一级,也就是模型变得更好的那一级,你必须在这两件事之间权衡。我觉得这相当清楚。
我们在 RL 环境创建方面仍然相对早期。为了创造好的环境,我们会利用很多不对称性。我们之前谈过的一种不对称性是,有些环境倒推比正推更容易。我的意思是,定义一个复杂的数据生成过程非常容易,而这就是你向模型隐藏的潜变量。你可以生成任意复杂的环境,而模型必须花费大量不可约的词元支出和不可约的工作,才能弄清楚那个数据生成过程是什么。
在从现实世界注入信息方面也存在不对称性。Anthropic 通过数以万计的人类和 LLM 共同发现了一个漏洞,然后把它变成一个非常非常整洁的环境,理论上单个 LLM 在几百万个词元内就能找到它。存在所有这些不对称性,而我们正在挑选它们,并且指望这种任务时域泛化。
但我觉得它在某个点会遇到收益递减,也就是首先创造这些环境、想出这些环境这件事本身会变得越来越难,因为你不一定总能拥有这些倒推比正推更容易的过程。你实际上必须坐下来,构造出某种在人类那里看起来有足够长时间跨度的东西,而这会是一项非常复杂的创建任务。然后,对于智能体来说,真正执行这些任务还会有计算和时间瓶颈。我觉得你会开始看到这条曲线变平。
John Schulman
我看到过有人把Talkie 模型在现代编程智能体数据上做了微调。这个模型只训练到 1930 年之前的数据。它超过了 Claude 3 Opus 在 SWE-bench 上的表现。所以这个完全没有代码知识的模型,可以用中等数量的数据进行微调,然后作为编程智能体的表现超过这个大得多的预训练模型,这非常疯狂。它某种程度上说明,一旦你有了正确专家行为的样例,把它复制到一个相对较弱的模型里,其实出人意料地容易。
Charlie O’Neill
但对此有一个反例,是最近一篇论文。他们把一个模型训练到五年级数学水平,也包括小学英语之类的东西,所以它是一个还不错的语言模型。他们试图用 RL 让它做高中高年级和大学数学。差距实在太大了。他们根本没办法让它爬上去。但如果你做连续的梯级,先是七年级数学,然后八年级数学……依此类推,你显然可以爬到十二年级。归根到底,问题仍然是这些梯子上各级之间的距离有多大,以及创造这些梯级有多难。
Beren Millidge
这又回到了 RL 信号问题。RL 现在并不擅长探索。如果模型在 128 次采样轨迹里得不到它,就非常不可能获得推动进展的信号。这就是为什么在 RL 中我们需要课程,而在预训练中不需要,因为这对预训练根本不是问题。
Charlie O’Neill
同样,预训练数据不同于后训练数据。我想随着我们继续前进,人类参与会越来越少,但这并不改变一个事实:你受限于能从现实世界提取多少信号。
世界上有很多信号,这是真的。有人在做电子表格任务,有人在做法律任务,以及所有这类事情。但在模型现在所处的能力前沿上,世界中有多少比特真的与提升模型能力有关?有多少新的数学问题正在被解决,而且它们刚好超出当前模型的触及范围或掌握范围?有多少新的编程问题正在被创造或解决,而且它们超出当前模型的能力范围?
我觉得这就是收益递减开始出现的原因,因为即使把整个世界加起来,也没有给你那些有用的比特,让你能进入下一个能力盆地。
Beren Millidge
我完全同意这一点。这其实是一个信号从哪里来的问题。在预训练中,信号已经存在于 Common Crawl 里。对于你在预训练中关心的任务,问题根本不是拿不到信号,而是要过滤掉其中存在的所有噪声。这是一个相当可以自动化的过程。
但随着模型变得更强,当我们进入中期训练和后训练阶段时,信号在我们原有的数据里根本不存在。再怎么过滤也得不到它。Common Crawl 里并没有某个隐藏的千禧年大奖难题证明,等着我们一直过滤到看见它为止。
到那个时候,你必须用别的方式获取这些信息位,要么直接从人类那里获取,让他们写出自己的推理过程,要么创建一些环境,让人类决定应该创建什么样的环境,以及这些环境的目标是什么,或者以某种方式在部署中已有的人类数据上进行训练。你必须从某个地方获得这些信息位。
Dwarkesh Patel
这里有一个问题:预训练中的进步有多少是由数据推动的。我做过这项研究,合作者是 Jerry Han,他是 Princeton 的学生,我们把 2019 年到现在的所有训练配方,与 2019 年到现在的所有数据集做了两两组合训练。比如你是在训练 GPT-2,用的是最新的数据集,像 Ultra-FineWeb。你用最新的开源训练配方 Delphi,去训练 the Pile 或某个旧数据集。你把整个网格都跑一遍。然后看,在这个网格里,要达到某个能力水平,需要少用多少计算量?
你会看到,数据似乎可以解释大约 12.0 倍的计算效率提升,而架构改进解释的大约是 3.7 倍的计算效率提升,不过这是在非常小的规模上。如果这在大规模上也成立,也就是说,大多数预训练计算效率提升都来自更好的数据,那么这种趋势还能持续多久?你能不能不断更细地过滤数据,并构建越来越多的合成数据?你们对这种预训练进步还能持续多久有感觉吗?
Charlie O’Neill
我的先验是,还是那句话,低垂的果实已经差不多摘完了。我们拿到了互联网这个大块头,而且互联网本身未必还在以同样的速度增长。互联网上所有有用的东西也不是以同样的速度增长。我们可能还会有不少 0.1% 的损失下降,但肯定没有已经发生过的那么多。
不过你们发现两者合起来有 33 倍的累计提升,这也非常有意思。我记得是 Epoch 或者别的什么人估算过,自 2019 年以来每年大约 3 倍,这会意味着类似 37,也就是超过 2,000 倍的提升。所以缺失的那 100 倍左右是从哪里来的?这大概能很好地提示你,其中有多少来自后训练。
Dwarkesh Patel
我认为解释必须是,许多计算效率提升依赖于规模,而我们起步的规模极小。这就引出了一个问题:数据带来的计算效率提升,和算法带来的计算效率提升,哪个对规模的依赖更强。我不知道你对此有没有先验。我们只是没有足够的计算资源去研究这个问题。
Charlie O’Neill
只从朴素的理论角度看,架构的规模依赖已经相当明确了,你可以给它拟合一条直线。而对于把预训练加后训练数据和中期训练数据结合起来,我完全不知道该怎么做这件事。
Beren Millidge
有意思的是,我感觉数据其实在规模变大时更重要。我觉得架构有点像一次性的东西。
只说 X% 的效率提升其实有点误导,因为架构的作用是让你进入一个旧架构无法到达的、性质上全新的区域。在那个区域内部,显然数据才是决定性的主要因素。
但如果我们甚至没有 GQA,如果我们整天都在做全量注意力,那么做一百万上下文会贵得离谱。因此,我们永远无法使用那些真正处在一百万上下文里的数据,也就无法获得这些能力。即使你只是很朴素地问“它在 2K 上下文下带来了多少提升”,在那种架构没有解锁任何东西的地方,数据看起来也会比它在某种意义上的真实重要性要重要得多。我不确定这些东西真的能用这种方式简单相乘。
Dwarkesh Patel
明白了。那么你怎么看数据的规模依赖?
Beren Millidge
关于规模依赖,我认为我们现在拥有的很多中期训练和后训练数据,实际上会随着规模变大而变得更好,因为其中很多东西,尤其是非常长上下文时域的环境类内容,真的需要大模型才能利用。如果你试图用 SWE-bench 轨迹去训练一个 1 亿参数模型,它不会有什么进展。它不会展现出那种如果你用一个真正合理大小的模型来训练就会得到的同类提升。
Charlie O’Neill
现在也很难说,因为很多架构变化,比如你看 Kimi,或者 DeepSeek,它们做这些架构修改时,考虑的不只是降低预训练损失,还考虑模型在现实世界中会如何被使用。推理效率,比如 DeepSeek 模型里某种形式的压缩注意力,并不一定是为了实现某种基本权衡上的改进。它只是:“好,我们在考虑模型将如何被使用。”
Dwarkesh Patel
为了理解未来,我很好奇的一个问题是,当我们进入一个更偏 RL 的阶段时,参数规模会如何变化。你可以看看开源架构,观察参数扩展的速度。也许前沿开源模型大致是每年翻 2 倍。就算前沿闭源模型有 100B 或 200B 活跃参数,你认为它还会继续逐年翻 2 倍吗?
或者说,现在我们处在一个 RL 阶段,你还想为轨迹生成节省计算量……另外,也许存在某种阈值效应,当你已经有足够容量时,再任意增加参数就没那么重要了。你们对 2030 年前沿模型会有多少活跃参数有感觉吗?
Charlie O’Neill
我认为在接下来几年里,因为我们非常专注于为 RL 生成越来越长时域的轨迹,而在这里推理效率非常重要,所以感觉模型在这方面的能力未必已经饱和。瓶颈仍然是环境。因此我们可能会看到一点平台期。
我有种感觉,Mythos 和 GPT 模型都远小于人们所说的 10 万亿参数量级。哪怕只是很朴素地把它们和开源模型比较一下,你大概也能倒推出这个结论。
未来几年里,我可能不会预期参数数量出现巨大增长。但同样,这里有太多不同的东西需要权衡。你会根据自己有多少预训练数据,以及你必须训练的 RL 环境有多难,来决定模型大小。理想情况下,你想达到一个最优点,也就是在你拥有的最难环境上能拿到还不错的 pass@1 或类似指标。在那里做一个更大的模型来通过测试没有意义,因为那样你只是在支付比所需更多得多的推理成本。
所以很大程度上,这取决于 Mercor 和内部团队能多快扩展他们用于训练的 RL 环境的复杂度。
John Schulman
我会预期模型继续变大,只是因为大家在扩大计算量,GPU 也在变大。但它们到底会变大多少,在某种程度上取决于扩展定律,而且方式并不显然。
有一点是,我认为既然我们进入了高质量预训练数据快要不够用的阶段,数据效率会比计算效率更大程度地驱动人们具体使用哪些架构。这可能会影响你希望模型有多稀疏。
我还认为,我们对稀疏性的理解并没有那么好。参数和活跃参数是不同的资源。稀疏性确实提高了一些,但并不清楚它会不会无限继续提高。这里可能存在某种甜点。
有一种论点认为,稀疏性会让数据效率变差,因为你可能不得不在多个专家上学习同一件事,当然这点可以争论。我不认为我们已经有足够好的扩展定律理论,真正理解为什么稀疏性有帮助、它能帮多少,以及它是否会在某个稀疏程度上进入平台期。
Dwarkesh Patel
抱歉,你能不能准确展开一下,数据效率对参数会有什么含义?听起来你会说稀疏性应该更低,但它对参数规模扩展还有哪些其他含义?
John Schulman
只是说,根据扩展定律,你试图优化的不是计算效率。你在架构上有所有可以做的选择。每一种选择都会给你一条不同的扩展定律。传统上,你会看某种基于计算量的包络线。你会看性能相对于计算量的关系,然后取最佳模型形成的包络线。
但如果我们是基于数据来做这个决定,也就是我们假设可以花大量计算量,因此 x 轴上放的是数据而不是计算量,那么我们就会得到一组不同的最优点,或者说一组不同的、位于前沿上的模型。
Charlie O’Neill
我也不认为过去几年里,我们真的每年都把模型大小翻了一倍。人们至少几年前就已经在训练 1 万亿参数模型了。甚至还有一个开源模型叫 Falcon。Liam 来自 Periodic Labs,我记得他昨天在 Twitter 上发帖说,一个早期实验是在训练一个非常、非常稀疏的 1 万亿参数模型。
John Schulman
那是他们在 OpenAI 之前,在 Google 做的东西,Switch Transformer。
Charlie O’Neill
它在知识方面非常、非常强,但在推理方面很糟,因为它太稀疏了。感觉我们至少已经在 1000 亿到 2 万亿参数这个范围里玩了一段时间。它当然不是那种漂亮的线性增长。
Beren Millidge
我觉得这里有两件事。正如 Charlie 所说,推理效率对 RL 轨迹生成来说极其重要。这会把活跃参数压低很多。
我认为总参数量也非常依赖硬件。你真的需要非常高的内存带宽和 VRAM 容量,才能真正服务多万亿参数模型。现在,人们仍在大量使用 H100 之类的东西。随着大家都迁移到 GBs,然后再到 Vera Rubins,我们会获得更强的扩展能力,也能在更大规模上真正服务模型,并进行大规模 RL 推理。
我觉得数据这个问题很有意思,因为直觉上,更大的模型在实际数据点上的样本效率要高得多。即使你没有把模型训练到饱和,做大一些仍然更好,因为更大的模型泛化更好,在相同数据量下能达到更低的损失。现在我觉得我们有大量数据,数据不是约束。算力才是。所以我们会用更小、推理效率很高的模型。但如果算力不再是瓶颈,事情可能又会回到更大的模型上,这些模型虽然没有被训练到饱和,但因为规模大,具备这种泛化能力。
Dwarkesh Patel
如果你只看基本的 Chinchilla 缩放律,然后只是把参数量最大化,它实际上只会非常有限地降低达到同样损失所需的数据量。如果你把参数量推到无穷大,我觉得你需要的数据量下降不到 10 倍,这只是幂律本身的性质决定的。
Beren Millidge
但我们现在已经处在 Chinchilla 定律里数据太多的那一侧。现在按 Chinchilla 来看,我们是在过度训练模型。所以如果我们开始用完数据,很容易回到 Chinchilla 最优点,甚至稍微偏到模型训练不足的那一侧。
Charlie O’Neill
但肯定的是,即使这些新芯片上线,接下来几年我们仍然会严重受算力限制,所以情况未必会那样。
Beren Millidge
这其实取决于你的训练算力和推理算力之间的比例。如果你的瓶颈非常明确是数据,而不是算力,那就应该做大模型。如果你的瓶颈非常明确是算力,那就应该总是做小模型。你也可以使用计算机生成的合成数据,所以这是那种非常难预测的事情之一。
John Schulman
我觉得人们一开始花了那么久才弄清缩放律,部分原因是,如果你没有把所有这些事情都做对,就得不到这么干净的关系。图表上那些漂亮的直线,掩盖了很多复杂性:你必须确保以正确方式缩放每一个超参数,或者以一种可缩放的方式参数化你的优化器,让你在改变模型规模时不必改变超参数。
Charlie O’Neill
错误本身也有干净的缩放律。比如 Kaplan 忘了余弦退火这件事,或者我觉得甚至只是没有考虑嵌入参数。这把小模型上的估计搞乱了,因为嵌入参数在模型里占的比例不小。
Dwarkesh Patel
稍微谈谈 RL。一年前,很多人都在提出这样一种论证,说 RL 对模型做缩放不会特别成功。John,你写过一篇研究文章,指出模型在 RL 时每个回合只学习一个比特。它们学到的是:“我的答案答对了吗,还是答错了?”然后今年早些时候我也写过几篇博客,我的观点是:“情况比这还糟”,因为当通过率很低、模型很不可能答对时,它几乎无法从一次 RL 回合中学到任何东西。
但我看今天的模型,它们似乎相当聪明。这看起来像是扩大 RL 规模的结果。Beren,你几周前有一篇文章,试图解释到底发生了什么。为什么 RL 会比人们直觉上以为的更成功?
Beren Millidge
我觉得 RL 的成功归结于一系列不同的因素。首先,一个有点被低估的东西是中期训练。我们看到的很多 RL 成功,其实来自非常非常好的中期训练数据,也就是我们本质上是在做预训练,但用的是合成推理数据,以及能让模型为 RL 热启动的那类环境。这通常会把模型带到最终 RL 检查点差不多 80% 的位置。
然后 RL 在此之上所做的,本质上是调整策略。这也是为什么它并不需要像你直觉上以为的那么多比特的原因之一。它不需要从零开始学习所有这些行为。它只需要从这些回合中获得少量比特,而这些比特确实能拿到。我在博客里指出的另一件事是,与常规预训练相比,这些比特的信号极强,这也是为什么你需要 RL,而不是只对成功推理轨迹做 SFT。
Dwarkesh Patel
因为它们正好就是关于如何答对的比特。
Beren Millidge
有两件事。是的,第一,它们正好就是关于如何答对的比特。但这并不完全是你想象的那种方式,因为在 SFT 中,你有一条轨迹。比如说,你有一堆数学推理,然后最后有答案。那个比特仍然在那里。你仍然会在答案词元上做 SFT。
重要的是,目标函数会忽略所有其他比特。在 SFT 中,你必须努力匹配模型产生的精确推理词元。你本质上得到了太多关于另一个模型具体如何推理的比特,而你是在这些内容上训练。对于 RL,你只得到那个单一比特。这意味着这个信号不会淹没在模型拥有的所有其他比特的噪声里。
这真的会让训练过程中的信噪比出现极其剧烈的提升,这也是为什么 RL 在步数上效率高得惊人。
Charlie O’Neill
关于 RL 对模型做了什么,相比中期训练、SFT 或其他东西,已经有太多争论。所有人都会说 pass@1 会上升,但 pass@256 会下降。非常罕见的正确推理轨迹会被降低权重,并且被更容易的推理轨迹产生的梯度信号压过。
我觉得现在看待 RL 的简单方式是:如果你有足够多的算力,能够采样足够大的组大小,使你得到一堆正确答案的概率超过某个不可忽略的概率,那么它就会被提高权重。对应 Beren 的观点,中期训练和更多预训练,也就是 pass@1、RL 的起点,会随着预训练词元数量的对数而缩放。
Dwarkesh Patel
我能问几个非常基础的问题吗?这个回答是说得通的,也许还有实证研究表明这就是正在发生的事情。但我只是看这些模型本身……我不知道到底发生了什么。也许你可以让我大概理解一下,过去一年 AI 进步的基础是什么。
也许它只是提高了那些本来就会进行正确思考的策略的权重。但从质感上看,模型似乎变得强大了太多。也许这里没有内在矛盾。但如果这种看法意味着 RL 的影响相对较小,我们要如何把它和模型实际获得的那些质变能力调和起来?
Beren Millidge
这里我想指出的一点是,这并不必然意味着 RL 的效果很小。即使你只有少量比特,而且你只改变了少量参数,它对函数空间,也就是模型学到的输入到输出的映射,所产生的实际影响仍然可能非常剧烈。哪怕一个比特也能大幅改变你的函数空间。它可以排除一半的假设空间,这是巨大的。
我不认为一定可以说,少量比特、少量 RL,在你已经从一个非常好的起点开始时,就意味着行为上不会产生剧烈影响。至少……不一定。
Charlie O’Neill
我觉得这归结为两件事。第一件事是,每个人都曾希望 RL 能把这种推理泛化到所有这些不同领域。我不觉得我们一定得到了这种横向泛化。只在数学上训练,并不一定会让你成为最强的程序员。你确实必须在代码环境中做 RL。
但我觉得我们确实得到的是长程泛化。模型就是学会了如何使用更多词元、持续更长时间,并且仍然在某类任务上取得进展。你可以在那些时长越来越长的环境中训练它们,然后把它们放进一个全新的环境。是的,它们可能没有泛化出能让它们在那个环境中表现良好的推理模式,但它们至少泛化出了在那项任务上持续更久的能力,而这种能力和成功相关。有一篇叫 EdgeBench 的论文显示,模型能够持续工作更久的速率每三个月翻一倍。这是泛化的明确证据。
最后一种理解方式是,在预训练中,有量子这个概念。你会看到一条非常平滑的预训练损失曲线。当你观察模型内部正在发生什么时,模型其实是在学习所有这些非常离散的任务,而且存在很多涌现点,在那里会发生相变。它原本没有归纳头,现在有了归纳头。这类东西有成千上万、数百万,可能有数亿个。你把它们全部平均起来,就得到了一条非常平滑的损失曲线。
在某种程度上,RL 也在发生类似的事情。正如 Beren 提到的,这里有一个非常缓慢的外循环。我们会训练一个模型,然后对它做 RL,然后在下一轮模型训练迭代中,把一大堆这些合成推理轨迹倒进中期训练数据里。我们有点像是在为所有这些不同任务命中这些量子,而在单个任务层面上,它可能看起来像一次相变。你突然从某个特定金融任务、Excel 任务或其他任务上的 0.5% 通过率,变成 90% 通过率。
但你把所有这些东西平均起来,再加上长程泛化,就会有点觉得:“哇,我们得到了质感上更好的模型。”
Beren Millidge
我觉得其中很多也只是……RL 确实会有一点泛化。你会在数学和代码之间,或者谜题和数学以及这类东西之间,看到一些迁移。另外,人们现在瞄准的环境数量也大得多。以前当你试图做某个你日常生活中会做的任务时,两年前,实验室其实并不会在意这个。他们不会为了它训练模型。现在范围就广得多了。他们有很多环境专门针对这种具体事情。
Dwarkesh Patel
前面谈话中,我们讨论 RL 时,是在导致这种熵坍缩的语境下谈的,或者说只是把概率集中到基础模型已经做出来的解上,并导致策略中相对稀疏的更新。
但我觉得关于 RL 还有另一个故事,也就是回到 Atari 游戏,然后 AlphaGo 下出第 37 手,那个超级有创造力的一手。因为它从来不是在人类数据上初始化的,所以它能以人类甚至没有想到的方式思考,并提出极有创造力的解法。
你有没有感觉,我们什么时候应该期待,或者是否应该期待,LLM 上的 RL 会产生类似第 37 手这样的东西,也就是甚至超越人类创造力的极端创造力,因为这里有智能的全新初始化?
Beren Millidge
这里有几件事。首先,我觉得 AlphaGo 使用的是 MCTS,它显然比常规策略梯度做了更多探索之类的事情。但我也认为,RL 不一定会降低创造力。
这显然是定性的说法,但如果我们看一下 OpenAI-Hugging Face 事件,这些模型当时会一次想出多个零日漏洞,用来逃出沙箱。这显然已经是某种程度上的“第 37 手”式创造力了,而这只是来自 LLM 的一般泛化属性。RL 绝对不是在彻底摧毁熵,尤其是在长时域上。
John Schulman
人们所说的创造力,有一种其实就是解决困难的搜索问题。第 37 手显然就是一个例子,或者写某种诗,同时满足一大堆不同的约束。如果 AI 为此接受训练,它显然会极其擅长这件事。
然后还有另一种情况:经过 RL 之后,模型输出的多样性低了很多,而且会发展出这些怪癖。即使模型看起来很擅长写作,当你做某种分布分析时,会发现它们总是在重复使用某些主题,也总是在使用同样的角色名。你得不到人类作者那种多样性。你得到的是一种非常好的风格。所以我认为那种多样性确实被 RL 大幅削弱了。
事实上,既然我们前面谈到了蒸馏,有一件正在发生的事是,太多人在做蒸馏,而且主要是从 Claude 蒸馏,以至于所有开放权重模型都像 Claude 一样写作,也有同样的怪癖。我觉得这有点令人担忧,因为一种单一文化正在出现。
Beren Millidge
不过,我还是不认为这是 RL 作为一种方法的根本问题。蒸馏也是一样。即使是蒸馏,你也只是在数据上训练。仅仅因为你的数据不够广泛,并不意味着训练方法本身在某种意义上是错的。这是数据的问题。
我认为很多 RL 的熵坍缩,比如说,基本上是因为在环境多样性不够大的情况下,对相当简单的验证器进行了利用。比如写作,大概是由某个评判器来评分。这个评判器有某些特定的怪癖,模型学会了钻评判器的奖励漏洞,所以它才会坍缩。但这其实是评判器的问题,不是一般意义上 RL 的问题。
Dwarkesh Patel
好,关于未来做一个超快速预测。我想问下面几个问题的时间线。到什么时候我们会有这样的模型……对用户来说,感觉是这样的:你基本上可以把它当作各种白领工作的即插即用远程员工来雇用?不只是写代码,还包括视频剪辑、法律、律师助理等等。它真的就是一个实际的远程员工,能够完整使用电脑,真的可以无缝学习和运行一个月,执行需要和其他人互动等等的复杂项目。一个人类员工一个月里能做的一切。
Charlie O’Neill
如果你强制它使用浏览器之类的东西,而不是公司把信息设置成可以通过程序访问,也许要几年。但如果不是基于浏览器,它可以发 Slack 消息,可以做所有这些事,那我大概还是会说一年左右。
Beren Millidge
如果要达到完全通用性,我会说也许三年。但就 Charlie 的观点来说,我们最终会看到很多人让自己的组织更容易被 AI 使用,所以在那之前你就已经能走到 80% 到 90% 了。
Dwarkesh Patel
抱歉,但一年和三年之间的差别简直就是……
Beren Millidge
我认为会有一条很长的杂项长尾,有些事情某个人类能做,但模型需要相当长时间才能做到。
Dwarkesh Patel
你是在想电脑操作方面的问题,还是基本认知能力的问题?
Beren Millidge
我觉得这其实归结为一个问题:我们能多快解决这种在线学习,以及我们能不能靠压缩、给自己写文件之类的东西走到 80% 到 90%。这是我最大的不确定性。我真的不知道。
Charlie O’Neill
它不擅长的一件事,比如说,如果我在工作中必须对某个人施压才能拿到东西,或者真的要推动某个人把事情做完。模型就是不会这么做。它会太友善。
John Schulman
我会说,人类远程员工的质量差异非常大。如果你试图在 Upwork 上找人做一个软件工程项目,差异会非常大。通常很难让他们做好,或者让他们认真听取你给的所有反馈。我猜在某些情况下,这件事的前 AI 版本,比你现在能从现有 AI 得到的还要糟。
我觉得这最后可能会有点复杂,因为在某种程度上,对一些质量没那么高的工作,我们已经有了这个东西。但显然,在某些更高质量的工作形式上,我们还没有达到人类水平。不过我基本同意 Charlie 和 Beren 的看法,也许一年左右我们会有某种还不错的版本。我们会有那种产品形态,它能把一些事情做得非常好,一些事情做得不那么好,然后从那里继续改进。
Charlie O’Neill
我们总是根据那条很长的长尾来移动球门柱。我感觉你以前用过一个例子,比如报税之类的。今年,我真的只是让 Codex 去把我需要的所有东西找出来,然后发给会计。有一大串东西,它必须用电脑一路点击并下载。它做到了。非常完美。很多这类事情它已经能做了。
Dwarkesh Patel
好:让你获得 10 倍的总生产力提升。基本上,如果你现在需要一年才能做出一个突破,那你每个月就能做出一个突破。
John Schulman
我想我会拒绝给你一个标量数字。在某些类型的工作上,我们可能已经超过这个水平了。假设你在尝试做某些类型的数学,然后……
Dwarkesh Patel
哦,抱歉。但我是说你们作为 AI 研究员,试图推进 AI 研究前沿。AI 研究员会被加速或提升多少?
Charlie O’Neill
大概 5 到 10 年之间?
Dwarkesh Patel
哦,真的吗?好吧,那挺远的。
Beren Millidge
真的吗,你觉得这比通用远程员工还要久?有意思。
Dwarkesh Patel
我意识到你对完全通用远程员工的定义可能非常不同。我刚才本可以早点说清楚。
Beren Millidge
这是真的,因为显然 AI 研究员也可以是远程员工。
Charlie O’Neill
我想象的是一个月周期里的普通白领工作。我觉得超过两个月之后,它开始有点分叉。
Dwarkesh Patel
一个非常能干的白领员工,但不一定是超级有创造力的研究员。
John Schulman
我会说两年。
Dwarkesh Patel
两年?10 倍?好吧。Beren,你呢?
Beren Millidge
其实我有点能理解,因为现在在编码方面,它肯定已经不止 10 倍了。所以如果它甚至能做一两个实验反馈循环,那实际上已经会非常巨大。
Dwarkesh Patel
所以两年内 AI 研究员的生产力提升 10 倍。如果你把这个放进一个非常朴素的 AI 进展模型里,考虑 AI 研究有多少来自 AI 研究员,而且他们的生产力提高了 10 倍,那就意味着从两年后开始,AI 进展速度会极大加快。
Beren Millidge
我认为这会意味着,AI 进展不会再受限于 AI 研究员运行小实验的能力。它会受限于其他东西。
Dwarkesh Patel
当然。但它就是快了 10 倍发生,这是一件大事。这也会帮助下一件事,也就是给你 100 倍加速的东西,更早发生,等等。
Charlie O’Neill
我愿意在这个问题上多花一点时间。
Dwarkesh Patel
关键分歧是什么?
Charlie O’Neill
我的信息吸收能力,以及针对下一个实验做出贝叶斯最优决策的能力。
Beren Millidge
我假设你可以把其中一些事情委托给 AI。AI 在做决策方面正在变得不错。它运行了这个实验,得到了这个结果,然后运行下一个实验。如果它能连续运行两三个实验而不崩,那实际上就是一个很大的提升。
Dwarkesh Patel
好,最后一个问题。一个 AI,在所有可以通过电脑完成的工作领域里,都压倒顶级人类专家。所以不只是 AI 研究,而是所有认知工作。不只是短时域工作,而是字面意义上,如果某件事需要三年之类的时间,AI 仍然会比人类做得更好。
Beren Millidge
这基本上就是 ASI 吧?
Dwarkesh Patel
是的。
John Schulman
我会说 3 到 4 年。
Dwarkesh Patel
卧槽?我是说这听起来也不一定错,但……
John Schulman
AI 显然正在得到更多关注。它是比较难的事情之一,但大量精力正在投入其中。而且它也不是对 AI 来说最难的事情之一,因为它涉及大量代码和数学,而模型非常擅长这些。
对于那些涉及 3D、空间内容和物理内容的事情,我认为会需要更久一点。如果是机械工程之类的东西,而且它现在没有得到最多关注,那可能会更久一点。
Dwarkesh Patel
但它也确实包括一些领域,由于领域本身的性质,相关数据相对较少,而且它必须即时学习那些数据。比如说,它必须在成为 TSMC 的工程师之类的事情上达到超人水平。
John Schulman
所以你必须假设你可以给 AI 同样的入职材料。然后还必须解决关于更长时域学习的某些问题。
Charlie O’Neill
我会说 5 到 10 年。
Dwarkesh Patel
所以基本上,你认为自动化 AI 研究是 ASI-complete 之类的?
Charlie O’Neill
是的,我是这么认为的。我觉得世界上有太多事情,即使你有某种模型外部的记忆系统,即使上下文长度再稍微增长一点,仍然有一些事情,从根本上说,即使你可以研究信息,或者自己写笔记,今天你也会需要超过一百万 token 的上下文窗口。
Beren Millidge
我有点同意 5 年这个范围,至少对实验室正在关注的东西来说是这样。但我认为会有一条很长的长尾,有些东西 AI 理论上可以出去学习,但没人费心去做,算力也没有分配到那里。所以如果说要覆盖字面意义上的每一个人类专家,那可能需要更久。
Dwarkesh Patel
抱歉,但我说的也包括像人类一样快速学习一个新领域的能力。
Beren Millidge
我觉得这不一定是必要的,因为 AI 会拥有远远超过任何人类的经验。
Dwarkesh Patel
非常感谢你们来聊。我觉得这种形式非常适合让不同专家相互提出异议、辩论并一起讨论事情。非常有成效。
John Schulman
谢谢邀请我们。