递归自我改进的真门槛,是改进“改进能力”

日期:2026-09-17 13:20:18 / 人气:9



2026年9月10日,上海交大、清华、字节、小红书、上海AI实验室等机构的一篇论文在中文AI圈刷屏。标题很大:《The Last AI Built by Humans》——人类建造的最后一个AI。

它描绘了这样一条路线:人类先造出一个足够强的AI系统;此后,AI自己发现问题、自己设计实验、自己获取经验、自己训练后继版本,最后甚至改写"如何改进自己"的方法。人类不再是研发链条的主角。

这篇论文最好的地方,是终于有人开始给"AI自我进化"这个词划边界。过去两年,几乎所有东西都被叫作self-improving:改一次Prompt叫自我进化,复盘一次失败轨迹叫自我进化,生成一点合成数据叫自我进化,让Agent给自己加一个工具叫自我进化,跑几轮代码搜索分数涨了叫递归自我改进。

问题是,"AI变强了"和"AI越来越擅长让未来的自己变强",并不是同一句话。后一句,才配得上recursive。

一、先别急着谈"最后一个AI",先看AI已经学会了什么

原论文把通往真正RSI的路径分成五级:

L1 改进执行自主。人类定义任务、规则和验收标准,AI按流程执行并保存经验。

L2 改进策略自主。人类仍规定目标和评测方式,AI开始诊断自己的不足,选择下一步该改Prompt、加工具还是换任务策略。

L3 经验获取自主。AI不再等人类喂数据,主动发现能力缺口,生成或选择值得学习的任务。

L4 环境适应自主。系统在真实环境中试错,积累经验,沉淀成Skills、工具、记忆和工作流,留给下一次任务。

L5 递归元改进。AI修改的对象不再是任务策略、Prompt或某段代码,而是"自己以后如何发现问题、设计实验、选择经验、更新后继版本"的那套改进机制。

L5才是这篇论文真正盯住的目标。前四级里,人类至少还握着一部分决定权:目标谁定,评测器谁造,什么叫变好,哪些版本允许上线。跨到L5后,系统开始碰"改进器本身"。

不过,把RSI说成未来式也不准确。今天的AI已经在改很多东西。

Darwin Gödel Machine(DGM)让Agent修改自己的代码,再通过基准测试筛选后继版本。它的自指性在于:被修改的代码里包含了帮助它继续修改自己的能力。AlphaEvolve把大模型生成、自动评测和演化搜索放进闭环,用于改进算法、代码库、数据中心效率和AI训练流程,效果尤其依赖自动评测器。Self-Harness不改模型权重,让Agent读失败轨迹、诊断问题、再修改自己的Harness(包括Prompt、上下文结构、工具调用顺序、重试逻辑和控制流),在Terminal-Bench 2.0上提高了多种底座模型的通过率。MetaSkill-Evolve让底座模型保持冻结,Skill和Meta-Skill在两个时间尺度上演化,在OfficeQA、SealQA和ALFWorld等任务上带来可观的held-out提升。

它们至少说明两件事:第一,权重更新不是自我改进的必要条件。一个冻结的大模型,只要能持续改造自己的Prompt、Memory、Skills、Tools、Harness和Agent代码,也可以在系统层面变得更强。第二,AI研发里最先被自动化的往往不是"训练新基础模型"这样昂贵的步骤,而是外层脚手架。今天很多Agent的能力差异根本不只在模型本身,还取决于上下文怎么切、失败怎么处理、工具如何调用、结果怎样验证、状态保存在哪里。模型是大脑,Harness决定它能不能把大脑用在一项具体工作上。

但到这里为止,我们还只能说:AI开始会修改自己的一部分。距离真正的递归自我改进,还缺一个比"会改代码"更难的条件。

二、真正的递归,不是结果一代比一代高

假设有一个系统:S₀→S₁→S₂→S₃,每一代任务成绩都比前一代高——70分、72分、74分、75分。很多人看到这里就会说"它在递归自我改进"。这个判断太早了。因为上述过程完全可能只是一个固定优化器重复运行。

真正的递归应该多问一层:第1代系统是否比第0代系统更擅长制造后继者?第2代是否又比第1代更擅长设计实验、发现瓶颈、选择经验和筛掉伪改进?如果没有,这更接近iterative optimization(迭代优化)。如果有,才开始接近recursive self-improvement。

可以把两件事分别写出来。普通自我改进关心任务能力:Q(Sₜ₊₁) > Q(Sₜ)。真正RSI还要关心改进能力:ρ(Mₜ₊₁) > ρ(Mₜ)。其中M是改进算子——发现问题、提出方案、执行实验、评估结果、保留后继版本的那套机制。ρ可以理解为改进生产率:预期能力增量÷总改进成本。成本不能只算GPU,至少包括token、FLOPs、实验次数、墙钟时间、失败样本以及人类在中间投入了多少分钟。

一个系统可能每次都比上次高一分,却越来越慢、越来越贵、越来越依赖人——这不叫"改进能力的改进"。另一个系统也许最终分数暂时没那么高,但它越来越会挑选值得尝试的任务,越来越能减少无效实验,越来越能识别伪提升,越来越能用更少资源造出更好的后继版本——后者才更接近RSI。

原论文提出Structural L5和Effective L5,试图区分"系统结构上能改元机制"和"系统实际表现出元改进效果"。但今天RSI最缺的不是再造一个自我迭代的Demo,而是一套测量"改进能力是否真的进化"的协议。

三、五级路线图很清楚,但世界不一定是一把梯子

原论文把RSI排成L1到L5,传播上有效,但作为科学测量框架有问题:现实中的能力并不总沿着一条线排列。一个Agent可能很会从环境中获取经验,却无法修改自己的训练算法;另一个系统可以重写Harness甚至重写"怎样搜索更优Harness"的策略,却仍依赖人类规定评测器;还有一种系统可以自动设计新学习策略,却只在一个固定benchmark上有效。这三种系统谁更接近RSI?很难用L3、L4或L5概括。

更合理的方式是把RSI看成一个多维空间,而不是五层楼。至少七个坐标轴:

更新对象——从输出文本到模型架构、训练算法、研究策略,越靠后越接近"产生下一次改进的机制"。

闭环程度——谁负责发现问题、提出方案、执行实验、评价结果、决定保留、批准部署。很多系统只是在人类画好的闭环里执行。

持久性与可继承性——改进能否跨session、跨任务、跨版本存在,能否被下一代继承。

迁移能力——在同一批题上更好可能只是benchmark overfitting,更严格的问题是改进能否迁移到未见任务、新领域、换底座模型。

元改进深度——改的是任务行为还是改进策略,是修改一个Skill还是修改"怎样产生、筛选、合并、淘汰Skills"的机制。

评测器独立性——系统说自己变强了谁来确认,能否改评测器,有没有不可修改的外部锚点。

改进生产率——在同样预算下是不是越来越会改。这是大多数RSI taxonomy最容易漏掉的一轴。

一旦把这七个维度放进去,DGM、AlphaEvolve、Self-Harness、MetaSkill-Evolve并不在一条"谁最强"的排行榜上,而是在不同坐标上向前走。它们都是RSI的组成部分,都还不足以构成完整证据。

四、"Self"到底是谁?

过去谈AI自我改进,人们默认"self"指模型权重。但在Agent时代这个定义已经太窄。一个现代Agent更接近:Foundation Model + Operational Scaffold。Scaffold里有Prompt、Memory、Skills、Tools、Harness、控制流、检索策略、权限、工作区和评测逻辑。如果模型不改权重却能长期自主改写这些组件,算不算改进自己?可以算,但前提是必须先声明系统边界。

如果一个外部工程师每隔两天帮它改一次Harness,再把效果归因于"AI自我进化",那就不成立。问题会在边界扩大时迅速变得棘手:如果把系统定义为"AI+人类研究员+数据团队+算力调度器+评测器+云服务",几乎任何现代AI实验室都能被称为自我改进系统,"self"就失去区分度。

所以未来的RSI论文应该强制报告一份"决策权清单":哪些决策权属于系统内部,哪些仍属于外部?谁设定研究目标、决定评测标准、提供训练数据、选择实验环境、给算力、判断版本更好、拥有最终部署权?比起贴L1到L5标签,这份清单更有解释力。

五、真正卡住RSI的,可能不是模型,而是评测器

任何自我改进归根结底要回答:这次更新到底更好了吗?没有可靠的better/worse信号,系统就无法稳定改进。这也是代码、数学、棋类、游戏、定理证明和模拟环境最先出现self-improvement结果的原因——实验便宜、反馈快、结果可复现、对错可自动判断。AlphaEvolve的有效性正建立在可执行的自动评测上;DGM也把benchmark放在闭环中央,让候选版本接受编码任务的经验验证。

AI可以生成一万种改进方案,没有evaluator就不知道哪一种值得留下。而evaluator一旦有漏洞,系统就会把漏洞当成学习目标——这就是Goodhart定律在RSI里的版本。更麻烦的是,未来系统可能开始修改evaluator自身:调整评测脚本、任务、裁判模型或打分阈值,表面上分数越来越高,实际上量尺变短了。谁来评价新评测器?如果答案还是系统自己,问题就陷入无限回归。

真正可用的RSI系统必须拥有"受保护的外部锚点":不可修改的隐藏测试集、形式化验证器、与运行系统隔离的环境结果、定期注入的真实世界反馈,或独立团队维护的审计机制。没有这些东西,自我改进容易变成自我确认。

六、Environment才是RSI的基础设施

很多人把RSI想象成模型越来越聪明于是自然学会改进自己。现实没这么顺。AI能不能自我改进,往往取决于它身处什么环境。能提供高频、低成本、可重复、可验证经验的环境,系统才有机会跑出很快的改进循环——代码环境很适合,游戏环境适合,数学和形式化证明也适合。现实世界就麻烦得多:改善企业销售策略要等几周才知道客户是否买单,优化科研路线实验周期可能是几个月,改进机器人策略摔一跤的成本是真实硬件损坏。

模型决定"它能学多快",环境决定"它有什么值得学"。未来最先出现高速RSI的地方,大概率集中在可验证、可仿真、可重放的封闭环境里——软件工程、算法研究、芯片设计、数学、游戏和部分自动化科学实验。更现实的问题是:哪些研发环节已经变成了机器可以高速试错的环境?

七、一个自我改进闭环至少有六道门

把RSI从浪漫叙事里拿出来,它是一条很长的能力链:Experience→Feedback→Credit Assignment→Update→Retention→Transfer→Verified Capability。每一环都可能断。

经验从哪里来?AI如何发现自己真正不会什么,怎样生成有学习价值又不至于超出能力边界的curriculum?反馈从哪里来?formal verifier、真实环境奖励、人工反馈、LLM-as-a-judge、过程奖励模型,可靠性差别很大。责任该归给谁?一次Agent任务运行几百步,最终失败时到底是Prompt有问题、工具调错了、记忆污染了还是规划失误了?如果分不清责任,改进就变成盲目试错。更新改在哪里?改Context很快,改Harness较快,改Skills可以积累,改权重昂贵,改架构更难。新能力留不留得住?会不会下一轮就忘掉,新策略会不会破坏旧任务?能力能走多远?在原benchmark有效可能是针对量尺的适配。如何确认真变强?成绩提高也许是因为更多token、更长上下文、更好的底座模型或更多人类干预。

很多论文只展示了链条里的一两段。RSI要求的是整条链持续闭合,而不是其中某一环特别漂亮。

八、自己喂自己,不一定会越来越强

Nature在2024年关于model collapse的研究指出,当生成模型递归训练于前代模型生成的数据时,原始数据分布里的长尾信息会逐渐消失,模型出现退化。问题不在于合成数据不能用——代码、数学和可验证推理里的合成数据已经发挥了很大作用——而在于无差别地、长期地、封闭地喂回模型自己的输出。系统会越来越熟悉自己的表达方式、偏好和错误模式,可能更流畅却更远离罕见、困难、反直觉但重要的真实情况。

如果Agent自己出题、自己回答、自己打分、自己选择数据、自己训练下一代,需要格外警惕一种风险:它不是越来越接近世界,而是越来越擅长确认自己。真正的RSI除了self-improvement还需要reality anchoring——系统必须持续接触来自自身之外的现实约束:新数据、新任务、隐藏测试、真实用户、独立验证器、实验仪器或不可操纵的环境反馈。没有它,闭环很容易变成自洽。

九、RSI不等于智能爆炸

递归自我改进不自动推出intelligence explosion。前者研究系统能否改进自己的改进机制,后者讨论这种改进是否会快到失控。中间隔着很多现实阻力:算力需要芯片,芯片需要制造周期;能源和散热不会因为模型会写代码就自动增加;高质量数据、可靠评测器和真实实验反馈都有成本;现实世界实验存在不可压缩的延迟;安全审查、部署审批、硬件验证、监管流程也不会变成零成本。

Anthropic在其RSI公开分析中判断很克制:AI已经在加速AI研发的一些部分,但完整RSI尚未到来,也并非必然发生。OpenAI近期也明确表示,完全自主的递归自我改进当前并未发生。两家前沿实验室的表述和目前公开证据一致:AI-assisted AI research已经发生,Automated AI research正在快速推进,但一个系统能在多代中持续、可迁移、资源匹配地提高自己的改进生产率,还没有得到足够强的公开证明。"RSI会不会出现"和"FOOM会不会出现"是两道不同的问题,不要把两张试卷混在一起答。

十、该怎样证明一个系统真的接近RSI?

现有benchmark常问"这个Agent能不能完成任务",RSI benchmark应该问"这个Agent能不能制造一个更擅长制造优秀后继者的successor"。更有说服力的方法是freeze-and-swap test:先让第0代系统在任务A上改进得到M₁,然后冻结M₀和M₁,放到同一个新起点上——同一个fresh base agent、同一组未见过的任务、同一份token/算力/墙钟时间预算、同一个不可修改的protected evaluator。接着问:谁能造出更好的successor?如果M₁稳定胜过M₀,M₂又稳定胜过M₁,且优势能迁移到新任务、新种子甚至新模型,才开始看到"改进能力的改进"。

一个真正的RSI benchmark至少应记录六类指标:Performance(后继系统任务能力)、Improvement Productivity(单位资源带来的能力增量)、Retention(新版本是否保住旧能力)、Transfer(跨任务/环境/模型迁移)、Evaluator Integrity(是否发生reward hacking或数据泄漏)、Autonomy(多少改进决策从人类手中转入系统内部)。

这套测量不需要等到训练出下一代前沿模型才开始做。现有开源模型就够了,可以从Prompt、Skill、Memory、Harness和Agent code开始,在软件工程、数学、网页操作和模拟环境里做跨代实验。

十一、未来几年,最值得研究的不是又一个"自我进化框架"

未来两到五年,Agent改Harness、Skill库自扩容、模型自动生成课程和合成数据都会继续发生。但真正值得优先做的研究至少有八个更基础的问题:Meta-Improvement Transfer Benchmark(新improver是否更会创造后继者)、Evaluator Co-Evolution with Protected Anchors(系统能改评测器时怎样防止漂移)、Experience Value Estimation(AI怎样判断下一项学习任务值不值得做)、Long-Horizon Credit Assignment(长轨迹失败后责任归给谁)、Harness-Model Co-evolution(模型与Harness是否互相条件过拟合)、Skill Library Lifecycle(技能准入/合并/淘汰/重新验证)、Improvement Productivity Scaling(固定资源后单位成本增量是否跨代提高)、Open-ended Environment Generation(AI能否自己产生新训练环境并保持新颖性和真实反馈)。

尤其第一个——Meta-Improvement Transfer Benchmark,它问的是整个领域一直在暗中假定却很少严格检验的问题:第N+1代系统到底是不是比第N代更擅长制造第N+2代?这个问题足够窄也足够基础,牵着benchmark、meta-learning、Agent evaluation、资源核算、评测器独立性、迁移能力和因果归因,而且可以被证伪。这是好研究问题最重要的品质。

十二、RSI现在最缺的,可能是一门"测量学"

"人类建造的最后一个AI"这个标题当然会吸引所有人,把视线拉向一个巨大的未来问题。但在那之前,研究界要先完成一项更基础也更枯燥的工作:我们需要知道什么算自我改进,哪些提升来自更好的底座模型、哪些来自更多算力、哪些来自隐藏的人类工程、哪些只是benchmark leakage;需要知道系统修改了什么、谁仍掌握决策权、评测器是否独立、改进能否继承、能否迁移、能否在同样成本下越改越快。

这可以叫作RSI Metrology——递归式自我改进测量学。它研究的不是怎样造出一个更会喊"我在进化"的Agent,而是怎样用定义、对照实验、资源归一化、跨代测试、独立评测器和因果分析,判断递归自我改进到底有没有发生。

截至今天,严谨的结论仍然是:我们已经看见了RSI的许多组成部分,已经看见Agent修改自己的代码、Harness、Skills、训练策略和研究流程,也已经看见AI开始加速AI研发。但"一个系统在多代中持续提高自己改进未来后继者的能力",仍然没有被足够严格地证明。

这并不意味着RSI很远。恰恰相反,它已经近到我们不能再满足于一句"AI在自我进化"。我们得开始问:它到底改了什么?谁在判断它变好了?它能在新环境里复现吗?它有没有变得更会改进自己?

要不要我按前几篇"财经深度稿"的调性再收一版:把DGM/AlphaEvolve/Self-Harness/MetaSkill-Evolve各自的论文出处和基准测试结果先核一遍,再把「七轴坐标系—六道门—决策权清单—freeze-and-swap test」压成可发稿的框架图,顺手补一段Anthropic与OpenAI关于RSI公开声明的横向对比?

作者:杏耀娱乐平台




现在致电 5243865 OR 查看更多联系方式 →

杏耀平台 版权所有