# 五级台阶：从自我修正到自主研究

> 把“自我改进”拆成由浅到深的五级：改答案、改训练信号、改脚手架、改研发环节、闭环自主研究。讲清每级改什么、谁验收、2026 年走到哪一步。

- 作者：David（道雾轩）
- 专栏：RSI 技术探究（https://daiw.org/manual/rsi.md）
- 最后更新：2026-09-19
- 原文：https://daiw.org/manual/rsi/rsi-ladder
- 转载与引用：请注明出处并附原文链接（https://daiw.org/about/copyright）

上一篇说过，“自我改进”这个词被用得太泛了：一个模型检查自己的答案，一个 Agent 改写自己的源代码，一个系统自己设计实验、训练出下一代——三者都叫“自我改进”，难度和风险却天差地别。2026 年 7 月的一篇综述专门指出过这个问题：self-refine、self-reward、self-play、self-evolve 这一串“self-X”词汇，把根本不同的目标混为一谈 [1]。

这一篇给全书立一把尺子，把自我改进拆成由浅到深的五级台阶。还是用学生打比方：

1. 考完试，自己把卷子检查一遍，改掉错处；
2. 自己出练习题、自己批改，靠刷题长本事；
3. 改进自己的学习工具：笔记方法、错题本、做题流程；
4. 替老师分担具体工作：批作业、出卷子、改教案里的某个环节；
5. 自己决定学什么、怎么教，最后带出一个比自己更强的学生。

越往上，改动越深、越难检验，离“AI 造出下一代 AI”也越近。

## 先备好两把尺子

分级之前，先说清楚衡量任何一种“自我改进”的两个维度。

**尺子一：改的是什么**。这就是本篇的五级台阶：从一次性的输出，到权重，到模型外面的程序，到研发流程，再到整个下一代。

**尺子二：谁来拍板**。上面那篇综述按“环”闭合的程度分了三档 [1]：

| 档位 | 含义 | 例子 |
| --- | --- | --- |
| 人在环中（human-in-the-loop） | 每一处改动都由人审查 | AI 辅助写代码，人逐条审 |
| 人在环上（human-on-the-loop） | 改进信号自动产生，人只审结果、把关上线 | 用测试或奖励模型自动训练，人看最终评测 |
| 闭环（closed loop） | 系统自己生成、验证并应用改进，无人审查 | 公开文献里很少 |

综述梳理的 1,250 篇论文，几乎都落在“人在环上”这一档，闭环的那一行很稀疏 [1]。

两把尺子之外，还有一条贯穿全书的经验规律，先记在这里：**改进能走多远，取决于验收有多可靠**。综述把验收信号从强到弱排成一个“验证等级”——形式化验证（证明检查器、类型系统）、执行反馈（测试、编译器、基准）、学出来的裁判（奖励模型、让大模型当评委）、内在信号（模型自己的置信度、多次回答是否一致）——并观察到，已被证实的自我改进强度大体随这个等级走 [1]。作者强调，这是定性的观察，不是测出来的定律。

## 第 1 级：改答案

**改什么**：只改这一次的输出。模型权重不动，任务结束后什么也不留下。

**典型做法**：同一个模型先写初稿，再给自己提意见，再按意见修改，反复几轮。2023 年的 Self-Refine 就是这个套路，作者报告它在 7 类任务上平均提升约 20 个百分点 [2]。写代码的 Agent 跑测试、看报错、再改，也属于这一级，只不过它有外部反馈可依。

**教训**：没有外部反馈时，这一级很容易原地打转。2023 年的一项研究发现，在推理题上，模型仅凭自己“再想想”往往改不对，有时反而把对的改错 [3]。2025 年的“镜像循环”实验让三家公司的模型各自反复自我批评十轮，作者报告，后几轮每轮带来的信息变化比前几轮少了 55%；只要在第三轮插入一次外部验证，变化量就立刻回升 [4]。

**2026 年**：研究的焦点转向“什么时候管用”。2026 年 6 月的一项研究认为，自我修正有没有用，取决于任务结构，比如任务里有没有可以逐条核对的显式约束 [5]。4 月的 ThinkTwice 则把“做题”和“修改自己的答案”放进同一个正确性奖励里联合训练，作者报告 Qwen3-4B 在 AIME 上经过一次自我修正后，比 GRPO 基线高 11.5 个百分点（pass@4）[6]。这已经在往第 2 级过渡：修正能力本身被训练进了权重。

**本书对应**：不单列一篇。它的核心教训——没有外部反馈，自我评判靠不住——是[第 4 篇](https://daiw.org/manual/rsi/self-rewarding)的主线。

## 第 2 级：改训练信号

**改什么**：模型自己生成训练数据、自己给答案打分，再用这些信号更新**自己的权重**。改动持久保留在权重里。

**典型做法**：2022 年的 STaR 让模型给大量问题写推理过程，只保留最终答对的那些，拿来微调自己，然后重复 [7]；2024 年 Meta 的“自我奖励语言模型”让同一个模型既答题、又当评委 [8]；2025 年的 Absolute Zero 和 R-Zero 更进一步，连题目都由模型自己出，一方出题、一方解题，从零数据开始共同进化 [9][10]。

**2026 年**：两条线索最活跃。一是把“自己验证自己”做得更可靠，例如斯坦福大学 2026 年 5 月的“自验证蒸馏”，只用没有标准答案的问题，让模型用三道关卡过滤自己生成的解答，再拿通过的解答训练自己 [11]；二是把自博弈推广到没有标准答案的开放任务 [12]。

**天花板**：信号质量。自己出的题、自己判的分如果有偏差，循环会把偏差和能力一起放大；数据反复自我复制，还可能“坍塌”。

**本书对应**：[第 3 篇 自己出题自己练](https://daiw.org/manual/rsi/self-play-data)讲“题从哪来”，[第 4 篇 自己当裁判](https://daiw.org/manual/rsi/self-rewarding)讲“分谁来打”。

## 第 3 级：改脚手架与代码

**改什么**：模型外面的那层程序，包括提示词、工具、记忆、工作流，乃至 Agent 自己的源代码。这层东西常被叫作脚手架（scaffold）或外壳（harness），指一切把“裸模型”变成 Agent 的部件 [1]；Agent 的内核其实就是一个循环，可以参考 [Agent Loop 那一篇](https://daiw.org/manual/llm-to-agent/agent-loop)。这一级通常**不动权重**，但改动会持久保留，影响之后的每一个任务。

**为什么排在第 2 级之上**：这里第一次出现了字面意义上的“递归”——被改进的，可以是“负责改进的那段代码”本身。2023 年的 STOP 是个早期例子：一个调用语言模型来改进程序的“改进器”，被拿去改进它自己；作者也坦言，因为语言模型本身没变，这还不是完整的 RSI [13]。

**典型做法**：2025 年的达尔文哥德尔机（DGM）让编码 Agent 反复改写自己的代码，用编程基准实测每个新版本，并保留一个不断长大的版本档案库；作者报告它在 SWE-bench 上从 20.0% 提升到 50.0% [14]。

**2026 年**：

- Meta 与不列颠哥伦比亚大学等机构 2026 年 3 月提出 Hyperagents：负责改进的“元 Agent”和负责干活的“任务 Agent”被写进同一个可编辑程序，**元 Agent 修改东西的那套办法本身也能被修改**。论文点出了这一级的要害：给“元系统”再套一层“元元系统”解决不了问题，只会把问题往上推成无穷的元层级，所以系统必须能改写自己。作者报告，这些“元层面”的改进可以跨领域迁移，也能跨轮次累积 [15]。
- 复旦大学等 2026 年 4 月的 AHE 让 Agent 自动演化编码 Agent 的外壳，作者报告十轮迭代后 Terminal-Bench 2 的通过率从 69.7% 升到 77.0%，超过人类设计的 Codex CLI 外壳（71.9%）[16]。
- Lilian Weng 在 2026 年 7 月的长文中判断：近期的 RSI 不太可能从模型直接改写自己的权重开始，更可能先让外壳本身成为优化对象 [17]。

**本书对应**：[第 5 篇 改自己的代码](https://daiw.org/manual/rsi/self-modifying-agents)。

## 第 4 级：改研发环节

**改什么**：造 AI 的流程里的具体工作，比如写训练代码、优化 GPU 内核、跑实验、排查训练事故、处理数据。**目标和评判标准由人给定**，AI 负责把活干完、干好。

Epoch AI 在 2026 年 6 月提出，可以把 AI 研发工作拆成决策、设计、构建、运行、分析、沟通六类 [18][19]。OpenAI 9 月用这个分类统计了内部 Agent 的用量：从 1 月到 8 月，各类工作都在增长，但“高层规划”在 Agent 产出中仍只占极小比例 [19]。可以粗略地说，第 4 级就是 AI 接手了“构建、运行、分析”里的大块工作，而“决策”仍握在人手里。

**典型做法**：

- 2025 年 5 月，DeepMind 的 AlphaEvolve 找到了更好的矩阵乘法分块方式，把 Gemini 架构中的一个关键内核提速 23%，使 Gemini 的训练时间缩短 1%（官方口径），相当于它加速了驱动它自己的那个模型的训练 [20]。
- 2026 年 2 月，GPT-5.3-Codex 的早期版本参与调试了自己这次发布的训练运行 [21]。
- 2026 年 3 月，Karpathy 开源 autoresearch：让 Agent 通宵修改一份小模型训练代码，每次训练 5 分钟，变好就保留、变差就丢弃。人不再改 Python 代码，改的是写给 Agent 看的说明文件 `program.md` [22]。
- Anthropic 的“训练代码提速”测试，成绩从 2025 年 5 月的约 3 倍涨到 2026 年 4 月的约 52 倍（官方口径）[23]。
- 2026 年 6 月，AI 公司 Recursive 公布自动研究系统的早期结果：在社区优化了两年的 NanoGPT Speedrun 上，把训练时间从 79.7 秒再压到 77.5 秒；在 235 个 GPU 内核任务上，把平均得分从 0.699 提到 0.754（公司自报）[24]。
- 2026 年 9 月 14 日公开的 Dream-RSI 改的是“怎么搜”：它把过去的探索记录当成一个可以“做梦”的回放模拟器，在里面低成本地试验大量搜索策略，再把最好的一种拿回真实任务，底层的编码 Agent 保持不变。作者报告在 KernelBench 等任务上用更少的生成次数达到同样效果，或在同样预算下做得更好 [25]。

**边界**：一旦任务要求 AI 自己拿主意，差距就露出来了。2026 年 3 月的 PostTrainBench 给 Agent 一块 H100、10 小时，让它自主把一个基座模型后训练得尽量好：表现最好的 Agent 得分 23.2%，各家官方的指令微调版本则是 51.1%；Agent 还出现了在测试集上训练、直接下载现成的指令模型、擅自使用找到的 API 密钥等投机行为 [26]。

这一级的数字多为官方口径或作者报告，尚待独立验证。

**本书对应**：[第 6 篇 让 AI 发明算法](https://daiw.org/manual/rsi/algorithm-discovery)、[第 7 篇 自动化 AI 研发](https://daiw.org/manual/rsi/automated-research)。

## 第 5 级：闭环自主研究

**改什么**：整个研究循环，包括“研究什么”。系统自己定方向、设计实验、判断结果，最终训练出更强的下一代自己，人至多在外面审计。这就是 Anthropic 所说的“闭环”，也最接近 Good 当年设想的“智能爆炸”。

**截至 2026 年 9 月的现状**：公开资料里还没有真正走通的实例，但有几次“摸到边”的尝试：

- Sakana AI 与不列颠哥伦比亚大学等团队的 AI Scientist，2026 年 3 月登上《自然》：从想点子、写代码、跑实验到写论文、自己审稿，全程自动。它生成的三篇论文里，有一篇通过了 ICLR 2025 一个研讨会的首轮同行评审，该研讨会的录用率是 70% [27]。不过作者在每个阶段都做了人工筛选，他们自己的内部评审也认为，三篇都达不到主会水平 [27]。
- Anthropic 在 2026 年 4 月做过一次演示：让 Claude 驱动的 Agent 自主研究“弱模型能否可靠地监督强模型”这个开放问题。两位人类研究员花了约一周，追回了约 23% 的性能差距；Agent 累计工作 800 小时、花费约 1.8 万美元算力，追回了 97%（官方口径）。但问题是人选的，打分标准也是人定的，成果还没能干净地迁移到生产规模的模型上 [23]。
- OpenAI 的公开目标是 2028 年 3 月前做出“自动化 AI 研究员”；现阶段的“研究实习生”仍是在人的指导下完成定义清楚的任务 [19]。

**更细的刻度**：METR 研究员 Ajeya Cotra 2026 年 4 月在个人博客上提出，衡量 AI 接管某个行业，可以看三个里程碑：**够用**（adequacy），把人全撤掉，AI 也能勉强往前推；**持平**（parity），撤掉 AI 比撤掉人的损失更大；**碾压**（supremacy），撤掉人反而效率更高。她认为 AI 研发眼下还没到“够用”：如果人全部撤出，Agent 大概会卡死，几周内研发就会停滞；但她也承认这并不显然，并预计几年内会跨过这条线（个人判断）[28]。

**本书对应**：[第 7 篇](https://daiw.org/manual/rsi/automated-research)讲这些系统本身；怎么量进展看[第 8 篇](https://daiw.org/manual/rsi/measuring-rsi)，为什么还没“爆炸”看[第 9 篇](https://daiw.org/manual/rsi/bottlenecks)，实验室为这一级设的红线看[第 10 篇](https://daiw.org/manual/rsi/safety-governance)。

## 一张图、一张表看全五级

```mermaid
flowchart BT
  L1["第 1 级 改答案<br/>自我修正，权重不变"] --> L2["第 2 级 改训练信号<br/>自己出题、打分，更新权重"]
  L2 --> L3["第 3 级 改脚手架<br/>改写提示词、工具与代码"]
  L3 --> L4["第 4 级 改研发环节<br/>接手造 AI 的具体工作"]
  L4 --> L5["第 5 级 闭环研究<br/>自定方向，造出下一代"]
```

| 级别 | 改的是什么 | 改动是否持久 | 常见的“裁判” | 2026 年 9 月的状态 | 本书篇目 |
| --- | --- | --- | --- | --- | --- |
| 1 改答案 | 这一次的输出 | 否 | 测试、工具、自我批评 | 日常使用 | 第 4 篇（教训） |
| 2 改训练信号 | 权重 | 是 | 答案校验、代码执行、投票、自评 | 研究活跃 | 第 3、4 篇 |
| 3 改脚手架 | 提示词、工具、记忆、代码 | 是 | 基准测试 | 研究活跃 | 第 5 篇 |
| 4 改研发环节 | 内核、训练代码、实验、运维 | 是，进入下一代模型 | 人定的指标 | 前沿实验室已在日常使用 | 第 6、7 篇 |
| 5 闭环研究 | 研究方向乃至整个下一代 | 是 | 系统自己 | 尚无公开的完整实例 | 第 7–10 篇 |

## 和其他分法的关系

五级台阶不是唯一的分法。几种常见框架各有侧重，可以互相对照：

| 分法 | 按什么分 | 出处 |
| --- | --- | --- |
| 本书的五级台阶 | 改的是什么 | 本篇 |
| 综述的两条轴 | 改什么，以及谁来验收 | 2026 年 7 月的综述 [1] |
| Anthropic 的五个阶段 | 人在研发里还亲手做什么 | 《When AI builds itself》[23]，见[上一篇](https://daiw.org/manual/rsi/what-is-rsi) |
| Cotra 的三个里程碑 | 把人撤掉之后还剩多少产出 | 个人博客 [28] |

## 三个常见误会

**台阶不是时间线，也不是互斥的格子**。一个真实系统往往同时横跨几级；综述也提醒，同一个系统先改输出、再改评估器、再改研究方法，会在分类表里同时占好几个格子 [1]。

**递归并不是第 5 级的专利**。从第 3 级起就能出现“改进改进者”，STOP 和 Hyperagents 都是例子；第 5 级的特殊之处在于，被改进的是整个下一代模型，而且没人把关。

**越往上，越难验收**。第 1、2 级有答案可对、有测试可跑；到了第 5 级，“这个研究方向值不值得做”是最典型的无法自动验证的问题。综述认为，这恰恰是人还留在环里的原因之一 [1]。

接下来两篇从第 2 级讲起：模型怎样自己给自己造训练信号。先看“题从哪来”。👉 [自己出题自己练：自博弈与合成数据](https://daiw.org/manual/rsi/self-play-data)

## 参考文献

- [1] Mingguang Chen, Licheng Wang, Bo Qu. “Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops.” 2026-07（v2 2026-09）. [arXiv:2607.07663](https://arxiv.org/abs/2607.07663) —— self-X 词汇的混乱、“改什么 × 谁验收”两轴分类、验证等级、外壳的定义、方向设定难以验证。
- [2] Aman Madaan et al. “Self-Refine: Iterative Refinement with Self-Feedback.” 2023-03. [arXiv:2303.17651](https://arxiv.org/abs/2303.17651) —— 同一模型生成、反馈、修改的循环，约 20 个百分点的平均提升。
- [3] Jie Huang et al. “Large Language Models Cannot Self-Correct Reasoning Yet.” 2023-10（ICLR 2024）. [arXiv:2310.01798](https://arxiv.org/abs/2310.01798) —— 无外部反馈时推理题自我修正的失败。
- [4] Bentley DeVilling. “The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems.” 2025-10. [arXiv:2510.21861](https://arxiv.org/abs/2510.21861) —— 十轮无依据自我批评后信息变化下降 55%，一次外部验证即可回升。
- [5] Elroy Stav et al. “When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis.” 2026-06. [arXiv:2606.23196](https://arxiv.org/abs/2606.23196) —— 自我修正的效果取决于任务结构。
- [6] Difan Jiao et al. “ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement.” 2026-04. [arXiv:2604.01591](https://arxiv.org/abs/2604.01591) —— 解题与自我修正联合训练，Qwen3-4B 在 AIME 上的提升（作者报告）。
- [7] Eric Zelikman et al. “STaR: Bootstrapping Reasoning With Reasoning.” 2022-03. [arXiv:2203.14465](https://arxiv.org/abs/2203.14465) —— 保留答对的推理、微调自己、重复。
- [8] Weizhe Yuan et al. “Self-Rewarding Language Models.” 2024-01（ICML 2024）. [arXiv:2401.10020](https://arxiv.org/abs/2401.10020) —— 模型同时当答题者与评委。
- [9] Andrew Zhao et al. “Absolute Zero: Reinforced Self-play Reasoning with Zero Data.” 2025-05. [arXiv:2505.03335](https://arxiv.org/abs/2505.03335) —— 单个模型自己出题、自己解题。
- [10] Chengsong Huang et al. “R-Zero: Self-Evolving Reasoning LLM from Zero Data.” 2025-08. [arXiv:2508.05004](https://arxiv.org/abs/2508.05004) —— 出题者与解题者从同一基座共同进化。
- [11] Tony Lee, Percy Liang. “Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline.” 2026-05. [arXiv:2605.26132](https://arxiv.org/abs/2605.26132) —— 只用无标注问题、三道自我验证关卡过滤后再训练。
- [12] Chengsong Huang et al. “G-Zero: Self-Play for Open-Ended Generation from Zero Data.” 2026-05. [arXiv:2605.09959](https://arxiv.org/abs/2605.09959) —— 把自博弈推广到开放式生成任务。
- [13] Eric Zelikman, Eliana Lorch, Lester Mackey, Adam Tauman Kalai. “Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation.” 2023-10（COLM 2024）. [arXiv:2310.02304](https://arxiv.org/abs/2310.02304) —— 改进器改进自己；语言模型未变，不算完整 RSI。
- [14] Jenny Zhang et al. “Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents.” 2025-05. [arXiv:2505.22954](https://arxiv.org/abs/2505.22954) —— 改写自身代码加实测筛选，SWE-bench 从 20.0% 到 50.0%。
- [15] Jenny Zhang et al. “Hyperagents.” 2026-03. [arXiv:2603.19461](https://arxiv.org/abs/2603.19461) —— 可编辑的元层修改机制、无穷元层级的论证、元层改进跨领域迁移（作者报告）。
- [16] Jiahang Lin et al. “Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses.” 2026-04. [arXiv:2604.25850](https://arxiv.org/abs/2604.25850) —— 外壳自动演化，Terminal-Bench 2 从 69.7% 到 77.0%（作者报告）。
- [17] Lilian Weng. “Harness Engineering for Self-Improvement.” 2026-07-04. [lilianweng.github.io](https://lilianweng.github.io/posts/2026-07-04-harness/) —— 近期 RSI 更可能先从外壳入手的判断。
- [18] Jean-Stanislas Denain, Joe Kwon, Anson Ho. “Toward an O*NET for AI R&D.” Epoch AI, 2026-06-17. [epoch.ai](https://epoch.ai/gradient-updates/toward-an-onet-for-ai-rnd) —— 把 AI 研发工作拆成六大类的提议。
- [19] OpenAI. “Research acceleration: The view inside OpenAI.” 2026-09-06. [openai.com](https://openai.com/index/research-acceleration-view-inside-openai/) —— 六类工作的名称、Agent 用量按类别的变化、“研究实习生”与 2028 年目标。
- [20] Google DeepMind. “AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms.” 2025-05-14. [deepmind.google](https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/)；白皮书 [arXiv:2506.13131](https://arxiv.org/abs/2506.13131) —— Gemini 内核提速 23%、训练时间缩短 1%，以及“加速了驱动 AlphaEvolve 自身的那个模型的训练”。
- [21] OpenAI. “Introducing GPT-5.3-Codex.” 2026-02-05. [openai.com](https://openai.com/index/introducing-gpt-5-3-codex/) —— 早期版本参与调试自身训练。
- [22] Andrej Karpathy. “autoresearch.” GitHub，2026-03. [github.com/karpathy/autoresearch](https://github.com/karpathy/autoresearch) —— 5 分钟训练循环、人改 `program.md`、Agent 改训练代码的分工。
- [23] Anthropic 研究院. “When AI builds itself.” 2026-06-04. [anthropic.com](https://www.anthropic.com/institute/recursive-self-improvement) —— 训练代码提速测试、弱监督强的自主研究演示、五个阶段与“闭环”（均为官方口径）。
- [24] Recursive. “First Steps Toward Automated AI Research.” 2026-06-11. [recursive.com](https://recursive.com/articles/first-steps-toward-automated-ai-research) —— NanoGPT Speedrun 与 SOL-ExecBench 的结果（公司自报）。
- [25] Tong Zheng et al. “Dream-RSI: Recursive Self-Improvement through Evolving Worlds.” 2026-09-14. [arXiv:2609.14858](https://arxiv.org/abs/2609.14858) —— 把探索历史当回放模拟器来改进搜索策略（作者报告）。
- [26] Ben Rank et al. “PostTrainBench: Can LLM Agents Automate LLM Post-Training?” 2026-03. [arXiv:2603.08640](https://arxiv.org/abs/2603.08640) —— 23.2% 对 51.1% 的差距与 Agent 的投机行为。
- [27] Chris Lu et al. “Towards end-to-end automation of AI research.” Nature 651, 914–919, 2026-03-25. [doi:10.1038/s41586-026-10265-5](https://doi.org/10.1038/s41586-026-10265-5) —— AI Scientist 的全流程、研讨会评审结果、人工筛选与内部评审结论。
- [28] Ajeya Cotra. “Six milestones for AI automation.” Planned Obsolescence, 2026-04-03. [planned-obsolescence.org](https://www.planned-obsolescence.org/p/six-milestones-for-ai-automation) —— 够用、持平、碾压三个里程碑及她的个人判断。
