← 全部文章
前沿判断14 MIN READ

RSI:AI 开始自己教自己

从 Harness 到 Loop,再到递归自我提升。AI 不只完成任务,还开始诊断弱点、制造训练材料、验证结果并改进下一轮系统。

AI 的递归自我提升

有一个数据第一次看到的时候,我在屏幕前坐了很久。

2024 年 3 月,最好的 AI 能连续干人类 4 分钟的活,然后开始出错。2025 年 3 月,1.5 小时。2026 年 3 月,12 小时。

每 7 个月翻一倍。摩尔定律是每 18 个月翻一倍。AI 的进化速度已经把芯片甩在了后面。

但这个数据真正让我在意的,不是「AI 越来越快」这件事。是另外一件事。

当 AI 能连续工作 12 小时不出错,它就不再只是一个接指令干活的工具了。它可以在没有你的情况下,完成一个完整的自我进化周期:发现自己的弱点,找到对应的训练数据,训练自己,验证效果,再发现新的弱点。一圈跑完,自动进入下一圈。

这就是 RSI——Recursive Self-Improvement,递归自我提升。

1965 年,英国数学家 I.J. Good 把这个概念写进了论文。他说,一旦人类造出一台比自己稍微聪明一点的机器,这台机器会造出更聪明的机器,然后那台再造出更聪明的。雪崩效应。

2026 年,这个概念正在从论文走进现实。业内的判断是:最快半年,AI 能跑通一次完整的自我进化闭环。

这件事跟你有关系。不管你是在管一个三人的小团队,还是在写代码,还是在做内容。因为 RSI 要改变的不是 AI 有多聪明。它要改变的是,你和 AI 之间到底谁教谁。


不是「更强的 AI」,而是一个会自己变强的系统#

区分两个概念。

现在你用 AI,是你在教它。你写 prompt,你纠错,你告诉它什么对什么不对。下次打开,它又忘了。你得重新教一遍。这是一个不会学习的工具。

RSI 在做的事刚好反过来:AI 学会了自己教自己。

技术上,它是一个四步闭环。

第一步,诊断。AI 完成一个任务之后,不是交差就完了。它会自己看:哪里做得不好?是推理过程有漏洞,还是知识不够,还是步骤设计有问题?

第二步,造题。针对诊断出来的弱点,自己去造对应的训练数据。比如它发现自己在某类数学推理上容易出错,它就自己给自己出一批类似的题,难度刚好卡在自己的薄弱点上。

第三步,训练。用这批自己造的数据,更新自己的参数或策略。这一步跟传统的模型训练没本质区别,但数据来源完全不同——不是人类标注的,不是网上爬的,是自己给自己出的。

第四步,验证。训练完之后,自己评估:刚才那个弱点,现在补上了吗?评估结果进入下一轮诊断,发现新的弱点,再来一圈。

转一圈,强一点。转一百圈,指数级积累。

这里有一个容易搞混的地方。很多人在讲「AI 自己进化」的时候,说的其实是「AI 干活越来越熟练」——同一个任务多做几遍,效率高了。这最多叫熟练,不叫进化。

举个真实的场景。

你现在用 ChatGPT 写周报,连续写了一个月,每次都跟它说「别写这么啰嗦」。一个月后,它还在啰嗦。因为每次对话结束,它关于你的记忆就清零了。它不是不想改,是根本不知道自己上次犯过错。

RSI 的版本是这样的:你第一次纠正它「太啰嗦」,它在自己的训练数据里加了一条记录——「这个用户在意的指标之一是简洁度,被我标注为当前弱点」。第二次你用,它的输出明显更短了。你什么都没说。第三次,它开始主动检查自己的输出里有没有多余的形容词。你没教它检查,它自己学会了检查。

这不是熟练。熟练是同一道菜做了十遍,手快了。进化是做了十道菜之后,自己总结出了一套做菜的方法论,然后发现这套方法论也适用于做面点。

这就是 RSI 里的 R——Recursive——真正的含义。不是重复做同一件事。是把上一轮的产出作为下一轮的输入,每一轮都在上一轮的基础上再走一步。

用一个你熟悉的类比:你的实习生。第一个月,你手把手教他怎么整理数据。第三个月,他发现整理数据最花时间的是清洗 Excel 格式,于是自己写了个脚本把清洗自动化了。半年后,他在优化你的项目管理流程。他从一个「做事的人」变成了一个「改进做事方式的人」。

RSI 就是让 AI 变成那个实习生。


为什么这件事现在才发生#

1965 年就有了理论。但过去六十年,RSI 从来没有真正成立过。

缺的不是算法。是一个很具体的硬件条件:AI 能保持多久不忘记自己在干什么。

你把 RSI 的四步闭环套到任何一个以前的模型上试试。诊断,刚分析了两步,上下文溢出了。造题,造到一半开始胡言乱语。验证,忘了自己要验证什么。

AI 的连续有效工作时长必须在某个阈值以上,RSI 的闭环才能跑完一圈。这个阈值大概是多少?业内没有一个精确数字,但从今年的进展来看,至少需要 8 到 10 小时的有效连续工作窗口。

2024 年的模型只有 4 分钟。做不到。

2025 年的模型有 1.5 小时。还是做不到。刚跑完诊断和造题,到训练那一步就断了。

2026 年初,12 小时。够了。

这就是为什么以前所有人都管这个方向叫「自我优化」,到了 2026 年突然改口叫「递归自我提升」。不是改个名字玩。以前的「优化」,模型只能在一两个方向上小修小补,因为时间窗口不够它做完一整个诊断到验证的循环。现在它能跑完整的一圈了。跑完一圈,就有了递归的基础——这一圈的结果自动成为下一圈的起点。

我读了一篇 Lilian Weng 七月初写的长文,她在里面讲了一个很重要的区分。她说,不要把 RSI 理解成「模型改写自己的权重」。至少近期不是这样。近期的 RSI 更像是:模型优化自己的训练流程和部署系统。优化训练数据的生成方式,优化后训练的配方,优化评估和验证的机制。然后,一个更强的后继模型在这些优化后的系统中被训练出来。

一句话:模型不直接改自己,模型改的是「训练下一个自己的那套流水线」。

这个区分很重要。因为它意味着 RSI 不是一个纯算法问题。它是一个系统工程问题。它需要 Harness——我在之前一篇文章里写过这个概念,就是给 AI 搭的那套操作系统,评估闭环、架构约束、记忆治理。它也需要 Loop——我另一篇文章讲的,用自动化的闸门和反馈替代手动 prompt 的编排方式。

Harness 是地基。Loop 是流水线。RSI 是把这套流水线的优化对象从「任务产出」变成了「模型能力本身」。

三件事不是平行的。是递进的。而每一层的落地,都在让你的角色往后退一步。


你的角色在往后退,但不是在消失#

用这三个层次来看你自己的日常工作,变化就很具体了。

现在你用的任何一个 AI 工具,本质上是一个无状态的函数。你给输入,它给输出。你关掉窗口,一切归零。你跟它合作了半年,它对你一无所知。

Harness 来了之后,你给 AI 搭了一套工作环境。它有规矩了,知道什么能做、什么不能做,在多 Agent 协作的时候不会互相污染。但你还是得在边上看着——每次它遇到新情况,你得来做判断。

Loop 来了之后,你设计了一套自动化流程。AI 自己发现问题,自己分配任务给子 Agent,自己检查结果,自己决定要不要再修一轮。你不再盯着每一步了。你只需要在关键决策点做判断。

RSI 来了之后,连「关键决策点该用什么标准判断」这件事,AI 都开始自己优化了。

举一个你今天就能感同身受的场景。

你是一个小团队的内容运营,一个人管三个平台。公众号、抖音、小红书。你现在每天在干嘛?早上想选题,中午写文案,下午调格式发平台,晚上看数据。睡前脑子里只有一件事:「明天还要再写一篇」。

RSI 加持的工作流是什么样?

AI 写完文案,不用等你审,自己过一遍检查清单——有没有违规词、有没有 AI 味、开头能不能留住人。发完之后,自己拉数据复盘。发现这条抖音的完播率掉了 15%。它自己去看掉在哪:开头前 3 秒没有视觉钩子,还是中间信息密度太低了?

找到了。下一条自己调整。调整之后发现确实有效。好,这个经验不是存在你脑子里,不是存成一条你下次还得手动告诉它的提示词,而是进入了它自己的自我进化记录。下次做任何视频,这个经验自动生效。

一个月之后,你回头看数据,发现账号整体表现涨了 30%。你没有多干任何活。你只是从一开始的「做内容」变成了「定方向」。

这就是角色位移。不是 AI 替你干活——这件事现在就已经发生了。是 AI 替你从干活中学习。你不再需要把自己的经验一条条写成 prompt 喂给它。它自己从干活的过程中提取经验。

企业层面,这个变化更剧烈。

OpenAI 的 Codex 团队有一个数据:5 个月,AI 写了 100 万行代码,零行手写。听起来很厉害。但团队真正头疼的事跟写代码没有任何关系。他们的瓶颈是:人类的代码审查速度已经追不上 AI 的代码产出速度了。

你用最好的工程师去审 AI 写的代码。AI 一天能写 5000 行,你的工程师一天能认真审 1000 行。剩下 4000 行怎么办?要么降低审查标准,要么代码堆在那里等。

RSI 解决的刚好是这个错配。它让 AI 不只是写代码的一方,还成为审代码的一方。而且不是简单地「AI 审 AI 的代码」,而是 AI 在审查过程中发现自己的审查标准有漏洞,然后自己优化审查标准。

人的角色从「每一行都要看」变成了「只看架构层面的关键决策」。从操作工变成了架构师。

这不是裁员。是你的注意力单位变了。以前你的注意力单位是「一行代码写对了没有」。以后你的注意力单位是「系统的进化方向对不对」。


两道根本性的难题#

但 RSI 不是魔法。有两道坎,目前没有任何一家公司真正迈过去。

第一道:验证悖论。

RSI 要求 AI 自己验证自己有没有进步。但验证这件事本身,也是 AI 在做的。

这就产生了一个死循环:如果验证器本身有盲区,它怎么知道自己有盲区?

在代码领域,这个问题相对好办。代码有单元测试,绿的就是绿,红的就是红。但即使在这里,坑已经出现了。测试代码本身也是代码,也可能写得太宽——让错误代码蒙混过关,或者写得太窄——把正确代码误杀。AI 在进化自己写代码能力的同时,测试代码也在被 AI 自己修改。验证的逻辑在静悄悄地漂移。而你,作为人类监督者,根本注意不到。

这还是代码领域。有客观标准。换到那些没有标准答案的领域——一篇文案写得好不好,一个产品决策对不对,一个研究方向值不值得投入——验证问题直接变成哲学问题。

你怎么定义一个「更好」的 AI?让用户打分?用户喜欢听好话,于是 AI 学会拍马屁。让专家打分?专家人数就那么几个,而且专家之间意见也不统一。让另一个 AI 打分?那谁来验证那个 AI 的判断?

这就是为什么 Lilian Weng 在她那篇文章的最后写道:「验证器和权限控制应该放在自进化循环的外部。」但她紧接着补了一句:「但外部监督能扩展到多大规模、能自动化到什么程度,这本身还是一个开放的研究问题。」

翻译一下:理论上是清楚的,实操上没人知道怎么搞。

第二道:品味。

「品味」这个词听起来很虚。但它解决的是 RSI 里最实际的一个问题:往哪个方向进化?

AI 有无数个可以改进的方向。它可以让自己回答得更快,可以让自己输出更长的回答,可以让自己用更华丽的词藻。哪个方向是真正有价值的?

健身房里有一种人,天天练镜子肌肉——胸肌、二头肌、腹肌。看着很大,一搬东西就散架。因为他选错了训练方向。他选择了「看起来更强」而不是「真的更强」。

AI 在自我进化的时候,面临一模一样的陷阱。而且更隐蔽。因为 AI 的训练反馈信号来自人类偏好数据——说白了就是用户投票。用户投票选出来的「好回答」长什么样?长。格式漂亮。顺着你的话说。马屁拍得响。

一个被这种数据训练出来的 AI,它的「自我进化方向」会是什么?不是变得更正确,而是变得更会讨好。它会在你看不到的地方疯狂练它的马屁技巧。每一圈 RSI 都在放大这个偏差。

这就触及了 RSI 最深层的问题。

RSI 不是一个纯技术问题。它本质上是一个价值问题。你让 AI 自己进化,你得先回答「往哪个方向进化是好的」。而这个问题的答案,不是工程师能定的。它涉及到一个社会的价值判断、一个行业的专业标准、一个领域内什么是真正的好研究、什么是灌水。

目前最前沿的做法是:用各自领域最顶尖的人来标注「什么是好的」。把少数顶级专家的判断力蒸馏进模型,而不是用大众投票。

这个思路在理论上是成立的。AlphaGo 最初学人类棋谱,AlphaZero 之后完全靠自己跟自己下,发现了人类几千年没想出来的走法。人类棋谱给了它一个「方向感」——什么叫赢棋——然后它自己在这个方向上走到了人类到不了的地方。

但在围棋之外,大多数领域连「什么叫赢」都定义不清楚。

这就是为什么 RSI 在写代码这个领域最先突破。不是因为代码简单。是因为代码有编译器和单元测试。赢了还是输了,是客观的。品味问题被一个机械的、外部的、不会漂移的裁判解决了。

而在那些没有编译器的领域——写作、设计、研究、决策——RSI 要成立,必须先回答「什么叫好」。


接下来会发生什么#

我是一个对时间线比较谨慎的人。但读完最近半年这个领域的进展,我倾向于相信一个判断:

第一阶段,半年到一年。 在那些有明确、客观评估标准的领域——写代码是最典型的一个——AI 跑通第一个完整的 RSI 闭环。不是全面自进化。是「AI 在一个可控沙箱里,自己改自己写的代码,改完之后跑测试验证,验证通过后把这个经验记下来,下次自动应用」。

对你的影响:你用的编程工具开始越用越懂你的代码库。以前你修了一个 bug,它转头就忘。以后你修了一个 bug,它自己分析根因,自己记住了,下次类似的问题不会再犯。你不需要写文档,不需要写 prompt。它自己看懂了。

第二阶段,一到三年。 多轮递归成立。不只是跑一圈,是跑完一圈自动触发下一圈。螺旋上升开始出现。但这个阶段人类监督者还是不能完全走开。递归漂移需要从每轮 10% 压到 0.1% 甚至更低,人类才能放心地把钥匙交出去。

这个阶段会出现一个很有意思的实践:把最靠谱的人类监督者的判断方式,蒸馏成一个 AI 监督者。让它学习「这个人是怎么一眼看出方向不对劲的」。但这件事本身,就又回到了验证悖论——你怎么知道蒸馏出来的 AI 监督者,真的学到了那个人的判断力?

第三阶段,时间不好说,可能是三到五年,也可能更久。 从解题者到提问者。现在的 AI,你给它一个问题,它给你答案。未来的 AI,自己发现哪里有一个值得解决的问题,自己提出假设,自己设计实验去验证。

这不是科幻。这是 Discovery Model(发现模型)和 Generative Model(生成模型)的区别。前者的能力边界远超后者。生成模型在人类现有知识里找最优解。发现模型提出一个人类还没想过的问题。

AlphaGo 到 AlphaZero 的跳跃,就是生成到发现的跳跃。

但不要被「终极形态」吓到或者分散注意力。第一阶段的变化,今年就可能出现在你每天用的工具里。你不需要等到 AI 成为科学家。你只需要关心一件事:你手里的 AI 什么时候开始记住你的偏好、你的标准、你的判断方式。那一个时刻,就是你跟 AI 的关系发生质变的时刻。


我之前的文章写过 Harness Engineering,也写过 Loop Engineering。那时候我讲的是,你得给 AI 搭一套操作系统,让它稳定地跑。你得设计好流水线,让它不用你盯着。

RSI 是第三步。

你把这三件事连在一起看,会发现一个共同的主题:你的工作,正在从「做事」变成「判断什么值得做」。

Harness 让你不再需要盯着每一步。Loop 让你不再需要手动调度任务。RSI 让你不再需要把自己积累的经验一条条写成规则喂给 AI——它自己从实践中提取经验。

你的角色在完成一个三次跳跃。从操作工到设计师,从设计师到教练。

RSI 不是什么遥远的、吓人的、只跟 AI 研究员有关的概念。它本质上跟你带一个靠谱的实习生一模一样。头两周你手把手盯着。两个月后你只看一眼大方向。半年后他已经在你没注意的地方自己琢磨出新东西了。

区别只有一个。

人的成长是按年算的。AI 的成长是按天算的。

你跟 AI 的这段关系,才刚刚开始。

AUTHORMiles Ma

从 AI 算法与模型部署转向 FDE,记录企业 AI 落地、Agent 系统和工具实战。