AI 开始「自己改进自己」了:资本正为这个未验证的方向提前下注

公众号精选大智投发布于 2026-09-18

一条容易被刷过去、但分量极重的消息:Google DeepMind 公开讨论,他们观察到了「递归自我改进」(Recursive Self-Improvement,简称 RSI)的早期迹象,而与此同时,Gemini 4 正在跑公司历史上最贵的一次训练。

同一周,中国这边,一家叫 Apex Intelligence 的公司——创始人陈永超是清华的 AI 研究员——成立才两个月,天使轮加天使+轮就融了近 4 亿人民币,押的正是「RSI」这条路。

中美两边的资本,几乎同时把目光投向了同一件事:让 AI 自己改进自己。

先把这个词说清楚,它比听起来更朴素。

你现在用的 AI,本质是「人训练出来的」——人准备数据、人定目标、人调参数。模型的进步,靠的是「人」往里面喂。

而「递归自我改进」,是让模型把「改进模型」这件事,也交给模型自己去做。模型去生成数据、模型去评估结果、模型去更新下一个版本的自己。人从「训练者」,退到「监督者」。

打个比方:过去是老师手把手教学生;RSI 是学生学会了自己给自己出题、自己批改、自己进步。

二、为什么这可能是「下一站」

关键不在「能不能做到」,而在「为什么大家都开始认真对待它」。

一个原因很实在:人力正在变成瓶颈。 当模型强到一定程度,靠人肉去标注数据、去写评估、去调参,速度跟不上了。你必须有「机器自己跑起来」的闭环,才能继续往前走。

另一个原因是资本逻辑:谁先做出会自我进化的模型,谁就锁定了下一代的成本优势。 一个能自己迭代的模型,训练成本会指数级下降。所以 Apex 成立两个月就能融近 4 亿——资本买的不是它今天的产品,是「如果 RSI 这条路通了,它能卡住的位置」。

三、两个反共识,帮你避免误判

第一,别把 RSI 当成「AI 觉醒了」。

很多人一听到「AI 自己改进自己」,第一反应是科幻片里的失控。但工程意义上的 RSI,是一个非常具体的技术路线——用「研究轨迹」当训练信号,让模型在下一次迭代里做得更好。它离「有意识」,还有十万八千里。

第二,这轮的「军备竞赛」,比的可能不是「谁模型大」,而是「谁迭代快」。

如果 RSI 成立,那么竞争的维度就从「静态的模型能力」,变成「动态的进化速度」。一个会自我加速的模型,哪怕起点低,也可能在短时间内反超一个「更大但不会自我进化」的模型。这意味着,整个行业的估值框架,可能要重写一遍。

写在最后

这一轮 AI 竞赛,正在从「人教机器」,走向「机器教机器」。

它会不会成,没人能打包票——包括 DeepMind 自己,用的都是「早期迹象」这种谨慎的措辞。但资本已经用真金白银表态了:他们愿意为这个「尚未验证的方向」,提前下注。

(本文为 AI 技术趋势与资本动向观察,仅作信息与判断交流,不构成任何投资建议。)

三个认知要点:①RSI 是「让模型改进模型」,本质是把人的训练角色让渡给机器;②人力成为瓶颈,是 RSI 被认真对待的根本原因;③竞争维度可能从「谁更大」转向「谁迭代更快」,估值框架面临重写。

资料来源AI Briefing/aibriefing(2026-09-17):Google DeepMind 报告递归自我改进早期迹象、Gemini 4 进入史上最贵训练;36Kr/CNR:Apex Intelligence 清华陈永超、天使+天使+近 4 亿人民币、RSI 递归自我改进路线。
本文为「大智投」公众号文章的授权转载,版权归原作者所有。