DC娱乐网

论文深解:人类建造的最后一代AI?递归自我改进开启自进化纪元 最新论文《The

论文深解:人类建造的最后一代AI?递归自我改进开启自进化纪元

最新论文《The Last AI Built by Humans》正式提出递归自我改进(RSI)完整框架,直指当前 AI 发展的人类中心瓶颈。论文定义了从执行自治到元改进的五级自治体系,描绘了 AI 从人类主导迭代转向系统自主进化的路径,重新定义了下一代 AI 发展范式。

递归自我改进(RSI)是自主闭环过程:AI 系统自主识别自身局限,设计并验证改进方案,再用升级后的能力进一步优化改进过程本身。这超越了单任务迭代优化,本质是把模型开发全生命周期 —— 数据治理、架构搜索、策略选择 —— 的责任,从人类工程师转移到 AI 系统自身。推动这一转向的核心是三大规模负担:基座模型训练的巨量资源需求、规模化生成高质量学习信号的难度、模型部署后动态适配的需求。

论文将 AI 改进能力拆解为 “改进循环” 单元,并据此划分出从 B0 到 L5 的自治层级:

- B0:任务内改进(基线),仅单次任务内优化输出,无持久化改进。
- L1:改进执行自治,AI 执行人类定义的改进步骤,如自动数据清洗、参数调优。
- L2:改进策略自治,AI 自主诊断短板并选择改进策略,人类仅设定总目标。
- L3:学习经验自治,系统自主决定学习议程,基于知识缺口获取新数据与经验。
- L4:部署适配自治,真实环境中持续迭代,自主沉淀经验为长期能力。
- L5:递归元改进,AI 持续修改自身的改进机制,形成自我增强的递归循环。

不同领域反馈机制差异决定了落地进度:科学研究当前达 L2 阶段;具身智能在模拟中可实现 L3,真实场景落地仍有挑战;软件工程是 RSI 最肥沃土壤,已出现受限 L5 级特征,Agent 可修改自身工具与工作流;医疗领域受高风险与强监管约束,高阶自治落地受限。

产业界已有先行验证:ModelBest 用 Agent 生成高性能科学计算内核,实现 1.15-1.9 倍速度提升;Humanlaya 双循环数据质量 RSI,四轮更新后缺陷率从 9.0% 降至 3.7%。

真正实现 L5 级完全自改进仍需突破四大核心挑战:安全继承,避免多轮更新的灾难性遗忘与误差累积;可靠验证,防范 AI 自我评估的奖励黑客问题;自治归因,区分进步来自人类设计还是 AI 自身推理;长周期评估,确保改进能力本身的延续而非单一基准性能。

向递归自我改进的转型,是 AI 发展范式的根本转向。当系统真正实现自主进化,这一代或许真会成为人类亲手建造的最后一代 AI。

递归自我改进RSIAI自进化大模型前沿在线