文章总结: 智谱提出让AI参与训练下一代模型的全自主训练方向,指向递归自我改进(RSI)概念。核心是模型参与生成训练数据、搭建任务环境、优化基础设施,使改进能力自身也随代际提升。文档以代码助手为例说明从修正具体问题到改进学习方法的演进,并讨论新信息来自尝试与检验,需用新任务验证能力迁移。 综合评分: 80 文章分类: 其他
智谱提出让 AI 自己训练自己,RSI 能够做什么?
原创
Willis Willis
Willis x AI
2026年9月14日 12:07 上海
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
智谱最近谈起下一代模型时,提出了一个方向:让 AI 参与训练 AI。
8 月 31 日业绩会,智谱提出 Fully Self Training,也就是全自主训练:由模型参与生成训练数据、搭建任务环境、优化基础设施。唐杰也把自进化列为未来 GLM-6.0 的研究方向。
它指向的概念叫 RSI,Recursive Self-Improvement,通常译作“递归自我改进”。
“递归”的意思是:AI 改进了自己的能力,再用改善后的能力,推动下一轮改进。
从改好一道题,到改进学习的方法
拿一个假设的代码助手来说。它写了一个读取表格的程序,普通文件能处理,一遇到空表格就报错。你指出问题,它补上判断,这次任务就完成了。
但下次换一个项目,它可能还会犯同样的错。刚才变好的是那份程序,模型未必学会了更可靠地处理边界情况。
再往前走一步:系统发现自己经常漏掉这类情况,整理出一批训练任务,包含空表格、缺列、异常格式。每道题都有可以实际运行的检查,用结果筛选有效的训练材料,再拿去训练下一版模型。
如果下一版在没见过的新题上也更可靠,改进就留下来了。
RSI 还想继续走下去:能力提高后的系统,能否发现更深的弱项、设计更合适的练习、调整训练或评测方法,让后面的改进也更有效?
前一轮留下的成果,成为后一轮的起点;连“怎样改进”这件事,也在被改进。
智谱把哪些工作交给了 RSI
过去,训练团队要找数据、设计任务、搭建运行环境,再决定哪些结果值得用于训练。模型能力提升以后,这些工作中的一部分,也开始成为模型能够参与的任务。
首先是训练材料。模型可以生成问题、尝试解答,再由验证环节筛选。重点在于留下的东西能教会下一版模型什么,而不只是生成了多少文字。
其次是练习环境。训练一个能干活的 Agent,需要让它操作文件、调用工具、查看执行结果。环境得真的能运行,任务也得有可检查的完成条件。AI 如果能参与搭建这些环境,就能帮助扩大可练习的任务范围。
还有运行 AI 的基础设施。训练和推理依赖大量软件,优化代码能够减少等待和资源消耗。能写代码的模型,也可以参与改进这些系统。
智谱已发布的 GLM-5.3 说明里,有一个具体例子:在机器学习优化任务中,模型使用计算集群、内部文档、代码库和实验结果,完成可量化的提速。这样的训练已经把“读材料、动手做、看反馈”放进了完整工作过程。
全自主训练进一步设想的是,把这些环节接起来:这一代模型帮助造出更好的训练条件,下一代在其中学习,再参与改善后续的训练条件。
新信息从尝试和检验中来
一个自然的疑问是:它不知道的东西,自己反复想就能知道吗?
还是那个程序的例子。模型第一次写错了,但程序运行后会报错,测试会指出输出不符。它根据反馈修改,再运行一次。新的信息来自尝试与检验,不必全靠脑中已有的答案。
难点也在这里:怎样判断改动有没有用?若生成题目、回答问题和评分的模型犯了同一种错,它们彼此同意,也不能让错误变成正确。
回到空表格的例子,如果系统只把原先见过的错误记住了,换一种表格又失败,就还没有学到足够可迁移的方法。必须拿新的任务检验,才能知道留下来的是能力,还是对旧题的适应。
现在 AI 前沿实验室正在推进的,是让这一代 AI 参与培养下一代 AI。RSI 的发展正是在验证:下一代能否把这件事做得更好,让进步一轮轮接续下去?
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:Willis x AI Willis Willis《智谱提出让 AI 自己训练自己,RSI 能够做什么?》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。











评论