智谱提出让AI自己训练自己,RSI能够做什么?

admin 2026-09-15 04:43:20 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 智谱提出让AI参与训练下一代模型的全自主训练方向,指向递归自我改进(RSI)概念。核心是模型参与生成训练数据、搭建任务环境、优化基础设施,使改进能力自身也随代际提升。文档以代码助手为例说明从修正具体问题到改进学习方法的演进,并讨论新信息来自尝试与检验,需用新任务验证能力迁移。 综合评分: 80 文章分类: 其他


智谱提出让 AI 自己训练自己,RSI 能够做什么?

原创

Willis Willis

Willis x AI

2026年9月14日 12:07 上海

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

智谱最近谈起下一代模型时,提出了一个方向:让 AI 参与训练 AI。

8 月 31 日业绩会,智谱提出 Fully Self Training,也就是全自主训练:由模型参与生成训练数据、搭建任务环境、优化基础设施。唐杰也把自进化列为未来 GLM-6.0 的研究方向。

它指向的概念叫 RSI,Recursive Self-Improvement,通常译作“递归自我改进”。

“递归”的意思是:AI 改进了自己的能力,再用改善后的能力,推动下一轮改进。

从改好一道题,到改进学习的方法

拿一个假设的代码助手来说。它写了一个读取表格的程序,普通文件能处理,一遇到空表格就报错。你指出问题,它补上判断,这次任务就完成了。

但下次换一个项目,它可能还会犯同样的错。刚才变好的是那份程序,模型未必学会了更可靠地处理边界情况。

再往前走一步:系统发现自己经常漏掉这类情况,整理出一批训练任务,包含空表格、缺列、异常格式。每道题都有可以实际运行的检查,用结果筛选有效的训练材料,再拿去训练下一版模型。

如果下一版在没见过的新题上也更可靠,改进就留下来了。

RSI 还想继续走下去:能力提高后的系统,能否发现更深的弱项、设计更合适的练习、调整训练或评测方法,让后面的改进也更有效?

前一轮留下的成果,成为后一轮的起点;连“怎样改进”这件事,也在被改进。

智谱把哪些工作交给了 RSI

过去,训练团队要找数据、设计任务、搭建运行环境,再决定哪些结果值得用于训练。模型能力提升以后,这些工作中的一部分,也开始成为模型能够参与的任务。

首先是训练材料。模型可以生成问题、尝试解答,再由验证环节筛选。重点在于留下的东西能教会下一版模型什么,而不只是生成了多少文字。

其次是练习环境。训练一个能干活的 Agent,需要让它操作文件、调用工具、查看执行结果。环境得真的能运行,任务也得有可检查的完成条件。AI 如果能参与搭建这些环境,就能帮助扩大可练习的任务范围。

还有运行 AI 的基础设施。训练和推理依赖大量软件,优化代码能够减少等待和资源消耗。能写代码的模型,也可以参与改进这些系统。

智谱已发布的 GLM-5.3 说明里,有一个具体例子:在机器学习优化任务中,模型使用计算集群、内部文档、代码库和实验结果,完成可量化的提速。这样的训练已经把“读材料、动手做、看反馈”放进了完整工作过程。

全自主训练进一步设想的是,把这些环节接起来:这一代模型帮助造出更好的训练条件,下一代在其中学习,再参与改善后续的训练条件。

新信息从尝试和检验中来

一个自然的疑问是:它不知道的东西,自己反复想就能知道吗?

还是那个程序的例子。模型第一次写错了,但程序运行后会报错,测试会指出输出不符。它根据反馈修改,再运行一次。新的信息来自尝试与检验,不必全靠脑中已有的答案。

难点也在这里:怎样判断改动有没有用?若生成题目、回答问题和评分的模型犯了同一种错,它们彼此同意,也不能让错误变成正确。

回到空表格的例子,如果系统只把原先见过的错误记住了,换一种表格又失败,就还没有学到足够可迁移的方法。必须拿新的任务检验,才能知道留下来的是能力,还是对旧题的适应。

现在 AI 前沿实验室正在推进的,是让这一代 AI 参与培养下一代 AI。RSI 的发展正是在验证:下一代能否把这件事做得更好,让进步一轮轮接续下去?


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:Willis x AI Willis Willis《智谱提出让 AI 自己训练自己,RSI 能够做什么?》

评论:0   参与:  0