openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

admin 2026-09-13 04:39:06 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: openJiuwen发布RSI递归自我改进框架,落地WorkSwarm办公智能体,支持Harness与Artifacts双维度优化,通过四层协作与六阶段闭环实现智能体自我迭代。实验显示SWE-bench通过率提升至87%,算力亲和使TTFT均值下降15.83%。该方案降低多轮优化成本,具备实际应用价值。 综合评分: 75 文章分类: AI安全,安全开发,解决方案


openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

机器之心

2026年9月11日 13:04 上海

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

机器之心发布

让智能体完成一次任务已经不难,难的是让它从每一次任务中学会改进。当前多数智能体还是 “交付即定型”:遇到失败,需要人工复盘日志、修改提示词、补充工具、再重新测试。调优成本高、周期长,有效经验也难以积累。

这正是 RSI(Recursive Self-Improvement,递归自我改进)要解决的问题。 它不是让模型自己训练自己,而是让智能体从真实任务反馈中生成改进方案、执行验证、保留有效改进,帮助智能体持续优化。

早在今年 6 月,由华为 2012 实验室、华为云、终端、计算等团队联合构建的开源 AI Agent 平台 openJiuwen 即发布了 Auto Harness 能力,让智能体能够自动优化自己的一整套 “工作装备”。这一次,openJiuwen 把完整的 RSI 框架落地到了 WorkSwarm 蜂群办公智能体上,率先支持 “可插拔的 Harness + Artifacts” 双维度优化,Artifact 当前包含科研论文和算法程序两类交付产物优化,同时结合 openJiuwen 的算力亲和能力,把多轮优化的成本和耗时压了下来。

对于横跨文档、代码、数据和工具的办公任务,这意味着工作方法可以改进,交付物可以持续打磨,成功与失败的经验也能为后续任务所用。用户像创建普通任务一样发起实验,就能查看优化过程,获得经过验证的成果。

openJiuwen RSI 框架:让自我迭代真正跑起来的工程闭环

openJiuwen RSI 不是一套固定的优化算法,而是让不同自我迭代任务都能稳定运行的工程框架。它以版本化优化对象、可验证的执行证据和可扩展的算法为核心,通过四层协作,把任务目标转化为可执行、可评估的改进过程。

任务层定义 “优化什么、如何评价、能用多少资源”;迭代优化层决定 “下一步试什么、哪些改进可以采纳”;执行层负责 “真正跑起来并返回证据”;基础框架层提供运行、模型与上下文、沙箱隔离、状态恢复和可观测性等统一能力。

整个流程串起了六阶段闭环:评测与验证建立基线;分析与优化定位从失败、轨迹和指标中找到原因;提案与构建生成候选,再按同一标准重新评测;采纳与融合消解冲突、组合有效改进,形成新版本;RSI 经验沉淀提炼方法及适用条件;最后通过归档与停止保存结果、判断是否结束。只要还有预算和改进空间,就会选择父版本继续迭代。

可靠性来自明确的分工。AgentLoop 负责单次任务的 “推理 — 行动 — 观察 — 反馈”,控制器负责跨版本优化,避免用生成者的主观判断代替验证。每份证据都绑定版本和评价上下文,候选经过过滤、融合或配置变更后必须重测;执行失败、证据无效和效果不佳也会分别记录。问题、假设、改进点及采纳或未采纳的原因都会保留,让下一轮既能借鉴成功,也能避开无效方向。

在统一的任务表达、阶段接口和生命周期下,不同对象可以采用各自的算法:

  • 科研论文优化接收研究目标、初稿或实验材料及评价标准,通过 Frontier 选择父版本,提出研究方案,构建包含研究内容和实验结果的论文,再经论文评测决定是否采纳。
  • 科研算法程序优化接收程序文件树、任务数据和标准,通过 PUCT 选择父版本、安排搜索,生成源码修改或修复方案。候选构建运行后,以脚本评测、规则匹配和指标聚合比较效果,指导下一轮搜索。
  • Harness 优化先运行当前版本,依据任务结果和轨迹诊断,再装载候选重跑同一组任务。只有经过自身评测的改进才能被采纳,方法及适用条件也会随之沉淀。

这套框架已经做进 WorkSwarm:新增的 “实验” 模式下,用户可以像创建普通任务一样发起 Harness 优化或产物优化,查看每一轮的改进过程和搜索路径,最终拿到经过验证的 Harness 插件或论文、程序产物。下面分别看三类优化在 WorkSwarm 里的实战案例。

1、Harness 优化:四步把失败案例变成即装即用的新能力

Harness 是智能体的 “工作装备”:Prompt 决定如何理解任务,Skill 提供专业方法,Tool 负责实际操作,Rail 则约束执行过程。当问题出在这些环节时,WorkSwarm 可以直接从失败案例入手,帮助用户改进装备。

1)构建优化数据。准备一份 JSON 评测集,每条用例包含用例标识、任务要求、评测方式,以及参考答案和评分规则。建议优先选真实失败过的任务。

[  {    "id": "case_001",    "input": "需要 Agent 完成的任务",    "judge_method": "llm",    "reference": {      "solution": "参考答案",      "judge_rubrics": "评分规则"    }  }]

2)创建实验。进入 WorkSwarm 的 “实验” 页面选择 “Harness 优化”,填写实验名称,选择优化模型、测试模型和初始插件,再选择评测集、评测方式和最大迭代轮次,即可创建。

3)自动迭代。WorkSwarm 先运行当前 Harness 建立基线,再从失败用例和执行轨迹中定位问题,围绕 Prompt、Skill、Tool 和 Rail 生成候选修改。候选先验证目标用例确实修好,再回放完整评测集确认整体有提升、没有改坏原本通过的任务。页面持续展示得分、迭代轮次、模型用量和搜索树,哪些方案试过、哪些被采纳,一目了然。

4)安装使用。实验产出有效版本后,点击 “安装插件”,最优 Harness 即作为插件包导入并热加载,不用手工复制任何内容;版本信息保留,需要时可以回退。

已关注

关注

重播 分享 赞

关闭

观看更多

更多

退出全屏

切换到竖屏全屏退出全屏

机器之心已关注

分享视频

,时长01:12

0/0

00:00/01:12

切换到横屏模式

继续播放

[ ]

进度条,百分之0

播放

00:00

/

01:12

01:12

倍速

全屏

倍速播放中

0.5倍0.75倍1.0倍1.5倍2.0倍

超清流畅

 您的浏览器不支持 video 标签

继续观看

openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

观看更多

转载

,

openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

机器之心已关注

分享点赞在看

已同步到看一看写下你的评论

视频详情

在 DeepSeek-V4-Flash 任务模型、最多 5 个 Epoch 的配置下,Harness 优化在 SWE-bench Lite Dev 全部 23 道题上的通过率由 61.0% 提升至 87.0%;冻结优化后的 Harness 后,在 Evo-Bench General 64 道独立评测题上的单次执行通过率由 60.9% 提升至 71.9%。结果表明,优化收益不仅覆盖参与迭代的任务,也能泛化到未参与优化的任务。

2、科研论文产物优化:从研究构想到论文成稿,持续打磨

在 WorkSwarm 中,既可以从一个科研构想出发生成科研论文,也可以提交已有科研论文继续优化。

在 “实验” 页面依次选择 “产物优化” 和 “论文”,填写优化指令(研究主题、目标问题或重点改进方向)或选择本地论文文件夹,设置最大迭代轮次,即可创建。

运行期间,详情页展示当前分数、最优论文、模型用量和迭代轮次;论文优化树记录每一轮产生的版本,点击节点可以看到本轮改动、评测结果以及未被采用的原因。实验完成后,预览当前最优产物,确认后一键下载完整论文。

已关注

关注

重播 分享 赞

关闭

观看更多

更多

退出全屏

切换到竖屏全屏退出全屏

机器之心已关注

分享视频

,时长02:17

0/0

00:00/02:17

切换到横屏模式

继续播放

[ ]

进度条,百分之0

播放

00:00

/

02:17

02:17

倍速

全屏

倍速播放中

0.5倍0.75倍1.0倍1.5倍2.0倍

超清流畅

 您的浏览器不支持 video 标签

继续观看

openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

观看更多

转载

,

openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

机器之心已关注

分享点赞在看

已同步到看一看写下你的评论

视频详情

3、科研算法程序产物优化:提交任务包,寻找更优版本

对于可以运行和评价的算法程序,WorkSwarm 支持从现有实现出发自动尝试多个版本,交付最优结果。

首先准备待优化的初始科研算法程序及其评价配置。推荐预先安装并调用 rsi-program-dataset-creator Skill,生成包含初始程序、scorecard 等运行和评价信息的任务包,再在 “实验” 页面依次选择 “产物优化” 和 “程序”,选择任务包文件夹,即可创建与启动优化。

优化过程中详情页展示当前最优分数、模型用量和程序优化树,每个节点是一个候选程序,点击可查看改动、评测结果和失败原因;中途可以暂停,之后再继续。实验完成后,一键下载经过多轮尝试和评测筛选的最优程序,用于后续验证、集成或开发

已关注

关注

重播 分享 赞

关闭

观看更多

更多

退出全屏

切换到竖屏全屏退出全屏

机器之心已关注

分享视频

,时长02:10

0/0

00:00/02:10

切换到横屏模式

继续播放

[ ]

进度条,百分之0

播放

00:00

/

02:10

02:10

倍速

全屏

倍速播放中

0.5倍0.75倍1.0倍1.5倍2.0倍

超清流畅

 您的浏览器不支持 video 标签

继续观看

openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

观看更多

转载

,

openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省

机器之心已关注

分享点赞在看

已同步到看一看写下你的评论

视频详情

4、算力亲和:把 RSI 多轮优化的成本降下来

RSI 的本质是拿算力换智力:反复生成候选、执行任务、评测结果,一次完整实验动辄成千上万次模型调用;优化过程中,提示词、工具描述和任务材料会反复使用,工具调用、评测和重试又带来频繁的暂停与恢复。如果每轮都重新计算相似上下文,优化规模越大,等待和资源开销就越高。

openJiuwen 算力亲和依托昇腾算力基础设施,让推理引擎 “读懂” 智能体的任务状态,框架通过 Agent Hint 把任务运行、等待、恢复和结束等信息传给引擎,帮助引擎在昇腾 NPU 显存、鲲鹏 CPU 内存和远端缓存池之间主动调度上下文缓存(KV Cache):等待时卸载到低成本存储,恢复前提前预取,结束后及时释放。从而降低多轮优化的时延与资源开销,让智能体在持续改进的同时更高效地使用算力。

在科研算法程序优化的实验中也验证了这一收益,开启算力亲和后,TTFT(首 Token 时延)均值下降 15.83%、P90 下降 19.16%;Token 加权 KV Cache 命中率由 7.53% 提升至 14.36%;HBM 与 DDR 峰值使用率分别下降 22.82% 与 30.74%。重复 Prefill 少了,首 Token 更快,存储压力也更低。

结语

openJiuwen RSI 已经形成一条从创建实验到获得优化结果的完整链路:

  • Harness 优化会根据失败案例改进智能体的工作方式;
  • Artifacts 优化打磨科研论文和算法程序等交付产物;
  • 再结合算力亲和,减少重复计算,降低资源开销。

从 Harness 到 Artifacts 的双维度优化,openJiuwen RSI 让优化成为用户可以发起、观察和复用的持续流程:每次改变都有证据,每次采纳都经验证,每轮经验都能帮助下一轮。

后续框架将继续丰富搜索、评测与融合算法,增强跨任务经验复用,并沿统一架构接入模型优化与混合优化,让 Harness、Artifacts 和 Models 在明确的评价标准、预算与安全边界内协同迭代。

RSI 实验模式已在 WorkSwarm 上线,感兴趣的用户可前往官网一键下载,立即体验:

  • WorkSwarm 立即体验:https://openjiuwen.com/workswarm
  • GitHub 代码仓:https://github.com/openJiuwen-ai/
  • AtomGit 代码仓:https://atomgit.com/openJiuwen/

© THE END

转载请联系本公众号获得授权

投稿或寻求报道:[email protected]


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:机器之心 《openJiuwen首发双维度RSI框架,AI自修改,落地办公智能体,算力亲和助力又快又省》

评论:0   参与:  0