首发双维度 RSI 框架,openJiuwen 让办公智能体实现「自我改进」

摘要

让智能体干完一件事并不难,难的是让它「越干越好」。

让智能体干完一件事并不难,难的是让它「越干越好」。长期以来,办公智能体普遍为「交付即定型」:一旦任务失败或未达预期,需要人工复盘日志、修改提示词、补充工具后再重新测试,调优成本高、周期长,有效经验也难以积累。

近日,由华为 2012 实验室、华为云、终端、计算等团队联合构建的开源 AI Agent 平台 openJiuwen 首发双维度 RSI 框架(Recursive Self-Improvement,递归自我改进),在 WorkSwarm 蜂群办公智能体完整落地,率先支持「可插拔的 Harness+Artifacts」双维度优化,用户只需像布置普通任务一样发起「实验」,就能全程观看智能体如何一步步进化升级。

该成果为 AI Agent 自身迭代改进提供了工程化的答案,在真实办公场景中实现「从失败中学习、在任务中成长」。目前,RSI 实验模式已在 WorkSwarm 上线。

办公智能体有了「错题本」

早在今年 6 月,openJiuwen 就发布了业界首个 Auto Harness 能力,让 Harness 在实战中自动学习、自动优化,提供了一套评测驱动的、覆盖 Harness 全栈组件的端到端自动优化框架。而 RSI 框架则进一步让智能体从真实任务反馈中生成改进方案、执行验证、保留有效改进,帮助智能体持续优化。这意味着对于横跨文档、代码、数据和工具的办公任务,工作方法可以改进,交付物可以持续打磨,成功与失败的经验也能为后续任务所用。

据介绍,openJiuwen RSI 的核心是一套让不同自我迭代任务都能稳定运行的工程框架,以版本化优化对象、可验证的执行证据和可扩展的算法为核心,通过四层协作,把任务目标转化为可执行、可评估的改进过程。

通俗地说,RSI 就像一个团队,任务层决定「优化什么、如何评价、能用多少资源」,迭代优化层决定「下一步试什么、哪些改进可以采纳」;执行层负责「尝试优化并检测结果」;基础框架层提供运行、模型与上下文、沙箱隔离、状态恢复和可观测性等统一能力。

目前,RSI 框架已融入 WorkSwarm 新增的「实验」模式,用户可以像创建普通任务一样发起 Harness 优化或产物优化,查看每一轮的改进过程和搜索路径,最终拿到经过验证的最优结果。

三大场景优化表现优异

根据开发者实战检验,RSI 加成的 WorkSwarm「实验」模式对于需要反复试错、不断优化的场景非常贴合。

例如在 Harness 优化方面,当出现失败案例,用户仅需四步即可完成「改错」:一、准备包含用例知识、任务要求、评测方式、参考答案和评分规则的 JSON 评测集;二、进入 WorkSwarm 的「实验」页面选择「Harness 优化」,选择优化模型、测试模型和初始插件,再选择评测集、评测方式和最大迭代轮次;三、执行自动迭代,页面持续展示得分、迭代轮次、模型用量和搜索树,试错和采纳过程一目了然;四、实验产出有效版本后,点击「安装插件」,最优 Harness 即作为插件包导入并热加载。

基于权威测试集 SWE-bench Lite,该模式使 Harness 优化通过率由 61.0% 提升至 87.0%,同时冻结优化后的 Harness 在 Evo-Bench General 64 道独立评测题上的单次执行通过率也由 60.9% 提升至 71.9%,表现极其优异。

而在科研论文产物优化方面,WorkSwarm 既可以从科研构想出发生成科研论文,也可以提交已有论文继续优化。用户只需要选择目标论文,填写优化指令(研究主题、目标问题或重点改进方向),设置最大迭代轮次,即可创建实验。过程中可在详情页看到当前分数、最优论文、模型用量和迭代轮次,记录了每一轮的改动细节、评测结果以及未被采用的原因。实验完成后支持预览,确认后一键下载完整论文。

在算法程序产物优化方面流程也较为类似,支持从现有实现出发自动尝试多个版本。用户准备好待优化的初始科研算法程序、评价配置和任务包,依次选择「产物优化」和「程序」,即可创建与启动优化。过程中可在详情页看到当前最优分数、模型用量和程序优化树,每个节点可查看改动、评测结果和失败原因,实验完成后,一键下载经过多轮尝试和评测筛选的最优程序,用于后续验证、集成或开发。

以算力亲和降低多轮优化成本

多轮优化的实质是多轮生成候选、执行任务、评测结果,背后是对提示词、工具描述和任务材料的反复使用,也意味着优化规模越大,等待和资源开销就越惊人。成本问题会否让开发者对 RSI 框架望而却步?

openJiuwen 给出的答案是「算力亲和」:依托国产昇腾算力基础设施,让计算引擎「读懂」智能体的工作状态,通过上下文缓存调度等技术,降低多轮优化的时延与资源消耗,让智能体在持续改进的同时更高效地使用算力。

实际测试显示,开启「算力亲和」后,智能体的响应速度提升近 16%,最慢场景下提升超过 19%,命中率由 7.53% 提升至 14.36%,关键存储资源消耗下降两到三成。持续学习与降本增效,在同一个框架里实现了兼得。

至此,openJiuwen RSI 已经形成一条从创建实验到获得优化结果的完整链路:Harness 优化根据失败案例改进智能体的工作方式——Artifacts 优化打磨科研论文和算法程序等交付产物——再结合算力亲和,减少重复计算,降低资源开销。这一突破为智能体持续进化、适应更复杂的场景任务铺平了道路。

openJiuwen 方面透露,后续框架将继续丰富搜索、评测与融合算法,增强跨任务经验复用,并沿统一架构接入模型优化与混合优化,让 Harness、Artifacts 和 Models 在明确的评价标准、预算与安全边界内协同迭代。值得一提的是,华为云 AgentArts 将 openJiuwen 引入到商业化平台能力中,提供开箱即用的体验,感兴趣的朋友可锁定华为全联接大会 2026,现场体验。openJiuwen 官方也提供了在线体验入口,Token 免费。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。