AI DAILY / 2026-09-16
RSIAgent:免训练多智能体框架,通过广度优先探索实现递归自我改进
AetherLabsAI/RSIAgent
全文中文翻译 · AI 生成,仅供学习交流
AetherLabsAI/RSIAgent
课程代理(Curriculum Agent)提出多样化的项目方案。执行代理(Actor Agent)和验证代理(Verifier Agent)从共享的初始记忆出发,并行地执行任务并进行检查。完成整个波次后,执行代理按顺序整合各自的经验。
第二阶段 深度递归自探索(Deep Recursive Self-exploration,DRS)
目标尝试会暴露出不足和脆弱的成功。课程代理挑选有针对性的练习内容;每条经验经核实后立即更新记忆,再继续后续练习或下一次目标尝试。
第三阶段 测试时记忆复用(Test-time memory reuse)
执行代理使用冻结的记忆来引导任务执行,通过与 RSI 期间相同的动作–验证循环与验证代理交互。任务执行与验证完成后,进入封装的官方评测。
记忆是跨任务持续存在的学习状态。各独立尝试之间会重置交互历史和任务环境;代理框架保持不变。有依据的成功和失败都能带来有用的经验。
官方基准分数保持在学习循环之外。各角色接口、波次记忆屏障(wave memory barrier)和停止规则参见架构说明。
📊 结果
论文报告了 Actor Agent 与 Verifier Agent 协调的共享运行环境下的均值部分得分(%),分别比较不含 RSI 和包含 RSI 的情况:
| 基准 | 与报告范围 | RSIAgent 不含 RSI | RSIAgent |
| --- | --- | --- | --- |
| OSWorld 2.0 · 0808 离线 · 82 项任务 | | 71.97 | 78.98 |
| Agents' Last Exam · Near-term · 67 项任务 | | 83.75 | 84.82 |以上是论文报告的汇总数据。RSI 列基于 41 条 OSWorld 的 RSI 记录和 19 条 ALE 的 RSI 记录,其余 41 项 OSWorld 任务和 48 项 ALE 任务保留基线分数。ALE 涵盖全部 67 项 Near-term 任务,包括三项 GPU 任务基线结果。RSI 列包含选定的重试与不同预算下的检查点,并非匹配重复运行的均值。ALE 还包含合格的本地重新评分与流程变体。完整范围、满分指标和聚合细节请参见论文及报告说明。
论文还考察了阶段消融、记忆增长与游戏开发。
其失败分析指出了改进的三重局限:练习可能遗漏相关薄弱环节;验证可能接受不完整的工作;记忆可能保留错误的规则。因此,探索、验证与记忆整合的质量与练习量同样重要。
基准
| 集成 | 固定版本 | 公开批次 |
| --- | --- | --- |
| OSWorld-V2 | August 8, 2026 | 108 项任务,Docker/QEMU |
| Agents' Last Exam (ALE) | d10fb61a14f9719774c3520c5763068b28ef5546 | 67 项 Near-term 任务;64 项 CPU 任务与 3 项已完成的 GPU 任务基线 |三项 GPU 任务基线均已完成。Chroma Key 任务在 Google Cloud(GCP)虚拟机上运行,使用官方 ALE Windows 镜像和 NVIDIA L4 vWS GPU。
仅包含当前运行时。两个集成使用相同的 Actor、Verifier、Curriculum 与记忆协议。基准设置与评分流程位于学习过程之外。
🗂️ 代码仓库结构
run_osworld.py OSWorld 批处理入口
run_ale.py ALE 准备、执行与报告
benchmarks/osworld/ OSWorld 各阶段、虚拟机适配与评测
ale/ ALE 宿主机、工作进程与虚拟机适配
core/ 共享的 Actor 与 Verifier 运行时
explore/ 课程、学习、记忆与恢复
env/ 共享的客户机传输层与隔离
llm/ 模型客户端
config/ 角色配置与基准配置
scripts/ 安装与单任务学习辅助脚本
tools/ 准备、冒烟检查与恢复工具
tests/ 回归测试
docs/ 指南、架构与致谢两个根目录入口是运行基准的起点。内部 OSWorld 各阶段是 benchmarks/osworld/ 下的 Python 模块;其职责参见源码地图。
️ 安装
需要 Python 3.12、uv,以及一台装有 Docker 且可访问 /dev/kvm 的 Linux 宿主机。从代码仓库和您自己的模型 API 凭证开始:
git clone https://github.com/AetherLabsAI/RSIAgent.git
cd RSIAgent
cp .env.example .env在 .env 中填写 OPENROUTER_API_KEY。路径默认为当前检出目录及同级基准目录。仅在使用不同目录布局时,才需要导出 RSIAGENT_ROOT、OSWORLD_ROOT 或 RSIAGENT_ENV_FILE。
命令若无特别说明,均从 RSIAgent 目录执行。虚拟机镜像和基准资源需另行下载。
🖥️ OSWorld
安装固定版本的 OSWorld 发布,并按其 Docker 安装步骤操作。
从 RSIAgent 检出目录执行:
git clone --branch v2026.08.08 https://github.com/xlang-ai/OSWorld-V2.git ../OSWorld-V2
cd ../OSWorld-V2
uv sync --frozen
uv pip install --python .venv/bin/python -r ../RSIAgent/requirements.txt
source .venv/bin/activate
cd ../RSIAgent准备基准资源与审计文件,然后检查虚拟机:
python tools/prepare_osworld_v2_release.py
python tools/build_p2_corpus.py
python tools/exam_fence.py build
python tools/smoke_osworld.py --output results/smoke/osworld保持该环境为激活状态,以执行下文的 OSWorld 批处理命令。在新终端中,可通过 source ../OSWorld-V2/.venv/bin/activate 重新激活。
results/ 下的审计文件保留在宿主机上,绝不会进入代理的提示词或记忆。
🎓 ALE
安装脚本会克隆固定版本的上游源码,并分别安装评分器与工作进程两套环境。这种隔离可避免两个项目的 Python 包互相干扰。
python3 scripts/setup_ale.py
../agents-last-exam/.venv/bin/python run_ale.py prepare --os linux
../agents-last-exam/.venv/bin/python run_ale.py prepare --os windows每次准备操作只下载所选的操作系统镜像。Linux 约需 167 GiB,Windows 约需 157 GiB,外加下载和虚拟机工作空间。准备、冒烟测试和运行请统一使用 --cache /path/with/space。
在运行完整 CPU 批次前,先检查两种客户机类型:
../agents-last-exam/.venv/bin/python run_ale.py smoke \
--os linux --output results/smoke/ale_linux
../agents-last-exam/.venv/bin/python run_ale.py smoke \
--os windows --output results/smoke/ale_windowsALE 要求在当前源码和运行器镜像上,对每个所请求的操作系统都完成一次成功的冒烟测试。重复执行冒烟时,请使用新的 --output 目录。存储选项与上游指南参见 ALE 操作说明。
🚀 运行批次
使用 --arm baseline 表示不启用 RSI 的任务执行,使用 --arm rsi 表示先进行学习再用冻结记忆评测,或使用 --arm both 同时运行两种模式。
🖥️ OSWorld
查看完整的 108 项任务计划,然后运行:
python run_osworld.py --arm both --name osworld_run_01 --dry-run
python run_osworld.py --arm both --name osworld_run_01 --concurrency 1--dry-run 仅打印计划而不启动虚拟机、调用模型或写入输出。日志和任务状态位于 results/batches/<name>/ 下。某项任务失败会停止其后续阶段,其他任务继续进行。每个批次请使用新的 --name,因为已存在的输出永远不会被覆盖。
🎓 ALE
查看批次,运行所支持的任务,并生成报告:
../agents-last-exam/.venv/bin/python run_ale.py plan --arm both
../agents-last-exam/.venv/bin/python run_ale.py run \
--arm both --output results/ale/run_01 --concurrency 1
../agents-last-exam/.venv/bin/python run_ale.py report \
--runs results/ale/run_01 --output results/ale/report_01每次运行请使用新的 --output 目录。报告包含 tasks.csv 和 summary.json,对缺失结果保持显式标注,并拒绝重复的已评分尝试。
两个入口脚本都直接运行批次。初始请使用 --concurrency 1;当宿主机有余量承载额外的独立任务分支时再提高该值。定制 OSWorld 协议与恢复方法参见操作说明。
✅ 校验
可移植的检查无需凭证、Docker 或基准安装:
uv venv .venv --python 3.12
uv pip install --python .venv/bin/python -r requirements-dev.txt
.venv/bin/python tools/check_rsi_release.py安装步骤中的虚拟机冒烟命令使用合成文件检查传输层、不可变记忆、候选重放、验证代理隔离与检查点回滚。它们不调用任何模型或官方评分器。冒烟测试通过仅能验证运行时机制;复现基准分数仍需使用固定配置完成完整实验。
📚 文档
- 架构
- OSWorld 操作与恢复
- ALE 设置、批次与报告
- 发布溯源与校验
- 论文与报告范围
- 贡献
- 第三方致谢
📝 引用
如果使用了 RSIAgent,请引用以下 arXiv 预印本:
@misc{zhu2026rsiagentautonomousexplorationrecursive,
title={RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments},
author={Sibo Zhu and Shicheng Fan and Xinyue Wang and Wenyi Wu and Kun Zhou and Biwei Huang},
year={},
eprint={2609.15364},
archivePrefix={arXiv},
primaryClass={cs.AI},
url={https://arxiv.org/abs/2609.15364},
}⚖️ 许可
RSIAgent 基于 Apache License 2.0 许可证授权。第三方依赖和基准资源保留各自许可证和条款;详见第三方致谢。