RSIBench-Data:LLM Agent 能否成为数据驱动的递归自我改进引擎 · 干货攻略
- 链接: https://x.com/cwolferesearch/status/2082923633593176426
- 分类: x-tips
- 来源: X @cwolferesearch
- 作者: Jay
- 更新: 2026-08-13
- 论文: https://arxiv.org/abs/2607.25886
这是什么
RSIBench-Data(Evolvent AI × 新加坡国立大学,arXiv:2607.25886,cs.SE,2026 年 7 月 28 日)是首个专门评测 LLM Agent 作为数据研究员(data-centric researcher)进行递归自我改进的受控基准。
它的核心问题:给一个固定的模型和训练基础设施,LLM Agent 能否自主诊断能力短板、设计针对性的训练数据策略、通过反馈迭代改进,最终提交一个更好的 checkpoint?
论文作者:Fanqing Meng、 Lingxiao Du、 Qiguang Chen、 Ziqi Zhao、 Haocheng Lu、 Mengkang Hu、 Michael Qizhe Shieh
为什么值得关注
谁分享的
@cwolferesearch(AI 评测研究达人),转自 2026 年 7 月 28 日原帖。论文同期在 X 上引发关注。
解决什么问题
递归自我改进(Recursive Self-Improvement, RSI)是 AI 能力提升的"圣杯"之一:让 AI 系统把自身失败的证据转化为有效的模型改进。传统 RSI 论文通常把数据研究、训练、评测、系统实现全部耦合在一起,导致无法单独评估"Agent 作为研究员"的能力。
RSIBench-Data 把这些全部解耦,只测一件事:Agent 能否独立完成数据驱动的研究闭环——形成假设 → 设计训练数据策略 → 通过受控训练验证 → 根据 checkpoint 反馈迭代 → 选择最优提交。
这对于 AI 工程团队意味着:如果你想用 Agent 来自动化 post-training 数据工程,这个 benchmark 告诉你当前 Agent 的能力边界在哪里。
核验过程
官方来源
- arXiv 摘要页(https://arxiv.org/abs/2607.25886):核心数据全部来自此处,包括 58.33%、78.26% 两个关键数字。
- arXiv HTML 全文(https://arxiv.org/html/2607.25886v1):含完整 Abstract、Introduction、protocol 定义和贡献总结。
- GitHub 仓库(https://github.com/evolvent-ai/RSIBench-Data):README 披露了全部基础设施细节(Tinker、E2B、Harbor)、6 个评测配置、3 个 Agent harness(Claude Code、Codex、Kimi Code)和 Docker 运行环境说明。
交叉验证
- alphaXiv 综述(https://www.alphaxiv.org/overview/2607.25886):独立确认了 58.33% / 78.26% 两个数字,并补充了"Discovery-Reliability Gap"命名。
- 4 个 YouTube 技术解说(搜索结果中)均独立引用了相同数字。
- 关键数字 58.33% 和 78.26% 在 arXiv 摘要、HTML 全文、GitHub README、alphaXiv、YouTube 总结五方来源中完全一致。
官方文档与原帖的差异
原帖说法"58% 场景能初步改进但 78% 无法保持峰值"与官方完全一致,数字表述略有出入(原帖取整为 58%/78%,官方为 58.33%/78.26%,以官方为准)。
上手步骤
基础设施要求
| 组件 | 用途 | 官方说明 |
|---|---|---|
| Tinker API | 模型训练与服务 | 需有 Qwen/Qwen3.5-35B-A3B-Bure 访问权限 |
| E2B API | 云端沙箱评测(Pro 计划推荐) | 每轮评测在独立 E2B 沙箱运行 |
| Claude Code / Codex / Kimi Code | 数据研究员 Agent | 三选一,配置在 DATA_AGENT_HARNESS |
核心协议(固定栈)
目标模型固定为 Qwen3.5-35B-A3B-Base,训练方法固定为 LoRA SFT,Agent 只控制训练数据策略。评测在 Harbor + E2B 沙箱中隔离进行,与训练栈完全分离。
快速启动命令
# 1. 克隆仓库
git clone https://github.com/evolvent-ai/RSIBench-Data
cd RSIBench-Data
# 2. 初始化 seed factories(只读参考数据源)
git submodule update --init --recursive seed_factories
# 3. 配置环境变量
cp .env.example .env
# 编辑 .env,填入 TINKER_API_KEY 和 E2B_API_KEY
# 4. 激活虚拟环境
source .venv/bin/activate
# 5. 选择评测目标(默认 swe-bench-verified)
export TARGET_BENCHMARK=swe-bench-verified # 可选:gpqa-diamond, aime, terminal-bench-2 等
export DATA_AGENT_HARNESS=claude-code # 或 codex / kimi-code
# 6. 运行单次研究会话
bash runner/run_session.sh
Docker 方式(隔离环境)
# 构建包含 Claude Code 2.1.197 + Codex 0.142.5 的运行时镜像
docker build --network=host \
--build-arg CLAUDE_CODE_VERSION=2.1.197 \
--build-arg CODEX_CLI_VERSION=0.142.5 \
-f docker/rsibench-runtime.Dockerfile \
-t rsibench-runtime:ubuntu24-claude-2.1.197-codex-0.142.5 \
docker
# 在 Docker 中运行
bash tools/run_session_in_docker
评测配置一览
| 目标基准 | 任务数 | Agent | Seed Factories |
|---|---|---|---|
| SWE-bench Verified | 100 | mini-swe-agent | SWE-smith, SWE-Gym, swe-factory |
| SWE-bench Multilingual | 100 | mini-swe-agent | 同上 |
| SWE-bench Pro | 100 | mini-swe-agent | 同上 |
| GPQA Diamond | 100 | terminus-2 | synthetic-data-kit |
| AIME 2026 | 30 | terminus-2 | synthetic-data-kit |
| Terminal-Bench 2.0 | 89 | terminus-2 | endless-terminals, tmax |
核心发现
Discovery–Reliability Gap(发现-可靠性鸿沟)
这是论文最核心的发现:
58.33% 的评测设置中,Agent 通过反馈改进了首次有效尝试——说明 Agent 确实具备数据研究员的核心能力。
但在所有越过峰值的搜索中,78.26% 最终提交的 checkpoint 得分低于历史最高点——说明 Agent 无法将反馈可靠地转化为持续改进。
这意味着:最强 candidate 可能出现在搜索早期或中期,后续轮次反而会破坏它。这直接挑战了"让 Agent 多轮迭代就能越来越强"的直觉。
评测的 4 个 Agent 结果
| Agent | 领先基准 |
|---|---|
| Claude Code Opus 4.8 | SWE-bench Verified |
| Claude Code Sonnet 5 | SWE-bench Multilingual |
| Codex gpt-5.6-sol | SWE-bench Pro、GPQA Diamond、AIME 2026、Terminal-Bench 2.0 |
没有单一 Agent 横扫所有基准,跨任务域的泛化仍是开放问题。
强运行的四个特征
轨迹分析发现,强运行普遍具备以下四个特征,论文称其为"stronger-run patterns":
- Accurate hypotheses(准确的假设):正确诊断目标模型的能力短板
- Validation-grounded supervision(验证导向的监督):生成的训练标签有真实来源支撑,而非凭空捏造
- Behavior-aligned data(行为对齐的数据):训练数据与目标能力缺口高度匹配
- Preservation of strong checkpoints(保留强 checkpoint):不在后续轮次中丢弃已发现的峰值
坑与适用边界
当前局限
- Agent 不等于数据工程师:Agent 能发现改进策略(58.33%),但无法保证每轮都做出正确决策(78.26% 回归率)
- 无单一最强 Agent:跨基准泛化能力不足,工程落地时需根据目标域选择 Agent
- 预算敏感:每个 run 有 Tinker 费用上限(~$500),Agent 的 effort level 会影响结果深度
- 数据合规:Agent 必须在 whitelist 的 seed factories 范围内合成数据,不得直接使用评测集
适用场景
✅ 适合的场景 - 评估你的 AI 团队在 post-training 数据策略上的自动化上限 - 决定是否引入 Agent 来做垂类模型的 LoRA SFT 数据工程 - 研究当前 Agent 的迭代稳定性边界
❌ 不适用的场景 - 期望 Agent 完全替代人类研究员(当前结果明确否定这一点) - 跨模型对比(基准固定 Qwen3.5-35B-A3B-Base,不支持换模型)
一句话结论
RSIBench-Data 用受控实验证明:当前前沿 Agent 在 58% 的场景下能找到数据改进策略,但 78% 的多轮迭代反而会让结果回归峰值——它揭示了 AI 自动数据研究有潜力但尚不可靠,是递归自我改进路径上第一块有意义的里程碑。