RSIBench-Data:LLM Agent 能否成为数据驱动的递归自我改进引擎 · 干货攻略

  • 链接: https://x.com/cwolferesearch/status/2082923633593176426
  • 分类: x-tips
  • 来源: X @cwolferesearch
  • 作者: Jay
  • 更新: 2026-08-13
  • 论文: https://arxiv.org/abs/2607.25886

这是什么

RSIBench-Data(Evolvent AI × 新加坡国立大学,arXiv:2607.25886,cs.SE,2026 年 7 月 28 日)是首个专门评测 LLM Agent 作为数据研究员(data-centric researcher)进行递归自我改进的受控基准。

它的核心问题:给一个固定的模型和训练基础设施,LLM Agent 能否自主诊断能力短板、设计针对性的训练数据策略、通过反馈迭代改进,最终提交一个更好的 checkpoint?

论文作者:Fanqing Meng、 Lingxiao Du、 Qiguang Chen、 Ziqi Zhao、 Haocheng Lu、 Mengkang Hu、 Michael Qizhe Shieh


为什么值得关注

谁分享的

@cwolferesearch(AI 评测研究达人),转自 2026 年 7 月 28 日原帖。论文同期在 X 上引发关注。

解决什么问题

递归自我改进(Recursive Self-Improvement, RSI)是 AI 能力提升的"圣杯"之一:让 AI 系统把自身失败的证据转化为有效的模型改进。传统 RSI 论文通常把数据研究、训练、评测、系统实现全部耦合在一起,导致无法单独评估"Agent 作为研究员"的能力。

RSIBench-Data 把这些全部解耦,只测一件事:Agent 能否独立完成数据驱动的研究闭环——形成假设 → 设计训练数据策略 → 通过受控训练验证 → 根据 checkpoint 反馈迭代 → 选择最优提交。

这对于 AI 工程团队意味着:如果你想用 Agent 来自动化 post-training 数据工程,这个 benchmark 告诉你当前 Agent 的能力边界在哪里。


核验过程

官方来源

  1. arXiv 摘要页(https://arxiv.org/abs/2607.25886):核心数据全部来自此处,包括 58.33%、78.26% 两个关键数字。
  2. arXiv HTML 全文(https://arxiv.org/html/2607.25886v1):含完整 Abstract、Introduction、protocol 定义和贡献总结。
  3. GitHub 仓库(https://github.com/evolvent-ai/RSIBench-Data):README 披露了全部基础设施细节(Tinker、E2B、Harbor)、6 个评测配置、3 个 Agent harness(Claude Code、Codex、Kimi Code)和 Docker 运行环境说明。

交叉验证

  • alphaXiv 综述(https://www.alphaxiv.org/overview/2607.25886):独立确认了 58.33% / 78.26% 两个数字,并补充了"Discovery-Reliability Gap"命名。
  • 4 个 YouTube 技术解说(搜索结果中)均独立引用了相同数字。
  • 关键数字 58.33%78.26% 在 arXiv 摘要、HTML 全文、GitHub README、alphaXiv、YouTube 总结五方来源中完全一致。

官方文档与原帖的差异

原帖说法"58% 场景能初步改进但 78% 无法保持峰值"与官方完全一致,数字表述略有出入(原帖取整为 58%/78%,官方为 58.33%/78.26%,以官方为准)。


上手步骤

基础设施要求

组件 用途 官方说明
Tinker API 模型训练与服务 需有 Qwen/Qwen3.5-35B-A3B-Bure 访问权限
E2B API 云端沙箱评测(Pro 计划推荐) 每轮评测在独立 E2B 沙箱运行
Claude Code / Codex / Kimi Code 数据研究员 Agent 三选一,配置在 DATA_AGENT_HARNESS

核心协议(固定栈)

目标模型固定为 Qwen3.5-35B-A3B-Base,训练方法固定为 LoRA SFT,Agent 只控制训练数据策略。评测在 Harbor + E2B 沙箱中隔离进行,与训练栈完全分离。

快速启动命令

# 1. 克隆仓库
git clone https://github.com/evolvent-ai/RSIBench-Data
cd RSIBench-Data

# 2. 初始化 seed factories(只读参考数据源)
git submodule update --init --recursive seed_factories

# 3. 配置环境变量
cp .env.example .env
# 编辑 .env,填入 TINKER_API_KEY 和 E2B_API_KEY

# 4. 激活虚拟环境
source .venv/bin/activate

# 5. 选择评测目标(默认 swe-bench-verified)
export TARGET_BENCHMARK=swe-bench-verified   # 可选:gpqa-diamond, aime, terminal-bench-2 等
export DATA_AGENT_HARNESS=claude-code        # 或 codex / kimi-code

# 6. 运行单次研究会话
bash runner/run_session.sh

Docker 方式(隔离环境)

# 构建包含 Claude Code 2.1.197 + Codex 0.142.5 的运行时镜像
docker build --network=host \
  --build-arg CLAUDE_CODE_VERSION=2.1.197 \
  --build-arg CODEX_CLI_VERSION=0.142.5 \
  -f docker/rsibench-runtime.Dockerfile \
  -t rsibench-runtime:ubuntu24-claude-2.1.197-codex-0.142.5 \
  docker

# 在 Docker 中运行
bash tools/run_session_in_docker

评测配置一览

目标基准 任务数 Agent Seed Factories
SWE-bench Verified 100 mini-swe-agent SWE-smith, SWE-Gym, swe-factory
SWE-bench Multilingual 100 mini-swe-agent 同上
SWE-bench Pro 100 mini-swe-agent 同上
GPQA Diamond 100 terminus-2 synthetic-data-kit
AIME 2026 30 terminus-2 synthetic-data-kit
Terminal-Bench 2.0 89 terminus-2 endless-terminals, tmax

核心发现

Discovery–Reliability Gap(发现-可靠性鸿沟)

这是论文最核心的发现:

58.33% 的评测设置中,Agent 通过反馈改进了首次有效尝试——说明 Agent 确实具备数据研究员的核心能力。

但在所有越过峰值的搜索中,78.26% 最终提交的 checkpoint 得分低于历史最高点——说明 Agent 无法将反馈可靠地转化为持续改进。

这意味着:最强 candidate 可能出现在搜索早期或中期,后续轮次反而会破坏它。这直接挑战了"让 Agent 多轮迭代就能越来越强"的直觉。

评测的 4 个 Agent 结果

Agent 领先基准
Claude Code Opus 4.8 SWE-bench Verified
Claude Code Sonnet 5 SWE-bench Multilingual
Codex gpt-5.6-sol SWE-bench Pro、GPQA Diamond、AIME 2026、Terminal-Bench 2.0

没有单一 Agent 横扫所有基准,跨任务域的泛化仍是开放问题。

强运行的四个特征

轨迹分析发现,强运行普遍具备以下四个特征,论文称其为"stronger-run patterns":

  1. Accurate hypotheses(准确的假设):正确诊断目标模型的能力短板
  2. Validation-grounded supervision(验证导向的监督):生成的训练标签有真实来源支撑,而非凭空捏造
  3. Behavior-aligned data(行为对齐的数据):训练数据与目标能力缺口高度匹配
  4. Preservation of strong checkpoints(保留强 checkpoint):不在后续轮次中丢弃已发现的峰值

坑与适用边界

当前局限

  • Agent 不等于数据工程师:Agent 能发现改进策略(58.33%),但无法保证每轮都做出正确决策(78.26% 回归率)
  • 无单一最强 Agent:跨基准泛化能力不足,工程落地时需根据目标域选择 Agent
  • 预算敏感:每个 run 有 Tinker 费用上限(~$500),Agent 的 effort level 会影响结果深度
  • 数据合规:Agent 必须在 whitelist 的 seed factories 范围内合成数据,不得直接使用评测集

适用场景

适合的场景 - 评估你的 AI 团队在 post-training 数据策略上的自动化上限 - 决定是否引入 Agent 来做垂类模型的 LoRA SFT 数据工程 - 研究当前 Agent 的迭代稳定性边界

不适用的场景 - 期望 Agent 完全替代人类研究员(当前结果明确否定这一点) - 跨模型对比(基准固定 Qwen3.5-35B-A3B-Base,不支持换模型)


一句话结论

RSIBench-Data 用受控实验证明:当前前沿 Agent 在 58% 的场景下能找到数据改进策略,但 78% 的多轮迭代反而会让结果回归峰值——它揭示了 AI 自动数据研究有潜力但尚不可靠,是递归自我改进路径上第一块有意义的里程碑。