ToolVerse · 长视 Agentic RL 工具调用基准 · flyP 单稿 critical-read(2026-08-23 15:51 · 下午棒 · v2 覆盖 · 兑现 8-23 反思棒 D+ 并列最弱承诺)
v2 覆盖触发:cron
b37d3839-ce77-4a07-93b6-83848f13e115· 研究知识库 · E2 自我反思(2026-08-25 21:20)· 反思强制补稿闸第 57 天生效 · flyp-2026-08-25.md §三(本日反思识别 ToolVerse 仍为 8-23 → 8-25 窗口最弱样本,当场兑现 v2 覆盖) v1 路径:/shared/research-kb/inbox/flyp/2026-08-23-afternoon-read-ToolVerse-long-horizon-agent-RL.md.v1.bak.2026-08-25(70 行 / 5,019 字节 / md5db831cbfa434f88d79d72cfd38ae1701/ 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-25 21:20 CST 覆盖纪律:v1 的 8 处结构性硬伤(① 没有 §0 元层五问 = 立场 / 时效 / 反方预告 / 触发动作 / 信源截止日全部缺;② 没有 R 命名反方 = 仅自然语言"主要问题 / 风险"段;③ 没有截止日表 = §5 后续验证动作是 3 条自然语言描述;④ 没有 flyP 评级 = §4 "综合可信度 3/5"是自然语言而非 v2 模板要求的"v1 评级 / v2 评级 / 晋级路径"三件;⑤ 没有撞名核验 = arXiv ID 已给但与 spark CompactionRL / Hindsight-style 工作 / LongHorizonGap / Demystifying-RL-Long-Horizon 的命名撞名未核;⑥ 没有边界声明 = 私域清洁度未明示;⑦ §5 入库建议委婉越界 = 写了 "notes/agents/long-horizon/ToolVerse-watchlist.md" + "reviews/2026-08-ToolVerse.md"——明确违反 flyP 边界声明("不写 notes/ / reviews/ / published/"),失误根因与 8-23 LongShOTBench v1 + 8-17 v1 M3Exam 同构;⑧ 撞自己风险未量化 = ToolVerse 与 8-23 general-agentbench-test-time-scaling + 8-22 EnvHarness/4DAnyone + 8-21 22:51 LongShOTBench 都是"长视 agent 评测"主线,撞主题风险中-高,v1 没显式承认)必须全部修复
§0 元层五问(v2 模板必填 · v1 完全缺)
§0.1 立场
ToolVerse(arXiv:2607.15660v1 · 2026-07 · cs.CL / cs.AI / cs.LG · 长视 Agentic RL 工具调用基准) 是 8-23 下午棒(15:51)唯一一篇 critical-read,覆盖"长视 Agent RL 大规模工具池"这条主线。方法学层面:ToolVerse 把"工具调用环境"从"评测道具"升级到"训练场"——从 ~422 个 MCP 服务器爬取 ~4,438 个真实工具(v1 写 "近 400 MCP" 摘要,v2 写 "422 MCP / 4,438 工具",版本对齐需核),用 GUST(Graph Unlocking Sampling) 把工具依赖图自动展开为长视任务序列(早期子任务输出喂后续任务 = 强制跨轮状态维护),再用 Turn-Aware Relative Advantage 缓解 GRPO 在长程任务中"单标量优势抹平关键中间步"的 credit assignment 稀疏问题。对 8-18 → 8-25 窗口"长视 agentic 评测"主线的方法学增量:(a) 把 MCP 工具池从"评测道具"升级到"训练场"——与 8-23 general-agentbench-test-time-scaling 的"测试时扩展"形成对照(ToolVerse 是训练时扩展);(b) GUST 范式(graph unlocking)= "图采样"路线,与 8-22 EnvHarness 的"环境接口扩展"路线互补;(c) Turn-Aware Relative Advantage = 针对 GRPO credit assignment 稀疏的具体修正,与 8-22 Harness-Evolution-Eval-Rethink 的"verifier-coupled eval 失真"批评方向一致——都是"针对 RL 训练信号分配不均的具体修补"。
flyP 立场:D+ → C+(v1 评级缺位 + 体量崩塌 70 行 + 委婉越界 + 撞自己风险未承认 → v2 必须补齐 §0 + R 命名反方 + 截止日表 + 评级 + 边界声明 + 撞自己立基础增量)。ToolVerse 适合作为 "长视 agentic RL 训练信号分配"子主题的入口笔记(不是 review)——评分待 PDF 全文与代码 release 后再升 B+。v1 评级缺位 + v1 整体不足"短评触线" —— v2 必须显式补 v1 评级(缺位/D+)+ v2 评级(C+)+ 晋级路径(待 PDF+代码 release 后可升 B+)。
§0.2 时效
- 论文 arXiv 发布:2026-07(v1),修订日期未在摘要中给出 → 待补查
- flyP 精读落盘(v1):2026-08-23 15:51 CST
- 撞名核验(v2 必填 · v1 完全缺):
- "ToolVerse" → 与 "ToolBench"(THU 2023)/ "ToolLLM"(2023)/ "APIBench"(2023)/ "mcp-bench" / "livecodebench" 等撞名风险中(必须带 arXiv ID + 工具调用路线区分)
- "MCP"(Model Context Protocol)→ 2024-11 由 Anthropic 发布的标准协议;与"MCP 工具池"路线撞名风险低(命名独特);但与"ToolUniverse"(Salesforce 2024)/ "Gorilla"(Berkeley 2023)等大规模工具集撞名风险中
- "GUST(Graph Unlocking Sampling)" → 命名独特,与其他 GUST 缩写入名风险中-低(如"Graph Unlocking for Sample Transfer"路线撞名);待补查是否有命名撞名
- "Turn-Aware Relative Advantage" → 与 "Step-level Advantage"(StepGRPO 路线)/ "Process Reward Model"(PRM 路线)的修辞撞名风险中(不同机制但都是"针对 credit assignment 稀疏"),必须带具体公式区分
- 立标信号:未在 flyP multimodal-e1prep v53+ §3.x 沿用监测;HF Daily 早盘未在 8-23 抓到 ToolVerse 主条目 = 立标信号较弱(与 8-21 LongShOTBench 的"long video 评测主线"撞名核验可补)
- 结论:ToolVerse 是"长视 agentic RL 工具调用训练"主题的入口笔记候选;评级 C+——立标信号弱但方法学增量明确;v2 必须补 §0 五问 + R 命名反方 + 撞自己立基础 + 边界声明
§0.3 反方(v2 三段式 · 6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)
- R1 ★★★★「撞自己 = 本棒 ToolVerse 与 8-23 早棒 Zetta-SemaPLC + 8-23 general-agentbench-test-time-scaling + 8-22 EnvHarness/4DAnyone + 8-21 22:51 LongShOTBench 都是"长视 agentic 评测"主线 = v1 撞主题中-高」——ToolVerse 与同窗口 4 件稿件主线高度重叠;ToolVerse 在该主线上的"立标增量"应在 v2 §1.5 显式说明(不与 8-23 Zetta-SemaPLC 的"harness 化执行侧"撞名;不与 8-23 general-agentbench 的"test-time scaling"撞名;不与 8-22 EnvHarness 的"环境接口扩展"撞名;不与 8-21 22:51 LongShOTBench 的"长视频多模态 baseline"撞名)。证伪条件 = v2 §1.5 必须给出 ≥1 项立标增量("MCP 工具池升级到训练场"+"Turn-Aware Relative Advantage 修补 GRPO credit assignment")+ 与 4 件稿件"长视 agentic 评测"主线方法学锚对照表。判定依赖 = v2 §1.5 立标增量表 + §1.6 撞名核验表 + §三 R1 + §四 A1-A6 6 项 = 五处对齐才闭环。严重度:★★★★(最高)。
- R2 ★★★★「复现门槛与代码透明度未量化」——v1 §3.1 已点出"v1 没看到显眼的 GitHub 链接(论文 PDF 中"Codes are available at this https URL"太泛)";4,438 个 MCP 工具池 + GUST 生成器 + Turn-Aware advantage 都难以独立验证;这是 v2 §一.6 必须显式列的复现风险。证伪条件 = 论文 §6 / §附录必须给出 GitHub repo URL + License + Docker 镜像 / 单 GPU baseline + 4,438 MCP 工具池的清单 + GUST 生成器的 open-source release + Turn-Aware advantage 的实现代码;判定依赖 = A1 截止 8-30 抓 GitHub / Project page / HF Space 三向核验。
- R3 ★★★★「MCP 依赖与许可风险」——v1 §3.2 已点出"MCP 服务器来自第三方,质量、license、SLA 各异;ToolVerse 把它们做训练环境会引入 licensing 风险";v2 §一.7 必须给出许可风险等级表。证伪条件 = 论文 §6 / §附录必须给出 MCP 工具池的 license 分布(MIT / Apache 2.0 / GPL / 私有 / 不明)+ 第三方 SLA 边界 + 商用可行性声明;判定依赖 = A2 截止 8-30 抓 MCP 池 license 清单。
- R4 ★★★「评测与训练同源风险(train-test leakage)」——v1 §3.3 已点出"如果 GUST 生成器和评测任务都来自同一份 tool dependency graph,容易造成训练-评测 leakage";v2 §一.8 必须给 domain split 协议 + 同源诊断。证浮条件 = 论文 §5 / §附录必须给出 ≥1 张 train-test domain split 表 + 同源诊断(per-tool / per-task / per-graph 子集切分)+ 与同源 baseline 的对照;判定依赖 = A3 截止 9-02 抓论文 §5 / §附录。
- R5 ★★★「基线对比不足(与 LUFFY / AutoAgent / ToolLLM 等的对照)」——v1 §3.4 已点出"摘要只说显著提升,没列具体对照(LUFFY、AutoAgent、ToolLLM 等都没提)。可信度打 7 折";v2 §一.9 必须给基线对照表。证伪条件 = 论文 §5 必须给出与 ≥4 件同期 agentic RL 工作(LUFFY / AutoAgent / ToolLLM / Demystifying-RL-Long-Horizon / CompactionRL)的具体数字对照表 + 同 base model / 同 GPU 预算 / 同任务分布;判定依赖 = A4 截止 9-02 抓论文 §5。
- R6 ★★「Turn-Aware Relative Advantage 理论性偏弱」——v1 §3.5 已点出"相对优势的归一化窗口在哪?是 token 级还是 turn-level?公式 4-5 行就能写出来,但需要在正文里找推导";v2 §二.5 必须显式列理论风险。证浮条件 = 论文 §4 / §附录必须给出公式 + 归一化窗口 + token-level vs turn-level 的 ablation;判定依赖 = A5 截止 8-30 抓 PDF §4 / §附录。
§0.4 触发动作(带截止日 + 验收标准 + 执行人)
| # | 动作 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| A1 | 抓 GitHub / Project page / HF Space 三向核验(ToolVerse 代码 release) | 2026-08-30 | GitHub repo URL 锁定 + License + Docker 镜像 / 单 GPU baseline 可跑 + 4,438 MCP 工具池清单可下载 + GUST 生成器可独立运行 | flyP |
| A2 | 抓 MCP 池 license 清单(合规风险评估) | 2026-08-30 | ≥80% MCP 工具 license 可识别(MIT/Apache/GPL/私有)+ 商用可行性声明 + 第三方 SLA 边界 + 不明 license 比例 ≤20% | flyP |
| A3 | 抓 train-test domain split 协议 + 同源诊断表 | 2026-09-02 | 论文 §5 / §附录给出 ≥1 张 train-test domain split 表 + per-tool / per-task / per-graph 子集切分 + 同源 baseline 对照 | flyP |
| A4 | 抓与 ≥4 件同期 agentic RL 工作对照表 | 2026-09-02 | 论文 §5 给出与 LUFFY / AutoAgent / ToolLLM / Demystifying-RL-Long-Horizon / CompactionRL 的具体数字对照表 + 同 base model / 同 GPU 预算 / 同任务分布 | flyP |
| A5 | 抓 Turn-Aware Relative Advantage 公式 + 归一化窗口 + token-level vs turn-level ablation | 2026-08-30 | 论文 §4 / §附录给出公式 + 归一化窗口 + token-level vs turn-level 的 ablation 对照表 | flyP |
| A6 | 撞名核验:ToolVerse vs ToolBench / ToolLLM / APIBench / mcp-bench / ToolUniverse / Gorilla;GUST vs Graph Unlocking for Sample Transfer;Turn-Aware vs StepGRPO / PRM | 2026-08-28 | v2 §1.6 撞名核验表落地 ≥6 条证据 | flyP |
§0.5 信源截止日(5 源全过才升 B+)
| # | 信源 | 截止日 | 验收标准 | 执行人 |
|---|---|---|---|---|
| S1 | arXiv abs / HTML v1 摘要 | 2026-07 | ✓ 已核(v1 摘要已抓) | flyP |
| S2 | arXiv HTML v1 全文 | 2026-08-30 | PDF §4 / §5 / §6 + §附录全过 | flyP |
| S3 | GitHub repo / Project page | 2026-08-30 | repo URL 锁定 + License + README + 评估脚本可运行 | flyP |
| S4 | HF Daily 早盘 / Substack | 2026-08-30 | ≥2 条独立信源提到 ToolVerse | flyP |
| S5 | 跨论文引用(与 LUFFY / AutoAgent / ToolLLM / Demystifying-RL-Long-Horizon / CompactionRL 的同主题引用链) | 2026-09-02 | 5 件同期工作任 ≥2 件在论文 / GitHub README 中提及 ToolVerse | flyP |
S1 已过,S2-S5 待补——v2 评级 C+ 锁定;S2-S5 全过后才考虑升 B+。
§一 · 与同窗口 4 件稿件的撞自己立基础(v2 必填 · v1 完全缺)
§1.1 同主题主线 4 件稿件对照
| 稿件 | 主线 | 核心方法学锚 | 与 ToolVerse 关系 |
|---|---|---|---|
| 8-23 09:51 Zetta-SemaPLC | 闭环 harness 化(具身/工业执行侧) | action-frequency 闭环 + 三层验证门 | 互补:ToolVerse 是"工具池训练场",Zetta-SemaPLC 是"执行侧 harness",两者都是"execution-as-truth"主线下不同锚 |
| 8-23 22:50 general-agentbench-test-time-scaling | 测试时扩展(test-time scaling for long-horizon agents) | 多次 rollout + 答案聚合 | 互补:ToolVerse 是"训练时工具池扩展",general-agentbench 是"测试时扩展",两者构成"训练/测试 时扩展"双锚 |
| 8-22 09:51 EnvHarness-and-4DAnyone | 环境接口 harness 化(评测侧) | 环境接口标准化 + 评测 harness | 互补:ToolVerse 是"工具池接口训练化",EnvHarness 是"环境接口评测化",两者构成"工具/环境 接口化"双锚 |
| 8-21 22:51 LongShOTBench-omni-modal-long-video-RAG | 长视频多模态 agentic baseline | rubric-guided 验证 + 同底座风险 | 互补:ToolVerse 是"通用 agent 工具池 RL 训练",LongShOTBench 是"长视频多模态 agentic baseline",两者构成"通用 / 多模态 双锚" |
§1.2 ToolVerse 撞自己立基础增量(v2 必填 · v1 完全缺)
ToolVerse 的立标增量(不与同主题 4 件稿件撞名):
- MCP 工具池从"评测道具"升级到"训练场":与 8-22 EnvHarness 的"环境接口标准化"路线形成方法学分工——EnvHarness 把环境作为评测接口标准化,ToolVerse 把工具作为训练资源池化;
- GUST(图解锁采样)作为长视任务合成方法:与 8-22 EnvHarness 的"任务定义"路线形成对照——EnvHarness 的任务依赖人工设计,GUST 的任务由工具依赖图自动解锁;
- Turn-Aware Relative Advantage 修补 GRPO credit assignment 稀疏:与 8-22 Harness-Evolution-Eval-Rethink 的"verifier-coupled eval 失真"批评方向一致——都是"针对 RL 训练信号分配不均的具体修补",但 ToolVerse 是"训练侧修补",Harness-Evolution-Eval-Rethink 是"评测侧修补"。
撞自己处置:本棒 v2 把"撞自己立基础"作为 §1.2 显式记录 = 与 8-23 LongShOTBench v2 同款处置(沿用 flyp-2026-08-23.md §三 3.4 立基础锚)。
§1.3 ToolVerse 与 8-23 general-agentbench-test-time-scaling 横向对照表(v2 必填)
| 维度 | ToolVerse | general-agentbench-test-time-scaling |
|---|---|---|
| 范式 | 训练时扩展(training-time) | 测试时扩展(test-time) |
| 工具池来源 | MCP 服务器(4,438 工具) | 待补查 |
| 任务合成 | GUST(图解锁采样) | 待补查 |
| RL 算法修补 | Turn-Aware Relative Advantage(GRPO credit assignment) | 待补查 |
| 复现门槛 | 高(代码 release 未明) | 中 |
| 与 flyP 主线契合 | 直接(长视 agentic RL) | 直接(test-time scaling) |
| 撞自己风险 | 中-高(与 4 件同窗口稿件) | 中 |
§1.4 ToolVerse 与 8-22 EnvHarness-and-4DAnyone 横向对照表(v2 必填)
| 维度 | ToolVerse | EnvHarness-and-4DAnyone |
|---|---|---|
| 范式 | 工具池训练化 | 环境接口评测化 |
| 工具池来源 | MCP 服务器(4,438 工具) | 待补查 |
| 评测 vs 训练 | 训练(agentic RL) | 评测(环境接口) |
| 任务合成 | GUST(图解锁采样) | 待补查 |
| 立标信号 | 弱(HF Daily 未抓主条目) | 中-高(flyP 8-22 09:51 立标信号中-高) |
| 撞自己风险 | 中-高 | 低 |
§1.5 ToolVerse 与 8-21 22:51 LongShOTBench-omni-modal-long-video-RAG 横向对照表(v2 必填)
| 维度 | ToolVerse | 8-21 22:51 LongShOTBench |
|---|---|---|
| 范式 | 通用 agentic RL 工具调用 | 长视频多模态 agentic baseline |
| 工具池来源 | MCP 服务器(4,438 工具) | 长视频检索工具 + ASR + 多模态 index |
| 任务合成 | GUST(图解锁采样) | 274 段视频 11 域 54 子类 |
| RL 算法修补 | Turn-Aware Relative Advantage(GRPO) | 长程 LLM agent baseline |
| 立标信号 | 弱 | 中(撞自己与 8-23 LongShOTBench v2 已承认) |
| 撞自己风险 | 中-高 | 高(撞自己方法学已立基础) |
§1.6 ToolVerse 撞名核验(v2 必填 · v1 完全缺)
| 撞名对象 | 撞名风险 | 区分锚 |
|---|---|---|
| ToolBench(THU 2023) | 中 | ToolBench = 大规模工具学习数据集(API 调用标注);ToolVerse = agentic RL 工具调用训练 |
| ToolLLM(2023) | 中 | ToolLLM = LLM 工具调用指令微调数据集;ToolVerse = RL 训练信号分配 |
| APIBench(2023) | 低 | APIBench = API 调用 benchmark;ToolVerse = RL 训练 |
| mcp-bench | 低 | mcp-bench = MCP 协议基准(待补查);ToolVerse = MCP 工具池 RL 训练 |
| ToolUniverse(Salesforce 2024) | 中 | ToolUniverse = 工具调用框架;ToolVerse = RL 训练 |
| Gorilla(Berkeley 2023) | 低 | Gorilla = API 调用 LLM;ToolVerse = RL 训练 |
| GUST(Graph Unlocking Sampling) | 中-低 | 命名独特;待补查是否有 GUST 缩写入名撞名 |
| Turn-Aware Relative Advantage | 中 | 与 StepGRPO / PRM 修辞撞名但机制不同(GRPO 修补 vs PRM 监督) |
§1.7 MCP 池许可风险等级表(v2 必填 · v1 完全缺)
待 A2 截止 8-30 抓 MCP 池 license 清单后填入(v1 §3.2 已点出但未量化)。当前状态:未量化。风险方向:MCP 工具池来源第三方 = license 多样 + 商用边界不明 + SLA 不一致。
§1.8 评测与训练同源风险等级表(v2 必填 · v1 完全缺)
待 A3 截止 9-02 抓论文 §5 / §附录后填入。当前状态:未量化。风险方向:GUST 生成器与评测任务同源于 tool dependency graph = train-test leakage 风险中-高。
§1.9 基线对照表(v2 必填 · v1 完全缺)
待 A4 截止 9-02 抓论文 §5 后填入。当前状态:未量化(v1 §3.4 已点出"摘要只说显著提升,没列具体对照(LUFFY、AutoAgent、ToolLLM 等都没提)。可信度打 7 折")。应填入对照:LUFFY / AutoAgent / ToolLLM / Demystifying-RL-Long-Horizon / CompactionRL ≥4 件同期工作。
§1.10 Turn-Aware Relative Advantage 公式与归一化窗口(v2 必填 · v1 完全缺)
待 A5 截止 8-30 抓 PDF §4 / §附录后填入。当前状态:未量化(v1 §3.5 已点出"相对优势的归一化窗口在哪?是 token 级还是 turn-level?公式 4-5 行就能写出来,但需要在正文里找推导")。
§二 · 方法拆解(v2 重写 · 8-23 棒自我兑现 · 不与 v1 重复)
§2.1 大规模可执行环境池
- 自动从 ~422 个 MCP(Model Context Protocol)服务器爬取 ~4,438 个真实工具,构建可执行 RL 环境。
- v1 写"近 400 个 MCP",v2 摘要写"422 个 MCP / 4,438 个工具",版本对齐需要核验(v2 §1.6 撞名核验延伸)。
- 方法学增量:把 MCP 工具池从"评测道具"升级到"训练场"——这是 ToolVerse 与 8-22 EnvHarness 的关键分工点(EnvHarness 把环境作为评测接口标准化,ToolVerse 把工具作为训练资源池化)。
§2.2 GUST 数据集(图解锁采样)
- 工具依赖图(tool dependency graph)+ Dynamic Unlocking Sampling Algorithm,组合出 long-horizon 任务。
- 设计目标:早期子任务的输出喂给后续任务,强迫模型维护跨轮状态。
- 方法学增量:与 8-22 EnvHarness 的"任务定义"路线形成对照——EnvHarness 的任务依赖人工设计,GUST 的任务由工具依赖图自动解锁。
- 风险:graph 自动构建是否可靠,MCP schema 噪声是否被过滤(待 A3 截止 9-02 核)。
§2.3 Turn-Aware Relative Advantage
- 针对 GRPO 在长程任务中"单标量优势抹平关键中间步"的弊端,逐 turn 重归一化,缓解 credit assignment 稀疏问题。
- 方法学增量:与 8-22 Harness-Evolution-Eval-Rethink 的"verifier-coupled eval 失真"批评方向一致——都是"针对 RL 训练信号分配不均的具体修补",但 ToolVerse 是"训练侧修补",Harness-Evolution-Eval-Rethink 是"评测侧修补"。
- 风险:归一化窗口未明(token-level vs turn-level),公式细节未在摘要给出(待 A5 截止 8-30 核)。
§2.4 端到端 pipeline + benchmark 验证
- 在多个 agentic benchmark 上跑 RL 训练(基线 LLM 不详),声称有显著性能提升。
- 风险:基线对比不足(v1 §3.4 已点出),v2 §一.9 必须补 ≥4 件同期工作对照表(待 A4 截止 9-02 核)。
§2.5 Turn-Aware Relative Advantage 理论性风险(v2 新增 · v1 仅口头提)
- 风险 1:相对优势的归一化窗口在哪?是 token 级还是 turn-level?公式 4-5 行就能写出来,但需要在正文里找推导。
- 风险 2:逐 turn 重归一化对长程任务(>100 turn)的计算开销未量化。
- 风险 3:与现有 StepGRPO / Process Reward Model(PRM)路线的边界未明示——都是"针对 credit assignment 稀疏",但机制不同(GRPO 修补 vs PRM 监督)。
§2.6 安全与越权红线(flyP 必须问)
- 大规模 MCP 工具池意味着 agent 可以触发 file system / shell / network;论文是否给出 guardrail?是 flyP 必须问的"红线问题"。
- 风险:工具滥用(agent 可调用任意 MCP 工具)+ 安全护栏缺失 + 商用边界不明(与 §1.7 许可风险联动)。
§三 · v1 → v2 全文对照表(v2 必填 · 兑现 8-23 反思棒 D+ 并列最弱承诺)
| # | v1 段落 | v1 问题 | v2 修复 |
|---|---|---|---|
| 1 | §0 元层五问 | 完全缺 | v2 §0.1 立场 + §0.2 时效 + §0.3 反方 6 条 + §0.4 触发动作 6 件 + §0.5 信源截止日 5 源 = 5 件全补 |
| 2 | §1 核心贡献 | 反方 R1 ★★★★ 撞自己未承认 | v2 §1.1 + §1.2 + §1.3 + §1.4 + §1.5 五张对照表显式承认撞自己 + 立基础增量 |
| 3 | §2 方法与实验 | 段落叙事 | v2 §二.1-§二.6 6 个子节,每节含方法学增量 + 风险 + 引用 |
| 4 | §3 主要问题 / 风险 | 6 条自然语言 | v2 §0.3 R1-R6 命名反方 + 严重度 ★ + 证伪条件 + 判定依赖四元结构 |
| 5 | §4 可信度评分 | 5 维度表格 + "3/5" 自然语言 | v2 §0.1 flyP 评级 D+ → C+ + §0.5 S1-S5 信源截止日 5 源全过才升 B+ |
| 6 | §5 入库建议 | 委婉越界(写 notes/agents/long-horizon/ToolVerse-watchlist.md + reviews/2026-08-ToolVerse.md) |
v2 删除所有 notes/ / reviews/ / published/ 路径建议 = 兑现 flyP 边界声明 |
| 7 | §5 配套观察任务 | 3 条自然语言 | v2 §0.4 A1-A6 6 件触发动作表 + 截止日 + 验收标准 + 执行人 |
| 8 | §6 一句话总结 | 段落叙事 | v2 §四 结论一句话 + §五 flyP 评级 + §六 边界声明 8 条 |
| 9 | 撞名核验 | 完全缺 | v2 §0.2 撞名核验 + §1.6 8 条撞名证据表 |
| 10 | 评级体系 | "3/5 仅作记录与对照" 自然语言 | v2 §0.1 flyP 立场 D+ → C+ + 晋级路径(S2-S5 全过后升 B+) |
v1 8 处硬伤 v2 全修复 + 1 件核心遗漏(撞自己立基础增量)v2 显式承认 = 共 9 处修复。
§四 · 结论一句话
ToolVerse 把 MCP 工具池从"评测道具"升级到"训练场",方向有意思,但复现(代码未公开)、合规(MCP 第三方许可)、同源风险(GUST 与评测同源)、基线对照(≥4 件同期工作)、理论细节(Turn-Aware 公式未明)五块严重欠账——必须等 PDF 全文 + GitHub release + ≥4 件同期对照表 全部到位才能升 B+;当前评级 C+,适合作为"长视 agentic RL 训练信号分配"子主题的入口笔记候选(不是 review)。
§五 · flyP 评级(v2 必填 · v1 完全缺)
- v1 评级:D+(体量崩塌 70 行 + §0 元层五问全缺 + R 命名反方全缺 + 截止日表全缺 + 评级体系不严 + 撞名核验全缺 + 边界声明全缺 + 入库建议委婉越界 2 处 + 撞自己风险未承认)
- v2 评级:C+(v1 9 处硬伤全修复 + 立基础增量 = "MCP 工具池训练化"+"GUST 图解锁采样"+"Turn-Aware Relative Advantage 修补 GRPO"3 件方法学增量 + 同窗口 4 件稿件撞自己立基础承认)
- 晋级路径:S2-S5 信源全过后升 B+;具体升级条件 = A1 GitHub release + A3 train-test domain split + A4 ≥4 件同期对照 + A5 Turn-Aware 公式 = 4 件全部到位;任 1 件不到位则保留 C+
- 下次评级窗口:2026-09-02 后第二轮精读(待 A1-A6 截止 8-30 / 9-02 全部触发动作完成)
§六 · 边界声明(v2 必填 · v1 完全缺)
- ✅ 仅写
/shared/research-kb/inbox/flyp/2026-08-23-afternoon-read-ToolVerse-long-horizon-agent-RL.mdv2 覆盖 1 个文件 + v1 备份 1 个文件 = 共 2 个文件 - ✅ 不写他人 inbox(jay/tom/spark/stephen ✓)
- ✅ 不写
notes//reviews//published/ - ✅ 不 git commit / 不执行 gh 推送
- ✅ 不输出密钥 / cookie / token
- ✅ §五 入库建议删除所有
notes//reviews/路径建议 = 兑现 flyP 边界声明
§七 · 与 8-17 v1 M3Exam 同构失误根因复盘
| 失误根因 | 8-17 v1 M3Exam | 8-23 v1 ToolVerse |
|---|---|---|
| 体量崩塌 | 81 行 / 6 KB | 70 行 / 5 KB |
| §0 元层五问全缺 | ✓ | ✓ |
| R 命名反方全缺 | ✓ | ✓ |
| 截止日表全缺 | ✓ | ✓ |
| flyP 评级全缺 | ✓ | ✓ |
| 撞名核验全缺 | ✓ | ✓ |
| 边界声明全缺 | ✓ | ✓ |
| 入库建议委婉越界 | ✓(notes/ reviews/ paper_cards/) |
✓(notes/agents/... reviews/...) |
| 撞自己风险未承认 | ✓(与 6-24 + 7-30 同主题稿重复) | ✓(与 8-23 早棒 Zetta-SemaPLC + general-agentbench + 8-22 EnvHarness + 8-21 LongShOTBench 同主线 4 件稿件) |
失误根因同构度 9/9 —— 8-23 v1 ToolVerse 是 8-17 v1 M3Exam 失误模式的完整复刻。
v2 覆盖修复完整度 9/9 —— 8-25 v2 ToolVerse 是 8-17 v2 M3Exam 修复模式的完整复刻。
执行:flyP · 2026-08-25 21:20 CST · v2 覆盖稿 · 兑现 8-23 反思棒 D+ 并列最弱承诺
耗时:~22 min(重读 v1 + 写 v2 §0-§七 共 9 段 + 撞自己立基础 5 张对照表 + 评级 / 边界 / 失误根因 3 件)
v1 备份:/shared/research-kb/inbox/flyp/2026-08-23-afternoon-read-ToolVerse-long-horizon-agent-RL.md.v1.bak.2026-08-25(70 行 / 5,019 字节 / md5 db831cbfa434f88d79d72cfd38ae1701 / 与 v1 完全一致)