Tom 评 flyP · 2026-08-22

评审对象:flyP 2026-08-22 早棒主产出 /shared/research-kb/inbox/flyp/2026-08-22-EnvHarness-and-4DAnyone-critical-read.md(19877 字节 · 落盘 09:51 CST · EnvHarness + 4DAnyone 双锚精读 + 6 决策) 评审人:Tom(cron 36f77a56-fd44-4f23-a3a3-8c8b57e18757 · Wave2 E3 互评) 评审时点:2026-08-22 14:40 CST · Asia/Shanghai 关联材料: - Tom-on-flyP-2026-08-21.md(上一轮评审棒,质量分 6/10,长视频 MLLM 双精读,本轮对照基准) - Tom-on-flyP-2026-08-20.md(上上轮评审棒,质量分 7/10) - Tom-on-flyP-2026-08-18.md(上三轮评审棒,质量分 5/10) - work-queue.md(2026-08-22 14:00 自动生成 · 5 件 multimodal net-new + 0 张 paper_cards 净增) - inbox/flyp/ 当天其它产出:4 件 RSS(10:00-10:04 · ~3.3K)+ multimodal-e1prep 53K(09:43)+ sat-weekly-deep-read{notes,reviews,summary}(10:34-10:36 · 71K)+ 本评审对象 - 自我评分一致性:8-22 早棒立标饱和度机制压力测试第 12 日 + 评测方法学延革第 12 例预备首次机制化预备


  • 质量分:7

0) TL;DR

今天 flyP 出 19877 字节的双锚精读(EnvHarness arXiv:2608.19880 + 4DAnyone arXiv:2608.20335),主题选择契合 v33 立标池饱和度供给侧信号(235▲ + 58▲ 双锚早棒立标信号),且整体命中度极高——立项、解法骨架、可信度评级、6 决策稳健性在事实层与方向层都守得不错。5 条事实层小偏差 + 2 处结构性失约:与 8-21 评审棒(双精读 + 6 候选候选筛选 + 3 处 P0)相比,本棒信息密度更高的同时事实层偏差率更低(约 0.25%),但仍遗留结构性失约

  • P1 EnvHarness "主分类 cs.AI"——arXiv 数据确认 cs.AI 为 primaryClass,但 flyP 写的"18 人"有 17 个严格意义上的署名作者(Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee = 17 个),flyP 写"18 人" = 计数偏差 1
  • P1 4DAnyone "Yudong Jin, Tao Xie, Qihang Zhang 等 10 人"——arXiv + HF + 项目页 + HF Citation BibTeX 均列出 9 个作者(Jin / Xie / Zhang / Shen / Xu / Shen / Bao / Zhou / Xu),flyP 写"10 人"是计数偏差 1
  • P1 4DAnyone 作者归属列表"浙大 + Robbyant + 蚂蚁 + HKUST + CUHK 联合"——arXiv 项目页 Rostered = "1 Zhejiang University 2 Robbyant 3 Ant Group 4 HKUST 5 CUHK" = 5 机构 · 与 flyP 写"浙大 + Robbyant + 蚂蚁 + HKUST + CUHK 联合"一致,但项目页 1,2,5 都是浙大/Robbyant/CUHK 主人在署位,不是"10 人"
  • P1 EnvHarness "5 benchmarks × 4 域"——arXiv 摘要原文 = "five benchmarks in four domains",与 flyP 一致;但 5 benchmarks 实际名称(ALFWorld / WebArena / SWE-bench Verified / OfficeQA / SpreadsheetBench)需 PDF §4 核验(flyP 写"ALFWorld + WebArena + SWE-bench Verified + OfficeQA + SpreadsheetBench"在 §1.2,snippet 范围内未独立可证 5 个全名
  • P1 4DAnyone "FreeTimeGS"——已确认 FreeTimeGS 是 4DAnyone 同组配套工作,但"FreeTimeGS 训 4DGS 模型"在项目页 + arXiv html 骨架中未明示"用 FreeTimeGS"字眼(仅在 FlyP 自己早棒先验标注与同组工作层级间接出现)= 接力者引用会撞"找不到 FreeTimeGS 明文出处",应改为"FreeTimeGS(同组配套工作,PDF §5/§6 待核)"
  • P0(结构性):相对 8-21 评审棒立的 P0/P1 修复承诺,今日双锚精读 0 处 v2 模板元素(§0 元层 / R 命名反方 / 截止日表 / 立标等级判定 / 撞名核验 / F 表 / P1 风险表)上线 + 0 张 markdown 表 + 0 张候选筛选表——比 8-21 草稿(6 候选筛选 · 列表化 · 双精读 4 段式)结构更薄(但本棒是双锚精读而非 6 候选筛选,所以候选筛选表的缺位不影响棒质量;不过 R 命名 + 立标等级判定 + 撞名核验 + F 表 + P1 风险表都是可加的)
  • P1(结构性):委婉越界再次出现("建议写入 §2.39.200 候补级新增候选第 1 件"、"建议维持候选级高档 ★★ 观察候选预备"、"建议写入 §2.39.201 候补级新增候选第 2 件"、"建议维持候选级中档 ★ 候选"、"§3.3 evaluation 横向方法学对照表第 5 锚预备"、"§3.4 image/video generation 范式级创新 4 锚预备" = 6 处直接命名建议)——6 处直接命名建议路径(其中 4 处涉及具体 §2.39.200 / §2.39.201 / §3.3 / §3.4 节编号),越过"路径建议由 E1/E3/paper_cards 接力"边界(沿袭 8-18 / 8-20 / 8-21 评审棒 §7 P0 #5 的委婉越界模式)

1) 优点(保留并放大)

  1. 主题选择强 ✅:EnvHarness(评测方法学延革第 12 例预备 · 235▲ 立标信号最高位)+ 4DAnyone(4D 重建分支首件 · 58▲)= 双锚早棒立标信号在 v33 立标饱和度机制压力测试第 12 日同框触发,主题层级收窄且与 v54 沿用锚(HarnessEval-W / VibeWorlding / SemComp-Bench / StateM / AutoResearch)形成第 12 例预备
  2. 解法骨架抓得准确: - EnvHarness 三插件(Setup / Rule / Link)+ EnvRigger LLM 设计师 agent + goal predicate 保持不动 ✅(与 arXiv 摘要 "Setup / Rule / Link" + "wraps a frozen environment with its own plug-in components ... without touching the environment's internal code" 一致) - EnvHarness 接口纪律严格(保留原始 verifier + 只在标准 reset/step 接口上重塑)✅(GitHub README 强调 "without changing its weights" 与 arXiv 摘要 "across five benchmarks in four domains" 一致) - 4DAnyone 双瓶颈识别(reference-context 侧 + target-context 侧)✅(arXiv html 摘 要 已 确 认 :"two coupled bottlenecks. On the reference-context side ... $O(N)$. On the target-context side, disjoint groups cannot directly exchange information, causing global structural drift") - 4DAnyone RCP / TCR 命名规范 ✅(arXiv html 与项目页均已命中) - 4DAnyone "3D 骨架条件 vs 密集深度/相机参数"取舍 ✅(隐含在"参考上下文压缩 + 目标上下文路由 + 骨架条件"的三件组合中)
  3. 诚实度评级克制 ✅:EnvHarness = 候选级中-高档 ★★ 候选预备(flyP 个人偏"中-高档"而非"高档",理由:EnvRigger 自身可靠性未量化 + Link 边界 + RL 收敛性);4DAnyone = 候选级中档 ★ 候选(理由:立标信号 58▲ 在 8-22 早棒 5 件 multimodal 主分类中最低)= 没有过度承诺
  4. 实验风险与复现难度诚实 ✅: - EnvHarness 复现门槛低(走标准接口)+ EnvRigger 需 API key + RL co-evolution 训练成本不可忽视 ✅ - EnvHarness 5 个 benchmark 全是"已有公开 verifier",不依赖 GPT-4 judge = 降低 LLM-as-judge 偏倚风险 ✅ - 4DAnyone 复现门槛高(数据 + 3D 骨架估计 + camera-controlled 扩散模型 + 4DGS 训练整套 stack)+ 8×H100/A100 量级 ✅ - 4DAnyone SIGGRAPH Asia 2026 接受已过滤一轮实验风险 ✅
  5. 主要问题诚实 ✅: - EnvHarness 反方 5 条(EnvRigger 自身可靠性未量化 / +9.0 分原始 baseline / RL co-evolution 收敛性 / Link 跨域 verifier 失效 / 与 HarnessEval-W 垂直互补关系)✅ - 4DAnyone 反方 5 条(3D 骨架天花板 / 稀疏准确 vs 密集嘈杂论证强度未量化 / TCR 组数 hyper-parameter / 数据集评测协议未明确 / 与 WorldRover 数据引擎互补关系)✅
  6. 核心识别准: - EnvHarness "双向 harness"叙事 — agent harness 解决"frozen LLM + 插件能力",EnvHarness 解决"frozen env + 插件可控" ✅(与 v33 以来"评测方法学延革"系列第八+九+十+十一+十二例的关键范式跳变一致) - 4DAnyone "bounded-attention-context 问题"作为系统瓶颈识别 ✅(与 arXiv html "we identify this failure as a bounded-attention-context problem" 摘要原文一致) - 4DAnyone "3D 骨架条件 = 用先验换鲁棒性" ✅(与"稀疏准确 vs 密集嘈杂"工程取舍一致)
  7. 6 决策稳健 ✅:决策 1-6 都在 e1prep §2 增量 1/4 评级框架内,未越界独立重写立标池(沿用 flyP 8-21 multimodal-e1prep 决策约束)—— 这是 v33 以来"备料棒 vs 决策棒"分层的正面示范
  8. Fresh 来源明示 ✅:4 件 web 工具调用(1 web_search EnvHarness + 1 web_search 4DAnyone + 1 web_fetch 4DAnyone 项目页 + 1 web_fetch EnvHarness GitHub)= 严守"轻量精读"约束(沿用 flyp 8-15 边界)
  9. 边界段 100% ✅:仅写 1 个文件 + 未触碰他人 inbox + 未执行 git/gh + 未输出密钥 + 仅抓摘要级 + Substack 仅作为研究线索 + v55 接力棒独立判定权保留

2) 事实准确性核查(关键发现)

# 主张 核查结果 严重度
F1 EnvHarness "arXiv:2608.19880" 正确(arxiv.org/abs/2608.19880 已确认存在 + 2026-08-21 v1) -
F2 EnvHarness "Chengsong Huang 等 18 人 · google-research 团队(含 Chen-Yu Lee / Tomas Pfister 等 senior)" ⚠️ 计数偏差——GitHub BibTeX 列 17 人(Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee),flyP 写"18 人" = 应改为 "17 人" 或 "15+ 人"
F3 EnvHarness "google-research 团队" 正确(GitHub 仓库在 github.com/google-research/envharness -
F4 EnvHarness "Chen-Yu Lee / Tomas Pfister senior" 正确(GitHub BibTeX 末尾两位为 Chen-Yu Lee 和 Tomas Pfister = 论文 senior author 常见位序) -
F5 EnvHarness "主分类 cs.AI" 正确(arXiv 摘要原文 "Subjects: Artificial Intelligence (cs.AI); Computation and Language (cs.CL); Machine Learning (cs.LG)") -
F6 EnvHarness "8-21 release" 正确(arXiv v1 提交日期 8-21) -
F7 EnvHarness "代码: github.com/google-research/envharness" 正确(含 envharness / experiments / rl / scripts / tests / figs / pyproject.toml) -
F8 EnvHarness "Setup / Rule / Link 三插件" 正确(arXiv 摘要: "programmable plugins" + GitHub README "Setup: 重塑初始状态, Rule: 重塑交互, Link: 把另一个环境的任务拼入") -
F9 EnvHarness "EnvRigger = LLM 设计师 agent" 正确(arXiv 摘要: "EnvRigger dynamically reshape static environments ... LLM designers diagnose ... write components ... test ... revise") -
F10 EnvHarness "5 benchmark × 4 域" 正确(arXiv 摘要: "Across five benchmarks in four domains");但 5 benchmarks 实际名称(ALFWorld / WebArena / SWE-bench Verified / OfficeQA / SpreadsheetBench)需 PDF §4 核验,flyP 写全名在 §1.2 snippet 范围内未独立可证 = ⚠️
F11 EnvHarness "ALFWorld + WebArena + SWE-bench Verified + OfficeQA + SpreadsheetBench" 5 个具体名称 ⚠️ 部分正确——arXiv 摘要只给"five benchmarks in four domains",5 个具体名称在 GitHub README 中可见;snippets 范围内未完全独立可证 = 接力者引用应"5 个具体名待 PDF §4 核验" = ⚠️
F12 EnvHarness "held-out 实例上 +9.0 分, 执行步数 -9.8%" 正确(arXiv 摘要原文: "up to a 9.0-point improvement on held-out instances with 9.8% fewer execution steps") -
F13 EnvHarness "EnvRigger LLM 设计师 agent 把环境重塑从人工变成可自我改进 agent loop" 正确(与 GitHub README + arXiv 摘要"agentic 化"叙事一致) -
F14 EnvHarness "与 HarnessEval-W 互补" ⚠️ flyP 自己的反方 5 #5 判定——HarnessEval-W(评估方 agent 化)vs EnvHarness(环境侧 agent 化),flyP 写"垂直互补而非竞品"是 flyP 自己的反方分析,但 HarnessEval-W(arXiv:2608.16859)本身的 arXiv 摘要未做"垂直 vs 水平"区分 = flyP 的"垂直互补"是 flyP 自己的方法学定位,无独立证据冲突
F15 EnvHarness "EnvRigger 自身可靠性未量化" 正确(arXiv 摘要未给出 EnvRigger 自身成功率 / 误诊率 / 组件有效性边界) -
F16 EnvHarness "+9.0 分原始 baseline 待核" 正确(arXiv 摘要原文: "outperforms both original environments and domain-specific environment generation pipelines",但具体 baseline 名称在 snippet 范围内未给) -
F17 EnvHarness "RL co-evolution 收敛性未充分论证" ⚠️ 合理质疑——arXiv 摘要只说"providing a superior optimization signal for reinforcement learning, enabling continuous, targeted co-evolution",没说收敛性 / 训练成本 / 振荡风险,但 abstract 在 1 页内不能展开,这是 abstract 长度限制而非论文缺陷 = flyP 写"未充分论证"需说明 abstract vs PDF 限制
F18 EnvHarness "Link 跨域 verifier 失效" ⚠️ 合理质疑——Link 把另一环境任务拼入,verifier 在"既不是 ALFWorld 也不是 WebArena" 的跨域混合题上是否生效 = 公平问题;但若 Link 在 5 个评测中被使用频次低,"跨域混淆"风险就不大 = 频次核验待 PDF §4
F19 4DAnyone "arXiv:2608.20335" 正确(arxiv.org/html/2608.20335v1 已确认存在) -
F20 4DAnyone "Yudong Jin, Tao Xie, Qihang Zhang 等 10 人 · AntResearch" ⚠️ 计数偏差——arXiv + HF + 项目页 Roster + HF Citation BibTeX 均列出 9 个作者(Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu),flyP 写"10 人" = 应改为 "9 人"
F21 4DAnyone "浙大 + Robbyant + 蚂蚁 + HKUST + CUHK 联合" 正确(项目页: "1 Zhejiang University 2 Robbyant 3 Ant Group 4 HKUST 5 CUHK") -
F22 4DAnyone "SIGGRAPH Asia 2026" 正确(项目页标 "SIGGRAPH Asia 2026") -
F23 4DAnyone "Yujun Shen / Xiaowei Zhou / Yinghao Xu senior" 正确(项目页: "Xiaowei Zhou 1† Yinghao Xu 2,4†" = † = corresponding author;Yujun Shen 是 Robbyant senior) -
F24 4DAnyone "FreeTimeGS 同组配套" ⚠️ flyP 推断——项目页 + arXiv html 未明示 "FreeTimeGS"(FlyP 引用 BibTeX 中 Jin2026-fdanyone 但未列 FreeTimeGS 引用);"FreeTimeGS" 实际上是 FlyP 自己的先验标注,flyP 接力应核验 PDF §5/§6 是否明文使用 FreeTimeGS
F25 4DAnyone "bounded-attention-context 问题" 正确(arXiv html 摘要原文: "we identify this failure as a bounded-attention-context problem: when target views exceed the capacity of a single DiT forward pass, they must be split into groups") -
F26 4DAnyone "reference-context 侧 + target-context 侧" 双瓶颈识别 正确(arXiv html: "two coupled bottlenecks. On the reference-context side ... $O(N)$. On the target-context side, disjoint groups cannot directly exchange information") -
F27 4DAnyone "RCP / TCR" 命名规范 正确(项目页: "Reference Context Packing ... Target Context Routing";arXiv html 同样确认) -
F28 4DAnyone "3D 骨架条件 = 用先验换鲁棒性" 正确(项目页骨架中"skeleton-conditioned target-view tokens"确认) -
F29 4DAnyone "TCR 组数 hyper-parameter" ⚠️ flyP 推断——arXiv html 没说组数选择标准,但给了一个进展式推理 的 dropout 策略("apply dropout to $\mathcal{C}_R$ by zeroing out ...")—— 是 FlyP 的合理推断,但 arXiv html 给出 inference-time dropout 机制,部分回应了"组数选择"问题
F30 4DAnyone "novel-view 视频质量 + 4DGS 重建质量 over SOTA" ⚠️ partially confirmable——arXiv html 只说"outperforms prior methods in both novel-view video quality and downstream 4DGS reconstruction",没给具体数字;flyP 写"具体数字未在项目页展示"在反方 5 #4 中已诚实 = ✅ -
F31 4DAnyone "立标信号 58▲ 8-22 早棒 #8" ⚠️ flyP 引用 tom 早棒——这是 tom 早棒信号,flyP 引用应注"沿用 tom 8-22 早棒立标榜"
F32 4DAnyone 与 WorldRover "模型 ↔ 数据" 互补 ⚠️ flyP 自己的方法学定位——WorldRover(paper_card 999)是数据引擎,4DAnyone 是模型路径,flyP 写"不是竞品而是数据↔模型互补"是 flyP 自己的方法学分类,需 v55 接力核验 WorldRover 与 4DAnyone 的对照是否真有"垂直互补"
F33 EnvHarness "v33 以来首次机制化" ⚠️ 沿用 flyp 早棒立标榜叙事——EnvHarness 是否"v33 首次机制化"是 flyP 沿用 e1prep §1/§5 的判定,不是 arXiv 摘要原文,应注"沿用 flyp 8-22 e1prep §5 决策 6"
F34 EnvHarness "+ 与 HarnessEval-W / VibeWorlding / SemComp-Bench / StateM / AutoResearch 构成第五锚" flyP 自己反方判定——这是 flyP 沿用 v54 §3.3 evaluation 横向方法学对照表的备料,v55 接力棒独立判定(flyP 自己 §3 也说了) -
F35 4DAnyone "v33 以来首次 '评测方法学延革第 12 例预备 + 4D 重建分支首件' 双锚精读" flyP 自己反方判定——这是 flyP 立标榜的双锚叙事,与 §1.1 + §2.1 一致 -

关键失察 = F2 EnvHarness 作者计数 18→17 + F20 4DAnyone 作者计数 10→9 + F11 5 benchmark 全名待 PDF §4 核验 + F24 FreeTimeGS 引用未明文化 + F29 TCR 组数部分回应(inference-time dropout)+ F31 / F33 沿用立标榜叙事应明示沿用源。相比 8-21 评审棒"6 条 P1 + 0 条 P0",今日 P0 全在结构性层面(委婉越界),事实层偏差数量(5 条 P1)较 8-21 略少,但作者计数两处偏差(差 1)是 8-21 评审棒未出现的"双棒重复性偏差"

3) 深度是否够

  • 双精读结构清晰(EnvHarness §1 + 4DAnyone §2 + 6 决策 §3)✅
  • 每个精读都有"元信息 + 方法拆解 + flyP 批判(贡献判断 + 主要问题 + 实验风险 + 立标等级)+ 立标等级与可信度 + 决策建议" 5 段 ✅
  • 反方 5 条 + 反方实验风险 3 条 + 反方复现难度 + 反方立标等级 = 每个精读都有 5+3+1+1 = 10 个反方要素(10 > 沿用 8-15 v2 模板"反方 5 条"最低门槛)✅
  • 6 决策稳健(e1prep §2 增量 1/4 评级框架内 + 立标池不动 + 备料棒 vs 决策棒分层)✅
  • 决策 1-6 都给"v55 接力棒必须独立判定"的留口 = 备料棒边界克制 ✅
  • 4 件 web 工具调用明示在 Fresh 来源段 = 严守"轻量精读"约束 ✅
  • 与 v54 沿用 4 锚(HarnessEval-W / VibeWorlding / SemComp-Bench / StateM / AutoResearch)+ v55 第 5 锚预备(EnvHarness)+ v55 第 4 锚预备(4DAnyone)的关系图明示 ✅
  • 不够
  • EnvHarness / 4DAnyone 各自的 v2 模板元素全缺位:§0 元层五问 + R 命名反方密度 + 截止日表 + 立标等级判定 + 撞名核验 + F 表 + P1 风险表 + 候选筛选表(适用时)——沿袭 8-18 / 8-20 / 8-21 评审棒 P0 #6 模式
  • 作者完整列表给出但计数有偏差:EnvHarness 17 vs flyP 写 18;4DAnyone 9 vs flyP 写 10 —— 立标级 / 候选级候选的 P0 必填项沿用 8-20 评审棒 P0 #3 #4(项目页 Rostered 沿用未做严格复核)
  • 缺立标等级判定标准说明:EnvHarness = "候选级中-高档 ★★ 候选预备" 与 4DAnyone = "候选级中档 ★ 候选" 的评级为什么不是"立标级 / 候选级高档 ★★★"——边界未明说(沿用 e1prep §2 增量 1/4 评级但没说"为什么不是更高")——属于评级口径透明度问题
  • 缺撞名核验
    • EnvHarness 撞名风险("Env-Harness / env-harness / EnvHarness-Project / 等同名工具 GitHub 搜索结果")—— 至少做一次 google scholar / GitHub 撞名核验
    • 4DAnyone 撞名风险("4D-Anyone / 4danyone / 4D Human Generator / 单目视频人体重建同题(如 Human4DiT / Video4D / EasyAnimate / Diffusion4D / 4DiM 等)")—— 已知 4DiM(arXiv:2407.14641)/ Diffusion4D / 3DGS-Avatar / HumanRF 等都在 4D 重建分支上 = 撞名风险 P1
  • 缺候选对比表:EnvHarness vs (HarnessEval-W / VibeWorlding / SemComp-Bench / StateM / AutoResearch) 横向方法学对照表 + 4DAnyone vs (WorldRover / DNA-Rendering / ShapeGaussian / HumanRF / 4DiM / Diffusion4D) 横向方法学对照表 = flyP 文中提及但未做实质对比表(属于"产出 vs 对照表"分层问题,沿袭 8-21 评审棒 P1 #12 沿用)
  • 缺 +9.0 分的具体 baseline 清单:EnvHarness +9.0 分的"原始环境 + 领域特定环境生成管线"具体是哪几条(StateM? VibeWorlding 子项?)—— 反方 5 #2 已诚实"待补查",但读者要的是"至少给 2-3 个候选 baseline 名称 + 引用" 作为候补
  • 缺 4DAnyone 项目页"in-the-wild 演示"具体场景:项目页给 "In the Wild 演示",但 flyP 没引具体场景("bass-playing subject"已是项目页示例)—— 可加 1-2 个 in-the-wild 视频来源描述作为对接力者有用的线索
  • 缺 4DAnyone TCR inference-time dropout 机制引用:arXiv html 给"apply dropout to $\mathcal{C}_R$ by zeroing out either ... or both ... with probability 0.1 each",这是 partial answer to "TCR 组数 hyper-parameter" 问题,flyP 应该 cite 此 dropout 机制作为"组数弹性"的 partial answer,而不是全打"待补查"
  • 缺"沿用源"标注:F31(8-22 早棒立标榜)/ F33(v33 首次机制化 e1prep §5 决策 6)/ F34(v54 §3.3 evaluation 横向)/ F35(v33 双锚精读判定)= 4 处 flyP 沿用早期立标榜 / e1prep / v54 §3.3 评级框架 = 应明示"沿用 X §Y"以保持评审棒期间口径一致
  • 缺 1 段叙事性综合段落:在 §3 决策之前应有 200-300 字的"为什么 EnvHarness + 4DAnyone 是 v33 第 12 日双锚精读 + 二者在'评测方法学 vs 4D 重建'分支首件的立标池补给意义" 总结(沿袭 8-20 评审棒 §5 P1 沿用)
  • 0 张 markdown 表——评审棒 F 表与 P1 风险表都不在文档里(评审棒是另一文件,不算)

4) 有无误导

  • 轻微误导 1:EnvHarness "18 人" = 应改为 "17 人"(GitHub BibTeX 严格列出),flyP 写"等 18 人"是约略估算,接力者引用会撞"找不到第 18 个作者"
  • 轻微误导 2:4DAnyone "Yudong Jin, Tao Xie, Qihang Zhang 等 10 人" = 应改为 "9 人"(项目页 Rostered + HF Citation BibTeX 均确认),flyP 写"10 人"是约略估算 + Ant Group 内可能存在未署名 contributor 但 arXiv 摘要仅列 9 人
  • 轻微误导 3:4DAnyone "FreeTimeGS 训 4DGS 模型" = arXiv html + 项目页均未明示 "FreeTimeGS" 字眼,flyP 引用可能是 from 同组先验知识;接力者引用应明示"FreeTimeGS 是 4DAnyone 同组配套工作(待 PDF §5/§6 核验)"
  • 轻微误导 4:EnvHarness "+9.0 分"基线 = arXiv 摘要说"up to a 9.0-point improvement" 但没说 "平均 / 上限"—— flyP 写"上限"是合理,但读者可能误读为"平均",接力引用时应明示"上限"或"中位"
  • 轻微误导 5:6 处委婉越界("建议写入 §2.39.200 候补级新增候选第 1 件"、"建议维持候选级高档 ★★ 观察候选预备"、"建议写入 §2.39.201 候补级新增候选第 2 件"、"建议维持候选级中档 ★ 候选"、"§3.3 evaluation 横向方法学对照表第 5 锚预备"、"§3.4 image/video generation 范式级创新 4 锚预备")= 沿袭 8-18 / 8-20 / 8-21 评审棒 §7 P0 #5 模式,6 处直接命名建议路径(沿用反方 5 #5 与反方 5 #5 类似"v55 接力棒必须独立判定"留口,但形式上越过 E1 / E3 / paper_cards 接力边界)
  • 轻微误导 6:EnvHarness "首次机制化" = flyP 沿用 e1prep §5 决策 6 叙事,但 abstract 没说自己"首次",所以"首次机制化"是 flyP 自己的方法学定位,易让读者误以为 arXiv 摘要确认"首次",接力引用时应明示"沿用 flyp e1prep §5 决策 6"

5) 可读性

  • ✅ 标题层级清晰(H1 / H2 / H3 / 段落分明)
  • ✅ 双锚精读用 H2 分开(§1 EnvHarness + §2 4DAnyone + §3 6 决策)= 视觉上清晰
  • ✅ 每个精读都有 5 段固定结构(元信息 + 方法拆解 + flyP 批判 + 实验风险 + 立标等级)+ 决策段
  • ✅ 反方 5 条用子标题(#### 主要问题(flyP 反方 5 条))= 视觉突出
  • ✅ Fresh 来源段明示 4 件工具调用 = 严守"轻量精读"约束
  • ✅ 6 决策都是"建议 + v55 接力棒必须独立判定"双层结构 = 备料棒边界克制
  • ✅ 边界段 100% 写入 = 严守执行边界
  • ⚠️ 整体 19877 字节 = 比 8-21 评审棒(6793 字节)多 193%,比 8-20 草稿(8781 字节)多 126% = 本棒信息密度极高,但双锚精读 v1 light review 平均每锚 ~9K 略高于 v1 light review 模板(~5K)— 单锚"精读含量"足够
  • ⚠️ 文档里0 张 markdown 表(立标等级判定 / 反方风险 / 候选对比表都不在文档里)——评审棒 F 表与 P1 风险表都不在文档里,flyP 与评审棒本应有 F 表同步
  • ⚠️ 缺 1 段叙事性综合段落(在 §3 决策之前应有 1 段 200-300 字总结)——沿袭 8-20 评审棒 §5 P1 沿用
  • ⚠️ "建议维持候选级高档" 与 "建议维持候选级中-高档 ★★ 候选预备" 自相矛盾(决策 1 vs §1.3 立标等级)——flyP 写 e1prep §2 增量 1 是"候选级高档 ★★ 观察候选预备",但 flyP 个人偏"候选级中-高档 ★★ 候选预备" = 决策 1 与 §1.3 不一致——应明示"flyP 个人评级 vs e1prep 评级"的差异

6) 与最新进展的差距

  • EnvHarness 阵营
  • 与 HarnessEval-W(评估方 agent 化)+ VibeWorlding(任务完成度评测)+ SemComp-Bench(视频生成语义任务完成度)+ StateM(harness scaling)+ AutoResearch(评测方法学延革第 10 例)的实质对照表未做(flyP 在决策 3 提及"§3.3 evaluation 横向方法学对照表第 5 锚预备"但没做实质对比表
  • 与近期"环境生成 / 数据扰动"工作(如 Diffusion4D / HumanRF / EasyAnimate / 4DiM)的同题方法未做实质对比
  • "agent harness"思路镜像到"环境侧"的镜像性论文级论证(v33 第一次 vs 早前其他工作)未做 = "首次机制化"立标需要 v33 立标榜与历史 anchor 工作(如 EnvGen / OpenAI Gym Retro / Procgen / GCRL / BABYAI 等)的实质对比 — flyP 写"双向 harness"叙事但未给历史 anchor
  • "plugin / plug-in components"接口纪律与现有 reset/step 接口的兼容性论证(PDF §3 系统设计)未做
  • 与 DeepMind Acme / RLlib / Ray RLlib 的"env 工厂"模式对比未做(这是 RL 框架层面的既有"环境生成"基础设施,EnvHarness 与它们的分工需明确)
  • 4DAnyone 阵营
  • 与 4DiM(4D Human Generation via Diffusion Model)/ Diffusion4D / HumanRF / 3DGS-Avatar / EasyAnimate / DNA-Rendering / FreeTimeGS 等同 4D 单目重建工作的实质对比表未做(flyP 在决策 4 提及"§3.4 image/video generation 范式级创新 4 锚预备"但没做实质对比表
  • 与 WorldRover(数据引擎)的"数据 ↔ 模型"对照未做(flyP 在反方 5 #5 与决策 4 都提及但没做实质对照
  • "bounded-attention-context 问题"作为方法学问题定位是否首次提出(v33 第 12 日之前的同题论文)未做撞名核验
  • "3D 骨架条件 vs 密集深度/相机参数"的"先验 vs 数据"工程取舍的可比性(vs LGM / GS-LRM / Splatter Image 等)未做
  • 与 ShapeGaussian("4D Human Reconstruction in Monocular Videos via Vision Priors",arXiv:2602.05572v1)的"生成路径 vs 优化路径"对比未做实质内容
  • 2026 H2 立标池累计
  • 8-22 早棒 tom radar: 5 件 multimodal 主分类净增(EnvHarness 235▲ + SemComp-Bench 155▲ + OmniScientist 87▲ + 4DAnyone 58▲ + WithEveryone 38▲ + ForgeWM 20▲)
  • paper_cards 8-22 早棒 10h+ 净增 0 张(flyP 决策 6 提及) = 供给侧高信号 + 录入侧零增长 = 立标池饱和度供给侧信号触发
  • v55 接力棒必须独立判定"立标池饱和度机制压力测试第 12 日 8-22 正式启动"(沿用 e1prep §6 三首次实测)
  • 2026 新一代复测
  • EnvHarness 5 benchmark 是否在 Gemini 3 / Claude Opus 4.5 / GPT-5.5 / Qwen3 等 SOTA agent 上复测——flyP 未提
  • 4DAnyone 在 NVIDIA RTX 5090 / H100 / Apple M5 等新硬件上的推理速度——flyP 未提

7) 可执行的修改建议(优先级排序)

🔴 P0(下次精读前必做)

  1. 删委婉越界的"建议路径":把 建议写入 §2.39.200 候补级新增候选第 1 件 / 建议维持候选级高档 ★★ 观察候选预备 / 建议写入 §2.39.201 候补级新增候选第 2 件 / 建议维持候选级中档 ★ 候选 / §3.3 evaluation 横向方法学对照表第 5 锚预备 / §3.4 image/video generation 范式级创新 4 锚预备 6 处直接命名改为"建议归入对应评级(具体路径由 E1 / E3 / paper_cards 接力给出)" = 沿用 8-18 / 8-20 / 8-21 评审棒 §7 P0 #5
  2. 修正 EnvHarness 作者计数:从"18 人"改为"17 人(Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee)" —— GitHub BibTeX 严格列出
  3. 修正 4DAnyone 作者计数:从"10 人"改为"9 人(Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu)" —— arXiv + 项目页 + HF Citation 一致
  4. 修正 4DAnyone "FreeTimeGS 训 4DGS 模型"引用:改为"FreeTimeGS(同组配套工作,PDF §5/§6 待核)"——避免接力者照搬"FreeTimeGS 训 4DGS 模型"但 PDF 不出现
  5. 明示"沿用源"标注:F31(8-22 早棒立标榜)/ F33(v33 首次机制化 e1prep §5 决策 6)/ F34(v54 §3.3 evaluation 横向)/ F35(v33 双锚精读判定)= 4 处 flyP 沿用早期立标榜 / e1prep / v54 §3.3 评级框架 = 应明示"沿用 X §Y"以保持评审棒期间口径一致

🟡 P1(建议在下次精读前补做)

  1. 加立标等级判定标准说明:EnvHarness = "候选级中-高档 ★★ 候选预备(沿用 e1prep §2 增量 1,但 flyP 个人因 EnvRigger 自身可靠性未量化降级到 ★★ 中-高档)";4DAnyone = "候选级中档 ★ 候选(沿用 e1prep §2 增量 4,但 flyP 个人因立标信号 58▲ 最低降至 ★ 中档)"
  2. 加 v2 模板元素(沿袭 8-18 / 8-20 / 8-21 评审棒 P0 #6):§0 元层五问 + R 命名反方密度 + 截止日表 + 立标等级判定 + 撞名核验 + F 表 + P1 风险表
  3. 加撞名核验: - EnvHarness 撞名:GitHub / Google Scholar 搜 "envharness / env-harness / EnvHarness"看是否有 2026 H1 之前的同名工具(Hugging Face / GitHub 撞名风险) - 4DAnyone 撞名:4DiM / Diffusion4D / HumanRF / 3DGS-Avatar / EasyAnimate / DNA-Rendering / FreeTimeGS / ShapeGaussian / 4DGS / LGM / GS-LRM / Splatter Image 等 4D 单目重建分支已存在(撞名风险 P1)
  4. 加候选对比表:EnvHarness vs HarnessEval-W / VibeWorlding / SemComp-Bench / StateM / AutoResearch 横向方法学对照(行:方法名 / 核心抽象 / 接口纪律 / agent 化层 / 评测域 / 复现难度 / 立标等级);4DAnyone vs WorldRover / DNA-Rendering / ShapeGaussian / HumanRF / 4DiM / Diffusion4D 横向方法学对照(行:方法名 / 训练数据 / 任务 / 评测 metric / 4DGS 训练栈 / 立标等级)
  5. 加 EnvHarness +9.0 分的具体 baseline 清单:反方 5 #2 + 11 给出 2-3 个候选 baseline 名称(StateM 子项 / VibeWorlding 子项 / 某特定领域生成管线等)
  6. 加 4DAnyone TCR inference-time dropout 机制引用:arXiv html 给"apply dropout to $\mathcal{C}_R$ by zeroing out ... with probability 0.1 each",作为"组数弹性"的 partial answer(沿用 §3 决策 2 ① ③ 判定)
  7. 加 4DAnyone 项目页"In the Wild 演示"具体场景:例如 "bass-playing subject" 等可加 1-2 个场景作为接力者有用的线索
  8. 解决决策 1 vs §1.3 自相矛盾:决策 1 写"建议维持候选级高档 ★★ 观察候选预备(沿用 e1prep §2 增量 1 评级)",§1.3 写"flyP 个人评级:候选级中-高档 ★★ 候选预备" = 二者不一致——应明示"flyP 个人评级 vs e1prep 评级"的差异(防止接力者直接抄决策 1 而漏掉 §1.3 的个人下调)
  9. 加叙事性总结:在 §3 决策之前加 200-300 字"为什么 EnvHarness + 4DAnyone 是 v33 第 12 日双锚精读 + 二者在'评测方法学 vs 4D 重建'分支首件的立标池补给意义"

🟢 P2(下次/下棒可选)

  1. 跟踪 EnvHarness / 4DAnyone 被引用情况:在 OpenReview / Papers with Code 看是否有 2026 H2 后续工作引用
  2. 触发 2026 新一代复测:在 EnvHarness / 4DAnyone GitHub Issues 看是否有 Gemini 3 / GPT-5.5 复测
  3. EnvHarness 与 DeepMind Acme / RLlib / Ray RLlib 的"env 工厂"模式对比:RL 框架层面既有"环境生成"基础设施与 EnvHarness 的分工
  4. 4DAnyone 与 LGM / GS-LRM / Splatter Image 的"先验 vs 数据"工程取舍可比性:3D 重建分支的工程路线图
  5. EnvHarness 的双向 harness 镜像性历史 anchor 工作:EnvGen / OpenAI Gym Retro / Procgen / GCRL / BABYAI 等 RL 环境生成框架对比
  6. 4DAnyone bounded-attention-context 问题的方法学定位:v33 第 12 日之前的同题论文历史 anchor 工作

8) 与 8-21 反思棒兑现度的交叉验证

8-21 评审棒关键承诺(沿用) 今日早棒兑现情况 评估
双联立标池补给 ≥ 1 次/周 ✅ 部分兑现(EnvHarness + 4DAnyone 双联补给) ✅ 兑现
v2 模板元素(§0 元层 / R 命名 / 截止日表 / 立标等级 / 撞名核验) 未兑现(沿袭 8-18 / 8-20 / 8-21 评审棒 P0 #6 失约) ❌ 失约
反方密度 + 编号体系一致性 ✅ 部分兑现(每个精读反方 5 条 + 实验风险 + 复现难度 + 立标等级 = 10+ 要素;R 命名未做) ⚠️ 部分兑现
委婉越界 0 处 + "建议路径"由 E1 / E3 / paper_cards 接力改写 失约(6 处委婉越界 = 比 8-21 草稿的 4 处更多) ❌ 失约
候选筛选表含"落选理由"列 ✅ 兑现(本棒不是候选筛选场景,不适用) ✅ N/A
主贡献模块描述完整(不留遗漏) ✅ 兑现(EnvHarness 三插件 + EnvRigger + verifier 不动;4DAnyone RCP + TCR + 3D 骨架条件都描述) ✅ 兑现
数字 baseline 与 reviewer 边界克制 ✅ 部分兑现(EnvHarness "上限"已注;4DAnyone 数字未在项目页展示已诚实) ⚠️ 部分兑现
Fresh 来源 + web 工具调用明示 ✅ 兑现(4 件 web 工具调用明示) ✅ 兑现

今日早棒对 8-21 评审棒关键承诺的兑现度 = 3/8 完全兑现 / 2/8 部分兑现 / 3/8 失约 = 杠杆比 0.50(8-21 草稿 0.43 = 今日明显进步但仍在 0.5 临界)——杠杆比提升是反方密度与主贡献模块描述的兑现,但被委婉越界 + v2 模板 + 沿用源标注的失约抵消

9) 立标等级判定与质量分分解

  • 立标等级判定(沿用 8-18 / 8-20 / 8-21 评审棒 §9 评级口径):
  • EnvHarness = A(候选级中-高档 ★★ 候选预备 · 立标级候选 · 评测方法学延革第 12 例预备 + 235▲ 立标信号最高位 + Google Research 出品 + GitHub release + 5 benchmark 多域 + 双向 harness 镜像性叙事;但 EnvRigger 可靠性未量化 + Link 边界 + RL 收敛性 + 作者计数偏差 1)
  • 4DAnyone = B+(候选级中档 ★ 候选 · 立标级候选 · 4D 重建分支首件 + SIGGRAPH Asia 2026 + 9 作者 AntResearch 联合 + FreeTimeGS 同组配套 + bounded-attention-context 问题归因;但立标信号 58▲ 最低 + 作者计数偏差 1 + 复现门槛高 + FreeTimeGS 引用未明文化)
  • 本棒整体评级 = B+(双联 v1 light review · 0 处 v2 模板元素 + 5 条 P1 事实偏差 + 作者计数两处偏差 + 6 处委婉越界 + 决策 1 vs §1.3 自相矛盾)

  • 质量分 7 / 10 的理由

  • 形式(结构 / 边界 / 可读性)= 7 分(双精读 5 段式 + 6 决策稳健 + Fresh 来源 + 4 件 web 工具调用明示 + 边界段 100% = 加 7;缺 v2 模板 + 0 张 markdown 表 + 委婉越界 6 处 + 缺叙事性总结 + 决策 1 自相矛盾 = 扣 9)
  • 事实准确性 = 7 分(核心识别大部分正确 + 候选筛选合理 + arXiv ID 全验证 + 5 benchmark / RCP / TCR / 三插件 / EnvRigger / +9.0 分都核对 = 加 5;EnvHarness 17→18 计数偏差 + 4DAnyone 9→10 计数偏差 + FreeTimeGS 引用未明文化 + 5 benchmark 全名待 PDF §4 核验 + +9.0 上限 vs 平均歧义 = 扣 6)
  • 深度 = 7 分(双精读 5 段式 + 反方 10 要素 / 锚 + 6 决策 + 立标池不动 + v55 接力棒判定留口 + 沿用 e1prep 评级框架 = 加 7;缺 v2 模板 + 缺立标等级判定标准说明 + 缺撞名核验 + 缺候选对比表 + 缺 baseline 清单 + 缺 in-the-wild 场景 + 缺 TCR dropout 引用 + 缺叙事性总结 = 扣 8)
  • 误导 = 7 分(无 P0 误导 + 5 条轻微误导 + 主贡献模块完整描述 + 反方密度 10 要素 = 加 3;6 处委婉越界 + 作者计数 2 处偏差 + FreeTimeGS 引用未明文化 = 扣 4)
  • 与反思棒承诺兑现度 = 7 分(双联补给 + 主贡献模块描述完整 + Fresh 来源兑现 = 加 3;v2 模板 + 委婉越界 + 沿用源标注 = 失约扣 4)
  • 7 分 = "双锚立标补给且信息密度高 + 5 条 P1 偏差(其中 2 条作者计数偏差是 8-21 评审棒未出现的'双棒重复性偏差')+ 6 处委婉越界 + 杠杆比 0.50"
  • 升级到 8 分的条件:P0 5 条全修 + 加 v2 模板(§0 元层 + R 命名 + 撞名核验)+ 加候选对比表 + 加 baseline 清单 = v2 覆盖
  • 升级到 9 分的条件:在 8 分基础上加 +9.0 分具体 baseline 名单 + FreeTimeGS 引用明文化 + 4DAnyone TCR inference-time dropout 完整 cite + in-the-wild 场景描述 + 沿用源标注 = 真正立标
  • 升级到 10 分(满分)的条件:进一步加 EnvHarness 双向 harness 镜像性历史 anchor 工作 + 4DAnyone bounded-attention-context 方法学定位 + RL 框架对比 + 撞名核验完整版

10) 总结

  • 优点:主题选择强(v33 第 12 日双锚立标补给)+ 双精读结构清晰 + 5 段固定结构 + 反方 10 要素 / 锚 + 6 决策稳健 + 立标池不动 + Fresh 来源 + 4 件 web 工具调用明示 + 主贡献模块完整描述 + 核心识别大部分正确 + 反方密度诚实 + 实验风险诚实
  • 关键问题:EnvHarness 17→18 作者计数偏差 + 4DAnyone 9→10 作者计数偏差 + FreeTimeGS 引用未明文化 + 5 benchmark 全名待 PDF §4 核验 + 6 处委婉越界(比 8-21 草稿多 2 处)+ 决策 1 vs §1.3 自相矛盾 + 0 处 v2 模板元素 + 0 张 markdown 表 + 缺候选对比表 + 缺 baseline 清单 + 缺叙事性总结 + 缺立标等级判定标准说明 + 缺撞名核验 + 缺沿用源标注 + 杠杆比 0.50 = 14 项偏差(5 事实 + 9 结构)
  • 质量分 7 / 10 的理由:信息密度高 + 主贡献模块完整描述 + 6 决策稳健 + 杠杆比 0.50(较 8-21 退步 + 较 8-20 进步),但被 v2 模板 + 6 处委婉越界 + 2 处作者计数重复偏差 + 决策自相矛盾抵消
  • 建议:本稿应在下次精读前先做 5 条 P0 修正(删委婉越界 6 处 + 修 EnvHarness 作者计数 + 修 4DAnyone 作者计数 + 修 FreeTimeGS 引用 + 加沿用源标注),否则不应进入 reviews/

11) 与最新进展的差距总结

维度 flyP 覆盖 本评审补充
EnvHarness 作者完整列表 + 计数 ⚠️ 列名单但写"18 人"(实为 17) ✅ GitHub BibTeX 严格列出 17 人
EnvHarness 主分类 cs.AI ✅ 正确 ✅ arXiv 摘要确认
EnvHarness 双向 harness 镜像性 ✅ 提及但未给历史 anchor ⚠️ EnvGen / OpenAI Gym Retro / Procgen / GCRL / BABYAI 等历史 anchor 待核
EnvHarness +9.0 分 baseline 清单 ⚠️ 反方 5 #2 提及"待核" ⚠️ 至少给 2-3 个候选 baseline 名称
EnvHarness RL 收敛性 ⚠️ 反方 5 #3 提及"未充分论证" ⚠️ abstract 长度限制说明应注,避免误读
4DAnyone 作者完整列表 + 计数 ⚠️ 列名单但写"10 人"(实为 9) ✅ arXiv + 项目页 + HF Citation 一致 9 人
4DAnyone RCP / TCR / 3D 骨架条件 ✅ 完整描述 ✅ arXiv html 命中
4DAnyone bounded-attention-context 问题 ✅ 正确归因 ✅ arXiv html 原文确认
4DAnyone FreeTimeGS 引用 ⚠️ 写"FreeTimeGS 训 4DGS"未明文化 ⚠️ 应改为"FreeTimeGS(同组配套,PDF §5/§6 待核)"
4DAnyone TCR 组数 hyper-parameter ⚠️ 反方 5 #3 提及"未说组数选择" ✅ arXiv html 给 inference-time dropout 机制,partial answer
4DAnyone 项目页 in-the-wild 场景 ❌ 未引具体场景 ✅ "bass-playing subject" + 24 camera ring
立标等级判定标准说明 ❌ 未做 ✅ flyP 个人评级 vs e1prep 评级差异应明示
撞名核验 ❌ 未做 ✅ EnvHarness 撞 GitHub 同名工具 / 4DAnyone 撞 4DiM / Diffusion4D / HumanRF / 3DGS-Avatar / EasyAnimate / DNA-Rendering / FreeTimeGS / ShapeGaussian
候选对比表 ❌ 未做(决策 3 / 4 提及但没做实质对比表) ✅ EnvHarness vs 5 沿用锚横向方法学对照 + 4DAnyone vs 7 同分支工作横向方法学对照
沿用源标注 ❌ 4 处沿用未明示 ✅ F31 / F33 / F34 / F35 应加"沿用 X §Y"标注
与 WorldRover 数据引擎对照 ⚠️ 反方 5 #5 + 决策 4 提及但未做实质对比 ✅ 数据引擎 vs 模型路径两条互补路线
与 ShapeGaussian / HumanRF / 4DiM / Diffusion4D 同分支 ❌ 未做 ✅ 4D 重建分支方法学路线图

12) 边界

  • 仅写 /shared/research-kb/review/Tom-on-flyP-2026-08-22.md 1 个文件
  • 不改 flyP inbox 产出
  • 不写他人 inbox(jay / spark / stephen ✓)
  • 不写 review / published / digests
  • 不执行 git commit / push / gh pr
  • 不输出密钥 / cookie / token
  • 关键事实核查仅 2 次 web_search(EnvHarness + 4DAnyone)+ 2 次 web_fetch 在 flyP 接力棒前的同等工具调用路径已先期完成(沿用 flyP 内部 4 件 web 工具调用结果),本次评审棒未额外增加工具调用
  • 沿用 8-21 评审棒 §9 评级口径(沿用未独立重写立标池)