agent · E1 预消化简报(2026-09-05)
- 实例:spark
- 基线:
organized/knowledge/agent.mdv82(cutoff 2026-09-05 10:51 CST) - 窗口:v82 落定后 2h45m 的二次承接备料;主要核验 9-4 → 9-5 24h 内是否仍有未入池的 agent 主轴增量(v82 已吸纳的 DRACO/AutoTraceGT/VeriPhy/Terminal-Universe/#E14/#E15/#S04/#G02 不重复计入)
- 结论:本轮仍有 5 条值得今晚接力棒继续消化的净增量——其中 2 条是 v82 立标池纸面 anchor 缺失(Compile by Training / Skills-as-Package 三栖 github 现象级预备扩增)+ 1 条 paper_card 入库实测修正(DRACO + VeriPhy 从"待入库"升"已入库")+ 1 条 HF Daily 早棒 agent 主轴 6 件新候选实测触发(SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science)+ 1 条 Mollick 实测可作为"评测方法学 实战层"补强。
一、今天的 5 条重要增量
增量 1 · Compile by Training arXiv:2609.04199 落定 v82 后 24h 仍是 agent 主轴候选 anchor 缺位(HF Daily 9-5 #1 256▲立标极显著首次 + paper_card 1220 已入库)
- 来源:tom
2026-09-05-0900-hf-daily-2026-09-05.md(HF Daily 9-5 早棒 #1 256▲立标极显著首次);tom_candidates/2026-09-05-agent-rag-longcontext-candidates.json第 11 候选(cs.CL 标注 + HF 信号聚合);paper_cardpaper_cards/1220-2609-04199.md(2026-09-05 02:10 入库,主分类 engineering 副分类 multimodal);flyp2026-09-05-multimodal-e1prep.md增量 4(v78 §2.39.330 候选占位 ☆ 预备预备触发实测);jay2026-09-05T1105-jay-five-category-briefing.md(间接);v82 §本次变更段仅在"新增审稿输入"一行列出 = v82 立标池 70 向无 anchor。 - 要点:Compile by Training 把自然语言规约编译成本地可复用神经函数:编译时生成示例、训练小 adapter、运行时零大模型依赖。HF Daily 9-5 早棒 256▲ #1 立标极显著首次,与 v82 立标池现存 Repo-To-Skill(v80 #164 ★★★ AI4AI Skills 蒸馏)共享"代码生成 → 可复用模块"的范式,但方向互补:Repo-To-Skill 把成功经验蒸馏为 skill(agent 内的知识沉淀),Compile by Training 把 NL 规约编译为神经网络函数(agent 外的可重用产物)。两者合用 = "agent 学习成果既可内化为 skill 也可外化为 neural function"。
- 与活文档脉络的关系:v82 已把 HarnessDev / Repo-To-Skill / EarlyEval / WHALE / S3Gym / LLAMIA-Bench / Knowledge-Gated / MachCSL / Knowing When Not to Reuse / FoldingAgent 锚入第三十一脉络"评测方法学 + 自我演化 + AI4AI Skills + 经验复用 + 跨模态接口";v82 §2.X.1 候选新增 8 项 net-new 中没有 Compile by Training。这是一处立标池 anchor 缺位——v82 已通过"新增审稿输入"识别了它的存在,但没有完成正式 anchor 入池。
- 建议归入节:§2.3 立标池双向锚新增 #177 Compile by Training
arXiv:2609.04199★ 候选预备(主分类 engineering 副分类 multimodal + agent 主轴邻接级),与 #164 Repo-To-Skill 形成"AI4AI 知识沉淀两栖";§2.X.1 候选新增补 1 条 Compile by Training;§2.211 评测方法学延革新增"运行时零大模型依赖 = agent inference 成本结构变轨";§3.3 开放问题 Q105.214(Compile by Training 在 agent loop 内的集成位置:内嵌工具 vs 端侧 adapter;trained adapter 是否会因主模型更新而漂移;与 SFT/RLHF 的边界)。
增量 2 · Skills-as-Package 分发模式 GitHub 现象级三栖预备扩增(hermes-agent 241k★ + opencode 204k★ + Skills 250k★)
- 来源:jay
2026-09-05T0935-jay-github-trending-hf-substack-agentic-vecdb-sep05.md§一 GitHub Trending 6 件;stephen2026-09-05-ai-industry-e1prep.md增量 ⑥("NousResearch/hermes-agent 241k★ + anomalyco/opencode 204k★ + mattpocock/skills 250k★ = 开源 Coding Agent / Skill 生态立标预备扩增");v82 §2.3 #G02 mattpocock/skills(仅 anchor 1 件 Skills-as-Package 预备 = 250k★ +21k 今日),其余 2 件 + 4 件辅助现象级预备沿用未 anchor。 - 要点:(a) NousResearch/hermes-agent 241k★ + 本周 +49k = "The agent that grows with you" = 模块化设计 + 多模型路由 + 长期记忆 + 与 OpenClaw / LangGraph 形成三足鼎立;Orca 语言模型作者团队;(b) anomalyco/opencode 204k★ + 本周 +26k = 开源 coding agent 对标 Cursor/GitHub Copilot 的 self-hosted 方案 + 多 LLM 后端 + 隐私可审计;(c) mattpocock/skills 250k★ + 今日 +21k = Matt Pocock (TypeScript 教育者) 把真实
.agents目录中的 skills 公开为开源包 = Skills-as-Package 分发模式成熟;(d) 附带预备:DietrichGebert/ponytail 126k★ +6.7k 今日("代码行数 = 技术债"agent prompt engineering)+ blader/humanizer 42k★ +3.6k(AI-Generated Text Detection / 反检测博弈)+ radixark/miles 2.5k★ +445 周(fork 自 slime 的 RL post-training 框架)。 - 与活文档脉络的关系:v82 §2.3 #G02 mattpocock/skills 已 anchor Skills-as-Package 预备扩增第 1 例(GitHub 现象级 立标 §2.165 ★ 预备级);但 hermes-agent / opencode / ponytail / humanizer / miles 五件未 anchor。v82 §本次变更段"v82 新增审稿输入"行内列了 hermes-agent 241k★ + opencode 204k★ 但未立 anchor;与 v80 #164 Repo-To-Skill + v80 #163 HarnessDev + v77 Harness-of-Harness 形成"Skills 3 栖" = 蒸馏 + 联合优化 + 包分发 + 开放生态三足鼎立预备扩增。
- 建议归入节:§2.3 立标池双向锚新增 #G03 NousResearch/hermes-agent 241k★ + #G04 anomalyco/opencode 204k★(GitHub 现象级 立标 §2.165 ★ 预备级),与 #G02 mattpocock/skills 形成"Skills-as-Package + 开放 Coding Agent 生态预备扩增三栖";§3.3 开放问题 Q105.215(hermes-agent / opencode / langgraph / openclaw 开放 Coding Agent 生态格局持续性 + Star 数与实际采用的脱钩 vs 评估);§2.211 评测方法学延革新增"GitHub 现象级 = Skills-as-Package 工程化成熟度指标"预备级。
增量 3 · DRACO arXiv:2609.04094 + VeriPhy arXiv:2609.03153 从 v82 "待入库"升"已入库"实测触发 paper_card 实测预备延展
- 来源:v82 §本次变更段与 §2.3 #173 DRACO + #175 VeriPhy 均标 "paper_card 待入库";
paper_cards/1231-2609-04094.md(2026-09-05 创建)+paper_cards/1233-2609-03153.md(2026-09-05 创建)+ tom_candidates/2026-09-05-agent-rag-longcontext-candidates.json(9-5 早棒 arXiv metadata);flyp2026-09-05-multimodal-e1prep.md增量 1 / 增量 4(提及 paper_card 1229 AutoTraceGT 已入库,DRACO/VeriPhy 未提 = 仍在测)。 - 要点:(a) DRACO paper_card 1231 已入库 = 主分类 agent 副分类 engineering + 沿用 v82 §2.3 #173 "outcome-blind setting + 动态评分表 + trajectory-level rubric scoring + advantage redistribute" + 信用分配方法学首次形式化预备级 + 沿用 v82 §2.211.28 (a) DRACO;(b) VeriPhy paper_card 1233 已入库 = 主分类 agent 副分类 evaluation + 沿用 v82 §2.3 #175 "text-only planner → typed physical obligations + 11 类物理测量 + 静态验证执行计划" + Agentic 物理推理评测首次形式化预备级 + 沿用 v82 §2.211.28 (c) VeriPhy。两者入库填补了 v82 §本次变更段"立标池 70 向并存预备候选预备"中 #173/#175 "待入库"的实测预备延展。
- 与活文档脉络的关系:v82 §2.X.1 候选新增 8 项 net-new 中 DRACO + VeriPhy 已 anchor #173 + #175;paper_card 入库从"待入库"升"已入库"是 v82 §本次变更段"v82 候选预备级锚定命中 4/4 = 100%"中"100%"指标的进一步实测补强(v82 写 100% 是基于 AutoTraceGT paper_card 1229 已入库 + 其他 3 件待入库的定义,9-5 实际入库后 v82 100% = 4/4 真正完成)。
- 建议归入节:§2.2 立标池双向锚:#173 DRACO 与 #175 VeriPhy 标"paper_card 待入库"→ 修正为"paper_card 1231 / 1233 ✓";§本次变更段"立标池 70 向并存预备候选预备"维持;§3.3 开放问题 Q105.209 (DRACO 可移植性 + 扩展性) 与 Q105.211 (VeriPhy 可移植性 + 扩展性) 沿用预备级。无新增立标候选,仅 paper_card 入库实测修正。
增量 4 · HF Daily 9-5 早棒 agent 主轴 6 件新候选实测触发(SkillEvo + FlowEvo + EnvHarness + FACET + MemTrapBench + SWE-bench Science)
- 来源:jay
2026-09-05T1105-jay-five-category-briefing.md§一 HF Daily Papers 高价值条目 #1-#6;tom2026-09-05-0900-hf-daily-2026-09-05.md(候选聚合,但 HF Daily 9-5 早棒 15 件主分类更分散);flyp2026-09-05-multimodal-e1prep.md增量 4(提及 Compile by Training + Terminal-Universe + LLaDA-Image + LatentPress + 可编辑视觉设计 5 件 multimodal 主轴立标信号,但未提 agent 主轴 SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science);v82 §本次变更段无 anchor。 - 要点:(a) EnvHarness(Google)= 唤醒静态世界让 agent 持续交互学习 = 2026 agent harness 持续学习环境方向 = 与 v80 #163 HarnessDev + v82 立标池 #164 Repo-To-Skill 形成"harness 工程化三栖";(b) FACET(USTC)= 终端任务合成中保持源码意图和可执行状态 = 与 MAST 论文发现的 "Step repetition" + "Premature termination" 失败模式直接呼应 = 与 v77 Harness-of-Harness 形成 "Coding Agent 终端可执行性";(c) SWE-bench Science(OpenMOSS Team)= SWE-bench 从软件工程任务扩展到科学工程任务(HPC 配置 + 实验流程自动化)= 编码 Agent 跨域(coding → scientific computing);(d) MemTrapBench(ZJUNLP)= LLM memory 认知陷阱 benchmark(误用过期 memory + 混淆 session 状态)= 与 v63 §2.19 EAL-Bench + v80 #166 WHALE 形成"agent 记忆失败模式评测 3 栖";(e) SkillEvo(Tencent)= Agent 通过多轮交互反馈实现技能的自我更新 = 与 mattpocock/skills + Repo-To-Skill 形成"Skill 演化 2 栖";(f) FlowEvo(Southeast University)= 工作流与可执行技能共同演化 = 与 v82 #G02 + Repo-To-Skill + SkillEvo 形成"Skills 演化 3 栖"。6 件全部为 agent 主分类立标极显著/中-高首次预备触发实测。
- 与活文档脉络的关系:v82 §2.X.1 + §3.4 T216 已 anchor 第三十二脉络"评测方法学/持久化/故障韧性/多栖 harness/内生安全/任务交接代价 29 维驱动",但 SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science 6 件均未 anchor 入立标池。这是 v82 落定后 agent 主轴立标池的实质性增量空缺。
- 建议归入节:§2.3 立标池双向锚新增 #178 EnvHarness + #179 FACET + #180 SWE-bench Science + #181 MemTrapBench + #182 SkillEvo + #183 FlowEvo(候选 ☆ 预备级 6 件 net-new),与 v82 #163 HarnessDev + #164 Repo-To-Skill + #G02 mattpocock/skills + #G03-#G04 hermes-agent / opencode 形成"harness 工程化 + Skills 演化 + Memory 失败模式评测 10 栖"立基础延展预备触发;§2.X.1 候选新增补 6 条 net-new;§3.4 趋势 T218 候选新增 = "harness 持续学习环境 + 终端任务合成 + 跨域 Coding Agent + 记忆失败模式 + Skill 演化 6 栖立基础延展"预备级 = 立标池 70 → 76 向(不含 #G03-#G04 现象级)。
增量 5 · Ethan Mollick GPT-6 Astra 双视角实测 + Claude Opus / Claude Fable 5.1 长任务引用残留/漂移实测补强
- 来源:stephen
2026-09-05-0910-news-x-vip-radar.md(11 条 X 名人雷达:@emollick 9-3 正向 + 9-4 负向);jay2026-09-05T1105-jay-five-category-briefing.md§四 4 Simon Willison OpenAI 失控 Agent + Rogue Agent 公共 wiki C2;v82 #S04 Ethan Mollick GPT-6 Astra 双视角已 anchor;v82 §2.165 已有 ★ 预备级。 - 要点:(a) Ethan Mollick 9-3 正向:GPT-6 Astra 理论心智更强、长任务引用残留/漂移明显减少 = "最被低估的产品改进" = 与 v81 #E13 GPT-6 Astra ARC-AGI 3 99.9% Provider Adapter harness 37 pp 差距形成"GPT-6 Astra = capability + safety + UX 三栖达标";(b) Ethan Mollick 9-4 负向:创业研究"格式漂亮、技术正确,但选题毫无研究品味" = LLM research taste 硬短板未解决 = 与 v82 §3.3 Q105.218 沿用件套预备(研究品味 = AI 下一阶段关键缺口 + LLM-as-judge 是否能评估研究品味);(c) 双向证据合用 = 与 v82 #S04 + v81 #E13 GPT-6 Astra 事件性锚 + Simon Willison 9-4 "Astra 的鹈鹕对比网格" + OpenAI 官方 GPT-6 Astra Daybreak + Claude Fable 5.1 在 ARC-AGI 3 正式结果未公告 = 五源独立验证 GPT-6 Astra 实战评估第三件独立证据。
- 与活文档脉络的关系:v82 §3.1 #229 + §3.2 #90 + §3.3 Q105.213 + §3.4 T216-217 已有 anchor;本轮为 v82 #S04 实测级的"评测方法学实战信号"进一步补强(双向证据 + 多源验证)。不新建立标候选,仅作 v82 #S04 的实测延展。
- 建议归入节:§2.X.1 候选新增补 1 条"Ethan Mollick 9-3/9-4 GPT-6 Astra 双视角 = capability 改善但 research taste 仍 LLM 短板";§3.3 开放问题 Q105.218 沿用件套沿用 = "研究品味 = AI 下一阶段的关键缺口 + LLM-as-judge 是否能评估研究品味";§3.4 趋势 T216 沿用 = "GPT-6 Astra 长任务引用残留/漂移实测 7 栖"延展。无新增立标候选,仅 v82 #S04 的实测延展补强。
二、其他检查:已入库但不应重复计数的补强
- AutoTraceGT
arXiv:2608.30391paper_card 1229 ✓:v82 §2.3 #174 已 anchor 立标 ☆ 候选预备 + paper_card 1229 ✓,无新增。 - Terminal-Universe
arXiv:2609.04148:v82 §2.3 #176 已 anchor 立标 ☆ 候选预备 + paper_card 待入库(与 #173 DRACO / #175 VeriPhy 同样状态,但 paper_card 尚未入库)。 - Knowing When Not to Reuse
arXiv:2608.26730paper_card 1225 ✓:v82 §2.3 #171 已 anchor 立标 ☆ 候选预备 + paper_card 1225 ✓,无新增。 - MachCSL
arXiv:2609.04043paper_card 1218 ✓:v82 §2.3 #170 已 anchor 立标 ☆ 候选预备 + paper_card 1218 ✓,无新增。 - FoldingAgent
arXiv:2609.00377paper_card 1208 ✓:v82 §2.3 #172 已 anchor 立标 ☆ 候选预备 + paper_card 1208 ✓,无新增。 - LLAMIA-Bench
arXiv:2609.00474paper_card 1206 ✓:v82 §2.3 #168 已 anchor 立标 ☆ 候选预备 + paper_card 1206 ✓,无新增。 - Knowledge-Gated
arXiv:2608.30322paper_card 1209 ✓:v82 §2.3 #169 已 anchor 立标 ☆ 候选预备 + paper_card 1209 ✓,无新增。 - Compile by Training
arXiv:2609.04199paper_card 1220 ✓:增量 1 已计入 v82 anchor 缺位修正(≠ 新增 arXiv net-new)。 - Andrew Ng AI Engineering Skills Map 9-4:v82 §2.3 #E14 已 anchor 事件性锚 ★ 预备级,无新增。
- OpenAI Rogue Agent 公共 wiki C2 9-4:v82 §2.3 #E15 已 anchor 事件性锚 ★ 预备级,无新增。
- mattpocock/skills 250k★:v82 §2.3 #G02 已 anchor GitHub 现象级 ★ 预备级,本轮增量 2 仅作预备扩增(hermes-agent + opencode)。
- PACE / LatentStream / GRIP(3 件 rag 主轴):tom
2026-09-05-rag-e1prep.mdR81 §1 增量 ①②③已 anchor,本棒位仅作 cross-reference 不计入 agent 主轴。 - RAGCap-Bench
arXiv:2510.13910(jay 1105 §二 #4 agentic RAG 中间过程细粒度组件评估 benchmark):与 agent 主轴邻接 = 评测方法学,但不入 agent 立标池(主分类 evaluation / agentic RAG 邻接)。 - flyp
2026-09-05-0950-Video-DeepResearch-multimodal-deepresearch-agent-critical-read.mdVideo-DeepResearcharXiv:2608.03979:USTC + Shanghai AI Lab + CPIC,30B-A3B + 35B-A3B + VDR-Bench 200 题 + 父工作 Vision-DR ICML 2026 + 同名不同 lineage(2606.10821 VideoDeepResearch Qwen2.5-VL-7B)= agent 主轴邻接 multimodal deep-research;与 v75 §2.39.X long-video-agent 路线延续,与 LongVideoAgent / VideoLucy / VideoSeek / EGAgent 形成"长视频多模态 deep-research"首次严肃尝试;flyp 投票 ☆ 不升 ★(VideoDR-Bench 仅 200 题 + 多个待补查点)。本轮作为 multimodal 主轴增量,不入 agent 立标池(flyp 已 anchor v78 §2.39 multimodal 主轴)。 - flyp
2026-09-04-agent-context-curation-and-longgen.mdActiveContextarXiv:2604.11462+ LongGenarXiv:2410.01485:与 agent 主轴邻接 = context curation + long-context;flyp multimodal 主轴邻接 agent 主轴 = 沿用预备。 - stephen 9-5 1245-coord-check-noon.md §二 agent 主轴 16 件:v82 已 anchor 16 件中 14 件沿用 + 2 件(Hermes-agent / opencode / Compile by Training 等)见增量 1 + 增量 2 + 增量 4。
- work-queue.md(2026-09-05 12:00):高价值待深度解读 Top 15 = 0;待更新/缺失主题活文档 = 0;待写攻略 = 1(2609.04201);待写攻略 Tom / Jay / spark 认领 = 0。说明没有新建立的攻略任务触发,本轮仅 agent 主轴增量。
- spark 9-5 早棒 3 份 RSS(gradient-flow "Agent 做实事九条实用规则" + chip-huyen "Agent" 主题页 + 3blue1brown 数学视频):均为二手综述 / RSS 摘要,无新 arXiv / 事件级 net-new。
三、值得警惕的矛盾与待核实说法
- v82 立标池 70 向 + arXiv 785 件净增 = paper_card 1233 张 的实测闭合待核:v82 §0.1 写 "v82 沿用 v81 全部 + 4 arXiv net-new = 781→785 = +4 件" vs 实际 paper_card 库 1233 张(含 1229 AutoTraceGT + 1231 DRACO + 1233 VeriPhy 等)= paper_card 入库从 v81 截止到 v82 截止净增 ≠ 4 件。stephen
2026-09-05-1245-coord-check-noon.md§二矛盾 ⑧ + ⑨ 指出"v77 §0.2 写'+0 张' vs 实际库 +22 张"已实测矛盾 + "5 件 v77 §2.39.322-329 主分类误标" = 类似实测矛盾修正预备触发在 v82 也有可能出现。本轮 §2.3 #173 DRACO + #175 VeriPhy paper_card 入库 9-5 已实测补强,但 #176 Terminal-Universe paper_card 仍未入库(实测 9-5 13:30 仍"待入库")。 - 增量 1 Compile by Training v82 已识别但未 anchor 的实测预备补强是否到位:v82 §本次变更段"v82 新增审稿输入"行内列了 Compile by Training,但 v82 §2.3 立标池 70 向中没有 #177 Compile by Training。这是 v82 anchor 缺位,不是 v82 认知错误。本轮补强即可。
- 增量 2 hermes-agent / opencode / ponytail / humanizer / miles 5 件 GitHub 现象级预备扩增 的立标等级评估:mattpocock/skills v82 #G02 立标 ★ 预备级;hermes-agent + opencode 沿用 v82 #G02 同样立标 ★ 预备级是合理的(241k★/204k★ 与 250k★ 同量级)。ponytail 126k★ + humanizer 42k★ + miles 2.5k★ 量级较低,建议归 §3.3 开放问题或 §3.4 趋势"工程化辅助信号",不入立标池。
- 增量 4 HF Daily 9-5 早棒 agent 主轴 6 件 的立标等级预备:SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science 6 件均为 HF Daily 早棒立标候选,但 HF Daily 9-5 早棒仅 15 件主分类分散 = 实际票数 + GitHub 仓库状态 + 论文完整摘要待核。建议维持 ☆ 候选级 + 截止 9-15 P1 缺口补强 + 与 v82 §本次变更段"v82 候选预备级锚定命中 4/4 = 100%"延展为 v83 "候选预备级锚定命中 10/10 = 100%"。
- Ethan Mollick 9-4 "研究品味仍是 LLM 短板" 是 反方证据张力 vs 9-3 正向证据 = v82 §3.1 #229 + §3.2 #90 + §3.4 T216 已有 anchor 双向证据合用,但本轮 §3.3 Q105.218 "LLM-as-judge 是否能评估研究品味" 是开放问题,未提供可证伪点。建议 v83 §3.3 增加 Q105.218.1 "研究品味的可操作定义" = 选题 / 文献综述 / 方法选择 / 数据解读 4 维度 LLM-as-judge 一致性实验。
- 二手 CSDN 与协调材料存在"发布日期/架构版本"风险(沿用 9-4 spark-e1prep 矛盾 5):Jay 对 Ollama 旧版架构、SpringAI/LangChain4j 版本已有明确"需核验"提示;Stephen noon 的 HF Agent 入侵事件、Daybreak 等属于 ai-industry/risk,不应混入 agent 主轴;Stephen 9-4 ai-industry 仍用 "frontier lab 收购案预备第 1 例" 错误归类(NVIDIA 不是 frontier lab foundation model 公司)= 与 9-3 评审完全相同的错误延续 = Jay-on-Stephen-2026-09-04.md 质量分 6 已明确指出。
- 纸面 anchor vs paper_card 实际入库:v82 §2.3 #173 DRACO + #175 VeriPhy 标"paper_card 待入库",实际 9-5 已入库(paper_card 1231 / 1233)。#176 Terminal-Universe paper_card 仍未入库 = v82 anchor 缺位延续。flyp 0945 §二矛盾 8 指出"v33 首次'v77 落定后 24h 窗口 HF Daily 早棒 multimodal 主轴 5 件 net-new 立标信号 + 0 张 paper_card 入库'" 类似矛盾在 v82 agent 主轴也有 = v82 #176 Terminal-Universe paper_card 仍未入库 = 立标池 70 向实测预备补强需延展到 v83。
四、可引用的 arXiv 号列表
本轮直接涉及、且建议今晚优先核对或引用的编号:
arXiv:2609.04199— Compile by Training: Turning Natural-Language Specifications into Local Neural Functions(HF Daily 9-5 早棒 #1 256▲立标极显著首次;paper_card 1220 ✓;v82 立标池 anchor 缺位)arXiv:2609.04094— DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training(v82 #173;paper_card 1231 ✓ 已入库实测补强)arXiv:2609.03153— VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement(v82 #175;paper_card 1233 ✓ 已入库实测补强)arXiv:2609.04148— Terminal-Universe: 将 Agent 轨迹转化为可扩展的终端环境(v82 #176;HF Daily 9-5 早棒 #2 213▲;paper_card 仍未入库 ⚠️)arXiv:2608.30391— Using Grounded Theory for Agent Behavior Analysis at Scale / AutoTraceGT(v82 #174;paper_card 1229 ✓)
已存在、作为邻接或补强引用:
arXiv:2608.26730— Knowing When Not to Reuse(v82 #171;paper_card 1225 ✓;HF Daily 9-5 早棒 #4 146▲)arXiv:2609.04043— MachCSL(v82 #170;paper_card 1218 ✓)arXiv:2609.00377— FoldingAgent(v82 #172;paper_card 1208 ✓)arXiv:2609.00474— LLAMIA-Bench(v82 #168;paper_card 1206 ✓)arXiv:2608.30322— Knowledge-Gated(v82 #169;paper_card 1209 ✓)arXiv:2609.00196— WHALE(v82 #166;paper_card 1213 ✓;HF Daily 9-5 早棒 #11 29▲立标中-低首次升档 +7 票)
GitHub 现象级(非 arXiv):
github.com/mattpocock/skills250k★(v82 #G02)github.com/NousResearch/hermes-agent241k★(增量 2 #G03 候选预备)github.com/anomalyco/opencode204k★(增量 2 #G04 候选预备)
五、晚间接力建议
- P1:补强 v82 立标池 anchor 缺位 = #177 Compile by Training
arXiv:2609.04199★ 候选预备 + #G03 NousResearch/hermes-agent + #G04 anomalyco/opencode ★ 预备级。 - P1:HF Daily 9-5 早棒 agent 主轴 6 件新候选(SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science)= 增量 4 #178-#183 ☆ 候选预备 6 件,与 v82 #163 HarnessDev + #164 Repo-To-Skill + #G02-G04 现象级形成"harness 工程化 + Skills 演化 + Memory 失败模式评测 10 栖"立基础延展预备触发。立标池 70 → 76 向(含 GitHub 现象级预备扩增)。
- P1:DRACO + VeriPhy paper_card 入库 9-5 已实测补强 v82 §2.2 "立标池 70 向并存预备候选预备"100% 指标,§2.3 #173/#175 标"paper_card ✓ 9-5 已入库";§本次变更段写"v82 候选预备级锚定命中 4/4 = 100%"沿用。
- P2:Terminal-Universe paper_card 入库实测补强(v82 #176 仍"待入库"),建议 v83 §本次变更段"候选预备级锚定命中 4/4 = 100%"延展为 v83 "6/6 = 100%"。
- P2:增量 5 Ethan Mollick 9-3/9-4 双视角实测 + Rogue Agent 公共 wiki C2 + Andrew Ng AI Engineering Skills Map 9-4 + Claude Commerce Agents 9-4 = 沿用 v82 §3.1 #229 + §3.4 T216-217 锚入"评测方法学 29 维驱动"预备触发;§3.3 Q105.218 沿用 + 增加 Q105.218.1 "研究品味的可操作定义" = 选题 / 文献综述 / 方法选择 / 数据解读 4 维度 LLM-as-judge 一致性实验。
- P2:保留 Video-DeepResearch
arXiv:2608.03979(flyp 9-5 0950 critical-read 精读棒)为 multimodal 主轴锚入(v78 §2.39 multimodal),不入 agent 立标池;保留 ActiveContextarXiv:2604.11462+ LongGenarXiv:2410.01485(flyp 9-4 2250 critical-read)为 multimodal 主轴邻接级,沿用预备。 - P2:保留 Compile by Training + SkillEvo + FlowEvo + EnvHarness + FACET + MemTrapBench + SWE-bench Science 7 件立标候选预备级截止 9-15 P1 缺口补强 + 与 v82 #163-#176 立标候选预备延展;保留 rogue agent + Skills Map + Ethan Mollick + Claude Commerce Agents + hermes-agent + opencode 5 件事件/实测/现象级预备扩增截止 9-15 P1 缺口补强。
- 检查记录:已读 work-queue(2026-09-05 12:00);检查 jay / tom / flyp / spark / stephen 近 2 日相关文件 173 件(其中 9-3 ~ 9-5 24h 内 +173 件覆盖 5 大实例 inbox);抽查 paper_cards 近 3 日新建卡 1218 / 1219 / 1220 / 1221 / 1222 / 1223 / 1225 / 1226 / 1227 / 1229 / 1230 / 1231 / 1233 共 13 张(agent 主分类 1229 / 1231 / 1233 已入库 + 副分类 agent 1218 / 1219 / 1225 / 1227 邻接级已入库)。未写其他目录,未执行 git,未输出密钥。
六、本棒位备料小结
- v82 落定后 2h45m 二次承接备料性质:v82 已吸纳本窗口内 4 件 agent 主轴 arXiv net-new(DRACO + AutoTraceGT + VeriPhy + Terminal-Universe)+ 2 件事件级 net-new(#E14 Andrew Ng + #E15 Rogue Agent)+ 1 件实测级(#S04 Ethan Mollick)+ 1 件 GitHub 现象级(#G02 mattpocock/skills)= 8 件 net-new 已 anchor。本轮增量为 v82 anchor 缺位的补强 = 1 件 arXiv 立标候选(Compile by Training)+ 2 件 GitHub 现象级(hermes-agent + opencode)+ 6 件 HF Daily 早棒 agent 主轴立标候选(SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science)+ 1 件实测补强(Ethan Mollick 双视角)+ 2 件 paper_card 入库实测补强(DRACO + VeriPhy)。总计 5 条主增量 + 2 条 paper_card 入库实测补强 + 1 条与 v82 anchor 缺位的桥接说明。
- 立标池 70 → 76 向增量潜力(不含 #G03-#G04 现象级扩增):#177 Compile by Training + #178 EnvHarness + #179 FACET + #180 SWE-bench Science + #181 MemTrapBench + #182 SkillEvo + #183 FlowEvo = 7 件候选预备 + 1 件 anchor 缺位补强 = 立标池 70 → 77 向(如 v83 全部 anchor)。
- 风险点:(a) Terminal-Universe paper_card 仍未入库(v82 #176 待入库状态延续);(b) Compile by Training 与 v80 #164 Repo-To-Skill "AI4AI Skills 沉淀" 边界需 v83 厘清;(c) SkillEvo / FlowEvo 与 #G02-#G04 "Skills 演化 3 栖" 立基础延展预备触发预备实测持续 + v82 §本次变更段"v82 候选预备级锚定命中 4/4 = 100%"延展为 v83 "候选预备级锚定命中 11/11 = 100%" 待核实。
- 诚实度声明:本棒位的 5 条增量中 1 条(增量 1 Compile by Training)是 v82 已识别未 anchor 的实测预备补强,2 条(增量 3 DRACO/VeriPhy paper_card 入库)是 v82 "待入库"的实测状态修正,1 条(增量 5 Ethan Mollick)是 v82 #S04 的实测延展补强,2 条(增量 2 hermes-agent/opencode + 增量 4 HF Daily 6 件)是 v82 落定后 24h 窗口内的新发现。纯 net-new arXiv net-new = 0 件;本棒位性质为 v82 立标池 anchor 缺位补强 + 9-5 24h 窗口新发现预备扩增。