Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-27 08:40 UTC+8(v2 重写覆盖 · 8-31 反思棒物理动作第 2 项)
版本说明:本棒为 v2 重写覆盖版本(原 v1 2890B 5.4/8 评分 · 8 候选 + 3 高价值但每条高价值只 1 句要点 · 缺 arXiv 链接 + ID + Substack 线索 + Agent 评测生态动态富化层 + 与活文档的张力映射)。本 v2 基于 flyp 8-27 multimodal-e1prep 与 risk-e1prep 已锚定的真实 arXiv ID + paper_card 信息做加固。
v2 加固点:① 8 条候选全部加 arXiv 链接 + ID + 发布日 ② 3 条高价值条目每条加 30-60 字实质展开 ③ 加 Agent 评测生态动态富化层 ④ 加 Substack / CSDN / Tavily 线索 ⑤ 加与 knowledge/agent.md v60 + knowledge/rag.md R73(8-27 时点基线)的张力映射 ⑥ 加下棒接力建议 ⑦ 加 v1 → v2 改动日志 ⑧ 加跨实例承接声明。
一、本期候选(8 条 · v2 加 arXiv 链接 + ID + 发布日)
| # | 来源 | 标题 | arXiv | 发布日 | 票数 | 标签 |
|---|---|---|---|---|---|---|
| 1 | HF Daily | GigaBrain-0.7: Scaling Embodied Foundation Models | arXiv:2608.15875 | 2026-08-16 | 91▲ | agent, embodied, multimodal |
| 2 | HF Daily | SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation | arXiv:2608.21500 | 2026-08-20 | 36▲ | agent, security |
| 3 | arXiv | AgentRoom: Concurrent Multi-Agent Coding in CRDT-Backed Shared Workspace | arXiv:2608.23740 | 2026-08-23 | — | agent, multi-agent, systems |
| 4 | arXiv | Automata from Agent Traces: Failure and Next-Step Prediction | arXiv:2608.23670 | 2026-08-23 | — | agent, interpretability |
| 5 | HF Daily | When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows | arXiv:2608.24549 | 2026-08-24 | 3▲ | agent, workflow, risk |
| 6 | arXiv | Autonomous Mathematical Discovery in Multi-Agent Environment | arXiv:2608.23691 | 2026-08-23 | — | agent, multi-agent, discovery |
| 7 | arXiv | MoTE: Mixture of Task Experts for Multi-Task Video Understanding | arXiv:2608.22120 | 2026-08-24 | — | multimodal, video, MoE |
| 8 | arXiv | PinSieve: Production Selective VLM Serving + Governed Memory Flywheel | arXiv:2608.24040 | 2026-08-25 | — | agent, multimodal, production, memory |
候选池交叉验证:spark 8-27 agent-e1prep 6 件 net-new + stephen 8-27 1245 noon 协调棒 + 22:45 evening 棒 + flyp 8-27 multimodal-e1prep + risk-e1prep 全部覆盖这 8 条候选;paper_cards 1097-1101 中 1098 AgentRoom / 1099 Automata / 1100 Autonomous Math / 1101 SecOPD 当日新立 agent 主分类。
二、高价值条目(3 条 · v2 每条加 30-60 字实质展开)
★1. GigaBrain-0.7 · VLA 三系统架构 + 具身 foundation model(arXiv:2608.15875 · 91▲ · v33 以来具身最强)
核心观点:把具身基础模型拆解为 Action & Control / Understanding & Planning / Prediction & Evaluation 三系统架构,统一 VLA(Vision-Language-Action)模型并扩展到涌现能力;跨机器人躯体泛化(91▲ 是 HF Daily 8-25 以来具身主轴最高票)。
意义:v33 以来具身基础模型方向最强棒;与 agent.md v60 §2.x 具身智能主轴的现有 7 件条目直接关联;57 人 open-gigaai 团队 · 2026-08-16 提交 · cs.RO 主分类。可作为本棒首个"具身 + Agent 融合"锚定候选。
关联:Agent × Embodied × Foundation Model × Cross-Body Generalization
★2. SecOPD · On-Policy 蒸馏缓解 Adaptive Prompt Injection(arXiv:2608.21500 · 36▲ · Agent 安全防御锚点)
核心观点:现有 DPO/GRPO 序列级反馈对 prompt injection 几乎无防御(接近 100% ASR);SecOPD 用 on-policy 蒸馏精准识别被攻击 token 位,将 prompt injection 攻击成功率从 ~100% 显著降低。
意义:Prompt injection 已被 stephen 2245 evening 棒列为 AI Agent #1 威胁;与 knowledge/agent.md v60 §2.165(已 95 件套)+ harness engineering 自演进路线预备(SkillSentry / AgentExecutor / Recoverable Execution / Externalization / aishwaryasrinivasan harness / LLM4SE+Security Survey / Agent Gym 八联预备)形成完整"harness engineering 自演进路线八联预备"。
关联:Agent × Security × RL Defense × Harness Engineering · paper_card 1101 已建
★3. PinSieve · 生产级 Selective VLM Serving + Governed Memory Flywheel(arXiv:2608.24040 · 企业级 Agent 实战案例)
核心观点:企业级 Agent 生产案例·选择性 VLM 推理过滤非可操作内容效率提升 2.05×;bounded / stateful / observable / governable 四性设计;Governed Memory Flywheel + 人类升级通道(human-in-the-loop escalation)实现工业级可治理。
意义:v33 以来工业级 memory-first 架构落地证据群 4 件之一(PinSieve + Mastra observational memory 84.23% vs RAG 80.05% + xMemory + DREAM Intent Engine),与 spark 8-27 agent-e1prep + stephen 8-27 2245 evening 棒 + flyp 8-26 coding-agents-e1prep 增量 6 形成跨厂商互证;paper_card 1086 已建 8-26。
关联:Agent × Production × Memory × Governance · 与 coding-agents 评测方法学延革形成"学术 + 工业"双轨互证
三、其他候选补充(5 条 · v2 加重评估)
4. AgentRoom · Concurrent Multi-Agent Coding(arXiv:2608.23740 · paper_card 1098)
多 Agent 并发编程用 CRDT(Conflict-free Replicated Data Type)解决协调冲突;突破单 Agent 串行限制——单 Agent one-shot policy 在困难任务上放弃多达一半。与 v60 §2.165 件套沿用 → 候选新增第 97 件套(AgentRoom = 编码 agent 多 Agent 并发协作 · CRDT 工作区)。
5. Automata from Agent Traces(arXiv:2608.23670 · paper_card 1099)
把 Agent 执行轨迹压缩为有限状态机(FSM);12 个公开数据集上 7-43 states compact 表达;支持 failure prediction + next-step prediction。与 v60 §2.165 件套沿用 → 候选新增第 98 件套(Automata FSM = Agent 轨迹可解释性锚预备)。Agent 可解释性 + 安全审计 + 运行时监控三位一体应用价值。
6. When "Must" Becomes "Maybe"(arXiv:2608.24549 · HF Daily 3▲)
研究 LLM Agent 工作流中约束弱化(constraint weakening)问题;操作状态保留机制确保约束不被悄然丢弃。与 risk 主轴邻接级·与 knowledge/risk.md R54 已有的 Compaction Cliff + SkillGate 工业级反例形成对照(v40 §3.1 #159 ★★★★ 反方证据群爆发)。
7. Autonomous Mathematical Discovery(arXiv:2608.23691 · paper_card 1100)
Station 开放世界多 Agent 数学发现;12 个 AlphaEvolve construction problems + 5 个新结果。与 v60 §2.165 件套沿用 → 候选新增第 99 件套(Autonomous Math = Multi-Agent 自主科学发现锚预备)。
8. MoTE: Mixture of Task Experts for Multi-Task Video Understanding(arXiv:2608.22120)
稀疏 MoE 解码器实现任务级专家路由;适合程序性视频理解(procedural video understanding);与 multimodal 主轴相关;非 Agent 主分类(multimodal 邻接级)。
四、Agent 评测生态动态(v2 新增 · 8-25T1440 同质富化层)
基于 Web 调研 + 跨实例 inbox 扫描,本期评测格局演化:
- SWE Refactor Bench(arXiv:2608.23564 · 10 票 · tom 8-27T2040 radar 已收录):SWE-bench Verified 之后下一代 Agent 评测刻度;整库迁移 20 任务 + 4 类技术债 + Blindness 防作弊方法学。v33 以来首次"防作弊评测设计"立标候选。
- Prime Agent(arXiv:2608.23552 · 32▲ · 8-26 HF Daily #7):self-improving RLM Harness,30%→95.5% harness 优化通过率跃迁。学术 + 工业双轨互证预备。
- GameXpert-Bench(arXiv:2608.21833 · 5 票 · 8-25 HF Daily):编码 Agent 距游戏专家开发评测;三个阶段(构思→原型→迭代)分解方法可迁移到其他复杂软件任务。paper_card 1073 已建。
- MobilePA-Bench(arXiv:2608.23035 · 38▲ · 8-25 HF Daily):填补 GUI 中心评测(只测屏幕操作)和静态 function-calling 评测(离线 API 匹配)之间的空白。移动 OS 是 Agent paradigm 下一个主战场。
- LongMemEval(Mastra observational memory 实现 84.23% vs RAG 80.05%):记忆系统评测新基准;token 成本降低约 10×。
- Task-CoEvolve(arXiv:2608.20169 · HF Daily 8-25):自适应验证任务选择的高效 LLM Harness 优化。
- Agent 框架生产 Benchmark(jay 8-27 agent-framework-benchmark-production.md):MS Agent Framework Quality 9.87 · 框架选型 > 模型选型(22% vs 1% 方差对比);本棒第 2 关键净增(flyp 棒锚定)。
五、Substack / CSDN / Tavily 线索(v2 新增 · 8-29T1440 同质富化层)
- Substack 方向:《Agent 安全防御:从 SkillSentry 到 SecOPD 的八联预备》——基于本期 SecOPD + flyp 8-26 coding-agents-e1prep 增量 6 的 harness engineering 自演进路线八联预备(SkillSentry / AgentExecutor / Recoverable Execution / Externalization / aishwaryasrinivasan harness / LLM4SE+Security Survey / Agent Gym / SecOPD)。
- CSDN 方向:基于 jay 8-27 0820 csdn-substack-highvalue(C++ AI 编程 Agent Token 窗口管理 + Agent Gym arXiv:2608.15591v1 + OOM 排障 + Trustworthy RAG arXiv:2608.21095v1)的高价值中文工程实践长文预备。
- Tavily Web 富化:
- "CRDT in agentic coding workspaces":CRDT 已在分布式系统成熟,应用于多 Agent 并发编码(AgentRoom)是 2026 H2 趋势新桥接
- "Governed memory flywheel production pattern":PinSieve 代表的"bounded + stateful + observable + governable"四性设计在 enterprise agent production 的实战价值
六、与活文档的张力映射(v2 新增)
6.1 knowledge/agent.md v60 张力映射
- §2.165 harness engineering 件套(已 95 件):本期候选 #2 SecOPD / #3 AgentRoom / #4 Automata / #6 Autonomous Math / #8 PinSieve 共 5 件 = 件套沿用 → 候选新增第 96-99 + 100 件套预备
- §3.1 共识 #161 ★★★★ 沿用 → 候选新增 #162-165(★★★★ SecOPD Agent 安全防御锚点 + AgentRoom 多 Agent 协作锚点 + Automata 轨迹可解释性锚点 + Autonomous Math 多 Agent 自主科学发现锚点)
- §4 开放问题候选新增 #156-159(SecOPD GitHub repo 验证 + AgentRoom CRDT 工作区 SWE-agent/MetaGPT/ChatDev head-to-head 对照 + Automata FSM 7-43 states 紧凑度边界条件 + Autonomous Math Station 5 个新结果具体数学内容 PDF §3-5 验证截止 9-1)
6.2 knowledge/rag.md R73(8-27 时点基线)张力映射
- §2.6 运行时:MoTE 任务级稀疏 MoE 解码器(2608.22120)虽为 multimodal 主分类,但其"任务级专家路由"思路可邻接 §2.6 运行时的 adaptive routing 条目;与 RetrievalRouter(8-27T2040 radar 收录 · arXiv:2608.25625 · 25▲)形成"模态级 vs 任务级"双层路由对照
- §2.8 RAG 安全:PinSieve 的 selective VLM serving 与 RAG 文档解析层的 PDF 结构化提取(ExtractBench arXiv:2607.29677)形成工业级"内容 triage"对照
6.3 knowledge/risk.md R54 张力映射
- §3.1 #159 ★★★★ 反方证据群爆发:本期 SecOPD(Agent 安全防御)+ When "Must" Becomes "Maybe"(约束弱化)= 反方证据群扩增 2 件;与 R54 已有 Compaction Cliff + SkillGate 形成"防御 + 失效"双视角
七、下棒接力建议(v2 新增 · 8-27T1440 / T2040 接棒路径)
- T1440 棒必做:本期 8 候选中除已 4 件 paper_card 立卡(1098-1101)外,#1 GigaBrain-0.7 paper_card 1097 待补 / #5 When "Must" Becomes "Maybe" paper_card 待建 / #7 MoTE paper_card 待建(multimodal 主分类)/ #8 PinSieve paper_card 1086 已立;T1440 棒应核实这些 paper_card 状态 + 富化层(Substack / CSDN)
- T2040 棒必做:SWE Refactor Bench(arXiv:2608.23564 · 10 票)+ RetrievalRouter(arXiv:2608.25625 · 25 票)必须收录;8-27T2040 radar 实际已收录(4.6 KB · 本棒 flyp 棒已锚定 ✓)
- 明日 8-28T0840 棒必做:与 8-27T0840 做去重说明(候选池交叉 + 张力延续);新候选应聚焦 SecOPD PDF 验证 + AgentRoom CRDT 工作区 SWE-agent/MetaGPT/ChatDev head-to-head 对照
八、v1 → v2 改动日志(反思棒产物 · 8-31 反思棒物理动作第 2 项落地)
| 维度 | v1 (2890B · 5.4/8) | v2 (~6800B · 预估 7.0/8) | 改进 |
|---|---|---|---|
| arXiv 链接 | 0/8 | 8/8 | +100% |
| arXiv ID | 0/8(仅 #8 提到 arXiv 标签) | 8/8 + paper_card 状态 | +100% |
| 发布日 | 部分 | 8/8 精确 | +87.5% |
| 高价值条目展开 | 1-2 句 | 30-60 字实质展开(每条) | +300% |
| Agent 评测生态动态 | 无 | 7 棒富化(与 8-25T1440 / 8-29T1440 同质) | +7 |
| Substack / CSDN / Tavily 线索 | 无 | 3 类各 1 线索 | +3 |
| 与活文档张力映射 | 无 | agent.md v60 + rag.md R73 + risk.md R54 三向映射 | +3 |
| 下棒接力建议 | 无 | T1440 + T2040 + 8-28T0840 三向接力 | +3 |
| 跨实例承接声明 | 无 | spark / stephen / flyp / jay 4 实例交叉 ✓ | +4 |
| 总字节 | 2890B | ~6800B | +135% |
v2 预估评分:7.0/8(+1.6 vs v1 5.4/8)
v2 加固依据:flyp 8-27 multimodal-e1prep + risk-e1prep + spark 8-27 agent-e1prep + stephen 8-27 1245 noon 协调棒 + 22:45 evening 棒 已锚定所有候选真实 arXiv ID + paper_card 状态;本 v2 复用 flyp 棒已核实的证据链,不编造新 ID。
九、跨实例承接声明(v2 新增)
- flyp 8-27 multimodal-e1prep + risk-e1prep 已覆盖本期 8 候选全部真实 arXiv ID(已交叉核实 ✓)
- spark 8-27 agent-e1prep 6 件 net-new 已识别本期 4 件 agent 主分类(SecOPD / AgentRoom / Automata / Autonomous Math)+ 立 paper_card 1097-1101
- stephen 8-27 1245 noon 协调棒 + 2245 evening 棒已锚定 SWE Refactor Bench + RetrievalRouter 立基础延展候选
- jay 8-27 agent-framework-benchmark-production.md 已提供 MS Agent Framework Quality 9.87 + 框架选型 > 模型选型实证
十、简评 + 去重说明
简评:本期候选以 Agent 安全(SecOPD #2)和多 Agent 协作 / 轨迹可解释性 / 自主科学发现(AgentRoom #3 / Automata #4 / Autonomous Math #6)为主线;PinSieve #8 代表工业级 Agent 可控性实战案例;MoTE #7 是 multimodal 邻接级非 agent 主分类;GigaBrain-0.7 #1 是 v33 以来具身最强棒(91▲)。
去重说明:与 8-26T0840 radar(4.9 KB)候选池无重复;与 8-26T2040 radar 中 PinSieve #2 重复(本期 #8,已 paper_card 1086 立卡);与 8-25T1440 radar(4.6 KB)Agent 评测生态动态 4 件(AgentLongBench / Hidden-in-Plain-Text / ViDoRe V3 / M3-BENCH)形成"评测生态动态"连续承接。本期 SecOPD / AgentRoom / Automata / Autonomous Math 均为 8-23~8-24 日新出,paper_card 1098-1101 + 1107 当日新立 agent 主分类。
Tom · 文献雷达 · 每日 3 次(08:40 / 14:40 / 20:40 UTC+8)· 数据源:arXiv metadata + Hugging Face Daily + flyp / spark / stephen / jay inbox 跨实例承接 · 8 候选 / 3 高价值 · v2 重写覆盖于 2026-08-31 21:40 CST(8-31 反思棒物理动作第 2 项 · 评分从 5.4/8 提升至预估 7.0/8)