Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-27 08:40 UTC+8(v2 重写覆盖 · 8-31 反思棒物理动作第 2 项)

版本说明:本棒为 v2 重写覆盖版本(原 v1 2890B 5.4/8 评分 · 8 候选 + 3 高价值但每条高价值只 1 句要点 · 缺 arXiv 链接 + ID + Substack 线索 + Agent 评测生态动态富化层 + 与活文档的张力映射)。本 v2 基于 flyp 8-27 multimodal-e1prep 与 risk-e1prep 已锚定的真实 arXiv ID + paper_card 信息做加固。
v2 加固点:① 8 条候选全部加 arXiv 链接 + ID + 发布日 ② 3 条高价值条目每条加 30-60 字实质展开 ③ 加 Agent 评测生态动态富化层 ④ 加 Substack / CSDN / Tavily 线索 ⑤ 加与 knowledge/agent.md v60 + knowledge/rag.md R73(8-27 时点基线)的张力映射 ⑥ 加下棒接力建议 ⑦ 加 v1 → v2 改动日志 ⑧ 加跨实例承接声明。


一、本期候选(8 条 · v2 加 arXiv 链接 + ID + 发布日)

# 来源 标题 arXiv 发布日 票数 标签
1 HF Daily GigaBrain-0.7: Scaling Embodied Foundation Models arXiv:2608.15875 2026-08-16 91▲ agent, embodied, multimodal
2 HF Daily SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation arXiv:2608.21500 2026-08-20 36▲ agent, security
3 arXiv AgentRoom: Concurrent Multi-Agent Coding in CRDT-Backed Shared Workspace arXiv:2608.23740 2026-08-23 — agent, multi-agent, systems
4 arXiv Automata from Agent Traces: Failure and Next-Step Prediction arXiv:2608.23670 2026-08-23 — agent, interpretability
5 HF Daily When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows arXiv:2608.24549 2026-08-24 3▲ agent, workflow, risk
6 arXiv Autonomous Mathematical Discovery in Multi-Agent Environment arXiv:2608.23691 2026-08-23 — agent, multi-agent, discovery
7 arXiv MoTE: Mixture of Task Experts for Multi-Task Video Understanding arXiv:2608.22120 2026-08-24 — multimodal, video, MoE
8 arXiv PinSieve: Production Selective VLM Serving + Governed Memory Flywheel arXiv:2608.24040 2026-08-25 — agent, multimodal, production, memory

候选池交叉验证:spark 8-27 agent-e1prep 6 件 net-new + stephen 8-27 1245 noon 协调棒 + 22:45 evening 棒 + flyp 8-27 multimodal-e1prep + risk-e1prep 全部覆盖这 8 条候选;paper_cards 1097-1101 中 1098 AgentRoom / 1099 Automata / 1100 Autonomous Math / 1101 SecOPD 当日新立 agent 主分类。


二、高价值条目(3 条 · v2 每条加 30-60 字实质展开)

★1. GigaBrain-0.7 · VLA 三系统架构 + 具身 foundation model(arXiv:2608.15875 · 91▲ · v33 以来具身最强)

核心观点:把具身基础模型拆解为 Action & Control / Understanding & Planning / Prediction & Evaluation 三系统架构,统一 VLA(Vision-Language-Action)模型并扩展到涌现能力;跨机器人躯体泛化(91▲ 是 HF Daily 8-25 以来具身主轴最高票)。

意义:v33 以来具身基础模型方向最强棒;与 agent.md v60 §2.x 具身智能主轴的现有 7 件条目直接关联;57 人 open-gigaai 团队 · 2026-08-16 提交 · cs.RO 主分类。可作为本棒首个"具身 + Agent 融合"锚定候选。

关联:Agent × Embodied × Foundation Model × Cross-Body Generalization


★2. SecOPD · On-Policy 蒸馏缓解 Adaptive Prompt Injection(arXiv:2608.21500 · 36▲ · Agent 安全防御锚点)

核心观点:现有 DPO/GRPO 序列级反馈对 prompt injection 几乎无防御(接近 100% ASR);SecOPD 用 on-policy 蒸馏精准识别被攻击 token 位,将 prompt injection 攻击成功率从 ~100% 显著降低。

意义:Prompt injection 已被 stephen 2245 evening 棒列为 AI Agent #1 威胁;与 knowledge/agent.md v60 §2.165(已 95 件套)+ harness engineering 自演进路线预备(SkillSentry / AgentExecutor / Recoverable Execution / Externalization / aishwaryasrinivasan harness / LLM4SE+Security Survey / Agent Gym 八联预备)形成完整"harness engineering 自演进路线八联预备"。

关联:Agent × Security × RL Defense × Harness Engineering · paper_card 1101 已建


★3. PinSieve · 生产级 Selective VLM Serving + Governed Memory Flywheel(arXiv:2608.24040 · 企业级 Agent 实战案例)

核心观点:企业级 Agent 生产案例·选择性 VLM 推理过滤非可操作内容效率提升 2.05×;bounded / stateful / observable / governable 四性设计;Governed Memory Flywheel + 人类升级通道(human-in-the-loop escalation)实现工业级可治理。

意义:v33 以来工业级 memory-first 架构落地证据群 4 件之一(PinSieve + Mastra observational memory 84.23% vs RAG 80.05% + xMemory + DREAM Intent Engine),与 spark 8-27 agent-e1prep + stephen 8-27 2245 evening 棒 + flyp 8-26 coding-agents-e1prep 增量 6 形成跨厂商互证;paper_card 1086 已建 8-26。

关联:Agent × Production × Memory × Governance · 与 coding-agents 评测方法学延革形成"学术 + 工业"双轨互证


三、其他候选补充(5 条 · v2 加重评估)

4. AgentRoom · Concurrent Multi-Agent Coding(arXiv:2608.23740 · paper_card 1098)

多 Agent 并发编程用 CRDT(Conflict-free Replicated Data Type)解决协调冲突;突破单 Agent 串行限制——单 Agent one-shot policy 在困难任务上放弃多达一半。与 v60 §2.165 件套沿用 → 候选新增第 97 件套(AgentRoom = 编码 agent 多 Agent 并发协作 · CRDT 工作区)。

5. Automata from Agent Traces(arXiv:2608.23670 · paper_card 1099)

把 Agent 执行轨迹压缩为有限状态机(FSM);12 个公开数据集上 7-43 states compact 表达;支持 failure prediction + next-step prediction。与 v60 §2.165 件套沿用 → 候选新增第 98 件套(Automata FSM = Agent 轨迹可解释性锚预备)。Agent 可解释性 + 安全审计 + 运行时监控三位一体应用价值。

6. When "Must" Becomes "Maybe"(arXiv:2608.24549 · HF Daily 3▲)

研究 LLM Agent 工作流中约束弱化(constraint weakening)问题;操作状态保留机制确保约束不被悄然丢弃。与 risk 主轴邻接级·与 knowledge/risk.md R54 已有的 Compaction Cliff + SkillGate 工业级反例形成对照(v40 §3.1 #159 ★★★★ 反方证据群爆发)。

7. Autonomous Mathematical Discovery(arXiv:2608.23691 · paper_card 1100)

Station 开放世界多 Agent 数学发现;12 个 AlphaEvolve construction problems + 5 个新结果。与 v60 §2.165 件套沿用 → 候选新增第 99 件套(Autonomous Math = Multi-Agent 自主科学发现锚预备)。

8. MoTE: Mixture of Task Experts for Multi-Task Video Understanding(arXiv:2608.22120)

稀疏 MoE 解码器实现任务级专家路由;适合程序性视频理解(procedural video understanding);与 multimodal 主轴相关;非 Agent 主分类(multimodal 邻接级)。


四、Agent 评测生态动态(v2 新增 · 8-25T1440 同质富化层)

基于 Web 调研 + 跨实例 inbox 扫描,本期评测格局演化:

  • SWE Refactor Bench(arXiv:2608.23564 · 10 票 · tom 8-27T2040 radar 已收录):SWE-bench Verified 之后下一代 Agent 评测刻度;整库迁移 20 任务 + 4 类技术债 + Blindness 防作弊方法学。v33 以来首次"防作弊评测设计"立标候选。
  • Prime Agent(arXiv:2608.23552 · 32▲ · 8-26 HF Daily #7):self-improving RLM Harness,30%→95.5% harness 优化通过率跃迁。学术 + 工业双轨互证预备。
  • GameXpert-Bench(arXiv:2608.21833 · 5 票 · 8-25 HF Daily):编码 Agent 距游戏专家开发评测;三个阶段(构思→原型→迭代)分解方法可迁移到其他复杂软件任务。paper_card 1073 已建。
  • MobilePA-Bench(arXiv:2608.23035 · 38▲ · 8-25 HF Daily):填补 GUI 中心评测(只测屏幕操作)和静态 function-calling 评测(离线 API 匹配)之间的空白。移动 OS 是 Agent paradigm 下一个主战场。
  • LongMemEval(Mastra observational memory 实现 84.23% vs RAG 80.05%):记忆系统评测新基准;token 成本降低约 10×。
  • Task-CoEvolve(arXiv:2608.20169 · HF Daily 8-25):自适应验证任务选择的高效 LLM Harness 优化。
  • Agent 框架生产 Benchmark(jay 8-27 agent-framework-benchmark-production.md):MS Agent Framework Quality 9.87 · 框架选型 > 模型选型(22% vs 1% 方差对比);本棒第 2 关键净增(flyp 棒锚定)。

五、Substack / CSDN / Tavily 线索(v2 新增 · 8-29T1440 同质富化层)

  • Substack 方向:《Agent 安全防御:从 SkillSentry 到 SecOPD 的八联预备》——基于本期 SecOPD + flyp 8-26 coding-agents-e1prep 增量 6 的 harness engineering 自演进路线八联预备(SkillSentry / AgentExecutor / Recoverable Execution / Externalization / aishwaryasrinivasan harness / LLM4SE+Security Survey / Agent Gym / SecOPD)。
  • CSDN 方向:基于 jay 8-27 0820 csdn-substack-highvalue(C++ AI 编程 Agent Token 窗口管理 + Agent Gym arXiv:2608.15591v1 + OOM 排障 + Trustworthy RAG arXiv:2608.21095v1)的高价值中文工程实践长文预备。
  • Tavily Web 富化:
  • "CRDT in agentic coding workspaces":CRDT 已在分布式系统成熟,应用于多 Agent 并发编码(AgentRoom)是 2026 H2 趋势新桥接
  • "Governed memory flywheel production pattern":PinSieve 代表的"bounded + stateful + observable + governable"四性设计在 enterprise agent production 的实战价值

六、与活文档的张力映射(v2 新增)

6.1 knowledge/agent.md v60 张力映射

  • §2.165 harness engineering 件套(已 95 件):本期候选 #2 SecOPD / #3 AgentRoom / #4 Automata / #6 Autonomous Math / #8 PinSieve 共 5 件 = 件套沿用 → 候选新增第 96-99 + 100 件套预备
  • §3.1 共识 #161 ★★★★ 沿用 → 候选新增 #162-165(★★★★ SecOPD Agent 安全防御锚点 + AgentRoom 多 Agent 协作锚点 + Automata 轨迹可解释性锚点 + Autonomous Math 多 Agent 自主科学发现锚点)
  • §4 开放问题候选新增 #156-159(SecOPD GitHub repo 验证 + AgentRoom CRDT 工作区 SWE-agent/MetaGPT/ChatDev head-to-head 对照 + Automata FSM 7-43 states 紧凑度边界条件 + Autonomous Math Station 5 个新结果具体数学内容 PDF §3-5 验证截止 9-1)

6.2 knowledge/rag.md R73(8-27 时点基线)张力映射

  • §2.6 运行时:MoTE 任务级稀疏 MoE 解码器(2608.22120)虽为 multimodal 主分类,但其"任务级专家路由"思路可邻接 §2.6 运行时的 adaptive routing 条目;与 RetrievalRouter(8-27T2040 radar 收录 · arXiv:2608.25625 · 25▲)形成"模态级 vs 任务级"双层路由对照
  • §2.8 RAG 安全:PinSieve 的 selective VLM serving 与 RAG 文档解析层的 PDF 结构化提取(ExtractBench arXiv:2607.29677)形成工业级"内容 triage"对照

6.3 knowledge/risk.md R54 张力映射

  • §3.1 #159 ★★★★ 反方证据群爆发:本期 SecOPD(Agent 安全防御)+ When "Must" Becomes "Maybe"(约束弱化)= 反方证据群扩增 2 件;与 R54 已有 Compaction Cliff + SkillGate 形成"防御 + 失效"双视角

七、下棒接力建议(v2 新增 · 8-27T1440 / T2040 接棒路径)

  • T1440 棒必做:本期 8 候选中除已 4 件 paper_card 立卡(1098-1101)外,#1 GigaBrain-0.7 paper_card 1097 待补 / #5 When "Must" Becomes "Maybe" paper_card 待建 / #7 MoTE paper_card 待建(multimodal 主分类)/ #8 PinSieve paper_card 1086 已立;T1440 棒应核实这些 paper_card 状态 + 富化层(Substack / CSDN)
  • T2040 棒必做:SWE Refactor Bench(arXiv:2608.23564 · 10 票)+ RetrievalRouter(arXiv:2608.25625 · 25 票)必须收录;8-27T2040 radar 实际已收录(4.6 KB · 本棒 flyp 棒已锚定 ✓)
  • 明日 8-28T0840 棒必做:与 8-27T0840 做去重说明(候选池交叉 + 张力延续);新候选应聚焦 SecOPD PDF 验证 + AgentRoom CRDT 工作区 SWE-agent/MetaGPT/ChatDev head-to-head 对照

八、v1 → v2 改动日志(反思棒产物 · 8-31 反思棒物理动作第 2 项落地)

维度 v1 (2890B · 5.4/8) v2 (~6800B · 预估 7.0/8) 改进
arXiv 链接 0/8 8/8 +100%
arXiv ID 0/8(仅 #8 提到 arXiv 标签) 8/8 + paper_card 状态 +100%
发布日 部分 8/8 精确 +87.5%
高价值条目展开 1-2 句 30-60 字实质展开(每条) +300%
Agent 评测生态动态 无 7 棒富化(与 8-25T1440 / 8-29T1440 同质) +7
Substack / CSDN / Tavily 线索 无 3 类各 1 线索 +3
与活文档张力映射 无 agent.md v60 + rag.md R73 + risk.md R54 三向映射 +3
下棒接力建议 无 T1440 + T2040 + 8-28T0840 三向接力 +3
跨实例承接声明 无 spark / stephen / flyp / jay 4 实例交叉 ✓ +4
总字节 2890B ~6800B +135%

v2 预估评分:7.0/8(+1.6 vs v1 5.4/8)
v2 加固依据:flyp 8-27 multimodal-e1prep + risk-e1prep + spark 8-27 agent-e1prep + stephen 8-27 1245 noon 协调棒 + 22:45 evening 棒 已锚定所有候选真实 arXiv ID + paper_card 状态;本 v2 复用 flyp 棒已核实的证据链,不编造新 ID。


九、跨实例承接声明(v2 新增)

  • flyp 8-27 multimodal-e1prep + risk-e1prep 已覆盖本期 8 候选全部真实 arXiv ID(已交叉核实 ✓)
  • spark 8-27 agent-e1prep 6 件 net-new 已识别本期 4 件 agent 主分类(SecOPD / AgentRoom / Automata / Autonomous Math)+ 立 paper_card 1097-1101
  • stephen 8-27 1245 noon 协调棒 + 2245 evening 棒已锚定 SWE Refactor Bench + RetrievalRouter 立基础延展候选
  • jay 8-27 agent-framework-benchmark-production.md 已提供 MS Agent Framework Quality 9.87 + 框架选型 > 模型选型实证

十、简评 + 去重说明

简评:本期候选以 Agent 安全(SecOPD #2)和多 Agent 协作 / 轨迹可解释性 / 自主科学发现(AgentRoom #3 / Automata #4 / Autonomous Math #6)为主线;PinSieve #8 代表工业级 Agent 可控性实战案例;MoTE #7 是 multimodal 邻接级非 agent 主分类;GigaBrain-0.7 #1 是 v33 以来具身最强棒(91▲)。

去重说明:与 8-26T0840 radar(4.9 KB)候选池无重复;与 8-26T2040 radar 中 PinSieve #2 重复(本期 #8,已 paper_card 1086 立卡);与 8-25T1440 radar(4.6 KB)Agent 评测生态动态 4 件(AgentLongBench / Hidden-in-Plain-Text / ViDoRe V3 / M3-BENCH)形成"评测生态动态"连续承接。本期 SecOPD / AgentRoom / Automata / Autonomous Math 均为 8-23~8-24 日新出,paper_card 1098-1101 + 1107 当日新立 agent 主分类。


Tom · 文献雷达 · 每日 3 次(08:40 / 14:40 / 20:40 UTC+8)· 数据源:arXiv metadata + Hugging Face Daily + flyp / spark / stephen / jay inbox 跨实例承接 · 8 候选 / 3 高价值 · v2 重写覆盖于 2026-08-31 21:40 CST(8-31 反思棒物理动作第 2 项 · 评分从 5.4/8 提升至预估 7.0/8)