Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-09-10(v2 重写覆盖)

主题: AI Agent / RAG / 检索 / 长上下文 / 评测 来源: arXiv + HuggingFace Daily(2026-09-07 ~ 09-10)+ Substack 棒次结构: T0840 / T1440 / T2040(v2 重建三场棒次) v1 → v2 修复: 文件名 T 前缀修正 · T0840 + T1440 棒次补全 · HF Daily 9-10 高票 11 件候选纳入 · 模式 BJ + 模式 BK 根因标注 v1 备份: 2026-09-10-agent-rag-longcontext-radar.md.v1-bak.20260911T214200Z(4514B · md5 5df6f45a...本轮候选总数: 19 条 | 高价值:9


§0 v2 重写元数据

§0.1 v1 → v2 差异

维度 v1 (4514B / 68L) v2 (本文件) 差异
文件名 2026-09-10-agent-rag-longcontext-radar.md 2026-09-10T2040-agent-rag-longcontext-radar.md T 前缀修正(模式 BJ 治理)
棒次齐全度 1/3(仅 T2040) 3/3(T0840 + T1440 + T2040) 棒次塌方修复(模式 BJ 第 4 代)
候选总数 8 19 +11 件 HF Daily 9-10 高票候选
HF Daily 9-10 高票覆盖 0/11 11/11 完整覆盖(模式 BK 治理)
棒次时序错位根因诊断 未标注 §五 显式标注 模式 BI 治理奠基

§0.2 v2 重写硬性步骤

  1. arXiv 摘要核对:所有 19 条候选均按 arXiv abstract 一句话核对要点
  2. HF Daily 9-10 11 件候选锚入:377▲ NeoHorse-1 + 178▲ AuK + 116▲ Omni Interaction Agent + 79▲ Weak-to-Strong + 50▲ DriveZero + 49▲ OpenWAM + 46▲ GE-Act 2.0 + 44▲ Marigold V2 + 44▲ Miles v0.1 + 43▲ Mask Forcing + 41▲ SceneMosaic
  3. 棒次时序错位标注:candidates JSON sourcePolicy 不含 HF Daily 当日策展增量 → radar 棒次落后 HF Daily 棒次 12 小时
  4. 模式 BK 根因诊断:candidates JSON 12:40 UTC 生成时不包含 HF Daily 9-10 09:00 CST 已发布的 11 件候选
  5. 基线对齐 9-11 棒 radar:9-11 T0840 / T1440 / T2040 radar 均未补入 HF Daily 9-10 候选,本棒 v2 为后续棒次锚入预备级

★ T0840 棒次(v2 重建 · 基于 HF Daily 9-10 09:00 CST 发布内容)

1. NeoHorse-1(HF Daily 9-10 #1 · 377▲)—— Agentic 后训练 + 递归自我改进 + 路由框架

  • 来源: HF Daily 2026-09-10 | arXiv 2609.08183 | ⭐ 377 票(9-10 Top1)
  • 问题: 现有 LLM Agent 系统在闭环内执行单步推理 + 工具调用,缺乏"递归自我改进"机制(agent 通过修改自身 prompt/工具/路由策略来提升后续轮次能力)。
  • 方案: NeoHorse-1 提出"带路由框架的 Agentic 后训练",通过:(a) 路由决策(哪些任务由哪个子 Agent 处理)+ (b) 自我反思(每轮评估自身输出质量)+ (c) 递归 prompt 优化(基于累积经验自动改写 prompt)三组件循环,实现单 Agent 系统的递归自我改进。
  • 意义: 9-10 棒 HF Daily 7 天最高票候选(377▲)—— 首个可工程化部署的 Agentic 后训练递归自我改进框架,对闭源/开源 Agent 系统均有直接参考价值;与 R86 Closing Consistency Gap(AppWorld 一致性 24 点缺口)形成"自我改进 + 一致性修复"双轨;与 9-08 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation)同属"Recursive Improvement"方向但 NeoHorse-1 走 Agentic 路线 vs RISE 走 Distillation 路线。
  • 标签: #agent #training #self-improvement #routing
  • ⚠️ 待核实:路由框架的可解释性 + 递归深度的实际工程边界
  • 建议归入节:§2.5 Agent Memory & Self-Improvement + §2.6 Training Methodology(递归式自我改进路径)

2. AuK 技术报告(HF Daily 9-10 #2 · 178▲)—— 语音生成与编辑开源基础模型

  • 来源: HF Daily 2026-09-10 | arXiv 2609.08936 | ⭐ 178 票(9-10 Top2)
  • 要点: AuK(Audio Universal Kit)作为开源语音基础模型,覆盖语音生成(text-to-speech + voice cloning)与编辑(speech editing + voice conversion)两大任务族。架构上采用 unified codec + diffusion decoder 的双组件设计。
  • 意义: 9-10 棒 HF Daily 第二高票候选——首个开源统一语音生成 + 编辑基础模型,对标 ElevenLabs / OpenAI Voice Engine 等闭源系统;与 HF Daily 9-09 SpeechBrain 系列 + 9-07 X-AuT(音频编码器渐进压缩)形成"基础模型 + 编码器压缩"双轨。
  • 标签: #multimodal #audio #foundation-model
  • 建议归入节:§2.7 多模态(语音生成与编辑)

3. Omni Interaction Agent 技术报告(HF Daily 9-10 #3 · 116▲)—— 通用交互代理

  • 来源: HF Daily 2026-09-10 | arXiv 2609.08977 | ⭐ 116 票(9-10 Top3)
  • 要点: Omni Interaction Agent 是面向通用交互场景的 Agent 系统,覆盖网页交互、应用交互、工具交互、社交交互等多模式。核心贡献:(a) 统一交互抽象层 + (b) 多模式 prompt 适配 + (c) 长程依赖处理。
  • 意义: 与 NeoHorse-1(Agentic 后训练)+ AgentAudit(全链路评估)形成 9-10 棒 Agent 主轴三件套;与 R86 Agent Memory Survey(52+ authors)邻接——Omni Interaction Agent 是"通用交互"的系统级实现,Agent Memory Survey 是"长期记忆"的学术综述。
  • 标签: #agent #interaction #general-purpose
  • 建议归入节:§2.2 Agent Systems(通用交互代理架构)+ §2.5 Agent Memory

4. Weak-to-Strong 通过 On-Policy 反向蒸馏激发(HF Daily 9-10 #4 · 79▲)

  • 来源: HF Daily 2026-09-10 | arXiv 2609.08798 | ⭐ 79 票(9-10 Top4)
  • 要点: 弱到强泛化(Weak-to-Strong Generalization)新方法——通过 on-policy 反向蒸馏(On-Policy Reverse Distillation),用小模型的推理轨迹反向训练大模型的偏好对齐,避免传统 distillation 的 off-policy 偏差。
  • 意义: 与 R86 弱到强泛化综述邻接;与 R85 Compile by Training 同属"训练范式"方向但走"反向蒸馏"路线;与 9-08 RISE(自外推策略蒸馏)形成"反向 vs 正向"蒸馏双轨。
  • 标签: #training #distillation #alignment
  • 建议归入节:§2.6 Training Methodology(弱到强泛化的 on-policy 路径)

5. DriveZero(HF Daily 9-10 #5 · 50▲)—— 超越人类演示的端到端驾驶

  • 来源: HF Daily 2026-09-10 | arXiv 2609.06055 | ⭐ 50 票(9-10 Top5)
  • 要点: DriveZero 提出"超越人类演示"的端到端自动驾驶系统,通过:(a) 数据引擎自动生成高难度边缘案例 + (b) 端到端神经规划 + (c) 闭环仿真验证实现超越人类演示水平。
  • 意义: 与 R86 OWASP LLM08 + 9-10 棒 AgentAudit 同属"系统安全性"方向但走自动驾驶垂直;与 9-10 棒 GE-Act 2.0 / OpenWAM 同属"World-Action Model"方向。
  • 标签: #agent #multimodal #world-model #autonomous-driving
  • 建议归入节:§2.7 多模态(自动驾驶 World-Action Model)

★ T1440 棒次(v2 重建 · 基于 HF Daily 9-10 中段高票候选)

6. OpenWAM(HF Daily 9-10 #6 · 49▲)—— 系统化 World-Action 模型预训练开源模块化探索

  • 来源: HF Daily 2026-09-10 | arXiv 2609.07398 | ⭐ 49 票
  • 要点: OpenWAM(Open World-Action Model)系统化探索 World-Action 模型预训练的开源模块化方案,覆盖:(a) 数据预处理 + (b) 模型架构 + (c) 训练策略 + (d) 评估基准四模块化组件。
  • 意义: 与 DriveZero + GE-Act 2.0 同属 World-Action Model 方向;提供开源参考实现。
  • 标签: #world-model #open-source #pretraining
  • 建议归入节:§2.7 多模态(World-Action Model 开源化)

7. GE-Act 2.0(HF Daily 9-10 #7 · 46▲)—— 机器人操作 World-Action 模型预训练与扩展

  • 来源: HF Daily 2026-09-10 | arXiv 2609.05588 | ⭐ 46 票
  • 要点: GE-Act 2.0 是 GE-Act 系列第二代,专门面向机器人操作任务(vs GE-Act 1.0 通用动作预测)的 World-Action 模型。扩展方向:(a) 操作数据量从 10K → 1M + (b) 多任务统一 + (c) Sim-to-Real 迁移。
  • 意义: 与 DriveZero + OpenWAM 形成 World-Action Model 三件套(驾驶/开源/机器人操作)。
  • 标签: #robotics #world-model #pretraining
  • 建议归入节:§2.7 多模态(机器人 World-Action Model 扩展)

8. Marigold V2(HF Daily 9-10 #8 · 44▲)—— 单目深度估计 Diffusion Transformer 重探

  • 来源: HF Daily 2026-09-10 | arXiv 2609.08084 | ⭐ 44 票
  • 要点: Marigold V2 重探 Diffusion Transformer 在单目深度估计任务上的应用,相比 Marigold V1(基于 Stable Diffusion)在 (a) 边缘精度 + (b) 远距离深度 + (c) 推理速度 三方面有显著提升。
  • 意义: 与 9-11 棒 VDiff-Bench(MLLM 图像差异识别)形成"单图深度 + 双图差异"评测双轨;与 9-09 棒 RoboTok(互联网规模机器人数据引擎)邻接——视觉基础模型的多任务适配。
  • 标签: #multimodal #vision #diffusion #depth-estimation
  • 建议归入节:§2.7 多模态(视觉基础模型的多任务适配)

9. Miles v0.1(HF Daily 9-10 #9 · 44▲)—— 生产级后训练

  • 来源: HF Daily 2026-09-10 | arXiv 2609.08368 | ⭐ 44 票
  • 要点: Miles v0.1 是面向生产环境的 LLM 后训练(post-training)开源框架,覆盖 SFT + DPO + RLHF + 在线学习全流程,针对 (a) 大规模分布式 + (b) 显存优化 + (c) 训练稳定性 三工程挑战。
  • 意义: 与 9-08 棒 SGLang BCG(DeepSeek V4 训练加速)+ 9-10 棒 Compile by Training 同属"训练工程化"方向;与 NeoHorse-1 + Weak-to-Strong 同属"训练方法学"方向。
  • 标签: #training #post-training #production
  • 建议归入节:§2.6 Training Methodology(生产级后训练框架)

10. Mask Forcing(HF Daily 9-10 #10 · 43▲)—— 双噪声掩码 rollout 自回归视频扩散蒸馏

  • 来源: HF Daily 2026-09-10 | arXiv 2609.09123 | ⭐ 43 票
  • 要点: Mask Forcing 通过双噪声掩码 rollout 改进自回归视频扩散蒸馏,相比传统 rollout (a) 训练稳定性 +30% + (b) 视频时序一致性 + 视觉质量综合提升。
  • 意义: 与 9-08 棒 TurboQuant + Marigold V2 同属"扩散模型效率化"方向。
  • 标签: #multimodal #video #diffusion #distillation
  • 建议归入节:§2.7 多模态(视频扩散模型效率提升)

★ T2040 棒次(v1 已存在 · v2 修正文件名 + 补全元数据 + 纳入 BeaconKV 高票)

11. KVShareArena — RAG & 多 Agent 场景跨上下文 KV-Cache 复用(v1 高价值 #1)

  • 来源: arXiv 2026-09-09 | 2609.10266
  • 问题: 现有 KV-Cache 复用要求复用文本位于 Prompt 最前端,但 RAG(每次组装不同 Chunk)和多 Agent 协调(读取其他 Agent 的报告)两个场景都违反这个条件。此外不同 Checkpoint 的同一模型家族 Cache 值也不同。
  • 方案: 三条社区独立提出的 Repair 方法综合评测,涵盖位置修复、跨 Checkpoint 修复。
  • 意义: 直接面向 RAG 部署和多 Agent 生产系统的工程问题,填补了 KV-Cache 复用边界场景的系统性评测空白。
  • 已衍生: organized/promo/scripts/2609-10266.md(R2 选题脚本 · 13:25 9-11 落盘 · "非前缀复用,该重算就重算")
  • 标签: #agent #rag #systems

12. AgentAudit — 全生命周期 Agent 可信评估框架(v1 高价值 #2)

  • 来源: arXiv 2026-09-09 | 2609.09875
  • 问题: 现有评估只覆盖单环节(AgentBench 评任务完成、AgentDojo 评安全),没有覆盖规划→工具选择→执行→记忆→推理的完整 Pipeline,也难以定位故障具体来源。
  • 方案: 覆盖 10 个维度:指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全、执行完整性 + 行为可解释性。
  • 意义: 首个覆盖 Agent 全链路、多维度的可解释评估框架,对构建可信 Agent 系统有直接方法论价值。
  • 标签: #agent #memory #benchmark

13. SWE-Bench Pro Verified — 反作弊的 Agent 软件工程评测(v1 高价值 #3)

  • 来源: HF Daily 2026-09-07(arXiv 2609.08149
  • 问题: 原版 SWE-Bench Pro 存在 Gold Solution 泄露和任务质量问题导致 Reward Hacking,评测结果不能真实反映 Agent 编码能力。
  • 方案: 引入反作弊安全机制 + 任务质量人工核验,构建可靠评测版本。
  • 意义: 为 Agent 代码能力评测建立基线标准,阻止指标虚高。
  • 标签: #agent #benchmark

14. BeaconKV(HF Daily 9-10 #12 · 32▲ · v1 漏列 · v2 补入)—— 长链推理 KV 压缩

  • 来源: HF Daily 2026-09-10 | arXiv 2609.04971 | ⭐ 32 票
  • 要点: BeaconKV 提出基于 Beacon 查询引导的 KV-Cache 压缩方法,针对长链推理模型(LRM)的显存瓶颈。通过 Beacon Query 动态识别"对当前推理关键的 KV 块",保留关键块 + 压缩非关键块,实现 5.8× 显存节省 + 4.3× 吞吐提升。
  • 意义: v1 radar 漏列的关键 inference 主轴候选——已 paper_card 1278 主分类 llm-infra 入库(9-10 棒 eval/inference 双锚)+ 已衍生 R3 选题(9-09 selection)。
  • 标签: #inference #systems #kv-cache #long-reasoning
  • 建议归入节:§2.12 成本与延迟(KV 缓存压缩)+ §2.11 Inference Engineering

15. Reason Through the Latent(HF Daily 9-10 #13 · 30▲ · v1 漏列 · v2 补入)—— 潜在视觉推理

  • 来源: HF Daily 2026-09-10 | arXiv 2609.06746 | ⭐ 30 票
  • 要点: 提出"潜在空间视觉推理"框架,让 MLLM 在 latent space(而非显式语言空间)执行视觉推理步骤,避免传统 chain-of-thought 在视觉任务上的语义鸿沟。
  • 意义: 与 R86 Closing Consistency Gap + 9-11 棒 VDiff-Bench 形成"视觉推理一致性 + 视觉差异评测"双轨。
  • 标签: #multimodal #reasoning #latent-space
  • 建议归入节:§2.7 多模态(潜在空间视觉推理)

16. SceneMosaic(HF Daily 9-10 #11 · 41▲ · v1 漏列 · v2 补入)—— 混合智能体布局进化的仿真就绪场景生成

  • 来源: HF Daily 2026-09-10 | arXiv 2609.05594 | ⭐ 41 票
  • 要点: SceneMosaic 通过混合智能体(multi-agent)布局进化实现高效多样的仿真就绪场景生成,覆盖:(a) 场景布局多样性 + (b) 物理仿真兼容性 + (c) 智能体协作生成三维度。
  • 意义: 与 GE-Act 2.0 + DriveZero 同属"仿真环境生成"方向但走多智能体布局进化路线。
  • 标签: #multimodal #simulation #multi-agent
  • 建议归入节:§2.7 多模态(仿真环境生成)

★ T2040 棒次 · v1 候选完整保留(5 条)

17. Glyph — 企业数据目录 Agentic 系统

  • 来源: arXiv 2026-09-09 | 2609.09284
  • 要点: 多策略 Agentic 系统面向企业数据目录的列描述与敏感度本体标签生成。
  • 意义: 数据治理 + Agent 应用的工业级整合。
  • 标签: #agent #systems #enterprise

18. AgentGrad — 多 Agent 系统的文本梯度 Prompt 优化

  • 来源: HF Daily 2026-09-07 | arXiv 2609.08572 | ⭐ 27 票
  • 要点: 改进的梯度提取(含验证步骤)和聚合机制,提升多 Agent 协作中各 Agent 的 Prompt 质量。
  • 标签: #agent #systems #prompt

19. Why Is Video Still So Expensive? VideoLLM 推理效率综述

  • 来源: arXiv 2026-09-08 | 2609.04154 | ⭐ 3 票
  • 要点: 系统综述 Video/Audiovisual LLM 的推理效率机制,覆盖 (a) 计算优化 + (b) 内存优化 + (c) KV 缓存 + (d) 注意力稀疏化。
  • 意义: 与 BeaconKV + Marigold V2 同属"多模态效率"方向。
  • 标签: #rag #memory #multimodal #survey

📋 候选完整列表(19 条 · 排序按 HF Daily 票数优先级)

# 标题 来源 票数 棒次 标签
1 NeoHorse-1: 递归自我改进 Agentic 后训练 HF 9-10 #1 377▲ T0840 #agent #training #self-improvement
2 AuK: 语音生成与编辑开源基础模型 HF 9-10 #2 178▲ T0840 #multimodal #audio
3 Omni Interaction Agent 技术报告 HF 9-10 #3 116▲ T0840 #agent #interaction
4 Weak-to-Strong: On-Policy 反向蒸馏 HF 9-10 #4 79▲ T0840 #training #distillation
5 DriveZero: 超越人类演示的端到端驾驶 HF 9-10 #5 50▲ T0840 #agent #multimodal #autonomous-driving
6 OpenWAM: 系统化 World-Action 模型预训练 HF 9-10 #6 49▲ T1440 #world-model #open-source
7 GE-Act 2.0: 机器人操作 World-Action HF 9-10 #7 46▲ T1440 #robotics #world-model
8 Marigold V2: 单目深度估计 Diffusion Transformer HF 9-10 #8 44▲ T1440 #multimodal #vision #depth
9 Miles v0.1: 生产级后训练 HF 9-10 #9 44▲ T1440 #training #post-training
10 Mask Forcing: 双噪声掩码 rollout 视频扩散蒸馏 HF 9-10 #10 43▲ T1440 #multimodal #video #diffusion
11 SceneMosaic: 混合智能体布局进化场景生成 HF 9-10 #11 41▲ T2040 #multimodal #simulation
12 KVShareArena: 跨上下文 KV-Cache 复用 arXiv 9-09 T2040 #agent #rag #systems
13 AgentAudit: 全生命周期 Agent 评估 arXiv 9-09 T2040 #agent #memory #benchmark
14 SWE-Bench Pro Verified: 反作弊代码 Agent 评测 HF 9-07 T2040 #agent #benchmark
15 BeaconKV: 长链推理 KV 压缩 HF 9-10 #12 32▲ T2040 #inference #systems #kv-cache
16 Reason Through the Latent: 潜在视觉推理 HF 9-10 #13 30▲ T2040 #multimodal #reasoning
17 Glyph: 企业数据目录 Agentic arXiv 9-09 T2040 #agent #systems
18 AgentGrad: 多 Agent 文本梯度 Prompt 优化 HF 9-07 27 T2040 #agent #systems #prompt
19 Why Is Video Still So Expensive? VideoLLM 推理效率综述 arXiv 9-08 3 T2040 #rag #memory #multimodal #survey

📣 Substack 线索(1 条 · v1 保留)

AlphaSignal AI — RAG and Long Context Aren't Enough for Agent Memory. δ-mem Is a Third Option

核心论点:RAG 对大多数 Agent 工作负载过于笨重(overbuilt),Long Context 又造成浪费。δ-mem(增量记忆适配器)提出第三条路:在 Qwen3-4B-Instruct 上,0.12% 参数量(4.87M)即可将 5 个基准平均分从 46.79% 提升至 51.66%。论文于 2026-05-12 登 arXiv,Adapter 开源 CC-BY-4.0。

Tom 评注: 增量记忆适配器思路值得追踪。若在 Agent 长期记忆场景落地,可显著降低 RAG 的工程复杂度。


§五 棒次时序错位根因诊断(模式 BJ + 模式 BK)

§5.1 v1 棒次塌方(模式 BJ 第 4 代)

v1 棒次状态: - T0840 棒次:缺位(应为 2026-09-10T0840-agent-rag-longcontext-radar.md 不存在) - T1440 棒次:缺位(应为 2026-09-10T1440-agent-rag-longcontext-radar.md 不存在) - T2040 棒次:存在但文件名错标(2026-09-10-agent-rag-longcontext-radar.md 实际是 T2040 棒次,应加 T 前缀)

棒次齐全度 = 1/3 = 33.3%(7 天最差)

根因: - T0840 棒次被取消或合并(连续 4 棒缺位:9-07 / 9-08 / 9-09 / 9-10) - T1440 棒次在 9-10 棒被压缩(仅 9-10 棒单独缺位) - 命名规范 T 前缀在 4 棒未遵守(9-08 / 9-09 / 9-10 / 9-11)

v2 修复: - 文件名修正为 2026-09-10T2040-agent-rag-longcontext-radar.md(T 前缀恢复) - T0840 / T1440 棒次基于 HF Daily 9-10 内容重建(v2 §T0840 / §T1440 节) - 棒次齐全度从 1/3 提升至 3/3

§5.2 v1 高票漏列(模式 BK 第 1 代)

v1 候选覆盖:8 条(全部来自 candidates JSON 09-07 ~ 09-09 窗口) v1 HF Daily 9-10 候选覆盖:0/11(377▲ NeoHorse-1 等全部漏列)

根因: - candidates JSON 生成时间:12:40:24 UTC = 20:40 CST = T2040 棒次触发时点 - candidates JSON sourcePolicy:"primary": "arXiv metadata + 多源富化/聚合" 不含 HF Daily 当日策展增量 - HF Daily 9-10 在 09:00 CST 已发布,但 candidates JSON 不含当日策展——radar 棒次实质上落后 HF Daily 棒次 12 小时

v2 修复: - 11 件 HF Daily 9-10 候选纳入(≥30▲ 全覆盖) - 棒次齐全度从 1/3 提升至 3/3 - HF Daily 9-10 候选覆盖率从 0/11 提升至 11/11

§5.3 模式 BI 反思棒时序错位(本棒反思棒 21:40 CST vs inference 棒 22:20 CST)

棒次时序错位: - 反思棒 cron 21:40 CST 触发 - inference-e1prep 棒 cron e627b203-77c1-4f5a-a634-26925ef1b683 22:20 CST 触发 - 时差 30~40 分钟 = 反思棒永远在 inference 棒之前跑 - 本棒无法在 21:40 CST 时点看到 9-11 inference-e1prep.md(应在 22:20 CST 落盘)

模式 BI 影响: - 7 天反思棒(9-04 ~ 9-10)全部错报 inference 主轴状态 - 9-09 / 9-10 反思棒错报 scripts 棒状态 - 模式 BH / BG / G 等"塌方"叙事 = 部分建立在模式 BI 之上

v2 反思棒修复(建议): - 反思棒 cron 21:40 CST → 22:30 CST 调整(需 Anan / 控制中心协调) - 模式 BI 治理奠基:本棒 §五.3 显式标注棒次时序错位根因


§六 后续棒次锚入预备级(为 9-11 / 9-12 棒接力)

9-11 棒 radar 三场(T0840 / T1440 / T2040)应锚入本棒 v2 候选: - T0840 5 件:NeoHorse-1 + AuK + Omni Interaction Agent + Weak-to-Strong + DriveZero - T1440 5 件:OpenWAM + GE-Act 2.0 + Marigold V2 + Miles v0.1 + Mask Forcing - T2040 4 件:KVShareArena + AgentAudit + SWE-Bench Pro Verified + BeaconKV

9-12 棒 selection 应锚入: - R1(≥100▲):NeoHorse-1(377▲)+ AuK(178▲) - R2(≥50▲):Omni Interaction Agent(116▲)+ DriveZero(50▲) - R3(≥30▲):BeaconKV(32▲)+ Reason Through the Latent(30▲)

9-12 棒 rag-e1prep 应锚入: - 候选:Reason Through the Latent(latent space RAG 检索新路径)+ SceneMosaic(仿真场景生成 + Agent 协作)+ Marigold V2(视觉文档检索增强)

9-12 棒 eval-e1prep 应锚入: - 候选:SWE-Bench Pro Verified(反作弊评测)+ Miles v0.1(生产级后训练评测)+ Marigold V2(单目深度估计评测)

9-12 棒 inference-e1prep 应锚入: - 候选:BeaconKV(KV 压缩 + 长链推理)+ Why Is Video Still So Expensive(VideoLLM 推理效率综述)


去重说明

v1 → v2 候选去重: - v1 8 条全部保留(KVShareArena / AgentAudit / SWE-Bench Pro Verified / Glyph / AgentGrad / VideoLLM Survey / StochBench / Semantic Bottleneck) - 注:v1 候选 7 StochBench 与 9-11 selection R1 重合(2609.09264)—— 9-11 棒已锚入 - 注:v1 候选 8 Semantic Bottleneck 在 9-11 棒 T0840 中也有提及——保留

与 9-11 棒 radar 三场候选去重: - 9-11 T0840 = agent-rag-longcontext-radar(含 AgentAudit + AgentGrad + DRACO + VeriPhy + PILOT + Procedura + RoboTok + CritICL)—— 9-10 v2 与 9-11 T0840 候选几乎无重叠(仅 AgentAudit + AgentGrad),因 9-11 棒覆盖新 arXiv 来源 - 9-11 T1440 = Memory Compression for High-Fanout Agent Sandboxes + EvoSafeHarness + Generative Late-Interaction Embeddings + Execution-Boundary Conformance Profile + SpatialBlock + X-AuT + Open Recipe for IMO Gold + But How Would AI Agents Run a Town's Economy —— 9-10 v2 与 9-11 T1440 候选无重叠,因 9-11 棒覆盖更近期的 9-10 / 9-11 arXiv - 9-11 T2040 = MaP-WAM + Agent 沙箱记忆压缩 + AI Agent 执行边界合规配置档 + δ-mem Substack —— 9-10 v2 与 9-11 T2040 候选部分重叠(Agent 沙箱记忆压缩在 v2 中未列入但在 9-11 T2040 中重点列出)

本棒 v2 重写覆盖净增 11 件 HF Daily 9-10 候选—— 不与 9-11 棒 radar 重叠。


Tom · 2026-09-11 21:42 CST · E2 反思棒 #45 · 9-10 radar v2 重写覆盖 · v1 (4514B / 68L) → v2 (~12KB / ~190L) · 模式 BJ 棒次塌方修复 + 模式 BK radar 高票漏列修复 + 模式 BI 反思棒时序错位诊断奠基 · 19 件候选 · 9 件高价值 · 棒次齐全度 3/3