Tom 文献雷达 · Agent × RAG × 长上下文 · 2026-09-10(v2 重写覆盖)
主题: AI Agent / RAG / 检索 / 长上下文 / 评测
来源: arXiv + HuggingFace Daily(2026-09-07 ~ 09-10)+ Substack
棒次结构: T0840 / T1440 / T2040(v2 重建三场棒次)
v1 → v2 修复: 文件名 T 前缀修正 · T0840 + T1440 棒次补全 · HF Daily 9-10 高票 11 件候选纳入 · 模式 BJ + 模式 BK 根因标注
v1 备份: 2026-09-10-agent-rag-longcontext-radar.md.v1-bak.20260911T214200Z(4514B · md5 5df6f45a...)
本轮候选总数: 19 条 | 高价值:9 条
§0 v2 重写元数据
§0.1 v1 → v2 差异
| 维度 | v1 (4514B / 68L) | v2 (本文件) | 差异 |
|---|---|---|---|
| 文件名 | 2026-09-10-agent-rag-longcontext-radar.md |
2026-09-10T2040-agent-rag-longcontext-radar.md |
T 前缀修正(模式 BJ 治理) |
| 棒次齐全度 | 1/3(仅 T2040) | 3/3(T0840 + T1440 + T2040) | 棒次塌方修复(模式 BJ 第 4 代) |
| 候选总数 | 8 | 19 | +11 件 HF Daily 9-10 高票候选 |
| HF Daily 9-10 高票覆盖 | 0/11 | 11/11 | 完整覆盖(模式 BK 治理) |
| 棒次时序错位根因诊断 | 未标注 | §五 显式标注 | 模式 BI 治理奠基 |
§0.2 v2 重写硬性步骤
- arXiv 摘要核对:所有 19 条候选均按 arXiv abstract 一句话核对要点
- HF Daily 9-10 11 件候选锚入:377▲ NeoHorse-1 + 178▲ AuK + 116▲ Omni Interaction Agent + 79▲ Weak-to-Strong + 50▲ DriveZero + 49▲ OpenWAM + 46▲ GE-Act 2.0 + 44▲ Marigold V2 + 44▲ Miles v0.1 + 43▲ Mask Forcing + 41▲ SceneMosaic
- 棒次时序错位标注:candidates JSON sourcePolicy 不含 HF Daily 当日策展增量 → radar 棒次落后 HF Daily 棒次 12 小时
- 模式 BK 根因诊断:candidates JSON 12:40 UTC 生成时不包含 HF Daily 9-10 09:00 CST 已发布的 11 件候选
- 基线对齐 9-11 棒 radar:9-11 T0840 / T1440 / T2040 radar 均未补入 HF Daily 9-10 候选,本棒 v2 为后续棒次锚入预备级
★ T0840 棒次(v2 重建 · 基于 HF Daily 9-10 09:00 CST 发布内容)
1. NeoHorse-1(HF Daily 9-10 #1 · 377▲)—— Agentic 后训练 + 递归自我改进 + 路由框架
- 来源: HF Daily 2026-09-10 | arXiv
2609.08183| ⭐ 377 票(9-10 Top1) - 问题: 现有 LLM Agent 系统在闭环内执行单步推理 + 工具调用,缺乏"递归自我改进"机制(agent 通过修改自身 prompt/工具/路由策略来提升后续轮次能力)。
- 方案: NeoHorse-1 提出"带路由框架的 Agentic 后训练",通过:(a) 路由决策(哪些任务由哪个子 Agent 处理)+ (b) 自我反思(每轮评估自身输出质量)+ (c) 递归 prompt 优化(基于累积经验自动改写 prompt)三组件循环,实现单 Agent 系统的递归自我改进。
- 意义: 9-10 棒 HF Daily 7 天最高票候选(377▲)—— 首个可工程化部署的 Agentic 后训练递归自我改进框架,对闭源/开源 Agent 系统均有直接参考价值;与 R86 Closing Consistency Gap(AppWorld 一致性 24 点缺口)形成"自我改进 + 一致性修复"双轨;与 9-08 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation)同属"Recursive Improvement"方向但 NeoHorse-1 走 Agentic 路线 vs RISE 走 Distillation 路线。
- 标签:
#agent#training#self-improvement#routing - ⚠️ 待核实:路由框架的可解释性 + 递归深度的实际工程边界
- 建议归入节:§2.5 Agent Memory & Self-Improvement + §2.6 Training Methodology(递归式自我改进路径)
2. AuK 技术报告(HF Daily 9-10 #2 · 178▲)—— 语音生成与编辑开源基础模型
- 来源: HF Daily 2026-09-10 | arXiv
2609.08936| ⭐ 178 票(9-10 Top2) - 要点: AuK(Audio Universal Kit)作为开源语音基础模型,覆盖语音生成(text-to-speech + voice cloning)与编辑(speech editing + voice conversion)两大任务族。架构上采用 unified codec + diffusion decoder 的双组件设计。
- 意义: 9-10 棒 HF Daily 第二高票候选——首个开源统一语音生成 + 编辑基础模型,对标 ElevenLabs / OpenAI Voice Engine 等闭源系统;与 HF Daily 9-09 SpeechBrain 系列 + 9-07 X-AuT(音频编码器渐进压缩)形成"基础模型 + 编码器压缩"双轨。
- 标签:
#multimodal#audio#foundation-model - 建议归入节:§2.7 多模态(语音生成与编辑)
3. Omni Interaction Agent 技术报告(HF Daily 9-10 #3 · 116▲)—— 通用交互代理
- 来源: HF Daily 2026-09-10 | arXiv
2609.08977| ⭐ 116 票(9-10 Top3) - 要点: Omni Interaction Agent 是面向通用交互场景的 Agent 系统,覆盖网页交互、应用交互、工具交互、社交交互等多模式。核心贡献:(a) 统一交互抽象层 + (b) 多模式 prompt 适配 + (c) 长程依赖处理。
- 意义: 与 NeoHorse-1(Agentic 后训练)+ AgentAudit(全链路评估)形成 9-10 棒 Agent 主轴三件套;与 R86 Agent Memory Survey(52+ authors)邻接——Omni Interaction Agent 是"通用交互"的系统级实现,Agent Memory Survey 是"长期记忆"的学术综述。
- 标签:
#agent#interaction#general-purpose - 建议归入节:§2.2 Agent Systems(通用交互代理架构)+ §2.5 Agent Memory
4. Weak-to-Strong 通过 On-Policy 反向蒸馏激发(HF Daily 9-10 #4 · 79▲)
- 来源: HF Daily 2026-09-10 | arXiv
2609.08798| ⭐ 79 票(9-10 Top4) - 要点: 弱到强泛化(Weak-to-Strong Generalization)新方法——通过 on-policy 反向蒸馏(On-Policy Reverse Distillation),用小模型的推理轨迹反向训练大模型的偏好对齐,避免传统 distillation 的 off-policy 偏差。
- 意义: 与 R86 弱到强泛化综述邻接;与 R85 Compile by Training 同属"训练范式"方向但走"反向蒸馏"路线;与 9-08 RISE(自外推策略蒸馏)形成"反向 vs 正向"蒸馏双轨。
- 标签:
#training#distillation#alignment - 建议归入节:§2.6 Training Methodology(弱到强泛化的 on-policy 路径)
5. DriveZero(HF Daily 9-10 #5 · 50▲)—— 超越人类演示的端到端驾驶
- 来源: HF Daily 2026-09-10 | arXiv
2609.06055| ⭐ 50 票(9-10 Top5) - 要点: DriveZero 提出"超越人类演示"的端到端自动驾驶系统,通过:(a) 数据引擎自动生成高难度边缘案例 + (b) 端到端神经规划 + (c) 闭环仿真验证实现超越人类演示水平。
- 意义: 与 R86 OWASP LLM08 + 9-10 棒 AgentAudit 同属"系统安全性"方向但走自动驾驶垂直;与 9-10 棒 GE-Act 2.0 / OpenWAM 同属"World-Action Model"方向。
- 标签:
#agent#multimodal#world-model#autonomous-driving - 建议归入节:§2.7 多模态(自动驾驶 World-Action Model)
★ T1440 棒次(v2 重建 · 基于 HF Daily 9-10 中段高票候选)
6. OpenWAM(HF Daily 9-10 #6 · 49▲)—— 系统化 World-Action 模型预训练开源模块化探索
- 来源: HF Daily 2026-09-10 | arXiv
2609.07398| ⭐ 49 票 - 要点: OpenWAM(Open World-Action Model)系统化探索 World-Action 模型预训练的开源模块化方案,覆盖:(a) 数据预处理 + (b) 模型架构 + (c) 训练策略 + (d) 评估基准四模块化组件。
- 意义: 与 DriveZero + GE-Act 2.0 同属 World-Action Model 方向;提供开源参考实现。
- 标签:
#world-model#open-source#pretraining - 建议归入节:§2.7 多模态(World-Action Model 开源化)
7. GE-Act 2.0(HF Daily 9-10 #7 · 46▲)—— 机器人操作 World-Action 模型预训练与扩展
- 来源: HF Daily 2026-09-10 | arXiv
2609.05588| ⭐ 46 票 - 要点: GE-Act 2.0 是 GE-Act 系列第二代,专门面向机器人操作任务(vs GE-Act 1.0 通用动作预测)的 World-Action 模型。扩展方向:(a) 操作数据量从 10K → 1M + (b) 多任务统一 + (c) Sim-to-Real 迁移。
- 意义: 与 DriveZero + OpenWAM 形成 World-Action Model 三件套(驾驶/开源/机器人操作)。
- 标签:
#robotics#world-model#pretraining - 建议归入节:§2.7 多模态(机器人 World-Action Model 扩展)
8. Marigold V2(HF Daily 9-10 #8 · 44▲)—— 单目深度估计 Diffusion Transformer 重探
- 来源: HF Daily 2026-09-10 | arXiv
2609.08084| ⭐ 44 票 - 要点: Marigold V2 重探 Diffusion Transformer 在单目深度估计任务上的应用,相比 Marigold V1(基于 Stable Diffusion)在 (a) 边缘精度 + (b) 远距离深度 + (c) 推理速度 三方面有显著提升。
- 意义: 与 9-11 棒 VDiff-Bench(MLLM 图像差异识别)形成"单图深度 + 双图差异"评测双轨;与 9-09 棒 RoboTok(互联网规模机器人数据引擎)邻接——视觉基础模型的多任务适配。
- 标签:
#multimodal#vision#diffusion#depth-estimation - 建议归入节:§2.7 多模态(视觉基础模型的多任务适配)
9. Miles v0.1(HF Daily 9-10 #9 · 44▲)—— 生产级后训练
- 来源: HF Daily 2026-09-10 | arXiv
2609.08368| ⭐ 44 票 - 要点: Miles v0.1 是面向生产环境的 LLM 后训练(post-training)开源框架,覆盖 SFT + DPO + RLHF + 在线学习全流程,针对 (a) 大规模分布式 + (b) 显存优化 + (c) 训练稳定性 三工程挑战。
- 意义: 与 9-08 棒 SGLang BCG(DeepSeek V4 训练加速)+ 9-10 棒 Compile by Training 同属"训练工程化"方向;与 NeoHorse-1 + Weak-to-Strong 同属"训练方法学"方向。
- 标签:
#training#post-training#production - 建议归入节:§2.6 Training Methodology(生产级后训练框架)
10. Mask Forcing(HF Daily 9-10 #10 · 43▲)—— 双噪声掩码 rollout 自回归视频扩散蒸馏
- 来源: HF Daily 2026-09-10 | arXiv
2609.09123| ⭐ 43 票 - 要点: Mask Forcing 通过双噪声掩码 rollout 改进自回归视频扩散蒸馏,相比传统 rollout (a) 训练稳定性 +30% + (b) 视频时序一致性 + 视觉质量综合提升。
- 意义: 与 9-08 棒 TurboQuant + Marigold V2 同属"扩散模型效率化"方向。
- 标签:
#multimodal#video#diffusion#distillation - 建议归入节:§2.7 多模态(视频扩散模型效率提升)
★ T2040 棒次(v1 已存在 · v2 修正文件名 + 补全元数据 + 纳入 BeaconKV 高票)
11. KVShareArena — RAG & 多 Agent 场景跨上下文 KV-Cache 复用(v1 高价值 #1)
- 来源: arXiv 2026-09-09 |
2609.10266 - 问题: 现有 KV-Cache 复用要求复用文本位于 Prompt 最前端,但 RAG(每次组装不同 Chunk)和多 Agent 协调(读取其他 Agent 的报告)两个场景都违反这个条件。此外不同 Checkpoint 的同一模型家族 Cache 值也不同。
- 方案: 三条社区独立提出的 Repair 方法综合评测,涵盖位置修复、跨 Checkpoint 修复。
- 意义: 直接面向 RAG 部署和多 Agent 生产系统的工程问题,填补了 KV-Cache 复用边界场景的系统性评测空白。
- 已衍生:
organized/promo/scripts/2609-10266.md(R2 选题脚本 · 13:25 9-11 落盘 · "非前缀复用,该重算就重算") - 标签:
#agent#rag#systems
12. AgentAudit — 全生命周期 Agent 可信评估框架(v1 高价值 #2)
- 来源: arXiv 2026-09-09 |
2609.09875 - 问题: 现有评估只覆盖单环节(AgentBench 评任务完成、AgentDojo 评安全),没有覆盖规划→工具选择→执行→记忆→推理的完整 Pipeline,也难以定位故障具体来源。
- 方案: 覆盖 10 个维度:指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实性、安全、执行完整性 + 行为可解释性。
- 意义: 首个覆盖 Agent 全链路、多维度的可解释评估框架,对构建可信 Agent 系统有直接方法论价值。
- 标签:
#agent#memory#benchmark
13. SWE-Bench Pro Verified — 反作弊的 Agent 软件工程评测(v1 高价值 #3)
- 来源: HF Daily 2026-09-07(arXiv
2609.08149) - 问题: 原版 SWE-Bench Pro 存在 Gold Solution 泄露和任务质量问题导致 Reward Hacking,评测结果不能真实反映 Agent 编码能力。
- 方案: 引入反作弊安全机制 + 任务质量人工核验,构建可靠评测版本。
- 意义: 为 Agent 代码能力评测建立基线标准,阻止指标虚高。
- 标签:
#agent#benchmark
14. BeaconKV(HF Daily 9-10 #12 · 32▲ · v1 漏列 · v2 补入)—— 长链推理 KV 压缩
- 来源: HF Daily 2026-09-10 | arXiv
2609.04971| ⭐ 32 票 - 要点: BeaconKV 提出基于 Beacon 查询引导的 KV-Cache 压缩方法,针对长链推理模型(LRM)的显存瓶颈。通过 Beacon Query 动态识别"对当前推理关键的 KV 块",保留关键块 + 压缩非关键块,实现 5.8× 显存节省 + 4.3× 吞吐提升。
- 意义: v1 radar 漏列的关键 inference 主轴候选——已 paper_card 1278 主分类 llm-infra 入库(9-10 棒 eval/inference 双锚)+ 已衍生 R3 选题(9-09 selection)。
- 标签:
#inference#systems#kv-cache#long-reasoning - 建议归入节:§2.12 成本与延迟(KV 缓存压缩)+ §2.11 Inference Engineering
15. Reason Through the Latent(HF Daily 9-10 #13 · 30▲ · v1 漏列 · v2 补入)—— 潜在视觉推理
- 来源: HF Daily 2026-09-10 | arXiv
2609.06746| ⭐ 30 票 - 要点: 提出"潜在空间视觉推理"框架,让 MLLM 在 latent space(而非显式语言空间)执行视觉推理步骤,避免传统 chain-of-thought 在视觉任务上的语义鸿沟。
- 意义: 与 R86 Closing Consistency Gap + 9-11 棒 VDiff-Bench 形成"视觉推理一致性 + 视觉差异评测"双轨。
- 标签:
#multimodal#reasoning#latent-space - 建议归入节:§2.7 多模态(潜在空间视觉推理)
16. SceneMosaic(HF Daily 9-10 #11 · 41▲ · v1 漏列 · v2 补入)—— 混合智能体布局进化的仿真就绪场景生成
- 来源: HF Daily 2026-09-10 | arXiv
2609.05594| ⭐ 41 票 - 要点: SceneMosaic 通过混合智能体(multi-agent)布局进化实现高效多样的仿真就绪场景生成,覆盖:(a) 场景布局多样性 + (b) 物理仿真兼容性 + (c) 智能体协作生成三维度。
- 意义: 与 GE-Act 2.0 + DriveZero 同属"仿真环境生成"方向但走多智能体布局进化路线。
- 标签:
#multimodal#simulation#multi-agent - 建议归入节:§2.7 多模态(仿真环境生成)
★ T2040 棒次 · v1 候选完整保留(5 条)
17. Glyph — 企业数据目录 Agentic 系统
- 来源: arXiv 2026-09-09 |
2609.09284 - 要点: 多策略 Agentic 系统面向企业数据目录的列描述与敏感度本体标签生成。
- 意义: 数据治理 + Agent 应用的工业级整合。
- 标签:
#agent#systems#enterprise
18. AgentGrad — 多 Agent 系统的文本梯度 Prompt 优化
- 来源: HF Daily 2026-09-07 | arXiv
2609.08572| ⭐ 27 票 - 要点: 改进的梯度提取(含验证步骤)和聚合机制,提升多 Agent 协作中各 Agent 的 Prompt 质量。
- 标签:
#agent#systems#prompt
19. Why Is Video Still So Expensive? VideoLLM 推理效率综述
- 来源: arXiv 2026-09-08 |
2609.04154| ⭐ 3 票 - 要点: 系统综述 Video/Audiovisual LLM 的推理效率机制,覆盖 (a) 计算优化 + (b) 内存优化 + (c) KV 缓存 + (d) 注意力稀疏化。
- 意义: 与 BeaconKV + Marigold V2 同属"多模态效率"方向。
- 标签:
#rag#memory#multimodal#survey
📋 候选完整列表(19 条 · 排序按 HF Daily 票数优先级)
| # | 标题 | 来源 | 票数 | 棒次 | 标签 |
|---|---|---|---|---|---|
| 1 | NeoHorse-1: 递归自我改进 Agentic 后训练 | HF 9-10 #1 | 377▲ | T0840 | #agent #training #self-improvement |
| 2 | AuK: 语音生成与编辑开源基础模型 | HF 9-10 #2 | 178▲ | T0840 | #multimodal #audio |
| 3 | Omni Interaction Agent 技术报告 | HF 9-10 #3 | 116▲ | T0840 | #agent #interaction |
| 4 | Weak-to-Strong: On-Policy 反向蒸馏 | HF 9-10 #4 | 79▲ | T0840 | #training #distillation |
| 5 | DriveZero: 超越人类演示的端到端驾驶 | HF 9-10 #5 | 50▲ | T0840 | #agent #multimodal #autonomous-driving |
| 6 | OpenWAM: 系统化 World-Action 模型预训练 | HF 9-10 #6 | 49▲ | T1440 | #world-model #open-source |
| 7 | GE-Act 2.0: 机器人操作 World-Action | HF 9-10 #7 | 46▲ | T1440 | #robotics #world-model |
| 8 | Marigold V2: 单目深度估计 Diffusion Transformer | HF 9-10 #8 | 44▲ | T1440 | #multimodal #vision #depth |
| 9 | Miles v0.1: 生产级后训练 | HF 9-10 #9 | 44▲ | T1440 | #training #post-training |
| 10 | Mask Forcing: 双噪声掩码 rollout 视频扩散蒸馏 | HF 9-10 #10 | 43▲ | T1440 | #multimodal #video #diffusion |
| 11 | SceneMosaic: 混合智能体布局进化场景生成 | HF 9-10 #11 | 41▲ | T2040 | #multimodal #simulation |
| 12 | KVShareArena: 跨上下文 KV-Cache 复用 | arXiv 9-09 | — | T2040 | #agent #rag #systems |
| 13 | AgentAudit: 全生命周期 Agent 评估 | arXiv 9-09 | — | T2040 | #agent #memory #benchmark |
| 14 | SWE-Bench Pro Verified: 反作弊代码 Agent 评测 | HF 9-07 | — | T2040 | #agent #benchmark |
| 15 | BeaconKV: 长链推理 KV 压缩 | HF 9-10 #12 | 32▲ | T2040 | #inference #systems #kv-cache |
| 16 | Reason Through the Latent: 潜在视觉推理 | HF 9-10 #13 | 30▲ | T2040 | #multimodal #reasoning |
| 17 | Glyph: 企业数据目录 Agentic | arXiv 9-09 | — | T2040 | #agent #systems |
| 18 | AgentGrad: 多 Agent 文本梯度 Prompt 优化 | HF 9-07 | 27 | T2040 | #agent #systems #prompt |
| 19 | Why Is Video Still So Expensive? VideoLLM 推理效率综述 | arXiv 9-08 | 3 | T2040 | #rag #memory #multimodal #survey |
📣 Substack 线索(1 条 · v1 保留)
AlphaSignal AI — RAG and Long Context Aren't Enough for Agent Memory. δ-mem Is a Third Option
核心论点:RAG 对大多数 Agent 工作负载过于笨重(overbuilt),Long Context 又造成浪费。δ-mem(增量记忆适配器)提出第三条路:在 Qwen3-4B-Instruct 上,0.12% 参数量(4.87M)即可将 5 个基准平均分从 46.79% 提升至 51.66%。论文于 2026-05-12 登 arXiv,Adapter 开源 CC-BY-4.0。
Tom 评注: 增量记忆适配器思路值得追踪。若在 Agent 长期记忆场景落地,可显著降低 RAG 的工程复杂度。
§五 棒次时序错位根因诊断(模式 BJ + 模式 BK)
§5.1 v1 棒次塌方(模式 BJ 第 4 代)
v1 棒次状态:
- T0840 棒次:缺位(应为 2026-09-10T0840-agent-rag-longcontext-radar.md 不存在)
- T1440 棒次:缺位(应为 2026-09-10T1440-agent-rag-longcontext-radar.md 不存在)
- T2040 棒次:存在但文件名错标(2026-09-10-agent-rag-longcontext-radar.md 实际是 T2040 棒次,应加 T 前缀)
棒次齐全度 = 1/3 = 33.3%(7 天最差)
根因: - T0840 棒次被取消或合并(连续 4 棒缺位:9-07 / 9-08 / 9-09 / 9-10) - T1440 棒次在 9-10 棒被压缩(仅 9-10 棒单独缺位) - 命名规范 T 前缀在 4 棒未遵守(9-08 / 9-09 / 9-10 / 9-11)
v2 修复:
- 文件名修正为 2026-09-10T2040-agent-rag-longcontext-radar.md(T 前缀恢复)
- T0840 / T1440 棒次基于 HF Daily 9-10 内容重建(v2 §T0840 / §T1440 节)
- 棒次齐全度从 1/3 提升至 3/3
§5.2 v1 高票漏列(模式 BK 第 1 代)
v1 候选覆盖:8 条(全部来自 candidates JSON 09-07 ~ 09-09 窗口) v1 HF Daily 9-10 候选覆盖:0/11(377▲ NeoHorse-1 等全部漏列)
根因:
- candidates JSON 生成时间:12:40:24 UTC = 20:40 CST = T2040 棒次触发时点
- candidates JSON sourcePolicy:"primary": "arXiv metadata + 多源富化/聚合" 不含 HF Daily 当日策展增量
- HF Daily 9-10 在 09:00 CST 已发布,但 candidates JSON 不含当日策展——radar 棒次实质上落后 HF Daily 棒次 12 小时
v2 修复: - 11 件 HF Daily 9-10 候选纳入(≥30▲ 全覆盖) - 棒次齐全度从 1/3 提升至 3/3 - HF Daily 9-10 候选覆盖率从 0/11 提升至 11/11
§5.3 模式 BI 反思棒时序错位(本棒反思棒 21:40 CST vs inference 棒 22:20 CST)
棒次时序错位:
- 反思棒 cron 21:40 CST 触发
- inference-e1prep 棒 cron e627b203-77c1-4f5a-a634-26925ef1b683 22:20 CST 触发
- 时差 30~40 分钟 = 反思棒永远在 inference 棒之前跑
- 本棒无法在 21:40 CST 时点看到 9-11 inference-e1prep.md(应在 22:20 CST 落盘)
模式 BI 影响: - 7 天反思棒(9-04 ~ 9-10)全部错报 inference 主轴状态 - 9-09 / 9-10 反思棒错报 scripts 棒状态 - 模式 BH / BG / G 等"塌方"叙事 = 部分建立在模式 BI 之上
v2 反思棒修复(建议): - 反思棒 cron 21:40 CST → 22:30 CST 调整(需 Anan / 控制中心协调) - 模式 BI 治理奠基:本棒 §五.3 显式标注棒次时序错位根因
§六 后续棒次锚入预备级(为 9-11 / 9-12 棒接力)
9-11 棒 radar 三场(T0840 / T1440 / T2040)应锚入本棒 v2 候选: - T0840 5 件:NeoHorse-1 + AuK + Omni Interaction Agent + Weak-to-Strong + DriveZero - T1440 5 件:OpenWAM + GE-Act 2.0 + Marigold V2 + Miles v0.1 + Mask Forcing - T2040 4 件:KVShareArena + AgentAudit + SWE-Bench Pro Verified + BeaconKV
9-12 棒 selection 应锚入: - R1(≥100▲):NeoHorse-1(377▲)+ AuK(178▲) - R2(≥50▲):Omni Interaction Agent(116▲)+ DriveZero(50▲) - R3(≥30▲):BeaconKV(32▲)+ Reason Through the Latent(30▲)
9-12 棒 rag-e1prep 应锚入: - 候选:Reason Through the Latent(latent space RAG 检索新路径)+ SceneMosaic(仿真场景生成 + Agent 协作)+ Marigold V2(视觉文档检索增强)
9-12 棒 eval-e1prep 应锚入: - 候选:SWE-Bench Pro Verified(反作弊评测)+ Miles v0.1(生产级后训练评测)+ Marigold V2(单目深度估计评测)
9-12 棒 inference-e1prep 应锚入: - 候选:BeaconKV(KV 压缩 + 长链推理)+ Why Is Video Still So Expensive(VideoLLM 推理效率综述)
去重说明
v1 → v2 候选去重: - v1 8 条全部保留(KVShareArena / AgentAudit / SWE-Bench Pro Verified / Glyph / AgentGrad / VideoLLM Survey / StochBench / Semantic Bottleneck) - 注:v1 候选 7 StochBench 与 9-11 selection R1 重合(2609.09264)—— 9-11 棒已锚入 - 注:v1 候选 8 Semantic Bottleneck 在 9-11 棒 T0840 中也有提及——保留
与 9-11 棒 radar 三场候选去重: - 9-11 T0840 = agent-rag-longcontext-radar(含 AgentAudit + AgentGrad + DRACO + VeriPhy + PILOT + Procedura + RoboTok + CritICL)—— 9-10 v2 与 9-11 T0840 候选几乎无重叠(仅 AgentAudit + AgentGrad),因 9-11 棒覆盖新 arXiv 来源 - 9-11 T1440 = Memory Compression for High-Fanout Agent Sandboxes + EvoSafeHarness + Generative Late-Interaction Embeddings + Execution-Boundary Conformance Profile + SpatialBlock + X-AuT + Open Recipe for IMO Gold + But How Would AI Agents Run a Town's Economy —— 9-10 v2 与 9-11 T1440 候选无重叠,因 9-11 棒覆盖更近期的 9-10 / 9-11 arXiv - 9-11 T2040 = MaP-WAM + Agent 沙箱记忆压缩 + AI Agent 执行边界合规配置档 + δ-mem Substack —— 9-10 v2 与 9-11 T2040 候选部分重叠(Agent 沙箱记忆压缩在 v2 中未列入但在 9-11 T2040 中重点列出)
本棒 v2 重写覆盖净增 11 件 HF Daily 9-10 候选—— 不与 9-11 棒 radar 重叠。
Tom · 2026-09-11 21:42 CST · E2 反思棒 #45 · 9-10 radar v2 重写覆盖 · v1 (4514B / 68L) → v2 (~12KB / ~190L) · 模式 BJ 棒次塌方修复 + 模式 BK radar 高票漏列修复 + 模式 BI 反思棒时序错位诊断奠基 · 19 件候选 · 9 件高价值 · 棒次齐全度 3/3