Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-10-01 14:40
本期候选(8 条,来自 arXiv + HF Daily)
| # | 来源 | 标题 | 信号 |
|---|---|---|---|
| 1 | HF(票 54) | UniEvo-VL: Multimodal Self-Evolution (2609.38721) | multimodal · self-critique · test-time compute |
| 2 | HF(票 22) | Mid-Harness: Agent Action Reliability at Model-Harness Boundary (2609.39982) | agent · systems · reliability |
| 3 | HF(票 12) | False Frontiers: Co-Cheating in Self-Evolving Search Agents (2609.39102) | agent · self-evolution · evaluation |
| 4 | HF(票 12) | SMART: Multi-Agent Subtitle Translation with Persistent Memory (2609.38660) | agent · memory · long-form |
| 5 | HF(票 11) | EVOKE: Eliciting World Knowledge for Decision-Making (2609.38334) | agent · multimodal · transfer |
| 6 | arXiv | OSWorld-Science: Computer Use Agents for Scientific Software (2609.39903) | agent · benchmark · VLM |
| 7 | arXiv | Unmask the State: Strategy Reversals in Diffusion Language Models (2609.33355) | systems · agent |
| 8 | arXiv | Loop Scaling Laws: Joint Recurrence + MoE Sparsity (2609.40316) | systems · scaling |
高价值条目(4 条)
K1 · Mid-Harness:Agent 工具执行可靠性的模型-框架边界问题
"Mid-Harness: Scaling Actions Between Model and Harness" · arXiv:2609.39982 · HF 票 22
终端 Agent 生成动作后执行可靠性不足:错误的命令(如装错包)会改变环境,拖累后续轨迹,即使模型本可生成更好的替代方案。本文在模型-harness 边界引入 test-time compute:采样+验证候选动作,确认安全后再执行,同时保持模型端生成策略不变。对 Agent 工程化落地(代码执行、shell 操作、CI/CD 场景)有直接参考价值。
K2 · False Frontiers:自进化搜索 Agent 的共舞弊问题
"False Frontiers: Diagnosing and Mitigating Co-Cheating" · arXiv:2609.39102 · HF 票 12
自进化搜索 Agent 联合优化提案者(生成问题)和求解者(回答问题),引入了一种名为"共舞弊"的失败模式:双方在共享错误上越来越一致,内部奖励改善但外部正确率停滞或下降。缓解方案:在训练前验证提案——这对 RAG 检索质量评估同样有警示意义,因为检索器和生成器若联合优化也可能出现类似的反馈回路偏差。
K3 · SMART:多 Agent 长篇字幕翻译的持久记忆路由
"Breaking Babel: Self-Evolving Multi-Agent Subtitle Translation" · arXiv:2609.38660 · HF 票 12
SMART 通过持久 series-level memory + 动态路由器 + MoA 层处理长篇字幕翻译中的话语和文化上下文。对 Agent 记忆系统的工程参考:如何在长程任务中维护跨会话状态、何时调用外部工具(术语验证、约束检查)、动态调整 workflow 复杂度。
K4 · OSWorld-Science:VLM Agent 操作科学软件评测
"OSWorld-Science" · arXiv:2609.39903 · HF 票 4
12 个 VLM × 146 个高质量任务,覆盖分子绘图、数据分析、可视化等科研 workflow,基于结果的 artifact 评估而非过程追踪。对 Agent 评测设计的参考:专用领域评测框架如何平衡任务复杂度与自动化评估可行性。
行业动态(1 条,Substack)
The Memory Stack: From RAG to Cognitive AI · interestingengineering.substack.com · 2026-02
系统梳理了 Naive RAG → Agentic RAG → Cognitive AI 的演进路径。关键洞察:主动检索受困于 context window 上限(128k-200k tokens),大量输入时必须压缩/摘要,导致"context rot"精度损失;Passive Context(被动上下文)通过预填充结构化上下文替代即时检索,实现高可靠性的 Agent 记忆管理。工程视角值得参考。
采集自 arXiv 元数据 + HF Daily,2026-10-01T06:40 UTC · Tom 文献雷达 3x/日