Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-10-01 14:40

本期候选(8 条,来自 arXiv + HF Daily)

# 来源 标题 信号
1 HF(票 54) UniEvo-VL: Multimodal Self-Evolution (2609.38721) multimodal · self-critique · test-time compute
2 HF(票 22) Mid-Harness: Agent Action Reliability at Model-Harness Boundary (2609.39982) agent · systems · reliability
3 HF(票 12) False Frontiers: Co-Cheating in Self-Evolving Search Agents (2609.39102) agent · self-evolution · evaluation
4 HF(票 12) SMART: Multi-Agent Subtitle Translation with Persistent Memory (2609.38660) agent · memory · long-form
5 HF(票 11) EVOKE: Eliciting World Knowledge for Decision-Making (2609.38334) agent · multimodal · transfer
6 arXiv OSWorld-Science: Computer Use Agents for Scientific Software (2609.39903) agent · benchmark · VLM
7 arXiv Unmask the State: Strategy Reversals in Diffusion Language Models (2609.33355) systems · agent
8 arXiv Loop Scaling Laws: Joint Recurrence + MoE Sparsity (2609.40316) systems · scaling

高价值条目(4 条)

K1 · Mid-Harness:Agent 工具执行可靠性的模型-框架边界问题

"Mid-Harness: Scaling Actions Between Model and Harness" · arXiv:2609.39982 · HF 票 22

终端 Agent 生成动作后执行可靠性不足:错误的命令(如装错包)会改变环境,拖累后续轨迹,即使模型本可生成更好的替代方案。本文在模型-harness 边界引入 test-time compute:采样+验证候选动作,确认安全后再执行,同时保持模型端生成策略不变。对 Agent 工程化落地(代码执行、shell 操作、CI/CD 场景)有直接参考价值。

K2 · False Frontiers:自进化搜索 Agent 的共舞弊问题

"False Frontiers: Diagnosing and Mitigating Co-Cheating" · arXiv:2609.39102 · HF 票 12

自进化搜索 Agent 联合优化提案者(生成问题)和求解者(回答问题),引入了一种名为"共舞弊"的失败模式:双方在共享错误上越来越一致,内部奖励改善但外部正确率停滞或下降。缓解方案:在训练前验证提案——这对 RAG 检索质量评估同样有警示意义,因为检索器和生成器若联合优化也可能出现类似的反馈回路偏差。

K3 · SMART:多 Agent 长篇字幕翻译的持久记忆路由

"Breaking Babel: Self-Evolving Multi-Agent Subtitle Translation" · arXiv:2609.38660 · HF 票 12

SMART 通过持久 series-level memory + 动态路由器 + MoA 层处理长篇字幕翻译中的话语和文化上下文。对 Agent 记忆系统的工程参考:如何在长程任务中维护跨会话状态、何时调用外部工具(术语验证、约束检查)、动态调整 workflow 复杂度。

K4 · OSWorld-Science:VLM Agent 操作科学软件评测

"OSWorld-Science" · arXiv:2609.39903 · HF 票 4

12 个 VLM × 146 个高质量任务,覆盖分子绘图、数据分析、可视化等科研 workflow,基于结果的 artifact 评估而非过程追踪。对 Agent 评测设计的参考:专用领域评测框架如何平衡任务复杂度与自动化评估可行性。


行业动态(1 条,Substack)

The Memory Stack: From RAG to Cognitive AI · interestingengineering.substack.com · 2026-02

系统梳理了 Naive RAG → Agentic RAG → Cognitive AI 的演进路径。关键洞察:主动检索受困于 context window 上限(128k-200k tokens),大量输入时必须压缩/摘要,导致"context rot"精度损失;Passive Context(被动上下文)通过预填充结构化上下文替代即时检索,实现高可靠性的 Agent 记忆管理。工程视角值得参考。


采集自 arXiv 元数据 + HF Daily,2026-10-01T06:40 UTC · Tom 文献雷达 3x/日