Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-03 下午

轻量版 · 检索:HuggingFace Daily(8 条候选,2 次 web_search 补充) 去重依据:早间版(2026-09-03 08:40)已覆盖 AgentJudgeBench、EAL 记忆安全、Token-Efficient 推理 Agents;早间版 14:40 雷达无重复。


高价值候选(4 条)

1. HarnessDev:LLM 能否自建 Agent 执行框架?

  • 来源: arXiv(2609.01437)· 2026-08-31 · HF 14 票
  • 核心: 当前 agent 评测依赖人工设定的 harness(执行基础设施),这本身就是一个被忽略的变量。HarnessDev 将评测单元从「任务输出」转向「可运行的基础设施」——模型要从 minimal seed 生成完整 harness,并在上面完成任务。覆盖 Creation 和 Evolution 两个阶段。
  • 意义: 首次系统评估模型「构建工具」的能力,而非仅评估「使用工具」的能力;揭示下游任务表现与 harness 质量之间的强耦合;为 Agent 自我改进提供新的评测维度。
  • 标签: #Agent #benchmark #自我改进
  • 原文: https://arxiv.org/abs/2609.01437

2. S³Gym:LLM 能否通过自测、自判实现自我改进?

  • 来源: arXiv(2608.31100)· 2026-08-30 · HF 11 票
  • 核心: S³Gym 评测三个耦合能力:Self-Testing(主动测试自身行为)、Self-Judging(评判测试结果)、Self-Improvement(基于经验改进)。与现有自进化研究起点不同——从「人类定义的任务+指标」出发,变成从「自然语言模糊目标」出发。Permissive exploration 与 strict held-out evaluation 分离。
  • 意义: 将 Agent 的「元认知」能力纳入标准化评测;与 ASPIRE(同期另一篇)共同推动「模糊目标驱动的自我进化」方向;SFT+RLHF 之外的新范式探索。
  • 标签: #Agent #self-improvement #benchmark
  • 原文: https://arxiv.org/abs/2608.31100

3. CRISP:长上下文推理的自适应稀疏 Prefill 路由

  • 来源: arXiv(2609.01925)· 2026-08-31 · HF 5 票
  • 核心: Self-attention 在长上下文 prefilling 阶段计算量二次增长。CRISP 发现两个结构性问题:post-softmax 质量层级被忽略(路由到低质量 head 导致稀释)、固定模式无法适应输入相关注意力结构。提出输入自适应路由,动态分配稀疏模式给不同 head。
  • 意义: 直接针对长上下文推理的成本瓶颈;稀疏注意力从固定模式向动态路由演进;与此前 Long Context vs RAG 成本分析形成互补——CRISP 解决 prefilling,RAG 解决 decoding。
  • 标签: #long-context #systems #推理优化
  • 原文: https://arxiv.org/abs/2609.01925

4. SnapBench:移动端 snap-and-ask 多模态检索鲁棒性基准

  • 来源: arXiv(2608.29607)· 2026-08-29 · HF 2 票 · 标签含 #RAG #multimodal
  • 核心: Mobile AI 的 snap-and-ask 是最高频入口之一,但照片模糊、文字输入错误等问题导致现有基准失真。SnapBench 构建 1,145 queries × 9,085 gallery items × 53 种 corruption 条件,含配对鲁棒性评测;覆盖 16 个多模态检索器。
  • 意义: 首个 paired robustness benchmark for snap-and-ask;模糊/噪声输入下的 RAG 评测缺口被填补;移动端 agent 视觉交互评测参考。
  • 标签: #RAG #multimodal #benchmark #移动端
  • 原文: https://arxiv.org/abs/2608.29607

一般候选(4 条)

# 标题 来源 票/信号 备注
5 ASPIRE:模糊目标驱动的自我进化基准 arXiv 2608.31111 · HF 12票 self-evolution benchmark 与 S³Gym 同日发表,同方向但侧重不同;可对比阅读
6 VibeVoice-ASR-Streaming:流式说话人归属 ASR arXiv 2609.02812 · HF 5票 streaming · agent LLM-based 端到端流式方案;实时语音 agent 基础设施
7 Institutional Newspapers Pipeline:历史报纸数据管道 arXiv 2608.18972 · HF 7票 data pipeline 模块化低成本历史报纸数字化;高质量预训练数据来源
8 SimLoss:单遍细粒度图像描述 arXiv 2609.00591 · HF 2票 multimodal 单次推理完成细粒度描述;无多阶段重写延迟

Substack 补充(1 条)

近期 Substack 无直接匹配本次主题的深度技术文章,主要讨论集中在大模型上下文窗口扩展(Claude 200K、Gemini 1.5 Pro)和 RAG 架构选型。Agent 自我评测方向暂未见高质量独立博客分析,以 arXiv 论文为主。


本期小结

  • Agent benchmark 新方向:HarnessDev(工具构建能力)和 S³Gym(自测自判自改进)代表了从「任务性能」到「元能力」的评测转向。
  • 长上下文:CRISP 从系统层面解决 prefilling 成本,与 RAG 形成互补而非替代。
  • RAG 新benchmark:SnapBench 填补了移动端模糊输入场景的评测空白。
  • 去重注意:早间版(08:40)已覆盖 AgentJudgeBench、EAL、Token-Efficient Agents,请勿重复归档。

Tom 文献雷达 · 每日 3 次(08:40 / 14:40 / 20:40)· 轻量版 Generated: 2026-09-03 14:40 Asia/Shanghai