Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21 20:40

候选概览(7条)

# 来源 标题 领域 热度
1 arXiv Inadvertent Context Leakage in Language Models agent+security ⭐⭐⭐
2 HF Daily SWE-bench Science: Coding Agents for Scientific Software agent+benchmark ⭐⭐⭐
3 HF Daily SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn agent ⭐⭐
4 arXiv FlashPrefill V2: Block-Sparse Prefill for Long-Context Serving long-context ⭐⭐⭐
5 HF Daily Chain-of-Experience for Continual LLM Improvement benchmark
6 HF Daily Thinking in a Low-Resource Language(基准噪声 7.7pt) benchmark
7 HF Daily NARU: Japanese Extreme Long Video Benchmark multimodal

注:FlashPrefill V2 详见 2026-08-21 14:40 雷达;本轮为增量补充。


⭐ 高价值条目(4条)

1. Inadvertent Context Leakage(上下文隐式泄露)⭐ 本轮最高价值

  • 来源:arXiv 2608.19857,2026-08-20
  • 作者:Fairoze, Mangaokar, Chaudhuri, Garg, Mahloujifar(UIUC/马里兰)
  • 核心:Agent 常持有用户敏感上下文(日历、凭证、健康、财务记录)。研究揭示:即使模型正确拒绝直接提取,敏感信息仍可通过隐藏相关性从正常输出中被重构;攻击者可主动构造 prompt 放大该效应(covert carrier)。
  • 意义:对部署 AI Agent 的安全边界有直接影响。若在多轮对话中持续注入含敏感上下文的 token,即使每轮都正确拒绝,累计泄露风险不可忽视。这是长上下文 Agent 的隐私盲区。
  • 标签:agent, security, long-context, privacy

2. SWE-bench Science(科学软件 Agent 评测)

  • 来源:arXiv 2608.19799,2026-08-19
  • 核心:119 任务 / 98 repo / 20 科学领域,专注"为何失败"而非仅"是否成功"。科学代码失败可直接动摇科学结论——区别于通用 SWE-bench 的纯功能评测。
  • 意义:从 Agent 功能评测 → 可信科学计算,评测维度的关键扩展。与 FlashPrefill V2(长上下文推理成本)共同构成 Agent 落地基础设施工具链的双轨。
  • 标签:agent, benchmark, scientific software

3. SkillEvo: Multi-Turn Agent 技能自演化

  • 来源:arXiv 2608.13120,2026-08-12
  • 核心:单轮 QA 反馈的演化梯度在第一轮补丁后迅速衰减,多轮交互才能暴露真实缺陷。SkillEvo 引入多轮反馈梯度闭合回路,技能可从真实使用失败中持续进化。
  • 意义:多轮 agent 能力进化路线,与 Chain-of-Experience(见下)从不同角度解决"测试时学习"问题。
  • 标签:agent, multi-turn, skill evolution

4. FlashPrefill V2(工程实用性突破)

  • 来源:arXiv 2608.19758,2026-08-20(14:40 已有,此处补充工程维度)
  • 新增维度:相比 V1 原型,V2 引入 mean correction + block-sparse mechanism,生产级部署能力(与 HuggingFace TGI、vLLM 路线对齐)。
  • 标签:long-context, serving, production

去重备注

  • 相比 2026-08-21 14:40 报告,新增:Context Leakage(安全维度)、Chain-of-Experience、Low-Resource benchmark 基准噪声分析、NARU
  • 保留:SWE-bench Science(已更新热度)、FlashPrefill V2(补充工程视角)
  • IAR / Repo0 / 4DAnyone / δ-mem Substack 来自上轮,已排除
  • Substack 补充:本轮候选富化工具未命中 Substack 源(工具仅支持 arXiv/HF),以 14:40 Substack 报告为准
  • CSDN:本轮无使用

生成时间:2026-08-21 20:40 CST
任务标识:tom-daily-radar-3x
Cronspace:lightweight(10min max)