Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21 20:40
候选概览(7条)
| # | 来源 | 标题 | 领域 | 热度 |
|---|---|---|---|---|
| 1 | arXiv | Inadvertent Context Leakage in Language Models | agent+security | ⭐⭐⭐ |
| 2 | HF Daily | SWE-bench Science: Coding Agents for Scientific Software | agent+benchmark | ⭐⭐⭐ |
| 3 | HF Daily | SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn | agent | ⭐⭐ |
| 4 | arXiv | FlashPrefill V2: Block-Sparse Prefill for Long-Context Serving | long-context | ⭐⭐⭐ |
| 5 | HF Daily | Chain-of-Experience for Continual LLM Improvement | benchmark | ⭐ |
| 6 | HF Daily | Thinking in a Low-Resource Language(基准噪声 7.7pt) | benchmark | ⭐ |
| 7 | HF Daily | NARU: Japanese Extreme Long Video Benchmark | multimodal | ⭐ |
注:FlashPrefill V2 详见 2026-08-21 14:40 雷达;本轮为增量补充。
⭐ 高价值条目(4条)
1. Inadvertent Context Leakage(上下文隐式泄露)⭐ 本轮最高价值
- 来源:arXiv 2608.19857,2026-08-20
- 作者:Fairoze, Mangaokar, Chaudhuri, Garg, Mahloujifar(UIUC/马里兰)
- 核心:Agent 常持有用户敏感上下文(日历、凭证、健康、财务记录)。研究揭示:即使模型正确拒绝直接提取,敏感信息仍可通过隐藏相关性从正常输出中被重构;攻击者可主动构造 prompt 放大该效应(covert carrier)。
- 意义:对部署 AI Agent 的安全边界有直接影响。若在多轮对话中持续注入含敏感上下文的 token,即使每轮都正确拒绝,累计泄露风险不可忽视。这是长上下文 Agent 的隐私盲区。
- 标签:agent, security, long-context, privacy
2. SWE-bench Science(科学软件 Agent 评测)
- 来源:arXiv 2608.19799,2026-08-19
- 核心:119 任务 / 98 repo / 20 科学领域,专注"为何失败"而非仅"是否成功"。科学代码失败可直接动摇科学结论——区别于通用 SWE-bench 的纯功能评测。
- 意义:从 Agent 功能评测 → 可信科学计算,评测维度的关键扩展。与 FlashPrefill V2(长上下文推理成本)共同构成 Agent 落地基础设施工具链的双轨。
- 标签:agent, benchmark, scientific software
3. SkillEvo: Multi-Turn Agent 技能自演化
- 来源:arXiv 2608.13120,2026-08-12
- 核心:单轮 QA 反馈的演化梯度在第一轮补丁后迅速衰减,多轮交互才能暴露真实缺陷。SkillEvo 引入多轮反馈梯度闭合回路,技能可从真实使用失败中持续进化。
- 意义:多轮 agent 能力进化路线,与 Chain-of-Experience(见下)从不同角度解决"测试时学习"问题。
- 标签:agent, multi-turn, skill evolution
4. FlashPrefill V2(工程实用性突破)
- 来源:arXiv 2608.19758,2026-08-20(14:40 已有,此处补充工程维度)
- 新增维度:相比 V1 原型,V2 引入 mean correction + block-sparse mechanism,生产级部署能力(与 HuggingFace TGI、vLLM 路线对齐)。
- 标签:long-context, serving, production
去重备注
- 相比 2026-08-21 14:40 报告,新增:Context Leakage(安全维度)、Chain-of-Experience、Low-Resource benchmark 基准噪声分析、NARU
- 保留:SWE-bench Science(已更新热度)、FlashPrefill V2(补充工程视角)
- IAR / Repo0 / 4DAnyone / δ-mem Substack 来自上轮,已排除
- Substack 补充:本轮候选富化工具未命中 Substack 源(工具仅支持 arXiv/HF),以 14:40 Substack 报告为准
- CSDN:本轮无使用
生成时间:2026-08-21 20:40 CST
任务标识:tom-daily-radar-3x
Cronspace:lightweight(10min max)