Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-21
候选概览(8条)
| # | 来源 | 标题 | 领域 | 热度 |
|---|---|---|---|---|
| 1 | arXiv/HF | FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving | long-context | ⭐⭐⭐ |
| 2 | HF Daily | IAR: Retrieval-Free Document Knowledge Internalization | rag | ⭐⭐⭐ |
| 3 | HF Daily | SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback | agent | ⭐⭐ |
| 4 | HF Daily | SWE-bench Science: Coding Agents for Scientific Software | agent+benchmark | ⭐⭐ |
| 5 | HF Daily | Repo0: Zero-to-All Code Generation with Dual-DAG | agent | ⭐ |
| 6 | HF Daily | Chain-of-Experience for Continual LLM Improvement | benchmark | ⭐ |
| 7 | HF Daily | Towards Quantifying Benchmark Optimization in ASR | benchmark | ⭐ |
| 8 | HF Daily | 4DAnyone: 4D Human Reconstruction from Monocular Video | multimodal | ⭐ |
⭐ 高价值条目(4条)
1. FlashPrefill V2(长上下文服务)
- 来源:arXiv 2608.19758,2026-08-20
- 作者:Fan et al. — 华中科技大学+人大
- 核心:将 FlashPrefill 原型推进到生产级别。引入 mean correction 抑制 attention 噪声,提出 block-sparse prefill 机制,显著降低 prefilling 阶段计算成本(kv-cache 压缩视角)。
- 意义:长上下文 LLM 落地的核心瓶颈是 prefilling 算力成本,V2 相比 V1 真正走向部署。对 Agent 上下文窗口管理有直接参考价值。
- 标签:long-context, serving, attention optimization
2. IAR: Inject, Align, Recover(无检索文档知识内化)
- 来源:arXiv 2608.20281,2026-08-19
- 核心:将固定文档集合转为"参数知识",在推理时不依赖检索即可回答文档相关问题。三阶段框架:文档知识注入 → QA 对齐 → 通用能力恢复。
- 意义:RAG 的检索层是延迟和错误的主要来源。IAR 代表了"把知识直接写进模型参数"的路线探索,若规模化验证有效,将动摇主流 RAG 架构。
- 标签:rag, retrieval-free, knowledge internalization
3. SkillEvo: Multi-Turn Agent 技能自演化
- 来源:arXiv 2608.13120,2026-08-12
- 核心:现有 agent 技能要么手工编写,要么单轮 LLM 生成后无法从交互失败中闭环改进。SkillEvo 引入多轮交互反馈梯度,让 agent 技能真正从真实使用中持续进化,弥补了单轮 QA 反馈导致演化梯度衰减的问题。
- 意义:多轮 agent 能力的核心问题是"第一轮补丁打完后如何继续进化"。SkillEvo 给出了闭合回路,值得关注其 benchmark 对比。
- 标签:agent, multi-turn, skill evolution
4. SWE-bench Science(科学软件工程 Agent 评测)
- 来源:arXiv 2608.19799,2026-08-19
- 核心:现有 coding agent 评测只看任务完成率,SWE-bench Science 专注科学软件(20 个领域 98 个 repo、119 个任务),揭示 Agent 在修复科学计算代码时失败的根本原因,而不仅是成功率。
- 意义:科学软件失败会影响科学结论本身——这是 Agent 评测从"功能"走向"可信"的重要分支。与 SWE-bench Full-Stack 形成互补。
- 标签:agent, benchmark, scientific software
📮 Substack 线索(1条)
δ-mem:Agent Memory 的第三条路 - 来源:AlphaSignal(alexewerlof),2026-05-15 - 核心论点:对于大多数 agent 工作负载,RAG 是过度设计,更长上下文是浪费。δ-mem 提出用 8×8 associative memory state(仅 4.87M 可训参数)存储长期记忆,在 Qwen3-4B 上将 5 个 benchmark 分数从 46.79% 提升到 51.66%。 - 与 agent-RAG-longcontext 三角关系:RAG 检索开销 vs. 全上下文浪费 vs. δ-mem 的轻量记忆矩阵——代表 2026 年 memory 模块的第三条路线探索。 - 原文链接:https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough
附:The AI Agents Stack (2026 Edition)(theaiengineer,2026-03-11) - 关键区分:"Agent stack ≠ LLM stack"。Agent 需要:跨步骤状态管理、协议化工具访问、跨 session 持久记忆、自主推理循环、实时 guardrails。 - 2026 新动向:Agent guardrails 从 input/output 过滤器演变为 tool call 授权+rate limit+行为验证(与 OWASP LLM05/06 高度呼应)。
去重备注
- 上轮(2026-08-20)已有 agent-rag-longcontext 候选,本轮以 FlashPrefill V2 和 IAR 为新增核心增量
- δ-mem 来自 Substack 补充(非 arXiv/HF 原始渠道),与近期 memory-related 候选路线不同
- CSDN:本轮无使用
生成时间:2026-08-21 14:40 CST
任务标识:tom-daily-radar-3x
Cronspace:lightweight(10min max)