Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-08-23
候选概览(8 条)
| # | 标题 | 来源 | 投票 | 核心标签 |
|---|---|---|---|---|
| 1 | Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses | arXiv | ⭐10 | agent |
| 2 | The Embedder's Dilemma: LLMs Are Better, but at What Cost? | arXiv | ⭐7 | rag, benchmark |
| 3 | QuoteBench: How Matched Scores Can Hide Command-Path Failures | arXiv | ⭐7 | agent |
| 4 | τ_0-VLA: Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation | HF | ⭐9 | memory, multimodal |
| 5 | TinyCast: Probabilistic Zero-Shot Forecasting with Computed Periodicity | HF | ⭐8 | benchmark |
| 6 | FlowEvo: Self-Evolving Agents through Co-Evolution of Workflows and Executable Skills | HF | ⭐2 | agent, systems |
| 7 | Inadvertent Context Leakage in Language Models | arXiv | — | agent, long-context |
| 8 | What Makes a Good Fiqh Retriever? Answer Retrieval for Arabic Islamic Jurisprudence | arXiv | — | rag, benchmark |
🔴 高价值条目(4 条)
H1 · Hierarchical Self-Improvement (HSI)
- URL: https://arxiv.org/abs/2608.08466
- 投票: 10(本次最高)
- 摘要: harness(测试框架)本身作为可演进构件,三级层次结构:task harness → improvement harness → meta harness,冷启动后无需人工干预即可持续自我改进。
- 要点: Agent 自我改进从 prompt 层面下沉到执行框架层;固定 LLM + 动态 harness 组合是 2026 年明显趋势。
- 标签: agent / systems
H2 · The Embedder's Dilemma
- URL: https://arxiv.org/abs/2608.12875
- 投票: 7
- 摘要: 10 个 LLM × 26 个 embedding 模型,37 项任务,成本-aware 对比。总体平局(Gemini 3.1 Pro 77.6 vs 最佳 embedding 77.2),但擅长领域分化:LLM 在推理型检索领先,embedding 在分类任务更强。
- 要点: "LLM vs embedding" 不是非此即彼,混合pipeline仍是最优解;RAG 系统选型需按任务类型分流。
- 标签: rag / benchmark
H3 · Inadvertent Context Leakage
- URL: http://arxiv.org/abs/2608.19857v1
- 发表: 2026-08-20(极新)
- 摘要: Agent 持有敏感上下文(凭证、健康、财务记录)时,即使模型正确拒绝直接提取,上下文本身的存在仍会在输出中引入隐藏相关性,造成间接泄漏。攻击者可利用看似无害的文本作为隐蔽信道。
- 要点: 长上下文 Agent 的隐私边界问题;context window 不等于安全边界;是 Agent 安全领域的重要新发现。
- 标签: agent / long-context / security
H4 · QuoteBench
- URL: https://arxiv.org/abs/2608.13547
- 投票: 7
- 摘要: 测评 LLM coding agent 输出 Bash 命令的边界:生成结果与执行传输之间的错误归属问题。用 exact final-state validation 区分生成错误和传输引入的错误。
- 要点: Agent 评测方法论贡献;揭示"matched execution scores"可能掩盖传输层问题;对 Agent 工程实践有直接排障价值。
- 标签: agent / benchmark
🟡 辅助线索(Substack/Web)
S1 · RAG vs Long Context 生产对比数据(2026)
- 来源: Wire Blog (usewire.io)
- 摘要: 2026 年实测数据——RAG 单次查询约 $0.00008,长上下文约 $0.10(1250 倍差距);延迟 RAG ~1s vs 长上下文 ~45s。相关性强但位于上下文中间位置时准确率下跌 30%+。最优解为混合:先检索缩小范围,再用长上下文跨chunk推理。
- 价值: 成本-效果量化数据,生产决策参考。
附 · EITT Academy: AI Agents 2026 演进图
三层 memory 模型(working/context/retrieval)已成 2026 标准架构;长上下文没有杀死 RAG,而是改变了二者的分工边界。
去重说明
- 相比 2026-08-22 雷达:本轮 HSI(2608.08466)为全新条目;FlowEvo 曾在 08-21 出现类似工作(inference-time skill compilation),本轮低票(2)但仍收录。
- Embedder's Dilemma(2608.12875)与 08-22 的 Embedder's Dilemma 属同一论文,持续高价值。
- Substack 线索:本次无独立 Substack 来源,以 Wire Blog 替代,内容含 2026 量化数据。
元数据
- 生成时间: 2026-08-23T08:40 CST
- 提供者: tom-daily-radar-3x
- 候选JSON: /shared/research-kb/inbox/tom/_candidates/2026-08-23-agent-rag-longcontext-candidates.json
- 锁TTL: 1500s