Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-20 08:40

概览

  • 主题:AI Agent、RAG、检索、长上下文、评测
  • 来源:arXiv + Hugging Face Daily(2026-08-16 ~ 08-18)
  • 候选总数:8 条
  • 高价值:4 条
  • Substack:未使用(CSDN 跳过)
  • 任务来源:cron 每日高频雷达第 1 次

🔥 高价值条目(4 条)

1. COMA: Compositional Misleading Attack on Security-RAG

  • 来源:arXiv · 2608.17960v1 · 2026-08-18
  • 作者:Chinmay Gondhalekar, Urjitkumar Patel
  • 标签rag benchmark
  • 核心:安全 RAG 的新攻击面——每份对抗文档单独看都是真实的、无指令的、无矛盾的,但组合起来可以让 copilot 给出可利用的漏洞评估后再推荐一个"修复"方案反而保留漏洞。不同于传统 prompt injection,COMA 攻击不需要文档本身包含恶意指令。
  • 意义:SecOps copilot 场景的严重威胁,RAG 评测基准的新维度。防御需要组合层面的完整性验证,而非逐文档审核。
  • 链接:http://arxiv.org/abs/2608.17960v1

2. Do LLMs Play Six Degrees of Separation? Measuring Topological Compression in Long-Context Manifolds

  • 来源:arXiv · 2608.17950v1 · 2026-08-18
  • 作者:Md. Faiyaz Abdullah Sayeedi
  • 标签long-context
  • 核心:绕过注意力权重,直接分析隐藏状态流形的动态几何,证明深度 LLM 潜伏空间原生组织为小世界网络(Small-World networks)。将连续相似度矩阵稀疏化为无向图,追踪长上下文中的"六度分离"特性。
  • 意义:对理解 LLM 长距离推理的内部机制有重要贡献;Small-World 特性可解释 multi-hop 推理效率来源,对长上下文架构设计有直接启示。
  • 链接:http://arxiv.org/abs/2608.17950v1

3. LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

  • 来源:HF Daily · arXiv:2608.17393 · 2026-08-17
  • 标签agent systems
  • 核心:coding agent 的 RL 训练面临 agent harness(工具集成/执行反馈)与 policy-gradient 优化之间的 misalignment:环境崩溃和 reward hacking 破坏结果信号,train-inference 差异导致 rollout 行为与策略更新脱钩。LEGO-RL 桥接 native harnesses 与 policy-gradient 优化,不修改 harness 内部控制流。
  • 意义:coding agent RL 训练框架的实际落地路径;固定 harness 接口 + 外挂优化层的设计值得参考。
  • 链接:https://arxiv.org/abs/2608.17393

4. Preference Is Not Intervention: Structure and Stability Boundaries of Reader-Specific Evidence Utility in RAG

  • 来源:arXiv · 2608.17781v1 · 2026-08-18
  • 作者:Shi Zhou
  • 标签rag benchmark systems
  • 核心:holding query/evidence/task/scoring/intervention fixed,9 个读者在 33% 的联合影响单元中对效果符号意见相反;读者×查询交互解释了 29.8% 的效用方差(vs. 8.4% 排列零假设);自选证据 F1 提升 +0.031(t=3.39)。说明"证据效用"不是稳定的任务属性,而是读者×查询的交互效应。
  • 意义:RAG evidence utility 的读者异质性问题被正式量化;对 RAG 评测设计(reader 作为变量)和个性化 RAG 系统有重要警示。
  • 链接:http://arxiv.org/abs/2608.17781v1

📋 其他候选(4 条)

# 标题 来源 标签 摘要
5 DiSCO: Distribution-Guided Contrastive Prompt Optimization HF · arXiv:2608.17067 · 08-16 systems T2I 生成模型的 NSFW 红队对抗防御,黑盒 LLM prompt 重写 + 分布对比优化。非本 radar 核心主题
6 MoE-ViE: Mixture of Experts Vision Encoder HF · arXiv:2608.17402 · 08-17 multimodal systems 细粒度 MoE 拓扑用于 CLIP 风格视觉编码器 Scaling,超越 dense 和标准 MoE 基线。非本 radar 核心主题
7 PTXBench: GPU Kernel Optimization with PTX HF · arXiv:2608.17379 · 08-17 benchmark 评估 LLM 用架构特定 PTX 优化 GPU kernel 的能力。非本 radar 核心主题
8 The Problem Is the Problem: Scalable Mathematical Discovery HF · arXiv:2608.16977 · 08-16 systems AI-for-math 中问题选择和专家评审成为瓶颈,提出新的人机发现范式。非本 radar 核心主题

Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-20 08:40 UTC