Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-10 14:40 UTC

本期速览

8 条候选来源 HF Daily + arXiv,去重参考近 7 天文件名(无重复)。


⭐ 高价值条目(3 条)

1. PrivacyPeek: 审计 LLM Agent acquisition 阶段隐私泄露

  • 来源: arXiv 2606.00152 | Tags: agent, benchmark
  • URL: https://arxiv.org/abs/2606.00152
  • 核心: 现有基准审计"响应/外发动作"泄露,忽视信息获取阶段(数据首次进入 agent context)。提出 PrivacyPeek,1182 案例覆盖 7 种 acquisition 行为。超过获取必要的信息在失控动作或攻击前随时可泄露。
  • 价值: Agent 安全评测新维度,值得跟进 benchmark 设计思路。

2. When Privileged Guidance Misaligns: 多轮 Agent 状态匹配路由与自蒸馏

  • 来源: arXiv 2608.05219 | Tags: agent, multimodal
  • URL: https://arxiv.org/abs/2608.05219
  • 核心: 多轮 agent 中,student 轨迹状态与 teacher 参考轨迹随交互深入而分歧(状态漂移),导致特权蒸馏失效。提出状态匹配路由 + 情境化自蒸馏。
  • 价值: 多轮 agent 训练对齐问题,方法可直接迁移至 RAG + agent 记忆场景。

3. PHOENIX: 星载 SLM 自主卫星自愈与多智能体 AI 恢复

  • 来源: arXiv 2608.07126 | Tags: agent
  • URL: http://arxiv.org/abs/2608.07126v1
  • 核心: CubeSat 85% 轨道时间不可达,提出预测健康在轨边缘神经网络,通过预测性自愈 + 多智能体 AI 恢复延长卫星寿命。
  • 价值: 边缘 agent 决策 + 多智能体协同在严苛离线环境中的实际部署案例,方法论值得关注。

补充条目(5 条)

4. SimWAM: 简化的世界动作模型用于端到端自动驾驶

  • 来源: HF Daily | arXiv 2608.07468 | Votes: 18 | Tags: agent, multimodal, systems
  • 视频生成仅用作训练信号,共用流匹配联合训练;推理时丢弃视频分支,保留轻量自包含规划器。
  • 亮点:视频分支推理时可剥离,是低延迟部署的实用思路。

5. Do AI Personas Grow? Agent 人格生命事件后的演变基准

  • 来源: HF Daily | arXiv 2608.06485 | Tags: agent, benchmark
  • 11 种重大生活事件驱动 PC-Agent 人格演变,跨特征/事件/角色/模型系统分析。
  • 价值:lifespan agent 人格一致性研究尚少,基准设计有参考性。

6. YOLO-PEFT: YOLO 家族参数高效微调的结构感知框架

  • 来源: HF Daily | arXiv 2608.07051 | Votes: 10 | Tags: agent, benchmark
  • 检测器异构算子约束下的 PEFT 放置问题,结构感知约束规划框架。
  • 价值:实时目标检测场景的 PEFT 适配问题,方法有一定泛化性。

7. Round-Trip Consistency: 双向扩散模型自监督 rollout 误差预测

  • 来源: HF Daily | arXiv 2608.00675 | Votes: 2 | Tags: systems
  • 单条件潜扩散模型可前向或后向步进,round-trip discrepancy C_i 提供免 ground truth 的测试时误差信号。
  • 亮点:无需额外 rollout、无需控制方程的自监督误差估计。

8. C4: MLLM 跨概念创造力评测框架

  • 来源: HF Daily | arXiv 2608.06501 | Tags: benchmark, systems
  • 基于成语跨概念编码/解码评测 MLLM 创造性理解。
  • 与 agent 任务关联弱,仅作补充。

趋势洞察(Substack 补充)

  • Mem0 v0.8.2 LoCoMo 91.6 分 → 30 天后实际精度跌至 49%(staleness 38%):RAG/记忆系统长期衰减是 2026 年生产级陷阱,hybrid architecture(L1 in-context → L4 summarization)已成事实标准。
  • Mem0 / Letta / LangMem / Zep 四大 memory 框架对比:Mem0 记忆更新逻辑强,Letta 状态管理清晰,LangMem 与 LangGraph 生态绑定,Zep 重时序推理。

Candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-08-10-agent-rag-longcontext-candidates.json