Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-08-10 14:40 UTC
本期速览
8 条候选来源 HF Daily + arXiv,去重参考近 7 天文件名(无重复)。
⭐ 高价值条目(3 条)
1. PrivacyPeek: 审计 LLM Agent acquisition 阶段隐私泄露
- 来源: arXiv 2606.00152 | Tags: agent, benchmark
- URL: https://arxiv.org/abs/2606.00152
- 核心: 现有基准审计"响应/外发动作"泄露,忽视信息获取阶段(数据首次进入 agent context)。提出 PrivacyPeek,1182 案例覆盖 7 种 acquisition 行为。超过获取必要的信息在失控动作或攻击前随时可泄露。
- 价值: Agent 安全评测新维度,值得跟进 benchmark 设计思路。
2. When Privileged Guidance Misaligns: 多轮 Agent 状态匹配路由与自蒸馏
- 来源: arXiv 2608.05219 | Tags: agent, multimodal
- URL: https://arxiv.org/abs/2608.05219
- 核心: 多轮 agent 中,student 轨迹状态与 teacher 参考轨迹随交互深入而分歧(状态漂移),导致特权蒸馏失效。提出状态匹配路由 + 情境化自蒸馏。
- 价值: 多轮 agent 训练对齐问题,方法可直接迁移至 RAG + agent 记忆场景。
3. PHOENIX: 星载 SLM 自主卫星自愈与多智能体 AI 恢复
- 来源: arXiv 2608.07126 | Tags: agent
- URL: http://arxiv.org/abs/2608.07126v1
- 核心: CubeSat 85% 轨道时间不可达,提出预测健康在轨边缘神经网络,通过预测性自愈 + 多智能体 AI 恢复延长卫星寿命。
- 价值: 边缘 agent 决策 + 多智能体协同在严苛离线环境中的实际部署案例,方法论值得关注。
补充条目(5 条)
4. SimWAM: 简化的世界动作模型用于端到端自动驾驶
- 来源: HF Daily | arXiv 2608.07468 | Votes: 18 | Tags: agent, multimodal, systems
- 视频生成仅用作训练信号,共用流匹配联合训练;推理时丢弃视频分支,保留轻量自包含规划器。
- 亮点:视频分支推理时可剥离,是低延迟部署的实用思路。
5. Do AI Personas Grow? Agent 人格生命事件后的演变基准
- 来源: HF Daily | arXiv 2608.06485 | Tags: agent, benchmark
- 11 种重大生活事件驱动 PC-Agent 人格演变,跨特征/事件/角色/模型系统分析。
- 价值:lifespan agent 人格一致性研究尚少,基准设计有参考性。
6. YOLO-PEFT: YOLO 家族参数高效微调的结构感知框架
- 来源: HF Daily | arXiv 2608.07051 | Votes: 10 | Tags: agent, benchmark
- 检测器异构算子约束下的 PEFT 放置问题,结构感知约束规划框架。
- 价值:实时目标检测场景的 PEFT 适配问题,方法有一定泛化性。
7. Round-Trip Consistency: 双向扩散模型自监督 rollout 误差预测
- 来源: HF Daily | arXiv 2608.00675 | Votes: 2 | Tags: systems
- 单条件潜扩散模型可前向或后向步进,round-trip discrepancy C_i 提供免 ground truth 的测试时误差信号。
- 亮点:无需额外 rollout、无需控制方程的自监督误差估计。
8. C4: MLLM 跨概念创造力评测框架
- 来源: HF Daily | arXiv 2608.06501 | Tags: benchmark, systems
- 基于成语跨概念编码/解码评测 MLLM 创造性理解。
- 与 agent 任务关联弱,仅作补充。
趋势洞察(Substack 补充)
- Mem0 v0.8.2 LoCoMo 91.6 分 → 30 天后实际精度跌至 49%(staleness 38%):RAG/记忆系统长期衰减是 2026 年生产级陷阱,hybrid architecture(L1 in-context → L4 summarization)已成事实标准。
- Mem0 / Letta / LangMem / Zep 四大 memory 框架对比:Mem0 记忆更新逻辑强,Letta 状态管理清晰,LangMem 与 LangGraph 生态绑定,Zep 重时序推理。
Candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-08-10-agent-rag-longcontext-candidates.json