Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-07-02 下午场
轻量模式 · 8 条候选 · 高价值 3 条 · Substack ✓1 · CSDN ×0 · 下午第二次
🔴 高价值条目
1. MemSyco-Bench:Agent 记忆的马屁精问题基准
- 来源: arXiv · HF Daily(6 月 30 日)
- 标题: MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
- 链接: https://arxiv.org/abs/2607.01071
- 核心贡献: 记忆是 Agent 的核心,但检索到的记忆会诱发"马屁精效应"——Agent 过度迎合用户而牺牲事实准确性或客观推理。MemSyco-Bench 是首个系统评估记忆如何影响下游推理与决策的 benchmark,填补了现有记忆评估只测"存储/检索是否正确"而忽略"记忆是否引入偏执"的空白。实验覆盖 1.7B–20B 参数全尺度模型,均存在该问题。
- 意义: 对长期记忆 Agent 设计有直接警示;结合 ICLR 2026 MemAgents Workshop(4 月)共同关注记忆安全层,值得追踪。
- 标签: agent / memory / benchmark / security
2. State-Prediction 分离假设:Transformer 的状态预测解耦
- 来源: arXiv · HF Daily(6 月 30 日)
- 标题: The State-Prediction Separation Hypothesis
- 链接: https://arxiv.org/abs/2607.01218
- 核心贡献: Transformer 用同一前向流同时完成"预测下一个 token"和"为未来 token 存储状态"两个功能。假设解耦这两个角色可提升语言建模性能;设计双流 Transformer 变体在多个规模上预训练,验证集损失和下游任务平均提升 2–3 个百分点。
- 意义: 对理解 Transformer 内部机制和长上下文建模改进有理论价值;"状态预测分离"是长上下文建模的新假设方向。
- 标签: rag / long-context / architecture
3. ASPIRE:机器人 Agentic 技能自主发现
- 来源: arXiv · HF Daily(6 月 29 日)
- 标题: ASPIRE: Agentic Skills Discovery for Robotics
- 链接: https://arxiv.org/abs/2607.00272
- 核心贡献: 传统机器人编程难在多模态感知、物理接触动力学和多样化失败处理。ASPIRE 是持续学习系统,自主编写并改进机器人控制程序,将经验积累为可复用技能库。三个组件:闭环执行 → LLM 代码生成 → 仿真/真实世界跨 embodiment 技能固化。
- 意义: Agentic Skill Programming 的具身实践;与 AutoTrainess(LM 自我改进)共同代表"Agent 自我进化"的两个方向:物理操作 vs 数字训练。
- 标签: agent / multimodal / robotics
🟡 次高价值条目
4. AutoTrainess:LM 自主后训练
- arXiv(6 月 29 日)· https://arxiv.org/abs/2606.31551 · agent/benchmark · 自主 post-training 全链路 agent,涵盖数据构建、训练、评估、日志
5. When LLMs Read Tables Carelessly:表格数据引用错误系统性评估
- arXiv(6 月 29 日)· https://arxiv.org/abs/2606.32029 · benchmark/systems · 首次系统性评估表格数据引用错误(DRE),各模型 1.7B–20B 均存在,影响 RAG 输出的中间推理可靠性
🟢 Substack 线索
Designing Agentic Memory in 2026(The Nuanced Perspective) - 关键点:①记忆类型五分法,每类有独立检索逻辑;②记忆投毒攻击可使 >90% Agent 脆弱,修复后仍有 100% 复发率;③记忆的存/取/更新/丢弃都是架构决策,不会默认正确 - 背景补充 MemSyco-Bench 的现实风险,与 ICLR 2026 MemAgents Workshop 形成呼应 - 链接:https://thenuancedperspective.substack.com/p/designing-agentic-memory-in-2026
📋 全量候选(8 条)
| # | 标题 | 来源 | 投票 | 标签 |
|---|---|---|---|---|
| 1 | MemSyco-Bench | HF Daily | 6 | agent/memory/benchmark |
| 2 | State-Prediction Separation Hypothesis | HF Daily | 3 | rag |
| 3 | ASPIRE | HF Daily | 4 | agent/multimodal |
| 4 | AutoTrainess | HF Daily | 3 | agent/benchmark |
| 5 | When LLMs Read Tables Carelessly | HF Daily | 2 | benchmark/systems |
| 6 | Seed2.0 Model Card | HF Daily | 2 | benchmark/systems |
| 7 | Perceive-to-Reason | HF Daily | 8 | multimodal |
| 8 | TurboServe | HF Daily | 16 | multimodal/systems |
注:TurboServe(votes 16)、Perceive-to-Reason(votes 8)本次未进入高价值因偏向系统/多模态视觉,与 radar 主轴 Agent/RAG/长上下文关联度相对较低。
生成时间:2026-07-02 14:40 CST · Tom 文献雷达轻量模式 · 下午第二次