📋 Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-09-01
候选概览
| # | 来源 | 标题 | 标签 |
|---|---|---|---|
| 1 | arXiv | MNIST-PRO: MNIST as Partially Observable World for AI Agents | agent, memory, benchmark |
| 2 | arXiv | Agents in the Large: Perception-Centered Architecture for Persistent Agents | agent, memory, systems |
| 3 | HF Daily | Chain-of-Thought Faithfulness Varies with Where Preference Cues Delivered | agent, benchmark |
| 4 | HF Daily | Super Library Agent: Multi-Codebase Joint Generation & Maintenance | agent |
| 5 | HF Daily | Evaluating Hidden Costs of Personalization in LLMs | benchmark |
| 6 | HF Daily | DreamX-Creator: Native Audio-Video Joint Generation (7B) | multimodal |
| 7 | HF Daily | SafeAtlas-VL: Multimodal Safety at Scale | multimodal |
| 8 | HF Daily | Chat-Edit-3D++: Interactive 3D/4D Scene Editing via LLM | multimodal |
⭐ 高价值条目(4条)
1. MNIST-PRO: AI Agent 感知-记忆基准
- URL: http://arxiv.org/abs/2608.31022v1
- 日期: 2026-08-31
- 核心: 将 MNIST 改造为部分可观测序列决策任务,测试 agent 在有限 glimpse + working memory 下构建感知状态的能力。评估 10 个多模态模型在 4 种记忆表示(raw visual history / textual states / structured grid maps / hash-atlas)上的表现。
- 价值: 首个将感知状态构建能力从物理/控制复杂度中解耦的 benchmark,对 RAG + memory 系统设计有直接参考意义。
2. Agents in the Large: 持久化 Agent 感知中心架构
- URL: http://arxiv.org/abs/2608.30478v1
- 日期: 2026-08-31
- 核心: 提出持久化 AI agent 框架,区别于单任务 agent,重点处理长生命期设置中用户需求、上下文和服务流程的持续变化。围绕感知-记忆-决策环路组织。
- 价值: 为多会话/长期助手类应用提供架构框架,对 agent 记忆模块的分层管理有参考价值。
3. CoT Faithfulness 随提示位置变化 (FACE-Eval)
- URL: https://arxiv.org/abs/2608.29464
- 日期: 2026-08-28
- 核心: 提出 FACE-Eval(5100 样本),测试 15 个开源模型在 user message / tool return 两种位置、显式/隐式提示下的 CoT 忠实度,发现 tool return 中的隐式偏好比显式 user 消息更难被检测。
- 价值: 对构建可靠 agent 推理链路有警示意义:agent 工具返回的隐式偏好可能绕过 CoT 监控。
4. Super Library Agent: 多代码库联合生成
- URL: https://arxiv.org/abs/2608.29310
- 日期: 2026-08-28
- 核心: 提出超级库模式:agent 在生成 N 个相关应用时维护一个跨项目共享库,避免代码重复和结构腐化。
- 价值: 软件工程 agent 领域的实际问题;"super library" 抽象对大型 RAG 知识库去重和跨库复用有启发。
📦 Substack / 技术评论
Context Engineering: Can You Trust Long Context? - 来源: Vectara Blog - 要点: 长上下文(1M token Gemini / 200K Claude)并不等于"全部塞进 context"。RAG 的选择性检索 vs. 长上下文的全量输入在成本(1s vs 30-60s)和位置偏见上存在本质差异。文章指出 context engineering 正在取代 prompt engineering,成为 RAG+agent 应用的核心挑战。 - 链接: https://www.vectara.com/blog/context-engineering-can-you-trust-long-context
去重说明
与最近 7 天已有报告无重复。本期新增 2 篇持久化 agent 架构论文、1 篇 agent 感知 benchmark、1 篇 CoT 忠实度评估,均为本期首发。
由 Tom 研究知识库 cron 自动生成 · 2026-09-01T12:40 UTC 来源: arXiv + HuggingFace Daily + Tavily web search