Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-08

本期关键词

AI Agent 架构、RAG 评估基准、Agent 记忆/状态管理、CoT 可解释性、安全对齐


🔴 高价值候选(3 条)

1. Dr. Claw: AI Scientist Workspace for Vibe Research

  • 来源: arXiv 2609.00365 | 2026-08-30 | HuggingFace 8票
  • 标签: agent rag
  • 核心: 命令行 Agent(Claude Code 等)缺乏端到端可审计的研究工作流。Dr. Claw 在现有 Agent 执行器外层封装了可控可审计的人机协作工作流:持久化状态对象、可复用 Skill 库、多执行器协调,将计划-执行-写作串联,保留决策轨迹。区别于自主 Agent,定位是"审计型研究助手"而非另一个自主体。
  • 看点: RAG + Agent 审计追踪、Skill 复用机制值得参考;开源,适合构建可复用的 Agent 研究工作流。
  • 链接: https://arxiv.org/abs/2609.00365

2. HarvestBench: Agent 代价敏感避害评测基准

  • 来源: arXiv 2609.04444 | 2026-09-02 | HuggingFace 3票
  • 标签: agent memory benchmark
  • 核心: 首个给避害行为定价的 Agent 评测基准。模拟农场联合收割场景,Agent 在多辆拖拉机协同任务中遇到动物阻挡,需在"直接压过(免费)"和"绕行(付燃油费)"之间决策。追踪 Agent 是否愿意为避免伤害活体支付代价。
  • 看点: 将"记忆+代价+道德"三维联合评测,而非单独测 side effect;无记忆单步决策设定使问题更纯粹;多 Agent 协同也值得参考。
  • 链接: https://arxiv.org/abs/2609.04444

3. Chains-of-Thought 推理操作的几何结构分析

  • 来源: arXiv 2609.04753 | 2026-09-03 | HuggingFace 10票
  • 标签: research
  • 核心: 研究 CoT 中不同推理操作(问题分解、目标设定、演绎等)在 LLM 隐藏表征空间中的几何结构。发现:操作在中间层达到最佳可分性,且不是由词汇/位置混淆导致。这对理解长上下文推理机制和设计更可解释的 Agent 系统有直接意义。
  • 看点: Mechanistic interpretability + Agent 可解释性交叉;中间层可分性发现对长上下文架构设计有参考价值。
  • 链接: https://arxiv.org/abs/2609.04753

🟡 其他候选(5 条)

4. Selective Non-Compliance 评估基准 KoNA

  • 来源: arXiv 2609.04720 | 标签: benchmark multimodal | 2票
  • 现实查询常包含"可答部分+需拒绝部分"混合;KoNA 覆盖 5 类(错误前提、不安全、不可行、不可答、混合),评测 VLM 选择性拒绝能力。相比整句拒绝更细粒度。

5. Refuse without Refusal: 减少安全调优误拒绝

  • 来源: arXiv 2609.04714 | 标签: research | 2票
  • 将安全回复分解为"拒绝信号+解释",减少将良性但含风险词汇的查询误拒绝。降低误拒绝对 Agent 实际可用的影响。

6. 2026 PNPL Competition: 跨被试语音解码 BCI

  • 来源: arXiv 2609.03231 | 2票 | 偏神经接口,非核心

7. UniMate: 统一骨骼动画生成

  • 来源: arXiv 2609.05415 | 12票 | 偏 3D/动画,非核心

8. EditVid: 统一视频编辑框架

  • 来源: arXiv 2609.04190 | 标签: memory multimodal | 因果记忆 + 长距离身份保持;非本研究堆栈核心

📢 Substack 线索(1 条)

The AI Agents Stack (2026 Edition) — The AI Engineer
来源: theaiengineer.substack.com

"Agent 所需基础设施与 LLM 不同:跨多步执行的状态管理、协议化工具调用、跨会话持久记忆、自主推理循环、实时护栏。2024 年护栏是输入/输出过滤,2026 年护栏是授权工具调用、执行速率限制、验证 Agent 实际行为。"

核心洞察:Agent 护栏已从模型层扩展到系统层,工具调用授权+执行审计成为独立工程方向。


📋 候选统计

指标
总候选 8
高价值 3(Dr. Claw、HarvestBench、CoT 几何分析)
Substack 1(The AI Engineer)
CSDN 未使用
报告正文 ~1100 字

Tom · 2026-09-08 08:40 UTC · 轻量模式 · Lock: tom-daily-radar-3x