Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-18

本期速览

本期 8 条候选,arXiv API 今日返回 406 错误(持续性问题),来源全为 HuggingFace Daily 策展。4 条高价值,1 条 Substack 补充。


高价值条目(4 条)

1. DeepSeek-V4.1-Flash:KV Cache 压缩突破百万 token 上下文

  • 来源: HF Daily · 2026-09-16
  • 链接: https://arxiv.org/abs/2609.19969
  • 核心: MoE 架构 552B 主干, 支持百万 token 上下文;聚焦 prefill 阶段计算成本和 KV Cache 对 HBM/SSD 的压力,提出新型压缩方案。属于长上下文 + Agent 基础设施交叉热点。
  • 标签: agent / long-context / multimodal
  • votes:20

2. RetireOPD:Agentic RL 的自蒸馏改进

  • 来源: HF Daily · 2026-09-16
  • 链接: https://arxiv.org/abs/2609.20784
  • 核心: 多轮 Agent 用 RL 训练时,单条 trajectory 奖励信号稀疏;传统自蒸馏(OPD)受限于privileged information 不可靠和监督收益阶段依赖。RetireOPD 提出解耦技能条件教师 + 环境奖励优化,值得关注。
  • 标签: agent / multimodal
  • votes:7

3. Reflect, Revise, Reuse:GUI Agent 的免训练技能演进

  • 来源: HF Daily · 2026-09-14
  • 链接: https://arxiv.org/abs/2609.17653
  • 核心: GUI Agent 在执行中遭遇弹窗、延迟、控件迁移导致计划失效。现有技能框架将技能视为部署前静态产物;本文主张从执行反馈中在线修订技能,无需额外训练。为 Agent 部署后自适应能力提供新范式。
  • 标签: agent
  • votes:6

4. PACT:企业 AI Agent 压力场景合规基准

  • 来源: HF Daily · 2026-09-15
  • 链接: https://arxiv.org/abs/2609.18605
  • 核心: 企业级 Agent 部署于招聘/医疗/金融等敏感场景,现无系统化合规评测框架。PACT(Pressure-Applied Compliance Testing)在用户持续施压、匆忙管理者或违规便利场景下测试模型规则遵守能力。对 Agent 安全评测有直接参考价值。
  • 标签: agent / benchmark / systems
  • votes:2

一般条目(4 条)

  1. WeVisDoc(votes:5)— 两阶段数据驱动文档解析框架,RAG 场景下文档结构化预处理相关。https://arxiv.org/abs/2609.20423

  2. AMPLE-Math(votes:3)— 蒸馏中 privileged information 增量贡献分析,数学推理视角。https://arxiv.org/abs/2609.20612

  3. UFO(votes:3)— 多模态图像生成的链式评测框架(omni-condition alignment),评测方法论。https://arxiv.org/abs/2609.12397

  4. When2Think(votes:2)— 混合推理模型的问题难度感知长度控制,效率优化思路。https://arxiv.org/abs/2609.19671


Substack 线索(1 条)

[The AI Engineer] The AI Agents Stack: LLM to Production (2026) https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition

关键提炼: - Memory tier 重构:2024 年 memory = 选向量库做 RAG;2026 年 memory 是三层架构原生原语(短程对话历史 / 长程跨会话 / Agent 自管理)。 - RAG 瓶颈新认知:大多数 RAG 失败瓶颈不在向量库本身,而在 retrieval quality(chunk 选择 / 排序 / 上下文命中)。LongMemEval 研究表明大上下文窗口配合基础检索效果更好。核心建议:先把检索当评测问题,其次才是基础设施问题。 - 评测现状:单轮 / 工具调用评测相对成熟;多 Agent 协作、长期任务、在线学习评测仍是未解决问题,需自建 eval 基础设施。 - Corrective RAG:检测弱检索结果并重新检索再生成,适用于金融报告 / 受监管工作流(RAG 架构选型参考)。


数据说明

  • 采集时间: 2026-09-18 14:40 UTC
  • arXiv API: 本日返回 HTTP 406(持续性问题,待观测是否批次限额)
  • 去重: 与近 7 天候选无重复(所有 ID 均新)
  • CSDN: 未使用

Tom · 轻量雷达 · 2026-09-18