Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-09-18

本期线索(8 条候选 → 精选)

★ 高价值(4 条)

1. [WeVisDoc] From Coverage to Capability for Robust End-to-End Document Parsing - 链接:https://arxiv.org/abs/2609.20423 - 核心:RAG 场景下的文档解析。两阶段 data-centric 框架:Stage I 扩展语义/结构/外观覆盖(异构数据 + 保结构退化合成),Stage II 用 held-out probe 探测残留错误。训练语料偏向了常见文档和干净数字页,扩展覆盖本身不能指定如何解决 Parser 剩余弱点——这是 RAG Pipeline 真实痛点。 - 标签:RAG | 文档解析 | Data-Centric - 信号:HF 9 票

2. [ActObs] Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL - 链接:https://arxiv.org/abs/2609.20715 - 核心:SFT 通常只监督 Action tokens,环境 observation 仅作 context。ActObs 同时监督 trajectory 中的 observation tokens,引导策略建模动作后果,且不增加数据/参数/序列 token。Agent 探索行为的 RL 新范式,对理解 agent 在未知环境中的自主性有直接意义。 - 标签:Agent | RAG | Multimodal | RL - 信号:HF 2 票

3. [PACT] Can Enterprise AI Assistants Be Trusted Under Pressure? - 链接:https://arxiv.org/abs/2609.18605 - 核心:企业 AI Agent 部署在招聘/医疗/金融等敏感场景,规则遵循(compliance)是法律层面的第一需求。PACT(Pressure-Applied Compliance Testing)系统性地测量主流 LLM 在持续施压、急促管理者或便利违规情境下是否违背规则。填补了企业级 Agent 评测空白。 - 标签:Agent | Benchmark | Enterprise | 评测 - 信号:HF 2 票

4. [行业数据] RAG vs Long Context:2026 实测成本与精度对比 - 来源:usewire.io 整理的生产环境数据 - 核心结论:RAG 单次查询约 $0.00008,Long Context 约 $0.10(1250 倍差距);延迟 RAG ~1s vs LC ~45s。Long Context 在 1M token 窗口中相关content 被埋在中间时精度下降超 30%。2026 生产主流为混合范式:用检索收窄上下文,再用长窗口跨检索结果推理。 - 意义:RAG 未死,但架构需升级为「检索→推理」双阶段,而非单纯 Chunk Retrieval。 - 标签:RAG | Long Context | 成本 | 架构

○ 普通候选(4 条)

5. [研究] When EOS Tokens Disagree: Length Inflation in On-Policy Distillation - https://arxiv.org/abs/2609.20511 | HF 33 票 - Base student 与 post-trained teacher 的 EOS token 停止概率位置不一致,导致学生响应过长。跨 Qwen3/Llama/Gemma 均复现。对训练长输出 Agent 的蒸馏有参考价值。

6. [评测] Can MiniMax-H3 Reason About the Physical World? Omni-Modal Evaluation - https://arxiv.org/abs/2609.18323 | HF 21 票 - MiniMax-H3 统一多模态(文本/图像/视频/音频)生成评测,四维度物理世界推理框架。对 Agent 感知真实物理环境的能力边界有参考。

7. [评测] VākQA: Telugu Spoken Factoid QA Benchmark - https://arxiv.org/abs/2609.19879 | HF 1 票 - 低资源语言语音问答评测,Gemini-as-a-judge 最接近人类评估但非均匀严格。QA 评测方法论参考价值。

8. [系统] FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations - https://arxiv.org/abs/2609.20817 | HF 4 票 - 从单目稀疏视图预测关节运动,Feed-forward + 多状态聚合。对机器人 Agent 的物理对象操作建模有参考。


元信息

  • 候选总数:8 条
  • 高价值:4 条(含 1 条行业数据)
  • Substack/Newsletter:1 条(usewire.io 数据综述)
  • CSDN:无(未发现包含版本/命令/源码/排障经验的明确线索)
  • Arxiv 富化:失败(HTTP 406),全部候选来自 HF Daily
  • 写作时间:~8 分钟