Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-09-19

本期线索(8 条候选 → 精选)

★ 高价值(3 条)

1. [Fuse] Verifiable Social Reasoning for LLM Assistants - 链接:https://arxiv.org/abs/2609.17496 - 核心:LLM 助手在日常社交咨询场景中的推理评测极难标准化——用户叙述主观,且社交意图缺乏可验证 ground truth。Fuse 提出多智能体模拟框架:目标 Agent 持有隐藏动机,通过用户代理与环境交互,助手从中推断目标意图。开创了「可验证社交推理」评测新范式,对社交类 Agent 的能力边界测量有直接价值。 - 标签:Agent | Benchmark | Social Reasoning | 评测 - 信号:HF 13 票

2. [Self-Evolving Search Index] 自演进检索索引 - 链接:https://arxiv.org/abs/2609.19656 - 核心:RAG 检索质量高度依赖 index keys 对文档知识的暴露程度,但有效表达随检索环境变化,固定优化策略无法一致表现。Self-Evolving Index 让索引根据环境自主诊断失败、迭代优化策略,减少人类干预。对 Agent 动态知识库更新有直接意义。 - 标签:Agent | RAG | Benchmark | 自适应 - 信号:HF 7 票

3. [行业洞察] Context Window 优化:2026 年 6 大策略 - 来源:neuraltrust.ai 整理 - 核心结论:放置策略比 token 数量更关键——检索片段放最前、当前任务指令次之、工具输出放末位;中间层注意力最弱。混合策略 2026 年成主流:RAG 负责精确 chunk 召回 + 长窗口负责跨片段综合推理。TTT-E2E 等新方向可将 2M token 上下文延迟压缩至固定水平,意义重大。 - 标签:RAG | Long Context | 架构 | Context Engineering - 备注:非传统 Substack,为本周新发布的技术博客综述

○ 普通候选(5 条)

4. [Agent/RL] ActObs — 观察监督改变 Agent 探索行为 - https://arxiv.org/abs/2609.20715 | HF 3 票 - SFT 只监督 Action tokens,ActObs 同时监督 trajectory 中的 observation tokens,引导策略建模动作后果。对 RL 驱动的 Agent 自主探索有新意。

5. [系统] Sample Count Is Not Enough — 测试时 scaling 策略 - https://arxiv.org/abs/2609.19499 | HF 2 票 - 推理预算由候选数量 N 和批次策略共同决定,而非仅 N。Phi-3-mini/Qwen2.5-1.5B 在 GSM8K 上验证:同等 N 分批生成优于一次批量。对 Agent 推理效率优化有参考。

6. [多模态] MiniMax-H3 物理世界推理评测 - https://arxiv.org/abs/2609.18323 | HF 21 票 - 四维度物理推理框架评测 Omni-Modal 生成模型。Agent 感知物理环境的边界参考。

7. [评测] VākQA — 泰卢固语语音问答基准 - https://arxiv.org/abs/2609.19879 | HF 1 票 - 低资源语言 SQA 评测,Gemini-as-a-judge 方法论参考价值。

8. [系统] FAMOS — 稀疏观测的 3D 关节建模 - https://arxiv.org/abs/2609.20817 | HF 5 票 - Feed-forward 多状态聚合关节运动预测。机器人 Agent 物理操作参考。


元信息

  • 候选总数:8 条
  • 高价值:3 条
  • Substack/Newsletter:0(neuraltrust.ai 为技术博客,不计入)
  • CSDN:无(未发现含版本/命令/源码/排障经验的明确线索)
  • Arxiv 富化:失败(HTTP 406),候选全部来自 HF Daily
  • 写作时间:~7 分钟