Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-28 晚间补充

本期速览

共 8 条候选(HF Daily,纯 metadata),高价值 2 条。1 条 Substack 补充。


🔥 高价值(2 条)

1. hRoPE:段落级层级位置编码

Paragraph Boundaries Are Not White Space: Compression Depth as the Signature of Hierarchical Structure - 链接:https://arxiv.org/abs/2609.23551 - 来源:HF Daily(2 票)| 2026-09-19 - 要点:标准 1D 位置编码无法区分段落层级结构。hRoPE 将段落/句子/token 三通道分离,各自独立旋转,在固定 token 序列上干预段落坐标 p1 后,用 token-distance-exact 估计器测量跨段落注意力。关键发现:压缩本身不能诊断真实结构,但段落边界对跨段引用的建模确实有独立贡献。 - 为什么重要: 对 RAG 的直接意义——检索回来的段落边界信息可能比段落内 token 顺序更关键;RAG 分块策略应考虑结构层级而非仅语义切分。 - 标签:RAG / 位置编码 / 长上下文


2. IndicBankBench:银行 Agent 工具调用的四阶段评测

IndicBankBench: Evaluating Safety and Reliability of LM Assistants in Indian Retail Banking - 链接:https://arxiv.org/abs/2609.29167 - 来源:HF Daily(4 票)| 2026-09-23 - 要点:799 案例覆盖 5 大运营域,在 4 个阶段评测:安全 → 工具调用 → 回复充分性 → 咨询质量。核心发现:一个 Agent 可能问出它自己已有答案的问题、用过期上下文、选错账户、或在正确答案后写无效值——仅评测最终回复会漏掉这些关键中间态错误。 - 为什么重要: 多步骤工具调用型 Agent 的评测框架;国内金融/客服 Agent 可参考此四阶段分层 evals 思路。 - 标签:Agent / Benchmark / 工具调用


📋 其他候选(6 条,低价值,仅存档)

# 标题 亮点
3 Depth-adaptive Looped LMs via CDB 循环 LM 的连续深度批处理,vLLM 高效支持;对 Agent 推理速度有参考
4 ARGUS:气候政策因果评估审计 LM 审计 DID 识别假设,11 维框架;方法论可迁移至 Agent 决策可解释性
5 VLA-Precision:视觉-语言-动作在线 RL 多模态 Agent 后训练,ACoB 算法;精密操作场景的 RL 路线
6 MOPD-Router:多教师蒸馏路由 Token 级软路由,无域标签;多专家模型路由的轻量化方案
7 DSM + 扩散模型增强 卫星 3D 建图去噪,非本方向
8 BoundInk:笔迹生成 手写时序生成,非本方向

📡 Substack 补充(1 条)

2026 AI Agent Stack 演化新信号(The AI Engineer,2026)

  • 知识 ≠ 记忆:2024 年两者混用,2026 年已拆分为独立架构问题——知识是 Agent 可访问的外部数据,记忆是 Agent 自身状态。
  • 检索瓶颈在质量而非向量库:LongMemEval 证明基础长上下文检索效果良好,核心是 chunk 切分质量与 ranking 策略;先做 evals 再做基础设施。
  • 新 Benchmark 涌现:Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent);三者覆盖 Agent 全生命周期评测需求。
  • OpenAI Responses API + WebSocket:server-side 缓存,20+ tool calls 任务提速 40%,1 小时连接,适合长时间 Agent 任务。

(综合自 The AI Engineer、codingwithroby、aixfunda 等,2026-09;本期新信号:hRoPE 段落层级发现、IndicBankBench 四阶段框架、三个新 Benchmark 名称)


📌 去重提示

  • 2026-09-28 早间:PISA 块稀疏注意力、AgentWorld 多 Agent 协作评测、hybrid RAG+长上下文工程范式已覆盖
  • 本期新增:hRoPE(RAG chunk 层级结构)、IndicBankBench(四阶段工具调用评测)、三个新 Benchmark 名称(Context/Recovery/Terminal-Bench)

Tom 文献雷达 · 轻量版 · 2026-09-28 晚间 · agent-rag-longcontext · 8 候选 · 2 高价值 · 1 Substack · 0 CSDN