Tom 文献雷达 · Agent RAG LongContext · 2026-09-04 08:40

本期高价值条目(3条)

1. WHALE: Weight-Harness Alternating LEarning ⭐ Agent

Paper: https://arxiv.org/abs/2609.00196 | HF 22票 | 2026-08-30

Agent 性能由模型参数和执行 harness 代码共同决定,但现有联合优化方法只调权重和文本提示,把 harness 固定了。WHALE 的思路是交替两阶段:先在当前 harness 下更新模型权重,再搜索更好的 harness(harness 搜索空间不限于文本)。

意义: 这是目前第一篇把 agent harness(context 管理与控制流代码)纳入联合优化的工作。若 scale 上验证有效,可能改变 Agent 系统的训练范式。


2. NeoMME: Single-Tower Multimodal Encoder ⭐ RAG/Retrieval

Paper: https://arxiv.org/abs/2609.01657 | HF 22票 | 2026-08-30

现有 ColPali 等视觉文档检索模型复用了 VLM 架构(因果 LM + 视觉编码器),参数和计算开销大。NeoMME 从头训练双向 Transformer Encoder,用 masked discrete-diffusion 目标,同时处理多语言文本和原始图像 patch。260M / 800M 两档。

意义: 非生成式检索场景(图文混合文档 RAG)的新架构候选,参数效率显著优于 ColPali 系列。若开源权重,可直接替代多语言图文检索 pipeline 中的视觉编码器。


3. SLM as Judges: 小模型做 Rubric-Based RL 评判 ⭐ Evaluation

Paper: https://arxiv.org/abs/2608.30005 | HF 1票 | 2026-08-29

Rubric-based RL 需要对每条回复按实例级标准打分,通常用 GPT-4 或 7B 以上模型做 judge,成本高。本文系统评估了 SLM(≤3B)做 rubric judge 的可靠性,构建了 PointRubric 和 RaR-Science-Static 两个带标签数据集。

意义: 对 Agent 评测有意义——若 SLM 能可靠打 rubric 分,Agent 的细粒度 reward 就无需调用贵重模型,降低训练/评测成本。


辅助参考(来自公开博客,非原始论文)

  • Vectara: Context Engineering (https://www.vectara.com/blog/context-engineering-can-you-trust-long-context) — "Context Engineering is the new prompt engineering",指出 LLM 长上下文存在被忽视的 lost-in-the-middle 脆弱性,RAG 和 Agent 应用不应盲目塞入所有上下文。实操警示价值高。

  • Databricks: Long Context RAG Performance (https://www.databricks.com/blog/long-context-rag-performance-llms) — 系统对比了 RAG(retrieve then generate)vs 纯长上下文在 200K~2M token 场景下的表现,指出 Gemini 2M 上下文在某些大海量检索任务上仍败给精筛 RAG。


候选清单(本期全部8条)

# 标题 来源 票/信号 标签
1 WHALE: Weight-Harness Alternating LEarning arxiv HF 22票 Agent, Systems
2 NeoMME: Single-Tower Multimodal Encoder arxiv HF 22票 Multimodal, Systems
3 Debias-SparseGPT: Bias-Aware Pruning arxiv HF 2票 Research
4 Sparse Readout Prism: Logit-Lens in Features arxiv HF 2票 Research
5 SLM as Judges for Rubric-Based RL arxiv HF 1票 Benchmark
6 Portfolio Risk Bounds via LM Representations arxiv HF 1票 Systems
7 Zero-Data Bootstrapping for CRS arxiv HF 1票 Multimodal, Systems
8 Wasserstein-Barycentric Interaction Fields arxiv HF 0票 Research

备注

  • arXiv 搜索因超时/429 本期全部失败,内容全靠 HF Daily 策展覆盖;无 CSDN 来源引入。
  • Substack 主动搜索未命中明确Newsletter来源,改为引用公开博客 Vectara + Databricks(均为可独立核实的技术文章,非付费Newsletter)。
  • 本期缺失:Agent Memory、Tool Use、Long Context Evaluation 的专项arXiv覆盖,下一轮可尝试补充 ArXiv API 重试。

Tom 文献雷达 · 每日3次 · 轻量版 · 2026-09-04T08:40 UTC+8