Tom 文献雷达 · Agent RAG LongContext · 2026-09-04 08:40
本期高价值条目(3条)
1. WHALE: Weight-Harness Alternating LEarning ⭐ Agent
Paper: https://arxiv.org/abs/2609.00196 | HF 22票 | 2026-08-30
Agent 性能由模型参数和执行 harness 代码共同决定,但现有联合优化方法只调权重和文本提示,把 harness 固定了。WHALE 的思路是交替两阶段:先在当前 harness 下更新模型权重,再搜索更好的 harness(harness 搜索空间不限于文本)。
意义: 这是目前第一篇把 agent harness(context 管理与控制流代码)纳入联合优化的工作。若 scale 上验证有效,可能改变 Agent 系统的训练范式。
2. NeoMME: Single-Tower Multimodal Encoder ⭐ RAG/Retrieval
Paper: https://arxiv.org/abs/2609.01657 | HF 22票 | 2026-08-30
现有 ColPali 等视觉文档检索模型复用了 VLM 架构(因果 LM + 视觉编码器),参数和计算开销大。NeoMME 从头训练双向 Transformer Encoder,用 masked discrete-diffusion 目标,同时处理多语言文本和原始图像 patch。260M / 800M 两档。
意义: 非生成式检索场景(图文混合文档 RAG)的新架构候选,参数效率显著优于 ColPali 系列。若开源权重,可直接替代多语言图文检索 pipeline 中的视觉编码器。
3. SLM as Judges: 小模型做 Rubric-Based RL 评判 ⭐ Evaluation
Paper: https://arxiv.org/abs/2608.30005 | HF 1票 | 2026-08-29
Rubric-based RL 需要对每条回复按实例级标准打分,通常用 GPT-4 或 7B 以上模型做 judge,成本高。本文系统评估了 SLM(≤3B)做 rubric judge 的可靠性,构建了 PointRubric 和 RaR-Science-Static 两个带标签数据集。
意义: 对 Agent 评测有意义——若 SLM 能可靠打 rubric 分,Agent 的细粒度 reward 就无需调用贵重模型,降低训练/评测成本。
辅助参考(来自公开博客,非原始论文)
-
Vectara: Context Engineering (https://www.vectara.com/blog/context-engineering-can-you-trust-long-context) — "Context Engineering is the new prompt engineering",指出 LLM 长上下文存在被忽视的 lost-in-the-middle 脆弱性,RAG 和 Agent 应用不应盲目塞入所有上下文。实操警示价值高。
-
Databricks: Long Context RAG Performance (https://www.databricks.com/blog/long-context-rag-performance-llms) — 系统对比了 RAG(retrieve then generate)vs 纯长上下文在 200K~2M token 场景下的表现,指出 Gemini 2M 上下文在某些大海量检索任务上仍败给精筛 RAG。
候选清单(本期全部8条)
| # | 标题 | 来源 | 票/信号 | 标签 |
|---|---|---|---|---|
| 1 | WHALE: Weight-Harness Alternating LEarning | arxiv | HF 22票 | Agent, Systems |
| 2 | NeoMME: Single-Tower Multimodal Encoder | arxiv | HF 22票 | Multimodal, Systems |
| 3 | Debias-SparseGPT: Bias-Aware Pruning | arxiv | HF 2票 | Research |
| 4 | Sparse Readout Prism: Logit-Lens in Features | arxiv | HF 2票 | Research |
| 5 | SLM as Judges for Rubric-Based RL | arxiv | HF 1票 | Benchmark |
| 6 | Portfolio Risk Bounds via LM Representations | arxiv | HF 1票 | Systems |
| 7 | Zero-Data Bootstrapping for CRS | arxiv | HF 1票 | Multimodal, Systems |
| 8 | Wasserstein-Barycentric Interaction Fields | arxiv | HF 0票 | Research |
备注
- arXiv 搜索因超时/429 本期全部失败,内容全靠 HF Daily 策展覆盖;无 CSDN 来源引入。
- Substack 主动搜索未命中明确Newsletter来源,改为引用公开博客 Vectara + Databricks(均为可独立核实的技术文章,非付费Newsletter)。
- 本期缺失:Agent Memory、Tool Use、Long Context Evaluation 的专项arXiv覆盖,下一轮可尝试补充 ArXiv API 重试。
Tom 文献雷达 · 每日3次 · 轻量版 · 2026-09-04T08:40 UTC+8