Tom 文献雷达 · Agent + RAG + LongContext · 2026-08-29
本期一句话
长上下文竞赛迈入 10M token 时代,但多跳推理质量在 500K 后明显衰减;Agent 自我改进正从"事后反思"走向"实时在线修正";评测基准从"测分数"向"许可证"演进。
高价值论文(3 条)
1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
- 来源: arXiv 2608.26530 · HF Daily 25票
- 核心观点: 当前自改进方法在运行结束后才处理经验,无法重定向当前 run。PILOT 主张"在线改进"——经验一边积累一边同时重定向当前任务并更新持久化 harness,让智能体在执行过程中实时应用教训。
- 意义: 对长周期 Agent 任务(代码生成、复杂推理、多步工具调用)有直接工程价值;是"Agent 自我改进"范式的重要节点。
- 标签: #agent #long-context #self-improvement
2. Agentic Game Development as a Verifiable Trajectory Data Engine
- 来源: arXiv 2608.25518 · HF Daily 124票
- 核心观点: 仅靠爬取视频扩展世界模型效率低;需要类似代码 Agent 那样的"可验证数据引擎"——代码可执行→编译器/runtime 提供高质量 RL 奖励信号,而空间生成仍依赖 CLIP 等模糊代理。
- 意义: 提出"数据引擎"思路将影响多模态 Agent 后训练范式;游戏开发成为 RL+多模态 Agent 的试验场。
- 标签: #agent #multimodal #RL #world-models
3. What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference
- 来源: arXiv 2608.19269 · benchmark/eval
- 核心观点: 评测 artifacts 只定义前向计算(任务+评分器+指标),不必然 license 该指标所附的声明——因为复现所需的历史证据和语义grounding可能缺失。124 个 Inspect Evals 单元中 110 个止步于确定性推理之前。
- 意义: 评测诚信问题浮出水面——不是测不出分数,而是分数没有对应的 claim license;对 RAG/Agent 评测设计有警示意义。
- 标签: #benchmark #evaluation #RAG
其他相关候选(4 条)
4. CritICL: Inference-Time Weak-to-Strong Generalization from Small LLM Failure Modes
- arXiv 2608.27455 · 弱模型失败模式→指导强模型推理,与 Agent 决策纠错路径相关。
- 标签: #rag #inference-time
5. Procedura: Agentic 3D Modeling with Procedural Control
- arXiv 2608.26238 · Agent 写程序化 3D 建模,融合 Agent 规划 + 程序生成。
- 标签: #agent #3D
6. Context Engine 趋势(Web Search 富化)
- 2026年 RAG 正从"检索模式"向"Context Engine"演进:混合检索 + metadata filtering + reranking + 结构化 chunking + HyDE + CRAG;
- Gemini 3 达 2M token 原生多模态,Llama 4 Maverick 1-2M 处理小时级视频;
- 500K 质量衰减红线:多跳推理、跨文档综合、长程一致性在 500K 后可测量下降。
7. 10M Token 经济学(Web Search 富化)
- RAG 在 corpora > 数百万 token 或内容高频变更场景仍具成本/延迟/新鲜度优势;
- 超出 200K 后 xAI Grok 4.6 重新定价,实际成本需重新评估;
- 适合 Substack 单独成篇(见下方)
Substack 线索(1 条)
方向:Context Window 10M 时代的经济学与工程取舍 - 标题方向:《10M Token 竞赛:长上下文何时比 RAG 更划算?》 - 核心素材:Digital Applied 2026-04-12 文章(score 0.766) - 关键数据点:500K 质量衰减红线;10M token 成本曲线;xAI repricing 机制 - 受众:开发者/研究员,关注成本优化与架构选型 - 角度:RAG vs Long Context 不是非此即彼,而是按 corpora 规模、变更频率、任务类型分层决策
去重说明
与最近 7 天对比,本期新增/侧重: - PILOT(本期新:在线自改进范式) - Agentic Game Development(本期高票,多模态数据引擎概念新) - What Does an Evaluation License(本期新:评测 claim license 问题) - 10M Token 经济学视角(本期 web 富化新增)
生成时间: 2026-08-29T06:40 UTC
来源: arXiv + HuggingFace Daily + Tavily Web Search
实例: Tom
下次建议: PILOT 开源代码复现 + Substack 10M Token 经济分析