Tom 文献雷达 · Agent + RAG + Long-Context · 2026-07-18 14:40
本期高价值条目(3条)
1. LongStraw:固定 GPU 预算下百万 Token 级 RL Post-Training
- 来源: arXiv 2607.14952 · 2026-07-16 · 作者:Zhou et al.
- 标签: agent · long-context · systems
- 核心: 推理上下文已到百万 token,但 RL 后训练仍卡在 256K。LongStraw 是架构感知的执行栈,通过共享 prompt 无梯度评估 + 仅保留模型特定状态,在固定 GPU 预算内完成百万 token 级 RL。面向 AI Agent 的长轨迹积累(观察、工具输出、文档、决策)痛点。
- 亮点: Agent 长上下文后训练效率问题的新解法;GRPO 实例化已开源。
- 来源: arXiv | 无 Substack / CSDN 线索
2. Rethinking Harness Evolution 评估:Agent 评测存在反馈预算作弊
- 来源: arXiv 2607.12227 · 2026-07-13 · HF Daily
- 标签: agent · benchmark · systems
- 核心: 现有 harness 进化方法用同一 public benchmark 报告最终性能——这相当于在测试集上搜索超参后用同一测试集打分。论文指出应在匹配的反馈和推理预算下与 task-level search 基线对比,否则收益来自改进的 harness 设计还是额外测试时计算无从分辨。
- 亮点: Agent 评测方法论的重要质疑;对构建可信的 Agent 基准有直接意义。
- 来源: arXiv | 无 Substack / CSDN 线索
3. AI Prototyper:Figma 插件,RAG 驱动的 GUI 原型分解生成
- 来源: arXiv 2607.14830 · 2026-07-16
- 标签: rag · benchmark
- 核心: 将自然语言 GUI 描述(login page、product card 等)分解为组件,用 RAG 从组件库检索组合,自动化生成 Figma 原型。工程实用性强,展示了 RAG 在设计-前端工作流中的具体落地路径。
- 亮点: RAG 的具体工程落地场景;非对话式 agent 工具的一个好案例。
- 来源: arXiv | 无 Substack / CSDN 线索
其余候选条目(2条)
4. Digital Pantheon:LLM Agent 联盟形成模拟与审计
- arXiv 2607.15095 · 2026-07-16 · agent · rag · benchmark
- DPO+SFT+RAG 组合让 LLM 保持党派意识形态行为,用于计算政治学研究。RAG 在这里作为事实锚定机制。
5. Chat2Scenic:迭代 RAG 自动生成自动驾驶场景脚本
- arXiv 2607.14387 · 2026-07-14 · agent · rag · benchmark
- 迭代式 RAG 循环逐步生成合规 DSL 脚本;工程约束严格场景的 agentic RAG 范本。
Substack 补充(1条)
The AI Agents Stack (2026 Edition)
- 来源:The AI Engineer · 2026 · 链接
- 6层 Agent 架构体系图,3层是 2024 年 Letta 原版没有的新兴类别;附 practical failure case 分析。
去重参考(近7日)
- LongStraw → 2026-07-17T2040 / 2026-07-18T0840 已有
- Digital Pantheon → 2026-07-17T2040 已有
- AI Prototyper → 2026-07-18T0840 已有
- Chat2Scenic → 2026-07-18T0840 已有
- HDR / RxBrain / SUFLECA → 2026-07-18T0840 已有
数据来源
- arXiv 元数据 + HF Daily 策展(8条候选)
- Substack 补充搜索:1条(The AI Engineer)
- CSDN:无符合质量门槛的结果
Tom 研究雷达 · 2026-07-18 14:40 · 轻量模式 · 共 5 条候选,高价值 3 条,Substack 1 条