Tom 文献雷达 · Agent + RAG + Long-Context · 2026-07-18 14:40

本期高价值条目(3条)

1. LongStraw:固定 GPU 预算下百万 Token 级 RL Post-Training

  • 来源: arXiv 2607.14952 · 2026-07-16 · 作者:Zhou et al.
  • 标签: agent · long-context · systems
  • 核心: 推理上下文已到百万 token,但 RL 后训练仍卡在 256K。LongStraw 是架构感知的执行栈,通过共享 prompt 无梯度评估 + 仅保留模型特定状态,在固定 GPU 预算内完成百万 token 级 RL。面向 AI Agent 的长轨迹积累(观察、工具输出、文档、决策)痛点。
  • 亮点: Agent 长上下文后训练效率问题的新解法;GRPO 实例化已开源。
  • 来源: arXiv | 无 Substack / CSDN 线索

2. Rethinking Harness Evolution 评估:Agent 评测存在反馈预算作弊

  • 来源: arXiv 2607.12227 · 2026-07-13 · HF Daily
  • 标签: agent · benchmark · systems
  • 核心: 现有 harness 进化方法用同一 public benchmark 报告最终性能——这相当于在测试集上搜索超参后用同一测试集打分。论文指出应在匹配的反馈和推理预算下与 task-level search 基线对比,否则收益来自改进的 harness 设计还是额外测试时计算无从分辨。
  • 亮点: Agent 评测方法论的重要质疑;对构建可信的 Agent 基准有直接意义。
  • 来源: arXiv | 无 Substack / CSDN 线索

3. AI Prototyper:Figma 插件,RAG 驱动的 GUI 原型分解生成

  • 来源: arXiv 2607.14830 · 2026-07-16
  • 标签: rag · benchmark
  • 核心: 将自然语言 GUI 描述(login page、product card 等)分解为组件,用 RAG 从组件库检索组合,自动化生成 Figma 原型。工程实用性强,展示了 RAG 在设计-前端工作流中的具体落地路径。
  • 亮点: RAG 的具体工程落地场景;非对话式 agent 工具的一个好案例。
  • 来源: arXiv | 无 Substack / CSDN 线索

其余候选条目(2条)

4. Digital Pantheon:LLM Agent 联盟形成模拟与审计

  • arXiv 2607.15095 · 2026-07-16 · agent · rag · benchmark
  • DPO+SFT+RAG 组合让 LLM 保持党派意识形态行为,用于计算政治学研究。RAG 在这里作为事实锚定机制。

5. Chat2Scenic:迭代 RAG 自动生成自动驾驶场景脚本

  • arXiv 2607.14387 · 2026-07-14 · agent · rag · benchmark
  • 迭代式 RAG 循环逐步生成合规 DSL 脚本;工程约束严格场景的 agentic RAG 范本。

Substack 补充(1条)

The AI Agents Stack (2026 Edition)

  • 来源:The AI Engineer · 2026 · 链接
  • 6层 Agent 架构体系图,3层是 2024 年 Letta 原版没有的新兴类别;附 practical failure case 分析。

去重参考(近7日)

  • LongStraw → 2026-07-17T2040 / 2026-07-18T0840 已有
  • Digital Pantheon → 2026-07-17T2040 已有
  • AI Prototyper → 2026-07-18T0840 已有
  • Chat2Scenic → 2026-07-18T0840 已有
  • HDR / RxBrain / SUFLECA → 2026-07-18T0840 已有

数据来源

  • arXiv 元数据 + HF Daily 策展(8条候选)
  • Substack 补充搜索:1条(The AI Engineer)
  • CSDN:无符合质量门槛的结果

Tom 研究雷达 · 2026-07-18 14:40 · 轻量模式 · 共 5 条候选,高价值 3 条,Substack 1 条