Jay 工程文章二次筛选 · 2026-08-25 第三期

实例: Jay | 时间: 2026-08-25 05:10 CST 任务性质: 工程文章二次筛选(工程价值 × 可复现性判断) 不执行 GitHub 写入


本次主题

本次聚焦 AI Agent 评测/基准/工具链工程 领域,扫描 2026-08-03 至 2026-08-25 新出 arXiv 论文及高价值 Substack,评估其工程可复现性、源码质量、实测数据含量。


检索范围

  • arXiv cs.AI / cs.CL / cs.SE(2026-08 新出)
  • Hugging Face Daily Papers(2026-08-21 后)
  • Substack:AI Engineering Insider、The AI Engineer、sarthakai
  • GitHub:AMAP-ML/LongHorizon-Harness
  • 辅证:Tavily 搜索 + HF Papers trending

🔴 保留条目(工程价值高、可复现)


保留 1|LongHorizon-Harness(⭐⭐⭐⭐⭐)

论文: LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks 来源: arXiv:2608.01964 · 2026-08-03 · Alibaba DreamX 标签: #agent-harness #long-horizon #MEA-loop #state-tracking #open-source 草稿编号: LHH-001

二次筛选判定

维度 评分 说明
真实环境 ✅ 极高 MEA 三角色(Manager/Executor/Auditor)完整分离,上下文隔离设计有文档支撑
命令/步骤 ✅ 高 GitHub 有完整 README;v0.1.x 有明确版本记录(08-06 至 08-20 持续活跃)
源码 ✅ 有 GitHub: AMAP-ML/LongHorizon-Harness(MIT License,311 ⭐)
性能数据 ✅ 有 阿里内部测试基准,含 Manager/Executor/Auditor 各阶段数据
可复现 ✅ 高 AgentAdapter 支持多 backend 切换;含 --reasoning-effort 参数控制
反直觉洞察 错误不在上下文中传播;外部验证状态防止 agent 自证其误

核心工程要点(摘要级,不抄原文)

  • MEA Loop:Manager 维护外部状态 → Executor 独立上下文执行 → Auditor 只读验证 → 循环
  • 状态外部化:任务状态存在 LLM 上下文之外,只保留审计通过的 facts,解决"上下文腐烂"问题
  • 角色隔离:Auditor 强制只读,防止 executor 自验证;Manager 不参与执行
  • v0.1.7 新增--reasoning-effort per-role 参数;run 中途可发消息继续而不重新规划("对话式延续")
  • 可借鉴架构:适合拆解为团队内部多角色 Agent 协作框架;与 flyp 的 reliability 主题(2603.29231)互补——LongHorizon-Harness 解决状态追踪,flyp 指标体系衡量可靠性

保留理由

阿里巴巴 DreamX 团队出品,有 GitHub、MIT License、持续活跃更新。工程设计非常扎实,MEA Loop 可直接映射到生产多步骤任务框架。与同期 flyp 写的 Reliability Science Framework(2603.29231)构成"架构+指标"互补组合。


保留 2|c-CRAB(⭐⭐⭐⭐)

论文: Code Review Agent Benchmark(c-CRAB) 来源: arXiv:2603.23448v3 · NUS · 2026 标签: #code-review #benchmark #test-based-eval #SE #NUS 草稿编号: cCRAB-001

二次筛选判定

维度 评分 说明
真实环境 ✅ 高 从真实 OSS PR review 挖掘;将 human review comment → executable test
命令/步骤 ⚠️ 需核验 benchmark 论文有方法论,但具体测试用例需访问 GitHub 仓库
源码 ⚠️ 待确认 arXiv 页面有 PDF 但未确认是否有开源 repo(摘要提到 benchmark,细节需访问)
性能数据 ✅ 有 与 SWE-CARE/AACR-Bench/RovoDev/Qodo/CR-Bench 对比表格完整
可复现 ⚠️ 中 需要跑 benchmark 自己生成的 tests;评测方法开放但复现成本偏高

核心工程要点

  • test-based 评测创新:不靠文本相似度或 LLM judge,直接把 human review comment 转成可执行测试,评估 agent 能否提出被开发者采纳的 review
  • 核心发现:SOTA review tools 只能找到 benchmark 中很小一部分 human-identified issues(差距显著)
  • 对比表:c-CRAB 是唯一 test-based 方法;其他全靠 LLM-as-a-judge 或 localization
  • 工程启示:代码审查 Agent 的评测应从"说得像不像人"转向"能不能帮人修 bug"

保留理由

NUS 出品,test-based 评测是业界稀缺方法论,有真实数据对比。与 StructureClaw 同属 SE 领域 benchmark 工程,但 c-CRAB 评测的是 code review 而非结构工程,互不重叠。


保留 3|Self-Harness(⭐⭐⭐⭐)

论文: Self-Harness: Harnesses That Improve Themselves 来源: arXiv:2606.09498 · 2026-06-08 标签: #harness-optimization #agent #self-improvement #Terminal-Bench 草稿编号: SELFH-001

二次筛选判定

维度 评分 说明
真实环境 ✅ 高 Terminal-Bench 2.0 / SWE-bench Verified / AppWorld 三 benchmark 验证
命令/步骤 ⚠️ 需核验 explainx.ai 有完整解析,但需确认 GitHub repo 状态
源码 ⚠️ 待确认 摘要提开源,需访问 arXiv 确认 repo 链接
性能数据 ✅ 有 MiniMax M2.5: 40.5%→61.9%(+52.6%);Qwen3.5-35B-A3B: 23.8%→38.1%
可复现 ⚠️ 中 需要跑 harness optimization loop,benchmark 评测成本偏高

核心工程要点

  • 三阶段循环:Weakness Mining → Harness Proposal → Proposal Validation
  • 实测提升:同一模型+Self-Harness 可比 baseline harness 提升 38-62%(绝对百分比)
  • 工程启示:harness 与模型同等重要;固定模型优化 harness 可带来比换模型更大的收益
  • 关键反直觉:最强模型(GPT-5.5)换 harness 后提升幅度,不如中小模型显著

保留理由

June 论文但工程价值持续有效——harness engineering 赛道今年持续火热(对照 SWE-agent 三倍性能、StructureClaw、Claw-SWE-Bench)。是"harness as first-class engineering artifact"叙事的重要节点。


🟡 降级/丢弃条目

条目 判定 理由
StructureClaw(2607.14896) 降级→背景参考 土木结构工程 domain,benchmark 含可执行测试,但领域过专。代码有(GitHub structureclaw/structureclaw,MIT),工程实现完整,但对通用 AI 工程参考价值有限。
Adaptation of Agentic AI(2512.16301) 丢弃 2025-12 论文,非新出;是 survey 而非工程文章;主要观点(4 paradigm framework)已通过 LinkedIn/MarkTechPost 广泛流传。
HarnessOpt-Bench(2608.0606) 待核验 出现在 arxiv cs.SE pastweek(Aug 6 submission),标题明确是 harness 优化 benchmark,值得追踪但信息不足,暂列候选。
AI Engineering Insider Substack 路线图 丢弃 LLM Inference Engineering Roadmap 2026 内容是知识点树状图(术语列举),无深入分析、无实测数据、无源码链接,不满足"高价值工程文章"标准。
The AI Engineer Substack(AI Agents Stack 2026) 降级→背景参考 "Agent Stack 6层架构"叙事有价值,适合作为架构图存档;但内容为泛泛而谈,缺少具体命令、benchmark 数据或源码。不满足本次工程筛选的"可复现"要求。
sarthakai Substack(AI Engineering 2026) 丢弃 2026 趋势预测散文,无新数据无源码。观点(workflow > agent for reliability; SLM 崛起)与业界共识高度重叠。

🔍 工程价值综合评分

LongHorizon-Harness  ████████████  12/12  强保留
c-CRAB               ██████████░░  10/12  保留(源码待核)
Self-Harness         █████████░░░   9/12  保留(6月论文)
StructureClaw        ██████░░░░░░   6/12  降级背景
HarnessOpt-Bench     █████░░░░░░░   5/12  待核验

分类标签汇总

#agent-harness #long-horizon #MEA-loop #state-tracking #code-review #test-based-eval #benchmark #harness-optimization #self-improvement #SWE-bench #Terminal-Bench #open-source #MIT-license #Alibaba-DreamX #NUS #SE #eval-engineering


建议写入路径

/shared/research-kb/inbox/jay/2026-08-25-0510-jay-engineering-articles-secondary-filter.md

后续行动建议

  1. 精读优先级 P1LongHorizon-Harness GitHub README + AgentAdapter 源码(直接可复用 MEA 架构)
  2. 精读优先级 P2c-CRAB benchmark 论文全文 + 确认开源 repo(test-based 评测方法对团队 eval 基础设施有直接价值)
  3. 主题页更新: - AI Agent 工程/评测 页:新增 LongHorizon-Harness(MEA Loop)、c-CRAB(test-based review benchmark)两条 - harness 工程 专题页:Self-Harness → StructureClaw → Claw-SWE-Bench → HarnessOpt-Bench 构成完整赛道,可做一次横向梳理
  4. 交叉验证: - LongHorizon-Harness 的 MEA loop 与 flyp 的 2603.29231(reliability decay curve)做对照——前者解决状态问题,后者衡量可靠性指标,组合价值高 - c-CRAB 与 SWE-agent/Claude Code 的 code review 能力做对照(已有 firecrawl.dev 整理的数据)
  5. 审稿:本次保留的 3 篇均建议写单篇审稿,控制在 400-600 字,不抄原文

Jay · 2026-08-25 05:10 CST · 工程二次筛选 · 不含 GitHub 写入