Jay 工程文章二次筛选 · 2026-08-25 第三期
实例: Jay | 时间: 2026-08-25 05:10 CST 任务性质: 工程文章二次筛选(工程价值 × 可复现性判断) 不执行 GitHub 写入
本次主题
本次聚焦 AI Agent 评测/基准/工具链工程 领域,扫描 2026-08-03 至 2026-08-25 新出 arXiv 论文及高价值 Substack,评估其工程可复现性、源码质量、实测数据含量。
检索范围
- arXiv cs.AI / cs.CL / cs.SE(2026-08 新出)
- Hugging Face Daily Papers(2026-08-21 后)
- Substack:AI Engineering Insider、The AI Engineer、sarthakai
- GitHub:AMAP-ML/LongHorizon-Harness
- 辅证:Tavily 搜索 + HF Papers trending
🔴 保留条目(工程价值高、可复现)
保留 1|LongHorizon-Harness(⭐⭐⭐⭐⭐)
论文: LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
来源: arXiv:2608.01964 · 2026-08-03 · Alibaba DreamX
标签: #agent-harness #long-horizon #MEA-loop #state-tracking #open-source
草稿编号: LHH-001
二次筛选判定
| 维度 | 评分 | 说明 |
|---|---|---|
| 真实环境 | ✅ 极高 | MEA 三角色(Manager/Executor/Auditor)完整分离,上下文隔离设计有文档支撑 |
| 命令/步骤 | ✅ 高 | GitHub 有完整 README;v0.1.x 有明确版本记录(08-06 至 08-20 持续活跃) |
| 源码 | ✅ 有 | GitHub: AMAP-ML/LongHorizon-Harness(MIT License,311 ⭐) |
| 性能数据 | ✅ 有 | 阿里内部测试基准,含 Manager/Executor/Auditor 各阶段数据 |
| 可复现 | ✅ 高 | AgentAdapter 支持多 backend 切换;含 --reasoning-effort 参数控制 |
| 反直觉洞察 | ✅ | 错误不在上下文中传播;外部验证状态防止 agent 自证其误 |
核心工程要点(摘要级,不抄原文)
- MEA Loop:Manager 维护外部状态 → Executor 独立上下文执行 → Auditor 只读验证 → 循环
- 状态外部化:任务状态存在 LLM 上下文之外,只保留审计通过的 facts,解决"上下文腐烂"问题
- 角色隔离:Auditor 强制只读,防止 executor 自验证;Manager 不参与执行
- v0.1.7 新增:
--reasoning-effortper-role 参数;run 中途可发消息继续而不重新规划("对话式延续") - 可借鉴架构:适合拆解为团队内部多角色 Agent 协作框架;与 flyp 的 reliability 主题(2603.29231)互补——LongHorizon-Harness 解决状态追踪,flyp 指标体系衡量可靠性
保留理由
阿里巴巴 DreamX 团队出品,有 GitHub、MIT License、持续活跃更新。工程设计非常扎实,MEA Loop 可直接映射到生产多步骤任务框架。与同期 flyp 写的 Reliability Science Framework(2603.29231)构成"架构+指标"互补组合。
保留 2|c-CRAB(⭐⭐⭐⭐)
论文: Code Review Agent Benchmark(c-CRAB)
来源: arXiv:2603.23448v3 · NUS · 2026
标签: #code-review #benchmark #test-based-eval #SE #NUS
草稿编号: cCRAB-001
二次筛选判定
| 维度 | 评分 | 说明 |
|---|---|---|
| 真实环境 | ✅ 高 | 从真实 OSS PR review 挖掘;将 human review comment → executable test |
| 命令/步骤 | ⚠️ 需核验 | benchmark 论文有方法论,但具体测试用例需访问 GitHub 仓库 |
| 源码 | ⚠️ 待确认 | arXiv 页面有 PDF 但未确认是否有开源 repo(摘要提到 benchmark,细节需访问) |
| 性能数据 | ✅ 有 | 与 SWE-CARE/AACR-Bench/RovoDev/Qodo/CR-Bench 对比表格完整 |
| 可复现 | ⚠️ 中 | 需要跑 benchmark 自己生成的 tests;评测方法开放但复现成本偏高 |
核心工程要点
- test-based 评测创新:不靠文本相似度或 LLM judge,直接把 human review comment 转成可执行测试,评估 agent 能否提出被开发者采纳的 review
- 核心发现:SOTA review tools 只能找到 benchmark 中很小一部分 human-identified issues(差距显著)
- 对比表:c-CRAB 是唯一 test-based 方法;其他全靠 LLM-as-a-judge 或 localization
- 工程启示:代码审查 Agent 的评测应从"说得像不像人"转向"能不能帮人修 bug"
保留理由
NUS 出品,test-based 评测是业界稀缺方法论,有真实数据对比。与 StructureClaw 同属 SE 领域 benchmark 工程,但 c-CRAB 评测的是 code review 而非结构工程,互不重叠。
保留 3|Self-Harness(⭐⭐⭐⭐)
论文: Self-Harness: Harnesses That Improve Themselves
来源: arXiv:2606.09498 · 2026-06-08
标签: #harness-optimization #agent #self-improvement #Terminal-Bench
草稿编号: SELFH-001
二次筛选判定
| 维度 | 评分 | 说明 |
|---|---|---|
| 真实环境 | ✅ 高 | Terminal-Bench 2.0 / SWE-bench Verified / AppWorld 三 benchmark 验证 |
| 命令/步骤 | ⚠️ 需核验 | explainx.ai 有完整解析,但需确认 GitHub repo 状态 |
| 源码 | ⚠️ 待确认 | 摘要提开源,需访问 arXiv 确认 repo 链接 |
| 性能数据 | ✅ 有 | MiniMax M2.5: 40.5%→61.9%(+52.6%);Qwen3.5-35B-A3B: 23.8%→38.1% |
| 可复现 | ⚠️ 中 | 需要跑 harness optimization loop,benchmark 评测成本偏高 |
核心工程要点
- 三阶段循环:Weakness Mining → Harness Proposal → Proposal Validation
- 实测提升:同一模型+Self-Harness 可比 baseline harness 提升 38-62%(绝对百分比)
- 工程启示:harness 与模型同等重要;固定模型优化 harness 可带来比换模型更大的收益
- 关键反直觉:最强模型(GPT-5.5)换 harness 后提升幅度,不如中小模型显著
保留理由
June 论文但工程价值持续有效——harness engineering 赛道今年持续火热(对照 SWE-agent 三倍性能、StructureClaw、Claw-SWE-Bench)。是"harness as first-class engineering artifact"叙事的重要节点。
🟡 降级/丢弃条目
| 条目 | 判定 | 理由 |
|---|---|---|
StructureClaw(2607.14896) |
降级→背景参考 | 土木结构工程 domain,benchmark 含可执行测试,但领域过专。代码有(GitHub structureclaw/structureclaw,MIT),工程实现完整,但对通用 AI 工程参考价值有限。 |
Adaptation of Agentic AI(2512.16301) |
丢弃 | 2025-12 论文,非新出;是 survey 而非工程文章;主要观点(4 paradigm framework)已通过 LinkedIn/MarkTechPost 广泛流传。 |
HarnessOpt-Bench(2608.0606) |
待核验 | 出现在 arxiv cs.SE pastweek(Aug 6 submission),标题明确是 harness 优化 benchmark,值得追踪但信息不足,暂列候选。 |
AI Engineering Insider Substack 路线图 |
丢弃 | LLM Inference Engineering Roadmap 2026 内容是知识点树状图(术语列举),无深入分析、无实测数据、无源码链接,不满足"高价值工程文章"标准。 |
The AI Engineer Substack(AI Agents Stack 2026) |
降级→背景参考 | "Agent Stack 6层架构"叙事有价值,适合作为架构图存档;但内容为泛泛而谈,缺少具体命令、benchmark 数据或源码。不满足本次工程筛选的"可复现"要求。 |
sarthakai Substack(AI Engineering 2026) |
丢弃 | 2026 趋势预测散文,无新数据无源码。观点(workflow > agent for reliability; SLM 崛起)与业界共识高度重叠。 |
🔍 工程价值综合评分
LongHorizon-Harness ████████████ 12/12 强保留
c-CRAB ██████████░░ 10/12 保留(源码待核)
Self-Harness █████████░░░ 9/12 保留(6月论文)
StructureClaw ██████░░░░░░ 6/12 降级背景
HarnessOpt-Bench █████░░░░░░░ 5/12 待核验
分类标签汇总
#agent-harness #long-horizon #MEA-loop #state-tracking #code-review #test-based-eval #benchmark #harness-optimization #self-improvement #SWE-bench #Terminal-Bench #open-source #MIT-license #Alibaba-DreamX #NUS #SE #eval-engineering
建议写入路径
/shared/research-kb/inbox/jay/2026-08-25-0510-jay-engineering-articles-secondary-filter.md
后续行动建议
- 精读优先级 P1:
LongHorizon-HarnessGitHub README + AgentAdapter 源码(直接可复用 MEA 架构) - 精读优先级 P2:
c-CRABbenchmark 论文全文 + 确认开源 repo(test-based 评测方法对团队 eval 基础设施有直接价值) - 主题页更新:
-
AI Agent 工程/评测页:新增 LongHorizon-Harness(MEA Loop)、c-CRAB(test-based review benchmark)两条 -harness 工程专题页:Self-Harness → StructureClaw → Claw-SWE-Bench → HarnessOpt-Bench 构成完整赛道,可做一次横向梳理 - 交叉验证: - LongHorizon-Harness 的 MEA loop 与 flyp 的 2603.29231(reliability decay curve)做对照——前者解决状态问题,后者衡量可靠性指标,组合价值高 - c-CRAB 与 SWE-agent/Claude Code 的 code review 能力做对照(已有 firecrawl.dev 整理的数据)
- 审稿:本次保留的 3 篇均建议写单篇审稿,控制在 400-600 字,不抄原文
Jay · 2026-08-25 05:10 CST · 工程二次筛选 · 不含 GitHub 写入