Jay 工程实践筛选报告 · 2026-09-03 下午(第 2 轮)

检索范围

  • arXiv (agent testing / software repair agents / tool architecture)
  • HuggingFace Forums (production agentic systems)
  • GitHub (VoltAgent/awesome-ai-agent-papers, OpenViking)
  • Substack (Latent.Space AINews, Simon Willison)

✅ 保留条目

1. Kozuchi Agent — 开源软件修复 Agent,SWE-bench Verified #1 开源权重方案

URL: https://arxiv.org/html/2608.15579v1
来源: arXiv · Fujitsu Research
可信度: 高(企业研究,有 GitHub 复现 artifacts,官方 SWE-bench Verified 评测)
已覆盖: ❌ 本日其他报告均未提及

核心工程数据

指标 数值
SWE-bench Verified 374/500(74.8%,Qwen3.5-27B)
Multi-SWE-bench Java 41/128
基础模型 Qwen3.5-27B(无微调)
采样策略 K=8 × K=8(独立候选),selector weights wB=0.3 / wR=0.7
推理配置 2-GPU tensor parallelism,max_model_len=150000,max_new_tokens=16384

三大工程痛点(论文精炼)

Pain 1 — Tool-Grammar Drift: 各 LLM 家族(OpenAI/Anthropic)对 tool call 格式约定不同,细微语法不匹配即可导致合理 action 被拒绝并级联浪费 turn。harness 必须吸收这种多样性,不能要求每个模型集成方都 fork 代码。

Pain 2 — Multi-Cluster Heterogeneity: 任务分布在异构集群(GPU 推理/训练、VM 测试、Docker 基准评分),需要一个 runtime 跨多硬件环境工作,不能让研究员为每种硬件重写脚本。

Pain 3 — Evaluation Cost: SWE-bench 评测代价高,需要在评测成本和评测质量之间找平衡。

可复现性配置(provenance/sweep_manifest.json 记录)

backbone: Qwen/Qwen3.5-27B
K=8K=8 (8 independent candidates × 8 selector runs)
wB=0.3, wR=0.7
2-GPU tensor parallelism, 50 shards
max_model_len=150000, max_new_tokens=16384
step_limit=1000, instance_timeout=06:00:00

Harness 架构要点(贡献点): - Phase control: 显式阶段控制(区别于隐式 loop) - Persistent shared state: 跨阶段状态保持 - Deterministic tools: 工具行为确定性保证可复现 - Model-independent action formatting: 解耦模型特定的 action 格式差异 - Cross-agent test-time selection: 测试时选择最优 agent 配置

保留理由: - 工程数据具体(SWE-bench Verified 74.8%,Qwen3.5-27B 非微调) - 三个工程痛点(Tool-Grammar Drift / Multi-Cluster / Eval Cost)是真实生产经验 - 可复现性配置完整(sweep manifest 记录所有参数) - harness 设计理念(phase control + deterministic tools)对 agent 工程有直接参考价值 - 与上午报告中的 DeerFlow(字节)形成软件修复 Agent 的双方案对比(Fujitsu vs ByteDance)

建议写入路径: research-kb/published/agents/kozuchi-agent-fujitsu-swe-bench-2026.md


2. Tangent — LLM Agent 测试实践实证研究(ASE 2026)

URL: https://arxiv.org/html/2608.08413v1
来源: arXiv(ASE 2026 接收)
可信度: 高(ACM ASE 会议,实证研究)
已覆盖: ❌ 本日其他报告均未提及

核心工程数据(大规模挖掘)

维度 数值
挖掘仓库 1,190 个候选 → 324 个含 agent/tool 测试
Agent 数量 1,723 个
Tool 数量 4,111 个
有测试的仓库 209 个
中位测试 NCLOC 14 行
中位圈复杂度 1
含 fixtures/helpers 后中位 NCLOC 20 行
含 fixtures/helpers 后中位圈复杂度 3
每测试中位断言数 2 个
每测试中位构造函数调用 1 个
每测试中位库调用 4 个

关键发现

  1. 当前 agent 测试以单元测试为主,覆盖范围窄,缺乏复杂交互和真实场景
  2. 测试大量依赖 mock 和简化输入,验证层次浅
  3. 测试结构简单:中位仅 14 行有效代码,圈复杂度 1
  4. 行业实践比开源更重视非功能测试,但双方都缺乏形式化测试基础
  5. 共同缺陷:测试目标不清晰、高质量测试数据生成困难

公开数据集

  • Tangent artifact (tan, 2026):1,723 agents、4,111 tools、324 repos 的测试数据集,支持未来研究复用

保留理由: - 量化数据具体(1,723 agents,测试行数/复杂度分布),是当前稀缺的大规模 agent 测试实证研究 - 揭示了行业共识的测试缺口,对构建 agent 测试基础设施有直接指导意义 - 数据集公开可复用 - 与 OWASP Top 10 Agents(上午报告已收录)形成"测试 + 安全"的 agent 工程闭环

建议写入路径: research-kb/published/agents/tangent-ase2026-agent-testing-empirical.md


3. Tool Architecture Shapes Coding Agent Behavior(arXiv 2608.11386)

URL: https://arxiv.org/html/2608.11386v1
来源: arXiv
可信度: 高(工程实证研究)
已覆盖: ❌ 本日其他报告均未提及

研究问题

隔离 tool architecture 这一个变量对 coding agent 行为的影响,采用六种常见 tool 设计:

维度一:抽象层级 - 低层操作暴露(直接文件编辑) - 自然语言搜索接口 - 可执行代码生成(代替单步 tool call)

维度二:认知脚手架(Cognitive Scaffolding) - 记录中间推理过程的接口 - 多步推理追踪

覆盖的现有框架对比

OpenHands / Anthropic / Gao et al. / Antoniades et al. / Smolagents / Yang et al. / Code 等框架的 tool 设计均有覆盖。

保留理由: - 直接回答"tool design 对 agent 效果的影响"这一工程问题 - 六种架构有具体实现,覆盖主流框架 - 对 agent 框架选型和 tool API 设计有直接工程参考价值 - 值得作为工程验证条目记录,待读完整 PDF 获取具体实验数据

建议写入路径: research-kb/published/agents/tool-architecture-agent-behavior-arxiv-2026.md


4. Production Agentic Systems — HF Forum 工程经验

URL: https://discuss.huggingface.co/t/lessons-from-building-production-agentic-systems-what-actually-matters-beyond-the-llm/178656
来源: HuggingFace Forum
可信度: 中高(实战经验,有具体数字)
已覆盖: ❌ 本日其他报告均未提及

核心工程洞察(原文关键数据)

可靠率衰减数学:

90% per-step reliability × 5 chained steps ≈ 59% end-to-end
这是 agent 架构重要的原因:通过 validation layers、retries with modified prompts、checkpoint human intervention 来挽回可靠性,而不是靠 prompt wizardry

多 Agent vs 单 Agent:

单 well-instrumented agent + good tools 在大多数用例中击败了多 agent 原型。但对研究风格工作流,多 agent 有优势。

Rough numbers 实测: - Planner/executor splits 和 reviewer agents:协调开销吃掉了大部分收益 - 单 agent + 良好工具的组合几乎每次都胜出

与已收录条目的关联

  • 与 Kozuchi Agent(harness + phase control)共同指向"架构选择对可靠性有决定性影响"
  • 90%×5=59% 的数学是 agent 选型的核心决策依据

保留理由: - 90%×5=59% 是有工程意义的量化洞察 - 多 agent vs 单 agent 的实战对比有直接决策参考价值 - HF Forum 讨论代表 2026 年工程社区的主流认知

建议写入路径: research-kb/published/agents/production-agentic-systems-hf-forum-2026.md


❌ 丢弃条目

条目 丢弃理由
VoltAgent/awesome-ai-agent-papers (GitHub) 论文列表导航页,工程实践条目不足;各子方向已有更深度条目覆盖;本次不上报
OpenViking (ByteDance/VikingMem) 有生产 benchmark 数据(User memory 80-83% 准确率,tau2-bench +6.87pp/+11.87pp),但 VLDB 2026 论文需精读;可入下一轮精读候选
OpenAI Jalapeño (SemiAnalysis Substack, paid) 付费内容,截取信息有限;芯片工程数据不适合本研究主题范围
Latent.Space AINews (Substack, Swyx) 新闻类 newsletter,工程深度不足本次;与 09-03 上午 AI Agents Stack 2026 有重叠
Simon Willison Qwen3.8-27B 博文 本日已有 GitHub Trending minimind 项目(训练侧);Qwen3.8-27B 本地部署属模型使用层面,非工程实践核心
Cost–Utility Alignment in LLM Agent Trajectories (arXiv 2608.26195) 框架性论文,有 token cost / latency attribution 细节,但本次优先聚焦有具体可操作数据的条目
LLM Agents for Time-Series Survey (arXiv 2608.26226) 领域专项(时序),不适合通用工程知识库;架构表有参考价值但非本次核心
Externalization in LLM Agents Survey (arXiv 2604.08224) 综述性,harness/observability 讨论有工程价值但深度依赖全文;降级为精读候选

📋 本轮摘要

类别 保留数 丢弃数
Agent 软件修复(Kozuchi) 1 0
Agent 测试实证(Tangent) 1 0
Tool Architecture 实验 1 0
Production Agent 经验 1 0
综述/导航页 0 2
专项领域 0 2
付费/浅新闻 0 2
合计 4 6

🏷️ 分类标签

agent-engineering swe-bench agent-testing 实证研究 tool-design production-agents harness-engineering kozuchi tangent ase2026


📁 建议写入路径(4个文件)

  1. published/agents/kozuchi-agent-fujitsu-swe-bench-2026.md
  2. published/agents/tangent-ase2026-agent-testing-empirical.md
  3. published/agents/tool-architecture-agent-behavior-arxiv-2026.md
  4. published/agents/production-agentic-systems-hf-forum-2026.md

🔬 后续行动

  • 精读: Kozuchi Agent 全文(获取 harness 架构图和 phase control 伪代码);Tangent PDF(获取测试框架分布和 mock 使用模式)
  • 交叉参考: Kozuchi + Tangent(Kozuchi 的 deterministic tools 实践是否回应了 Tangent 发现的测试缺口)
  • 主题页更新: agent-engineering 主题页建议增补 Kozuchi(T1)和 Tangent(T2)

📌 与上午报告(09-03T1050)的关联与去重

  • ✅ Kozuchi vs DeerFlow:均为软件修复 Agent,Fujitsu vs ByteDance 对比有参考价值
  • ✅ Tangent vs OWASP Top 10:测试工程 + 安全工程共同构成 agent 质量基础设施
  • ✅ Tool Architecture vs AI Agents Stack 2026:Stack 2026 提供了生产系统分层视角,本文提供 tool design 实证

Jay · 2026-09-03T14:50 · 工程实践筛选第 4 轮