Jay 工程实践筛选报告 · 2026-09-03 下午(第 2 轮)
检索范围
- arXiv (agent testing / software repair agents / tool architecture)
- HuggingFace Forums (production agentic systems)
- GitHub (VoltAgent/awesome-ai-agent-papers, OpenViking)
- Substack (Latent.Space AINews, Simon Willison)
✅ 保留条目
1. Kozuchi Agent — 开源软件修复 Agent,SWE-bench Verified #1 开源权重方案
URL: https://arxiv.org/html/2608.15579v1
来源: arXiv · Fujitsu Research
可信度: 高(企业研究,有 GitHub 复现 artifacts,官方 SWE-bench Verified 评测)
已覆盖: ❌ 本日其他报告均未提及
核心工程数据
| 指标 | 数值 |
|---|---|
| SWE-bench Verified | 374/500(74.8%,Qwen3.5-27B) |
| Multi-SWE-bench Java | 41/128 |
| 基础模型 | Qwen3.5-27B(无微调) |
| 采样策略 | K=8 × K=8(独立候选),selector weights wB=0.3 / wR=0.7 |
| 推理配置 | 2-GPU tensor parallelism,max_model_len=150000,max_new_tokens=16384 |
三大工程痛点(论文精炼)
Pain 1 — Tool-Grammar Drift: 各 LLM 家族(OpenAI/Anthropic)对 tool call 格式约定不同,细微语法不匹配即可导致合理 action 被拒绝并级联浪费 turn。harness 必须吸收这种多样性,不能要求每个模型集成方都 fork 代码。
Pain 2 — Multi-Cluster Heterogeneity: 任务分布在异构集群(GPU 推理/训练、VM 测试、Docker 基准评分),需要一个 runtime 跨多硬件环境工作,不能让研究员为每种硬件重写脚本。
Pain 3 — Evaluation Cost: SWE-bench 评测代价高,需要在评测成本和评测质量之间找平衡。
可复现性配置(provenance/sweep_manifest.json 记录)
backbone: Qwen/Qwen3.5-27B
K=8K=8 (8 independent candidates × 8 selector runs)
wB=0.3, wR=0.7
2-GPU tensor parallelism, 50 shards
max_model_len=150000, max_new_tokens=16384
step_limit=1000, instance_timeout=06:00:00
Harness 架构要点(贡献点): - Phase control: 显式阶段控制(区别于隐式 loop) - Persistent shared state: 跨阶段状态保持 - Deterministic tools: 工具行为确定性保证可复现 - Model-independent action formatting: 解耦模型特定的 action 格式差异 - Cross-agent test-time selection: 测试时选择最优 agent 配置
保留理由: - 工程数据具体(SWE-bench Verified 74.8%,Qwen3.5-27B 非微调) - 三个工程痛点(Tool-Grammar Drift / Multi-Cluster / Eval Cost)是真实生产经验 - 可复现性配置完整(sweep manifest 记录所有参数) - harness 设计理念(phase control + deterministic tools)对 agent 工程有直接参考价值 - 与上午报告中的 DeerFlow(字节)形成软件修复 Agent 的双方案对比(Fujitsu vs ByteDance)
建议写入路径: research-kb/published/agents/kozuchi-agent-fujitsu-swe-bench-2026.md
2. Tangent — LLM Agent 测试实践实证研究(ASE 2026)
URL: https://arxiv.org/html/2608.08413v1
来源: arXiv(ASE 2026 接收)
可信度: 高(ACM ASE 会议,实证研究)
已覆盖: ❌ 本日其他报告均未提及
核心工程数据(大规模挖掘)
| 维度 | 数值 |
|---|---|
| 挖掘仓库 | 1,190 个候选 → 324 个含 agent/tool 测试 |
| Agent 数量 | 1,723 个 |
| Tool 数量 | 4,111 个 |
| 有测试的仓库 | 209 个 |
| 中位测试 NCLOC | 14 行 |
| 中位圈复杂度 | 1 |
| 含 fixtures/helpers 后中位 NCLOC | 20 行 |
| 含 fixtures/helpers 后中位圈复杂度 | 3 |
| 每测试中位断言数 | 2 个 |
| 每测试中位构造函数调用 | 1 个 |
| 每测试中位库调用 | 4 个 |
关键发现
- 当前 agent 测试以单元测试为主,覆盖范围窄,缺乏复杂交互和真实场景
- 测试大量依赖 mock 和简化输入,验证层次浅
- 测试结构简单:中位仅 14 行有效代码,圈复杂度 1
- 行业实践比开源更重视非功能测试,但双方都缺乏形式化测试基础
- 共同缺陷:测试目标不清晰、高质量测试数据生成困难
公开数据集
- Tangent artifact (tan, 2026):1,723 agents、4,111 tools、324 repos 的测试数据集,支持未来研究复用
保留理由: - 量化数据具体(1,723 agents,测试行数/复杂度分布),是当前稀缺的大规模 agent 测试实证研究 - 揭示了行业共识的测试缺口,对构建 agent 测试基础设施有直接指导意义 - 数据集公开可复用 - 与 OWASP Top 10 Agents(上午报告已收录)形成"测试 + 安全"的 agent 工程闭环
建议写入路径: research-kb/published/agents/tangent-ase2026-agent-testing-empirical.md
3. Tool Architecture Shapes Coding Agent Behavior(arXiv 2608.11386)
URL: https://arxiv.org/html/2608.11386v1
来源: arXiv
可信度: 高(工程实证研究)
已覆盖: ❌ 本日其他报告均未提及
研究问题
隔离 tool architecture 这一个变量对 coding agent 行为的影响,采用六种常见 tool 设计:
维度一:抽象层级 - 低层操作暴露(直接文件编辑) - 自然语言搜索接口 - 可执行代码生成(代替单步 tool call)
维度二:认知脚手架(Cognitive Scaffolding) - 记录中间推理过程的接口 - 多步推理追踪
覆盖的现有框架对比
OpenHands / Anthropic / Gao et al. / Antoniades et al. / Smolagents / Yang et al. / Code 等框架的 tool 设计均有覆盖。
保留理由: - 直接回答"tool design 对 agent 效果的影响"这一工程问题 - 六种架构有具体实现,覆盖主流框架 - 对 agent 框架选型和 tool API 设计有直接工程参考价值 - 值得作为工程验证条目记录,待读完整 PDF 获取具体实验数据
建议写入路径: research-kb/published/agents/tool-architecture-agent-behavior-arxiv-2026.md
4. Production Agentic Systems — HF Forum 工程经验
URL: https://discuss.huggingface.co/t/lessons-from-building-production-agentic-systems-what-actually-matters-beyond-the-llm/178656
来源: HuggingFace Forum
可信度: 中高(实战经验,有具体数字)
已覆盖: ❌ 本日其他报告均未提及
核心工程洞察(原文关键数据)
可靠率衰减数学:
90% per-step reliability × 5 chained steps ≈ 59% end-to-end
这是 agent 架构重要的原因:通过 validation layers、retries with modified prompts、checkpoint human intervention 来挽回可靠性,而不是靠 prompt wizardry
多 Agent vs 单 Agent:
单 well-instrumented agent + good tools 在大多数用例中击败了多 agent 原型。但对研究风格工作流,多 agent 有优势。
Rough numbers 实测: - Planner/executor splits 和 reviewer agents:协调开销吃掉了大部分收益 - 单 agent + 良好工具的组合几乎每次都胜出
与已收录条目的关联
- 与 Kozuchi Agent(harness + phase control)共同指向"架构选择对可靠性有决定性影响"
- 90%×5=59% 的数学是 agent 选型的核心决策依据
保留理由: - 90%×5=59% 是有工程意义的量化洞察 - 多 agent vs 单 agent 的实战对比有直接决策参考价值 - HF Forum 讨论代表 2026 年工程社区的主流认知
建议写入路径: research-kb/published/agents/production-agentic-systems-hf-forum-2026.md
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| VoltAgent/awesome-ai-agent-papers (GitHub) | 论文列表导航页,工程实践条目不足;各子方向已有更深度条目覆盖;本次不上报 |
| OpenViking (ByteDance/VikingMem) | 有生产 benchmark 数据(User memory 80-83% 准确率,tau2-bench +6.87pp/+11.87pp),但 VLDB 2026 论文需精读;可入下一轮精读候选 |
| OpenAI Jalapeño (SemiAnalysis Substack, paid) | 付费内容,截取信息有限;芯片工程数据不适合本研究主题范围 |
| Latent.Space AINews (Substack, Swyx) | 新闻类 newsletter,工程深度不足本次;与 09-03 上午 AI Agents Stack 2026 有重叠 |
| Simon Willison Qwen3.8-27B 博文 | 本日已有 GitHub Trending minimind 项目(训练侧);Qwen3.8-27B 本地部署属模型使用层面,非工程实践核心 |
| Cost–Utility Alignment in LLM Agent Trajectories (arXiv 2608.26195) | 框架性论文,有 token cost / latency attribution 细节,但本次优先聚焦有具体可操作数据的条目 |
| LLM Agents for Time-Series Survey (arXiv 2608.26226) | 领域专项(时序),不适合通用工程知识库;架构表有参考价值但非本次核心 |
| Externalization in LLM Agents Survey (arXiv 2604.08224) | 综述性,harness/observability 讨论有工程价值但深度依赖全文;降级为精读候选 |
📋 本轮摘要
| 类别 | 保留数 | 丢弃数 |
|---|---|---|
| Agent 软件修复(Kozuchi) | 1 | 0 |
| Agent 测试实证(Tangent) | 1 | 0 |
| Tool Architecture 实验 | 1 | 0 |
| Production Agent 经验 | 1 | 0 |
| 综述/导航页 | 0 | 2 |
| 专项领域 | 0 | 2 |
| 付费/浅新闻 | 0 | 2 |
| 合计 | 4 | 6 |
🏷️ 分类标签
agent-engineering swe-bench agent-testing 实证研究 tool-design production-agents harness-engineering kozuchi tangent ase2026
📁 建议写入路径(4个文件)
published/agents/kozuchi-agent-fujitsu-swe-bench-2026.mdpublished/agents/tangent-ase2026-agent-testing-empirical.mdpublished/agents/tool-architecture-agent-behavior-arxiv-2026.mdpublished/agents/production-agentic-systems-hf-forum-2026.md
🔬 后续行动
- 精读: Kozuchi Agent 全文(获取 harness 架构图和 phase control 伪代码);Tangent PDF(获取测试框架分布和 mock 使用模式)
- 交叉参考: Kozuchi + Tangent(Kozuchi 的 deterministic tools 实践是否回应了 Tangent 发现的测试缺口)
- 主题页更新:
agent-engineering主题页建议增补 Kozuchi(T1)和 Tangent(T2)
📌 与上午报告(09-03T1050)的关联与去重
- ✅ Kozuchi vs DeerFlow:均为软件修复 Agent,Fujitsu vs ByteDance 对比有参考价值
- ✅ Tangent vs OWASP Top 10:测试工程 + 安全工程共同构成 agent 质量基础设施
- ✅ Tool Architecture vs AI Agents Stack 2026:Stack 2026 提供了生产系统分层视角,本文提供 tool design 实证
Jay · 2026-09-03T14:50 · 工程实践筛选第 4 轮