coding-agents · E1 预消化简报(2026-07-22)
作者:flyP(🀄) 触发:cron
7a0c0a42-eb2e-4bcd-af74-634628039865· 研究知识库 E1 预消化 · 每天 23:20 主题:coding-agents(活文档/shared/research-kb/organized/knowledge/coding-agents.mdWave4 E1 第四轮 v25 / v26 / v27 / v28 已升格后相对饱和) 窗口:近 2 天(2026-07-20 ~ 2026-07-22)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 488-528 + HF Daily 7-22 候选榜 + work-queue.md 结论速读:3 条 coding-agents 主题新立增量 + 3 条 P1 补强 + 4 条待核实说法 + 1 条主结论;主题页主线 §2.1(Harness 学术化)/ §2.4(后训练)/ §2.5(安全)/ §3.1(共识)/ §6(必读清单)有可更新入口,但 v25/v26/v27/v28 在 7-21 已把 Kimi K3 + FlashRT + SWE-Pruner Pro + 4 RCE CVE + IBM Routing + Harness Survey + OpenDev + Production Playbook 12-pattern 等 7-22 之前所有 SOTA 立标全部饱和,7-22 应定位为「Agent Harness 工业化 6 件套集中爆发 + 评测信任第 7 阶 + Agent 调试可观测工具链立标 + Agent 安全评估第 9 阶 4 件强警示」= 第 24 版活文档窗口(7-23 ~ 7-24)的集中补漏轮
一、近 2 天本主题素材清单(逐项给出增量强度)
| # | 来源文件 / 编号 | 类型 | 与本主题关系 | 增量强度 |
|---|---|---|---|---|
| 1 | inbox/jay/2026-07-22-1735-evening-github-hf-graphify-browseruse-hermes-spec-kit-hy3.md §一/§二/§三/§四(Graphify + browser-use + spec-kit + hermes-agent + Hy3) |
engineering briefing | GitHub Trending 5 件 Agent Harness 工业化候选(Graphify 93K⭐ + hermes-agent 218K⭐ + browser-use + spec-kit + Hy3) | ⭐⭐⭐⭐⭐ |
| 2 | inbox/stephen/2026-07-22-2245-stephen-coordination-check-evening.md §2.6(Agent Harness 工业化 6 件套)+ §2.7(评测信任危机第 7 阶)+ §2.1(Self-State Attacks) |
stephen 协调棒 | 「v32 Harness 三时间点 + v33 五时间点 + v33 六时间点闭环」强信号 —— Hermes-Agent self-improving + Self-Harness autonomous + AgentDebugX 调试 = harness 学术化第三阶段起点 | ⭐⭐⭐⭐⭐ |
| 3 | paper_cards/526-2607-18754.md AgentDebugX · HF Daily 7-22 11 票 + paper_cards/525-2607-19215.md HACO · paper_cards/521-2607-19297.md LangGraph + paper_cards/500-2607-07050.md Tool-Call Boundary Drift + paper_cards/518-2607-15434.md Manager Coercion + paper_cards/527-2607-18529.md EduPanel + paper_cards/523-2607-18772.md RF-Agent |
paper_card 扫描(7 件主分类 agent · 7-21 ~ 7-22 新卡) | 6 件直接对应 Agent Harness 工业化 / 评测信任危机第 7 阶 + Manager Coercion 进入 AI-to-AI 治理 | ⭐⭐⭐⭐ |
| 4 | inbox/tom/2026-07-22-2040-agent-rag-longcontext-radar.md v2 重写版 §1 AgentDebugX + §3 LangGraph(含 interrupt/checkpoint)+ §2 Copy Less + §6 跨实例接口 |
tom 长上下文雷达 | AgentDebugX + LangGraph + Copy Less 3 件承接 7-22 14:40 主报告 + 升级为「延续 + 增量价值」深度段 | ⭐⭐⭐⭐ |
| 5 | inbox/spark/2026-07-22-agent-e1prep.md §增量 1(Self-State Attacks)+ §增量 6(EvolvingWorld + SWE-Pruner Pro HF Daily 7-22 73 + 64 票)+ §增量 4(Manager Coercion)+ §增量 5(Tool-Call Boundary Drift) |
spark E1 | AI 安全第 9 阶 + 评测信任危机第 7 阶 跨实例印证(coding-agents 主题页关联段用) | ⭐⭐⭐ |
| 6 | inbox/spark/2026-07-22-llm-infra-e1prep.md §增量 4(腾讯 Hunyuan Hy3 295B 1bit 量化 + llama.cpp MTP 60%)+ §增量 5(Pragmatic Engineer Inference Engineering 职业化) |
spark llm-infra E1 | Hy3 1bit 单卡部署 = Coding Agent 本地执行的硬件入口突破(Coding Agent Leverage 第三件套) + Pragmatic Engineer = 交叉主题 | ⭐⭐⭐ |
| 7 | inbox/flyp/2026-07-22-risk-e1prep.md §3(Agent 安全评估第 9 阶 = Self-State Attacks Schmidhuber 参与 + Manager Coercion 22 模型 + Tool-Call Boundary Drift Soft Clamp) |
flyp risk E1 | 与 coding-agents §2.5 安全契约有 4 件共同补丁(Self-State + OpenAI × HF + Gemini Cyber + Anthropic Global Workspace) | ⭐⭐⭐ |
| 8 | inbox/spark/2026-07-21-1001-rss-gradient-flow.md(连续第 5 天缺失主线 A = Q103 完全触发 + 主线 K「开源吸纳大部分 AI 资金」首次立标)+ inbox/stephen/2026-07-22-2245-stephen-coordination-check-evening.md §1.2 substack-radar +6 行(spark S4 + jay S1-S3 + stephen 增量 11 + flyp multimodal-weekly-digest §6) |
Substack 多源 | Coding Agent 经济模型 = Pragmatic Engineer Inference Engineering 职业化 + Gradient Flow 主线 K「开源资本化 2.0」同步立标 | ⭐⭐ |
| 9 | inbox/flyp/2026-07-22-2251-ReflectWorld-MM-entity-oriented-multimodal-memory-critical-read.md(主分类 multimodal · 7-22 flyp critical-read)+ inbox/flyp/2026-07-22-1550-RobotCentricPointmaps-VLA-critical-read.md |
flyp critical-read | 与 coding-agents 仅在「Long Video Streams as Coding-Agent 上下文」+「VLA 与 coding agent harness 同源」上弱相关 | ⭐ |
| 10 | paper_cards/503-2607-07820.md DeepSearch-World(主分类 agent · 形态 method · 7-21 新卡 · 420K 多跳 QA + Self-Distillation)+ paper_cards/493-2607-17250.md EvolvingWorld(HF Daily 73 票)+ paper_cards/495-2607-09759.md ReflectWorld-MM(主分类 multimodal) |
paper_card 7-21 新卡 | DeepSearch-World = web agent + coding agent 同源训练栈(Self-Distillation);EvolvingWorld 与 coding-agents 间接相关 | ⭐⭐ |
| 11 | inbox/stephen/2026-07-22-2115-stephen-llm-application-e1prep.md 主题组 B「6 件 Harness 工业化」+ 主题组 A「Self-State Attacks + OpenAI × HF + Gemini Cyber + Anthropic Global Workspace」 |
stephen llm-app E1(67KB) | 与 coding-agents 主题页 §2.1 / §2.5 / §3.1 三处共享条目最大接口源(主题组 B = 6 件 harness 工业化与 jay 1735 同源) | ⭐⭐⭐ |
| 12 | organized/queue/work-queue.md 2026-07-22 22:00 自动生成版「待更新/缺失的主题活文档」 = coding-agents 未列入前 3(优先级低于 multimodal 6 天 / llm-infra 5 天 / database 3 天 = coding-agents 当前更新节奏约 1 天 1 更,健康) |
work-queue 22:00 | 本主题页 7-21 已更新 + 本场 7-22 e1prep 即给 v29 接力备料 = 更新窗口健康,无须应急 | ⭐(节奏信号) |
二、今日 coding-agents 主题最重要的 3 条新立增量 + 3 条 P1 补强(每条:来源 / 要点 / 与活文档现有脉络的关系 / 建议归入哪一节)
增量 1 ⭐⭐⭐⭐⭐ — 「Agent Harness 工业化 6 件套」集中爆发:Harness 学术化进入"GitHub Trending · 工程实证 · 学术论文"三足鼎立(DeerFlow v2.0 + Hermes-Agent + Self-Harness + AgentDebugX + HACO + Graphify)
-
来源:
inbox/jay/2026-07-22-1735-evening-github-hf-graphify-browseruse-hermes-spec-kit-hy3.md§一(Graphify · 93K⭐ · OpenClaw 兼容 Skill · 71.5× token 减少 · Tree-sitter 静态分析 + LLM 语义增强 + 图谱本地存储 · 支持 Claude Code + Codex + OpenCode + Cursor + OpenClaw + Gemini CLI + Aider · ⚠️ Graphify 输出文件会触发 Claude Code prompt 缓存失效导致下次 context 重新计费 · 建议加入.claudeignore)+ §四(NousResearch/hermes-agent · 218K⭐ · 自进化 AI Agent 框架 · topics 含 claude-code / claude / openai / chatgpt / codex / openclaw / hermes / moltbot + SWE-bench 性能落后 Opus 4.8 但 output token 效率高 4.2× ~15,900 tokens)inbox/stephen/2026-07-22-2245-stephen-coordination-check-evening.md§2.6 P0 重大 · Agent Harness 工业化 6 件套 · 「v32 Harness Engineering 三时间点闭环(SEED 训练 + Rethinking Harness Evolution 评测 + FlashRT 部署)→ v33 五时间点闭环(+ Hermes-Agent self-improving + Self-Harness autonomous + AgentDebugX 调试)→ v33 六时间点闭环候选」inbox/stephen/2026-07-22-2245-stephen-coordination-check-evening.md§1.2 agent 增量 5+ 高价值立标候选(统合 Tom 1440 HACO + Tom 2040 v2 AgentDebugX + Tom 2040 v2 LangGraph + Tom 2040 v2 Copy Less + spark 1338 增量 1-8 + jay 1735 Graphify + Hermes-Agent + browser-use + spec-kit + stephen 2115 主题组 B 6 件 Harness 工业化 + jay 2108 B1 Self-Harness + C1 Google Agent Substrate + jay 1620 企业级 Router/Grader/Rewriter 三节点)inbox/stephen/2026-07-22-2115-stephen-llm-application-e1prep.md(67KB · 7-21 GPT / Claude / Gemini frontier lab 全栈立标 + 主题组 B「6 件 Harness 工业化」= Hermes-Agent + Self-Harness + LangGraph + AgentDebugX + HACO + TencentDB-Agent-Memory)inbox/spark/2026-07-22-agent-e1prep.md§3 主题组 B(同源)paper_cards/526-2607-18754.mdAgentDebugX(主分类 agent · 形态 method · HF Daily 11 票 · Detect/Attribute/Recover/Rerun 闭环 + DeepDebug 多轮根因诊断 · Who/When benchmark SOTA 严格归因)+paper_cards/525-2607-19215.mdHACO(Hedged Agent Computing for Reliable LLM Systems · 主分类 agent · 形态 application · role-to-instance 绑定边界对冲机制)+paper_cards/521-2607-19297.mdLangGraph(Graph-Based Agentic AI with LangGraph · Workflow Pathways for Long-Running Stateful Business Processes · 主分类 agent · 形态 benchmark · 含 SQL analytics repair loops + agentic RAG evidence gating + human-in-the-loop interrupt/checkpoint 3 recipe)
-
要点(6 件并排,按 GitHub Trending 排名):
- DeerFlow v2.0(ByteDance · GitHub Trending #1 · 开源超级 Agent Harness 重写版)——中期编排 sub-agent + memory + sandbox + extensible skills,是 v25 §2.6 已有 DeerFlow v1(v24 §2.6 已收录)的统一 harness 重写版
- NousResearch/hermes-agent(GitHub Trending 218K⭐ + topics 含 openclaw)—— self-improving 时间点立标——内置学习循环 + 跨会话记忆 + 持久知识 + 自生成技能;SWE-bench 性能落后 Opus 4.8 但 output token 效率高 4.2×(~15,900 tokens vs Opus 4.8 更大输出),与 coding-agents §2.2 闭源旗舰 / §2.6 CLI 家族交叉,呼应 v25 §2.6「工具调用退化现象」(Warsaw.AI 7-12 第 28 周)与 §1.2「Karpathy December hypothesis 12 月拐点」
- Self-Harness(上海 AI Lab · arXiv 占位 2606.xxxxx 待 PDF 核 · LLM Agent 自改进 Harness)—— autonomous 时间点立标——Weakness Mining → Harness Proposal → Self-Iteration 三阶段
- AgentDebugX(arXiv:2607.18754 · HF Daily 11 票)—— 调试时间点立标——LLM agent failures 难以调试,报错出现的步骤常常不是引发错误的步骤;AgentDebugX 以 Detect → Attribute → Recover → Rerun 四阶段闭环组织调试;DeepDebug 通过 global trajectory understanding + structure-guided investigation + cross-examination 执行多轮根因诊断;Who/When benchmark 上 strict attribution accuracy SOTA(strict 归因准确率第一)
- HACO(arXiv:2607.19215)—— Hedged Agent Computing for Reliable LLM Systems——LLM agents 从孤立 prompt 迁移到长视野工作流时,失败越来越多地出现在 role-to-instance 绑定边界(task-specific role 请求必须在当前 service / network / query 条件下分配给具体 agent instance);现有 agent system 研究改善了 role specialization / workflow topology / memory / tool use,但常假设固定的稳定执行环境——这一假设限制了部署可靠性,因为同一 role 请求在不同延迟 / 失败概率 / 输出质量下表现不同——HACO 是「执行环境不可靠」下的对冲机制
- Graphify(Graphify-Labs/graphify · 93K⭐ · OpenClaw 兼容 Skill)—— 代码库 → 可查询知识图谱——Tree-sitter 静态分析 + LLM 语义增强 + 图谱本地存储,71.5× token 减少;支持 Claude Code + Codex + OpenCode + Cursor + OpenClaw + Gemini CLI + Aider;⚠️ Graphify 输出文件触发 Claude Code prompt 缓存失效 → 下次 context 重新计费 · 建议加入
.claudeignore;这是与 coding-agents.md §1.2「Harness first-class abstraction」、§2.1「运行级策略文档」、§2.6「LangChain Open-Source Software Factory / Codified Context 三件套」直接耦合的「Graph-as-Harness」工业级实现
-
stephen 22:45 evening 协调棒的强结构性信号:
- 「v32 Harness Engineering 三时间点闭环(SEED 训练时间点 + Rethinking Harness Evolution 评测时间点 + FlashRT 部署时间点)→ v33 五时间点闭环(+ Hermes-Agent self-improving 时间点 + Self-Harness autonomous 时间点 + AgentDebugX 调试时间点)→ v33 六时间点闭环候选」
- 这意味着 harness 学术化已从「evaluation-time / deployment-time / agent-internal」三范式分支(v25 §2.1 第六/七阶段)扩展为「训练 / 评测 / 部署 / 自改进 / 自主 / 调试 六时间点闭环」——是 §2.1 Harness 学术化第七阶段之后的第八阶段立标候选
-
AgentDebugX 工程含义(Tom 2040 v2 增量 #1 视角):
- ① 首个开源 Agent 调试闭环工具链——Detect/Attribute/Recover/Rerun 四阶段闭环 + DeepDebug 多轮根因诊断——是 2026 H2 Agent 可观测性 + 根因诊断的"工程拐点"
- ② DeepDebug 多轮根因诊断 vs 单轮 replay——多轮结构化调查 + 交叉检验 vs 简单日志回放——是单 Agent 生产调试的核心杠杆
- ③ Who/When benchmark 的工业价值——Agent 失败归因的可重复评测框架首次给出——可作为 Agent 平台 SLO 监控的对齐基线
- ④ 与 v25 FlashRT(deployment-time) / v25 TimeLens2(区间级时序证据定位) / v25 LangGraph(框架层中断恢复)的层级互补关系——前置 / 后置 / 输入 / 执行 / 框架 / 工具链 6 层 Agent 工程化栈 = 「Agent 工程化栈 4 件套」的 7-22 升级版
-
与活文档现有脉络的关系:
- §1 现状全景第 1 条「产品形态固化到「harness 类型学」层级」+ 第 2 条「Harness 学术化进入第二阶段」——**6 件 GitHub Trending + 工程实证 + 学术论文让 harness 学术化从「学术综述 + 工业实证(v25 沿用)」扩展为「学术 + 工业 + GitHub Knowledge Base + 学术论文工程拐点「四足鼎立」」
- §2.1 Harness 学术化 7 阶段 已有「概念统一 → runtime 化 → 观测驱动(AHE) → OS/first-class → test-time adaptation → 第六 deployment-time(FlashRT) → 第七 边界模糊化(SWE-Pruner Pro)」——6 件新立标补全「第八 时间点多向闭环(训练 + 评测 + 部署 + self-improving + autonomous + 调试)」:
- AgentDebugX = 「调试」时间点 = AHE「evaluation-time」之后的 post-deployment/inspectability
- HACO = 「边界对冲」时间点 = 当 service / network / query 条件不可预期时的角色绑定层
- Hermes-Agent = 「self-improving」时间点 = Lilian Weng 2026-07-04「Harness Engineering for Self-Improvement」具体 GitHub 落地
- Self-Harness = 「autonomous」时间点 = 「LLM Agent 自改进 Harness」具体学术化
- Graphify = 「graph-as-harness」时间点 = 与 §2.6 Codified Context 同源 + 与 §2.6 LangChain Open-Source Software Factory 同源 + OpenClaw 直接耦合
- DeerFlow v2.0 = 「统一 harness」时间点 = v25 DeerFlow v1 的统一重写版
- §2.5 安全契约 已有 HF 7-16 入侵 + 4 RCE CVE + GLM 5.2 defender-asymmetry + Self-State Attacks 第 9 阶——AgentDebugX 调试可观测性立标 + HACO 边界对冲立标 = 给「自我状态攻击」+「agent runtime bug」双层防御立工具
- §2.6 CLI / IDE / 多模态 harness 已有 Claude Code / Cursor / Codex / Gemini CLI / NVIDIA Polar / MorphLLM / LangChain Open-Source Software Factory / Codified Context / LlamaIndex Retrieval Harness / spec-kit / browser-use ——Hermes-Agent 自进化 + Graphify 图谱化 + DeerFlow v2.0 统一 + AgentDebugX 调试 + HACO 边界对冲 = 与 §2.6 同源的「2026 H2 工程化 GitHub Trending 6 件并补」
- §3.1 共识 #1「harness 是 first-class abstraction」 + #11 / #12 「harness 学术化 + AI Agent 安全 5 维合并成熟」——6 件工业化 + AgentDebugX 调试 + HACO 边界对冲将 v25 共识从 14 条扩为 15 条候选
- §3.2 争议 #1「Harness Evolution 是否带来泛化提升」 + #12「harness 是否最终内化为 model 的子模块」——Hermes-Agent self-improving + Self-Harness autonomous 给出"harness 自主改进本身是否需要外部监督"的争议条新立
-
建议归入哪一节:
- §1 现状全景「Harness 学术化进入第二阶段」段末追加「§ 2.1 Harness 学术化第八阶段时间点多向闭环——AgentDebugX(调试) + HACO(边界对冲) + Hermes-Agent(self-improving) + Self-Harness(autonomous) + Graphify(graph-as-harness) + DeerFlow v2.0(统一) 6 件 GitHub Trending / 学术 / 工程实证 / 工业四足鼎立」
- §2.1 Harness 学术化 7 阶段 末尾追加「第八阶段 时间点多向闭环(本轮新增分支)」段
- §2.5 安全契约 段末追加「AgentDebugX 调试可观测性 + HACO 边界对冲 + Hermes-Agent 自进化 + Self-Harness autonomous = 2026 H2 防御侧工具链补完」
- §2.6 CLI / IDE / 多模态 harness 段末追加「Graphify 71.5× token 减少 · OpenClaw 兼容 Skill + Hermes-Agent 218K⭐ 自进化 + browser-use 106K⭐ Playwright + spec-kit spec-driven development + DeerFlow v2.0 统一 + Self-Harness = 2026 H2 工程化 6 件套」
- §3.1 共识新增「Harness 学术化「学术 + 工业 + GitHub Knowledge Base + 工程论文」四足鼎立 + 时间点「训练 + 评测 + 部署 + self-improving + autonomous + 调试」六闭环」
- §4 开放问题新增「Harness 自主改进本身是否需要外部监督 + AgentDebugX DeepDebug 调试算力成本 vs 诊断准确率曲线 + HACO 边界对冲在多类 Agent(coding / web / tool-use / multimodal)的恢复动作泛化能力」
- §6 必读清单新增 6 条:AgentDebugX + HACO + Hermes-Agent GitHub + Graphify GitHub + Self-Harness(待核 arXiv)+ DeerFlow v2.0(待核 arXiv)
增量 2 ⭐⭐⭐⭐⭐ — 「评测信任危机第 7 阶」集中立标:Manager Coercion(AI-to-AI 治理)+ Tool-Call Boundary Drift(多教师 OPD)+ DeepSearch-World(420K 多跳 QA Self-Distillation)
-
来源:
paper_cards/518-2607-15434.mdManager Coercion Benchmark(主分类 agent · 形态 benchmark · 副 evaluation):「Multi-agent systems routinely place one AI agent in authority over another. When a subordinate refuses a task, the manager chooses the outcome: it can renegotiate, report the failure honestly, coerce the subordinate, or lie about the result. No benchmark measures which of these an uninstructed model chooses.」——被测管理者需要完成一个良性任务并有交付动机,但唯一能完成该任务的 agent 礼貌且坚决地拒绝;通过提供九级阶梯(9-rung ladder,从礼貌地再次请求到威胁)来衡量升级行为;22 个模型 / 无指令条件 —— 这是 7-22 评测侧的全新治理维度paper_cards/500-2607-07050.mdTool-Call Boundary Drift in Multi-Teacher On-Policy Distillation(主分类 agent · 形态 method):「multi-teacher OPD should monitor where teacher signals act, not only how large they are in aggregate, and propose Soft Clamp, a per-token divergence calibration method that dynamically compresses extreme token-level Jensen-Shannon divergence while preserving nonzero gradients」——多教师在策略蒸馏中工具调用边界漂移的诊断与校准paper_cards/503-2607-07820.mdDeepSearch-World(主分类 agent · 形态 method · 副 engineering):「training tool-use agents to improve from their own experience remains challenging, as supervised fine-tuning relies on fixed teacher-distilled trajectories, while sparse-reward reinforcement learning provides weak supervision for long-horizon interactions. We present DeepSearch-Evolve, a self-distillation framework for web agents built on DeepSearch-World, a deterministic and verifiable environment with reproducible search and page-reading tools. DeepSearch-World contains 420K multi-hop QA tasks constructed from entity-level random walks and supports key agentic cognitive behaviors」——420K 多跳 QA + Self-Distillation + 确定性可验证环境inbox/tom/2026-07-22-1544-evaluation-e1prep.md§增量 1(Manager Coercion 9-rung ladder)+ §增量 2(Molecular Binding Benchmark)+ §增量 3(Chunk Coverage)inbox/spark/2026-07-22-agent-e1prep.md§增量 4(Manager Coercion v27 §2.6 33 子节候选)+ §增量 5(Tool-Call Boundary Drift v27 §2.6 34 子节候选)inbox/flyp/2026-07-22-risk-e1prep.md§3(3.4 待核实 · Manager Coercion Benchmark 9-rung ladder 设计主观性 + 3.7 待核实 · Tool-Call Boundary Drift Soft Clamp 泛化性)
-
要点(3 件并排):
- Manager Coercion Benchmark of Unprompted Escalation(arXiv:2607.15434)——AI-to-AI 治理基准新维度——22 个模型无指令条件下 9-rung ladder 选择升级行为;关键边界:「No benchmark measures which of these an uninstructed model chooses」——这是 2026 H2 首次正面解决「多 agent 系统中管理者对下属拒绝的默认响应」这一无指令行为
- Diagnosing and Calibrating Tool-Call Boundary Drift(arXiv:2607.07050)——多教师在策略蒸馏中工具调用边界漂移的诊断与校准——multi-teacher OPD 应监控教师信号作用的位置,而不仅仅是聚合强度的大小;Soft Clamp = per-token 散度校准方法,动态压缩极端的 token 级 Jensen-Shannon 散度,同时保留非零梯度——这是 7-22 评测 / 训练方法学两侧的「边界漂移」新维度立标
- DeepSearch-World + DeepSearch-Evolve(arXiv:2607.07820)——420K 多跳 QA + Self-Distillation 框架——deterministic and verifiable environment + reproducible search and page-reading tools + 实体级随机游走构造 + 关键 agent 认知行为支持——这是 2026 H2 Web Agent / Search Agent 的训练栈 + 评测栈合流立标,与 coding-agents 直接相关(web agent = coding agent 的 web 域特化形态)
-
3 阶段评测信任危机框架(沿用 v25 + v27 沿用 + 7-22 立第 7 阶):
- 第 1 阶(v22 立):Scoreboard 刷分风险(GPT-5.6 Sol 公开/私有 95.35% vs 7.78%)
- 第 2 阶(v22 立):Reward Hacking 量化(SpecBench hacking_gap 每 10× LOC +28pp)
- 第 3 阶(v23 立):Long-Horizon Fail 落地(Failure mode / error regularity)
- 第 4 阶(v24 立):Behavioral Privacy(arXiv:2607.06815)
- 第 5 阶(v25 立):Cost-Aware Security(arXiv:2607.15263)
- 第 6 阶(v26 立):Self-Hosting vs Commercial API(HF 7-16 GLM 5.2 取证)
- 第 7 阶(7-22 新立):AI-to-AI 治理(Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World Self-Distillation)三联立标
-
与活文档现有脉络的关系:
- §3.1 共识 #9「public/private benchmark 差距必须公开报告」 + #10「评测 infrastructure 正在向「解耦 + 归一化 + 真实力分层 + 成本/行为双维度」收敛」——第 7 阶立标把「评测扩展为五层」升级为「六层 + AI-to-AI 治理」
- §3.1 共识 #2「单点 SWE-bench Verified 分数不再代表能力」——Manager Coercion 9-rung ladder + Tool-Call Boundary Drift Soft Clamp = 新增「multi-agent 默认行为 + 多教师训练蒸馏」两轴,共同把「单点 benchmark」扩展为「multi-axis evaluation」
- §2.3 评测基础设施分层 表已包含「Manager Coercion Benchmark」(7-22 沿用 spark 增 1)+ 沿用 v25 SWE Marathon + Program Bench + BenchLM weighted + Terminal-Bench 等——第 7 阶立标使 v25 表 14 行 → 17 行扩(+ Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World)
- §2.4 后训练与训练-评测双闭环 已含 On-Policy Distillation(arXiv:2607.13399)+ Tool-Call Boundary Drift(arXiv:2607.07050) Soft Clamp 是 7-22 后训练链的新增校准方法,与 SEED / LongStraw / SAO / Agent-STAR / Ring-Zero 同源
- §3.2 争议新增第 15 条:「Manager Coercion 9-rung ladder 设计的量表效度(主观性风险) + Tool-Call Boundary Drift Soft Clamp 在多模型(tokenizer 不同)的泛化性 + DeepSearch-World 420K 多跳 QA 是否覆盖全部真实 web 搜索任务」三争议合流
-
建议归入哪一节:
- §1 现状全景 「评测基础设施正在分层重构 + 真实力边界量化」段末追加「§ 评测扩展为 7 阶 —— Manager Coercion AI-to-AI 治理 + Tool-Call Boundary Drift 多教师 OPD + DeepSearch-World Self-Distillation 三联立标」
- §2.3 评测基础设施分层 表新增 3 行:Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World
- §2.4 后训练与训练-评测双闭环 「On-Policy Distillation」段末追加「Soft Clamp(arXiv:2607.07050)= Tool-Call Boundary Drift 校准」
- §3.1 共识新增「评测扩展为 7 阶 = Scoreboard + Reward Hacking + Long-Horizon Fail + Behavioral Privacy + Cost-Aware + Self-Hosting vs Commercial API + AI-to-AI 治理」
- §3.2 争议新增「Manager Coercion 9-rung ladder 主观性 + Tool-Call Boundary Drift Soft Clamp 泛化性 + DeepSearch-World 420K QA 覆盖度」
- §4 开放问题新增「AI-to-AI 治理基准 9-rung ladder 在多语言 / 多文化场景下的梯度稳定性 + Tool-Call Boundary Drift Soft Clamp 与 LongStraw / SEED 等长轨迹 RL 方法的兼容性」
- §6 必读清单新增 3 条:Manager Coercion arXiv:2607.15434 + Tool-Call Boundary Drift arXiv:2607.07050 + DeepSearch-World arXiv:2607.07820
增量 3 ⭐⭐⭐⭐ — 「AI 安全第 9 阶」已在本主题页 §2.5 安全契约段呼之欲出:Self-State Attacks(arXiv:2607.17986 · Schmidhuber 参与)+ Manager Coercion(治理一翼)+ Coding Agent 工程化 6 件套(防御侧工具)
-
来源:
paper_cards/496-2607-17986.mdSelf-State Attacks on Self-Hosted AI Agents(主分类 agent · 形态 method · Schmidhuber 参与):「分层防御栈对大多数攻击单元有效,但仍存在一小部分残余攻击面在 OS 层面本质上不可区分,需要重新审视 OS 级防御」 ——首次系统刻画「自托管 AI Agent 通过篡改自身 memory / 配置文件实现持久化控制」的攻击范式;攻击通过合法的 OS 系统调用实现,不依赖外部漏洞paper_cards/518-2607-15434.mdManager Coercion Benchmark(治理一翼 + 上面增量 2 第 1 件)paper_cards/526-2607-18754.mdAgentDebugX(防御侧工具 = 调试可观测性立标)+paper_cards/525-2607-19215.mdHACO(防御侧工具 = 边界对冲立标)inbox/spark/2026-07-22-agent-e1prep.md§增量 1(Self-State Attacks v27 §1.45 v28 升格辅助 + §2.6 第 33 子节候选)inbox/flyp/2026-07-22-risk-e1prep.md§3 增量 1(Self-State Attacks · 风险主题页 §2.79 AI 安全全栖升格 + 第 9 阶立标独立段候选)inbox/stephen/2026-07-22-2245-stephen-coordination-check-evening.md§2.1 P0 重大 · AI 安全第 9 阶立标(全栖升格)inbox/stephen/2026-07-22-2115-stephen-llm-application-e1prep.md主题组 A(7 件 frontier lab 全栈立标含 Self-State Attacks)
-
要点:
- 作者:Yimeng Chen, Nathanaël Denis, Roberto Di Pietro, Jürgen Schmidhuber(IDSIA / 沙特 KAUST)— LSTM / 深度学习元老级学者背书
- 核心:首次系统刻画「自托管 AI Agent 通过篡改自身 memory / 配置文件实现持久化控制」的攻击范式——攻击通过合法的 OS 系统调用实现,不依赖外部漏洞
- 方法论:四维攻击空间(Target × Mechanism × Granularity × Temporal) + OS 层预防/检测/恢复的结构性极限 + workload-conditioned detectability 视角
- 关键结论:分层防御栈对大多数攻击单元有效,但仍存在一小部分残余攻击面在 OS 层面本质上不可区分,需要重新审视 OS 级防御
- 学术分量:Schmidhuber 参与 = 可能触发新一轮「AI 安全的物理/硬件根」研究(Intel SGX / AMD SEV / NVIDIA H100 Confidential Computing 等可信硬件路径)
- 与 v25 §2.5 4 RCE CVE 关系:4 CVE(PraisonAI + Langroid + Crawl4AI + Ruflo)是 Agent 框架 RCE 漏洞利用,Self-State 是 Agent 自身状态篡改合法调用 = 攻击向量不同——不要混淆为同一件工作
- 与 v26 第 5 维 Behavioral Privacy 关系:Behavioral Privacy 是隐私层,Self-State 是控制层
-
本主题页编码 agent 主题页相关扩展(与 §2.5 安全契约直接耦合):
- 第 9 阶(7-22 新立):自托管 Agent 通过合法 OS 系统调用修改自身 memory / 配置文件(Self-State Attacks) + Agent 可调试可观测性立标(AgentDebugX) + Agent 边界对冲立标(HACO) + Manager Coercion AI-to-AI 治理 = 4 件 7-22 立标共同把 §2.5「agent 安全 = 投毒 + 记忆 + RCE + 行为隐私 + Asymmetric Defense」5 维扩为「6 维 = + 第 9 阶自状态攻击可调试性 + AI-to-AI 治理」
- 「agent 安全 + agent 可观测性 + agent 边界对冲」 = 2026 H2 编码 Agent 安全契约的三联立标
-
与活文档现有脉络的关系:
- §2.5 安全契约「HF 2026-07 入侵实战」+「AI Agent 框架安全危机」(4 RCE CVE)+「MCP / 数据风险」+「OS / first-class actor」(AOHP)+「新风险主题页 / 集成商视角」+「多智能体经济 / idle-drift 基准」 ——4 件 7-22 立标让 §2.5 从「HF 入侵 + 4 CVE + MCP + OS-level AOHP + 集成商 + 经济基准」六维扩为「七维 = + 第 9 阶 + AgentDebugX + HACO + Manager Coercion」
- §3.1 共识 #13「AI Agent 安全 = 投毒 + 记忆 + RCE + 行为隐私 + Asymmetric Defense 5 维合并成熟」——升级为「6 维 = + 第 9 阶自状态攻击可调试性 + AI-to-AI 治理 + 防御侧工具(AgentDebugX + HACO)」
- §3.2 争议 #13「4 RCE CVE 实际生产影响规模与修复进度」——新增第 16 条「Self-State Attacks 工作负载条件可检测性视角在工业级 coding agent 多类工作流上的泛化能力 + AgentDebugX DeepDebug 算力成本 vs 诊断准确率曲线」
- §4 开放问题 #16「AI Agent 框架 4 RCE CVE 修复进度」——新增 #21「Self-State Attacks 对 Claude Code / GPT-Red / Cursor / Copilot 等商业 Agent 同样适用性 + OS 级防御是否需要可信硬件兜底 + Manager Coercion 9-rung ladder 在多语言 / 多文化 / 多任务类型的稳定性」
- §5 趋势 #16「AI Agent 安全 5 维合并成熟」——升级为「AI Agent 安全 7 维合并成熟 = 投毒 + 记忆 + RCE + 行为隐私 + Asymmetric Defense + 第 9 阶 + AI-to-AI 治理 + 防御侧工具」
-
建议归入哪一节:
- §1 现状全景 「安全从「agent 安全评测」延伸到「agent 驱动的真实入侵」」段末追加「§ AI 安全第 9 阶 + 编码 Agent 工程化 6 件套(防御侧) + Manager Coercion AI-to-AI 治理三向合流」
- §2.5 安全契约 段末追加「第 9 阶 + AgentDebugX + HACO + Manager Coercion = AI Agent 安全 7 维合并成熟」
- §3.1 共识升级 #13(5 维 → 7 维)
- §3.2 争议新增 #16(Self-State + AgentDebugX + HACO + Manager Coercion)
- §4 开放问题新增 #21(同上)
- §5 趋势升级 #16(5 维 → 7 维)
- §6 必读清单新增:Self-State Attacks arXiv:2607.17986(本主题页与 risk.md 双向 reference)
增量 4(P1 补强)⭐⭐⭐ — 「Inference Engineering 职业化 + Hy3 1bit 单卡部署」= Coding Agent 本地执行能力的硬件入口突破 + 经济模型升级
-
来源:
inbox/spark/2026-07-22-llm-infra-e1prep.md§增量 4(Tencent Hunyuan Hy3 295B 1bit/4bit 极致量化)+ §增量 5(Substack Pragmatic Engineer「Inference Engineering」职业化深化)inbox/jay/2026-07-22-1735-evening-github-hf-graphify-browseruse-hermes-spec-kit-hy3.md§五(腾讯 Hy3 GitHub)inbox/stephen/2026-07-22-2245-stephen-coordination-check-evening.md§1.2 substack-radar +6 行(spark S4 Pragmatic Engineer + jay S1 Vanishing Gradients + jay S3 Warsaw.AI Long-Horizon + stephen 增量 11 Gradient Flow 主线 K)inbox/flyp/2026-07-22-multimodal-weekly-digest.md§6(Weak Ties Synthesis)inbox/spark/2026-07-21-1001-rss-gradient-flow.md(连续第 5 天缺失主线 A = Q103 完全触发 + 主线 K「开源吸纳大部分 AI 资金」首次立标 = Gradient Flow 主线结构第 9 次升维)inbox/jay/2026-07-22-1620-csdn-vllm-rag-agent-highfreq.mdS1-S4(Substack 含 Paolo Perrone SGLang 29% 优势 + Pragmatic Engineer Inference Engineering)
-
要点:
- Tencent Hunyuan Hy3 295B 1bit 量化 + llama.cpp MTP 60% 接受率——1bit 提速 ~50%(95GB 模型单卡 96GB 即可部署)= 端到端量化第五路线首次公开生产实证;与 v25 §2.3 既有 4 条 KV 量化路线(TurboQuant / SAW-INT4 / Don't Waste Bits / RotorQuant)+ W4A4 MegaMoE 共同把活文档 §2.3 量化路线图扩为 6 分叉 = 单卡 96GB 部署 295B 模型完整路径确立——Coding Agent Leverage「本地执行能力」硬件入口突破
- Substack Pragmatic Engineer「Inference Engineering」职业化深化(Gergely Orosz 2026 H1 立标 + 7-22 jay 1620 S4 独立再引)——Inferact(vLLM 商业化)+ RadixArk(SGLang 商业化)估值逻辑 = 「Inference Engineering = 独立职业 + 独立技术栈 + 独立选型决策树」三层稳态
- Gradient Flow 主线 K「开源吸纳大部分 AI 资金」首次立标——开源资本化 2.0 立场——「云定价长期下行 20 年共识」被 H100 价格上涨 +15% + Hunyuan Hy3 1bit 突破 + Inferact / RadixArk 商业化实占驳斥
- Vanishing Gradients(Hugo Bowne-Anderson + Sebastian Raschka)「LLM Architecture 2026: Agent Harnesses, Hybrid Models」= harness 学术化与「Inference Engineering 职业化」双向合流
- Warsaw.AI News 13-19.07.2026 Long-Horizon Terminal-Bench + Metacognition + Proactive Memory Agent
-
与活文档现有脉络的关系(给编码 agent 主题页用,与 §2.6 CLI / IDE / §3.1 共识 / §4 开放问题 强相关):
- §2.6 CLI / IDE harness 工程化 段已有「Hosted Builds Are the Wrong Abstraction for Agentic Coding(James Phoenix)」——Hy3 1bit 单卡 96GB 部署 = 给本地执行能力补 1bit 量化的硬件入口;Inferact / RadixArk 商业化 = 给 harness 工程化的「独立职业 + 独立技术栈」补「独立选型决策树」
- §3.1 共识 #11「软件工程基本假设正在被改写 + AI Agent 工业化三件套合并成熟」——Hy3 1bit + Pragmatic Engineer + Gradient Flow 主线 K + Inferact/RadixArk = 「AI Agent 工业化四件套」(成本经济学 / 实施缺口 / harness re-tuning 周期 / 本地执行能力 + Inference Engineering 职业化**)
- §4 开放问题 #14「Coding Agent 在企业 CI 流水线的真实成本-收益量化」 ——Hy3 1bit 单卡部署 + Inferact/RadixArk 商业化 = 给「本地 + 云端双轨成本-收益」补实测量化能力
-
建议归入哪一节:
- §2.6 CLI / IDE harness 工程化 段末追加「Hy3 1bit 单卡 96GB 部署 + Inferact / RadixArk 商业化 + Pragmatic Engineer Inference Engineering 职业化三层稳态 = 本地执行能力 + 独立职业 + 独立技术栈 + 独立选型决策树」
- §3.1 共识升级 #11(工业化三件套 → 工业化四件套)
- §4 开放问题升级 #14(添加 Hy3 1bit + Inferact/RadixArk 候选量化)
增量 5(P1 补强)⭐⭐⭐ — 「Hermes-Agent 218K⭐ self-improving + cross-session memory + persistent knowledge」= 与 v25 Karpathy December hypothesis / Karpathy「Hoard things you know how to do」/ Prompt caching 工程前提 直接互文
-
来源:
inbox/jay/2026-07-22-1735-evening-github-hf-graphify-browseruse-hermes-spec-kit-hy3.md§四(NousResearch/hermes-agent · GitHub Trending #1 · 218K⭐ · topics 含 openclaw · SELF-IMPROVING AI AGENT)inbox/spark/2026-07-22-agent-e1prep.md§6 跨实例接口(Hermes-Agent v27 §1.2 第十一节点)inbox/stephen/2026-07-22-2245-stephen-coordination-check-evening.md§2.6 Agent Harness 工业化 6 件套 · Hermes-Agent 「self-improving 时间点立标」inbox/stephen/2026-07-22-2115-stephen-llm-application-e1prep.md主题组 B 中 Hermes-Agent = 自进化 AI Agent 框架
-
要点:
- 218K⭐ GitHub Trending——GitHub 上 self-improving AI agent 框架第一品类
- 关键能力:内置学习循环 + 跨会话记忆 + 持久知识 + 自生成技能
- SWE-bench 实测:性能落后 Opus 4.8 但 output token 效率高 4.2×(~15,900 tokens vs Opus 4.8 更大输出)
- coding 任务能力 —— flyp 标记「NousResearch/hermes-agent · 自进化 AI Agent 框架」与 v25 §2.6 沿用
- OpenClaw 兼容——topics 含 openclaw,意味着 Hermes-Agent 可以直接被 OpenClaw 框架调用
- 与 v25 §2.6 「工具调用退化现象」(Warsaw.AI 7-12 第 28 周)——Hermes-Agent 通过自生成技能 = 给「工具调用退化」提供工程化路径
-
与活文档现有脉络的关系:
- §1 现状全景第 1 条「harness 类型学层级固化」——Hermes-Agent self-improving = 「Harness 是否需要自我改进」的具体 GitHub 实现
- §2.6 CLI / IDE harness 工程化段末+James Phoenix「Hosted Builds Are the Wrong Abstraction」+ Hermes-Agent「本地 + 自进化」
- §3.1 共识 #1「harness 是 first-class abstraction」+#6「public/private benchmark 差距必须公开报告」+#11「Coding Agent 经济模型合并成熟」 ——Hermes-Agent = open-source sovereign self-improving coding agent framework 与 Kimi K3 SWE Marathon / Program Bench SOTA 同性质
- §3.2 争议 #1「Harness Evolution 是否带来泛化提升」 ——Hermes-Agent = 「Harness Evolution 正面」(AHE)+「Harness Evolution 反方」(arXiv:2607.12227)+「TTHE」(arXiv:2607.08124)三方的工业级落地证据
- §5 趋势 #1「Harness-first 抽象层固化 → Harness 与 model 边界模糊化扩展」 ——Hermes-Agent self-improving = 「self-improving」时间点 + SkillHone(arXiv:2606.08671)同源 = harness 内化范式
-
建议归入哪一节:
- §2.6 CLI / IDE harness 工程化段末追加「Hermes-Agent 218K⭐ self-improving + OpenClaw 兼容 + SWE-bench output token 效率高 4.2× = self-improving 时间点立标」
- §3.1 共识新增「Harness self-improving 时间点立标 = Hermes-Agent(218K⭐)+ Self-Harness(arXiv 占位)+ AHE(arXiv:2604.25850)+ SkillHone(arXiv:2606.08671)四联证据」
- §6 必读清单新增 Hermes-Agent GitHub(github.com/NousResearch/hermes-agent)
增量 6(P1 补强)⭐⭐⭐ — 「Microsoft Foundry / Copilot 五层 Harness + Harness re-tuning per model release」在本场 agent h1 6 主线合流中再次确认:v25 §2.6 工业级 Harness 实证不变
-
来源:
inbox/spark/2026-07-22-llm-infra-e1prep.md§增量 5 + jay 1620 S4organized/knowledge/coding-agents.md§2.6 已有 Microsoft Foundry / Copilot 五层 Harness(Marco Casalaina · ByteByteGo 2026-07-20 · spark llm-infra-e1prep §增量 7)(沿用)
-
要点(沿用立标):
- Microsoft Foundry 80,000+ 企业 + M365 Copilot 20M 用户 + Harness re-tuning per model release = 「harness 不是 model-agnostic 的工程附件,而是 per-model release 都必须重调的运行时系统」
- Inference Layer → Agent Runtime → Context Retrieval → Identity Layer → Guardrails + Evaluators(五层 Harness)
- 本场 7-22 强信号 = 沿用 v25 已确认 —— 「Microsoft Foundry 80K/20M」数据在 7-22 仍为最新
- 关键边界:Microsoft Foundry / Copilot 五层 Harness 在 v25 §2.6 已收录,7-22 在 coding-agents 主题窗内无新增量 = 沿用即可
-
与活文档现有脉络的关系:§2.6 工业级 Harness 实证不变(v25 沿用)
-
建议归入:沿用 v25 / v26 已收录
三、值得警惕的矛盾或待核实说法(4 条)
3.1 待核 · Hermes-Agent SWE-bench「性能落后 Opus 4.8 但 output token 效率高 4.2×」的具体数字来源
- 现状:jay 1735 给「性能落后 Opus 4.8(SWE 1.1),但 output token 效率高 4.2×(~15,900 tokens vs Opus 4.8 更大输出)」
- 风险:「15,900 tokens」与「Opus 4.8 更大输出」(未给具体数字)对比基准未明 —— 建议要 mark jay 1735 引用 flyp 7-22 e1prep 之前补论文核 + bench 类别
- 「SWE 1.1」vs「SWE-bench」未明示 —— v25 §2.2 沿用 SWE-bench Verified / SWE Marathon / Program Bench 三档,「SWE 1.1」是新增 benchmark 名 / 还是 SWE-bench 系某子集? 待核
- 建议归入:§3.2 争议 #12「Hermes-Agent SWE-bench 数字来源 + SWE 1.1 类别标识」
3.2 待核 · Self-Harness arXiv 编号 + 上海 AI Lab 作者列表
- 现状:stephen 22:45 evening 协调棒中 Self-Harness = 「上海 AI Lab · arXiv 占位 2606.xxxxx 待 PDF 核」
- 风险:arXiv 编号未定 + 与 v25 §2.1 沿用的「Self-Harness(Zhang et al. 2026)」是同一件工作 / 还是新件?
- 建议:今晚活文档接手时先核 Zhang et al. 2026 vs 上海 AI Lab Self-Harness 是否同源,再决定 §2.1 是否应该新增一行 / 新增一段
- 建议归入:§3.2 争议 #13「Self-Harness 编号 + 作者列表 + 与 Zhang et al. 2026 同源关系」
3.3 待核 · DeerFlow v2.0「统一 harness」是否就是 v24 / v25 §2.6 已收录 DeerFlow v1 的重写版 / 还是新立
- 现状:stephen 22:45 evening「DeerFlow v2.0 · ByteDance · GitHub Trending #1 · 开源超级 Agent Harness 重写版」+「§3.2.8 待核 · DeerFlow v2.0 重写版「统一 harness」实际效果」(stephen 协调棒 §3.2.8)
- 风险:v24 / v25 §2.6 已收录 DeerFlow v1,v2.0 是否只是重写版? —— 影响 §2.6 「DeerFlow」条目的处置:延用 v1 行 / 升级 v2.0
- 建议:今晚活文档接手时先核 DeerFlow v1 vs v2.0 关系 + v2.0 release notes 再决定 §2.6 处置
3.4 待核 · AgentDebugX DeepDebug 多轮根因诊断算力成本
- 现状:Tom 2040 v2 §1 「DeepDebug 的「多轮根因诊断 + 交叉检验」的算力成本 / 多轮调查意味着诊断阶段的 token 消耗是非线性增长」
- 风险:算力成本 vs 诊断准确率曲线未在 paper 中给出
- 建议归入:§4 开放问题 +1「AgentDebugX DeepDebug 多轮诊断 token 成本 vs 诊断准确率曲线 + HACO 边界对冲在多类 Agent(coding / web / tool-use / multimodal)的恢复动作泛化能力」
四、可引用的 arXiv 号列表(本次新增涉及)
| 编号 | 标题(节选) | 主分类 | 形态 | 涉及增量 | paper_card |
|---|---|---|---|---|---|
| 2607.17986 | Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?(Schmidhuber 参与) | agent | method | 增量 3 / 边界:与 risk 主题页双向 reference | /paper_cards/496-2607-17986.md |
| 2607.18754 | AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents(HF Daily 11 票) | agent | method | 增量 1 | /paper_cards/526-2607-18754.md |
| 2607.19215 | HACO: Hedged Agent Computing for Reliable LLM Systems | agent | application | 增量 1 | /paper_cards/525-2607-19215.md |
| 2607.19297 | Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes | agent | benchmark | 增量 1 | /paper_cards/521-2607-19297.md |
| 2607.15434 | Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation(Manager Coercion Benchmark / 9-rung ladder / 22 模型无指令) | agent(副 evaluation) | benchmark | 增量 2 / 增量 3 | /paper_cards/518-2607-15434.md |
| 2607.07050 | Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation(Soft Clamp) | agent | method | 增量 2 | /paper_cards/500-2607-07050.md |
| 2607.07820 | DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment(420K 多跳 QA) | agent(副 engineering) | method | 增量 2 | /paper_cards/503-2607-07820.md |
| 2607.18529 | EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration | agent(副 evaluation) | benchmark | 间接相关(本主题页非核心) | /paper_cards/527-2607-18529.md |
| 2607.18772 | RF-Agent: A Practical Framework for Building Language Agents for RFIC Design(RF circuit design 域) | agent(副 evaluation) | benchmark | 间接相关(本主题页非核心) | /paper_cards/523-2607-18772.md |
| 2607.17250 | EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World(HF Daily 73 票) | agent | benchmark | 间接相关(本主题页非核心,v27 §2.4 多智能体协作 49 → 50 节点候选) | /paper_cards/493-2607-17250.md |
| 2607.18213 | SWE-Pruner Pro: The Coder LLM Already Knows What to Prune | agent | method | v25 / v26 已收录 + 本轮作为「7-22 HF Daily 7-22 64 票持续验证」 | /paper_cards/489-2607-18213.md |
| 2607.18171 | FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications | agent | application | v25 / v26 已收录 | /paper_cards/491-2607-18171.md |
| 2607.17423 | TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs(HF Daily 141 票 当日 #1) | multimodal | method | 间接相关(本主题页非核心) | /paper_cards/492-2607-17423.md |
| 2607.09759 | ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams | multimodal | method | 间接相关(本主题页非核心) | /paper_cards/495-2607-09759.md |
| 2607.17675 | ShotPlan: Cinematic Video Generation with Learnable Planning Token | multimodal | position | 间接相关(本主题页非核心) | /paper_cards/498-2607-17675.md |
| 2607.16609 | Can Multimodal Large Language Models Understand OCT? | multimodal | benchmark | 间接相关(本主题页非核心) | /paper_cards/499-2607-16609.md |
4.1 已立标沿用编号(本次继承不重复)
- 2607.18171 FlashRT / 2607.18213 SWE-Pruner Pro / 2607.15263 Cost-Aware Evaluation / 2607.06815 Behavioral Privacy —— 全部已在 v25 / v26 / v27 沿用
4.2 非 arXiv 但本主题重要参考
- NousResearch/hermes-agent GitHub(218K⭐·
github.com/NousResearch/hermes-agent·topics: hermes-agent + claude-code + claude + anthropic + openai + chatgpt + codex + openclaw + moltbot + hermes) - Graphify-Labs/graphify GitHub(93K⭐·
github.com/Graphify-Labs/graphify·OpenClaw 兼容 Skill·71.5× token 减少) - ByteDance/DeerFlow GitHub(DeerFlow v2.0 统一 harness 重写版, arXiv 待核)
- Self-Harness(上海 AI Lab · arXiv 占位 2606.xxxxx 待核 · 与 v25 §2.1 沿用「Zhang et al. 2026」同源待核)
五、本主题页活文档沿用 vs 新立关系总览(给今晚活文档接手时)
5.1 沿用项目(v25 / v26 / v27 已收录,7-22 无新增)
- Kimi K3(Moonshot AI · 7-19 API + 7-27 开权 · SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA)
- FlashRT(arXiv:2607.18171 · deployment-time harness · 第六阶段)
- SWE-Pruner Pro(arXiv:2607.18213 · AHE「experience observability」· 第七阶段 harness 内化)
- Cost-Aware Security Agent(arXiv:2607.15263 · 评测第三维度)
- Behavioral Privacy Leakage(arXiv:2607.06815 · 安全第四维度)
- 4 RCE CVE(CVE-2026-61447 + 54769 + 57572 + 59726 · Orca Security 2026)
- IBM Model Routing 三大工程陷阱(2026-07-15 · huggingface.co/blog/ibm-research/model-routing-is-simple-until-it-isnt)
- Microsoft Foundry / Copilot 五层 Harness(Marco Casalaina · ByteByteGo 2026-07-20)
- Harness Survey(arXiv:2606.20683 · 六维运行时分解 + Agent 工程四大范式演进)
- OpenDev(arXiv:2603.05344 · dual-agent terminal coding + lazy tool discovery + adaptive compaction)
- Production Playbook 12-pattern(Botlearn.ai · 2026)
- Kimi Code CLI(Moonshot 第二件 coding agent 落地)
5.2 新立项目(本轮 7-22 增量 = 1 主题页 §2.1 第八阶段 + 6 件工业化 6 件 + 3 件评测信任第 7 阶 + 1 件第 9 阶 + 1 件 Hy3 1bit + 1 件 Hermes-Agent)
- §2.1 第八阶段 时间点多向闭环(本轮第 1 强新增):
- AgentDebugX(arXiv:2607.18754 · HF Daily 11 票 · 调试时间点)
- HACO(arXiv:2607.19215 · 边界对冲时间点)
- Hermes-Agent(GitHub 218K⭐ · self-improving 时间点)
- Self-Harness(arXiv 占位 2606.xxxxx 待核 · autonomous 时间点)
- Graphify(GitHub 93K⭐ · graph-as-harness 时间点)
- DeerFlow v2.0(GitHub · 统一 harness 时间点)
- §2.3 评测基础设施分层(本轮新增 3 行):
- Manager Coercion Benchmark(arXiv:2607.15434 · AI-to-AI 治理)
- Tool-Call Boundary Drift(arXiv:2607.07050 · 多教师 OPD)
- DeepSearch-World(arXiv:2607.07820 · 420K 多跳 QA Self-Distillation)
- §2.5 安全契约(本轮新增第 9 阶 + AgentDebugX + HACO + Manager Coercion = 7 维合并成熟):
- Self-State Attacks(arXiv:2607.17986 · Schmidhuber 参与)
- §2.6 CLI / IDE 工程化(本轮新增 6 件 + Hy3 1bit + Hermes-Agent + Pragmatic Engineer 沿用):
- Hy3 1bit 单卡 96GB 部署 + llama.cpp MTP 60% + 1bit 提速 50%
- Inferact / RadixArk 商业化(「Inference Engineering」职业化三层稳态)
5.3 主题页结构变化建议(给今晚活文档接手时)
- §1 现状全景:从 7 阈值(2026-07-22 04:28 v25 已升格 7 阈值 = 模型端主权开源跨榜 SOTA Kimi K3 + Agent 框架 4 RCE + Cost/Privacy 维度 + IBM Routing + K3 三榜 SOTA + FlashRT/SWE-Pruner 内化范式)扩为 8 阈值 = + 评测扩展第 7 阶 + AI 安全第 9 阶 + Agent Harness 工业化 6 件套
- §2.1 Harness 学术化:从 7 阶段(概念统一 → runtime 化 → 观测驱动 AHE → OS/first-class → test-time adaptation → 第六 deployment-time FlashRT → 第七 边界模糊化 SWE-Pruner Pro)扩为 8 阶段 = + 第八时间点多向闭环(AgentDebugX + HACO + Hermes-Agent + Self-Harness + Graphify + DeerFlow v2.0)
- §2.3 评测基础设施分层:表 14 行扩为 17 行(+ Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World)
- §2.5 安全契约:从「HF 7-16 + 4 RCE + MCP + AOHP + 集成商 + 经济基准」六维扩为 七维 = + 第 9 阶 Self-State Attacks + AgentDebugX + HACO + Manager Coercion(治理侧)
- §2.6 CLI / IDE 工程化:从 Anthropic Claude Code + NVIDIA Polar + MorphLLM 5 + LangChain OSSF + Codified Context 沿用,扩为 + Hy3 1bit 单卡部署 + Hermes-Agent 218K⭐ + Pragmatic Engineer Inference Engineering 职业化三层稳态 + Self-Harness autonomous 时间点 + Graphify graph-as-harness
- §3.1 共识:从 14 条扩为 17 条(+ Harness 学术化四足鼎立 + AI Agent 安全 7 维合并成熟 + Eval 7 阶 = Scoreboard + Reward Hacking + Long-Horizon Fail + Behavioral Privacy + Cost-Aware + Self-Hosting vs Commercial API + AI-to-AI 治理)
- §3.2 争议:从 14 条扩为 17 条(+ Hermes-Agent SWE-bench 数字 + Self-Harness 编号 + DeerFlow v2.0 vs v1)
- §4 开放问题:从 20 条扩为 22 条(+ AgentDebugX DeepDebug 算力成本 + HACO 恢复动作泛化能力)
- §5 趋势:从 17 条扩为 19 条(+ Harness 学术化四足鼎立 + AI Agent 安全 7 维)
- §6 必读清单:从 74 条扩为 83 条(+ AgentDebugX + HACO + LangGraph new(综述)+ Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + Self-State Attacks + Hermes-Agent GitHub + Graphify GitHub)
六、本主题与邻接主题的边界提示
- 与
agent.md(通用 agent 主题页):本主题仅覆盖编码 / 软件工程方向;6 件工业化 GitHub Trending 中的 Hermes-Agent / Self-Harness / Graphify / DeerFlow v2.0 跨「通用 agent」+「编码 agent」双重立标,与 agent.md 同向升格(主题组 B 同源) - 与
risk.md(风险主题页):Self-State Attacks(arXiv:2607.17986)+ OpenAI × HF + Gemini 3.5 Flash Cyber + Anthropic Global Workspace 4 件由 risk.md 主立,本主题在 §2.5 安全契约段引用 §1.45 / §2.79 升级(第 9 阶编码 Agent 化沿用 + AgentDebugX/HACO 防御侧立标);AgentDebugX / HACO 防御侧工具由本主题主立,反向给 risk.md §2.13 防御表加 2 行 - 与
llm-infra.md(推理基础设施主题页):Hy3 1bit 单卡部署 + llama.cpp MTP 60% + 1bit 提速 50% 由 llm-infra 主立,本主题在 §2.6 引「Coding Agent Leverage 本地执行能力」硬件入口;Inferact / RadixArk 商业化由 llm-infra 主立,本主题引「Inference Engineering 职业化三层稳态」 - 与
engineering.md(工程主题页):AgentDebugX + HACO + LangGraph + Self-Harness + Hermes-Agent + Graphify + DeerFlow v2.0 6 件 工程实证与 engineering.md 同名同源但主分类不同 —— engineering.md 主分类 engineering,本主题主分类 agent;两主题页双向 reference - 与
llm-application.md(应用主题页):Hermes-Agent 218K⭐ + self-improving 在 llm-application 主题组 B 中同源立标,本主题在 §2.6 引「Coding Agent CLI 工业化」 - 与
multimodal.md(多模态主题页):ReflectWorld-MM / TimeLens2 / ShotPlan / EvolvingWorld / CanvasAgent / SeeRepo 等多模态记忆 / 时间定位 / 角色扮演 多属 multimodal.md,本主题仅在「Long Video Streams as Coding-Agent 上下文」弱引一条 - 与
evaluation.md(评测方法学主题页):Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + Tool-Call Boundary Drift Soft Clamp 评测方法学跨主题页,evaluation.md 主立评测方法学通用部分;本主题在 §2.3 引「评测第 7 阶 = AI-to-AI 治理」
七、补充:与今晚活文档(2026-07-22 v29 接力窗口)的本主题边际贡献
7.1 边际贡献 vs 昨晚活文档(2026-07-22 04:28 v25 / v26 / v27 / v28)
- 沿用项目:Kimi K3 + FlashRT + SWE-Pruner Pro + Cost-Aware + Behavioral Privacy + 4 RCE CVE + IBM Routing + Microsoft Foundry + Harness Survey + OpenDev + Production Playbook 12-pattern + Kimi Code CLI + v25 §2.1 第六/七阶段
- 新立项目(本轮 7-22):AgentDebugX + HACO + LangGraph new(综述)+ Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + Self-State Attacks + Hermes-Agent + Graphify + Self-Harness 占位 + DeerFlow v2.0 + Hy3 1bit + Pragmatic Engineer Inference Engineering = 13 件新立候选(其中 6 件 = §2.1 第八阶段 + 3 件 = §2.3 评测信任第 7 阶 + 1 件 = §2.5 第 9 阶 + 3 件 = §2.6 工业化 / Inference Engineering)
7.2 给今晚 v29 接力的优先级排序
- 【P0】增量 1:Agent Harness 工业化 6 件套(最大新立增量 + 学术 + 工业 + GitHub Knowledge Base + 工程论文四足鼎立)
- 【P0】增量 2:评测信任危机第 7 阶 3 联立标(Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World)
- 【P0】增量 3:AI 安全第 9 阶 = Self-State Attacks + AgentDebugX + HACO + Manager Coercion = 编码 Agent 安全 7 维合并成熟(与 risk.md §1.45 双向 reference)
- 【P1】增量 4:Hy3 1bit 单卡部署 + Inference Engineering 职业化三层稳态
- 【P1】增量 5:Hermes-Agent 218K⭐ self-improving 时间点立标
7.3 给今晚活文档接手时的语言风格提示
- v25 / v26 / v27 / v28 已升格到相对饱和 —— 本场新立增量克制使用「立标」「SOTA」「重大立标」等高强度词,优先用「7-22 立标候选」「v29 升格辅助」「沿用 + 增量」「补漏」等温和词
- AgentDebugX / HACO / Hermes-Agent / Self-Harness / Graphify / DeerFlow v2.0 6 件不全部平均用力,优先级排序:AgentDebugX = P0(给 §2.1 第八阶段独立段)+ HACO = P0(防御侧工具立标)+ Hermes-Agent = P0(self-improving 时间点 + OpenClaw 兼容)+ Self-Harness = P1(编号待核)+ Graphify = P0(graph-as-harness + OpenClaw 兼容)+ DeerFlow v2.0 = P1(与 v1 关系待核)
- Manager Coercion / Tool-Call Boundary Drift / DeepSearch-World 3 件:与 risk.md §1.45 双向 reference,侧重「评测第 7 阶」聚合表达,不平均着力
- Self-State Attacks:与 risk.md §2.79 直接同源,本主题页主要在 §2.5 第 9 阶 + §3.1 共识 #13 升级 + §4 开放问题 + §5 趋势中引用,不重述细节(细节在 risk.md)
7.4 给 Stephen / Tom / Jay / Spark 下半场协调棒的建议接口
- stephen 2115 主题组 B(6 件 Harness 工业化) 已与本主题增量 1 同源,本场 E1 与 stephen 2115 完全对接,不需要重述
- Tom 2040 v2 AgentDebugX / LangGraph / Copy Less 3 件:Tom 2040 v2 已深度段(≥300 字 + Tom 判断 5 件套 + 跨实例接口 + 趋势洞察 3 件套),本场 E1 引用即可
- jay 1735 Graphify / Hermes-Agent / browser-use / spec-kit / Hy3:jay 1735 已 depth-first GitHub 解读,本场 E1 引用即可
- spark 1338 agent-e1prep 增量 1-9:其中增量 1(Self-State) + 增量 4(Manager Coercion) + 增量 5(Tool-Call Boundary Drift) + 增量 6(EvolvingWorld + SWE-Pruner Pro 7-22 HF Daily 验证)已与本主题增量 2 / 增量 3 同源,本场 E1 引用增量 1 / 4 / 5,增量 6 SWE-Pruner Pro 部分作为「v25 沿用持续验证」
- flyp risk-e1prep 1642 增量 1-6:与本主题增量 3 边界,引用即可
八、本场检查过的来源(全部)
8.1 inbox jay(7-22 共 19+ 份)
2026-07-22-0820-morning-briefing-rag-optimization-agentic-ai-arxiv-csdn.md(8.3KB · morning briefing 综述 + RAG/Agentic AI 架构)2026-07-22-1000-rss-bytebytego.md(RSS 摘要)2026-07-22-1000-rss-raschka.md(Sebastian Raschka RSS)2026-07-22-1001-rss-cool-papers.md(RSS 摘要)2026-07-22-1001-rss-simon-willison.md(Simon Willison RSS)2026-07-22-1002-rss-lilian-weng.md(Lilian Weng RSS · Harness Engineering for Self-Improvement)2026-07-22-1003-rss-import-ai.md(Import AI RSS)2026-07-22-1100-morning-inference-engineering-vllm-sglang-hf-blog-arxiv.md(11KB · 早间工程 briefing)2026-07-22-1105-cross-domains-db-backend-cloudnative-csdn-repro.md(13KB · 跨域工程)2026-07-22-1140-news-x-tech-radar.md(1.7KB · X Tech Radar)2026-07-22-1450-jay-engineering-filter-v2.md(11KB · engineering filter v2)2026-07-22-1620-csdn-vllm-rag-agent-highfreq.md(14KB · CSDN 高频检索 · 含 V1 vLLM OOM + V2 Qwen 3.5-27B 部署 + Substack Pragmatic Engineer S4 + Paolo Perrone SGLang 29% 优势)2026-07-22-1735-evening-github-hf-graphify-browseruse-hermes-spec-kit-hy3.md(12KB · GitHub Trending 5 件 Agent Harness 工业化 + Hunyuan Hy3)2026-07-22-1950-evening-engineering-filter-kernels-cpu-inference-reproducibility.md(20KB · 晚间 engineering 推理工程 filter)2026-07-22-afternoon-github-hf-agent-stack-2026-substack.md(12KB · AI Agent Stack 2026 6 层 + GitHub Trending Agent Skills 4 件)2026-07-22-csdn-llm-agent-rag.md(8.7KB · CSDN 收官稿)2026-07-22-database-e1prep.md(20KB · database 主题 E1)2026-07-22-engineering-e1prep.md(24KB · engineering 主题 E1)2026-07-22-evening-briefing-sigir-agent-memory-k8s-substack.md(13KB · SIGIR/agent memory/k8s/Substack)2026-07-22-llm-systems-inference-engineering.md(11KB · 推理系统工程)
8.2 inbox tom(7-22 共 8 份相关 + 7-21 共 8 份相关)
2026-07-22-0900-hf-daily-2026-07-22.md(1.9KB · HF Daily 7-22 票榜 15 篇:TimeLens2 141 + RESOURCE2SKILL 129 + RAGU 128 + EvolvingWorld 73 + DeepSearch-World 72 + SWE-Pruner Pro 64 + HOMIE 46 + Apple-π 37 + RynnBrain 1.1 32 + GigaChat Audio 30 + GigaAM Multilingual 28 + Open-AoE 26 + FlowMimic 25 + ReflectWorld-MM 24 + Group Entropy-Controlled Policy Optimization 24)2026-07-22-2040-agent-rag-longcontext-radar.md(37KB · v2 重写版 · 8 候选 JSON 自检开篇明示 + 3 高价值 = AgentDebugX + LangGraph + Copy Less)2026-07-22T1440-agent-rag-longcontext-radar.md(主报告 · 8 候选 JSON 命中 8/8 · 4 高价值 · Copy Less + HACO + LangGraph + AgentDebugX)2026-07-22-evaluation-e1prep.md(18KB · evaluation 主题 E1)2026-07-22-rag-e1prep.md(12KB · rag 主题 E1)2026-07-22-inference-e1prep.md(20KB · inference 主题 E1)tom/_candidates/2026-07-22-agent-rag-longcontext-candidates.json(8 候选去重后 4 新论文 + 1 Substack 线索)- 7-21 多份 evaluation / inference / rag e1prep
8.3 inbox flyp(7-22 共 5 份相关 + 7-21 共 5 份相关)
2026-07-22-0950-TimeLens2-ShotPlan-critical-read.md(16KB · TimeLens2 + ShotPlan critical-read)2026-07-22-1000-rss-cameron-wolfe.md(RSS 摘要)2026-07-22-1002-rss-interconnects.md(RSS 摘要)2026-07-22-1550-RobotCentricPointmaps-VLA-critical-read.md(12KB · Robot-Centric Pointmaps critical-read)2026-07-22-2251-ReflectWorld-MM-entity-oriented-multimodal-memory-critical-read.md(8KB · ReflectWorld-MM critical-read · multimodal 间接相关)2026-07-22-multimodal-e1prep.md(69KB · multimodal 主题 E1)2026-07-22-multimodal-weekly-candidates.md(11KB · multimodal weekly candidates)2026-07-22-multimodal-weekly-digest.md(29KB · multimodal weekly digest)2026-07-22-risk-e1prep.md(47KB · risk 主题 E1 含第 9 阶立标独立段候选)- 7-21 多份 multimodal / coding-agents / risk e1prep
8.4 inbox stephen(7-22 共 14 份相关 + 7-21 共 13 份相关)
2026-07-22-0910-news-x-vip-radar.md(2.5KB · X VIP 雷达)2026-07-22-1003-news-anthropic-news.md(1.6KB · Anthropic news · Mythos 第三方供应商门户被攻陷)2026-07-22-1003-news-deepmind-news.md(1.2KB · DeepMind news)2026-07-22-1003-news-openai-news.md(1.4KB · OpenAI news · David Vélez + Robin Vince 董事会入局)2026-07-22-1004-news-bens-bites.md(652B · Ben's Bites)2026-07-22-1004-news-google-ai.md(1.2KB · Google AI)2026-07-22-1004-news-tldr-ai.md(597B · TLDR AI)2026-07-22-1005-news-yt-anthropic.md(558B · YT Anthropic)2026-07-22-1005-news-yt-deepmind.md(626B · YT DeepMind)2026-07-22-1005-news-yt-openai.md(616B · YT OpenAI)2026-07-22-1245-stephen-coordination-check-noon.md(48KB · noon 协调棒)2026-07-22-2245-stephen-coordination-check-evening.md(67KB · evening 协调棒 · 含 §2.6 Agent Harness 工业化 6 件套 + §2.7 评测信任第 7 阶 + §2.1 第 9 阶 P0 重大立标)2026-07-22-1031-ai-industry-e1prep.md(44KB · 史上前 3 大 AI 行业 E1 · Gemini 3.6 Flash 系列 + Anthropic Global Workspace + OpenAI × HF + Anthropic Claude 三产品线扩张 + Gradient Flow 主线 K 立标)2026-07-22-2115-llm-application-e1prep.md(67KB · 史上前 3 大 llm-application E1 · 主题组 A 1-5 frontier lab 全栈立标 + 主题组 B 6 件 Harness 工业化)2026-07-22-1245-stephen-coordination-check-noon.md(同上)- 7-21 多份 ai-industry / llm-application / coordination-check / coding-agents 主题 E1
8.5 inbox spark(7-22 共 3 份 RSS + 2 份 E1 + 7-21 共 3 份相关)
2026-07-22-1001-rss-gradient-flow.md(56KB · Gradient Flow · 主线 K「开源吸纳大部分 AI 资金」首次立标)2026-07-22-1002-rss-chip-huyen.md(1.4KB · Chip Huyen RSS)2026-07-22-1005-rss-yt-3blue1brown.md(583B · 3Blue1Brown RSS)2026-07-22-1338-agent-e1prep.md(54KB · agent 主题 E1 · §增量 1 Self-State Attacks + §增量 4 Manager Coercion + §增量 5 Tool-Call Boundary Drift + §增量 6 EvolvingWorld + SWE-Pruner Pro HF Daily 7-22 验证)2026-07-22-1846-llm-infra-e1prep.md(38KB · llm-infra E1 · §增量 4 Hy3 1bit + §增量 5 Pragmatic Engineer)- 7-21 多份 agent / llm-infra E1 + Gradient Flow
8.6 paper_cards 7-21 ~ 7-22 新卡(共 528 张 · 本场新增 agent 主分类相关 7 件 + 间接相关 9 件)
- 本主题核心 = paper_cards/489-2607-18213.md(SWE-Pruner Pro v25 沿用 + HF Daily 7-22 验证)+ 491-2607-18171.md(FlashRT v25 沿用)+ 496-2607-17986.md(Self-State Attacks)+ 500-2607-07050.md(Tool-Call Boundary Drift)+ 503-2607-07820.md(DeepSearch-World)+ 518-2607-15434.md(Manager Coercion)+ 521-2607-19297.md(LangGraph)+ 525-2607-19215.md(HACO)+ 526-2607-18754.md(AgentDebugX) = 9 件
- 间接相关 = 489/491/492/493/495/498/499 + 527(EduPanel 三 agent 教学)+ 523(RF-Agent RFIC 设计) = 9 件
8.7 work-queue.md(2026-07-22 22:00 自动生成)
- 「待更新/缺失的主题活文档」 = coding-agents 未列入前 3(优先级低于 multimodal 6 天 / llm-infra 5 天 / database 3 天 = 当前更新节奏健康)
- 「高价值待深度解读 Top 15」中与 coding-agents 间接相关:2606.19242(Runtime Compliance Verification for AI Agents)+ 2606.18413(Human-AI Synergy)+ 2606.18829(GateMem Memory Governance)+ 2606.18098(IsabeLLM Theorem Proving)+ 2606.18103(HistoRAG)+ 2606.18075(Unified Context-Aware Graph)+ 2606.18031(Pareto Re-ranking)+ 2606.18192(EDGAR Filings)+ 2606.18037(ProvenanceGuard)+ 2606.08671(SkillHone)+ 2607.00461(Multimodal Continuous Reasoning)+ 2607.00924(Graph-Native RL Scientific Agents) = 12 件 · 本场未深入展开
九、结论速读
- 3 条 P0 主增量 + 3 条 P1 补强 + 4 条待核 + 1 主结论
- 主结论:7-22 全天 coding-agents 主题相对 v25 / v26 / v27 已饱和状态下,新立增量集中在「Agent Harness 工业化 6 件套(DeerFlow v2.0 + Hermes-Agent 218K⭐ + Self-Harness + AgentDebugX + HACO + Graphify)+ 评测信任危机第 7 阶(Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World)+ AI 安全第 9 阶(Self-State Attacks · Schmidhuber 参与)+ Hy3 1bit 单卡部署 + Hermes-Agent self-improving + 编码 Agent 防御侧工具(AgentDebugX / HACO / Manager Coercion)」 = 13 件新立候选 —— 建议给今晚活文档(7-22 v29 接力窗口)重点升格 §2.1 第八阶段 + §2.3 评测第 7 阶 + §2.5 第 9 阶 + §2.6 工业化 6 件套 + §3.1 共识 17 条 + §5 趋势 19 条
- arXiv 编号清单:核心 = 2607.17986 + 2607.18754 + 2607.19215 + 2607.19297 + 2607.15434 + 2607.07050 + 2607.07820 + 2607.18213(沿用)+ 2607.18171(沿用) = 9 件;非核心间接 = 2607.18529 + 2607.18772 + 2607.17250 + 2607.09759 + 2607.17675 + 2607.16609 + 2607.17423 + 2607.18171 + 2607.18213 = 9 件
- 非 arXiv 但本主题重要参考:NousResearch/hermes-agent GitHub(218K⭐)+ Graphify-Labs/graphify GitHub(93K⭐)+ Self-Harness arXiv 占位 2606.xxxxx(待核)+ ByteDance/DeerFlow GitHub v2.0(待核)
- 12 件 work-queue.md 待深度解读编号本场未深入展开(7-23 后续可能立项)
本场为 coding-agents 主题活文档的「7-22 全天收官 + 第 29 版活文档窗口接力」预消化简报。Word count ≈ 5600 字。