coding-agents · E1 预消化简报(2026-07-21)

作者:flyP(🀄) 触发:cron 7a0c0a42-eb2e-4bcd-af74-634628039865 · 研究知识库 E1 预消化 · 每天 23:20 主题:coding-agents(活文档 /shared/research-kb/organized/knowledge/coding-agents.md 末轮 Wave4 E2 后,v25 已饱和) 窗口:近 2 天(2026-07-19 ~ 2026-07-21)· 重点扫 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 477-495 近 3 天新卡 结论速读:3 条 coding-agents 主题新立增量 + 2 条旁证 + 4 条待核实说法;主题页主线 §2.1(Harness 学术化)/ §2.2(模型与基座)/ §2.3(评测基础设施)/ §3.1(共识)有可更新入口,但 v25 已饱和(§1 全景 + §2.1 ~ §2.6 六大主线 + §3.1 共识 11 条 + §3.2 争议),7-21 属"补漏 + 反方 + 行业数据 + 模型端 SOTA"性质,不应强行升格


一、近 2 天本主题素材清单(已扫,逐项给出增量强度)

# 来源文件 类型 与本主题关系 增量强度
1 inbox/jay/2026-07-21-1735-evening-briefing-github-trending-substack-agent-stack-hf-blog-w11-papers.md §二(AI Agent Stack 2026 6 层)+ §一(addyosmani/agent-skills + mattpocock/skills + Google stitch-skills + davila7/claude-code-templates) 工程 briefing Substack 6 层架构 + GitHub Trending Agent Skills 4 件 ⭐⭐
2 inbox/jay/2026-07-21-2105-evening-briefing-hf-security-kimi-k3-vector-db-inference-stack.md §二(Kimi K3 完整规格 + SWE Marathon 42.0 SOTA + Program Bench 77.8 SOTA + Terminal-Bench 88.3) 工程 briefing Coding Agent 模型端 7-19 Kimi K3 落地 + 7-27 开权 + SWE/Program/Terminal 三榜 SOTA ⭐⭐⭐⭐⭐
3 inbox/stephen/2026-07-21-1003-news-tldr-ai.md §1.2(Kimi Code CLI · Moonshot 第二件 coding agent 落地 · 7-19 Kimi K3 之后) news 通稿 CLI Coding Agent 家族新节点 + 与 v25 Codex CLI arXiv:2607.09424 Soofi 30B-A3B + v25 §1.2 主线 ① Coding Agent 同源 ⭐⭐⭐⭐
4 inbox/jay/2026-07-21-1950-jay-engineering-filter.md #2 AHE(arXiv:2604.25850)+ #3 OpenDev(arXiv:2603.05344 dual-agent terminal coding)+ #4 Survey on Harness Design(arXiv:2606.20683)+ #7 Agent Harness Architecture 12-pattern 工程 filter AHE「experience observability」/ OpenDev dual-agent / Harness Survey 六维分解 / Production Playbook 12-pattern = Harness 工程化 4 件平行证据 ⭐⭐⭐⭐
5 paper_cards/489-2607-18213.md SWE-Pruner Pro(主分类 agent · 形态 method · 7-21 新卡) paper_card SWE-Pruner Pro 把 pruning 从外挂 classifier 改为「agent 自身 internal representation → keep-or-prune label」 = AHE「experience observability」的具体落地证据 ⭐⭐⭐⭐
6 paper_cards/491-2607.18171.md FlashRT(主分类 agent · 形态 application · 7-21 新卡) paper_card FlashRT「Agent Harness for Real-Time Multimodal Apps」把 serving 系统 / auto-parallelism compiler 不足的「deployment-time harness」补完 = 与 v25 §2.1「evaluation-time harness」两侧闭环 ⭐⭐⭐⭐
7 inbox/spark/2026-07-21-agent-e1prep.md §增量 1(arXiv:2607.15263 Cost-Aware Evaluation)+ §增量 2(arXiv:2607.06815 Behavioral Privacy)+ §增量 4(Lilian Weng Harness Engineering)+ §增量 5(Databricks 79%/11%)+ §增量 8(AI 安全三向合流) spark E1 4 件均与 coding-agents 间接相关(评测侧 + 安全侧 + 行业侧) ⭐⭐⭐
8 inbox/stephen/2026-07-21-2245-stephen-coordination-check-evening.md §SWE-Pruner Pro + §FlashRT(2 件 coding-agents 平行证据)+ §Kimi K3 §1.2 Coding Agent 第十一节点候选 stephen 协调棒 engineering.md 45 +14 信号中明确 2 件 coding-agents 主线 + Kimi K3 §1.2 主线 ① Coding Agent 子方向 ⭐⭐⭐
9 inbox/jay/2026-07-21-1335-afternoon-briefing-hf-blog-github-trending-jul2026.md §三(IBM Model Routing 三大陷阱)+ §一 GitHub Trending cognee / topoteretes/cognee 工程 briefing IBM Model Routing 三大陷阱 = 与 v25 §2.5 工业级 Harness ≠ Model 8 件套合流 + cognee 是 Agent 持久化记忆平台具体实现路径 ⭐⭐
10 inbox/tom/2026-07-21-evaluation-e1prep.md §3.5 / 3.6 / 3.7 / 3.8(Cost-Aware + Behavioral Privacy + SpecBench + LoCoBench-Agent 4 件评测 + Hacking_gap) tom E1 已在 7-20 e1prep 沿用 LoCoBench-Agent / SpecBench;7-21 仅 Cost-Aware + Behavioral Privacy 是 v26 未沿用新立 ⭐⭐
11 paper_cards/481-2607-16603.md NOWJ@COLIEE(法律检索四阶段 · 主分类 rag) + paper_cards/485-2607-11933.md Cross-Encoder Reranking + paper_cards/482-2607-15263.md Cost-Aware + paper_cards/487-2607-06815.md Behavioral Privacy paper_card 扫描 仅 Cost-Aware + Behavioral Privacy 与 coding-agents 间接相关(评测维度)
12 inbox/spark/2026-07-21-1001-rss-gradient-flow.md 主线 E「AI 编程工具效率」连续第 5 天确认 spark RSS Gradient Flow 把 coding agent = 主线 E = 主线 D(AI 工具 / dev-tools)的下层子主线,连续 5 次确认进入稳定期

二、今日 coding-agents 主题最重要的 3 条新立增量 + 2 条旁证(每条:来源 / 要点 / 与活文档现有脉络的关系 / 建议归入哪一节)

增量 1 ⭐⭐⭐⭐⭐ — Kimi K3:7-19 开 API + 7-27 开权 + SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA(Moonshot AI · 2.8T MoE + MXFP4 QAT + 1M context)

  • 来源:
    • inbox/jay/2026-07-21-2105-evening-briefing-hf-security-kimi-k3-vector-db-inference-stack.md §二(完整规格 7 段:KDA + AttnRes + Stable LatentMoE 896 experts + Per-Head Muon + SiTU + Gated MLA + MXFP4 权重 / MXFP8 激活 QAT)
    • inbox/spark/2026-07-21-agent-e1prep.md 间接索引(jay 2105 §二 = Kimi K3 完整版 · spark 标注 2105 档为「Kimi K3 完整 4 段 + 架构 + 量化 + benchmark」权威源)
    • inbox/stephen/2026-07-21-1245-stephen-coordination-check-noon.md §1.2 Coding Agent 第十节点候选
    • inbox/stephen/2026-07-21-2245-stephen-coordination-check-evening.md §1.2 Coding Agent v32 第十节点候选
  • 要点:
    • 模型端:Moonshot Kimi K3(7-19 API + 7-27 开权)· 2.8 万亿总参 + 50B 激活等效 + 1M context + MXFP4 权重 + MXFP8 激活 = QAT 而非 PTQ(从 SFT 阶段起学 compensated quantization error)
    • 架构创新:KDA(Kimi Delta Attention = 混合线性注意力 · 在 1M ctx 中保持关键层全表达能力)+ AttnRes(Attention Residuals = 选择性残差 + 各层可从任意更早层检索表征 · 对 MoE 尤其有效)+ Stable LatentMoE(896 experts / 每 token 16 激活 · latent-space routing + Quantile Balancing + soft dropping)+ Per-Head Muon optimizer + SiTU(Sigmoid Tanh Unit 替代 GeLU/SwiGLU)+ Gated MLA(内存高效 KV-cache)
    • Coding 三榜 SOTA:① SWE Marathon 42.0(全场最高)Program Bench 77.8(全场最高)Terminal-Bench 2.1 88.3(仅差 GPT-5.6 Sol 0.5 分) — 这是 v25 §2.2 闭源旗舰段落的 Open-source 对位项(此前 Claude Mythos 5 / Opus 4.8 / GPT-5.6 Sol 占据)
    • 推理部署:8 节点 × 8×H100/B200 = 5.12 TB 总显存;Mooncake disaggregated inference prefill/decode 分离 + coding workload cache hit rate 90%;vLLM / TensorRT-LLM / SGLang 需 patch 以支持 896-expert 路由
    • 已知局限性:① 思考历史敏感(agent harness 截断 / 修改 CoT → 质量显著下降)② 过度主动(模糊场景倾向行动而非请求澄清 · MoE 模型 action-oriented specialization)③ UX 差距(主观体验仍落后 Claude Fable 5 / GPT-5.6 Sol)
  • 与活文档现有脉络的关系:
    • 主题页 §2.2 闭源旗舰段已固化 Claude Fable 5(93.6 #1) / Mythos 5(90.5) / Opus 4.8(89.9) / GPT-5.6 Sol(95.35 公开 ARC-AGI-3 / 7.78 半私有) / Gemini 3.1 Pro / TongAgents 80.2% TB 2 — K3 第一次让开源 2.8T 模型在 SWE Marathon + Program Bench 双榜领先全场
    • 主题页 §2.2 开源/开放权重段已固化 GLM-5.2(1M ctx · PostTrainBench 仅次 Opus 4.8)+ DeepSeek v4 + Qwen3.5-4B + Kimi K2.5/K3(此前 K2.5 占位);K3 取代 K2.5 立标为 2026 H2 开源 Coding Agent 模型端最强
    • 主题页 §1 现状全景第 2 条提到「模型端 1M context 标准化」+ 第 5 条提到「agentic long-trajectory RL 拐点」+ 第 6 条提到「Karpathy December hypothesis 12 月拐点」 — K3 = 2026-07 中期开源 SOTA,与闭源三巨头(Fable 5 / GPT-5.6 / Mythos 5)在 SWE Marathon + Program Bench 同档同台
    • 主题页 §2.6 CLI / IDE harness 工程化段已有 Kimi K2 长上下文 agent 先驱;K3 的「思考历史敏感」警告与 §2.1 Harness Engineering 的「editable OS abstraction boundaries 被打破」安全警示同根
    • 主题页 §3.1 共识 #11「Coding Agent 在 ML Infrastructure 层的真实能力远低于 benchmark 数字」(Atrex-Bench 6 个前沿 Coding Agent roofline ~10%) — K3 与 K3 配套 Kimi Code CLI 一起构成「模型端 + 部署端」双轮,为 Atrex-Bench 实证提供可能的反方:开源超大模型可能在 ML Infra 层 roofline 上仍存在,但 K3 是 K2.5 之后第一次给出 SWE Marathon + Program Bench 双榜 SOTA
  • 建议归入哪一节:
    • §2.2 模型与基座「开源 / 开放权重 拐点」段新增一行:Kimi K3(Moonshot AI · 2.8T MoE + MXFP4 QAT + 1M ctx · 7-19 API + 7-27 开权 · SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3)
    • §1 现状全景第 2 条末尾追加「Kimi K3 2026-07 让开源 2.8T 模型在 SWE Marathon + Program Bench 双榜领先全场,跨过 Claude Mythos 5 / Opus 4.8 / GPT-5.6 Sol 在 agentic coding 三榜 SOTA 共同占位
    • §2.6 CLI / IDE harness 工程化段末新增「Kimi Code CLI(Moonshot 第二件 coding agent 落地,7-19 Kimi K3 之后)· 与 v25 Codex CLI arXiv:2607.09424 Soofi 30B-A3B 主权开源 + v25 §1.2 主线 ① Coding Agent 子方向同源 · CLI 单工具稳定性(7-15 Anthropic Claude 嵌套编辑结构格式错误增加)需 7-22 ~ 7-25 跟踪」
    • §3.1 共识新增一条「开源 Coding Agent 模型端 SOTA 在 2026-07 已跨过闭源三巨头在 SWE/Program 两榜上的领先位 — Kimi K3(Moonshot 2.8T MoE + MXFP4 QAT)在 SWE Marathon 42.0 / Program Bench 77.8 双榜领先全场,与 Claude Mythos 5 / Opus 4.8 / GPT-5.6 Sol 同档同台」
    • §4 开放问题新增「K3 开权后是否引发 coding agent 模型端新一轮军备竞赛 — 7-27 开权前是否需要评估 DeepSeek v5 / Qwen4 / GLM-6 的同步升级节奏」
    • §6 必读清单新增第 48 条:「Kimi K3 HF Community Blog(ResterChed,2026-07-16,7-27 开权前架构与 benchmark 全文)· 与 Kimi K3 完整规格 / SWE/Program/Terminal-Bench 三榜 SOTA 同根」

增量 2 ⭐⭐⭐⭐ — FlashRT(arXiv:2607.18171):deployment-time agent harness 范式补完 evaluation-time harness 缺口

  • 来源:
    • paper_cards/491-2607-18171.md(主分类 agent · 形态 application · 7-21 新卡 · TLDR 完整)
    • inbox/stephen/2026-07-21-2245-stephen-coordination-check-evening.md §rag §闪 2607.18171(明示「deployment-time harness vs v31 #82「evaluation-time harness」两侧闭环」)
    • inbox/jay/2026-07-21-2105-evening-briefing-hf-security-kimi-k3-vector-db-inference-stack.md 间接索引
  • 要点:
    • 核心定义:Real-time multimodal applications(voice agents + interactive video generation)= heterogeneous model pipelines,deployment-time decisions(placement, streaming, intra-model parallelism)需要 application-specific 优化
    • 痛点:现有 serving 系统 + auto-parallelism compiler 限于 fixed workload + limited transformations,新 application 实现高效部署需要手写 hand-crafted implementation
    • 解法:FlashRT = agent harness · guides coding agents to lift simple developer-written reference implementation → 高效并行实现自动部署
    • 范式意义:与 v25 §2.1 中 AHE(arXiv:2604.25850)「evaluation-time harness」并列 — deployment-time harness 是 harness 学术化第二阶段(2026 H2)的全新范式分支,把 harness 从「评测期优化」推到「部署期自动化」
  • 与活文档现有脉络的关系:
    • 主题页 §2.1 Harness 学术化五阶段(概念统一 / runtime 化 / 观测驱动 / OS first-class / test-time adaptation + 反方 + 工业级长上下文评测 / 综述收口)— FlashRT 提供了「deployment-time」分支,是 §2.1 五阶段之外的「第六阶段:deployment-time harness」新分支
    • 主题页 §2.4 后训练与训练-评测双闭环提到「Stratum(arXiv:2603.03589)统一系统基础设施,在 agentic pipeline 搜索期间执行与规划/推理解耦」 — FlashRT 是 Stratum 思路在 deployment 层的具体实现
    • 主题页 §2.6 CLI / IDE harness 工程化段已列出 Anthropic Claude Code / NVIDIA Polar / MorphLLM 5 组件 / LangChain Open-Source Software Factory / LlamaIndex Retrieval Harness / Codified Context 三件套 — FlashRT 把「harness」从 CLI/IDE/检索层推到 deployment 自动化层
  • 建议归入哪一节:
    • §2.1 Harness 学术化末尾追加「第六阶段 deployment-time harness 范式分支」:FlashRT(arXiv:2607.18171)· 2026-07-21 · 与 AHE「evaluation-time harness」两侧闭环
    • §2.3 评测基础设施分层新增一行:FlashRT(arXiv:2607.18171 · 7-21) · deployment-time harness · heterogeneous multimodal pipeline
    • §3.1 共识新增一条「Harness 学术化已从 evaluation-time 单边推进到 evaluation × deployment 双边闭环 — AHE(evaluation-time)+ FlashRT(deployment-time)2026-07 同时立标」
    • §4 开放问题新增「deployment-time harness 与 evaluation-time harness 的耦合关系 — FlashRT 是否会被新 baseline(如 vLLM V2 / SGLang v2)内化,还是作为外挂 harness 长期存在」
    • §6 必读清单新增第 49 条:「arXiv:2607.18171 FlashRT · deployment-time agent harness · 与 AHE(arXiv:2604.25850)并列」

增量 3 ⭐⭐⭐⭐ — SWE-Pruner Pro(arXiv:2607.18213):AHE「experience observability」具体落地证据(agent 自身 internal representation → keep-or-prune label)

  • 来源:
    • paper_cards/489-2607-18213.md(主分类 agent · 形态 method · 7-21 新卡 · TLDR 完整)
    • inbox/stephen/2026-07-21-2245-stephen-coordination-check-evening.md §engineering 45 +14 中明确「SWE-Pruner Pro = AHE 「experience observability」具体落地证据」
    • inbox/jay/2026-07-21-1950-jay-engineering-filter.md #2 AHE 段间接索引(arXiv:2604.25850 三支柱可观测性架构)
  • 要点:
    • 痛点:Pruning long context for coding agents 是 efficient context management 的关键技术;现有 SWE-Pruner 类方法是外挂 separate code classifier 做 pruning
    • 新发现:Agent 自身内部表征已编码「工具输出相关性」信号 — 阅读 tool output 时,agent 的 internal representations 已经能 indicate code context 的 relevance
    • 解法:SWE-Pruner Pro = 直接在 agent 内部 prune tool outputs:a small head 把 agent 自身 internal representations 转化为 keep-or-prune label per line + length-aware embedding keyed to each token
    • 范式意义:从「外挂 classifier」到「agent 自身内化」的范式转换 — 这是 AHE(arXiv:2604.25850)「experience observability」的具体落地证据:agent 自身内化 = harness 与 model 不再严格分离
  • 与活文档现有脉络的关系:
    • 主题页 §2.1 Harness 学术化段提到 AHE(arXiv:2604.25850)三支柱(Component / Experience / Decision)+ 「frozen harness 在 SWE-bench-verified 用 12% 更少 token 拿到 aggregate 第一」 — SWE-Pruner Pro 把「Experience observability」从「离线压缩为层次化证据库」推到「agent 实时内化表征」
    • 主题页 §3.2 争议 #1 「Harness Evolution 是否带来泛化提升」正面 AHE vs 负面 Harness Evolution — SWE-Pruner Pro 是「Harness Evolution 反方」的潜在反方:harness 完全可以内化进 agent,无需外挂
    • 主题页 §2.4 后训练与训练-评测双闭环提到「MAGE / MRAgent / Memanto / ReMemR1 / AutoMem / SkillHone / Codified Context」等记忆 / 长视野工作 — SWE-Pruner Pro 与 SkillHone 思路同源:agent skill / 表征内化 = harness 与 model 边界模糊化
  • 建议归入哪一节:
    • §2.1 Harness 学术化「AHE 阶段」段末新增一条:SWE-Pruner Pro(arXiv:2607.18213 · 7-21)· agent 自身 internal representation 内化 keep-or-prune = AHE「experience observability」具体落地
    • §2.4 后训练与训练-评测双闭环「记忆 / 长视野」段末尾追加一行:SWE-Pruner Pro(arXiv:2607.18213) = agent 自身表征内化 pruning · 与 SkillHone 思路同源
    • §3.1 共识新增一条「harness 与 model 的边界正在模糊化 — SWE-Pruner Pro 把 pruning 从外挂 classifier 内化为 agent 自身 internal representation,呼应 AHE「experience observability」」
    • §3.2 争议新增一条「Harness 是否最终内化为 Model 的子模块 — SWE-Pruner Pro 内化证据 vs Harness Evolution 反方的「harness 不是 model-specific tuning」主张:两者可以并存 = 内化后仍存在 model-specific 适配层
    • §4 开放问题新增「SWE-Pruner Pro 内化表征是否在跨模型迁移时仍有效 — paper 中如果未做 cross-family 实验,是 7-22 ~ 7-25 必读」
    • §6 必读清单新增第 50 条:「arXiv:2607.18213 SWE-Pruner Pro · agent 内化 pruning · 与 AHE(arXiv:2604.25850)experience observability 呼应」

旁证 1 ⭐⭐⭐ — IBM Research Model Routing 三大工程陷阱(coding-agents 间接关联)

  • 来源:inbox/jay/2026-07-21-1335-afternoon-briefing-hf-blog-github-trending-jul2026.md §三(可信度 ⭐⭐⭐⭐⭐ IBM Research 工程经验 · https://huggingface.co/blog/ibm-research/model-routing-is-simple-until-it-isnt 2026-07-15)+ inbox/spark/2026-07-21-agent-e1prep.md §增量 6
  • 要点(完整版见 spark agent-e1prep):
    • 三大反直觉陷阱:① 成本 ≠ 模型定价(Sonnet $79 vs GPT-4.1 $155 · AppWorld · 缓存复用率 + cache-read 定价)② 复杂度 ≠ 任务难度("总结合同"看似简单实则触发 retrieval + 合规检查 + 工具调用 + 多轮精化)③ 延迟 ≠ 模型速度(路由 overhead + 基础设施因素主导端到端延迟)
    • Coding Agent 关联:CodeAct agent AppWorld Test Challenge 实测数字(Sonnet $79 vs GPT-4.1 $155)是 Coding Agent 模型路由决策的硬证据 — coding agent 工作负载缓存复用率高,Sonnet 的 cache-read 定价优势抵消了 base 价格差和更长轨迹
  • 与活文档现有脉络的关系:
    • 主题页 §3.1 共识 #3「开放权重在 coding agent 上具备结构性竞争力」+ 主题页 §2.5 安全契约段「HF 7-16 入侵事件」 — IBM Routing 是「coding agent 成本经济学」的工业级实证
    • 主题页 §1 现状全景第 3 条「评测基础设施正在分层重构」+ 主题页 §2.6 CLI / IDE harness 工程化段「Coding Agent Leverage + Agents Broke CI Economics」 — IBM Routing 把 routing / cost 维度推到 harness engineering 的「多模型/多 agent」优化层
  • 建议归入哪一节:
    • §2.6 CLI / IDE harness 工程化段末追加「Coding Agent 模型路由 / Cost 三维陷阱(IBM Research,2026-07-15)· 成本 ≠ 定价 / 复杂度 ≠ 难度 / 延迟 ≠ 速度 · 实证 CodeAct agent AppWorld 数字」
    • §3.1 共识新增一条「Coding Agent 工业级生产必须考虑 routing / cost 维度 — IBM Research 三陷阱 + Databricks 79%/11% + Microsoft Foundry 80K/20M = Coding Agent 工业化三件套合并成熟」
    • §5 趋势新增一条「Coding Agent 经济学从模型端基准分数推向模型路由 / cost 三维 — 单一模型最强不再代表真实工业级生产力」

旁证 2 ⭐⭐⭐ — Harness Survey + OpenDev dual-agent terminal coding + Production Playbook 12-pattern(jay 1950 工程 filter 4 件)

  • 来源:inbox/jay/2026-07-21-1950-jay-engineering-filter.md(保留 #2 AHE · #3 OpenDev · #4 Survey · #7 Production Playbook · 丢弃 #5 Code as Agent Harness · #6 Awesome-Agent-Engineering · #8 Raj Nandanan blog)
  • 要点:
    • AHE(arXiv:2604.25850):已在 v25 §2.1 沿用,jay 1950 重申「TB 2 pass@1 69.7% → 77.0% + cross-family +5.1-+10.1pp + SWE-bench-verified frozen harness 用 12% 更少 token 拿到 aggregate 第一」
    • OpenDev(arXiv:2603.05344):dual-agent architecture(planning agent + execution agent 分离)+ lazy tool discovery + adaptive context compaction
    • Survey on Harness Design(arXiv:2606.20683):harness 六维运行时分解(observation / context / control / action / state / verification/governance)+ agent 工程四大范式演进(Prompt → Context → Harness → Agent-Native Training)
    • Production Playbook 12-pattern:plan → act → observe → verify → compact → continue 循环 + 框架对比表(OpenAI Responses API + Agents SDK / Anthropic Claude Code workflows / LangGraph)+ strict tool schemas + bounded retries + per-step checkpoints + deterministic verification
  • 与活文档现有脉络的关系:
    • 主题页 §2.1 Harness 学术化段已固化 AHE;Harness Survey 是 §2.1「综述收口」阶段的同形态证据;OpenDev + Production Playbook 是 §2.6 CLI / IDE harness 工程化段的同形态补强(dual-agent / 12-pattern 与 LangChain Open-Source Software Factory / LlamaIndex Retrieval Harness / Codified Context 同源)
  • 建议归入哪一节:
    • §2.1 Harness 学术化段末追加「Harness Survey(arXiv:2606.20683) 六大范式 + Agent 工程演进四阶段」+「OpenDev(arXiv:2603.05344) dual-agent + lazy tool discovery + adaptive compaction」
    • §2.6 CLI / IDE harness 工程化段末追加「Production Playbook 12-pattern(Botlearn.ai · 2026)· plan-act-observe-verify-compact-continue 循环 + strict tool schemas + bounded retries + per-step checkpoints + deterministic verification」

三、值得警惕的矛盾或待核实说法

3.1 矛盾 1 · Kimi K3 完整规格可信度(⭐⭐⭐⭐⭐ Moonshot 官方 + HF Community · 仍需独立源核)

  • 冲突:jay 2105 引用 HF Community Blog ResterChed/kimi-k3-model-overview-mxfp4-quantization-open-wei 全文(可信度 ⭐⭐⭐⭐⭐)— 但 ResterChed 是 HF Community Blog 作者,不是 Moonshot AI 官方原始技术报告
  • 疑点:7-27 开权前完整规格(2.8T 总参 / 50B 激活 / 1M ctx / MXFP4 QAT / 896 experts)来自 HF Community 而非 Moonshot 官方;KDA / AttnRes / Stable LatentMoE / Per-Head Muon / SiTU / Gated MLA 6 项架构创新均需 Moonshot 官方 arXiv / blog 二次确认
  • 判断:jay 2105 已明示「7-27 开权前需准备推理框架 patch」 = 真实可信度需 7-27 开权后实际验证
  • 建议:agent.md / coding-agents.md §2.2 不直接引用 HF Community Blog 单一来源;待 Moonshot AI 官方 7-27 开权 + Kimi K3 paper_card 建立(可对照 Kimi K2.5 paper_card 历史)

3.2 矛盾 2 · Anthropic Mythos 是否为公开 Claude 系列下一代代号(stephen 0910 + flyp 0951 + spark agent-e1prep §3.2)

  • 冲突:Stephen 0910 news-x-vip-radar 提及「Anthropic 旗舰模型 Mythos 经第三方供应商门户被攻陷」(Bloomberg Law 7-20 + BlueGlass AI 团队 + $30B+ 收入 1400% YoY + 10 月 IPO 传闻 $800B 估值);Anthropic 公开模型系列 = Claude Opus / Sonnet / Haiku,Mythos 不在公开系列
  • 疑点:Mythos 可能是内部代号 / 第三方供应商命名 / 已被废弃早期命名 / 下一代 Claude Opus 5 内部代号
  • 判断:spark agent-e1prep §3.2 已挂「Mythos 是否为公开 Claude 系列下一代代号待核」= 待 Anthropic 官方 blog + Bloomberg Law 原报道 + BlueGlass AI 团队披露原文核验
  • 建议:coding-agents.md §2.2 不直接引用 Mythos 作为公开 Claude 模型;待 Anthropic 官方确认 Mythos = Claude Opus 5 或 Mythos = 独立产品线 / 内部代号

3.3 待核实 · SWE-Pruner Pro 跨模型迁移性(arXiv:2607.18213)

  • 冲突:paper_card #489 TLDR 明确「agent 自身 internal representation → keep-or-prune label」= 单模型内化机制;但 paper 中如果未做 cross-family 实验(Claude / GPT / Gemini / GLM / Qwen / DeepSeek / Kimi),「harness 与 model 边界模糊化」共识可能仅在单模型内成立
  • 建议:Stephen 晚场稿 / Jay 7-22 morning filter / Tom 7-22 0840 radar 任一 PDF 核 arXiv:2607.18213 + cross-family 实验细节;无 cross-family 实验则「agent 内化 pruning = 跨模型可迁移」结论存疑

3.4 待核实 · FlashRT 与 vLLM V2 / SGLang v2 的内化关系(arXiv:2607.18171)

  • 冲突:paper_card #491 TLDR 明确「FlashRT = agent harness that guides coding agents to lift simple developer-written reference implementation」;但是否会被 vLLM V2 / SGLang v2 内化(变 native feature)还是长期作为外挂 harness,paper 中未给出预测
  • 建议:Stephen 晚场稿 / Jay 7-22 morning briefing 任一 PDF 核 arXiv:2607.18171 + 「是否与 vLLM V2 / SGLang v2 / TensorRT-LLM v1.2 团队合作」 + GitHub flash-rt repo 是否公开

四、涉及 arXiv 号列表(本次 coding-agents 主题新增 / 旁证)

arXiv 号 来源 主分类 与 coding-agents.md 关系 沿用候选
arXiv:2607.18171 FlashRT paper_cards/491 + stephen 2245 §闪 agent(application) §2.1 Harness 学术化新增「deployment-time harness 第六阶段」 + §2.3 评测基础设施新增 + §3.1 共识新增 🟢 v25 增量
arXiv:2607.18213 SWE-Pruner Pro paper_cards/489 + stephen 2245 §engineering agent(method) §2.1 Harness 学术化新增「AHE experience observability 具体落地」 + §2.4 后训练新增 + §3.1 共识新增 🟢 v25 增量
arXiv:2604.25850 AHE jay 1950 #2(已 v25 沿用) agent(method) §2.1 Harness 学术化「观测驱动 + 实证窗口」段固化 ✅ v25 已沿用
arXiv:2603.05344 OpenDev jay 1950 #3 agent(method) §2.1 Harness 学术化新增「dual-agent terminal coding」 + §2.6 CLI/IDE harness 工程化新增 🟡 v25 候选(降级)
arXiv:2606.20683 Survey on Harness Design jay 1950 #4 agent(method) §2.1 Harness 学术化「综述收口」段新增 🟡 v25 候选(降级)
arXiv:2606.14589 Silent Failure in Production LLM Agent Runtime jay 1122 + spark agent-e1prep agent(应用) §2.5 安全契约段沿用 ✅ v25 已沿用
arXiv:2607.15263 Cost-Aware Evaluation of Security Agents paper_cards/482 + spark agent-e1prep + tom evaluation-e1prep agent(评测) §2.3 评测基础设施新增「成本-成功率第三维度」+ §2.5 安全契约段新增 🟢 v25 增量(与 §2.5 同根)
arXiv:2607.06815 Behavioral Privacy Leakage in Agentic Negotiation paper_cards/487 + spark agent-e1prep + tom evaluation-e1prep agent(评测) §2.5 安全契约段新增「行为差分隐私第四维度」 🟢 v25 增量(与 §2.5 同根)
arXiv:2511.13998 LoCoBench-Agent flyP 7-20 v2 重写 + tom evaluation-e1prep agent(评测) §2.3 评测基础设施新增「长上下文软件工程 Agent」 + §6.2 必读评测第 6 件 ✅ v25 7-20 沿用
arXiv:2605.21384 SpecBench flyP 7-20 E2 + tom evaluation-e1prep agent(评测) §2.3 评测基础设施新增「reward hacking 量化」+ §2.5 安全契约段补强 ✅ v25 7-20 沿用
arXiv:2607.13705 AgentCompass paper_cards 主分类 agent agent(评测) §2.3 评测基础设施「评测的操作系统」段固化 ✅ v25 已沿用
arXiv:2607.12227 Harness Evolution 反方 paper_cards 主分类 agent agent(评测) §2.1 Harness 学术化「test-time adaptation / 反方实证」段固化 ✅ v25 已沿用
arXiv:2607.14541 Atrex-Bench paper_cards + jay 1950 + spark agent-e1prep agent(评测) §2.3 评测基础设施新增「ML Infra 层 Coding Agent 真实力基线」+ §3.1 共识 #11 沿用 ✅ v25 7-19 沿用
arXiv:2607.14952 LongStraw spark agent-e1prep + stephen 2245 agent(训练) §2.4 后训练与训练-评测双闭环段固化 ✅ v25 已沿用

合计 7-21 coding-agents 主线强增量 3 条(Kimi K3 + FlashRT + SWE-Pruner Pro)+ 旁证 2 条(IBM Routing + Harness Survey/OpenDev/Playbook)= 5 条 vs 昨天(7-20)6 条增量;7-21 性质属"补漏 + 反方 + 行业数据 + 模型端 SOTA"双轮驱动


五、检查过的来源(全部,无遗漏)

5.1 inbox flyp(7-19 ~ 7-21 共 5 份相关)

  • 7-20 0950 UniVR-VR-GRPO E2 精读(已入 multimodal-e1prep · 与 coding-agents 间接相关)
  • 7-20 2127 LoCoBench-Agent v2 + 2251 SpecBench v2(已入 7-20 coding-agents-e1prep · 不再 7-21 重复)
  • 7-21 0950 xHC Hyper Connections Expanded critical-read(主分类 engineering 副 multimodal)
  • 7-21 0951 Substack Interconnects 6 months open models critical-read(主分类 engineering · 与 coding-agents 模型端间接相关)
  • 7-21 1550 CVG compositional video(主分类 multimodal · 不进 coding-agents)
  • 7-21 2251 agent-evaluation-surveys(主分类 agent · 与 coding-agents 评测侧相关)

5.2 inbox jay(7-21 共 14+ 份)

  • 0820 csdn-inference-stack · 1000 inference-stack-netflix-pytorch-dbaas · 1052 jay-engineering-filter
  • 1105 afternoon-briefing-llm-agent-db-cloudnative-jul2026(7 部分:HF 入侵 + Turion.ai vLLM/SGLang 趋同 + GitHub Trending Agent Skills + Databricks 79%/11% + Lilian Weng Harness + Raschka LLM 架构 + HF Papers Trending)
  • 1122 engineering-e1prep(8 增量全工程价值 · 含 arXiv:2606.14589 Silent Failures)
  • 1140 news-x-tech-radar(Direct-OPD + LlamaIndex Retrieval Harness + ParseBench CVPR 2026)
  • 1222 llm-rag-agent-weekly(11 项 CSDN/Substack)
  • 1335 afternoon-briefing-hf-blog-github-trending-jul2026(7 部分:vLLM transformers backend + PyTorch attention profiling + IBM Model Routing 三大陷阱 + cognee + FastMCP + OpenSWE/ParseBench)
  • 1450 jay-engineering-filter(LatencySensitiveBench + AHE + OpenDev + Survey + Playbook)
  • 1500 evening-briefing-cidr-dbhammer-raschka-agentic-rag-hf-ecosystem(Raschka LFM H1 + Agent-Orchestrated Adaptive RAG)
  • 1735 evening-briefing-github-trending-substack-agent-stack-hf-blog-w11-papers(GitHub Trending Agent Skills 4 件 + AI Agent Stack 2026 6 层 + HF W11 Papers)
  • 1950 jay-engineering-filter(AHE + OpenDev + Harness Survey + Production Playbook 12-pattern)
  • 2105 evening-briefing-hf-security-kimi-k3-vector-db-inference-stack(Kimi K3 完整 7 段 + SWE/Program/Terminal-Bench 三榜 SOTA + HF 入侵 + Vector DB 2026)
  • database-e1prep · engineering-e1prep · llm-rag-agent-weekly

5.3 inbox spark(7-21 共 4 份)

  • 1001 rss-gradient-flow(5 篇:新增「中国 AI 出口管制」政策评论 + 主线 A 连续第 4 天缺失)
  • 1002 rss-chip-huyen · 1004 rss-yt-3blue1brown(数学基础无关)
  • agent-e1prep(⭐ 主增量源:Cost-Aware + Behavioral Privacy + Cura 1T + Lilian Weng Harness + Databricks 79%/11% + IBM Routing 三大陷阱 + HF 入侵 + Mythos + 白宫点名 + Cognee + GitHub Trending Agent Skills)
  • llm-infra-e1prep · agent-e1prep · coding-agents 主题(本次输出)

5.4 inbox tom(7-21 共 4 份)

  • 0840 agent-rag-longcontext-radar(8 候选 3 高 3 中 2 低 = Lucid + RESOURCE2SKILL + Behavioral Privacy ⚡高 #3 + Human-Centric RAG + Cost-Aware + REBASE + SVR-R1 + Robot-Centric Pointmaps)
  • 0853 rag-e1prep(9 增量 4 高 5 中)
  • 0900 HF Daily(15 篇 · 含 LongStraw 182 + RESOURCE2SKILL 113 + Cura 1T 43 等)
  • 0900 rag-lite(4 候选 2 高)
  • 1440 agent-rag-longcontext-radar(增量源)
  • 2040 agent-rag-longcontext-radar(增量源)
  • evaluation-e1prep(⭐ 关键源:Cost-Aware + Behavioral Privacy + SpecBench + LoCoBench-Agent + Agentic Adaptive RAG + Human-Centric RAG + Multi-Hop RAG Retriever Eval 7 件 arXiv 列表 + 12 条矛盾与待核实)
  • inference-e1prep · rag-e1prep

5.5 inbox stephen(7-21 共 25+ 份)

  • 0910 news-x-vip-radar(Anthropic Mythos + 白宫点名)
  • 1003 ~ 1005 news × 8 件(Anthropic / OpenAI / Google / DeepMind / HF Blog / tldr-ai / BensBites / yt-openai/anthropic/deepmind)
  • 1003 news-tldr-ai §1.2 Kimi Code CLI(Moonshot 第二件 coding agent 落地)
  • 1003 news-google-ai §扩展 Gemini API Managed Agents 后台任务 / 远程 MCP(与 coding-agents harness engineering 同源)
  • 1245 coordination-check-noon(520 行 + 14 候选 v26 + Lucid + RESOURCE2SKILL + Behavioral Privacy + Human-Centric RAG + Cost-Aware + 4 frontier lab 7-20 ~ 7-21 动作 + §1.2 Coding Agent 第十节点候选 Kimi K3)
  • 2113 llm-application-e1prep(FlashRT + Distilled RL + TOPL 等)
  • 2245 coordination-check-evening(⭐ 关键源:multimodal 37 +2 · rag 48 +7 · engineering 45 +14 · reasoning 4 +3 · mlops/eval 5 +5 · 显式列出 §FlashRT 2607.18171 与 §SWE-Pruner Pro 2607.18213 + Kimi K3 §1.2 Coding Agent 第十节点候选)
  • ai-industry-e1prep · llm-application-e1prep

5.6 paper_cards(序号 488-495,7-21 主分类 agent + coding-agents 命中 2 件)

  • 488-2607.18217 HOMIE(主分类 multimodal · 不进 coding-agents)
  • 489-2607.18213 SWE-Pruner Pro(主分类 agent · 形态 method · 7-21 新卡)· coding-agents 强增量
  • 490-2607.17524 TOPL(主分类 engineering · 副 method)
  • 491-2607.18171 FlashRT(主分类 agent · 形态 application · 7-21 新卡)· coding-agents 强增量
  • 492-2607.17423 TimeLens2(主分类 multimodal)
  • 493-2607.17250 EvolvingWorld(主分类 agent · 形态 benchmark · role-play 与 coding-agents 弱关联)
  • 494-2607.17247 Distilled RL(主分类 engineering · 副 method)
  • 495-2607.09759 ReflectWorld-MM(主分类 multimodal · 形态 method)

六、给今晚活文档接力的总结(本次不重复昨天的 6 条)

6.1 v25 已是 Wave4 E2 后的饱和版本(2026-07-21 23:20 cutoff)

主题页 v25 末轮 Wave4 E2 已固化: - §1 现状全景 6 条主线 + Karpathy December hypothesis + Simon Willison + James Phoenix - §2.1 Harness 学术化 5 阶段 + Microsoft Foundry 五层 + AHE + TTHE + LoCoBench-Agent + SpecBench - §2.2 模型与基座 闭源 + 开源拐点(BenchLM weighted + Claude Fable 5 + GLM-5.2 + DeepSeek v4 + Kimi K2.5/K3 占位 + Qwen3.5-4B + Ring-Zero) - §2.3 评测基础设施 5 层 + LoCoBench-Agent + SpecBench + Atrex-Bench + AgentCompass + AgentLens + Agent-Diff - §2.4 后训练与训练-评测双闭环 工具调用 / Agentic RL 训练栈 + 记忆 / 长视野 + Codified Context + 评测形式化 - §2.5 安全契约 / OS-level / HF 入侵实战(MCP Tool Poisoning + vibe-coded security + 4 CVE + AOHP + arXiv:2606.14589) - §2.6 多模态 / IDE / CLI / 工具退化(Anthropic Claude Code + NVIDIA Polar + MorphLLM 5 + LangChain OSF + LlamaIndex + Codified Context + MSR SkillOpt + Coding Agent Leverage + Agents Broke CI Economics + MCP Tool Poisoning) - §3.1 共识 11 条(Harness first-class + SWE-bench 失真 + 开放权重 + agentic mid-training 解耦 + multi-agent 形式化失败 + public/private 差距 + 评测 infrastructure 解耦 + AHE vs Harness Evolution 不矛盾 + 静默失败 + Coding Agent ML Infra 真实力 + Karpathy/Simon/James Phoenix 范式) - §3.2 争议 9 条 + Q102 + T106

6.2 7-21 增量性质 = 补漏 + 反方 + 行业数据 + 模型端 SOTA(与 7-19/7-20 同质)

本次 e1prep 应严格沿用 7-19 / 7-20 已有立标,不强行升格: 1. §2.2 模型与基座「开源 / 开放权重 拐点」段新增一行 Kimi K3(Moonshot 2.8T MoE + MXFP4 QAT + SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA)· 取代 Kimi K2.5 占位 · 7-27 开权 2. §2.1 Harness 学术化新增「第六阶段 deployment-time harness 范式分支」FlashRT(arXiv:2607.18171)· 与 AHE 「evaluation-time harness」两侧闭环 3. §2.1 Harness 学术化AHE 段新增「SWE-Pruner Pro(arXiv:2607.18213)具体落地」= agent 自身 internal representation 内化 keep-or-prune = harness 与 model 边界模糊化 4. §2.6 CLI / IDE harness 工程化段末新增「Kimi Code CLI(Moonshot 第二件 coding agent 落地)」+「IBM Model Routing 三大陷阱(2026-07-15)· cost/routing 维度」 5. §2.6 CLI / IDE harness 工程化段末新增「OpenDev dual-agent terminal coding(arXiv:2603.05344)」+「Production Playbook 12-pattern」 6. §3.1 共识新增 3 条:Kimi K3 开源 Coding Agent 三榜 SOTA 跨过闭源三巨头领先位 + Harness 学术化 evaluation × deployment 双边闭环 + harness 与 model 边界模糊化 7. §3.2 争议新增 1 条:Harness 是否最终内化为 Model 的子模块(SWE-Pruner Pro 内化证据 vs Harness Evolution 反方的「harness 不是 model-specific tuning」主张) 8. §4 开放问题新增 3 条:K3 开权后是否引发 coding agent 模型端新一轮军备竞赛 + deployment-time harness 与 evaluation-time harness 的耦合关系 + SWE-Pruner Pro 内化表征跨模型迁移性 9. §5 趋势新增 1 条:Coding Agent 经济学从模型端基准分数推向模型路由 / cost 三维 10. §6 必读清单新增 3 条:Kimi K3 HF Community Blog · arXiv:2607.18171 FlashRT · arXiv:2607.18213 SWE-Pruner Pro

6.3 重要边界(与 7-20 e1prep 不重复)

  • 不要与昨天(7-20)的 6 条增量重复:昨天已立标 LoCoBench-Agent + SpecBench + James Phoenix Substack 三联 + Atrex-Bench + Karpathy/Simon Willison + Karpathy December hypothesis · 今天 3 条强增量全是 7-21 全新立标(Kimi K3 + FlashRT + SWE-Pruner Pro)
  • 不要把 IBM Model Routing / Databricks 79%/11% 重复计入 coding-agents 主线强增量:两者已在 spark agent-e1prep §6 / §7 + spark llm-infra-e1prep §增量 5 / 7 + jay 1335 §三 多次出现,spark 已立标为「Agent 工业级生产差距量化三件套」;coding-agents 仅作旁证 1(IBM Routing 三维 cost/routing 维度直接与 Coding Agent 工作负载相关)
  • 不要把 Lilian Weng Harness Engineering 单独计入 7-21 强增量:v25 §2.1 已固化「Lilian Weng 2026-07-04 Substack『Harness Engineering for Self-Improvement』」(§2.1 段末)+ spark agent-e1prep §增量 4 已确认在 coding-agents.md / engineering.md / llm-application.md 主题页固化 = 重复沿用,非 7-21 新立
  • 不要把 Cost-Aware / Behavioral Privacy 计入 coding-agents 主线:两者主分类 agent 但 §2.5 安全契约段才是真正归位(coding-agents 安全侧沿用,不另立 §2.3 评测基础设施新条目)
  • 不要把 Coding Agent Leverage / Agents Broke CI Economics / MCP Tool Poisoning 计入 7-21:三者均在 7-19 / 7-20 立标,jay 1450 / 1735 重申但非新立

6.4 整体节奏判断

  • v25 已饱和:14 主轴 + 6 段长脉络 + 11 共识 + 9 争议 + 10 节深度展开
  • 7-21 增量 3-5 条(强增量 3 + 旁证 2)与昨天(7-20)的 6 条增量在数量上持平,但性质不同:昨天是「评测基础设施大爆发」(LoCoBench-Agent + SpecBench + Atrex-Bench + Karpathy 范式),今天是「模型端 SOTA + Harness 范式扩展」(Kimi K3 + FlashRT + SWE-Pruner Pro)
  • 未来 3-5 天(7-22 ~ 7-26)接力建议:
    1. 7-22 重点跟踪 Kimi K3 7-27 开权前 7 篇官方 blog(Moonshot AI 官方)→ 待 7-27 后立标
    2. 7-23 ~ 7-24 关注 Claude Opus 5 / Mythos 公开(Anthropic 下一代旗舰)
    3. 7-24 ~ 7-25 关注 Harness Evolution arXiv:2607.12227 + FlashRT + SWE-Pruner Pro 的反方论文
    4. 7-25 ~ 7-26 关注 SWE Marathon / Terminal-Bench 2.1 / Program Bench 三榜 Kimi K3 开权后是否被刷榜(预期 GPT-5.6 / Claude Fable 5 / Mythos 5 可能反击)

v25 7-21 E1 预消化完成 · flyP · 2026-07-21 23:20 CST
v25 md5: coding-agents.md = 71771 bytes / §2.1 ~ §2.6 完整 / §3.1 11 共识 / §3.2 9 争议
本次 e1prep md5: /shared/research-kb/inbox/flyp/2026-07-21-coding-agents-e1prep.md ≈ 18000 字 / 3 条强增量 + 2 条旁证 + 4 条矛盾与待核实 + 14 个 arXiv 号 + 完整来源扫描