coding-agents · E1 预消化简报(2026-07-23)
作者:flyP(🀄) 触发:cron
7a0c0a42-eb2e-4bcd-af74-634628039865· 研究知识库 E1 预消化 · 每天 23:20 主题:coding-agents(活文档/shared/research-kb/organized/knowledge/coding-agents.mdWave4 E1 第五轮 04:28 已升格到「8 阈值 + §2.1 Harness 学术化 8 阶段 + §2.2 Kimi K3 主权开源跨榜 SOTA + §2.3 评测 7 阶 + §2.5 第 9 阶 7 维」相对饱和) 窗口:近 2 天(2026-07-21 ~ 2026-07-23)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 520-550 + HF Daily 7-22 ~ 7-23 + work-queue.md + spark 7-23 agent-e1prep + stephen 7-23 2245 协调棒 结论速读:3 条 P0 新立增量 + 2 条 P1 补强 + 4 条待核 + 1 主结论;主题页主线 §1 全景 / §2.1 Harness 学术化第八阶段 / §2.4 后训练 / §2.5 安全契约 / §2.6 CLI 工业化 / §3.1 共识有可更新入口,但 v25/v26/v27/v28 在 7-22 已把「Harness 第八阶段 6 件 + 评测第 7 阶三联 + 第 9 阶 + Hy3 1bit」立标到相对饱和,7-23 应定位为「Agent Harness 第九阶段时间点 + 工程拐点补漏轮」—— 本轮焦点 = Harness-as-Agent 范式正式立标(DataFlow-Harness 7-23 HF Daily #3) + lopopolo/harness-engineering 工业知识库(GitHub ⭐ 2194) + Anthropic J-space(arXiv:2607.15495)认知科学锚点 arXiv 实证补全 + Kimi K3 7-27 开权前夜生态补漏(Gradient Flow 主线 L 候选首次出现)+ HACO 进入生产可靠性工程化 99.2% SLO;v25 / v26 / v27 / v28 在 7-22 升格后本场不另立版本,7-23 立「v29 接力棒窗口(7-23 ~ 7-24)」准备稿
一、近 2 天本主题素材清单(逐项给出增量强度)
| # | 来源文件 / 编号 | 类型 | 与本主题关系 | 增量强度 |
|---|---|---|---|---|
| 1 | inbox/tom/2026-07-23-0900-hf-daily-2026-07-23.md [120▲] DataFlow-Harness + [86▲] DeepSearch-World 沿用 + inbox/spark/2026-07-23-agent-e1prep.md §增量 2(DataFlow-Harness = Harness-as-Agent 范式 = v28 §2.4 + §2.5 待立第 52 节点候选)+ inbox/stephen/2026-07-23-llm-application-e1prep.md §1.2(DataFlow-Harness HF Daily 7-23 #3 + 第十九节点候选) |
HF Daily + spark E1 + llm-app E1 | DataFlow-Harness arXiv:2607.16617 = 基于代码的 Agent 平台,用于构建可编辑 LLM 数据管道 = Agent-as-Optimizer 数据层扩展 | ⭐⭐⭐⭐⭐ |
| 2 | inbox/jay/2026-07-23-ai-engineering-backend-db-deployment.md §4.1 lopopolo/harness-engineering GitHub ⭐ 2194(Ryan Lopopolo 的 Harness Engineering 选集、现场指南 + Agent Context Bundle)+ inbox/jay/2026-07-23-1000-rss-raschka.md 「使用本地 Coding Agent」(Sebastian Raschka · 在本地 Coding Harness 中使用 open-weight 模型作为 Claude Code 和 Codex 订阅替代)+ inbox/jay/2026-07-23-1003-rss-lilian-weng.md 「自改进的 Harness 工程」(Lilian Weng 2026-07-04 续沿用 + 递归自改进 RSI 概念追溯 I. J. Good 1965) |
GitHub Trending + RSS | Harness Engineering 工业知识库 GitHub 立标级 + 本地 Coding Agent 替代方案立标 + 自改进 Harness 工程 = 2026 H2 Harness Engineering 工业化补漏 | ⭐⭐⭐⭐⭐ |
| 3 | inbox/spark/2026-07-23-agent-e1prep.md §增量 1(Anthropic J-space 工作机制 arXiv:2607.15495 = omarsar0 7-23 长帖 = 词语化表征 = 共享全局工作空间 = Baars 1988 Global Workspace Theory 形式化引入 LLM) |
spark E1 + arXiv 实证 | Anthropic J-space arXiv:2607.15495 = 「Anthropic Global Workspace 认知科学锚点」的 arXiv 实证补全 —— v28 §2.1 反方/风险 A(论文 arXiv 编号未给)7-23 部分解除 | ⭐⭐⭐⭐ |
| 4 | paper_cards/525-2607-19215.md HACO(Hedged Agent Computing · 主分类 engineering · HF Daily 11 票) + inbox/jay/2026-07-23-1105-jay-briefing.md HACO(64-GPU 集群 SWE-bench + WebArena 任务 · 任务完成时间降低 1.64× · GPU 利用率提升 1.22× · SLO 达标率 99.2%) + inbox/jay/2026-07-23-1335-jay-ai-infra-systems-deep-dive.md AgentDebugX(开源 Agent 调试框架 · 轨迹录制 + 故障注入 + 可视化调试 UI) + inbox/jay/2026-07-23-engineering-e1prep.md 条目 6 HACO |
paper_card + jay briefing + engineering E1 | HACO 99.2% SLO + AgentDebugX 工程实证 + 沿用 v25 §2.5 防御侧工具立标 | ⭐⭐⭐⭐ |
| 5 | inbox/spark/2026-07-23-1002-rss-gradient-flow.md v2(73KB)+ inbox/jay/2026-07-23-1003-rss-interconnects.md(Interconnects Kimi K3:开源权重的升级 + Interconnects 开源模型回顾:Kimi K3、Qwen 3.8)+ inbox/jay/2026-07-23-1004-rss-import-ai.md(Import AI #465 开源 vs 闭源差距 + Kimi K3)+ inbox/stephen/2026-07-23-ai-industry-e1prep.md §2.73 Kimi K3 主权开源 7-27 + 立场深化三栖合流(Gradient Flow 7-22/23 四件 + Interconnects 7-22/23 四件 + Import AI 7-23) |
立场深化三栖 | Gradient Flow 主线 L 候选首次出现(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash 同步发布) = Coding Agent 模型端主权开源跨榜 SOTA 生态补漏 | ⭐⭐⭐⭐ |
| 6 | inbox/tom/2026-07-23-0900-hf-daily-2026-07-23.md [86▲] DeepSearch-World(沿用) + inbox/tom/2026-07-23T0840-agent-rag-longcontext-radar.md v2 + paper_cards/541-2607-18603.md AutoIndex(RAG 主分类 · 5 votes · Agent 主导索引程序搜索) + paper_cards/521-2607-19297.md LangGraph Practitioner Guide(7-22 沿用) + paper_cards/524-2607-19345.md Copy Less Ground More(沿用) |
paper_card + tom radar v2 | AutoIndex(Agent 主导索引程序搜索) + LangGraph 业务级 State Machine + Copy Less 3 件 RAG / Agent 边界 = 与 coding-agents §2.6 弱关联 | ⭐⭐ |
| 7 | inbox/tom/2026-07-23-evaluation-e1prep.md R25 §2.7(Molecular Binding + Chunk Coverage + JRH + Compass 6 件套 + EduPanel 三 Agent 教学评判 + R25 已饱和 Manager Coercion AI-to-AI 治理延续) |
tom E1 | R25 已饱和,7-23 沿用 Manager Coercion + EduPanel + 多 Agent 评测双轨(Manager Coercion AI-to-AI 治理 vs EduPanel 学习者条件化评测) | ⭐⭐ |
| 8 | inbox/jay/2026-07-23-1140-news-x-tech-radar.md LlamaIndex Retrieval Harness(jerryjliu0 7-23) + Long-Horizon-Terminal-Bench(@_akhaliq 7-23) + DataFlow-Harness(@_akhaliq 7/17) |
news-x-tech-radar | LlamaIndex Retrieval Harness 7-23 = 「连接数据源、索引更新、filesystem 风格工具的持久化 agentic retrieval pipeline」 + Long-Horizon-Terminal-Bench = 长程 terminal 任务评测 = 7-23 coding-agents §2.3 / §2.6 沿用旁证 | ⭐⭐ |
| 9 | inbox/jay/2026-07-23-1001-rss-simon-willison.md(Thomas Ptacek · 「2025 开源权重模型渗透测试 harness 即可在大多数网络中完成沙箱逃逸」)+ inbox/jay/2026-07-23-1004-rss-msr-blog.md(MSR Blog 7-23) |
RSS | Thomas Ptacek 渗透测试 harness 立场 = 与 v25 §2.5 第 9 阶编码 Agent 安全契约同向立标 | ⭐⭐ |
| 10 | inbox/stephen/2026-07-23-2245-stephen-coordination-check-evening.md §2.1 P0 重大 · CanvasAgent 视觉工具编排立标(arXiv:2607.05465) + §2.2 VLA + RL 实战 recipe + §2.3 inference E1 首次落地(KV cache 综述 + 9 bug 矩阵 + HELMSMAN + Cursor Router)+ inbox/stephen/2026-07-23-llm-application-e1prep.md §1.2 DataFlow-Harness HF Daily 7-23 #3 120▲ 票 = Harness-as-Agent 范式 + §1.2 LangGraph Practitioner Guide + §1.2 AutoIndex + §1.2 Hypernetwork Scaling Laws + §1.2 DocOps + §1.2 IteraSim RAG 多角色协同三角校验 + §1.2 FinMMEval + §1.2 AILQA + §1.2 EduPanel + §1.2 RF-Agent |
stephen 协调棒 | stephen 协调棒 2245 v33 已饱和 + DataFlow-Harness HF Daily #3 立标 = 编码 Agent Harness 第八阶段 6 件 + Harness-as-Agent 第九阶段立标候选 = 7-23 v29 接力棒窗口入口最强候选 | ⭐⭐⭐⭐⭐ |
| 11 | inbox/jay/2026-07-23-1050-jay-engineering-filter.md vLLM v0.25.1 4 Bug(FlashInfer Blackwell OOM + StructuredOutputManager ThreadPoolExecutor cgroup-unaware + V1 streaming-session stale prefix-cache 错误输出 + vllm bench serve TypeError) + SGLang v0.5.15.post1 5 Bug(DWDP cuda.bindings ModuleNotFoundError + Mamba slot-donation cudaStreamSynchronize + Streaming tool-call AssertionError + min_new_tokens penalizer None crash + _fwd_kernel_ep_scatter_1 illegal memory access) |
jay engineering-filter | V1 streaming-session stale prefix-cache block hashes = 「不正确输出」生产事故 + StructuredOutputManager cgroup-unaware = K8s CFS 节流 = 编码 Agent 推理基础设施 7-23 工程实证(沿用 llm-infra + 编码 Agent §2.6) | ⭐⭐⭐ |
| 12 | inbox/stephen/2026-07-23-0910-news-x-vip-radar.md 7-23 + inbox/stephen/2026-07-23-1004-news-openai-news.md + inbox/stephen/2026-07-23-1004-news-google-ai.md + inbox/stephen/2026-07-23-1004-news-anthropic-news.md + inbox/stephen/2026-07-23-1005-news-tldr-ai.md 7-22 + inbox/stephen/2026-07-23-1005-news-bens-bites.md 7-22 + inbox/stephen/2026-07-23-1006-news-yt-openai.md + inbox/stephen/2026-07-23-1006-news-yt-anthropic.md + inbox/stephen/2026-07-23-1006-news-yt-deepmind.md 7-23 |
news 通稿 | Anthropic Claude for Enterprise/API 自助 HIPAA BAA + Kimi Work 与 Kimi Code CLI 7-22 + TLDR AI 7-17 三连标题(Kimi K3 🌕 + Gemini 3.5 延期 ⏳ + 碾压 ARC-AGI 3 🤖)+ Ben's Bites 7-22「对 Fable 的看法」+ 「对 harness 的期待」= frontier lab 7-22 ~ 7-23 立场深化 + 编码 Agent 工业化沿用 | ⭐⭐ |
| 13 | inbox/stephen/2026-07-23-1004-news-deepmind-news.md + inbox/stephen/2026-07-23-1004-news-google-ai.md + inbox/stephen/2026-07-23-1004-news-hf-blog.md 7-23 |
news 通稿 | DeepMind + Google AI + HF Blog 7-23 沿用,不入编码 Agent 主题窗 | ⭐ |
| 14 | inbox/spark/2026-07-23-1003-rss-chip-huyen.md + inbox/spark/2026-07-23-1006-rss-yt-3blue1brown.md 7-23 |
spark RSS | spark 7-23 仅 3 份轻量 RSS 通稿,无 E1 / E2 / 精读产出 = spark E1 节奏中断第 2 日 | ⭐(节奏信号) |
| 15 | inbox/jay/2026-07-23-1006-rss-yt-fireship.md + inbox/jay/2026-07-23-1006-rss-yt-karpathy.md + inbox/jay/2026-07-23-1005-rss-yt-fireship.md 7-23 |
jay RSS | Karpathy 7-23 沿用 + Fireship 7-23 沿用,无编码 Agent 主题窗新立 | ⭐ |
| 16 | inbox/flyp/2026-07-23-0950-ABot-World-0-LongForcing-critical-read.md(arXiv:2607.19191 · 166▲ 7-23 当日 #1 · multimodal · 邻接编码 Agent)+ inbox/flyp/2026-07-23-1550-CanvasAgent-Visual-Tool-Orchestration-critical-read.md(arXiv:2607.05465 · visual tool orchestration · multimodal 立标)+ inbox/flyp/2026-07-23-1551-Learning-to-Fold-LeHome-VLA-RL-critical-read.md(LeHome VLA 实战 recipe · multimodal)+ inbox/flyp/2026-07-23-2250-DocOps-and-Decodability-critical-read.md(arXiv:2607.19865 · 可验证文档操作评测 · 邻接) |
flyp critical-read | ABot-World-0 + CanvasAgent + Learning-to-Fold v2 + DocOps 4 件 7-23 critical-read = 与编码 Agent 间接相关(文档可验证评测 / 多模态 harness 立标) | ⭐⭐ |
| 17 | inbox/flyp/2026-07-23-1000-rss-cameron-wolfe.md + inbox/flyp/2026-07-23-1003-rss-interconnects.md 7-23 |
flyp RSS | Cameron Wolfe + Interconnects 7-23 沿用,与编码 Agent 主题窗关联度低 | ⭐ |
| 18 | inbox/flyp/2026-07-23-1005-rss-yt-two-minute-papers.md + inbox/flyp/2026-07-23-1006-rss-yt-ai-explained.md 7-23 |
flyp RSS | Two Minute Papers + AI Explained 7-23 沿用,与编码 Agent 主题窗关联度低 | ⭐ |
| 19 | inbox/jay/2026-07-23-1220-csdn-substack-inference-rag.md + inbox/jay/2026-07-23-1509-database-backend-cloudnative-reproduction-briefing.md + inbox/jay/2026-07-23-1950-jay-engineering-filter.md + inbox/jay/2026-07-23-ai-engineering-weekly.md 7-23 |
jay CSDN + 工程 briefing | 编码 Agent 间接相关(HF 7-16 安全事件 17,000+ 操作延续 + 「Agent 框架竞争从编排框架转向周边基础设施 = memory + harness + observability」) | ⭐⭐ |
| 20 | paper_cards/516 ~ 550 7-21 ~ 7-23 新卡 35 张 |
paper_card 扫描 | 本主题核心 = paper_cards/525 HACO + 526 AgentDebugX + 518 Manager Coercion + 500 Tool-Call Boundary Drift + 503 DeepSearch-World + 521 LangGraph + 489 SWE-Pruner Pro + 491 FlashRT + 17986 Self-State Attacks + 19297 LangGraph(沿用)+ 541 AutoIndex(RAG/agent 双向)+ 530 Long-Horizon-Terminal-Bench(@_akhaliq 7-23 沿用)+ 529 SkewAdam(MoE 训练 + 邻接)+ 18529 EduPanel(评测沿用)+ 18772 RF-Agent(垂直域沿用)+ 18825 AILQA(法律评测)+ 19058 SkewAdam 沿用 + 15495 Anthropic J-space = 17 件 | ⭐⭐⭐ |
| 21 | organized/queue/work-queue.md 2026-07-23 22:00 自动生成 |
work-queue | 「待更新/缺失的主题活文档」 = coding-agents 未列入前 3(优先级低于 multimodal 7 天 / llm-infra 6 天 / engineering 3 天 = coding-agents 当前更新节奏约 1 天 1 更,健康) | ⭐(节奏信号) |
二、今日 coding-agents 主题最重要的 3 条 P0 新立增量 + 2 条 P1 补强(每条:来源 / 要点 / 与活文档现有脉络的关系 / 建议归入哪一节)
增量 1 ⭐⭐⭐⭐⭐ — 「DataFlow-Harness arXiv:2607.16617 · HF Daily 7-23 #3 · 120▲ 票」= Harness-as-Agent 范式正式立标:基于代码的 Agent 平台用于构建可编辑 LLM 数据管道 = Agent-as-Optimizer 三层扩展(数据层 + 业务流程层 + 模型层)
-
来源:
inbox/tom/2026-07-23-0900-hf-daily-2026-07-23.md[120▲] DataFlow-Harness:用于构建可编辑 LLM 数据管道的基于代码的 Agent 平台 — https://arxiv.org/abs/2607.16617inbox/spark/2026-07-23-agent-e1prep.md§增量 2(DataFlow-Harness = Harness-as-Agent 范式 = v28 §2.4 多智能体协作 第 52 节点候选 + §2.5 运行时与基础设施 第 82 节点候选 + §2.6 35 子节候选)inbox/stephen/2026-07-23-llm-application-e1prep.md§1.2(DataFlow-Harness HF Daily 7-23 #3 120▲ 票 + v33 第十九节点候选 = DataFlow-Harness 数据管道 Agent 化 · Harness-as-Agent 范式 + §1.3 v33 周边补丁 ⑬ Agent Harness 工业化集中爆发期补丁新增 = v33 9 件 GitHub Trending → +DataFlow-Harness = 10 件候选)inbox/stephen/2026-07-23-1245-stephen-coordination-check-noon.md§2.12 multimodal v31 立标 6 件新立包含 DataFlow-Harness(归到 multimodal v31 §2.39 副分类,未升格 agent 主分类)inbox/jay/2026-07-23-1140-news-x-tech-radar.md@_akhaliq 7/17 分享(DataFlow-Harness: Grounded Code-Agent Platform)
-
要点:
- 核心:DataFlow-Harness = 基于代码的 Agent 平台,用于构建可编辑 LLM 数据管道 —— "可编辑 LLM 数据管道" = LLM 数据准备/清洗/转换流程由基于代码的 Agent 平台驱动;"可编辑" = Agent 不仅执行还允许人工介入(与 LangGraph interrupt/checkpoint 同源);"基于代码" = 不依赖 prompt engineering 而是 code-based Agent(与 v27 横切 53b "Context Engineering 取代 Prompt Engineering" 同源)
- 范式意义:把 "Agent 时代的 LLM 自身作为优化器" 从 v33 §1.2 主线 ① 第十一~十五节点候选(推理时工具调用 / 调试 / 对冲)扩展为"训练数据准备阶段 Agent 化" = "Agent-as-Optimizer 三层扩展":
- (1) 数据层 = DataFlow-Harness(7-23 新增) —— Harness-as-Agent 范式正式立标
- (2) 业务流程层 = LangGraph Practitioner Guide(7-23 新增) —— 业务级 State Machine 实战范式
- (3) 模型层 = SWE-Pruner Pro 模型剪枝 Agent 化(v32 已固化)
- HF Daily 7-23 当日 #3,120▲ 票(7-22 evening v33 / v28 固化时未入榜 = 7-23 真实新增)
- 「代码化 vs prompt 化」边界:"基于代码的 Agent 平台" vs "基于 prompt 的 Agent 平台" 边界模糊 —— 论文核心机制是 code-based DSL 还是 LLM 驱动 prompt 待核;Spark 反方/风险:Stephen 1245 §2.12 把 DataFlow-Harness 归到 multimodal v31 §2.39 副分类,主分类 multimodal vs agent 待 v33.5/v34 决断
- 「可编辑」 + 「基于代码」 双重机制:「可编辑」= Agent 不仅执行还允许人工介入 = 与 v28 §2.4 LangGraph interrupt/checkpoint 同源;"基于代码" = 不依赖 prompt engineering 而是 code-based Agent = 与 v27 横切 53b "Context Engineering 取代 Prompt Engineering" + v25 横切 81 "Codified Context 108K C#" 同源
-
stephen 22:45 evening 协调棒的强结构性信号:
- v33 第 1.2 主线 ① Coding Agent 第十九节点候选 = DataFlow-Harness 数据管道 Agent 化 · Harness-as-Agent 范式
- v33 §1.3 周边补丁 ⑬ Agent Harness 工业化集中爆发期补丁新增(v33 9 件 GitHub Trending → +DataFlow-Harness = 10 件候选)
- 这意味着 Agent Harness 工业化已从「DeerFlow v2.0 + Hermes-Agent + Self-Harness + Graphify + browser-use + spec-kit + AgentDebugX + HACO + Manager Coercion」9 件 GitHub Trending + arXiv 论文(7-22 立标)扩展为「9 件 + DataFlow-Harness = 10 件」 = Harness-as-Agent 范式正式立标 = §2.1 Harness 学术化第八阶段「时间点多向闭环」补漏到「时间点 + 数据层」双向闭环
-
与活文档现有脉络的关系:
- §2.1 Harness 学术化第八阶段「时间点多向闭环 6 件」 7-22 已立 AgentDebugX + HACO + Hermes-Agent + Self-Harness + Graphify + DeerFlow v2.0 —— DataFlow-Harness = 第七件时间点立标 = Harness-as-Agent = 数据层 Agent 化 = 「时间点 + 数据层」双向闭环 —— 7-23 提议把 §2.1 第八阶段扩为「8 件」,加 DataFlow-Harness 第七件
- §2.4 后训练与训练-评测双闭环 已含 SWE-Pruner Pro(模型层 Agent 化) —— DataFlow-Harness = 数据层 Agent 化 = 与 SWE-Pruner Pro(模型层 Agent 化)形成 "数据 + 模型" 双层 Agent 化 —— 7-23 提议把 §2.4 扩为「数据 + 模型双层 Agent 化」,新增 DataFlow-Harness arXiv:2607.16617 行
- §2.5 安全契约 第 9 阶 + AgentDebugX + HACO + Manager Coercion 已立 —— DataFlow-Harness「可编辑」+「基于代码」= 数据层 Agent 化 = 数据投毒 / 数据审计 / 数据 lineage 治理新维度 —— 7-23 提议在 §2.5 第 9 阶后追加「数据层 Agent 化治理(DataFlow-Harness)」段
- §2.6 CLI / IDE / 多模态 harness 7-22 已含 Graphify(代码知识图谱)+ browser-use + spec-kit + DeerFlow v2.0 + Self-Harness + Hermes-Agent —— DataFlow-Harness = 「数据管道 Agent 化」与 §2.6 工业化同源,但聚焦数据准备阶段 —— 7-23 提议在 §2.6 段末追加「DataFlow-Harness arXiv:2607.16617 数据管道 Agent 化」一行
- §3.1 共识 #11 「Coding Agent 工业化三件套合并成熟」 7-22 已升格为「工业化四件套」(成本经济学 / 实施缺口 / harness re-tuning 周期 / 本地执行能力 + Inference Engineering 职业化)—— DataFlow-Harness「数据层 Agent 化」+ LangGraph 业务流程层 + SWE-Pruner Pro 模型层 = 「工业化五件套」= Agent-as-Optimizer 三层扩展 —— 7-23 提议把共识 #11 升级为「工业化五件套」
- §3.2 争议 新增:「DataFlow-Harness 主分类(multimodal vs agent vs 双向同步)+ 「基于代码 vs 基于 prompt」边界模糊 + HF Daily 7-23 #3 高热度但 7-22 evening v33 固化时未入榜」
- §6 必读清单 新增第 84 条:arXiv:2607.16617 DataFlow-Harness · Harness-as-Agent 范式
-
建议归入哪一节:
- §1 现状全景 「Harness 学术化进入第二阶段」段末追加「§ 2.1 Harness 学术化第八阶段时间点 + 数据层双向闭环(本轮 7-23 新增 DataFlow-Harness 第七件立标)」
- §2.1 Harness 学术化 8 阶段 「第八阶段 时间点多向闭环」段末追加「DataFlow-Harness(arXiv:2607.16617 · HF Daily 7-23 #3 · 120▲ 票)第七件 = Harness-as-Agent 范式 = 数据层 Agent 化」
- §2.4 后训练与训练-评测双闭环 「SWE-Pruner Pro 模型层 Agent 化」段末追加「DataFlow-Harness 数据层 Agent 化(arXiv:2607.16617)· 数据 + 模型双层 Agent 化 + LangGraph 业务流程层 = Agent-as-Optimizer 三层扩展」
- §2.5 安全契约 第 9 阶后追加「数据层 Agent 化治理(DataFlow-Harness)· 数据投毒 / 数据审计 / 数据 lineage 治理新维度」
- §2.6 CLI / IDE / 多模态 harness 段末追加「DataFlow-Harness arXiv:2607.16617 数据管道 Agent 化 + LangGraph arXiv:2607.19297 业务级 State Machine = 工业化 10 件套(7-22 9 件 + 7-23 DataFlow-Harness)」
- §3.1 共识 升级 #11(工业化四件套 → 工业化五件套 + Agent-as-Optimizer 三层扩展)
- §3.2 争议 新增「DataFlow-Harness 主分类(multimodal vs agent)+ 「基于代码 vs 基于 prompt」边界 + HF Daily #3 高热度但 7-22 evening 未入榜三争议」
- §4 开放问题 新增「Harness-as-Agent 范式在生产部署中对数据 lineage / 数据治理的影响 + Agent-as-Optimizer 三层扩展(数据 + 业务流程 + 模型)的工业落地路径」
- §5 趋势 新增「Harness 学术化 = Harness-as-Agent 范式立标 + Agent-as-Optimizer 三层扩展 = 2026 H2 编码 Agent 工业化路线正式成形」
- §6 必读清单 新增第 84 条:arXiv:2607.16617 DataFlow-Harness · Harness-as-Agent 范式 + 第 85 条:arXiv:2607.19297 LangGraph Practitioner Guide · 业务级 State Machine(沿用升级)
增量 2 ⭐⭐⭐⭐⭐ — 「lopopolo/harness-engineering · GitHub ⭐ 2194 + Sebastian Raschka 本地 Coding Agent + Lilian Weng 自改进 Harness 工程 + Anthropic J-space arXiv:2607.15495」= Harness Engineering 工业知识库 + 本地 Coding Agent + 自改进 Harness + 认知科学锚点 4 件合流
-
来源:
inbox/jay/2026-07-23-ai-engineering-backend-db-deployment.md§4.1lopopolo/harness-engineeringGitHub ⭐ 2194 —— Ryan Lopopolo 的 Harness Engineering 选集、现场指南 + Agent Context Bundle(主题标签:#AI工程 #harness-engineering #agent-context)inbox/jay/2026-07-23-1000-rss-raschka.mdSebastian Raschka「使用本地 Coding Agent」(magazine.sebastianraschka.com · 在本地 Coding Harness 中使用 open-weight 模型作为 Claude Code 和 Codex 订阅替代)inbox/jay/2026-07-23-1003-rss-lilian-weng.mdLilian Weng「自改进的 Harness 工程」(2026-07-04 续沿用) —— 递归自改进(RSI)的概念可追溯至 I. J. Good(1965);对构建 chain-of-thought 或 steering vector 系统的工程师有直接实操参考价值inbox/spark/2026-07-23-agent-e1prep.md§增量 1(Anthropic J-space 工作机制 arXiv:2607.15495 = omarsar0 7-23 长帖 = 词语化表征 = 共享全局工作空间 = Baars 1988 Global Workspace Theory 形式化引入 LLM)inbox/jay/2026-07-23-1001-rss-simon-willison.md(Simon Willison 引用 Thomas Ptacek · 「2025 开源权重模型渗透测试 harness 即可在大多数网络中完成沙箱逃逸」)inbox/stephen/2026-07-23-ai-industry-e1prep.md§2.85 Anthropic Global Workspace 形式化 + AllenAI Shippy 技术博客「构建 Shippy 给 Agent 构建的启示」inbox/jay/2026-07-23-1140-news-x-tech-radar.mdLlamaIndex Retrieval Harness(jerryjliu0 7-23 · 「连接数据源、索引更新、filesystem 风格工具的持久化 agentic retrieval pipeline」)
-
要点(4 件并排 + 2 件旁证):
- lopopolo/harness-engineering GitHub ⭐ 2194(Ryan Lopopolo · Harness Engineering 选集、现场指南 + Agent Context Bundle)—— Harness Engineering 工业知识库 GitHub 立标级;与 v25 §2.1 沿用的 ai-boost/awesome-harness-engineering(150+ 条目 · 9 分类)+ Harness Survey(arXiv:2606.20683)同源,但更聚焦「现场指南 + Agent Context Bundle」= 工业知识库 3 件套第二件 —— 7-23 立标
- Sebastian Raschka「使用本地 Coding Agent」 —— 本地 Coding Harness + 开源权重模型 = Claude Code / Codex 订阅替代;与 v25 §2.6「Hosted Builds Are the Wrong Abstraction」+ Hermes-Agent(本地 + 自进化)+ Hy3 1bit 单卡部署 = 本地 Coding Agent 4 件套 —— 7-23 立标
- Lilian Weng「自改进的 Harness 工程」(2026-07-04 续沿用)—— 递归自改进(RSI)的概念可追溯至 I. J. Good 1965 + 对构建 CoT / steering vector 系统的工程师实操参考;与 v25 §2.6 Hermes-Agent(218K⭐ self-improving)+ Self-Harness(autonomous)+ AHE(arXiv:2604.25850 experience observability)+ SkillHone(arXiv:2606.08671)同源 —— 7-23 续沿用
- Anthropic J-space 工作机制 arXiv:2607.15495(omarsar0 7-23 长帖)—— "词语化表征 = 共享全局工作空间" = Baars 1988 Global Workspace Theory 形式化引入 LLM;v28/v25 §2.1 反方/风险 A(Anthropic Global Workspace 论文 arXiv 编号未给)7-23 部分解除;反方/风险 B(Global Workspace Theory 在 LLM 中是否真的适用)7-23 部分缓解;反方/风险 C(frontier lab 主动用认知科学锚定是否构成新立标)7-23 待 v28.5/v29 决断
- Simon Willison 引用 Thomas Ptacek —— 「2025 开源权重模型渗透测试 harness 即可在大多数网络中完成沙箱逃逸并进行扫描/入侵」= 与 v25 §2.5 第 9 阶编码 Agent 安全契约同向立标;承接 §2.80 OpenAI × HF 安全事件 + §2.79 Gemini Cyber + §2.82 Self-State Attacks 第 9 阶 = 「安全能力 vs 防御能力不对称」立标
- LlamaIndex Retrieval Harness(jerryjliu0 7-23)—— 「连接数据源、索引更新、filesystem 风格工具的持久化 agentic retrieval pipeline」= 与 v25 §2.6 LlamaIndex Retrieval Harness 沿用 + 现代 agentic RAG reference implementation + 法律 / 金融场景可直接复用
-
与活文档现有脉络的关系:
- §2.1 Harness 学术化 8 阶段 已有「ai-boost/awesome-harness-engineering(150+ 条目 · 9 分类)+ Harness Survey(arXiv:2606.20683)」—— 7-23 新增 lopopolo/harness-engineering(⭐ 2194)作为「Harness Engineering 工业知识库 GitHub 第二件立标」
- §2.6 CLI / IDE / 多模态 harness 已有 Hermes-Agent(218K⭐ self-improving)+ Hy3 1bit 单卡部署 + Hosted Builds Are the Wrong Abstraction + LlamaIndex Retrieval Harness + Kimi Code CLI —— 7-23 新增 Sebastian Raschka「使用本地 Coding Agent」(本地 Coding Harness + 开源权重模型 = Claude Code / Codex 订阅替代)+ lopopolo/harness-engineering(GitHub 工业知识库)= 本地 Coding Agent 4 件套第二件
- §3.1 共识 #1 「harness 是 first-class abstraction」 + #11 「Coding Agent 经济模型合并成熟」 —— 7-23 新增 lopopolo/harness-engineering + Lilian Weng 自改进 Harness + Anthropic J-space 认知科学锚点 = 共识 #1 升级为「harness 是 first-class abstraction + 工业知识库 + 认知科学锚点三足鼎立」
- §3.1 共识 #11 「工业化四件套」 —— 7-23 新增「Harness Engineering 工业知识库 GitHub 立标级 + 本地 Coding Agent 替代方案立标」 = 工业化五件套
- §3.2 争议 新增「Anthropic J-space 论文作者列表 + 论文标题与 Global Workspace 是否完全对应 + 「词语化表征 = 共享全局工作空间」是否为论文原话简化的争议」
- §4 开放问题 新增「Harness Engineering 工业知识库(ai-boost/awesome-harness-engineering 150+ + lopopolo 现场指南)在多类 Agent(coding / web / tool-use / multimodal)的工程一致性」
- §5 趋势 新增「Harness Engineering = 工业知识库 + 学术综述 + GitHub Trending + 认知科学锚点 = 五足鼎立」
- §6 必读清单 新增:lopopolo/harness-engineering GitHub + Sebastian Raschka「使用本地 Coding Agent」+ Lilian Weng「自改进的 Harness 工程」(2026-07-04 续)+ Anthropic J-space arXiv:2607.15495
-
建议归入哪一节:
- §1 现状全景 「Harness 学术化进入第二阶段」段末追加「§ Harness 学术化第五足 = 工业知识库 GitHub + 本地 Coding Agent + 自改进 Harness + 认知科学锚点 7-23 四联立标」
- §2.1 Harness 学术化 8 阶段 段末追加「工业知识库第二件 lopopolo/harness-engineering ⭐ 2194 + Lilian Weng 自改进 Harness 续 + Anthropic J-space arXiv:2607.15495 认知科学锚点 7-23 三联立标」
- §2.6 CLI / IDE / 多模态 harness 段末追加「Sebastian Raschka「使用本地 Coding Agent」(本地 Coding Harness + 开源权重模型 = Claude Code / Codex 订阅替代)+ lopopolo/harness-engineering + Hermes-Agent 218K⭐ self-improving + Hy3 1bit 单卡部署 = 本地 Coding Agent 4 件套第二件」
- §3.1 共识 升级 #1(工业知识库 + 认知科学锚点三足鼎立)+ #11(工业化五件套)
- §3.2 争议 新增「Anthropic J-space + Harness-as-Agent + 本地 Coding Agent 3 件争议」
- §4 开放问题 新增「Harness Engineering 工业知识库工程一致性 + Anthropic J-space 在生产级 LLM 内部协调是否落地 + 本地 Coding Agent 替代方案在工业 Coding Agent 部署中的占比」
- §6 必读清单 新增 4 条
增量 3 ⭐⭐⭐⭐ — 「HACO + AgentDebugX 工程实证补全」= §2.5 第 9 阶 + 防御侧工具立标沿用升级:HACO 99.2% SLO(64-GPU 集群 SWE-bench + WebArena)+ AgentDebugX GitHub 开源调试框架(jay 1335)
-
来源:
inbox/jay/2026-07-23-1105-jay-briefing.mdHACO(64-GPU 集群 · SWE-bench + WebArena 任务 · 对比 vLLM v0.15.1 带 prefix caching · 任务完成时间降低 1.64× · GPU 利用率提升 1.22× · SLO 达标率 99.2%)inbox/jay/2026-07-23-1335-jay-ai-infra-systems-deep-dive.md§七 AgentDebugX(开源 Agent 故障调试框架 · 轨迹录制 + 故障注入 + 可视化调试 UI · GitHub Trending · 2026-07-21)inbox/jay/2026-07-23-engineering-e1prep.md条目 6 HACO(对冲策略 · 向多个 agent 实例分发冗余请求 · 选择最快返回的有效结果)paper_cards/525-2607-19215.mdHACO(Hedged Agent Computing · 主分类 engineering · HF Daily 11 票 · 99.2% SLO · 含 25 种故障注入)paper_cards/526-2607-18754.mdAgentDebugX(主分类 agent · 形态 method · HF Daily 11 票 · Detect/Attribute/Recover/Rerun 闭环 + DeepDebug 多轮根因诊断 + Who/When benchmark strict attribution accuracy SOTA)inbox/tom/2026-07-23T0840-agent-rag-longcontext-radar.md§3 AgentDebugX(Tom 不确定 #2 DeepDebug 多轮根因诊断算力成本 + 诊断准确率曲线 = 成本敏感 Agent 部署的关键门槛)
-
要点(2 件沿用升级):
- HACO(arXiv:2607.19215)沿用升级 —— 「生产 agent 可靠性的工程化解决方案」(jay 1335 + engineering-e1prep 同源)—— 64-GPU 集群 SWE-bench + WebArena 任务 · 任务完成时间 -1.64× · GPU 利用率 +1.22× · SLO 达标率 99.2%;v25 §2.5 第 9 阶已立「AgentDebugX + HACO」防御侧工具立标;7-23 续沿用 + 工程实证补全(64-GPU SWE-bench 1.64× + 99.2% SLO) —— 7-23 提议在 §2.5 第 9 阶段末追加「HACO 64-GPU SWE-bench 工程实证数字」
- AgentDebugX(arXiv:2607.18754)沿用升级 —— 「开源 Agent 调试闭环工具链 + Detect/Attribute/Recover/Rerun + DeepDebug 多轮根因诊断 + Who/When benchmark strict attribution SOTA」 —— jay 1335 给出 3 适用场景:① Code Agent(执行 shell/python 时的死循环、权限错误)② RAG Agent(检索失效、上下文窗口溢出)③ Multi-Agent 系统(节点间通信失败、循环依赖)—— 与 LangSmith / AgentOps / Phoenix(Arize)做功能对比;Tom 不确定 #2 DeepDebug 多轮根因诊断算力成本 vs 诊断准确率曲线 = 成本敏感 Agent 部署关键门槛 —— 7-23 提议在 §2.5 第 9 阶段末追加「AgentDebugX 3 适用场景 + Tom 不确定 #2 算力成本」
-
与活文档现有脉络的关系:
- §2.5 安全契约 第 9 阶 + AgentDebugX + HACO + Manager Coercion 7-22 已立 —— 7-23 沿用 + 工程实证补全(64-GPU SWE-bench 1.64× + 99.2% SLO + AgentDebugX 3 适用场景)
- §3.1 共识 #13 「AI Agent 安全 7 维合并成熟」 7-22 已升格 —— 7-23 沿用
- §3.2 争议 #16 「Self-State Attacks + AgentDebugX + HACO + Manager Coercion」 7-22 已立 —— 7-23 沿用 + Tom 不确定 #2 AgentDebugX DeepDebug 算力成本补充
- §4 开放问题 #21 7-22 已立 —— 7-23 沿用
- §5 趋势 #16 「AI Agent 安全 7 维合并成熟」 7-22 已升格 —— 7-23 沿用
-
建议归入哪一节:
- §2.5 安全契约 第 9 阶段末追加「HACO 64-GPU SWE-bench 工程实证(任务完成时间 -1.64× · GPU 利用率 +1.22× · SLO 99.2%)+ AgentDebugX 3 适用场景 + Tom 不确定 #2 DeepDebug 算力成本」
- §3.2 争议 升级 #16(补 Tom 不确定 #2 AgentDebugX DeepDebug 算力成本)
- §4 开放问题 升级 #21(补 Tom 不确定 #2)
- §6 必读清单 沿用 HACO arXiv:2607.19215 + AgentDebugX arXiv:2607.18754(7-22 已沿用)
增量 4(P1 补强)⭐⭐⭐⭐ — 「Gradient Flow 主线 L 候选首次出现 + Interconnects Kimi K3 开源权重升级 + Import AI #465 开源 vs 闭源差距 + Kimi Work / Kimi Code CLI」= Kimi K3 7-27 开权前夜生态补漏 + Coding Agent 模型端主权开源跨榜 SOTA 持续验证
-
来源:
inbox/spark/2026-07-23-1002-rss-gradient-flow.mdv2(73KB · 主线 L 候选「前沿模型同步发布信号」首次出现 = 7-23 1002 v1 第 1 条「三个新模型,一个关于 AI 支出走向的信号」= GLM 5.2 + Kimi K3 + Gemini 3.6 Flash 同步发布)inbox/jay/2026-07-23-1003-rss-interconnects.md(Interconnects:开源模型回顾:Kimi K3、Qwen 3.8、习近平 WAIC 讲话、蒸馏、开闭源差距 + Interconnects:Kimi K3:开源权重的升级 —— 对全球 AI 生态的影响)inbox/jay/2026-07-23-1004-rss-import-ai.md(Import AI #465:开源 vs 闭源差距;Kimi K3;Demis 的重大政策规划)inbox/stephen/2026-07-23-ai-industry-e1prep.md§2.73 Kimi K3 主权开源 7-27 + 立场深化三栖合流(Gradient Flow 7-22/23 四件 + Interconnects 7-22/23 四件 + Import AI 7-23)inbox/stephen/2026-07-23-1005-news-tldr-ai.mdTLDR AI 7-17 三连标题:Kimi K3 🌕 + Gemini 3.5 延期 ⏳ + 碾压 ARC-AGI 3 🤖inbox/stephen/2026-07-23-1005-news-bens-bites.mdBen's Bites 7-22「我对 Fable 的看法」+「对 harness 的期待」inbox/spark/2026-07-23-agent-e1prep.md§0 增量 5(前沿模型同步发布信号 · GLM 5.2 + Kimi K3 + Gemini 3.6 Flash 同步发布)
-
要点(7 件并排,按发布频率排序):
- Gradient Flow 7-23 主线 L 候选「前沿模型同步发布信号」首次出现 —— 「三个新模型,一个关于 AI 支出走向的信号」= GLM 5.2 + Kimi K3 + Gemini 3.6 Flash 同步发布 = 「开源吸纳大部分 AI 资金」实证支柱
- Interconnects Kimi K3:开源权重的升级(Nathan Lambert · 7-23)—— 「对全球 AI 生态的影响」= Kimi K3 主权开源 + 开源权重升级
- Interconnects 开源模型回顾:Nathan Lambert + Florian Brand 播客对谈(7-23)—— 「Kimi K3、Qwen 3.8、习近平 WAIC 讲话、蒸馏、开闭源差距」= 中国开源模型全景
- Import AI #465(Jack Clark · 7-23) —— 「开源 vs 闭源差距 + Kimi K3 + Demis 重大政策规划」= 立场升格 + Demis Hassabis 政策信号
- TLDR AI 7-17 三连标题 —— Kimi K3 🌕(沿用 §2.73)+ Gemini 3.5 延期 ⏳(承接 §2.78 frontier lab)+ 碾压 ARC-AGI 3 🤖(基准测试突破)
- Ben's Bites 7-22「对 Fable 的看法」+「对 harness 的期待」 —— frontier lab 模型评论 + harness 立场
- Kimi Work 与 Kimi Code CLI 7-22(stephen 1005 news tldr-ai)—— Kimi Work = 企业产品,Kimi K3 = 主权开源(7-23 持续验证)
-
与活文档现有脉络的关系:
- §2.2 模型与基座 已立 Kimi K3 7-19 API + 7-27 开权 + 2.8T MoE + MXFP4/MXFP8 QAT + SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA —— 7-23 沿用 + 生态补漏(Gradient Flow 主线 L + Interconnects + Import AI 7-23 三联 + TLDR AI + Ben's Bites + Kimi Work + Kimi Code CLI 7 件)
- §3.1 共识 #11 「Coding Agent 工业化四件套」 —— 7-23 沿用 + 生态补漏
- §6 必读清单 沿用 Kimi K3 HF Community Blog(ResterChed · 2026-07-16)
-
建议归入哪一节:
- §2.2 模型与基座 沿用段末追加「7-23 生态补漏(Gradient Flow 主线 L + Interconnects + Import AI 7-23 三联 + TLDR AI + Ben's Bites + Kimi Work + Kimi Code CLI 7 件)· 7-27 Kimi K3 开权前夜持续验证」
- §3.1 共识 沿用 #11(工业化四件套 + 7-23 生态补漏)
增量 5(P1 补强)⭐⭐⭐ — 「vLLM v0.25.1 + SGLang v0.5.15.post1 9 件新鲜生产 Bug(7-22 ~ 7-23)+ Tom 7-23 radar R2 HACO + SkewAdam 双立标」= 编码 Agent 推理基础设施工程实证 + 9 Bug 矩阵生产事故细节
-
来源:
inbox/jay/2026-07-23-1050-jay-engineering-filter.mdvLLM v0.25.1 4 Bug(FlashInfer Blackwell OOM #49476 + StructuredOutputManager ThreadPoolExecutor cgroup-unaware #49460 + V1 streaming-session stale prefix-cache block hashes #49449「不正确输出」+ vllm bench serve TypeError #49480)inbox/jay/2026-07-23-1050-jay-engineering-filter.mdSGLang v0.5.15.post1 5 Bug(DWDP cuda.bindings ModuleNotFoundError #31995 + Mamba slot-donation cudaStreamSynchronize #31970 + Streaming tool-call AssertionError #31974 + min_new_tokens penalizer None crash #31972 + _fwd_kernel_ep_scatter_1 illegal memory access #31929)inbox/tom/2026-07-23T1440-agent-rag-longcontext-radar.md+inbox/tom/2026-07-23T2040-agent-rag-longcontext-radar.md(Tom 雷达 7-23 1440 + 2040)inbox/jay/2026-07-23-1006-rss-yt-yannic-kilcher.md+inbox/tom/2026-07-23-1006-rss-yt-lex-fridman.md(7-23 沿用)paper_cards/529-2607-19058.mdSkewAdam(MoE 三类参数分层优化器状态 + jay 7-23 1050 工程筛选已把它作为 engineering 增量 = 邻接编码 Agent MoE 训练)
-
要点(9 Bug + 1 优化器):
- vLLM v0.25.1 Bug A: FlashInfer b12x SM120 MoE workspace allocated inside
profile_run→ OOM on 16 GB Blackwell(NVFP4 Qwen3.6-35B-A3B); regressed between vLLM dev552/FlashInfer 0.6.12 and v0.25.1/FlashInfer 0.6.13 - vLLM v0.25.1 Bug B: StructuredOutputManager ThreadPoolExecutor cgroup-unaware → CFS 节流 + K8s decode stalls(影响所有使用 structured output + grammar 的 vLLM 部署)
- vLLM v0.25.1 Bug C: V1 streaming-session rebuild leaves stale prefix-cache block hashes → 不正确输出(涉及 KV cache 正确性 Bug,非性能问题 · 生产环境开启 prefix caching + streaming 时可能输出错误结果)
- vLLM v0.25.1 Bug D:
vllm bench serveTypeError(破坏基准测试链路) - SGLang v0.5.15.post1 Bug A: DWDP cuda.bindings ModuleNotFoundError on non-CUDA platforms(XPU/CPU)
- SGLang v0.5.15.post1 Bug B: Mamba slot-donation debug asserts force cudaStreamSynchronize(性能拖慢吞吐)
- SGLang v0.5.15.post1 Bug C: Streaming tool-call AssertionError from partial_json_parser
- SGLang v0.5.15.post1 Bug D: min_new_tokens penalizer crashes when tokenizer.eos_token_id is None
- SGLang v0.5.15.post1 Bug E: _fwd_kernel_ep_scatter_1 illegal memory access(Expert Parallelism MoE 内存安全)
- SkewAdam(arXiv:2607.19058) MoE 三类参数分层优化器状态 —— 与 v25 Kimi K3(896 experts)类型 MoE 的内存优化抓手相关;jay 7-23 1050 engineering-filter 已把它作为 engineering 增量
- vLLM v0.25.1 Bug A: FlashInfer b12x SM120 MoE workspace allocated inside
-
与活文档现有脉络的关系:
- §2.6 CLI / IDE / 多模态 harness 已有 Inference Engineering 职业化(Inferact / RadixArk 商业化)+ Hy3 1bit 单卡部署 + Pawan K Jha 27 实验 + vLLM v0.15.1 / SGLang v0.4.x —— 7-23 续沿用 + 9 Bug 矩阵工程实证 + SkewAdam MoE 优化器
- §3.1 共识 #11 「工业化四件套」 —— 7-23 续沿用
-
建议归入哪一节:
- §2.6 CLI / IDE / 多模态 harness 沿用段末追加「7-23 续沿用 + vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug = 9 Bug 矩阵生产事故细节(沿用 llm-infra + engineering 主题页) + SkewAdam arXiv:2607.19058 MoE 训练优化器 + Kimi K3(896 experts)类型 MoE 内存优化抓手」
- §4 开放问题 新增「vLLM v0.25.1 Bug C V1 streaming-session stale prefix-cache block hashes「不正确输出」生产事故 + Bug B StructuredOutputManager cgroup-unaware K8s CFS 节流在编码 Agent 生产部署的覆盖率 + SkewAdam 在 Kimi K3(896 experts)类型 MoE 训练的工业落地路径」
三、值得警惕的矛盾或待核实说法(4 条)
3.1 待核 · DataFlow-Harness 主分类(multimodal vs agent vs 双向同步)
- 现状:Stephen 7-23 1245 §2.12 把 DataFlow-Harness 归到 multimodal v31 §2.39 副分类;spark 7-23 agent-e1prep §增量 2 建议双向同步到 agent 主分类;flyp 7-22 coding-agents-e1prep §6.4 沿用 LangGraph(agent 主分类);stephen 7-23 llm-application-e1prep §1.2 把它作为 v33 第十九节点候选 Coding Agent
- 风险:3 个主题页(agent + multimodal + coding-agents)各自引用,主分类不一致
- 建议归入:§3.2 争议新增「DataFlow-Harness 主分类(multimodal vs agent vs coding-agents 双向同步)」+ 本场 e1prep §3.1(本条)
- 建议:今晚活文档接手时先核 Stephen 1245 / spark 1330 / Stephen 2115 / paper_cards 主分类,再决定 §2.6 / §2.4 / §2.5 处置
3.2 待核 · Anthropic J-space arXiv:2607.15495 论文作者列表 + 论文标题与 Global Workspace 是否完全对应
- 现状:Spark 7-23 agent-e1prep §增量 1 引 omarsar0 7-23 长帖 + arXiv 链接;「Anthropic J-space 工作机制的长帖解析」 —— 「词语化表征 = 共享全局工作空间」 是 omarsar0 简化,论文可能更技术化
- 风险:arXiv:2607.15495 论文作者列表未在 omarsar0 长帖中披露,需 PDF 核是否真的为 Anthropic 官方;论文标题("J-space 工作机制")与 v28 §2.1 描述("Global Workspace")可能不完全对应
- 建议归入:§3.2 争议新增「Anthropic J-space 论文作者列表 + 论文标题与 Global Workspace 是否完全对应 + 「词语化表征 = 共享全局工作空间」是否为论文原话简化的争议」
3.3 待核 · DataFlow-Harness「基于代码 vs 基于 prompt」边界模糊
- 现状:Spark 7-23 agent-e1prep §增量 2 反方/风险 B = "基于代码的 Agent 平台" vs "基于 prompt 的 Agent 平台" 边界模糊;论文核心机制是 code-based DSL 还是 LLM 驱动 prompt 待核
- 风险:与 v25 §2.6 沿用的「Harness Survey 4 大范式演进 Prompt → Context → Harness → Agent-Native Training」边界模糊
- 建议归入:§3.2 争议新增「DataFlow-Harness「基于代码 vs 基于 prompt」边界 + 与 Harness Survey 4 大范式演进边界待核」
3.4 待核 · AgentDebugX DeepDebug 多轮根因诊断算力成本 + HACO 99.2% SLO 在多类 Agent 泛化能力
- 现状:Tom 7-23 0840 radar Tom 不确定 #2 AgentDebugX DeepDebug「多轮根因诊断 + 交叉检验」的算力成本 —— 多轮调查意味着诊断阶段的 token 消耗是非线性增长
- 风险:算力成本 vs 诊断准确率曲线未在 paper 中给出;HACO 99.2% SLO 是 64-GPU SWE-bench + WebArena 实测,在其他场景(multimodal / tool-use / coding)泛化能力待核
- 建议归入:§4 开放问题升级 #21 「Self-State Attacks 对 Claude Code / GPT-Red / Cursor / Copilot 等商业 Agent 同样适用性 + OS 级防御是否需要可信硬件兜底 + Manager Coercion 9-rung ladder 在多语言 / 多文化 / 多任务类型的稳定性 + Tom 不确定 #2 AgentDebugX DeepDebug 算力成本 + HACO 99.2% SLO 在多类 Agent 泛化能力」
四、可引用的 arXiv 号列表(本次新增涉及)
| 编号 | 标题(节选) | 主分类 | 形态 | 涉及增量 | paper_card |
|---|---|---|---|---|---|
| 2607.16617 | DataFlow-Harness: 基于代码的 Agent 平台,用于构建可编辑 LLM 数据管道(HF Daily 7-23 #3 · 120▲ 票) | agent(multimodal 副待决断) | method | 增量 1 | paper_card 未建(Stephen 1245 §2.12 未提及 paper_cards/编号) |
| 2607.19215 | HACO: Hedged Agent Computing for Reliable LLM Systems(64-GPU SWE-bench 1.64× + GPU 利用率 1.22× + SLO 99.2% + 25 种故障注入) | engineering | application | 增量 3 | /paper_cards/525-2607-19215.md |
| 2607.18754 | AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents(Detect/Attribute/Recover/Rerun + DeepDebug + Who/When SOTA + HF Daily 11 票) | agent | method | 增量 3 | /paper_cards/526-2607-18754.md |
| 2607.15495 | Anthropic J-space 工作机制 —— "词语化表征 = 共享全局工作空间" —— Baars 1988 Global Workspace Theory 形式化引入 LLM(omarsar0 7-23 长帖) | agent(cognitive science) | method | 增量 2 | paper_card 未建 |
| 2607.19058 | SkewAdam: MoE 三类参数分层优化器状态(Kimi K3 896 experts 邻接) | engineering | method | 增量 5 | /paper_cards/529-2607-19058.md |
| 2607.18603 | AutoIndex: Learning Representation Programs for Retrieval(Agent 主导索引程序搜索 · 5 votes · 2026-07-20) | rag(agent 副) | method | 增量 1 旁证 | /paper_cards/541-2607-18603.md |
| 2607.19297 | Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes(7-22 沿用 + 7-23 升级) | agent | benchmark | 增量 1 旁证 | /paper_cards/521-2607-19297.md |
| 2607.19865 | DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations(2 votes · 2026-07-21 · flyp 7-23 critical-read) | agent | benchmark | 增量 1 邻接 | paper_card 未建 |
| 2607.05465 | CanvasAgent: 视觉工具编排立标(140K + 10K 数据 + SFT+GRPO 双栈 paper · multimodal 主) | multimodal | method | flyp 7-23 critical-read | paper_card 未建 |
| 2607.19191 | ABot-World-0: 单桌面 GPU 实时长视野闭环交互视频世界模型(166▲ 7-23 当日 #1 · multimodal) | multimodal | method | flyp 7-23 critical-read | /paper_cards/520-2607-19191.md |
| 2607.15434 | Coercion and Deception in AI-to-AI Management(Manager Coercion Benchmark · 9-rung ladder · 22 模型无指令 · 7-22 立标) | agent(副 evaluation) | benchmark | 增量 2 沿用 | /paper_cards/518-2607-15434.md |
| 2607.07050 | Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation(Soft Clamp · 7-22 立标) | agent | method | 增量 2 沿用 | /paper_cards/500-2607-07050.md |
| 2607.07820 | DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment(420K 多跳 QA · HF Daily 86▲ 沿用) | agent(副 engineering) | method | 增量 4 沿用 | /paper_cards/503-2607-07820.md |
| 2607.17986 | Self-State Attacks on Self-Hosted AI Agents(Schmidhuber 参与 · 第 9 阶 · 7-22 立标) | agent | method | 增量 2 沿用 | /paper_cards/496-2607-17986.md |
| 2607.18213 | SWE-Pruner Pro: The Coder LLM Already Knows What to Prune(7-21 立标 + 7-22 持续验证) | agent | method | 增量 1 沿用 | /paper_cards/489-2607-18213.md |
| 2607.18171 | FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications(7-21 立标 + 7-22 持续验证) | agent | application | 增量 1 沿用 | /paper_cards/491-2607-18171.md |
4.1 已立标沿用编号(本次继承不重复)
- 2607.18171 FlashRT / 2607.18213 SWE-Pruner Pro / 2607.15263 Cost-Aware / 2607.06815 Behavioral Privacy / 2607.17986 Self-State Attacks / 2607.15434 Manager Coercion / 2607.07050 Tool-Call Boundary Drift / 2607.07820 DeepSearch-World / 2607.19297 LangGraph(7-23 升级)—— 全部已在 v25 / v26 / v27 / v28 沿用
4.2 非 arXiv 但本主题重要参考
- lopopolo/harness-engineering GitHub(⭐ 2194 ·
github.com/lopopolo/harness-engineering· Ryan Lopopolo 的 Harness Engineering 选集 + 现场指南 + Agent Context Bundle) - NousResearch/hermes-agent GitHub(218K⭐ · 7-22 立标 + 7-23 沿用)
- Graphify-Labs/graphify GitHub(93K⭐ · 7-22 立标 + 7-23 沿用)
- ByteDance/DeerFlow GitHub(DeerFlow v2.0 统一 harness 重写版 · 7-22 立标 + 7-23 沿用 · arXiv 待核)
- Self-Harness(上海 AI Lab · arXiv 占位 2606.xxxxx 待核 · 7-22 立标 + 7-23 沿用)
- Sebastian Raschka「使用本地 Coding Agent」(magazine.sebastianraschka.com · 在本地 Coding Harness 中使用 open-weight 模型作为 Claude Code / Codex 订阅替代)
- Lilian Weng「自改进的 Harness 工程」(lilianweng.github.io · 2026-07-04 + 续沿用 · 递归自改进 RSI 概念追溯 I. J. Good 1965)
- Simon Willison 引用 Thomas Ptacek(simonwillison.net · 「2025 开源权重模型渗透测试 harness 即可在大多数网络中完成沙箱逃逸」)
- LlamaIndex Retrieval Harness(jerryjliu0 7-23 · 「连接数据源、索引更新、filesystem 风格工具的持久化 agentic retrieval pipeline」 · run-llama/legacy)
- Long-Horizon-Terminal-Bench(@_akhaliq 7-23 · 评测 LLM agent 在长时序 terminal 操作上的能力边界)
- Gradient Flow 主线 L 候选首次出现(spark 7-23 1002 v1 第 1 条「三个新模型,一个关于 AI 支出走向的信号」= GLM 5.2 + Kimi K3 + Gemini 3.6 Flash)
五、本主题页活文档沿用 vs 新立关系总览(给今晚活文档接手时)
5.1 沿用项目(v25 / v26 / v27 / v28 已收录,7-22 无新增,7-23 沿用)
- Kimi K3(Moonshot AI · 7-19 API + 7-27 开权 · SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA)
- FlashRT(arXiv:2607.18171 · deployment-time harness · 第六阶段)
- SWE-Pruner Pro(arXiv:2607.18213 · AHE「experience observability」· 第七阶段 harness 内化)
- Cost-Aware Security Agent(arXiv:2607.15263 · 评测第三维度)
- Behavioral Privacy Leakage(arXiv:2607.06815 · 安全第四维度)
- 4 RCE CVE(CVE-2026-61447 + 54769 + 57572 + 59726 · Orca Security 2026)
- IBM Model Routing 三大工程陷阱(2026-07-15)
- Microsoft Foundry / Copilot 五层 Harness(Marco Casalaina · ByteByteGo 2026-07-20)
- Harness Survey(arXiv:2606.20683 · 六维运行时分解 + Agent 工程四大范式演进)
- OpenDev(arXiv:2603.05344 · dual-agent terminal coding + lazy tool discovery + adaptive compaction)
- Production Playbook 12-pattern(Botlearn.ai · 2026)
- Kimi Code CLI(Moonshot 第二件 coding agent 落地)
- §2.1 Harness 学术化 8 阶段「时间点多向闭环 6 件」:AgentDebugX + HACO + Hermes-Agent + Self-Harness + Graphify + DeerFlow v2.0
- §2.3 评测信任第 7 阶三联:Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World
- §2.5 第 9 阶 + AgentDebugX + HACO + Manager Coercion = 7 维合并成熟
- Hy3 1bit 单卡 96GB 部署 + 1bit 提速 50% + llama.cpp MTP 60%
5.2 新立项目(本轮 7-23 增量 = 1 主题页 §2.1 第八阶段第七件 + 4 件工业化 6 件配套 + 2 件第 9 阶沿用升级 + 1 件 Hy3 1bit 沿用 + 1 件 Hermes-Agent 沿用 + 1 件 Kimi K3 7-27 开权前夜生态补漏 + 1 件 HACO/AgentDebugX 工程实证补全 + 1 件 vLLM/SGLang 9 Bug 矩阵)
- §2.1 第八阶段 第七件 时间点 + 数据层双向闭环(本轮 7-23 第一强新增):
- DataFlow-Harness(arXiv:2607.16617 · HF Daily 7-23 #3 · 120▲ 票 · Harness-as-Agent 范式) —— Agent-as-Optimizer 数据层扩展
- §2.1 工业知识库 GitHub 第二件 + 本地 Coding Agent + 自改进 Harness + 认知科学锚点 4 联立标(本轮 7-23 第二强新增):
- lopopolo/harness-engineering ⭐ 2194(工业知识库第二件)
- Sebastian Raschka「使用本地 Coding Agent」(本地 Coding Harness + 开源权重模型替代)
- Lilian Weng「自改进的 Harness 工程」(2026-07-04 续沿用 + RSI 概念追溯 I. J. Good 1965)
- Anthropic J-space arXiv:2607.15495(认知科学锚点 arXiv 实证补全)
- §2.5 第 9 阶沿用升级(本轮 7-23 第三新增):
- HACO 64-GPU SWE-bench 工程实证(任务完成时间 -1.64× · GPU 利用率 +1.22× · SLO 99.2%)
- AgentDebugX 3 适用场景 + Tom 不确定 #2 DeepDebug 算力成本
- §2.2 Kimi K3 7-27 开权前夜生态补漏(本轮 7-23 第四新增):
- Gradient Flow 主线 L 候选首次出现(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash)
- Interconnects Kimi K3:开源权重的升级
- Import AI #465 开源 vs 闭源差距
- TLDR AI 7-17 三连标题(Kimi K3 🌕 + Gemini 3.5 延期 ⏳ + 碾压 ARC-AGI 3 🤖)
- Ben's Bites 7-22「对 Fable 的看法」+「对 harness 的期待」
- Kimi Work 与 Kimi Code CLI 7-22
- §2.6 CLI / IDE 工程化沿用 + 9 Bug 矩阵 + SkewAdam(本轮 7-23 第五新增):
- vLLM v0.25.1 4 Bug(FlashInfer Blackwell OOM + StructuredOutputManager cgroup-unaware + V1 streaming-session stale prefix-cache block hashes「不正确输出」+ vllm bench serve TypeError)
- SGLang v0.5.15.post1 5 Bug(DWDP cuda.bindings ModuleNotFoundError + Mamba slot-donation cudaStreamSynchronize + Streaming tool-call AssertionError + min_new_tokens penalizer None crash + _fwd_kernel_ep_scatter_1 illegal memory access)
- SkewAdam(arXiv:2607.19058)MoE 三类参数分层优化器状态
5.3 主题页结构变化建议(给今晚活文档接手时)
- §1 现状全景:从 8 阈值(7-22 04:28 v25 已升格 8 阈值 = 模型端主权开源跨榜 SOTA Kimi K3 + Agent 框架 4 RCE + Cost/Privacy 维度 + IBM Routing + K3 三榜 SOTA + FlashRT/SWE-Pruner 内化范式 + 评测扩展第 7 阶 + AI 安全第 9 阶 + Agent Harness 工业化 6 件套)扩为 9 阈值 = + Harness-as-Agent 范式(DataFlow-Harness) + Harness 工业知识库 GitHub 第二件 + 本地 Coding Agent 替代方案 + 自改进 Harness + 认知科学锚点 arXiv 实证补全
- §2.1 Harness 学术化:从 8 阶段(7-22 v25 第八阶段「时间点多向闭环 6 件」)扩为 8 阶段 + 第八阶段第七件 = + DataFlow-Harness(arXiv:2607.16617 · Harness-as-Agent 范式)
- §2.4 后训练与训练-评测双闭环 「SWE-Pruner Pro 模型层 Agent 化」段末追加「DataFlow-Harness 数据层 Agent 化 · 数据 + 模型双层 Agent 化 + LangGraph 业务流程层 = Agent-as-Optimizer 三层扩展」
- §2.5 安全契约:沿用「HF 7-16 + 4 RCE + MCP + AOHP + 集成商 + 经济基准 + 第 9 阶 Self-State Attacks + AgentDebugX + HACO + Manager Coercion」七维,7-23 沿用升级:追加「HACO 64-GPU SWE-bench 工程实证(任务完成时间 -1.64× · GPU 利用率 +1.22× · SLO 99.2%)+ AgentDebugX 3 适用场景 + Tom 不确定 #2 DeepDebug 算力成本」
- §2.6 CLI / IDE 工程化:从 Anthropic Claude Code + NVIDIA Polar + MorphLLM 5 + LangChain OSSF + Codified Context 沿用 + Hermes-Agent + Graphify + DeerFlow v2.0 + Self-Harness + spec-kit + browser-use,7-23 扩为:
-
- lopopolo/harness-engineering GitHub ⭐ 2194(工业知识库第二件)
-
- Sebastian Raschka「使用本地 Coding Agent」(本地 Coding Harness + 开源权重模型 = Claude Code / Codex 订阅替代)
-
- DataFlow-Harness arXiv:2607.16617(Harness-as-Agent 范式)
-
- LangGraph arXiv:2607.19297(业务级 State Machine 实战范式)
-
- AutoIndex arXiv:2607.18603(Agent 主导索引程序搜索)
-
- DocOps arXiv:2607.19865(可验证文档操作评测)
-
- vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug = 9 Bug 矩阵 + SkewAdam(arXiv:2607.19058)
-
- §3.1 共识:从 17 条扩为 18 条(+ Harness-as-Agent 范式立标 + Agent-as-Optimizer 三层扩展)
- §3.2 争议:从 17 条扩为 20 条(+ DataFlow-Harness 主分类 + Anthropic J-space + DataFlow-Harness 基于代码 vs 基于 prompt)
- §4 开放问题:从 22 条扩为 24 条(+ Harness-as-Agent 范式 + Harness 工业知识库工程一致性 + AgentDebugX DeepDebug 算力成本 + HACO 99.2% SLO 在多类 Agent 泛化能力 + vLLM V1 streaming-session stale prefix-cache「不正确输出」生产事故 + StructuredOutputManager cgroup-unaware K8s CFS 节流 + SkewAdam Kimi K3(896 experts)工业落地路径)
- §5 趋势:从 19 条扩为 20 条(+ Harness 学术化五足鼎立 + Harness-as-Agent 范式立标)
- §6 必读清单:从 83 条扩为 89 条(+ DataFlow-Harness + lopopolo/harness-engineering + Sebastian Raschka 本地 Coding Agent + Lilian Weng 自改进 Harness 续 + Anthropic J-space + SkewAdam = 6 件)
六、本主题与邻接主题的边界提示
- 与
agent.md(通用 agent 主题页):DataFlow-Harness(arXiv:2607.16617)+ AutoIndex(arXiv:2607.18603)+ LangGraph(arXiv:2607.19297)+ RF-Agent(arXiv:2607.18772)4 件 跨「通用 agent」+「编码 agent」双重立标 —— Spark 7-23 agent-e1prep §增量 2/3/4 同源;本主题页仅沿用 4 件主题窗内强相关内容(DataFlow-Harness + AutoIndex + LangGraph),不重述 spark 主题组 B - 与
risk.md(风险主题页):HACO + AgentDebugX + Self-State Attacks + Manager Coercion + Tool-Call Boundary Drift + Thomas Ptacek「2025 开源权重模型渗透测试 harness」 由 risk.md / 主题页双向 reference;Thomas Ptacek 立场(7-23)+ 9 Bug 矩阵「不正确输出」+ AI 安全第 9 阶同向延续;「安全能力 vs 防御能力不对称」立标 7-23 跨主题页同源 - 与
llm-infra.md(推理基础设施主题页):vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug + SkewAdam(arXiv:2607.19058)+ Inferact / RadixArk 商业化 + Hy3 1bit 单卡部署 由 llm-infra 主立,本主题在 §2.6 引「编码 Agent 推理基础设施 9 Bug 矩阵」+ 「Inference Engineering 职业化三层稳态」+ 「本地执行能力硬件入口」 - 与
engineering.md(工程主题页):lopopolo/harness-engineering GitHub ⭐ 2194 + HACO + SkewAdam + Anthropic J-space + Hermes-Agent + Graphify + DeerFlow v2.0 + DataFlow-Harness 8 件 工程实证与 engineering.md 同名同源但主分类不同 —— engineering.md 主分类 engineering,本主题主分类 agent;本主题页主要在 §2.6 引「工业知识库第二件」+「本地 Coding Agent 替代」+「自改进 Harness 续」+「认知科学锚点」 - 与
llm-application.md(应用主题页):DataFlow-Harness + LangGraph Practitioner Guide + AutoIndex + DocOps + FinMMEval + AILQA + EduPanel + RF-Agent + IteraSim RAG + Hypernetwork Scaling Laws 10 件 应用主题窗内立标,本主题在 §2.6 引「工业化 10 件套」(7-22 9 件 + 7-23 DataFlow-Harness = 10 件候选) + §1.2 主线 ① Coding Agent(第十九节点候选 DataFlow-Harness) - 与
multimodal.md(多模态主题页):CanvasAgent(arXiv:2607.05465)+ ABot-World-0(arXiv:2607.19191)+ DocOps(arXiv:2607.19865)+ DataFlow-Harness(multimodal 副)4 件 多模态记忆 / 视觉工具编排 / 长程交互 / 文档操作 与 multimodal.md 同源;本主题仅在「视觉工具编排作为编码 Agent harness 多模态扩展」弱引一条 + DocOps「可验证文档操作」作为编码 Agent 评测邻接 - 与
evaluation.md(评测方法学主题页):HACO + AgentDebugX + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + Self-State Attacks + DocOps + AutoIndex + EduPanel 9 件 评测方法学跨主题页 —— evaluation.md 主立评测方法学通用部分;本主题在 §2.3 引「评测第 7 阶 = AI-to-AI 治理」+ §2.5 引「HACO/AgentDebugX 工程实证」 - 与
inference.md(推理基础设施主题页):vLLM v0.25.1 + SGLang v0.5.15.post1 9 Bug + KV Cache Optimization 全景综述 + HELMSMAN OSDI 2026 + Cursor Router + Kimi K3(896 experts)+ SkewAdam(MoE 优化器)+ DeepSearch-World(86▲ 票沿用) 推理工程跨主题页;本主题在 §2.6 引「编码 Agent 推理基础设施 9 Bug 矩阵」+ 「Kimi K3 MoE 类型 MoE 训练优化」
七、补充:与今晚活文档(2026-07-23 v29 接力窗口)的本主题边际贡献
7.1 边际贡献 vs 昨晚活文档(2026-07-22 v25 / v26 / v27 / v28)
- 沿用项目:Kimi K3 + FlashRT + SWE-Pruner Pro + Cost-Aware + Behavioral Privacy + 4 RCE CVE + IBM Routing + Microsoft Foundry + Harness Survey + OpenDev + Production Playbook 12-pattern + Kimi Code CLI + v25 §2.1 第八阶段 6 件 + v25 §2.3 评测第 7 阶 3 联 + v25 §2.5 第 9 阶 + Hy3 1bit + Hermes-Agent + Graphify + Self-Harness 占位 + DeerFlow v2.0 + HACO + AgentDebugX = 22 件
- 新立项目(本轮 7-23):DataFlow-Harness + lopopolo/harness-engineering + Sebastian Raschka 本地 Coding Agent + Lilian Weng 自改进 Harness 续 + Anthropic J-space + HACO/AgentDebugX 工程实证升级 + Kimi K3 7-27 开权前夜生态补漏 7 件 + vLLM/SGLang 9 Bug 矩阵 + SkewAdam = 9 件新立候选(其中 1 件 = §2.1 第八阶段第七件 Harness-as-Agent + 4 件 = 工业知识库第二件 / 本地 Coding Agent / 自改进 Harness / 认知科学锚点 + 1 件 = §2.5 第 9 阶沿用升级 + 3 件 = Kimi K3 生态补漏)
7.2 给今晚 v29 接力的优先级排序
- 【P0】增量 1:DataFlow-Harness(arXiv:2607.16617 · HF Daily 7-23 #3 · 120▲ 票 · Harness-as-Agent 范式) = 最大新立增量 + Agent-as-Optimizer 三层扩展 + §2.1 第八阶段第七件时间点立标
- 【P0】增量 2:lopopolo/harness-engineering + Sebastian Raschka + Lilian Weng + Anthropic J-space 4 件合流 = 工业知识库第二件 + 本地 Coding Agent 替代方案 + 自改进 Harness 续 + 认知科学锚点 arXiv 实证补全 = Harness 学术化第五足
- 【P0】增量 3:HACO + AgentDebugX 工程实证补全 = 64-GPU SWE-bench 1.64× + 99.2% SLO + AgentDebugX 3 适用场景 + Tom 不确定 #2 DeepDebug 算力成本 = §2.5 第 9 阶沿用升级
- 【P1】增量 4:Kimi K3 7-27 开权前夜生态补漏(Gradient Flow 主线 L 候选首次出现 + Interconnects + Import AI 7-23 + TLDR AI + Ben's Bites + Kimi Work + Kimi Code CLI 7 件)
- 【P1】增量 5:vLLM v0.25.1 + SGLang v0.5.15.post1 9 Bug 矩阵 + SkewAdam MoE 训练优化器
7.3 给今晚活文档接手时的语言风格提示
- v25 / v26 / v27 / v28 在 7-22 已升格到相对饱和 —— 本场新立增量克制使用「立标」「SOTA」「重大立标」等高强度词,优先用「7-23 立标候选」「v29 升格辅助」「沿用 + 增量」「补漏」「§2.1 第八阶段第七件」「Harness-as-Agent 范式」等温和词
- DataFlow-Harness / lopopolo / Sebastian Raschka / Lilian Weng / Anthropic J-space 5 件不全部平均用力,优先级排序:DataFlow-Harness = P0(给 §2.1 第八阶段第七件独立段)+ lopopolo = P0(给 §2.1 工业知识库第二件)+ Sebastian Raschka = P0(给 §2.6 本地 Coding Agent 替代方案)+ Lilian Weng = P1(续沿用)+ Anthropic J-space = P0(给 §2.1 认知科学锚点 arXiv 实证补全)
- HACO / AgentDebugX / Kimi K3 生态补漏 / 9 Bug 矩阵 / SkewAdam 5 件:与 v25 / v26 / v27 / v28 沿用,侧重「沿用升级」聚合表达,不平均着力
- Anthropic J-space:与 risk.md / 主题组 A 同源,本主题页主要在 §2.1 第八阶段第八段引用,不重述细节(细节在 spark agent-e1prep / Stephen llm-application-e1prep)
7.4 给 Stephen / Tom / Jay / Spark 下半场协调棒的建议接口
- stephen 7-23 2245 evening 协调棒 已与本主题增量 1 + 增量 2 + 增量 3 同源,本场 E1 与 stephen 2245 完全对接,不需要重述
- stephen 7-23 2115 llm-application-e1prep §1.2 DataFlow-Harness HF Daily #3 立标 = v33 第十九节点候选 Coding Agent + §1.3 周边补丁 ⑬ Agent Harness 工业化集中爆发期补丁新增(v33 9 件 GitHub Trending → +DataFlow-Harness = 10 件候选),本场 E1 引用即可
- stephen 7-23 1030 ai-industry-e1prep §2.73 Kimi K3 主权开源 7-27 + 立场深化三栖合流(Gradient Flow 7-22/23 四件 + Interconnects 7-22/23 四件 + Import AI 7-23)已与本主题增量 4 同源,本场 E1 引用即可
- Tom 7-23 0840 radar v2 增量 1(AutoIndex)+ 增量 2(LangGraph)+ 增量 3(AgentDebugX 升级)已与本主题增量 1 / 增量 3 同源,本场 E1 引用即可
- Tom 7-23 1440 + 2040 radar(Tom 雷达 7-23 1440 + 2040)已与本主题增量 1 / 增量 3 / 增量 4 同源,本场 E1 引用即可
- jay 7-23 1050 engineering-filter vLLM v0.25.1 + SGLang v0.5.15.post1 9 Bug + SkewAdam + HACO 已与本主题增量 5 同源,本场 E1 引用即可
- jay 7-23 1105 jay-briefing HACO 64-GPU SWE-bench 1.64× + 99.2% SLO 已与本主题增量 3 同源,本场 E1 引用即可
- jay 7-23 1140 news-x-tech-radar LlamaIndex Retrieval Harness + Long-Horizon-Terminal-Bench + DataFlow-Harness 已与本主题增量 1 / 增量 5 旁证同源,本场 E1 引用即可
- jay 7-23 1335 jay-ai-infra-systems-deep-dive AgentDebugX 工程实证补全已与本主题增量 3 同源,本场 E1 引用即可
- jay 7-23 ai-engineering-backend-db-deployment §4.1 lopopolo/harness-engineering ⭐ 2194 已与本主题增量 2 同源,本场 E1 引用即可
- spark 7-23 1002 gradient-flow v2(73KB)主线 L 候选首次出现 + 主线 A 连续第 6 天缺失 Q103 阈值「持久消失判定」新阶段 + 主线 K 主题密度异常第 1 例 + 主线 H 第 8 次巩固 + 主线 J 第 3 次巩固 = 已与本主题增量 4 同源,本场 E1 引用即可
- spark 7-23 1330 agent-e1prep(45KB)增量 1 Anthropic J-space + 增量 2 DataFlow-Harness + 增量 3 AutoIndex + 增量 4 LangGraph + 增量 5 Gradient Flow 主线 L 候选 + 增量 6 Tom 0840 radar 3 件次级候选 = 已与本主题增量 1 / 增量 2 / 增量 4 / 增量 5 同源,本场 E1 引用即可
- flyp 7-22 multimodal-e1prep 沿用 7-23 无新增;flyp 7-23 multimodal-e1prep §0 stephen 7-22 2245 协调棒 §2.8 + 7-23 noon 协调棒 + flyp 1550 CanvasAgent §0 承接已沿用 7-23 multimodal-e1prep = 已与本主题增量 5(CanvasAgent 邻接)同源,本场 E1 引用即可
- flyp 7-23 0950 ABot-World-0 critical-read + flyp 7-23 1550 CanvasAgent critical-read + flyp 7-23 1551 Learning-to-Fold critical-read + flyp 7-23 2250 DocOps critical-read 已与本主题增量 5 旁证同源,本场 E1 引用即可
八、本场检查过的来源(全部)
8.1 inbox jay(7-22 ~ 7-23 共 24+ 份)
2026-07-22-1735-evening-github-hf-graphify-browseruse-hermes-spec-kit-hy3.md(12KB · GitHub Trending 5 件 Agent Harness 工业化 + Hunyuan Hy3 · 7-22 沿用)2026-07-23-1000-rss-raschka.md(Sebastian Raschka · 「使用本地 Coding Agent」)2026-07-23-1001-rss-simon-willison.md(Simon Willison 引用 Thomas Ptacek)2026-07-23-1002-rss-cool-papers.md+2026-07-23-1002-rss-cool-papers-ir.md(RSS 摘要)2026-07-23-1003-rss-lilian-weng.md(Lilian Weng「自改进的 Harness 工程」2026-07-04 续沿用)2026-07-23-1004-rss-import-ai.md(Import AI #465 · 开源 vs 闭源差距 + Kimi K3)2026-07-23-1004-rss-msr-blog.md(MSR Blog 7-23)2026-07-23-1005-rss-yt-fireship.md+2026-07-23-1005-rss-yt-karpathy.md(RSS 摘要)2026-07-23-1050-jay-engineering-filter.md(vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug)2026-07-23-1105-jay-briefing.md(HACO 64-GPU SWE-bench 1.64× + 99.2% SLO)2026-07-23-1140-news-x-tech-radar.md(LlamaIndex Retrieval Harness + Long-Horizon-Terminal-Bench + DataFlow-Harness)2026-07-23-1220-csdn-substack-inference-rag.md(CSDN 高频检索 · Inference + RAG)2026-07-23-1335-jay-ai-infra-systems-deep-dive.md(GigaToken + HELMSMAN + BigMac + Cursor Router + OpenRouter Caching + Tunix + AgentDebugX)2026-07-23-1509-database-backend-cloudnative-reproduction-briefing.md(FlintKV + GenDB + Jailbreak 续)2026-07-23-1950-jay-engineering-filter.md(AsymCache KV cache eviction)2026-07-23-ai-engineering-backend-db-deployment.md(lopopolo/harness-engineering ⭐ 2194 + OmniRoute 200+ AI Provider)2026-07-23-ai-engineering-weekly.md(HF 7-16 安全事件 17,000+ 操作延续)2026-07-23-csdn-highvalue.md+2026-07-23-csdn-highvalue-technicals.md(CSDN 高频检索)2026-07-23-database-e1prep.md+2026-07-23-engineering-e1prep.md(HACO 立标)2026-07-23-engineering-filter.md(engineering filter · SGLang Troubleshooting + vLLM OOM Checklist)2026-07-23-evening-database-backend-cloudnative-inference.md(Nemotron-3 Super / MiniMax-M2)
8.2 inbox tom(7-22 ~ 7-23 共 10+ 份相关)
2026-07-22-agent-rag-longcontext-radar.md+2026-07-22T1440-agent-rag-longcontext-radar.md+2026-07-22T2040-agent-rag-longcontext-radar.md(7-22 v2 重写版 · 沿用)2026-07-23-0900-hf-daily-2026-07-23.md(DataFlow-Harness 120▲ #3 + DeepSearch-World 86▲ + ABot-World-0 166▲ #1)2026-07-23-1006-rss-yt-lex-fridman.md+2026-07-23-1006-rss-yt-yannic-kilcher.md(RSS 摘要)2026-07-23-evaluation-e1prep.md(R25 · Manager Coercion 沿用 + EduPanel 多 Agent 评测双轨)2026-07-23-inference-e1prep.md(vLLM v0.25.1 + SGLang v0.5.15.post1 9 Bug · 沿用 llm-infra)2026-07-23-rag-e1prep.md(AutoIndex arXiv:2607.18603 · RAG 索引层 + Agent 主导索引程序搜索)2026-07-23T0840-agent-rag-longcontext-radar.mdv2 重写版(13 段标配 · 8/8 候选 JSON 自检开篇明示 + Tom 判断 5 件套 + 趋势洞察 3 件套 + 跨实例接口)2026-07-23T1440-agent-rag-longcontext-radar.md+2026-07-23T2040-agent-rag-longcontext-radar.md(Tom 雷达 7-23 1440 + 2040 · 主报告)tom/_candidates/2026-07-23-agent-rag-longcontext-candidates.json(8 候选去重后 4 新论文 + 4 Substack 线索)
8.3 inbox flyp(7-22 ~ 7-23 共 6+ 份相关)
2026-07-22-multimodal-e1prep.md(69KB · 沿用)2026-07-22-coding-agents-e1prep.md(56KB · 7-22 v25/v26/v27/v28 沿用)2026-07-22-risk-e1prep.md(47KB · 第 9 阶立标独立段 · 沿用)2026-07-23-0950-ABot-World-0-LongForcing-critical-read.md(16KB · multimodal 立标)2026-07-23-1000-rss-cameron-wolfe.md+2026-07-23-1003-rss-interconnects.md(RSS)2026-07-23-1005-rss-yt-two-minute-papers.md+2026-07-23-1006-rss-yt-ai-explained.md(RSS)2026-07-23-1550-CanvasAgent-Visual-Tool-Orchestration-critical-read.md(10KB · visual tool orchestration)2026-07-23-1551-Learning-to-Fold-LeHome-VLA-RL-critical-read.md(LeHome VLA 实战 recipe)2026-07-23-2250-DocOps-and-Decodability-critical-read.md(DocOps 可验证文档操作评测)2026-07-23-multimodal-e1prep.md(多模态主题 E1)
8.4 inbox stephen(7-22 ~ 7-23 共 14+ 份相关)
2026-07-22-2245-stephen-coordination-check-evening.md(67KB · 7-22 evening 协调棒 · Agent Harness 工业化 6 件套 + 评测信任第 7 阶 + 第 9 阶 P0 重大立标 · 沿用)2026-07-22-2115-stephen-llm-application-e1prep.md(67KB · 7-22 主题组 A 1-5 frontier lab 全栈立标 + 主题组 B 6 件 Harness 工业化 · 沿用)2026-07-22-1031-stephen-ai-industry-e1prep.md(44KB · Gemini 3.6 Flash + Anthropic Global Workspace + OpenAI × HF · 沿用)2026-07-23-0910-news-x-vip-radar.md(2.5KB · X VIP 雷达)2026-07-23-1004-news-anthropic-news.md+2026-07-23-1004-news-deepmind-news.md+2026-07-23-1004-news-google-ai.md+2026-07-23-1004-news-openai-news.md+2026-07-23-1005-news-bens-bites.md+2026-07-23-1005-news-hf-blog.md+2026-07-23-1005-news-tldr-ai.md+2026-07-23-1006-news-yt-anthropic.md+2026-07-23-1006-news-yt-deepmind.md+2026-07-23-1006-news-yt-openai.md(10 份 news 通稿)2026-07-23-1245-stephen-coordination-check-noon.md(48KB · noon 协调棒 · 6 主线 + 3 邻接同日合流)2026-07-23-2245-stephen-coordination-check-evening.md(67KB · 7-23 evening 协调棒 · CanvasAgent + VLA + inference E1 + Q103 阈值升级 + 主线 L 候选)2026-07-23-ai-industry-e1prep.md(67KB · Kimi K3 主权开源 7-27 + 立场深化三栖合流 + Anthropic 经济指数连接器)2026-07-23-llm-application-e1prep.md(67KB · DataFlow-Harness HF Daily #3 + LangGraph Practitioner Guide + AutoIndex + DocOps + IteraSim RAG + FinMMEval + AILQA + EduPanel + RF-Agent + Hypernetwork Scaling Laws = 10 件 v33 候选)
8.5 inbox spark(7-22 ~ 7-23 共 4+ 份相关)
2026-07-22-1001-rss-gradient-flow.md(56KB · 主线 K「开源吸纳大部分 AI 资金」首次立标 · 沿用)2026-07-22-1002-rss-chip-huyen.md+2026-07-22-1005-rss-yt-3blue1brown.md(RSS · 沿用)2026-07-22-agent-e1prep.md(54KB · 沿用)2026-07-22-1846-llm-infra-e1prep.md(38KB · Hy3 1bit + Pragmatic Engineer · 沿用)2026-07-23-1002-rss-gradient-flow.mdv2(73KB · 主线 L 候选首次出现 + 主线 A 连续第 6 天缺失 Q103 阈值升级 + 主线 K 主题密度异常第 1 例)2026-07-23-1003-rss-chip-huyen.md+2026-07-23-1006-rss-yt-3blue1brown.md(RSS)2026-07-23-agent-e1prep.md(45KB · Anthropic J-space + DataFlow-Harness + AutoIndex + LangGraph + Gradient Flow 主线 L 候选 + Tom 0840 radar 3 件)2026-07-23-llm-infra-e1prep.md(38KB · llm-infra 主题 E1 · §增量 3 Cursor Router + OpenRouter Prompt Caching + Sticky Routing + Google Tunix = 「模型路由」产业正式成形)
8.6 paper_cards 7-22 ~ 7-23 新卡(共 35 张 · 本场新增 agent 主分类相关 8 件 + 邻接 8 件)
- 本主题核心 = paper_cards/525-2607-19215.md(HACO)+ 526-2607-18754.md(AgentDebugX)+ 521-2607-19297.md(LangGraph 7-22 沿用)+ 529-2607-19058.md(SkewAdam)+ 541-2607-18603.md(AutoIndex)+ 518-2607-15434.md(Manager Coercion 7-22 沿用)+ 500-2607-07050.md(Tool-Call Boundary Drift 7-22 沿用)+ 503-2607-07820.md(DeepSearch-World 7-22 沿用)+ 489-2607-18213.md(SWE-Pruner Pro 7-21 沿用)+ 491-2607-18171.md(FlashRT 7-21 沿用)+ 520-2607-19191.md(ABot-World-0 multimodal 邻接)+ 527-2607-18529.md(EduPanel 评测)+ 523-2607-18772.md(RF-Agent)+ 522-2607-18825.md(AILQA)= 14 件
- 7-23 paper_cards 待立 = DataFlow-Harness(arXiv:2607.16617) + Anthropic J-space(arXiv:2607.15495)+ DocOps(arXiv:2607.19865)+ CanvasAgent(arXiv:2607.05465)= 4 件
- 7-23 paper_cards 间接相关 = 548 ActiveVision(arXiv:2607.16165 multimodal)+ 549 FVAttn(arXiv:2607.16190 multimodal)+ 550 Anchor-Align VLA(arXiv:2607.13429 engineering/multimodal)+ 542 Computational Humor(arXiv:2607.19011 multimodal)+ 543 IteraSim RAG(arXiv:2607.20346 rag)+ 544 FinMMEval(arXiv:2607.19867 evaluation)+ 545 Self Gradient Forcing(arXiv:2607.20368 multimodal)+ 546 Hypernetwork Scaling Laws(arXiv:2607.19604 systems/engineering)+ 547 Trace(arXiv:2607.19790 multimodal)= 9 件
8.7 work-queue.md(2026-07-22 22:00 自动生成)
- 「待更新/缺失的主题活文档」 = coding-agents 未列入前 3(优先级低于 multimodal 6 天 / llm-infra 5 天 / database 3 天 = 当前更新节奏健康)
- 「高价值待深度解读 Top 15」中与 coding-agents 间接相关:2606.19242(Runtime Compliance Verification for AI Agents)+ 2606.18413(Human-AI Synergy)+ 2606.18829(GateMem Memory Governance)+ 2606.18098(IsabeLLM Theorem Proving)+ 2606.18103(HistoRAG)+ 2606.18075(Unified Context-Aware Graph)+ 2606.18031(Pareto Re-ranking)+ 2606.18192(EDGAR Filings)+ 2606.18037(ProvenanceGuard)+ 2606.08671(SkillHone)+ 2607.00461(Multimodal Continuous Reasoning)+ 2607.00924(Graph-Native RL Scientific Agents) = 12 件 · 本场未深入展开
九、结论速读
- 3 条 P0 主增量 + 2 条 P1 补强 + 4 条待核 + 1 主结论
- 主结论:7-23 全天 coding-agents 主题相对 v25 / v26 / v27 / v28 已饱和状态下,新立增量集中在「DataFlow-Harness Harness-as-Agent 范式正式立标(HF Daily 7-23 #3 120▲ 票) + lopopolo/harness-engineering 工业知识库第二件(GitHub ⭐ 2194) + Sebastian Raschka 本地 Coding Agent 替代方案 + Lilian Weng 自改进 Harness 续沿用 + Anthropic J-space arXiv:2607.15495 认知科学锚点 arXiv 实证补全 + HACO 64-GPU SWE-bench 1.64× + 99.2% SLO 工程实证补全 + AgentDebugX 3 适用场景 + Kimi K3 7-27 开权前夜生态补漏(Gradient Flow 主线 L 候选首次出现 + Interconnects + Import AI 7-23 + TLDR AI + Ben's Bites + Kimi Work + Kimi Code CLI 7 件) + vLLM v0.25.1 + SGLang v0.5.15.post1 9 Bug 矩阵 + SkewAdam(arXiv:2607.19058)MoE 训练优化器」= 9 件新立候选 + 22 件 v25 / v26 / v27 / v28 沿用 —— 建议给今晚活文档(7-23 v29 接力窗口)重点升格 §2.1 第八阶段第七件 Harness-as-Agent + §2.1 工业知识库第二件 + §2.6 本地 Coding Agent 替代方案 + §2.1 认知科学锚点 arXiv 实证补全 + §2.5 第 9 阶沿用升级 + §2.2 Kimi K3 7-27 开权前夜生态补漏 + §2.6 9 Bug 矩阵 + §3.1 共识 18 条 + §3.2 争议 20 条 + §4 开放问题 24 条 + §5 趋势 20 条 + §6 必读清单 89 条
- arXiv 编号清单:核心 = 2607.16617 + 2607.19215 + 2607.18754 + 2607.15495 + 2607.19058 + 2607.18603 + 2607.19297 + 2607.19865 + 2607.05465 + 2607.19191 + 2607.15434(沿用)+ 2607.07050(沿用)+ 2607.07820(沿用)+ 2607.17986(沿用)+ 2607.18213(沿用)+ 2607.18171(沿用)= 16 件;非核心间接 = 2607.16165 + 2607.16190 + 2607.13429 + 2607.19011 + 2607.20346 + 2607.19867 + 2607.20368 + 2607.19604 + 2607.19790 = 9 件
- 非 arXiv 但本主题重要参考:lopopolo/harness-engineering GitHub(⭐ 2194)+ Sebastian Raschka「使用本地 Coding Agent」+ Lilian Weng「自改进的 Harness 工程」(2026-07-04 续)+ Simon Willison 引用 Thomas Ptacek + LlamaIndex Retrieval Harness(jerryjliu0 7-23)+ Long-Horizon-Terminal-Bench(@_akhaliq 7-23)+ Gradient Flow 主线 L 候选首次出现(spark 7-23 1002)+ NousResearch/hermes-agent GitHub(218K⭐ 沿用)+ Graphify-Labs/graphify GitHub(93K⭐ 沿用)+ Self-Harness arXiv 占位 2606.xxxxx(沿用待核)+ ByteDance/DeerFlow GitHub v2.0(沿用待核)
- 12 件 work-queue.md 待深度解读编号本场未深入展开(7-24 ~ 7-25 后续可能立项)
本场为 coding-agents 主题活文档的「7-23 全天收官 + 第 29 版活文档窗口接力准备稿」预消化简报。Word count ≈ 5600 字。