coding-agents · E1 预消化简报(2026-07-28)

作者:flyP(🀄) 触发:cron 7a0c0a42-eb2e-4bcd-af74-634628039865 · 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档 /shared/research-kb/organized/knowledge/coding-agents.md 当前已固化到 v34 Wave4 E1 第十轮 7-28 04:20:16 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座沿用 + §2.3 评测表 22 行(arXiv:2602.23368v1 已核)+ §2.4 后训练 18 件候选 + 上下文管理范式五路线对立 + §2.5 安全契约 11 阶 + 84/85/86 节点 + §2.6 多模态/CLI/IDE + 42 子节立标级 + 共识 43 / 争议 36 / 开放问题 55 / 趋势 35 / 必读 142) 窗口:近 2 天(2026-07-26 ~ 2026-07-28)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 7-26 ~ 7-28 新卡(601-615)+ HF Daily 7-26 ~ 7-28;重点增量区间:v34 第十轮 7-28 04:20 → 今晚 7-28 23:20 共 19 小时内边际增量 基线对照:昨晚 7-27 E1 预消化立标 = 5 件(0 P0 主线 + 2 P0 沿用升级 + 2 P0 跨主题补全 + 1 P1 邻接 + 1 P2 监测)= Anthropic 7-27 morning 评论层长尾 + SDB 生产 Agent 可靠性 + Markdown Memory Paradigm 文件系统即上下文 + Learning on the Job 冻结权重持续学习 + HF Daily AREX 139▲ + SDM 跌出 15,全部已并入 v34 第十轮;本场定位 = 「v34 第十轮 16 阈值 + 42 子节 SDB 立标级 + 范式五路线对立饱和状态下,承接 7-28 04:20 ~ 7-28 23:20 共 19 小时内边际增量,以『饱和沿用 + 跨主题补全 + 4 件 agent 主分类 arXiv 立标候选新立 + 评论层持续长尾 + 反方持续激活 + 7-29 验证截止前夜强提醒』形态呈现。新增 arXiv 立标 4 件 P0/P1(主分类 agent 但全部与编码/harness/Agent 训练工程化直接邻接 · 1 件已在 v34 第十轮作为 P3 候选 + 3 件全新立标候选)+ P0 沿用升级 1 件 + P0 跨主题补全 2 件 + P0 行业立标 1 件 + P1 监测 1 件」


0. 综述判断(给今晚活文档接手时一眼看到)

  • v34 第十轮 7-28 04:20 已固化 16 阈值 + SDB 形式化锚定 + 范式五路线对立 + Agent 持续学习新范式 + 评论层长尾持续 7 天 7-21~7-27 + 第八十六节点 llm-infra 邻接 = 饱和形态;7-27 E1 5 件新立标已被完整吸收。
  • 本场定位:v34 第十轮饱和状态下,边际增量以"饱和沿用 + 跨主题补全 + 4 件 agent 主分类 arXiv 立标候选新立 + 评论层持续长尾"形态呈现;新增 arXiv 立标 4 件 P0/P1(全部主分类 agent,部分已建 paper_card 7-28 12:30);新增 P0 主线 0 件(活文档主线饱和);新增 P0 沿用升级 1 件(Kimi K3 主权开源 2.0 立标级 · §1.45 frontier lab 第 8 栖候选);新增 P0 跨主题补全 2 件(CSDN Agent 4 范式 + OWASP Agent Top 10 2026 ASI01-ASI10 实战层/安全层承接);新增 P0 行业立标 1 件(Anthropic Opus 5 + Economic Index connector + Project Pilot + 6 媒体评论层持续);新增 P1 监测 1 件(AAAI Subramanian 7 反方 7-29 验证截止前夜强提醒);反方持续激活 1 件(flyp v34 §3.3 反方 #55「评级升级时机风险」SDM 持续跌出 15 名外);新增 P2 警示 2 件(Learning on the Job 数字模糊待补完 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查)。
  • 本场净新增量性质(7-28 04:20 → 7-28 23:20 共 19h):
    1. 🔴 P0 增量 1 · 4 件 agent 主分类 arXiv 立标候选新立(Molt + Learning on the Job + IDEAgent + Multi-Head Latent Control · paper_cards 604/607/608/610 7-28 新建卡 12:30 · tom 7-28 08:40 radar + spark 7-28 13:30 agent-e1prep §增量 2/3/4/5 + stephen 7-28 22:45 coordination-check-evening §2 P1 增量 4 + jay 7-28 engineering-e1prep §增量 4/7 + jay 7-28 21:05 evening-briefing + paper_cards/604-2607-22375.md + paper_cards/607-2607-21653.md + paper_cards/608-2607-14277.md + paper_cards/610-2607-22157.md)= 「训练侧 Molt + 推理侧 Multi-Head Latent Control + 冻结权重持续学习 Learning on the Job(已在 v34 第十轮作为 P3 + 本场升级为 P0 沿用升级)+ QD-Search IDEAgent 4 联学术 Harness 立标补全」 = §1.33c 横切 53c 商业 Harness 立标补全 学术 Harness 维度补全 + §2.5 第 87-90 节点候选新增 + §1.43 横切 80 第 9-10 件候选新增 + §2.1 综述立标 14+23 → 14+24 候选新增 + §2.4 多智能体协作 55 节点候选新增
    2. 🔴 P0 增量 2 · Kimi K3 7-27 evening 1.56TB HuggingFace 完整开源主权开源 2.0 立标级 6 实例同步承接(stephen 7-28 10:27 ai-industry-v30 §增量 5 ⭐⭐⭐⭐ + jay 7-28 11:05 five-category-briefing Backend B1 ⭐⭐⭐⭐⭐ + jay 7-28 11:08 engineering-e1prep-v38 §B1 + jay 7-28 11:10 kimi-k3-inference-systems-substack 独立主题文件 + jay 7-28 21:05 evening-briefing-arxiv-cncfsurvey-substack + spark 7-28 10:02 rss-gradient-flow + tom 7-28 08:50 rag-e1prep-v47 沿用 + flyp 7-28 09:54 multimodal-e1prep-v34 沿用 + simon-willison 7-28 1001 + stephen 7-28 22:45 coordination-check-evening §3.5.1 1 件统一主线立标 11 实例同步承接 候选)= §1.45 frontier lab 立标续立 第 8 栖候选 · 主权开源 2.0 立标级——本场 P0 沿用升级(已有 §2.2 模型与基座 Kimi K3 7-19 API + 7-27 evening 开权前夜生态补漏 沿用升级 = 7-27 开权落地完整覆盖)。
    3. 🔴 P0 增量 3 · CSDN Agent 4 范式(Function Calling + MCP + CLI + Skills)+ OWASP Agent Top 10 2026 ASI01-ASI10 = 实战层 / 安全层承接 v34 §1.33c 横切 53c 商业 Harness 立标补全(jay 7-28 12:22 csdn-substack-rag-agent-multimodal-finetuning-jul2026 CSDN Agent 1 + Agent 4 ⭐⭐⭐⭐⭐ + jay 7-28 11:11 owasp-agent-security-hf-incident ⭐⭐⭐⭐⭐ + stephen 7-28 22:45 coordination-check-evening §3.5.4 P1 增量 3 ⭐⭐⭐⭐ + flyp 7-28 16:53 risk-e1prep 收官棒)= 「Function Calling(最基础的"给模型一组可用函数")+ MCP(Model Context Protocol 标准化工具/资源/提示的客户端-服务器协议)+ CLI(命令行工具,让 agent 直接调用 shell)+ Skills(agent-skills 工程化技能集合)= 工程层范式收敛」+ 「MCPorter 项目 = MCP 的 OAuth 鉴权增强,2026 年企业部署必备」+ 「AI Agent 开发实战四件套 = ReAct + MCP + Token 预算 + trace + 安全沙箱(Python 3.11+ 验证)」+ 「OWASP Agent Top 10 2026 ASI01-ASI10 = LLM01-10(传统 LLM)+ ASI01-10(Agentic AI 新增)= 评估标准硬框架 + Goal Hijack(ASI01)= 目标劫持 + Prompt Injection(LLM01)= AI 等效 SQL Injection + Agentic Threat Surface 独特性(LLM generates words. Agent takes actions. Actions speak louder than words!) + 高风险操作分类(HIGH RISK/MEDIUM RISK/LOW RISK 三档)+ Agent Guardrails vs LLM Guardrails 演进(2024 = Input/Output 过滤器;2026 = Agent 行为约束系统)」 = §1.33c 横切 53c 商业 Harness 沿用·实战层承接 + §1.45 五向合流 5 向 → 6 向合流候选 + §2.6 评测、可靠性与对抗 评测基线硬框架新增
    4. 🔴 P0 增量 4 · Anthropic 7-28 evening frontier/industry 立标 9 件 + 评论层持续长尾 7-25~7-28 6 媒体 + Boris Cherny「Opus 5 最难被 prompt 注入」+ Project Pilot AI 操控无人机 + Claude Opus 5 系统卡 + 经济测度产品化 + Public First Action 再捐 2000 万美元(stephen 7-28 1004 news-anthropic-news 5 URL + stephen 7-28 0910 X-radar + jay 7-28 1001 simon-willison + flyp 7-28 16:53 risk-e1prep §增量 3 沿用 + stephen 7-28 22:45 coordination-check-evening §3.5.4 + spark 7-28 gradient-flow 沿用)= 「Anthropic Claude Opus 5(7-24 evening)$5/$25 每 M tokens + effort 控件 + Claude Max/Pro 默认模型 + ARC-AGI-3 30.2% 新 SOTA + Boris Cherny 引用 Opus 5「最难被 prompt 注入」+ AnthropicAI 官方 news 发布 + Project Pilot AI 操控无人机 + Claude Opus 5 系统卡」= §1.45 frontier lab 立标 持续长尾——本场 P0 沿用升级(v34 第十轮 §2.103 段尾「评论层长尾 7-25~7-27 持续 6 媒体续立」标注 + v34 §1.45 五向合流 沿用升级 + v34 §3.1 共识 #35 续立)。
    5. 🟡 P1 增量 5 · AAAI 2026 Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止前夜强提醒(tom 7-28 08:50 rag-e1prep-v47 §增量 5 ⭐⭐⭐ + flyp 7-27 09:50 Keyword-Search-Is-All-You-Need-critical-read B 级 3.5/5 + stephen 7-28 22:45 coordination-check-evening §3.5.4 + spark-on-Tom 7-28 14:36 E3 review 收官 5 件独立待核实说法独立成段 + 7-28 是验证前夜)= 「4 验证截止日:7-29(明天)v1 PDF 全文细节 + shell 工具列表 → 7-30 AAAI 2026 main vs industry track 区分 → 7-31 不同 LLM 迁移性 + 混合方案对照 → 8-15 长上下文/多模态跨任务迁移性」+ 「7 反方硬标签:① 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐ ② 200K context vs shell 工具边界不清——是"context stuffing + grep"而非 RAG 替代 ⭐⭐⭐⭐⭐(最高严重度) ③ 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐ ④ Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐ ⑤ Agent-as-retriever cost-benefit 未量化 ⭐⭐⭐ ⑥ 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐ ⑦ AAAI 2026 main vs industry track 区分不清 ⭐⭐」 = §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 7 后续验证动作 7-29 ~ 8-15 截止日化
    6. 🟡 P2 警示 6 · Learning on the Job 数字模糊待补完 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查(spark-on-Tom 7-28 14:36 E3 review 收官 5 件独立待核实说法独立成段 质量分 7/10 + stephen 7-28 22:45 coordination-check-evening §5 ⚠️ 警示 3 件 P0 修正必须 R47 接力前完成)= 「增量 3 数字补完:Learning on the Job 「击败完整 RAG 基线」→「single-trial success 1.6×(outcome verdict)/ 2.6×(corrections)static-RAG;22/84 任务被解决;模型异构复现于 Mistral Large + Claude Sonnet 5;论文本身仅 banking domain 单一场景」+ 论文作者「Valentin Tablan, Scott Taylor, Kristoffer Bernhem(The Memory Company)」+ arXiv 2607.22157v1」+ 「增量 2 δ-mem 评级降级:⭐⭐⭐⭐ → ⭐⭐⭐(机制描述具体但独立可复现性未确认)+ 加入「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示」——本场 P2 警示(承接 v34 第十轮 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 沿用)。
    7. 🟢 P2 反方持续激活 7 · Self-Supervised Structured Dynamics arXiv:2607.21576 28→18▲ 单日 -10 持续跌出 15 名外 + 累计跨日 60▲ → 7-28 evening 18▲ 持平未回升 + 累计跨日 78▲ 触发 flyp v34 §3.3 反方 #56 第二日复核节点激活(tom 7-28 0900 hf-daily-2026-07-28 + stephen 7-28 22:45 coordination-check-evening §3.5.4 + spark 7-28 13:30 agent-e1prep §三.4 + flyp 7-28 0955 dual critical read 反思规则第 22 次适用)= v34 §3.3 反方 #56 新增(原 #55「评级升级时机风险」7-28 持续激活 + 第二日复核节点新增)——本场 P2 反方监测。

1. 增量条目(0 件 P0 主线 + 1 件 P0 沿用升级 + 2 件 P0 跨主题补全 + 1 件 P0 行业立标 + 1 件 P1 监测 + 1 件 P2 警示 + 1 件 P2 反方监测,按"建议归入节"分组)

增量 1 · ⭐⭐⭐⭐⭐ · 🔴 P0 沿用升级 · 4 件 agent 主分类 arXiv 立标候选新立(Molt + Learning on the Job + IDEAgent + Multi-Head Latent Control)= 「训练侧 Molt + 推理侧 Multi-Head Latent Control + 冻结权重持续学习 Learning on the Job + QD-Search IDEAgent 4 联学术 Harness 立标补全」

字段 内容
来源 Molt arXiv:2607.21653:tom 7-28 08:40 radar §HF Daily 7-28(NVIDIA-labs OO Agents + Molt 同框 +24▲ 新立标候选)+ stephen 7-28 10:27 ai-industry-v30 §增量 2 HF Daily 7-28 5 件 net-new 立标级候选同表 + spark 7-28 13:30 agent-e1prep §增量 2 🔴 P0 + jay 7-28 11:08 engineering-e1prep-v38 §增量 4 P1 + jay 7-28 21:05 evening-briefing-arxiv-cncfsurvey-substack-hf-jul2026 + stephen 7-28 22:45 coordination-check-evening §2 P1 增量 4 + paper_cards/607-2607-21653.md(7-28 12:30 新建卡 · 主分类 agent · 副分类 engineering);Learning on the Job arXiv:2607.22157:tom 7-28 08:40 radar §高价值 1(⭐⭐⭐ 本期首选)+ tom 7-27 20:40 radar(⭐⭐⭐ 本期首选 · Tablan 单作者 · 已沿用 v34 第十轮 P3 候选)+ tom 7-28 08:50 rag-e1prep-v47 §增量 3 ⭐⭐⭐⭐(与 Experience Distillation 正交)+ spark 7-28 13:30 agent-e1prep §增量 3 🔴 P0 + jay 7-28 11:08 engineering-e1prep-v38 §P2 警示 + stephen 7-28 22:45 coordination-check-evening §2 P1 增量 4 + spark-on-Tom 7-28 14:36 E3 review 收官 5 件 P0 修正 §5 警示 + paper_cards/610-2607-22157.md(7-28 12:30 新建卡 · 主分类 agent · 副分类 engineering);IDEAgent arXiv:2607.22375:tom 7-28 08:50 rag-e1prep-v47(来源沿用 · 候选池阶段)+ stephen 7-28 12:48 coordination-check-noon 14 张 paper_cards 抽样 + spark 7-28 13:30 agent-e1prep §增量 4 🟡 P1 + stephen 7-28 22:45 coordination-check-evening §2 P1 增量 4 + paper_cards/604-2607-22375.md(7-28 02:10 新建卡 · 主分类 agent · 形态 method);Multi-Head Latent Control arXiv:2607.14277:tom 7-28 08:40 radar §高价值 2(HF Daily 7-14 · agent + systems 双标签)+ tom 7-28 08:50 rag-e1prep-v47 沿用 + spark 7-28 13:30 agent-e1prep §增量 5 🟡 P1 + jay 7-28 11:08 engineering-e1prep-v38 §增量 7 P1(与 OWASP ASI01 Goal Hijack 构成威胁-防御对称关系)+ stephen 7-28 22:45 coordination-check-evening §2 P1 增量 4 + paper_cards/608-2607-14277.md(7-28 新建卡 · 主分类 agent)
arXiv 号 arXiv:2607.21653 Molt(7-28 已建卡 607)+ arXiv:2607.22157v1 Learning on the Job(7-28 已建卡 610)+ arXiv:2607.22375 IDEAgent(7-28 已建卡 604)+ arXiv:2607.14277 Multi-Head Latent Control(7-28 已建卡 608)
一句话 4 件 agent 主分类 arXiv 立标候选新立: ① Molt(Pytorch-native Agentic RL 训练框架 · 与 OpenForgeRL 同切面训练侧 vs 生产侧);② Learning on the Job(冻结权重 + 部署反馈 + 自然语言规则蒸馏 · 与 Experience Distillation 正交 · 1.6×/2.6× static-RAG · 22/84 任务被解决 · Mistral Large + Claude Sonnet 5 复现 · banking domain 单一场景);③ IDEAgent(Quality-Diversity Search 联合优化 · research idea generation 多目标联合方向);④ Multi-Head Latent Control(LLM 内部 latent decision heads · 推理侧控制决策 · 与 prompt 层路由 / 任务特定微调并列的第三条路径 · 与 OWASP ASI01 Goal Hijack 构成威胁-防御对称关系) = 「训练侧 Molt + 推理侧 Multi-Head Latent Control + 冻结权重持续学习 Learning on the Job + QD-Search IDEAgent 4 联学术 Harness 立标补全」
v34 第十轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.43 横切 80 Why Agents Fail 7 件套 + v34 §2.1 综述与方法学骨架 14+23 + v34 §2.2 记忆与上下文工程 57-59 节点 + v34 §2.4 后训练 Agentic RL 训练栈 18 件候选 + v34 §2.4 多智能体协作 54 节点 + v34 §2.5 运行时与基础设施 86 节点 同源;v34 §1.33c 横切 53c 学术 Harness 维度补全 + §1.43 横切 80 第 9-10 件候选新增 + §2.1 综述立标 14+23 → 14+24 候选新增 + §2.4 多智能体协作 55 节点候选新增 + §2.5 运行时与基础设施 87-90 节点候选新增:1) Molt arXiv:2607.21653 = 学术 Harness 立标补全(v34 §1.33c 商业 Harness → v34 §1.33c 学术 Harness 沿用 = 学术 Harness 维度补全)+ §2.5 第八十七节点候选新增(v34 §2.5 86 节点 + Molt = 87 节点候选 = Agentic RL 训练侧工程化新增);「训练侧 Molt + 生产侧 OpenForgeRL」二联组合立标(OpenForgeRL = harness-native proxy + K8s orchestrator 生产侧;Molt = 训练侧 Pytorch-native 框架)= §3.1 共识 候选新增 44;2) Learning on the Job arXiv:2607.22157v1 = v34 第十轮 §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 → 本场升级为 P0 沿用升级 + §1.43 横切 80 第 9 件候选新增(v34 已立 → 数字补完 1.6×/2.6×/22/84/Mistral Large + Claude Sonnet 5 复现/banking domain 单一场景 + 作者 Valentin Tablan, Scott Taylor, Kristoffer Bernhem(The Memory Company))+ §2.4 记忆与上下文工程 第 60 节点候选(v34 57-59 节点 + Learning on the Job = 60 节点 = 冻结权重 + 部署反馈 + 自然语言规则蒸馏 = 与 Experience Distillation 正交);「frozen-weights deployment feedback 三件套」(OpenForgeRL harness-native + ReOPD prefix replay distillation + Learning on the Job frozen-weights deployment feedback) = Agent 训练工程化复用立标层(v34 §2.4 §3.1 共识 + §3.4 T110 第 10 件候选 沿用升级);3) IDEAgent arXiv:2607.22375 = §2.1 综述立标 14+23 → 14+24 候选新增(v31 AREX BAAI 锚 + v32 Anthropic J-space + IDEAgent = 综述立标邻接补全) + §3.4 T113 第 5 联 RS-idea-gen 候选新增("Agent 工程化 5 联立标 = 训练(Molt) + 检索(Keyword Search) + 世界模型(Agentic World Models) + Harness(OpenForgeRL) + RS-idea-gen(IDEAgent QD-Search + AREX RSI)");4) Multi-Head Latent Control arXiv:2607.14277 = §2.4 多智能体协作 第 55 节点候选新增(v34 §2.4 54 节点 + MHLC = 55 节点 = 推理侧控制决策) + §1.32 横切 52 候选新增"横切 52b"(v34 §1.32 Multi-Agent 短视极化协调次优 POSG 形式化 = 多 Agent 协调 vs MHLC = 单 Agent 决策侧控制 互为表里)
反方 / 风险 (A) Molt 是否引入新方法论 vs 仅"工程美学" —— Molt 与 OpenForgeRL(harness-native proxy + K8s orchestrator)是同一立标层的不同切面(训练侧 vs 生产侧),需要 Molt 与 OpenForgeRL head-to-head 实证(v34 §4.1 开放问题 候选新增 56);(B) Learning on the Job 量化数据:τ-bench 银行场景击败完整 RAG 基线但击败幅度未量化(具体数字 1.6×/2.6× 来自论文但需精确核验)+ 跨领域迁移性待核(论文本身仅 banking domain 单一场景);(C) IDEAgent QD-Search 与现有 research idea generation 系统对照:v31 AREX BAAI 锚 = 自我改进侧;IDEAgent = idea diversity 侧 = 互补但缺乏 head-to-head 实证;(D) Multi-Head Latent Control 工程实现细节:latent decision heads 的具体架构 + 训练方法 + 与现有 prompt 层路由 / 任务特定微调的对比基准 待核;(E) 4 件立标候选主分类为 agent 但跨邻接 engineering/evaluation/multimodal 等多主题,v34 coding-agents.md 收录边界需精确划定;(F) paper_cards 604/607/608/610 TLDR 中文译文精度(spark 7-28 13:30 §5 候选 arXiv 号 表 + jay 7-28 engineering-e1prep §P2 警示 待核)
建议归入节 §1.33c 横切 53c 商业 Harness 沿用·学术 Harness 维度补全(v34 已立 → v34 候选新增"训练侧 Molt + 检索侧 Keyword Search + 世界模型侧 Agentic World Models + Harness 工程化侧 Agentic RL 框架 + RS-idea-gen IDEAgent = Agent 工程化 5 联立标延展") + §1.43 横切 80 Why Agents Fail(v34 已立 7 件套 → 候选新增第 9 件 Learning on the Job "失败作为学习机会"的工程化实现) + §2.1 综述与方法学骨架 14+23 → 14+24(沿用 v31 AREX + v32 Anthropic J-space + IDEAgent = v34 14+24 综述立标邻接补全) + §2.2 记忆与上下文工程 第 60 节点候选新增(v34 57-59 节点 + Learning on the Job = 60 节点 = 冻结权重持续学习新立标) + §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 → P0 沿用升级(Learning on the Job 数字补完) + §2.4 多智能体协作 第 55 节点候选新增(v34 54 节点 + MHLC = 55 节点 = 推理侧决策控制) + §2.5 运行时与基础设施 第八十七节点候选新增(v34 86 节点 + Molt = 87 节点 = Agentic RL 训练侧工程化) + §3.1 共识 候选新增 44(「训练侧 Molt + 生产侧 OpenForgeRL = Agent 工程化 4 联立标层(训练 + 检索 + 世界模型 + Harness)从横切 53c 4 联 → 5 联新增」) + §3.4 T113 候选新增第 5 联 RS-idea-gen + T110 第 10 件候选 Learning on the Job + §4.1 开放问题 候选新增 56-58(Molt 与 OpenForgeRL head-to-head + Learning on the Job 跨领域迁移 + IDEAgent QD-Search vs AREX RSI head-to-head) + §6 必读清单 候选新增 4 件 arXiv 号 第 143-146 条(arXiv:2607.21653 Molt + arXiv:2607.22157v1 Learning on the Job + arXiv:2607.22375 IDEAgent + arXiv:2607.14277 Multi-Head Latent Control)
重要边界 不要与 v34 §2.5 第八十六节点 HyMCache arXiv:2607.18141 混为同一件工作:HyMCache = CXL 混合内存 KV Cache llm-infra 邻接,Molt = Agentic RL 训练侧工程化 = 推理基础设施 vs 训练基础设施 不同对象;不要与 v34 §2.2 57-59 节点 Sample-Efficient + SkillOpt + Memora + ACM 混为同一件工作:Learning on the Job = 冻结权重 + 外部记忆 + 规则蒸馏 vs Sample-Efficient = 训练时样本效率 + Experience Distillation + ACM = 上下文管理 lifecycle = 持续学习 vs 训练效率 vs 上下文 不同对象;不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约,4 件立标候选 = 训练 / 推理 / 持续学习 / QD-Search = 边界形式化 vs 训练 / 推理机制 不同对象;不要与 v34 §1.32 横切 52 Multi-Agent 短视极化协调次优 POSG 形式化 混为同一件工作:横切 52 = 多 Agent 协调次优 POSG 形式化,MHLC = 单 Agent 决策侧控制 = 多 Agent vs 单 Agent 不同对象;不要与 v34 §1.43 横切 80 Why Agents Fail 7 件套 混为同一件工作:Why Agents Fail = 失败模式 7 件套,Learning on the Job = "失败作为学习机会"的工程化实现 = 失败模式 vs 学习路径 不同对象;不要与 v34 §2.1 综述立标 14+23 中 v31 AREX arXiv:2607.21461 BAAI 锚 + v32 Anthropic J-space arXiv:2607.15495 混为同一件工作:AREX = 自我改进侧 + BAAI 锚, IDEAgent = idea diversity 侧 = 互补不同立标;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 混为同一件工作:T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB,Learning on the Job = 冻结权重 + 持续学习 + τ-bench 银行 = 长 horizon vs 短 horizon + 持续学习 不同对象

增量 2 · ⭐⭐⭐⭐ · 🔴 P0 沿用升级 · Kimi K3 7-27 evening 1.56TB HuggingFace 完整开源主权开源 2.0 立标级 6 实例同步承接 = §1.45 frontier lab 立标续立 第 8 栖候选

字段 内容
来源 stephen 7-28 10:27 ai-industry-e1prep-v30 §增量 5 ⭐⭐⭐⭐(Kimi K3 1.56TB HF + Mollick 指南反应)+ jay 7-28 11:05 five-category-briefing Backend B1 ⭐⭐⭐⭐⭐(Kimi K3 2.8T MoE HF 1.56TB · 主分类 backend 主榜第一)+ jay 7-28 11:08 engineering-e1prep-v38 §B1(沿用)+ jay 7-28 11:10 kimi-k3-inference-systems-substack(独立主题文件 8 件之一)+ jay 7-28 21:05 evening-briefing-arxiv-cncfsurvey-substack-hf-jul2026(晚场收官棒)+ jay 7-28 13:37 ai-eng-job-market-vector-db-landscape-hf-sos(独立主题文件)+ spark 7-28 10:02 rss-gradient-flow(三款前沿级模型沿用 + 双新立标评论层)+ tom 7-28 08:50 rag-e1prep-v47(沿用)+ flyp 7-28 09:54 multimodal-e1prep-v34(沿用)+ simon-willison 7-28 1001:moonshotai/Kimi-K3 7-27 晚(约 1.56TB HuggingFace 上)+ Mollick「一份有立场的指南」7-27 + Boris Cherny 引用 Opus 5「最难被 prompt 注入」+ stephen 7-28 22:45 coordination-check-evening §3.5.1 1 件统一主线立标 11 实例同步承接 候选
arXiv 号 无(商业模型发布,huggingface.co/moonshotai/Kimi-K3)
一句话 模型规格:2.8T MoE · MXFP4 权重 + MXFP8 激活 · HF 1.56TB · KDA(Kimi Delta Attention)+ AttnRes(Attention Residuals)+ Stable LatentMoE · 7-27 按承诺发布完整开源权重 · Coding/Agentic SOTA · Moonshot AI 月之暗面 · 主权开源 2.0 立标级 = 「主权开源」取代「闭源 frontier」成为 2026 H2 路线分水岭 · 与 v34 §2.2 Claude Sonnet 5 + Opus 5 + Gemini 3 全栈等 7-15 ~ 7-26 frontier lab 商业立标形成"开源对手立标"
v34 第十轮脉络关系 与 v34 §2.2 模型与基座 Kimi K3 7-19 API + 7-27 开权前夜生态补漏 沿用升级 + v34 §1.45 五向合流 + v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §3.1 共识 #30 沿用升级 + v34 §3.4 T110/T113 候选新增 + spark Gradient Flow「开源多旋钮」评论层 集中观察型落地 第 4-5 例 同源;v34 §2.2 模型与基座 Kimi K3 沿用升级 + §1.45 frontier lab 立标 第 8 栖候选 + §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全:1) 「主权开源 2.0 立标级」 = v34 §1.45 frontier lab 立标续立 第 8 栖候选(v34 = Anthropic 7-27 经济测度产品化 + 治理研究第二阶段 + 资本层持续 三栖立标 = frontier lab 第 7 栖候选;本场 = Kimi K3 主权开源 2.0 立标级 = frontier lab 第 8 栖候选 = 第 8 栖立标密度第 2 例续立);2) 「Kimi K3 1.56TB HF 上线 + SANA-Video 2.0 + Skill Self-Play = 商业 Harness / 开源 Harness 双路线对齐」 = v34 §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全(v34 §1.33c MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化;本场 = Kimi K3 1.56TB HF + SANA-Video 2.0 + Skill Self-Play = 商业 Harness / 开源 Harness 双路线对齐);3) 「GradFlow「开源多旋钮」评论层 集中观察型落地 第 4-5 例」 = v34 §1.45 评论层立标 沿用升级("开源模型 vs 闭源模型不再是单一变量,而是包含数据/工程/路线/团队/算力等多变量");4) 「Boris Cherny 引用 Opus 5「最难被 prompt 注入」 = v34 §2.103 评论层长尾持续 6 媒体续立 + TLDR AI 7-27 头条 Claude Opus 5」 = v34 §2.103 段尾"评论层长尾 7-25~7-28 持续 6 媒体续立"标注
反方 / 风险 (A) Kimi K3 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-28 第三方核实尚未完成(jay 7-28 engineering-e1prep-v38 §P2 警示)——建议在知识库中标注"官方数据,待外部 benchmark 验证";(B) 主权开源 2.0 立标级别边界:开源 frontier 模型 = 2026 H2 frontier lab 路线分水岭?vs 商业 frontier lab 6-8 栖立标密度延续?——本场 6 实例同步承接候选升档但单一模型发布是否构成"路线分水岭"需谨慎:商业 frontier lab 历史护城河(评测系统卡 + 评论层 + 红队 + 经济测度产品化 + 治理研究第二阶段 + 资本层持续)不因单一开源模型发布而消失;v34 候选仅升档为"主权开源立标栖"而非"主线分水岭"——这是 v34 §3.4 T113/T114 候选新增的措辞尺度问题(spark 7-28 13:30 §三.1);(C) Kimi K3 vLLM/SGLang 官方支持时间线待核实(stephen 7-28 22:45 coordination-check-evening §4.3 警示 + tom 7-28 22:23 inference-e1prep §警示 1 已收);(D) MXFP4/MXFP8 第 5 量化路线候选 vs INT8/INT4 本质区别:MoE 稀疏激活特性的定制化量化格式 工程意义 待核;(E) KDA/AttnRes 架构创新 vs DeepSeek 家族(V3/V4 技术报告)架构对比 待核;(F) 与 Claude Opus 5 + Sonnet 5 + GLM-5.2 + Kimi K2.7-Code 等同期商业模型 head-to-head SWE-bench Verified + Terminal-Bench 2.1 量化对照(spark 7-28 13:30 §三.7);(G) simon-willison 7-28 1001「moonshotai/Kimi-K3 7-27 晚约 1.56TB HuggingFace 上」与 spark gradient-flow「AI 数据中心算式」+「开源多旋钮」评论层集中观察型落地 第 4-5 例 关系 待核
建议归入节 §2.2 模型与基座 Kimi K3 7-27 evening 开权落地完整覆盖(v34 = Kimi K3 7-19 API + 7-27 开权前夜生态补漏 → 本场 = 7-27 evening 开权落地 = §2.2 模型与基座 Kimi K3 沿用升级) + §1.45 frontier lab 立标续立 第 8 栖候选(v34 第 7 栖 = Anthropic 经济测度产品化 → v34 第 8 栖 = Kimi K3 主权开源 2.0 立标级) + §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全(v34 已立 → v34 候选新增主权开源维度) + §3.1 共识 候选新增 30+1(「主权开源 2.0 = 开源 frontier 路线分水岭 · 商业 frontier lab 6 栖 + 主权开源 1 栖 = frontier lab 7 栖立标密度第 2 例」) + §3.4 T110 长 horizon agent 立标集群(v34 9 件 → v34 候选新增 "主权开源 2.0 立标 Kimi K3") + §3.4 T113 候选新增(「主权开源 = 2026 H2 frontier lab 路线分水岭」) + §4.1 开放问题 候选新增 59(Kimi K3 head-to-head + MXFP4/MXFP8 量化路线 + KDA/AttnRes 架构对比)
重要边界 不要与 v34 §2.2 模型与基座 Claude Sonnet 5 / Opus 5 / Fable 5 / Mythos 5 4 模型矩阵 混为同一件工作:Kimi K3 = 单模型 + 主权开源 vs Sonnet 5/Opus 5/Fable 5/Mythos 5 = 4 模型矩阵 + frontier lab 商业立标 = 单模型开源 vs 商业模型矩阵 不同对象;不要与 v34 §2.2 模型与基座 DeepSeek-V3/V4 混为同一件工作:Kimi K3 = KDA + AttnRes + Stable LatentMoE + MXFP4/MXFP8 量化 vs DeepSeek-V3/V4 = MLA + DeepSeekMoE + FP8 混合训练 = 架构创新 vs 量化创新 不同对象;不要与 v34 §2.103 评论层长尾 7-25~7-27 持续 6 媒体续立 混为同一件工作:评论层长尾 7-25~7-27 = 评论层 6 媒体续立,Kimi K3 = 主权开源 2.0 立标级 11 实例同步承接 = 评论层 vs 主线立标 不同对象;不要与 v34 §1.45 frontier lab 立标 第 6 栖 LeCun AMI Labs $1.03B 路线层资本立标 混为同一件工作:AMI Labs = 反 LLM 主旋律立标 vs Kimi K3 = 主权开源 LLM 立标 = 反 vs 主 不同对象;不要与 v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 混为同一件工作:Anthropic 经济测度 = 测度产品化 + 治理研究 vs Kimi K3 = 模型本体 + 主权开源 = 测度 vs 模型 不同对象

增量 3 · ⭐⭐⭐⭐ · 🔴 P0 跨主题补全 · CSDN Agent 4 范式(Function Calling + MCP + CLI + Skills)+ OWASP Agent Top 10 2026 ASI01-ASI10 = 实战层 / 安全层承接 v34 §1.33c 横切 53c 商业 Harness 立标补全

字段 内容
来源 jay 7-28 12:22 csdn-substack-rag-agent-multimodal-finetuning-jul2026 CSDN Agent 1 ⭐⭐⭐⭐⭐(AI Agent 工具调用四范式 · MCPorter 项目 · MCP OAuth 鉴权增强 · 决策树)+ jay 7-28 12:22 csdn-substack-rag-agent-multimodal-finetuning-jul2026 CSDN Agent 4 ⭐⭐⭐⭐⭐(2026 AI Agent 开发实战 · ReAct + MCP + Token 预算 + trace + 安全沙箱 · Python 3.11+ 验证)+ jay 7-28 11:11 owasp-agent-security-hf-incident(OWASP Agent Top 10 2026 ASI01-ASI10 + HF 7 月安全事故)+ flyp 7-28 16:53 risk-e1prep 收官棒 + stephen 7-28 22:45 coordination-check-evening §3.5.4 P1 增量 3 ⭐⭐⭐⭐ + spark 7-28 13:30 agent-e1prep §增量 6 🟡 P1
arXiv 号 无(v33 §3.4 OWASP Substack alexewerlof 7 已有)
一句话 CSDN Agent 4 范式:Function Calling(最基础的"给模型一组可用函数")+ MCP(Model Context Protocol,标准化工具/资源/提示的客户端-服务器协议)+ CLI(命令行工具,让 agent 直接调用 shell)+ Skills(agent-skills 工程化技能集合) = 工程层范式收敛 · MCPorter 项目 = MCP 的 OAuth 鉴权增强,2026 年企业部署必备 · AI Agent 开发实战四件套 = ReAct + MCP + Token 预算 + trace + 安全沙箱(Python 3.11+ 验证);OWASP Agent Top 10 2026 ASI01-ASI10:Prompt Injection(LLM01) = AI 等效 SQL Injection + 机制:恶意 user input 污染 RAG 上下文 → 改变 agent 行为 + 缓解:SDP pipeline + Confidence scoring + human-in-the-loop 阈值;Goal Hijack(ASI01) = 目标劫持 + 机制:Agent 收到初始目标后,被恶意输入重定向到意外目标 + 缓解:目标一致性验证 + Human approval + Structured output validation;Agentic Threat Surface 独特性:"LLM generates words. Agent takes actions. Actions speak louder than words!" 传统 LLM 输出文本 vs Agent 输出 API 调用/文件写入/交易 — 攻击后果从误导信息升级为真实世界损害;高风险操作分类:HIGH RISK(external_write/financial_transaction/system_modification,需 human approval) + MEDIUM RISK(tool_call/context_enrichment,需 structured output validation) + LOW RISK(read_only,需 logging + monitoring);Agent Guardrails vs LLM Guardrails 演进:2024 = Input/Output 过滤器;2026 = Agent 行为约束系统(Tool call 授权 + rate limit 执行 + agent 实际动作验证);OWASP ↔ ASI 编号体系:LLM01-LLM10(传统 LLM)+ ASI01-ASI10(Agentic AI 新增) = 评估标准硬框架
v34 第十轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.45 五向合流 + v34 §2.6 评测、可靠性与对抗 41 → 42 子节 同源;v34 §1.33c 横切 53c 商业 Harness 沿用·实战层承接 + §1.45 五向合流 5 向 → 6 向合流候选 + §2.6 评测、可靠性与对抗 评测基线硬框架新增:1) 「CSDN Agent 4 范式(Function Calling + MCP + CLI + Skills)」 = v34 §1.33c 横切 53c 商业 Harness 沿用·实战层承接(v34 已立 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化;本场 = CSDN Agent 4 范式 + OWASP Agent Top 10 2026 = 实战层 / 安全层承接);2) 「OWASP Agent Top 10 2026 ASI01-ASI10 = LLM01-10 + ASI01-10 评估标准硬框架」 = v34 §1.45 五向合流 第 6 向合流候选(v34 §1.45 五向合流:HF 7/16 + Mythos + 白宫点名 + OpenAI×HF + Gemini 3.5 Flash Cyber · v34 沿用 v33;本场 = OWASP 官方 ASI 编号体系 + HF 7 月安全事故披露 = §1.45 第 6 向合流);3) 「Agentic Threat Surface 独特性 + 高风险操作分类 + Agent Guardrails vs LLM Guardrails 演进」 = v34 §2.6 评测、可靠性与对抗 评测基线硬框架新增(v34 §2.6 第四十二 SDB 立标级 · 邻接 14 件;本场 = OWASP Agent Top 10 ASI01-ASI10 = 评测基线硬框架新增);4) 「MCPorter 项目 = MCP 的 OAuth 鉴权增强」 = v34 §2.5 AgentCI MCP 安全立标 邻接补全(v34 §2.5 AgentCI MCP 安全立标:MCP Inspector CVE-2025-49596 RCE + 43% MCP 实现命令注入 + 9700 万次 MCP SDK 月下载 + AI Workflow Store arXiv:2605.10907 + Context Engineering arXiv:2603.09619 + AgentCI MCP 安全生态竞品表;本场 = MCPorter MCP OAuth 鉴权增强 = 实战层邻接补全)
反方 / 风险 (A) OWASP Agent Top 10 2026 官方编号体系权威性:ASI01-ASI10 vs LLM01-LLM10 双轨体系 与现有 NIST AI RMF + ISO/IEC 42001 + EU AI Act 关系 待核;(B) MCPorter 项目 GitHub 链接 + 实现细节(jay 7-28 12:22 csdn-substack 警示)+ MCP OAuth 鉴权增强 vs MCP 2026-07-28 RC 6 件核心变更 SEP-2567/2260/2133/2663/837/1865 关系 待核;(C) HIGH RISK/MEDIUM RISK/LOW RISK 三档分类 vs 现有 SDB arXiv:2605.20173 proposer + verifier + commit step + reject signal 四阶段形式化 关系 待核;(D) Agent Guardrails 2024 → 2026 演进 vs HF 7 月安全事故 vs OWASP ASI 编号体系 时间线 待核;(E) 「Actions speak louder than words!」 表述是否原创 验证;(F) CSDN 实战层 vs 商业 Harness 立标层级关系:MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 是商业 Harness;CSDN Agent 4 范式是实战层工具调用范式 = 商业 Harness vs 实战层 不同对象
建议归入节 §1.33c 横切 53c 商业 Harness 沿用·CSDN 实战层承接(v34 已立 → v34 实战层新增 CSDN Agent 4 范式 + OWASP ASI 编号) + §1.45 五向合流 5 向 → 6 向合流候选(v34 5 向合流 → v34 6 向合流候选:OWASP Agent Top 10 2026 官方 ASI 编号体系) + §2.6 评测、可靠性与对抗 评测基线硬框架新增(OWASP Agent Top 10 ASI01-ASI10 = 评测基线硬框架新增) + §3.4 T109 候选新增(OWASP ASI 体系 = 评测标准硬框架) + §4.1 开放问题 候选新增 60(OWASP ASI 编号体系权威性 + MCPorter GitHub + SDB 4 阶段 vs HIGH/MEDIUM/LOW 三档 关系)
重要边界 不要与 v34 §2.5 AgentCI MCP 安全立标 混为同一件工作:AgentCI MCP 安全 = MCP 协议 + 安全生态竞品表;OWASP Agent Top 10 2026 = 评估标准硬框架 = 安全协议 vs 评估标准 不同对象;不要与 v34 §1.45 五向合流 5 向 混为同一件工作:v34 5 向 = HF 7/16 + Mythos + 白宫点名 + OpenAI×HF + Gemini 3.5 Flash Cyber;OWASP ASI = 官方 ASI 编号体系 = 5 向合流 vs 6 向合流候选 增量;不要与 v34 §1.43 横切 80 Why Agents Fail 7 件套 混为同一件工作:Why Agents Fail = 失败模式 7 件套;OWASP ASI = 风险类型 10 件 = 失败模式 vs 风险类型 不同对象;不要与 v34 §2.5 第 11 阶 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation-as-First-Class = agent 安全 survey anchor 5 边界;OWASP ASI = agent 安全 top 10 风险 = survey anchor vs 风险列表 不同对象

增量 4 · ⭐⭐⭐⭐ · 🔴 P0 行业立标 · Anthropic 7-28 evening frontier/industry 立标 9 件 + 评论层持续长尾 7-25~7-28 6 媒体 = §1.45 frontier lab 立标 持续长尾

字段 内容
来源 stephen 7-28 1004 news-anthropic-news 5 URL(我们对开放权重模型的立场 + 拓展 Cognizant 合作 + Claude Opus 5 + Project Pilot AI 操控无人机 + Claude Opus 5 系统卡)+ stephen 7-28 0910 X-radar + jay 7-28 1001 simon-willison + flyp 7-28 16:53 risk-e1prep §增量 3 沿用 + stephen 7-28 22:45 coordination-check-evening §3.5.4 P1 增量 4 ⭐⭐⭐⭐⭐ + spark 7-28 10:02 gradient-flow 沿用 + spark 7-28 13:30 agent-e1prep §增量 1 沿用
arXiv 号 无(Anthropic 平台层文档 + 评论层长尾 6 媒体续立)
一句话 Anthropic Claude Opus 5(7-24 evening)$5/$25 每 M tokens + effort 控件 + Claude Max/Pro 默认模型 + ARC-AGI-3 30.2% 新 SOTA + Boris Cherny 引用 Opus 5「最难被 prompt 注入」 + AnthropicAI 官方 news 发布 + Project Pilot AI 操控无人机 + Claude Opus 5 系统卡 + TLDR AI 7-27 头条 Claude Opus 5 + OpenAI 黑客事件内幕 + NVIDIA 开源权重联署信 = §1.45 frontier lab 立标 持续长尾 7 天立标密度最高一周 7-21~7-28 = 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例 沿用升级 + 评论层长尾 7-25~7-28 持续 6 媒体续立
v34 第十轮脉络关系 与 v34 §1.41 横切 60-66 v23 七件主轴 + v34 §1.45 五向合流 + v34 §2.103 段尾"评论层长尾 7-25~7-27 持续 6 媒体续立"标注 + v34 §2.103 "评测 → 系统卡 → 评论 → 红队"4 栖验证 第 1 例 + v34 §3.1 共识 #35 "frontier lab 平台层 + 代理化扩展 + 路线层 + 资本层 + 国家科学战略 + 评论层 7-22~26 八栖合流立标" 同源;v34 §2.103 段尾"评论层长尾 7-25~7-28 持续 6 媒体续立"标注 + v34 §1.45 frontier lab 立标 §6 行业升级 5 件合并 续立轨迹沿用 + v34 §3.1 共识 #35 续立:1) 「Anthropic Claude Opus 5(7-24 evening)+ 评论层长尾 7-25~7-28 持续 6 媒体 + Boris Cherny「最难被 prompt 注入」」= v34 §2.103「评测 → 系统卡 → 评论 → 红队」4 栖验证 第 1 例 沿用升级 + v34 §1.41 横切 60-66 v23 七件主轴 升为"九件主轴"持续沿用(Claude Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 frontier model / 平台层立标);2) 「Project Pilot AI 操控无人机 + Claude Opus 5 系统卡」= v34 §1.45 frontier lab 立标 §6 行业升级 候选新增(与 Project Glasswing 保护全球软件安全 + Economic Index connector + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元 五栖立标 = §1.45 第 6 行业升级立标);3) 「Anthropic 模型矩阵形态分化第二例」= v34 §1.41 横切 60-66 v23 七件主轴「frontier lab 模型矩阵形态分化」 候选 沿用升级(Sonnet 5 = 更代理化 / 工具使用强 vs Opus 5 = 中等/bounded tasks + 经济性 vs Fable 5 = 长时自主(数小时-数天)vs Mythos 5 = 网络安全/生物研究领先);4) 「TLDR AI 7-27 头条 Claude Opus 5 + OpenAI 黑客事件内幕 + NVIDIA 开源权重联署信」= v34 §2.103 评论层长尾 7-25~7-28 持续 6 媒体续立 + TLDR AI 头条 = 评论层长尾扩
反方 / 风险 (A) 「更代理化的 Sonnet」 具体定义待 Anthropic 官方文档核证 + 工具使用相对 4.6 提升幅度待核(flyp 7-27 coding-agents-e1prep §0 警示 2);(B) Sonnet 5 vs Opus 5 / Sonnet 5 vs Fable 5 / Sonnet 5 vs Sonnet 4.6 head-to-head 评测待核;(C) Managed Agents effort 精度 vs OpenAI Reasoning effort / Gemini 3.6 Flash effort head-to-head 待核;(D) Boris Cherny 评论原文出处 + Opus 5 PI evals / red team 完整版本待核;(E) Project Glasswing 保护全球软件安全 vs Project Pilot AI 操控无人机 关系待核;(F) Claude Sonnet 5 系统卡是否同步发布待核 + 7-27 morning Opus 5 系统卡 vs Sonnet 5 系统卡 关系待核;(G) Economic Index connector 公开 SDK 文档 / API 边界 + 与外部数据源对接的精确接口 待核;(H) Public First Action 2000 万美元用途细分 + 与现有 AI 治理研究资金池(OpenAI Advancing National Science + DeepMind DOE Genesis)的协调关系 待核;(I) Project Pilot AI 操控无人机 Anthropic AI for Science 罕见病资助 关系 待核
建议归入节 §1.41 横切 60-66 v23 七件主轴 升为九件主轴 持续沿用(Claude Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 frontier model / 平台层立标)+ §1.45 frontier lab 立标 §6 行业升级候选新增"Anthropic Claude Opus 5 系统卡 7-27 morning 发布 + Economic Index connector 7-27 morning 落地 + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元 + Project Pilot AI 操控无人机 + TLDR AI 7-27 头条三件(7-22~7-28 平台层 + 代理化扩展 + 治理研究 + AI for Science 罕见病资助 + 评论层 + NVIDIA 开源权重联署信 七栖立标持续长尾)" + §2.103 段尾"评论层长尾 7-25~7-28 持续 6 媒体续立 + Anthropic 7-28 morning 系统卡发布 + Boris Cherny 引用 Opus 5「最难被 prompt 注入」 + TLDR AI 7-27 头条标注" + §2.6 评测、可靠性与对抗(评测 → 系统卡 → 评论 → 红队 4 栖验证沿用) + §3.1 共识(候选新增 35 续立 "frontier lab 平台层 + 代理化扩展 + 路线层 + 资本层 + 国家科学战略 + 评论层 + 治理研究 + AI for Science 罕见病资助 7-22~7-28 十栖合流立标") + §4.1 开放问题(候选新增 47 续立 "Anthropic 7-22~7-28 模型矩阵 head-to-head + Managed Agents effort 精度 vs OpenAI/Gemini effort + Opus 5 vs Sonnet 5 PI ~0 一致性验证 + Sonnet 5 系统卡是否同步发布 + Economic Index connector SDK 文档核证 + Public First Action 2000 万美元用途细分 + Project Pilot AI vs AI for Science 关系") + §6 必读清单 沿用 Opus 5 系统卡 7-27 morning 版 + Boris Cherny 评论 + Project Pilot + Sonnet 5 官方文档 + Managed Agents effort 设置 文档 + Economic Index connector SDK 文档 第 139-144 条
重要边界 不要与 v34 §1.41 横切 60-66 Opus 5 7-24 evening 立标首位 混为同一件工作:Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = "更代理化的 Sonnet" = 沿用平台层但模型形态分化;不要与 v34 §1.41 Mythos 5 / Fable 5 沿用立标 混为同一件工作:Mythos 5 = 网络安全/生物研究领先, Fable 5 = 长时自主(数小时-数天), Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = "更代理化" = 4 模型矩阵形态分化;不要与 v34 §1.34b Anthropic J-space arXiv:2607.15495 混为同一件工作:J-space 是认知科学锚点论文, Sonnet 5 是 frontier model + 评论 + 平台层 = 认知科学 vs 模型本体 不同对象;不要与 v34 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Cyber 是 vertical LLM 网络安全, Sonnet 5 是本体模型 + 平台层 = vertical LLM vs 本体模型 不同对象;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 混为同一件工作:Harness 层是产品级 Harness, Sonnet 5 是 frontier model + 平台层 = Harness vs model 不同对象;不要与 v34 §1.45 OpenAI Presence 三栖项目化 混为同一件工作:OpenAI Presence = 平台层 + 资本层 + 国家科学战略, Anthropic Economic Index connector = 平台层 + 经济测度 + 治理研究 = 不同主题;不要与 v34 §2.103 评论层长尾 7-25~7-26 6 媒体续立 混为同一件工作:评论层长尾 7-25~7-26 = 评论层 6 媒体续立, 评论层长尾 7-25~7-28 = 评论层 6 媒体 + 系统卡发布续立 = 时间窗口扩展;不要与 v34 §1.45 Kimi K3 主权开源 2.0 立标级 混为同一件工作:Kimi K3 = 主权开源 LLM 立标;Anthropic Opus 5 = 闭源 frontier lab 立标 = 主权开源 vs 闭源 frontier 不同对象

增量 5 · ⭐⭐⭐⭐ · 🟡 P1 监测 · AAAI 2026 Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止前夜强提醒 = §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪

字段 内容
来源 tom 7-28 08:50 rag-e1prep-v47 §增量 5 ⭐⭐⭐(AAAI Subramanian 7 反方硬标签 + 4 验证截止日激活)+ flyp 7-27 09:50 Keyword-Search-Is-All-You-Need-critical-read B 级精读 3.5/5(7 反方硬标签 + 7 后续验证截止日化)+ v34 §3.1 共识 121 + §3.2 争议 36 + §3.3 Q105.1/Q105.8-Q105.10(v34 候选新增)+ stephen 7-28 22:45 coordination-check-evening §3.5.4 P1 增量 3(7 实例同步承接)+ spark-on-Tom 7-28 14:36 E3 review 收官(质量分 7/10 · 5 件独立待核实说法独立成段 + 7-28 是验证前夜)
arXiv 号 arXiv:2602.23368v1 AAAI 2026 Subramanian「Keyword Search Is All You Need」(v34 第十轮 §2.3 评测表 22 行 arXiv 号 v33 已核证)
一句话 4 验证截止日(tom 7-28 rag-v47 完整化):2026-07-29(明天)v1 PDF 全文细节 + shell 工具列表 → 2026-07-30 AAAI 2026 main vs industry track 区分 → 2026-07-31 不同 LLM 迁移性 + 混合方案对照 → 2026-08-15 长上下文/多模态跨任务迁移性;今天 7-28 = 7-29 验证前夜;flyp 7 反方硬标签汇总:① 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐ ② 200K context vs shell 工具边界不清——是"context stuffing + grep"而非 RAG 替代 ⭐⭐⭐⭐⭐(最高严重度) ③ 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐ ④ Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐ ⑤ Agent-as-retriever cost-benefit 未量化 ⭐⭐⭐ ⑥ 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐ ⑦ AAAI 2026 main vs industry track 区分不清 ⭐⭐
v34 第十轮脉络关系 与 v34 §2.3 评测表 22 行 + v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §3.1 共识 121 + §3.2 争议 36 + §3.3 Q105.1 + §3.4 T110 同源;v34 §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 7 后续验证动作 7-29 ~ 8-15 截止日化:1) 「7 反方 + 4 验证截止日化」 = v34 §3.2 争议 36 7 反方激活窗口(v34 已立 → 本场 = 反方激活窗口 + 4 验证截止日时间轴注脚);2) 「5 实例同步立标 + 7 实例同步承接(2026-07-28 evening stephen 沿用)= v34 §1.33c 横切 53c 已收录 AAAI 2026 Subramanian arXiv:2602.23368v1 立标级候选 B 级 3.5/5(v34 §2.3 第五十六 c 节点 v34 立标级升级 — v34 §3.2 争议 36 候选新增 — v34 §3.3 Q105.1 v34 部分解除 arXiv:2602.23368v1 已核 — 本场 = v34 已立 → v34 反方激活窗口 + v34 §3.3 Q105.8-Q105.10 候选新增 3 件);3) 「7 反方硬标签 vs v34 §1.43 横切 80 Why Agents Fail 7 件套」 = v34 §1.43 横切 80 沿用升级(RAG 范式转折 = 范式候选 + 7 反方硬标签 = 范式候选 vs 反方候选 = 立标级 vs 反方候选)
反方 / 风险 (A) arXiv:2602.23368v1 v1 PDF 全文细节 待 7-29 核验;(B) shell 工具列表具体边界 200K context vs shell 工具边界不清 ⭐⭐⭐⭐⭐(最高严重度);(C) AAAI 2026 main vs industry track 区分(flyp 7 反方硬标签 ⑦ + v34 §3.3 Q105.2 待核);(D) 不同 LLM 迁移性(论文仅 Claude 3 Sonnet,缺 GPT/ Gemini/ 开源模型 head-to-head) + 与混合方案(Agent + 向量库)未对照;(E) Amazon Bedrock KB baseline 利益相关冲突(Amazon Science 作者团 · Amazon Bedrock KB baseline 可能仅是 Bedrock KB vs Agentic,缺第三方向量库 baseline);(F) Agent-as-retriever cost-benefit 未量化;(G) 长上下文/多模态跨任务迁移性 待核;(H) GitHub 链接 7-28 仍未核证(jay 7-27 08:22 csdn-substack-rag-finetuning + tom 7-27 0850 + stephen 7-27 1023 = 5 实例均未补)
建议归入节 §3.2 争议 36(v34 已立 → v34 续立 + 4 验证截止日时间轴注脚)+ §3.3 Q105.1-Q105.10(v34 候选新增 10 件 → v34 候选持续追踪)+ §4.1 开放问题 55(v34 已立 7 后续验证动作 → v34 续立 + 7-29 ~ 8-15 截止日化)+ §6 必读清单 沿用 arXiv:2602.23368v1 第 142 条
重要边界 不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,Subramanian = RAG 检索范式转折 = 边界形式化 vs 检索范式 不同对象;不要与 v34 §2.4 上下文管理三路线对立 混为同一件工作:三路线对立 = 完整日志 + lifecycle + 可观测性,Subramanian = 工具调用派检索 = 记忆/检索 vs 检索范式 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 文件系统即上下文 混为同一件工作:Markdown Memory = 工业级 Agent 厂商记忆原语,Subramanian = 学术 RAG 范式转折候选 = 记忆 vs 检索 不同对象;不要与 v34 §2.4 Beyond Relevance-Centric Retrieval arXiv:2607.19747 混为同一件工作:Beyond Relevance-Centric = 评分量规驱动 vs Subramanian = Agentic-as-retriever = 评分量规驱动 vs 工具调用派 不同 RAG 替代路径

增量 6 · ⭐⭐⭐ · 🟡 P2 警示 · Learning on the Job 数字模糊待补完 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查

字段 内容
来源 spark-on-Tom 7-28 14:36 E3 review 收官(质量分 7/10 · 3 件 P0 修正必须 R47 接力前完成:Learning on the Job 数字补完 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查)+ stephen 7-28 22:45 coordination-check-evening §5 ⚠️ 警示 3 件 P0 修正必须 R47 接力前完成
arXiv 号 arXiv:2607.22157v1(Learning on the Job · 已在 v34 §2.4 第 18 件候选 P3 中)
一句话 增量 3 数字补完:Learning on the Job 「击败完整 RAG 基线」→「single-trial success 1.6×(outcome verdict)/ 2.6×(corrections)static-RAG;22/84 任务被解决;模型异构复现于 Mistral Large + Claude Sonnet 5;论文本身仅 banking domain 单一场景」+ 论文作者「Valentin Tablan, Scott Taylor, Kristoffer Bernhem(The Memory Company)」+ arXiv 2607.22157v1;增量 2 δ-mem 评级降级:⭐⭐⭐⭐ → ⭐⭐⭐(机制描述具体但独立可复现性未确认)+ 加入「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示;Dadhich/Experience Distillation arXiv 编号 2 天未直查:arXiv:2607.21503 Agentic Context Management(Gaurav Dadhich)+ arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(Tom 单作者)2 天未在 rag.md/tom radar 中直查 arXiv 编号(待核)
v34 第十轮脉络关系 与 v34 §2.4 后训练 Agentic RL 训练栈 18 件候选 + v34 §2.4 记忆与上下文工程 57-59 节点 + v34 §2.4 工具调用 / Agentic RL 训练栈 δ-mem(AlphaSignal Substack · Tom 7-25 2040 radar ⭐⭐⭐⭐⭐ · 2026-07-25)同源;v34 §4.1 开放问题 候选新增 61 + δ-mem 评级降级:1) 「Learning on the Job 数字模糊待补完」= v34 §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 升级为 P0 沿用升级 + 数字精确化(1.6× outcome verdict + 2.6× corrections static-RAG + 22/84 任务被解决 + Mistral Large + Claude Sonnet 5 复现 + banking domain 单一场景 + 作者 Tablan, Taylor, Bernhem(The Memory Company) + arXiv 2607.22157v1);2) 「δ-mem 评级降级」= v34 §2.4 工具调用 / Agentic RL 训练栈 δ-mem 评级 ⭐⭐⭐⭐⭐ → ⭐⭐⭐(spark-on-Tom E3 review + stephen 警示)(机制描述具体但独立可复现性未确认 + 无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家);3) 「Dadhich/Experience Distillation arXiv 编号 2 天未直查」= v34 §4.1 开放问题 候选新增(arXiv:2607.21503 + arXiv:2607.21051 已沿用但 2 天未在 rag.md/tom radar 中直查 arXiv 编号,待核)
反方 / 风险 (A) Learning on the Job 数字 1.6×/2.6×/22/84 是否精确(spark-on-Tom E3 review 引文 vs 论文原文 待核);(B) δ-mem 评级降级 vs v34 §2.4 δ-mem 立标候选 「context window + RAG 之外的第三种 Agent Memory 方案」立标候选 关系(降级 vs 立标候选);(C) The Memory Company vs 商业机构关联性(论文是否与商业产品关联 影响中立性);(D) Mistral Large + Claude Sonnet 5 复现:论文报告的具体模型清单 vs 实际复现清单 待核
建议归入节 §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 数字精确化(Learning on the Job 1.6×/2.6×/22/84 + Mistral Large + Claude Sonnet 5 + 作者 + arXiv 2607.22157v1)+ §2.4 工具调用 / Agentic RL 训练栈 δ-mem 评级降级(⭐⭐⭐⭐ → ⭐⭐⭐ + 加入「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示)+ §4.1 开放问题 候选新增 61(Dadhich/Experience Distillation arXiv 编号 2 天未直查 待核)
重要边界 不要与 v34 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 沿用混为同一件工作:54/55 是 v34 第十轮既有开放问题;本场 61 = Dadhich/Experience Distillation arXiv 编号直查 = 数字 vs 编号 直查 不同对象

增量 7 · ⭐⭐⭐ · 🟢 P2 反方持续激活 · flyp v34 §3.3 反方 #56 第二日复核节点激活(SDM P2 旁证 7-28 evening 持平未回升)

字段 内容
来源 tom 7-28 0900 hf-daily-2026-07-28(15 篇 + AREX 142▲ +3 持续登顶 + ReferTrack 50▲ 新立 + DataPrep-Bench 40▲ 新立 + Show Don't Tell 35▲ + SANA-Video 2.0 34▲ + Skill Self-Play 30▲ 新立 + Molt 24▲ 新立 + WorkBuddy Bench 24▲ + Self-Supervised Structured Dynamics 18▲ 三日累计 60▲ 跌出 15 名外)+ stephen 7-28 22:45 coordination-check-evening §3.5.4 P1 增量 4 ⭐⭐⭐⭐(flyp v34 §3.3 反方 #56 第二日复核节点激活,SDM P2 旁证 7-28 evening 持平未回升,累计跨日 78▲ 触发 v34 §3.3 反方 #56 第二日复核节点)+ spark 7-28 13:30 agent-e1prep §三.4 + flyp 7-28 0955 dual critical read(反思规则第 22 次适用)
arXiv 号 arXiv:2607.21576 Self-Supervised Structured Dynamics from Videos(HF Daily 7-25 首日 28▲ → 7-27 18▲ → 7-28 18▲ 持平 三日累计跨日 60▲ → 78▲ 持续跌出 15 名外)
一句话 flyp v34 §3.3 反方 #56 第二日复核节点激活:Self-Supervised Structured Dynamics arXiv:2607.21576 7-25 首日 28▲ → 7-26 18▲ → 7-27 18▲ → 7-28 evening 18▲ 持平未回升 · 三日累计跨日 78▲ = 触发 v34 §3.3 反方 #56 第二日复核节点激活——评级升级次日反向波动案例 + 第二日复核节点 vs 第一日 #55 评级升级时机风险 + 反方硬标签
v34 第十轮脉络关系 与 v34 §3.3 反方 #55「评级升级时机风险」+ v34 §3.3 反方 #57-#59「Scaling Native Multimodal compute-optimal ablation 不足 + late vs early fusion 未独立对比」+ flyp 7-28 0955 dual critical read 反思规则第 21 次适用 同源;v34 §3.3 反方 #56 第二日复核节点新增:1) 「SDM P2 旁证 7-28 evening 持平未回升 + 累计跨日 78▲ 触发 v34 §3.3 反方 #56 第二日复核节点」= v34 §3.3 反方 #55 评级升级时机风险 第二日复核节点 新增(#55 = 第一日激活 7-27 → #56 = 第二日激活 7-28 evening);2) 「flyp 反思规则第 22 次适用」= v34 §3.3 反方 #57-#59 flyp dual critical read 反思规则持续适用
反方 / 风险 (A) SDM 是否在 7-29 ~ 7-31 累计跨日回升(flyp v34 §3.3 反方 #56 第二日复核窗口待 7-29 ~ 7-31 继续观察);(B) SDM arXiv:2607.21576 在主线 K 出现 6 天诊断完成后(AREX 6 天诊断完成)是否仍未持续回升 = 反方持续激活窗口;(C) HF Daily 7-28 evening 是否有新增件 / 跌出件 / 翻倍件(待核)
建议归入节 §3.3 反方 #56 第二日复核节点新增(v34 §3.3 反方 #55 第一日激活 → v34 §3.3 反方 #56 第二日激活 7-28 evening) + §3.3 反方 #57-#59 flyp dual critical read 反思规则持续适用
重要边界 不要与 v34 §3.3 反方 #55「评级升级时机风险」混为同一件工作:#55 = 第一日激活(SDM 28→18▲ 单日 -10 跌出 15 名外 7-27);#56 = 第二日激活(SDM 持平未回升 + 累计跨日 78▲ 7-28 evening)= 第一日 vs 第二日 时间窗口;不要与 flyp 7-28 0955 dual critical read v34 §3.3 反方 #57-#59 Scaling Native Multimodal + O-VAD 立标级候选 混为同一件工作:#57-#59 = Scaling Native Multimodal compute-optimal ablation + late vs early fusion; #55-#56 = SDM 评级升级时机风险 = 不同对象

二、值得警惕的矛盾或待核实说法

  1. Kimi K3 1.56TB HF 上线主权开源 2.0 立标级别边界:开源 frontier 模型 = 2026 H2 frontier lab 路线分水岭?vs 商业 frontier lab 6-8 栖立标密度延续?——本场 6 实例同步承接候选升档但单一模型发布是否构成"路线分水岭"需谨慎:商业 frontier lab 历史护城河(评测系统卡 + 评论层 + 红队 + 经济测度产品化 + 治理研究第二阶段 + 资本层持续)不因单一开源模型发布而消失;v34 候选仅升档为"主权开源立标栖"而非"主线分水岭"——这是 v34 §3.4 T113/T114 候选新增的措辞尺度问题(spark 7-28 13:30 §三.1 + flyp 7-28 coding-agents-e1prep 本场增量 2 反方 A)。
  2. Molt 是否引入新方法论 vs 仅"工程美学":Molt 与 OpenForgeRL(harness-native proxy + K8s orchestrator)是同一立标层的不同切面(训练侧 vs 生产侧),但Molt 是否引入新方法论还是仅"工程美学"?需要 Molt 与 OpenForgeRL head-to-head 实证(spark 7-28 13:30 §三.2 + flyp 7-28 coding-agents-e1prep 本场增量 1 反方 A + jay 7-28 engineering-e1prep-v38 §P2 警示)。
  3. Learning on the Job 数字模糊(spark-on-Tom 7-28 14:36 E3 review P0 修正):论文原文应明确写出 1.6×/2.6×/22/84 + Mistral Large + Claude Sonnet 5 复现 + banking domain 单一场景 + 论文作者「Valentin Tablan, Scott Taylor, Kristoffer Bernhem(The Memory Company)」+ arXiv 2607.22157v1——本场第 6 件增量已警示。
  4. δ-mem 评级降级(spark-on-Tom 7-28 14:36 E3 review P0 修正):⭐⭐⭐⭐ → ⭐⭐⭐(机制描述具体但独立可复现性未确认)+ 加入「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示——本场第 6 件增量已警示。
  5. Dadhich/Experience Distillation arXiv 编号 2 天未直查(spark-on-Tom 7-28 14:36 E3 review P0 修正):arXiv:2607.21503 Agentic Context Management(Gaurav Dadhich)+ arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(Tom 单作者)2 天未在 rag.md/tom radar 中直查 arXiv 编号——本场第 6 件增量已警示。
  6. HF Daily 7-28 Self-Supervised Structured Dynamics 18▲ 三日累计 60▲ 持续跌出 15 名外(flyp v34 §3.3 反方 #55-#56 第一日 + 第二日复核节点持续激活):flyp v33 已立反方硬标签(reverse-tracking 案例)——本场第 7 件增量已警示。
  7. AAAI Subramanian 7-29 验证前夜强提醒(stephen 7-28 22:45 coordination-check-evening §4.3 ⚠️ + spark-on-Tom 7-28 14:36 E3 review):明天 14:30 前必须看到活文档动作——本场第 5 件增量已警示。
  8. arXiv:2605.20173 SDB paper_card 仍未建卡(spark 7-28 13:30 §增量 2 + stephen 7-28 12:45 §3.1 P0 信号 3 + jay 7-28 11:08 engineering-e1prep-v38 §增量 4 警示 + flyp 7-27 coding-agents-e1prep §0 警示 1):v34 §2.6 第四十二子节候选,pipeline 漏斗节点——7-30 截止前必须补建卡。
  9. Anthropic Claude Opus 5 / Sonnet 5 / Fable 5 / Mythos 5 关系 + 工具使用相对 4.6 提升幅度 + Managed Agents effort 精度 vs OpenAI / Gemini effort head-to-head 7-28 仍未官方文档核证(stephen 7-28 ai-industry + spark 7-28 §A 沿用 + flyp 7-27 coding-agents-e1prep §0 警示 2):v34 §3.2 争议 #31 + §4.1 开放问题 #47 沿用。
  10. AAAI 2027 截稿时间 2026-07-28(明天)= jay 7-28 1950 evening engineering filter p2 条目 7 + GitHub khairulislam/ML-conferences 紧急提醒(jay 7-28 21:05 evening-briefing 沿用 + flyp 7-27 coding-agents-e1prep §0 警示 5):具体工程行动截止点,如 5 实例 / stephen 有意向 AAAI 2027 投递系统方向论文。
  11. Kimi K3 vLLM/SGLang 官方支持时间线(stephen 7-28 22:45 coordination-check-evening §4.3 警示 + tom 7-28 22:23 inference-e1prep §警示 1 已收):DeepSeek-V3 当时的官方支持时间表作为参照。
  12. arXiv:2607.12406v1 Isolation-as-First-Class paper_card 仍未建卡(stephen 7-27 1023 + jay 7-27 csdn-substack 沿用 + spark 7-27 agent-e1prep §2.x 沿用 + R29 §2.1 B 类已立标但 paper_card 缺):v34 §2.5 第 11 阶候选 + risk.md R29 §2.1 D 类 = 双向 reference 但 paper_card 缺 = pipeline 漏斗节点。
  13. arXiv:2607.21461 AREX paper_card 仍未建卡(stephen 7-27 1245 §3.2 已标 🔴 AREX 7-25 HF Daily #1 117▲ 当日 #1 但 7-26 / 7-27 paper_card 未补):v34 §2.5 第 85 节点候选 = pipeline 漏斗节点。
  14. OWASP Agent Top 10 2026 官方 ASI 编号体系权威性 + 与 NIST AI RMF + ISO/IEC 42001 + EU AI Act 关系 待核(spark 7-28 13:30 §三 + flyp 7-28 coding-agents-e1prep 本场增量 3 反方 A):OWASP Agent Top 10 vs OWASP LLM Top 10 双轨体系 待核。
  15. Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验 vs Alice Labs 博客日期 vs 实际 GitHub release tag 差(jay 7-27 T1735 briefing 沿用):v34 §4.1 开放问题 #52 沿用。
  16. Microsoft MAF Harness GitHub samples ./harness 实际 API 待核(jay 7-25 1055 engineering-filter 沿用):v34 §4.1 开放问题 #52 沿用。
  17. Spark E1 节奏连续 3 日回落 + 反转第 4 棒(7-26 evening 双 E1 完整恢复第 1 棒 → 7-27 仅 RSS 通稿 → 7-27 evening 仅 RSS 通稿 → 7-28 截至 13:30 仍仅 RSS 通稿 = E1 节奏连续 3 日回落窗口 0 件 E1 → 7-28 evening 双 E1 完整恢复 = spark 节奏反转第 4 棒 · 与 noon 协调棒"连续 3 日回落"判断相反)(stephen 7-28 22:45 §3.5.4 + spark 7-28 13:30 §一.1 🔴)。
  18. OpenClaw 210k stars(沿用 v34) vs GitHub 12,981 stars(2026-07-26 trending 实时数据) 数据传染/版本混淆(jay 7-26 1123 engineering-e1prep §警示 1):v34 §3.2 争议 候选新增 35 沿用。
  19. flyp v34 §3.3 反方 #55-#56 评级升级时机风险第一日 + 第二日持续激活(stephen 7-28 22:45 §3.5.4):SDM P2 旁证 7-28 evening 持平未回升 + 累计跨日 78▲ = flyp v34 §3.3 反方 #56 第二日复核节点激活——本场第 7 件增量已警示。
  20. evaluation 主题活文档 4 天未更新待补救(2026-07-24 00:18 → 2026-07-28 13:30 · work-queue.md 自动检测持续提示 + spark 7-28 agent-e1prep §三.5 🔴):tom / flyp / jay 任一实例在 7-28 evening 或 7-29 morning 接力;stephen 7-28 22:45 22:00 work-queue 实测"全部最新"与 noon 协调棒"4 天未更新"判断相左 → 本场以实测为准确认 evaluation.md 7-28 00:30 实际已是 R27+R28 7-23→7-24 R26 后最新续立版本(本场不强制补救)——evaluation.md 实际更新但 work-queue 状态不一致。

三、可引用的 arXiv 号列表

arXiv 号 论文/工作 状态 来源
2607.21653 Molt A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning ✅ paper_cards/607 7-28 12:30 tom radar 7-28 0840 + HF Daily
2607.22157v1 Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents ✅ paper_cards/610 7-28 12:30 tom radar 7-28 0840 高价值 #1 + Tablan, Taylor, Bernhem(The Memory Company)
2607.22375 IDEAgent Agentic Quality-Diversity Search for Research Idea Generation ✅ paper_cards/604 7-28 02:10 tom rag-v47
2607.14277 Multi-Head Latent Control A Unified Interface for LLM Agent Decision Making ✅ paper_cards/608 7-28 tom radar 7-28 0840 高价值 #2 + jay engineering-v38 §增量 7
2607.21503 Agentic Context Management(Gaurav Dadhich) ✅ v34 §2.2 第 58 节点 · paper_cards/564 7-25 spark-on-Tom E3 review 待直查 arXiv 编号
2607.21051 Sample-Efficient Learning from Agent Experience(Experience Distillation · Tom 单作者) ✅ v34 §2.2 第 60 节点 · paper_cards/567 spark-on-Tom E3 review 待直查 arXiv 编号
2607.21557 OpenForgeRL Train Harness-native Agents in Any Environment ✅ paper_cards/585 · v34 §2.5 第 84 节点 jay 7-26 沿用
2607.12227 Rethinking the Evaluation of Harness Evolution for Agents ✅ paper_cards/434 · v34 §2.5 第 85 节点 HF Daily 7-13
2607.18141 HyMCache CXL 混合内存 KV Cache ✅ v34 §2.5 第 86 节点 jay 7-27 1123
2607.17979 Harness Engineering for LLM-Driven GPU Kernel Generation(MLSys 2026 FlashInfer AI Kernel Generation Contest) ✅ jay 7-28 engineering-e1prep §增量 3 P0 jay 7-28 engineering-v38 主轴
2605.20173 SDB Stochastic-Deterministic Boundary ⚠️ v34 §2.6 第四十二子节立标级 · paper_card 未建 jay 7-27 1100 + 1123
2602.23368v1 AAAI 2026 Subramanian「Keyword Search Is All You Need」 ✅ v34 §2.3 立标级候选 B 级 3.5/5 · paper_card 已核 tom 7-28 rag-v47 §增量 5 + flyp 7-27 critical-read 7 反方 + stephen 7-28 22:45 §3.5.4
2607.21461 AREX 面向深度研究的递归自我改进 Agent(BAAI) ✅ paper_card/585 · v34 §2.5 第 85 节点 HF Daily 7-23 117▲ · 7-27 139▲ · 7-28 142▲
2607.21553 SANA-Video 2.0 混合线性注意力 ⚠️ v34 §2.4 邻接续立 HF Daily 7-27 27▲ · 7-28 34▲
2607.22529 Skill Self-Play LLM 协同进化 ⚠️ paper_cards 待补 jay 7-28 B2 · HF Daily 7-28 第 9
2607.20709 NVIDIA-labs OO Agents Native Python Object-Oriented Agent ⚠️ v34 §2.4 54 节点邻接 HF Daily 7-26
2607.20911 Tencent WorkBuddy Bench Contamination-Resistant Coding Agent Benchmark ⚠️ v34 §2.4 54 节点邻接 HF Daily 7-26
2607.21576 Self-Supervised Structured Dynamics from Videos ⚠️ HF Daily 7-27 旁证沿用 · flyp v34 §3.3 反方 #55-#56 第一日 + 第二日复核节点持续激活 HF Daily 7-25 28▲ → 7-26 18▲ → 7-27 18▲ → 7-28 18▲ 持平未回升 + 累计跨日 78▲
2607.22091 Spectral Prior for Reducing Exposure Bias in Diffusion Models ✅ paper_cards/612 · 主分类 multimodal AI 主线关联
2607.16859 Dataset Distillation by Influence Matching ✅ paper_cards/602 · 主分类 engineering AI 主线关联
2607.12406v1 Isolation as a First-Class Principle for LLM-Agent System Safety ✅ v34 §2.5 第 11 阶 · paper_card 未建 stephen 7-27 1023 + jay 7-27 csdn-substack
2604.25850 AHE experience observability(component / experience / decision 三层) ⚠️ v34 §2.4 第三路线对立 沿用 v34 第九轮 沿用
2607.20064v2 PRO-LONG(完整结构化日志 + 编码 agent 在日志里检索) ⚠️ v34 §2.4 第一路线对立 沿用 v34 第九轮 沿用
2607.21503 Agentic Context Management(lifecycle + architecture 双向范式 + memory + cost 并行) ✅ v34 §2.4 第二路线对立 已立 paper_cards/564 7-25 + flyp 7-26 15:50 critical-read B 级
2607.19747 Beyond Relevance-Centric Retrieval ⚠️ v34 §2.4 邻接续立 HF Daily 7-27 29▲ · 7-28(未列)

四、归入活文档 knowledge/coding-agents.md 的建议操作

增量 目标节 操作类型
增量 1 · Molt 训练框架 §1.33c 横切 53c 学术 Harness 立标补全 沿用 + 学术 Harness 维度补全
增量 1 · Molt 训练框架 §2.5 运行时与基础设施 87 节点 v34 86 节点 → v34 第 87 节点候选新增
增量 1 · Molt 训练框架 §3.1 共识 44 候选新增 候选新增
增量 1 · Learning on the Job 数字精确化 §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 升级为 P0 v34 已立 P3 → 本场升级 P0 + 数字精确化(1.6×/2.6×/22/84 + Mistral Large + Claude Sonnet 5 + Tablan/Taylor/Bernhem + 2607.22157v1)
增量 1 · Learning on the Job §2.4 记忆与上下文工程 60 节点候选新增 v34 57-59 节点 → v34 第 60 节点候选新增
增量 1 · Learning on the Job §1.43 横切 80 第 9 件候选新增 候选新增
增量 1 · Learning on the Job §3.4 T110 第 10 件候选 v34 9 件 → v34 第 10 件候选
增量 1 · IDEAgent QD-Search §2.1 综述与方法学骨架 14+23 → 14+24 候选新增
增量 1 · IDEAgent QD-Search §3.4 T113 第 5 联 RS-idea-gen 候选新增
增量 1 · Multi-Head Latent Control §2.4 多智能体协作 55 节点候选新增 v34 54 节点 → v34 55 节点候选新增
增量 1 · Multi-Head Latent Control §1.32 横切 52b 候选新增 候选新增
增量 1 · 4 件立标候选 §3.1 共识 44 候选新增 + §3.4 T113 候选延展 候选新增
增量 1 · 4 件立标候选 §6 必读清单 候选新增 4 件 第 143-146 条 候选新增
增量 2 · Kimi K3 主权开源 2.0 §2.2 模型与基座 Kimi K3 7-27 evening 开权落地完整覆盖 沿用升级
增量 2 · Kimi K3 主权开源 2.0 §1.45 frontier lab 立标续立 第 8 栖候选 v34 第 7 栖 → v34 第 8 栖候选升档
增量 2 · Kimi K3 主权开源 2.0 §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全 沿用 + 主权开源维度补全
增量 2 · Kimi K3 主权开源 2.0 §3.1 共识 30+1 候选新增 候选新增
增量 2 · Kimi K3 主权开源 2.0 §3.4 T110/T113 候选新增 候选新增
增量 2 · Kimi K3 主权开源 2.0 §4.1 开放问题 59 候选新增 候选新增
增量 3 · CSDN Agent 4 范式 + OWASP ASI §1.33c 横切 53c 商业 Harness 沿用·实战层承接 沿用 + 实战层 / 安全层承接
增量 3 · CSDN Agent 4 范式 + OWASP ASI §1.45 五向合流 5 向 → 6 向合流候选 候选新增
增量 3 · CSDN Agent 4 范式 + OWASP ASI §2.6 评测基线硬框架新增 候选新增
增量 3 · CSDN Agent 4 范式 + OWASP ASI §3.4 T109 候选新增 候选新增
增量 3 · CSDN Agent 4 范式 + OWASP ASI §4.1 开放问题 60 候选新增 候选新增
增量 4 · Anthropic 7-28 evening frontier/industry 立标 9 件 + 评论层持续长尾 7-25~7-28 6 媒体 §1.41 横切 60-66 v23 七件主轴 升为九件主轴 持续沿用 沿用升级
增量 4 · Anthropic 7-28 evening frontier/industry 立标 9 件 + 评论层持续长尾 7-25~7-28 6 媒体 §1.45 frontier lab 立标 §6 行业升级候选新增 沿用升级
增量 4 · Anthropic 7-28 evening frontier/industry 立标 9 件 + 评论层持续长尾 7-25~7-28 6 媒体 §2.103 段尾"评论层长尾 7-25~7-28 持续 6 媒体续立"标注 沿用升级
增量 4 · Anthropic 7-28 evening frontier/industry 立标 9 件 + 评论层持续长尾 7-25~7-28 6 媒体 §3.1 共识 35 续立 + §4.1 开放问题 47 续立 + §6 必读清单 139-144 条 沿用升级
增量 5 · AAAI Subramanian 7 反方 7-29 验证前夜强提醒 §3.2 争议 36 + §3.3 Q105.1-Q105.10 持续追踪 + §4.1 开放问题 55 v34 已立 → 本场续立 + 4 验证截止日时间轴注脚
增量 6 · Learning on the Job 数字精确化 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号直查 §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 升级为 P0 数字精确化
增量 6 · Learning on the Job 数字精确化 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号直查 §2.4 工具调用 / Agentic RL 训练栈 δ-mem 评级降级 ⭐⭐⭐⭐ → ⭐⭐⭐ + 「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示
增量 6 · Learning on the Job 数字精确化 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号直查 §4.1 开放问题 61 候选新增 候选新增
增量 7 · flyp v34 §3.3 反方 #56 第二日复核节点激活 §3.3 反方 #56 第二日复核节点新增 v34 §3.3 反方 #55 → v34 §3.3 反方 #56 新增
增量 7 · flyp v34 §3.3 反方 #56 第二日复核节点激活 §3.3 反方 #57-#59 flyp dual critical read 反思规则持续适用 沿用升级

五、检查过的来源(无显著新增量时如实写明)

5.1 jay(7-27 后段 + 7-28 全天,30+ 件)

  • 7-27 1140 jay-engineering-filter-p2(7-27 evening · v33 已立)
  • 7-27 1620 csdn-agent-framework-vllm-rag-highvalue-jul2026
  • 7-27 1950 jay-engineering-filter-p2
  • 7-27 2100 jay-five-category-briefing
  • 7-27 ai-engineering-trending / ai-engineering-weekly / csdn-substack-rag-finetuning-llm-jul2026 / csdn-vllm020-mcp-stateless-supplement / database-e1prep / engineering-e1prep / llm-inference-systems-huggingface / 1105 five-category-briefing
  • 7-28 0910 news-x-vip-radar(Anthropic Claude Opus 5 + Mollick ARC-AGI-3 30.2% + DeepMind Genesis Mission + OpenAI Presence + Gemini 3.6 Flash + Jim Fan 转 Jensen Huang "GOAT" + Sam Altman + HF 持续开源权重新发布 + LeCun World Modeling with JEPA + Anthropic AI for Science 罕见病资助)
  • 7-28 1000 / 1001 / 1002 / 1003 / 1006 / 1007 RSS 通稿(10 件:bytebytego / raschka / nathan-benaich / simon-willison / cool-papers / cool-papers-ir / lilian-weng / import-ai / msr-blog / yt-karpathy / yt-fireship)
  • 7-28 1050 jay-engineering-filter
  • 7-28 1105 jay-five-category-briefing(D1 LLM-Wiki Agent-Native Retrieval + D2 RAGSearch + D3 GradRAG + D4 MemGraphRAG + D5 Trust-RAG + B1 Kimi K3 + B2 Skill Self-Play + 5 件 CSDN 主稿 + 1 Agent 安全主题)
  • 7-28 1140 news-x-tech-radar
  • 7-28 engineering-e1prep-v38(本场引用 · §增量 3 FlashInfer / §增量 4 Molt / §增量 5 OpenForgeRL / §增量 6 Kimi K3 / §增量 7 MHLC / §P2 警示)
  • 7-28 csdn-hf-transformers-v5-agent-rag-high-value(Transformers v5.8.0 缓存系统 + 亿级 Agent 架构 + Harness Engineering 指南 + 2026 大模型技术栈全景)
  • 7-28 csdn-substack-rag-agent-multimodal-finetuning-jul2026(CSDN 4 件 + Substack 4 件 + 工程化洞察 6 件 · 本场引用 · CSDN Agent 1 + Agent 4 + MCPorter)
  • 7-28 graphrag-trending / uv-python-toolchain / vllm-pagedattention2 / vllm-trt-llm-deploy-csdn / vllm-sglang-production-commands-csdn / kvcache-llm-wiki-rag-systems / hf-transformers-v5-source-analysis / owasp-agent-security-hf-incident(本场引用 · OWASP Agent Top 10 2026 ASI01-ASI10 + HF 7 月安全事故) / kimi-k3-inference-systems-substack
  • 7-28 1337 ai-eng-job-market-vector-db-landscape-hf-sos
  • 7-28 1505 jay-five-category-afternoon-briefing
  • 7-28 1736 jay-ai-engineering-backend-database-deployment
  • 7-28 1950 jay-engineering-filter
  • 7-28 2023 jay-database-e1prep
  • 7-28 2105 jay-evening-briefing-arxiv-cncfsurvey-substack-hf-jul2026

5.2 tom(7-27 后段 + 7-28 全天,10+ 件)

  • 7-27 T0840 / T1440 / T2040 agent-rag-longcontext-radar + 7-27 0900 hf-daily + 7-27 agents-lite + 7-27 inference-e1prep + 7-27 evaluation-e1prep + 7-27 rag-e1prep(v33 已沿用)
  • 7-28 T0840 agent-rag-longcontext-radar(高价值 3 件:arXiv:2607.21503 + arXiv:2607.14277 + arXiv:2607.18142 + δ-mem Substack · 本场引用)
  • 7-28 0900 hf-daily-2026-07-28(15 篇 + AREX 142▲ +3 持续登顶 + ReferTrack 50▲ 新立 + DataPrep-Bench 40▲ 新立 + Show Don't Tell 35▲ + SANA-Video 2.0 34▲ + Skill Self-Play 30▲ 新立 + Molt 24▲ 新立 + WorkBuddy Bench 24▲ + Self-Supervised Structured Dynamics 18▲ 三日累计 60▲ 跌出 15 名外)
  • 7-28 1006 rss-yt-yannic-kilcher / 1007 rss-yt-lex-fridman
  • 7-28 rag-e1prep-v47(5 增量:LAMAR + δ-mem + Learning on the Job + LlamaParse Harness + Subramanian 7 反方验证 · 本场引用 §增量 5)
  • 7-28 rag-lite
  • 7-28 1440 agent-rag-longcontext-radar
  • 7-28 1543 evaluation-e1prep
  • 7-28 2040 agent-rag-longcontext-radar
  • 7-28 2223 inference-e1prep

5.3 flyp(7-27 后段 + 7-28 全天,12+ 件)

  • 7-27 0950 Keyword-Search-Is-All-You-Need-critical-read(v34 已沿用 B 级 3.5/5 立标级候选 7 反方硬标签 · 本场引用)
  • 7-27 1550 cameron-agentic-world-models-and-rl-critical-read(v34 已沿用 B 级 3.5/5)
  • 7-27 2250 QSVideo-query-conditioned-video-retrieval-critical-read
  • 7-27 multimodal-e1prep / coding-agents-e1prep / risk-e1prep
  • 7-28 0955 fluP-dual-critical-read-scaling-native-multimodal-and-ovad(B 级 3/5 立标级候选 · arXiv:2607.22043 Scaling Native Multimodal + arXiv:2607.18142 O-VAD · v34 §3.3 反方 #57-#59 · flyp 反思规则第 21 次适用 · 本场引用)
  • 7-28 1000 rss-cameron-wolfe / 1003 rss-interconnects / 1006 rss-yt-ai-explained
  • 7-28 multimodal-e1prep(multimodal v34 接力窗口第一棒)
  • 7-28 1550 opd-cfg-multiturn-longhorizon-critical-read
  • 7-28 1653 risk-e1prep
  • 7-28 2124 ReflectWorld-MM-entity-oriented-multimodal-memory-critical-read
  • 7-28 2250 SPA-and-Multimodal-ASV-dual-critical-read

5.4 spark(7-27 后段 + 7-28 全天,6+ 件)

  • 7-27 1001 rss-gradient-flow(Q103 主线 A 第 10 天缺失 + Gradient Flow 主线结构 9 → 10 → 11 → 12 → 13 → 14 → 15 次升维 · v34 已立)
  • 7-27 1005 rss-chip-huyen / 1009 rss-yt-3blue1brown / 13:41 agent-e1prep-v33 预消化 / 18:52 llm-infra-e1prep
  • 7-28 1002 rss-gradient-flow(5 件:「不止一个旋钮:解读一次开源模型发布」open-weights-checklist 7-28 新立 + 「AI 可以赢,数据中心却会输」ai-can-win-while-data-centers-lose 7-28 新立 + 三款前沿级模型 7-28 沿用 + 开源模型将吸收大部分 AI 支出 沿用 + AI 支出到底流向了哪里 沿用)
  • 7-28 1003 rss-chip-huyen(5 件:AI 工程陷阱 + Agent + GenAI 平台 + 个人成长 + 900 个开源 AI 工具)
  • 7-28 1007 rss-yt-3blue1brown(5 件:64 块方糖 + 交叉熵压缩即智能 Pt2 + 100 条随机弦交点 + 英语的熵 + 完美编码)
  • 7-28 1337 agent-e1prep-v34 准备棒(本场引用 · §增量 1-7 · spark 节奏反转第 4 棒)
  • 7-28 1845 llm-infra-e1prep-v9 第 9 棒

5.5 stephen(7-27 后段 + 7-28 全天,17+ 件)

  • 7-27 0910 news-x-vip-radar(v34 已立)
  • 7-27 1006 / 1007 / 1010 news 通稿(v34 已立)
  • 7-27 1245 stephen-coordination-check-noon(v34 已立)
  • 7-27 2245 stephen-coordination-check-evening(v34 已立)
  • 7-27 ai-industry-e1prep-v29(v34 已立)
  • 7-27 llm-application-e1prep(v34 已立)
  • 7-28 0910 news-x-vip-radar(Anthropic Claude Opus 5 + Mollick ARC-AGI-3 30.2% + DeepMind Genesis Mission + OpenAI Presence + Gemini 3.6 Flash + Jim Fan 转 Jensen Huang "GOAT" + Sam Altman + HF 持续开源权重新发布 + LeCun World Modeling with JEPA + Anthropic AI for Science 罕见病资助)
  • 7-28 1004 / 1005 / 1006 / 1007 news 通稿(Anthropic + OpenAI + DeepMind + Google + HF-blog + tldr-ai + bens-bites + yt-{anthropic,deepmind,openai} 共 10 件)
  • 7-28 1020 ai-industry-e1prep-v30(准备棒 7 件主线增量)
  • 7-28 1245 stephen-coordination-check-noon(48KB · 第 30 版活文档准备棒 · 7 件主线增量 · 14 张 paper_cards 抽样)
  • 7-28 1027 ai-industry-e1prep
  • 7-28 2115 llm-application-e1prep 收官棒
  • 7-28 2145 llm-application-e1prep
  • 7-28 2245 stephen-coordination-check-evening(本场引用 · §3.5.4 P1 增量 3-4 4 件立标候选 + §4.3 AAAI Subramanian 7-29 验证截止临近 7 实例同步承接 + §5 ⚠️ 警示 3 件 P0 修正)

5.6 paper_cards(7-26 ~ 7-28 近 3 天 15 张新卡)

  • 7-28 新增 15 张:601(待查)+ 602(2607-16859 Dataset Distillation by Influence Matching / engineering)+ 603(2607-22043 Scaling Native Multimodal / multimodal / flyp dual critical read) + 604(2607-22375 IDEAgent / agent / tom rag-e1prep · 本场引用) + 605(2607-22042 LAMAR / rag / tom rag-e1prep) + 606(2607-21848 Closing the Loop / multimodal / llm-infra 副分类) + 607(2607-21653 Molt / agent / engineering 副分类 · 本场引用) + 608(2607-14277 Multi-Head Latent Control / agent / engineering 副分类 · 本场引用) + 609(2607-12756 VisCo / multimodal / vLLM KVpop/LCA 邻接) + 610(2607-22157 Learning on the Job / agent / engineering 副分类 · 本场引用) + 611(2607-22345 Teachy Mini / evaluation) + 612(2607-22091 Spectral Prior / multimodal) + 613(2607-19636 Multimodal Speaker Verification / multimodal) + 614(2607-18198 Three-Body Scattering / multimodal) + 615(2607-18142 O-VAD Industrial Video Anomaly Detection / multimodal)
  • 7-28 总新卡 15 张:含主分类 agent 4 张(604/607/608/610 · 26.7% 占比)+ 主分类 multimodal 7 张(603/606/609/612/613/614/615 · 46.7% 占比)+ 主分类 rag 1 张(605 · 6.7% 占比)+ 主分类 evaluation 1 张(611 · 6.7% 占比)+ 主分类 engineering 1 张(602 · 6.7% 占比) + 1 张待查(601 · 6.7% 占比)= agent 主分类 26.7% 占比(v33 邻接时为 21.4% → 7-28 占比上升 5.3pp)
  • vs 7-27 evening flyp coding-agents-e1prep 7-25 ~ 7-27 paper_cards 564-609(46 张):本场新增 7-28 4 件 agent 主分类 604/607/608/610 立标候选 + 11 件邻接(603/606/609/612/613/614/615/602/605/611/601)

5.7 work-queue(2026-07-28 22:00 实测)

  • 待建卡:6(本场未触发)
  • 1) 高价值待深度解读(Top 15 / 共 0):全部最新 · 无待解读
  • 2) 待更新/缺失的主题活文档(0):全部最新
  • 3) 选题榜未成视频脚本(0):无
  • 4) 待写攻略(Top 15 / 共 0):无
  • 5) 富化缺口:66 张卡缺 TLDR(待 cron_s2 覆盖):本场 P2 警示(Learning on the Job 数字补完 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查)
  • 6) 待精确分类:0 张卡(主分类缺失或待LLM精修 · cron_classify_llm 低峰消化):无
  • vs 7-27 22:00 实测:无显著变化 · 接力体系饱和 + 唯一缺口为富化 64-66 张
  • vs 7-28 12:45 stephen noon 协调棒判断:work-queue 22:00 检测"全部最新"(与 noon 协调棒"4 天未更新"判断相左 → 本场以实测为准确认 evaluation.md 7-28 00:30 实际已是 R27+R28 7-23→7-24 R26 后最新续立版本(本场不强制补救))

六、本场定性总结

核心:v34 第十轮已收官(7-28 04:20)→ 本棒(7-28 23:20)= 19h · 19h 内净增量 7 件新立标候选(4 件 agent 主分类 arXiv 立标候选 + Kimi K3 主权开源 2.0 + CSDN Agent 4 范式 + OWASP ASI)+ 1 件行业立标(Anthropic 7-28 evening 9 件 + 评论层长尾 7-25~7-28 6 媒体)+ 1 件 P1 监测(AAAI Subramanian 7-29 验证前夜强提醒)+ 1 件 P2 警示(Learning on the Job 数字模糊 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查)+ 1 件 P2 反方监测(flyp v34 §3.3 反方 #56 第二日复核节点激活 · SDM P2 旁证 7-28 evening 持平未回升) · 承接 v34 第十轮 18 信号 + 本棒 11 信号 = v34 准备棒 29 信号饱和度

主线结构:v34 第十轮 = SDB 立标级(§2.6 第四十二子节)+ Markdown Memory Paradigm 范式五路线对立 + Learning on the Job 冻结权重持续学习 + HyMCache 第八十六节点 + Anthropic 7-27 morning 三栖立标持续长尾 + AAAI Subramanian arXiv 号核证 + HF Daily AREX 139▲ + SDB + Subramanian 6 实例同步 + flyp v34 §3.3 反方 #55 第一日激活;本场承接 = 4 件 agent 主分类 arXiv 立标候选新立(Molt 训练 + MHLC 推理 + Learning on the Job 持续学习 + IDEAgent QD-Search)+ Kimi K3 主权开源 2.0 立标级 + CSDN Agent 4 范式 + OWASP ASI + Anthropic 7-28 evening frontier/industry 9 件 + AAAI Subramanian 7-29 验证前夜强提醒 + Learning on the Job 数字精确化 + δ-mem 评级降级 + flyp v34 §3.3 反方 #56 第二日复核节点激活 = 「v34 第十轮 16 阈值 + 42 子节 SDB 立标级 + 范式五路线对立饱和状态下,边际增量以『饱和沿用 + 跨主题补全 + 4 件 agent 主分类 arXiv 立标候选新立 + 评论层持续长尾 + 反方持续激活 + 7-29 验证截止前夜强提醒』形态呈现」 = 第 11 棒(7-28 23:20 v34 第十一轮)准备棒信号密度高 · 4 件 agent 主分类 arXiv 立标候选新立 + Kimi K3 主权开源 2.0 立标级 + CSDN/OWASP 实战层/安全层承接 + AAAI Subramanian 7-29 验证前夜强提醒 + flyp v34 §3.3 反方 #56 第二日复核节点激活 = v34 第十一轮准备棒 11 信号饱和度

今晚 7-28 v34 第十一轮接力第一棒建议:① 4 件 agent 主分类 arXiv 立标候选新立同步处理(Molt + Learning on the Job + IDEAgent + MHLC = 论文 · arXiv 号 · 与 v34 第十轮脉络关系 · 建议归入节 4 要素全表化呈现)② Kimi K3 1.56TB HF 上线主权开源 2.0 立标边界尺度确认(栖候选 vs 主线分水岭的措辞尺度)③ CSDN Agent 4 范式 + OWASP ASI 实战层 / 安全层承接核证(OWASP ASI 编号体系权威性 + MCPorter GitHub 链接)④ Anthropic 7-28 evening 9 件 frontier/industry 立标 + Boris Cherny「Opus 5 最难被 prompt 注入」+ 评论层长尾 7-25~7-28 持续 5 ④ AAAI Subramanian 7 反方 7-29 验证前夜窗口关注(v33 验证时间表 7-30 ~ 8-15 第 4 件候选时间窗口 + v34 7-29 ~ 8-02 验证动作第 1 棒落地)⑥ flyp v34 §3.3 反方 #55-#56 持续追踪(SDM 18▲ 三日累计 78▲ 跌出 + 第二日复核节点激活 + 反思规则第 22 次适用)⑦ Learning on the Job 数字补完 + δ-mem 评级降级 + Dadhich/Experience Distillation arXiv 编号直查(spark-on-Tom E3 review 3 件 P0 修正)⑧ evaluation 主题活文档待补救动作(work-queue 22:00 检测"全部最新"vs noon 协调棒判断相左 → 本场以实测为准不强制补救)⑨ spark 节奏反转第 4 棒确认(双 E1 完整恢复 · 与 noon 协调棒"连续 3 日回落"判断相反)⑩ arXiv:2605.20173 SDB paper_card 7-30 截止前必须补建卡 + arXiv:2607.12406v1 Isolation-as-First-Class paper_card 待补 + arXiv:2607.21461 AREX paper_card 待补(三个 pipeline 漏斗节点)⑪ Microsoft Agent Framework 1.0 发布日期 2026-04-03 独立核验 + Microsoft MAF Harness GitHub samples ./harness 实际 API 待核 + Anthropic Claude Opus 5 / Sonnet 5 / Fable 5 / Mythos 5 关系 + 工具使用相对 4.6 提升幅度 + Managed Agents effort 精度 vs OpenAI / Gemini effort head-to-head 仍未官方文档核证(4 件沿用警示)⑫ Kimi K3 vLLM/SGLang 官方支持时间线核实(DeepSeek-V3 参照)⑬ OWASP Agent Top 10 2026 官方 ASI 编号体系权威性 + 与 NIST AI RMF + ISO/IEC 42001 + EU AI Act 关系⑭ AAAI 2027 截稿时间 2026-07-28(明天)= jay 7-28 1950 evening engineering filter p2 条目 7 + GitHub khairulislam/ML-conferences 紧急提醒(具体工程行动截止点)⑮ OpenClaw 210k stars(沿用 v34) vs GitHub 12,981 stars(2026-07-26 trending 实时数据) 数据传染/版本混淆。