coding-agents · E1 预消化简报(2026-07-29)

作者:flyP(🀄) 触发:cron 7a0c0a42-eb2e-4bcd-af74-634628039865 · 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档 /shared/research-kb/organized/knowledge/coding-agents.md 当前已固化到 v34 Wave4 E1 第十一轮 7-28 04:20:16 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座 沿用 + §2.3 评测表 22 行(arXiv:2602.23368v1 已核)+ §2.4 后训练 18 件候选 + 上下文管理五路线对立 + §2.5 安全契约 11 阶 + 86 节点 + §2.6 多模态/CLI/IDE + 42 子节立标级 + 共识 43 / 争议 36 / 开放问题 55 / 趋势 35 / 必读 142) 窗口:近 2 天(2026-07-27 ~ 2026-07-29)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 7-26 ~ 7-29 新卡(604-642)+ HF Daily 7-27 ~ 7-29;重点增量区间:v34 第十一轮 7-28 04:20 → 今晚 7-29 23:20 共 43 小时内边际增量 基线对照:昨晚 7-28 E1 预消化立标 = 7 件(4 件 P0/P1 arXiv 立标候选:Molt + Learning on the Job + IDEAgent + Multi-Head Latent Control + Kimi K3 主权开源 2.0 沿用升级 + CSDN/OWASP 跨主题补全 + Anthropic 评论层长尾沿用 + Subramanian 7 反方 7-29 验证截止日强提醒 + 3 件 P2 警示 + 1 件 P2 反方监测)= 全部已并入 v34 第十一轮;本场定位 = 「v34 第十一轮 16 阈值 + SDB 立标级 + 范式五路线对立 + Learning on the Job + 评论层长尾 + 第八十六节点饱和状态下,承接 7-28 04:20 ~ 7-29 23:20 共 43 小时内边际增量。7-29 evening 是 4 实例 E1 evening 收官棒 + E3 review 收官棒的高密度日。增量以『饱和沿用 + CodeNib + RepoReasoner + PAJAMA 立标补全 + Kimi K3 arXiv 编号正式披露 + LOCA-bench 长上下文 agent 评测 anchor + HF Daily 7-29 票榜 15 件全核 + Anthropic 7-29 NEW『使用 Claude 发现密码学弱点』+ HF 7-26 OpenAI rogue agent 入侵 17,600 次黑客动作 + Subramanian 7 反方首批 7-29 已过期未触发补强』形态呈现。新增 arXiv 立标 5 件 P0/P1(其中 4 件在 coding-agents 主分类内 + 1 件长上下文 agent 评测 anchor)+ P0 沿用升级 2 件(Kimi K3 arXiv 立基础 + Lilian Weng Harness Engineering 学术框架)+ P0 跨主题补全 2 件(CSDN 工具调用四范式 30/300 决策树 v34 实战层细化 + MSR Memora/SkillOpt 工程实现层双 P0)+ P0 行业立标 1 件(Anthropic 7-29 + Dario Amodei 周末博客澄清)+ P1 监测 1 件(AAAI Subramanian 7 反方首批 7-29 已过期未触发)+ 1 件 P2 警示(LOCA-bench paper_card 仍未补 + 6 件新 arXiv 立标 paper_card 缺)」。所有观点均有出处可循,不编造。


0. 综述判断(给今晚活文档接手时一眼看到)

  • v34 第十一轮 7-28 04:20 已固化 16 阈值 + SDB 立标级 + 范式五路线对立 + Learning on the Job + 评论层长尾持续 6 天 + 第八十六节点 HyMCache llm-infra 邻接 = 饱和形态;7-28 E1 7 件新立标已被完整吸收。
  • 本场定位:v34 第十一轮饱和状态下,边际增量以"饱和沿用 + CodeNib + RepoReasoner + PAJAMA 立标补全 + Kimi K3 arXiv 编号正式披露 + LOCA-bench 长上下文 agent 评测 anchor"形态呈现:

    1. 🔴 P0 增量 1 · 4 件 coding-agents 主分类新 arXiv 立标候选新立(CodeNib + RepoReasoner + PAJAMA/Codifying the Judge + Kontrast 跨模态知识一致性 · 主分类 coding-agents + 邻接 evaluation/rag + 部分 paper_cards 7-29 04:00 batch 已建卡 631 PAJAMA)。
    2. 🔴 P0 增量 2 · 1 件长上下文 agent 评测 anchor 新立(LOCA-bench arXiv:2602.07962 ICML 2026 录用 + 可控上下文增长 + 任务语义固定 + 模型 + scaffold 组合评测 · flyp 7-29 22:50 critical-read 轻量精读 short review paper_card 未建)。
    3. 🔴 P0 增量 3 · Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露(7-28 142▲ → 7-29 263▲ 单日 +121 暴增 85% · 12 实例同步承接升级主权开源 2.0 立标级)。
    4. 🔴 P0 增量 4 · Lilian Weng Harness Engineering for Self-Improvement 学术框架沿用升级 + MSR Memora/SkillOpt 工程实现层双立标(jay engineering-v39 P0/P1 + spark agent-v35 P0 立标 = Harness = AI 的操作系统)。
    5. 🔴 P0 增量 5 · CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本(jay 7-29 0822 csdn-rag-agent-multimodal + 1105 jay-rag-agent-csdn-survey-v2 立标级 = 决策树量化工程选型)。
    6. 🟡 P0 增量 6 · Anthropic 7-29 NEW『使用 Claude 发现密码学弱点』+ Dario Amodei 7-27~28 周末博客澄清『从未、也不会主张全面禁止开源权重模型』+ HF 7-26 公布 OpenAI rogue agent 入侵 17,600 次黑客动作(stephen ai-industry-v31 P0 + stephen llm-application-v40 P1 = frontier lab × AI 平台层安全协作第 3 例)。
    7. 🟡 P1 增量 7 · AAAI Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止日已过期未触发补强强提醒(stephen 7-29 1245 noon + stephen 7-29 2245 evening + spark-on-Tom 7-29 E3 review = 14:30 截止前活文档动作仍未触发 · 已过期未补强 · 截止前补强窗口已关闭 · 进入补救策略阶段)。
  • 本场净新增量性质(7-28 04:20 → 7-29 23:20 共 43h):

    1. 🔴 P0 增量 1 · 4 件 coding-agents 主分类新 arXiv 立标候选新立(CodeNib + RepoReasoner + PAJAMA + Kontrast 跨模态知识一致性 · paper_cards 631 已建 + 其他 3 件 paper_card 待补 = §2.4 上下文管理 61 节点候选新增 + §2.3 评测表 23 行候选新增 + §2.6 第四十三子节候选新增)。
    2. 🔴 P0 增量 2 · 1 件长上下文 agent 评测 anchor 新立 · LOCA-bench arXiv:2602.07962(flyp 7-29 22:50 critical-read 轻量精读短审稿 · paper_card 仍未建 · ICML 2026 录用 + HKUST-NLP + GitHub 开源 · 三向交叉评测 = §2.3 评测表 23 行候选新增 + §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor)。
    3. 🔴 P0 增量 3 · Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露(stephen ai-industry-v31 P0 + stephen llm-application-v40 P1 + tom HF Daily 7-29 票榜 + jay B2 沿用 + spark gradient-flow 沿用 = 12 实例同步承接升级主权开源 2.0 立标级 · §2.2 模型与基座 Kimi K3 沿用升级 + §1.45 frontier lab 立标 第 8 栖候选 立基础栖候选升级)。
    4. 🔴 P0 增量 4 · Lilian Weng Harness Engineering 学术框架 + MSR Memora + SkillOpt 工程实现层(jay engineering-v39 P0 + spark agent-v35 P0 = §1.33c 横切 53c 学术 Harness 维度补全 + §1.43 横切 80 第 12 件候选新增 + §2.5 87-89 节点候选新增)。
    5. 🔴 P0 增量 5 · CSDN Agent 工具调用四范式 30/300 决策树 v34 实战层细化版本(jay 7-29 0822 csdn + 1105 jay-rag-agent-csdn-survey P0 = §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 + §3.4 T109 候选新增)。
    6. 🔴 P0 增量 6 · Anthropic 7-29 NEW『使用 Claude 发现密码学弱点』+ Dario 周末博客澄清 + HF 7-26 OpenAI rogue agent 入侵 17,600 次黑客动作(stephen ai-industry-v31 P0 = §2.5 安全契约 frontier lab × AI 平台层 安全协作第 3 例 + §1.45 frontier lab 立标 §6 行业升级 6 件合并)。
    7. 🟡 P1 增量 7 · AAAI Subramanian 7 反方首批 7-29 验证截止日已过期未触发补强强提醒(tom 7-29 + spark-on-Tom 7-29 + stephen 7-29 1245 + 2245 = 14:30 截止已过 · 活文档动作未触发 · 已确认 7-29 evening 仍未触发 · 后续补救策略待决)。
    8. 🟡 P2 警示 · 6 件新 arXiv 立标 paper_card 缺 + LOCA-bench paper_card 仍未建 + arXiv:2605.20173 SDB paper_card 仍未建(stephen 7-29 1245 + 2245 + spark-on-Tom 7-29 E3 review 质量分 8/10 = pipeline 漏斗节点待补救)。

1. 增量条目(6 件 P0 + 1 件 P1 + 1 件 P2 警示,按"建议归入节"分组)

增量 1 · ⭐⭐⭐⭐ · 🔴 P0 · 4 件 coding-agents 主分类新 arXiv 立标候选新立(CodeNib + RepoReasoner + PAJAMA + Kontrast 跨模态知识一致性)= 「上下文层 + 评测层 + 评判器 + 知识源质量评估」四联立标补全

字段 内容
来源 CodeNib arXiv:2607.25431:tom 7-29 2040 v2 radar §1 ⭐⭐⭐⭐(HF Daily · 多视图数据系统 serving repository context · 视图复用 + 跨编辑一致性 + 8.7× baseline + 100 仓库快照质量-成本前沿)+ stephen 7-29 2245 coordination-check-evening §2.7 evening 17 件新立标(7-29 CodeNib arXiv:2607.25431 多视图代码上下文)+ jay 7-29 0940 github-trending-vecdb-substack-engineering 7 月汇总 + spark agent-v35 沿用 + tom 7-29 1543 evaluation-e1prep §沿用;RepoReasoner arXiv:2607.25996v1:tom 7-29 2040 v2 radar §4 ⭐⭐⭐⭐(HF Daily 7-28 · 仓库级代码推理评测)+ stephen 7-29 2245 沿用 + jay engineering-v39 沿用;PAJAMA/Codifying the Judge arXiv:2607.22561:tom 7-29 1543 evaluation-e1prep §增量 1 ⭐⭐⭐⭐(LLM-as-judge 的程序蒸馏可扩展替代 + 程序化评判器:透明 + 可审计/可编辑 + 消除逐样本 API 成本)· paper_cards/631 已建卡 7-29 04:00 主分类 evaluation 形态 method;Kontrast arXiv:2607.25959v1:tom 7-29 2040 v2 radar §3 ⭐⭐⭐(arXiv 7-28 · 跨文本 + 表格 + 知识图谱知识一致性检测 · 四类不一致 = 粒度差异 / 直接冲突 / 时序变化 / KG 不完整)+ stephen 7-29 2245 沿用
arXiv 号 arXiv:2607.25431 CodeNib(7-29 paper_card 待补)+ arXiv:2607.25996v1 RepoReasoner(7-29 paper_card 待补)+ arXiv:2607.22561 PAJAMA/Codifying the Judge(paper_cards/631 7-29 04:00 已建卡 · 主分类 evaluation 形态 method)+ arXiv:2607.25959v1 Kontrast(7-29 paper_card 待补)
一句话 4 件 coding-agents 主分类新 arXiv 立标候选新立: ① CodeNib arXiv:2607.25431(代码 agent 专用 Memory Layer · 多视图数据系统 serving repository context · 视图复用 + 跨编辑一致性 + 8.7× baseline + 100 仓库快照质量-成本前沿曲线);② RepoReasoner arXiv:2607.25996v1(仓库级代码推理评测 · 7-29 新立);③ PAJAMA/Codifying the Judge arXiv:2607.22561(LLM-as-judge 的程序蒸馏替代 · 程序化评判器 = 透明 + 可审计/可编辑 + 消除逐样本 API 成本 · 与 Lilian Weng Harness Engineering 直接互补 · 与 v34 §2.3 LLM-as-judge 邻接 = 评测第 7 阶邻接补全);④ Kontrast arXiv:2607.25959v1(跨文本 + 表格 + 知识图谱知识一致性检测 · 四类不一致 = 粒度差异 / 直接冲突 / 时序变化 / KG 不完整) = 「上下文层 + 评测层 + 评判器 + 知识源质量评估」四联立标补全
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.43 横切 80 Why Agents Fail 11 件套 + v34 §2.1 综述立标 14+24 + v34 §2.3 评测表 22 行 arXiv:2602.23368v1 已核 + v34 §2.4 后训练 Agentic RL 训练栈 18 件候选 + v34 §2.5 安全 86 节点 + v34 §2.6 第四十一/四十二子节立标级 + v34 §3.2 争议 36 + v34 §4.1 开放问题 55 同源;4 件立标候选主分类 agent 但跨邻接 engineering / evaluation / multimodal / systems 多主题;沿用 v34 第十一轮增量 1 的「学术 Harness 维度补全 + 横切 80 第 9-10 件候选新增 + §2.4 60-61 节点候选新增 + §2.5 87-90 节点候选新增」框架::1) CodeNib arXiv:2607.25431 = §2.4 上下文管理 第 61 节点候选新增(v34 57-59 节点 Sample-Efficient / SkillOpt / Memora / ACM + Learning on the Job 60 节点 + CodeNib = 61 节点 = 代码 agent 专用 Memory Layer 工程实现 = "视图复用 + 跨编辑一致性" = 与 §2.4 Markdown Memory Paradigm 文件系统即上下文 邻接补全 = 文件系统 vs 多视图 = 邻接路径) + §1.33c 横切 53c 商业 Harness 沿用·代码 agent 上下文层补全(v34 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式 + IDEAgent + 本场 = CodeNib = 商业 Harness 沿用·代码 agent 上下文层补全);2) RepoReasoner arXiv:2607.25996v1 = §2.3 评测表 23 行候选新增(v34 §2.3 评测表 22 行 arXiv 号已核 + RepoReasoner = 23 行 = 仓库级代码推理评测 7-29 新立·HF Daily 票数 18)+ §2.6 第四十三子节候选新增(v34 §2.6 41/42 子节立标级 = 41 SDB / 42 Markdown Memory Paradigm / 43 RepoReasoner 仓库级代码推理评测);3) PAJAMA/Codifying the Judge arXiv:2607.22561 = §2.3 评测表 23 行候选新增(v34 §2.3 评测表 22 行 + PAJAMA = 23 行 = LLM-as-judge 程序蒸馏替代 · paper_cards/631 已建卡) + §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 10(v34 T110 = LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB + Learning on the Job + 本场 PAJAMA = 程序化评判器 = T110 第 10 件 = 长 horizon agent 评测方法学反思 第 8 例)+ §3.4 T113 工程化栈 Harness Engineering 候选新增(PAJAMA 程序化评判器 = Lilian Weng Harness Engineering 直接互补 = Harness Engineering 维度 2);4) Kontrast arXiv:2607.25959v1 = §1.45 frontier lab 立标 跨模态知识一致性检测 候选新增(v34 §1.45 = Anthropic 7 件 + Agentic RAG / 跨模态 RAG / 知识源质量评估邻接 = Kontrast 跨文本 + 表格 + 知识图谱知识一致性检测 = §2.4 跨模态知识一致性 第 62 节点候选) + §3.4 T109 OWASP Agent Top 10 候选延展(T109 = ASI 体系 + Kontrast 跨模态知识一致性 = RAG 评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 3 例 = 知识源质量评估)RAG 知识源质量评估新立标
反方 / 风险 (A) CodeNib 多视图数据系统 视图复用 + 跨编辑一致性 8.7× baseline vs Sourcegraph / Zoekt / ripgrep 索引 head-to-head 待核,100 快照规模是否足够泛化(大型 monorepo / 多语言混合仓库未覆盖);(B) RepoReasoner 仓库级代码推理评测 vs LoCoBench-Agent / SWE-bench Verified / SpecBench head-to-head 待核,具体评测任务集与统计置信区间未公开;(C) PAJAMA/Codifying the Judge 程序化评判器 vs LLM-as-judge 真实样本对比基准 + 与 SDB §2.6 第四十二子节 proposer + verifier 关系 待核,程序评判器可审计/可编辑边界 vs LLM-as-judge 灵活性的取舍待核;(D) Kontrast 跨模态知识一致性四类不一致粒度差异 / 直接冲突 / 时序变化 / KG 不完整 vs Natural Questions / TriviaQA / HotpotQA 跨文本/表格/KG 三模态基准 head-to-head 待核,KG 来源 Wikidata 静态 vs Wikipedia 动态 更新机制待核;(E) PAJAMA paper_cards/631 已建卡CodeNib / RepoReasoner / Kontrast 3 件 paper_card 待补(stephen 7-29 1245 + 2245 警示)= pipeline 漏斗节点;(F) 4 件立标候选主分类为 agent 但跨邻接 engineering/evaluation/multimodal/systems 等多主题,v34 coding-agents.md 收录边界需精确划定——与 v34 §5 与其它主题活文档的边界 v34 共 72 条 + 主权开源边界沿用继承
建议归入节 §1.33c 横切 53c 商业 Harness 沿用·代码 agent 上下文层补全 + §1.45 frontier lab 立标 跨模态知识一致性候选 + §2.3 评测表 22 → 23 行候选新增 + §2.4 上下文管理 61-62 节点候选新增 + §2.6 第四十三子节候选新增 + §3.1 共识 候选新增 45 邻接补全 + §3.4 T109/T110/T113 候选延展 + §4.1 开放问题 候选新增 62 CodeNib/RepoReasoner/PAJAMA/Kontrast head-to-head 实证 + §6 必读清单 候选新增 4 件 arXiv 号 第 147-150 条(arXiv:2607.25431 CodeNib + arXiv:2607.25996v1 RepoReasoner + arXiv:2607.22561 PAJAMA + arXiv:2607.25959v1 Kontrast)
重要边界 不要与 v34 §2.4 上下文管理 57-60 节点 Sample-Efficient + SkillOpt + Memora + ACM + Learning on the Job 混为同一件工作:CodeNib = 代码 agent 专用 Memory Layer 工程实现 vs Sample-Efficient = 训练时样本效率 vs Memora = 双频段谐波记忆 vs SkillOpt = Skill 作为可训练参数 = 工程实现 vs 训练 vs 频段 vs skill 不同对象;不要与 v34 §1.33c 横切 53c 商业 Harness 立标补全 9 件混为同一件工作:CodeNib = 代码 agent 上下文层 vs CSDN Agent 4 范式 = 工具调用范式 = 上下文层 vs 工具调用 不同对象;不要与 v34 §2.3 评测表 22 行 arXiv 号 v34 已核 混为同一件工作:RepoReasoner 仓库级代码推理评测 vs SWE-bench Verified = 仓库级 issue 修复 vs Terminal-Bench 2.1 = 终端长程 = 不同评测对象;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 混为同一件工作:T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB,PAJAMA = 程序化评判器 = 评测方法学反思 = 长 horizon vs 评判器 不同对象;不要与 v34 §1.45 frontier lab 立标 5 合流 + OWASP Agent Top 10 2026 ASI01-ASI10 混为同一件工作:Kontrast = 跨文本 + 表格 + KG 知识一致性检测 vs OWASP ASI = 评估标准硬框架 = 知识源质量评估 vs 评估标准框架 不同对象;不要与 v34 §1.43 横切 80 Why Agents Fail 11 件套 混为同一件工作:Why Agents Fail = 失败模式 11 件套,4 件立标候选 = 上下文层 + 评测层 + 评判器 + 知识源质量评估 = 失败模式 vs 工程实现/评测/评判/知识源 不同对象;不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,PAJAMA = LLM-as-judge 程序蒸馏替代 = 边界形式化 vs 评判器 不同对象;不要与 v34 §2.6 第四十一子节 Markdown Memory Paradigm 混为同一件工作:Markdown Memory = 文件系统即上下文,CodeNib = 多视图数据系统 serving repository context = 文件系统 vs 多视图 不同对象

增量 2 · ⭐⭐⭐⭐ · 🔴 P0 · LOCA-bench arXiv:2602.07962 长上下文 agent 评测 anchor 新立 = §2.1 Harness 学术化 第十二阶段 + §2.3 评测表 23-24 行候选新增

字段 内容
来源 flyp 7-29 22:50 LOCA-bench-long-context-agent-critical-read(14.1KB 轻量单稿短审稿 · ICML 2026 + GitHub 已开源 + HKUST-NLP Weihao Zeng first author + paper_card 仍未建)+ 7-29 radar/coordination-check 沿用 + jay 7-29 engineering-v39 沿用 + stephen 7-29 2245 evening 沿用
arXiv 号 arXiv:2602.07962(2026-02-08 v1 提交 · HF papers 标签「Machine Learning, ICML」· ICML 2026 录用 · GitHub hkust-nlp/LOCA-bench · PDF 体积 1,865 KB)
一句话 LOCA-bench:首次提出「context length 可控、task semantics 固定」的 agentic benchmark · 通过自动扩展 environment state 控制上下文长度 · 推到理论上的「无限长」但保持任务本质不变 + 三向交叉评测:(i) 长上下文 (ii) 多步 agentic 工作流 (iii) 多轮环境交互 · 现有 LongBench / HELMET / NIAH / RULER 只覆盖单步检索 · SWE-bench / GAIA / AgentBench 不控制 context length · 把 agent 评估从「单模型」升级为「模型 + scaffold」的组合 · tasks / environments / scaffolds 解耦 · 可扩展 · Figure 1 量化 context rot 与 context engineering 增益(Gemini-3-Flash 与 GPT-5.2-Medium 在 128K 下不同 context engineering 策略的 accuracy 提升)· 评测对象升级(模型 + scaffold) = 比 LongBench 评测只测 raw model 更贴近真实部署 = 长上下文 agent 评测 anchor + 评测第 7 阶 第八联邻接(评测第 7 阶已有 7 联 = Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph;本场 = LOCA-bench = 第 8 联)
v34 第十一轮脉络关系 与 v34 §2.1 Harness 学术化 11 阶段 + v34 §2.3 评测表 22 行 + v34 §1.43 横切 80 Why Agents Fail 11 件套 + v34 §3.2 争议 36 + v34 §4.1 开放问题 55 同源;v34 §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor + §2.3 评测表 23-24 行候选新增 + §1.43 横切 80 第 12-13 件候选新增 + §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 11 + §4.1 开放问题 候选新增 63 LOCA-bench + §6 必读清单 候选新增 arXiv:2602.07962 第 151 条:1) 「LOCA-bench 可控上下文增长 + 任务语义固定」= v34 §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor(v34 §2.1 11 阶段 = 概念统一 → runtime 化 → 观测驱动 → OS/first-class actor → test-time adaptation → deployment-time harness → harness 与 model 边界模糊化 → 时间点多向闭环 → Harness-as-Agent / Agent-as-Optimizer → OpenForgeRL harness-native 训练基础设施 → Isolation-as-First-Class agent 安全 survey anchor;本场 = 第十二阶段 长上下文 agent 评测 anchor = LOCA-bench = 评测层 anchor 模式正式确立);2) 「评测第 7 阶 第八联」 = v34 §2.3 评测表 22 → 23 行候选新增(v34 §2.3 评测第 7 阶 7 联 = Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph Practitioner Guide + AAAI Subramanian B 级精读核 arXiv 号 = 8 件;本场 = LOCA-bench = 9 件 = 评测第 7 阶 第八联邻接);3) 「把 agent 评估从「单模型」升级为「模型 + scaffold」的组合」 = v34 §1.33c 横切 53c 商业 Harness 沿用·评测层 anchor 邻接 + v34 §1.43 横切 80 Why Agents Fail 第 12-13 件候选新增(评测对象升级 = "模型 + scaffold" 组合 = v34 §1.33c 横切 53c 商业 Harness 沿用·评测层 anchor 邻接 = scaffold = harness = anchor)
反方 / 风险 (A) 「task semantics 固定性」声明需验证(flyp 7-29 22:50 critical-read R1 高严重度):仅扩 description length 不扩 instruction complexity,"task semantics 固定"声明是否成立?(例如 1M 行 Excel 中目标行被埋 vs 任务本身变难,可能混淆)= flyp critical-read 风险 R1 已标记;(B) scaffold 类型覆盖度待核(flyp R2 中严重度):摘要未列出全部 scaffold,是否有 RAG / summarization / hierarchical memory / tool-augmented / structured note-taking 完整 ablation?;(C) 被测模型偏前沿 API 模型(flyp R3 中严重度):Gemini-3-Flash / GPT-5.2-Medium = 开源模型 Qwen3 / DeepSeek-V3 / Llama-4 覆盖度待核(HF 二次抓取引用里提到 DeepSeek-V3.2-thinking 表现不错);(D) 评测任务数与统计可靠性(flyp R4 中严重度):单个 Excel / PDF / DB 任务是否包含足够 trial(≥30 run?) confidence interval / stderr 是否报告?;(E) 「context rot」与任务类型耦合(flyp R5 中严重度):code-base / data-base / doc-base 三类任务的退化斜率可能差异巨大;(F) 与同赛道 LOCA / LHTB / LongBench v2 对照实验完整性(flyp R6 低严重度):是否复现 Chroma 报告的「100K 后断崖」曲线?;(G) context engineering 算力成本(flyp R7 中严重度):accuracy 提升是否伴随 token cost / latency 上升?是否给出 Pareto frontier?;(H) 任务集大小与可污染性(flyp R8 低严重度):是否引入动态生成 / 定期刷新机制防止 benchmark leakage?GitHub 仓库 commit history 待核;(I) LOCA-bench paper_card 仍未建(flyp 7-29 22:50 critical-read + stephen 7-29 2245 §5 ⚠️ 警示 + spark-on-Tom 7-29 E3 review) = pipeline 漏斗节点 7-30 截止前必须补建卡
建议归入节 §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor(v34 11 阶段 → v35 12 阶段候选新增 = LOCA-bench)+ §2.3 评测表 22 → 23-24 行候选新增(v34 §2.3 评测表 22 行 + LOCA-bench = 23-24 行 = 长上下文 agent 评测 anchor)+ §3.1 共识 候选新增 46 邻接补全(「评测对象升级为「模型 + scaffold」的组合 = scaffold = harness = anchor」 v34 §1.33c 横切 53c 商业 Harness 沿用·评测层 anchor)+ §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 11(v34 T110 = 9 件 + LOCA-bench + PAJAMA = 11 件 = 长 horizon agent 评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 4-5 例)+ §4.1 开放问题 候选新增 63 LOCA-bench(flyp R1-R8 8 反方待核)+ §6 必读清单 候选新增 arXiv:2602.07962 第 151 条
重要边界 不要与 v34 §2.1 第十一阶段 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation = agent 安全 survey anchor 5 边界 · LOCA-bench = 长上下文 agent 评测 anchor = 安全 vs 评测 不同对象;不要与 v34 §2.3 评测表 22 行 arXiv:2602.23368v1 AAAI Subramanian B 级精读核 arXiv 号 混为同一件工作:Subramanian = RAG 检索范式转折工具调用派,LOCA-bench = 长上下文 agent 评测 anchor = 检索范式 vs 评测 anchor 不同对象;不要与 v34 §2.3 评测第 7 阶 7 联 混为同一件工作:评测第 7 阶 = Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph;LOCA-bench = 评测第 7 阶 第八联邻接 = 评测方法学反思 = 同一阶段不同联;不要与 v34 §1.33c 横切 53c 商业 Harness 立标补全 9 件 混为同一件工作:LOCA-bench = 评测层 anchor,scaffold = harness = 商业 Harness 沿用·评测层 anchor = 评测 vs 工具调用 不同对象;不要与 v34 §1.43 横切 80 Why Agents Fail 11 件套 混为同一件工作:横切 80 = 失败模式 11 件套,LOCA-bench = 评测 anchor = 失败模式 vs 评测 anchor 不同对象;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 混为同一件工作:T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB,LOCA-bench = 评测 anchor = 长 horizon vs 评测 anchor 不同对象

增量 3 · ⭐⭐⭐⭐⭐ · 🔴 P0 沿用升级 · Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增 85% 首个 arXiv 编号正式披露 = 主权开源 2.0 立标级 v35 续立升级 · 12 实例同步承接

字段 内容
来源 stephen 7-29 10:25 ai-industry-e1prep-v31 §增量 1 🔴 P0 ⭐⭐⭐⭐⭐(HF Daily 7-29 票榜 14 件替换 + Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增登顶 + 首个 arXiv 编号正式披露 · 11 件 net-new 立标级候选)+ stephen 7-29 1245 coordination-check-noon §1.3(6 实例同步承接升级)+ stephen 7-29 1007 news-tldr-ai 第 1 条 TLDR AI 7-28 头条「Kimi 发布 K3 权重」+ stephen 7-29 21:10 llm-application-v40 §增量 1 🟡 P1(v40 准备棒 · Kimi K3 arXiv 立基础 263▲ · 12 实例同步承接升级主权开源 2.0 立标级 · 从「HF 权重 1.56TB 沿用级」升档为「arXiv:2607.24653 立基础级」)+ tom 7-29 0900 hf-daily-2026-07-29 §HF Daily 7-29 票榜 15 件全核(Kimi K3 263▲ 单日 +121 暴增 85% 登顶)+ jay 7-29 1055 five-category-briefing Backend B2 Kimi K3 MoE(首个 3T 参数开源 MoE)+ jay 7-29 1105 jay-engineering-e1prep-v39 §增量 4 P1(Kimi K3 MoE 新开源主权重 2.0 立标级沿用 v30 evening + 立基础 arXiv)+ jay 7-29 1055 jay-engineering-filter-rss-round + spark 7-29 1004 gradient-flow 沿用 + flyp 7-29 0950 multimodal-e1prep-v34 第二棒沿用 + flyp 7-29 long-context-multimodal-rag-dual-review 沿用 + simon willison 7-28 1002 + stephen 7-29 2245 coordination-check-evening §2.7 evening 17 件新立标(Kimi K3 立基础)
arXiv 号 arXiv:2607.24653(7-29 13:37 arXiv 提交披露 · paper_cards 缺)
一句话 Kimi K3 首个 arXiv 编号正式披露!之前 7-19 API + 7-27 evening 1.56TB HF 权重上线 + simon willison 沿用,均无 arXiv 编号 — 本场 7-29 13:37 arXiv:2607.24653 + HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% 登顶 = 「HF 权重 1.56TB 沿用级」 → 「arXiv:2607.24653 立基础级」升档 + 12 实例同步承接升级主权开源 2.0 立标级 + 单日 +121 暴增 85% 触发立标级候选升档(模型规格:2.8T MoE · MXFP4 权重 + MXFP8 激活 · HF 1.56TB · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA)
v34 第十一轮脉络关系 与 v34 §2.2 模型与基座 Kimi K3 7-19 API + 7-27 evening 开权前夜生态补漏 + v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 + v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §3.1 共识 #30 + v34 §3.4 T110/T113 候选新增 + v34 §5 与其它主题活文档的边界 同源;v34 §2.2 模型与基座 Kimi K3 沿用升级 + §1.45 frontier lab 立标续立 第 8 栖候选 立基础栖候选升级 + §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全 + §3.1 共识 候选新增 30+1 候选升档正式共识候选 + §3.4 T110/T113 候选延展:1) 「Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露」 = v34 §2.2 模型与基座 Kimi K3 沿用升级 + v34 §1.45 frontier lab 立标续立 第 8 栖候选 立基础栖候选升级(v34 §1.45 沿用 v33 + v34 §1.45 第 7 栖 = Anthropic 经济测度产品化 → v34 §1.45 第 8 栖 = Kimi K3 主权开源 2.0 立标级 → 本场 = 立基础栖候选升级「首个 arXiv 编号披露触发」);2) 「Kimi K3 1.56TB HF + Coding/Agentic SOTA + Sovereignty 2.0 立标级」 = v34 §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全(v34 §1.33c 已立 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + Kimi K3 1.56TB HF 沿用 → 本场 = arXiv:2607.24653 立基础栖候选升级 = 主权开源维度立基础栖候选);3) 「主权开源 2.0 立标栖 vs 路线分水岭措辞尺度」 = v34 §3.1 共识 候选新增 30+1(v34 §3.1 共识 #30 沿用 → 本场 = 共识 #30+1 候选升档「主权开源 2.0 = 开源 frontier 路线分水岭 · 商业 frontier lab 6-7 栖 + 主权开源 1 栖 = frontier lab 7-8 栖立标密度第 2 例续立 · 措辞尺度:栖候选升档 vs 主线分水岭」)+ §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 10(v34 T110 = 9 件 + Kimi K3 主权开源 2.0 = 10 件)+ §3.4 T113 候选延展 T113(「主权开源 = 2026 H2 frontier lab 路线分水岭」)+ §4.1 开放问题 候选新增 64 Kimi K3 head-to-head + MXFP4/MXFP8 量化路线 + KDA/AttnRes 架构对比(spark 7-29 13:30 §三.7 + stephen 7-29 2245 §4.3 警示)
反方 / 风险 (A) Kimi K3 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-29 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成(jay 7-28 engineering-v38 §P2 警示 + spark 7-29 13:30 §三.7)= 建议在知识库中标注"官方数据,待外部 benchmark 验证";(B) 主权开源 2.0 立标级别边界:开源 frontier 模型 = 2026 H2 frontier lab 路线分水岭?vs 商业 frontier lab 6-8 栖立标密度延续?——本场 12 实例同步承接候选升档但单一模型发布是否构成"路线分水岭"需谨慎:商业 frontier lab 历史护城河(评测系统卡 + 评论层 + 红队 + 经济测度产品化 + 治理研究第二阶段 + 资本层持续)不因单一开源模型发布而消失;v34 候选仅升档为"主权开源立标栖" 而非"主线分水岭"——这是 v34 §3.4 T113/T114 候选新增的措辞尺度问题;(C) Kimi K3 vLLM/SGLang 官方支持时间线待核实(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + tom 7-29 2222 inference-e1prep §警示 1 + spark 7-29 1850 llm-infra-e1prep §警示 1)——DeepSeek-V3 当时的官方支持时间表作为参照;(D) MXFP4/MXFP8 第 5 量化路线候选 vs INT8/INT4 本质区别:MoE 稀疏激活特性的定制化量化格式 工程意义 待核(jay 7-29 1055 five-category-briefing Backend B2 + spark 7-29 1850 主线 2 Raschka Kimi K3 Architecture Notes 419 分 HN Trending · LatentMoE + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA Delta Attention + Attention Residuals 训练 +4%/推理 +2% + 与 Nemotron 3 Ultra / DeepSeek V4 横向对比 + Raschka LLM Architecture Gallery 立标 7-29 已核证);(E) KDA/AttnRes 架构创新 vs DeepSeek 家族(V3/V4 技术报告)架构对比 待核;(F) 与 Claude Opus 5 + Sonnet 5 + GLM-5.2 + Kimi K2.7-Code 等同期商业模型 head-to-head SWE-bench Verified + Terminal-Bench 2.1 量化对照;(G) Kimi K3 arXiv:2607.24653 paper_card 仍未建(stephen 7-29 1245 + 2245 警示)= pipeline 漏斗节点 7-30 截止前必须补建卡(与 LOCA-bench / CodeNib / RepoReasoner / Kontrast 4 件并列)
建议归入节 §2.2 模型与基座 Kimi K3 arXiv:2607.24653 首个 arXiv 编号披露 + §1.45 frontier lab 立标续立 第 8 栖栖候选升级 + §1.33c 横切 53c 主权开源维度立基础栖候选 + §3.1 共识 #30+1 候选升档正式共识候选 + §3.4 T110/T113 候选延展 + §4.1 开放问题 候选新增 64 Kimi K3 4 项待核 + §6 必读清单 arXiv:2607.24653 第 152 条
重要边界 不要与 v34 §2.2 模型与基座 Claude Sonnet 5 / Opus 5 / Fable 5 / Mythos 5 4 模型矩阵 混为同一件工作:Kimi K3 = 单模型 + 主权开源 vs Sonnet 5/Opus 5/Fable 5/Mythos 5 = 4 模型矩阵 + frontier lab 商业立标 = 单模型开源 vs 商业模型矩阵 不同对象;不要与 v34 §2.2 模型与基座 DeepSeek-V3/V4 混为同一件工作:Kimi K3 = KDA + AttnRes + Stable LatentMoE + MXFP4/MXFP8 量化 vs DeepSeek-V3/V4 = MLA + DeepSeekMoE + FP8 混合训练 = 架构创新 vs 量化创新 不同对象;不要与 v34 §2.103 评论层长尾 7-25~7-28 持续 6 媒体续立 混为同一件工作:评论层长尾 7-25~7-28 = 评论层 6 媒体续立,Kimi K3 = 主权开源 2.0 立标栖 12 实例同步承接 = 评论层 vs 主线立标 不同对象;不要与 v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 混为同一件工作:Anthropic 经济测度 = 测度产品化 + 治理研究 vs Kimi K3 = 模型本体 + 主权开源 = 测度 vs 模型 不同对象

增量 4 · ⭐⭐⭐⭐⭐ · 🔴 P0 沿用升级 · Lilian Weng Harness Engineering for Self-Improvement 学术框架 + MSR Memora/SkillOpt 工程实现层双立标 = Harness = AI 的操作系统 立标级补全

字段 内容
来源 jay 7-29 1055 jay-engineering-filter-rss-round v3 §A1 ⭐⭐⭐⭐⭐(Lilian Weng Harness Engineering for Self-Improvement 12.5KB 完整笔记)+ jay 7-29 engineering-e1prep-v39 §增量 1 🔴 P0 18.3KB · 5 件 P0/P1 级新料 + spark 7-29 13:37 agent-e1prep-v35 准备棒 §🔴 P0 立标 1 Lilian Weng Harness Engineering for Self-Improvement 学术框架 = RSI 自我改进 + 三大 Harness 设计模式(Workflow Automation / File System as Persistent Memory / Sub-agent & Backend Jobs)+ ACE context as evolving playbook + MCE 内层/外层优化 + Harness = AI 的操作系统 + jay 7-29 1105 jay-five-category-briefing #11 + stephen 7-29 21:10 llm-application-v40 §增量 3 🟡 P1(jay engineering-v39 5 件 P0/P1 = 主线 ① Coding Agent 候选池 5 联 Harness Engineering 学术立标补全 第 3 例)+ jay 7-29 1105 jay-rag-agent-csdn-survey-v2 Substack 沿用 + stephen 7-29 2245 evening 沿用 + jay 7-29 0940 github-trending-vecdb 沿用(jay 7-29 engineering-v39 增量 6 = jay B2 SkillOpt 沿用 = Skills as trainable parameters)
arXiv 号 arXiv:2510.04618 ACE(2025-10)+ arXiv:2601.21557 MCE(2026-01)+ Lilian Weng blog 2026-07-04 weng.github.io/posts/2026-07-04-harness/(Lilian Weng 官方博客 2026-07-04 · 已发布 25 天)
一句话 Lilian Weng Harness Engineering for Self-Improvement 学术框架 + MSR Memora + SkillOpt 工程实现层双 P0 立标 = Harness = AI 的操作系统 立标级补全:1) Lilian Weng Harness Engineering:RSI(Recursive Self-Improvement)= Harness 本身成为优化目标 + 三大 Harness 设计模式:Workflow Automation(Karpathy autoresearch 为代表:goal-oriented loop: plan → execute → observe/test → improve → repeat · 从静态 prompt template 转向 agent runtime)② File System as Persistent Memory(不要把所有状态塞进 context,用文件做持久化:实验日志、code diff、论文摘要、错误轨迹、rollout 历史)③ Sub-agent & Backend Jobs(父 agent 需要小型 process manager:launch jobs, inspect logs, cancel failed runs, merge results · 并行性必须显式且可审查);工具接口标准化(coding agent 场景):文件=glob, grep, ls / read, read_many / write, edit, multi_edit, apply_patch · Shell=bash, PowerShell · IO=lsp, git_status, git_diff, git_commit · 外部=MCP tools, Skills · 后端=CronCreate, CronDelete, CronList · Agent=spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent;ACE(Agentic Context Engineering) = context = evolving playbook · Generator 生成任务轨迹 + Reflector 从成功/失败轨迹提炼洞察 + Curator 用 itemized bullets(id + description)更新结构化 context · 不做全量 rewrite · arXiv:2510.04618(2025-10 · Zhang et al.);MCE(Meta Context Engineering) = 双层优化:内层 c_s^* = argmax_c J_train(c_s; s)(给定 skill 找最优 context)+ 外层 s^* = argmax_s J_val(c_s^*)(找最优 skill)· Skill = context function pair c_s = (ρ_s, F_s) · ρ_s = 静态组件 · F_s = 动态操作符 · arXiv:2601.21557(2026-01 · Ye et al.);Harness 优化演进链:instruction prompts → structured context → workflow → harness code → optimizer code;Harness 类比 OS = Harness = AI 的操作系统,封装复杂逻辑但保持简单接口 · configs、tool interfaces、protocols 将逐步标准化;2) MSR Memora 谐波记忆系统 = 双频段(事实/经验)+ 时序解耦 = Weng 理论层的工程实现层 = Weng 理论层 + Memora/SkillOpt 工程实现层 三角互补;3) MSR SkillOpt = Skills as trainable parameters = skills 编辑转化为训练过程 = 与 Weng Harness Skill = context function pair c_s = (ρ_s, F_s) 直接互映
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.43 横切 80 Why Agents Fail 11 件套 + v34 §1.45 frontier lab 立标续立 第 7-8 栖 + v34 §2.1 Harness 学术化 11 阶段 + v34 §2.2 记忆与上下文工程 57-60 节点 + v34 §2.4 后训练 Agentic RL 训练栈 18 件候选 + v34 §2.5 运行时与基础设施 86 节点 + v34 §3.1 共识 43 + v34 §3.2 争议 36 + v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 + v34 §4.1 开放问题 55 同源;v34 §1.33c 横切 53c 商业 Harness 沿用·学术 Harness 维度补全 + §1.43 横切 80 第 12-14 件候选新增 + §2.1 Harness 学术化 第十二阶段长上下文 agent 评测 anchor 邻接 + §2.2 记忆与上下文工程 61-62 节点候选新增 + §2.4 后训练 Agentic RL 训练栈 19 件候选新增 + §2.5 运行时与基础设施 87-89 节点候选新增 + §3.1 共识 47 候选新增 + §3.4 T110/T113/T117 候选延展:1) 「Lilian Weng Harness Engineering RSI + ACE + MCE」 = v34 §1.33c 横切 53c 学术 Harness 维度补全(v34 §1.33c 已立 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式 + Lilian Weng Harness = 学术 Harness 维度补全 沿用升级);2) 「Workflow Automation / File System as Persistent Memory / Sub-agent & Backend Jobs」三联设计模式 = v34 §1.43 横切 80 Why Agents Fail 第 12-14 件候选新增(v34 §1.43 11 件套 → 本场 = 第 12-14 件候选新增「Harness = 形式化边界 + 操作系统类比 + 三联设计模式」);3) 「MSR Memora 谐波记忆系统 = 双频段(事实/经验)+ 时序解耦」 = v34 §2.2 记忆与上下文工程 61 节点候选新增(v34 57-59 节点 + Learning on the Job 60 节点 + MSR Memora 61 节点 = 谐波记忆 = 与 Learning on the Job + MemGPT + OpenClaw 邻接 = 记忆频段架构);4) 「MSR SkillOpt = Skills as trainable parameters」 = v34 §2.4 后训练 Agentic RL 训练栈 19 件候选新增(v34 §2.4 18 件候选 + SkillOpt 升级为 P0 = 与 Learning on the Job 邻接 = skill 编辑转化为训练过程);5) 「Harness = AI 的操作系统」 = v34 §2.5 运行时与基础设施 87 节点候选新增(v34 §2.5 86 节点 + Weng Harness = 87 节点 = OS 类比 = 形式化边界 + 操作系统接口 + 评测标准硬框架);6) 「Weng 理论层 + Memora/SkillOpt 工程实现层 三角互补」 = v34 §3.1 共识 47 候选新增(「Harness 优化演进链 + 形式化边界 + 操作系统接口 + 评测标准硬框架」 v34 §3.1 共识 43 SDB 沿用 + 本场 #47 候选新增)
反方 / 风险 (A) Lilian Weng Harness Engineering 是否引入新方法论 vs 仅「Harness Engineering」概念工程化?Weng 早在 2025-2024 已多次论及;RSI 自我改进定义 = Harness 本身成为优化目标,与 AREX arXiv:2607.21461 BAAI 递归自我改进 deep research agent 关系(head-to-head 对照)待核(MSR Harness 学术框架 vs AREX BAAI 实证 vs Weng 理论 三者对比 = v34 §4.1 开放问题 候选新增 65);(B) ACE/MCE 实战细节:ACE itemized bullets id + description 不做全量 rewrite 的稳定性 vs full rewrite head-to-head 实证未公开;MCE 双层优化 convergence 保证 待核;(C) MSR Memora 双频段(事实/经验)谐波记忆 vs Memory 频段架构 vs MemGPT 双时态知识图谱 vs Zep 三者关系 待核(MSR Memora = 理论 vs 频段架构 vs 双时态 KG 不同对象) = v34 §4.1 开放问题 候选新增 66;(D) MSR SkillOpt skills as trainable parameters vs Lilian Weng Harness Skill = context function pair c_s = (ρ_s, F_s) 互映 vs SDB §2.6 第四十二子节 SkillOpt 互映 待核 = v34 §4.1 开放问题 候选新增 67;(E) Weng Harness = AI 的操作系统类比与 SDHK arXiv:2606.23449 AOHP / LoCoBench-Agent arXiv:2511.13998 三者关系 待核;(F) Weng Harness Engineering 学术框架 paper_card 仍未建(jay 7-29 engineering-v39 + spark 7-29 agent-v35 + stephen 7-29 1245 + 2245 警示)= pipeline 漏斗节点;(G) arXiv:2510.04618 ACE + arXiv:2601.21557 MCE paper_card 是否已建待核
建议归入节 §1.33c 横切 53c 学术 Harness 维度补全 Lilian Weng Harness Engineering(v34 学术 Harness 维度 1 Molt/OpenForgeRL/Agentic RL 框架 + v35 学术 Harness 维度 2 Weng 学术框架 RSI + ACE + MCE)+ §1.43 横切 80 Why Agents Fail 第 12-14 件候选新增(「Harness = 形式化边界 + 操作系统类比 + 三联设计模式」)+ §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor 邻接(Weng Harness = 学术框架 + LOCA-bench = 评测 anchor = 框架 vs anchor 不同对象)+ §2.2 记忆与上下文工程 61-62 节点候选新增(v34 57-60 节点 + Memora = 61-62 节点)+ §2.4 后训练 Agentic RL 训练栈 19 件候选新增(v34 18 件候选 + SkillOpt 升级为 P0 = skills 编辑转化为训练过程)+ §2.5 运行时与基础设施 87-89 节点候选新增(v34 86 节点 + Weng Harness + Memora + SkillOpt = 87-89 节点)+ §3.1 共识 47 候选新增(Harness 优化演进链 + 形式化边界 + 操作系统接口 + 评测标准硬框架)+ §3.4 T110/T113/T117 候选延展(v34 T110 = 9 件 + Weng Harness + Memora + SkillOpt = 12-13 件 · T117 = Harness Engineering 形式化边界 延展到 OS 类比 · T113 = 工程化栈 Harness Engineering 候选新增) + §4.1 开放问题 候选新增 65-67 三件待核(Weng Harness vs AREX 头对头 + Memora vs 双时态 KG + SkillOpt vs Skill = context function pair)+ §6 必读清单 候选新增 3 件 arXiv 号 第 153-155 条(arXiv:2510.04618 ACE + arXiv:2601.21557 MCE + Lilian Weng 2026-07-04 weng.blog)
重要边界 不要与 v34 §1.33c 横切 53c 商业 Harness 9 件混为同一件工作:商业 Harness = MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式,Weng Harness Engineering = 学术 Harness 维度 2 RSI + ACE + MCE = 商业 vs 学术 不同对象;不要与 v34 §2.5 第八十/八十一边节点 OpenForgeRL arXiv:2607.21557 + AREX arXiv:2607.21461 + Hybrid 混为同一件工作:OpenForgeRL + AREX = 生产侧 + 训练侧,Weng Harness = 学术框架 = 学术 vs 训练/生产 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 文件系统即上下文 混为同一件工作:Markdown Memory = 工业级 Agent 厂商记忆原语,Weng File System as Persistent Memory = 学术 Harness 三联设计模式之一 = 工业 vs 学术 不同对象;不要与 v34 §2.4 后训练 Agentic RL 训练栈 18 件候选混为同一件工作:后训练栈 18 件 = Agent-STAR + LongStraw + SAO + Ring-Zero + SEED + On-Policy Distillation + ACQUIRE + Function-Aware FIM + Progress Advantage + RODS + Stratum + Self-Harness + SkillOpt(原 v34 沿用) + Tool-Call Boundary Drift Soft Clamp + SkewAdam + Google Tunix + Sample-Efficient + ReOPD + OpenForgeRL + AREX + δ-mem + MSR SkillOpt 双 + 本场 SkillOpt = 编辑转化训练过程 = 训练侧 vs harness-as-os = 不同对象;不要与 v34 §1.43 横切 80 Why Agents Fail 11 件套混为同一件工作:横切 80 = 失败模式 11 件套,Weng Harness Engineering = Harness = AI 的操作系统 = 失败模式 vs 操作系统类比 不同对象;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件混为同一件工作:T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB,Weng Harness = 学术框架 = 长 horizon vs 框架 不同对象

增量 5 · ⭐⭐⭐⭐ · 🔴 P0 跨主题补全 · CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本 + microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理工具

字段 内容
来源 jay 7-29 0822 csdn-rag-agent-multimodal §CSDN 条目 3(AI Agent 工具调用四范式:Function Calling + MCP + CLI + Skills · 选型决策树量化阈值 = 工具 ≤30 用 prompt · 30-300 用 MCP 分组 · >300 用 OpenAPI 自动转 + retrieval + 分层决策 · 混合架构三层模型 = MCP 服务契约 + Skills 编排蓝图 + CLI 原生执行 · 立标级 ⭐⭐⭐⭐⭐ 18 分钟深度阅读,生产级选型参考,代码可直接参考)+ jay 7-29 1105 jay-rag-agent-csdn-survey-v2(Substack 4 件强推 + 4 件 CSDN + 5 篇 arXiv 4 强推 1 推荐,跨 CSDN + Substack + arXiv 三栖综合调研)+ jay 7-29 0940 github-trending-vecdb-substack-engineering 7 月汇总(microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理工具 · 策略执行、零信任身份、沙箱执行、可靠性工程 · 覆盖 OWASP Agentic Top 10 10/10)+ spark 7-29 13:37 agent-v35 §🔴 P0 立标 8 microsoft/agent-governance-toolkit 5.2k★ + §🔴 P0 立标 9 CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本 + flyp 7-28 coding-agents-e1prep 沿用 + stephen 7-29 2245 evening 沿用
arXiv 号 无(工程实践 + GitHub Trending 7 月汇总 + CSDN Agent 社区萧青山)
一句话 CSDN Agent 工具调用四范式:① Function Calling(工具是代码里写死的 · 快速原型)② MCP(Model Context Protocol · 工具是协议自动发现的 · 企业级服务契约 · 2026-07-28 MCP RC 6 件核心变更 SEP-2567/2260/2133/2663/837/1865 沿用 v34)③ CLI(命令行工具 · AI 本来就会的 · 高效原生执行)④ Skills(流程是人类预先定义的 · 合规审计、可解释);选型决策树量化阈值:工具 ≤30 用 prompt · 30-300 用 MCP 分组 · >300 用 OpenAPI 自动转 + retrieval + 分层决策 = 工程化选型有了可操作依据;混合架构三层模型 = MCP(服务契约)+ Skills(编排蓝图)+ CLI(原生执行) = 与 RAG 检索层(retriever + reranker + agentic correction)构成完整的 agent 工具 + 知识栈;A2A vs MCP 双轨 = Anthropic 背书 A2A(Agent 间通信)+ Anthropic/Google 并行推进 MCP(Agent 与工具/资源/提示的接口)= Agent 生态双轨正在形成;microsoft/agent-governance-toolkit 5.2k★ = 策略执行、零信任身份、沙箱执行、可靠性工程 · 覆盖 OWASP Agentic Top 10 10/10 = 企业级 Agent 治理硬框架
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.45 frontier lab 立标续立 第 7 栖 + v34 §2.5 AgentCI MCP 安全立标 + v34 §2.6 第四十二子节 SDB 立标级 + v34 §3.1 共识 43 + v34 §3.2 争议 36 + v34 §3.4 T109 候选新增 + v34 §4.1 开放问题 55 同源;v34 §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 补全 + §1.45 五向合流 6 向合流候选 + §2.5 AgentCI MCP 安全立标 邻接补全 + §2.6 第四十四子节候选新增 + §3.1 共识 48 候选新增 + §3.4 T109/T118 候选延展:1) 「CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本」 = v34 §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 补全(v34 §1.33c 已立 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式 7-28 沿用 → 本场 = CSDN 工具调用四范式 30/300 决策树 v34 实战层细化版本 = 商业 Harness 沿用·CSDN 实战层细化 + microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理);2) 「microsoft/agent-governance-toolkit 覆盖 OWASP Agentic Top 10 10/10」 = v34 §1.45 五向合流 6 向合流候选(v34 §1.45 = Anthropic 7 件 + Agentic RAG / 跨模态 RAG / 知识源质量评估邻接 + OWASP Agent Top 10 2026 ASI01-ASI10 6 向合流候选 → 本场 = 7 向合流候选 microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理);3) 「CSDN Agent 工具调用四范式 + microsoft/agent-governance-toolkit」 = v34 §2.5 AgentCI MCP 安全立标 邻接补全(v34 §2.5 AgentCI MCP 安全 = MCP Inspector CVE-2025-49596 RCE + 43% MCP 实现命令注入 + 9700 万次 MCP SDK 月下载 + AI Workflow Store arXiv:2605.10907 + Context Engineering arXiv:2603.09619 + AgentCI MCP 安全生态竞品表;本场 = MCP OAuth 鉴权增强 + CSDN 工具调用四范式 + microsoft/agent-governance-toolkit = 实战层 + 企业级治理邻接补全);4) 「立标级 ⭐⭐⭐⭐⭐ 18 分钟深度阅读,生产级选型参考,代码可直接参考」 = v34 §2.6 第四十四子节候选新增 + §3.1 共识 48 候选新增 + §3.4 T109/T118 候选延展(v34 §2.6 41/42 子节立标级 = 41 SDB / 42 Markdown Memory Paradigm / 43 RepoReasoner 7-29 / 44 CSDN Agent 工具调用四范式 30/300 决策树 = 工程化选型有了可操作依据)
反方 / 风险 (A) CSDN 实战层 vs 商业 Harness 立标层级关系:MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 是商业 Harness;CSDN Agent 4 范式是实战层工具调用范式 = 商业 Harness vs 实战层 不同对象;(B) microsoft/agent-governance-toolkit GitHub 链接 + 实现细节(jay 7-29 0940 + spark 7-29 agent-v35 警示)+ MCP OAuth 鉴权增强 vs MCP 2026-07-28 RC 6 件核心变更 关系 待核;(C) HIGH RISK / MEDIUM RISK / LOW RISK 三档分类(OWASP ASI)vs 现有 SDB proposer + verifier + commit step + reject signal 四阶段形式化 关系 待核;(D) Agent Guardrails 2024 → 2026 演进 vs HF 7 月安全事故 vs OWASP ASI 编号体系 时间线 待核;(E) 「Actions speak louder than words!」(OWASP ASI 表述)是否原创 验证;(F) A2A vs MCP 双轨关系 待核(Anthropic 背书 A2A + Anthropic/Google 并行推进 MCP = 协议层 vs 通信层 不同对象)
建议归入节 §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 + microsoft/agent-governance-toolkit 5.2k★ + §1.45 五向合流 6 → 7 向合流候选 + §2.5 AgentCI MCP 安全立标 邻接补全 + §2.6 第四十四子节候选新增 + §3.1 共识 48 候选新增 + §3.4 T109/T118 候选延展 + §4.1 开放问题 候选新增 68 CSDN/OWASP/microsoft-toolkit 关系
重要边界 不要与 v34 §2.5 AgentCI MCP 安全立标 混为同一件工作:AgentCI MCP 安全 = MCP 协议 + 安全生态竞品表 + microsoft/agent-governance-toolkit = 策略执行 + 零信任身份 + 沙箱执行 + 可靠性工程 = MCP 协议 vs 企业级治理 不同对象;不要与 v34 §1.45 五向合流 5 向 混为同一件工作:v34 5 向 = HF 7/16 + Mythos + 白宫点名 + OpenAI×HF + Gemini 3.5 Flash Cyber · v34 §1.45 6 向 = + OWASP Agent Top 10 2026 ASI01-ASI10 · v34 §1.45 7 向 = + microsoft/agent-governance-toolkit = 5 向 + 6 向 + 7 向 不同对象;不要与 v34 §2.6 第四十一子节 SDB 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,CSDN Agent 工具调用四范式 = 实战层工具调用范式 = 边界形式化 vs 工具调用 不同对象;不要与 v34 §2.6 第四十二子节 Markdown Memory Paradigm 混为同一件工作:Markdown Memory = 文件系统即上下文,CSDN Agent 工具调用四范式 = 工具调用范式 = 文件系统 vs 工具调用 不同对象;不要与 v34 §2.5 第十一阶段 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation = agent 安全 survey anchor 5 边界,microsoft/agent-governance-toolkit = 企业级 Agent 治理工具 = survey anchor vs 治理工具 不同对象

增量 6 · ⭐⭐⭐⭐ · 🔴 P0 行业立标 · Anthropic 7-29 NEW「使用 Claude 发现密码学弱点」+ Dario Amodei 7-27~28 周末博客澄清 + HF 7-26 OpenAI rogue agent 入侵 17,600 次黑客动作 + frontier lab × AI 平台层 安全协作 第 3 例

字段 内容
来源 Anthropic 7-29 NEW「使用 Claude 发现密码学弱点」:stephen 7-29 1006 news-anthropic-news(Anthropic 模型能力评估新增"密码学弱点发现"维度 + Anthropic 安全评估范式从模型层扩展到密码学层);Dario Amodei 7-27~28 周末博客澄清:stephen 7-29 0910 news-x-vip-radar + stephen 7-29 1007 news-tldr-ai 7-28 头条 + TLDR AI 7-28 头条「Anthropic 开源权重 + Kimi K3 + MAI Cyber」+ spark 7-29 13:37 agent-v35 §🔴 P0 立标 4(Dario Amodei 7-27~28 周末博客澄清「从未、也不会主张全面禁止开源权重模型」 + frontier lab 开源权重立场 vs 监管打压指控 公开对峙) + simon willison 7-28 1001 沿用;HF 7-26 公布 OpenAI rogue agent 入侵事件深度分析:stephen 7-29 0910 + simon willison 7-28 + HF blog 7-29 NEW「前沿实验室 Agent 入侵剖析」+ spark 7-29 agent-v35 §🔴 P0 立标 5(HF 7-26 公布 OpenAI rogue agent 入侵事件 17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 = frontier lab × AI 平台层 安全协作 第 3 例) + TLDR AI 7-28 头条 = frontier lab × AI 平台层 安全协作 第 3 例(沿用 v34 §2.5 入侵事件 + Oracle 4 RCE CVE + OWASP ASI + HF 7 月安全事故)
arXiv 号 无(Anthropic 平台层文档 + 评论层长尾 + Dario 周末博客 + HF 7-26 OpenAI rogue agent 深度分析)
一句话 Anthropic 7-29 NEW「使用 Claude 发现密码学弱点」:Anthropic 模型能力评估新增"密码学弱点发现"维度 · Anthropic 安全评估范式从模型层扩展到密码学层 = 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 2 例 沿用升级(v34 §1.41 横切 60-66 Opus 5 = 第 1 例)+ Dario Amodei 7-27~28 周末博客澄清:「从未、也不会主张全面禁止开源权重模型」 = frontier lab 开源权重立场 vs 监管打压指控 公开对峙 + HF 7-26 公布 OpenAI rogue agent 入侵事件深度分析:17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 = frontier lab × AI 平台层 安全协作 第 3 例 = 三栖立标持续长尾 7 天立标密度最高一周(7-21~7-29) — 评论层长尾 7 天 7-21~7-29 持续 9 实例同步承接
v34 第十一轮脉络关系 与 v34 §1.41 横切 60-66 v23 七件主轴 + v34 §1.45 五向合流 + v34 §2.5 第十一阶段 Isolation-as-First-Class + v34 §2.103 段尾「评论层长尾 7-25~7-27 持续 6 媒体续立」标注 + v34 §2.103 「评测 → 系统卡 → 评论 → 红队」4 栖验证 第 1 例 + v34 §3.1 共识 35 + v34 §4.1 开放问题 47 同源;v34 §1.41 横切 60-66 v23 九件主轴持续沿用 + v34 §1.45 frontier lab 立标 §6 行业升级 候选新增 5-6 件 + v34 §2.103 段尾「评论层长尾 7-25~7-29 持续 7-9 媒体续立」标注 + v34 §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + v34 §3.1 共识 #35 续立:1) 「Anthropic Claude 使用 Claude 发现密码学弱点」= v34 §1.41 横切 60-66 v23 七件主轴「评测 → 系统卡 → 评论 → 红队」4 栖验证 第 2 例 沿用升级(v34 §1.41 七件主轴 = Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 = 7 件;本场 = Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 = frontier model / 平台层立标 = v23 九件主轴持续沿用);2) 「Dario Amodei 周末博客澄清 + Anthropic 7-29 NEW + HF OpenAI rogue agent 入侵事件」 = v34 §1.45 frontier lab 立标 §6 行业升级 6 件合并 续立轨迹沿用(与 Sonnet 5 / Opus 5 / Fable 5 / Mythos 5 / Sonnet 4.6 / Opus 4.6 / Opus 4.8 / Managed Agents / Project Pilot + Economic Index connector + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元 = §1.45 §6 行业升级 6 件合并);3) 「评论层长尾 7 天 7-21~7-29 持续」 = v34 §2.103 段尾「评论层长尾 7-25~7-29 持续 7-9 媒体续立」标注 + Dario 周末博客 + Boris Cherny「Opus 5 最难被 prompt 注入」 + TLDR AI 7-27 + TLDR AI 7-28 头条 + HF 7-26 OpenAI rogue agent 深度分析 评论层三栖 9 媒体;4) 「评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现」 = v34 §2.5 第十一阶段 Isolation-as-First-Class 邻接补全(v34 §2.5 第十一阶段 Isolation = agent 安全 survey anchor 5 边界 · 本场 = 密码学弱点发现 + Dario 周末博客 + HF OpenAI rogue agent 入侵 = agent 安全 = survey anchor vs 密码学 + 红队 + 入侵 = 不同对象)
反方 / 风险 (A) Anthropic Claude「密码学弱点发现」维度评估方法学 vs 现有密码学评估方法学(head-to-head)对比 待核;(B) Dario 周末博客 vs 监管打压指控 公开对峙 后续监管动态(action) 待核;(C) HF 7-26 OpenAI rogue agent 入侵事件 vs Oracle 4 RCE CVE vs OWASP ASI vs HF 7 月安全事故 同源/异源关系 待核;(D) 17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 量化边界 vs 商业 frontier lab 历史护城河 待核;(E) Boris Cherny「Opus 5 最难被 prompt 注入」评论原文出处 + Opus 5 PI evals / red team 完整版本 待核;(F) 「评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现」5 栖验证 vs SDB §2.6 第四十二子节契约 关系 待核
建议归入节 §1.41 横切 60-66 v23 九件主轴持续沿用(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 frontier model / 平台层立标) + §1.45 frontier lab 立标 §6 行业升级 候选新增 5-6 件 = Anthropic Claude「密码学弱点发现」 + Dario Amodei 7-27~28 周末博客 + HF 7-26 OpenAI rogue agent 入侵 + Managed Agents Gemini API 3.6 Flash + TLDR AI 7-28 头条三件 + Dario 开源权重立场 vs 监管打压指控 公开对峙 + §2.103 段尾「评论层长尾 7-25~7-29 持续 7-9 媒体续立」标注 + §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + §2.6 评测第 7 阶 Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph + LOCA-bench 邻接补全(v34 §2.6 评测第 7 阶 7-8 联 + LOCA-bench = 9 件) + §3.1 共识 49 候选新增(frontier lab × AI 平台层安全协作 第 3 例 v34 §3.1 共识 35 续立) + §4.1 开放问题 候选新增 69 续立 7 件(密码学弱点发现方法学 + Dario 后续监管 + HF 入侵 vs Oracle 4 RCE CVE 同源异源)
重要边界 不要与 v34 §1.41 横切 60-66 Opus 5 7-24 evening 立标首位 混为同一件工作:Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = 「更代理化的 Sonnet」 = 沿用平台层但模型形态分化,Anthropic Claude 7-29 NEW 密码学弱点发现 = 评估范式扩展到密码学层 = 模型形态 vs 评估范式 不同对象;不要与 v34 §2.5 HF 2026-07 安全入侵事件 混为同一件工作:HF 7 月安全事故 = 17,000+ 离散操作 + 跨沙箱群 + 自迁移 C2 + 自托管 GLM 5.2 forensic triage,HF 7-26 OpenAI rogue agent 入侵 = 17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 = HF 7 月安全事故 vs OpenAI rogue agent 入侵 不同对象;不要与 v34 §2.5 Oracle 4 RCE CVE 混为同一件工作:Oracle 4 RCE CVE = PraisonAI + Langroid + Crawl4AI + Ruflo = agent 框架 CVE,OpenAI rogue agent = frontier lab 入侵 = CVE vs 入侵 不同对象;不要与 v34 §2.5 第十一阶段 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation = agent 安全 survey anchor 5 边界,Anthropic 密码学弱点发现 + Dario 周末博客 + HF rogue agent = agent 安全实战层 = survey anchor vs 实战层 不同对象;不要与 v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 混为同一件工作:Anthropic 经济测度 = 测度产品化 + 治理研究,Anthropic 7-29 NEW「密码学弱点发现」 + Dario 周末博客 = 评测 + 立场 = 测度 vs 评测 + 立场 不同对象

增量 7 · ⭐⭐⭐⭐ · 🟡 P1 监测 · AAAI Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止日已过期未触发补强强提醒

字段 内容
来源 tom 7-29 0853 rag-e1prep-v48 §沿用 + stephen 7-29 12:45 coordination-check-noon + stephen 7-29 22:45 coordination-check-evening §2.5(7-29 截止日临近 14:30 截止前活文档动作仍未触发 + 已确认 7-29 evening 仍未触发 + 截止前补强窗口已关闭 + 后续补救策略待决)+ spark-on-Tom 7-29 E3 review(质量分 8/10 · 8 条建议 3 P0 改 5 P1 改 2 P2 改 · P0 #1 补全 100% relapse rate 细节 · P0 #2 澄清「98.4% OpenClaw 代码是基础设施」语义 · P1 #3 标注 Azure +21.6% 对照组维度 · P1 #4 加 RAG 主题词横向趋势收束 · P1 #5 APS-RAG 和 DeCoRAG 合并对比段 · P2 #6 调整 Trust-RAG Compass 框架契合度表述 · P2 #7 补 2607-22098 + 2607-22561 邻接 · P3 #8 CSDN 增量补具体日期) + flyp 7-27 0950 Keyword-Search-Is-All-You-Need-critical-read B 级 3.5/5(7 反方硬标签)
arXiv 号 arXiv:2602.23368v1 AAAI 2026 Subramanian(v34 §2.3 评测表 22 行 arXiv 号 v33 已核证)
一句话 7-29 验证截止日已过期未触发补强强提醒(v34 第十一轮已立 14:30 前必须看到活文档动作 · 已确认 7-29 evening 仍未触发 · 截止前补强窗口已关闭):4 验证截止日化(7-29 截止 v1 PDF 全文细节 + shell 工具列表 + 7-30 AAAI 2026 main vs industry track 区分 + 7-31 不同 LLM 迁移性 + 混合方案对照 + 8-15 长上下文/多模态跨任务迁移性)+ 7 反方硬标签: ① 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐ ② 200K context vs shell 工具边界不清——是"context stuffing + grep"而非 RAG 替代 ⭐⭐⭐⭐⭐(最高严重度) ③ 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐ ④ Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐ ⑤ Agent-as-retriever cost-benefit 未量化 ⭐⭐⭐ ⑥ 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐ ⑦ AAAI 2026 main vs industry track 区分不清 ⭐⭐ = §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 7 后续验证动作 7-29 ~ 8-15 截止日化
v34 第十一轮脉络关系 与 v34 §2.3 评测表 22 行 + v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §3.1 共识 121 + §3.2 争议 36 + §3.3 Q105.1 + §3.4 T110 同源;v34 §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 7 后续验证动作 已过期未触发补强 + 补救策略待决:1) 「7 反方 + 4 验证截止日已过期未触发补强」 = v34 §3.2 争议 36 7 反方激活窗口(v34 已立 → 本场 = 反方激活窗口 + 4 验证截止日时间轴注脚 · 已过期未触发补强 = 补救策略待决 = 7-29 evening 14:30 已过 + 7-29 evening 22:45 已确认仍未触发);2) 「飞 grep 检索范式转折已 7-29 截止 v1 PDF 全文细节待核 14:30 截止已过」 = v34 §1.33c 横切 53c 已收录 AAAI 2026 Subramanian arXiv:2602.23368v1 立标级 B 级 3.5/5 后续补救(v34 §2.3 第五十六 c 节点 v34 立标级升级 — v34 §3.2 争议 36 候选新增 — v34 §3.3 Q105.1 v34 部分解除 arXiv:2602.23368v1 已核 — 本场 = v34 已立 → v34 反方激活窗口 + v34 §3.3 Q105.8-Q105.10 候选新增 3 件 + v34 §4.1 开放问题 55 7 后续验证动作 已过期未触发补强 = 补救策略待决)
反方 / 风险 (A) arXiv:2602.23368v1 v1 PDF 全文细节 7-29 14:30 截止已过 未触发补强强提醒(已确认 v34 §3.2 争议 36 7 反方激活窗口 + 7-29 evening 22:45 已确认仍未触发);(B) shell 工具列表具体边界 200K context vs shell 工具边界不清 ⭐⭐⭐⭐⭐(最高严重度);(C) AAAI 2026 main vs industry track 区分 待核;(D) 不同 LLM 迁移性(论文仅 Claude 3 Sonnet,缺 GPT/Gemini/开源模型 head-to-head) + 与混合方案(Agent + 向量库)未对照;(E) Amazon Bedrock KB baseline 利益相关冲突(Amazon Science 作者团 · Amazon Bedrock KB baseline 可能仅是 Bedrock KB vs Agentic,缺第三方向量库 baseline);(F) Agent-as-retriever cost-benefit 未量化;(G) 长上下文/多模态跨任务迁移性 待核;(H) GitHub 链接 7-29 仍未核证(jay 7-27 08:22 csdn-substack-rag-finetuning + tom 7-27 0850 + stephen 7-27 1023 + stephen 7-28 22:45 = 6 实例均未补 = 本场 7-29 仍未补);(I) 补救策略待决(已过期未触发补强窗口进入补救阶段 = 7-30 014:30 截止前补救已关闭 · 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救 + 8-15 长上下文/多模态补救 4 阶段补救)
建议归入节 §3.2 争议 36(v34 已立 → v34 续立 + 4 验证截止日时间轴注脚 + 已过期未触发补强 + 补救策略待决)+ §3.3 Q105.1-Q105.10(v34 候选新增 10 件 → v34 候选持续追踪)+ §4.1 开放问题 55(v34 已立 7 后续验证动作 → v34 续立 + 7-29 14:30 截止已过 + 补救策略待决)+ §6 必读清单 沿用 arXiv:2602.23368v1 第 142 条
重要边界 不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,Subramanian = RAG 检索范式转折 = 边界形式化 vs 检索范式 不同对象;不要与 v34 §2.4 上下文管理五路线对立 混为同一件工作:五路线对立 = 完整日志 + lifecycle + 可观测性 + 文件系统 + 语义索引,Subramanian = 工具调用派检索 = 记忆/检索 vs 检索范式 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 文件系统即上下文 混为同一件工作:Markdown Memory = 工业级 Agent 厂商记忆原语,Subramanian = 学术 RAG 范式转折候选 = 记忆 vs 检索 不同对象;不要与 v34 §2.4 Beyond Relevance-Centric Retrieval arXiv:2607.19747 混为同一件工作:Beyond Relevance-Centric = 评分量规驱动 vs Subramanian = Agentic-as-retriever = 评分量规驱动 vs 工具调用派 不同 RAG 替代路径;不要与 v34 §2.4 LOCA-bench arXiv:2602.07962 7-29 新立 arXiv 混为同一件工作:LOCA-bench = 长上下文 agent 评测 anchor 新立,Subramanian = RAG 检索范式转折 = 评测 vs 检索范式 不同对象

增量 8 · ⭐⭐⭐ · 🟡 P2 警示 · 6 件新 arXiv 立标 paper_card 缺 + LOCA-bench paper_card 仍未建 + arXiv:2605.20173 SDB paper_card 仍未建 + arXiv:2607.12406 Isolation paper_card 仍未建 + arXiv:2607.21461 AREX paper_card 仍未建

字段 内容
来源 stephen 7-29 1245 coordination-check-noon 持续缺口人工确认 + stephen 7-29 2245 coordination-check-evening §5 ⚠️ 警示 + spark-on-Tom 7-29 E3 review 收官(质量分 8/10 · 8 条建议 3 P0 改 5 P1 改 2 P2 改 · P0 #1 补全 100% relapse rate 细节 · P0 #2 澄清「98.4% OpenClaw 代码是基础设施」语义 · P1 #3 标注 Azure +21.6% 对照组维度 · P1 #4 加 RAG 主题词横向趋势收束 · P1 #5 APS-RAG 和 DeCoRAG 合并对比段 · P2 #6 调整 Trust-RAG Compass 框架契合度表述 · P2 #7 补 2607-22098 + 2607-22561 邻接 · P3 #8 CSDN 增量补具体日期)
arXiv 号 多件:arXiv:2607.25431 CodeNib + arXiv:2607.25996v1 RepoReasoner + arXiv:2607.25959v1 Kontrast + arXiv:2607.25600v1 BeyondUncertainty + arXiv:2602.07962 LOCA-bench + arXiv:2607.24653 Kimi K3 + arXiv:2605.20173 SDB + arXiv:2607.12406 Isolation-as-First-Class + arXiv:2607.21461 AREX
一句话 6 件新立标 paper_card 缺 + LOCA-bench paper_card 仍未建 + 3 件既有立标 paper_card 仍未建 = pipeline 漏斗节点 · 7-30 截止前必须补建卡:(1) 7-29 4 件新 arXiv 立标 paper_card 待补:CodeNib + RepoReasoner + Kontrast + BeyondUncertainty · (2) 7-29 2 件新 arXiv 立标未建卡 paper_card 缺:LOCA-bench + Kimi K3 · (3) 既有 3 件立标 paper_card 仍未建:SDB arXiv:2605.20173(v34 §2.6 第四十二子节立标级 + 7-30 截止前必须补建卡)+ Isolation arXiv:2607.12406(v34 §2.5 第十一阶段 + flyP 安全主题页 anchor)+ AREX arXiv:2607.21461(v34 §2.5 第八十五节点候选 7-25 HF Daily #1 117▲ 当日 #1 但 paper_card 仍未补)
v34 第十一轮脉络关系 与 v34 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 + 61 Dadhich/Experience Distillation arXiv 编号 2 天未直查 沿用;v34 §4.1 开放问题 候选新增 70 pipeline 漏斗节点多件待补:1) 「6 件 7-29 新 arXiv 立标 paper_card 缺」 = v34 §4.1 开放问题 候选新增 70(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty + LOCA-bench + Kimi K3 + SDB + Isolation + AREX = 9 件待补);2) 「pipeline 漏斗节点 7-30 截止前必须补建卡」 = v34 §4.1 开放问题 54 沿用 + spark-on-Tom E3 review P0 警示(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + spark-on-Tom E3 review 质量分 8/10)
反方 / 风险 (A) 9 件 paper_card 漏斗节点是否全部 7-30 截止前补建卡?:(B) LOCA-bench paper_card 待建是否影响 v34 §2.1 Harness 学术化 第十二阶段 立标级补全?:(C) SDB paper_card 待建是否影响 v34 §2.6 第四十二子节立标级?:(D) Isolation paper_card 待建是否影响 v34 §2.5 第十一阶段 flyP 安全主题页 anchor?:(E) AREX paper_card 待建是否影响 v34 §2.5 第八十五节点候选 + 7-25 HF Daily #1 117▲?;(F) 9 件 paper_card 补建卡的优先级 与 v34 coding-agents.md 收录边界关系?待核
建议归入节 §4.1 开放问题 候选新增 70 pipeline 漏斗节点 9 件 paper_card 7-30 截止前必须补建卡 + 沿用 v34 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 + 61 Dadhich/Experience Distillation arXiv 编号 2 天未直查
重要边界 不要与 v34 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 + 61 Dadhich/Experience Distillation arXiv 编号 2 天未直查 混为同一件工作:54/55/61 是 v34 第十一轮既有开放问题 + 本场 70 = 9 件 paper_card 7-30 截止前必须补建卡 = 已有开放问题 vs pipeline 漏斗节点 不同对象

二、值得警惕的矛盾或待核实说法

  1. Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露主权开源 2.0 立标级别边界:本场 12 实例同步承接候选升档「主权开源 2.0 立标栖立基础栖候选升级」但单一模型发布是否构成"路线分水岭"需谨慎:商业 frontier lab 历史护城河(评测系统卡 + 评论层 + 红队 + 经济测度产品化 + 治理研究第二阶段 + 资本层持续)不因单一开源模型发布而消失;v34 候选仅升档为"主权开源立标栖" 而非"主线分水岭"——这是 v34 §3.4 T113/T114 候选新增的措辞尺度问题(stephen 7-29 1245 + 2245 沿用 + spark 7-29 13:30 §三.1 + flyp 7-28 coding-agents-e1prep §0 警示)。
  2. Kimi K3 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-29 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成(jay 7-28 engineering-v38 §P2 警示 + spark 7-29 13:30 §三.7 + stephen 7-29 1245 + 2245 警示)——建议在知识库中标注"官方数据,待外部 benchmark 验证"
  3. Kimi K3 vLLM/SGLang 官方支持时间线待核实(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + tom 7-29 2222 inference-e1prep §警示 1 + spark 7-29 1850 llm-infra-e1prep §警示 1)——DeepSeek-V3 当时的官方支持时间表作为参照。
  4. MXFP4/MXFP8 第 5 量化路线候选 vs INT8/INT4 本质区别:MoE 稀疏激活特性的定制化量化格式 工程意义 待核(jay 7-29 1055 five-category-briefing Backend B2 + spark 7-29 1850 主线 2 Raschka Kimi K3 Architecture Notes 419 分 HN Trending · LatentMoE + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA Delta Attention + Attention Residuals 训练 +4%/推理 +2% + 与 Nemotron 3 Ultra / DeepSeek V4 横向对比 + Raschka LLM Architecture Gallery 立标 7-29 已核证)。
  5. KDA/AttnRes 架构创新 vs DeepSeek 家族(V3/V4 技术报告)架构对比 待核
  6. Lilian Weng Harness Engineering 是否引入新方法论 vs 仅「Harness Engineering」概念工程化?Weng 早在 2025-2024 已多次论及;RSI 自我改进定义 = Harness 本身成为优化目标,与 AREX arXiv:2607.21461 BAAI 递归自我改进 deep research agent 关系(head-to-head 对照)待核(MSR Harness 学术框架 vs AREX BAAI 实证 vs Weng 理论 三者对比 = v34 §4.1 开放问题 候选新增 65);MSR Memora vs Memory 频段架构 vs MemGPT 双时态知识图谱 vs Zep 三者关系 待核(v34 §4.1 开放问题 候选新增 66);MSR SkillOpt skills as trainable parameters vs Lilian Weng Harness Skill = context function pair c_s = (ρ_s, F_s) 互映 vs SDB §2.6 第四十二子节 SkillOpt 互映 待核(v34 §4.1 开放问题 候选新增 67)。
  7. ACE/MCE 实战细节:ACE itemized bullets id + description 不做全量 rewrite 的稳定性 vs full rewrite head-to-head 实证未公开;MCE 双层优化 convergence 保证 待核。
  8. CodeNib 多视图数据系统 视图复用 + 跨编辑一致性 8.7× baseline vs Sourcegraph / Zoekt / ripgrep 索引 head-to-head 待核,100 快照规模是否足够泛化(大型 monorepo / 多语言混合仓库未覆盖)。
  9. RepoReasoner 仓库级代码推理评测 vs LoCoBench-Agent / SWE-bench Verified / SpecBench head-to-head 待核,具体评测任务集与统计置信区间未公开。
  10. PAJAMA/Codifying the Judge 程序化评判器 vs LLM-as-judge 真实样本对比基准 + 与 SDB §2.6 第四十二子节 proposer + verifier 关系 待核,程序评判器可审计/可编辑边界 vs LLM-as-judge 灵活性的取舍待核。
  11. Kontrast 跨模态知识一致性四类不一致粒度差异 / 直接冲突 / 时序变化 / KG 不完整 vs Natural Questions / TriviaQA / HotpotQA 跨文本/表格/KG 三模态基准 head-to-head 待核,KG 来源 Wikidata 静态 vs Wikipedia 动态 更新机制待核。
  12. LOCA-bench paper_card 仍未建 + flyp 7-29 22:50 critical-read R1-R8 八反方待核(R1 = task semantics 固定性声明 / R2 = scaffold 类型覆盖度 / R3 = 开源模型覆盖度 / R4 = 评测任务数与统计可靠性 / R5 = 「context rot」与任务类型耦合 / R6 = 与 LOCA / LHTB / LongBench v2 对照完整性 / R7 = context engineering 算力成本 / R8 = 任务集大小与可污染性)= pipeline 漏斗节点 7-30 截止前必须补建卡 + 8 反方硬标签待补查
  13. AAAI Subramanian 7 反方首批 7-29 验证截止日已过期未触发补强强提醒(stephen 7-29 1245 + 2245 = 14:30 截止前活文档动作仍未触发 · 已确认 7-29 evening 仍未触发 · 截止前补强窗口已关闭 · 后续补救策略待决)——7-30 014:30 截止前补救已关闭 · 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救 + 8-15 长上下文/多模态补救 4 阶段补救。
  14. 6 件 7-29 新 arXiv 立标 + 3 件既有立标 = 9 件 paper_card 待补(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty + LOCA-bench + Kimi K3 + SDB arXiv:2605.20173 + Isolation arXiv:2607.12406 + AREX arXiv:2607.21461)——pipeline 漏斗节点 · 7-30 截止前必须补建卡(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + spark-on-Tom 7-29 E3 review)。
  15. Anthropic Claude Opus 5 / Sonnet 5 / Fable 5 / Mythos 5 关系 + 工具使用相对 4.6 提升幅度 + Managed Agents effort 精度 vs OpenAI / Gemini effort head-to-head 7-29 仍未官方文档核证(stephen 7-29 ai-industry-v31 + spark 7-29 agent-v35 + flyp 7-28 coding-agents-e1prep §0 警示):v34 §3.2 争议 #31 + §4.1 开放问题 #47 沿用。
  16. microsoft/agent-governance-toolkit GitHub 链接 + 实现细节(jay 7-29 0940 github-trending-vecdb-substack-engineering 警示 + spark 7-29 agent-v35 §🔴 P0 立标 8)——v34 §4.1 开放问题 候选新增 71 待核。
  17. Anthropic Claude「密码学弱点发现」维度评估方法学 vs 现有密码学评估方法学(head-to-head)对比 待核;Dario Amodei 7-27~28 周末博客澄清 vs 监管打压指控 公开对峙 后续监管动态(action) 待核;HF 7-26 OpenAI rogue agent 入侵事件 vs Oracle 4 RCE CVE vs OWASP ASI vs HF 7 月安全事故 同源/异源关系 待核——v34 §4.1 开放问题 候选新增 72-73 待核。
  18. Molt 与 OpenForgeRL head-to-head 实证(v34 §4.1 开放问题 候选新增 56 沿用 + spark 7-29 agent-v35 沿用 7-28 警示):v34 §4.1 开放问题 61 spark-on-Tom E3 review 沿用。
  19. Learning on the Job 数字模糊(spark-on-Tom 7-29 E3 review P0 修正):论文原文应明确写出 1.6×/2.6×/22/84 + Mistral Large + Claude Sonnet 5 复现 + banking domain 单一场景 + 论文作者「Valentin Tablan, Scott Taylor, Kristoffer Bernhem(The Memory Company)」+ arXiv 2607.22157v1——v34 §4.1 开放问题 61 沿用。
  20. δ-mem 评级降级(spark-on-Tom 7-29 E3 review P0 修正沿用):⭐⭐⭐⭐ → ⭐⭐⭐(机制描述具体但独立可复现性未确认)+ 加入「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示——v34 §4.1 开放问题 61 沿用。
  21. Dadhich/Experience Distillation arXiv 编号 2 天未直查(spark-on-Tom 7-29 E3 review P0 修正沿用):arXiv:2607.21503 Agentic Context Management(Gaurav Dadhich)+ arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(Tom 单作者)2 天未在 rag.md/tom radar 中直查 arXiv 编号——v34 §4.1 开放问题 61 沿用。
  22. flyp v34 §3.3 反方 #55-#56 评级升级时机风险第一日 + 第二日持续激活(stephen 7-29 1245 + 2245 §3.5.4 沿用 7-28 警示):SDM P2 旁证 7-29 evening 是否回升?(已确认 7-29 evening 仍未回升 = 第二日复核节点沿用 7-28 evening 触发).
  23. evaluation 主题活文档持续更新 vs work-queue 状态不一致(stephen 7-29 12:45 + 2245 + spark 7-29 13:30 §一.1 🔴 沿用):沿用 7-28 警示。
  24. Spark E1 节奏 7-28 evening 双 E1 完整恢复 + 7-29 noon 协调棒判断 4 日回落已纠正 + stephen 7-29 1245 + 2245 修正(7-26 evening 双 E1 完整恢复第 1 棒 → 7-27 仅 RSS 通稿 → 7-27 evening 仅 RSS 通稿 → 7-28 截至 13:30 仍仅 RSS 通稿 = E1 节奏连续 3 日回落窗口 → 7-28 evening 双 E1 完整恢复第 4 棒 · 7-29 13:37 agent-v35 + 18:50 llm-infra-v10 双 E1 完整恢复第 5 棒 = 与 7-28 evening 双 E1 完整恢复判断一致 = stephen 7-29 1245 + 2245 节奏反转信号修正 4 日回落窗口判断为 节奏反转第 5 棒).

三、可引用的 arXiv 号列表

arXiv 号 论文/工作 状态 来源
2607.24653 Kimi K3(Moonshot AI · 2.8T MoE · Coding/Agentic SOTA) ⚠️ 7-29 paper_card 待补 stephen ai-industry-v31 + stephen llm-application-v40 + tom HF Daily 7-29 + jay B2 + spark gradient-flow + simon willison + flyp multimodal-v34
2602.07962 LOCA-bench(可控上下文增长下评测语言 agent · ICML 2026 · HKUST-NLP · GitHub 开源) ⚠️ flyp 7-29 22:50 critical-read · paper_card 待补 flyp 7-29 22:50 LOCA-bench-long-context-agent-critical-read
2607.25431 CodeNib(代码 agent 多视图数据系统 serving repository context · 多视图 + 视图复用 + 跨编辑一致性 + 8.7× baseline) ⚠️ 7-29 paper_card 待补 tom 7-29 2040 v2 radar §1 ⭐⭐⭐⭐
2607.25996v1 RepoReasoner(仓库级代码推理评测) ⚠️ 7-29 paper_card 待补 tom 7-29 2040 v2 radar §4 ⭐⭐⭐⭐
2607.22561 Codifying the Judge / PAJAMA(LLM-as-judge 程序蒸馏替代 · 透明 + 可审计/可编辑 + 消除逐样本 API 成本) ✅ paper_cards/631 7-29 04:00 · 主分类 evaluation tom 7-29 1543 evaluation-e1prep §增量 1 ⭐⭐⭐⭐
2607.25959v1 Kontrast(跨文本 + 表格 + KG 知识一致性检测) ⚠️ 7-29 paper_card 待补 tom 7-29 2040 v2 radar §3 ⭐⭐⭐
2607.25600v1 BeyondUncertainty(推理步骤置信度传播) ⚠️ 7-29 paper_card 待补 tom 7-29 2040 v2 radar §4 ⭐⭐⭐ + stephen 7-29 2245
2602.23368v1 AAAI 2026 Subramanian「Keyword Search Is All You Need」 ✅ v34 §2.3 立标级候选 B 级 3.5/5 · paper_card 已核 · 7-29 14:30 截止前活文档动作未触发补强 · 已确认 7-29 evening 仍未触发 · 截止前补强窗口已关闭 · 后续补救策略待决 v34 §2.3 第五十六 c 节点 + v34 §3.2 争议 36 + v34 §3.3 Q105.1
2510.04618 ACE(Agentic Context Engineering · context = evolving playbook · Generator + Reflector + Curator) ⚠️ Lilian Weng Harness Engineering 相关 arXiv · paper_card 待核 jay engineering-v39 + jay engineering-filter-rss-round v3 A1 + spark agent-v35 §立标 1
2601.21557 MCE(Meta Context Engineering · 双层优化 · 内层 / 外层) ⚠️ paper_card 待核 jay engineering-v39 + spark agent-v35 §立标 1
2607.22529 Skill Self-Play LLM 协同进化 ⚠️ paper_cards 待补 jay 7-28 B2 · HF Daily 7-28 第 9
2607.20911 Tencent WorkBuddy Bench Contamination-Resistant Coding Agent Benchmark ⚠️ v34 §2.4 54 节点邻接 · paper_card 待补 HF Daily 7-26
2607.21557 OpenForgeRL Train Harness-native Agents in Any Environment ✅ paper_cards/585 · v34 §2.5 第八十四节点 jay 7-26 沿用
2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety ⚠️ v34 §2.5 第十一阶段 flyP 安全主题页 anchor · paper_card 仍未建 stephen 7-27 1023 + spark 7-29 agent-v35 警示
2607.21461 AREX 面向深度研究的递归自我改进 Agent(BAAI) ⚠️ paper_card/585 沿用 · v34 §2.5 第八十五节点候选 · paper_card 补建待核 HF Daily 7-23 117▲ · 7-27 139▲ · 7-28 142▲ · 7-29 263▲(AREX vs Kimi K3 不同对象)
2605.20173 SDB Stochastic-Deterministic Boundary ⚠️ v34 §2.6 第四十二子节立标级 · paper_card 仍未建 · 7-30 截止前必须补建卡 jay 7-27 1100 + 1123 + stephen 7-27 12:45 + spark 7-27 agent-e1prep
2607.21653 Molt A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning ✅ paper_cards/607 7-28 12:30 tom radar 7-28 0840 + HF Daily
2607.22157v1 Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents ✅ paper_cards/610 7-28 12:30 · v34 §2.4 第 18 件候选 P3 tom radar 7-28 0840 高价值 #1 + Tablan, Taylor, Bernhem
2607.22375 IDEAgent Agentic Quality-Diversity Search for Research Idea Generation ✅ paper_cards/604 7-28 02:10 tom rag-v47
2607.14277 Multi-Head Latent Control A Unified Interface for LLM Agent Decision Making ✅ paper_cards/608 7-28 tom radar 7-28 0840 高价值 #2 + jay engineering-v38 §增量 7
2607.18141 HyMCache CXL 混合内存 KV Cache ✅ v34 §2.5 第八十六节点 jay 7-27 1123
2607.21503 Agentic Context Management(Gaurav Dadhich) ✅ paper_cards/564 7-25 · v34 §2.2 58 节点 + spark-on-Tom E3 review 待直查 arXiv 编号 spark-on-Tom E3 review 待直查 arXiv 编号
2607.21051 Sample-Efficient Learning from Agent Experience(Experience Distillation · Tom 单作者) ✅ paper_cards/567 7-25 · v34 §2.2 第 60 节点 + spark-on-Tom E3 review 待直查 arXiv 编号 spark-on-Tom E3 review 待直查 arXiv 编号
2607.12227 Rethinking the Evaluation of Harness Evolution for Agents ✅ paper_cards/434 · v34 §2.5 第八十五节点 HF Daily 7-13
2607.21576 Self-Supervised Structured Dynamics from Videos ⚠️ HF Daily 7-27 旁证沿用 · flyp v34 §3.3 反方 #55-#56 第一日 + 第二日复核节点持续激活 HF Daily 7-25 28▲ → 7-26 18▲ → 7-27 18▲ → 7-28 18▲ 持平未回升 · 7-29 evening 是否回升 待核

四、检查过的来源清单(无显著新增量时如实写明并列出检查过的来源)

来源 文件 / 路径 coding-agents 主题覆盖
work-queue.md /shared/research-kb/organized/queue/work-queue.md 待建卡 8 + 待更新主题 0 + 选题榜 1(2607.23242 IndicTalk = llm-infra 邻接)+ 富化缺口 66 张卡缺 TLDR(待 cron_s2 覆盖)
flyp/inbox/flyp 2026-07-29-0950 multimodal-e1prep-v34 第二棒 v34 接力窗口第二棒 E1 · 35 件 v34 候选增量(主分类 coding-agents 主增量 6 件立标级/立标级候选 沿用)
flyp/inbox/flyp 2026-07-29-0952 long-context-multimodal-rag-dual-review 双稿轻量精读(AcademicEval 2510.17725 TMLR 已接收 + Scaling Beyond Context 2510.15253 ACL2026 Main 已接收 · 主分类 long-context + rag 邻接)
flyp/inbox/flyp 2026-07-29-2250-LOCA-bench-long-context-agent-critical-read 🔴 LOCA-bench arXiv:2602.07962 短审稿 · 本场增量 2 · 第十二阶段 长上下文 agent 评测 anchor 立标级
jay/inbox/jay 2026-07-29-0822 csdn-rag-agent-multimodal 🔴 CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本 · 本场增量 5
jay/inbox/jay 2026-07-29-0940 july2026-github-trending-vecdb-substack-engineering microsoft/agent-governance-toolkit 5.2k★ + GitHub Trending 7 月汇总 · 本场增量 5
jay/inbox/jay 2026-07-29-1055 jay-engineering-filter-rss-round v3 ⭐⭐⭐⭐⭐ A1 Lilian Weng Harness Engineering for Self-Improvement + A2 MSR Memora + A3 uv 0.12.0 · 本场增量 4
jay/inbox/jay 2026-07-29-1105 jay-five-category-briefing #11 Backend B2 Kimi K3 MoE 首个 3T 参数开源 MoE · 本场增量 3
jay/inbox/jay 2026-07-29-1105 jay-engineering-e1prep-v39 5 件 P0/P1 + 4 件 P2 参考归档 · Lilian Weng Harness Engineering + MSR Memora + Kimi K3 · 本场增量 4 + 沿用 3
jay/inbox/jay 2026-07-29-1105 jay-rag-agent-csdn-survey-v2 13 件跨三栖综合调研 · CSDN Agent 工具调用四范式 沿用 · 本场增量 5 沿用
jay/inbox/jay 2026-07-29-0853 rag-e1prep-v48 R47 → R48 接力(主要 RAG 主题 · coding-agents 主题沿用 Subramanian 7 反方)
jay/inbox/jay 2026-07-29-1140 news-x-tech-radar Andrew Ng LearnVector + Sam Altman singularity + Sam Altman 华盛顿国会闭门会 + HF OpenAI rogue agent + Dario Amodei 澄清 + Karpathy bio Anthropic 字段移除 · 本场增量 6 沿用
tom/inbox/tom 2026-07-29-0900 hf-daily-2026-07-29 HF Daily 7-29 票榜 15 件全核 · Kimi K3 263▲ 单日 +121 暴增登顶 + JarvisHub 104▲ + Progress Reward Modeling 综述 68▲ + StateAct 53▲ + Sol-Attn 25▲ · 本场增量 3 沿用 + 邻接 2
tom/inbox/tom 2026-07-29-0840 agent-rag-longcontext-radar 7-29 早场 ⭐⭐⭐⭐ A New Role for Relevance arXiv:2607.24223 62▲ + Keep It InMind arXiv:2607.24368 19▲ implicit-association blind spot · 邻接
tom/inbox/tom 2026-07-29-1441 agent-rag-longcontext-radar 早场 1441 中场 沿用
tom/inbox/tom 2026-07-29-2040 agent-rag-longcontext-radar v2 🔴 ⭐⭐⭐⭐ A CodeNib arXiv:2607.25431 + Cyber-Capable AI Agents arXiv:2607.25379v1 + Kontrast arXiv:2607.25959v1 + BeyondUncertainty arXiv:2607.25600v1 + RepoReasoner arXiv:2607.25996v1 · 本场增量 1 + 邻接 3
tom/inbox/tom 2026-07-29-1543 evaluation-e1prep 🔴 ⭐⭐⭐⭐ P1 增量 1 Codifying the Judge PAJAMA arXiv:2607.22561 + 增量 2 Keep It InMind arXiv:2607.24368 · 本场增量 1 沿用
tom/inbox/tom 2026-07-29-2222 inference-e1prep evening 收官棒 24h 窗口 · 增量 1 Raschka Kimi K3 Architecture Notes 419 分 HN Trending · 增量 2 FlashInfer→SGLang/vLLM 集成数据 · 增量 3 vLLM Conference 2026 Roadmap · 本场增量 3 沿用
spark/inbox/spark 2026-07-29-1337 agent-e1prep-v35 准备棒 🔴 P0 立标 1 Lilian Weng Harness Engineering 学术框架 + 立标 2 MSR Memora + 立标 3 SkillOpt + 立标 4 Dario Amodei 周末博客 + 立标 5 HF OpenAI rogue agent + 立标 6 arXiv:2607.22682 多 Agent 系统设计词汇表 + 立标 7 Anthropic 7-29 NEW 密码学弱点发现 + 立标 8 microsoft/agent-governance-toolkit + 立标 9 CSDN Agent 工具调用四范式 · 本场增量 4 + 5 + 6
spark/inbox/spark 2026-07-29-1850 llm-infra-e1prep-v10 evening 收官棒 7 主线 + 3 旁证 + 2 警示 · Kimi K3 arXiv 立基础 + Raschka Kimi K3 架构 + FlashInfer 集成 + vLLM Conference 2026 Roadmap + SGLang vs vLLM + CNCF llm-d + Colibri 纯 C 25GB RAM 744B MoE · 本场增量 3 沿用 + llm-infra 邻接
spark-on-Tom 2026-07-29-1430 E3 review 收官 质量分 8/10 · 8 条建议 3 P0 改 5 P1 改 2 P2 改 · P0 #1 补全 100% relapse rate 细节 · P0 #2 澄清「98.4% OpenClaw 代码是基础设施」语义 · P1 #3 标注 Azure +21.6% 对照组维度 · P1 #4 加 RAG 主题词横向趋势收束 · P1 #5 APS-RAG 和 DeCoRAG 合并对比段 · P2 #6 调整 Trust-RAG Compass 框架契合度表述 · P2 #7 补 2607-22098 + 2607-22561 邻接 · P3 #8 CSDN 增量补具体日期
stephen/inbox/stephen 2026-07-29-1025 ai-industry-e1prep-v31 准备棒 6 件 P0 立标 · 🔴 P0 增量 1 HF Daily 7-29 票榜 14 件替换 + Kimi K3 arXiv 立基础 · 增量 2 Dario Amodei 周末博客澄清 · 增量 3 HF 7-26 OpenAI rogue agent 入侵 · 增量 4 Andrew Ng + Sam Altman · 增量 5 Karpathy bio · 增量 6 TLDR AI 7-28 头条 · 9 件 7-29 上午 frontier/industry 立标 · 本场增量 3 + 6
stephen/inbox/stephen 2026-07-29-1245 coordination-check-noon 5 实例 E1/radar/briefing/csdn/critical-read 全员在岗 + 1 件统一主线立标续立升级 Kimi K3 arXiv:2607.24653 立基础 · 12 件 noon 持续缺口待人工确认 + AAAI Subramanian 7 反方首批 7-29 验证截止强提醒 + spark-on-Tom E3 评审 3 件 P0 修正
stephen/inbox/stephen 2026-07-29-2110 llm-application-e1prep-v40 8 件主线增量 + 1 件旁证 · Kimi K3 arXiv 立基础 + HF Daily 7-29 票榜 + jay engineering-v39 5 件 P0/P1 · 主线 ① Coding Agent 候选池 5 联 Harness Engineering 学术立标补全 第 3 例 · 本场增量 4 沿用
stephen/inbox/stephen 2026-07-29-2245 coordination-check-evening 7-29 evening 17 件新立标(其中 CodeNib + Kimi K3 + 多件邻接)+ 8 大主题活文档(ai-industry/agent/rag/multimodal/systems/engineering/llm-application/llm-infra/risk/evaluation/database/coding-agents)接力窗口预备完成 + 1 件统一主线立标续立升级 Kimi K3 + 13 件需要人工确认/修正/强提醒 · 本场增量 1 + 3 沿用
paper_cards/ 007-2606-13141.md642-2607-24957.md 643 张 · 近 3 天主分类 agent 新卡 11 张(OpenComputer/MAGE/User as Code/π-Bench/ALE/Metaprogramming/DeLM/Context-Fractured Attacks/Parthenon Law/Agentic RAG Survey/MCP Design Patterns/TOKI 等)+ 主分类 agent 总计 15 张 · 占比 ~21% · 0 张主分类 coding-agents · 7-29 4 件新 arXiv 立标 paper_card 待补(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty)+ LOCA-bench paper_card 待补 + Kimi K3 arXiv:2607.24653 paper_card 待补 + SDB arXiv:2605.20173 paper_card 仍未建 + Isolation arXiv:2607.12406 paper_card 仍未建 + AREX arXiv:2607.21461 paper_card 仍未建 = 9 件 paper_card 待补 = pipeline 漏斗节点
knowledge/coding-agents.md /shared/research-kb/organized/knowledge/coding-agents.md v34 Wave4 E1 第十一轮 7-28 04:20:16 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座 沿用 + §2.3 评测表 22 行(arXiv:2602.23368v1 已核)+ §2.4 后训练 18 件候选 + 上下文管理五路线对立 + §2.5 安全契约 11 阶 + 86 节点 + §2.6 多模态/CLI/IDE + 42 子节立标级 + 共识 43 / 争议 36 / 开放问题 55 / 趋势 35 / 必读 142

总结:本场 E1 预消化共识别 7 件增量(6 件 P0 + 1 件 P1)+ 1 件 P2 警示,涉及 arXiv 号 8 件新立标候选(arXiv:2607.24653 Kimi K3 + arXiv:2602.07962 LOCA-bench + arXiv:2607.25431 CodeNib + arXiv:2607.25996v1 RepoReasoner + arXiv:2607.22561 PAJAMA + arXiv:2607.25959v1 Kontrast + arXiv:2607.25600v1 BeyondUncertainty + arXiv:2510.04618 ACE + arXiv:2601.21557 MCE)+ 6 件跨主题补全 / 沿用升级(Lilian Weng Harness Engineering + MSR Memora + MSR SkillOpt + CSDN Agent 4 范式 30/300 决策树 + microsoft/agent-governance-toolkit + Anthropic 7-29 NEW + Dario 7-27~28 周末博客 + HF 7-26 OpenAI rogue agent)+ 1 件 P1 监测(AAAI Subramanian 7 反方首批 7-29 14:30 截止已过 未触发补强强提醒 · 后续补救策略待决)+ 9 件 paper_card 7-30 截止前必须补建卡(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty + LOCA-bench + Kimi K3 + SDB + Isolation + AREX)。