coding-agents · E1 预消化简报(2026-07-29)
作者:flyP(🀄) 触发:cron
7a0c0a42-eb2e-4bcd-af74-634628039865· 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档/shared/research-kb/organized/knowledge/coding-agents.md当前已固化到 v34 Wave4 E1 第十一轮 7-28 04:20:16 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座 沿用 + §2.3 评测表 22 行(arXiv:2602.23368v1 已核)+ §2.4 后训练 18 件候选 + 上下文管理五路线对立 + §2.5 安全契约 11 阶 + 86 节点 + §2.6 多模态/CLI/IDE + 42 子节立标级 + 共识 43 / 争议 36 / 开放问题 55 / 趋势 35 / 必读 142) 窗口:近 2 天(2026-07-27 ~ 2026-07-29)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 7-26 ~ 7-29 新卡(604-642)+ HF Daily 7-27 ~ 7-29;重点增量区间:v34 第十一轮 7-28 04:20 → 今晚 7-29 23:20 共 43 小时内边际增量 基线对照:昨晚 7-28 E1 预消化立标 = 7 件(4 件 P0/P1 arXiv 立标候选:Molt + Learning on the Job + IDEAgent + Multi-Head Latent Control + Kimi K3 主权开源 2.0 沿用升级 + CSDN/OWASP 跨主题补全 + Anthropic 评论层长尾沿用 + Subramanian 7 反方 7-29 验证截止日强提醒 + 3 件 P2 警示 + 1 件 P2 反方监测)= 全部已并入 v34 第十一轮;本场定位 = 「v34 第十一轮 16 阈值 + SDB 立标级 + 范式五路线对立 + Learning on the Job + 评论层长尾 + 第八十六节点饱和状态下,承接 7-28 04:20 ~ 7-29 23:20 共 43 小时内边际增量。7-29 evening 是 4 实例 E1 evening 收官棒 + E3 review 收官棒的高密度日。增量以『饱和沿用 + CodeNib + RepoReasoner + PAJAMA 立标补全 + Kimi K3 arXiv 编号正式披露 + LOCA-bench 长上下文 agent 评测 anchor + HF Daily 7-29 票榜 15 件全核 + Anthropic 7-29 NEW『使用 Claude 发现密码学弱点』+ HF 7-26 OpenAI rogue agent 入侵 17,600 次黑客动作 + Subramanian 7 反方首批 7-29 已过期未触发补强』形态呈现。新增 arXiv 立标 5 件 P0/P1(其中 4 件在 coding-agents 主分类内 + 1 件长上下文 agent 评测 anchor)+ P0 沿用升级 2 件(Kimi K3 arXiv 立基础 + Lilian Weng Harness Engineering 学术框架)+ P0 跨主题补全 2 件(CSDN 工具调用四范式 30/300 决策树 v34 实战层细化 + MSR Memora/SkillOpt 工程实现层双 P0)+ P0 行业立标 1 件(Anthropic 7-29 + Dario Amodei 周末博客澄清)+ P1 监测 1 件(AAAI Subramanian 7 反方首批 7-29 已过期未触发)+ 1 件 P2 警示(LOCA-bench paper_card 仍未补 + 6 件新 arXiv 立标 paper_card 缺)」。所有观点均有出处可循,不编造。
0. 综述判断(给今晚活文档接手时一眼看到)
- v34 第十一轮 7-28 04:20 已固化 16 阈值 + SDB 立标级 + 范式五路线对立 + Learning on the Job + 评论层长尾持续 6 天 + 第八十六节点 HyMCache llm-infra 邻接 = 饱和形态;7-28 E1 7 件新立标已被完整吸收。
-
本场定位:v34 第十一轮饱和状态下,边际增量以"饱和沿用 + CodeNib + RepoReasoner + PAJAMA 立标补全 + Kimi K3 arXiv 编号正式披露 + LOCA-bench 长上下文 agent 评测 anchor"形态呈现:
- 🔴 P0 增量 1 · 4 件 coding-agents 主分类新 arXiv 立标候选新立(CodeNib + RepoReasoner + PAJAMA/Codifying the Judge + Kontrast 跨模态知识一致性 · 主分类 coding-agents + 邻接 evaluation/rag + 部分 paper_cards 7-29 04:00 batch 已建卡 631 PAJAMA)。
- 🔴 P0 增量 2 · 1 件长上下文 agent 评测 anchor 新立(LOCA-bench arXiv:2602.07962 ICML 2026 录用 + 可控上下文增长 + 任务语义固定 + 模型 + scaffold 组合评测 · flyp 7-29 22:50 critical-read 轻量精读 short review paper_card 未建)。
- 🔴 P0 增量 3 · Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露(7-28 142▲ → 7-29 263▲ 单日 +121 暴增 85% · 12 实例同步承接升级主权开源 2.0 立标级)。
- 🔴 P0 增量 4 · Lilian Weng Harness Engineering for Self-Improvement 学术框架沿用升级 + MSR Memora/SkillOpt 工程实现层双立标(jay engineering-v39 P0/P1 + spark agent-v35 P0 立标 = Harness = AI 的操作系统)。
- 🔴 P0 增量 5 · CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本(jay 7-29 0822 csdn-rag-agent-multimodal + 1105 jay-rag-agent-csdn-survey-v2 立标级 = 决策树量化工程选型)。
- 🟡 P0 增量 6 · Anthropic 7-29 NEW『使用 Claude 发现密码学弱点』+ Dario Amodei 7-27~28 周末博客澄清『从未、也不会主张全面禁止开源权重模型』+ HF 7-26 公布 OpenAI rogue agent 入侵 17,600 次黑客动作(stephen ai-industry-v31 P0 + stephen llm-application-v40 P1 = frontier lab × AI 平台层安全协作第 3 例)。
- 🟡 P1 增量 7 · AAAI Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止日已过期未触发补强强提醒(stephen 7-29 1245 noon + stephen 7-29 2245 evening + spark-on-Tom 7-29 E3 review = 14:30 截止前活文档动作仍未触发 · 已过期未补强 · 截止前补强窗口已关闭 · 进入补救策略阶段)。
-
本场净新增量性质(7-28 04:20 → 7-29 23:20 共 43h):
- 🔴 P0 增量 1 · 4 件 coding-agents 主分类新 arXiv 立标候选新立(CodeNib + RepoReasoner + PAJAMA + Kontrast 跨模态知识一致性 · paper_cards 631 已建 + 其他 3 件 paper_card 待补 = §2.4 上下文管理 61 节点候选新增 + §2.3 评测表 23 行候选新增 + §2.6 第四十三子节候选新增)。
- 🔴 P0 增量 2 · 1 件长上下文 agent 评测 anchor 新立 · LOCA-bench arXiv:2602.07962(flyp 7-29 22:50 critical-read 轻量精读短审稿 · paper_card 仍未建 · ICML 2026 录用 + HKUST-NLP + GitHub 开源 · 三向交叉评测 = §2.3 评测表 23 行候选新增 + §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor)。
- 🔴 P0 增量 3 · Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露(stephen ai-industry-v31 P0 + stephen llm-application-v40 P1 + tom HF Daily 7-29 票榜 + jay B2 沿用 + spark gradient-flow 沿用 = 12 实例同步承接升级主权开源 2.0 立标级 · §2.2 模型与基座 Kimi K3 沿用升级 + §1.45 frontier lab 立标 第 8 栖候选 立基础栖候选升级)。
- 🔴 P0 增量 4 · Lilian Weng Harness Engineering 学术框架 + MSR Memora + SkillOpt 工程实现层(jay engineering-v39 P0 + spark agent-v35 P0 = §1.33c 横切 53c 学术 Harness 维度补全 + §1.43 横切 80 第 12 件候选新增 + §2.5 87-89 节点候选新增)。
- 🔴 P0 增量 5 · CSDN Agent 工具调用四范式 30/300 决策树 v34 实战层细化版本(jay 7-29 0822 csdn + 1105 jay-rag-agent-csdn-survey P0 = §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 + §3.4 T109 候选新增)。
- 🔴 P0 增量 6 · Anthropic 7-29 NEW『使用 Claude 发现密码学弱点』+ Dario 周末博客澄清 + HF 7-26 OpenAI rogue agent 入侵 17,600 次黑客动作(stephen ai-industry-v31 P0 = §2.5 安全契约 frontier lab × AI 平台层 安全协作第 3 例 + §1.45 frontier lab 立标 §6 行业升级 6 件合并)。
- 🟡 P1 增量 7 · AAAI Subramanian 7 反方首批 7-29 验证截止日已过期未触发补强强提醒(tom 7-29 + spark-on-Tom 7-29 + stephen 7-29 1245 + 2245 = 14:30 截止已过 · 活文档动作未触发 · 已确认 7-29 evening 仍未触发 · 后续补救策略待决)。
- 🟡 P2 警示 · 6 件新 arXiv 立标 paper_card 缺 + LOCA-bench paper_card 仍未建 + arXiv:2605.20173 SDB paper_card 仍未建(stephen 7-29 1245 + 2245 + spark-on-Tom 7-29 E3 review 质量分 8/10 = pipeline 漏斗节点待补救)。
1. 增量条目(6 件 P0 + 1 件 P1 + 1 件 P2 警示,按"建议归入节"分组)
增量 1 · ⭐⭐⭐⭐ · 🔴 P0 · 4 件 coding-agents 主分类新 arXiv 立标候选新立(CodeNib + RepoReasoner + PAJAMA + Kontrast 跨模态知识一致性)= 「上下文层 + 评测层 + 评判器 + 知识源质量评估」四联立标补全
| 字段 | 内容 |
|---|---|
| 来源 | CodeNib arXiv:2607.25431:tom 7-29 2040 v2 radar §1 ⭐⭐⭐⭐(HF Daily · 多视图数据系统 serving repository context · 视图复用 + 跨编辑一致性 + 8.7× baseline + 100 仓库快照质量-成本前沿)+ stephen 7-29 2245 coordination-check-evening §2.7 evening 17 件新立标(7-29 CodeNib arXiv:2607.25431 多视图代码上下文)+ jay 7-29 0940 github-trending-vecdb-substack-engineering 7 月汇总 + spark agent-v35 沿用 + tom 7-29 1543 evaluation-e1prep §沿用;RepoReasoner arXiv:2607.25996v1:tom 7-29 2040 v2 radar §4 ⭐⭐⭐⭐(HF Daily 7-28 · 仓库级代码推理评测)+ stephen 7-29 2245 沿用 + jay engineering-v39 沿用;PAJAMA/Codifying the Judge arXiv:2607.22561:tom 7-29 1543 evaluation-e1prep §增量 1 ⭐⭐⭐⭐(LLM-as-judge 的程序蒸馏可扩展替代 + 程序化评判器:透明 + 可审计/可编辑 + 消除逐样本 API 成本)· paper_cards/631 已建卡 7-29 04:00 主分类 evaluation 形态 method;Kontrast arXiv:2607.25959v1:tom 7-29 2040 v2 radar §3 ⭐⭐⭐(arXiv 7-28 · 跨文本 + 表格 + 知识图谱知识一致性检测 · 四类不一致 = 粒度差异 / 直接冲突 / 时序变化 / KG 不完整)+ stephen 7-29 2245 沿用 |
| arXiv 号 | arXiv:2607.25431 CodeNib(7-29 paper_card 待补)+ arXiv:2607.25996v1 RepoReasoner(7-29 paper_card 待补)+ arXiv:2607.22561 PAJAMA/Codifying the Judge(paper_cards/631 7-29 04:00 已建卡 · 主分类 evaluation 形态 method)+ arXiv:2607.25959v1 Kontrast(7-29 paper_card 待补) |
| 一句话 | 4 件 coding-agents 主分类新 arXiv 立标候选新立: ① CodeNib arXiv:2607.25431(代码 agent 专用 Memory Layer · 多视图数据系统 serving repository context · 视图复用 + 跨编辑一致性 + 8.7× baseline + 100 仓库快照质量-成本前沿曲线);② RepoReasoner arXiv:2607.25996v1(仓库级代码推理评测 · 7-29 新立);③ PAJAMA/Codifying the Judge arXiv:2607.22561(LLM-as-judge 的程序蒸馏替代 · 程序化评判器 = 透明 + 可审计/可编辑 + 消除逐样本 API 成本 · 与 Lilian Weng Harness Engineering 直接互补 · 与 v34 §2.3 LLM-as-judge 邻接 = 评测第 7 阶邻接补全);④ Kontrast arXiv:2607.25959v1(跨文本 + 表格 + 知识图谱知识一致性检测 · 四类不一致 = 粒度差异 / 直接冲突 / 时序变化 / KG 不完整) = 「上下文层 + 评测层 + 评判器 + 知识源质量评估」四联立标补全 |
| v34 第十一轮脉络关系 | 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.43 横切 80 Why Agents Fail 11 件套 + v34 §2.1 综述立标 14+24 + v34 §2.3 评测表 22 行 arXiv:2602.23368v1 已核 + v34 §2.4 后训练 Agentic RL 训练栈 18 件候选 + v34 §2.5 安全 86 节点 + v34 §2.6 第四十一/四十二子节立标级 + v34 §3.2 争议 36 + v34 §4.1 开放问题 55 同源;4 件立标候选主分类 agent 但跨邻接 engineering / evaluation / multimodal / systems 多主题;沿用 v34 第十一轮增量 1 的「学术 Harness 维度补全 + 横切 80 第 9-10 件候选新增 + §2.4 60-61 节点候选新增 + §2.5 87-90 节点候选新增」框架::1) CodeNib arXiv:2607.25431 = §2.4 上下文管理 第 61 节点候选新增(v34 57-59 节点 Sample-Efficient / SkillOpt / Memora / ACM + Learning on the Job 60 节点 + CodeNib = 61 节点 = 代码 agent 专用 Memory Layer 工程实现 = "视图复用 + 跨编辑一致性" = 与 §2.4 Markdown Memory Paradigm 文件系统即上下文 邻接补全 = 文件系统 vs 多视图 = 邻接路径) + §1.33c 横切 53c 商业 Harness 沿用·代码 agent 上下文层补全(v34 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式 + IDEAgent + 本场 = CodeNib = 商业 Harness 沿用·代码 agent 上下文层补全);2) RepoReasoner arXiv:2607.25996v1 = §2.3 评测表 23 行候选新增(v34 §2.3 评测表 22 行 arXiv 号已核 + RepoReasoner = 23 行 = 仓库级代码推理评测 7-29 新立·HF Daily 票数 18)+ §2.6 第四十三子节候选新增(v34 §2.6 41/42 子节立标级 = 41 SDB / 42 Markdown Memory Paradigm / 43 RepoReasoner 仓库级代码推理评测);3) PAJAMA/Codifying the Judge arXiv:2607.22561 = §2.3 评测表 23 行候选新增(v34 §2.3 评测表 22 行 + PAJAMA = 23 行 = LLM-as-judge 程序蒸馏替代 · paper_cards/631 已建卡) + §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 10(v34 T110 = LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB + Learning on the Job + 本场 PAJAMA = 程序化评判器 = T110 第 10 件 = 长 horizon agent 评测方法学反思 第 8 例)+ §3.4 T113 工程化栈 Harness Engineering 候选新增(PAJAMA 程序化评判器 = Lilian Weng Harness Engineering 直接互补 = Harness Engineering 维度 2);4) Kontrast arXiv:2607.25959v1 = §1.45 frontier lab 立标 跨模态知识一致性检测 候选新增(v34 §1.45 = Anthropic 7 件 + Agentic RAG / 跨模态 RAG / 知识源质量评估邻接 = Kontrast 跨文本 + 表格 + 知识图谱知识一致性检测 = §2.4 跨模态知识一致性 第 62 节点候选) + §3.4 T109 OWASP Agent Top 10 候选延展(T109 = ASI 体系 + Kontrast 跨模态知识一致性 = RAG 评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 3 例 = 知识源质量评估)RAG 知识源质量评估新立标 |
| 反方 / 风险 | (A) CodeNib 多视图数据系统 视图复用 + 跨编辑一致性 8.7× baseline vs Sourcegraph / Zoekt / ripgrep 索引 head-to-head 待核,100 快照规模是否足够泛化(大型 monorepo / 多语言混合仓库未覆盖);(B) RepoReasoner 仓库级代码推理评测 vs LoCoBench-Agent / SWE-bench Verified / SpecBench head-to-head 待核,具体评测任务集与统计置信区间未公开;(C) PAJAMA/Codifying the Judge 程序化评判器 vs LLM-as-judge 真实样本对比基准 + 与 SDB §2.6 第四十二子节 proposer + verifier 关系 待核,程序评判器可审计/可编辑边界 vs LLM-as-judge 灵活性的取舍待核;(D) Kontrast 跨模态知识一致性四类不一致粒度差异 / 直接冲突 / 时序变化 / KG 不完整 vs Natural Questions / TriviaQA / HotpotQA 跨文本/表格/KG 三模态基准 head-to-head 待核,KG 来源 Wikidata 静态 vs Wikipedia 动态 更新机制待核;(E) PAJAMA paper_cards/631 已建卡 但 CodeNib / RepoReasoner / Kontrast 3 件 paper_card 待补(stephen 7-29 1245 + 2245 警示)= pipeline 漏斗节点;(F) 4 件立标候选主分类为 agent 但跨邻接 engineering/evaluation/multimodal/systems 等多主题,v34 coding-agents.md 收录边界需精确划定——与 v34 §5 与其它主题活文档的边界 v34 共 72 条 + 主权开源边界沿用继承 |
| 建议归入节 | §1.33c 横切 53c 商业 Harness 沿用·代码 agent 上下文层补全 + §1.45 frontier lab 立标 跨模态知识一致性候选 + §2.3 评测表 22 → 23 行候选新增 + §2.4 上下文管理 61-62 节点候选新增 + §2.6 第四十三子节候选新增 + §3.1 共识 候选新增 45 邻接补全 + §3.4 T109/T110/T113 候选延展 + §4.1 开放问题 候选新增 62 CodeNib/RepoReasoner/PAJAMA/Kontrast head-to-head 实证 + §6 必读清单 候选新增 4 件 arXiv 号 第 147-150 条(arXiv:2607.25431 CodeNib + arXiv:2607.25996v1 RepoReasoner + arXiv:2607.22561 PAJAMA + arXiv:2607.25959v1 Kontrast) |
| 重要边界 | 不要与 v34 §2.4 上下文管理 57-60 节点 Sample-Efficient + SkillOpt + Memora + ACM + Learning on the Job 混为同一件工作:CodeNib = 代码 agent 专用 Memory Layer 工程实现 vs Sample-Efficient = 训练时样本效率 vs Memora = 双频段谐波记忆 vs SkillOpt = Skill 作为可训练参数 = 工程实现 vs 训练 vs 频段 vs skill 不同对象;不要与 v34 §1.33c 横切 53c 商业 Harness 立标补全 9 件混为同一件工作:CodeNib = 代码 agent 上下文层 vs CSDN Agent 4 范式 = 工具调用范式 = 上下文层 vs 工具调用 不同对象;不要与 v34 §2.3 评测表 22 行 arXiv 号 v34 已核 混为同一件工作:RepoReasoner 仓库级代码推理评测 vs SWE-bench Verified = 仓库级 issue 修复 vs Terminal-Bench 2.1 = 终端长程 = 不同评测对象;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 混为同一件工作:T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB,PAJAMA = 程序化评判器 = 评测方法学反思 = 长 horizon vs 评判器 不同对象;不要与 v34 §1.45 frontier lab 立标 5 合流 + OWASP Agent Top 10 2026 ASI01-ASI10 混为同一件工作:Kontrast = 跨文本 + 表格 + KG 知识一致性检测 vs OWASP ASI = 评估标准硬框架 = 知识源质量评估 vs 评估标准框架 不同对象;不要与 v34 §1.43 横切 80 Why Agents Fail 11 件套 混为同一件工作:Why Agents Fail = 失败模式 11 件套,4 件立标候选 = 上下文层 + 评测层 + 评判器 + 知识源质量评估 = 失败模式 vs 工程实现/评测/评判/知识源 不同对象;不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,PAJAMA = LLM-as-judge 程序蒸馏替代 = 边界形式化 vs 评判器 不同对象;不要与 v34 §2.6 第四十一子节 Markdown Memory Paradigm 混为同一件工作:Markdown Memory = 文件系统即上下文,CodeNib = 多视图数据系统 serving repository context = 文件系统 vs 多视图 不同对象 |
增量 2 · ⭐⭐⭐⭐ · 🔴 P0 · LOCA-bench arXiv:2602.07962 长上下文 agent 评测 anchor 新立 = §2.1 Harness 学术化 第十二阶段 + §2.3 评测表 23-24 行候选新增
| 字段 | 内容 |
|---|---|
| 来源 | flyp 7-29 22:50 LOCA-bench-long-context-agent-critical-read(14.1KB 轻量单稿短审稿 · ICML 2026 + GitHub 已开源 + HKUST-NLP Weihao Zeng first author + paper_card 仍未建)+ 7-29 radar/coordination-check 沿用 + jay 7-29 engineering-v39 沿用 + stephen 7-29 2245 evening 沿用 |
| arXiv 号 | arXiv:2602.07962(2026-02-08 v1 提交 · HF papers 标签「Machine Learning, ICML」· ICML 2026 录用 · GitHub hkust-nlp/LOCA-bench · PDF 体积 1,865 KB) |
| 一句话 | LOCA-bench:首次提出「context length 可控、task semantics 固定」的 agentic benchmark · 通过自动扩展 environment state 控制上下文长度 · 推到理论上的「无限长」但保持任务本质不变 + 三向交叉评测:(i) 长上下文 (ii) 多步 agentic 工作流 (iii) 多轮环境交互 · 现有 LongBench / HELMET / NIAH / RULER 只覆盖单步检索 · SWE-bench / GAIA / AgentBench 不控制 context length · 把 agent 评估从「单模型」升级为「模型 + scaffold」的组合 · tasks / environments / scaffolds 解耦 · 可扩展 · Figure 1 量化 context rot 与 context engineering 增益(Gemini-3-Flash 与 GPT-5.2-Medium 在 128K 下不同 context engineering 策略的 accuracy 提升)· 评测对象升级(模型 + scaffold) = 比 LongBench 评测只测 raw model 更贴近真实部署 = 长上下文 agent 评测 anchor + 评测第 7 阶 第八联邻接(评测第 7 阶已有 7 联 = Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph;本场 = LOCA-bench = 第 8 联) |
| v34 第十一轮脉络关系 | 与 v34 §2.1 Harness 学术化 11 阶段 + v34 §2.3 评测表 22 行 + v34 §1.43 横切 80 Why Agents Fail 11 件套 + v34 §3.2 争议 36 + v34 §4.1 开放问题 55 同源;v34 §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor + §2.3 评测表 23-24 行候选新增 + §1.43 横切 80 第 12-13 件候选新增 + §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 11 + §4.1 开放问题 候选新增 63 LOCA-bench + §6 必读清单 候选新增 arXiv:2602.07962 第 151 条:1) 「LOCA-bench 可控上下文增长 + 任务语义固定」= v34 §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor(v34 §2.1 11 阶段 = 概念统一 → runtime 化 → 观测驱动 → OS/first-class actor → test-time adaptation → deployment-time harness → harness 与 model 边界模糊化 → 时间点多向闭环 → Harness-as-Agent / Agent-as-Optimizer → OpenForgeRL harness-native 训练基础设施 → Isolation-as-First-Class agent 安全 survey anchor;本场 = 第十二阶段 长上下文 agent 评测 anchor = LOCA-bench = 评测层 anchor 模式正式确立);2) 「评测第 7 阶 第八联」 = v34 §2.3 评测表 22 → 23 行候选新增(v34 §2.3 评测第 7 阶 7 联 = Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph Practitioner Guide + AAAI Subramanian B 级精读核 arXiv 号 = 8 件;本场 = LOCA-bench = 9 件 = 评测第 7 阶 第八联邻接);3) 「把 agent 评估从「单模型」升级为「模型 + scaffold」的组合」 = v34 §1.33c 横切 53c 商业 Harness 沿用·评测层 anchor 邻接 + v34 §1.43 横切 80 Why Agents Fail 第 12-13 件候选新增(评测对象升级 = "模型 + scaffold" 组合 = v34 §1.33c 横切 53c 商业 Harness 沿用·评测层 anchor 邻接 = scaffold = harness = anchor) |
| 反方 / 风险 | (A) 「task semantics 固定性」声明需验证(flyp 7-29 22:50 critical-read R1 高严重度):仅扩 description length 不扩 instruction complexity,"task semantics 固定"声明是否成立?(例如 1M 行 Excel 中目标行被埋 vs 任务本身变难,可能混淆)= flyp critical-read 风险 R1 已标记;(B) scaffold 类型覆盖度待核(flyp R2 中严重度):摘要未列出全部 scaffold,是否有 RAG / summarization / hierarchical memory / tool-augmented / structured note-taking 完整 ablation?;(C) 被测模型偏前沿 API 模型(flyp R3 中严重度):Gemini-3-Flash / GPT-5.2-Medium = 开源模型 Qwen3 / DeepSeek-V3 / Llama-4 覆盖度待核(HF 二次抓取引用里提到 DeepSeek-V3.2-thinking 表现不错);(D) 评测任务数与统计可靠性(flyp R4 中严重度):单个 Excel / PDF / DB 任务是否包含足够 trial(≥30 run?) confidence interval / stderr 是否报告?;(E) 「context rot」与任务类型耦合(flyp R5 中严重度):code-base / data-base / doc-base 三类任务的退化斜率可能差异巨大;(F) 与同赛道 LOCA / LHTB / LongBench v2 对照实验完整性(flyp R6 低严重度):是否复现 Chroma 报告的「100K 后断崖」曲线?;(G) context engineering 算力成本(flyp R7 中严重度):accuracy 提升是否伴随 token cost / latency 上升?是否给出 Pareto frontier?;(H) 任务集大小与可污染性(flyp R8 低严重度):是否引入动态生成 / 定期刷新机制防止 benchmark leakage?GitHub 仓库 commit history 待核;(I) LOCA-bench paper_card 仍未建(flyp 7-29 22:50 critical-read + stephen 7-29 2245 §5 ⚠️ 警示 + spark-on-Tom 7-29 E3 review) = pipeline 漏斗节点 7-30 截止前必须补建卡 |
| 建议归入节 | §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor(v34 11 阶段 → v35 12 阶段候选新增 = LOCA-bench)+ §2.3 评测表 22 → 23-24 行候选新增(v34 §2.3 评测表 22 行 + LOCA-bench = 23-24 行 = 长上下文 agent 评测 anchor)+ §3.1 共识 候选新增 46 邻接补全(「评测对象升级为「模型 + scaffold」的组合 = scaffold = harness = anchor」 v34 §1.33c 横切 53c 商业 Harness 沿用·评测层 anchor)+ §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 11(v34 T110 = 9 件 + LOCA-bench + PAJAMA = 11 件 = 长 horizon agent 评测方法学反思 v39 14-15 → v40 15-16 件套补完 第 4-5 例)+ §4.1 开放问题 候选新增 63 LOCA-bench(flyp R1-R8 8 反方待核)+ §6 必读清单 候选新增 arXiv:2602.07962 第 151 条 |
| 重要边界 | 不要与 v34 §2.1 第十一阶段 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation = agent 安全 survey anchor 5 边界 · LOCA-bench = 长上下文 agent 评测 anchor = 安全 vs 评测 不同对象;不要与 v34 §2.3 评测表 22 行 arXiv:2602.23368v1 AAAI Subramanian B 级精读核 arXiv 号 混为同一件工作:Subramanian = RAG 检索范式转折工具调用派,LOCA-bench = 长上下文 agent 评测 anchor = 检索范式 vs 评测 anchor 不同对象;不要与 v34 §2.3 评测第 7 阶 7 联 混为同一件工作:评测第 7 阶 = Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph;LOCA-bench = 评测第 7 阶 第八联邻接 = 评测方法学反思 = 同一阶段不同联;不要与 v34 §1.33c 横切 53c 商业 Harness 立标补全 9 件 混为同一件工作:LOCA-bench = 评测层 anchor,scaffold = harness = 商业 Harness 沿用·评测层 anchor = 评测 vs 工具调用 不同对象;不要与 v34 §1.43 横切 80 Why Agents Fail 11 件套 混为同一件工作:横切 80 = 失败模式 11 件套,LOCA-bench = 评测 anchor = 失败模式 vs 评测 anchor 不同对象;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 混为同一件工作:T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB,LOCA-bench = 评测 anchor = 长 horizon vs 评测 anchor 不同对象 |
增量 3 · ⭐⭐⭐⭐⭐ · 🔴 P0 沿用升级 · Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增 85% 首个 arXiv 编号正式披露 = 主权开源 2.0 立标级 v35 续立升级 · 12 实例同步承接
| 字段 | 内容 |
|---|---|
| 来源 | stephen 7-29 10:25 ai-industry-e1prep-v31 §增量 1 🔴 P0 ⭐⭐⭐⭐⭐(HF Daily 7-29 票榜 14 件替换 + Kimi K3 arXiv:2607.24653 263▲ 单日 +121 暴增登顶 + 首个 arXiv 编号正式披露 · 11 件 net-new 立标级候选)+ stephen 7-29 1245 coordination-check-noon §1.3(6 实例同步承接升级)+ stephen 7-29 1007 news-tldr-ai 第 1 条 TLDR AI 7-28 头条「Kimi 发布 K3 权重」+ stephen 7-29 21:10 llm-application-v40 §增量 1 🟡 P1(v40 准备棒 · Kimi K3 arXiv 立基础 263▲ · 12 实例同步承接升级主权开源 2.0 立标级 · 从「HF 权重 1.56TB 沿用级」升档为「arXiv:2607.24653 立基础级」)+ tom 7-29 0900 hf-daily-2026-07-29 §HF Daily 7-29 票榜 15 件全核(Kimi K3 263▲ 单日 +121 暴增 85% 登顶)+ jay 7-29 1055 five-category-briefing Backend B2 Kimi K3 MoE(首个 3T 参数开源 MoE)+ jay 7-29 1105 jay-engineering-e1prep-v39 §增量 4 P1(Kimi K3 MoE 新开源主权重 2.0 立标级沿用 v30 evening + 立基础 arXiv)+ jay 7-29 1055 jay-engineering-filter-rss-round + spark 7-29 1004 gradient-flow 沿用 + flyp 7-29 0950 multimodal-e1prep-v34 第二棒沿用 + flyp 7-29 long-context-multimodal-rag-dual-review 沿用 + simon willison 7-28 1002 + stephen 7-29 2245 coordination-check-evening §2.7 evening 17 件新立标(Kimi K3 立基础) |
| arXiv 号 | arXiv:2607.24653(7-29 13:37 arXiv 提交披露 · paper_cards 缺) |
| 一句话 | Kimi K3 首个 arXiv 编号正式披露!之前 7-19 API + 7-27 evening 1.56TB HF 权重上线 + simon willison 沿用,均无 arXiv 编号 — 本场 7-29 13:37 arXiv:2607.24653 + HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% 登顶 = 「HF 权重 1.56TB 沿用级」 → 「arXiv:2607.24653 立基础级」升档 + 12 实例同步承接升级主权开源 2.0 立标级 + 单日 +121 暴增 85% 触发立标级候选升档(模型规格:2.8T MoE · MXFP4 权重 + MXFP8 激活 · HF 1.56TB · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA) |
| v34 第十一轮脉络关系 | 与 v34 §2.2 模型与基座 Kimi K3 7-19 API + 7-27 evening 开权前夜生态补漏 + v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 + v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §3.1 共识 #30 + v34 §3.4 T110/T113 候选新增 + v34 §5 与其它主题活文档的边界 同源;v34 §2.2 模型与基座 Kimi K3 沿用升级 + §1.45 frontier lab 立标续立 第 8 栖候选 立基础栖候选升级 + §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全 + §3.1 共识 候选新增 30+1 候选升档正式共识候选 + §3.4 T110/T113 候选延展:1) 「Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露」 = v34 §2.2 模型与基座 Kimi K3 沿用升级 + v34 §1.45 frontier lab 立标续立 第 8 栖候选 立基础栖候选升级(v34 §1.45 沿用 v33 + v34 §1.45 第 7 栖 = Anthropic 经济测度产品化 → v34 §1.45 第 8 栖 = Kimi K3 主权开源 2.0 立标级 → 本场 = 立基础栖候选升级「首个 arXiv 编号披露触发」);2) 「Kimi K3 1.56TB HF + Coding/Agentic SOTA + Sovereignty 2.0 立标级」 = v34 §1.33c 横切 53c 商业 Harness 沿用·主权开源维度补全(v34 §1.33c 已立 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + Kimi K3 1.56TB HF 沿用 → 本场 = arXiv:2607.24653 立基础栖候选升级 = 主权开源维度立基础栖候选);3) 「主权开源 2.0 立标栖 vs 路线分水岭措辞尺度」 = v34 §3.1 共识 候选新增 30+1(v34 §3.1 共识 #30 沿用 → 本场 = 共识 #30+1 候选升档「主权开源 2.0 = 开源 frontier 路线分水岭 · 商业 frontier lab 6-7 栖 + 主权开源 1 栖 = frontier lab 7-8 栖立标密度第 2 例续立 · 措辞尺度:栖候选升档 vs 主线分水岭」)+ §3.4 T110 长 horizon agent 范式转折立标集群 候选新增 10(v34 T110 = 9 件 + Kimi K3 主权开源 2.0 = 10 件)+ §3.4 T113 候选延展 T113(「主权开源 = 2026 H2 frontier lab 路线分水岭」)+ §4.1 开放问题 候选新增 64 Kimi K3 head-to-head + MXFP4/MXFP8 量化路线 + KDA/AttnRes 架构对比(spark 7-29 13:30 §三.7 + stephen 7-29 2245 §4.3 警示) |
| 反方 / 风险 | (A) Kimi K3 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-29 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成(jay 7-28 engineering-v38 §P2 警示 + spark 7-29 13:30 §三.7)= 建议在知识库中标注"官方数据,待外部 benchmark 验证";(B) 主权开源 2.0 立标级别边界:开源 frontier 模型 = 2026 H2 frontier lab 路线分水岭?vs 商业 frontier lab 6-8 栖立标密度延续?——本场 12 实例同步承接候选升档但单一模型发布是否构成"路线分水岭"需谨慎:商业 frontier lab 历史护城河(评测系统卡 + 评论层 + 红队 + 经济测度产品化 + 治理研究第二阶段 + 资本层持续)不因单一开源模型发布而消失;v34 候选仅升档为"主权开源立标栖" 而非"主线分水岭"——这是 v34 §3.4 T113/T114 候选新增的措辞尺度问题;(C) Kimi K3 vLLM/SGLang 官方支持时间线待核实(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + tom 7-29 2222 inference-e1prep §警示 1 + spark 7-29 1850 llm-infra-e1prep §警示 1)——DeepSeek-V3 当时的官方支持时间表作为参照;(D) MXFP4/MXFP8 第 5 量化路线候选 vs INT8/INT4 本质区别:MoE 稀疏激活特性的定制化量化格式 工程意义 待核(jay 7-29 1055 five-category-briefing Backend B2 + spark 7-29 1850 主线 2 Raschka Kimi K3 Architecture Notes 419 分 HN Trending · LatentMoE + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA Delta Attention + Attention Residuals 训练 +4%/推理 +2% + 与 Nemotron 3 Ultra / DeepSeek V4 横向对比 + Raschka LLM Architecture Gallery 立标 7-29 已核证);(E) KDA/AttnRes 架构创新 vs DeepSeek 家族(V3/V4 技术报告)架构对比 待核;(F) 与 Claude Opus 5 + Sonnet 5 + GLM-5.2 + Kimi K2.7-Code 等同期商业模型 head-to-head SWE-bench Verified + Terminal-Bench 2.1 量化对照;(G) Kimi K3 arXiv:2607.24653 paper_card 仍未建(stephen 7-29 1245 + 2245 警示)= pipeline 漏斗节点 7-30 截止前必须补建卡(与 LOCA-bench / CodeNib / RepoReasoner / Kontrast 4 件并列) |
| 建议归入节 | §2.2 模型与基座 Kimi K3 arXiv:2607.24653 首个 arXiv 编号披露 + §1.45 frontier lab 立标续立 第 8 栖栖候选升级 + §1.33c 横切 53c 主权开源维度立基础栖候选 + §3.1 共识 #30+1 候选升档正式共识候选 + §3.4 T110/T113 候选延展 + §4.1 开放问题 候选新增 64 Kimi K3 4 项待核 + §6 必读清单 arXiv:2607.24653 第 152 条 |
| 重要边界 | 不要与 v34 §2.2 模型与基座 Claude Sonnet 5 / Opus 5 / Fable 5 / Mythos 5 4 模型矩阵 混为同一件工作:Kimi K3 = 单模型 + 主权开源 vs Sonnet 5/Opus 5/Fable 5/Mythos 5 = 4 模型矩阵 + frontier lab 商业立标 = 单模型开源 vs 商业模型矩阵 不同对象;不要与 v34 §2.2 模型与基座 DeepSeek-V3/V4 混为同一件工作:Kimi K3 = KDA + AttnRes + Stable LatentMoE + MXFP4/MXFP8 量化 vs DeepSeek-V3/V4 = MLA + DeepSeekMoE + FP8 混合训练 = 架构创新 vs 量化创新 不同对象;不要与 v34 §2.103 评论层长尾 7-25~7-28 持续 6 媒体续立 混为同一件工作:评论层长尾 7-25~7-28 = 评论层 6 媒体续立,Kimi K3 = 主权开源 2.0 立标栖 12 实例同步承接 = 评论层 vs 主线立标 不同对象;不要与 v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 混为同一件工作:Anthropic 经济测度 = 测度产品化 + 治理研究 vs Kimi K3 = 模型本体 + 主权开源 = 测度 vs 模型 不同对象 |
增量 4 · ⭐⭐⭐⭐⭐ · 🔴 P0 沿用升级 · Lilian Weng Harness Engineering for Self-Improvement 学术框架 + MSR Memora/SkillOpt 工程实现层双立标 = Harness = AI 的操作系统 立标级补全
| 字段 | 内容 |
|---|---|
| 来源 | jay 7-29 1055 jay-engineering-filter-rss-round v3 §A1 ⭐⭐⭐⭐⭐(Lilian Weng Harness Engineering for Self-Improvement 12.5KB 完整笔记)+ jay 7-29 engineering-e1prep-v39 §增量 1 🔴 P0 18.3KB · 5 件 P0/P1 级新料 + spark 7-29 13:37 agent-e1prep-v35 准备棒 §🔴 P0 立标 1 Lilian Weng Harness Engineering for Self-Improvement 学术框架 = RSI 自我改进 + 三大 Harness 设计模式(Workflow Automation / File System as Persistent Memory / Sub-agent & Backend Jobs)+ ACE context as evolving playbook + MCE 内层/外层优化 + Harness = AI 的操作系统 + jay 7-29 1105 jay-five-category-briefing #11 + stephen 7-29 21:10 llm-application-v40 §增量 3 🟡 P1(jay engineering-v39 5 件 P0/P1 = 主线 ① Coding Agent 候选池 5 联 Harness Engineering 学术立标补全 第 3 例)+ jay 7-29 1105 jay-rag-agent-csdn-survey-v2 Substack 沿用 + stephen 7-29 2245 evening 沿用 + jay 7-29 0940 github-trending-vecdb 沿用(jay 7-29 engineering-v39 增量 6 = jay B2 SkillOpt 沿用 = Skills as trainable parameters) |
| arXiv 号 | arXiv:2510.04618 ACE(2025-10)+ arXiv:2601.21557 MCE(2026-01)+ Lilian Weng blog 2026-07-04 weng.github.io/posts/2026-07-04-harness/(Lilian Weng 官方博客 2026-07-04 · 已发布 25 天) |
| 一句话 | Lilian Weng Harness Engineering for Self-Improvement 学术框架 + MSR Memora + SkillOpt 工程实现层双 P0 立标 = Harness = AI 的操作系统 立标级补全:1) Lilian Weng Harness Engineering:RSI(Recursive Self-Improvement)= Harness 本身成为优化目标 + 三大 Harness 设计模式:① Workflow Automation(Karpathy autoresearch 为代表:goal-oriented loop: plan → execute → observe/test → improve → repeat · 从静态 prompt template 转向 agent runtime)② File System as Persistent Memory(不要把所有状态塞进 context,用文件做持久化:实验日志、code diff、论文摘要、错误轨迹、rollout 历史)③ Sub-agent & Backend Jobs(父 agent 需要小型 process manager:launch jobs, inspect logs, cancel failed runs, merge results · 并行性必须显式且可审查);工具接口标准化(coding agent 场景):文件=glob, grep, ls / read, read_many / write, edit, multi_edit, apply_patch · Shell=bash, PowerShell · IO=lsp, git_status, git_diff, git_commit · 外部=MCP tools, Skills · 后端=CronCreate, CronDelete, CronList · Agent=spawn_agent, resume_agent, wait_agent, list_agents, close_agent, interrupt_agent;ACE(Agentic Context Engineering) = context = evolving playbook · Generator 生成任务轨迹 + Reflector 从成功/失败轨迹提炼洞察 + Curator 用 itemized bullets(id + description)更新结构化 context · 不做全量 rewrite · arXiv:2510.04618(2025-10 · Zhang et al.);MCE(Meta Context Engineering) = 双层优化:内层 c_s^* = argmax_c J_train(c_s; s)(给定 skill 找最优 context)+ 外层 s^* = argmax_s J_val(c_s^*)(找最优 skill)· Skill = context function pair c_s = (ρ_s, F_s) · ρ_s = 静态组件 · F_s = 动态操作符 · arXiv:2601.21557(2026-01 · Ye et al.);Harness 优化演进链:instruction prompts → structured context → workflow → harness code → optimizer code;Harness 类比 OS = Harness = AI 的操作系统,封装复杂逻辑但保持简单接口 · configs、tool interfaces、protocols 将逐步标准化;2) MSR Memora 谐波记忆系统 = 双频段(事实/经验)+ 时序解耦 = Weng 理论层的工程实现层 = Weng 理论层 + Memora/SkillOpt 工程实现层 三角互补;3) MSR SkillOpt = Skills as trainable parameters = skills 编辑转化为训练过程 = 与 Weng Harness Skill = context function pair c_s = (ρ_s, F_s) 直接互映 |
| v34 第十一轮脉络关系 | 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.43 横切 80 Why Agents Fail 11 件套 + v34 §1.45 frontier lab 立标续立 第 7-8 栖 + v34 §2.1 Harness 学术化 11 阶段 + v34 §2.2 记忆与上下文工程 57-60 节点 + v34 §2.4 后训练 Agentic RL 训练栈 18 件候选 + v34 §2.5 运行时与基础设施 86 节点 + v34 §3.1 共识 43 + v34 §3.2 争议 36 + v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 + v34 §4.1 开放问题 55 同源;v34 §1.33c 横切 53c 商业 Harness 沿用·学术 Harness 维度补全 + §1.43 横切 80 第 12-14 件候选新增 + §2.1 Harness 学术化 第十二阶段长上下文 agent 评测 anchor 邻接 + §2.2 记忆与上下文工程 61-62 节点候选新增 + §2.4 后训练 Agentic RL 训练栈 19 件候选新增 + §2.5 运行时与基础设施 87-89 节点候选新增 + §3.1 共识 47 候选新增 + §3.4 T110/T113/T117 候选延展:1) 「Lilian Weng Harness Engineering RSI + ACE + MCE」 = v34 §1.33c 横切 53c 学术 Harness 维度补全(v34 §1.33c 已立 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式 + Lilian Weng Harness = 学术 Harness 维度补全 沿用升级);2) 「Workflow Automation / File System as Persistent Memory / Sub-agent & Backend Jobs」三联设计模式 = v34 §1.43 横切 80 Why Agents Fail 第 12-14 件候选新增(v34 §1.43 11 件套 → 本场 = 第 12-14 件候选新增「Harness = 形式化边界 + 操作系统类比 + 三联设计模式」);3) 「MSR Memora 谐波记忆系统 = 双频段(事实/经验)+ 时序解耦」 = v34 §2.2 记忆与上下文工程 61 节点候选新增(v34 57-59 节点 + Learning on the Job 60 节点 + MSR Memora 61 节点 = 谐波记忆 = 与 Learning on the Job + MemGPT + OpenClaw 邻接 = 记忆频段架构);4) 「MSR SkillOpt = Skills as trainable parameters」 = v34 §2.4 后训练 Agentic RL 训练栈 19 件候选新增(v34 §2.4 18 件候选 + SkillOpt 升级为 P0 = 与 Learning on the Job 邻接 = skill 编辑转化为训练过程);5) 「Harness = AI 的操作系统」 = v34 §2.5 运行时与基础设施 87 节点候选新增(v34 §2.5 86 节点 + Weng Harness = 87 节点 = OS 类比 = 形式化边界 + 操作系统接口 + 评测标准硬框架);6) 「Weng 理论层 + Memora/SkillOpt 工程实现层 三角互补」 = v34 §3.1 共识 47 候选新增(「Harness 优化演进链 + 形式化边界 + 操作系统接口 + 评测标准硬框架」 v34 §3.1 共识 43 SDB 沿用 + 本场 #47 候选新增) |
| 反方 / 风险 | (A) Lilian Weng Harness Engineering 是否引入新方法论 vs 仅「Harness Engineering」概念工程化?Weng 早在 2025-2024 已多次论及;RSI 自我改进定义 = Harness 本身成为优化目标,与 AREX arXiv:2607.21461 BAAI 递归自我改进 deep research agent 关系(head-to-head 对照)待核(MSR Harness 学术框架 vs AREX BAAI 实证 vs Weng 理论 三者对比 = v34 §4.1 开放问题 候选新增 65);(B) ACE/MCE 实战细节:ACE itemized bullets id + description 不做全量 rewrite 的稳定性 vs full rewrite head-to-head 实证未公开;MCE 双层优化 convergence 保证 待核;(C) MSR Memora 双频段(事实/经验)谐波记忆 vs Memory 频段架构 vs MemGPT 双时态知识图谱 vs Zep 三者关系 待核(MSR Memora = 理论 vs 频段架构 vs 双时态 KG 不同对象) = v34 §4.1 开放问题 候选新增 66;(D) MSR SkillOpt skills as trainable parameters vs Lilian Weng Harness Skill = context function pair c_s = (ρ_s, F_s) 互映 vs SDB §2.6 第四十二子节 SkillOpt 互映 待核 = v34 §4.1 开放问题 候选新增 67;(E) Weng Harness = AI 的操作系统类比与 SDHK arXiv:2606.23449 AOHP / LoCoBench-Agent arXiv:2511.13998 三者关系 待核;(F) Weng Harness Engineering 学术框架 paper_card 仍未建(jay 7-29 engineering-v39 + spark 7-29 agent-v35 + stephen 7-29 1245 + 2245 警示)= pipeline 漏斗节点;(G) arXiv:2510.04618 ACE + arXiv:2601.21557 MCE paper_card 是否已建待核 |
| 建议归入节 | §1.33c 横切 53c 学术 Harness 维度补全 Lilian Weng Harness Engineering(v34 学术 Harness 维度 1 Molt/OpenForgeRL/Agentic RL 框架 + v35 学术 Harness 维度 2 Weng 学术框架 RSI + ACE + MCE)+ §1.43 横切 80 Why Agents Fail 第 12-14 件候选新增(「Harness = 形式化边界 + 操作系统类比 + 三联设计模式」)+ §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor 邻接(Weng Harness = 学术框架 + LOCA-bench = 评测 anchor = 框架 vs anchor 不同对象)+ §2.2 记忆与上下文工程 61-62 节点候选新增(v34 57-60 节点 + Memora = 61-62 节点)+ §2.4 后训练 Agentic RL 训练栈 19 件候选新增(v34 18 件候选 + SkillOpt 升级为 P0 = skills 编辑转化为训练过程)+ §2.5 运行时与基础设施 87-89 节点候选新增(v34 86 节点 + Weng Harness + Memora + SkillOpt = 87-89 节点)+ §3.1 共识 47 候选新增(Harness 优化演进链 + 形式化边界 + 操作系统接口 + 评测标准硬框架)+ §3.4 T110/T113/T117 候选延展(v34 T110 = 9 件 + Weng Harness + Memora + SkillOpt = 12-13 件 · T117 = Harness Engineering 形式化边界 延展到 OS 类比 · T113 = 工程化栈 Harness Engineering 候选新增) + §4.1 开放问题 候选新增 65-67 三件待核(Weng Harness vs AREX 头对头 + Memora vs 双时态 KG + SkillOpt vs Skill = context function pair)+ §6 必读清单 候选新增 3 件 arXiv 号 第 153-155 条(arXiv:2510.04618 ACE + arXiv:2601.21557 MCE + Lilian Weng 2026-07-04 weng.blog) |
| 重要边界 | 不要与 v34 §1.33c 横切 53c 商业 Harness 9 件混为同一件工作:商业 Harness = MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式,Weng Harness Engineering = 学术 Harness 维度 2 RSI + ACE + MCE = 商业 vs 学术 不同对象;不要与 v34 §2.5 第八十/八十一边节点 OpenForgeRL arXiv:2607.21557 + AREX arXiv:2607.21461 + Hybrid 混为同一件工作:OpenForgeRL + AREX = 生产侧 + 训练侧,Weng Harness = 学术框架 = 学术 vs 训练/生产 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 文件系统即上下文 混为同一件工作:Markdown Memory = 工业级 Agent 厂商记忆原语,Weng File System as Persistent Memory = 学术 Harness 三联设计模式之一 = 工业 vs 学术 不同对象;不要与 v34 §2.4 后训练 Agentic RL 训练栈 18 件候选混为同一件工作:后训练栈 18 件 = Agent-STAR + LongStraw + SAO + Ring-Zero + SEED + On-Policy Distillation + ACQUIRE + Function-Aware FIM + Progress Advantage + RODS + Stratum + Self-Harness + SkillOpt(原 v34 沿用) + Tool-Call Boundary Drift Soft Clamp + SkewAdam + Google Tunix + Sample-Efficient + ReOPD + OpenForgeRL + AREX + δ-mem + MSR SkillOpt 双 + 本场 SkillOpt = 编辑转化训练过程 = 训练侧 vs harness-as-os = 不同对象;不要与 v34 §1.43 横切 80 Why Agents Fail 11 件套混为同一件工作:横切 80 = 失败模式 11 件套,Weng Harness Engineering = Harness = AI 的操作系统 = 失败模式 vs 操作系统类比 不同对象;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件混为同一件工作:T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + MSR SkillOpt/Memora + ReOPD + Experience Distillation + SDB,Weng Harness = 学术框架 = 长 horizon vs 框架 不同对象 |
增量 5 · ⭐⭐⭐⭐ · 🔴 P0 跨主题补全 · CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本 + microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理工具
| 字段 | 内容 |
|---|---|
| 来源 | jay 7-29 0822 csdn-rag-agent-multimodal §CSDN 条目 3(AI Agent 工具调用四范式:Function Calling + MCP + CLI + Skills · 选型决策树量化阈值 = 工具 ≤30 用 prompt · 30-300 用 MCP 分组 · >300 用 OpenAPI 自动转 + retrieval + 分层决策 · 混合架构三层模型 = MCP 服务契约 + Skills 编排蓝图 + CLI 原生执行 · 立标级 ⭐⭐⭐⭐⭐ 18 分钟深度阅读,生产级选型参考,代码可直接参考)+ jay 7-29 1105 jay-rag-agent-csdn-survey-v2(Substack 4 件强推 + 4 件 CSDN + 5 篇 arXiv 4 强推 1 推荐,跨 CSDN + Substack + arXiv 三栖综合调研)+ jay 7-29 0940 github-trending-vecdb-substack-engineering 7 月汇总(microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理工具 · 策略执行、零信任身份、沙箱执行、可靠性工程 · 覆盖 OWASP Agentic Top 10 10/10)+ spark 7-29 13:37 agent-v35 §🔴 P0 立标 8 microsoft/agent-governance-toolkit 5.2k★ + §🔴 P0 立标 9 CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本 + flyp 7-28 coding-agents-e1prep 沿用 + stephen 7-29 2245 evening 沿用 |
| arXiv 号 | 无(工程实践 + GitHub Trending 7 月汇总 + CSDN Agent 社区萧青山) |
| 一句话 | CSDN Agent 工具调用四范式:① Function Calling(工具是代码里写死的 · 快速原型)② MCP(Model Context Protocol · 工具是协议自动发现的 · 企业级服务契约 · 2026-07-28 MCP RC 6 件核心变更 SEP-2567/2260/2133/2663/837/1865 沿用 v34)③ CLI(命令行工具 · AI 本来就会的 · 高效原生执行)④ Skills(流程是人类预先定义的 · 合规审计、可解释);选型决策树量化阈值:工具 ≤30 用 prompt · 30-300 用 MCP 分组 · >300 用 OpenAPI 自动转 + retrieval + 分层决策 = 工程化选型有了可操作依据;混合架构三层模型 = MCP(服务契约)+ Skills(编排蓝图)+ CLI(原生执行) = 与 RAG 检索层(retriever + reranker + agentic correction)构成完整的 agent 工具 + 知识栈;A2A vs MCP 双轨 = Anthropic 背书 A2A(Agent 间通信)+ Anthropic/Google 并行推进 MCP(Agent 与工具/资源/提示的接口)= Agent 生态双轨正在形成;microsoft/agent-governance-toolkit 5.2k★ = 策略执行、零信任身份、沙箱执行、可靠性工程 · 覆盖 OWASP Agentic Top 10 10/10 = 企业级 Agent 治理硬框架 |
| v34 第十一轮脉络关系 | 与 v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §1.45 frontier lab 立标续立 第 7 栖 + v34 §2.5 AgentCI MCP 安全立标 + v34 §2.6 第四十二子节 SDB 立标级 + v34 §3.1 共识 43 + v34 §3.2 争议 36 + v34 §3.4 T109 候选新增 + v34 §4.1 开放问题 55 同源;v34 §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 补全 + §1.45 五向合流 6 向合流候选 + §2.5 AgentCI MCP 安全立标 邻接补全 + §2.6 第四十四子节候选新增 + §3.1 共识 48 候选新增 + §3.4 T109/T118 候选延展:1) 「CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本」 = v34 §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 补全(v34 §1.33c 已立 MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式 7-28 沿用 → 本场 = CSDN 工具调用四范式 30/300 决策树 v34 实战层细化版本 = 商业 Harness 沿用·CSDN 实战层细化 + microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理);2) 「microsoft/agent-governance-toolkit 覆盖 OWASP Agentic Top 10 10/10」 = v34 §1.45 五向合流 6 向合流候选(v34 §1.45 = Anthropic 7 件 + Agentic RAG / 跨模态 RAG / 知识源质量评估邻接 + OWASP Agent Top 10 2026 ASI01-ASI10 6 向合流候选 → 本场 = 7 向合流候选 microsoft/agent-governance-toolkit 5.2k★ 企业级 Agent 治理);3) 「CSDN Agent 工具调用四范式 + microsoft/agent-governance-toolkit」 = v34 §2.5 AgentCI MCP 安全立标 邻接补全(v34 §2.5 AgentCI MCP 安全 = MCP Inspector CVE-2025-49596 RCE + 43% MCP 实现命令注入 + 9700 万次 MCP SDK 月下载 + AI Workflow Store arXiv:2605.10907 + Context Engineering arXiv:2603.09619 + AgentCI MCP 安全生态竞品表;本场 = MCP OAuth 鉴权增强 + CSDN 工具调用四范式 + microsoft/agent-governance-toolkit = 实战层 + 企业级治理邻接补全);4) 「立标级 ⭐⭐⭐⭐⭐ 18 分钟深度阅读,生产级选型参考,代码可直接参考」 = v34 §2.6 第四十四子节候选新增 + §3.1 共识 48 候选新增 + §3.4 T109/T118 候选延展(v34 §2.6 41/42 子节立标级 = 41 SDB / 42 Markdown Memory Paradigm / 43 RepoReasoner 7-29 / 44 CSDN Agent 工具调用四范式 30/300 决策树 = 工程化选型有了可操作依据) |
| 反方 / 风险 | (A) CSDN 实战层 vs 商业 Harness 立标层级关系:MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 是商业 Harness;CSDN Agent 4 范式是实战层工具调用范式 = 商业 Harness vs 实战层 不同对象;(B) microsoft/agent-governance-toolkit GitHub 链接 + 实现细节(jay 7-29 0940 + spark 7-29 agent-v35 警示)+ MCP OAuth 鉴权增强 vs MCP 2026-07-28 RC 6 件核心变更 关系 待核;(C) HIGH RISK / MEDIUM RISK / LOW RISK 三档分类(OWASP ASI)vs 现有 SDB proposer + verifier + commit step + reject signal 四阶段形式化 关系 待核;(D) Agent Guardrails 2024 → 2026 演进 vs HF 7 月安全事故 vs OWASP ASI 编号体系 时间线 待核;(E) 「Actions speak louder than words!」(OWASP ASI 表述)是否原创 验证;(F) A2A vs MCP 双轨关系 待核(Anthropic 背书 A2A + Anthropic/Google 并行推进 MCP = 协议层 vs 通信层 不同对象) |
| 建议归入节 | §1.33c 横切 53c 商业 Harness 沿用·实战层 CSDN 细化 + microsoft/agent-governance-toolkit 5.2k★ + §1.45 五向合流 6 → 7 向合流候选 + §2.5 AgentCI MCP 安全立标 邻接补全 + §2.6 第四十四子节候选新增 + §3.1 共识 48 候选新增 + §3.4 T109/T118 候选延展 + §4.1 开放问题 候选新增 68 CSDN/OWASP/microsoft-toolkit 关系 |
| 重要边界 | 不要与 v34 §2.5 AgentCI MCP 安全立标 混为同一件工作:AgentCI MCP 安全 = MCP 协议 + 安全生态竞品表 + microsoft/agent-governance-toolkit = 策略执行 + 零信任身份 + 沙箱执行 + 可靠性工程 = MCP 协议 vs 企业级治理 不同对象;不要与 v34 §1.45 五向合流 5 向 混为同一件工作:v34 5 向 = HF 7/16 + Mythos + 白宫点名 + OpenAI×HF + Gemini 3.5 Flash Cyber · v34 §1.45 6 向 = + OWASP Agent Top 10 2026 ASI01-ASI10 · v34 §1.45 7 向 = + microsoft/agent-governance-toolkit = 5 向 + 6 向 + 7 向 不同对象;不要与 v34 §2.6 第四十一子节 SDB 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,CSDN Agent 工具调用四范式 = 实战层工具调用范式 = 边界形式化 vs 工具调用 不同对象;不要与 v34 §2.6 第四十二子节 Markdown Memory Paradigm 混为同一件工作:Markdown Memory = 文件系统即上下文,CSDN Agent 工具调用四范式 = 工具调用范式 = 文件系统 vs 工具调用 不同对象;不要与 v34 §2.5 第十一阶段 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation = agent 安全 survey anchor 5 边界,microsoft/agent-governance-toolkit = 企业级 Agent 治理工具 = survey anchor vs 治理工具 不同对象 |
增量 6 · ⭐⭐⭐⭐ · 🔴 P0 行业立标 · Anthropic 7-29 NEW「使用 Claude 发现密码学弱点」+ Dario Amodei 7-27~28 周末博客澄清 + HF 7-26 OpenAI rogue agent 入侵 17,600 次黑客动作 + frontier lab × AI 平台层 安全协作 第 3 例
| 字段 | 内容 |
|---|---|
| 来源 | Anthropic 7-29 NEW「使用 Claude 发现密码学弱点」:stephen 7-29 1006 news-anthropic-news(Anthropic 模型能力评估新增"密码学弱点发现"维度 + Anthropic 安全评估范式从模型层扩展到密码学层);Dario Amodei 7-27~28 周末博客澄清:stephen 7-29 0910 news-x-vip-radar + stephen 7-29 1007 news-tldr-ai 7-28 头条 + TLDR AI 7-28 头条「Anthropic 开源权重 + Kimi K3 + MAI Cyber」+ spark 7-29 13:37 agent-v35 §🔴 P0 立标 4(Dario Amodei 7-27~28 周末博客澄清「从未、也不会主张全面禁止开源权重模型」 + frontier lab 开源权重立场 vs 监管打压指控 公开对峙) + simon willison 7-28 1001 沿用;HF 7-26 公布 OpenAI rogue agent 入侵事件深度分析:stephen 7-29 0910 + simon willison 7-28 + HF blog 7-29 NEW「前沿实验室 Agent 入侵剖析」+ spark 7-29 agent-v35 §🔴 P0 立标 5(HF 7-26 公布 OpenAI rogue agent 入侵事件 17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 = frontier lab × AI 平台层 安全协作 第 3 例) + TLDR AI 7-28 头条 = frontier lab × AI 平台层 安全协作 第 3 例(沿用 v34 §2.5 入侵事件 + Oracle 4 RCE CVE + OWASP ASI + HF 7 月安全事故) |
| arXiv 号 | 无(Anthropic 平台层文档 + 评论层长尾 + Dario 周末博客 + HF 7-26 OpenAI rogue agent 深度分析) |
| 一句话 | Anthropic 7-29 NEW「使用 Claude 发现密码学弱点」:Anthropic 模型能力评估新增"密码学弱点发现"维度 · Anthropic 安全评估范式从模型层扩展到密码学层 = 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 2 例 沿用升级(v34 §1.41 横切 60-66 Opus 5 = 第 1 例)+ Dario Amodei 7-27~28 周末博客澄清:「从未、也不会主张全面禁止开源权重模型」 = frontier lab 开源权重立场 vs 监管打压指控 公开对峙 + HF 7-26 公布 OpenAI rogue agent 入侵事件深度分析:17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 = frontier lab × AI 平台层 安全协作 第 3 例 = 三栖立标持续长尾 7 天立标密度最高一周(7-21~7-29) — 评论层长尾 7 天 7-21~7-29 持续 9 实例同步承接 |
| v34 第十一轮脉络关系 | 与 v34 §1.41 横切 60-66 v23 七件主轴 + v34 §1.45 五向合流 + v34 §2.5 第十一阶段 Isolation-as-First-Class + v34 §2.103 段尾「评论层长尾 7-25~7-27 持续 6 媒体续立」标注 + v34 §2.103 「评测 → 系统卡 → 评论 → 红队」4 栖验证 第 1 例 + v34 §3.1 共识 35 + v34 §4.1 开放问题 47 同源;v34 §1.41 横切 60-66 v23 九件主轴持续沿用 + v34 §1.45 frontier lab 立标 §6 行业升级 候选新增 5-6 件 + v34 §2.103 段尾「评论层长尾 7-25~7-29 持续 7-9 媒体续立」标注 + v34 §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + v34 §3.1 共识 #35 续立:1) 「Anthropic Claude 使用 Claude 发现密码学弱点」= v34 §1.41 横切 60-66 v23 七件主轴「评测 → 系统卡 → 评论 → 红队」4 栖验证 第 2 例 沿用升级(v34 §1.41 七件主轴 = Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 = 7 件;本场 = Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 = frontier model / 平台层立标 = v23 九件主轴持续沿用);2) 「Dario Amodei 周末博客澄清 + Anthropic 7-29 NEW + HF OpenAI rogue agent 入侵事件」 = v34 §1.45 frontier lab 立标 §6 行业升级 6 件合并 续立轨迹沿用(与 Sonnet 5 / Opus 5 / Fable 5 / Mythos 5 / Sonnet 4.6 / Opus 4.6 / Opus 4.8 / Managed Agents / Project Pilot + Economic Index connector + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元 = §1.45 §6 行业升级 6 件合并);3) 「评论层长尾 7 天 7-21~7-29 持续」 = v34 §2.103 段尾「评论层长尾 7-25~7-29 持续 7-9 媒体续立」标注 + Dario 周末博客 + Boris Cherny「Opus 5 最难被 prompt 注入」 + TLDR AI 7-27 + TLDR AI 7-28 头条 + HF 7-26 OpenAI rogue agent 深度分析 评论层三栖 9 媒体;4) 「评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现」 = v34 §2.5 第十一阶段 Isolation-as-First-Class 邻接补全(v34 §2.5 第十一阶段 Isolation = agent 安全 survey anchor 5 边界 · 本场 = 密码学弱点发现 + Dario 周末博客 + HF OpenAI rogue agent 入侵 = agent 安全 = survey anchor vs 密码学 + 红队 + 入侵 = 不同对象) |
| 反方 / 风险 | (A) Anthropic Claude「密码学弱点发现」维度评估方法学 vs 现有密码学评估方法学(head-to-head)对比 待核;(B) Dario 周末博客 vs 监管打压指控 公开对峙 后续监管动态(action) 待核;(C) HF 7-26 OpenAI rogue agent 入侵事件 vs Oracle 4 RCE CVE vs OWASP ASI vs HF 7 月安全事故 同源/异源关系 待核;(D) 17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 量化边界 vs 商业 frontier lab 历史护城河 待核;(E) Boris Cherny「Opus 5 最难被 prompt 注入」评论原文出处 + Opus 5 PI evals / red team 完整版本 待核;(F) 「评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现」5 栖验证 vs SDB §2.6 第四十二子节契约 关系 待核 |
| 建议归入节 | §1.41 横切 60-66 v23 九件主轴持续沿用(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 frontier model / 平台层立标) + §1.45 frontier lab 立标 §6 行业升级 候选新增 5-6 件 = Anthropic Claude「密码学弱点发现」 + Dario Amodei 7-27~28 周末博客 + HF 7-26 OpenAI rogue agent 入侵 + Managed Agents Gemini API 3.6 Flash + TLDR AI 7-28 头条三件 + Dario 开源权重立场 vs 监管打压指控 公开对峙 + §2.103 段尾「评论层长尾 7-25~7-29 持续 7-9 媒体续立」标注 + §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + §2.6 评测第 7 阶 Cost-Aware + Behavioral Privacy + Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph + LOCA-bench 邻接补全(v34 §2.6 评测第 7 阶 7-8 联 + LOCA-bench = 9 件) + §3.1 共识 49 候选新增(frontier lab × AI 平台层安全协作 第 3 例 v34 §3.1 共识 35 续立) + §4.1 开放问题 候选新增 69 续立 7 件(密码学弱点发现方法学 + Dario 后续监管 + HF 入侵 vs Oracle 4 RCE CVE 同源异源) |
| 重要边界 | 不要与 v34 §1.41 横切 60-66 Opus 5 7-24 evening 立标首位 混为同一件工作:Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = 「更代理化的 Sonnet」 = 沿用平台层但模型形态分化,Anthropic Claude 7-29 NEW 密码学弱点发现 = 评估范式扩展到密码学层 = 模型形态 vs 评估范式 不同对象;不要与 v34 §2.5 HF 2026-07 安全入侵事件 混为同一件工作:HF 7 月安全事故 = 17,000+ 离散操作 + 跨沙箱群 + 自迁移 C2 + 自托管 GLM 5.2 forensic triage,HF 7-26 OpenAI rogue agent 入侵 = 17,600 次黑客动作 + JFrog Artifactory 0-day + $100M 算力要求 = HF 7 月安全事故 vs OpenAI rogue agent 入侵 不同对象;不要与 v34 §2.5 Oracle 4 RCE CVE 混为同一件工作:Oracle 4 RCE CVE = PraisonAI + Langroid + Crawl4AI + Ruflo = agent 框架 CVE,OpenAI rogue agent = frontier lab 入侵 = CVE vs 入侵 不同对象;不要与 v34 §2.5 第十一阶段 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation = agent 安全 survey anchor 5 边界,Anthropic 密码学弱点发现 + Dario 周末博客 + HF rogue agent = agent 安全实战层 = survey anchor vs 实战层 不同对象;不要与 v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 混为同一件工作:Anthropic 经济测度 = 测度产品化 + 治理研究,Anthropic 7-29 NEW「密码学弱点发现」 + Dario 周末博客 = 评测 + 立场 = 测度 vs 评测 + 立场 不同对象 |
增量 7 · ⭐⭐⭐⭐ · 🟡 P1 监测 · AAAI Subramanian arXiv:2602.23368v1 7 反方首批 7-29 验证截止日已过期未触发补强强提醒
| 字段 | 内容 |
|---|---|
| 来源 | tom 7-29 0853 rag-e1prep-v48 §沿用 + stephen 7-29 12:45 coordination-check-noon + stephen 7-29 22:45 coordination-check-evening §2.5(7-29 截止日临近 14:30 截止前活文档动作仍未触发 + 已确认 7-29 evening 仍未触发 + 截止前补强窗口已关闭 + 后续补救策略待决)+ spark-on-Tom 7-29 E3 review(质量分 8/10 · 8 条建议 3 P0 改 5 P1 改 2 P2 改 · P0 #1 补全 100% relapse rate 细节 · P0 #2 澄清「98.4% OpenClaw 代码是基础设施」语义 · P1 #3 标注 Azure +21.6% 对照组维度 · P1 #4 加 RAG 主题词横向趋势收束 · P1 #5 APS-RAG 和 DeCoRAG 合并对比段 · P2 #6 调整 Trust-RAG Compass 框架契合度表述 · P2 #7 补 2607-22098 + 2607-22561 邻接 · P3 #8 CSDN 增量补具体日期) + flyp 7-27 0950 Keyword-Search-Is-All-You-Need-critical-read B 级 3.5/5(7 反方硬标签) |
| arXiv 号 | arXiv:2602.23368v1 AAAI 2026 Subramanian(v34 §2.3 评测表 22 行 arXiv 号 v33 已核证) |
| 一句话 | 7-29 验证截止日已过期未触发补强强提醒(v34 第十一轮已立 14:30 前必须看到活文档动作 · 已确认 7-29 evening 仍未触发 · 截止前补强窗口已关闭):4 验证截止日化(7-29 截止 v1 PDF 全文细节 + shell 工具列表 + 7-30 AAAI 2026 main vs industry track 区分 + 7-31 不同 LLM 迁移性 + 混合方案对照 + 8-15 长上下文/多模态跨任务迁移性)+ 7 反方硬标签: ① 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐ ② 200K context vs shell 工具边界不清——是"context stuffing + grep"而非 RAG 替代 ⭐⭐⭐⭐⭐(最高严重度) ③ 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐ ④ Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐ ⑤ Agent-as-retriever cost-benefit 未量化 ⭐⭐⭐ ⑥ 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐ ⑦ AAAI 2026 main vs industry track 区分不清 ⭐⭐ = §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 7 后续验证动作 7-29 ~ 8-15 截止日化 |
| v34 第十一轮脉络关系 | 与 v34 §2.3 评测表 22 行 + v34 §1.33c 横切 53c 商业 Harness 立标补全 + v34 §3.1 共识 121 + §3.2 争议 36 + §3.3 Q105.1 + §3.4 T110 同源;v34 §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 7 后续验证动作 已过期未触发补强 + 补救策略待决:1) 「7 反方 + 4 验证截止日已过期未触发补强」 = v34 §3.2 争议 36 7 反方激活窗口(v34 已立 → 本场 = 反方激活窗口 + 4 验证截止日时间轴注脚 · 已过期未触发补强 = 补救策略待决 = 7-29 evening 14:30 已过 + 7-29 evening 22:45 已确认仍未触发);2) 「飞 grep 检索范式转折已 7-29 截止 v1 PDF 全文细节待核 14:30 截止已过」 = v34 §1.33c 横切 53c 已收录 AAAI 2026 Subramanian arXiv:2602.23368v1 立标级 B 级 3.5/5 后续补救(v34 §2.3 第五十六 c 节点 v34 立标级升级 — v34 §3.2 争议 36 候选新增 — v34 §3.3 Q105.1 v34 部分解除 arXiv:2602.23368v1 已核 — 本场 = v34 已立 → v34 反方激活窗口 + v34 §3.3 Q105.8-Q105.10 候选新增 3 件 + v34 §4.1 开放问题 55 7 后续验证动作 已过期未触发补强 = 补救策略待决) |
| 反方 / 风险 | (A) arXiv:2602.23368v1 v1 PDF 全文细节 7-29 14:30 截止已过 未触发补强强提醒(已确认 v34 §3.2 争议 36 7 反方激活窗口 + 7-29 evening 22:45 已确认仍未触发);(B) shell 工具列表具体边界 200K context vs shell 工具边界不清 ⭐⭐⭐⭐⭐(最高严重度);(C) AAAI 2026 main vs industry track 区分 待核;(D) 不同 LLM 迁移性(论文仅 Claude 3 Sonnet,缺 GPT/Gemini/开源模型 head-to-head) + 与混合方案(Agent + 向量库)未对照;(E) Amazon Bedrock KB baseline 利益相关冲突(Amazon Science 作者团 · Amazon Bedrock KB baseline 可能仅是 Bedrock KB vs Agentic,缺第三方向量库 baseline);(F) Agent-as-retriever cost-benefit 未量化;(G) 长上下文/多模态跨任务迁移性 待核;(H) GitHub 链接 7-29 仍未核证(jay 7-27 08:22 csdn-substack-rag-finetuning + tom 7-27 0850 + stephen 7-27 1023 + stephen 7-28 22:45 = 6 实例均未补 = 本场 7-29 仍未补);(I) 补救策略待决(已过期未触发补强窗口进入补救阶段 = 7-30 014:30 截止前补救已关闭 · 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救 + 8-15 长上下文/多模态补救 4 阶段补救) |
| 建议归入节 | §3.2 争议 36(v34 已立 → v34 续立 + 4 验证截止日时间轴注脚 + 已过期未触发补强 + 补救策略待决)+ §3.3 Q105.1-Q105.10(v34 候选新增 10 件 → v34 候选持续追踪)+ §4.1 开放问题 55(v34 已立 7 后续验证动作 → v34 续立 + 7-29 14:30 截止已过 + 补救策略待决)+ §6 必读清单 沿用 arXiv:2602.23368v1 第 142 条 |
| 重要边界 | 不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,Subramanian = RAG 检索范式转折 = 边界形式化 vs 检索范式 不同对象;不要与 v34 §2.4 上下文管理五路线对立 混为同一件工作:五路线对立 = 完整日志 + lifecycle + 可观测性 + 文件系统 + 语义索引,Subramanian = 工具调用派检索 = 记忆/检索 vs 检索范式 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 文件系统即上下文 混为同一件工作:Markdown Memory = 工业级 Agent 厂商记忆原语,Subramanian = 学术 RAG 范式转折候选 = 记忆 vs 检索 不同对象;不要与 v34 §2.4 Beyond Relevance-Centric Retrieval arXiv:2607.19747 混为同一件工作:Beyond Relevance-Centric = 评分量规驱动 vs Subramanian = Agentic-as-retriever = 评分量规驱动 vs 工具调用派 不同 RAG 替代路径;不要与 v34 §2.4 LOCA-bench arXiv:2602.07962 7-29 新立 arXiv 混为同一件工作:LOCA-bench = 长上下文 agent 评测 anchor 新立,Subramanian = RAG 检索范式转折 = 评测 vs 检索范式 不同对象 |
增量 8 · ⭐⭐⭐ · 🟡 P2 警示 · 6 件新 arXiv 立标 paper_card 缺 + LOCA-bench paper_card 仍未建 + arXiv:2605.20173 SDB paper_card 仍未建 + arXiv:2607.12406 Isolation paper_card 仍未建 + arXiv:2607.21461 AREX paper_card 仍未建
| 字段 | 内容 |
|---|---|
| 来源 | stephen 7-29 1245 coordination-check-noon 持续缺口人工确认 + stephen 7-29 2245 coordination-check-evening §5 ⚠️ 警示 + spark-on-Tom 7-29 E3 review 收官(质量分 8/10 · 8 条建议 3 P0 改 5 P1 改 2 P2 改 · P0 #1 补全 100% relapse rate 细节 · P0 #2 澄清「98.4% OpenClaw 代码是基础设施」语义 · P1 #3 标注 Azure +21.6% 对照组维度 · P1 #4 加 RAG 主题词横向趋势收束 · P1 #5 APS-RAG 和 DeCoRAG 合并对比段 · P2 #6 调整 Trust-RAG Compass 框架契合度表述 · P2 #7 补 2607-22098 + 2607-22561 邻接 · P3 #8 CSDN 增量补具体日期) |
| arXiv 号 | 多件:arXiv:2607.25431 CodeNib + arXiv:2607.25996v1 RepoReasoner + arXiv:2607.25959v1 Kontrast + arXiv:2607.25600v1 BeyondUncertainty + arXiv:2602.07962 LOCA-bench + arXiv:2607.24653 Kimi K3 + arXiv:2605.20173 SDB + arXiv:2607.12406 Isolation-as-First-Class + arXiv:2607.21461 AREX |
| 一句话 | 6 件新立标 paper_card 缺 + LOCA-bench paper_card 仍未建 + 3 件既有立标 paper_card 仍未建 = pipeline 漏斗节点 · 7-30 截止前必须补建卡:(1) 7-29 4 件新 arXiv 立标 paper_card 待补:CodeNib + RepoReasoner + Kontrast + BeyondUncertainty · (2) 7-29 2 件新 arXiv 立标未建卡 paper_card 缺:LOCA-bench + Kimi K3 · (3) 既有 3 件立标 paper_card 仍未建:SDB arXiv:2605.20173(v34 §2.6 第四十二子节立标级 + 7-30 截止前必须补建卡)+ Isolation arXiv:2607.12406(v34 §2.5 第十一阶段 + flyP 安全主题页 anchor)+ AREX arXiv:2607.21461(v34 §2.5 第八十五节点候选 7-25 HF Daily #1 117▲ 当日 #1 但 paper_card 仍未补) |
| v34 第十一轮脉络关系 | 与 v34 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 + 61 Dadhich/Experience Distillation arXiv 编号 2 天未直查 沿用;v34 §4.1 开放问题 候选新增 70 pipeline 漏斗节点多件待补:1) 「6 件 7-29 新 arXiv 立标 paper_card 缺」 = v34 §4.1 开放问题 候选新增 70(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty + LOCA-bench + Kimi K3 + SDB + Isolation + AREX = 9 件待补);2) 「pipeline 漏斗节点 7-30 截止前必须补建卡」 = v34 §4.1 开放问题 54 沿用 + spark-on-Tom E3 review P0 警示(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + spark-on-Tom E3 review 质量分 8/10) |
| 反方 / 风险 | (A) 9 件 paper_card 漏斗节点是否全部 7-30 截止前补建卡?:(B) LOCA-bench paper_card 待建是否影响 v34 §2.1 Harness 学术化 第十二阶段 立标级补全?:(C) SDB paper_card 待建是否影响 v34 §2.6 第四十二子节立标级?:(D) Isolation paper_card 待建是否影响 v34 §2.5 第十一阶段 flyP 安全主题页 anchor?:(E) AREX paper_card 待建是否影响 v34 §2.5 第八十五节点候选 + 7-25 HF Daily #1 117▲?;(F) 9 件 paper_card 补建卡的优先级 与 v34 coding-agents.md 收录边界关系?待核 |
| 建议归入节 | §4.1 开放问题 候选新增 70 pipeline 漏斗节点 9 件 paper_card 7-30 截止前必须补建卡 + 沿用 v34 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 + 61 Dadhich/Experience Distillation arXiv 编号 2 天未直查 |
| 重要边界 | 不要与 v34 §4.1 开放问题 54 SDB 6 项 + 55 Subramanian 7 项 + 61 Dadhich/Experience Distillation arXiv 编号 2 天未直查 混为同一件工作:54/55/61 是 v34 第十一轮既有开放问题 + 本场 70 = 9 件 paper_card 7-30 截止前必须补建卡 = 已有开放问题 vs pipeline 漏斗节点 不同对象 |
二、值得警惕的矛盾或待核实说法
- Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露主权开源 2.0 立标级别边界:本场 12 实例同步承接候选升档「主权开源 2.0 立标栖立基础栖候选升级」但单一模型发布是否构成"路线分水岭"需谨慎:商业 frontier lab 历史护城河(评测系统卡 + 评论层 + 红队 + 经济测度产品化 + 治理研究第二阶段 + 资本层持续)不因单一开源模型发布而消失;v34 候选仅升档为"主权开源立标栖" 而非"主线分水岭"——这是 v34 §3.4 T113/T114 候选新增的措辞尺度问题(stephen 7-29 1245 + 2245 沿用 + spark 7-29 13:30 §三.1 + flyp 7-28 coding-agents-e1prep §0 警示)。
- Kimi K3 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-29 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成(jay 7-28 engineering-v38 §P2 警示 + spark 7-29 13:30 §三.7 + stephen 7-29 1245 + 2245 警示)——建议在知识库中标注"官方数据,待外部 benchmark 验证"。
- Kimi K3 vLLM/SGLang 官方支持时间线待核实(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + tom 7-29 2222 inference-e1prep §警示 1 + spark 7-29 1850 llm-infra-e1prep §警示 1)——DeepSeek-V3 当时的官方支持时间表作为参照。
- MXFP4/MXFP8 第 5 量化路线候选 vs INT8/INT4 本质区别:MoE 稀疏激活特性的定制化量化格式 工程意义 待核(jay 7-29 1055 five-category-briefing Backend B2 + spark 7-29 1850 主线 2 Raschka Kimi K3 Architecture Notes 419 分 HN Trending · LatentMoE + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA Delta Attention + Attention Residuals 训练 +4%/推理 +2% + 与 Nemotron 3 Ultra / DeepSeek V4 横向对比 + Raschka LLM Architecture Gallery 立标 7-29 已核证)。
- KDA/AttnRes 架构创新 vs DeepSeek 家族(V3/V4 技术报告)架构对比 待核。
- Lilian Weng Harness Engineering 是否引入新方法论 vs 仅「Harness Engineering」概念工程化?Weng 早在 2025-2024 已多次论及;RSI 自我改进定义 = Harness 本身成为优化目标,与 AREX arXiv:2607.21461 BAAI 递归自我改进 deep research agent 关系(head-to-head 对照)待核(MSR Harness 学术框架 vs AREX BAAI 实证 vs Weng 理论 三者对比 = v34 §4.1 开放问题 候选新增 65);MSR Memora vs Memory 频段架构 vs MemGPT 双时态知识图谱 vs Zep 三者关系 待核(v34 §4.1 开放问题 候选新增 66);MSR SkillOpt skills as trainable parameters vs Lilian Weng Harness Skill = context function pair
c_s = (ρ_s, F_s)互映 vs SDB §2.6 第四十二子节 SkillOpt 互映 待核(v34 §4.1 开放问题 候选新增 67)。 - ACE/MCE 实战细节:ACE itemized bullets id + description 不做全量 rewrite 的稳定性 vs full rewrite head-to-head 实证未公开;MCE 双层优化 convergence 保证 待核。
- CodeNib 多视图数据系统 视图复用 + 跨编辑一致性 8.7× baseline vs Sourcegraph / Zoekt / ripgrep 索引 head-to-head 待核,100 快照规模是否足够泛化(大型 monorepo / 多语言混合仓库未覆盖)。
- RepoReasoner 仓库级代码推理评测 vs LoCoBench-Agent / SWE-bench Verified / SpecBench head-to-head 待核,具体评测任务集与统计置信区间未公开。
- PAJAMA/Codifying the Judge 程序化评判器 vs LLM-as-judge 真实样本对比基准 + 与 SDB §2.6 第四十二子节 proposer + verifier 关系 待核,程序评判器可审计/可编辑边界 vs LLM-as-judge 灵活性的取舍待核。
- Kontrast 跨模态知识一致性四类不一致粒度差异 / 直接冲突 / 时序变化 / KG 不完整 vs Natural Questions / TriviaQA / HotpotQA 跨文本/表格/KG 三模态基准 head-to-head 待核,KG 来源 Wikidata 静态 vs Wikipedia 动态 更新机制待核。
- LOCA-bench paper_card 仍未建 + flyp 7-29 22:50 critical-read R1-R8 八反方待核(R1 = task semantics 固定性声明 / R2 = scaffold 类型覆盖度 / R3 = 开源模型覆盖度 / R4 = 评测任务数与统计可靠性 / R5 = 「context rot」与任务类型耦合 / R6 = 与 LOCA / LHTB / LongBench v2 对照完整性 / R7 = context engineering 算力成本 / R8 = 任务集大小与可污染性)= pipeline 漏斗节点 7-30 截止前必须补建卡 + 8 反方硬标签待补查。
- AAAI Subramanian 7 反方首批 7-29 验证截止日已过期未触发补强强提醒(stephen 7-29 1245 + 2245 = 14:30 截止前活文档动作仍未触发 · 已确认 7-29 evening 仍未触发 · 截止前补强窗口已关闭 · 后续补救策略待决)——7-30 014:30 截止前补救已关闭 · 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救 + 8-15 长上下文/多模态补救 4 阶段补救。
- 6 件 7-29 新 arXiv 立标 + 3 件既有立标 = 9 件 paper_card 待补(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty + LOCA-bench + Kimi K3 + SDB arXiv:2605.20173 + Isolation arXiv:2607.12406 + AREX arXiv:2607.21461)——pipeline 漏斗节点 · 7-30 截止前必须补建卡(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + spark-on-Tom 7-29 E3 review)。
- Anthropic Claude Opus 5 / Sonnet 5 / Fable 5 / Mythos 5 关系 + 工具使用相对 4.6 提升幅度 + Managed Agents effort 精度 vs OpenAI / Gemini effort head-to-head 7-29 仍未官方文档核证(stephen 7-29 ai-industry-v31 + spark 7-29 agent-v35 + flyp 7-28 coding-agents-e1prep §0 警示):v34 §3.2 争议 #31 + §4.1 开放问题 #47 沿用。
- microsoft/agent-governance-toolkit GitHub 链接 + 实现细节(jay 7-29 0940 github-trending-vecdb-substack-engineering 警示 + spark 7-29 agent-v35 §🔴 P0 立标 8)——v34 §4.1 开放问题 候选新增 71 待核。
- Anthropic Claude「密码学弱点发现」维度评估方法学 vs 现有密码学评估方法学(head-to-head)对比 待核;Dario Amodei 7-27~28 周末博客澄清 vs 监管打压指控 公开对峙 后续监管动态(action) 待核;HF 7-26 OpenAI rogue agent 入侵事件 vs Oracle 4 RCE CVE vs OWASP ASI vs HF 7 月安全事故 同源/异源关系 待核——v34 §4.1 开放问题 候选新增 72-73 待核。
- Molt 与 OpenForgeRL head-to-head 实证(v34 §4.1 开放问题 候选新增 56 沿用 + spark 7-29 agent-v35 沿用 7-28 警示):v34 §4.1 开放问题 61 spark-on-Tom E3 review 沿用。
- Learning on the Job 数字模糊(spark-on-Tom 7-29 E3 review P0 修正):论文原文应明确写出 1.6×/2.6×/22/84 + Mistral Large + Claude Sonnet 5 复现 + banking domain 单一场景 + 论文作者「Valentin Tablan, Scott Taylor, Kristoffer Bernhem(The Memory Company)」+ arXiv 2607.22157v1——v34 §4.1 开放问题 61 沿用。
- δ-mem 评级降级(spark-on-Tom 7-29 E3 review P0 修正沿用):⭐⭐⭐⭐ → ⭐⭐⭐(机制描述具体但独立可复现性未确认)+ 加入「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示——v34 §4.1 开放问题 61 沿用。
- Dadhich/Experience Distillation arXiv 编号 2 天未直查(spark-on-Tom 7-29 E3 review P0 修正沿用):arXiv:2607.21503 Agentic Context Management(Gaurav Dadhich)+ arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(Tom 单作者)2 天未在 rag.md/tom radar 中直查 arXiv 编号——v34 §4.1 开放问题 61 沿用。
- flyp v34 §3.3 反方 #55-#56 评级升级时机风险第一日 + 第二日持续激活(stephen 7-29 1245 + 2245 §3.5.4 沿用 7-28 警示):SDM P2 旁证 7-29 evening 是否回升?(已确认 7-29 evening 仍未回升 = 第二日复核节点沿用 7-28 evening 触发).
- evaluation 主题活文档持续更新 vs work-queue 状态不一致(stephen 7-29 12:45 + 2245 + spark 7-29 13:30 §一.1 🔴 沿用):沿用 7-28 警示。
- Spark E1 节奏 7-28 evening 双 E1 完整恢复 + 7-29 noon 协调棒判断 4 日回落已纠正 + stephen 7-29 1245 + 2245 修正(7-26 evening 双 E1 完整恢复第 1 棒 → 7-27 仅 RSS 通稿 → 7-27 evening 仅 RSS 通稿 → 7-28 截至 13:30 仍仅 RSS 通稿 = E1 节奏连续 3 日回落窗口 → 7-28 evening 双 E1 完整恢复第 4 棒 · 7-29 13:37 agent-v35 + 18:50 llm-infra-v10 双 E1 完整恢复第 5 棒 = 与 7-28 evening 双 E1 完整恢复判断一致 = stephen 7-29 1245 + 2245 节奏反转信号修正 4 日回落窗口判断为 节奏反转第 5 棒).
三、可引用的 arXiv 号列表
| arXiv 号 | 论文/工作 | 状态 | 来源 |
|---|---|---|---|
| 2607.24653 | Kimi K3(Moonshot AI · 2.8T MoE · Coding/Agentic SOTA) | ⚠️ 7-29 paper_card 待补 | stephen ai-industry-v31 + stephen llm-application-v40 + tom HF Daily 7-29 + jay B2 + spark gradient-flow + simon willison + flyp multimodal-v34 |
| 2602.07962 | LOCA-bench(可控上下文增长下评测语言 agent · ICML 2026 · HKUST-NLP · GitHub 开源) | ⚠️ flyp 7-29 22:50 critical-read · paper_card 待补 | flyp 7-29 22:50 LOCA-bench-long-context-agent-critical-read |
| 2607.25431 | CodeNib(代码 agent 多视图数据系统 serving repository context · 多视图 + 视图复用 + 跨编辑一致性 + 8.7× baseline) | ⚠️ 7-29 paper_card 待补 | tom 7-29 2040 v2 radar §1 ⭐⭐⭐⭐ |
| 2607.25996v1 | RepoReasoner(仓库级代码推理评测) | ⚠️ 7-29 paper_card 待补 | tom 7-29 2040 v2 radar §4 ⭐⭐⭐⭐ |
| 2607.22561 | Codifying the Judge / PAJAMA(LLM-as-judge 程序蒸馏替代 · 透明 + 可审计/可编辑 + 消除逐样本 API 成本) | ✅ paper_cards/631 7-29 04:00 · 主分类 evaluation | tom 7-29 1543 evaluation-e1prep §增量 1 ⭐⭐⭐⭐ |
| 2607.25959v1 | Kontrast(跨文本 + 表格 + KG 知识一致性检测) | ⚠️ 7-29 paper_card 待补 | tom 7-29 2040 v2 radar §3 ⭐⭐⭐ |
| 2607.25600v1 | BeyondUncertainty(推理步骤置信度传播) | ⚠️ 7-29 paper_card 待补 | tom 7-29 2040 v2 radar §4 ⭐⭐⭐ + stephen 7-29 2245 |
| 2602.23368v1 | AAAI 2026 Subramanian「Keyword Search Is All You Need」 | ✅ v34 §2.3 立标级候选 B 级 3.5/5 · paper_card 已核 · 7-29 14:30 截止前活文档动作未触发补强 · 已确认 7-29 evening 仍未触发 · 截止前补强窗口已关闭 · 后续补救策略待决 | v34 §2.3 第五十六 c 节点 + v34 §3.2 争议 36 + v34 §3.3 Q105.1 |
| 2510.04618 | ACE(Agentic Context Engineering · context = evolving playbook · Generator + Reflector + Curator) | ⚠️ Lilian Weng Harness Engineering 相关 arXiv · paper_card 待核 | jay engineering-v39 + jay engineering-filter-rss-round v3 A1 + spark agent-v35 §立标 1 |
| 2601.21557 | MCE(Meta Context Engineering · 双层优化 · 内层 / 外层) | ⚠️ paper_card 待核 | jay engineering-v39 + spark agent-v35 §立标 1 |
| 2607.22529 | Skill Self-Play LLM 协同进化 | ⚠️ paper_cards 待补 | jay 7-28 B2 · HF Daily 7-28 第 9 |
| 2607.20911 | Tencent WorkBuddy Bench Contamination-Resistant Coding Agent Benchmark | ⚠️ v34 §2.4 54 节点邻接 · paper_card 待补 | HF Daily 7-26 |
| 2607.21557 | OpenForgeRL Train Harness-native Agents in Any Environment | ✅ paper_cards/585 · v34 §2.5 第八十四节点 | jay 7-26 沿用 |
| 2607.12406 | Isolation as a First-Class Principle for LLM-Agent System Safety | ⚠️ v34 §2.5 第十一阶段 flyP 安全主题页 anchor · paper_card 仍未建 | stephen 7-27 1023 + spark 7-29 agent-v35 警示 |
| 2607.21461 | AREX 面向深度研究的递归自我改进 Agent(BAAI) | ⚠️ paper_card/585 沿用 · v34 §2.5 第八十五节点候选 · paper_card 补建待核 | HF Daily 7-23 117▲ · 7-27 139▲ · 7-28 142▲ · 7-29 263▲(AREX vs Kimi K3 不同对象) |
| 2605.20173 | SDB Stochastic-Deterministic Boundary | ⚠️ v34 §2.6 第四十二子节立标级 · paper_card 仍未建 · 7-30 截止前必须补建卡 | jay 7-27 1100 + 1123 + stephen 7-27 12:45 + spark 7-27 agent-e1prep |
| 2607.21653 | Molt A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning | ✅ paper_cards/607 7-28 12:30 | tom radar 7-28 0840 + HF Daily |
| 2607.22157v1 | Learning on the Job Continual Learning from Deployment Feedback for Frozen-Weights Agents | ✅ paper_cards/610 7-28 12:30 · v34 §2.4 第 18 件候选 P3 | tom radar 7-28 0840 高价值 #1 + Tablan, Taylor, Bernhem |
| 2607.22375 | IDEAgent Agentic Quality-Diversity Search for Research Idea Generation | ✅ paper_cards/604 7-28 02:10 | tom rag-v47 |
| 2607.14277 | Multi-Head Latent Control A Unified Interface for LLM Agent Decision Making | ✅ paper_cards/608 7-28 | tom radar 7-28 0840 高价值 #2 + jay engineering-v38 §增量 7 |
| 2607.18141 | HyMCache CXL 混合内存 KV Cache | ✅ v34 §2.5 第八十六节点 | jay 7-27 1123 |
| 2607.21503 | Agentic Context Management(Gaurav Dadhich) | ✅ paper_cards/564 7-25 · v34 §2.2 58 节点 + spark-on-Tom E3 review 待直查 arXiv 编号 | spark-on-Tom E3 review 待直查 arXiv 编号 |
| 2607.21051 | Sample-Efficient Learning from Agent Experience(Experience Distillation · Tom 单作者) | ✅ paper_cards/567 7-25 · v34 §2.2 第 60 节点 + spark-on-Tom E3 review 待直查 arXiv 编号 | spark-on-Tom E3 review 待直查 arXiv 编号 |
| 2607.12227 | Rethinking the Evaluation of Harness Evolution for Agents | ✅ paper_cards/434 · v34 §2.5 第八十五节点 | HF Daily 7-13 |
| 2607.21576 | Self-Supervised Structured Dynamics from Videos | ⚠️ HF Daily 7-27 旁证沿用 · flyp v34 §3.3 反方 #55-#56 第一日 + 第二日复核节点持续激活 | HF Daily 7-25 28▲ → 7-26 18▲ → 7-27 18▲ → 7-28 18▲ 持平未回升 · 7-29 evening 是否回升 待核 |
四、检查过的来源清单(无显著新增量时如实写明并列出检查过的来源)
| 来源 | 文件 / 路径 | coding-agents 主题覆盖 |
|---|---|---|
| work-queue.md | /shared/research-kb/organized/queue/work-queue.md |
待建卡 8 + 待更新主题 0 + 选题榜 1(2607.23242 IndicTalk = llm-infra 邻接)+ 富化缺口 66 张卡缺 TLDR(待 cron_s2 覆盖) |
| flyp/inbox/flyp | 2026-07-29-0950 multimodal-e1prep-v34 第二棒 |
v34 接力窗口第二棒 E1 · 35 件 v34 候选增量(主分类 coding-agents 主增量 6 件立标级/立标级候选 沿用) |
| flyp/inbox/flyp | 2026-07-29-0952 long-context-multimodal-rag-dual-review |
双稿轻量精读(AcademicEval 2510.17725 TMLR 已接收 + Scaling Beyond Context 2510.15253 ACL2026 Main 已接收 · 主分类 long-context + rag 邻接) |
| flyp/inbox/flyp | 2026-07-29-2250-LOCA-bench-long-context-agent-critical-read |
🔴 LOCA-bench arXiv:2602.07962 短审稿 · 本场增量 2 · 第十二阶段 长上下文 agent 评测 anchor 立标级 |
| jay/inbox/jay | 2026-07-29-0822 csdn-rag-agent-multimodal |
🔴 CSDN Agent 工具调用四范式(FC/MCP/CLI/Skills)30/300 决策树 v34 实战层细化版本 · 本场增量 5 |
| jay/inbox/jay | 2026-07-29-0940 july2026-github-trending-vecdb-substack-engineering |
microsoft/agent-governance-toolkit 5.2k★ + GitHub Trending 7 月汇总 · 本场增量 5 |
| jay/inbox/jay | 2026-07-29-1055 jay-engineering-filter-rss-round v3 |
⭐⭐⭐⭐⭐ A1 Lilian Weng Harness Engineering for Self-Improvement + A2 MSR Memora + A3 uv 0.12.0 · 本场增量 4 |
| jay/inbox/jay | 2026-07-29-1105 jay-five-category-briefing #11 |
Backend B2 Kimi K3 MoE 首个 3T 参数开源 MoE · 本场增量 3 |
| jay/inbox/jay | 2026-07-29-1105 jay-engineering-e1prep-v39 |
5 件 P0/P1 + 4 件 P2 参考归档 · Lilian Weng Harness Engineering + MSR Memora + Kimi K3 · 本场增量 4 + 沿用 3 |
| jay/inbox/jay | 2026-07-29-1105 jay-rag-agent-csdn-survey-v2 |
13 件跨三栖综合调研 · CSDN Agent 工具调用四范式 沿用 · 本场增量 5 沿用 |
| jay/inbox/jay | 2026-07-29-0853 rag-e1prep-v48 |
R47 → R48 接力(主要 RAG 主题 · coding-agents 主题沿用 Subramanian 7 反方) |
| jay/inbox/jay | 2026-07-29-1140 news-x-tech-radar |
Andrew Ng LearnVector + Sam Altman singularity + Sam Altman 华盛顿国会闭门会 + HF OpenAI rogue agent + Dario Amodei 澄清 + Karpathy bio Anthropic 字段移除 · 本场增量 6 沿用 |
| tom/inbox/tom | 2026-07-29-0900 hf-daily-2026-07-29 |
HF Daily 7-29 票榜 15 件全核 · Kimi K3 263▲ 单日 +121 暴增登顶 + JarvisHub 104▲ + Progress Reward Modeling 综述 68▲ + StateAct 53▲ + Sol-Attn 25▲ · 本场增量 3 沿用 + 邻接 2 |
| tom/inbox/tom | 2026-07-29-0840 agent-rag-longcontext-radar |
7-29 早场 ⭐⭐⭐⭐ A New Role for Relevance arXiv:2607.24223 62▲ + Keep It InMind arXiv:2607.24368 19▲ implicit-association blind spot · 邻接 |
| tom/inbox/tom | 2026-07-29-1441 agent-rag-longcontext-radar |
早场 1441 中场 沿用 |
| tom/inbox/tom | 2026-07-29-2040 agent-rag-longcontext-radar v2 |
🔴 ⭐⭐⭐⭐ A CodeNib arXiv:2607.25431 + Cyber-Capable AI Agents arXiv:2607.25379v1 + Kontrast arXiv:2607.25959v1 + BeyondUncertainty arXiv:2607.25600v1 + RepoReasoner arXiv:2607.25996v1 · 本场增量 1 + 邻接 3 |
| tom/inbox/tom | 2026-07-29-1543 evaluation-e1prep |
🔴 ⭐⭐⭐⭐ P1 增量 1 Codifying the Judge PAJAMA arXiv:2607.22561 + 增量 2 Keep It InMind arXiv:2607.24368 · 本场增量 1 沿用 |
| tom/inbox/tom | 2026-07-29-2222 inference-e1prep evening 收官棒 |
24h 窗口 · 增量 1 Raschka Kimi K3 Architecture Notes 419 分 HN Trending · 增量 2 FlashInfer→SGLang/vLLM 集成数据 · 增量 3 vLLM Conference 2026 Roadmap · 本场增量 3 沿用 |
| spark/inbox/spark | 2026-07-29-1337 agent-e1prep-v35 准备棒 |
🔴 P0 立标 1 Lilian Weng Harness Engineering 学术框架 + 立标 2 MSR Memora + 立标 3 SkillOpt + 立标 4 Dario Amodei 周末博客 + 立标 5 HF OpenAI rogue agent + 立标 6 arXiv:2607.22682 多 Agent 系统设计词汇表 + 立标 7 Anthropic 7-29 NEW 密码学弱点发现 + 立标 8 microsoft/agent-governance-toolkit + 立标 9 CSDN Agent 工具调用四范式 · 本场增量 4 + 5 + 6 |
| spark/inbox/spark | 2026-07-29-1850 llm-infra-e1prep-v10 evening 收官棒 |
7 主线 + 3 旁证 + 2 警示 · Kimi K3 arXiv 立基础 + Raschka Kimi K3 架构 + FlashInfer 集成 + vLLM Conference 2026 Roadmap + SGLang vs vLLM + CNCF llm-d + Colibri 纯 C 25GB RAM 744B MoE · 本场增量 3 沿用 + llm-infra 邻接 |
| spark-on-Tom | 2026-07-29-1430 E3 review 收官 |
质量分 8/10 · 8 条建议 3 P0 改 5 P1 改 2 P2 改 · P0 #1 补全 100% relapse rate 细节 · P0 #2 澄清「98.4% OpenClaw 代码是基础设施」语义 · P1 #3 标注 Azure +21.6% 对照组维度 · P1 #4 加 RAG 主题词横向趋势收束 · P1 #5 APS-RAG 和 DeCoRAG 合并对比段 · P2 #6 调整 Trust-RAG Compass 框架契合度表述 · P2 #7 补 2607-22098 + 2607-22561 邻接 · P3 #8 CSDN 增量补具体日期 |
| stephen/inbox/stephen | 2026-07-29-1025 ai-industry-e1prep-v31 准备棒 |
6 件 P0 立标 · 🔴 P0 增量 1 HF Daily 7-29 票榜 14 件替换 + Kimi K3 arXiv 立基础 · 增量 2 Dario Amodei 周末博客澄清 · 增量 3 HF 7-26 OpenAI rogue agent 入侵 · 增量 4 Andrew Ng + Sam Altman · 增量 5 Karpathy bio · 增量 6 TLDR AI 7-28 头条 · 9 件 7-29 上午 frontier/industry 立标 · 本场增量 3 + 6 |
| stephen/inbox/stephen | 2026-07-29-1245 coordination-check-noon |
5 实例 E1/radar/briefing/csdn/critical-read 全员在岗 + 1 件统一主线立标续立升级 Kimi K3 arXiv:2607.24653 立基础 · 12 件 noon 持续缺口待人工确认 + AAAI Subramanian 7 反方首批 7-29 验证截止强提醒 + spark-on-Tom E3 评审 3 件 P0 修正 |
| stephen/inbox/stephen | 2026-07-29-2110 llm-application-e1prep-v40 |
8 件主线增量 + 1 件旁证 · Kimi K3 arXiv 立基础 + HF Daily 7-29 票榜 + jay engineering-v39 5 件 P0/P1 · 主线 ① Coding Agent 候选池 5 联 Harness Engineering 学术立标补全 第 3 例 · 本场增量 4 沿用 |
| stephen/inbox/stephen | 2026-07-29-2245 coordination-check-evening |
7-29 evening 17 件新立标(其中 CodeNib + Kimi K3 + 多件邻接)+ 8 大主题活文档(ai-industry/agent/rag/multimodal/systems/engineering/llm-application/llm-infra/risk/evaluation/database/coding-agents)接力窗口预备完成 + 1 件统一主线立标续立升级 Kimi K3 + 13 件需要人工确认/修正/强提醒 · 本场增量 1 + 3 沿用 |
| paper_cards/ | 007-2606-13141.md 到 642-2607-24957.md |
643 张 · 近 3 天主分类 agent 新卡 11 张(OpenComputer/MAGE/User as Code/π-Bench/ALE/Metaprogramming/DeLM/Context-Fractured Attacks/Parthenon Law/Agentic RAG Survey/MCP Design Patterns/TOKI 等)+ 主分类 agent 总计 15 张 · 占比 ~21% · 0 张主分类 coding-agents · 7-29 4 件新 arXiv 立标 paper_card 待补(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty)+ LOCA-bench paper_card 待补 + Kimi K3 arXiv:2607.24653 paper_card 待补 + SDB arXiv:2605.20173 paper_card 仍未建 + Isolation arXiv:2607.12406 paper_card 仍未建 + AREX arXiv:2607.21461 paper_card 仍未建 = 9 件 paper_card 待补 = pipeline 漏斗节点 |
| knowledge/coding-agents.md | /shared/research-kb/organized/knowledge/coding-agents.md |
v34 Wave4 E1 第十一轮 7-28 04:20:16 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座 沿用 + §2.3 评测表 22 行(arXiv:2602.23368v1 已核)+ §2.4 后训练 18 件候选 + 上下文管理五路线对立 + §2.5 安全契约 11 阶 + 86 节点 + §2.6 多模态/CLI/IDE + 42 子节立标级 + 共识 43 / 争议 36 / 开放问题 55 / 趋势 35 / 必读 142 |
总结:本场 E1 预消化共识别 7 件增量(6 件 P0 + 1 件 P1)+ 1 件 P2 警示,涉及 arXiv 号 8 件新立标候选(arXiv:2607.24653 Kimi K3 + arXiv:2602.07962 LOCA-bench + arXiv:2607.25431 CodeNib + arXiv:2607.25996v1 RepoReasoner + arXiv:2607.22561 PAJAMA + arXiv:2607.25959v1 Kontrast + arXiv:2607.25600v1 BeyondUncertainty + arXiv:2510.04618 ACE + arXiv:2601.21557 MCE)+ 6 件跨主题补全 / 沿用升级(Lilian Weng Harness Engineering + MSR Memora + MSR SkillOpt + CSDN Agent 4 范式 30/300 决策树 + microsoft/agent-governance-toolkit + Anthropic 7-29 NEW + Dario 7-27~28 周末博客 + HF 7-26 OpenAI rogue agent)+ 1 件 P1 监测(AAAI Subramanian 7 反方首批 7-29 14:30 截止已过 未触发补强强提醒 · 后续补救策略待决)+ 9 件 paper_card 7-30 截止前必须补建卡(CodeNib + RepoReasoner + Kontrast + BeyondUncertainty + LOCA-bench + Kimi K3 + SDB + Isolation + AREX)。