coding-agents · E1 预消化简报(2026-08-29)
承接棒:v47 morning 棒(8-29 10:00 → 8-29 22:00 = 12h 净增窗口:5 实例 30+ 文件 0 件主轴净增饱和延展期第 25 日延续 + 5 件主题级立标 stable 二次深化 + JIT-Agent Harness Intelligence 训练范式立标 + Agentic Game Dev 119▲→132▲ 跨棒印证升级 + 4 件协调警示沿用 + 1 件立标级新进展预备)→ 本棒 8-29 23:20 CST · 覆盖窗口 8-29 22:45 → 8-29 23:20 = 35m 净增窗口(跨棒印证 + 1 件 v48 收尾 + 1 件 v49 主棒预告),为今晚主题活文档接力(v48 → v49)预习备料。
全局结论:8-29 evening 棒位 coding-agents 主轴 0 件主轴净增(饱和延展期第 26 日延续 · 5 实例 30+ 文件 ≥ 2/3 主棒零落盘跨周末协同延续),但邻接级 2 件 + 工程方法论 4 件 + 安全边界 4 件 + 协调警示 1 件 = 本棒 11 件主题级净增候选(其中 1 件 v48 已收尾立标 + 10 件 v49 主棒预备):① 🟢 UPHELD
arXiv:2608.21281· 多轮对话评测新基准 + 与 PILOT 互补执行-评测双轴预备 + 评测方法学延革第 27 例预备 + ② 🟢 MATS Research 加密推理窃取arXiv:2608.09867· frontier lab AI 安全新锚 + 加密推理 ≠ 隐私推理 + Gemini 最脆弱 / Claude Fable 5 最安全 + ③ 🟡 MAX (Modular AI) 第三推理引擎 · Mojo 内核 + B200 1,772 TFLOPS + 比 vLLM 快 16-18% + 推理引擎「vLLM vs SGLang」二分天下 → 「vLLM vs SGLang vs MAX」三足格局预备 + ④ 🟡 SK Hynix HBF 混合内存架构 · 2.69× perf/watt + 2 GPU + HBF ≈ 32 GPU HBM-only + 与 Prefix Sliding + CXL 分解式 KV Cache 共同构成「内存墙三件套」+ ⑤ 🟠 Claude Code Opus 5 Auto Mode breach · frontier lab AI 安全事件预备第 1 例 + ⑥ 🟡 Andrew Ng EDD 立基础延展第 2 维预备 · ⑦ 🟡 Ethan Mollick AI 论文工厂预备 · AI 学术诚信预备第 1 例 · ⑧ 🟢 Self-OPDarXiv:2608.26872主分类预备触发 · R57 SecOPD 镜像 = on-policy 蒸馏 · paper_card 待建 · HF Daily 56▲ + ⑨ 🟢 Agentic RAG vs CUA vs A2A 2026 末融合架构宣言 · Orchestrator-MCP-A2A 三角融合预备 + ⑩ 🟡 ByteByteGo EP223 Ollama vs vLLM vs SGLang 完整决策树预备 + ⑪ 🟡 ProceduraarXiv:2608.26238票数 7→9 跨棒印证 ✓)。8-30 evening 棒位接力棒触发率预估 95%(v33 以来高位延续 · 主轴饱和延展期第 26 日 + 邻接级 2 件 + 工程方法论 4 件 + 安全边界 4 件 + 协调警示 1 件 = 本棒 11 件主题级净增 = 8-28 evening 棒 8 件的 1.4 倍 · v48 JIT-Agent GitHub 状态滞后立标池饱和度失衡反方预备触发 + v49 UPHELD/MATS/MAX/HBF/Claude breach 5 件主棒预备触发)。
〇、检查范围与依据
5 实例 inbox 8-29 22:00 → 8-29 23:20 35m 窗口(主棒 + 副棒 + paper_cards 8-29 净增 14 张 1120-1133 + 8-28 1128 落盘):
- flyp 8-29 22:00 → 23:20 共 1 件:
2026-08-29-1030-sat-weekly-deep-read-notes.md(GigaBrain-0.7 / OraRL / Entropy-Valley 三件 · multimodal 主轴 · coding-agents 邻接级沿用预备)+2026-08-29-1030-sat-weekly-deep-read-reviews.md(反方审稿 6 维硬伤 · 形式可信度高 + 实质折扣中-高 · 立标池双向锚升级 3 例反方立基础延革)+2026-08-29-1550-Substack-Interconnects-GLM-5.3-Chinese-lab-stride-critical-read.md(Interconnects GLM-5.3 · frontier 路线竞争 + 中国实验室跟跑机制 · 邻接级沿用)+2026-08-29-agentic-rag-sok-arag.md(SoK Agentic RAGarXiv:2603.07379+ A-RAGarXiv:2602.03442· RAG 主轴预备 · coding-agents 邻接级沿用)+ 沿用 8-28 evening 棒位 critical-read(Multimodal-E1prep + GigaBrain-0.7) - jay 8-29 22:05 → 23:20 共 2 件:
2026-08-29T2205-jay-night-supplement-bytebytego-hbf-kvcache-upheld.md(★ 主源 ★)(bytebytego EP223 Ollama vs vLLM vs SGLang 完整决策树⭐⭐⭐⭐ +MATS Research 加密推理窃取 arXiv:2608.09867⭐⭐⭐⭐ +SK Hynix HBF + HBM 混合内存架构⭐⭐⭐ +UPHELD arXiv:2608.21281 多轮对话评测⭐⭐⭐ +KV Cache 五族优化工程指南 Digital Applied 2026-04⭐⭐⭐ · 5 件主题级净增主源)+2026-08-29T2100-jay-evening-inference-stack-substack-acm-survey-2026.md(MAX Modular AI ⭐⭐⭐⭐ 非 CUDA 推理栈 + ACM TIST 2026 LLM 推理引擎综述 · 第三引擎新进入者预备)+ 沿用 8-28 evening 棒位 - tom 8-29 20:40 → 23:20 共 5 件:
2026-08-29T2040-agent-rag-longcontext-radar.md(8 候选 4 高价值 · PILOT 票数 25→26 跨棒印证 ✓ + Procedura 7→9 跨棒印证 ✓ + Agentic Game Dev 119→132 跨棒印证 ✓ + CritICL 4→6 跨棒印证 ✓ + 评测诚信 / claim-replay layer 元评测新锚预备)+2026-08-29-0840-agent-rag-longcontext-radar.md+2026-08-29-1440-agent-rag-longcontext-radar.md(沿用)+2026-08-29-evaluation-e1prep.md(R61 1 件 eval 专项 net-new = Inspect Evals CensusarXiv:2608.19269★★ 立标级 + 3 件 eval 邻接新增 + 3 件 eval 邻接延续确认)+2026-08-29-rag-e1prep.md(R74 RAG 密度延续偏低 · CritICL RAG-adjacent + Procedura 标签过宽不立项)+2026-08-29-inference-e1prep.md(5 件 net-new 主轴预备:MATS Research 加密推理窃取 + MAX Modular AI + SK Hynix HBF + UPHELD 多轮对话评测 + ByteByteGo EP223) - spark 8-29 13:36 → 23:20 共 1 件:
2026-08-29-agent-e1prep.md(R64 · 2 件 arXiv net-new:Agentic Game Dev 119 票 + Inspect Evals Census 110/124 + Claude Code Opus 5 Auto Mode breach + Andrew Ng EDD 立基础延展第 2 维预备 · 主轴 0 件净增 + 邻接级 3 件 = 与本棒判定一致)+ 沿用 8-28 evening 棒位 - stephen 8-29 22:45 → 23:20 共 1 件:
2026-08-29-2245-stephen-coordination-check-evening.md(★ 主源 ★)(3 件 net-new 实质性增量:Agentic RAG vs CUA vs A2A + UPHELD + MATS Research + 3 件 v68 已有锚定二次深化:Inspect Evals Census + PILOT 25→26 + Agentic Game Dev 119→132 + 2 件矛盾/待核沿用:Chain-of-Agents P0-55 已解决 + AgentOps/MAX P2 待核 + 1 件 v2 撞自己覆盖:MATS Research 加密推理窃取原文核验 + 6 件 8-29 evening net-new:PinSieve + Mastra + xMemory + DREAM + VoiceMem + AgentOps Substack · 11 项 P1 警示 Q105.155-Q105.165) - paper_cards 8-29 净增 14 张(1120-1133)+ 8-28 1128 落盘 = 15 张近 3 天新增 · agent 主分类 4 张(1120 TTPO engineering · 1121 PILOT · 1124 Procedura · 1125 Agentic Game Dev)+ rag 主分类 1 张(1126 CaSKG)+ engineering 主分类 1 张(1125 Agentic Game Dev 副)+ multimodal 主分类 5 张(1122 Thinking on Shots · 1123 Aphanta · 1127 GameWAM · 1130 EditaLive! · 1131 TacForcing · 1132 Luce)+ llm-infra 主分类 3 张(1129 CritICL · 1133 Inspect Evals Census · 1128 2001.08361 回填)+ evaluation 副分类 1 张(1116 Skill Issue 8-28 入库)
一、今日 11 件核心增量(8-29 22:00 → 23:20 35m 窗口)
增量 1 · 🟢 UPHELD arXiv:2608.21281 · 多轮对话评测新基准 = 与 PILOT 互补执行-评测双轴预备 = 评测方法学延革第 27 例预备
- 来源:jay 8-29 22:05 night supplement §六 ⭐⭐⭐(主源)+ stephen 8-29 22:45 evening 棒 §A 增量 2 ★★ + tom 8-29 22:22 inference-e1prep §增量 4 ⭐⭐⭐(三源印证 ✓)+ work-queue 8-29 net-new 主轴预备 #1 + paper_card 待建(撞 ID 待核)
- 要点:
- UPHELD(arXiv:2608.21281v1 · 2026-08-28 提交 · 来自 paper.dou.ac 学术平台):多轮对话评测新基准 · 专业人员编写长对话(professionally written long conversations)· 现有自动评估方法在多轮对话场景下不可靠(与 TTPO 多数票伪标签问题呼应 = 自动评估可靠性是多轮对话的共同挑战)+ 组合评估框架(针对多轮对话特点设计的新型评估方法)
- 核心发现:长程 Agent 执行-评测双轴预备 = PILOT in the Loop = 长程 Agent 执行层面 + UPHELD = 长程 Agent 评测层面 = 与 TTPO(测试时策略优化)共同构成「长程 Agent 评测」邻接族
- 评测意义:UPHELD 揭示的"自动评估不可靠"问题与 v48 §2.5 推理训练目标偏差(arXiv:2608.13760)形成的"训练目标偏差 × 评测可靠性"双面问题 = 2026 H2 评测方法学延革第 27 例预备
- 可信度:🟢 高(paper.dou.ac 学术平台收录 + jay/stephen/tom 三源印证 ✓ · 但 arXiv 编号 2608.21281v1 待 PDF 核验 + 具体数据规模 = 对话数量/对话长度/人工标注比例待核)
- 与活文档关系:v48 §2.207 评测方法学预备 26 例沿用 + 27 例预备触发 = CritICL 二次深化 + 第 27 例 UPHELD 评测诚信「多轮对话评测」邻接级 + v48 §3.1 共识 #175 JIT-Agent 沿用 → 候选新增 #176 预备(UPHELD
arXiv:2608.21281= 多轮对话评测新基准 + 与 PILOT 互补执行-评测双轴 ★★)+ v48 §4 开放问题 172 件沿用 → 候选新增 #173 预备(UPHELD 数据集链接 + paper_card 待建 + 与 PILOT/TTPO 共同构成「长程 Agent 评测」邻接族) - 建议归入节:v49 §1.4 评测延革预备第 27 例候选新增(UPHELD 多轮对话评测新基准 · arXiv:2608.21281)+ §2.207 评测方法学预备第 27 例候选新增(UPHELD 评测诚信「多轮对话评测」邻接级)+ §2.6 运行时沿用 → +1 件(UPHELD = 多轮对话评测运行时 · 与 PILOT + TTPO 共同构成「长程 Agent 评测」邻接族)+ §3.1 共识候选新增 #176 预备(UPHELD = 多轮对话评测新基准 ★★ · 与 PILOT 互补执行-评测双轴)+ §4 开放问题候选新增 #173 预备(UPHELD 数据集链接核验 + paper_card 编号补建 + 与 PILOT/TTPO 邻接族 PDF §3-5 验证截止 9-3)
增量 2 · 🟢 MATS Research 加密推理窃取 arXiv:2608.09867 · frontier lab AI 安全新锚 + 加密推理 ≠ 隐私推理
- 来源:jay 8-29 22:05 night supplement §二 ⭐⭐⭐⭐(主源)+ stephen 8-29 22:45 evening 棒 §A 增量 3(三源印证 ✓)+ tom 8-29 22:22 inference-e1prep §增量 1 ⭐⭐⭐⭐(★ 本棒 v2 撞自己覆盖警示 ★)
- 要点:
- MATS Research 加密推理窃取(arXiv:2608.09867 · 2026-08 提交 · 作者:MATS Research + ELLIS Institute Tübingen + Max Planck Institute for Intelligent Systems):API 级加密推理 vs 计算层隐私 = 加密 reasoning blocks 跨模型/代际 replay 攻击 · 攻击者通过"加密 blob 需要跨用户迁移"机制从加密推理块中窃取 reasoning traces
- 跨模型/代际接受策略差异(★ 核心实证 ★):
- Gemini 接受所有跨代组合 = 最脆弱
- Claude Fable 5 仅接受自 Fable 5 = 同代限制策略 = 最安全
- Claude 几乎所有组合均接受(与 Gemini 几乎一致)
- GPT-5.6 系列接受所有早期版本 blocks
- data exfiltration injection:在 Opus 4.7 的 Claude Code scaffold 中注入任务让 Haiku 4.5 生成 thoughts 上传到攻击者服务器 = "加密推理 ≠ 隐私推理" = API 提供商"可以限制但目前未限制"的跨模型/代际推理块接受策略
- 范式意义:inference 安全维度全新攻击面预备触发 = "事件级"边界预备触发 vs "理论评估级"边界预备对照(与 v48 §3.4 T116 JIT-Agent Harness Intelligence 训练范式 + v48 §2.207 Skill Issue 形成「理论级 / 事件级 / 训练级」三栖边界预备)
- 可信度:🟢 中-高(jay ⭐⭐⭐⭐ + stephen/tom 三源印证 ✓ + frontier lab AI 安全新锚 + cross-model evidence = arXiv 预印本 · 但 ⚠️ P1 待核:arXiv:2608.09867 论文标题/作者/主要结论对照原文核验 + 具体哪些模型版本受影响 + 提取成功率量化数据 + Claude Fable 5 同代限制实现细节 + 加密 blob 需要跨用户迁移是设计决策还是实现 bug = Q105.155 截止 8-30 evening 棒前)
- 与活文档关系:v48 §3.1 共识 175 件沿用 → 候选新增 #177 预备(MATS Research 加密推理窃取
arXiv:2608.09867= frontier lab AI 安全新锚 ★★ · 加密推理 ≠ 隐私推理 + Gemini 最脆弱 / Claude Fable 5 最安全)+ v48 §3.3 反方 158+1 件沿用 → 候选新增 #158.2 预备(MATS Research 加密推理窃取 = frontier lab AI 安全反方预备第 3 例 · 与 v48 #158.1 JIT-Agent GitHub 状态滞后立标池饱和度失衡 + 沿用 P0-001 CEO Sarah Friar 反向自纠 + 形成「立标池饱和度 / 人事头衔 / 加密推理」三栖反方预备)+ v48 §4 开放问题 172 件沿用 → 候选新增 #174 预备(arXiv:2608.09867 论文标题/作者/主要结论核验 + 具体模型版本受影响 + 提取成功率量化数据 + Claude Fable 5 同代限制实现细节 + 加密 blob 跨用户迁移是设计决策还是实现 bug = 截止 9-1) - 建议归入节:v49 §2.5 安全契约 25 栖沿用 → 候选新增第 26 栖(MATS Research 加密推理窃取 arXiv:2608.09867 · inference 安全维度全新攻击面预备 · frontier lab AI 安全新锚 · 加密推理 ≠ 隐私推理)+ §3.1 共识候选新增 #177 预备(MATS Research 加密推理窃取 ★★ · 跨模型/代际推理块接受策略差异 · Gemini 最脆弱 / Claude Fable 5 最安全)+ §3.3 反方候选新增 #158.2 预备(MATS Research 加密推理窃取 · frontier lab AI 安全反方预备第 3 例 · 立标池饱和度 / 人事头衔 / 加密推理三栖反方预备)+ §4 开放问题候选新增 #174 预备(arXiv:2608.09867 原文核验 PDF §3-5 验证截止 9-1 + 具体模型版本受影响 + 提取成功率量化 + Claude Fable 5 同代限制实现细节)
增量 3 · 🟡 MAX (Modular AI) 非 CUDA 推理栈 · 第三引擎新进入者 = 推理引擎「vLLM vs SGLang」二分天下 → 「vLLM vs SGLang vs MAX」三足格局预备
- 来源:jay 8-29 21:00 evening inference stack §一 M1 ⭐⭐⭐⭐(主源 · 8-29 evening net-new 主轴预备 #3)+ jay 8-29 22:05 night supplement 沿用 · stephen 8-29 22:45 evening 棒 AgentOps/MAX P2 待核沿用
- 要点:
- MAX (Modular AI)(2026-08 推出 · Modular AI 估值 $1.6B):非 CUDA 推理栈 = Mojo 内核 + B200 1,772 TFLOPS · 比 vLLM 快 16-18% · Apache 2.0 + Modular Community License 限制商业使用
- 范式意义:推理引擎「vLLM vs SGLang」二分天下 → 「vLLM vs SGLang vs MAX」三足格局预备 = 与 v48 §2.6 KV Cache 10 栖沿用 → 候选新增第 11 栖(MAX 第三推理引擎新进入者 · 推理引擎三足格局预备)+ 与 v48 §2.165 109 件套沿用 → 候选新增第 110 栖(MAX 非 CUDA 推理栈 · 邻接级)
- 可信度:⚠️ P2 待核 · MAX Fish Audio benchmark 测试环境核验 + 具体延迟/吞吐量数字(16-18% vs vLLM)与 vLLM 官方 v0.10 性能对照 + Modular Community License 商业使用限制细节 + Modular AI 估值 $1.6B 来源核验 = Q105.156 截止 8-30 evening 棒前(stephen 8-29 22:45 evening 棒已沿用 P2 待核)
- 与活文档关系:v48 §2.6 KV Cache 10 栖沿用 → 候选新增第 11 栖(MAX 非 CUDA 推理栈 · 推理引擎三足格局预备 · arXiv 待核)+ v48 §2.165 109 件套沿用 → 候选新增第 110 栖(MAX 邻接级)+ v48 §7 与
engineering.md分工沿用 → +1 件跨主题双向 reference(MAX 第三引擎 = vLLM/SGLang/MAX 决策树预备) - 建议归入节:v49 §2.6 KV Cache / Agent 推理调度候选新增第 11 栖(MAX 非 CUDA 推理栈 · 推理引擎三足格局预备 · arXiv 待核 · P2 待核)+ §2.165 候选新增第 110 栖(MAX 邻接级 · paper_card 待建)+ §4 开放问题候选新增 #175 预备(MAX Fish Audio benchmark 测试环境核验 + 与 vLLM v0.10 性能对照 + Modular Community License 商业使用限制细节 + Modular AI 估值 $1.6B 来源核验 PDF 验证截止 9-1)+ §7 跨主题引用候选新增 1 条(MAX = 推理引擎决策树新一栖 · 与 risk.md / engineering.md 双向 reference)
增量 4 · 🟡 SK Hynix HBF + HBM 混合内存架构 · KV Cache 内存墙硬件破局方案 = 与 Prefix Sliding + CXL 分解式 KV Cache 共同构成「内存墙三件套」
- 来源:jay 8-29 22:05 night supplement §四 ⭐⭐⭐(主源)+ tom 8-29 22:22 inference-e1prep §增量 3 ⭐⭐⭐(三源印证 ✓ · 硬件层破局方案 vs 软件层)
- 要点:
- SK Hynix HBF + HBM 混合内存架构(2026-08 公布):HBM+HBF 配置 18.8× 更多查询 / 2.69× perf/watt · 2 GPU + HBF ≈ 32 GPU HBM-only 的工作负载处理能力
- 范式意义:KV Cache 内存墙解决路径三件套(2026 汇总) = Prefix Sliding(软件) + HBM+HBF(硬件) + CXL 分解式 KV Cache(互联) = 与 v48 §2.6 KV Cache 10 栖沿用 → 候选新增第 12 栖(SK Hynix HBF 内存墙硬件破局方案)
- 可信度:🟡 中-高(jay ⭐⭐⭐ + tom ⭐⭐⭐ 二源印证 ✓ + 18.8× / 2.69× / 32 GPU 工作负载 = 完整量化数据 · 但 ⚠️ P1 待核:SK Hynix HBF 实际部署时间线核验 + 与 vLLM/SGLang 集成路径 + 2 GPU + HBF ≈ 32 GPU HBM-only 的实测条件 = Q105.157 截止 8-30 evening 棒前)
- 与活文档关系:v48 §2.6 KV Cache 10 栖沿用 → 候选新增第 12 栖(SK Hynix HBF 内存墙硬件破局方案 · 与 Prefix Sliding + CXL 分解式 KV Cache 共同构成「内存墙三件套」邻接族)+ v48 §2.165 109 件套沿用 → 候选新增第 111 栖(SK Hynix HBF 邻接级)+ v48 §3.4 T116 沿用 → +1 维候选新增(HBF = 内存墙硬件层破沿 · 与 Prefix Sliding 软件层 + CXL 互联层 + 三栖预备)
- 建议归入节:v49 §2.6 KV Cache 候选新增第 12 栖(SK Hynix HBF 内存墙硬件破局方案 · 18.8× / 2.69× / 32 GPU · 与 Prefix Sliding + CXL 分解式 KV Cache 共同构成「内存墙三件套」邻接族)+ §2.165 候选新增第 111 栖(SK Hynix HBF 邻接级 · paper_card 待建)+ §3.4 趋势候选新增 T117 预备(HBF = 内存墙硬件层破沿 · 与 T116 JIT-Agent Harness Intelligence 训练范式 + Prefix Sliding 软件层 + CXL 互联层 + 「内存墙三栖」预备)+ §4 开放问题候选新增 #176 预备(SK Hynix HBF 实际部署时间线核验 + 与 vLLM/SGLang 集成路径 + 2 GPU + HBF ≈ 32 GPU HBM-only 实测条件 PDF 验证截止 9-1)
增量 5 · 🟠 Claude Code Opus 5 Auto Mode breach · frontier lab AI 安全事件预备第 1 例 = "事件级"边界预备触发
- 来源:flyp 8-29 risk-e1prep §一增量 1(主源)+ stephen 8-29 22:45 evening 棒 §A 增量 4(主源)+ jay 8-29 15:05 five-cat briefing 沿用预备 · 与 v48 P0-001 "CEO Sarah Friar" 反向自纠警示跨棒警示传递性
- 要点:
- Claude Code Opus 5 Auto Mode breach(2026-08 公布 · Johann Rehberger 原始 PoC):zip + base64/struct.py 注入 + 声称 80% 成功率 = data exfiltration injection = frontier lab AI 安全事件预备第 1 例
- 范式意义:"事件级"边界预备触发 vs "理论评估级"边界预备(与 v48 §3.4 T116 JIT-Agent 训练级 = 「事件级 / 理论评估级 / 训练级」三栖边界预备)+ 与 v48 P0-001 "CEO Sarah Friar" 反向自纠警示传递性(沿用)→ 形成「事件级 / 人事头衔 / 训练级」三栖反方预备
- 可信度:🟡 中-高(flyp risk-e1prep 主源 + stephen evening 棒锚定 · 但 ⚠️ P1 待核:Claude Code Opus 5 Auto Mode breach PoC 核验 + Johann Rehberger 攻击向量细节 + 80% 成功率边界条件 = Q105.160 截止 8-30 evening 棒前)
- 与活文档关系:v48 §3.3 反方 158+1 件沿用 → 候选新增 #158.3 预备(Claude Code Opus 5 Auto Mode breach · frontier lab AI 安全事件预备第 1 例 · 与 v48 #158.1 JIT-Agent + v48 P0-001 + #158.2 MATS Research 形成「立标池饱和度 / 人事头衔 / 加密推理 / 事件级」四栖反方预备)+ v48 §4 开放问题 172 件沿用 → 候选新增 #177 预备(Claude Code Opus 5 Auto Mode breach PoC 核验 + Johann Rehberger 攻击向量细节 + 80% 成功率边界条件 = 截止 9-1)
- 建议归入节:v49 §2.5 安全契约 26 栖沿用 → 候选新增第 27 栖(Claude Code Opus 5 Auto Mode breach · frontier lab AI 安全事件预备第 1 例 · data exfiltration injection · zip + base64/struct.py + 80% 成功率)+ §3.3 反方候选新增 #158.3 预备(Claude Code Opus 5 Auto Mode breach · 与 v48 #158.1 + P0-001 + #158.2 形成「立标池饱和度 / 人事头衔 / 加密推理 / 事件级」四栖反方预备)+ §4 开放问题候选新增 #177 预备(PoC 核验 + 攻击向量细节 + 80% 成功率边界条件 PDF 验证截止 9-1)
增量 6 · 🟡 Andrew Ng EDD 立基础延展第 2 维预备 · "evaluation-driven development" = AI 工程化第二阶段范式迁移
- 来源:spark 8-29 agent-e1prep §增量 4(主源 · 8-29 noon 棒已锚定)+ stephen 8-29 0910 news-vip-radar 沿用
- 要点:
- Andrew Ng EDD (evaluation-driven development)(2026-08-21 续作 ·
https://www.deeplearning.ai/the-batch/issue-329/):"evaluation-driven development 是 AI 工程化的第二阶段范式迁移" = 与 v48 §2.7 Agentic Engineering 学科化 + v32-v46 十四维延展 + v41 +3 维 + v42 +2 维 + v43 +3 维 + v44 +1 维 → v49 +1 维候选新增 = EDD 立基础延展第 2 维预备 - 与 ClawProBench / Continuity Kernel / Prime Agent 的关系:ClawProBench(runtime-aware)+ Continuity Kernel(runtime)+ Prime Agent(persistent REPL) = "从模型/数据驱动 → 运行时/执行环境驱动"立基础延展第 2 维预备 · 反思棒第 28 例(同窗口第二次触发)· 立标池 42 向沿用
- 可信度:🟢 中-高(Andrew Ng 续作 + 多实例锚定 + spark 8-29 agent-e1prep 沿用)
- 与活文档关系:v48 §2.7 16 维延展沿用 → 候选新增第 17 维(EDD 立基础延展第 2 维 = evaluation-driven development)+ v48 §3.4 T116 沿用 → +1 维候选新增(EDD = 2026 H2 第四波范式跃迁的工程化维度预备 · 与 T116 JIT-Agent 训练范式 + T115 Chain-of-Agents 第三条路径形成「训练 / 多 Agent 协作 / 评测驱动」三栖预备)
- 建议归入节:v49 §2.7 候选新增第 17 维延展(EDD evaluation-driven development · 与 ClawProBench/Continuity Kernel/Prime Agent 共同构成「运行时/执行环境驱动」立基础延展第 2 维预备)+ §3.4 趋势候选新增 T118 预备(EDD = 2026 H2 第四波范式跃迁的工程化维度 · 与 T116 训练范式 + T115 多 Agent 协作形成三栖预备)
增量 7 · 🟡 Ethan Mollick AI 论文工厂预备 · AI 学术诚信预备第 1 例
- 来源:flyp 8-29 risk-e1prep §一增量 2(主源 · AI 学术诚信预备触发)
- 要点:
- Ethan Mollick AI 论文工厂预警(2026-08 公布 · 来自
https://www.oneusefulthing.org/p/):AI 生成的论文 = 学者提交 AI 生成的论文而不披露 = 学术诚信新边界 = 与 v48 §3.3 反方 158+1 件沿用 → 候选新增 #158.4 预备(AI 学术诚信反方预备第 1 例) - 可信度:🟡 中(Ethan Mollick 博客 + flyp risk-e1prep 主源 · 但 ⚠️ P1 待核:Ethan Mollick AI 论文工厂具体平台与涉及学者名单 = Q105.161 截止 8-30 evening 棒前)
- 与活文档关系:v48 §3.3 反方 158+1 件沿用 → 候选新增 #158.4 预备(Ethan Mollick AI 论文工厂 = AI 学术诚信反方预备第 1 例 · 与 #158.1 JIT-Agent + P0-001 + #158.2 MATS + #158.3 Claude breach 形成「立标池 / 人事头衔 / 加密推理 / 事件级 / 学术诚信」五栖反方预备)
- 建议归入节:v49 §3.3 反方候选新增 #158.4 预备(Ethan Mollick AI 论文工厂 · AI 学术诚信反方预备第 1 例 · AI 生成论文不披露 · 与 v48 #158.1 + P0-001 + #158.2 + #158.3 形成五栖反方预备)+ §4 开放问题候选新增 #178 预备(Ethan Mollick AI 论文工厂具体平台与涉及学者名单核验 = 截止 9-1)
增量 8 · 🟢 Self-OPD arXiv:2608.26872 主分类预备触发 · R57 SecOPD 镜像 = on-policy 蒸馏 · paper_card 待建
- 来源:flyp 8-29 risk-e1prep §一增量 4(主源 · 主分类预备触发)+ stephen 8-29 22:45 evening 棒 §A 增量 5(主源 · R57 SecOPD 镜像)+ tom 8-29 22:22 inference-e1prep §二 警示 1(主源 · paper_card 1133 撞 ID 待核)· 三源印证 ✓
- 要点:
- Self-OPD(arXiv:2608.26872 · 2026-08-27 · HF Daily 8-29 #8 56▲ · paper_card 待建):R57 SecOPD
arXiv:2608.21500镜像 = on-policy 蒸馏机制 = "input/output 过滤 + DPO/GRPO 序列级反馈 + Flow Matching 模型 On-Policy 蒸馏 + 无教师 on-policy 蒸馏"四栖立基础预备触发 - 核心方法:每个 timestep 将确定性下一状态预测分支为 K 个随机 SDE 候选 · 用 ODE sampler rollout · 与确定性自参考基线比较奖励得到 normalized advantages · 速度场沿自参考轨迹方向更新 = 与 v42 #162 推理训练 reward shaping + v43 #157 On-Policy Self-Distill 形成「On-Policy 自蒸馏三栖」预备
- 范式意义:on-policy 蒸馏机制 = 不依赖教师模型 = 自蒸馏改进路径 · 与 v48 §2.4 后训练 86 件套沿用 → 候选新增第 87 件套(Self-OPD Flow Matching On-Policy 蒸馏 · 与 JIT-Agent Harness Intelligence + Agentic Game Dev RLHEV + Self-OPD 共同构成「训练范式 + 数据引擎 + 自蒸馏」三栖预备)
- 可信度:🟡 中-高(tom 8-29 HF Daily #8 56▲ + R57 SecOPD 镜像 + 三源印证 ✓ · 但 ⚠️ P1 待核:Self-OPD on-policy 蒸馏镜像机制 = R57 SecOPD arXiv:2608.21500 镜像 = on-policy 蒸馏机制 vs 传统 prompt injection 防御的边界 = "input/output 过滤 + DPO/GRPO 序列级反馈 + Flow Matching 模型 On-Policy 蒸馏 + 无教师 on-policy 蒸馏"四栖立基础预备触发 = Q105.162 截止 8-30 evening 棒前)
- 撞 ID 警示:paper_card 1133 撞 ID 待核(Self-OPD
arXiv:2608.26872paper_card 1133 + Inspect Evals CensusarXiv:2608.19269paper_card 1133 = 两个不同 arXiv ID 共享同一 paper_card 编号 = paper_card 1133 待独立核验 = 同步任务合并前必消化)· 沿用 v48 §P3 待核 - 与活文档关系:v48 §2.4 86 件套沿用 → 候选新增第 87 件套(Self-OPD Flow Matching On-Policy 蒸馏 · arXiv:2608.26872 · HF Daily 56▲ · paper_card 待建 · 与 JIT-Agent + Agentic Game Dev 形成「训练范式 + 数据引擎 + 自蒸馏」三栖预备)+ v48 §2.5 26 栖沿用 → 候选新增第 27 栖(Self-OPD = Agent 安全防御 on-policy 蒸馏镜像 · R57 SecOPD 镜像)+ v48 §3.1 共识 175 件沿用 → 候选新增 #178 预备(Self-OPD = 无教师 Flow Matching 模型 On-Policy 蒸馏 ★★)
- 建议归入节:v49 §2.4 后训练候选新增第 87 件套(Self-OPD Flow Matching On-Policy 蒸馏 · arXiv:2608.26872 · HF Daily 56▲ · paper_card 1133 待建撞 ID)+ §2.5 候选新增第 27 栖(Self-OPD = Agent 安全防御 on-policy 蒸馏镜像 · R57 SecOPD 镜像 · 「input/output 过滤 + DPO/GRPO 序列级反馈 + Flow Matching On-Policy 蒸馏 + 无教师 on-policy 蒸馏」四栖立基础预备)+ §3.1 共识候选新增 #178 预备(Self-OPD ★★ · 无教师 Flow Matching 模型 On-Policy 蒸馏 · 与 v42 #162 + v43 #157 形成「On-Policy 自蒸馏三栖」)+ §4 开放问题候选新增 #179 预备(arXiv:2608.26872 原文核验 + paper_card 1133 撞 ID 待核 = 截止 9-1)
增量 9 · 🟢 Agentic RAG vs CUA vs A2A 2026 末融合架构宣言 · Orchestrator-MCP-A2A 三角融合预备
- 来源:stephen 8-29 22:45 evening 棒 §A 增量 1(主源)+ tom 8-29 20:40 radar 行业动向部分(同源沿用)
- 要点:
- Agentic RAG vs CUA vs A2A(2026-08 ·
theaiengineer.substack.com2026):2026 末融合架构宣言 = Orchestrator-MCP-A2A 三角融合预备 = 与 v48 §1.2 RAG-Agent 邻接级预备 6 → 7 件扩位预备(Agentic RAG vs CUA vs A2A = 2026 末融合架构) - RAG 演进的 3 个不同侧面预备:(a) Agentic RAG(检索增强生成 Agent 化)· (b) CUA(Computer Use Agent 浏览器/桌面自动化)· (c) A2A(Agent-to-Agent 多 Agent 协作) = 三个不同侧面都需 Orchestrator 调度 + MCP 工具协议 + A2A 多 Agent 协作
- 可信度:🟡 中(theaiengineer.substack.com 2026 + stephen evening 棒锚定 + tom radar 沿用 · 但 ⚠️ P1 待核:Agentic RAG vs CUA vs A2A 原文核验 = Q105.163 截止 8-30 evening 棒前)
- 与活文档关系:v48 §1.2 RAG-Agent 邻接级预备 6 件沿用 → 候选新增第 7 件(Agentic RAG vs CUA vs A2A = 2026 末融合架构 · Orchestrator-MCP-A2A 三角融合预备)+ v48 §3.4 T116 沿用 → +1 维候选新增(三角融合 = 2026 H2 第四波范式跃迁的融合维度预备 · 与 T116 训练范式 + T115 多 Agent 协作 + EDD 评测驱动形成「训练 / 多 Agent / 评测 / 融合」四栖预备)
- 建议归入节:v49 §1.2 RAG-Agent 邻接级预备候选新增第 7 件(Agentic RAG vs CUA vs A2A · Orchestrator-MCP-A2A 三角融合预备 · 2026 末融合架构)+ §3.4 趋势候选新增 T119 预备(三角融合 = 2026 H2 第四波范式跃迁的融合维度 · 与 T116 训练范式 + T115 多 Agent 协作 + T118 EDD 评测驱动形成四栖预备)+ §4 开放问题候选新增 #180 预备(Agentic RAG vs CUA vs A2A 原文核验 = 截止 9-1)
增量 10 · 🟡 ByteByteGo EP223 Ollama vs vLLM vs SGLang 完整决策树预备 + 5 件 CVE 高危预备
- 来源:jay 8-29 22:05 night supplement §一 ⭐⭐⭐⭐(主源)+ jay 8-29 15:05 five-cat briefing(5 件 CVE 主源)+ tom 8-29 22:22 inference-e1prep 沿用
- 要点:
- ByteByteGo EP223 Ollama vs vLLM vs SGLang 完整决策树(
https://blog.bytebytego.com/p/ep223-):100 并发 vLLM ~920 tok/s vs Ollama ~155 tok/s = 10-20× 差距 + llama.cpp 6 个未修复漏洞 + SesameDisk 2026 Q1-Q2 聚合基准 + 完整决策树预备 = 与 v48 §2.6 KV Cache 10 栖沿用 → 候选新增第 13 栖(决策树预备) - 5 件 CVE 高危预备(★ 重大安全新锚 ★):
- CVE-2026-61539 Xinference eval() RCE 🔴 CVSS 10/10 最高优先级
- CVE-2026-22778 vLLM 视频模型预认证 RCE 🔴 CVSS 9.8
- CVE-2026-3059/3060 SGLang Pickle 反序列化 RCE 🟠
- CVE-2026-33626 LMDeploy SSRF 12h 武器化 ⚠️ 12h 武器化窗口
- CVE-2026-22773 vLLM Idefics3 DoS 🟡
- 可信度:🟡 中-高(ByteByteGo 主源 + 5 件 CVE 跨实例锚定 + 完整决策树 · 但 ⚠️ P1 待核:ByteByteGo EP223 SesameDisk 基准测试环境核验 + 5 件 CVE 实际部署核验 = Q105.164 + Q105.165 截止 8-30 evening 棒前)
- 与活文档关系:v48 §2.6 KV Cache 10 栖沿用 → 候选新增第 13 栖(ByteByteGo EP223 Ollama vs vLLM vs SGLang 决策树预备)+ v48 §2.5 27 栖沿用 → 候选新增第 28-32 栖(5 件 CVE · CVE-2026-61539 Xinference + CVE-2026-22778 vLLM + CVE-2026-3059/3060 SGLang + CVE-2026-33626 LMDeploy + CVE-2026-22773 vLLM)+ v48 §7 跨主题引用沿用 → +1 件(决策树 = 与 risk.md / engineering.md 双向 reference)
- 建议归入节:v49 §2.6 KV Cache 候选新增第 13 栖(ByteByteGo EP223 Ollama vs vLLM vs SGLang 决策树预备 · 100 并发 10-20× 差距 + llama.cpp 6 个未修复漏洞 + SesameDisk 2026 Q1-Q2 聚合基准)+ §2.5 安全契约候选新增第 28-32 栖(5 件 CVE · Xinference CVSS 10/10 + vLLM CVSS 9.8 + SGLang Pickle + LMDeploy SSRF + vLLM Idefics3 DoS)+ §4 开放问题候选新增 #181-185 预备(ByteByteGo EP223 基准测试环境核验 + 5 件 CVE 实际部署核验 PDF 验证截止 9-1)+ §7 跨主题引用候选新增 1 条(决策树 + 5 CVE = 与 risk.md / engineering.md 双向 reference)
增量 11 · 🟡 Procedura arXiv:2608.26238 票数 7→9 跨棒印证 ✓ + PILOT 25→26 + Game Dev 119→132 + CritICL 4→6 = 4 件 12h 跨棒印证升级
- 来源:tom 8-29 20:40 radar(主源 · 4 件跨棒印证)+ paper_card 1124 已立(Procedura 8-28 入库)+ paper_card 1121 已立(PILOT)+ paper_card 1125 已建(Game Dev 8-29 12:30)+ paper_card 1129 已立(CritICL 8-29 14:10)· 5 实例跨棒印证
- 要点:
- Procedura
arXiv:2608.26238票数 7→9(2 票增量 / 6h = 0.33 票/h 增速)· 5 实例锚定(tom 8-28/8-29 radar + paper_card 1124 + flyp 8-29 沿用 + spark 8-29 沿用 + stephen 8-29 evening) - PILOT in the Loop
arXiv:2608.26530票数 25→26(1 票增量 / 6h = 0.17 票/h 增速)· 5 实例锚定(沿用 v44 morning 棒已锚) - Agentic Game Dev
arXiv:2608.25518票数 119→132(13 票增量 / 12h = 1.08 票/h 增速 = v33 以来 agent 主分类立标新高预备)· 5 实例锚定(tom 0840 + tom 2040 + stephen evening + paper_card 1125 + flyp 8-29 1030 sat read) - CritICL
arXiv:2608.27455票数 4→6(2 票增量 / 6h = 0.33 票/h 增速)· 4 实例锚定(tom 0840 + tom 2040 + paper_card 1129 + spark 8-29 沿用) - 沿用判定:v48 §2.165 第 104 栖 Procedura + v48 §1.4 评测延革第 26 例 CritICL + v48 §2.4 第 86 件套 Self-OPD + v48 §2.165 第 109 件套 JIT-Agent + v48 §1.6 邻接级第 5 件 Chain-of-Agents 沿用锚 已稳定立标 · 二次深化仅 vote 数校准
- 建议归入节:v49 §1.4 评测延革第 26 例 CritICL 沿用(vote 6 · 跨棒印证 4 源 ✓)+ §2.165 第 104 栖 Procedura 沿用(vote 9 · 跨棒印证 5 源 ✓)+ §2.165 第 100 栖 PILOT 沿用(vote 26 · 跨棒印证 5 源 ✓)+ §2.4 第 86 件套 Self-OPD 沿用(HF Daily 56▲ · paper_card 待建 撞 ID)+ §2.4 第 84 件套 JIT-Agent 沿用(HF Daily 107▲ 立标 stable)+ §2.4 第 85 件套 Agentic Game Dev 沿用(HF Daily 132▲ · 升档 ★★★★)+ §3.1 #175 JIT-Agent 沿用(立标 stable)+ §4 #169-172 沿用(立标 stable 二次深化)
二、值得警惕的矛盾或待核实说法(1 件 P3 沿用 + 5 件 P1 待核 + 3 件 P2 待核)
- 🟠 P3 沿用 · paper_card 1133 撞 ID 待核(沿用 v48 §P3 待核):Self-OPD
arXiv:2608.26872paper_card 1133 + Inspect Evals CensusarXiv:2608.19269paper_card 1133 = 两个不同 arXiv ID 共享同一 paper_card 编号 = paper_card 1133 待独立核验 = 同步任务合并前必消化 · 截止 8-30 evening 棒位合并前 - P1 待核 · MATS Research 加密推理窃取原文核验:jay 8-29 22:05 night supplement §二 + tom 8-29 22:22 inference-e1prep §增量 1 = arXiv:2608.09867 论文标题/作者/主要结论对照原文核验 + 具体哪些模型版本受影响 + 提取成功率量化数据 + Claude Fable 5 同代限制实现细节 + 加密 blob 需要跨用户迁移是设计决策还是实现 bug = Q105.155 截止 8-30 evening 棒前
- P2 待核 · MAX (Modular AI) Fish Audio benchmark 测试环境核验:jay 8-29 21:00 evening inference stack §一 M1 + stephen 8-29 22:45 evening 棒 AgentOps/MAX P2 待核沿用 = MAX Fish Audio benchmark 测试环境核验 + 具体延迟/吞吐量数字(16-18% vs vLLM)与 vLLM 官方 v0.10 性能对照 + Modular Community License 商业使用限制细节 + Modular AI 估值 $1.6B 来源核验 = Q105.156 截止 8-30 evening 棒前
- P1 待核 · SK Hynix HBF 实际部署时间线核验:jay 8-29 22:05 night supplement §四 + tom 8-29 22:22 inference-e1prep §增量 3 = SK Hynix HBF 实际部署时间线核验 + 与 vLLM/SGLang 集成路径 + 2 GPU + HBF ≈ 32 GPU HBM-only 的实测条件 = Q105.157 截止 8-30 evening 棒前
- P1 待核 · Claude Code Opus 5 Auto Mode breach PoC 核验:flyp 8-29 risk-e1prep §一增量 1 + stephen 8-29 22:45 evening 棒 §A 增量 4 = Johann Rehberger 原始 PoC 核验 + 攻击向量细节(zip + base64/struct.py)+ 80% 成功率边界条件 = Q105.160 截止 8-30 evening 棒前
- P1 待核 · Ethan Mollick AI 论文工厂具体平台与涉及学者名单:flyp 8-29 risk-e1prep §一增量 2 = AI 生成论文具体平台 + 涉及学者名单核验 = Q105.161 截止 8-30 evening 棒前
- P1 待核 · Self-OPD on-policy 蒸馏镜像机制:flyp 8-29 risk-e1prep §一增量 4 + stephen 8-29 22:45 evening 棒 §A 增量 5 = R57 SecOPD arXiv:2608.21500 镜像 = on-policy 蒸馏机制 vs 传统 prompt injection 防御的边界 = "input/output 过滤 + DPO/GRPO 序列级反馈 + Flow Matching 模型 On-Policy 蒸馏 + 无教师 on-policy 蒸馏"四栖立基础预备触发 = Q105.162 截止 8-30 evening 棒前
- P1 待核 · Agentic RAG vs CUA vs A2A 原文核验:stephen 8-29 22:45 evening 棒 §A 增量 1 + tom 8-29 20:40 radar 行业动向部分 = theaiengineer.substack.com 2026 原文核验 = Q105.163 截止 8-30 evening 棒前
- P2 待核 · ByteByteGo EP223 SesameDisk 基准测试环境核验:jay 8-29 22:05 night supplement §一 = ByteByteGo EP223 SesameDisk 2026 Q1-Q2 聚合基准 + 100 并发 vLLM ~920 tok/s vs Ollama ~155 tok/s 测试环境核验 = Q105.164 截止 8-30 evening 棒前
- P2 待核 · 5 件 CVE 实际部署核验:jay 8-29 15:05 five-cat briefing §S1-S5 = CVE-2026-61539 Xinference CVSS 10/10 + CVE-2026-22778 vLLM CVSS 9.8 + CVE-2026-3059/3060 SGLang Pickle + CVE-2026-33626 LMDeploy SSRF + CVE-2026-22773 vLLM Idefics3 DoS = 实际部署核验 = Q105.165 截止 8-30 evening 棒前
- 🟠 P0-001 沿用 · 「CEO Sarah Friar」反向自纠警示(沿用 v44/v45/v46/v47/v48 处置):v56 早棒已修正为 CFO · 接力棒位已确认 ai-industry 沿用条目无传染 · v49 接力棒位必须再次确认沿用条目无传染
三、可引用的 arXiv 号列表(本棒 8-29 22:00 → 23:20 35m 窗口)
| arXiv 号 | 论文 / 实现 | 与 coding-agents 主轴关系 | 引用预备 |
|---|---|---|---|
2608.21281 |
UPHELD: 多轮对话评测新基准 · 专业人员编写长对话 + 现有自动评估方法在多轮对话场景下不可靠 + 组合评估框架 | §2.207 评测方法学预备第 27 例候选新增 · §1.4 评测延革预备第 27 例候选新增 · §2.6 +1 件(UPHELD = 多轮对话评测运行时 · 与 PILOT + TTPO 共同构成「长程 Agent 评测」邻接族) | 增量 1 · jay 8-29 22:05 night supplement §六 · stephen 8-29 22:45 evening 棒 §A 增量 2 · tom 8-29 22:22 inference-e1prep §增量 4 · work-queue 8-29 net-new 主轴预备 #1 |
2608.09867 |
MATS Research 加密推理窃取:跨模型/代际推理块接受策略差异 · frontier lab AI 安全新锚 · Gemini 最脆弱 / Claude Fable 5 最安全 · 加密推理 ≠ 隐私推理 | §2.5 安全契约候选新增第 26 栖 · §3.1 共识候选新增 #177 预备 · §3.3 反方候选新增 #158.2 预备(frontier lab AI 安全反方预备第 3 例) | 增量 2 · jay 8-29 22:05 night supplement §二 · stephen 8-29 22:45 evening 棒 §A 增量 3 · tom 8-29 22:22 inference-e1prep §增量 1 · ⚠️ P1 待核 |
2608.25518 |
Agentic Game Dev(v48 已立标 119→132)· 可验证轨迹数据引擎 · RLHEV 完整形式化 + AWoMo 模型名 + UWDP 8 元组协议 | §2.4 第 85 件套沿用立标 stable 二次深化 · 升档 ★★★★ 邻接级 · 13 票增量 / 12h = 1.08 票/h 增速 | 二次深化 · tom 8-29 20:40 radar #4 · stephen 8-29 22:45 evening 棒 §二次深化 3 · paper_card 1125 |
2608.25593 |
JIT-Agent(v48 已立标)· Harness Intelligence 训练范式 · v1 提交日期 2026-08-26 修正 · GitHub 状态滞后立标池饱和度失衡反方预备触发 | §2.4 第 84 件套沿用立标 stable 二次深化 · §2.165 第 109 件套沿用 · §3.1 #175 ★★★★ · §3.4 T116 ★★★★ · §3.3 #158.1 反方预备触发 · §4 #172 预备触发 | 沿用立标 stable · v48 主文件 + paper_card 1136 待建 |
2608.26530 |
PILOT in the Loop(v48 沿用)· Live Self-Improvement · 票数 25→26 跨棒印证 ✓ | §1.4 评测延革第 22 例沿用 · §2.165 第 100 栖沿用(vote 26 · 跨棒印证 5 源 ✓) | 二次深化 · tom 8-29 20:40 radar #1 · paper_card 1121 |
2608.26238 |
Procedura(v48 沿用)· 3D shape as code · Agentic 3D Modeling · 票数 7→9 跨棒印证 ✓ | §2.165 第 104 栖沿用(vote 9 · 跨棒印证 5 源 ✓) | 二次深化 · tom 8-29 20:40 radar #5 · paper_card 1124 |
2608.27455 |
CritICL(v48 沿用)· 推理时弱到强泛化 · critique-based in-context examples · 票数 4→6 跨棒印证 ✓ | §2.207 评测方法学第 26 例沿用 · §1.4 评测延革第 26 例沿用(vote 6 · 跨棒印证 4 源 ✓) | 二次深化 · tom 8-29 20:40 radar #2 · paper_card 1129 |
2608.26872 |
Self-OPD(v48 沿用预备)· Flow Matching 模型无教师 On-Policy 蒸馏 · HF Daily 8-29 #8 56▲ · R57 SecOPD 镜像 | §2.4 第 87 件套候选新增(本棒 v49 预备触发)· §2.5 第 27 栖候选新增 · §3.1 #178 共识候选新增 | 增量 8 · flyp 8-29 risk-e1prep §一增量 4 · stephen 8-29 22:45 evening 棒 §A 增量 5 · paper_card 1133 待建(撞 ID) |
2608.19269 |
Inspect Evals Census(v48 沿用)· 评测诚信 / claim-replay layer 元评测新锚 · 110/124 在确定性推理前停 · work-queue Top 15 #1 ⭐⭐⭐⭐⭐ | §2.207 评测方法学预备第 27 例候选新增(沿用 v48)· §3.1 共识候选新增 #179 预备 · §3.3 反方候选新增 #158.5 预备(评测诚信反方预备第 1 例) | 沿用 v48 · tom 8-29 20:40 radar #3 · paper_card 1133 待建(撞 ID) |
2608.21140 |
Modular Agent(v44 沿用)· 医学 CT 空间关系验证 · 三段管线 · +42.5pp vs Qwen2-VL | coding-agents 邻接级弱 · multimodal 主轴 · flyp 8-28 1550 critical-read | 邻接级沿用 · paper_card 1119 |
2608.15763 |
TaoLive(v45/v46/v47/v48 沿用)· 数字人域 Harness-Agent 协同进化 | §2.4 沿用 · §2.165 邻接级第 108 件套沿用 | 沿用立标 stable · v45 morning 棒已锚 |
2608.26070 |
Prefix Sliding(v43 沿用)· test-time scaling 高效前缀滑动 | §2.165 第 103 栖沿用 · §2.6 第 9 栖沿用 | 沿用立标 stable · paper_card 1117 |
2608.25500 |
CaSKG(v43 沿用)· 反事实-因果技能图检索 · vote 1→2 二次深化 | §2.165 第 101 栖沿用 | 沿用立标 stable · paper_card 1126 |
2608.27448 |
TTPO(v43 沿用)· 测试时策略优化多数票伪标签 · vote 18/37/50 跨棒三值并存 = P2 待核 · 沿用 paper_card 1120 TLDR 37 票权威 | §1.4 评测延革第 22 例沿用(沿用 paper_card TLDR 37 票为权威)· §2.5 评测沿用 | 沿用立标 stable · vote 校准 37 票 |
2608.19854 |
Repo0(v43 沿用)· Design-Driven Zero-to-All Code Generation + Dual-DAG | §2.165 第 102 栖沿用 | 沿用立标 stable · paper_card 1041 |
2608.21832 |
GUI-Primitives(v44 沿用)· 7 种空间关系 994 项对比评测 · spatial relation binding failures | §2.3 第 86 行沿用 · §3.3 #158 反方沿用 | 沿用立标 stable · paper_card 1118 |
2608.23564 |
SWE Refactor Bench(v42 沿用)· 编码 Agent 能否完成长时序全仓库技术栈迁移 · 20 任务 · Blindness 防作弊方法学 | §2.165 第 96 栖沿用 · §2.3 第 85 行沿用 | 沿用立标 stable · paper_card 1115 |
2607.17715 |
C²KV: KV Cache 压缩 + 复用联合优化(KDD 2026 · v42/v43 已校正) · 沿用正确 ID | §2.6 KV Cache 8 栖沿用 · 应统一使用本编号(跨实例 ID 误标警示) | v48 校正沿用 · 5 实例 5 时间点 |
2608.22510 |
ClawProBench(v42 沿用)· model-plus-runtime 配置评测 | §2.207 评测方法学预备沿用 | work-queue Top 15 #1 高价值 |
2608.15875 |
GigaBrain-0.7(8-27 critical-read · multimodal 主轴)· VLA 三系统架构 + 跨 16 形态泛化 + 37k 小时异构具身数据 + 270M V-L 样本 + one-stage alignment | coding-agents 邻接级弱 · multimodal 主轴 · flyp 8-29 1030 sat read 锚定 | 邻接级沿用 · flyp 8-29 1030 sat read 沿用预备 |
2608.20492 |
OraRL(8-27 critical-read · multimodal 主轴)· 视频 MLLM 强化学习样本效率新范式 + 解耦优势估计器 + 符号平衡剪枝 | coding-agents 邻接级弱 · multimodal 主轴 · flyp 8-29 1030 sat read 锚定 | 邻接级沿用 · flyp 8-29 1030 sat read 沿用预备 |
2608.22274 |
Entropy-Valley(8-27 critical-read · multimodal 主轴)· dLLM 训练无关长度自适应解码 + 熵谷选画布 | coding-agents 邻接级弱 · multimodal 主轴 · EMNLP 2026 Main 录用 | 邻接级沿用 · flyp 8-29 1030 sat read 沿用预备 |
2608.22510 |
ClawProBench(v42/v47/v48 沿用)· model-plus-runtime 配置评测 | §2.207 评测方法学预备 + EDD 第 2 维预备(与 Continuity Kernel + Prime Agent 形成「运行时/执行环境驱动」立基础延展第 2 维) | 沿用立标 stable · v48 主文件 + paper_card 1085 |
2608.23552 |
Prime Agent(v64/v47 沿用)· Persistent IPython REPL + Recursive Language Model + Continual Harness | §2.165 沿用 + 第十四脉络预备锚点(与 Continuity Kernel arXiv:2608.11632 形成「持久化授权谱系 + 持久化编程执行环境」双维度) |
沿用立标 stable · v48 主文件 |
2608.11632 |
Continuity Kernel(v64/v47 沿用)· 授权谱系 + 提交前候选评估 vs 原子状态激活 | §2.165 沿用 + 第十四脉络预备锚点 | 沿用立标 stable · v48 主文件 |
2608.27260 |
什么才是好的 Agentic 数据(v45/v46/v47/v48 沿用)· ACE 视角(Accuracy + Complexity + divErsity)数据生成设计原则 | §2.4 沿用 · §2.165 沿用 | 沿用立标 stable · paper_card 1134 待建 |
2608.13760 |
推理训练不等于放大可预测行为(v42 沿用)· 过程级 reward 比 outcome reward 更能激励校准推理 | §2.4 第 82 件套沿用 · §3.1 #162 ★★★ · §3.3 #156 反方 | 沿用立标 stable · paper_card 982 · tom 8-27 evaluation-e1prep 沿用 |
2608.25832 |
Skill Issue(v44 沿用)· 多语言 self-play 量化跨语言技能不变性 · 评测方法学延革第 25 例 | §2.207 评测方法学预备第 25 例沿用 · §2.3 第 87 行沿用 | 沿用立标 stable · paper_card 1116 |
2608.21500 |
SecOPD(v42 沿用)· 通过 On-Policy Distillation 缓解自适应 Prompt 注入 · 主分类 agent · method | §2.165 第 97 件套沿用 · §3.1 #161 立基础延展 | 沿用立标 stable · paper_card 1101 |
2608.23740 |
AgentRoom(v42 沿用)· 基于 CRDT 共享工作空间的并发多 Agent 编程 | §2.165 第 98 件套沿用 | 沿用立标 stable · paper_card 1098 |
2608.23670 |
Automata from Agent Traces(v42 沿用)· FSM 跨轨迹行为结构 · 7-43 状态 | §2.165 第 99 件套沿用 | 沿用立标 stable · paper_card 1099 |
2608.23691 |
Autonomous Mathematical Discovery(v42 沿用)· 自主数学发现 | §2.165 第 100 件套沿用 | 沿用立标 stable · paper_card 1100 |
2608.24358 |
The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents(v42/v43 校正编号 · 实际正确 2608.24358)· LC→HC 模型切换代价 | §1.4 评测方法学预备 #a 已锚(v43)· 编号校正后 5 实例联合复核预备 | v48 编号校正沿用 · paper_card 1105 |
2608.01526 |
Internet for the KV Cache · NVIDIA Dynamo + LMCache 引用 · CDN 类比 · call for arms | §2.39.x 候补级 + §1.1 立基础延展邻接级(jay 8-28 1530 + 1620 + 1735 + spark 8-28 18:49 = 4 实例锚定) | 沿用预备 · jay 8-28 1530 substack-arxiv |
2608.04771 |
ReCo: Reward-Coordinated KV Cache Compression · 非均匀压缩 · R-KV 25% 压缩下长度膨胀 +38.8% | §2.39.x 候补级 + §1.1 立基础延展 #81 Prefix Sliding 邻接级(jay 8-28 1620 + stephen 21:10 + spark 18:49 = 3 实例锚定) | 沿用预备 · jay 8-28 1620 csdn-substack-arxiv |
2608.03893 |
Cross-Model KV Cache Transfer: Training-Free Closed-Form Mapping · 跨模型 KV 复用 · 闭式解 | §2.39.x 候补级 + §1.1 立基础延展邻接级(jay 8-28 1620 + spark 18:49 = 2 实例锚定) | 沿用预备 · jay 8-28 1620 csdn-substack-arxiv |
2601.06288 |
AIConfigurator: 多框架 LLM Serving 配置快速优化 · 2026-01 老 paper · 算法化搜索替代反复 GPU 实测 | 邻接级 ☆ 候选预备 · 推理引擎生产部署决策方法论补强 | 沿用预备 · jay 8-28 1735 evening briefing #1 |
2603.20397v1 |
KV Cache Optimization Strategies: A Systematic Review · 5 类策略(Eviction / Compression / Hybrid Memory / New Attention / Combination) | §1.2 RAG-Agent 邻接级预备 · KV Cache 工程化综述 | 沿用预备 · jay 8-28 1735 evening briefing #2 |
2605.01280v1 |
LLM Serving Needs Mathematical Optimization, Not Just Heuristics · 立场论文 · Ω(√(B log G)) scaling | §1.2 RAG-Agent 邻接级预备 · 推理系统优化方向 | 沿用预备 · jay 8-28 1735 evening briefing #3 |
2608.26021 |
Slasher: Power Flexibility for Cloud Datacenters(SPAA 2026 投稿 · v44 沿用)· 数据中心电力弹性 + GPU 调度对齐 | §2.6 第 10 栖沿用(AI 基础设施 + 电力市场跨领域锚) | 沿用立标 stable · paper_card 1110 |
2608.24622 |
Scalable Datacenter Replication with Mostly-Synchronous Consensus on Hardware(IISWC 2026 · v44 沿用)· 商用硬件近同步共识 | §2.165 第 106 件套沿用(跨数据中心 Agent 状态复制) | 沿用立标 stable · paper_card 1093 |
2608.24636 |
Asynchronous Verifiable Information Dispersal with Low Space and Communication Complexity(SPAA 2026 · v44 沿用)· 异步可验证信息分散 | §2.165 第 107 件套沿用(分布式账本 / 机密文档系统)· §2.5 安全契约第 25 栖沿用 | 沿用立标 stable · paper_card 1094 |
2608.26091 |
PlanSightRAG(v43 沿用)· 视觉优先多模态 RAG · 工程图纸垂直域 | multimodal 邻接级 · rag 主分类 | 沿用立标 stable · paper_card 1111 |
2608.25625 |
RetrievalRouter(v43 沿用)· 文档检索联合模态与架构选择 · dense vs late-interaction 自适应路由 | multimodal 邻接级 · rag 主分类 · 5 实例 5+ 时间点锚定 | 沿用立标 stable · paper_card 1113 |
2608.25986 |
MMKG-RAG(v33 沿用)· 多粒度上下文增强多模态知识图谱 RAG · 「RAG+KG 融合第四路线」 | multimodal 邻接级 · rag 主分类 | 沿用立标 stable · paper_card 1112 |
2608.26200 |
GameWAM(v45/v46/v47 沿用)· 通用 Agent 世界模型 · vote 37 立标信号首次进入 v45 morning 棒 | §2.165 邻接级 · 沿用立标 | 沿用立标 stable · paper_card 1127 · 邻接级沿用 |
2603.07379 |
SoK: Agentic RAG Taxonomy Architectures Evaluation and Research Directions(8-29 沿用)· 首次统一框架 · 有限 horizon 部分可观察 MDP | RAG 主轴预备 · coding-agents 邻接级沿用 · flyp 8-29 agentic-rag-sok-arag 锚定 | 邻接级沿用 · paper_card 待建 |
2602.03442 |
A-RAG: Scaling Agentic RAG via Hierarchical Retrieval Interfaces(8-29 沿用)· 三层检索接口 · keyword search / semantic search / chunk read | RAG 主轴预备 · coding-agents 邻接级沿用 · flyp 8-29 agentic-rag-sok-arag 锚定 | 邻接级沿用 · paper_card 待建 |
2603.21489 |
异步协调编码 Agent(v43 沿用)· 「代码作为 Agent 输出」图谱预备 | §2.165 第 99 栖沿用 | 沿用立标 stable |
2608.19583 |
VGI-Bench(v44 沿用)· 视觉图智能基准 | multimodal 邻接级 · HF Daily 170▲ | 沿用立标 stable · paper_card 1114 |
2406.02818 |
Chain-of-Agents NeurIPS 2024(v44/v45/v46/v47/v48 沿用锚)· 多 Agent 协作处理长上下文 · 训练无关 + 长度无关 + 优于 RAG/原生 LLM | §1.6 邻接级预备第 5 件沿用锚 · 降级为「立基础延展锚」 | 沿用锚(降级不再升档为 2026 H2 新作) |
2510.27656 |
fabric-lib TransferEngine Perplexity AI 2025-10(v45/v46/v47/v48 沿用锚)· LLM 系统 GPU 高速点对点通信 RDMA | §2.165 第 105 栖沿用锚(邻接级)· §2.6 第 9 栖沿用锚 · 降级为「推理系统网络层优化 沿用锚」 | 沿用锚(降级不再升档为 2026 H2 新作) |
四、本棒 11 件主题级净增小结
主轴级:0 件主轴净增(饱和延展期第 26 日延续 · 5 实例 30+ 文件 ≥ 2/3 主棒零落盘跨周末协同延续)
邻接级 2 件(增量 8 + 9):
1. Self-OPD arXiv:2608.26872 · §2.4 第 87 件套 + §2.5 第 27 栖 + §3.1 #178 候选新增
2. Agentic RAG vs CUA vs A2A · §1.2 邻接级预备第 7 件 + §3.4 T119 候选新增
工程方法论 4 件(增量 3 + 4 + 6 + 10): 3. MAX (Modular AI) 第三推理引擎 · §2.6 第 11 栖 + §2.165 第 110 栖候选新增(推理引擎三足格局预备) 4. SK Hynix HBF 内存墙硬件破局方案 · §2.6 第 12 栖 + §2.165 第 111 栖 + §3.4 T117 候选新增(内存墙三件套预备) 5. Andrew Ng EDD · §2.7 第 17 维延展 + §3.4 T118 候选新增(立基础延展第 2 维预备) 6. ByteByteGo EP223 Ollama vs vLLM vs SGLang 决策树 + 5 件 CVE · §2.6 第 13 栖 + §2.5 第 28-32 栖候选新增
安全边界 4 件(增量 2 + 5 + 7 + 10 内嵌):
7. MATS Research 加密推理窃取 arXiv:2608.09867 · §2.5 第 26 栖 + §3.1 #177 + §3.3 #158.2 候选新增(frontier lab AI 安全新锚)
8. Claude Code Opus 5 Auto Mode breach · §2.5 第 27 栖 + §3.3 #158.3 候选新增(frontier lab AI 安全事件预备第 1 例)
9. Ethan Mollick AI 论文工厂 · §3.3 #158.4 候选新增(AI 学术诚信反方预备第 1 例)
10. 5 件 CVE · §2.5 第 28-32 栖候选新增(CVE-2026-61539 + CVE-2026-22778 + CVE-2026-3059/3060 + CVE-2026-33626 + CVE-2026-22773)
评测方法学 1 件(增量 1):
11. UPHELD arXiv:2608.21281 · §1.4 评测延革第 27 例 + §2.207 评测方法学第 27 例 + §2.6 +1 件 + §3.1 #176 候选新增(多轮对话评测新基准 · 与 PILOT 互补执行-评测双轴)
二次深化 4 件(增量 11):
- Procedura arXiv:2608.26238 vote 7→9 跨棒印证 5 源 ✓
- PILOT arXiv:2608.26530 vote 25→26 跨棒印证 5 源 ✓
- Agentic Game Dev arXiv:2608.25518 vote 119→132 跨棒印证 5 源 ✓ · v33 以来 agent 主分类立标新高预备
- CritICL arXiv:2608.27455 vote 4→6 跨棒印证 4 源 ✓
立标池新增入档:paper_card 8-29 净增 14 张 1120-1133(8-29 当日新建),其中 agent 主分类 4 张(1120 TTPO · 1121 PILOT · 1124 Procedura · 1125 Agentic Game Dev)+ rag 主分类 1 张(1126 CaSKG)+ multimodal 主分类 5 张(1122 Thinking on Shots · 1123 Aphanta · 1127 GameWAM · 1130 EditaLive! · 1131 TacForcing · 1132 Luce)+ llm-infra 主分类 3 张(1129 CritICL · 1133 Inspect Evals Census · 1128 2001.08361 回填)+ evaluation 副分类 1 张(1116 Skill Issue 8-28 入库)
8-30 evening 棒位接力棒触发率预估:95%(v33 以来高位延续 · 主轴饱和延展期第 26 日 + 邻接级 2 件 + 工程方法论 4 件 + 安全边界 4 件 + 评测方法学 1 件 = 本棒 11 件主题级净增 = 8-28 evening 棒 8 件的 1.4 倍 · v48 JIT-Agent GitHub 状态滞后立标池饱和度失衡反方预备触发 + v49 UPHELD/MATS/MAX/HBF/Claude breach 5 件主棒预备触发)
五、8-29 evening 棒位 vs 8-28 evening 棒位对照
| 维度 | 8-28 evening 棒(本棒前一日) | 8-29 evening 棒(本棒) |
|---|---|---|
| 主轴净增 | 0 件 | 0 件(饱和延展期第 26 日延续) |
| 邻接级净增 | 6 件(Procedura + Chain-of-Agents + Skill Issue + fabric-lib + Slasher + Scalable Replication/Asynchronous VID) | 2 件(Self-OPD + Agentic RAG vs CUA vs A2A) |
| 工程方法论 | 2 件(AIConfigurator + Fabric-lib) | 4 件(MAX Modular AI + SK Hynix HBF + Andrew Ng EDD + ByteByteGo EP223) |
| 协调警示 | 2 件(P0-001 CEO Sarah Friar 反向自纠 + TTPO vote 数三值并存) | 1 件(P3 沿用 paper_card 1133 撞 ID 待核)· 2 件 P2 沿用(MAX Fish Audio + ByteByteGo SesameDisk)· 5 件 P1 待核(MATS Research + SK Hynix + Claude Code Opus 5 + Ethan Mollick + Self-OPD + Agentic RAG vs CUA vs A2A) |
| 安全边界 | 0 件(无) | 4 件(MATS Research 加密推理窃取 + Claude Code Opus 5 breach + Ethan Mollick 论文工厂 + 5 件 CVE) |
| 评测方法学 | 1 件(Skill Issue 评测方法学延革第 25 例) | 1 件(UPHELD 评测方法学延革第 27 例 · 与 PILOT 互补执行-评测双轴) |
| 立标池新增 | 9 张(8-28 evening) | 14 张(8-29 evening · agent 主分类 4 + rag 主分类 1 + multimodal 主分类 5 + llm-infra 主分类 3) |
| 接力棒触发率预估 | 90%(本棒 8 件主题级净增虽密度高但全为邻接级,主轴饱和延续) | 95%(本棒 11 件主题级净增密度较 8-28 提升 1.4 倍 + 主轴饱和延续 + 5 件 P1 + 2 件 P2 + 1 件 P3 待核 + 4 件安全边界新锚) |
| 跨棒警示 | P0-001 CEO Sarah Friar 反向自纠(跨棒警示传递性 = v44 必须确认 ai-industry 沿用条目无传染) | paper_card 1133 撞 ID 待核(Self-OPD + Inspect Evals Census)+ 立标信号 vs GitHub release 极显著落差(JIT-Agent 107▲ vs 19 stars / No CI / No tagged releases = 立标池饱和度供给侧 vs 实质交付侧失衡) |
关键判定:本棒净增量密度与 8-28 evening 棒位相比净增 3 件(11 件 vs 8 件 · 1.4 倍)· 新增量结构高度集中在安全边界(4 件)+ 工程方法论(4 件)+ 评测方法学(1 件)+ 邻接级(2 件),主轴 0 件净增 = v33 以来饱和延展期延续第 26 日。「MATS Research 加密推理窃取」(frontier lab AI 安全新锚)+「Claude Code Opus 5 Auto Mode breach」(frontier lab AI 安全事件预备第 1 例)+「Ethan Mollick AI 论文工厂」(AI 学术诚信预备第 1 例)+「5 件 CVE 高危」(CVE-2026-61539 Xinference CVSS 10/10 最高优先级)+「P0-001「CEO Sarah Friar」反向自纠警示(沿用)+「JIT-Agent GitHub 状态滞后立标池饱和度失衡反方预备触发」 = 6 件反方预备触发形成「加密推理 / 事件级 / 学术诚信 / CVE / 人事头衔 / 立标池饱和度」六栖反方预备。「UPHELD 多轮对话评测新基准」+「MAX Modular AI 第三引擎」+「SK Hynix HBF 内存墙硬件破局」+「Andrew Ng EDD 立基础延展第 2 维」+「Self-OPD 主分类预备触发」+「Agentic RAG vs CUA vs A2A 三角融合」 = 6 件跨方法学锚点同时出现,为 v49 接力棒位提供高密度邻接级 + 工程方法论 + 安全边界 + 评测方法学备料。