coding-agents · E1 预消化简报(2026-07-27)

作者:flyP(🀄) 触发:cron 7a0c0a42-eb2e-4bcd-af74-634628039865 · 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档 /shared/research-kb/organized/knowledge/coding-agents.md 当前已固化到 v34 Wave4 E1 第九轮 7-27 04:20:15 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座 9 段 + §2.3 评测表 22 行 + §2.4 后训练 Agentic RL 训练栈 17 件 + §2.4 记忆 / 长视野 10 件 + §2.5 安全契约第 9-11 阶 + 84/85 节点 + §2.6 多模态/CLI/IDE/工业件套 + 共识 42 / 争议 35 / 开放问题 53 / 趋势 34 / 必读 138) 窗口:近 2 天(2026-07-25 ~ 2026-07-27)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 7-25 ~ 7-27 新卡(564-609)+ HF Daily 7-25 ~ 7-27 基线对照:昨晚 7-26 E1 预消化立标 = 8 件(2 P0 主线 + 4 P0 沿用升级 + 3 P1 旁证 + 1 P1 监测)= Anthropic Sonnet 5 + Managed Agents effort 设置 + 评论层长尾 + ReOPD critical-read B 级 + ACM critical-read B 级 + AAAI 2026 Subramanian + GitHub Trending 6 件 + AI Engineer 画像 + OpenClaw 210k vs 12,981 stars + HF Daily 续立,全部已并入 v34 第九轮;本场定位 = 「v34 第九轮 15 阈值饱和下,承接 7-26 23:00 ~ 7-27 23:00 共 24 小时内边际增量以『饱和沿用 + 跨主题补全 + R30/R31 反方候选 + 评论层持续长尾』形态呈现。新增 arXiv 立标 0 件,新增 P0 主线 0 件,P0 沿用升级 2 件 + 跨主题补全 2 件 + P1/P2 监测 2 件」


0. 综述判断(给今晚活文档接手时一眼看到)

  • v34 第九轮 7-27 04:20 已固化 15 阈值 + 上下文管理三路线对立 + Agent 经验蒸馏双轨 + 第十/十一阶段 + 工业 MCP 安全立标 + frontier lab 八栖合流 + AAAI Subramanian RAG 范式转折立标级候选 = 饱和形态;7-26 E1 8 件新立标已被完整吸收。
  • 本场定位:v34 第九轮饱和状态下,边际增量以"饱和沿用 + 跨主题补全 + 评论层持续长尾"形态呈现;新增 arXiv 立标 0 件(所有相关 arXiv = OpenForgeRL + ACM + ReOPD + AREX + NVIDIA OO Agents + Tencent WorkBuddy + Sample-Efficient + HyMCache 等 8 件已立 + 7 件沿用续立);新候选立标 P3 = 1 件(arXiv:2607.22157 Learning on the Job frozen-weights 持续学习);跨主题补全 P1 = 2 件(arXiv:2605.20173 SDB 生产 Agent 可靠性 + Markdown Memory Paradigm 文件系统即上下文);评论层持续长尾 = 1 件(Anthropic 7-27 morning Opus 5 系统卡 + Economic Index connector 落地 + 6 媒体 7-25~7-27 持续);P2 监测 = 1 件(Self-Supervised Structured Dynamics 跌出前 15 边缘 = flyp v34 §3.3 反方 #55 评级升级时机风险激活)。
  • 本场净新增量性质:
    1. Anthropic 7-27 morning 评论层长尾续立 + Economic Index connector 落地(stephen 7-27 ai-industry §A + spark 7-27 agent-e1prep §增量 7 + jay 7-27 rss-simon-willison/rss-bens-bites/rss-tldr-ai)= §1.45 frontier lab 立标 §6 行业升级 5 件合并 续立轨迹 + §2.103 评论层长尾 7-25~7-27 续立——已 v34 第九轮固化轨迹沿用,非新立标,但持续长尾累积。
    2. arXiv:2605.20173 SDB(Stochastic-Deterministic Boundary)生产 LLM Agent 运行时架构框架(jay 7-27 engineering-v37 §1 + stephen 7-27 12:45 §3.1 + spark 7-27 agent-e1prep §增量 2 · paper_card 待补)= §2.6 第四十二子节 立标级候选新增 · 21 调用点审计 + 71% SDB 边界故障 + 81% 修复加固 SDB 四部分之一——这是 coding-agents 主题新立标级候选(0 → 1 件);v34 §2.6 评测、可靠性与对抗 41 子节 → 42 子节扩
    3. Markdown Memory Paradigm in AI Agent Architectures(tom 7-27 14:40 radar + Manus 2025-12 Meta $20-30 亿收购 + OpenClaw + Claude Code 文件系统即上下文范式)= §2.4 记忆 / 长视野 第 12 件候选 · 「语义索引(sqlite-vec)作为派生能力 · 混合架构正在成为 2026 年主流范式」——与 ACM lifecycle + PRO-LONG 完整日志 + AHE 可观测性 形成"范式四路线对立"(向量索引 / 完整日志 / 生命周期 / 文件系统 / 可观测性),§3.2 争议候选新增 第 36 条
    4. arXiv:2607.22157 Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents(tom 7-27 20:40 radar ⭐⭐⭐⭐⭐ 首选 · $τ$-bench 银行领域击败完整 RAG)= §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 · 「外部记忆 + 规则蒸馏」对冻结权重 agent 的持续学习新范式 · 与 ReOPD prefix replay distillation + Sample-Efficient Experience Distillation + OpenForgeRL harness-native training 形成"训练工程化复用"四联对照
    5. HF Daily 7-27 票榜续立/翻倍第 2 日 = AREX 139▲ 持续登顶 + SANA-Video 2.0 单日 +6 + 9 件净增续立(tom 7-27 0900 + stephen 7-27 1245 + flyp 7-27 multimodal §1.2)= v34 §2.5 第 85 节点 AREX + §2.4 NVIDIA OO Agents + §2.4 Tencent WorkBuddy Bench 持续验证;Self-Supervised Structured Dynamics arXiv:2607.21576 28→18▲ 单日 -10 跌出前 15 名边缘 + 累计跨日 60▲ = flyp v34 §3.3 反方 #55 评级升级时机风险激活(评级升级次日反向波动)。
    6. vLLM v0.20.0 三层分层架构 + Turion.ai vLLM vs SGLang 工作负载分类 Benchmark + arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache(jay 7-27 csdn-vllm020-mcp-stateless + jay 7-27 1100 engineering-filter + jay 7-27 1950 evening engineering-filter p2 + tom 7-27 22:23 inference-e1prep)= v34 §1.33c 横切 53c 商业 Harness 立标补全 + §2.5 第 86 节点 · engineering/llm-infra 主题主导邻接补全——非 coding-agents 直接立标,但通过 harness → inference 影响 coding agents。
  • 本日谨慎提醒:
    1. arXiv:2605.20173 SDB paper_card 仍未建卡(spark 7-27 13:30 §增量 2 已标 P0 + stephen 7-27 12:45 §3.1 P0 信号 3)= v34 §2.6 第四十二子节候选,pipeline 漏斗节点
    2. Anthropic Claude Opus 5 / Sonnet 5 / Fable 5 / Mythos 5 关系 + 工具使用相对 4.6 提升幅度 + Managed Agents effort 精度 vs OpenAI / Gemini effort head-to-head 7-27 仍未官方文档核证(stephen 7-27 ai-industry + spark 7-27 §A 沿用):v34 §3.2 争议 #31 + §4.1 开放问题 #47 沿用
    3. AAAI 2026 Subramanian「Keyword search is all you need」arXiv:2602.23368v1 GitHub 链接 7-27 仍未核证(jay 7-27 08:22 csdn-substack-rag-finetuning + tom 7-27 0850 + stephen 7-27 1023 = 5 实例均未补)——v34 §3.2 争议 #34 + §4.1 开放问题 #50 沿用
    4. AAAI 2026 Subramanian 单一 LLM 对照可比性盲区 + 200K context vs shell grep 边界不清 + Amazon Bedrock KB 利益相关 + 与混合方案未对照(flyp 7-27 0950 critical-read 7 反方硬标签 #1-#6)——v34 §3.2 争议 #34 + §4.1 开放问题 #50 沿用
    5. AAAI 2027 截稿时间 2026-07-28(明天)= jay 7-27 1950 evening engineering filter p2 条目 7 + GitHub khairulislam/ML-conferences 紧急提醒——具体工程行动截止点,如 5 实例 / stephen 有意向 AAAI 2027 投递系统方向论文
    6. arXiv:2607.12406v1 Isolation-as-First-Class paper_card 仍未建卡(stephen 7-27 1023 + jay 7-27 csdn-substack 沿用 + spark 7-27 agent-e1prep §2.x 沿用 + R29 §2.1 B 类已立标但 paper_card 缺):v34 §2.5 第 11 阶候选 + risk.md R29 §2.1 D 类 = 双向 reference 但 paper_card 缺 = pipeline 漏斗节点
    7. arXiv:2607.21461 AREX paper_card 仍未建卡(stephen 7-27 1245 §3.2 已标 🔴 AREX 7-25 HF Daily #1 117▲ 当日 #1 但 7-26 / 7-27 paper_card 未补):v34 §2.5 第 85 节点候选 = pipeline 漏斗节点
    8. flyp v34 §3.3 反方 #55「评级升级时机风险」激活(Self-Supervised Structured Dynamics arXiv:2607.21576 7-27 28→18▲ 单日 -10 跌出前 15 名边缘):7-28 ~ 7-30 累计跨日必须复核(本棒标注关键截止日)
    9. evaluation 主题活文档 3 天未更新待补救(2026-07-24 00:18 → 2026-07-27 23:00 · work-queue.md 自动检测持续提示 + spark 7-27 agent-e1prep §4.5 标 🔴):tom / flyp / jay 任一实例在 7-27 evening 或 7-28 morning 接力
    10. Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验 vs Alice Labs 博客日期 vs 实际 GitHub release tag 差(jay 7-27 T1735 briefing 沿用):v34 §4.1 开放问题 #52 沿用
    11. Microsoft MAF Harness GitHub samples ./harness 实际 API 待核(jay 7-25 1055 engineering-filter 沿用):v34 §4.1 开放问题 #52 沿用
    12. Spark E1 节奏连续 2 日回落(7-27 截至 13:30 0 件 E1 · 7-27 截至 22:45 实际 2 件 E1 agent 13:41 + llm-infra 18:52 = 双 E1 完整恢复第 2 棒) = spark E1 节奏第 2 日观察窗口未关闭(stephen 晚场协调棒 §1.6)
    13. OpenClaw 210k stars(沿用 v34) vs GitHub 12,981 stars(2026-07-26 trending 实时数据) 数据传染/版本混淆(jay 7-26 1123 engineering-e1prep §警示 1):v34 §3.2 争议 候选新增 35 沿用

1. 增量条目(0 件 P0 主线 + 2 件 P0 沿用升级 + 2 件 P0 跨主题补全 + 2 件 P1/P2 监测,按"建议归入节"分组)

增量 1 · ⭐⭐⭐ · Anthropic 7-27 morning 评论层长尾持续 + Economic Index connector 落地 + Public First Action 再捐 2000 万美元 = §1.45 frontier lab 立标 §6 行业升级 5 件合并 续立轨迹沿用 + §2.103 评论层长尾 7-25~7-27 续立(P0 沿用升级)

字段 内容
来源 inbox/stephen/2026-07-27-1006-news-anthropic-news.md(5 URL: Claude Opus 5 系统卡 + Claude Opus 5 介绍 + Economic Futures Research Fund 议程 + Anthropic Economic Index 连接器 + 再向 Public First Action 捐赠 2000 万美元)+ inbox/jay/2026-07-27-1001-rss-simon-willison.md Boris Cherny 引语 沿用 + inbox/jay/2026-07-27-1001-rss-nathan-benaich.md Air Street Capital Fund III + State of AI 5 月 + Boris Cherny + Claude Opus 5 沿用 + inbox/spark/2026-07-27-agent-e1prep.md §增量 7 P1 P0(Anthropic Economic Index connector 7-27 morning 落地 + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元)+ inbox/flyp/2026-07-27-risk-e1prep.md §增量 3 P3 沿用
arXiv 号 无(Anthropic 平台层文档 + 评论层长尾 6 媒体续立)
一句话 Anthropic Claude Opus 5 系统卡 7-27 morning 发布(继 7-24 evening 立标首位 + 7-25 评论层 6 媒体 48h 长尾 + 7-26 §1.45 沿用升级 + 7-27 morning 持续长尾)+ Anthropic Economic Index connector 7-27 morning 落地(经济测度产品化)+ Economic Futures Research Fund 议程第二阶段(治理研究 + 公共政策)+ Public First Action 再捐 2000 万美元(治理研究 + 公共政策倡导的资金承诺) = Anthropic 7-22~7-27 平台层 + 代理化扩展 + 治理研究 三栖立标持续长尾 7 天立标密度最高一周 7-21~7-27
v34 脉络关系 与 v34 §1.41 横切 60-66 v23 七件主轴 + v34 §1.45 五向合流 + v34 §2.103 段尾"评论层长尾 7-25~7-26 6 媒体续立"标注 + v34 §2.103 "评测 → 系统卡 → 评论 → 红队"4 栖验证 第 1 例 + v34 §3.1 共识 #35 "frontier lab 平台层 + 代理化扩展 + 路线层 + 资本层 + 国家科学战略 + 评论层 7-22~26 八栖合流立标" 同源;v34 §2.103 段尾"评论层长尾 7-25~7-27 持续 6 媒体续立"标注 + v34 §1.45 frontier lab 立标 §6 行业升级 5 件合并 续立轨迹沿用 + v34 §3.1 共识 #35 续立:1) Anthropic Claude Opus 5 系统卡 7-27 morning 发布(继 7-24 evening 正式发布 + 7-25 Boris Cherny 评论 + 7-26 评论层 6 媒体 48h 持续)= 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例 沿用升级 + 评论层长尾 7-25~7-27 持续 6 媒体续立;2) Anthropic Economic Index connector 7-27 morning 落地(经济测度从研究项目升级为产品形态,可与外部 API / 数据源对接) = v34 §2.103 立标首位沿用升级 + §1.45 §6 行业升级 5 件合并 续立轨迹;3) Economic Futures Research Fund 议程第二阶段(治理研究第二阶段 = 在第一阶段 1.0 基金基础上扩展研究议程) = v34 §1.45 frontier lab 立标 §6 行业升级 续立;4) Public First Action 再捐 2000 万美元(治理研究 + 公共政策倡导的资金承诺) = v34 §2.103 平台层立标 续立轨迹;5) Anthropic 7-22~7-27 五线齐扩(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Managed Agents + Project Glasswing + Economic Index + Public First Action 2000 万美元 + 4 模型矩阵形态分化 Opus/Fable/Mythos/Sonnet) = v34 §1.45 frontier lab 立标 §6 行业升级 5 件合并 + v34 §1.41 横切 60-66 v23 七件主轴升格为"九件主轴"持续沿用;6) Anthropic 模型矩阵形态分化第二例(Sonnet 5 = 更代理化 / 工具使用强 vs Opus 5 = 中等/bounded tasks + 经济性 vs Fable 5 = 长时自主(数小时-数天)vs Mythos 5 = 网络安全/生物研究领先)= v34 §1.41 横切 60-66 v23 七件主轴「frontier lab 模型矩阵形态分化」 候选 沿用升级;7) Anthropic 评论层长尾 7-25~7-27 持续 6 媒体 + 7-27 morning 系统卡发布 = v34 §2.103「评测 → 系统卡 → 评论 → 红队」4 栖验证 第 1 例 沿用升级
反方 / 风险 (A) 「更代理化的 Sonnet」 具体定义待 Anthropic 官方文档核证 + 工具使用相对 4.6 提升幅度待核;(B) Sonnet 5 vs Opus 5 / Sonnet 5 vs Fable 5 / Sonnet 5 vs Sonnet 4.6 head-to-head 评测待核;(C) Managed Agents effort 精度 vs OpenAI Reasoning effort / Gemini 3.6 Flash effort head-to-head 待核;(D) Boris Cherny 评论原文出处 + Opus 5 PI evals / red team 完整版本待核;(E) Project Glasswing 保护全球软件安全 vs Project Pilot AI 操控无人机 关系待核;(F) Claude Sonnet 5 系统卡是否同步发布待核 + 7-27 morning Opus 5 系统卡 vs Sonnet 5 系统卡 关系待核;(G) Economic Index connector 公开 SDK 文档 / API 边界 + 与外部数据源对接的精确接口 待核;(H) Public First Action 2000 万美元用途细分 + 与现有 AI 治理研究资金池(OpenAI Advancing National Science + DeepMind DOE Genesis)的协调关系 待核
建议归入节 §1.41 横切 60-66 v23 七件主轴 升为九件主轴 持续沿用(Claude Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 frontier model / 平台层立标)+ §1.45 frontier lab 立标 §6 行业升级候选新增"Anthropic Claude Opus 5 系统卡 7-27 morning 发布 + Economic Index connector 7-27 morning 落地 + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元(7-22~7-27 平台层 + 代理化扩展 + 治理研究 三栖立标持续长尾)" + §2.103 段尾"评论层长尾 7-25~7-27 持续 6 媒体续立 + Anthropic 7-27 morning 系统卡发布"标注 + §2.6 评测、可靠性与对抗(评测 → 系统卡 → 评论 → 红队 4 栖验证沿用) + §3.1 共识(候选新增 35 续立 "frontier lab 平台层 + 代理化扩展 + 路线层 + 资本层 + 国家科学战略 + 评论层 + 治理研究 7-22~7-27 九栖合流立标") + §4.1 开放问题(候选新增 47 续立 "Anthropic 7-22~7-27 模型矩阵 head-to-head + Managed Agents effort 精度 vs OpenAI/Gemini effort + Opus 5 vs Sonnet 5 PI ~0 一致性验证 + Sonnet 5 系统卡是否同步发布 + Economic Index connector SDK 文档核证 + Public First Action 2000 万美元用途细分") + §6 必读清单 沿用 Opus 5 系统卡 7-27 morning 版 + Boris Cherny 评论 + Project Pilot + Sonnet 5 官方文档 + Managed Agents effort 设置 文档 + Economic Index connector SDK 文档 第 139-144 条
重要边界 不要与 v34 §1.41 横切 60-66 Opus 5 7-24 evening 立标首位 混为同一件工作:Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = "更代理化的 Sonnet" = 沿用平台层但模型形态分化;不要与 v34 §1.41 Mythos 5 / Fable 5 沿用立标 混为同一件工作:Mythos 5 = 网络安全/生物研究领先, Fable 5 = 长时自主(数小时-数天), Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = "更代理化" = 4 模型矩阵形态分化;不要与 v34 §1.34b Anthropic J-space arXiv:2607.15495 混为同一件工作:J-space 是认知科学锚点论文, Sonnet 5 是 frontier model + 评论 + 平台层 = 认知科学 vs 模型本体 不同对象;不要与 v34 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Cyber 是 vertical LLM 网络安全, Sonnet 5 是本体模型 + 平台层 = vertical LLM vs 本体模型 不同对象;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 混为同一件工作:Harness 层是产品级 Harness, Sonnet 5 是 frontier model + 平台层 = Harness vs model 不同对象;不要与 v34 §1.45 OpenAI Presence 三栖项目化 混为同一件工作:OpenAI Presence = 平台层 + 资本层 + 国家科学战略, Anthropic Economic Index connector = 平台层 + 经济测度 + 治理研究 = 不同主题;不要与 v34 §2.103 评论层长尾 7-25~7-26 6 媒体续立 混为同一件工作:评论层长尾 7-25~7-26 = 评论层 6 媒体续立, 评论层长尾 7-25~7-27 = 评论层 6 媒体 + 系统卡发布续立 = 时间窗口扩展

增量 2 · ⭐⭐⭐⭐⭐ · arXiv:2605.20173 SDB(Stochastic-Deterministic Boundary)生产 LLM Agent 运行时架构框架 = §2.6 第四十二子节 立标级候选新增 · 21 调用点审计 + 71% SDB 边界故障 + 81% 修复加固 SDB 四部分之一(P0 跨主题补全)

字段 内容
来源 inbox/jay/2026-07-27-1100-jay-engineering-filter.md(✅ 保留条目 1)+ inbox/jay/2026-07-27-1123-engineering-e1prep.md §增量 1 ⭐⭐⭐⭐⭐(19KB · 6 件主线增量 · 知识库 v36 §2.91 子节位置 · 工程化分析)+ inbox/stephen/2026-07-27-1245-stephen-coordination-check-noon.md §3.1 P0 信号 3 + inbox/spark/2026-07-27-agent-e1prep.md §增量 2 🔴 P0(8.7KB · 立标级候选)+ inbox/flyp/2026-07-27-risk-e1prep.md §增量 3 P3(SDB 边界弱点 71% = R29 §2.1 B 类 Isolation agent-execution 边界 + agent-tool 边界 + R27 Self-State Attacks 23-cell × 43 ops 残余攻击面的反向实证) + paper_card 未建
arXiv 号 arXiv:2605.20173 SDB Stochastic-Deterministic Boundary 生产 LLM Agent 运行时架构框架
一句话 SDB(Stochastic-Deterministic Boundary)描述 LLM 输出如何转化为系统行为的四部分契约(proposer 提议者 + verifier 验证者 + commit step 提交步骤 + reject signal 拒绝信号)。一手工程数据:审计 5 个主流开源 agent 框架共 21 个 LLM-to-action 调用点,其中 19 个存在显式 verifier-and-commit 逻辑;分析 21 篇 agent 故障 post-mortem,71%(15/21)的故障可归因于 SDB 边界弱点;81%(17/21)的修复加固了 SDB 四部分之一。生产 agent 运行时三类正交关注点:Coordination(协调)+ State(状态)+ Control(控制),以及六种组合 pattern = 首个将"LLM 输出 → 系统行为"的边界问题形式化为可审计的框架,而非抽象工程原则 + Why Agents Fail 形式化锚定
v34 脉络关系 与 v34 §2.6 评测、可靠性与对抗 41 子节 + v34 §1.43 横切 80 Why Agents Fail 7 件套(Compounding Error 0.85^10 ≈ 0.197 量化公式 + Gartner 2027 40% 废弃预测 + "quiet failure" 概念)+ v34 §2.5 安全契约 第 9 阶 + 第 10 阶 + 第 11 阶 + v34 §1.33c 横切 53c 商业 Harness 立标 同源;v34 §2.6 评测、可靠性与对抗 41 子节 → 42 子节扩(立标级 · SDB = 生产 Agent 可靠性首获系统性审计框架):1) 「SDB 四部分契约(proposer + verifier + commit step + reject signal)」 = LLM 输出 → 系统行为的边界问题形式化 = 与 v34 §2.6 41 子节(Silent Failure 4,286 单元测试 + 827 治理检查 · arXiv:2606.14589)+ Cost-Aware Security Agent(arXiv:2607.15263)+ Behavioral Privacy(arXiv:2607.06815)+ Manager Coercion(arXiv:2607.15434)+ Tool-Call Boundary Drift(arXiv:2607.07050)+ DeepSearch-World(arXiv:2607.07820)+ AutoIndex(arXiv:2607.18603)+ LangGraph(arXiv:2607.19297)+ Beyond Relevance-Centric Retrieval(arXiv:2607.19747)+ AAAI Subramanian(arXiv:2602.23368)沿用升级 = v34 §2.6 第四十二子节 立标级新增 · SDB 形式化锚定 Why Agents Fail;2) 「71% SDB 边界故障 + 81% 修复加固 SDB 四部分之一」 = v34 §1.43 Why Agents Fail 7 件套的量化根因(Compounding Error 0.85^10 ≈ 0.197 量化公式 + Gartner 2027 40% 废弃预测 + "quiet failure" 概念) = Why Agents Fail 形式化锚定;3) 「5 个主流开源 agent 框架 21 个 LLM-to-action 调用点 19 个存在显式 verifier-and-commit 逻辑」 = v34 §2.5 安全契约 第 9 阶(Self-State Attacks Schmidhuber 参与 · arXiv:2607.17986)+ 第 10 阶(SeerGuard arXiv:2607.15550)+ 第 11 阶(Isolation-as-First-Class arXiv:2607.12406)邻接补全 = 攻 + 防 + SDB 形式化 三向合并;4) 「Coordination + State + Control 三类正交关注点 + 六种组合 pattern」 = v34 §2.1 Harness 学术化 11 阶段 邻接补全(H=(E,T,C,S,L,V) 学术 Harness 六维运行时分解沿用升级) = 学术 Harness → 生产 Agent 运行时 三类正交关注点形式化;5) 「与 ACM(arXiv:2607.21503)lifecycle + architecture 双向范式 + ReOPD(arXiv:2607.04763)prefix trap + Sample-Efficient(arXiv:2607.21051)Experience Distillation 三栖合流」 = v34 §2.4 记忆 / 长视野 10 件 → 11 件扩 + §2.4 后训练 Agentic RL 训练栈 17 件 → 18 件候选扩;6) 「与 HF 2026-07 安全入侵实战(17,000+ 离散操作 + 跨沙箱群 + 自迁移 C2 + 商业 API safety guardrails 拒收真实攻击 payload → 最终使用自托管 GLM 5.2)+ 4 RCE CVE(PraisonAI + Langroid + Crawl4AI + Ruflo · 2026-07-13 披露)+ Oracle 2026 4 RCE CVE 集中爆发 + Self-State Attacks 第 9 阶 + HACO 99.2% SLO + SeerGuard 第 10 阶 + AgentCI MCP 安全立标 + Isolation-as-First-Class 第 11 阶 互补为「Agent 安全 = 攻击面分析 + 边界隔离 + CVE 集群 + harness 安全 + 自我状态 + MCP 三栖 + SDB 形式化锚定 7 维合并成熟」 = v34 §2.5 安全契约 第 9-11 阶 + 84/85 节点 + §2.6 第四十二子节 SDB 形式化锚定 立标级合并成熟
反方 / 风险 (A) 「六种 pattern 的具体组合方式(catalog 细节需读取原文)」 待核;(B) 「审计的 5 个 agent 框架具体是哪 5 个(可能 = LangChain / LangGraph / AutoGen / CrewAI / LlamaIndex 等)」 待核;(C) 「21 篇 post-mortem 的来源(公司/项目/时间范围)」 待核;(D) 「SDB 与 Isolation-as-First-Class arXiv:2607.12406 的 5 边界(user-agent / agent-tool / agent-execution / agent-agent / system-environment)的关系(SDB = 提议/验证/提交/拒绝 4 阶段;Isolation = 5 边界,是否 1:1 对应)」 待核;(E) 「71% 故障归因 SDB 边界弱点 vs 81% 修复加固 SDB 四部分之一 = 修复方向与审计结果高度吻合 但未给具体数据集与时间范围」 待核;(F) 「Coordination + State + Control 三类正交关注点 vs v34 §2.1 Harness H=(E,T,C,S,L,V) 六维运行时分解 的对应关系」 待核;(G) 「arXiv:2605.20173 v32 §2.6 agent.md 未收录 + paper_card 未建 = pipeline 漏斗节点 7-30 截止前必须补建卡」(spark 7-27 已标 P0 + stephen 7-27 1245 §3.1 P0 信号 3 + jay 7-27 1123 §增量 1 ⭐⭐⭐⭐⭐)
建议归入节 §2.6 评测、可靠性与对抗 第四十二子节(v33 新增 1 件正式子节,立标级;沿用 v31 第四十一 + 第四十一 a/b/c/d/e 子节)= §2.6 第四十二 SDB Stochastic-Deterministic Boundary = 生产 Agent 可靠性审计框架(arXiv:2605.20173 · 21 调用点审计 + 71% SDB 边界故障 + 81% 修复加固 SDB 四部分之一 + 6 种 pattern)+ §1.43 横切 80 Why Agents Fail(v32 已立 → v33 补充:"SDB = Why Agents Fail 的形式化锚定")+ §3.1 共识(候选新增 36 "SDB = 生产 Agent 可靠性审计的形式化锚定 · 71% 故障可归因 SDB 边界弱点 + 81% 修复加固 SDB 四部分之一 = Why Agents Fail 量化根因")+ §3.4 T110 长 horizon agent 范式转折立标集群(v32 8 件 → v33 第 9 件:"SDB = 可靠性形式化锚定")+ §2.5 安全契约 第 9-11 阶 + 84/85 节点(邻接补全:"攻 + 防 + SDB 形式化 三向合并" = Agent 安全 7 维合并成熟)+ §2.4 记忆 / 长视野 11 件扩 + §2.4 后训练 Agentic RL 训练栈 18 件候选扩(ACM + ReOPD + Sample-Efficient 三栖合流)+ §4.1 开放问题(候选新增 54 "SDB 六种 pattern catalog 细节 + 审计 5 个 agent 框架具体清单 + 21 篇 post-mortem 来源 + SDB vs Isolation-as-First-Class 5 边界 对应关系 + SDB vs Harness H=(E,T,C,S,L,V) 六维分解 对应关系 + arXiv:2605.20173 paper_card 7-30 截止前必须补建卡")+ §6 必读清单 候选新增 arXiv:2605.20173 SDB Stochastic-Deterministic Boundary 第 145 条(待 paper_card 建卡)
重要边界 不要与 v34 §2.6 41 子节 arXiv:2606.14589 Silent Failure 混为同一件工作:Silent Failure = 4,286 单元测试 + 827 治理检查,SDB = 21 调用点审计 + 71% 边界故障 + 81% 修复加固 = 单元测试 vs 调用点审计 不同方法;不要与 v34 §2.5 第 9 阶 Self-State Attacks arXiv:2607.17986 混为同一件工作:Self-State Attacks = 23-cell × 43 ops 残余攻击面,SDB = 提议/验证/提交/拒绝 4 阶段形式化 = 攻击面 vs 形式化锚定 不同层;不要与 v34 §2.5 第 11 阶 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation-as-First-Class = agent 安全 survey anchor 5 边界(user-agent / agent-tool / agent-execution / agent-agent / system-environment),SDB = 4 阶段契约(proposer + verifier + commit step + reject signal) = 5 边界 vs 4 阶段 不同分类;不要与 v34 §2.4 记忆 / 长视野 ACM arXiv:2607.21503 混为同一件工作:ACM = position paper + reference implementation 5 原语 lifecycle, SDB = position paper + 工程审计框架 = lifecycle vs 边界形式化 不同框架;不要与 v34 §2.1 Harness 学术化 H=(E,T,C,S,L,V) 六维运行时分解 混为同一件工作:Harness 6 维 = 学术 Harness 运行时分解, SDB = 生产 Agent 运行时三类正交关注点 = 学术 vs 生产 不同对象;不要与 v34 §1.43 Why Agents Fail 7 件套 混为同一件工作:Why Agents Fail = 失败模式 7 件套, SDB = Why Agents Fail 形式化锚定 = 模式 vs 锚定 不同层

增量 3 · ⭐⭐⭐⭐ · Markdown Memory Paradigm in AI Agent Architectures = 「文件系统即上下文」+ 语义索引(sqlite-vec)作为派生能力 + 混合架构正在成为 2026 年主流范式 = §2.4 记忆 / 长视野 第 12 件候选 · 「范式四路线对立」(向量索引 / 完整日志 / 生命周期 / 文件系统 / 可观测性)(P0 跨主题补全)

字段 内容
来源 inbox/tom/2026-07-27T1440-agent-rag-longcontext-radar.md §"The Markdown Memory Paradigm in AI Agent Architectures"(条目 6)+ inbox/spark/2026-07-27-agent-e1prep.md §增量 7 P1 监测(Manus 2025-12 Meta $20-30 亿收购 + OpenClaw + Claude Code 文件系统即上下文范式 沿用)+ inbox/jay/2026-07-27-1507-jay-briefing-agent-vecdb-k8s-stack2026.md alphaxiv Experience Distillation 沿用 + inbox/jay/2026-07-27-csdn-substack-rag-finetuning-llm-jul2026.md AI with Aish RAG 2026 沿用
arXiv 号 无明确单一 arXiv 号(涉及 Manus 2025-12 Meta $20-30 亿收购报道 + OpenClaw + Claude Code + sqlite-vec + 多个 GitHub 项目 + AI with Aish Substack)
一句话 Manus(2025 年 12 月被 Meta 以约 20-30 亿美元收购)+ OpenClaw + Claude Code 均转向以 Markdown 文件作为核心记忆原语,而非向量数据库。趋势:文件系统即上下文,语义索引(sqlite-vec)作为派生能力。混合架构正在成为 2026 年主流范式。Microsoft 收购 Manus 估值 $20-30 亿 = 工业级 Agent 厂商对"Markdown 文件作为核心记忆原语"的资本验证 = §2.4 记忆 / 长视野 第 12 件候选 · 「范式五路线对立」(向量索引 / 完整日志 / 生命周期 / 文件系统 / 可观测性)
v34 脉络关系 与 v34 §2.4 记忆 / 长视野 10 件(MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + SkillHone + Codified Context + PRO-LONG + ACM + SkillOpt + Memora + δ-mem + ReMemR1 + AutoMem + Codified Context) + v34 §2.4 上下文管理三路线对立(PRO-LONG 完整日志 + Agentic Context Management lifecycle + AHE 可观测性) + v34 §2.4 Agent 经验蒸馏双轨范式(Sample-Efficient + ReOPD) + v34 §1.33c 横切 53c 商业 Harness 立标 + v34 §2.5 记忆 / 长视野 10 件 邻接 同源;v34 §2.4 记忆 / 长视野 10 件 → 11 件扩 + §3.2 争议候选新增 第 36 条:1) 「Manus(2025-12 Meta $20-30 亿收购) + OpenClaw + Claude Code 均转向以 Markdown 文件作为核心记忆原语」 = v34 §2.4 记忆 / 长视野 第 5 路线 文件系统即上下文 范式候选(继向量索引 / 完整日志 / 生命周期 / 可观测性 4 路线后)= 「范式五路线对立」立标级候选 · §2.4 记忆 / 长视野 11 件 → 12 件扩;2) 「文件系统即上下文,语义索引(sqlite-vec)作为派生能力」 = v34 §2.4 记忆 / 长视野 现有 10 件(PRO-LONG 完整日志 + ACM lifecycle + AHE 可观测性 + SkillOpt Skill 训练参数 + Memora 谐波记忆 + δ-mem steering attention + MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context)沿用升级 = v34 §2.4 邻接补全;3) 「混合架构正在成为 2026 年主流范式」 = v34 §2.3 评测基础设施分层 22 行 + v34 §2.6 评测、可靠性与对抗 41 子节 + 42 子节(SDB)沿用升级 + v34 §1.43 横切 80 Why Agents Fail + v34 §1.45 frontier lab 4 栖立标 沿用 = 「范式五路线对立」立标级候选;4) 「Microsoft 收购 Manus 估值 $20-30 亿 = 工业级 Agent 厂商对"Markdown 文件作为核心记忆原语"的资本验证」 = v34 §2.5 第 11 阶 Isolation-as-First-Class + v34 §2.7 行业与平台动态 + v34 §1.45 frontier lab 立标 §6 行业升级 5 件合并 邻接 = frontier lab 资本层立标 + 工业级验证;5) 「与 v34 §1.45 Anthropic Claude Sonnet 5 + Managed Agents effort 设置 + 评论层 6 媒体 48h 持续长尾 + DeepMind Gemini 3 全栈 + OpenAI Presence 三栖 + LeCun AMI Labs $1.03B + Jim Fan World Models 立场 + GitHub Trending 6 件 + AI Engineer 画像 立标候选邻接」 = frontier lab + Agent 工业化 + 范式转折 三栖立标
反方 / 风险 (A) 「Microsoft 收购 Manus 估值 $20-30 亿 报道 待独立核证(Reuters / 36Kr / Bloomberg / The Information)」;(B) 「sqlite-vec 作为派生能力 vs 主流向量库(Qdrant / Weaviate / pgvector / FAISS / Pinecone)的边界不清 · 工业级 RAG 场景(<10M / 10M-100M / >100M 向量)的覆盖度待核」;(C) 「Manus + OpenClaw + Claude Code 三家厂商均转向 Markdown 文件作为核心记忆原语 · 但具体实现细节(grep 工具 / 文件系统遍历 / sqlite-vec 集成 / RAG 兜底)未给 · 是否完全弃用向量库或采用混合架构 待核」(与 AAAI Subramanian 7 反方 #6 同源问题);(D) 「Markdown 文件作为核心记忆原语 vs 现有 RAG-as-store 思路的工业级实测数据 · 是否在长上下文 / 多模态 / 安全场景下仍成立 待核」;(E) 「v34 §2.4 现有 10 件 + 1 件 Markdown = 11 件,可能 5 路线对立 = 候选立标级 但立标级证据强度待核」;(F) 「Microsoft 收购 Manus 是否影响 Manus 作为 Agent 厂商的开放性 / 与 Anthropic Claude Code / OpenAI Codex 的竞争关系 待核」
建议归入节 §2.4 记忆 / 长视野 第 12 件(v33 新增 1 件候选 · 立标级 · 「Markdown Memory Paradigm = 文件系统即上下文 · 语义索引作为派生能力 · 混合架构 2026 主流范式」)+ §2.4 上下文管理三路线对立 → 范式五路线对立(v32 PRO-LONG 完整日志 + ACM lifecycle + AHE 可观测性 三路线对立 → v33 加 Semantic Index(sqlite-vec) + File System As Context = 五路线对立)+ §1.33c 横切 53c 商业 Harness 立标补全(Manus + OpenClaw + Claude Code = 主流 Agent 厂商采纳 Markdown 记忆原语)+ §2.7 行业与平台动态 邻接补全(Microsoft 收购 Manus 估值 $20-30 亿 = frontier lab 资本层立标)+ §3.1 共识(候选新增 37 "Markdown Memory Paradigm = 文件系统即上下文 · 语义索引作为派生能力 · 混合架构 2026 主流范式 · 工业级 Agent 厂商 Manus + OpenClaw + Claude Code 均采纳") + §3.2 争议(候选新增 36 "Markdown vs 向量库 vs 完整日志 vs lifecycle vs 可观测性 = 范式五路线对立 · 是否完全弃用向量库 or 混合架构 · 工业级 RAG 场景(<10M / 10M-100M / >100M 向量)覆盖度") + §4.1 开放问题(候选新增 55 "Manus $20-30 亿收购核证 + sqlite-vec vs 主流向量库边界 + 三家厂商具体实现细节 + Markdown vs RAG-as-store 工业级实测 + v34 §2.4 11 件立标级证据强度") + §6 必读清单 候选新增 Markdown Memory Paradigm + Manus + OpenClaw + Claude Code 4 件 第 146-149 条
重要边界 不要与 v34 §2.4 PRO-LONG arXiv:2607.20064v2 混为同一件工作:PRO-LONG 是「不设 memory 子系统 + 完整结构化日志 + 编码 agent 在日志里检索」, Markdown 是「文件作为核心记忆原语 + 语义索引作为派生能力」 = 不设 memory vs 文件作为 memory 不同路线;不要与 v34 §2.4 Agentic Context Management arXiv:2607.21503 混为同一件工作:ACM 是「完整生命周期 + 5 原语 + 3 档成本曲线」 position paper, Markdown 是「工业级 Agent 厂商实践 · 文件系统即上下文」 = 学术 vs 工业 不同对象;不要与 v34 §2.4 AHE experience observability arXiv:2604.25850 混为同一件工作:AHE = component / experience / decision 三层 observability, Markdown = 文件系统作为记忆 = observability vs 记忆 不同层;不要与 v34 §2.4 SkillOpt + Memora MSR 7-25 沿用升级 混为同一件工作:SkillOpt + Memora = MSR Skill 训练参数 + 谐波记忆, Markdown = 工业级 Agent 厂商实践 · 文件系统即上下文 = 不同机构不同形态;不要与 v34 §2.4 Sample-Efficient arXiv:2607.21051 + ReOPD arXiv:2607.04763 混为同一件工作:Sample-Efficient + ReOPD = 训练时样本效率框架, Markdown = 推理时记忆原语 = 训练 vs 推理 不同对象;不要与 AAAI 2026 Subramanian arXiv:2602.23368 混为同一件工作:Subramanian = 「Agentic 搜索工具调用 vs 向量检索」对立, Markdown = 「文件系统即上下文 vs 向量库」对立 = 不同对立维度(检索 vs 记忆)

增量 4 · ⭐⭐⭐ · arXiv:2607.22157 Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents = §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 · 「外部记忆 + 规则蒸馏」对冻结权重 agent 的持续学习新范式(P1 邻接)

字段 内容
来源 inbox/tom/2026-07-27T2040-agent-rag-longcontext-radar.md ⭐⭐⭐⭐⭐ 首选 + inbox/stephen/2026-07-27-2245-stephen-coordination-check-evening.md §1(7 反方预判)+ inbox/flyp/2026-07-27-risk-e1prep.md 邻接沿用 + paper_card 未建
arXiv 号 arXiv:2607.22157 Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents(2026-07-24)
一句话 AI Agent 每次运行都在产生学习信号(outcome verdicts、事后纠正),但模型部署后即冻结,无法利用。解决方案:将外部记忆与自然语言规则蒸馏配对,每次 episode 将反馈转化为可检索的规则。在 $τ$-bench 银行领域测试中,击败完整 RAG 基线(静态 RAG 检索全量知识库)。关键机制:外部记忆 + 规则蒸馏 → 不改模型权重也能持续学习 = §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 · 「外部记忆 + 规则蒸馏」对冻结权重 agent 的持续学习新范式 · 与 ReOPD prefix replay distillation + Sample-Efficient Experience Distillation + OpenForgeRL harness-native training 形成"训练工程化复用"四联对照
v34 脉络关系 与 v34 §2.4 后训练 Agentic RL 训练栈 17 件(Agent-STAR + LongStraw + SAO + SEED + Function-Aware FIM + Tool-Call Boundary Drift + DataFlow-Harness + SkewAdam + Google Tunix + Sample-Efficient + ReOPD + OpenForgeRL + AREX + δ-mem + SkillOpt + Memora + Self-Harness + Agent Compactor)+ v34 §2.4 Agent 经验蒸馏双轨范式(Sample-Efficient + ReOPD)+ v34 §1.33c 横切 53c Harness 层 + v34 §2.1 Harness 学术化 11 阶段 + v34 §2.4 记忆 / 长视野 11 件 同源;v34 §2.4 后训练 Agentic RL 训练栈 17 件 → 18 件候选扩(P3 · Learning on the Job):1) 「外部记忆 + 规则蒸馏 → 不改模型权重也能持续学习」 = v34 §2.4 现有 17 件 Agentic RL 训练栈(LongStraw + Agent-STAR + SAO + SEED + DeNovoSWE + Function-Aware FIM + SWE-Pruner Pro + Tool-Call Boundary Drift + DataFlow-Harness + SkewAdam + Sample-Efficient + ReOPD 已有 + On-Policy Distillation + OpenForgeRL + AREX + δ-mem + SkillOpt + Memora + Self-Harness)互补为「Agent 训练工程化复用 + 持续学习新范式」;2) 「$τ$-bench 银行领域击败完整 RAG 基线(静态 RAG 检索全量知识库)」 = v34 §2.3 评测基础设施分层 22 行 + v34 §2.6 评测、可靠性与对抗 41/42 子节 邻接补全 = v34 §2.6 第四十二子节 SDB 立标级候选 + §1.43 Why Agents Fail 形式化锚定 邻接;3) 「外部记忆 + 规则蒸馏」= v34 §2.4 记忆 / 长视野 11 件 + Markdown Memory Paradigm 第 12 件候选 邻接补全 = 「外部记忆作为核心记忆原语」 vs 「文件系统即上下文」 vs 「向量索引作为派生能力」 = 范式五路线对立 邻接;4) 「与 ReOPD prefix replay distillation(arXiv:2607.04763)方法学同源待核」= v34 §2.4 ReOPD critical-read B 级 7 反方硬标签 #4 沿用升级 = 「训练信号复用(ReOPD prefix replay)vs 外部记忆+规则蒸馏(Learning on the Job)」= 训练工程化复用二联对照;5) 「frozen weights vs 完整模型 fine-tune 哪个更强未对照」 = v34 §2.4 Sample-Efficient(arXiv:2607.21051)Experience Distillation + ReOPD prefix replay distillation 同源问题 = 「样本效率 vs 外部记忆 vs 规则蒸馏」三栖合流
反方 / 风险 (A) 「$τ$-bench 单一领域(银行领域)vs 通用 RAG · 是否在多领域 / 长上下文 / 多模态场景下仍成立」 待核;(B) 「规则蒸馏的具体规则格式(自然语言 vs 形式化)未给」 待核;(C) 「frozen-weights vs 完整模型 fine-tune 哪个更强未对照」 待核;(D) 「外部记忆+规则蒸馏 vs ReOPD prefix replay distillation 方法学同源待核」(flyp 7-26 2250 critical-read 7 反方硬标签 #4 沿用升级);(E) 「规则数量 + 记忆容量上限未给 · 长期持续学习(>1000 episode)的稳定性未给」 待核;(F) 「与 MemGPT / PRO-LONG / RRB / ACM head-to-head 缺失」 待核;(G) 「arXiv:2607.22157 paper_card 未建 = pipeline 漏斗节点 7-30 截止前必须补建卡」(tom 7-27 20:40 radar ⭐⭐⭐⭐⭐ + stephen 7-27 2245 §1)
建议归入节 §2.4 后训练 Agentic RL 训练栈 17 件 → 18 件候选扩(v33 新增 1 件 P3 候选 · Learning on the Job · 外部记忆 + 规则蒸馏 · $τ$-bench 银行领域击败完整 RAG)+ §2.4 Agent 训练工程化复用 二联对照(OpenForgeRL 训练栈复用 + ReOPD 训练数据复用 + Sample-Efficient 样本效率 + Learning on the Job 外部记忆+规则蒸馏 = 四联对照)+ §2.4 记忆 / 长视野 11 件 → 12 件扩(Markdown Memory Paradigm 第 12 件候选 + Learning on the Job 第 13 件候选 邻接)+ §2.3 评测基础设施分层 22 行 邻接补全($τ$-bench 银行领域 击败完整 RAG = 工业级评测)+ §2.6 评测、可靠性与对抗 41/42 子节 邻接补全(SDB 形式化锚定 + Learning on the Job 外部记忆 + 规则蒸馏)+ §3.1 共识(候选新增 38 "Learning on the Job = 外部记忆 + 规则蒸馏 · 冻结权重 agent 持续学习新范式 · $τ$-bench 银行领域击败完整 RAG") + §3.2 争议(候选新增 37 "$τ$-bench 单一领域 vs 通用 RAG · 规则蒸馏格式 vs frozen weights vs fine-tune · 长期稳定性未给") + §4.1 开放问题(候选新增 56 "Learning on the Job 7-30 截止前必做 4 项 = PDF 全文 + head-to-head 验证 + 与 ReOPD / MemGPT / PRO-LONG / RRB 对照 + 规则数量与记忆容量上限") + §6 必读清单 候选新增 arXiv:2607.22157 Learning on the Job 第 150 条(待 paper_card 建卡)
重要边界 不要与 v34 §2.4 17 件 Agentic RL 训练栈 LongStraw + Agent-STAR + SAO + SEED + DeNovoSWE + Function-Aware FIM + SWE-Pruner Pro + Tool-Call Boundary Drift + DataFlow-Harness + SkewAdam + Sample-Efficient + ReOPD 已有 + On-Policy Distillation + OpenForgeRL + AREX + δ-mem + SkillOpt + Memora + Self-Harness 混为同一件工作:Learning on the Job 是「外部记忆 + 规则蒸馏 · 冻结权重 agent 持续学习新范式」,既有 17 件是「训练范式与方法」 立标 = 持续学习 vs 训练范式 不同对象;不要与 v34 §1.33c 横切 53c Harness 层 混为同一件工作:Harness 层是产品级 Harness, Learning on the Job 是训练工程化复用 = Harness vs training 不同对象;不要与 v34 §2.5 第 84 节点 OpenForgeRL 混为同一件工作:OpenForgeRL 是「训练栈复用(harness ↔ RL)」, Learning on the Job 是「外部记忆 + 规则蒸馏 · 冻结权重 agent 持续学习」 = 训练栈复用 vs 持续学习 不同维度;不要与 v34 §2.4 Agentic Context Management arXiv:2607.21503 混为同一件工作:ACM 是「推理时上下文管理」 5 原语 + 3 档成本曲线, Learning on the Job 是「训练时持续学习」 外部记忆 + 规则蒸馏 = 推理 vs 训练 不同对象;不要与 v34 §2.4 Sample-Efficient arXiv:2607.21051 + ReOPD arXiv:2607.04763 Agent 经验蒸馏双轨范式 混为同一件工作:Sample-Efficient + ReOPD = 「训练时样本效率框架 + prefix replay distillation」, Learning on the Job = 「推理时外部记忆 + 规则蒸馏 · 冻结权重持续学习」 = 训练 vs 推理 不同时间维度;不要与 v34 §2.4 Markdown Memory Paradigm 第 12 件候选 混为同一件工作:Markdown = 「文件系统即上下文 · 语义索引作为派生能力 · 工业级 Agent 厂商实践」, Learning on the Job = 「外部记忆 + 规则蒸馏 · 学术论文方法」 = 工业实践 vs 学术方法 不同对象

增量 5 · ⭐⭐⭐ · HF Daily 7-27 票榜续立/翻倍第 2 日 = AREX 139▲ 持续登顶 + SANA-Video 2.0 单日 +6 + 9 件净增续立 + Self-Supervised Structured Dynamics 跌出前 15 名边缘 = flyp v34 §3.3 反方 #55 评级升级时机风险激活(P2 监测)

字段 内容
来源 inbox/tom/2026-07-27-0900-hf-daily-2026-07-27.md(15 篇 · 按社区票数排序)+ inbox/stephen/2026-07-27-1245-stephen-coordination-check-noon.md §2.2(HF Daily 7-27 票榜续立/翻倍第 2 日)+ inbox/flyp/2026-07-27-multimodal-e1prep-v34.md §1.2 / §1.4(v34 §3.3 反方 #55 评级升级时机风险激活)+ inbox/spark/2026-07-27-agent-e1prep.md §增量 3 🔴 P0(HF Daily 7-27 票榜续立/翻倍第 2 日)
arXiv 号 2607.21461 AREX 139▲ 持续登顶 · 累计跨日 117+127+139=383 | 2607.20145 SLAI T-Rex 58▲ +2 续立 · 累计跨日 56+58=114+ | 2605.09635 K12-KGraph 57▲ +2 续立 · 累计跨日 55+57=112+ | 2607.20061 ReferTrack 49▲ 无变化 · 累计跨日 44+49+49=142 跨日累计 | 2607.21556 视觉对比自蒸馏 43▲ +2 续立 · 累计跨日 41+41+43=125 跨日累计 | 2607.01774 Subliminal Clocks 38▲ 无变化 · 累计跨日 38+38=76+ | 2607.21072 Show, Don't Tell 35▲ 无变化 · 累计跨日 34+35+35=104 跨日累计 | 2607.20368 Self Gradient Forcing 30▲ 无变化 · 累计跨日 30+30=60+ | 2607.19747 Beyond Relevance-Centric 29▲ +1 续立 · 累计跨日 28+29=57+ | 2607.21553 SANA-Video 2.0 27▲ +6 立标级证据继续充分加固 · 累计跨日 15+21+27=63 跨日累计 | 2607.20709 NVIDIA-labs OO Agents 26▲ +4 续立 · 累计跨日 22+26=48+ | 2607.16165 ActiveVision 25▲ +1 续立 · 累计跨日 24+25=49+ | 2607.20734 LLMs Get Lost 21▲ +3 升幅显著 · 累计跨日 18+21=39+ | 2607.20911 Tencent WorkBuddy Bench 21▲ +1 续立 · 累计跨日 20+21=41+ | 2607.21576 Self-Supervised Structured Dynamics 18▲ -10 ⚠️ 跌出前 15 名边缘 · 累计跨日 14+28+18=60 跨日累计
一句话 AREX arXiv:2607.21461 7-27 139▲ 持续登顶 · 累计跨日 383▲ = 主线 K 连续 6 天 7-22 + 7-23 + 7-24 + 7-25 + 7-26 + 7-27 出现 = "首次出现 → 重复出现 → 稳定 → 持续稳定 → 持续稳定 v2 → 持续稳定 v3" 六阶段诊断完成 · v34 §2.5 第 85 节点候选持续验证 + 9 件净增续立/翻倍(AREX 139▲ + SANA-Video 2.0 27▲ + ReferTrack 142▲ + NVIDIA OO Agents 26▲ + Tencent WorkBuddy Bench 21▲ 等)= HF Daily 7-27 票榜 第 2 日续立/翻倍证据加固 + Self-Supervised Structured Dynamics arXiv:2607.21576 7-27 28→18▲ 单日 -10 跌出前 15 名边缘 + 累计跨日 60▲ = flyp v34 §3.3 反方 #55 评级升级时机风险激活(评级升级次日反向波动)
v34 脉络关系 与 v34 §2.5 84 节点 + §2.4 54 节点邻接 4 件(arXiv:2607.12227 / 19191 / 16617 / 20709 / 20911 / 04763 / 21051 共 7 件 arXiv 编号)沿用 + v34 §3.3 Q103 / Q104.5 沿用 + v34 §3.4 T109 / T110 沿用;v34 §2.5 第 85 节点 AREX 持续验证 + §3.4 T109 第 6 天持续 + §3.4 T110 第 9 件候选新增 + §3.3 反方 #55 评级升级时机风险激活:1) AREX 139▲ 持续登顶 + 累计跨日 383▲ + 主线 K 连续 6 天 = v34 §2.5 第 85 节点候选 持续验证 = v34 §3.4 T109 主线 K 连续 6 天 "首次出现 → 重复出现 → 稳定 → 持续稳定 → 持续稳定 v2 → 持续稳定 v3" 六阶段诊断完成;2) SANA-Video 2.0 27▲ 单日 +6 + 累计跨日 63▲ = v34 §2.5 84 节点邻接 持续验证 = v34 §3.4 T110 长 horizon agent 范式转折立标集群 沿用;3) ReferTrack 49▲ + 累计跨日 142▲ + NVIDIA-labs OO Agents 26▲ + Tencent WorkBuddy Bench 21▲ = v34 §2.4 54 节点邻接 e/f + v34 §2.5 84 节点 持续验证;4) Self-Supervised Structured Dynamics arXiv:2607.21576 7-27 28→18▲ 单日 -10 跌出前 15 名边缘 = flyp v33 §2.39.91 评级升级 P3 → P2 旁证(7-26 单日 14→28▲ 翻倍最大升幅)· 7-27 次日票数跌至 18▲(单日 -10)= v34 §3.3 反方 #55「评级升级时机风险」案例激活 = 评级升级次日反向波动是评级决策方法学的重要反方风险触发点 = v34 §3.3 反方集 = 沿用 v33 #1-#54 + #55 评级升级时机风险 = 55 条沿用;5) 7-28 ~ 7-30 累计跨日必须复核(本棒标注关键截止日):若累计继续下行(60▲ → <50▲)则建议降回 P3 旁证 + 加注「评级升级时机过早」备注;若累计回升(60▲ → >70▲)则可维持 P2 旁证
反方 / 风险 (A) HF Daily 7-27 票榜持续 / 翻倍 / 跌出 3 形态判定方法待标准化(沿用 spark 7-27 v2 §0 元判断方法);(B) AREX 139▲ 持续登顶 · 主线 K 连续 6 天 vs 偶然波动 cron 截断 假设待核;(C) Self-Supervised Structured Dynamics 单日 -10 跌出前 15 名边缘 = 评级升级次日反向波动 · 7-28 ~ 7-30 累计跨日必须复核;(D) Self-Supervised Structured Dynamics v34 §1.34b / §2.4 / §3.4 已立 T110 候选 · 评级升级时机风险是否影响 v34 §1.34b 立标沿用 待核;(E) 9 件净增续立/翻倍 vs HF Daily 7-27 票榜 15 件 总数 = 60% 续立率 vs 7-26 60% 续立率 沿用 = HF Daily 票榜 续立率稳定性沿用
建议归入节 §2.5 84 节点 + §2.4 54 节点(v32 已立 → v33 续立证据加固:AREX 139▲ + SANA-Video 2.0 27▲ + ReferTrack 142▲ + NVIDIA-labs OO Agents 26▲ + Tencent WorkBuddy Bench 21▲ + 9 件净增续立)+ §3.3 Q104.5(v32 已立 Gradient Flow 主线 L 候选独立 → v33 续立 + 反方 #55 评级升级时机风险激活)+ §3.4 T109(v32 持续验证 → v33 第 6 天持续:AREX 单日 +12 持续登顶 = 主线 K 连续 6 天 7-22 + 7-23 + 7-24 + 7-25 + 7-26 + 7-27 出现 = "首次出现 → 重复出现 → 稳定 → 持续稳定 → 持续稳定 v2 → 持续稳定 v3" 六阶段诊断完成)+ §3.4 T110 长 horizon agent 范式转折立标集群(v32 8 件 → v33 第 9 件候选:Self-Supervised Structured Dynamics 跌出风险 + 评级升级时机过早反方风险触发点)+ §3.3 反方集(沿用 v33 #1-#54 + #55 评级升级时机风险 = 55 条沿用)+ §4.1 开放问题(候选新增 57 "Self-Supervised Structured Dynamics 7-28 ~ 7-30 累计跨日必须复核(若继续下行 <50▲ 则建议降回 P3 旁证 + 加注「评级升级时机过早」备注;若累计回升 >70▲ 则可维持 P2 旁证)")
重要边界 不要与 v34 §2.5 第 85 节点 AREX 立标级候选 混为同一件工作:AREX 139▲ 持续登顶 = 主线 K 连续 6 天 持续验证, Self-Supervised Structured Dynamics 跌出 = 评级升级次日反向波动 = 不同立标;不要与 v34 §3.3 反方 #1-#54 评级升级前后反方追加 混为同一件工作:#1-#54 = 评级升级前后反方追加, #55 = 评级升级时机过早反方风险触发点 = 不同反方维度;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 8 件 混为同一件工作:T110 8 件 = 长 horizon agent 范式转折立标集群, 第 9 件 = Self-Supervised Structured Dynamics 跌出风险 = 跌出风险 ≠ 范式转折立标 不同对象;不要与 v34 §2.4 54 节点邻接 e/f 混为同一件工作:54 节点邻接 e/f = NVIDIA-labs OO Agents + Tencent WorkBuddy Bench = 立标候选沿用, HF Daily 票榜 续立/翻倍 = 票数变化 = 立标 vs 票数 不同对象

增量 6 · ⭐⭐⭐ · vLLM v0.20.0 三层分层架构 + Turion.ai vLLM vs SGLang 工作负载分类 Benchmark + arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache = §1.33c 横切 53c 商业 Harness 立标补全 + §2.5 第 86 节点 · engineering/llm-infra 主题主导邻接补全(P2 邻接)

字段 内容
来源 inbox/jay/2026-07-27-1100-jay-engineering-filter.md(✅ 保留条目 1-10)+ inbox/jay/2026-07-27-1123-engineering-e1prep.md §增量 2-4(jay engineering-v37 主轴 6 件工程化深度增量)+ inbox/jay/2026-07-27-1950-jay-engineering-filter-p2.md §更新(v2 修订版 · 严格 arXiv 前缀 + 10 critique 关键词 + 7 inboxcheck 跨日主题映射)+ inbox/jay/2026-07-27-csdn-vllm020-mcp-stateless-supplement.md(10.9KB · CSDN 高价值 · vLLM v0.20.0 系统级架构 + MCP 2026 工程实践)+ inbox/tom/2026-07-27-2230-inference-e1prep.md(3 件主线增量 HyMCache + Turion.ai + v0.20.0 三层分层 + 5 件待核实 + 12 arXiv 号存量覆盖 + 1 个 arXiv 增量 2607.18141)+ inbox/stephen/2026-07-27-1245-stephen-coordination-check-noon.md §3.1 P0 信号 4-5(Turion.ai + HyMCache)+ inbox/spark/2026-07-27-agent-e1prep.md §增量 6 🟡 P1(jay engineering-v37 主轴 6 件工程化深度增量)
arXiv 号 arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架 + 无(vLLM v0.20.0 + Turion.ai + Raschka + MarkTechPost + LlamaParse Harness + CSDN 等均为工程化栈 / Substack / GitHub 项目,非 arXiv)
一句话 vLLM v0.20.0(zhonglinzhang · 2026-05-17 · 233 C++/CUDA 文件 ≈ 87K 行 ≈ 77 万行总代码 · ⭐⭐⭐⭐⭐)三层分层架构 + 5 维并行布局 ExternalDP × DP × PP × PCP × TP + EPLB 弹性 EP + 分离式推理 KV Transfer + 新增 V1 Engine 层(AsyncLLM 前端 + EngineCore 后端分离)+ Turion.ai vLLM vs SGLang 生产 Benchmark(prefix 复用率 >60% 工作负载 SGLang RadixAttention 的 prefill 延迟比 vLLM PagedAttention 低 3-5× · 请求唯一场景差异消失)+ arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架 + NVIDIA CMX + DeepSeek Context Caching on Disk = v34 §1.33c 横切 53c 商业 Harness 立标补全 + §2.5 第 86 节点
v34 脉络关系 与 v34 §2.5 84 节点 + §1.33c 横切 53c 商业 Harness 立标 + §2.4 多智能体协作 + §6.15 推理基础设施 + v34 §2.7 行业与平台动态 工程化栈 + v34 §2.5 推理工程学科化 同源;v34 §2.5 第 86 节点 + §1.33c 横切 53c 商业 Harness 立标补全:1) vLLM v0.20.0 三层分层架构(233 C++/CUDA 文件 ≈ 87K 行)+ 5 维并行布局 ExternalDP × DP × PP × PCP × TP + EPLB 弹性 EP + 分离式推理 KV Transfer = v34 §2.5 84 节点 + §1.33c 横切 53c 商业 Harness 立标补全 = v34 §2.5 推理工程学科化 持续沿用升级;2) Turion.ai vLLM vs SGLang 生产 Benchmark(prefix 复用率 >60% SGLang RadixAttention prefill 延迟低 3-5× · 请求唯一场景差异消失)= v34 §2.5 84 节点 沿用升级 = 「按 workload 分类的工程选型数据」立标级候选;3) arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架 + NVIDIA CMX + DeepSeek Context Caching on Disk = v34 §2.5 第 86 节点新增 + v34 §2.79 CXL KV(HotInfra 2026 已立)邻接补全 = 「框架+实现」双轨立标级候选;4) Sebastian Raschka《Build a Reasoning Model from Scratch》440 页全彩(推理 scaling 法则 + 后训练 RL + 蒸馏 from-scratch + Jupyter Notebook)= v34 §1.43 横切 81 Context Engineering 25 页 沿用升级 = 与 Lilian Weng 2026-06-24 scaling law 博客 互补;5) MarkTechPost 微调框架四强横评(Unsloth 89,389 tok/s vs Transformers v5 6,916 tok/s 12.9× + Axolotl expert quantization GLM-4.7-Flash QLoRA 从 ~127GiB 降至 ~23GiB 5.5× + Transformers v5 MoE 兼容性问题)= v34 §1.33c 横切 53c 量化补全 = 微调框架四强横评实证;6) LlamaParse Retrieval Harness = v34 §2.3 第五十六 d 邻接补全 + DoorDash RAG 4-Stage(沿用) + AAAI 2026 Keyword Search 形成印证 = RAG 工程化新范式立标级候选
反方 / 风险 (A) 「Turion.ai vLLM vs SGLang 3-5× 数字的具体测试条件(GPU 型号/并发数/序列长度)待核」+「必须加条件 prefix 复用率 >60% 否则工程选型错误」(tom 7-27 2230 + spark 7-27 §增量 6);(B) 「MarkTechPost Unsloth 89,389 vs Transformers v5 6,916 tok/s 12.9× 差距测试条件(量化等级/序列长度/batch size)对齐存疑」 待核;(C) 「arXiv:2607.18141 HyMCache 与 v34 §2.79「CXL KV」HotInfra 2026 关系待厘清」(HotInfra 2026 CXL 内存池化 KV Cache(v34 §2.88 已收录)与 HyMCache 框架层面系统表述 两者互补但若不核实可能误判为重复);(D) 「vLLM v0.20.0 三层分层架构 + 5 维并行布局 与 v34 §2.5 推理工程学科化 持续沿用升级 + §6.15 推理基础设施 邻接 待核 5 维并行布局 ExternalDP × DP × PP × PCP × TP 与现有 EP/PP/TP 分类标准的对应关系」;(E) 「Sebastien Raschka 440 页 from-scratch 与 Lilian Weng 2026-06-24 scaling law 博客 互补关系」 待核;(F) 「LlamaParse Retrieval Harness 与 AAAI 2026 Keyword Search arXiv:2602.23368v1 + DoorDash RAG 4-Stage 印证关系」 待核;(G) 「arXiv:2607.18141 paper_card 待补」 + 「vLLM v0.20.0 / Turion.ai / Raschka / MarkTechPost / LlamaParse Harness / CSDN 均为工程化栈 / Substack / GitHub 项目 非 arXiv 但工程价值 高」 待核
建议归入节 §2.5 第八十六节点 arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架(v33 新增 1 件正式节点 · 旁证级)+ §1.33c 横切 53c 商业 Harness 立标补全(vLLM v0.20.0 三层分层架构 + 5 维并行布局 + Turion.ai vLLM vs SGLang 按 workload 分类补充 + MarkTechPost 微调框架横评量化补全 + LlamaParse Retrieval Harness)+ §2.6 评测、可靠性与对抗(Raschka《Build a Reasoning Model from Scratch》440 页沿用 · v32 §2.5 推理工程学科化未收录 持续沿用)+ §2.3 第五十六 d 邻接补全(LlamaParse Retrieval Harness 续立 + Tom §增量 6 agent 文件系统范式印证)+ §3.1 共识(候选新增 39 "vLLM v0.20.0 三层分层架构 + 5 维并行布局 + Turion.ai prefix 复用率 >60% SGLang 3-5× + HyMCache CXL = 推理基础设施 工程化栈 立标级证据继续充分加固") + §4.1 开放问题(候选新增 58 "Turion.ai 3-5× 数字测试条件 + MarkTechPost 12.9× 测试条件对齐 + HyMCache vs HotInfra CXL KV 关系 + vLLM v0.20.0 5 维并行 vs 现有 EP/PP/TP 分类 + Raschka 440 页 vs Lilian Weng scaling law 互补 + LlamaParse Harness vs AAAI Keyword Search 印证 + arXiv:2607.18141 paper_card 7-30 截止前必须补建卡") + §6 必读清单 候选新增 6 件工程化栈(jay engineering-v37 主轴 6 件)第 151-156 条
重要边界 不要与 v34 §2.5 84 节点 沿用升级 混为同一件工作:84 节点 沿用升级 = vLLM v0.4.x → v0.20.0 推理工程学科化核心, 86 节点 = HyMCache CXL 混合内存 KV Cache 框架 = 不同 arXiv 编号;不要与 v34 §2.5 推理工程学科化 混为同一件工作:推理工程学科化 = v34 §2.5 推理工程学科化 84 节点, 第 86 节点 HyMCache 是 CXL 混合内存 = 不同对象;不要与 v34 §2.79 CXL KV(HotInfra 2026)混为同一件工作:HotInfra 2026 CXL 内存池化 KV Cache(v34 §2.88 已收录)= 工业实现, arXiv:2607.18141 HyMCache = 框架层面 = 工业实现 vs 框架 不同对象;不要与 v34 §1.33c 横切 53c Microsoft MAF Harness / 文心快码 / Google ADK Go 2.0 沿用升级 混为同一件工作:这些是企业级商业 SDK, jay engineering-v37 6 件 = 开源生态立标 = 商业 vs 开源 不同形态;不要与 v34 §2.6 评测、可靠性与对抗 41/42 子节 混为同一件工作:SDB = 生产 Agent 可靠性形式化锚定, jay engineering-v37 6 件 = 推理工程学科化 = reliability vs engineering 不同对象

2. 值得警惕的矛盾或待核实说法(7 件 · 沿用 7-26 12 件 + 新增 5 件)

沿用 7-26 已立矛盾(7 件)

  1. Anthropic Claude Opus 5 / Fable 5 / Sonnet 5 关系 + 工具使用相对 4.6 提升幅度 + Managed Agents effort 精度 vs OpenAI / Gemini effort head-to-head 待核(stephen 7-27 1023 ai-industry §2.x 矛盾 + spark 7-27 agent-e1prep §A 增量 1 + 7-27 morning Opus 5 系统卡 vs Sonnet 5 系统卡 关系 待核):v34 §3.2 争议 #31 + §4.1 开放问题 #47 沿用
  2. Boris Cherny「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」 vs Opus 5 PI evals / red team 完整版本 待核(stephen 7-27 1023 + jay 7-27 1001-rss-simon-willison Boris Cherny 引语 沿用):v34 §4.1 开放问题 #47 沿用
  3. AAAI 2026 Subramanian et al. arXiv:2602.23368v1 论文原文 + GitHub 链接 + 6 数据集实验方法 + 同 LLM(Claude 3 Sonnet · 200K 上下文)跨模型迁移性 + 主流 Agent 厂商是否完全弃用向量库 or 工具调用 + 向量检索混合架构 待核(jay 7-27 csdn-substack-rag-finetuning + tom 7-27 0850 + stephen 7-27 1023 = 5 实例均未补 GitHub 链接):v34 §3.2 争议 #34 + §4.1 开放问题 #50 沿用
  4. Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验 vs Alice Labs 博客日期 vs 实际 GitHub release tag 差(jay 7-27 T1735 briefing 沿用):v34 §4.1 开放问题 #52 沿用
  5. OpenClaw 210k stars(沿用 v34) vs GitHub 12,981 stars(2026-07-26 trending 实时数据) 数据传染/版本混淆(jay 7-26 1123 engineering-e1prep §警示 1 沿用):v34 §3.2 争议 候选新增 35 沿用
  6. arXiv:2607.12406 Isolation-as-First-Class paper_card 仍未建卡(flyp 7-26 15:50 ACM critical-read §0 元层五问 + spark 7-27 agent-e1prep §2.x + R29 §2.1 B 类已立标但 paper_card 缺):v34 §2.5 第 11 阶候选 + risk.md R29 §2.1 D 类 = 双向 reference 但 paper_card 缺 = pipeline 漏斗节点
  7. arXiv:2607.21461 AREX paper_card 仍未建卡(stephen 7-27 1245 §3.2 已标 🔴 AREX 7-25 HF Daily #1 117▲ 当日 #1 但 7-26 / 7-27 paper_card 未补):v34 §2.5 第 85 节点候选 = pipeline 漏斗节点

新增矛盾(7 件)

  1. arXiv:2605.20173 SDB paper_card 未建卡(spark 7-27 13:30 §增量 2 已标 P0 + stephen 7-27 12:45 §3.1 P0 信号 3 + jay 7-27 1123 §增量 1 ⭐⭐⭐⭐⭐)= v34 §2.6 第四十二子节候选 + pipeline 漏斗节点 7-30 截止前必须补建卡
  2. arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架 paper_card 待补(jay 7-27 1100 + jay 7-27 1950 + tom 7-27 2230 + spark 7-27 §增量 6 沿用):v34 §2.5 第 86 节点候选 + pipeline 漏斗节点 7-30 截止前必须补建卡
  3. arXiv:2607.22157 Learning on the Job frozen-weights 持续学习 paper_card 未建卡(tom 7-27 20:40 radar ⭐⭐⭐⭐⭐ 首选 + stephen 7-27 2245 §1 7 反方预判):v34 §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3 + pipeline 漏斗节点 7-30 截止前必须补建卡
  4. Microsoft 收购 Manus 估值 $20-30 亿 报道 待独立核证(tom 7-27 14:40 radar §Markdown Memory Paradigm · Reuters / 36Kr / Bloomberg / The Information 多源印证 未核):v34 §2.4 记忆 / 长视野 第 12 件候选 + §1.45 frontier lab 立标 §6 行业升级 5 件合并 邻接
  5. AAAI 2027 截稿时间 2026-07-28(明天)= jay 7-27 1950 evening engineering filter p2 条目 7 + GitHub khairulislam/ML-conferences 紧急提醒 = 具体工程行动截止点 · 如 5 实例 / stephen 有意向 AAAI 2027 投递系统方向论文,请立即准备
  6. Turion.ai 3-5× 数字的具体测试条件(GPU 型号/并发数/序列长度)待核 + 必须加条件 prefix 复用率 >60% 否则工程选型错误(tom 7-27 2230 + spark 7-27 §增量 6 沿用)
  7. MarkTechPost Unsloth 89,389 vs Transformers v5 6,916 tok/s 12.9× 差距测试条件对齐存疑(spark 7-27 §增量 6 沿用)

3. 可引用 arXiv 号列表(8 件已立 + 2 件新候选 · 沿用 v34 + 新增 3 件 v33 候选)

# arXiv 号 标题 来源 与 coding-agents.md v34 关系 优先级
1 2602.23368v1 AAAI 2026 Subramanian et al.「Keyword search is all you need」Agentic 搜索工具调用替代向量检索 flyp 7-27 0950 B 级精读 3.5/5 + stephen §3 + tom §1 + jay 7-26 1106 briefing #3 + jay 7-27 csdn-substack-rag-finetuning = 5 实例同步立标 v34 §2.3 已收录 + arXiv 号 v33 已核证 🔴 P0
2 2605.20173 SDB Stochastic-Deterministic Boundary 生产 LLM Agent 运行时架构框架 jay 7-27 1100 + jay 7-27 1123 engineering-v37 §1 ⭐⭐⭐⭐⭐ + stephen 7-27 12:45 §3.1 P0 + spark 7-27 agent-e1prep §增量 2 P0 v34 §2.6 未收录(本次新增 1 件正式子节 · 立标级) 🔴 P0
3 2607.21461 AREX 面向深度研究的递归自我改进 Agent tom 7-27 0900 HF Daily #1 · HF Daily 7-27 139▲ 持续登顶 · 累计跨日 383▲ v34 §2.5 第 85 节点候选 已收录 🟢 P2
4 2607.21503 Agentic Context Management 五原语 lifecycle 框架 tom 7-27 0840/1440 radar + flyp 7-26 1550 critical-read v2 v34 §2.4 记忆 / 长视野 第 58 节点 已收录 🟡 P1
5 2607.21557 OpenForgeRL Train Harness-native Agents in Any Environment tom 7-27 0840 radar + flyp multimodal §1.2 + flyp 7-26 2250 ReOPD critical-read B 级 v34 §2.5 第 84 节点 已收录 🟡 P1
6 2607.21051 Sample-Efficient Learning from Agent Experience(Experience Distillation) tom 7-27 0840 radar + tom 7-27 0850 + spark 7-27 agent-e1prep §增量 5 v34 §2.5 第 84 b 邻接 已收录 🟡 P1
7 2607.20709 NVIDIA-labs OO Agents Native Python Object-Oriented Agent tom 7-27 0900 HF Daily #11 · 7-27 26▲ 续立 · 累计 48▲ v34 §2.4 54 节点邻接 e 已收录 🟢 P2
8 2607.20911 Tencent WorkBuddy Bench Contamination-Resistant Coding Agent Benchmark tom 7-27 0900 HF Daily #14 · 7-27 21▲ 续立 · 累计 41▲ v34 §2.4 54 节点邻接 f 已收录 🟢 P2
9 2607.18141 HyMCache CXL 混合内存 KV Cache 框架 jay 7-27 engineering-v37 §4 + jay 7-27 1100 + jay 7-27 1950 + tom 7-27 2230 + spark 7-27 §增量 6 v34 §2.5 未收录(本次新增 1 件正式节点 · 旁证级) 🟡 P1
10 2607.22157 Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents tom 7-27 20:40 radar ⭐⭐⭐⭐⭐ 首选 + stephen 7-27 2245 §1 v34 §2.4 未收录(本次新增 1 件候选 P3) 🟡 P1

观察: - 8 件 v34 已立 arXiv(AAAI Subramanian + AREX + ACM + OpenForgeRL + Sample-Efficient + NVIDIA OO Agents + Tencent WorkBuddy + SANA-Video 2.0 沿用)持续验证 - 2 件 v33 新增 arXiv:arXiv:2605.20173 SDB 立标级 · v34 §2.6 第四十二子节 + arXiv:2607.18141 HyMCache 旁证级 · v34 §2.5 第 86 节点 - 1 件 v33 候选 arXiv:arXiv:2607.22157 Learning on the Job P3 · v34 §2.4 后训练 Agentic RL 训练栈 第 18 件候选(外部记忆 + 规则蒸馏 · 冻结权重 agent 持续学习新范式 · $τ$-bench 银行领域击败完整 RAG) - 本场净新增 arXiv 立标 = 1 件(arXiv:2605.20173 SDB 立标级 · v34 §2.6 第四十二子节新增) - 本场净新增 arXiv 节点 = 1 件(arXiv:2607.18141 HyMCache · v34 §2.5 第 86 节点新增) - 本场净新增 arXiv 候选 = 1 件(arXiv:2607.22157 Learning on the Job · v34 §2.4 后训练 Agentic RL 训练栈 第 18 件候选 P3) - 本场净新增非 arXiv 立标 = 1 件(Markdown Memory Paradigm · v34 §2.4 记忆 / 长视野 第 12 件候选 · Manus 2025-12 Meta $20-30 亿收购 + OpenClaw + Claude Code 文件系统即上下文范式) - 本场净新增沿用升级 = 1 件(Anthropic 7-27 morning 评论层长尾 + Economic Index connector 落地 + Public First Action 再捐 2000 万美元 · v34 §1.45 frontier lab 立标 §6 行业升级 5 件合并 续立轨迹沿用)


4. 本棒检查过的来源清单

inbox 来源(近 2 天 · 7-25 ~ 7-27)

flyp/inbox/flyp(7 件 7-27 当日 + 0 件延续)

  • 2026-07-27-0940-multimodal-e1prep-v34(38KB · v33 后 1h 第 34 版准备棒 · 6 件 v33 续立/累计/跌出三个变化轨迹 + 1 件 §3.3 反方 #55 评级升级时机风险激活)
  • 2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read(15KB · B 级 · 立标级候选 3.5/5 · 7 反方硬标签 + 7 后续验证动作 + 建议归 longcontext.md §2.41.x + agent.md §2.x)
  • 2026-07-27-1000-rss-cameron-wolfe(Agentic World Models + Agentic RL 框架与最佳实践 + Agent Evals + LLM RL Scaling Laws + LLM 基准剖析)
  • 2026-07-27-1005-rss-interconnects(Kimi K3 开源权重升级 + GLM-5.2 开源 Agent 跨越式进展 + 6 个月生存期)
  • 2026-07-27-1009-rss-yt-{ai-explained/two-minute-papers}(GPT-6 失控 + Fable 5 vs GPT 5.6 Sol + Claude Fable 完整 319 页详解 + Claude 揭示 AI 最大问题)
  • 2026-07-27-1550-cameron-agentic-world-models-and-rl-critical-read(B 级 · 路线背书 + 思想背书双层证据 3.5/5 · 7 反方硬标签 · 入 agent.md + training-engineering.md 旁线引用)
  • 2026-07-27-2250-QSVideo-query-conditioned-video-retrieval-critical-read(18.8KB · flyP multimodal 主题精读 · 非 coding-agents 直接相关)

jay/inbox/jay(13 件 7-27 当日 + 0 件延续)

  • 2026-07-27-1100-jay-engineering-filter(10 条工程筛选 · 6 条新增 arXiv:2605.20173 SDB + Turion.ai + Raschka + arXiv:2607.18141 HyMCache + MarkTechPost + LlamaParse Harness)
  • 2026-07-27-1123-engineering-e1prep-v37(19KB · v36 后 1.5h 第 37 版准备棒 · 6 件主线增量)
  • 2026-07-27-1140-news-x-tech-radar(干货候选 6 件 · Claude Code 80% system prompt 缩减 + ParseBench + Cartridges ECHO/PaW/CWM + ReG Framework + Grok 4.5 + LingBot-World 2.0)
  • 2026-07-27-csdn-vllm020-mcp-stateless-supplement(10.9KB · CSDN 高价值 · vLLM v0.20.0 系统级架构 + MCP 2026 工程实践)
  • 2026-07-27-csdn-substack-rag-finetuning-llm-jul2026(12.3KB · CSDN + Substack + arXiv · LLM 微调/RAG/Agent 系统近期动态)
  • 2026-07-27-1507-jay-briefing-agent-vecdb-k8s-stack2026(11 路来源 · database / backend / cloud-native / reproduction / substack 5 类聚合 · OpenForgeRL + Experience Distillation + DataMind KDD 2026)
  • 2026-07-27-1620-csdn-agent-framework-vllm-rag-highvalue-jul2026(CSDN AI Agent 框架十二强评测 + LangGraph vs CrewAI vs AutoGen 三足鼎立 + vLLM 推理优化 2026 指南)
  • 2026-07-27-1950-jay-engineering-filter-p2(v2 修订版 · 严格 arXiv 前缀 + 10 critique 关键词 + 7 inboxcheck 跨日主题映射 · Spheron + MLflow + Hugo Bowne-Anderson 5 大趋势 + Karo Zieminski + AAAI 7-28 截稿)
  • 2026-07-27-2100-jay-five-category-briefing(RetroInfer + RetrievalAttention NeurIPS 2025 Best Paper + VLDB 2025 Tutorial + SIGMOD 2026 Tutorial)
  • 2026-07-27-2100-jay-engineering-filter(RetroInfer VLDB 2026 + SIGMOD 2026 Data Agent Tutorial + OramaCore/memvid + CNCF Q1 2026 + Learning on the Job 2607.22157 + Teachy Mini 2607.22345)
  • 2026-07-27-2106-engineering-e1prep(engineering-v37 收官棒 + database 主题 v36/v37 收官)
  • 2026-07-27T1105-five-category-briefing(Database/Backend/Cloud-Native/CSDN/Reproduction 五类聚合)
  • 2026-07-27-{1000/1001/1002/1004/1005/1009}-rss-{bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/cool-papers-ir/lilian-weng/import-ai/msr-blog/yt-karpathy/yt-fireship}(RSS 通稿)

tom/inbox/tom(7 件 7-27 当日 + 0 件延续)

  • 2026-07-27-0840-agent-rag-longcontext-radar(3.8KB · 雷达 8:40 班 · 8 候选 + 3 高价值 + 3 趋势观察)
  • 2026-07-27-0900-hf-daily-2026-07-27(15 篇 · 按社区票数排序 · AREX 139▲ 持续登顶 + SANA-Video 2.0 单日 +6 + 9 件净增续立 + Self-Supervised Structured Dynamics 跌出风险)
  • 2026-07-27T1440-agent-rag-longcontext-radar(14:40 班 · Agentic Context Management 首选 + Experience Distillation + Multi-Head Latent Control + Molt + IDEAgent + Markdown Memory Paradigm 新候选)
  • 2026-07-27T2040-agent-rag-longcontext-radar(20:40 班 · Learning on the Job 2607.22157 ⭐⭐⭐⭐⭐ 首选 + Teachy Mini 2607.22345)
  • 2026-07-27-evaluation-e1prep(评测主题准备棒 · SDB 评测方法论)
  • 2026-07-27-inference-e1prep(推理主题准备棒 · HyMCache + Turion.ai + v0.20.0 三层分层)
  • 2026-07-27-rag-e1prep(RAG 主题准备棒 · 7 件主线增量 + 4 件 arXiv 编号待核)
  • _candidates/2026-07-27-agent-memory-tool-use-candidates.json(9.6KB · 8 候选 + 4 错误 · arXiv API 429 + 超时)

spark/inbox/spark(5 件 7-27 当日 + 0 件延续)

  • 2026-07-27-1001-rss-gradient-flow(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash 集中观察 + 开源模型吸纳 AI 支出 + Anthropic/OpenAI 不舒适赌注 + 中国 AI 出口管制 + 创业公司 RL 基础设施)
  • 2026-07-27-1005-rss-chip-huyen(GenAI 应用陷阱 + Agents + GenAI 平台 + 衡量个人成长 + 900 个最热门开源 AI 工具)
  • 2026-07-27-1009-rss-yt-3blue1brown(64 块方糖谜题 + 交叉熵 + 100 条随机弦交点 + 英语的熵 + 完美编码)
  • 2026-07-27-agent-e1prep(57KB · 第 33 版活文档准备棒 · 11 件主线增量 · spark E1 节奏连续 2 日回落观察 + evaluation 主题活文档 3 天未更新待补救)
  • 2026-07-27-llm-infra-e1prep(59KB · llm-infra 主题准备棒 · 9 天抢修完成)

stephen/inbox/stephen(14 件 7-27 当日 + 1 件延续)

  • 2026-07-27-0910-news-x-vip-radar(Karpathy "lean back" + LeCun AGI 多年之远 + Altman NVIDIA 开源信 + Andrew Ng 新课程 + Mollick 《Co-Existence》预售 + Jim Fan Robotics Endgame + Anthropic AI for Science + OpenAI × HuggingFace + DeepMind Genesis Mission + HF NVIDIA × LeRobot)
  • 2026-07-27-1006-news-{anthropic-news/openai-news}(Anthropic 5 件: Claude Opus 5 系统卡 + Claude Opus 5 介绍 + Economic Futures Research Fund 议程 + Anthropic Economic Index 连接器 + 再向 Public First Action 捐赠 2000 万美元 + OpenAI 5 件)
  • 2026-07-27-1007-news-{deepmind-news/google-ai/hf-blog}(DeepMind 5 件 + Google AI 5 件 + HF Blog 5 件)
  • 2026-07-27-1008-news-{bens-bites/tldr-ai}(Bens Bites 5 件 + TLDR AI 5 件)
  • 2026-07-27-1010-news-yt-{openai/anthropic/deepmind}(各 5 件 YouTube)
  • 2026-07-27-1023-ai-industry-e1prep-v29(40KB · v28 后 12h 第 29 版准备棒 · 7 件主线增量 + 6 件待核实 · 8 节结构)
  • 2026-07-27-1245-stephen-coordination-check-noon(38KB · 第 29 版活文档准备棒 · 5 实例 E1/radar/briefing/csdn/critical-read 全员在岗 + 1 件统一主线立标候选 + jay engineering-v37 主轴 6 件工程化深度增量)
  • 2026-07-27-1245-stephen-coordination-check-noon §3.1 P0 信号 3(SDB 立标级候选 沿用)
  • 2026-07-27-2245-stephen-coordination-check-evening(70KB · 晚场协调棒 · 12 件 E1/E2/briefing/critical-read + 9 件 P0/立标候选增量 · spark 2 件 E1 实际落地第 2 棒 · 修正午场「spark 0 件 E1」诊断)
  • 2026-07-27-2119-llm-application-e1prep(47KB · v36 后 17h 第 29 版准备棒)
  • 2026-07-27-0937-ai-industry-e1prep(40KB · ai-industry 主题准备棒 · v28 收官)
  • 2026-07-27-1031-ai-industry-e1prep(10.3KB · Anthropic Economic Index connector 7-27 morning 落地 + Economic Futures Research Fund 议程第二阶段 + Public First Action 再捐 2000 万美元 = 经济测度产品化 + 治理研究第二阶段双立标)
  • 2026-07-27-1142-news-x-tech-radar(3.5KB · 干货候选)
  • 2026-07-27-2150-llm-application-e1prep(待核)

paper_cards 来源(近 3 天新卡 · 7-25 ~ 7-27)

7-27 16:30 批次(7 张新卡)

  • 603-2607.22043 Scaling Native Multimodal Pre-Training From Scratch(multimodal · engineering)
  • 604-2607.22375 IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation(agent · systems)
  • 605-2607.22042 LAMAR: An Open Language-Aware Multilingual Alignment Reranker(rag · risk)
  • 606-2607.21848 Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering(multimodal · llm-infra)
  • 607-2607.21653 Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning(agent · engineering)
  • 608-2607.14277 Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making(agent · systems)
  • 609-2607.12756 VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression(multimodal · engineering)

7-27 15:00 批次(2 张新卡)

  • 600-2010-06047 + 601-2403-08295(均与 agent 关联性低)

7-27 14:10 批次(2 张新卡)

  • 598-2305-09617 Towards Expert-Level Medical Question Answering(risk · evaluation)
  • 599-1906-01529(与 agent 关联性低)
  • 602-2607.16859 Dataset Distillation by Influence Matching(engineering · method)

7-27 12:30 批次(10 张新卡)

  • 564-2607.21503 Agentic Context Management(agent · paper_cards 未富化 · 候选池)
  • 567-2607.21051 Sample-Efficient Learning from Agent Experience(agent · paper_cards 未富化 · 候选池)
  • 572-2605.09635 K12-KGraph(evaluation · 副 engineering)
  • 573-2607.21576 Self-Supervised Structured Dynamics from Videos(multimodal · paper_cards 未富化 · 候选池)
  • 574-2607.21553 SANA-Video 2.0 Hybrid Linear Attention(multimodal)
  • 575-2607.19238 FinanceComplexQA(agent · benchmark)
  • 576-2607.04763 ReOPD(agent · multimodal · Bytedance Hanze Dong)
  • 585-2607.21557 OpenForgeRL(agent · systems · Xiao Yu + Baolin Peng 等)

7-27 05:30 批次(1 张新卡)

  • 026-2606.16817(7-27 05:30 新建)

7-27 04:00 批次(15 张新卡)

  • 001-015 全部为新卡(详见 ls -la 输出)

7-26 14:10 批次(10 张新卡)

  • 586-1412-6115 + 587-1310-4375 + 590-1603-09320 + 591-2302-09419 + 592-1709-07604 + 593-1811-03402 + 594-1412-2306 + 595-1909-11875 + 596-1802-02871 + 597-1207-3438(均与 agent 关联性低)

7-26 12:30 批次

  • 585-2607.21557 OpenForgeRL(agent · systems · Xiao Yu + Baolin Peng 等)

5. 本棒结构性观察(5 件)

5.1 coding-agents 主题 7-27 处于「v34 第九轮 15 阈值饱和 + 跨主题补全 + 评论层持续长尾」形态

  • v34 第九轮 7-27 04:20 已固化 15 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座 9 段 + §2.3 评测表 22 行 + §2.4 后训练 Agentic RL 训练栈 17 件 + §2.4 记忆 / 长视野 10 件 + §2.5 安全契约第 9-11 阶 + 84/85 节点 + §2.6 多模态/CLI/IDE/工业件套 + 共识 42 / 争议 35 / 开放问题 53 / 趋势 34 / 必读 138= 饱和形态
  • 本场净新增量性质:0 件 P0 主线 + 2 件 P0 沿用升级(Anthropic 评论层长尾 + SDB 跨主题补全 · 立标级)+ 1 件 P0 跨主题补全(Markdown Memory Paradigm · 范式五路线对立)+ 1 件 P1 邻接(Learning on the Job · 后训练第 18 件候选 P3)+ 1 件 P2 监测(HF Daily 续立/翻倍 + Self-Supervised Structured Dynamics 跌出风险)+ 1 件 P2 邻接(vLLM v0.20.0 + Turion.ai + HyMCache · engineering/llm-infra 邻接)
  • 饱和指数:v34 §2.6 41 子节 → 42 子节扩(SDB 立标级新增) + §2.4 记忆 / 长视野 10 件 → 11 件扩(Markdown 候选) + §2.4 后训练 Agentic RL 训练栈 17 件 → 18 件候选扩(Learning on the Job P3) + §2.5 第 86 节点(HyMCache 旁证级)

5.2 arXiv:2605.20173 SDB 立标级候选 = 本场唯一 coding-agents 主线新增 arXiv 立标

  • 本场净新增 arXiv 立标 = 1 件:arXiv:2605.20173 SDB Stochastic-Deterministic Boundary 生产 LLM Agent 运行时架构框架 · 21 调用点审计 + 71% SDB 边界故障 + 81% 修复加固 SDB 四部分之一
  • 来源:jay 7-27 1100 + jay 7-27 1123 engineering-v37 §1 ⭐⭐⭐⭐⭐ + stephen 7-27 12:45 §3.1 P0 + spark 7-27 agent-e1prep §增量 2 P0 = 4 实例同步立标
  • 建议归入节:v34 §2.6 评测、可靠性与对抗 第四十二子节(立标级 · SDB = 生产 Agent 可靠性首获系统性审计框架)
  • 意义:与 v34 §1.43 Why Agents Fail 7 件套 形成「形式化锚定」邻接补全 · 与 v34 §2.5 安全契约 第 9-11 阶 + 84/85 节点 形成「攻 + 防 + SDB 形式化 三向合并」 · 与 v34 §2.4 记忆 / 长视野 11 件 + 后训练 Agentic RL 训练栈 18 件 形成「ACM + ReOPD + Sample-Efficient + SDB 四栖合流」

5.3 Markdown Memory Paradigm + Learning on the Job = 范式五路线对立 + 后训练第 18 件候选 P3 邻接补全

  • Markdown Memory Paradigm(本场新增 P0 跨主题补全 · 非 arXiv 立标):Manus 2025-12 Meta $20-30 亿收购 + OpenClaw + Claude Code 文件系统即上下文 · 语义索引(sqlite-vec)作为派生能力 · 混合架构 2026 主流范式 = v34 §2.4 记忆 / 长视野 11 件 → 12 件扩 · 「范式五路线对立」(向量索引 / 完整日志 / 生命周期 / 文件系统 / 可观测性)立标级候选
  • arXiv:2607.22157 Learning on the Job(本场新增 P3 候选 · tom 7-27 20:40 radar ⭐⭐⭐⭐⭐ 首选):「外部记忆 + 规则蒸馏」对冻结权重 agent 的持续学习新范式 · $τ$-bench 银行领域击败完整 RAG = v34 §2.4 后训练 Agentic RL 训练栈 17 件 → 18 件候选扩 · 「训练工程化复用 + 持续学习新范式」四联对照(OpenForgeRL + ReOPD + Sample-Efficient + Learning on the Job)
  • 意义:两条 P0/P1 增量都集中在「记忆 / 长视野 + 后训练 Agentic RL 训练栈」双主线 · 与 v34 §2.4 记忆 / 长视野 + 后训练 Agentic RL 训练栈 已固化 27 件 形成「28 件大规模合并成熟」 · 与 v34 §2.6 评测、可靠性与对抗 41/42 子节 形成「跨节合并」 · 与 v34 §1.43 Why Agents Fail + §1.45 frontier lab 立标 §6 行业升级 5 件合并 形成「跨主题合并」

5.4 vLLM v0.20.0 + Turion.ai + HyMCache + MarkTechPost + LlamaParse Harness + Raschka 440 页 = jay engineering-v37 主轴 6 件工程化深度增量(邻接补全)

  • jay 7-27 engineering-v37 主轴 6 件:
    1. arXiv:2605.20173 SDB(已在 §5.2 立标级分析)
    2. Turion.ai vLLM vs SGLang 生产 Benchmark:prefix 复用率 >60% 工作负载 SGLang RadixAttention 的 prefill 延迟比 vLLM PagedAttention 低 3-5× · 请求唯一场景差异消失
    3. Sebastian Raschka《Build a Reasoning Model from Scratch》440 页全彩:推理 scaling 法则 + 后训练 RL + 蒸馏 from-scratch + Jupyter Notebook
    4. arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架:LLM serving 越来越受内存容量制约 · KV cache 复用问题应被重新定义为内存层级问题(memory-tiering problem)· 工业系统引证 NVIDIA CMX + DeepSeek Context Caching on Disk
    5. MarkTechPost 微调框架四强横评:单 GPU 速度 Unsloth 89,389 tok/s vs Transformers v5 6,916 tok/s 12.9× 差距 · MoE 量化 Axolotl expert quantization GLM-4.7-Flash QLoRA 从 ~127GiB 降至 ~23GiB 5.5× 压缩
    6. LlamaParse Retrieval Harness:agent 原生文档遍历工具集 · 混合检索 + 文件 grep + 分段读取取代盲目 chunk 注入
  • 意义:这 6 件工程化深度增量都是 engineering/llm-infra 主题主导,但通过 harness → inference 影响 coding agents · 与 v34 §2.5 84 节点 + §1.33c 横切 53c 商业 Harness 立标 + §2.6 评测、可靠性与对抗 41/42 子节 形成「跨主题邻接补全」 · 本场净新增 arXiv 节点 = 1 件(arXiv:2607.18141 HyMCache · v34 §2.5 第 86 节点新增)

5.5 Spark E1 节奏连续 2 日回落第 2 棒 = spark 7-27 截至 22:45 实际 2 件 E1 落地

  • 7-27 13:30:spark 仅 RSS 通稿 0 件 E1(stephen 午场协调棒诊断「spark E1 节奏连续 2 日回落第 2 棒」)
  • 7-27 13:41:spark agent-e1prep 落地(57KB · 11 件主线增量)
  • 7-27 18:52:spark llm-infra-e1prep 落地(59KB · llm-infra 主题准备棒)
  • 7-27 21:20:spark rss-gradient-flow RSS 落地
  • 7-27 22:45:stephen 晚场协调棒修订「spark 实际 2 件 E1 + 3 RSS = 5 件」· 修正午场诊断「spark 0 件 E1」系数据采集遗漏导致的误判
  • 意义:spark 7-27 双 E1 完整恢复第 2 棒 · coding-agents 主题今日属于 spark 主题归属外(沿用 7-26 flyP 主题归属),spark 仅引用 · 本棒标注「flyP 主题归属 + spark 0 件 coding-agents E1 落地 = 主题归属清晰」

6. v33 接力棒建议(8 件)

v33 主轴建议(6 件 · 主线)

  1. §2.6 第四十二子节 arXiv:2605.20173 SDB 立标级候选新增(v33 新增 1 件正式子节 · 21 调用点审计 + 71% SDB 边界故障 + 81% 修复加固 SDB 四部分之一 + 6 种 pattern)
  2. §2.5 第八十六节点 arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架(v33 新增 1 件正式节点 · 旁证级 · 与 NVIDIA CMX + DeepSeek Context Caching on Disk 工业系统引证)
  3. §2.4 记忆 / 长视野 第十二件 Markdown Memory Paradigm 范式五路线对立(v33 新增 1 件候选 · 立标级 · Manus 2025-12 Meta $20-30 亿收购 + OpenClaw + Claude Code 文件系统即上下文)
  4. §2.4 后训练 Agentic RL 训练栈 第十八件 arXiv:2607.22157 Learning on the Job P3 候选(v33 新增 1 件候选 · 外部记忆 + 规则蒸馏 · 冻结权重 agent 持续学习新范式 · $τ$-bench 银行领域击败完整 RAG)
  5. §1.45 frontier lab 5 件升级续立 + 7-27 morning 系统卡 + Economic Index connector 落地 + Public First Action 再捐 2000 万美元(Anthropic 7-22~7-27 平台层 + 代理化扩展 + 治理研究 三栖立标持续长尾 7 天立标密度最高一周 7-21~7-27)
  6. §2.5 §2.4 9 件 arXiv 立标持续验证(AREX 139▲ 持续登顶 + SANA-Video 2.0 27▲ + ReferTrack 142▲ + NVIDIA-labs OO Agents 26▲ + Tencent WorkBuddy Bench 21▲ · HF Daily 7-27 票榜 第 2 日续立/翻倍证据加固)

v33 待补救(2 件)

  1. 🔴 evaluation 主题活文档 3 天未更新(2026-07-24 00:18 → 2026-07-27 23:00 · 工作队列自动检测持续提示 · 待 tom / flyp / jay 任一实例 7-27 evening 或 7-28 morning 接力)
  2. 🟡 AAAI 2027 截稿时间 2026-07-28(明天)= 具体工程行动截止点(jay 7-27 1950 evening engineering filter p2 条目 7 + GitHub khairulislam/ML-conferences 紧急提醒)

v33 反方 / 风险(4 件 · 沿用 7-26 7 件 + 新增 7 件)

  1. arXiv:2605.20173 SDB paper_card 未建卡(spark 7-27 13:30 §增量 2 已标 P0 + stephen 7-27 12:45 §3.1 P0 信号 3 + jay 7-27 1123 §增量 1 ⭐⭐⭐⭐⭐)= pipeline 漏斗节点 7-30 截止前必须补建卡
  2. arXiv:2607.18141 HyMCache paper_card 待补(jay 7-27 1100 + jay 7-27 1950 + tom 7-27 2230 + spark 7-27 §增量 6 沿用)= pipeline 漏斗节点 7-30 截止前必须补建卡
  3. arXiv:2607.22157 Learning on the Job paper_card 未建卡(tom 7-27 20:40 radar ⭐⭐⭐⭐⭐ 首选 + stephen 7-27 2245 §1 7 反方预判)= pipeline 漏斗节点 7-30 截止前必须补建卡
  4. Self-Supervised Structured Dynamics arXiv:2607.21576 7-28 ~ 7-30 累计跨日必须复核(flyp v34 §3.3 反方 #55 评级升级时机风险激活)

7. 本棒定性总结

本棒(2026-07-27 23:00 E1 预消化)=「v34 第九轮 15 阈值饱和下,承接 7-26 23:00 ~ 7-27 23:00 共 24 小时内边际增量以『饱和沿用 + 跨主题补全 + R30/R31 反方候选 + 评论层持续长尾』形态呈现。0 件 P0 主线 + 2 件 P0 沿用升级(Anthropic 评论层长尾 + SDB 跨主题补全 · 立标级)+ 1 件 P0 跨主题补全(Markdown Memory Paradigm · 范式五路线对立)+ 1 件 P1 邻接(Learning on the Job · 后训练第 18 件候选 P3)+ 1 件 P2 监测(HF Daily 续立/翻倍 + Self-Supervised Structured Dynamics 跌出风险)+ 1 件 P2 邻接(vLLM v0.20.0 + Turion.ai + HyMCache · engineering/llm-infra 邻接) = 第 33 版活文档准备棒 + coding-agents 主题饱和沿用状态延续 + §2.6 第四十二子节 SDB 立标级新增 + §2.4 记忆/后训练 11→13 件扩 + §2.5 第 86 节点 HyMCache 旁证级新增 + 5 大分类饱和延续 + evaluation 主题 3 天未更新待补救 + spark 双 E1 完整恢复第 2 棒 + AAAI 2027 截稿 7-28 紧急提醒」


END · 落稿时间 2026-07-27 23:00 CST · flyP 预消化棒(8 件增量 / 11 件反方 / 11 件 arXiv)