engineering · E1 预消化简报(2026-07-31)
执行:Jay · 主题:engineering · 类型:E1 日间预消化轮(engineering) 窗口:2026-07-30 11:20 CST → 2026-07-31 11:20 CST(约 24 小时增量) 基线:
organized/knowledge/engineering.mdv40(2026-07-30 · MCP 2026-07-28 史上最大更新 + llm-d CNCF Sandbox + 7 子件 · 96 主线 v40 收官) 覆盖来源:inbox/jay/7-31 共 15 件(1000 RSS simon-willison/bytebytego/nathan-benaich/raschka + 1001 cool-papers/cool-papers-ir + 1002 lilian-weng/msr-blog + 1003 import-ai + 1005 karpathy + 1006 fireship + 1050 jay-engineering-filter + ai-engineering-trending + engineering-database-backend-cloudnative + csdn-weekly + T1105 five-category-briefing)+inbox/tom/7-31 共 4 件(0900 hf-daily + agent-rag-longcontext-radar + rag-e1prep + 1005 yt-lex-fridman + 1005 yt-yannic-kilcher)+inbox/spark/7-31 共 3 件(1001 gradient-flow + 1002 chip-huyen + 1005 3blue1brown)+inbox/stephen/7-31 共 11 件(ai-industry-e1prep + 0910 X VIP radar + 6 news 通稿 + 3 YT 通稿)+inbox/flyp/7-31 共 3 件(0950 SkillRise-Metis critical-read + 1000 rss-cameron-wolfe + 1002 rss-interconnects + 1005 yt-ai-explained + 1005 yt-two-minute-papers + multimodal-e1prep)+paper_cards/IDs 654-668(15 张 · 7-30~31 新卡 · engineering 主 4 张 + llm-infra 主 2 张 + agent 主 9 张邻接 engineering) 结论:高密度(6 主线 + 3 旁证 + 1 警示),核心动作 = (1) SIGMOD 2026 LLM Serving 三件套(CoDec/AlignedServe/HotPrefix · 前缀共享解码内核 + 前缀感知 batching + 热 aware KV cache 调度 · 2026 年 SIGMOD 明显增加 LLM inference systems 论文 track);(2) MC-SF 在线调度 arXiv:2502.07115v5 MIT+MSR+Amazon(LLM inference 显式建模 KV cache 动态内存增长 · ILP 最优基准 · 仅需输出长度预测值即可达常数竞争比);(3) Memory for LLMs 综述 arXiv:2607.25380 统一架构分类学(三个正交轴:表征(隐式 vs 显式)+ 更新策略 + 可扩展查找存储 · memory 研究碎片化 → 统一框架);(4) Graph-Native Bitemporal Memory Store arXiv:2607.26520v1(Neo4j 属性图 + HNSW + 双向时态数据模型 valid time + transaction time · 工程完整度高);(5) StealthBench arXiv:2607.26314 评测自主进攻性安全 Agent 操作隐蔽性(6 OPSEC 维度 · 11 个手工验证真实 OPSEC 事件);(6) HANDBOOK.md arXiv:2607.25398v1 评测长程 Agent 对约束性政策文档的遵循(65 任务 · 企业员工遵循员工手册模式);(7) CXL-PIM KV Cache HotInfra '26(Mooncake 后继 · DeepSeek-R1-671B 32K tokens PIM 方案比 H100 集群吞吐高 2.4× · CapEx 降低 20.6× · OpEx 降低 16.8× · Cost/Mtokens 降低 39.7×);(8) vLLM 生产质量工程(vLLM AI Blog 2026-07-16 · 2026 年 6 月合并 1,918 commits 到 main · 平均每天 64 个 · CI 1,300 万 job minutes · 两周一次发版节奏);(9) CoRT arXiv:2607.25659 Token 级 Rubric-Guided GRPO 策略优化(DRIFT per-token forward/reverse KL 凸混合 · HF Daily 75▲) + 1 旁证:PipeMax Pipeline Parallelism + KV Cache Offloading arXiv:2605.02189v1 + RLHF C++ vs PyTorch arXiv:2607.19712 + 1 警示:paper_cards 主分类 engineering 近 3 天新增 4 张(654/655/656/657/658/659/660/661/662/663/664/665/666/667/668 中 engineering 主 4 张:658 Metis/659 SkillRise/662 CAST/663 CoRT · agent 主分类邻接 engineering)
一、核心增量(6 主线 + 3 旁证 + 1 警示,按活文档归位顺序)
增量 1【KV Cache 基础设施 / §2.1 / §2.3】SIGMOD 2026 LLM Serving 三件套 + MC-SF 在线调度理论(★★ 必补)
- 来源:
inbox/jay/2026-07-31T1105-jay-five-category-briefing.mdReproduction 条目 3/4/5/11/12(⭐⭐⭐⭐⭐ · ACM SIGMOD 2026 + arXiv:2502.07115v5 MIT+MSR+Amazon + arXiv:2504.11320v4);v40 engineering.md §2.1 KV Cache 已收 LMCache/vLLM MRv2/SwiftCache/KVpop + §2.3 调度理论已收 Fluid-Guided WAIT/Tail-Aware/STAR/SAGA;但 SIGMOD 2026 三件套(CoDec/AlignedServe/HotPrefix · 前缀共享内核 + 前缀感知 batching + 热 aware 调度)未入位;MC-SF(ILP 最优基准 + 仅需输出长度预测即可达常数竞争比)未入位
SIGMOD 2026 LLM Serving 三件套完整展开:
-
CoDec: Prefix-Shared Decoding Kernel for LLMs(SIGMOD 2026) - 前缀共享解码内核,多请求间共享前缀时减少冗余计算 - 与 SGLang RadixAttention 技术路线一致;建议精读核验与 SGLang 实现的关系
-
AlignedServe: Prefix-aware Batching(SIGMOD 2026) - 前缀感知的 batching 调度,构建高吞吐、低计算浪费的 LLM serving 系统
-
HotPrefix: Hotness-Aware KV Cache Scheduling(SIGMOD 2026) - 热 aware KV cache 调度,实现高效前缀共享 - 信号:2026 年 SIGMOD 明显增加了 LLM inference systems 论文 track
MC-SF Online Scheduling for LLM Inference arXiv:2502.07115v5(完整展开): - 机构:MIT CSAIL + Microsoft Research + Amazon - 核心贡献: - 理论模型:LLM inference 调度问题的形式化模型,显式建模 KV cache 动态内存增长 - 整数规划(ILP):hindsight-optimal benchmark 的 ILP 公式,证明确定性在线算法在对抗性到达下无法达到常数竞争比 - MC-SF 算法:实际的多项式时间算法,在 prompt 到达分布满足特定结构条件时达到常数竞争比 - 关键发现:仅需输出长度的预测 $\tilde{o}_i \geq o_i$ 即可(不需要精确值) - 实验:合成实验(对比 hindsight 最优) + 大规模真实 LLM trace 仿真 - 评价:理论与工程结合的杰作,MIT 运筹学 + MSR Azure 系统团队联合出品
Fluid-Guided WAIT/Nested WAIT arXiv:2504.11320v4(旁证补入): - 研究 KV cache 超容导致的 eviction-recomputation 恶性循环问题 - fluid approximation 识别 fluid stability region 和最优内存需求 $M^*$ - vLLM 默认使用 recomputation 作为 eviction 策略
- 与活文档关系:v40 §2.1 KV Cache 学科已收 LMCache/SwiftCache/KVpop;但 SIGMOD 2026 三件套(CoDec/AlignedServe/HotPrefix)未入位;MC-SF(ILP 最优基准 + 仅需输出长度预测)未入位;Fluid WAIT 未入位
- 建议归入:§2.1 KV Cache(新增「SIGMOD 2026 LLM Serving 三件套(CoDec 前缀共享解码内核 + AlignedServe 前缀感知 batching + HotPrefix 热 aware KV cache 调度)」小节)+ §2.3 调度理论(新增「MC-SF arXiv:2502.07115v5 MIT+MSR+Amazon 在线调度(ILP 最优基准 + 仅需输出长度预测 + MC-SF 常数竞争比算法)」小节);新增 C 条共识候选:"SIGMOD 2026 三件套 = CoDec(前缀共享解码)+AlignedServe(前缀感知 batching)+HotPrefix(热 aware 调度)代表 2026 年 VLDB/SIGMOD 对 LLM inference systems 的集中关注";新增 O 条试金石:"SIGMOD 2026 三件套与 SGLang RadixAttention / vLLM PagedAttention 的实现关系是否已有开源复现"
增量 2【Agent Memory 系统 / §2.24】Memory for LLMs 综述 + Graph-Native Bitemporal Memory Store(★★ 必补)
- 来源:
inbox/tom/2026-07-31-agent-rag-longcontext-radar.md#3 P0 高价值 + paper_cards/668/666;inbox/stephen/2026-07-31-ai-industry-e1prep.md增量 4 Tom 7-31 radar;v40 engineering.md §2.24 多层记忆基底已收 MRMS/SeKV/Agent-Native Memory/RankSquire/MemoryArena/Memora/SkillOpt;但 Memory for LLMs 综述(统一架构分类学·三个正交轴)未入位;Graph-Native Bitemporal Memory Store 未入位
Memory for Large Language Models 综述 arXiv:2607.25380(完整展开): - 核心贡献:系统梳理 LLM 中 memory 的 architecture-centric taxonomy - 三个正交轴: 1. 表征:隐式 vs 显式 2. 更新策略:各种更新机制 3. 可扩展查找存储: lookup storage 的可扩展性 - 意义:memory 研究碎片化 → 统一框架;是入门此方向的完整地图 - 主分类:llm-infra(engineering 邻接)
A Graph-Native Bitemporal Memory Store for Conversational AI Agents arXiv:2607.26520v1(完整展开): - 作者:Alp Niksarli, Gopesh Baheti - 核心架构:Agent-local Neo4j 属性图 + HNSW 向量索引 + 双向时态数据模型 - valid time:事实成立的时间区间 - transaction time:系统记录该事实的时间区间 - 解决的问题:避免上下文窗口耗尽或数据经第三方服务泄露 - 工程意义:图结构 + 时态记忆 + 向量检索三合一;工程上完整度高,适合多轮对话 agent 生产落地参考 - 主分类:agent(engineering 邻接)
- 与活文档关系:v40 §2.24 多层记忆基底已收 Agent Memory 三路线;但 Memory for LLMs 综述(统一分类学·三个正交轴)未入位;Graph-Native Bitemporal Memory Store(Neo4j+HNSW+双向时态)未入位
- 建议归入:§2.24 多层记忆基底(新增「Memory for LLMs 综述 arXiv:2607.25380 统一架构分类学(表征·更新策略·可扩展查找存储三正交轴)」小节)+ 新增「Graph-Native Bitemporal Memory Store arXiv:2607.26520v1(Neo4j 属性图+HNSW+valid time+transaction time · 图结构+时态记忆+向量检索三合一)」小节);新增 C 条共识候选:"Agent Memory 2026 H2 三层 = Memory for LLMs 综述(统一分类学)+Graph-Native Bitemporal(工程化实现)+Metis Memory Foundation Model(原生化)";新增 O 条试金石:"Graph-Native Bitemporal 的 transaction time 是否支持 GDPR 删除权(right to be forgotten)要求"
增量 3【Agent 安全 / §2.15】StealthBench arXiv:2607.26314 自主进攻性安全 Agent 操作隐蔽性评测(★ 必补)
- 来源:
inbox/stephen/2026-07-31-ai-industry-e1prep.md增量 1 paper_cards/664 + paper_cards/664;v40 engineering.md §2.15 推理工程安全已收 Cyber-Capable AI Agents(arXiv:2607.25379v1 · 五类漏洞边界+containment 评估);但 StealthBench(评测自主进攻性安全 Agent 操作隐蔽性·6 OPSEC 维度·11 手工验证真实 OPSEC 事件)未入位
StealthBench arXiv:2607.26314 完整展开: - 核心问题:Stealth——在不暴露存在、能力或情报的情况下达成目标——是区分成熟操作员与可检测操作员的关键能力;自主 Agent 越来越多地继承相同的进攻任务,但它们是否继承了相同的操作安全技巧 - 核心贡献:benchmark 评测自主进攻性安全 Agent 的操作隐蔽性 - 覆盖范围:6 个 operational security(OPSEC)维度 - 数据集:从真实安全事件中提取 11 个手工验证的 OPSEC 事件 - 主分类:agent(engineering 邻接)
StealthBench 与 Cyber-Capable AI Agents 的关键区分: - Cyber-Capable AI Agents(arXiv:2607.25379v1):评估攻击面——AI agent 被攻击后能造成多大破坏的containment 能力;侧重防御框架(OPSEC 防御清单) - StealthBench(arXiv:2607.26314):评估进攻能力——自主 Agent 在执行进攻任务时的操作隐蔽性;侧重量化 OPSEC 进攻效果 - 互补关系:两者是同一枚硬币的两面——Cyber-Capable 问"被攻击了怎么办",StealthBench 问"进攻时有多隐蔽"
- 与活文档关系:v40 §2.15 已收 Cyber-Capable AI Agents;但 StealthBench(6 OPSEC 维度 + 11 真实 OPSEC 事件)未入位
- 建议归入:§2.15 推理工程安全(新增「StealthBench arXiv:2607.26314 自主进攻性安全 Agent 操作隐蔽性评测(6 OPSEC 维度 + 11 手工验证真实 OPSEC 事件 · 与 Cyber-Capable AI Agents 形成攻击面/防御清单互补)」小节);新增 C 条共识候选:"Agent 安全评估 = Cyber-Capable AI Agents(containment 防御框架)+StealthBench(OPSEC 进攻隐蔽性评测)";新增 O 条试金石:"StealthBench 评测集是否覆盖 C2 隐蔽性(network 层面 beacon 间隔/Jitter/域前置)"
增量 4【Harness Engineering / §2.7】HANDBOOK.md arXiv:2607.25398v1 评测长程 Agent 对约束性政策文档的遵循(★ 必补)
- 来源:
inbox/stephen/2026-07-31-ai-industry-e1prep.mdpaper_cards/654 + paper_cards/654;v40 engineering.md §2.7 Agentic Engineering 学科化已收 Harness Engineering(Lilian Weng 2026-07-04)·Self-Harness·PAEF·RAMP·YatCC·ICSE 2026;但 HANDBOOK.md(评测 Agent 对长程约束性政策文档的遵循·65 任务·企业员工手册模式)未入位
HANDBOOK.md arXiv:2607.25398v1 完整展开: - 核心问题:语言模型 Agent 越来越多地在持续指令下部署——系统提示词、政策文件或技能文档被放在上下文中,Agent 被信任遵循它来约束每个后续行动。现有 benchmark 很少直接测试这种部署模式。 - 核心贡献:HANDBOOK.md benchmark——65 个 Agent 任务,模拟企业员工遵循公司员工手册的方式 - 测试内容:不是 Agent 能否完成任务,而是长程、约束性的政策文档是否真的能在扩展的工具使用范围内约束 Agent 的行为 - 主分类:agent(engineering 邻接)
- 与活文档关系:v40 §2.7 已收 Harness Engineering 工具链;但 HANDBOOK.md(65 任务·政策文档遵循·企业员工手册模式)未入位
- 建议归入:§2.7 Agentic Engineering 学科化(新增「HANDBOOK.md arXiv:2607.25398v1 评测长程 Agent 对约束性政策文档的遵循(65 任务 · 企业员工遵循员工手册模式 · 评测政策文档是否真能约束 Agent 行为)」小节);新增 O 条试金石:"HANDBOOK.md 65 任务与 SWE-bench / AgentBench 的评测维度差异是否已有 cross-benchmark 对比"
增量 5【KV Cache 存储分离 / §2.1】CXL-PIM KV Cache Server HotInfra '26 + PipeMax Pipeline+Offloading arXiv:2605.02189v1(★★ 旁证)
- 来源:
inbox/jay/2026-07-31T1105-jay-five-category-briefing.mdReproduction 条目 1(Mooncake 后继)+ 13(PipeMax) + paper_cards(无独立卡);v40 engineering.md §2.1 KV Cache 学科已收 Mooncake(vLLM 60 GB200 3.8×/46×/8.6×);但 CXL-PIM KV Cache 后继方案未入位;PipeMax(commodity GPU 8 GPUs + pipeline parallelism + KV cache offloading)未入位
CXL-PIM KV Cache Server HotInfra '26(完整展开): - 来源:HotInfra '26(ISCA '26 联合工作坊,2026-06-28);论文:hotinfra.org/2026/papers/hotinfra26-final59.pdf - 对比:GPU cluster vs CXL-PIM KV cache server(分离式架构) - 关键数据(DeepSeek-R1-671B, 32K tokens 生成): - PIM 方案比 H100 集群吞吐高 2.4× - CapEx 降低 20.6× - OpEx 降低 16.8× - Cost/Mtokens 降低 39.7× - Tokens/Watt:H100 集群 0.051 vs PIM 方案 1.507(29.5× 提升) - 核心洞察:推理成本主要来自 KV cache 存储,而非计算
PipeMax:Pipeline Parallelism + KV Cache Offloading arXiv:2605.02189v1(完整展开): - 场景:commodity GPU server(8 GPUs)上的高吞吐 LLM inference - 方案:将 inactive KV cache offload 到 CPU,结合 pipeline parallelism - 技术创新:计算与 offloading 数据传输协同调度,最大化 compute-data overlap - 结果:相比 SOTA 提升最高 2.51×(8 GPUs)
- 与活文档关系:v40 §2.1 已收 Mooncake(vLLM 60 GB200 分离式架构);但 CXL-PIM 后继方案(2.4× 吞吐/39.7× cost 降低)未入位;PipeMax(commodity GPU 8 GPUs pipeline+offloading 2.51×)未入位
- 建议归入:§2.1 KV Cache(新增「CXL-PIM KV Cache Server HotInfra '26(Mooncake 后继 · DeepSeek-R1-671B 32K tokens · 2.4× 吞吐 + 39.7× Cost/Mtokens 降低 + 29.5× Tokens/Watt 提升)」小节)+ §2.2 PD Disaggregation(新增「PipeMax arXiv:2605.02189v1 commodity GPU 8 GPUs pipeline parallelism + KV cache offloading 2.51× 提升」小节);新增 O 条试金石:"CXL-PIM 方案的 latency SLA 是否满足交互式应用需求(2.4× 吞吐提升 vs latency 影响)"
增量 6【推理引擎生产工程 / §2.13】vLLM 生产质量工程 + vLLM vs SGLang vs TensorRT-LLM H100 Benchmark(★★ 必补)
- 来源:
inbox/jay/2026-07-31T1105-jay-five-category-briefing.mdBackend 条目 6/5(⭐⭐⭐⭐⭐ · vLLM AI Blog 2026-07-16 + Spheron Blog 2026) +inbox/jay/2026-07-31-engineering-database-backend-cloudnative.md;v40 engineering.md §2.13 推理引擎可复现性危机已收 Albireo/TrueFoundry/LeetLLM/Spheron;但 vLLM 官方工程博客(1,918 commits/月 + CI 1,300 万 job minutes + 两周一次发版节奏)未入位;vLLM vs TensorRT-LLM vs SGLang 2026 H100 Benchmark 未入位
vLLM Keeping Production Quality vLLM AI Blog 2026-07-16(完整展开): - 2026 年 6 月数据: - 合并 1,918 commits 到 main(平均每天 64 个,与 PyTorch/Kubernetes 规模相当) - CI 耗用 1,300 万 job minutes,峰值 1,400 并发 runner - 发版节奏: - 采用两周一次的发版节奏(two-week cadence,自 2025 年 11 月起) - 分层发版策略:main 持续 → release 分支 → 每两周正式发布 - 500 commits 量级最适合 bisect 管理 feature 和回归追踪 - 工程成熟度:vLLM 工程规模已达 PyTorch/Kubernetes 量级,是 LLM serving 事实标准的基础
Spheron Blog vLLM vs TensorRT-LLM vs SGLang H100 Benchmark 2026(完整展开): - TensorRT-LLM:编译后领先所有并发级别(低并发 +8%,50 并发 +13% 领先 vLLM);缺点是需要 28 分钟编译,模型稳定时才值得 - vLLM:启动最快,模型灵活性最高;TTFT 150-200ms;是大多数场景的默认选择 - SGLang:在共享前缀场景下 RadixAttention 提供真实收益;无共享前缀时表现与 vLLM 相近;VRAM 峰值占用最低 - 决策框架: - 能接受 28 分钟编译 + 模型稳定 → TensorRT-LLM(最优吞吐和延迟) - 需要快速启动 + 模型灵活性 → vLLM - 共享前缀工作负载 → SGLang
- 与活文档关系:v40 §2.13 已收 Albireo/TrueFoundry/LeetLLM;但 vLLM 官方工程博客(1,918 commits/月 + 1,300 万 job minutes + 两周发版节奏)未入位;vLLM vs TRT-LLM vs SGLang H100 Benchmark 未入位
- 建议归入:§2.13 推理引擎可复现性危机(新增「vLLM 官方工程博客 2026-07-16(1,918 commits/月 + 1,300 万 job minutes + 两周一次发版节奏 + 500 commits bisect 管理)」小节)+ §2.5 推理工程学科化(新增「vLLM vs TensorRT-LLM vs SGLang 2026 H100 Benchmark(Spheron Blog · TRT-LLM 28 分钟编译代价 / vLLM 快速启动灵活性 / SGLang RadixAttention 共享前缀收益)」小节);新增 C 条共识候选:"2026 年推理引擎选型 = TRT-LLM(编译优化·28min 冷启动代价)+vLLM(快速启动·高灵活性)+SGLang(共享前缀场景·最低 VRAM)";新增 O 条试金石:"vLLM 1,918 commits/月 的 CI 质量门禁通过率是否公开"
增量 7【RLHF 系统工程 / §2.13】RLHF C++ vs PyTorch arXiv:2607.19712 + CoRT Token 级 GRPO(★ 旁证)
- 来源:
inbox/stephen/2026-07-31-ai-industry-e1prep.mdpaper_cards/657 + paper_cards/663 +inbox/jay/2026-07-31T1105-jay-five-category-briefing.mdReproduction 条目无;v40 engineering.md §2.13 推理引擎可复现性危机已收 Albireo;但 RLHF 推理系统工程(C++ ONNX Runtime vs PyTorch)未入位;CoRT(per-token forward/reverse KL 凸混合)未入位
How Fast Can Reward Models Score? arXiv:2607.19712(完整展开): - 核心问题:在 RLHF pipeline 中,reward scoring 阻塞 policy 更新;慢速 scoring 是整个循环的瓶颈 - 发现: - scoring 本身很小,但 scoring 和 generation 争夺相同的 CPU 和 GPU 资源 - 更快的 scoring engine 不单独缩减 step time,主要释放 generation 可用的容量 - 方案:构建了 native C++ inference engine on ONNX Runtime(Fir...) - 评价:RLHF系统工程级研究,与 vLLM 生产质量工程共同构成推理系统基础设施视角
CoRT:Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization arXiv:2607.25659(完整展开): - 核心问题:在 GRPO-style pipeline 中,结构化评判被压缩为标量 response-level reward;不同 token 对不同 criteria 的贡献无法被区分 - 方案:DRIFT 机制 per-token forward/reverse KL 凸混合 - 三大失效模式:冷启动崩溃/状态无关调度/稀疏二元 reward - HF Daily 7-31 票榜 75▲
- 与活文档关系:v40 §2.13 推理引擎可复现性危机已收 Albireo;但 RLHF scoring C++ vs PyTorch 未入位;CoRT(per-token KL 凸混合)未入位
- 建议归入:§2.13 推理引擎可复现性危机(新增「RLHF C++ vs PyTorch arXiv:2607.19712 reward scoring 瓶颈分析 + ONNX Runtime C++ inference engine」小节)+ §2.8(新增「CoRT arXiv:2607.25659 token 级 rubric-guided GRPO · HF Daily 75▲ · DRIFT per-token forward/reverse KL 凸混合 · 三大失效模式:冷启动崩溃/状态无关调度/稀疏二元 reward」小节);新增 O 条试金石:"RLHF C++ scoring engine 在多节点分布式训练中的 GPU 调度开销是否优于 PyTorch"
增量 8【Skill 系统 + Coding Agent / §2.7 / §2.22】SkillRise arXiv:2607.26784 跨任务技能进化 + CAST arXiv:2607.25308 博弈求解器作为回合级教师(★ 旁证)
- 来源:
inbox/stephen/2026-07-31-ai-industry-e1prep.mdpaper_cards/659/662 +inbox/flyp/2026-07-31-0950-SkillRise-and-Metis-critical-read.md;v40 engineering.md §2.7 Agentic Engineering 学科化已收 Self-Harness/PAEF/RAMP/SkillOpt;但 SkillRise(统一 RL 框架跨任务技能学习 + 测试时跨任务 scaling)未入位;CAST(博弈求解器状态值变化揭示动作效果 + 回合级信用分配)未入位
SkillRise:Agentic Reinforcement Learning for Cross-Task Skill Evolution arXiv:2607.26784(完整展开): - 问题:标准 agentic RL 将任务视为独立 episodes;现有技能学习方法聚焦单一任务重复尝试或多阶段流水线 - 方案:SkillRise——统一 RL 框架,跨任务学习技能 - 将相关实例组织为逐步挑战的序列 - 使用单一策略在任务间交替(solve/curate 双角色) - 同任务重复尝试也保留收益 - 作者:Yao/Chen/Lu et al.(17 位作者) - 主分类:agent(engineering 邻接)
CAST:Game Solvers as Turn-Level Teachers for LLM Agents arXiv:2607.25308(完整展开): - 问题:RLVR 依赖稀疏的最终奖励,揭示不了哪些决策决定了成功 - 洞察:博弈求解器的状态值变化揭示了一个动作是否推进了状态向成功 - 方案:CAST(Credit Assignment from Solver Teachers)——从博弈求解器状态值变化中导出回合级信用 - 主分类:agent(engineering 邻接)
- 与活文档关系:v40 §2.7 已收 Self-Harness/SkillOpt/Harness Engineering;但 SkillRise(跨任务技能进化)未入位;CAST(博弈求解器回合级信用分配)未入位
- 建议归入:§2.7 Agentic Engineering 学科化(新增「SkillRise arXiv:2607.26784 跨任务技能进化(统一 RL 框架 + solve/curate 双角色 + 测试时跨任务 scaling)」小节)+ §2.22 Coding Agent 企业 Agent(新增「CAST arXiv:2607.25308 博弈求解器作为回合级教师(状态值变化揭示动作效果 + CAST 回合级信用分配)」小节)
增量 9【警示】paper_cards 主分类 engineering 近 3 天新增 4 张(658/659/662/663)·均为 agent 主分类邻接·v40 §2.24/§2.7/§2.8 归位候选·主体工程增量与 v40 收官状态吻合
- 来源:
paper_cards/IDs 654-668(15 张 7-30~31 新卡):658 Metis(agent → engineering 邻接)+659 SkillRise(agent → engineering 邻接)+662 CAST(agent → engineering 邻接)+663 CoRT(evaluation → engineering 邻接) - 注:v40 engineering.md §2.24 多层记忆基底 §2.7 Agentic Engineering §2.8 SoK Agentic RAG 均已收相关主题的老版本;本批新卡主分类均为 agent/evaluation 而非 engineering,但属于 engineering 邻接
- ⚠️ 无 engineering 主分类新卡新增警示:近 3 天 paper_cards engineering 主分类新增 0 张(654 HANDBOOK.md agent 主分类 / 655 Human-in-the-Loop multimodal / 656 Agent Retrieval Bench agent / 657 RLHF C++ llm-infra / 658 Metis agent / 659 SkillRise agent / 660 DecoEvo evaluation / 661 CLBench-V multimodal / 662 CAST agent / 663 CoRT evaluation / 664 StealthBench agent / 665 Grading Narrators agent / 666 Graph-Native Bitemporal agent / 667 KAMR rag / 668 Memory for LLMs llm-infra);主体工程增量(§2.1 KV Cache SIGMOD 三件套 + §2.13 vLLM 生产质量 + §2.24 Memory 综述)均来自 RSS/博客/arXiv 邻接,非 paper_cards 工程主分类新增
二、值得警惕的矛盾或待核实说法
⚠️ 待核实 1:SIGMOD 2026 三件套与 vLLM/SGLang 实际实现的对应关系
- 来源:ACM SIGMOD 2026(2026-05-18 published)
- 问题:CoDec/AlignedServe/HotPrefix 三篇论文的技术方案与 SGLang RadixAttention / vLLM PagedAttention 的具体实现路径是否已有开源复现或官方集成
- 核实建议:查 SIGMOD 2026 论文配套代码库;对照 vLLM GitHub issues 和 SGLang release notes
⚠️ 待核实 2:CXL-PIM KV Cache Server 的 latency SLA
- 来源:HotInfra '26 论文
- 问题:PIM 方案 2.4× 吞吐提升 + 39.7× Cost/Mtokens 降低的同时,latency 是否满足交互式应用 SLA
- 核实建议:HotInfra 论文 §4/§5 latency breakdown;查 Mooncake v3 / DeepSeek-R1 官方 benchmark
⚠️ 待核实 3:Graph-Native Bitemporal Memory Store 的 GDPR 删除权支持
- 来源:arXiv:2607.26520v1
- 问题:bitemporal data model(transaction time)是否支持 right to be forgotten 要求;Neo4j graph 的 immutability 设计是否与 GDPR 删除权冲突
- 核实建议:精读 §3 Data Model;查 Neo4j GDPR compliance documentation
⚠️ 待核实 4:StealthBench 11 个 OPSEC 事件的覆盖范围是否涵盖 C2 隐蔽性
- 来源:arXiv:2607.26314
- 问题:6 个 OPSEC 维度是否覆盖 C2 隐蔽性(network 层面 beacon 间隔/Jitter/域前置);11 个手工验证 OPSEC 事件中进攻性安全场景的代表性
- 核实建议:精读 §2 Benchmark Design;对照 MITRE ATT&CK framework
三、可引用的 arXiv 号列表(本轮涉及)
| arXiv 号 | 标题 / 主题 | 增量归属 | 与 engineering.md v40 现有脉络关系 |
|---|---|---|---|
| arXiv:2607.25380 | Memory for Large Language Models(LLM memory 统一架构分类学 · 表征·更新策略·可扩展查找存储三正交轴 · memory 研究碎片化→统一框架 · llm-infra 主) | 增量 2 | §2.24 多层记忆基底新增综述节点 |
| arXiv:2607.26520v1 | A Graph-Native Bitemporal Memory Store for Conversational AI Agents(Neo4j 属性图+HNSW+valid time+transaction time · agent 主) | 增量 2 | §2.24 多层记忆基底新增工程化实现节点 |
| arXiv:2607.26314 | StealthBench:Measuring Operational Stealth in Autonomous Offensive-Security Agents(6 OPSEC 维度 · 11 手工验证真实 OPSEC 事件 · agent 主) | 增量 3 | §2.15 推理工程安全新增 OPSEC 进攻性评测节点 |
| arXiv:2607.25398v1 | HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following(65 任务 · 评测长程 Agent 对约束性政策文档的遵循 · agent 主) | 增量 4 | §2.7 Agentic Engineering 学科化新增政策文档遵循评测节点 |
| arXiv:2502.07115v5 | MC-SF:Online Scheduling for LLM Inference with KV Cache Constraints(MIT+MSR+Amazon · ILP 最优基准 · 仅需输出长度预测即可达常数竞争比) | 增量 1 | §2.3 调度理论新增在线调度理论核心节点 |
| arXiv:2605.02189v1 | PipeMax:Pipeline Parallelism + KV Cache Offloading(commodity GPU 8 GPUs · 2.51× 提升) | 增量 5 | §2.2 PD Disaggregation 新增 commodity GPU 方案节点 |
| arXiv:2607.19712 | How Fast Can Reward Models Score? C++ vs PyTorch Inference Runtimes for RLHF(RLHF scoring 瓶颈 · ONNX Runtime C++ engine · llm-infra 主) | 增量 7 | §2.13 推理引擎可复现性危机新增 RLHF 系统工程节点 |
| arXiv:2607.25659 | CoRT:Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization(DRIFT per-token KL 凸混合 · HF Daily 75▲ · evaluation 主) | 增量 7 | §2.8 SoK Agentic RAG 新增 token 级信用分配节点 |
| arXiv:2607.26784 | SkillRise:Agentic Reinforcement Learning for Cross-Task Skill Evolution(统一 RL 框架跨任务技能学习 · 17 作者 · agent 主) | 增量 8 | §2.7 Agentic Engineering 新增跨任务技能进化节点 |
| arXiv:2607.25308 | CAST:Game Solvers as Turn-Level Teachers for LLM Agents(博弈求解器状态值变化揭示动作效果 · agent 主) | 增量 8 | §2.22 Coding Agent 企业 Agent 新增回合级信用分配节点 |
| arXiv:2607.25895 | HiFi-UMI(v40 §2.7 已立 · HF Daily 141▲ · VLA 机械手) | 存量沿用 | §2.7 Harness Engineering v40 已有 |
| arXiv:2607.25996v1 | RepoReasoner(v40 §2.8 已立 · 代码库级推理评测基准) | 存量沿用 | §2.8 SoK Agentic RAG v40 已有 |
| arXiv:2607.25379v1 | Cyber-Capable AI Agents(v40 §2.15 已立 · 五类漏洞边界 + containment 评估) | 存量沿用 | §2.15 推理工程安全 v40 已有 |
| arXiv:2607.25431 | CodeNib(v40 §2.8 已立 · 多视图代码 Agent 数据系统 · HF Daily 77▲) | 存量沿用 | §2.8 SoK Agentic RAG v40 已有 |
| arXiv:2607.25600v1 | Beyond Self-Knowledge/BeyondUncertainty(v40 §2.10 已立 · verbalized confidence 路由检索 · HF Daily 83▲) | 存量沿用 | §2.10 RAG / Agent 质量矩阵 v40 已有 |
| arXiv:2606.01927 | Albireo Async Scheduling(v40 §2.13 已立 · 1.9× Throughput -48% Latency) | 存量沿用 | §2.13 推理引擎可复现性危机 v40 已有 |
| arXiv:2607.26760v1 | Metis Memory Foundation Model(v40 未立 · 2026-07-31 paper_cards/658 · 42 页 · agent 主) | 存量邻接 | §2.24 多层记忆基底邻接候选(待立) |
注:本轮 engineering 主题核心新增 arXiv 号 10 个(Memory for LLMs + Graph-Native Bitemporal + StealthBench + HANDBOOK.md + MC-SF + PipeMax + RLHF C++ + CoRT + SkillRise + CAST);其余均为存量沿用/邻接。
四、检查过的来源清单
inbox/jay(7-31 共 15 件,全部已读): - ✅ 2026-07-31T1105-jay-five-category-briefing.md(11:05 · 五大类目补编 · MCP 2026-07-28 无状态规范 + SIGMOD 2026 三件套 + vLLM vs TRT-LLM vs SGLang H100 Benchmark + vLLM 生产质量工程 + MC-SF + CXL-PIM HotInfra '26 + PipeMax + A-RAG arXiv:2602.03442 + A2A 协议 150 组织 + Fluid WAIT) - ✅ 2026-07-31-1050-jay-engineering-filter.md(工程筛选报告 · 幂等性 ByteByteGo + Simon Willison 三起安全事件 + llm 0.32rc2 + Lilian Weng Harness + MSR Echoverse + DoorDash/Instacart/Uber Eats LLM 搜索 · ⭐ 精读:幂等性+Harness+Echoverse) - ✅ 2026-07-31-ai-engineering-trending.md(GitHub Trending vLLM/ComfyUI/Open WebUI/Dify/Langflow/CrewAI/Claude Code + HF Hub 100 万模型里程碑 + Substack AI Agents Stack 2026 + OWASP Top 10 Agents 2026 + RAG 架构演进 4 阶段 + 国产模型选型) - ✅ 2026-07-31-engineering-database-backend-cloudnative.md(PostgreSQL vs MySQL 2026 基准对比 PG 4.87x 领先 + PgBouncer/ProxySQL 生产配置实战 + CNCF K8s 排障实战 + eBPF 内核调优 + K8s vs Docker Swarm 选型 + InnoDB 源码分析 + 执行计划排障) - ✅ 2026-07-31-csdn-weekly.md(CSDN vLLM 部署参数详解 + 阿里云 DeepSeek-R1 微调 + RAG 进阶混合检索 BM25/RRF/HyDE/GraphRAG/PageIndex + 腾讯云 RAG + Datawhale DeepSeek vLLM) - ✅ 2026-07-31-1000-rss-simon-willison.md(5 件:🆕 GPT-5.6 Luna 80% 降幅 + 🆕 三起真实安全事件调查 + 🆕 llm 0.32rc2 + 🆕 llm-chat-completions-server 0.1a0 + 🆕 Bruce Schneier 引用) - ✅ 2026-07-31-1000-rss-bytebytego.md(5 件:幂等性投递语义 + DoorDash/Instacart/Uber Eats LLM 搜索 + NVIDIA 开放模型 + 分布式系统时钟因果 + ChatGPT 优化 Agent 循环 · engineering 邻接) - ✅ 2026-07-31-1000-rss-raschka.md(5 件:🆕 控制 LLM 推理力度 + 🆕 使用本地 Coding Agent + 🆕 LLM 架构最新进展(KV Sharing + mHC + Compressed Attention)+ 🆕 LLM 研究论文 2026 part1 + 🆕 工作流理解 LLM= 实质增量 5 件 net-new) - ✅ 2026-07-31-1000-rss-nathan-benaich.md(5 件:沿用 · 0 件 engineering) - ✅ 2026-07-31-1001-rss-cool-papers.md(5 件:Mental World Modeling + APEX-Accounting + Pangram 4 + DenseOn+LateOn 多语种长上下文 + Regional Bias · 0 件 engineering 主增) - ✅ 2026-07-31-1001-rss-cool-papers-ir.md(5 件:相关意图 + KAMR + 序列推荐 + IMFuse + 决策感知用户模拟器 · 0 件 engineering 主增) - ✅ 2026-07-31-1002-rss-lilian-weng.md(5 件:沿用 Harness Engineering + 谨慎 Scaling Laws + 为何思考 + RL Reward Hacking + LLM 外在幻觉 · 实质增量 0 件) - ✅ 2026-07-31-1002-rss-msr-blog.md(5 件:🆕 Echoverse 计算机使用 Agent + 🆕 EvoLib 持续演进知识 + 沿用 SymCrypt Rust + Aurora 1.5 + Flint= 实质增量 2 件 net-new MSR Agent 维度) - ✅ 2026-07-31-1003-rss-import-ai.md(5 件:沿用苦涩教训 + 开源闭源差距 + Fable GPU kernel + 自我改进机器人 + 超级说服力 · 实质增量 0 件) - ✅ 2026-07-31-1005-rss-yt-karpathy.md(5 件:🆕 如何使用 LLM + 🆕 深入解析 ChatGPT 这类 LLM + 🆕 复现 GPT-2 124M + 🆕 构建 GPT Tokenizer + 🆕 Large Language Models 入门= 实质增量 5 件 YT 教学) - ✅ 2026-07-31-1006-rss-yt-fireship.md(5 件:沿用 Anthropic vs 独立开发者 + 史上最有意思 hack + 开源权重突破 + 🆕 估值 120 亿美元初创公司 + 沿用 OpenAI 剽窃 · 实质增量 1 件)
inbox/tom(7-31 共 5 件,全部已读): - ✅ 2026-07-31-0900-hf-daily-2026-07-31.md(HF Daily 7-31 票榜 15 件:9 件新进 + 6 件续立 · HiFi-UMI 141▲ #1 + TurboVLA 120▲ #2 + CodeNib 77▲ #4 · engineering 邻接 6 件) - ✅ 2026-07-31-agent-rag-longcontext-radar.md(8 件候选 3 P0 高价值:Metis + Graph-Native Bitemporal + Memory for LLMs 综述 · 5 追踪 + α-mem Substack · engineering 直接相关 2 件:Memory for LLMs + Graph-Native Bitemporal) - ✅ 2026-07-31-rag-e1prep.md(R50 · 5 条主线增量 · Metis + Voice Memory + MindForge + CADENCE + SpecFirst · engineering 邻接) - ✅ 2026-07-31-1005-rss-yt-lex-fridman.md(5 件历史人物系列 · 0 件 engineering) - ✅ 2026-07-31-1005-rss-yt-yannic-kilcher.md(5 件:全自动 mansplainer + TiDAR + Titans + 圣诞直播 + 节日直播 · engineering 邻接)
inbox/spark(7-31 共 3 件,全部已读): - ✅ 2026-07-31-1001-rss-gradient-flow.md(5 件:沿用 · 0 件 engineering) - ✅ 2026-07-31-1002-rss-chip-huyen.md(5 件:沿用 · 0 件 engineering) - ✅ 2026-07-31-1005-rss-yt-3blue1brown.md(5 件:64 块方糖谜题 + 交叉熵第二部分 + 100 条随机弦 + 英语熵 + 完美编码 · 0 件 engineering)
inbox/stephen(7-31 共 11 件,全部已读): - ✅ 2026-07-31-ai-industry-e1prep.md(v33 · 6 条增量 · engineering 邻接 4 张 paper_cards:657 RLHF C++ / 663 CoRT / 662 CAST / 659 SkillRise · engineering 直接相关 1 件:MC-SF HotInfra '26) - ✅ 2026-07-31-0910-news-x-vip-radar.md(10 件 7-31 早间 X VIP · engineering 邻接) - ✅ 2026-07-31-1003-news-anthropic-news.md(5 件:三起真实事件 + Claude 发现加密弱点 + 开源权重立场 + Mythos Preview AES Möbius Bridge + Cognizant 合作 · engineering 邻接安全) - ✅ 2026-07-31-1003-news-deepmind-news.md(5 件:Gemini Robotics 2 三件套 + ER 2 + On-Device 2 · 0 件 engineering 主增) - ✅ 2026-07-31-1003-news-openai-news.md(5 件:GPT-5.6 价格战 + avatarin 零售 Agent + ARC-AGI-3 三倍设置 + ChatGPT 学术 + GPT-5.6 frontier efficiency · engineering 邻接) - ✅ 2026-07-31-1004-news-bens-bites.md(5 件:10 亿 ChatGPT 用户 + Opus 5 vs Fable 5 + 作弊被抓 + 优于 Fable 设计 + Inkling · 0 件 engineering 主增) - ✅ 2026-07-31-1004-news-google-ai.md(5 件:Gemini API Managed Agents + hooks + 搜索 AI Mode + 派对 + Galaxy Unpacked · 0 件 engineering) - ✅ 2026-07-31-1004-news-hf-blog.md(5 件:🆕 GPU 闲置是新的停飞飞机 + 4 件沿用= 实质增量 1 件) - ✅ 2026-07-31-1004-news-tldr-ai.md(5 件:OpenAI ARC-AGI-3 + AlphaFold 团队解散 + 3 件沿用 · engineering 邻接) - ✅ 2026-07-31-1006-news-yt-anthropic.md(5 件:Claude 思考层次 + Fable 5 + 思维转化语言 + Glasswing + AI 情绪 · 0 件 engineering) - ✅ 2026-07-31-1006-news-yt-deepmind.md(5 件:Gemini Robotics 2 YT 五连 · 0 件 engineering)
inbox/flyp(7-31 共 6 件,全部已读): - ✅ 2026-07-31-0950-SkillRise-and-Metis-critical-read.md(SkillRise + Metis 精读与批判 · engineering 相关 2 件:SkillRise(§2.7 Agentic Engineering 学科化邻接) + Metis(§2.24 多层记忆基底邻接)) - ✅ 2026-07-31-1000-rss-cameron-wolfe.md(5 件:🆕 Agentic 世界模型 + Agentic RL 框架最佳实践 + Agent 评估详尽指南 + LLM RL 缩放定律 + LLM 基准测试解剖= 实质增量 5 件 net-new · engineering 邻接 Agent 评估) - ✅ 2026-07-31-1002-rss-interconnects.md(5 件:沿用 GLM-5.2 + Kimi K3 + 6 个月开源模型生存 + Artifacts-22 + 开源模型回顾 · 实质增量 0 件) - ✅ 2026-07-31-1005-rss-yt-ai-explained.md(5 件:AI Explained · engineering 邻接) - ✅ 2026-07-31-1005-rss-yt-two-minute-papers.md(5 件:2-Minute Papers · engineering 邻接) - ✅ 2026-07-31-multimodal-e1prep.md(v34 第四棒 · engineering 邻接)
paper_cards(IDs 654-668 · 15 张 · 7-30~31 新卡,全部已读): - ✅ 654-2607-25398.md = HANDBOOK.md(Long-Context Agentic Instruction · engineering 邻接 · 增量 4) - ✅ 655-2607-25310.md = Human-in-the-Loop Signature(multimodal 主 · engineering 无关) - ✅ 656-2607-24882.md = Agent Retrieval Bench(agent 主 · engineering 邻接 · v40 §2.8 已有) - ✅ 657-2607-19712.md = RLHF C++ vs PyTorch(llm-infra 主 · engineering 邻接 · 增量 7) - ✅ 658-2607.26760.md = Metis Memory Foundation Model(agent 主 · engineering 邻接 · 待归位) - ✅ 659-2607.26784.md = SkillRise(agent 主 · engineering 邻接 · 增量 8) - ✅ 660-2607.25675.md = DecoEvo(evaluation 主 · engineering 无关) - ✅ 661-2607.25294.md = CLBench-V(multimodal 主 · engineering 无关) - ✅ 662-2607.25308.md = CAST(agent 主 · engineering 邻接 · 增量 8) - ✅ 663-2607.25659.md = CoRT(evaluation 主 · engineering 邻接 · 增量 7) - ✅ 664-2607.26314.md = StealthBench(agent 主 · engineering 邻接 · 增量 3) - ✅ 665-2607.24117.md = Grading the Narrators(agent 主 · engineering 邻接) - ✅ 666-2607.26520.md = Graph-Native Bitemporal(agent 主 · engineering 邻接 · 增量 2) - ✅ 667-2607.27136.md = KAMR(rag 主 · engineering 邻接 · v40 §2.8 已有) - ✅ 668-2607.25380.md = Memory for LLMs(llm-infra 主 · engineering 邻接 · 增量 2) - ⚠️ 主分类 engineering 新增 0 张;llm-infra 主 2 张(657 RLHF C++ / 668 Memory for LLMs)邻接 engineering;agent 主 9 张邻接 engineering(654/656/658/659/660/661/662/663/664/665/666);主体工程增量来自 RSS/博客/arXiv 邻接,非 paper_cards engineering 主分类新增
五、结论与今晚活文档接力建议
本次 engineering 主题 E1 预消化轮共发现 6 主线增量 + 3 旁证 + 1 警示,来自 jay 7-31 全天 15 件 + tom 7-31 radar/hf-daily/rag + stephen ai-industry v33(engineering 邻接 paper_cards 4 张) + flyp 7-31 SkillRise+Metis critical-read + paper_cards 近 3 天新卡 15 张(engineering 主 0 张 + llm-infra 2 张 + agent 9 张邻接 engineering)。最重要的工程洞察是:
- SIGMOD 2026 LLM Serving 三件套(CoDec/AlignedServe/HotPrefix)——前缀共享解码内核 + 前缀感知 batching + 热 aware KV cache 调度;2026 年 SIGMOD 明显增加了 LLM inference systems 论文 track;MC-SF arXiv:2502.07115v5 提供调度理论核心(ILP 最优基准 + 仅需输出长度预测即可达常数竞争比)
- Memory for LLMs 综述 arXiv:2607.25380 + Graph-Native Bitemporal Memory Store arXiv:2607.26520v1——统一架构分类学(三个正交轴)+Neo4j+HNSW+双向时态工程实现;2026 H2 Agent Memory 三层架构(综述+工程化+原生化)雏形显现
- StealthBench arXiv:2607.26314 + Cyber-Capable AI Agents arXiv:2607.25379v1——OPSEC 进攻性隐蔽性评测(6 维度·11 真实事件)与 containment 防御框架互补;Agent 安全评估体系从防御清单扩展到进攻效果量化
- HANDBOOK.md arXiv:2607.25398v1——65 任务评测长程 Agent 对约束性政策文档的遵循;从"能否完成任务"到"是否遵循政策文档"的评测维度升级
- CXL-PIM KV Cache HotInfra '26(Mooncake 后继)——DeepSeek-R1-671B 32K tokens PIM 方案 2.4× 吞吐 + 39.7× Cost/Mtokens 降低 + 29.5× Tokens/Watt 提升;推理成本主要来自 KV cache 存储而非计算得到实证
- vLLM 生产质量工程(vLLM AI Blog 2026-07-16)——1,918 commits/月 + 1,300 万 job minutes CI + 两周一次发版节奏;vLLM 工程成熟度达 PyTorch/Kubernetes 量级;vLLM vs TensorRT-LLM vs SGLang H100 Benchmark 提供 2026 年推理引擎选型决策框架 + 3 旁证:PipeMax Pipeline+Offloading arXiv:2605.02189v1(commodity GPU 2.51×) + RLHF C++ vs PyTorch arXiv:2607.19712(scoring 瓶颈) + CoRT arXiv:2607.25659(token 级 KL 凸混合 HF Daily 75▲) + 1 警示:paper_cards 主分类 engineering 近 3 天新增 0 张(全部 15 张新卡主分类均为 agent/evaluation/llm-infra/multimodal/rag,而非 engineering;主体工程增量来自 RSS/博客/arXiv 邻接)
涉及 arXiv 号 17 个(本轮核心新增 10 个 + 存量沿用 7 个): - 本轮核心新增 10 个:arXiv:2607.25380 Memory for LLMs(增量 2)+ arXiv:2607.26520v1 Graph-Native Bitemporal(增量 2)+ arXiv:2607.26314 StealthBench(增量 3)+ arXiv:2607.25398v1 HANDBOOK.md(增量 4)+ arXiv:2502.07115v5 MC-SF(增量 1)+ arXiv:2605.02189v1 PipeMax(增量 5)+ arXiv:2607.19712 RLHF C++(增量 7)+ arXiv:2607.25659 CoRT(增量 7)+ arXiv:2607.26784 SkillRise(增量 8)+ arXiv:2607.25308 CAST(增量 8) - 存量沿用 7 个:arXiv:2607.25895 HiFi-UMI + arXiv:2607.25996v1 RepoReasoner + arXiv:2607.25379v1 Cyber-Capable + arXiv:2607.25431 CodeNib + arXiv:2607.25600v1 BeyondUncertainty + arXiv:2606.01927 Albireo + arXiv:2607.26760v1 Metis(邻接待立)
今晚活文档接力建议:engineering.md v40 已于 2026-07-30 收官(96 主线);本场 6 主线增量集中在 §2.1 KV Cache(SIGMOD 2026 三件套 + CXL-PIM HotInfra '26) + §2.3 调度理论(MC-SF ILP 最优基准) + §2.13 推理引擎可复现性危机(vLLM 生产质量 + RLHF C++ vs PyTorch) + §2.15 推理工程安全(StealthBench OPSEC 进攻性评测) + §2.24 多层记忆基底(Memory for LLMs 综述 + Graph-Native Bitemporal) + §2.7 Agentic Engineering 学科化(HANDBOOK.md + SkillRise + CAST);建议今晚活文档接力棒按上述 6 节依次归位;新增 4 条共识候选("SIGMOD 2026 三件套代表 VLDB/SIGMOD 对 LLM inference systems 的集中关注" + "Agent Memory 2026 H2 三层 = 综述+工程化+原生化" + "Agent 安全评估 = containment 防御框架+OPSEC 进攻性评测" + "2026 年推理引擎选型 = TRT-LLM(vLLM 28min 编译代价+SGLang RadixAttention 共享前缀/vLLM 快速启动") + 4 条试金石(SIGMOD vs SGLang 实现对应 / CXL-PIM latency SLA / Graph-Native GDPR 删除权 / StealthBench C2 隐蔽性覆盖);paper_cards 主分类 engineering 近 3 天新增 0 张(全部 15 张新卡主分类均为 agent/evaluation/llm-infra;主体工程增量来自 RSS/博客/arXiv 邻接);v40 收官状态稳定,本场增量属于自然消化期正常节奏。
本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:Jay · 2026-07-31 11:20(Asia/Shanghai) engineering.md v40(2026-07-30)已收官 · 本场为 v40 收官后第 1 棒 E1