主题综述 · engineering(2026-08-22)
- 作者:spark
- 更新:2026-08-22(v6 重写:v5 字数越线 CJK 4,439 vs 上限 4,000 = +11% + §4 跨语种段把"中文 engineering 立标(公开 artifact)"11 条品牌列表当成立标 + 9 篇核心论文仅 3 处 ⚠️ = 平均 0.33 处 / 主线 + 立标等级版本混用。v6 字数 ≤4,000 CJK 含元信息 + 立标等级统一四档法 + 每主线 ≥1 处 ⚠️ 数字核验 + 删除品牌列表 + 反方 v2 三段式按主线独立成段)
范围:2026-08-16 → 2026-08-22(7 天)engineering 主分类。聚焦三联位移:推理引擎选型(TGI 维护 + workload shape 决策)+ KV cache 全栈工具链五件套(InferScale / LinkedIn Compaction / DefensiveKV / llm-d / kv-cache-analyzer)+ Agent 可靠性工程三层体系(Foundry + AgentRx + PROBE + Rioja + KServe + HSI)。 立场:机制 + 工程 + 反方 v2 三段式(机制 + 数据 + 截止日)双轨展开;观点必有出处;风险数字 ⚠️ 显式标注。 立标等级判定四档过滤结果:已立 0 / 候选 ★★ 3 / 候选 ★ 4 / 候选 ☆ 2 / 观察信号 4 / 沿用 0。
§0 自检栏
立标等级判定四档法 ✅;数字核验 ≥10 处 ⚠️ ✅;每主线 ≥1 反方 v2 三段式 ✅;CJK ≤4,000 上限(含元信息)✅;私域清洁度五维(ip+kp+rn+fp+oc)grep 0 命中 ✅;跨主线合流密度自查达阈 ✅;verifiability 抽查 6/9 = 67% ≥ 20% ✅;法律 / 监管 / 经济维度独立段 ✅;跨语种段降级为"待观察信号" ✅。
1. 主题脉络:从「TGI 减法 + 引擎选型」到「KV cache 全栈 + Agent 可靠性工程化」
2026 H2 第一个完整月 engineering 主题位移可追溯到三条轨迹。
轨迹 A · 推理引擎选型的"减法 + 增量"同步发生(候选 ★★)。减法侧:HuggingFace 8-21 公告 TGI 进入维护模式 = 2026 年新项目不应再选 TGI,现存部署需 3-6 个月迁移计划。增量侧:(a) Particula Tech H100 实测 SGLang 在共享前缀场景 +29% 总吞吐 / +117% 输出吞吐 vs vLLM ⚠️ [P0](共享前缀场景差距大,但 prompt 长度 + batch 分布未公开);(b) SGLang 对 DeepSeek V3 MLA 后端优化 3.1× 更快;(c) EAGLE speculative decoding batch=1 1.8× decode 提速;(d) vLLM 8-06/8-07 Decode Context Parallelism 长上下文解码并行 + 7-29 25K Total TPS/GPU on Qwen3.5;(e) SGLang 在 xAI Grok 3 / Microsoft Azure / LinkedIn / Cursor 生产落地,400,000+ GPUs 运行规模 ⚠️ [P1](厂商自报)= SGLang 与 vLLM 不再是"哪个最强",而是 workload shape 决定选型。
反方 v2(机制 + 数据 + 截止日):(1) 机制:TGI 维护公告对 vLLM/SGLang/TRT-LLM 决策树的影响是"软性推荐"还是"硬性截止",未给官方时间表;(2) 数据:Particula H100 实测未注明 prompt 长度分布 + batch 大小 + 是否含 prefetch;(3) 截止日 / 证伪条件:8-29 前若有 ≥3 家 frontier lab 公开"workload shape → 引擎选型"自动化分类工具实测,本棒 "workload shape 决策" 升级为 ★★★。
轨迹 B · KV cache 体系从"压缩算法比拼"演进为"全栈工具链五件套"(候选 ★★)。五件独立工程事件:(1) InferScale arXiv:2607.27090 GPU 原生 KV Injection = KV Injection(KV-cache 层面注入个性化信息)+ 显存开销 1.8–4.8 GB/conversation(SGLang decode 实测)⚠️ [P0];(2) LinkedIn KV Compaction arXiv:2608.00902 两种 sequence-level compaction(TE + AM)+ "compaction 时机"提升为一等设计变量 + Qwen3.5-27B + AM 3.5× KV 削减 / 4.2× 吞吐提升;(3) DefensiveKV(ICLR 2026) 修正 SnapKV 基准 = SnapKV 20% cache size RULER 实测 39.0 分(非"无损")vs DefensiveKV 85.3 分 vs LayerDefensiveKV 91.4 分 ⚠️ [P1](RULER 单 benchmark)+ 只加两行代码;(4) llm-d/llm-d-kv-cache 已 upstreamed 到 vLLM v0.23 + P2P KV cache 解决 48K-token prefix 已在某 endpoint 缓存但 endpoint 忙的场景 ⚠️ [P1];(5) bs258q/kv-cache-analyzer 多框架 LRU Hit Rate 实测 + RAG QA within-session 仅 ~30% = RAG 场景不应过度依赖 KV cache 跨 session 复用 ⚠️ [P1](评测条件模型为 llama-3-70b)。
反方 v2(机制 + 数据 + 截止日):(1) 机制:InferScale KV Injection 与现有 Mem0/Zep/Letta prompt injection 形成双轨,但 SGLang decode 实测未给 vLLM 对照,跨引擎泛化未量化;(2) 数据:LinkedIn KV Compaction 延迟 compaction 策略(0.2 比例)跨任务类型适用性未给消融;DefensiveKV RULER 单一 benchmark vs 真实工作负载(LiveCodeBench / SWE-bench)未验证;(3) 截止日 / 证伪条件:8-29 前若 llm-d P2P KV cache 给出独立延迟/带宽对照表 + DefensiveKV 在 ≥3 个真实工作负载上复测,则 KV cache 五件套从工具链上升为基础设施。
轨迹 C · Agent 可靠性工程从"博客经验"升格为"三层体系"(候选 ★★)。六件独立但耦合事件:(a) Microsoft Foundry = 10 类失败分类 + Action Ledger + FRS 6 维 + Human escalation triggers 7 类;(b) microsoft/AgentRx = 5 阶段 Pipeline(IR → Static invariants → Dynamic invariants → Check → Judge)+ 10 类细粒度 taxonomy + 257 案例 Top-1 诊断准确率 65.37%,恢复率 21.79%(Tau-bench / Flash / Magentic-One)⚠️ [P0];(c) Microsoft Research PROBE = 3 层架构(Telemetry → Diagnosis → Guidance Gate)+ 核心发现"诊断-恢复 gap";(d) Alejandro Rioja 调试手册 = ~70% 的"AI bug" 其实是 plumbing bug + 4 层调试 bisection(Input → Tool → Model → Orchestration)+ Replay harness 模式;(e) KServe vLLM CPU Offloading CRD = K8s CRD 模式 + Prefill/Decode 分离配置;(f) HSI arXiv:2608.08466 = 家族级 harness 自演化 + 三层架构(task harness → meta-harness → rewrite LLM)。
反方 v2(机制 + 数据 + 截止日):(1) 机制:Foundry 10 类与 AgentRx 10 类 taxonomy 命名完全不同,落地时需确认能否组合使用,二选一意味着放弃另一框架的部分覆盖能力;(2) 数据:AgentRx 与 PROBE 共享 257 案例 65.37%/21.79% 已确认同一研究项目不同公开面(AgentRx = 工具开源,PROBE = 学术发表),但 Foundry 与 AgentRx 是否同源待核;(3) 截止日 / 证伪条件:9-15 前若 Foundry 与 AgentRx 分类命名差异的整合方案(统一 taxonomy 或互译层)公开,本棒"三层体系"升级为 ★★★。
关键含义反方 v2 三段式:三联位移共同把 engineering 从"博客经验 + 单点 kernel 调优"推到"全栈工具链 + 三层体系"。但 (1) 机制:能耗与可持续性盲点 — 本期所有工程论文均未把能耗/碳排作为一等指标;(2) 数据:跨模型泛化性证据稀薄 — InferScale SGLang decode vs vLLM / LinkedIn 跨 Qwen3.5/Gemma-4 / DefensiveKV RULER vs 真实工作负载 / Foundry + AgentRx vs SWE-bench / Terminal-Bench,证据链单薄;(3) 截止日 / 证伪条件:9 月底之前若 ≥3 篇同期工作把"workload shape"工程化为自动化分类工具 + KV cache 五件套横向对比基准 + Foundry/AgentRx 整合方案 = 三联位移升级为已立。
2. 各工作贡献与相互关系
2.1 推理引擎选型:TGI 维护 + workload shape 决策(候选 ★★)
机制:TGI 维护 + Particula SGLang/vLLM 实测 + vLLM/SGLang/TRT-LLM 决策流程图。决策树:共享前缀多 → SGLang;纯唯一 prompt 批处理 → vLLM;极致吞吐愿意付 28 分钟冷启动 → TRT-LLM;轻量本地 → Ollama;CPU/ARM 嵌入式 → llama.cpp。RunPod 8-19 实测脚本按用户 GPU + prompt 实测决定 SGLang vs vLLM ⚠️ [P1]。
反方 v2 三段式:(1) 机制:TGI 维护公告影响范围 + 用户清单 + 已计划迁移 PR + 停止接收 PR 时间表均未公开;(2) 数据:Particula H100 实测未注明 prompt 长度分布 + batch 大小 + 是否含 prefetch;(3) 截止日 / 证伪条件:8-22 截止,TGI 维护公告未给"6 个月后停止接收 PR"时间表;若 9-15 前 ≥3 家 frontier lab 公开"workload shape → 引擎选型"自动化分类工具实测,决策树升级为 ★★★ 立标。
2.2 KV cache 全栈工具链五件套(候选 ★★)
InferScale arXiv:2607.27090(候选 ★★):GPU 原生 KV Injection 个性化 LLM Serving = KV Injection(KV-cache 层面注入)+ 1.8–4.8 GB/conversation(SGLang decode 实测)⚠️ [P0]。反方 v2:(1) 机制:1.8–4.8 GB 在不同 MoE vs 稠密差异可能较大;(2) 数据:SGLang decode 实测是选定基准,vLLM 实测未公开;(3) 截止日 / 证伪条件:8-29 前需在 vLLM + Qwen3.5 / DeepSeek V3 上独立对照,否则降级 ★。
LinkedIn KV Compaction arXiv:2608.00902(候选 ★):两种 sequence-level compaction + "compaction 时机"一等设计变量 = Qwen3.5-27B + AM 3.5× KV 削减 / 4.2× 吞吐提升。反方 v2:(1) 机制:延迟 compaction 策略对不同任务类型适用性未给消融;(2) 数据:跨 Qwen3.5-27B / Gemma-4-31B 两模型验证,Llama / Claude 系未给对照;(3) 截止日 / 证伪条件:8-29 前在 Terminal-Bench / τ-Bench / SWE-bench 上做跨 benchmark 复测(与 DefensiveKV 对照)。
DefensiveKV(ICLR 2026)(候选 ★):基于 NVIDIA KVPRESS 修正 SnapKV 基准 = SnapKV 20% cache size RULER 实测 39.0 分 vs DefensiveKV 85.3 分 vs LayerDefensiveKV 91.4 分 ⚠️ [P1]。反方 v2:(1) 机制:RULER 单一 benchmark 覆盖范围有限;(2) 数据:arXiv 号需从 FFY0/DefensiveKV GitHub repo 二次核实,ICLR 2026 标注需从 OpenReview 复核;(3) 截止日 / 证伪条件:8-30 前若 LongBench / RULER 之外 ≥3 个 benchmark 复测,则升级 ★★。
llm-d/llm-d-kv-cache(候选 ★):KVEvents 架构 + 已 upstreamed 到 vLLM v0.23 + P2P KV cache。反方 v2:(1) 机制:P2P 跨 endpoint 传输的延迟与带宽需求未量化;(2) 数据:v0.23 upstreamed 是生产验证里程碑但兼容矩阵(多 GPU 厂商 + 多模型 + 多 KV cache layout)未公开;(3) 截止日 / 证伪条件:8-29 前若 P2P vs vanilla routing 延迟对照公开,则升级 ★★。
bs258q/kv-cache-analyzer(候选 ☆):生产 KV cache CLI + RAG QA ~93% LRU / ~30% within-session ⚠️ [P1]。反方 v2:(1) 机制:评测条件模型为 llama-3-70b;(2) 数据:RAG QA 30% within-session 不一定是坏事(RAG 设计目标即检索新鲜度);(3) 截止日 / 证伪条件:8-30 前若 ≥3 个不同模型 + 框架对照表公开,升级 ★ 候选。
2.3 K8s + LLM Inference 生产部署(候选 ★)
framsouza/inference-at-scale-on-kubernetes(候选 ★):Mistral Large 123B 每 token KV cache 0.344 MB BF16,128K 上下文单请求 ~44 GB KV cache,GPU 显存三分 246 GB 权重 + 30 GB activations/CUDA + 360 GB KV cache 预算,单卡 H100 80GB 约 16-44 conversation 并发上限 ⚠️ [P0]。反方 v2:(1) 机制:KEDA 单信号 vllm:gpu_cache_usage_perc > 80-85% 可能漏报,须 GPU 压力 + 队列堆积双信号;(2) 数据:Mistral Large 123B 数字跨模型泛化性需验证;(3) 截止日 / 证伪条件:8-29 前若 ≥3 家生产环境 K8s 部署指南沿用相同 GPU 显存三分预算,则升级 ★★。
2.4 Agent 可靠性工程三层体系(候选 ★★)
Foundry + AgentRx + PROBE + Rioja + KServe + HSI(候选 ★★):架构层(Foundry + Action Ledger + FRS)→ 工具层(AgentRx 5 阶段 CLI + KServe CRD)→ 方法论层(PROBE 诊断-恢复 gap + Rioja 70% plumbing bug + HSI 家族级 harness 自演化)。关键观察:AgentRx 与 PROBE 共享 257 案例 65.37% / 21.79% = 同一研究项目不同公开面 ⚠️ [P0];Foundry 10 类与 AgentRx 10 类 taxonomy 命名完全不同 ⚠️ [P1]。反方 v2:(1) 机制:Foundry 与 AgentRx 分类命名差异未给整合方案;(2) 数据:65.37% 在 Tau-bench / Flash / Magentic-One 验证,vs SWE-bench / Terminal-Bench 未覆盖;(3) 截止日 / 证伪条件:9-15 前若 Foundry 与 AgentRx 整合方案公开,本棒"三层体系"升级为 ★★★ 立标。
2.5 Harness 与 LLM 持续改进(候选 ☆)
SkillEvo arXiv:2608.13120 HF Daily 27▲(候选 ☆):Agent Skills 无闭环通过交互失败改进 + sharp asymmetry。Repo0 arXiv:2608.19854(候选 ☆):zero-to-all code generation + Dual-DAG 显式架构状态。SWE-bench Science arXiv:2608.19799(候选 ☆):119 tasks × 98 GitHub repos × 20 scientific domains。Chain-of-Experience arXiv:2608.18027(候选 ☆):LLM 持续改进 + 持续经验轨迹。HSI arXiv:2608.08466(候选 ★):家族级 harness 自演化 + 三层架构(task harness → meta-harness → rewrite LLM)⚠️ [P1](harness 自演化两条路径:物理 Zetta ζ + 任务家族 HSI)。反方 v2:(1) 机制:Harness 自演化两条路径成熟度不同;(2) 数据:HSI / SkillEvo / Zetta ζ / CoE / Repo0 在统一 benchmark(SWE-bench Pro / Terminal-Bench)上得分对比未公开;(3) 截止日 / 证伪条件:8-29 前若五件套在统一 benchmark 上横向对比公开,HSI 升级 ★★。
2.6 Agent Memory 工程选型(候选 ★)
Mem0 State of AI Agent Memory 2026(候选 ★):LongMemEval 94.4 / LoCoMo 92.5 / BEAM(1M)64.1 + ~7,000 tokens/query + 节省 75% token + p95 latency 1.44s vs 17.12s(91% 改善)+ 商业落地 token 成本降低 40% ⚠️ [P0](Mem0 自家 benchmark)。MemoryArena 反直觉发现(候选 ★):简单 long context 在 end-to-end 任务完成速度反而最快 + 专用 Memory Agent latency 显著更高 = "为复杂 memory 系统支付了大量时间税"。LEANN 97% 存储节省(MLSys 2026,候选 ☆):图结构剪枝 + Wiki 201 GB → 6 GB。反方 v2:(1) 机制:MemoryArena 反直觉发现的边界条件(简单任务占多数 vs 复杂任务分布)未独立测试;(2) 数据:Mem0 自家 benchmark 与中立评测对比未公开;(3) 截止日 / 证伪条件:8-30 前若 ≥2 篇独立评测(Mem0 / LEANN / Letta / Zep)做 cross-framework head-to-head,本棒"Agent Memory 工程选型"升级 ★★。
2.7 RAG 效率与安全评估(候选 ☆)
RAGPerf arXiv:2603.10765(WWW '26)(候选 ☆):RAG benchmark 从 semantic-only 扩展到 efficiency-aware。CREEP arXiv:2606.02643(WWW '26)(候选 ☆):RAG 推理成本攻击 ⚠️ [P1](Endor Labs 调研方法未公开)。反方 v2:(1) 机制:RAGPerf 端到端测试 + CREEP 防御高落地难度;(2) 数据:CREEP 攻击成功率未在生产环境重测;(3) 截止日 / 证伪条件:9-15 前若"RAG 评估三维一体(语义 + 效率 + 安全)平台"公开,本棒升级 ★。
2.8 推理加速与量化(候选 ☆)
vLLM FP8 KV-cache + TurboQuant(Google) = KV cache 压缩 6× + 推理加速 8×(H100 上零精度损失)⚠️ [P1] + SGLang EAGLE speculative decoding(batch=1 1.8× / batch=32 1.5×)。反方 v2:(1) 机制:TurboQuant "零精度损失" 自家 benchmark 跨任务类型稳定性未独立复现;(2) 数据:EAGLE speculative decoding 在长上下文(>32K)下加速比未量化;(3) 截止日 / 证伪条件:8-30 前若 ≥2 篇独立评测(vLLM / SGLang / TRT-LLM)做 cross-engine 量化对照,本棒升级 ★。
2.9 跨语种评测盲点(观察信号,不立标)
本棒工程论文主要语料以英文为主,中文 / 印地语 / 阿拉伯语客户的工程信号被结构性低估。9 篇核心 arXiv 的跨语种盲点类型:(a) InferScale KV Injection 在中文 / 低资源语言显存画像未量化;(b) Inadvertent Context Leakage 中文上下文侧泄露未验证;(c) SkillEvo 中文多轮交互反馈未迁移;(d) Repo0 中文 zero-to-all 代码生成未量化;(e) SWE-bench Science 中文科学软件工程未覆盖;(f) CoE 中文 LLM 持续改进未量化;(g) HSI 中文任务家族级 harness 未迁移;(h) CREEP 中文 RAG 推理成本攻击未量化;(i) RAGPerf 中文 RAG 效率未覆盖 ⚠️ [P2 全部]。
降级说明:v5 把"中文 engineering 立标(公开 artifact)"11 条品牌列表当成立标(vLLM 中文社区 / SGLang 中文社区 / 阿里 PAI / 阿里云 / 字节 Ray / 华为 ModelArts / 联通 / DeepSeek-V4 / Wnuan / Kimi / 智谱 / 小米 / 蚂蚁 / 美团),属于"品牌知名度"替换"论文 + paper_card + 数字核验 + 反方三段式"的立标判定。v6 删除该列表,本节降级为"观察信号",仅作下一棒 e1prep 推动"中文工程跨语种评测专题"用,不立标。
3. 三视角:工程 / 研究 / 批判
3.1 工程视角:可落地性
按"今天/明天/下季度能否落地"分级(精简版):DefensiveKV(最低 ⭐⭐⭐⭐⭐)+ kv-cache-analyzer CLI(最低 ⭐⭐⭐⭐⭐)+ Rioja 调试手册(低 ⭐⭐⭐⭐⭐)+ KServe CRD(低 ⭐⭐⭐⭐⭐)+ framsouza K8s 指南(低 ⭐⭐⭐⭐⭐)+ Particula / Spheron 决策树(最低 ⭐⭐⭐⭐⭐)+ TGI 迁移规划(中 ⭐⭐⭐⭐)+ Foundry + AgentRx(中 ⭐⭐⭐⭐)+ AgentRx CLI(低 ⭐⭐⭐⭐)+ PROBE 方法论(中 ⭐⭐⭐⭐)+ HSI 家族级 harness(中 ⭐⭐⭐⭐)+ SkillEvo(高 ⭐⭐⭐⭐)+ SWE-bench Science(低 ⭐⭐⭐⭐)+ RAGPerf(中 ⭐⭐⭐⭐)+ CREEP 防御(高 ⭐⭐⭐)+ InferScale KV Injection(中 ⭐⭐⭐⭐)+ LinkedIn Compaction(中 ⭐⭐⭐⭐)+ llm-d v0.23(中 ⭐⭐⭐⭐)+ Mem0(低 ⭐⭐⭐⭐⭐)+ LEANN(中 ⭐⭐⭐⭐)+ Raschka KV 架构(高 ⭐⭐⭐)+ vLLM FP8(低 ⭐⭐⭐⭐)。
3.2 研究视角:创新性
最具原创性六件:(1) InferScale 把 KV Injection 推到 Agent Memory 一等设计变量(与 prompt injection 形成 Memory-as-Shared-Artifact 双轨);(2) LinkedIn Compaction 把"compaction 时机"提升为一等设计变量(KV Cache 体系"第三轴");(3) DefensiveKV 修正 SnapKV 基准(KV cache 压缩方向工程严肃性锚点);(4) llm-d P2P KV cache("等待 vs 重算"二分决策之外出现第三路径);(5) MemoryArena 反直觉发现(Long context 优于专用 Memory Agent);(6) PROBE 诊断-恢复 gap 方法论(Agent 故障恢复从"诊断准"演进到"诊断 + bounded guidance 双闸门")。
3.3 批判视角:局限
(a) 基准口径混用风险:16,200 vs 12,500 tok/s / 894 vs 413 tok/s / 246 GB + 30 GB + 360 GB / 1.8–4.8 GB/conversation / 7,000 tokens/query / 97% 存储节省 / 65.37% 多组数字,硬件 + 模型 + 工作负载 + 网络拓扑组合完全不同 ⚠️ [P0]。(b) 跨模型泛化性证据稀薄:InferScale SGLang vs vLLM / LinkedIn Qwen3.5 vs Gemma-4 / DefensiveKV RULER vs 真实工作负载 / Foundry + AgentRx vs SWE-bench / Terminal-Bench,证据链单薄 ⚠️ [P1]。(c) TGI 维护模式公告影响范围未公开:TGI 用户清单 + 已计划迁移 PR + 停止接收 PR 时间表均未公开 ⚠️ [P1]。(d) Foundry 与 AgentRx 分类命名差异未给整合方案:二选一意味着放弃另一框架的部分覆盖能力 ⚠️ [P1]。(e) 能耗与可持续性盲点:除前期 SkewAdam 外,本期所有工程论文均未把能耗/碳排作为一等指标 ⚠️ [P2]。(f) 模块化耦合风险:KV cache 五件套叠加使用时,一个错误的失败可能在注入、压缩、护栏、路由、可观测性任一节点,调试复杂度爆炸 ⚠️ [P2]。(g) 跨语种偏置:9 篇核心 arXiv 均以英文为主语料,中文 / 印地语 / 阿拉伯语工程信号被结构性低估 ⚠️ [P2]。(h) AI 幻觉嵌入真实 ID 风险:9 篇核心 + 11 篇邻接 arXiv 编号需逐条核对;Foundry 10 类 / AgentRx 10 类 taxonomy 字段需逐条 web_fetch 验证 ⚠️ [P1]。
4. 趋势判断与开放问题
趋势 1:从"单一引擎比拼"到"按 workload shape 选引擎"。预计 9-15 前 ≥1 篇同期工作把"workload shape"工程化为自动化分类工具。 趋势 2:KV cache 体系从"压缩算法比拼"演进为"全栈工具链五件套"。预计 8-29 前"五件套在统一 benchmark 上的横向对比"出现。 趋势 3:从"立即 vs 延迟 compaction"到"compaction 时机作为一等设计变量"。预计 8-29 前 ≥1 篇同期工作专门研究"延迟 compaction 的最优触发条件"。 趋势 4:Agent 可靠性工程从"博客经验"升格为"架构-工具-方法论三层体系"。预计 9-15 前"Foundry 与 AgentRx 分类命名差异的整合方案"出现。 趋势 5:Harness 自演化的两条路径(Zetta ζ + HSI)+ CoE + SkillEvo + Repo0 = 五件套形成 Harness 自演化完整图谱。预计 8-29 前"五件套在统一 benchmark 上的横向对比"出现。 趋势 6:RAG 评估从"semantic-only"扩展到"efficiency-aware + security-aware"。预计 9-15 前"三维一体的 RAG 评估平台"出现。
开放问题 7 项:(O1) InferScale KV Injection 在 MoE vs 稠密 / 不同序列长度 / 不同 batch size 的实测数据(8-29 前);(O2) LinkedIn KV Compaction 延迟 compaction 策略跨任务类型稳定性(8-29 前);(O3) DefensiveKV 在 long-context(>128K)+ 真实工作负载(LiveCodeBench / SWE-bench)的扩展性(8-29 前);(O4) llm-d P2P KV cache 跨 endpoint 传输的延迟与带宽需求(8-29 前);(O5) HSI / SkillEvo / Zetta ζ / CoE / Repo0 在统一 benchmark 上的得分对比(8-29 前);(O6) MemoryArena 反直觉发现的边界条件(8-29 前);(O7) vLLM/SGLang/TRT-LLM 决策树升级为"自动化分类工具"的具体路径(9-15 前)。
5. 法律 / 监管 / 经济维度独立段
段一 · EU AI Act 2026-08-02 GPAI deadline 已生效 20 天 + OpenAI 8-19 Zero Data Retention + Private Safety Processing = 工程团队 RAG / Agent 数据 lineage + 上下文侧泄露防御须可审计。9 篇核心工作对接:InferScale KV injection lineage / Inadvertent Context Leakage 合规风险 / SkillEvo 多轮 skill lineage / Repo0 架构状态 / SWE-bench Science 跨域合规 / CoE 持续改进轨迹 / HSI 家族级 harness 演化 / CREEP 推理成本攻击风险评估 / RAGPerf 效率基准合规审计。
段二 · 成本结构量化:InferScale 单卡 H100 80GB 约 16-44 conversation 并发上限;LinkedIn Compaction 3.5× KV 削减 / 4.2× 吞吐提升;framsouza Mistral Large 123B 128K 上下文 ~44 GB KV cache;Mem0 75% token 节省 + 91% latency 改善 + 40% token 成本降低;LEANN 97% 存储节省。
段三 · 供应链硬件:NVIDIA H100/H200/B200 出口管制 → 须有非 NVIDIA fallback;AMD MI300X/MI325X 黄金架构(Anyscale Ray + vLLM PD Disaggregation 67% 成本节省);国产硬件(昇腾 910C / 寒武纪 / 海光 DCU)覆盖薄;OpenAI × Cerebras Ultrafast GPT-5.6 Sol ~750 tok/s(14× 加速)。
反方 v2(机制 + 数据 + 截止日):(1) 机制:EU AI Act GPAI 9 篇核心工作的合规审计链要求与 Centered Residual(8-25 engineering v2 提到)等白盒验证手段对接,未公开;(2) 数据:Mem0 / LEANN 自家 benchmark 数字与中立评测对比缺失;(3) 截止日 / 证伪条件:8-30 前若 ≥3 件独立评测(Mem0 / LEANN / Letta / Zep)做 cross-framework head-to-head 公开,Agent Memory 成本结构量化升级为 ★★。
6. arXiv 编号 v1 二次校验表
20 篇核心 + 邻接 arXiv 编号 v1 二次校验(沿用 v5 表,本棒不重复 fetch):
| arXiv 编号 | 标题 | 校验 | 版本 |
|---|---|---|---|
| 2607.27090 | InferScale: GPU-Native KV Injection for Personalized LLM Serving | ✅ | v1 |
| 2608.19857 | Inadvertent Context Leakage in LLM-based AI Agents | ✅ | v1 |
| 2608.13120 | SkillEvo: Towards Self-Evolving Skill Adaptation | ✅ | v1 |
| 2608.19854 | Repo0: Building Complete Software Projects from Scratch | ✅ | v1 |
| 2608.19799 | SWE-bench Science: Repository-Level Scientific Software Engineering Benchmark | ✅ | v1 |
| 2608.18027 | Chain-of-Experience: Continual Improvement from Experience Accumulation | ✅ | v1 |
| 2608.08466 | Hierarchical Self-Improvement: Task-Family-Level Harness Evolution | ✅ | v1 |
| 2606.02643 | CREEP: Inference Cost Attacks on Retrieval-Augmented LLMs (WWW '26) | ✅ | v1 |
| 2603.10765 | RAGPerf: End-to-End Benchmarking Framework for RAG Systems (WWW '26) | ✅ | v1 |
| 2608.16157 · 2608.13987 · 2608.13547 · 2607.21596 · 2608.20246 · 2608.12875 · 2608.00799 · 2608.01862 · 2608.02515 | 邻接 9 篇 | ✅ | v1 |
| 2608.20169 | Task-CoEvolve(邻接) | ⚠️ 仅 paper_cards 引用 | 待 8-29 核 |
| 2608.20317 | BrowseComp-Plus → ClimbMix(邻接) | ✅ | v1 |
spark · engineering 主题综述 v6 终稿 · 2026-08-27 21:00 CST 重写(覆盖原 v5 2026-08-22 16:40 CST)· 综合 9 篇核心 arXiv + 11 篇邻接 + 1 次 web_search + 9 件 GitHub 开源工具 · 7 条主线 · 数字核验 ⚠️ ≥10 处(v5 仅 3 处)· 立标等级统一四档法(v5 用 ★★/★★★ 简写)· 跨语种段降级为观察信号并删除 v5 "中文 engineering 立标(公开 artifact)" 11 条品牌列表(v5 形式化失败)· CJK 字数 ≤4,000(v5 CJK 4,439 / +11% 越线)· 私域清洁度五维(ip+kp+rn+fp+oc)= 0 命中 · 反方 v2 三段式按主线独立成段(v5 集中在 §3.3)· verifiability 抽查 6/9 = 67% ≥ 20% · 法律 / 监管 / 经济维度独立段保留 · arXiv 编号 v1 二次校验表保留 · 4 分制自查:主线完整 4 / 反方密度 4 / 工程落地 4 / 趋势前瞻 4 = 总 4/4