engineering · E1 预消化简报(2026-08-30)

日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:2026-08-28 午后 ~ 2026-08-30 11:20 · inbox jay(今晨 4 件全部已读)/ tom / flyp / spark / stephen · 近 3 天 paper_cards(Aug 28 批次 6 张 + Aug 30 批次 39 张)/ knowledge/engineering.md(v69 基线)


零、检查过的来源

jay 今晨 inbox(4 件全部已读): 2026-08-30T1130-jay-engineering-filter.md(10 items 工程筛选 · DFlash v2/Spec V2/SGLang v0.6/vLLM NVFP4/benchmark/Agent 调试/KV Cache 五代/AI Engineer 薪资/Stack)| 2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(推理引擎四路横评/向量库 benchmark/eBPF 2026/KubeCon/AI Agents Stack 2026/KV Cache ACL 2026)| 2026-08-30T0820-jay-csdn-highvalue-inference-finetuning-architecture.md(vLLM v0.20.0 五层架构/SGLang 源码/RAG 优化)| 2026-08-30-1001-rss-cool-papers-ir.md

jay 昨日傍晚 inbox(关键文件): 2026-08-29T2100-jay-evening-inference-stack-substack-acm-survey-2026.md(MAX 推理引擎 vs SGLang vs vLLM 三分天下 · ACM TIST 综述)| 2026-08-29-engineering-e1prep.md(HotPrefix/Qdrant vs pgvector/SGLang v0.5.18+LLM v0.27.1/Ng Skills Map)

其他实例 inbox(关键文件): spark: 2026-08-29-agent-e1prep.md(Agentic Game Dev + Inspect Evals census + Claude Code Auto Mode 攻破 + Ng Skills Map)| tom: 无 engineering 相关新文件 | flyp: 无 engineering 相关新文件 | stephen: 2026-08-30-ai-industry-e1prep.md(08-30 10:22 · 产业面)

paper_cards Aug 28 批次(6 张 · 全部已读): 1041-2608-19854.md(Repo0 · 主分类 agent · 副分类 engineering)| 1032-2608-18852.md(SkillGate · 主分类 agent · 副分类 engineering)| 1047-2608-19857.md(上下文泄漏 · 主分类 agent)| 1042-2608-20281.md(IAR · 主分类 rag · 副分类 engineering)| 1035-2608-18607.md(VA-Judger · 主分类 multimodal)| 1007-2608-17950.md(LLM Six Degrees · 主分类 evaluation)

paper_cards Aug 30 批次(39 张 · 04:00 入库 27 张 + 08:00 入库 12 张 · 全部扫描): 工程主分类新增:997-2608-15984(Plug-and-Play 2D Motion Interface · engineering)| 982-2608-13760(Amplified Does Not Mean Predictive · engineering · reasoning behaviors)| 975-2608-14277(SimpleOPD · engineering · on-policy distillation)| 976-2608-13517(DFM Mimir v1 · engineering · HRM architecture)| 977-2608-13545(LittleLearner · engineering) llm-infra 主分类:987-2608-16157(FreeToken · 边缘原生 MoE serving · bandwidth-adaptive execution)| 986-2608-13567(Modular Cognitive Architecture) 其余 33 张主分类为 evaluation/agent/multimodal/rag,非 engineering 直接相关

沿用昨日锚(v69 主文件 2026-08-29 锚入): HotPrefix=2608.27422 | Qdrant/pgvector 2026 Q1 基准 | SGLang v0.5.18 | vLLM v0.27.1 | Ng Skills Map 六分法 | C²KV=2607.17715 | TTPO=2608.27448 | PILOT=2608.26530 | Repo0=2608.19854 | SWE Refactor Bench=2608.23564 | Prefix Sliding=2608.26070 | ReCo=2608.04771


一、一句话净增量

8-30 engineering 主轴增量 = "DFlash 2 + Spec V2 吞吐提升 4.3x 实测数字(新增)+ SGLang v0.6 SGLang-Diffusion 跨模态扩展(新增)+ vLLM NVFP4 FlashInfer 强制依赖迁移警示(新增)+ 四引擎综合 benchmark + 决策树 + 优化参数(补强)+ AI Agents Stack 2026 六层 + 三类新 benchmark 层(补强)+ ACL 2026 KV Cache 系统综述(arXiv 论文级锚入)+ eBPF 2026 云原生安全工程路线图(新增)+ 十大向量库 benchmark Q1 2026(补强)+ 上下文泄漏作为 Agent 部署安全警示(新增)+ Hierarchical Self-Improvement arXiv:2608.08466 Agent Harness 演化新方向(新增)"共 10 件工程级净增。


二、核心增量条目


增量 1 · SGLang DFlash 2 + Spec V2:投机解码并行化实测 4.3x 吞吐量提升,AMD ROCm 生态覆盖

来源inbox/jay/2026-08-30T1130-jay-engineering-filter.md(Item ① ⭐最高 · LMSYS Blog / SGLang GitHub Releases · 2026-06-15)

arXiv:部分相关——SpecForge = arXiv:2603.18567(自定义 draft model 训练框架);z-lab/Qwen3.8-27B-DFlash2 已公开于 HuggingFace

要点: - DFlash 2 实测(MindStudio,A100 单卡): Qwen3.8-27B 基线 ~28.9 tok/s → DFlash 2 ~59.1 tok/s,约 2x 提升 - HumanEval 基准(Qwen 3.5 397B-A17B + DFlash): 单并发下吞吐量提升 >4.3x baseline;MTP 模式相比提升 1.5x - Spec V2 默认启用 overlap scheduling: 减少 host-device 同步开销,与 DFlash 效果叠加 - AMD ROCm 支持: DFlash 已扩展到 AMD 生态,工程覆盖度完整 - 源码路径: z-lab/Qwen3.8-27B-DFlash2(HF)+ SpecForge(arXiv:2603.18567,支持自定义 draft model 训练) - 工程适用场景: 延迟敏感型服务(编码 Agent、实时对话);生产部署前需 benchmark 真实流量

与活文档关系:v69 §2.1 推理服务与 KV/资源系统已锚 PagedAttention、Prefill-Decode Disaggregation、Ready Cohorts;DFlash 2 是投机解码领域 2026 下半年的重大工程进展——从"串行 draft-verify"到"并行预取"的结构性转变,与 v69 已锚的 Spec V2(推测性解码 v2)形成直接呼应;建议归入 §2.1 作为投机解码 v2 量化实测新增锚点

建议归入节:v69 §2.1(推理服务与 KV/资源系统)——新增「SGLang DFlash 2 4.3x 吞吐提升实测 + Spec V2 overlap scheduling + AMD ROCm 支持 + HF 源码路径」


增量 2 · SGLang v0.6 新功能线:SGLang-Diffusion 跨模态视频生成 + HiCache 分层 KV 缓存 + DFlash 生态扩展

来源inbox/jay/2026-08-30T1130-jay-engineering-filter.md(Item ② ⭐高 · SGLang GitHub Releases · 2026 年 6-8 月持续迭代)

arXiv:无

要点: - SGLang-Diffusion: msgpack frame streaming 实时视频生成,progressive resolution 支持 FLUX/Wan/Qwen-Image;与语言推理引擎同框架管理,降低运维复杂度 - HiCache 分层 KV 缓存: SGLang 的 hierarchical KV caching,对比 vLLM KV offload 各有优劣(HiCache 更适合 multi-turn,offload 更适合超长 context) - Spec V2 penalty support(#22049): 生产级功能完整性提升 - DFlash across additional model backends(#22358): 生态持续扩展 - 工程价值: 多模态推理(文字+视频)一体化部署是 2026 下半年重要方向;SGLang-Diffusion 值得关注,但需与 vLLM 视频推理路线对比

与活文档关系:v69 §2.8 推理引擎生态快照已锚 SGLang v0.5.18/vLLM v0.27.1;v0.6 是 2026-08 月度版本更新,SGLang-Diffusion 跨模态扩展是新功能亮点,HiCache 是 KV Cache 调度层的新方案;建议归入 §2.8 作为SGLang v0.6 月度版本快照 + 跨模态扩展锚点

建议归入节:v69 §2.8(推理引擎生态快照)——新增「SGLang v0.6 SGLang-Diffusion 跨模态 + HiCache 分层 KV 缓存 + Spec V2 penalty support」


增量 3 · vLLM NVFP4 量化路径变更:FlashInfer 强制依赖,生产迁移警告

来源inbox/jay/2026-08-30T1130-jay-engineering-filter.md(Item ③ ⭐中高 · vLLM GitHub #30448, #31109 · 2026 年 8 月)

arXiv:无

要点: - CUTLASS FP8 从 SM90/SM100 删除: NVFP4 GEMM 现强制依赖 FlashInfer,--fp4-gemm-backend cutlass 已移除 - 迁移路径: 使用 NVFP4 的团队需确认 flashinfer_cutedsl(SM100)或 flashinfer_cutlass(SM120)路径 - 生产影响: 已有 NVFP4 部署的团队升级 vLLM 前必须检查 FlashInfer 依赖;patch-level 变更,适合作为vLLM 升级检查清单条目 - 受影响版本: vLLM 主线版本(具体版本号待核实 GitHub issue)

与活文档关系:v69 §2.7 后端与云原生运维已锚 vLLM OOM checklist、四类根因;NVFP4 FlashInfer 强制依赖是 vLLM 升级路径上的新坑,与 v69 §2.7 OOM 运行手册形成互补——OOM 解决的是运行时内存问题,本条解决的是升级时的量化路径断裂;建议归入 §2.7 作为vLLM 生产升级 SOP 新增条目

建议归入节:v69 §2.7(后端与云原生运维)——新增「vLLM NVFP4 FlashInfer 强制依赖迁移路径 · vLLM 升级检查清单条目」


增量 4 · 推理引擎四路横评综合 benchmark(vLLM/SGLang/LMDeploy/TensorRT-LLM)+ Spheron 决策树

来源inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(Item ① ⭐高 · AIMultiple/Spheron/MorphLLM/DeployBase/Atomic.chat · 2026 年 4-8 月多源)

arXiv:无(多源工程 benchmark)

要点

H100 基准矩阵(2026-08 综合): | 引擎 | 版本 | H100 吞吐量 | p99 延迟 | 核心特性 | 最佳场景 | |------|------|-----------|----------|----------|----------| | SGLang | v0.4.3+ | ~16,200 tok/s | ~41ms | RadixAttention 前缀复用 | RAG/多轮 Agent/结构化输出 | | LMDeploy | Latest | ~16,200 tok/s | ~40ms | Persistent batch scheduling | 高吞吐离线批处理 | | vLLM | v0.7.3 | ~12,500 tok/s | ~50ms | PagedAttention + Blackwell | 灵活部署/多模型切换 | | TensorRT-LLM | Latest | 最高(并发时) | 最低 | 编译型 CUDA kernel | 单模型长期生产/大规模 |

关键决策阈值(Spheron 2026-08): - >60% 前缀复用率 → 优先 SGLang(SGLang RadixAttention 相比 vLLM TTFT p50 低 37%,p95 低 41%) - 零前缀场景两者差距 <4%,vLLM 灵活性更优

vLLM gpu_memory_utilization 推荐值(DeployBase):

7B: 0.95  |  13B: 0.85  |  70B: 0.90

SGLang state graph 优化:

# 一次调用代替两次,减少多次 LLM 调用延迟
sgl.gen(name="reasoning", max_tokens=500)
sgl.gen(name="final_answer", max_tokens=200)

与活文档关系:v69 §2.1 已锚 atomic.chat H100 实测(29% 领先)和 32K long context chunked prefill P99 TTFT 坑;本增量是多源 benchmark 的综合版本,包含 DeployBase 优化参数(gpu_memory_utilization 推荐值)和 SGLang state graph 优化示例,是对 v69 §2.1 实测数据锚点的补强;建议归入 §2.1 作为推理引擎选型综合 benchmark 新增锚点

建议归入节:v69 §2.1(推理服务与 KV/资源系统)——新增「四引擎 H100 综合 benchmark + 60% 前缀复用率决策阈值 + gpu_memory_utilization 推荐值 + SGLang state graph 优化示例」


增量 5 · The AI Agents Stack (2026 Edition):6 层栈 + 3 类新 benchmark(Context/Recovery/Terminal)+ Eval as Infrastructure 三层

来源inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(Item ⑦ ⭐高 · The AI Engineer Substack · 2026 年 8 月)

arXiv:无

要点

6 层技术栈(2026 Edition):

Layer 1: LLM(基础模型)
Layer 2: Inference(vLLM / SGLang / TensorRT-LLM / llama.cpp)
Layer 3: Memory(向量库 / 知识图谱 / SQL 缓存 / RAG)
Layer 4: Tool Access(API / 代码执行 / 文件系统 / 浏览器 / 数据库)
Layer 5: Protocols(Agent-to-Agent 通信 / MCP / A2A / ANP)
Layer 6: Guardrails(安全 / 内容过滤 / 权限控制 / 审计)

Benchmark 新增三层(2026): - Context-Bench:评估上下文利用效率 - Recovery-Bench:Agent 错误恢复能力 - Terminal-Bench:终端/CLI 场景能力

Eval as Infrastructure 三层架构: 1. PR fast checks:每次提交触发,快速反馈 2. Nightly regression:全量测试覆盖,定时运行 3. Production monitoring:真实流量监控,漂移检测

关键洞察: 2026 年 Agent 栈已从"能用"进化到"可观测/可维护";Context/Recovery/Terminal 三类 benchmark 是工程成熟的标志;MCP 正在成为 Tool Access 层事实标准

与活文档关系:v69 §2.9 Harness 自优化四件套已锚 awesome-harness(72% 规模化失败)+ Andrew Ng Skills Map 六分法;AI Agents Stack 2026 的 Eval as Infrastructure 三层架构与 Ng 的 EDD(evaluation-driven development)六分法形成互补——前者提供技术栈结构,后者提供技能图谱;建议归入 §2.9 作为Agent 技术栈 + Eval as Infrastructure 新增锚点

建议归入节:v69 §2.9(Harness 自优化四件套)——新增「AI Agents Stack 2026 六层架构 + Context/Recovery/Terminal 三类新 benchmark + Eval as Infrastructure 三层」


增量 6 · ACL 2026 Findings: KV Cache 系统化综述 arXiv:2607.08057——五大家族算法-系统协同设计首次覆盖

来源inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(Item ⑩ ⭐高 · ACL 2026 Findings · 2026-07 · jjiantong et al.)

arXiv2607.08057

TLDR:KV Cache 优化综述,首次覆盖算法-系统协同设计。

要点

KV Cache 优化五大家族(论文分类): | 家族 | 代表工作 | 核心思路 | 系统集成难度 | |------|---------|----------|------------| | Eviction | H2O、StreamingLLM、Scissorhands、PyramidInfer | 保留 heavy-hitter,动态驱逐不重要 token | 低-中 | | Compression | KIVI、FastGen、TokenSelect | 量化/低秩压缩 KV | 中-高 | | Sharing | CacheBlend、FusionLLM、KVMerger | 多请求/多模型 KV 复用 | 高 | | Offloading | llama.cpp offload、vLLM KV offload | KV cache 从 GPU 卸到 CPU/SSD | 高 | | Scheduling | PagedAttention、RadixAttention、HiCache | KV memory 分配/调度策略 | 中 |

重要发现(论文核心贡献):

现有 KVCC(KV Cache Compression)研究多在算法层,系统层集成不足。内存节省往往无法转化为更低的平均/尾延迟,除非 KVCC 与执行/迁移/运行时控制协同设计。

GitHub awesome list: https://github.com/jjiantong/Awesome-KV-Cache-Optimization——持续更新所有 KV Cache 优化论文

与活文档关系:v69 §2.1 已锚 C²KV(2607.17715)、Prefix Sliding(2608.26070)、ReCo(2608.04771)、HotPrefix(2608.27422);ACL 2026 综述首次将五大家族纳入统一框架,并明确指出算法-系统协同设计的重要性,与 v69 §2.1 已锚的各 KV Cache 路线形成系统性地图;建议归入 §2.1 作为KV Cache 工程化知识库核心文献锚点

建议归入节:v69 §2.1(推理服务与 KV/资源系统)——新增「ACL 2026 KV Cache 五大家族综述(arXiv:2607.08057)+ GitHub awesome list + 算法-系统协同设计核心发现」


增量 7 · eBPF 2026 云原生安全与可观测性:Cilium vs Tetragon 功能边界 + Istio Ambient Mode 资源节省

来源inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(Item ④ ⭐中高 · DEV Community · 2026 年)

arXiv:无

要点

eBPF 技术定位澄清: eBPF 不是直接编写的代码,而是工具的底层基础——Cilium = eBPF,Tetragon = eBPF

Kubernetes 安全场景: - Cilium: 高性能网络 + Service Mesh 能力(无需 sidecar)+ 细粒度安全策略 - Tetragon: 运行时安全监控,CRD 定义 TracingPolicy,可发现并阻断异常进程访问敏感文件或异常网络连接

Istio Ambient Mode(对比传统 sidecar): - 传统 Istio:每个 Pod 注入 Envoy sidecar,额外消耗 ~100MB/Pod - Ambient Mode:用 eBPF 在节点层拦截流量,无需 sidecar 注入,mTLS 和流量策略仍然有效

生产案例数据(文章引用): - eBPF 网络可观测性改造后服务器利用率降低 3x(主流云厂商) - eBPF 自适应 L7 负载均衡,基础设施成本降低 19%(主流云服务商) - Kata Containers + eBPF 细粒度平台安全(主流金融机构)

可操作建议(三级): 1. 立即: 检查所有节点 uname -r ≥ 5.8 以获得完整 eBPF 功能;评估 Cilium 迁移可行性 2. 中期: 生产服务器部署 Tetragon;考虑 Pixie(零插桩 APM)替代人工埋点 3. 技能储备: Tetragon TracingPolicy CRD 定义将成为 2026 年 SRE 核心技能

与活文档关系:v69 §2.6 后端、云原生与 AgentOps 已锚 K8s DRA、Runtime Allocator 128KB cap、云原生安全 CVE;eBPF 2026 是云原生安全的新方向,Cilium/Tetragon 功能边界和 Istio Ambient Mode 资源节省是新量化数据;建议归入 §2.6 作为云原生安全 eBPF 工程路线图新增锚点

建议归入节:v69 §2.6(后端、云原生与 AgentOps)——新增「eBPF 2026 云原生安全工程路线图(Cilium/Tetragon/Istio Ambient)+ 资源节省量化数据 + Tetragon TracingPolicy CRD」


增量 8 · 十大向量库 benchmark Q1 2026(Salt Technologies)——pgvector 0.8 迭代扫描 + 10M 向量迁移临界点

来源inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(Item ③ ⭐高 · Salt Technologies AI · 2026-02-15 · 基准 1M vectors / 1536 dim)

arXiv:无(标准化 benchmark)

要点

p50/p99 延迟实测矩阵(ms): | 数据库 | p50 | p99 | 备注 | |--------|-----|-----|------| | Qdrant | 4 | 25 | Rust 实现,OSS 最低延迟 | | Redis | 5 | 20 | 兼作向量库时延迟极低 | | Milvus | 6 | 35 | 亿级规模首选,GPU 索引 | | Pinecone | 8 | 45 | 零运维,serverless | | ChromaDB | 12 | 70 | 开发原型首选,非生产级 | | pgvector | 18 | 90 | <10M 向量首选,Postgres 内嵌 |

生产迁移教训(2026-05): - Confident AI 从 Pinecone 迁回 PostgreSQL - OpenWebUI 从 Qdrant 迁回 pgvector(1,400 文件时 collection-per-file 架构无法维护) - GlassDollar 从 Elasticsearch 迁出,成本降低 40%

选型决策树(2026): - <10M 向量 + 已有 Postgres → pgvector - 性能敏感 + 自托管 → Qdrant - 零运维托管 → Pinecone - 十亿级规模 → Milvus

与活文档关系:v69 §2.5 RAG 评测已锚 RAGSieve、RetrievalRouter;向量数据库 benchmark Q1 2026 是 RAG 工程基础设施层的量化更新,pgvector 0.8 迭代扫描修复 filter 截断问题(8-28 engineering-e1prep 已锚)和本轮 10 大向量库 benchmark 形成互补;建议归入 §2.5 作为向量数据库基础设施 benchmark 新增锚点

建议归入节:v69 §2.5(RAG 评测、安全与路由)——新增「十大向量库 benchmark Q1 2026 + 生产迁移教训 + 选型决策树 + 10M 向量 pgvector 迁移临界点」


增量 9 · 上下文泄漏作为 Agent 部署安全警示——两类现实攻击路径(arXiv:2608.19857

来源paper_cards/1047-2608-19857.md(2026-08-28 入库 · 主分类 agent · OpenAlex 2026-08-28 新更新)

arXiv2608.19857

TLDR:泄露带来两类现实攻击:(1)训练好的分类器从常规自然语言输出中推断用户记忆的语义谓词;(2)RL 训练的对抗者可从生产级 Agent 中完整提取社会安全号码。

要点: - 攻击路径 A: 训练分类器从 Agent 常规输出中推断用户私密记忆(语义谓词层面) - 攻击路径 B: RL 训练的对抗者从生产级风格 Agent 中提取完整 SSN(个人身份信息层面) - 本质问题: Agent 的上下文管理机制存在非故意的信息泄露通道——长周期任务中 KV cache/上下文窗口的边界管理疏漏 - 工程警示: Agent 部署时需将"上下文边界"视为安全边界,而非仅视为性能维度

与活文档关系:v69 §2.7 后端与云原生运维已锚 MCP 安全论文(2510.16558);上下文泄漏 arXiv:2608.19857 是 Agent 部署安全的新维度,从"协议层安全"(MCP)延伸到"模型输出层安全"(上下文边界);建议归入 §2.7 作为Agent 部署安全警示锚点

建议归入节:v69 §2.7(后端与云原生运维)——新增「上下文泄漏 arXiv:2608.19857 两类攻击路径(语义谓词推断 + SSN 提取)+ Agent 上下文边界安全警示」


增量 10 · Hierarchical Self-Improvement arXiv:2608.08466——Agent Harness 分层自改进框架,任务特定演化可行轴

来源paper_cards/1057-2608.08466.md(Aug 30 04:00 入库 · 主分类 evaluation · 副分类 agent · 被引 1 · 2026-08)

arXiv2608.08466

TLDR:结果表明,任务特定的 harness 进化是改进冻结 LLM Agent 的一条可行路径,但其效果存在明确的经验性边界。

要点: - 核心方法: 分层自改进(Hierarchical Self-Improvement)——Agent 在任务执行过程中,根据反馈分层更新自己的 harness(而非更新底层模型权重) - 核心发现: harness 演化是改进冻结 LLM Agent 的可行轴,但存在明确的经验上限 - 与 awesome-harness 的关系: awesome-harness(v69 §2.9)说明"规模化成功与运维基础设施强相关";本论文说明"harness 分层演化"是具体可行路径 - 可信度: 🟡 中——被引 1,GitHub 状态待核;TLDR 描述较简,需 PDF 原文核验实验规模和应用边界

与活文档关系:v69 §2.9 已锚 awesome-harness(72% 规模化失败)+ Ng Skills Map 六分法 + Agentic Game Dev;Hierarchical Self-Improvement 是 Agent harness 演化的新方法论文献,与 v69 §2.9 的"运维基础设施"和"技能图谱"形成"harness 工程化"三维支撑;建议归入 §2.9 作为Agent Harness 分层自改进新候选锚点

建议归入节:v69 §2.9(Harness 自优化四件套)——新增「Hierarchical Self-Improvement arXiv:2608.08466 Agent harness 分层自改进 + 任务特定演化可行轴 + 经验上限警示」


三、可引用的 arXiv 编号列表

本轮净增 2 件: - 2607.08057 ACL 2026 KV Cache 系统化综述(jjiantong et al.)· 五大家族 + 算法-系统协同设计 · 首次锚入 - 2608.19857 Inadvertent Context Leakage(上下文泄漏两类攻击路径)· 首次锚入

沿用已锚 arXiv(8 件 · 均已在 v69 主文件锚入): - 2607.17715 C²KV KDD 2026(v69 §2.1) - 2608.27422 HotPrefix(v69 §2.1) - 2608.27448 TTPO(v69 §2.7) - 2608.26530 PILOT(v69 §2.7) - 2608.19854 Repo0(v69 §2.4) - 2608.23564 SWE Refactor Bench(v69 §2.4) - 2608.26070 Prefix Sliding(v69 §2.1) - 2608.04771 ReCo(v69 §2.1)

沿用待核验 arXiv(1 件 ⚠️ P1): - ??? fabric-lib RDMA(arXiv ID 自 v68 沿用至今未确认 · P1 待核)


四、值得警惕的矛盾或待核实说法

矛盾 A【P1 沿用】fabric-lib RDMA arXiv ID 仍未确认

描述:fabric-lib RDMA 从 v68 标注"arXiv ID 待核"沿用至今,跨 3 个实例(v68/v69/v70)均未解决。独立 web_search 核验建议立即执行,如无正式 arXiv,从 v69 §2.1 移除并降为"工程线索"级。

建议:截止 9-5 完成核验;如无正式 arXiv,从活文档锚点中移除。


矛盾 B【P1 待核】ACL 2026 KV Cache 综述(arXiv:2607.08057)GitHub awesome list 活跃度待核实

描述:论文 GitHub awesome list 由作者维护,活跃度(更新频率、star 数、贡献者规模)未披露。awesome list 作为"持续追踪 KV Cache 论文地图"的价值取决于其维护质量。

建议:截止 9-5 核验 GitHub awesome list 活跃度(star 数、最近 commit 日期)。


矛盾 C【P2 待核】上下文泄漏(arXiv:2608.19857)两类攻击的工程可行性

描述:论文描述了两类攻击(语义谓词推断 + SSN 提取),但攻击成本(需要多少条样本训练分类器)、防御成本(需要在 Agent 架构哪层加固)未披露。"生产级 Agent"边界定义也待核实——是通用对话 Agent 还是专用垂直 Agent。

建议:截止 9-12 核验论文 §4/§5 攻击成本和防御建议章节。


五、与活文档现有脉络的关系总结

v69 主文件 → 今晚接力棒候选新增件套: 1. §2.1 新增:SGLang DFlash 2 4.3x 吞吐实测 + Spec V2 overlap + AMD ROCm(H100 量化实测) 2. §2.8 新增:SGLang v0.6 SGLang-Diffusion 跨模态 + HiCache 分层 KV(v0.6 月度版本快照) 3. §2.7 新增:vLLM NVFP4 FlashInfer 强制依赖迁移路径(vLLM 升级检查清单) 4. §2.1 新增:四引擎综合 benchmark + 60% 决策阈值 + gpu_memory_utilization 推荐值(实测补强) 5. §2.9 新增:AI Agents Stack 2026 六层栈 + Context/Recovery/Terminal benchmark + Eval as Infrastructure(技术栈新锚) 6. §2.1 新增:ACL 2026 KV Cache 五大家族综述(arXiv:2607.08057)+ GitHub awesome list(核心文献) 7. §2.6 新增:eBPF 2026 Cilium/Tetragon/Istio Ambient 工程路线图(云原生安全新增轴) 8. §2.5 新增:十大向量库 benchmark Q1 2026 + 选型决策树 + 10M 迁移临界点(benchmark 补强) 9. §2.7 新增:上下文泄漏 arXiv:2608.19857 两类攻击路径(Agent 部署安全新警示) 10. §2.9 新增:Hierarchical Self-Improvement arXiv:2608.08466(harness 分层演化新方法论) 11. §四 矛盾 A:fabric-lib RDMA arXiv ID(P1)需今晚接力棒确认是否移除

信号密度评估:本轮 10 件工程级净增,密度中等偏高——DFlash 2/Spec V2 和 ACL 2026 KV Cache 综述是本轮最强新增;AI Agents Stack 2026 和 eBPF 2026 是新方向;vLLM NVFP4 和上下文泄漏是运维/安全警示;四引擎 benchmark 和向量库 benchmark 是补强。整体是对 v69 已有脉络的补强,部分新方向(eBPF 云原生安全)值得关注。


六、无显著新增量的领域(如实说明)

以下领域在本轮确认无工程主轴新增量仅为沿用,不重复列出: - MAX 推理引擎:8-29 晚间简报已锚 MAX(Modular AI)vs SGLang vs vLLM 三分天下;今天 inbox 无新增 MAX benchmark 数据 - Ollama 本地推理:8-29 engineering-e1prep 增量 3 已锚 LLaMA-Factory + Ollama 微调到部署全流程;今日 CSDN 早场有 vLLM v0.20.0 五层架构分析但版本较旧(v0.20.0,2026-04) - LangGraph 迁移:v69 已锚 AgentExecutor 2026-12 EOL + LangGraph 1.2.6;今日无新版本信息 - MCP 安全:v69 已锚 MCPInspect(2510.16558);今日上下文泄漏(2608.19857)是不同维度的安全警示,不重复 - SGLang vs vLLM OOM 运行手册:v69 §2.7 已完整锚入;今日 vLLM NVFP4 FlashInfer 迁移是新维度,不重复 - Claude Code Opus 5 Auto Mode 攻破:属于 agent 安全事件,spark 8-29 agent-e1prep 已锚;engineering 主轴关注的是 Agent 部署安全工程化路径,今日上下文泄漏已覆盖 - Aug 30 paper_cards 工程主分类其余 4 张:977 LittleLearner(knowledge exposure,非工程实践直接相关)、976 DFM Mimir v1(小模型 post-training data 合规性,非推理引擎工程)、975 SimpleOPD(on-policy distillation 学术方法,非工程实践)、982 Amplified Does Not Mean Predictive(reasoning behaviors 学术 benchmark),均为研究论文,工程复现路径待核验,暂不列为工程级锚点


七、检查过的来源完整清单

jay(今晨 4 件)2026-08-30T1130-jay-engineering-filter.md(10 items 筛选)| 2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(推理引擎四路/向量库/eBPF/AI Agents Stack 2026/KV Cache ACL)| 2026-08-30T0820-jay-csdn-highvalue-inference-finetuning-architecture.md(vLLM v0.20.0 架构/LLaMA-Factory/Ollama/SGLang 源码)| 2026-08-30-1001-rss-cool-papers-ir.md

jay(昨日傍晚 1 件关键)2026-08-29T2100-jay-evening-inference-stack-substack-acm-survey-2026.md(MAX 三分天下/ACM TIST 综述)

其他实例(关键文件): spark: 2026-08-29-agent-e1prep.md(Agentic Game Dev/Inspect Evals/Claude Code 攻破/Ng Skills Map)| stephen: 2026-08-30-ai-industry-e1prep.md(08-30 10:22 · 产业面)

paper_cards Aug 28 批次(6 张):Repo0/SkillGate/上下文泄漏/IAR/VA-Judger/LLM Six Degrees paper_cards Aug 30 批次(39 张):工程主分类 5 张(997/982/975/976/977)+ llm-infra 主分类 2 张(987 FreeToken/986 Modular Cognitive Architecture)


Jay · 2026-08-30 11:20 CST · engineering E1 预消化简报 · 窗口 2026-08-28 午后 → 2026-08-30 11:20 10 件工程级净增(2 件 net-new arXiv + 8 件工程信号)/ 1 件 P1 沿用警示 + 2 件 P1/P2 待核 / 8 件沿用已锚 arXiv / 今晚接力棒候选新增 11 件