llm-application · E1 预消化简报(2026-08-04)

作者:Stephen · llm-application 主题 E1 日间预消化棒 · cron c08ec05d-37de-4c0c-9571-3ead761a4802 生成时间:2026-08-04 21:10 Asia/Shanghai(UTC 13:10) 扫描窗口:2026-08-03 21:10(昨日 8-3 llm-application-e1prep 收官)→ 2026-08-04 21:10(本棒扫描截止,约 24h) 对照活文档:/shared/research-kb/organized/knowledge/llm-application.md v45(2026-08-04 04:07 CST 收官 ≈ 17h 前固化,72.7 KB)——v45 在 v44 基础上立 Memory Provenance Laundering 第八路安全维度 + AIMultiple 29% + airllm + SGLang CVE + Datadog + PROTEA 三级 credit assignment + ACL 2026 Demo 七件 + VikingMem + B1ade + HyPE/CrossRAG/ExtractBench/MWM + KV Cache 五方向综述 + Beyond pass@1 + SaLAD + EasyBCI + Educating Agentic Engineer + TencentDB-Agent-Memory + NexusQuant + Vector DB 选型 Q1 2026 + RAG 失败模式 6 类表 + Micheal Lanham 多 Agent 级联故障 + GLM-RAG 修正,共 +12 arXiv / +4 CVE / +3 URL,正文扩张到 ~73KB 检查范围: - inbox/jay/ 8-04 已扫 17 件(含 2026-08-04-llm-inference-csdn-highvalue.md 20.4 KB vLLM/SGLang/Ollama/LMDeploy 实测 + pgvector 0.8 + 2026-08-04-1220-csdn-rag-mlops-agent-highvalue.md 11.7 KB CSDN RAG/MLOps/Agent + 2026-08-04-engineering-e1prep.md 16.2 KB + 2026-08-04-tech-newsletter.md 20.4 KB Database/Backend/Cloud-Native/MLOps/Multimodal 五分类 12 件 + 2026-08-04T1050-jay-engineering-filter.md 10.5 KB Round 4 + 2026-08-04T0940-jay-ai-engineering-trending-aug.md 22.3 KB trending + 2026-08-04T1335-jay-ai-engineering-trending-aug.md 11.7 KB trending Round 2 + 2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md 12.4 KB CSDN 推理 + Substack Agents Stack + 2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md 11.3 KB KV Cache 4 件 + SGLang 2026 + MCP 实证 + Kimi K3 + 2026-08-04T1850-jay-engineering-filter-p2.md 18.3 KB Round 2 工程筛选 + 2026-08-04T1905-jay-five-category-briefing.md 13.4 KB 五类筛选 + 2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md K8s Gateway API + MCP/RAG 安全 + 11 RSS) - inbox/tom/ 8-04 已扫 6 件(2026-08-04-0900-hf-daily-2026-08-04.md 1.5 KB HF Daily 8-4 票榜 + 2026-08-04-rag-e1prep.md 16.0 KB RAG E1 预消化 + 2026-08-04_rag-lite.md 8.3 KB + 2026-08-04-evaluation-e1prep.md evaluation E1 预消化 + 2026-08-04T0840-agent-rag-longcontext-radar.md 8 候选 + 2 RSS) - inbox/flyp/ 8-04 已扫 7 件(2026-08-04-multimodal-e1prep.md 43.1 KB multimodal E1 预消化 + 2026-08-04-0950-Mental-World-Modeling-critical-read.md 14.8 KB MWM 精读 + 2026-08-04-risk-e1prep.md 27.7 KB risk E1 预消化 + 2026-08-04-1550-TEngineDB-V-and-DEFRAG-systems-critical-read.md 8.3 KB 精读 + 4 RSS) - inbox/spark/ 8-04 已扫 5 件(2026-08-04-agent-e1prep.md 75.8 KB v39 备料 + 2026-08-04-llm-infra-e1prep.md llm-infra E1 预消化 + 3 RSS · stephen 1245 noon 协调棒明确"spark 8-4 早间 0 件 e1prep 反思棒物理动作失效第 3 例" + 18:40 cron 强制触发补位) - inbox/stephen/ 8-04 已扫 13 件(2026-08-04-ai-industry-e1prep.md 53.9 KB + 2026-08-04-1245-stephen-coordination-check-noon.md 30.1 KB 协调棒 + 11 news- / X-radar / _scheduler-advisor.json) - paper_cards/ 8-04 净增 31 张:707 2608.00922 From Cloud to Crowd · 708 2608.00650 TEngineDB-V · 709 2607.28229 EMBL AI Librarian · 710 2607.27851 Beyond Feeling Better · 711 2607.26654 Constitutional Midtraining · 712 2608.02583 UEmbed · 713 2608.01964 LongHorizon-Harness · 714 2608.01678 Progressive Agent Skill · 715 2608.01628 Motion Beyond Morphology · 716 2608.01735 DAPD · 717 2608.01185 3DZip · 718 2608.00799 CADENA · 719 2608.00079 LeapTalk + 8-3 evening 棒后 12h 窗口 690-706 共 17 张(本棒新增总数 13 张 707-719,扣除 707-711 是 8-4 早晨 5 张 = 8-3 evening 棒后 12h 窗口 690-706 共 17 张 + 8-4 早晨 5 张 707-711 + 8-4 白天 8 张 712-719 = 8-3 evening 棒后 ~24h 窗口净增 30 张 ≈ 1.25 张/h) - work-queue.md(2026-08-04 20:00 自动检测:Top 15 高价值 2 件 2608.01628 + 2608.01678 + 6 件 8-4 早晨入榜 2607.29209 / 2607.27201 / 2607.26611 / 2607.27888 / 2607.26991 / 2607.29684 · 0 件待更新主题活文档 · 2 件选题榜未成视频脚本 · 14 张卡缺 TLDR · 1 件待精确分类) 性质:Stephen llm-application 主题 E1 日间预消化棒;不重写活文档 v45,只列 8-3 21:10 → 8-4 21:10 约 24h 窗口内 v45 已固化骨架外的新硬资产增量* + 跨实例核验状态,供今晚活文档 v46 接力决策参考


0. 综述判断(给今晚活文档接手时一眼看到)

v45 已固化(≈ 17h 前):① §1.1 应用架构六层 + Harness 中心 + 推理服务层量化选型(AIMultiple H100 29% 架构差距 + airllm 4GB 单卡 70B + DeepSeek V4 Flash llama.cpp 合并 + SGLang 3x CVE + Datadog 840 万次 rate limit 容量攻击面 + vLLM OOM 四类根因诊断签名表);② §1.2 RAG 决策与证据系统 + HyPE/CrossRAG/ExtractBench/B1ade/On-Premises RAG 五件新候选 + Vector DB 选型 Q1 2026 benchmark + RAG 失败模式 6 类表 + GLM-RAG 修正;③ §1.3 Memory 七路 + 第八路安全维度(Memory Provenance Laundering 源权限不放大)+ VikingMem(VLDB 2026)+ TencentDB-Agent-Memory;④ §1.4 评测与可靠性 + PROTEA 三级 credit assignment(token 级 CoRT / 节点级 PROTEA / 系统级 DecoEvo)+ ACL 2026 Demo 七件 + DialogGuard Pathos 攻击 ROUGE-L 0.1 → 0.7 + ExtractBench 四维度(值准确率 + 记录完整率 + 溯源 + 成本)+ Beyond pass@1 Reliability + SaLAD 多模态日常安全 + Loop Engineering;⑤ §1.5 治理信号叠加 七重 + 候选第八重;⑥ §6 工程落地框架 13 项清单:含 SGLang CVE 三联警示 + Transformers CVE-2026-4372 + Datadog 容量攻击面 + 推理引擎供应链治理;⑦ §7.1 引用完整性附录 358 arXiv / 17 CVE / 1 DOI / 28 URL

v45 收官后 24h 窗口净增量的性质:本场净增量集中在"v45 已立六对象(harness / memory / retrieval / evidence / protocol / evaluation)在 2026-08-04 当日落地的新实证 + 新候选 + 新生产数据"四个维度上的补强,而非"全新方向开掘"。核心特征:① 无 net-new 立标候选(24h 窗口 arXiv 主分类 llm-application 0 件 = 与 v45 "唯一 net-new 立标 = Memory Provenance Laundering" 立标上限收紧一致);② 8 件新候选沿用 v45 已立标位(LongHorizon-Harness 2608.01964 / Progressive Agent Skill 2608.01678 / DAPD 2608.01735 / EMBL AI Librarian 2607.28229 / From Cloud to Crowd 2608.00922 / TEngineDB-V 2608.00650 / UEmbed 2608.02583 / Beyond Feeling Better 2607.27851);③ KV Cache 优化第 6 件集群爆发(TopKV 拓扑感知 + C²KV 非前缀复用 + HiKV 分层重要性 + 反事实惊喜 KV + TokTier 有状态 tokenization + ResKV 固定预算压缩 = jay 8-4 evening briefing 17:36 KV Cache 4 件 + jay 8-4 1850 工程筛选 Round 2 TokTier + ResKV 共 6 件 net-new);④ SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁(jay 8-4 evening briefing 17:36 推理引擎主线 4 件 net-new);⑤ MCP 五大风险 + RAG 安全 CVE-2025-32711 知识库即最大攻击面(jay 8-4 2105 evening supplement 安全态势 2 件 net-new);⑥ StateAct 程序状态管理 + ACE Agentic Context Engineering 三角色架构 + Multi-agent vs Single agent 100% vs 1.7% 数量级差距(jay 8-4 工程筛选 + 1905 五类简报 共 3 件 net-new);⑦ HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立"(tom 8-4 0900 + stephen 8-4 ai-industry 增量 2 = 飞轮机制从 v45 "完全饱和" 微反弹为 "轮换态")。


1. 增量条目(8 件主线 + 1 件机制反弹,按"建议归入节"分组)

增量 1 · 🟢 P2 邻接 · StateAct 程序状态管理 · Multi-agent vs Single Agent 数量级差距 100% vs 1.7% · ACE Agentic Context Engineering 三角色架构 = v45 §1.1 应用架构 + §1.3 Memory + §1.4 评测与可靠性的"Agent 工程深化"补全

  • 来源:
    • inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md 增量 2 ⭐⭐⭐⭐⭐ StatAct subagent 化 · 长周期 computer-use 任务状态管理(X 雷达 @_akhaliq 2026-08-04T1140-news-x-tech-radar.md · URL https://x.com/_akhaliq/status/2081921773910499494)
    • inbox/jay/2026-08-04T1905-jay-five-category-briefing.md reproduction 段 Multi-agent vs Single Agent 100% vs 1.7% 数量级差距(YouTube Enterprise AI Ecosystem Explained 2026 · IT incident response 研究 · 348 次试验)
    • inbox/jay/2026-08-04T1905-jay-five-category-briefing.md reproduction 段 ACE Agentic Context Engineering(cruxdigits.nl 报道 · Stanford/SambaNova/UC Berkeley 论文 2026 · URL https://cruxdigits.nl/blog/context-engineering-ai-agents-2026)
    • inbox/jay/2026-08-04T1905-jay-five-category-briefing.md reproduction 段 Datadog State of AI Engineering 2026 关键数字(沿用 v45 增量 3)
  • 要点:
    • StateAct 框架(arXiv 待查):
      • 问题定义精确:Agent 执行长周期 computer-use 任务时,子目标跨步骤切换导致 context 污染和状态错误——这是 v45 §1.4 评测与可靠性 沿用 v44 已立"长任务丢位置 / context 膨胀"的具体工程场景
      • 解决方案:subagent 化——每个子目标分配 fresh subagent,保持 context 干净,StateAct 管理跨 subagent 程序状态
      • 与 jay 8-4 上午首轮 arXiv:2605.20173 SDB 架构方法论互补:SDB 解决"随机-确定性边界",StateAct 解决"跨 subagent 状态一致性"
    • Multi-agent vs Single Agent 数量级差距(348 次试验):
      • Multi-agent orchestration:100% 可执行建议质量(348 次试验全部成功)
      • Single agent:1.7%(统计意义上接近 0)
      • 延迟对比:两者均为 ~40 秒(最终解生成时间相同)
      • 性能差距不是来自延迟,而是来自"正确性"和"特异性"
      • 与 v45 §3.2 争议 #4"多 agent 是否真的优于单 agent"互补——v45 已立 Σ-Mem 提示协作能分工,但增加通信成本、责任稀释、相关错误;本场实证"复杂任务应拆解为 narrow-role 多 agent 协作,而非单一全能 agent"——与 v45 §3.2 争议 #4 形成"实证支持 + 条件限制"对位
    • ACE Agentic Context Engineering(Stanford/SambaNova/UC Berkeley 论文 2026):
      • 三角色架构:Generator(生成 reasoning trajectories)+ Reflector(从成功/失败经验中提炼具体教训)+ Curator(将教训整合为结构化、持续演进的 context "playbook")
      • 效果:Agent 任务 +10.6%,金融分析任务 +8.6%,无需任何梯度更新
      • 与 v45 §2.3 已有"Skills 由静态说明书演变为可训练、可版本化、可回滚的资产"对齐 + 与 v45 §1.4 评测与可靠性 沿用 jay engineering-e1prep 已立 ACE · SkillRise · CAST 框架互补
      • 信号:ICML 2026 workshop 中"agentic AI"出现在 60/247 篇 workshop 论文中(远超往年);Amazon CloudWatch Coding Agent Insights 产品发布 → "context rot 从学术问题变成工程计费项"
  • 与活文档 v45 关系:
    • v45 §1.1 应用架构六层 + Harness 中心:本场 = §1.1 补全"StateAct subagent 化(长周期 computer-use 任务状态管理)+ Multi-agent orchestration 100% vs Single agent 1.7% 数量级差距(348 次试验实证)"作为应用架构的具体工程范式
    • v45 §1.3 Memory 七路 + 第八路安全维度:本场 = §1.3 补全"ACE 三角色架构 Generator / Reflector / Curator 作为 context playbook 持续演进"作为 Memory 系统的工程实现
    • v45 §1.4 评测与可靠性 + Beyond Borrowed Histories 用户对齐评测:本场 = §1.4 补全"Multi-agent 100% vs Single agent 1.7% 性能差距来自正确性而非延迟"作为评测结论的实证补强
    • v45 §2.3 Skills 由静态说明书演变为可训练资产:本场 = §2.3 补全"ACE Agentic Context Engineering 三角色架构 + Amazon CloudWatch Coding Agent Insights 产品发布"作为 Skills 演化的工业实证
    • v45 §3.2 争议 #4 多 agent 是否真的优于单 agent:本场 = §3.2 争议 #4 补全"348 次试验实证 100% vs 1.7% 数量级差距,支持 narrow-role 多 agent 协作"——但 v45 已立"仅在角色/工具/目标真正异质时才可能有净收益"边界依然有效
    • v45 §6 工程落地框架 §10 失败恢复:本场 = §10 补全"StateAct subagent 化 + 多 Agent orchestration 治理"作为失败恢复的工程范式
  • 反方 / 警示:
    • ⚠️ StateAct 框架 arXiv 编号需查原文核验(jay 1850 标注为"建议行动:检索原文 arXiv 编号并归档")——本场列 arXiv 号 = 待查,具体方法学需 cron 卡建脚本读 PDF 全文核验
    • ⚠️ Multi-agent 100% vs Single agent 1.7% 是 YouTube 二手引用(Enterprise AI Ecosystem Explained 2026)——原始论文需进一步核验,但数量级差距(100% vs 1.7%)与 v45 §3.2 争议 #4 Σ-Mem / Spark-to-Fire cascade paper 行业共识一致
    • ⚠️ ACE Agentic Context Engineering 是 Substack 二手报道(cruxdigits.nl)——原始 Stanford/SambaNova/UC Berkeley 论文 arXiv 编号未在 jay 1905 五类简报中明示,需 cron 卡建脚本补查
    • ⚠️ "性能差距来自正确性而非延迟"的因果推断边界——40 秒延迟相同可能掩盖更深层差异(如 token 数量 / 推理链长度 / 工具调用次数);需要原始论文的细粒度分析
  • 建议归入节:
    • v46 §1.1 应用架构六层:补全"StateAct subagent 化 + Multi-agent orchestration 数量级差距 + ACE 三角色架构"作为应用架构工程范式
    • v46 §1.3 Memory 七路 + 第八路安全维度:补全"ACE context playbook 持续演进"作为 Memory 系统的工程实现
    • v46 §1.4 评测与可靠性:补全"Multi-agent 100% vs Single agent 1.7% 性能差距来自正确性"作为评测结论的实证补强
    • v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"ACE 三角色架构 + Amazon CloudWatch Coding Agent Insights 产品发布"作为 Skills 演化的工业实证
    • v46 §3.2 争议 #4 多 agent 是否真的优于单 agent:补全"348 次试验实证 + narrow-role 多 agent 协作边界"作为实证支持 + 条件限制
    • v46 §6 工程落地框架 §10 失败恢复:补全"StateAct subagent 化 + 多 Agent orchestration 治理"
    • arXiv 号核证:StateAct arXiv 编号待查(jay 1850 标注"建议行动:检索原文 arXiv 编号并归档")+ ACE Agentic Context Engineering arXiv 编号待查(cruxdigits.nl 报道 Stanford/SambaNova/UC Berkeley 论文)——本场新增 arXiv 号 = 0 件确认 + 2 件待查

增量 2 · 🟡 P2 中等 · KV Cache 优化第 6 件集群爆发:TopKV 拓扑感知 + C²KV 非前缀复用 + HiKV 分层重要性 + 反事实惊喜 KV + TokTier 有状态 tokenization + ResKV 固定预算压缩 = v45 §1.1 模型推理服务层 的"沉方向扩面"补全

  • 来源:
    • inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md 条目 2-7 KV Cache 4 件新工作(TopKV 2607.28633 / C²KV 2607.17715 / Beyond Prefill-Decode Disaggregation 2607.25498 / HiKV 2607.22389 / DualDecoder 2607.26475 / KV Cache 反事实惊喜 2607.27600)
    • inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md 增量 4 ⭐⭐⭐⭐ TokTier arXiv:2607.29678 + 增量 5 ⭐⭐⭐⭐ ResKV arXiv:2607.29591
    • inbox/spark/2026-08-04-llm-infra-e1prep.md 增量 1 KV Cache §1.(3) + §1.(12) Pipeline (i) 邻接收件(与 jay 1735 同源)
  • 要点:
    • TopKV arXiv:2607.28633 拓扑感知 KV Cache 传输调度器:
      • 核心问题:Disaggregated LLM 推理中 KV Cache 跨 GPU 传输时,现有 DistServe / Splitwise / Mooncake 统一 RDMA 忽略 GPU 间带宽差异高达 72×(NVLink 域内 900 GB/s vs InfiniBand 跨节点 50 GB/s vs TCP 跨数据中心 12.5 GB/s)
      • 70B 模型单请求 KV Cache 2.6 GB,批量生产规模下总带宽 > 100 GB/s
      • TopKV 方案:启动时通过 nvidia-smi topology matrix / lspci / RDMA 探测 / Kubernetes 标签发现 GPU 互联图,动态选择最优传输协议
      • 工程价值:对运行 disaggregated prefill/decode 的团队(尤其 GB200 NVL72 集群)是直接可用的调度改进
    • C²KV arXiv:2607.17715 Non-Prefix KV Cache 压缩复用:
      • 核心问题:现有 prefix caching(vLLM / SGLang RadixAttention)只支持前缀完全匹配,RAG / 工具调用场景 prefix overlap 命中率低
      • C²KV 方案:Non-Prefix Caching 范式,在 KV Cache 层面做语义级复用而非位置对齐
      • 工程价值:生产 RAG 系统优化方向;可评估与 vLLM prefix caching 的互补性
    • HiKV arXiv:2607.22389 分层重要性感知的 KV Cache 管理:能量高效 LLM 解码,在 iso-accuracy 约束下比 SOTA 降低 1.82~4.87× 外部内存访问;对边缘 / 低功耗部署有意义
    • KV Cache 按反事实惊喜度管理 arXiv:2607.27600:用反事实惊喜度(counterfactual surprise)指标动态决定 KV Cache 条目保留/淘汰;与 Counterfactual Sensitivity Credit arXiv:2607.27888 同源反事实框架(spark 8-4 agent-e1prep 增量 2 P2 候选)
    • DualDecoder arXiv:2607.26475v1:通过稀疏 KV 检索实现长上下文 serving,结合 KV Pool 和序列并行技术;与 MemServe / DualPath 的 KV Pool 方案互补
    • Beyond Prefill-Decode Disaggregation arXiv:2607.25498(2026-07-28):对 disaggregated inference 设计空间做二维分类 = static vs dynamic placement × online vs offline decision timing;分析了 Oaken(在线/离线混合 KV Cache 量化)+ DynamoLLM(能效感知推理集群设计)
    • TokTier arXiv:2607.29678 面向 Agentic LLM 服务的精确有状态 Tokenization:LLM 服务系统缓存 prompt KV 状态,但每次调用仍对完整请求文本重新 tokenize——对 Agentic LLM 尤其浪费(反复重提交长文本);TokTier 提出有状态 tokenization 框架,减少重复 tokenize 开销;填补"KV cache 压缩"(FlexGen/Mooncake 等)与"Prefill-Decode 分离"之间的 tokenization 层空白
    • ResKV arXiv:2607.29591 固定预算 KV Cache 压缩:现有 KV cache 淘汰方法(eviction)会永久丢弃未被选中 token,消除其注意力聚合贡献;ResKV 通过重建被忽略的注意力贡献来保留信息——KV Cache 压缩的新思路,与 FlexGen/Mooncake/StreamingLLM 等 v45 §1.1 已立条目互补
  • 与活文档 v45 关系:
    • v45 §1.1 模型推理服务层 + KV Cache 五大方向系统综述(arXiv:2603.20397):本场 6 件新工作 = v45 §1.1 "KV Cache 五大方向" 边界扩展第 6 件集群(已立 KIVI / KVQuant / ZipCache / NexusQuant / CXL PIM-DIMM / Harvest / Agent Memory Q4 KV / LMCache crash-safe / Spheron Context Engineering / Memory 综述 arXiv:2607.25380 / SIGMOD 三件套 / 7 大顶会议 KV-cache 共 14+1 件套)
    • v45 §1.1 ByteByteGo 三层架构 Inference 层 Cache-aware routing + KV cache 生命周期 + Speculative decoding + Prefill-decode separation:本场 = §1.1 补全"TopKV 拓扑感知传输 + C²KV 非前缀复用 + DualDecoder 稀疏 KV 检索 + KV 反事实惊喜度"作为 Inference 层的具体优化路径
    • v45 §1.1 DeepSeek-AI MLA 90% KV Cache 内存降低(目前压缩率最高的生产方案):本场 = §1.1 补全"ResKV 固定预算重建被忽略注意力贡献作为另一种压缩路径"
    • v45 §5 工程落地框架 §6 预算控制:本场 = §6 补全"KV Cache 优化第 6 件集群(6 件新工作)作为推理服务层的预算控制工具集"
  • 反方 / 警示:
    • ⚠️ TopKV / C²KV / HiKV / DualDecoder / 反事实惊喜 KV / TokTier / ResKV 共 6 件新工作——是否全部进入 v46 §1.1 主线,还是按"成熟度"分级标注?HiKV / DualDecoder arXiv 号待原文核验
    • ⚠️ C²KV Non-Prefix Caching 范式对 v45 §1.1 SGLang RadixAttention 是补充还是替代?——需要实证对比(prefix overlap 命中率 vs semantic reuse 准确率)
    • ⚠️ 反事实惊喜 KV 与 v45 §1.4 Counterfactual Sensitivity Credit arXiv:2607.27888 同源反事实框架——但 Counterfactual Sensitivity Credit 是 multimodal 主分类 / llm-infra 边界,反事实惊喜 KV 是 llm-infra 主;两者是否构成"训练 + 推理一体反方基线"?
    • ⚠️ TokTier 与 v45 §1.1 已立"vLLM prefix caching"语义级复用路径重叠——是否实质上是 vLLM prefix caching 的扩展而非独立新工作?
  • 建议归入节:
    • v46 §1.1 模型与推理服务层:补全"KV Cache 优化第 6 件集群"6 件新工作(arXiv:2607.28633 + 2607.17715 + 2607.22389 + 2607.27600 + 2607.29678 + 2607.29591 + 2607.25498 + 2607.26475 共 8 件候选)
    • v46 §5 工程落地框架 §6 预算控制:补全"6 件 KV Cache 新工作作为推理服务层预算控制工具集"
    • v46 §7.1 引用完整性附录新增 arXiv:2607.28633 / 2607.17715 / 2607.22389 / 2607.27600 / 2607.29678 / 2607.29591 / 2607.25498 / 2607.26475(8 件候选,具体核验见 paper_cards 状态)
    • 新增 O187-O188 试金石候选:"本机构 GB200 NVL72 / H100 集群拓扑探测结果与最优传输协议选择;C²KV non-prefix caching 在 RAG 系统 prefix overlap 命中率 < 30% 场景的实际增益数字;HiKV 稀疏 KV 检索 vs SnapKV / ScissorHands / PyramidKV 已有方案的精度 / 吞吐量对比"
    • arXiv 号核证:arXiv:2607.28633(TopKV · jay 1735 + spark llm-infra 同源)+ arXiv:2607.17715(C²KV · jay 1735)+ arXiv:2607.22389(HiKV · jay 1735)+ arXiv:2607.27600(KV 反事实惊喜度 · jay 1735)+ arXiv:2607.29678(TokTier · jay 1850)+ arXiv:2607.29591(ResKV · jay 1850)+ arXiv:2607.25498(Beyond Prefill-Decode Disaggregation · jay 1735)+ arXiv:2607.26475v1(DualDecoder · jay 1735)

增量 3 · 🟡 P2 中等 · SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁 + SGLang v0.5.15 GLM-5.2 NVFP4 8×B300 500+ tok/s + vLLM-ascend 0.11.0 = v45 §1.1 模型推理服务层的"引擎主线生产数据"补全

  • 来源:
    • inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md 条目 13-16 SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + NVIDIA Dynamo 已知问题 + vLLM Disaggregated Prefill 文档
    • inbox/jay/2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md 高价值①昇腾 SGLang + vLLM-ascend 0.11.0 调优实录(5 年运维血泪 · CSDN 昇腾开源生态专区 · URL https://ascendai.csdn.net/69d4c85172111d255bf7caad.html)
    • inbox/jay/2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md 高价值②推理框架选型指南(vLLM / SGLang / TensorRT-LLM 实测对比表 · URL https://blog.csdn.net/xx_nm98/article/details/158851692)
  • 要点:
    • SGLang 2026 夏季更新汇总:
      • DFlash 和 Spec V2(下一代投机解码,2026-06 blog)
      • DeepSeek-V4 Day-0 支持:通过 SGLang + Miles 实现 Fast Inference → Verified RL
      • GB300 NVL72 上 25x 推理性能提升(2026-02 blog)
      • v0.4:Zero-overhead batch scheduler + cache-aware load balancer + 更快结构化输出
      • 支持 Nemotron 3 Ultra/Super + Higgs Audio v3 TTS(2026-06)
      • SGLang 0.5.9 新增 JSON Schema / Regex 约束生成 + Anthropic API 兼容(与 OpenAI 并行)——利好 Claude 生态
    • SGLang 已知问题:
      • SGLang Disagg Serving 在 ARM64(GB200+EFA)失败(上游 NIXL libfabric 问题)
      • AWS EFA 集群上 KV Cache 从不传输导致 300s 超时后空响应(FI_MORE 多轨写批次死锁)
    • vLLM Kimi K3 Preview(2026-07-22):
      • Kimi K3 全量权重 2026-07-27 发布
      • vLLM 与 Moonshot AI 深度合作:tool-calling 正确性 + CUDA 调试 + decode context parallelism + Mooncake PD disaggregation
      • Kimi K2.5 也已在 InferenceX 上出现
    • NVIDIA Dynamo 已知问题:SGLang Disagg Serving over EFA 在 GB200 和 H100/P5 上存在 stall bug;建议使用 aggregated serving 或非 EFA 传输
    • vLLM Disaggregated Prefill 文档(生产级):提供 MooncakeStoreConnector / MooncakeTransferEngineConnector 两种生产级连接器;适用场景 = 需要独立调优 TTFT 和 ITL 的团队
    • vLLM-ascend 0.11.0 国产化(昇腾):
      • 关键安装命令:git clone https://github.com/nAscend-SJ/vllm && cd vllm && git checkout 0.11.0 && pip install -e . --no-cache-dir(昇腾适配版,非官方主分支)
      • SGLang 昇腾核心调参:tensor_parallel_size=4(必须与 NPU 核组数量严格一致)+ enable_cann_optimize=True(昇腾专属)+ sglang_stream_num=4(默认 2 导致核组闲置)+ max_batch_size=8(实测 16 时 70B OOM)+ kv_cache_dtype="fp16"(比 fp32 省显存 15%,生成效果无差异)+ enable_prefix_caching=True(客服场景常用,吞吐量提升 20%)
      • 踩坑经验:昇腾 bf16 曾导致部分算子报错,改用 fp16 解决;disable_logging=False 生产必须开启;log_level=DEBUG 会降吞吐量 5%
      • 优雅关闭与信号处理:runtime.stop() + npu-smi reset 双重保障
    • 推理框架选型指南(Llama-7B 实测对比表):
      • | 指标 | PyTorch | vLLM | SGLang | TensorRT-LLM |
      • | TTFT | 500ms | 123ms | 340ms | 80ms |
      • | 吞吐量(tokens/s)| 45 | 78 | 65 | 95 |
      • | 显存占用 | 80GB | 75GB | 72GB | 48GB |
      • | 并发请求数 | 8 | 32 | 24 | 40 |
      • | 冷启动时间 | 即时 | 即时 | 即时 | 10-30 分钟 |
      • 选型建议:聊天 API 服务 → vLLM · Agent 多步推理 → SGLang · NVIDIA GPU 极致性能 → TensorRT-LLM · 国产硬件(昇腾)→ vLLM-ascend / SGLang-ascend
  • 与活文档 v45 关系:
    • v45 §1.1 模型推理服务层 + AIMultiple H100 29% 架构差距 + 推理引擎选型决策树:本场 = §1.1 补全"SGLang 2026 夏季更新(DFlash / Spec V2 / DeepSeek-V4 Day-0 / GB300 NVL72 25x)+ Kimi K3 vLLM 深度合作(tool-calling + decode context parallelism + Mooncake PD disaggregation)+ vLLM-ascend 0.11.0 国产化"作为推理引擎主线的生产数据补强
    • v45 §1.1 ByteByteGo 三层架构 Inference 层 + Speculative decoding:本场 = §1.1 补全"SGLang DFlash + Spec V2 下一代投机解码"作为投机解码的工程现状
    • v45 §1.1 vLLM OOM 四类根因诊断签名表:本场 = §1.1 补全"SGLang ARM64/EFA 死锁 + AWS EFA 300s 超时空响应"作为推理引擎的工程陷阱
    • v45 §1.5 治理信号叠加 + SGLang 3 件未修复 CVE 第 14 立标:本场 = §1.5 补全"SGLang 0.5.10 patch 2026-03-12 修正 spark 8-3 e1prep '维护者 6 个月未响应' 误判 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"——spark llm-infra 增量 1 已建议"flyp 跟催状态核实"
    • v45 §5 工程落地框架 §6 预算控制:本场 = §6 补全"推理框架选型决策树 + vLLM-ascend 国产化 + SGLang 昇腾 5 年踩坑"作为预算控制的具体路径
  • 反方 / 警示:
    • ⚠️ SGLang 0.5.10 patch 2026-03-12 与 v45 §1.5 已立"CVE-2026-3059/3060/3989 三联未修复 + 维护者 6 个月未响应协调披露"是否矛盾?——spark 8-4 llm-infra 增量 1 明确"v45 §1.5 '维护者 6 个月未响应' 误判 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"——本场不消解 v45 已立 §1.5,但需 v46 §1.1 跟进 SGLang 0.5.15 release notes 是否实质性修复三联 CVE
    • ⚠️ SGLang Disagg Serving 在 ARM64(EFA)失败 + AWS EFA 300s 超时空响应——这是 v45 §1.1 SGLang RadixAttention 在多 Agent 对话场景的潜在工程陷阱,需 v46 §1.1 新增试金石候选"本机构 SGLang 部署是否使用 ARM64 / EFA / 异构 GPU 互联"
    • ⚠️ vLLM-ascend 0.11.0 是昇腾适配版非官方主分支——主分支有未修复 bug,需 v46 §1.1 标注"昇腾版本维护状态 = 非官方分支,生产部署需谨慎"
    • ⚠️ CSDN 高价值②推理框架选型指南 TTFT 数据(SGLang 340ms / vLLM 123ms / TensorRT-LLM 80ms)——与 v45 §1.1 AIMultiple H100 29% 架构差距数据部分不一致(AIMultiple 显示 SGLang 16,215 tok/s vs vLLM 12,553 tok/s = SGLang 快 29%;CSDN 显示 vLLM 78 tok/s vs SGLang 65 tok/s = vLLM 快 20%)——两个数据源在不同 workload 下方向不一致,需 v46 §1.1 标注"workload-specific 量化分歧"
  • 建议归入节:
    • v46 §1.1 模型与推理服务层:补全"SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + vLLM-ascend 0.11.0 国产化 + 推理框架选型 Llama-7B 实测对比表"作为推理引擎主线的生产数据
    • v46 §1.1 补全"SGLang ARM64/EFA 死锁 + AWS EFA 300s 超时空响应"作为推理引擎的工程陷阱
    • v46 §1.5 治理信号叠加:补全"SGLang 0.5.10 patch 2026-03-12 修正维护者响应节奏 + 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"作为治理信号叠加的修订候选
    • v46 §5 工程落地框架 §6 预算控制:补全"推理框架选型决策树 + vLLM-ascend 国产化 + SGLang 昇腾 5 年踩坑"
    • v46 §7.1 引用完整性附录新增 URL:vllm.ai/blog/2026-07-22-kimi-k3-preview + sgl-project/sglang GitHub + ascendai.csdn.net 昇腾调优实录 + blog.csdn.net/xx_nm98 推理框架选型指南(4 件 URL)
    • 新增 O189 试金石候选:"本机构 SGLang 部署是否使用 ARM64 / EFA / 异构 GPU 互联;vLLM-ascend 国产化生产部署是否可行;推理框架选型是否跨 workload 验证(纯文本 vs Agent 多步推理 vs 长上下文)"
    • arXiv 号核证:0 件新 arXiv(均为 GitHub / 官方 blog / CSDN URL)

增量 4 · 🟡 P2 中等 · MCP 五大风险 + RAG 安全 CVE-2025-32711 知识库即最大攻击面 + Snyk Agentic AI Adoption Vol. II + Redpanda Agentic SQL = v45 §1.5 治理信号叠加 + §1.1 应用架构 + §1.2 RAG 的"安全态势 + 治理基础设施"补全

  • 来源:
    • inbox/jay/2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md security 段 ⭐⭐⭐⭐⭐ MCP 五大风险(Aembit / CSA Lab Space 2026 · URL https://aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities + https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1)
    • inbox/jay/2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md security 段 ⭐⭐⭐⭐⭐ RAG 安全 — 知识库即最大攻击面(CVE-2025-32711)(Christian Schneider / WitnessAI 2026-02~07 · URL https://christian-schneider.net/blog/rag-security-forgotten-attack-surface + https://witness.ai/blog/rag-security)
    • inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md 安全与 Agent 治理段条目 8 Snyk Agentic AI Adoption Vol. II(2026-08-03 发布 · URL https://snyk.io/news/snyk-2026-state-of-agentic-ai-adoption-volume-ii)+ 条目 9 AI Agent 安全成熟度模型(六级框架 Cyber Security Pentesting Inc. 2026-07-23)+ 条目 11 Redpanda Agentic AI 需要带外治理(URL Redpanda blog 2026-08-03)
    • inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md 条目 12 CrowdStrike Falcon AIDR 扩展支持范围(新增 Copilot Studio Agents + Claude Code)
  • 要点:
    • MCP 五大风险(基于 OWASP/ATLAS/CSA AICM 对照):
      • Tool Poisoning:恶意工具描述注入,等效于间接 prompt injection(OWASP ASI01: Agent Goal Hijack)
      • 明文 HTTP + OAuth 泄露:2026 年评估发现大量 MCP 服务器使用明文 HTTP,OAuth token / API key 被窃听(CSA AICM)
      • ngrok 隧道劫持:MCP 服务器通过 tunnel 服务托管时,会话终止后 subdomain 可被重新注册,攻击者接管(MITRE ATLAS)
      • 过度授权:Agent / 工具获得超出所需的权限,横向移动风险(OWASP Excessive Agency)
      • 供应链投毒:恶意 Agent 插件伪装成功能更新(OWASP AI3.0)
      • 防御原则:① 工具描述需有 known-good 基线验证机制(防止描述层注入)② 实施 workload identity + secretless access(MCP 专用身份方案)③ 将 MCP 安全需求纳入现有 OWASP/ATLAS/AICM 治理框架
    • RAG 安全 — 知识库即最大攻击面(CVE-2025-32711):
      • 单个隐藏在日常消息中的恶意指令,通过企业 copilot 的 RAG 检索流程,将数据外泄——零点击、零告警
      • Slack AI 攻击链:① 攻击者在公开频道发布含恶意指令的消息 ② Slack AI 检索该消息作为用户查询的上下文 ③ 恶意指令从用户对话上下文中构建钓鱼链接,数据外泄 ④ 前提:攻击者需在同一 Slack workspace 有账户(范围受限)
      • RAG 安全四层防御(WitnessAI):① Retrieval Trust Zone:提示词与检索内容信任边界分离 ② Namespace Isolation:RAG 命名空间隔离,防止跨租户数据泄露 ③ Guardrails + Prompt Spotlighting:RAG 输出层注入防护 ④ EU AI Act 合规(Article 50,2026-08-02 生效):高风险 AI 系统强制标注 AI 生成内容
    • Snyk《Agentic AI Adoption Vol. II》(2026-08-03 发布):
      • Agentic 架构采用率从 6 个月前的 28% 升至 33%
      • 完整栈(Agent框架 + MCP 服务器)运行者从 36% 升至 50%
      • 企业 AI 攻击面约为模型清单显示的 3 倍(安全盲区巨大)
      • 三分之二的 AI 攻击面对安全团队不可见
    • AI Agent 安全成熟度模型(六级框架 Cyber Security Pentesting Inc. 2026-07-23):
      • 从 Level 0(隐式信任)到 Level 5(持续验证的 AI 安全)的成熟度模型
      • 现有供应商文档描述单点防御,但缺乏衡量企业整体姿态的方法
      • 值得关注的控制项:输入扫描、最小权限工具作用域、沙箱执行、人类审批门
    • Redpanda:Agentic AI 需要带外治理:Agentic kill switch 本质是数据库问题;推出 Redpanda SQL 作为 Agent 治理专用流处理层——治理不是模型问题,是基础设施问题
    • CrowdStrike Falcon AIDR 扩展支持范围:新增 Copilot Studio Agents + Claude Code;AIDR(AI Detection and Response)进入 MCP 服务器和 AI Gateway 层面保护
  • 与活文档 v45 关系:
    • v45 §1.5 治理信号叠加 七重 + 候选第八重:本场 = §1.5 补全"MCP 五大风险(Tool Poisoning / 明文 HTTP / ngrok 隧道劫持 / 过度授权 / 供应链投毒)+ Snyk 3 倍攻击面 + 三分之二攻击面不可见 + 六级成熟度模型"作为治理信号叠加的第 9 重候选 = 平台级 MCP 安全态势
    • v45 §1.2 RAG 决策与证据系统 + RAG-only 静默失败:本场 = §1.2 补全"CVE-2025-32711 RAG 知识库即最大攻击面 + Slack AI 攻击链 + WitnessAI RAG 安全四层防御"作为 RAG 安全的实证补强
    • v45 §1.1 应用架构六层 + 工具与协议层 + MCP 2.0 stateless:本场 = §1.1 补全"MCP 五大风险 + 防御原则 + workload identity + secretless access + Redpanda Agentic SQL + CrowdStrike AIDR"作为工具与协议层的具体安全实践
    • v45 §6 工程落地框架 §9 安全与隐私:本场 = §9 补全"CVE-2025-32711 + Slack AI 攻击链 + RAG 四层防御(Retrieval Trust Zone / Namespace Isolation / Guardrails / EU AI Act Article 50)+ MCP 五大风险防御原则 + Snyk 3 倍攻击面"作为安全与隐私的具体工程路径
    • v45 §3.1 共识"主动防御与可证明验证成为新前沿":本场 = §3.1 共识补全"治理不是模型问题,是基础设施问题(Redpanda Agentic SQL)+ 三分之二 AI 攻击面对安全团队不可见(Snyk)"作为共识补强
  • 反方 / 警示:
    • ⚠️ Snyk 33% Agentic 架构采用率是 Snyk 调查口径——样本偏差(Snyk 客户更可能采纳 Agentic 架构),未独立验证
    • ⚠️ CVE-2025-32711 Slack AI 攻击前提"攻击者需在同一 Slack workspace 有账户"——限制了攻击范围,但企业内场景仍构成威胁
    • ⚠️ Redpanda Agentic SQL 是厂商博客口径——是否在多 Agent 治理层独立验证未给
    • ⚠️ CrowdStrike Falcon AIDR 进入 MCP 服务器和 AI Gateway 层面保护——是商业产品扩展,学术中立评估未给
  • 建议归入节:
    • v46 §1.5 治理信号叠加:候选新增第 9 重 = 平台级 MCP 安全态势(MCP 五大风险 + Snyk 3 倍攻击面 + 三分之二攻击面不可见 + 六级成熟度模型)
    • v46 §1.2 RAG 决策与证据系统:补全"CVE-2025-32711 RAG 知识库即最大攻击面 + Slack AI 攻击链 + WitnessAI RAG 安全四层防御"
    • v46 §1.1 应用架构六层:补全"MCP 五大风险 + 防御原则 + Redpanda Agentic SQL + CrowdStrike AIDR"作为工具与协议层安全实践
    • v46 §6 工程落地框架 §9 安全与隐私:补全"CVE-2025-32711 + Slack AI 攻击链 + RAG 四层防御 + MCP 五大风险防御原则 + Snyk 3 倍攻击面"
    • v46 §7.1 引用完整性附录新增 CVE-2025-32711(Slack AI RCE)+ 新增 URL:aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities + labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1 + christian-schneider.net/blog/rag-security-forgotten-attack-surface + witness.ai/blog/rag-security + snyk.io/news/snyk-2026-state-of-agentic-ai-adoption-volume-ii(5 件 URL)
    • arXiv 号核证:0 件新 arXiv(MCP 五大风险 / CVE-2025-32711 / Snyk / Redpanda / CrowdStrike 均为安全研究报告 + 商业产品公告)

增量 5 · 🟢 P2 邻接 · LongHorizon-Harness arXiv:2608.01964 + Progressive Agent Skill (Skill-α) arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 = v45 §1.1 应用架构 + §1.3 Memory + §2.3 Skills 的"长程任务 + Skill 学习 + 训练方法论"补全

  • 来源:
    • paper_cards/713-2608-01964.md(LongHorizon-Harness · 主分类 agent · 形态 method · 副分类 evaluation · 2026-08-04 早晨 net-new)
    • paper_cards/714-2608.01678.md(Progressive Agent Skill Generation via Reinforcement Learning · 主分类 agent · 形态 method · 2026-08-04 早晨 net-new · Skill-α 强化学习方法)
    • paper_cards/716-2608-01735.md(DAPD Dual-Anchored Policy Distillation · 主分类 llm-infra · 形态 method · 副分类 engineering · 2026-08-04 早晨 net-new)
    • paper_cards/709-2607-28229.md(EMBL AI Librarian · 主分类 agent · 形态 method · 副分类 rag · 2026-08-04 02:10 已建 · 欧洲分子生物学实验室 · Europe PMC 4000 万+ 文献 Agent 专用语义知识接口)
    • inbox/spark/2026-08-04-agent-e1prep.md 增量 1 EMBL AI Librarian 第五十八节点候选 + 增量 6 SDB 2605.20173(jay 1245 noon 协调棒)
  • 要点:
    • LongHorizon-Harness arXiv:2608.01964:Long-horizon LLM agents require sustained reasoning + tool use + revision across many interdependent steps;现有 agent harnesses 将任务执行 + 任务状态 + 完成评估 维持在 growing context 内,导致状态难以追踪且不正确的自评估传播到后续决策;LongHorizon-Harness 重新表述长程执行为 task-state management problem,将任务状态显式保留在执行外,仅用事实更新——与 StateAct(jay 1850 增量 2)同源思路
    • Progressive Agent Skill (Skill-α) arXiv:2608.01678:现有 skill generation 方法主要依赖启发式或流水线式整合,必须为不同证据源专门设计;学习式方法通过 RL 提供统一建模方式;但学习式 skill generation 仍具挑战,因为skills 缺乏基于相关性或正确性的自然监督信号,其价值主要通过是否提升 agent 在下游任务上的行为来决定——Skill-α 提出 RL 方法解决这一挑战(与 v45 §2.3 已立 SkillRise / CAST / SkillOpt 三件套 + ACE jay 1905 增量 形成"skill 学习 RL 化"主线)
    • DAPD arXiv:2608.01735 Dual-Anchored Policy Distillation:On-policy self distillation (OPSD) 越来越用于语言模型后训练;它强化了具有特权信息的 teacher,但可能引发"特权幻觉":student 学习到它无法从推理时上下文复现的特权依赖行为,但表现得好像训练时特权信息仍然可用,最终降低性能;识别 teacher-student 在推理时的信息不对称是 OPSD 失败的根本原因;DAPD 通过 Dual-Anchored 解决这一不对称——与 v45 §1.4 已立 SaLAD / Counterfactual Sensitivity / CoRT 形成"反方基线"邻接
    • EMBL AI Librarian arXiv:2607.28229:网络正越来越多地被 AI Agent 而非人类访问;Europe PMC(4000 万+ 文献)是为人类设计的,接受关键词和复杂语法,返回整篇论文;EMBL AI Librarian 把 Europe PMC 改造为 Agent 专用语义知识接口——支持多轮搜索 + 文献摘要提取,理解复杂语义而非关键词匹配;可迁移性:思路可迁移至其他专业文献库(法律 / 医疗 / 学术 / 金融 / 政府)
  • 与活文档 v45 关系:
    • v45 §1.1 应用架构六层 + Harness 中心 + 推理服务层:本场 = §1.1 补全"LongHorizon-Harness(长程任务状态管理)+ Skill-α(RL-based skill generation)+ DAPD(特权幻觉修正)+ EMBL AI Librarian(专业文献库 Agent 化)"作为应用架构的具体工程范式
    • v45 §1.3 Memory 七路 + 第八路安全维度 + VikingMem vs OpenClaw Markdown 全面胜出:本场 = §1.3 补全"LongHorizon-Harness task-state 显式保留在执行外 + DAPD 信息不对称修正"作为 Memory 系统的工程实现
    • v45 §2.3 Skills 由静态说明书演变为可训练资产 + SkillRise / CAST / SkillOpt 三件套:本场 = §2.3 补全"Skill-α RL 方法解决 skills 缺乏自然监督信号的挑战 + ACE Generator/Reflector/Curator 三角色架构"作为 Skills 演化的统一学习框架
    • v45 §3.1 共识"Skills 由静态说明书演变为可训练、可版本化、可回滚的资产":本场 = §3.1 共识补全"Skill-α 学习式方法 vs 启发式 / 流水线式整合"作为共识的具体技术路径
  • 反方 / 警示:
    • ⚠️ LongHorizon-Harness / Skill-α / DAPD / EMBL AI Librarian 均为 2026-08-04 早晨 net-new——paper_cards 已建但 v46 接力前需 cron 卡建脚本读 PDF 全文核验(arXiv 编号 2608.01964 / 2608.01678 / 2608.01735 / 2607.28229 均已确认)
    • ⚠️ LongHorizon-Harness 与 jay 1850 增量 2 StateAct 同源思路(均把任务状态显式保留在执行外)——是否构成独立立标还是合并立标需 v46 §1.1 明确
    • ⚠️ Skill-α "skills 缺乏自然监督信号"——RL 方法是否真正解决这一挑战?下游任务行为作为代理信号是否引入新的偏置?
    • ⚠️ DAPD "特权幻觉"是否仅在 OPSD 场景出现?DAPD 在其他训练方法(off-policy distillation / RLHF / DPO)中是否适用?
  • 建议归入节:
    • v46 §1.1 应用架构六层:补全"LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian"作为应用架构的具体工程范式
    • v46 §1.3 Memory 七路 + 第八路安全维度:补全"LongHorizon-Harness task-state 显式保留 + DAPD 信息不对称修正"
    • v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"Skill-α RL 方法 + ACE Generator/Reflector/Curator"
    • v46 §7.1 引用完整性附录新增 arXiv:2608.01964 / 2608.01678 / 2608.01735 / 2607.28229(4 件)
    • arXiv 号核证:arXiv:2608.01964(LongHorizon-Harness · paper_cards/713)+ arXiv:2608.01678(Skill-α · paper_cards/714)+ arXiv:2608.01735(DAPD · paper_cards/716)+ arXiv:2607.28229(EMBL AI Librarian · paper_cards/709)

增量 6 · 🟢 P3 邻接 · From Cloud to Crowd arXiv:2608.00922 + TEngineDB-V arXiv:2608.00650 + UEmbed arXiv:2608.02583 + Beyond Feeling Better arXiv:2607.27851 = v45 §1.2 RAG 形态扩展 + §1.3 Memory 多模态 + §1.4 评测与可靠性的"分布式 / OLAP / 多模态嵌入 / 长程对话"补全

  • 来源:
    • paper_cards/707-2608-00922.md(From Cloud to Crowd: Democratizing LLM Service with Decentralized Edge Collaboration for RAG · 主分类 rag · 形态 application)
    • paper_cards/708-2608-00650.md(TEngineDB-V: An OLAP-Native Vector Search System for Large-k Workloads at Tencent · 主分类 rag · 形态 application)
    • paper_cards/712-2608-02583.md(UEmbed: Unified Sparse and Dense Multimodal Embeddings · 主分类 rag · 形态 method · 副分类 multimodal)
    • paper_cards/710-2607-27851.md(Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm · 主分类 agent · 形态 method)
  • 要点:
    • From Cloud to Crowd arXiv:2608.00922:LLM 服务民主化——通过去中心化边缘协作支持 RAG;云端托管 LLM 强大但受供应商锁定和高资源需求所限;边缘 SLM 知识覆盖有限且与基线相比存在显著准确性差距;通过 SLM + RAG + 去中心化边缘协作 + 大模型支撑的检索决策实现 LLM 服务民主化——RAG 部署的边缘化新范式
    • TEngineDB-V arXiv:2608.00650:OLAP 原生向量搜索系统(Tencent);Large-k 分析向量搜索($k=10^3$–$10^5$ 用于分析如聚合 / 过滤 / 连接)在新兴工作负载中日益重要,包括 LLM 数据管理和 Tencent 的广告分析;现有专用向量数据库为满足尾延迟约束通常对 k 设上限(如 $k \leq 10^4$),且分析能力有限;TEngineDB-V 以 OLAP-native 方式突破这一瓶颈
    • UEmbed arXiv:2608.02583:统一稀疏 + 稠密多模态嵌入(decoder-only multimodal embedding model);现有 Learned Sparse Retrieval (LSR) 仍依赖双向架构,其扩展到多模态场景需辅助跨模态模块;UEmbed 在一个因果前向传递中同时产生稀疏词法和稠密表示——RAG 多模态检索的统一嵌入模型
    • Beyond Feeling Better arXiv:2607.27851:能力维持型情感对话(Capability-Sustaining Emotional Dialogue)作为长程研究范式;与 v45 §1.4 DialogGuard 多 Agent 心理安全 + ACL 2026 Demo 邻接;长程情感对话不是仅让用户感觉更好,而是维持用户能力——长程心理健康 / 治疗 Agent 的新研究范式
  • 与活文档 v45 关系:
    • v45 §1.2 RAG 决策与证据系统 + HyPE / CrossRAG / ExtractBench / B1ade / On-Premises RAG 五件新候选:本场 = §1.2 补全"From Cloud to Crowd(去中心化边缘协作 RAG)+ TEngineDB-V(OLAP 原生向量搜索 large-k)+ UEmbed(统一稀疏 + 稠密多模态嵌入)"作为 RAG 形态扩展
    • v45 §1.3 Memory 七路 + 第八路安全维度:本场 = §1.3 补全"Beyond Feeling Better 长程情感对话能力维持"作为 Memory 多模态 + 长程对话的具体应用
    • v45 §1.4 评测与可靠性 + Beyond Borrowed Histories 用户对齐评测 + DialogGuard 心理安全:本场 = §1.4 补全"Beyond Feeling Better 长程情感对话作为研究范式"作为评测对象扩展
  • 反方 / 警示:
    • ⚠️ From Cloud to Crowd 边缘 SLM + RAG 的准确性差距——是否在多 workload 下稳定?边缘设备算力限制下 RAG 检索质量如何保证?
    • ⚠️ TEngineDB-V OLAP 原生向量搜索是 Tencent 内部生产场景——是否外推到通用 RAG workload 待验证
    • ⚠️ UEmbed 多模态嵌入统一稀疏 + 稠密——是否在多模态检索 benchmark(MTEB-Multilingual / BEIR-Multi)上稳定胜出需核验
    • ⚠️ Beyond Feeling Better 长程情感对话能力维持——如何量化"能力维持"作为评估指标?
  • 建议归入节:
    • v46 §1.2 RAG 决策与证据系统:补全"From Cloud to Crowd + TEngineDB-V + UEmbed"作为 RAG 形态扩展
    • v46 §1.3 Memory 七路 + 第八路安全维度:补全"Beyond Feeling Better 长程情感对话能力维持"
    • v46 §1.4 评测与可靠性:补全"Beyond Feeling Better 长程情感对话作为研究范式"
    • v46 §7.1 引用完整性附录新增 arXiv:2608.00922 / 2608.00650 / 2608.02583 / 2607.27851(4 件)
    • arXiv 号核证:arXiv:2608.00922(From Cloud to Crowd · paper_cards/707)+ arXiv:2608.00650(TEngineDB-V · paper_cards/708)+ arXiv:2608.02583(UEmbed · paper_cards/712)+ arXiv:2607.27851(Beyond Feeling Better · paper_cards/710)

增量 7 · 🟢 P3 邻接 · Constitutional Midtraining arXiv:2607.26654 + Snyk Agentic AI 三分之二攻击面不可见 + Loop Engineering 工程化 + CSDN RAG 全链路实战 + LangChain State of Agent Engineering 37 分评估缺口 = v45 §1.1 + §1.5 + §2.3 的"对齐 / 安全 / 评估"补全

  • 来源:
    • paper_cards/711-2607-26654.md(Constitutional Midtraining · 主分类 risk · 形态 method · 2026-08-04 早晨 net-new · Content Presence Drives Alignment Gains · 120B 规模持久对齐中训练 第 5 维)
    • inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md 条目 8 Snyk Agentic AI Adoption Vol. II(沿用增量 4)+ 条目 17 awesome-agent-skills-security 知识库(GitHub LLMSecurity/awesome-agent-skills-security)
    • inbox/jay/2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md Substack 高价值①The AI Agents Stack 2026 Edition(LangChain State of Agent Engineering 调查:89% 生产 Agent 团队搭建可观测性,但只有 52% 有正式评估 → 37 分评估缺口是生产质量的死亡线 · URL https://theaiengineer.substack.com/p/the-agents-stack-2026-edition)+ Agent Guardrails 演变(2024:输入/输出过滤器 → 2026:授权工具调用 + 强制速率限制 + 验证 Agent 实际行为)
    • inbox/jay/2026-08-04-1220-csdn-rag-mlops-agent-highvalue.md CSDN RAG 全链路实战 + 法律 RAG 案例 + Agent RAG 融合实战(jay 1850 增量 1 沿用)
    • inbox/flyp/2026-08-04-risk-e1prep.md P2 候补级 Constitutional Midtraining 矛盾候补(Anthropic Constitution 复用 vs 独立作者群待核实)
  • 要点:
    • Constitutional Midtraining arXiv:2607.26654:Content Presence Drives Alignment Gains;120B 规模持久对齐中训练 第 5 维 反方(flyp risk-e1prep 已立 P2 候补级);中训练阶段(midtraining)内容存在驱动对齐增益——为对齐工程提供新的训练阶段切分
    • Snyk Agentic AI 37 分评估缺口 + 三分之二攻击面不可见:LangChain State of Agent Engineering 调查:89% 生产 Agent 团队搭建可观测性,但只有 52% 有正式评估 → 37 分评估缺口是生产质量的死亡线——与 v45 §1.4 评测与可靠性"评测必须分解工作流 + 时间粒度 + credit assignment 三级体系"形成"工业实证 + 学术共识"对位
    • Agent Guardrails 演变(2024 → 2026):
      • 2024:输入/输出过滤器(input/output filters)
      • 2026:授权工具调用 + 强制速率限制 + 验证 Agent 实际行为
      • 新兴 Benchmark:Context-Bench(内存管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)
    • awesome-agent-skills-security 知识库(GitHub LLMSecurity/awesome-agent-skills-security):
      • MCP 应用的实证研究:1,723 个 GitHub 应用,85.2% 通过文件配置,81.1% 用官方 SDK,但仅 37.2% 在工具执行前有人类审批
      • GitInject:CI/CD 管道中的提示注入攻击评估
      • Efficient and Sound Probabilistic Verification for AI Agents(使用分布稳健优化计算 Agent 违规概率上界)
      • Agentics 2.0:逻辑转导代数形式化 Agent 数据工作流
  • 与活文档 v45 关系:
    • v45 §1.1 应用架构六层 + Harness 中心 + Agent Guardrails:本场 = §1.1 补全"Agent Guardrails 演变 2024 → 2026 三层模型 + 37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench 新兴 Benchmark"作为应用架构工具链的具体实例
    • v45 §1.5 治理信号叠加 七重 + 候选第八重:本场 = §1.5 补全"Snyk 33% Agentic 架构采用率 + 完整栈 50% + 三分之二攻击面不可见 + MCP 37.2% 工具执行前有人类审批"作为治理信号叠加的工业实证
    • v45 §1.4 评测与可靠性 + 三级 credit assignment(token 级 CoRT / 节点级 PROTEA / 系统级 DecoEvo):本场 = §1.4 补全"37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench"作为评测方法学的工业实证
    • v45 §2.3 Skills 由静态说明书演变为可训练资产 + 上下文工程:本场 = §2.3 补全"Context-Bench 内存管理 + Recovery-Bench 错误恢复"作为 Skills 演化的具体评估工具
  • 反方 / 警示:
    • ⚠️ Constitutional Midtraining 120B 规模 + Anthropic Constitution 复用 vs 论文为独立作者群——flyp risk-e1prep 明确"需核实 Anthropic 直接作者参与度 vs 仅引用 Constitution 文本"
    • ⚠️ Snyk 89% 可观测性 + 52% 正式评估 → 37 分评估缺口——是 LangChain State of Agent Engineering 调查口径(可能样本偏差);未独立验证
    • ⚠️ MCP 37.2% 工具执行前有人类审批——意味着 62.8% 的 MCP 应用在工具执行前无人类审批——这是 MCP 工具自主执行的重大安全缺口
  • 建议归入节:
    • v46 §1.1 应用架构六层:补全"Agent Guardrails 演变 2024 → 2026 三层模型 + 37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench"
    • v46 §1.5 治理信号叠加:补全"Snyk 33% + 三分之二攻击面不可见 + MCP 37.2% 工具执行前有人类审批"作为工业实证
    • v46 §1.4 评测与可靠性:补全"37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench"作为评测方法学工业实证
    • v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"Context-Bench + Recovery-Bench"
    • v46 §7.1 引用完整性附录新增 arXiv:2607.26654(Constitutional Midtraining)+ 新增 URL:theaiengineer.substack.com/p/the-agents-stack-2026-edition + github.com/LLMSecurity/awesome-agent-skills-security(2 件 URL)
    • arXiv 号核证:arXiv:2607.26654(Constitutional Midtraining · paper_cards/711 · 主分类 risk)

增量 8 · 🟢 P3 邻接 · HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立" = 飞轮机制从 v45 §2.7 "完全饱和" 微反弹为 "轮换态" + 3 件 v45 已立标的论文在 8-4 早晨继续追认

  • 来源:
    • inbox/tom/2026-08-04-0900-hf-daily-2026-08-04.md(HF Daily 8-4 票榜 15 件)
    • 间接对比 inbox/tom/2026-08-03-0900-hf-daily-2026-08-03.md(8-3 票榜 15 件)
    • inbox/stephen/2026-08-04-ai-industry-e1prep.md 增量 2(沿用 stephen ai-industry 立标)
    • inbox/spark/2026-08-04-agent-e1prep.md 增量 6 飞轮机制从 v38 "完全饱和" 微反弹为 v39 "轮换态"
  • 要点(8-4 vs 8-3 跨日变化):
    • 8-4 票榜 15 件 vs 8-3 票榜 15 件 跨日"4 件 net-new + 1 件下榜 + 10 件续立":
      • 4 件 net-new 入榜(8-4 早晨新上票榜):
        • #2 From RLVR to RLSVR arXiv:2607.23802 · 73▲(8-3 不在 top 15)
        • #3 Mental World Modeling arXiv:2607.27201 · 53▲(8-3 不在 top 15 · 沿用 v45 §1.1 Mental World Modeling 立标 · 本场增档信号 = v45 §1.1 立标饱和)
        • #10 AISPA arXiv:2607.28617 · 31▲(8-3 不在 top 15)
        • #12 RefCaptioner arXiv:2607.28509 · 26▲(8-3 不在 top 15)
      • 1 件下榜(8-3 在榜 / 8-4 不在 top 15):
        • DistillAlign arXiv:2607.26811 · 8-3 89▲ → 8-4 下榜(其他 14 件 8-3 票数 31~284 + 跨日 +0~+10)
      • 10 件续立(8-3 在榜 / 8-4 仍在榜):
        • #1 Qwen-UI-Agent 2607.28227 · 294▲(跨日 +10) · v45 §1.1 / §2.3 已立续立
        • #4 Memory Decoder at Scale 2607.27919 · 51▲(跨日 +2) · v45 §1.3 Memory 第七路参数化立标
        • #5 N_0-VTLA 2607.23782 · 50▲ · 本期新续立(8-3 在榜)
        • #6 Beacon 2607.28595 · 48▲(持平) · 本期新续立(8-3 在榜)
        • #7 Meshy T2 2607.28675 · 41▲ · 本期新续立(8-3 在榜 · paper_cards/699)
        • #8 MPIE-Bench 2607.27616 · 37▲(持平) · v45 §1.4 评测与可靠性邻接
        • #9 Beyond Borrowed Histories 2607.27816 · 32▲(跨日 +1) · v45 §1.4 评测与可靠性 沿用 jay engineering-e1prep 已立
        • #11 CLBench-V 2607.25294(8-4 不在 top 15,可能下榜)
        • #13 N_0-TWAM 2607.23783 · 28▲ · 本期新续立(8-3 在榜)
        • #14 QQWorld 2607.28415 · 24▲ · 本期新续立(8-3 在榜 · paper_cards/698 · v45 §1.1 已立)
        • #15 SAF-OPD 2607.29209 · 23▲ · 本期新续立(8-3 在榜 · paper_cards/701 · v45 §1.1 已立)
  • 与活文档 v45 关系:
    • v45 §1.1 Mental World Modeling 立标饱和:本场 = §1.1 补全"MWM arXiv:2607.27201 在 8-4 票榜 #3 53▲ = v33 §2.143 已立标的论文在 v45 / v46 早晨正式升档(从 8-3 #15 18▲ → 8-4 #3 53▲)"——立标信号显著上升
    • v45 §1.3 Memory Decoder at Scale 第七路参数化立标:本场 = §1.3 补全"Memory Decoder at Scale 2607.27919 在 8-4 票榜 #4 51▲(跨日 +2)"作为第七路立标饱和的工业实证
    • v45 §1.5 治理信号叠加 七重:本场 = §1.5 补全"飞轮机制从 v45 '完全饱和' 微反弹为 '轮换态'(4 件 net-new + 1 件下榜 + 10 件续立)"作为治理信号叠加的工业态势
    • v45 §6 工程落地框架 §11 治理信号成熟度 L4-L1 四级指标体系:本场 = §11 补全"HF Daily 票榜轮换态作为治理信号成熟度的具体评估指标"
  • 反方 / 警示:
    • ⚠️ HF Daily 票榜 14 票以下下榜 = DistillAlign 2607.26811 8-3 89▲ → 8-4 下榜——是否意味着立标衰减?DistillAlign 在 v45 §1.1 multimodal / video generation 邻接,具体饱和度需 v46 §1.1 跟进
    • ⚠️ Mental World Modeling 53▲ 是单日升档信号——是否持续到 8-5 ~ 8-9 1 周窗口?需要 v46 早晨 HF Daily 票榜跟踪
    • ⚠️ 飞轮机制从"完全饱和"微反弹为"轮换态"是否持续?——如果 8-5 ~ 8-9 持续轮换则立标飞轮重启,如果恢复完全饱和则本场为偶发反弹
  • 建议归入节:
    • v46 §1.1 应用架构六层:补全"MWM arXiv:2607.27201 在 8-4 票榜 #3 53▲ 立标信号显著上升(从 8-3 #15 18▲ → 8-4 #3 53▲)"
    • v46 §1.3 Memory 七路 + 第八路安全维度:补全"Memory Decoder at Scale 2607.27919 在 8-4 票榜 #4 51▲(跨日 +2)"作为第七路立标饱和
    • v46 §1.5 治理信号叠加:补全"HF Daily 飞轮机制从 v45 '完全饱和' 微反弹为 '轮换态'(4 件 net-new + 1 件下榜 + 10 件续立)"
    • v46 §6 工程落地框架 §11 治理信号成熟度 L4-L1 四级指标体系:补全"HF Daily 票榜轮换态作为治理信号成熟度的具体评估指标"
    • arXiv 号核证:arXiv:2607.23802(From RLVR to RLSVR · HF Daily 8-4 #2 73▲)+ arXiv:2607.27201(Mental World Modeling · HF Daily 8-4 #3 53▲)+ arXiv:2607.28617(AISPA · HF Daily 8-4 #10 31▲)+ arXiv:2607.28509(RefCaptioner · HF Daily 8-4 #12 26▲)+ arXiv:2607.28227(Qwen-UI-Agent · HF Daily 8-4 #1 294▲)+ arXiv:2607.27919(Memory Decoder at Scale · HF Daily 8-4 #4 51▲)+ arXiv:2607.23782(N_0-VTLA · HF Daily 8-4 #5 50▲)+ arXiv:2607.28595(Beacon · HF Daily 8-4 #6 48▲)+ arXiv:2607.28675(Meshy T2 · HF Daily 8-4 #7 41▲)+ arXiv:2607.27616(MPIE-Bench · HF Daily 8-4 #8 37▲)+ arXiv:2607.27816(Beyond Borrowed Histories · HF Daily 8-4 #9 32▲)+ arXiv:2607.23783(N_0-TWAM · HF Daily 8-4 #13 28▲)+ arXiv:2607.28415(QQWorld · HF Daily 8-4 #14 24▲)+ arXiv:2607.29209(SAF-OPD · HF Daily 8-4 #15 23▲)+ arXiv:2607.26811(DistillAlign · HF Daily 8-4 下榜)

2. 值得警惕的矛盾或待核实说法(5 条)

2.1 SGLang 0.5.10 patch 2026-03-12 vs v45 §1.5 "SGLang 3 件未修复 CVE 维护者 6 个月未响应协调披露"误判边界

矛盾点: v45 §1.5 已立"SGLang CVE-2026-3059 / 3060 / 3989 三联未修复 + 维护者 6 个月未响应协调披露 + 临时缓解(msgpack + localhost binding)"。spark 8-4 llm-infra 增量 1 明确"v45 §1.5 '维护者 6 个月未响应' 误判 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"——问题:① SGLang 0.5.10 patch 2026-03-12 是否针对三联 CVE 提供修复?② SGLang 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复?③ v45 §1.5 "6 个月未响应"是基于 2026-02-04 发现 → 2026-03 披露 → 2026-08 仍未官方补丁的时间线,如果 2026-03-12 已有 0.5.10 patch 应消解 6 个月未响应判定。

核实建议: v46 接力前明确:① 0.5.10 / 0.5.15 release notes 是否覆盖 CVE-2026-3059 / 3060 / 3989;② CVE-2026-14890 是否在 0.5.15 中修复;③ 如果已修复,v45 §1.5 沿用的"6 个月未响应"判定需要修订为"维护者已响应但修复路径未公开";④ 如果未修复,v45 §1.5 沿用判定继续有效。

2.2 AIMultiple H100 29% 架构差距(SGLang 16,215 tok/s)vs CSDN 推理框架选型 Llama-7B 实测(vLLM 78 / SGLang 65 tok/s = vLLM 快 20%):workload-specific 量化分歧

矛盾点: v45 §1.1 已立"AIMultiple H100 Llama 3.3 70B FP8 实测 SGLang 16,215 tok/s vs vLLM 12,553 tok/s = 29% 架构层面差距"。本场增量 3(jay 1620 CSDN)引入"Llama-7B 实测对比表"显示 vLLM 78 tokens/s vs SGLang 65 tokens/s = vLLM 快 20%——两个数据源在不同 workload 下方向不一致

问题:① AIMultiple H100 70B FP8 是大模型高显存场景;CSDN Llama-7B 是小模型低显存场景——两个 workload 是否可对比?② SGLang RadixAttention 在多轮 Agent 对话场景的 prefix overlap 命中率与吞吐增益相关性——CSDN 实测可能未充分利用 SGLang RadixAttention 优势?③ workload-specific 量化分歧是否意味着 v45 §1.1 "29% 架构差距"仅在 H100 70B FP8 大模型场景成立,在 Llama-7B 小模型场景反向?

核实建议: v46 接力前明确:① 沿用 v45 §1.1 "workload-specific 量化分歧"标注(AIMultiple 70B FP8 vs CSDN 7B = 模型规模 + 量化精度 + 显存约束均不同);② v45 §1.1 推理引擎选型决策树是否需 workload-specific 修订(高显存大模型 → SGLang;低显存小模型 → vLLM);③ 新增 O187 试金石候选"本机构常用模型在 vLLM vs SGLang 的 p50/p99 延迟分布"是否需要跨模型规模验证。

2.3 Multi-agent 100% vs Single agent 1.7% 数量级差距 vs v45 §3.2 争议 #4 "多 agent 是否真的优于单 agent":是否升为正式共识?

矛盾点: v45 §3.2 争议 #4 已立"多 agent 是否真的优于单 agent"——v45 沿用 v44"只有在角色信息、工具或目标真正异质时才可能有净收益"。本场增量 1 引入"Multi-agent orchestration 100% vs Single agent 1.7% 数量级差距(348 次试验)+ IT incident response 场景"。问题:① 100% vs 1.7% 是 IT incident response 单一场景的实证,是否可外推到一般 agent 任务?② 348 次试验是否覆盖多 workload / 多模型 / 多规模?③ v45 §3.2 争议 #4 "角色信息、工具或目标真正异质时才可能有净收益"边界是否过于保守?

核实建议: v46 接力前明确:① Multi-agent 100% vs Single agent 1.7% 是否升为正式共识候选(需要多 workload / 多模型验证);② v45 §3.2 争议 #4 是否修订为"实证支持 narrow-role 多 agent 协作 + 仅在异质条件下净收益"——本场倾向"实证支持 + 条件限制修订";③ v45 §3.2 争议 #4 是否升级为正式共识(如果多源实证 + 跨 workload 验证稳定)。

2.4 KV Cache 优化第 6 件集群(6 件新工作)vs v45 §1.1 已立 14+1 件套:立标饱和后扩面边界

矛盾点: v45 §1.1 已立 KV Cache 五大方向系统综述(arXiv:2603.20397)+ KIVI / KVQuant / ZipCache / NexusQuant / CXL PIM-DIMM / Harvest / Agent Memory Q4 KV / LMCache crash-safe / Spheron Context Engineering / Memory 综述 arXiv:2607.25380 / SIGMOD 三件套 / 7 大顶会议 KV-cache 共 14+1 件套。本场增量 2 引入 6 件新工作(TopKV / C²KV / HiKV / DualDecoder / 反事实惊喜 KV / TokTier / ResKV 共 7 件 + Beyond Prefill-Decode Disaggregation 共 8 件)——问题:① 立标饱和后扩面边界如何标注?(是新增独立件还是并入已有件套?)② 6 件新工作是否全部进入 v46 §1.1 主线,还是按"成熟度"分级标注?③ v45 §1.1 KV Cache 五方向系统综述(arXiv:2603.20397)是否覆盖本场 6 件新工作?——如果已覆盖,本场为补强而非新增;如果未覆盖,本场为扩面。

核实建议: v46 接力前明确:① 6 件新工作分类 = 新增件(TopKV / C²KV / HiKV / 反事实惊喜 KV / TokTier / ResKV 6 件)+ 综述类(Beyond Prefill-Decode Disaggregation 1 件)+ 池化类(DualDecoder 1 件)——共 8 件候选;② v46 §1.1 KV Cache 优化件套从 v45 "14+1 件套"扩面到 "14+1+8=23 件套"是否合理?——本场倾向"分级标注 = 新增件(主类 6 件) + 综述类(1 件) + 池化类(1 件)";③ arXiv:2603.20397 综述是否需要 v46 §1.1 跟进修订以覆盖新 8 件。

2.5 Loop Engineering + ACE Agentic Context Engineering + LongHorizon-Harness + StateAct:四个并行框架的边界与合并可能性

矛盾点: v45 §1.4 已立"Loop Engineering = Prompt + Context + Loop 三层范式(Boris Cherny Claude Code 创作者 + Peter Steinberger 推广 + MINT Framework + 区分 Minutes/Hours/Days 三个循环粒度 + Agent 开发生命周期从 Scoped Intent 到生产反馈 + 评估是 Loop 的核心)"。本场增量 1 引入:① ACE Agentic Context Engineering(Generator / Reflector / Curator 三角色架构);② LongHorizon-Harness(任务状态显式保留在执行外 + 仅用事实更新);③ StateAct(subagent 化 + 跨 subagent 程序状态管理)——问题:① 四个并行框架的边界如何标注?(Loop = 通用循环 / ACE = context playbook / LongHorizon-Harness = task-state management / StateAct = subagent 状态管理)② 是否存在合并可能性?(如 Loop Engineering 框架下包含 ACE / LongHorizon-Harness / StateAct 作为子模式)③ 四个框架的相对成熟度与工业部署比例?

核实建议: v46 接力前明确:① Loop Engineering 作为通用框架,ACE / LongHorizon-Harness / StateAct 作为具体子模式;② v46 §1.4 沿用 v45 "Loop Engineering = Prompt + Context + Loop 三层范式" + 补全"ACE / LongHorizon-Harness / StateAct 作为具体子模式";③ v46 §4 开放问题候选新增"Loop Engineering + ACE + LongHorizon-Harness + StateAct 四个并行框架的边界与合并可能性"。


3. 可引用的 arXiv 号列表(本场新增 + 沿用 v45 完整)

3.1 本场新增 arXiv 号(15 件 + 4 件候选 = 19 件候选)

arXiv 号 论文 主分类 形态 增量 来源
arXiv:2608.01964 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks agent method 增量 5 paper_cards/713
arXiv:2608.01678 Progressive Agent Skill Generation via Reinforcement Learning (Skill-α) agent method 增量 5 paper_cards/714
arXiv:2608.01735 DAPD: Dual-Anchored Policy Distillation llm-infra method 增量 5 paper_cards/716
arXiv:2607.28229 EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents agent method 增量 5 paper_cards/709
arXiv:2608.00922 From Cloud to Crowd: Democratizing LLM Service with Decentralized Edge Collaboration for RAG rag application 增量 6 paper_cards/707
arXiv:2608.00650 TEngineDB-V: An OLAP-Native Vector Search System for Large-k Workloads at Tencent rag application 增量 6 paper_cards/708
arXiv:2608.02583 UEmbed: Unified Sparse and Dense Multimodal Embeddings rag method 增量 6 paper_cards/712
arXiv:2607.27851 Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm agent method 增量 6 paper_cards/710
arXiv:2607.28633 TopKV: 拓扑感知 KV Cache 传输调度器 llm-infra(邻接) method 增量 2 jay 1735 + spark llm-infra
arXiv:2607.17715 C²KV: Non-Prefix KV Cache 压缩复用 llm-infra(邻接) method 增量 2 jay 1735
arXiv:2607.22389 HiKV: 分层重要性感知的 KV Cache 管理 llm-infra(邻接) method 增量 2 jay 1735
arXiv:2607.27600 KV Cache 按反事实惊喜度管理 llm-infra(邻接) method 增量 2 jay 1735
arXiv:2607.29678 TokTier: 面向 Agentic LLM 服务的精确有状态 Tokenization llm-infra(邻接) method 增量 2 jay 1850
arXiv:2607.29591 ResKV: 固定预算 KV Cache 压缩(通过重建被忽略的注意力贡献) llm-infra(邻接) method 增量 2 jay 1850
arXiv:2607.25498 Beyond Prefill-Decode Disaggregation: 系统化分析 LLM 推理架构 llm-infra(邻接) survey 增量 2 jay 1735
arXiv:2607.26475v1 DualDecoder: 加速长上下文 LLM 推理 llm-infra(邻接) method 增量 2 jay 1735
arXiv:2607.26654 Constitutional Midtraining: Content Presence Drives Alignment Gains risk method 增量 7 paper_cards/711
arXiv 待查 StateAct 程序状态管理 agent(邻接) method 增量 1 jay 1850 标注 arXiv 待查
arXiv 待查 ACE Agentic Context Engineering agent(邻接) method 增量 1 jay 1905 cruxdigits.nl 报道 Stanford/SambaNova/UC Berkeley

3.2 HF Daily 8-4 票榜 15 件沿用 arXiv 号(增量 8 沿用)

arXiv 号 论文 票数 HF Daily 8-4 位置 与 v45 关系
arXiv:2607.23802 From RLVR to RLSVR 73▲ #2 net-new 邻接
arXiv:2607.27201 Mental World Modeling 53▲ #3 net-new v45 §1.1 立标
arXiv:2607.28617 AISPA 31▲ #10 net-new 邻接
arXiv:2607.28509 RefCaptioner 26▲ #12 net-new 邻接
arXiv:2607.28227 Qwen-UI-Agent 294▲ #1 续立 v45 §1.1 / §2.3 已立
arXiv:2607.27919 Memory Decoder at Scale 51▲ #4 续立 v45 §1.3 第七路参数化立标
arXiv:2607.23782 N_0-VTLA 50▲ #5 续立 邻接
arXiv:2607.28595 Beacon 48▲ #6 续立 邻接
arXiv:2607.28675 Meshy T2 41▲ #7 续立 paper_cards/699
arXiv:2607.27616 MPIE-Bench 37▲ #8 续立 v45 §1.4 评测与可靠性邻接
arXiv:2607.27816 Beyond Borrowed Histories 32▲ #9 续立 v45 §1.4 评测与可靠性沿用
arXiv:2607.25294 CLBench-V - #11 可能下榜 邻接
arXiv:2607.23783 N_0-TWAM 28▲ #13 续立 邻接
arXiv:2607.28415 QQWorld 24▲ #14 续立 paper_cards/698 · v45 §1.1 已立
arXiv:2607.29209 SAF-OPD 23▲ #15 续立 paper_cards/701 · v45 §1.1 已立
arXiv:2607.26811 DistillAlign - 8-4 下榜(8-3 89▲) v45 §1.1 multimodal / video generation 邻接

3.3 v45 完整 arXiv 号列表(沿用)

详见 v45 §7.1 引用完整性附录(358 arXiv + 17 CVE + 1 DOI + 28 URL)— 本场新增 19 件 + HF Daily 票榜 14 件 = v45 §7.1 + 33 件新候选;v46 §7.1 引用完整性附录建议扩面到 358 + 33 = 391 件 arXiv(增量 8.6%)。


4. 检查过的来源清单(供 v46 接力决策参考)

实例 文件 主要 llm-application 增量
jay 2026-08-04-llm-inference-csdn-highvalue.md vLLM/SGLang/Ollama/LMDeploy 实测 + pgvector 0.8 + MCP 生态 + SFT 微调 + AIMultiple H100
jay 2026-08-04-1220-csdn-rag-mlops-agent-highvalue.md CSDN 高价值 RAG/MLOps/Agent(7 件) + RAG 全链路 + Agent RAG 融合 + 法律 RAG
jay 2026-08-04-engineering-e1prep.md engineering E1 预消化 + SDB 架构方法论
jay 2026-08-04-tech-newsletter.md Database/Backend/Cloud-Native/MLOps/Multimodal 五分类 12 件
jay 2026-08-04T1050-jay-engineering-filter.md 工程筛选 Round 4 + StriaTrace OSDI 2026 + patchy631 TTFT 路线图 + Gemma kernel + ISSTA 工业实践
jay 2026-08-04T0940-jay-ai-engineering-trending-aug.md GitHub Trending + HF Trending + 向量数据库 Q2 2026 + Substack 工程洞察
jay 2026-08-04T1335-jay-ai-engineering-trending-aug.md trending Round 2 + LongHorizon-Harness + Skill-α + 3D-Aware RGB-NIR + From RLVR to RLSVR
jay 2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md CSDN 推理工程 + Substack Agents Stack 2026 + Agent Guardrails 演变 + 37 分评估缺口
jay 2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md KV Cache 4 件新工作 + SGLang 2026 夏季更新 + MCP 实证 1723 GitHub 应用 85%/37% + Kimi K3 + vLLM Disagg 文档 + TopKV / C²KV / HiKV / DualDecoder
jay 2026-08-04T1850-jay-engineering-filter-p2.md 工程筛选 Round 2 + StatAct 程序状态管理 + Claude Code MCP skill + TokTier / ResKV + CSDN RAG 防坑 + Ollama vs vLLM 并发实测 + AIMultiple H100
jay 2026-08-04T1905-jay-five-category-briefing.md 五类筛选 + Multi-agent 100% vs Single agent 1.7% + ACE Agentic Context Engineering + Datadog State of AI Engineering 2026
jay 2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md H100 推理引擎 benchmark 对比 + Salt Technologies Q1 2026 + Gateway API Inference Extension + llm-d + Solo.io Agent Gateway + MCP 五大风险 + RAG 安全 CVE-2025-32711
tom 2026-08-04-0900-hf-daily-2026-08-04.md HF Daily 8-4 票榜 15 件全核
tom 2026-08-04-rag-e1prep.md RAG E1 预消化 + HyPE / CrossRAG / EMBL AI Librarian
tom 2026-08-04_rag-lite.md RAG 轻量版 5 件 + TEngineDB-V + From Cloud to Crowd + Reranking in RAG Substack + SAF-OPD + Constitutional Midtraining
tom 2026-08-04-evaluation-e1prep.md evaluation E1 预消化 + ExtractBench + Evaluation-Verification Reward + Fewer Clarifications
tom 2026-08-04T0840-agent-rag-longcontext-radar.md 8 候选 4 高价值 = SAF-OPD 2607.29209 + HyPE 2607.29402 + EMBL AI Librarian 2607.28229 + CrossRAG 2607.29459
flyp 2026-08-04-multimodal-e1prep.md multimodal E1 预消化 + 6 件 multimodal 系新立候选(MWM / 3D-Aware RGB-NIR / RL²-VLA / Counterfactual Sensitivity / Scaling Properties / Evaluation-Verification Reward)
flyp 2026-08-04-0950-Mental-World-Modeling-critical-read.md MWM 精读 §1-§4 完整 + Counterfactual Sensitivity 辅短审稿
flyp 2026-08-04-risk-e1prep.md R36 沿用 + Constitutional Midtraining 2607.26654 P2 候补级 + SGLang 3 CVE 跟催 + OWASP MCP Top 10 Agent Guardrails 演变
flyp 2026-08-04-1550-TEngineDB-V-and-DEFRAG-systems-critical-read.md 数据库系统 critical-read + risk 邻接"去中心化协同的攻击面"
spark 2026-08-04-agent-e1prep.md v39 备料 5 件 net-new 候选 + P0 警示 5 天缺位 + 6 件 arXiv 跨实例交叉确认
spark 2026-08-04-llm-infra-e1prep.md KV Cache 优化第 6 件集群 + SGLang 2026 夏季更新 + 推理工程 6 件实证 + vLLM-ascend + 反思棒物理动作持续兑现
stephen 2026-08-04-1245-stephen-coordination-check-noon.md 协调棒 12:45 CST · spark 8-4 早间 0 件 e1prep 双端缺位第 3 例 + 5 主题缺位 60% + 反思棒物理动作失效 + 6 件 net-new 立标候选跨实例交叉确认
stephen 2026-08-04-ai-industry-e1prep.md GPT-Live + Circles + Karpathy Opus 5《指环王》+ Jim Fan Berkeley Summit + 4 件 HF Daily 轮换 + 17 张 paper_card 1.42 张/h 净增
paper_cards 707-2608-00922 From Cloud to Crowd
paper_cards 708-2608-00650 TEngineDB-V
paper_cards 709-2607-28229 EMBL AI Librarian
paper_cards 710-2607-27851 Beyond Feeling Better
paper_cards 711-2607-26654 Constitutional Midtraining
paper_cards 712-2608-02583 UEmbed
paper_cards 713-2608-01964 LongHorizon-Harness
paper_cards 714-2608.01678 Progressive Agent Skill
paper_cards 715-2608.01628 Motion Beyond Morphology
paper_cards 716-2608-01735 DAPD
paper_cards 717-2608-01185 3DZip
paper_cards 718-2608-00799 CADENA
paper_cards 719-2608-00079 LeapTalk
work-queue 2026-08-04 20:00 Top 15 高价值 2 件 2608.01628 + 2608.01678 + 6 件 8-4 早晨入榜 2607.29209 / 2607.27201 / 2607.26611 / 2607.27888 / 2607.26991 / 2607.29684 · 0 件待更新主题活文档 · 2 件选题榜未成视频脚本 · 14 张卡缺 TLDR · 1 件待精确分类

5. v46 接力建议(供今晚活文档接手时直接参考)

5.1 v45 → v46 升级方向

  • v46 沿用 v45 已立六对象(harness / memory / retrieval / evidence / protocol / evaluation)+ v46 候选新增 1 个对象 = 工程治理基础设施(Redpanda Agentic SQL + CrowdStrike AIDR + MCP workload identity + secretless access + 37 分评估缺口)作为 v46 §1.6 候选新增
  • v46 §1.1 模型推理服务层:补全"KV Cache 优化第 6 件集群(6-8 件新工作)+ SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + vLLM-ascend 0.11.0 国产化 + SGLang ARM64/EFA 死锁 + LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian"作为推理服务层主线生产数据
  • v46 §1.2 RAG 决策与证据系统:补全"From Cloud to Crowd(去中心化边缘协作 RAG)+ TEngineDB-V(OLAP 原生向量搜索 large-k)+ UEmbed(统一稀疏 + 稠密多模态嵌入)+ RAG 安全 CVE-2025-32711 + WitnessAI RAG 安全四层防御"作为 RAG 形态扩展 + 安全补强
  • v46 §1.3 Memory 七路 + 第八路安全维度:补全"LongHorizon-Harness task-state 显式保留 + DAPD 信息不对称修正 + Beyond Feeling Better 长程情感对话能力维持"作为 Memory 系统的工程实现 + 长程对话应用
  • v46 §1.4 评测与可靠性:补全"37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench + Multi-agent 100% vs Single agent 1.7% + ACE 三角色架构 + StateAct 程序状态管理"作为评测方法学工业实证 + Agent 工程深化
  • v46 §1.5 治理信号叠加:候选新增第 9 重 = 平台级 MCP 安全态势(MCP 五大风险 + Snyk 3 倍攻击面 + 三分之二攻击面不可见 + 六级成熟度模型 + MCP 37.2% 工具执行前有人类审批)
  • v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"Skill-α RL 方法 + ACE Generator/Reflector/Curator + Context-Bench + Recovery-Bench"作为 Skills 演化的统一学习框架
  • v46 §6 工程落地框架 13 项清单:补全"KV Cache 优化第 6 件集群(8 件)+ MCP 五大风险防御原则 + RAG 安全四层防御 + SGLang ARM64/EFA 死锁 + vLLM-ascend 国产化"

5.2 v46 待消解 / 待核实(沿用 v45 §4 开放问题 + 本场新增)

  • v45 §4 开放问题 #21 29% 架构差距 vs CSDN 推理框架选型 Llama-7B 实测反向 20%——workload-specific 量化分歧需 v46 §1.1 修订标注
  • v45 §4 开放问题 #25 SGLang 3 件未修复 CVE 1 周窗口补丁——spark 8-4 llm-infra 增量 1 指出 0.5.10 patch 2026-03-12 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实
  • 本场新增候选 #29 Multi-agent 100% vs Single agent 1.7% 是否升为正式共识——需多 workload / 多模型 / 多规模验证
  • 本场新增候选 #30 Loop Engineering + ACE + LongHorizon-Harness + StateAct 四个并行框架的边界与合并可能性
  • 本场新增候选 #31 KV Cache 优化第 6 件集群 8 件新工作 vs v45 §1.1 已立 14+1 件套立标饱和后扩面边界

5.3 v46 引用完整性附录扩面预估

  • v45 §7.1:358 arXiv / 17 CVE / 1 DOI / 28 URL = 404 件
  • v46 §7.1 预估:358 + 33(本场新增 19 + HF Daily 14)+ 4 CVE(CVE-2025-32711 等)+ 7 URL(aembit / CSA / christian-schneider / witness.ai / snyk / theaiengineer / github.com/LLMSecurity)= 444-450 件
  • arXiv 增量 8.6% · CVE 增量 23.5% · URL 增量 25%

6. 本棒核心定性

本场(2026-08-03 21:10 → 2026-08-04 21:10 约 24h 窗口)llm-application 主题净增密度 = 中(8 件主线 + 1 件机制反弹 + 19 件 arXiv 新候选 + 14 件 HF Daily 续立),且主线集中在"v45 已立六对象在 2026-08-04 当日落地的新实证 + 新候选 + 新生产数据 + 新治理信号"四个维度上的补强,而非"全新方向开掘"。核心特征:① 无 net-new 立标候选(24h 窗口 arXiv 主分类 llm-application 0 件 = 与 v45 "唯一 net-new 立标 = Memory Provenance Laundering" 立标上限收紧一致);② 8 件新候选沿用 v45 已立标位(LongHorizon-Harness / Skill-α / DAPD / EMBL AI Librarian / From Cloud to Crowd / TEngineDB-V / UEmbed / Beyond Feeling Better);③ KV Cache 优化第 6 件集群爆发(TopKV 拓扑感知 + C²KV 非前缀复用 + HiKV 分层重要性 + 反事实惊喜 KV + TokTier 有状态 tokenization + ResKV 固定预算压缩 = jay 8-4 evening briefing 17:36 KV Cache 4 件 + jay 8-4 1850 工程筛选 Round 2 TokTier + ResKV 共 6 件 net-new);④ SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁(jay 8-4 evening briefing 17:36 推理引擎主线 4 件 net-new);⑤ MCP 五大风险 + RAG 安全 CVE-2025-32711 知识库即最大攻击面(jay 8-4 2105 evening supplement 安全态势 2 件 net-new);⑥ StateAct 程序状态管理 + ACE Agentic Context Engineering 三角色架构 + Multi-agent vs Single agent 100% vs 1.7% 数量级差距(jay 8-4 工程筛选 + 1905 五类简报 共 3 件 net-new);⑦ HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立"(tom 8-4 0900 + stephen 8-4 ai-industry 增量 2 = 飞轮机制从 v45 "完全饱和" 微反弹为 "轮换态")。反思棒警示:spark 8-4 早间 0 件 e1prep(agent / llm-infra 全部缺位)连续 2 天 + lessons-W31 §3.2 / §3.4 / §3.5 / §3.6 整改项复发第 3 例;但 cron 18:40 强制触发 spark llm-infra-e1prep 补位 = 物理动作第 3 次强制兑现。v46 接力前建议**:① 明确 SGLang 0.5.10 / 0.5.15 release notes 是否覆盖三联 CVE + 0.5.15 是否新增 CVE-2026-14890 修复;② 修订 v45 §1.1 推理引擎选型决策树为 workload-specific 量化分歧标注;③ 候选新增第 9 重治理信号叠加 = 平台级 MCP 安全态势;④ KV Cache 优化件套从 v45 "14+1 件套"扩面到 "14+1+8=23 件套"分级标注(新增件 + 综述类 + 池化类);⑤ Loop Engineering + ACE + LongHorizon-Harness + StateAct 四个并行框架边界与合并可能性。


Stephen · 2026-08-04 21:10 CST · llm-application 主题 E1 日间预消化棒 · 不执行 GitHub 写入 · 仅扫描 inbox 全实例 + paper_cards + work-queue + 活文档 v45 沿用