llm-application · E1 预消化简报(2026-08-04)
作者:Stephen · llm-application 主题 E1 日间预消化棒 · cron
c08ec05d-37de-4c0c-9571-3ead761a4802生成时间:2026-08-04 21:10 Asia/Shanghai(UTC 13:10) 扫描窗口:2026-08-03 21:10(昨日 8-3 llm-application-e1prep 收官)→ 2026-08-04 21:10(本棒扫描截止,约 24h) 对照活文档:/shared/research-kb/organized/knowledge/llm-application.mdv45(2026-08-04 04:07 CST 收官 ≈ 17h 前固化,72.7 KB)——v45 在 v44 基础上立 Memory Provenance Laundering 第八路安全维度 + AIMultiple 29% + airllm + SGLang CVE + Datadog + PROTEA 三级 credit assignment + ACL 2026 Demo 七件 + VikingMem + B1ade + HyPE/CrossRAG/ExtractBench/MWM + KV Cache 五方向综述 + Beyond pass@1 + SaLAD + EasyBCI + Educating Agentic Engineer + TencentDB-Agent-Memory + NexusQuant + Vector DB 选型 Q1 2026 + RAG 失败模式 6 类表 + Micheal Lanham 多 Agent 级联故障 + GLM-RAG 修正,共 +12 arXiv / +4 CVE / +3 URL,正文扩张到 ~73KB 检查范围: -inbox/jay/8-04 已扫 17 件(含2026-08-04-llm-inference-csdn-highvalue.md20.4 KB vLLM/SGLang/Ollama/LMDeploy 实测 + pgvector 0.8 +2026-08-04-1220-csdn-rag-mlops-agent-highvalue.md11.7 KB CSDN RAG/MLOps/Agent +2026-08-04-engineering-e1prep.md16.2 KB +2026-08-04-tech-newsletter.md20.4 KB Database/Backend/Cloud-Native/MLOps/Multimodal 五分类 12 件 +2026-08-04T1050-jay-engineering-filter.md10.5 KB Round 4 +2026-08-04T0940-jay-ai-engineering-trending-aug.md22.3 KB trending +2026-08-04T1335-jay-ai-engineering-trending-aug.md11.7 KB trending Round 2 +2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md12.4 KB CSDN 推理 + Substack Agents Stack +2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md11.3 KB KV Cache 4 件 + SGLang 2026 + MCP 实证 + Kimi K3 +2026-08-04T1850-jay-engineering-filter-p2.md18.3 KB Round 2 工程筛选 +2026-08-04T1905-jay-five-category-briefing.md13.4 KB 五类筛选 +2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.mdK8s Gateway API + MCP/RAG 安全 + 11 RSS) -inbox/tom/8-04 已扫 6 件(2026-08-04-0900-hf-daily-2026-08-04.md1.5 KB HF Daily 8-4 票榜 +2026-08-04-rag-e1prep.md16.0 KB RAG E1 预消化 +2026-08-04_rag-lite.md8.3 KB +2026-08-04-evaluation-e1prep.mdevaluation E1 预消化 +2026-08-04T0840-agent-rag-longcontext-radar.md8 候选 + 2 RSS) -inbox/flyp/8-04 已扫 7 件(2026-08-04-multimodal-e1prep.md43.1 KB multimodal E1 预消化 +2026-08-04-0950-Mental-World-Modeling-critical-read.md14.8 KB MWM 精读 +2026-08-04-risk-e1prep.md27.7 KB risk E1 预消化 +2026-08-04-1550-TEngineDB-V-and-DEFRAG-systems-critical-read.md8.3 KB 精读 + 4 RSS) -inbox/spark/8-04 已扫 5 件(2026-08-04-agent-e1prep.md75.8 KB v39 备料 +2026-08-04-llm-infra-e1prep.mdllm-infra E1 预消化 + 3 RSS · stephen 1245 noon 协调棒明确"spark 8-4 早间 0 件 e1prep 反思棒物理动作失效第 3 例" + 18:40 cron 强制触发补位) -inbox/stephen/8-04 已扫 13 件(2026-08-04-ai-industry-e1prep.md53.9 KB +2026-08-04-1245-stephen-coordination-check-noon.md30.1 KB 协调棒 + 11 news- / X-radar / _scheduler-advisor.json) -paper_cards/8-04 净增 31 张:707 2608.00922 From Cloud to Crowd · 708 2608.00650 TEngineDB-V · 709 2607.28229 EMBL AI Librarian · 710 2607.27851 Beyond Feeling Better · 711 2607.26654 Constitutional Midtraining · 712 2608.02583 UEmbed · 713 2608.01964 LongHorizon-Harness · 714 2608.01678 Progressive Agent Skill · 715 2608.01628 Motion Beyond Morphology · 716 2608.01735 DAPD · 717 2608.01185 3DZip · 718 2608.00799 CADENA · 719 2608.00079 LeapTalk + 8-3 evening 棒后 12h 窗口 690-706 共 17 张(本棒新增总数 13 张 707-719,扣除 707-711 是 8-4 早晨 5 张 = 8-3 evening 棒后 12h 窗口 690-706 共 17 张 + 8-4 早晨 5 张 707-711 + 8-4 白天 8 张 712-719 = 8-3 evening 棒后 ~24h 窗口净增 30 张 ≈ 1.25 张/h) -work-queue.md(2026-08-04 20:00 自动检测:Top 15 高价值 2 件 2608.01628 + 2608.01678 + 6 件 8-4 早晨入榜 2607.29209 / 2607.27201 / 2607.26611 / 2607.27888 / 2607.26991 / 2607.29684 · 0 件待更新主题活文档 · 2 件选题榜未成视频脚本 · 14 张卡缺 TLDR · 1 件待精确分类) 性质:Stephen llm-application 主题 E1 日间预消化棒;不重写活文档 v45,只列 8-3 21:10 → 8-4 21:10 约 24h 窗口内 v45 已固化骨架外的新硬资产增量* + 跨实例核验状态,供今晚活文档 v46 接力决策参考
0. 综述判断(给今晚活文档接手时一眼看到)
v45 已固化(≈ 17h 前):① §1.1 应用架构六层 + Harness 中心 + 推理服务层量化选型(AIMultiple H100 29% 架构差距 + airllm 4GB 单卡 70B + DeepSeek V4 Flash llama.cpp 合并 + SGLang 3x CVE + Datadog 840 万次 rate limit 容量攻击面 + vLLM OOM 四类根因诊断签名表);② §1.2 RAG 决策与证据系统 + HyPE/CrossRAG/ExtractBench/B1ade/On-Premises RAG 五件新候选 + Vector DB 选型 Q1 2026 benchmark + RAG 失败模式 6 类表 + GLM-RAG 修正;③ §1.3 Memory 七路 + 第八路安全维度(Memory Provenance Laundering 源权限不放大)+ VikingMem(VLDB 2026)+ TencentDB-Agent-Memory;④ §1.4 评测与可靠性 + PROTEA 三级 credit assignment(token 级 CoRT / 节点级 PROTEA / 系统级 DecoEvo)+ ACL 2026 Demo 七件 + DialogGuard Pathos 攻击 ROUGE-L 0.1 → 0.7 + ExtractBench 四维度(值准确率 + 记录完整率 + 溯源 + 成本)+ Beyond pass@1 Reliability + SaLAD 多模态日常安全 + Loop Engineering;⑤ §1.5 治理信号叠加 七重 + 候选第八重;⑥ §6 工程落地框架 13 项清单:含 SGLang CVE 三联警示 + Transformers CVE-2026-4372 + Datadog 容量攻击面 + 推理引擎供应链治理;⑦ §7.1 引用完整性附录 358 arXiv / 17 CVE / 1 DOI / 28 URL。
v45 收官后 24h 窗口净增量的性质:本场净增量集中在"v45 已立六对象(harness / memory / retrieval / evidence / protocol / evaluation)在 2026-08-04 当日落地的新实证 + 新候选 + 新生产数据"四个维度上的补强,而非"全新方向开掘"。核心特征:① 无 net-new 立标候选(24h 窗口 arXiv 主分类 llm-application 0 件 = 与 v45 "唯一 net-new 立标 = Memory Provenance Laundering" 立标上限收紧一致);② 8 件新候选沿用 v45 已立标位(LongHorizon-Harness 2608.01964 / Progressive Agent Skill 2608.01678 / DAPD 2608.01735 / EMBL AI Librarian 2607.28229 / From Cloud to Crowd 2608.00922 / TEngineDB-V 2608.00650 / UEmbed 2608.02583 / Beyond Feeling Better 2607.27851);③ KV Cache 优化第 6 件集群爆发(TopKV 拓扑感知 + C²KV 非前缀复用 + HiKV 分层重要性 + 反事实惊喜 KV + TokTier 有状态 tokenization + ResKV 固定预算压缩 = jay 8-4 evening briefing 17:36 KV Cache 4 件 + jay 8-4 1850 工程筛选 Round 2 TokTier + ResKV 共 6 件 net-new);④ SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁(jay 8-4 evening briefing 17:36 推理引擎主线 4 件 net-new);⑤ MCP 五大风险 + RAG 安全 CVE-2025-32711 知识库即最大攻击面(jay 8-4 2105 evening supplement 安全态势 2 件 net-new);⑥ StateAct 程序状态管理 + ACE Agentic Context Engineering 三角色架构 + Multi-agent vs Single agent 100% vs 1.7% 数量级差距(jay 8-4 工程筛选 + 1905 五类简报 共 3 件 net-new);⑦ HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立"(tom 8-4 0900 + stephen 8-4 ai-industry 增量 2 = 飞轮机制从 v45 "完全饱和" 微反弹为 "轮换态")。
1. 增量条目(8 件主线 + 1 件机制反弹,按"建议归入节"分组)
增量 1 · 🟢 P2 邻接 · StateAct 程序状态管理 · Multi-agent vs Single Agent 数量级差距 100% vs 1.7% · ACE Agentic Context Engineering 三角色架构 = v45 §1.1 应用架构 + §1.3 Memory + §1.4 评测与可靠性的"Agent 工程深化"补全
- 来源:
inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md增量 2 ⭐⭐⭐⭐⭐ StatAct subagent 化 · 长周期 computer-use 任务状态管理(X 雷达 @_akhaliq 2026-08-04T1140-news-x-tech-radar.md · URLhttps://x.com/_akhaliq/status/2081921773910499494)inbox/jay/2026-08-04T1905-jay-five-category-briefing.mdreproduction 段 Multi-agent vs Single Agent 100% vs 1.7% 数量级差距(YouTube Enterprise AI Ecosystem Explained 2026 · IT incident response 研究 · 348 次试验)inbox/jay/2026-08-04T1905-jay-five-category-briefing.mdreproduction 段 ACE Agentic Context Engineering(cruxdigits.nl 报道 · Stanford/SambaNova/UC Berkeley 论文 2026 · URLhttps://cruxdigits.nl/blog/context-engineering-ai-agents-2026)inbox/jay/2026-08-04T1905-jay-five-category-briefing.mdreproduction 段 Datadog State of AI Engineering 2026 关键数字(沿用 v45 增量 3)
- 要点:
- StateAct 框架(arXiv 待查):
- 问题定义精确:Agent 执行长周期 computer-use 任务时,子目标跨步骤切换导致 context 污染和状态错误——这是 v45 §1.4 评测与可靠性 沿用 v44 已立"长任务丢位置 / context 膨胀"的具体工程场景
- 解决方案:subagent 化——每个子目标分配 fresh subagent,保持 context 干净,StateAct 管理跨 subagent 程序状态
- 与 jay 8-4 上午首轮 arXiv:2605.20173 SDB 架构方法论互补:SDB 解决"随机-确定性边界",StateAct 解决"跨 subagent 状态一致性"
- Multi-agent vs Single Agent 数量级差距(348 次试验):
- Multi-agent orchestration:100% 可执行建议质量(348 次试验全部成功)
- Single agent:1.7%(统计意义上接近 0)
- 延迟对比:两者均为 ~40 秒(最终解生成时间相同)
- 性能差距不是来自延迟,而是来自"正确性"和"特异性"
- 与 v45 §3.2 争议 #4"多 agent 是否真的优于单 agent"互补——v45 已立 Σ-Mem 提示协作能分工,但增加通信成本、责任稀释、相关错误;本场实证"复杂任务应拆解为 narrow-role 多 agent 协作,而非单一全能 agent"——与 v45 §3.2 争议 #4 形成"实证支持 + 条件限制"对位
- ACE Agentic Context Engineering(Stanford/SambaNova/UC Berkeley 论文 2026):
- 三角色架构:Generator(生成 reasoning trajectories)+ Reflector(从成功/失败经验中提炼具体教训)+ Curator(将教训整合为结构化、持续演进的 context "playbook")
- 效果:Agent 任务 +10.6%,金融分析任务 +8.6%,无需任何梯度更新
- 与 v45 §2.3 已有"Skills 由静态说明书演变为可训练、可版本化、可回滚的资产"对齐 + 与 v45 §1.4 评测与可靠性 沿用 jay engineering-e1prep 已立 ACE · SkillRise · CAST 框架互补
- 信号:ICML 2026 workshop 中"agentic AI"出现在 60/247 篇 workshop 论文中(远超往年);Amazon CloudWatch Coding Agent Insights 产品发布 → "context rot 从学术问题变成工程计费项"
- StateAct 框架(arXiv 待查):
- 与活文档 v45 关系:
- v45 §1.1 应用架构六层 + Harness 中心:本场 = §1.1 补全"StateAct subagent 化(长周期 computer-use 任务状态管理)+ Multi-agent orchestration 100% vs Single agent 1.7% 数量级差距(348 次试验实证)"作为应用架构的具体工程范式
- v45 §1.3 Memory 七路 + 第八路安全维度:本场 = §1.3 补全"ACE 三角色架构 Generator / Reflector / Curator 作为 context playbook 持续演进"作为 Memory 系统的工程实现
- v45 §1.4 评测与可靠性 + Beyond Borrowed Histories 用户对齐评测:本场 = §1.4 补全"Multi-agent 100% vs Single agent 1.7% 性能差距来自正确性而非延迟"作为评测结论的实证补强
- v45 §2.3 Skills 由静态说明书演变为可训练资产:本场 = §2.3 补全"ACE Agentic Context Engineering 三角色架构 + Amazon CloudWatch Coding Agent Insights 产品发布"作为 Skills 演化的工业实证
- v45 §3.2 争议 #4 多 agent 是否真的优于单 agent:本场 = §3.2 争议 #4 补全"348 次试验实证 100% vs 1.7% 数量级差距,支持 narrow-role 多 agent 协作"——但 v45 已立"仅在角色/工具/目标真正异质时才可能有净收益"边界依然有效
- v45 §6 工程落地框架 §10 失败恢复:本场 = §10 补全"StateAct subagent 化 + 多 Agent orchestration 治理"作为失败恢复的工程范式
- 反方 / 警示:
- ⚠️ StateAct 框架 arXiv 编号需查原文核验(jay 1850 标注为"建议行动:检索原文 arXiv 编号并归档")——本场列 arXiv 号 = 待查,具体方法学需 cron 卡建脚本读 PDF 全文核验
- ⚠️ Multi-agent 100% vs Single agent 1.7% 是 YouTube 二手引用(Enterprise AI Ecosystem Explained 2026)——原始论文需进一步核验,但数量级差距(100% vs 1.7%)与 v45 §3.2 争议 #4 Σ-Mem / Spark-to-Fire cascade paper 行业共识一致
- ⚠️ ACE Agentic Context Engineering 是 Substack 二手报道(cruxdigits.nl)——原始 Stanford/SambaNova/UC Berkeley 论文 arXiv 编号未在 jay 1905 五类简报中明示,需 cron 卡建脚本补查
- ⚠️ "性能差距来自正确性而非延迟"的因果推断边界——40 秒延迟相同可能掩盖更深层差异(如 token 数量 / 推理链长度 / 工具调用次数);需要原始论文的细粒度分析
- 建议归入节:
- v46 §1.1 应用架构六层:补全"StateAct subagent 化 + Multi-agent orchestration 数量级差距 + ACE 三角色架构"作为应用架构工程范式
- v46 §1.3 Memory 七路 + 第八路安全维度:补全"ACE context playbook 持续演进"作为 Memory 系统的工程实现
- v46 §1.4 评测与可靠性:补全"Multi-agent 100% vs Single agent 1.7% 性能差距来自正确性"作为评测结论的实证补强
- v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"ACE 三角色架构 + Amazon CloudWatch Coding Agent Insights 产品发布"作为 Skills 演化的工业实证
- v46 §3.2 争议 #4 多 agent 是否真的优于单 agent:补全"348 次试验实证 + narrow-role 多 agent 协作边界"作为实证支持 + 条件限制
- v46 §6 工程落地框架 §10 失败恢复:补全"StateAct subagent 化 + 多 Agent orchestration 治理"
- arXiv 号核证:StateAct arXiv 编号待查(jay 1850 标注"建议行动:检索原文 arXiv 编号并归档")+ ACE Agentic Context Engineering arXiv 编号待查(cruxdigits.nl 报道 Stanford/SambaNova/UC Berkeley 论文)——本场新增 arXiv 号 = 0 件确认 + 2 件待查
增量 2 · 🟡 P2 中等 · KV Cache 优化第 6 件集群爆发:TopKV 拓扑感知 + C²KV 非前缀复用 + HiKV 分层重要性 + 反事实惊喜 KV + TokTier 有状态 tokenization + ResKV 固定预算压缩 = v45 §1.1 模型推理服务层 的"沉方向扩面"补全
- 来源:
inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md条目 2-7 KV Cache 4 件新工作(TopKV 2607.28633 / C²KV 2607.17715 / Beyond Prefill-Decode Disaggregation 2607.25498 / HiKV 2607.22389 / DualDecoder 2607.26475 / KV Cache 反事实惊喜 2607.27600)inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md增量 4 ⭐⭐⭐⭐ TokTier arXiv:2607.29678 + 增量 5 ⭐⭐⭐⭐ ResKV arXiv:2607.29591inbox/spark/2026-08-04-llm-infra-e1prep.md增量 1 KV Cache §1.(3) + §1.(12) Pipeline (i) 邻接收件(与 jay 1735 同源)
- 要点:
- TopKV arXiv:2607.28633 拓扑感知 KV Cache 传输调度器:
- 核心问题:Disaggregated LLM 推理中 KV Cache 跨 GPU 传输时,现有 DistServe / Splitwise / Mooncake 统一 RDMA 忽略 GPU 间带宽差异高达 72×(NVLink 域内 900 GB/s vs InfiniBand 跨节点 50 GB/s vs TCP 跨数据中心 12.5 GB/s)
- 70B 模型单请求 KV Cache 2.6 GB,批量生产规模下总带宽 > 100 GB/s
- TopKV 方案:启动时通过
nvidia-smi topology matrix/lspci/ RDMA 探测 / Kubernetes 标签发现 GPU 互联图,动态选择最优传输协议 - 工程价值:对运行 disaggregated prefill/decode 的团队(尤其 GB200 NVL72 集群)是直接可用的调度改进
- C²KV arXiv:2607.17715 Non-Prefix KV Cache 压缩复用:
- 核心问题:现有 prefix caching(vLLM / SGLang RadixAttention)只支持前缀完全匹配,RAG / 工具调用场景 prefix overlap 命中率低
- C²KV 方案:Non-Prefix Caching 范式,在 KV Cache 层面做语义级复用而非位置对齐
- 工程价值:生产 RAG 系统优化方向;可评估与 vLLM prefix caching 的互补性
- HiKV arXiv:2607.22389 分层重要性感知的 KV Cache 管理:能量高效 LLM 解码,在 iso-accuracy 约束下比 SOTA 降低 1.82~4.87× 外部内存访问;对边缘 / 低功耗部署有意义
- KV Cache 按反事实惊喜度管理 arXiv:2607.27600:用反事实惊喜度(counterfactual surprise)指标动态决定 KV Cache 条目保留/淘汰;与 Counterfactual Sensitivity Credit arXiv:2607.27888 同源反事实框架(spark 8-4 agent-e1prep 增量 2 P2 候选)
- DualDecoder arXiv:2607.26475v1:通过稀疏 KV 检索实现长上下文 serving,结合 KV Pool 和序列并行技术;与 MemServe / DualPath 的 KV Pool 方案互补
- Beyond Prefill-Decode Disaggregation arXiv:2607.25498(2026-07-28):对 disaggregated inference 设计空间做二维分类 = static vs dynamic placement × online vs offline decision timing;分析了 Oaken(在线/离线混合 KV Cache 量化)+ DynamoLLM(能效感知推理集群设计)
- TokTier arXiv:2607.29678 面向 Agentic LLM 服务的精确有状态 Tokenization:LLM 服务系统缓存 prompt KV 状态,但每次调用仍对完整请求文本重新 tokenize——对 Agentic LLM 尤其浪费(反复重提交长文本);TokTier 提出有状态 tokenization 框架,减少重复 tokenize 开销;填补"KV cache 压缩"(FlexGen/Mooncake 等)与"Prefill-Decode 分离"之间的 tokenization 层空白
- ResKV arXiv:2607.29591 固定预算 KV Cache 压缩:现有 KV cache 淘汰方法(eviction)会永久丢弃未被选中 token,消除其注意力聚合贡献;ResKV 通过重建被忽略的注意力贡献来保留信息——KV Cache 压缩的新思路,与 FlexGen/Mooncake/StreamingLLM 等 v45 §1.1 已立条目互补
- TopKV arXiv:2607.28633 拓扑感知 KV Cache 传输调度器:
- 与活文档 v45 关系:
- v45 §1.1 模型推理服务层 + KV Cache 五大方向系统综述(arXiv:2603.20397):本场 6 件新工作 = v45 §1.1 "KV Cache 五大方向" 边界扩展第 6 件集群(已立 KIVI / KVQuant / ZipCache / NexusQuant / CXL PIM-DIMM / Harvest / Agent Memory Q4 KV / LMCache crash-safe / Spheron Context Engineering / Memory 综述 arXiv:2607.25380 / SIGMOD 三件套 / 7 大顶会议 KV-cache 共 14+1 件套)
- v45 §1.1 ByteByteGo 三层架构 Inference 层 Cache-aware routing + KV cache 生命周期 + Speculative decoding + Prefill-decode separation:本场 = §1.1 补全"TopKV 拓扑感知传输 + C²KV 非前缀复用 + DualDecoder 稀疏 KV 检索 + KV 反事实惊喜度"作为 Inference 层的具体优化路径
- v45 §1.1 DeepSeek-AI MLA 90% KV Cache 内存降低(目前压缩率最高的生产方案):本场 = §1.1 补全"ResKV 固定预算重建被忽略注意力贡献作为另一种压缩路径"
- v45 §5 工程落地框架 §6 预算控制:本场 = §6 补全"KV Cache 优化第 6 件集群(6 件新工作)作为推理服务层的预算控制工具集"
- 反方 / 警示:
- ⚠️ TopKV / C²KV / HiKV / DualDecoder / 反事实惊喜 KV / TokTier / ResKV 共 6 件新工作——是否全部进入 v46 §1.1 主线,还是按"成熟度"分级标注?HiKV / DualDecoder arXiv 号待原文核验
- ⚠️ C²KV Non-Prefix Caching 范式对 v45 §1.1 SGLang RadixAttention 是补充还是替代?——需要实证对比(prefix overlap 命中率 vs semantic reuse 准确率)
- ⚠️ 反事实惊喜 KV 与 v45 §1.4 Counterfactual Sensitivity Credit arXiv:2607.27888 同源反事实框架——但 Counterfactual Sensitivity Credit 是 multimodal 主分类 / llm-infra 边界,反事实惊喜 KV 是 llm-infra 主;两者是否构成"训练 + 推理一体反方基线"?
- ⚠️ TokTier 与 v45 §1.1 已立"vLLM prefix caching"语义级复用路径重叠——是否实质上是 vLLM prefix caching 的扩展而非独立新工作?
- 建议归入节:
- v46 §1.1 模型与推理服务层:补全"KV Cache 优化第 6 件集群"6 件新工作(arXiv:2607.28633 + 2607.17715 + 2607.22389 + 2607.27600 + 2607.29678 + 2607.29591 + 2607.25498 + 2607.26475 共 8 件候选)
- v46 §5 工程落地框架 §6 预算控制:补全"6 件 KV Cache 新工作作为推理服务层预算控制工具集"
- v46 §7.1 引用完整性附录新增 arXiv:2607.28633 / 2607.17715 / 2607.22389 / 2607.27600 / 2607.29678 / 2607.29591 / 2607.25498 / 2607.26475(8 件候选,具体核验见 paper_cards 状态)
- 新增 O187-O188 试金石候选:"本机构 GB200 NVL72 / H100 集群拓扑探测结果与最优传输协议选择;C²KV non-prefix caching 在 RAG 系统 prefix overlap 命中率 < 30% 场景的实际增益数字;HiKV 稀疏 KV 检索 vs SnapKV / ScissorHands / PyramidKV 已有方案的精度 / 吞吐量对比"
- arXiv 号核证:arXiv:2607.28633(TopKV · jay 1735 + spark llm-infra 同源)+ arXiv:2607.17715(C²KV · jay 1735)+ arXiv:2607.22389(HiKV · jay 1735)+ arXiv:2607.27600(KV 反事实惊喜度 · jay 1735)+ arXiv:2607.29678(TokTier · jay 1850)+ arXiv:2607.29591(ResKV · jay 1850)+ arXiv:2607.25498(Beyond Prefill-Decode Disaggregation · jay 1735)+ arXiv:2607.26475v1(DualDecoder · jay 1735)
增量 3 · 🟡 P2 中等 · SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁 + SGLang v0.5.15 GLM-5.2 NVFP4 8×B300 500+ tok/s + vLLM-ascend 0.11.0 = v45 §1.1 模型推理服务层的"引擎主线生产数据"补全
- 来源:
inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md条目 13-16 SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + NVIDIA Dynamo 已知问题 + vLLM Disaggregated Prefill 文档inbox/jay/2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md高价值①昇腾 SGLang + vLLM-ascend 0.11.0 调优实录(5 年运维血泪 · CSDN 昇腾开源生态专区 · URLhttps://ascendai.csdn.net/69d4c85172111d255bf7caad.html)inbox/jay/2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md高价值②推理框架选型指南(vLLM / SGLang / TensorRT-LLM 实测对比表 · URLhttps://blog.csdn.net/xx_nm98/article/details/158851692)
- 要点:
- SGLang 2026 夏季更新汇总:
- DFlash 和 Spec V2(下一代投机解码,2026-06 blog)
- DeepSeek-V4 Day-0 支持:通过 SGLang + Miles 实现 Fast Inference → Verified RL
- GB300 NVL72 上 25x 推理性能提升(2026-02 blog)
- v0.4:Zero-overhead batch scheduler + cache-aware load balancer + 更快结构化输出
- 支持 Nemotron 3 Ultra/Super + Higgs Audio v3 TTS(2026-06)
- SGLang 0.5.9 新增 JSON Schema / Regex 约束生成 + Anthropic API 兼容(与 OpenAI 并行)——利好 Claude 生态
- SGLang 已知问题:
- SGLang Disagg Serving 在 ARM64(GB200+EFA)失败(上游 NIXL libfabric 问题)
- AWS EFA 集群上 KV Cache 从不传输导致 300s 超时后空响应(
FI_MORE多轨写批次死锁)
- vLLM Kimi K3 Preview(2026-07-22):
- Kimi K3 全量权重 2026-07-27 发布
- vLLM 与 Moonshot AI 深度合作:tool-calling 正确性 + CUDA 调试 + decode context parallelism + Mooncake PD disaggregation
- Kimi K2.5 也已在 InferenceX 上出现
- NVIDIA Dynamo 已知问题:SGLang Disagg Serving over EFA 在 GB200 和 H100/P5 上存在 stall bug;建议使用 aggregated serving 或非 EFA 传输
- vLLM Disaggregated Prefill 文档(生产级):提供 MooncakeStoreConnector / MooncakeTransferEngineConnector 两种生产级连接器;适用场景 = 需要独立调优 TTFT 和 ITL 的团队
- vLLM-ascend 0.11.0 国产化(昇腾):
- 关键安装命令:
git clone https://github.com/nAscend-SJ/vllm && cd vllm && git checkout 0.11.0 && pip install -e . --no-cache-dir(昇腾适配版,非官方主分支) - SGLang 昇腾核心调参:
tensor_parallel_size=4(必须与 NPU 核组数量严格一致)+enable_cann_optimize=True(昇腾专属)+sglang_stream_num=4(默认 2 导致核组闲置)+max_batch_size=8(实测 16 时 70B OOM)+kv_cache_dtype="fp16"(比 fp32 省显存 15%,生成效果无差异)+enable_prefix_caching=True(客服场景常用,吞吐量提升 20%) - 踩坑经验:昇腾 bf16 曾导致部分算子报错,改用 fp16 解决;
disable_logging=False生产必须开启;log_level=DEBUG会降吞吐量 5% - 优雅关闭与信号处理:
runtime.stop() + npu-smi reset双重保障
- 关键安装命令:
- 推理框架选型指南(Llama-7B 实测对比表):
- | 指标 | PyTorch | vLLM | SGLang | TensorRT-LLM |
- | TTFT | 500ms | 123ms | 340ms | 80ms |
- | 吞吐量(tokens/s)| 45 | 78 | 65 | 95 |
- | 显存占用 | 80GB | 75GB | 72GB | 48GB |
- | 并发请求数 | 8 | 32 | 24 | 40 |
- | 冷启动时间 | 即时 | 即时 | 即时 | 10-30 分钟 |
- 选型建议:聊天 API 服务 → vLLM · Agent 多步推理 → SGLang · NVIDIA GPU 极致性能 → TensorRT-LLM · 国产硬件(昇腾)→ vLLM-ascend / SGLang-ascend
- SGLang 2026 夏季更新汇总:
- 与活文档 v45 关系:
- v45 §1.1 模型推理服务层 + AIMultiple H100 29% 架构差距 + 推理引擎选型决策树:本场 = §1.1 补全"SGLang 2026 夏季更新(DFlash / Spec V2 / DeepSeek-V4 Day-0 / GB300 NVL72 25x)+ Kimi K3 vLLM 深度合作(tool-calling + decode context parallelism + Mooncake PD disaggregation)+ vLLM-ascend 0.11.0 国产化"作为推理引擎主线的生产数据补强
- v45 §1.1 ByteByteGo 三层架构 Inference 层 + Speculative decoding:本场 = §1.1 补全"SGLang DFlash + Spec V2 下一代投机解码"作为投机解码的工程现状
- v45 §1.1 vLLM OOM 四类根因诊断签名表:本场 = §1.1 补全"SGLang ARM64/EFA 死锁 + AWS EFA 300s 超时空响应"作为推理引擎的工程陷阱
- v45 §1.5 治理信号叠加 + SGLang 3 件未修复 CVE 第 14 立标:本场 = §1.5 补全"SGLang 0.5.10 patch 2026-03-12 修正 spark 8-3 e1prep '维护者 6 个月未响应' 误判 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"——spark llm-infra 增量 1 已建议"flyp 跟催状态核实"
- v45 §5 工程落地框架 §6 预算控制:本场 = §6 补全"推理框架选型决策树 + vLLM-ascend 国产化 + SGLang 昇腾 5 年踩坑"作为预算控制的具体路径
- 反方 / 警示:
- ⚠️ SGLang 0.5.10 patch 2026-03-12 与 v45 §1.5 已立"CVE-2026-3059/3060/3989 三联未修复 + 维护者 6 个月未响应协调披露"是否矛盾?——spark 8-4 llm-infra 增量 1 明确"v45 §1.5 '维护者 6 个月未响应' 误判 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"——本场不消解 v45 已立 §1.5,但需 v46 §1.1 跟进 SGLang 0.5.15 release notes 是否实质性修复三联 CVE
- ⚠️ SGLang Disagg Serving 在 ARM64(EFA)失败 + AWS EFA 300s 超时空响应——这是 v45 §1.1 SGLang RadixAttention 在多 Agent 对话场景的潜在工程陷阱,需 v46 §1.1 新增试金石候选"本机构 SGLang 部署是否使用 ARM64 / EFA / 异构 GPU 互联"
- ⚠️ vLLM-ascend 0.11.0 是昇腾适配版非官方主分支——主分支有未修复 bug,需 v46 §1.1 标注"昇腾版本维护状态 = 非官方分支,生产部署需谨慎"
- ⚠️ CSDN 高价值②推理框架选型指南 TTFT 数据(SGLang 340ms / vLLM 123ms / TensorRT-LLM 80ms)——与 v45 §1.1 AIMultiple H100 29% 架构差距数据部分不一致(AIMultiple 显示 SGLang 16,215 tok/s vs vLLM 12,553 tok/s = SGLang 快 29%;CSDN 显示 vLLM 78 tok/s vs SGLang 65 tok/s = vLLM 快 20%)——两个数据源在不同 workload 下方向不一致,需 v46 §1.1 标注"workload-specific 量化分歧"
- 建议归入节:
- v46 §1.1 模型与推理服务层:补全"SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + vLLM-ascend 0.11.0 国产化 + 推理框架选型 Llama-7B 实测对比表"作为推理引擎主线的生产数据
- v46 §1.1 补全"SGLang ARM64/EFA 死锁 + AWS EFA 300s 超时空响应"作为推理引擎的工程陷阱
- v46 §1.5 治理信号叠加:补全"SGLang 0.5.10 patch 2026-03-12 修正维护者响应节奏 + 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"作为治理信号叠加的修订候选
- v46 §5 工程落地框架 §6 预算控制:补全"推理框架选型决策树 + vLLM-ascend 国产化 + SGLang 昇腾 5 年踩坑"
- v46 §7.1 引用完整性附录新增 URL:vllm.ai/blog/2026-07-22-kimi-k3-preview + sgl-project/sglang GitHub + ascendai.csdn.net 昇腾调优实录 + blog.csdn.net/xx_nm98 推理框架选型指南(4 件 URL)
- 新增 O189 试金石候选:"本机构 SGLang 部署是否使用 ARM64 / EFA / 异构 GPU 互联;vLLM-ascend 国产化生产部署是否可行;推理框架选型是否跨 workload 验证(纯文本 vs Agent 多步推理 vs 长上下文)"
- arXiv 号核证:0 件新 arXiv(均为 GitHub / 官方 blog / CSDN URL)
增量 4 · 🟡 P2 中等 · MCP 五大风险 + RAG 安全 CVE-2025-32711 知识库即最大攻击面 + Snyk Agentic AI Adoption Vol. II + Redpanda Agentic SQL = v45 §1.5 治理信号叠加 + §1.1 应用架构 + §1.2 RAG 的"安全态势 + 治理基础设施"补全
- 来源:
inbox/jay/2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.mdsecurity 段 ⭐⭐⭐⭐⭐ MCP 五大风险(Aembit / CSA Lab Space 2026 · URLhttps://aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities+https://labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1)inbox/jay/2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.mdsecurity 段 ⭐⭐⭐⭐⭐ RAG 安全 — 知识库即最大攻击面(CVE-2025-32711)(Christian Schneider / WitnessAI 2026-02~07 · URLhttps://christian-schneider.net/blog/rag-security-forgotten-attack-surface+https://witness.ai/blog/rag-security)inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md安全与 Agent 治理段条目 8 Snyk Agentic AI Adoption Vol. II(2026-08-03 发布 · URLhttps://snyk.io/news/snyk-2026-state-of-agentic-ai-adoption-volume-ii)+ 条目 9 AI Agent 安全成熟度模型(六级框架 Cyber Security Pentesting Inc. 2026-07-23)+ 条目 11 Redpanda Agentic AI 需要带外治理(URL Redpanda blog 2026-08-03)inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md条目 12 CrowdStrike Falcon AIDR 扩展支持范围(新增 Copilot Studio Agents + Claude Code)
- 要点:
- MCP 五大风险(基于 OWASP/ATLAS/CSA AICM 对照):
- Tool Poisoning:恶意工具描述注入,等效于间接 prompt injection(OWASP ASI01: Agent Goal Hijack)
- 明文 HTTP + OAuth 泄露:2026 年评估发现大量 MCP 服务器使用明文 HTTP,OAuth token / API key 被窃听(CSA AICM)
- ngrok 隧道劫持:MCP 服务器通过 tunnel 服务托管时,会话终止后 subdomain 可被重新注册,攻击者接管(MITRE ATLAS)
- 过度授权:Agent / 工具获得超出所需的权限,横向移动风险(OWASP Excessive Agency)
- 供应链投毒:恶意 Agent 插件伪装成功能更新(OWASP AI3.0)
- 防御原则:① 工具描述需有 known-good 基线验证机制(防止描述层注入)② 实施 workload identity + secretless access(MCP 专用身份方案)③ 将 MCP 安全需求纳入现有 OWASP/ATLAS/AICM 治理框架
- RAG 安全 — 知识库即最大攻击面(CVE-2025-32711):
- 单个隐藏在日常消息中的恶意指令,通过企业 copilot 的 RAG 检索流程,将数据外泄——零点击、零告警
- Slack AI 攻击链:① 攻击者在公开频道发布含恶意指令的消息 ② Slack AI 检索该消息作为用户查询的上下文 ③ 恶意指令从用户对话上下文中构建钓鱼链接,数据外泄 ④ 前提:攻击者需在同一 Slack workspace 有账户(范围受限)
- RAG 安全四层防御(WitnessAI):① Retrieval Trust Zone:提示词与检索内容信任边界分离 ② Namespace Isolation:RAG 命名空间隔离,防止跨租户数据泄露 ③ Guardrails + Prompt Spotlighting:RAG 输出层注入防护 ④ EU AI Act 合规(Article 50,2026-08-02 生效):高风险 AI 系统强制标注 AI 生成内容
- Snyk《Agentic AI Adoption Vol. II》(2026-08-03 发布):
- Agentic 架构采用率从 6 个月前的 28% 升至 33%
- 完整栈(Agent框架 + MCP 服务器)运行者从 36% 升至 50%
- 企业 AI 攻击面约为模型清单显示的 3 倍(安全盲区巨大)
- 三分之二的 AI 攻击面对安全团队不可见
- AI Agent 安全成熟度模型(六级框架 Cyber Security Pentesting Inc. 2026-07-23):
- 从 Level 0(隐式信任)到 Level 5(持续验证的 AI 安全)的成熟度模型
- 现有供应商文档描述单点防御,但缺乏衡量企业整体姿态的方法
- 值得关注的控制项:输入扫描、最小权限工具作用域、沙箱执行、人类审批门
- Redpanda:Agentic AI 需要带外治理:Agentic kill switch 本质是数据库问题;推出 Redpanda SQL 作为 Agent 治理专用流处理层——治理不是模型问题,是基础设施问题
- CrowdStrike Falcon AIDR 扩展支持范围:新增 Copilot Studio Agents + Claude Code;AIDR(AI Detection and Response)进入 MCP 服务器和 AI Gateway 层面保护
- MCP 五大风险(基于 OWASP/ATLAS/CSA AICM 对照):
- 与活文档 v45 关系:
- v45 §1.5 治理信号叠加 七重 + 候选第八重:本场 = §1.5 补全"MCP 五大风险(Tool Poisoning / 明文 HTTP / ngrok 隧道劫持 / 过度授权 / 供应链投毒)+ Snyk 3 倍攻击面 + 三分之二攻击面不可见 + 六级成熟度模型"作为治理信号叠加的第 9 重候选 = 平台级 MCP 安全态势
- v45 §1.2 RAG 决策与证据系统 + RAG-only 静默失败:本场 = §1.2 补全"CVE-2025-32711 RAG 知识库即最大攻击面 + Slack AI 攻击链 + WitnessAI RAG 安全四层防御"作为 RAG 安全的实证补强
- v45 §1.1 应用架构六层 + 工具与协议层 + MCP 2.0 stateless:本场 = §1.1 补全"MCP 五大风险 + 防御原则 + workload identity + secretless access + Redpanda Agentic SQL + CrowdStrike AIDR"作为工具与协议层的具体安全实践
- v45 §6 工程落地框架 §9 安全与隐私:本场 = §9 补全"CVE-2025-32711 + Slack AI 攻击链 + RAG 四层防御(Retrieval Trust Zone / Namespace Isolation / Guardrails / EU AI Act Article 50)+ MCP 五大风险防御原则 + Snyk 3 倍攻击面"作为安全与隐私的具体工程路径
- v45 §3.1 共识"主动防御与可证明验证成为新前沿":本场 = §3.1 共识补全"治理不是模型问题,是基础设施问题(Redpanda Agentic SQL)+ 三分之二 AI 攻击面对安全团队不可见(Snyk)"作为共识补强
- 反方 / 警示:
- ⚠️ Snyk 33% Agentic 架构采用率是 Snyk 调查口径——样本偏差(Snyk 客户更可能采纳 Agentic 架构),未独立验证
- ⚠️ CVE-2025-32711 Slack AI 攻击前提"攻击者需在同一 Slack workspace 有账户"——限制了攻击范围,但企业内场景仍构成威胁
- ⚠️ Redpanda Agentic SQL 是厂商博客口径——是否在多 Agent 治理层独立验证未给
- ⚠️ CrowdStrike Falcon AIDR 进入 MCP 服务器和 AI Gateway 层面保护——是商业产品扩展,学术中立评估未给
- 建议归入节:
- v46 §1.5 治理信号叠加:候选新增第 9 重 = 平台级 MCP 安全态势(MCP 五大风险 + Snyk 3 倍攻击面 + 三分之二攻击面不可见 + 六级成熟度模型)
- v46 §1.2 RAG 决策与证据系统:补全"CVE-2025-32711 RAG 知识库即最大攻击面 + Slack AI 攻击链 + WitnessAI RAG 安全四层防御"
- v46 §1.1 应用架构六层:补全"MCP 五大风险 + 防御原则 + Redpanda Agentic SQL + CrowdStrike AIDR"作为工具与协议层安全实践
- v46 §6 工程落地框架 §9 安全与隐私:补全"CVE-2025-32711 + Slack AI 攻击链 + RAG 四层防御 + MCP 五大风险防御原则 + Snyk 3 倍攻击面"
- v46 §7.1 引用完整性附录新增 CVE-2025-32711(Slack AI RCE)+ 新增 URL:aembit.io/blog/the-ultimate-guide-to-mcp-security-vulnerabilities + labs.cloudsecurityalliance.org/agentic/agentic-mcp-security-best-practices-v1 + christian-schneider.net/blog/rag-security-forgotten-attack-surface + witness.ai/blog/rag-security + snyk.io/news/snyk-2026-state-of-agentic-ai-adoption-volume-ii(5 件 URL)
- arXiv 号核证:0 件新 arXiv(MCP 五大风险 / CVE-2025-32711 / Snyk / Redpanda / CrowdStrike 均为安全研究报告 + 商业产品公告)
增量 5 · 🟢 P2 邻接 · LongHorizon-Harness arXiv:2608.01964 + Progressive Agent Skill (Skill-α) arXiv:2608.01678 + DAPD arXiv:2608.01735 + EMBL AI Librarian arXiv:2607.28229 = v45 §1.1 应用架构 + §1.3 Memory + §2.3 Skills 的"长程任务 + Skill 学习 + 训练方法论"补全
- 来源:
paper_cards/713-2608-01964.md(LongHorizon-Harness · 主分类 agent · 形态 method · 副分类 evaluation · 2026-08-04 早晨 net-new)paper_cards/714-2608.01678.md(Progressive Agent Skill Generation via Reinforcement Learning · 主分类 agent · 形态 method · 2026-08-04 早晨 net-new · Skill-α 强化学习方法)paper_cards/716-2608-01735.md(DAPD Dual-Anchored Policy Distillation · 主分类 llm-infra · 形态 method · 副分类 engineering · 2026-08-04 早晨 net-new)paper_cards/709-2607-28229.md(EMBL AI Librarian · 主分类 agent · 形态 method · 副分类 rag · 2026-08-04 02:10 已建 · 欧洲分子生物学实验室 · Europe PMC 4000 万+ 文献 Agent 专用语义知识接口)inbox/spark/2026-08-04-agent-e1prep.md增量 1 EMBL AI Librarian 第五十八节点候选 + 增量 6 SDB 2605.20173(jay 1245 noon 协调棒)
- 要点:
- LongHorizon-Harness arXiv:2608.01964:Long-horizon LLM agents require sustained reasoning + tool use + revision across many interdependent steps;现有 agent harnesses 将任务执行 + 任务状态 + 完成评估 维持在 growing context 内,导致状态难以追踪且不正确的自评估传播到后续决策;LongHorizon-Harness 重新表述长程执行为 task-state management problem,将任务状态显式保留在执行外,仅用事实更新——与 StateAct(jay 1850 增量 2)同源思路
- Progressive Agent Skill (Skill-α) arXiv:2608.01678:现有 skill generation 方法主要依赖启发式或流水线式整合,必须为不同证据源专门设计;学习式方法通过 RL 提供统一建模方式;但学习式 skill generation 仍具挑战,因为skills 缺乏基于相关性或正确性的自然监督信号,其价值主要通过是否提升 agent 在下游任务上的行为来决定——Skill-α 提出 RL 方法解决这一挑战(与 v45 §2.3 已立 SkillRise / CAST / SkillOpt 三件套 + ACE jay 1905 增量 形成"skill 学习 RL 化"主线)
- DAPD arXiv:2608.01735 Dual-Anchored Policy Distillation:On-policy self distillation (OPSD) 越来越用于语言模型后训练;它强化了具有特权信息的 teacher,但可能引发"特权幻觉":student 学习到它无法从推理时上下文复现的特权依赖行为,但表现得好像训练时特权信息仍然可用,最终降低性能;识别 teacher-student 在推理时的信息不对称是 OPSD 失败的根本原因;DAPD 通过 Dual-Anchored 解决这一不对称——与 v45 §1.4 已立 SaLAD / Counterfactual Sensitivity / CoRT 形成"反方基线"邻接
- EMBL AI Librarian arXiv:2607.28229:网络正越来越多地被 AI Agent 而非人类访问;Europe PMC(4000 万+ 文献)是为人类设计的,接受关键词和复杂语法,返回整篇论文;EMBL AI Librarian 把 Europe PMC 改造为 Agent 专用语义知识接口——支持多轮搜索 + 文献摘要提取,理解复杂语义而非关键词匹配;可迁移性:思路可迁移至其他专业文献库(法律 / 医疗 / 学术 / 金融 / 政府)
- 与活文档 v45 关系:
- v45 §1.1 应用架构六层 + Harness 中心 + 推理服务层:本场 = §1.1 补全"LongHorizon-Harness(长程任务状态管理)+ Skill-α(RL-based skill generation)+ DAPD(特权幻觉修正)+ EMBL AI Librarian(专业文献库 Agent 化)"作为应用架构的具体工程范式
- v45 §1.3 Memory 七路 + 第八路安全维度 + VikingMem vs OpenClaw Markdown 全面胜出:本场 = §1.3 补全"LongHorizon-Harness task-state 显式保留在执行外 + DAPD 信息不对称修正"作为 Memory 系统的工程实现
- v45 §2.3 Skills 由静态说明书演变为可训练资产 + SkillRise / CAST / SkillOpt 三件套:本场 = §2.3 补全"Skill-α RL 方法解决 skills 缺乏自然监督信号的挑战 + ACE Generator/Reflector/Curator 三角色架构"作为 Skills 演化的统一学习框架
- v45 §3.1 共识"Skills 由静态说明书演变为可训练、可版本化、可回滚的资产":本场 = §3.1 共识补全"Skill-α 学习式方法 vs 启发式 / 流水线式整合"作为共识的具体技术路径
- 反方 / 警示:
- ⚠️ LongHorizon-Harness / Skill-α / DAPD / EMBL AI Librarian 均为 2026-08-04 早晨 net-new——paper_cards 已建但 v46 接力前需 cron 卡建脚本读 PDF 全文核验(arXiv 编号 2608.01964 / 2608.01678 / 2608.01735 / 2607.28229 均已确认)
- ⚠️ LongHorizon-Harness 与 jay 1850 增量 2 StateAct 同源思路(均把任务状态显式保留在执行外)——是否构成独立立标还是合并立标需 v46 §1.1 明确
- ⚠️ Skill-α "skills 缺乏自然监督信号"——RL 方法是否真正解决这一挑战?下游任务行为作为代理信号是否引入新的偏置?
- ⚠️ DAPD "特权幻觉"是否仅在 OPSD 场景出现?DAPD 在其他训练方法(off-policy distillation / RLHF / DPO)中是否适用?
- 建议归入节:
- v46 §1.1 应用架构六层:补全"LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian"作为应用架构的具体工程范式
- v46 §1.3 Memory 七路 + 第八路安全维度:补全"LongHorizon-Harness task-state 显式保留 + DAPD 信息不对称修正"
- v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"Skill-α RL 方法 + ACE Generator/Reflector/Curator"
- v46 §7.1 引用完整性附录新增 arXiv:2608.01964 / 2608.01678 / 2608.01735 / 2607.28229(4 件)
- arXiv 号核证:arXiv:2608.01964(LongHorizon-Harness · paper_cards/713)+ arXiv:2608.01678(Skill-α · paper_cards/714)+ arXiv:2608.01735(DAPD · paper_cards/716)+ arXiv:2607.28229(EMBL AI Librarian · paper_cards/709)
增量 6 · 🟢 P3 邻接 · From Cloud to Crowd arXiv:2608.00922 + TEngineDB-V arXiv:2608.00650 + UEmbed arXiv:2608.02583 + Beyond Feeling Better arXiv:2607.27851 = v45 §1.2 RAG 形态扩展 + §1.3 Memory 多模态 + §1.4 评测与可靠性的"分布式 / OLAP / 多模态嵌入 / 长程对话"补全
- 来源:
paper_cards/707-2608-00922.md(From Cloud to Crowd: Democratizing LLM Service with Decentralized Edge Collaboration for RAG · 主分类 rag · 形态 application)paper_cards/708-2608-00650.md(TEngineDB-V: An OLAP-Native Vector Search System for Large-k Workloads at Tencent · 主分类 rag · 形态 application)paper_cards/712-2608-02583.md(UEmbed: Unified Sparse and Dense Multimodal Embeddings · 主分类 rag · 形态 method · 副分类 multimodal)paper_cards/710-2607-27851.md(Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm · 主分类 agent · 形态 method)
- 要点:
- From Cloud to Crowd arXiv:2608.00922:LLM 服务民主化——通过去中心化边缘协作支持 RAG;云端托管 LLM 强大但受供应商锁定和高资源需求所限;边缘 SLM 知识覆盖有限且与基线相比存在显著准确性差距;通过 SLM + RAG + 去中心化边缘协作 + 大模型支撑的检索决策实现 LLM 服务民主化——RAG 部署的边缘化新范式
- TEngineDB-V arXiv:2608.00650:OLAP 原生向量搜索系统(Tencent);Large-k 分析向量搜索($k=10^3$–$10^5$ 用于分析如聚合 / 过滤 / 连接)在新兴工作负载中日益重要,包括 LLM 数据管理和 Tencent 的广告分析;现有专用向量数据库为满足尾延迟约束通常对 k 设上限(如 $k \leq 10^4$),且分析能力有限;TEngineDB-V 以 OLAP-native 方式突破这一瓶颈
- UEmbed arXiv:2608.02583:统一稀疏 + 稠密多模态嵌入(decoder-only multimodal embedding model);现有 Learned Sparse Retrieval (LSR) 仍依赖双向架构,其扩展到多模态场景需辅助跨模态模块;UEmbed 在一个因果前向传递中同时产生稀疏词法和稠密表示——RAG 多模态检索的统一嵌入模型
- Beyond Feeling Better arXiv:2607.27851:能力维持型情感对话(Capability-Sustaining Emotional Dialogue)作为长程研究范式;与 v45 §1.4 DialogGuard 多 Agent 心理安全 + ACL 2026 Demo 邻接;长程情感对话不是仅让用户感觉更好,而是维持用户能力——长程心理健康 / 治疗 Agent 的新研究范式
- 与活文档 v45 关系:
- v45 §1.2 RAG 决策与证据系统 + HyPE / CrossRAG / ExtractBench / B1ade / On-Premises RAG 五件新候选:本场 = §1.2 补全"From Cloud to Crowd(去中心化边缘协作 RAG)+ TEngineDB-V(OLAP 原生向量搜索 large-k)+ UEmbed(统一稀疏 + 稠密多模态嵌入)"作为 RAG 形态扩展
- v45 §1.3 Memory 七路 + 第八路安全维度:本场 = §1.3 补全"Beyond Feeling Better 长程情感对话能力维持"作为 Memory 多模态 + 长程对话的具体应用
- v45 §1.4 评测与可靠性 + Beyond Borrowed Histories 用户对齐评测 + DialogGuard 心理安全:本场 = §1.4 补全"Beyond Feeling Better 长程情感对话作为研究范式"作为评测对象扩展
- 反方 / 警示:
- ⚠️ From Cloud to Crowd 边缘 SLM + RAG 的准确性差距——是否在多 workload 下稳定?边缘设备算力限制下 RAG 检索质量如何保证?
- ⚠️ TEngineDB-V OLAP 原生向量搜索是 Tencent 内部生产场景——是否外推到通用 RAG workload 待验证
- ⚠️ UEmbed 多模态嵌入统一稀疏 + 稠密——是否在多模态检索 benchmark(MTEB-Multilingual / BEIR-Multi)上稳定胜出需核验
- ⚠️ Beyond Feeling Better 长程情感对话能力维持——如何量化"能力维持"作为评估指标?
- 建议归入节:
- v46 §1.2 RAG 决策与证据系统:补全"From Cloud to Crowd + TEngineDB-V + UEmbed"作为 RAG 形态扩展
- v46 §1.3 Memory 七路 + 第八路安全维度:补全"Beyond Feeling Better 长程情感对话能力维持"
- v46 §1.4 评测与可靠性:补全"Beyond Feeling Better 长程情感对话作为研究范式"
- v46 §7.1 引用完整性附录新增 arXiv:2608.00922 / 2608.00650 / 2608.02583 / 2607.27851(4 件)
- arXiv 号核证:arXiv:2608.00922(From Cloud to Crowd · paper_cards/707)+ arXiv:2608.00650(TEngineDB-V · paper_cards/708)+ arXiv:2608.02583(UEmbed · paper_cards/712)+ arXiv:2607.27851(Beyond Feeling Better · paper_cards/710)
增量 7 · 🟢 P3 邻接 · Constitutional Midtraining arXiv:2607.26654 + Snyk Agentic AI 三分之二攻击面不可见 + Loop Engineering 工程化 + CSDN RAG 全链路实战 + LangChain State of Agent Engineering 37 分评估缺口 = v45 §1.1 + §1.5 + §2.3 的"对齐 / 安全 / 评估"补全
- 来源:
paper_cards/711-2607-26654.md(Constitutional Midtraining · 主分类 risk · 形态 method · 2026-08-04 早晨 net-new · Content Presence Drives Alignment Gains · 120B 规模持久对齐中训练 第 5 维)inbox/jay/2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md条目 8 Snyk Agentic AI Adoption Vol. II(沿用增量 4)+ 条目 17 awesome-agent-skills-security 知识库(GitHub LLMSecurity/awesome-agent-skills-security)inbox/jay/2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.mdSubstack 高价值①The AI Agents Stack 2026 Edition(LangChain State of Agent Engineering 调查:89% 生产 Agent 团队搭建可观测性,但只有 52% 有正式评估 → 37 分评估缺口是生产质量的死亡线 · URLhttps://theaiengineer.substack.com/p/the-agents-stack-2026-edition)+ Agent Guardrails 演变(2024:输入/输出过滤器 → 2026:授权工具调用 + 强制速率限制 + 验证 Agent 实际行为)inbox/jay/2026-08-04-1220-csdn-rag-mlops-agent-highvalue.mdCSDN RAG 全链路实战 + 法律 RAG 案例 + Agent RAG 融合实战(jay 1850 增量 1 沿用)inbox/flyp/2026-08-04-risk-e1prep.mdP2 候补级 Constitutional Midtraining 矛盾候补(Anthropic Constitution 复用 vs 独立作者群待核实)
- 要点:
- Constitutional Midtraining arXiv:2607.26654:Content Presence Drives Alignment Gains;120B 规模持久对齐中训练 第 5 维 反方(flyp risk-e1prep 已立 P2 候补级);中训练阶段(midtraining)内容存在驱动对齐增益——为对齐工程提供新的训练阶段切分
- Snyk Agentic AI 37 分评估缺口 + 三分之二攻击面不可见:LangChain State of Agent Engineering 调查:89% 生产 Agent 团队搭建可观测性,但只有 52% 有正式评估 → 37 分评估缺口是生产质量的死亡线——与 v45 §1.4 评测与可靠性"评测必须分解工作流 + 时间粒度 + credit assignment 三级体系"形成"工业实证 + 学术共识"对位
- Agent Guardrails 演变(2024 → 2026):
- 2024:输入/输出过滤器(input/output filters)
- 2026:授权工具调用 + 强制速率限制 + 验证 Agent 实际行为
- 新兴 Benchmark:Context-Bench(内存管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent)
- awesome-agent-skills-security 知识库(GitHub LLMSecurity/awesome-agent-skills-security):
- MCP 应用的实证研究:1,723 个 GitHub 应用,85.2% 通过文件配置,81.1% 用官方 SDK,但仅 37.2% 在工具执行前有人类审批
- GitInject:CI/CD 管道中的提示注入攻击评估
- Efficient and Sound Probabilistic Verification for AI Agents(使用分布稳健优化计算 Agent 违规概率上界)
- Agentics 2.0:逻辑转导代数形式化 Agent 数据工作流
- 与活文档 v45 关系:
- v45 §1.1 应用架构六层 + Harness 中心 + Agent Guardrails:本场 = §1.1 补全"Agent Guardrails 演变 2024 → 2026 三层模型 + 37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench 新兴 Benchmark"作为应用架构工具链的具体实例
- v45 §1.5 治理信号叠加 七重 + 候选第八重:本场 = §1.5 补全"Snyk 33% Agentic 架构采用率 + 完整栈 50% + 三分之二攻击面不可见 + MCP 37.2% 工具执行前有人类审批"作为治理信号叠加的工业实证
- v45 §1.4 评测与可靠性 + 三级 credit assignment(token 级 CoRT / 节点级 PROTEA / 系统级 DecoEvo):本场 = §1.4 补全"37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench"作为评测方法学的工业实证
- v45 §2.3 Skills 由静态说明书演变为可训练资产 + 上下文工程:本场 = §2.3 补全"Context-Bench 内存管理 + Recovery-Bench 错误恢复"作为 Skills 演化的具体评估工具
- 反方 / 警示:
- ⚠️ Constitutional Midtraining 120B 规模 + Anthropic Constitution 复用 vs 论文为独立作者群——flyp risk-e1prep 明确"需核实 Anthropic 直接作者参与度 vs 仅引用 Constitution 文本"
- ⚠️ Snyk 89% 可观测性 + 52% 正式评估 → 37 分评估缺口——是 LangChain State of Agent Engineering 调查口径(可能样本偏差);未独立验证
- ⚠️ MCP 37.2% 工具执行前有人类审批——意味着 62.8% 的 MCP 应用在工具执行前无人类审批——这是 MCP 工具自主执行的重大安全缺口
- 建议归入节:
- v46 §1.1 应用架构六层:补全"Agent Guardrails 演变 2024 → 2026 三层模型 + 37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench"
- v46 §1.5 治理信号叠加:补全"Snyk 33% + 三分之二攻击面不可见 + MCP 37.2% 工具执行前有人类审批"作为工业实证
- v46 §1.4 评测与可靠性:补全"37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench"作为评测方法学工业实证
- v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"Context-Bench + Recovery-Bench"
- v46 §7.1 引用完整性附录新增 arXiv:2607.26654(Constitutional Midtraining)+ 新增 URL:theaiengineer.substack.com/p/the-agents-stack-2026-edition + github.com/LLMSecurity/awesome-agent-skills-security(2 件 URL)
- arXiv 号核证:arXiv:2607.26654(Constitutional Midtraining · paper_cards/711 · 主分类 risk)
增量 8 · 🟢 P3 邻接 · HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立" = 飞轮机制从 v45 §2.7 "完全饱和" 微反弹为 "轮换态" + 3 件 v45 已立标的论文在 8-4 早晨继续追认
- 来源:
inbox/tom/2026-08-04-0900-hf-daily-2026-08-04.md(HF Daily 8-4 票榜 15 件)- 间接对比
inbox/tom/2026-08-03-0900-hf-daily-2026-08-03.md(8-3 票榜 15 件) inbox/stephen/2026-08-04-ai-industry-e1prep.md增量 2(沿用 stephen ai-industry 立标)inbox/spark/2026-08-04-agent-e1prep.md增量 6 飞轮机制从 v38 "完全饱和" 微反弹为 v39 "轮换态"
- 要点(8-4 vs 8-3 跨日变化):
- 8-4 票榜 15 件 vs 8-3 票榜 15 件 跨日"4 件 net-new + 1 件下榜 + 10 件续立":
- 4 件 net-new 入榜(8-4 早晨新上票榜):
- #2 From RLVR to RLSVR arXiv:2607.23802 · 73▲(8-3 不在 top 15)
- #3 Mental World Modeling arXiv:2607.27201 · 53▲(8-3 不在 top 15 · 沿用 v45 §1.1 Mental World Modeling 立标 · 本场增档信号 = v45 §1.1 立标饱和)
- #10 AISPA arXiv:2607.28617 · 31▲(8-3 不在 top 15)
- #12 RefCaptioner arXiv:2607.28509 · 26▲(8-3 不在 top 15)
- 1 件下榜(8-3 在榜 / 8-4 不在 top 15):
- DistillAlign arXiv:2607.26811 · 8-3 89▲ → 8-4 下榜(其他 14 件 8-3 票数 31~284 + 跨日 +0~+10)
- 10 件续立(8-3 在榜 / 8-4 仍在榜):
- #1 Qwen-UI-Agent 2607.28227 · 294▲(跨日 +10) · v45 §1.1 / §2.3 已立续立
- #4 Memory Decoder at Scale 2607.27919 · 51▲(跨日 +2) · v45 §1.3 Memory 第七路参数化立标
- #5 N_0-VTLA 2607.23782 · 50▲ · 本期新续立(8-3 在榜)
- #6 Beacon 2607.28595 · 48▲(持平) · 本期新续立(8-3 在榜)
- #7 Meshy T2 2607.28675 · 41▲ · 本期新续立(8-3 在榜 · paper_cards/699)
- #8 MPIE-Bench 2607.27616 · 37▲(持平) · v45 §1.4 评测与可靠性邻接
- #9 Beyond Borrowed Histories 2607.27816 · 32▲(跨日 +1) · v45 §1.4 评测与可靠性 沿用 jay engineering-e1prep 已立
- #11 CLBench-V 2607.25294(8-4 不在 top 15,可能下榜)
- #13 N_0-TWAM 2607.23783 · 28▲ · 本期新续立(8-3 在榜)
- #14 QQWorld 2607.28415 · 24▲ · 本期新续立(8-3 在榜 · paper_cards/698 · v45 §1.1 已立)
- #15 SAF-OPD 2607.29209 · 23▲ · 本期新续立(8-3 在榜 · paper_cards/701 · v45 §1.1 已立)
- 4 件 net-new 入榜(8-4 早晨新上票榜):
- 8-4 票榜 15 件 vs 8-3 票榜 15 件 跨日"4 件 net-new + 1 件下榜 + 10 件续立":
- 与活文档 v45 关系:
- v45 §1.1 Mental World Modeling 立标饱和:本场 = §1.1 补全"MWM arXiv:2607.27201 在 8-4 票榜 #3 53▲ = v33 §2.143 已立标的论文在 v45 / v46 早晨正式升档(从 8-3 #15 18▲ → 8-4 #3 53▲)"——立标信号显著上升
- v45 §1.3 Memory Decoder at Scale 第七路参数化立标:本场 = §1.3 补全"Memory Decoder at Scale 2607.27919 在 8-4 票榜 #4 51▲(跨日 +2)"作为第七路立标饱和的工业实证
- v45 §1.5 治理信号叠加 七重:本场 = §1.5 补全"飞轮机制从 v45 '完全饱和' 微反弹为 '轮换态'(4 件 net-new + 1 件下榜 + 10 件续立)"作为治理信号叠加的工业态势
- v45 §6 工程落地框架 §11 治理信号成熟度 L4-L1 四级指标体系:本场 = §11 补全"HF Daily 票榜轮换态作为治理信号成熟度的具体评估指标"
- 反方 / 警示:
- ⚠️ HF Daily 票榜 14 票以下下榜 = DistillAlign 2607.26811 8-3 89▲ → 8-4 下榜——是否意味着立标衰减?DistillAlign 在 v45 §1.1 multimodal / video generation 邻接,具体饱和度需 v46 §1.1 跟进
- ⚠️ Mental World Modeling 53▲ 是单日升档信号——是否持续到 8-5 ~ 8-9 1 周窗口?需要 v46 早晨 HF Daily 票榜跟踪
- ⚠️ 飞轮机制从"完全饱和"微反弹为"轮换态"是否持续?——如果 8-5 ~ 8-9 持续轮换则立标飞轮重启,如果恢复完全饱和则本场为偶发反弹
- 建议归入节:
- v46 §1.1 应用架构六层:补全"MWM arXiv:2607.27201 在 8-4 票榜 #3 53▲ 立标信号显著上升(从 8-3 #15 18▲ → 8-4 #3 53▲)"
- v46 §1.3 Memory 七路 + 第八路安全维度:补全"Memory Decoder at Scale 2607.27919 在 8-4 票榜 #4 51▲(跨日 +2)"作为第七路立标饱和
- v46 §1.5 治理信号叠加:补全"HF Daily 飞轮机制从 v45 '完全饱和' 微反弹为 '轮换态'(4 件 net-new + 1 件下榜 + 10 件续立)"
- v46 §6 工程落地框架 §11 治理信号成熟度 L4-L1 四级指标体系:补全"HF Daily 票榜轮换态作为治理信号成熟度的具体评估指标"
- arXiv 号核证:arXiv:2607.23802(From RLVR to RLSVR · HF Daily 8-4 #2 73▲)+ arXiv:2607.27201(Mental World Modeling · HF Daily 8-4 #3 53▲)+ arXiv:2607.28617(AISPA · HF Daily 8-4 #10 31▲)+ arXiv:2607.28509(RefCaptioner · HF Daily 8-4 #12 26▲)+ arXiv:2607.28227(Qwen-UI-Agent · HF Daily 8-4 #1 294▲)+ arXiv:2607.27919(Memory Decoder at Scale · HF Daily 8-4 #4 51▲)+ arXiv:2607.23782(N_0-VTLA · HF Daily 8-4 #5 50▲)+ arXiv:2607.28595(Beacon · HF Daily 8-4 #6 48▲)+ arXiv:2607.28675(Meshy T2 · HF Daily 8-4 #7 41▲)+ arXiv:2607.27616(MPIE-Bench · HF Daily 8-4 #8 37▲)+ arXiv:2607.27816(Beyond Borrowed Histories · HF Daily 8-4 #9 32▲)+ arXiv:2607.23783(N_0-TWAM · HF Daily 8-4 #13 28▲)+ arXiv:2607.28415(QQWorld · HF Daily 8-4 #14 24▲)+ arXiv:2607.29209(SAF-OPD · HF Daily 8-4 #15 23▲)+ arXiv:2607.26811(DistillAlign · HF Daily 8-4 下榜)
2. 值得警惕的矛盾或待核实说法(5 条)
2.1 SGLang 0.5.10 patch 2026-03-12 vs v45 §1.5 "SGLang 3 件未修复 CVE 维护者 6 个月未响应协调披露"误判边界
矛盾点: v45 §1.5 已立"SGLang CVE-2026-3059 / 3060 / 3989 三联未修复 + 维护者 6 个月未响应协调披露 + 临时缓解(msgpack + localhost binding)"。spark 8-4 llm-infra 增量 1 明确"v45 §1.5 '维护者 6 个月未响应' 误判 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实"——问题:① SGLang 0.5.10 patch 2026-03-12 是否针对三联 CVE 提供修复?② SGLang 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复?③ v45 §1.5 "6 个月未响应"是基于 2026-02-04 发现 → 2026-03 披露 → 2026-08 仍未官方补丁的时间线,如果 2026-03-12 已有 0.5.10 patch 应消解 6 个月未响应判定。
核实建议: v46 接力前明确:① 0.5.10 / 0.5.15 release notes 是否覆盖 CVE-2026-3059 / 3060 / 3989;② CVE-2026-14890 是否在 0.5.15 中修复;③ 如果已修复,v45 §1.5 沿用的"6 个月未响应"判定需要修订为"维护者已响应但修复路径未公开";④ 如果未修复,v45 §1.5 沿用判定继续有效。
2.2 AIMultiple H100 29% 架构差距(SGLang 16,215 tok/s)vs CSDN 推理框架选型 Llama-7B 实测(vLLM 78 / SGLang 65 tok/s = vLLM 快 20%):workload-specific 量化分歧
矛盾点: v45 §1.1 已立"AIMultiple H100 Llama 3.3 70B FP8 实测 SGLang 16,215 tok/s vs vLLM 12,553 tok/s = 29% 架构层面差距"。本场增量 3(jay 1620 CSDN)引入"Llama-7B 实测对比表"显示 vLLM 78 tokens/s vs SGLang 65 tokens/s = vLLM 快 20%——两个数据源在不同 workload 下方向不一致。
问题:① AIMultiple H100 70B FP8 是大模型高显存场景;CSDN Llama-7B 是小模型低显存场景——两个 workload 是否可对比?② SGLang RadixAttention 在多轮 Agent 对话场景的 prefix overlap 命中率与吞吐增益相关性——CSDN 实测可能未充分利用 SGLang RadixAttention 优势?③ workload-specific 量化分歧是否意味着 v45 §1.1 "29% 架构差距"仅在 H100 70B FP8 大模型场景成立,在 Llama-7B 小模型场景反向?
核实建议: v46 接力前明确:① 沿用 v45 §1.1 "workload-specific 量化分歧"标注(AIMultiple 70B FP8 vs CSDN 7B = 模型规模 + 量化精度 + 显存约束均不同);② v45 §1.1 推理引擎选型决策树是否需 workload-specific 修订(高显存大模型 → SGLang;低显存小模型 → vLLM);③ 新增 O187 试金石候选"本机构常用模型在 vLLM vs SGLang 的 p50/p99 延迟分布"是否需要跨模型规模验证。
2.3 Multi-agent 100% vs Single agent 1.7% 数量级差距 vs v45 §3.2 争议 #4 "多 agent 是否真的优于单 agent":是否升为正式共识?
矛盾点: v45 §3.2 争议 #4 已立"多 agent 是否真的优于单 agent"——v45 沿用 v44"只有在角色信息、工具或目标真正异质时才可能有净收益"。本场增量 1 引入"Multi-agent orchestration 100% vs Single agent 1.7% 数量级差距(348 次试验)+ IT incident response 场景"。问题:① 100% vs 1.7% 是 IT incident response 单一场景的实证,是否可外推到一般 agent 任务?② 348 次试验是否覆盖多 workload / 多模型 / 多规模?③ v45 §3.2 争议 #4 "角色信息、工具或目标真正异质时才可能有净收益"边界是否过于保守?
核实建议: v46 接力前明确:① Multi-agent 100% vs Single agent 1.7% 是否升为正式共识候选(需要多 workload / 多模型验证);② v45 §3.2 争议 #4 是否修订为"实证支持 narrow-role 多 agent 协作 + 仅在异质条件下净收益"——本场倾向"实证支持 + 条件限制修订";③ v45 §3.2 争议 #4 是否升级为正式共识(如果多源实证 + 跨 workload 验证稳定)。
2.4 KV Cache 优化第 6 件集群(6 件新工作)vs v45 §1.1 已立 14+1 件套:立标饱和后扩面边界
矛盾点: v45 §1.1 已立 KV Cache 五大方向系统综述(arXiv:2603.20397)+ KIVI / KVQuant / ZipCache / NexusQuant / CXL PIM-DIMM / Harvest / Agent Memory Q4 KV / LMCache crash-safe / Spheron Context Engineering / Memory 综述 arXiv:2607.25380 / SIGMOD 三件套 / 7 大顶会议 KV-cache 共 14+1 件套。本场增量 2 引入 6 件新工作(TopKV / C²KV / HiKV / DualDecoder / 反事实惊喜 KV / TokTier / ResKV 共 7 件 + Beyond Prefill-Decode Disaggregation 共 8 件)——问题:① 立标饱和后扩面边界如何标注?(是新增独立件还是并入已有件套?)② 6 件新工作是否全部进入 v46 §1.1 主线,还是按"成熟度"分级标注?③ v45 §1.1 KV Cache 五方向系统综述(arXiv:2603.20397)是否覆盖本场 6 件新工作?——如果已覆盖,本场为补强而非新增;如果未覆盖,本场为扩面。
核实建议: v46 接力前明确:① 6 件新工作分类 = 新增件(TopKV / C²KV / HiKV / 反事实惊喜 KV / TokTier / ResKV 6 件)+ 综述类(Beyond Prefill-Decode Disaggregation 1 件)+ 池化类(DualDecoder 1 件)——共 8 件候选;② v46 §1.1 KV Cache 优化件套从 v45 "14+1 件套"扩面到 "14+1+8=23 件套"是否合理?——本场倾向"分级标注 = 新增件(主类 6 件) + 综述类(1 件) + 池化类(1 件)";③ arXiv:2603.20397 综述是否需要 v46 §1.1 跟进修订以覆盖新 8 件。
2.5 Loop Engineering + ACE Agentic Context Engineering + LongHorizon-Harness + StateAct:四个并行框架的边界与合并可能性
矛盾点: v45 §1.4 已立"Loop Engineering = Prompt + Context + Loop 三层范式(Boris Cherny Claude Code 创作者 + Peter Steinberger 推广 + MINT Framework + 区分 Minutes/Hours/Days 三个循环粒度 + Agent 开发生命周期从 Scoped Intent 到生产反馈 + 评估是 Loop 的核心)"。本场增量 1 引入:① ACE Agentic Context Engineering(Generator / Reflector / Curator 三角色架构);② LongHorizon-Harness(任务状态显式保留在执行外 + 仅用事实更新);③ StateAct(subagent 化 + 跨 subagent 程序状态管理)——问题:① 四个并行框架的边界如何标注?(Loop = 通用循环 / ACE = context playbook / LongHorizon-Harness = task-state management / StateAct = subagent 状态管理)② 是否存在合并可能性?(如 Loop Engineering 框架下包含 ACE / LongHorizon-Harness / StateAct 作为子模式)③ 四个框架的相对成熟度与工业部署比例?
核实建议: v46 接力前明确:① Loop Engineering 作为通用框架,ACE / LongHorizon-Harness / StateAct 作为具体子模式;② v46 §1.4 沿用 v45 "Loop Engineering = Prompt + Context + Loop 三层范式" + 补全"ACE / LongHorizon-Harness / StateAct 作为具体子模式";③ v46 §4 开放问题候选新增"Loop Engineering + ACE + LongHorizon-Harness + StateAct 四个并行框架的边界与合并可能性"。
3. 可引用的 arXiv 号列表(本场新增 + 沿用 v45 完整)
3.1 本场新增 arXiv 号(15 件 + 4 件候选 = 19 件候选)
| arXiv 号 | 论文 | 主分类 | 形态 | 增量 | 来源 |
|---|---|---|---|---|---|
| arXiv:2608.01964 | LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks | agent | method | 增量 5 | paper_cards/713 |
| arXiv:2608.01678 | Progressive Agent Skill Generation via Reinforcement Learning (Skill-α) | agent | method | 增量 5 | paper_cards/714 |
| arXiv:2608.01735 | DAPD: Dual-Anchored Policy Distillation | llm-infra | method | 增量 5 | paper_cards/716 |
| arXiv:2607.28229 | EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents | agent | method | 增量 5 | paper_cards/709 |
| arXiv:2608.00922 | From Cloud to Crowd: Democratizing LLM Service with Decentralized Edge Collaboration for RAG | rag | application | 增量 6 | paper_cards/707 |
| arXiv:2608.00650 | TEngineDB-V: An OLAP-Native Vector Search System for Large-k Workloads at Tencent | rag | application | 增量 6 | paper_cards/708 |
| arXiv:2608.02583 | UEmbed: Unified Sparse and Dense Multimodal Embeddings | rag | method | 增量 6 | paper_cards/712 |
| arXiv:2607.27851 | Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm | agent | method | 增量 6 | paper_cards/710 |
| arXiv:2607.28633 | TopKV: 拓扑感知 KV Cache 传输调度器 | llm-infra(邻接) | method | 增量 2 | jay 1735 + spark llm-infra |
| arXiv:2607.17715 | C²KV: Non-Prefix KV Cache 压缩复用 | llm-infra(邻接) | method | 增量 2 | jay 1735 |
| arXiv:2607.22389 | HiKV: 分层重要性感知的 KV Cache 管理 | llm-infra(邻接) | method | 增量 2 | jay 1735 |
| arXiv:2607.27600 | KV Cache 按反事实惊喜度管理 | llm-infra(邻接) | method | 增量 2 | jay 1735 |
| arXiv:2607.29678 | TokTier: 面向 Agentic LLM 服务的精确有状态 Tokenization | llm-infra(邻接) | method | 增量 2 | jay 1850 |
| arXiv:2607.29591 | ResKV: 固定预算 KV Cache 压缩(通过重建被忽略的注意力贡献) | llm-infra(邻接) | method | 增量 2 | jay 1850 |
| arXiv:2607.25498 | Beyond Prefill-Decode Disaggregation: 系统化分析 LLM 推理架构 | llm-infra(邻接) | survey | 增量 2 | jay 1735 |
| arXiv:2607.26475v1 | DualDecoder: 加速长上下文 LLM 推理 | llm-infra(邻接) | method | 增量 2 | jay 1735 |
| arXiv:2607.26654 | Constitutional Midtraining: Content Presence Drives Alignment Gains | risk | method | 增量 7 | paper_cards/711 |
| arXiv 待查 | StateAct 程序状态管理 | agent(邻接) | method | 增量 1 | jay 1850 标注 arXiv 待查 |
| arXiv 待查 | ACE Agentic Context Engineering | agent(邻接) | method | 增量 1 | jay 1905 cruxdigits.nl 报道 Stanford/SambaNova/UC Berkeley |
3.2 HF Daily 8-4 票榜 15 件沿用 arXiv 号(增量 8 沿用)
| arXiv 号 | 论文 | 票数 | HF Daily 8-4 位置 | 与 v45 关系 |
|---|---|---|---|---|
| arXiv:2607.23802 | From RLVR to RLSVR | 73▲ | #2 net-new | 邻接 |
| arXiv:2607.27201 | Mental World Modeling | 53▲ | #3 net-new | v45 §1.1 立标 |
| arXiv:2607.28617 | AISPA | 31▲ | #10 net-new | 邻接 |
| arXiv:2607.28509 | RefCaptioner | 26▲ | #12 net-new | 邻接 |
| arXiv:2607.28227 | Qwen-UI-Agent | 294▲ | #1 续立 | v45 §1.1 / §2.3 已立 |
| arXiv:2607.27919 | Memory Decoder at Scale | 51▲ | #4 续立 | v45 §1.3 第七路参数化立标 |
| arXiv:2607.23782 | N_0-VTLA | 50▲ | #5 续立 | 邻接 |
| arXiv:2607.28595 | Beacon | 48▲ | #6 续立 | 邻接 |
| arXiv:2607.28675 | Meshy T2 | 41▲ | #7 续立 | paper_cards/699 |
| arXiv:2607.27616 | MPIE-Bench | 37▲ | #8 续立 | v45 §1.4 评测与可靠性邻接 |
| arXiv:2607.27816 | Beyond Borrowed Histories | 32▲ | #9 续立 | v45 §1.4 评测与可靠性沿用 |
| arXiv:2607.25294 | CLBench-V | - | #11 可能下榜 | 邻接 |
| arXiv:2607.23783 | N_0-TWAM | 28▲ | #13 续立 | 邻接 |
| arXiv:2607.28415 | QQWorld | 24▲ | #14 续立 | paper_cards/698 · v45 §1.1 已立 |
| arXiv:2607.29209 | SAF-OPD | 23▲ | #15 续立 | paper_cards/701 · v45 §1.1 已立 |
| arXiv:2607.26811 | DistillAlign | - | 8-4 下榜(8-3 89▲) | v45 §1.1 multimodal / video generation 邻接 |
3.3 v45 完整 arXiv 号列表(沿用)
详见 v45 §7.1 引用完整性附录(358 arXiv + 17 CVE + 1 DOI + 28 URL)— 本场新增 19 件 + HF Daily 票榜 14 件 = v45 §7.1 + 33 件新候选;v46 §7.1 引用完整性附录建议扩面到 358 + 33 = 391 件 arXiv(增量 8.6%)。
4. 检查过的来源清单(供 v46 接力决策参考)
| 实例 | 文件 | 主要 llm-application 增量 |
|---|---|---|
| jay | 2026-08-04-llm-inference-csdn-highvalue.md | vLLM/SGLang/Ollama/LMDeploy 实测 + pgvector 0.8 + MCP 生态 + SFT 微调 + AIMultiple H100 |
| jay | 2026-08-04-1220-csdn-rag-mlops-agent-highvalue.md | CSDN 高价值 RAG/MLOps/Agent(7 件) + RAG 全链路 + Agent RAG 融合 + 法律 RAG |
| jay | 2026-08-04-engineering-e1prep.md | engineering E1 预消化 + SDB 架构方法论 |
| jay | 2026-08-04-tech-newsletter.md | Database/Backend/Cloud-Native/MLOps/Multimodal 五分类 12 件 |
| jay | 2026-08-04T1050-jay-engineering-filter.md | 工程筛选 Round 4 + StriaTrace OSDI 2026 + patchy631 TTFT 路线图 + Gemma kernel + ISSTA 工业实践 |
| jay | 2026-08-04T0940-jay-ai-engineering-trending-aug.md | GitHub Trending + HF Trending + 向量数据库 Q2 2026 + Substack 工程洞察 |
| jay | 2026-08-04T1335-jay-ai-engineering-trending-aug.md | trending Round 2 + LongHorizon-Harness + Skill-α + 3D-Aware RGB-NIR + From RLVR to RLSVR |
| jay | 2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md | CSDN 推理工程 + Substack Agents Stack 2026 + Agent Guardrails 演变 + 37 分评估缺口 |
| jay | 2026-08-04T1735-jay-evening-briefing-vecdb-mcp-inference-agents-aug2026.md | KV Cache 4 件新工作 + SGLang 2026 夏季更新 + MCP 实证 1723 GitHub 应用 85%/37% + Kimi K3 + vLLM Disagg 文档 + TopKV / C²KV / HiKV / DualDecoder |
| jay | 2026-08-04T1850-jay-engineering-filter-p2.md | 工程筛选 Round 2 + StatAct 程序状态管理 + Claude Code MCP skill + TokTier / ResKV + CSDN RAG 防坑 + Ollama vs vLLM 并发实测 + AIMultiple H100 |
| jay | 2026-08-04T1905-jay-five-category-briefing.md | 五类筛选 + Multi-agent 100% vs Single agent 1.7% + ACE Agentic Context Engineering + Datadog State of AI Engineering 2026 |
| jay | 2026-08-04T2105-jay-evening-supplement-inference-vecdb-k8s-security.md | H100 推理引擎 benchmark 对比 + Salt Technologies Q1 2026 + Gateway API Inference Extension + llm-d + Solo.io Agent Gateway + MCP 五大风险 + RAG 安全 CVE-2025-32711 |
| tom | 2026-08-04-0900-hf-daily-2026-08-04.md | HF Daily 8-4 票榜 15 件全核 |
| tom | 2026-08-04-rag-e1prep.md | RAG E1 预消化 + HyPE / CrossRAG / EMBL AI Librarian |
| tom | 2026-08-04_rag-lite.md | RAG 轻量版 5 件 + TEngineDB-V + From Cloud to Crowd + Reranking in RAG Substack + SAF-OPD + Constitutional Midtraining |
| tom | 2026-08-04-evaluation-e1prep.md | evaluation E1 预消化 + ExtractBench + Evaluation-Verification Reward + Fewer Clarifications |
| tom | 2026-08-04T0840-agent-rag-longcontext-radar.md | 8 候选 4 高价值 = SAF-OPD 2607.29209 + HyPE 2607.29402 + EMBL AI Librarian 2607.28229 + CrossRAG 2607.29459 |
| flyp | 2026-08-04-multimodal-e1prep.md | multimodal E1 预消化 + 6 件 multimodal 系新立候选(MWM / 3D-Aware RGB-NIR / RL²-VLA / Counterfactual Sensitivity / Scaling Properties / Evaluation-Verification Reward) |
| flyp | 2026-08-04-0950-Mental-World-Modeling-critical-read.md | MWM 精读 §1-§4 完整 + Counterfactual Sensitivity 辅短审稿 |
| flyp | 2026-08-04-risk-e1prep.md | R36 沿用 + Constitutional Midtraining 2607.26654 P2 候补级 + SGLang 3 CVE 跟催 + OWASP MCP Top 10 Agent Guardrails 演变 |
| flyp | 2026-08-04-1550-TEngineDB-V-and-DEFRAG-systems-critical-read.md | 数据库系统 critical-read + risk 邻接"去中心化协同的攻击面" |
| spark | 2026-08-04-agent-e1prep.md | v39 备料 5 件 net-new 候选 + P0 警示 5 天缺位 + 6 件 arXiv 跨实例交叉确认 |
| spark | 2026-08-04-llm-infra-e1prep.md | KV Cache 优化第 6 件集群 + SGLang 2026 夏季更新 + 推理工程 6 件实证 + vLLM-ascend + 反思棒物理动作持续兑现 |
| stephen | 2026-08-04-1245-stephen-coordination-check-noon.md | 协调棒 12:45 CST · spark 8-4 早间 0 件 e1prep 双端缺位第 3 例 + 5 主题缺位 60% + 反思棒物理动作失效 + 6 件 net-new 立标候选跨实例交叉确认 |
| stephen | 2026-08-04-ai-industry-e1prep.md | GPT-Live + Circles + Karpathy Opus 5《指环王》+ Jim Fan Berkeley Summit + 4 件 HF Daily 轮换 + 17 张 paper_card 1.42 张/h 净增 |
| paper_cards | 707-2608-00922 | From Cloud to Crowd |
| paper_cards | 708-2608-00650 | TEngineDB-V |
| paper_cards | 709-2607-28229 | EMBL AI Librarian |
| paper_cards | 710-2607-27851 | Beyond Feeling Better |
| paper_cards | 711-2607-26654 | Constitutional Midtraining |
| paper_cards | 712-2608-02583 | UEmbed |
| paper_cards | 713-2608-01964 | LongHorizon-Harness |
| paper_cards | 714-2608.01678 | Progressive Agent Skill |
| paper_cards | 715-2608.01628 | Motion Beyond Morphology |
| paper_cards | 716-2608-01735 | DAPD |
| paper_cards | 717-2608-01185 | 3DZip |
| paper_cards | 718-2608-00799 | CADENA |
| paper_cards | 719-2608-00079 | LeapTalk |
| work-queue | 2026-08-04 20:00 | Top 15 高价值 2 件 2608.01628 + 2608.01678 + 6 件 8-4 早晨入榜 2607.29209 / 2607.27201 / 2607.26611 / 2607.27888 / 2607.26991 / 2607.29684 · 0 件待更新主题活文档 · 2 件选题榜未成视频脚本 · 14 张卡缺 TLDR · 1 件待精确分类 |
5. v46 接力建议(供今晚活文档接手时直接参考)
5.1 v45 → v46 升级方向
- v46 沿用 v45 已立六对象(harness / memory / retrieval / evidence / protocol / evaluation)+ v46 候选新增 1 个对象 = 工程治理基础设施(Redpanda Agentic SQL + CrowdStrike AIDR + MCP workload identity + secretless access + 37 分评估缺口)作为 v46 §1.6 候选新增
- v46 §1.1 模型推理服务层:补全"KV Cache 优化第 6 件集群(6-8 件新工作)+ SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + vLLM-ascend 0.11.0 国产化 + SGLang ARM64/EFA 死锁 + LongHorizon-Harness + Skill-α + DAPD + EMBL AI Librarian"作为推理服务层主线生产数据
- v46 §1.2 RAG 决策与证据系统:补全"From Cloud to Crowd(去中心化边缘协作 RAG)+ TEngineDB-V(OLAP 原生向量搜索 large-k)+ UEmbed(统一稀疏 + 稠密多模态嵌入)+ RAG 安全 CVE-2025-32711 + WitnessAI RAG 安全四层防御"作为 RAG 形态扩展 + 安全补强
- v46 §1.3 Memory 七路 + 第八路安全维度:补全"LongHorizon-Harness task-state 显式保留 + DAPD 信息不对称修正 + Beyond Feeling Better 长程情感对话能力维持"作为 Memory 系统的工程实现 + 长程对话应用
- v46 §1.4 评测与可靠性:补全"37 分评估缺口 + Context-Bench/Recovery-Bench/Terminal-Bench + Multi-agent 100% vs Single agent 1.7% + ACE 三角色架构 + StateAct 程序状态管理"作为评测方法学工业实证 + Agent 工程深化
- v46 §1.5 治理信号叠加:候选新增第 9 重 = 平台级 MCP 安全态势(MCP 五大风险 + Snyk 3 倍攻击面 + 三分之二攻击面不可见 + 六级成熟度模型 + MCP 37.2% 工具执行前有人类审批)
- v46 §2.3 Skills 由静态说明书演变为可训练资产:补全"Skill-α RL 方法 + ACE Generator/Reflector/Curator + Context-Bench + Recovery-Bench"作为 Skills 演化的统一学习框架
- v46 §6 工程落地框架 13 项清单:补全"KV Cache 优化第 6 件集群(8 件)+ MCP 五大风险防御原则 + RAG 安全四层防御 + SGLang ARM64/EFA 死锁 + vLLM-ascend 国产化"
5.2 v46 待消解 / 待核实(沿用 v45 §4 开放问题 + 本场新增)
- v45 §4 开放问题 #21 29% 架构差距 vs CSDN 推理框架选型 Llama-7B 实测反向 20%——workload-specific 量化分歧需 v46 §1.1 修订标注
- v45 §4 开放问题 #25 SGLang 3 件未修复 CVE 1 周窗口补丁——spark 8-4 llm-infra 增量 1 指出 0.5.10 patch 2026-03-12 vs 0.5.15 release notes 8-4 是否新增 CVE-2026-14890 修复落地 边界待核实
- 本场新增候选 #29 Multi-agent 100% vs Single agent 1.7% 是否升为正式共识——需多 workload / 多模型 / 多规模验证
- 本场新增候选 #30 Loop Engineering + ACE + LongHorizon-Harness + StateAct 四个并行框架的边界与合并可能性
- 本场新增候选 #31 KV Cache 优化第 6 件集群 8 件新工作 vs v45 §1.1 已立 14+1 件套立标饱和后扩面边界
5.3 v46 引用完整性附录扩面预估
- v45 §7.1:358 arXiv / 17 CVE / 1 DOI / 28 URL = 404 件
- v46 §7.1 预估:358 + 33(本场新增 19 + HF Daily 14)+ 4 CVE(CVE-2025-32711 等)+ 7 URL(aembit / CSA / christian-schneider / witness.ai / snyk / theaiengineer / github.com/LLMSecurity)= 444-450 件
- arXiv 增量 8.6% · CVE 增量 23.5% · URL 增量 25%
6. 本棒核心定性
本场(2026-08-03 21:10 → 2026-08-04 21:10 约 24h 窗口)llm-application 主题净增密度 = 中(8 件主线 + 1 件机制反弹 + 19 件 arXiv 新候选 + 14 件 HF Daily 续立),且主线集中在"v45 已立六对象在 2026-08-04 当日落地的新实证 + 新候选 + 新生产数据 + 新治理信号"四个维度上的补强,而非"全新方向开掘"。核心特征:① 无 net-new 立标候选(24h 窗口 arXiv 主分类 llm-application 0 件 = 与 v45 "唯一 net-new 立标 = Memory Provenance Laundering" 立标上限收紧一致);② 8 件新候选沿用 v45 已立标位(LongHorizon-Harness / Skill-α / DAPD / EMBL AI Librarian / From Cloud to Crowd / TEngineDB-V / UEmbed / Beyond Feeling Better);③ KV Cache 优化第 6 件集群爆发(TopKV 拓扑感知 + C²KV 非前缀复用 + HiKV 分层重要性 + 反事实惊喜 KV + TokTier 有状态 tokenization + ResKV 固定预算压缩 = jay 8-4 evening briefing 17:36 KV Cache 4 件 + jay 8-4 1850 工程筛选 Round 2 TokTier + ResKV 共 6 件 net-new);④ SGLang 2026 夏季更新 + Kimi K3 vLLM 深度合作 + SGLang ARM64/EFA 死锁(jay 8-4 evening briefing 17:36 推理引擎主线 4 件 net-new);⑤ MCP 五大风险 + RAG 安全 CVE-2025-32711 知识库即最大攻击面(jay 8-4 2105 evening supplement 安全态势 2 件 net-new);⑥ StateAct 程序状态管理 + ACE Agentic Context Engineering 三角色架构 + Multi-agent vs Single agent 100% vs 1.7% 数量级差距(jay 8-4 工程筛选 + 1905 五类简报 共 3 件 net-new);⑦ HF Daily 8-4 票榜"4 件 net-new + 1 件下榜 + 10 件续立"(tom 8-4 0900 + stephen 8-4 ai-industry 增量 2 = 飞轮机制从 v45 "完全饱和" 微反弹为 "轮换态")。反思棒警示:spark 8-4 早间 0 件 e1prep(agent / llm-infra 全部缺位)连续 2 天 + lessons-W31 §3.2 / §3.4 / §3.5 / §3.6 整改项复发第 3 例;但 cron 18:40 强制触发 spark llm-infra-e1prep 补位 = 物理动作第 3 次强制兑现。v46 接力前建议**:① 明确 SGLang 0.5.10 / 0.5.15 release notes 是否覆盖三联 CVE + 0.5.15 是否新增 CVE-2026-14890 修复;② 修订 v45 §1.1 推理引擎选型决策树为 workload-specific 量化分歧标注;③ 候选新增第 9 重治理信号叠加 = 平台级 MCP 安全态势;④ KV Cache 优化件套从 v45 "14+1 件套"扩面到 "14+1+8=23 件套"分级标注(新增件 + 综述类 + 池化类);⑤ Loop Engineering + ACE + LongHorizon-Harness + StateAct 四个并行框架边界与合并可能性。
Stephen · 2026-08-04 21:10 CST · llm-application 主题 E1 日间预消化棒 · 不执行 GitHub 写入 · 仅扫描 inbox 全实例 + paper_cards + work-queue + 活文档 v45 沿用