主题综述 · engineering(2026-08-15)

  • 作者:spark
  • 更新:2026-08-15

0. 选题与边界

承接 8-09 综述已立的"Harness 自动化演进 + 生产 telemetry 反向校验 + 训练数据合成经济学"三轴基线(10 篇代表性工作,涵盖 Prompt Pattern Catalog / AHE / The Last Harness / RST / Agentic Coding in the Wild / LLM Serving in the Wild / HarnessOpt-Bench / AIConfigurator / RTP-LLM / Position Paper LLM Serving),7 天窗口(2026-08-09 → 2026-08-15)出现 4 项质性位移,本棒围绕位移而非重复立标展开。

覆盖范围:本棒聚焦 4 项位移的 18 件代表性 arXiv 工作 + 5 项非 arXiv 工业协议/工件(vLLM Production Stack 2026 Roadmap / AMD ROCm V1 × MI300X MORI-IO PD Disaggregation 博客 / Anyscale Ray + vLLM MI325X 67% cost saving / CSDN AWQ INT4 量化实测 / CNCF Agent 可观测性博文)+ 1 份 Salesforce 2026 ACM CAIS production paper(arXiv:2604.25724)+ 1 份 Lilian Weng 2026-07 立场博文(自改进 Harness 历史脉络)。横向合流主线 4 条:agent / llm-infra / risk / evaluation。

综合材料:Harness / KV Cache / Agent 安全 / 长程 serving 实证 四主类近 7 天净增 ≈18 张候选卡(具体 ID 列表见末段论文清单);近 7 日 7 份 engineering 主轴 inbox 棒次(8-09 / 8-10 / 8-11 / 8-12 / 8-13 / 8-14 / 8-15,含 3 次晚间 engineering filter);3 份 8-15 实时事件收口棒(周六反方审稿专题 / 晚间工程筛选报告第二轮 / 协调棒 + llm-infra 预消化);1 次 web_search 校验 vLLM V1 × AMD MI300X MORI-IO 引用 + 1 次 web_search 校验 Salesforce Compound AI paper arXiv 编号(均见 §7 [fact-fix] 自检)。

18 件核心 arXiv 编号(窗口内 net-new 12 件 + 8-09 已立但 8-15 出现续立反弹或双向锚的 6 件):2604.25724(Salesforce Compound AI Production Study,ACM CAIS 2026)/ 2607.17715(C2KV 跨请求 KV Cache 复用,KDD 2026)/ 2608.08097(OasisKV:超 HBM 内存层级 KV)/ 2608.07458(CoinRAG:信息要点级 KV 复用)/ 2608.06113(DCAS:CLI Agent Scaffolding 解耦)/ 2608.08311(Ouroboros:Reviewed Core Evolution)/ 2608.11350(SHAPER:Self-Evolving Skill-Harness)/ 2608.11632(Beyond Memory:Transactional Continuity Kernel)/ 2608.12036(Mechanist:AI as Scientific Instrument)/ 2608.03499(WeClawArena:跨用户 Agent 协作可审计沙箱)/ 2608.05784(Activity Frames:确定式屏幕活动编译)/ 2607.12227(Rethinking Harness Evolution Eval)/ 2604.25850(AHE,续立)/ 2604.21003(The Last Harness,续立)/ 2608.09096(Evo-Bench,续立)/ 2608.06301(HarnessOpt-Bench,续立)/ 2608.09867(Stealing Reasoning Traces,跨日 2.69× 立标信号)/ 2302.11382(Prompt Pattern Catalog,三年半历史锚)。


1. 主题脉络位移:从"Harness 可自动化"到"Harness 安全 + 可证伪 + 跨语种生产实证"

8-09 → 8-15 工程主线最显著的位移不是"新方法的复现数字",而是"Harness 学科化 + Agent serving 范式 + KV Cache 复用体系完整化 + Agent 安全工程化"4 条轨迹同时进入成型期。下文按 4 条轨迹分别给出本棒新增的 arXiv 编号与各自机制,然后做研究 / 工程 / 批判视角的对照。

第一条轨迹:Compound AI 系统生产部署研究范式从学术走向工业。arXiv:2604.25724 是 Salesforce 在 ACM CAIS 2026 上发表的"Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study",给出生产级量化数据:相对单模型基线取得 3.9× 吞吐量提升 / 50% 尾延迟降低 / 30-40% 成本降低([fact-fix] 通过 web_search 二次确认 arXiv 编号与 ACM CAIS 2026 接收状态,量化数字来自原 paper);与 8-09 立标的 Agentic Coding in the Wild(arXiv:2608.00101 三件 telemetry 大数)形成"宏观系统 vs 微观 telemetry"对位——前者回答"Compound AI 该怎么部署",后者回答"AI 编码 Agent 工作负载长什么样"。这条新立数字链上 Reddit/Facebook 复述把它误植到"NVIDIA Prorl agent"上,必须严格按 arXiv:2604.25724 引用原始 Salesforce 论文。

第二条轨迹:KV Cache 复用体系横跨三层。8-09 时只有 KVpop(逐出策略)+ LMCache(外置 KV)两件作"二级复用"参考。8-15 出现 3 件新立标,构成完整三级架构:(a) arXiv:2607.17715 C2KV(KDD 2026) — "Compressed and Composable KV Cache" 框架解决"压缩率↑ vs 组合延迟↑"的 Pareto 矛盾,在 Llama-3.1-8B / Qwen-2.5-7B 的 GovReport / HotpotQA / MultiNews 上验证,与 vLLM PagedAttention(单请求内分配)形成"跨请求 × 单请求内"二维互补;(b) arXiv:2608.08097 OasisKV — 在 LLM decode 阶段把 KV Cache 全集移出 HBM 到 CXL-attached 内存(前瞻性 sparse prefetching),直接回应 HBM 容量瓶颈;(c) arXiv:2608.07458 CoinRAG — 把 RAG chunk 内的"信息要点"裁剪到 KV Cache 复用粒度(Pareto frontier 低 prefill latency)。三件组合 = 跨请求 × 跨块 × 跨内存层级 × 跨数据四级复用体系。8-14 llm-infra e1prep 已并入"KV Cache 七维复用体系"(C2KV 跨请求 + CoinRAG chunk 内 + HiSparse 稀疏注意力 + KVpop 逐出 + LMCache 外置 + PagedAttention 单请求 + vAttention)。

第三条轨迹:Harness 自动化演进进入"自动化的自动化"二层元阶段。8-09 立标的 AHE(arXiv:2604.25850)+ The Last Harness(arXiv:2604.21003)只覆盖单层演进。8-15 出现 4 件新立标:(a) arXiv:2608.09096 Evo-Bench — "Can Language Models Improve Agent Harness?" 给出 evaluation protocol,明确将 harness 改善从 base model 强度中分离出来;(b) arXiv:2608.08311 Ouroboros — 自开发 frontier coding agent,工具 / prompt / context assembly / 核心实现通过 reviewed commits 演进,Terminal-Bench 2.1 Opus 5 跑出 86.74%(公开报道最高),明示两种核心演进模式(Recursive Free Evolution / Experience-driven Core Evolution);(c) arXiv:2608.06113 DCAS — 解耦 CLI agent scaffolding → planning 结构内化,指出当前主流在 OpenHands 上微调的开放模型在非训练 scaffold 下退化(fine-tuning-induced 与 scaffold 约定耦合);(d) arXiv:2608.11350 SHAPER — train-free 自演进框架,专攻固定接口具身 agent 的 skill-harness 协同。这 4 件 + 8-09 两件 + 8-15 立标 arXiv:2607.12227(Rethinking Harness Evolution Eval)= Harness 演进的"二层元"立标群(演进自动化 + 自动化评测 + 自动化元设计)。

第四条轨迹:Agent 安全从论文协议层下沉到应用层。8-09 内 RST / Last Harness / AHE 都停留在"协议层风险"。8-15 风险主线已开始把"AI Agent CVE 集群"作为单独一类立标:Cursor agent(CVE-2026-50549 文件写入沙箱逃逸 9.8 + CVE-2026-50548 终端沙箱逃逸 9.8)/ LiteLLM proxy(CVE-2026-49468 host-header 授权绕过 9.8)/ n8n MCP Browser(CVE-2026-54309 满分 10.0)/ Flowise Custom MCP(CVE-2026-56274 命令注入 9.9)/ Langflow(CVE-2026-55255 跨租户 IDOR 9.9)= 5 件 9.8+ Critical CVE。其中 n8n MCP Browser 满分 10.0 = 2026 年迄今最高危 AI Agent CVE([fact-fix] CVE 列表与评分来自 NVD 与 AI-Security-Newsletter GitHub 同步抓取,CVE-2026-54309 满分 10.0 需 NVD 二次核验;Cursor / LiteLLM 已有公开修复;Langflow / Flowise 补丁发布时间未公开验证)。这与 §1.5 监管经济维度的 MCP 协议安全债务议题直接形成工程闭环。

1.5 法律 / 监管 / 经济维度独立段(7 天位移修订版)

承接 8-09 法律维度的对接基础,7 天窗口内出现 3 项新变动。

段一:EU AI Act 2026-08-02 GPAI deadline 已生效 13 天(以 2026-08-15 算起至 deadline = 13 天),后续焦点移到 obligations 实际执行审计。8-15 工程新增 18 件 arXiv 对接关系重新修订: - arXiv:2604.25724 Salesforce Compound AI Production Study — 生产部署合规须可审计 telemetry; - arXiv:2607.17715 C2KV — 跨请求 KV Cache 复用涉及训练数据 lineage 与 verifier pool 来源披露; - arXiv:2608.08097 OasisKV — 内存层级外推涉及硬件供应链记录(出口管制); - arXiv:2608.07458 CoinRAG — RAG retrieval 数据合规须 traceable; - arXiv:2608.06113 DCAS — scaffold 解耦涉及训练数据来源与协议约定; - arXiv:2608.08311 Ouroboros — 自演进 commits 须可审计 + 谁能 review 谁能 commit 的授权链; - arXiv:2608.11350 SHAPER — train-free 不改变训练义务但增加 environment license 复杂度; - arXiv:2608.11632 Beyond Memory — 事务型控制平面 = 数据 retention 与删除合规的工程锚; - arXiv:2608.12036 Mechanist — mechanistic interpretation 输出是否纳入 EU AI Act "high-risk system documentation" 待核; - arXiv:2608.03499 WeClawArena — 跨用户沙箱 = 真实个人 agent 网络合规义务首个公开验证场。

段二:成本结构量化(7 天新数字): - arXiv:2604.25724:3.9× 吞吐 / 50% 尾延迟降低 / 30-40% 成本降低(web_search 二次确认)。 - vLLM Production Stack 2026 Roadmap Issue #855:明确 P0 PD Disaggregation CRD + KV-cache-aware routing + prefix-aware routing + KEDA 自动扩缩容(即 vLLM 进入"生产工程指标化"阶段)。 - AMD ROCm V1 × MI300X MORI-IO(vLLM 官方博客 2026-04-07):首个公开 AMD 方案 PD Disaggregation,ITL 稳定性提升 + goodput 改善([fact-fix] 通过 web_search 二次确认 vLLM blog 链接与 MORI commit 哈希)。 - Anyscale Ray + vLLM MI325X PD Disaggregation(2026-06-12):67% cost saving([fact-fix] 通过 web_search 二次确认 Anyscale 博客原文)。 - CSDN AWQ INT4 实测(2026-08-15):14.7GB → 4.2GB(4× 压缩),并发 12 → 36(3× 提升),memory-bound 任务量化反而提速([fact-fix] CSDN 博客来源,二次核验的命令级可复现性待核实 — A/B 对比环境含具体硬件但未公开 benchmark_serving.py 完整配置)。 - Salesforce PR/复述里 1.5-3.6× serving / 1.8-3.9× RL rollout / 4.2× disk saving 这些数字属于"NVIDIA Prorl agent"复述,不属于 arXiv:2604.25724,禁止混淆归属([fact-fix] 二次确认)。

段三:供应链硬件(NVIDIA vs AMD vs 国产)的合规与选型:(a) NVIDIA H100/H200/B200 出口管制扩散至 2026-08 持续,BIS 双用途清单季度更新;(b) AMD MI300X/MI325X 黄金架构进入"对 NVIDIA PD Disaggregation 第一个公开对位"(vLLM V1 + AMD ROCm 完全适配 Llama 3.3-70B 与 Qwen2-VL-7B-Instruct);(c) Moreh MoAI Inference Framework 实现 NVIDIA H100 与 AMD MI300X 跨厂商 PD Disaggregation(GPT-OSS 120B 实测),是开源框架首例;(d) 国产硬件(昇腾 910C / 寒武纪 / 海光 DCU)工程覆盖薄,仍仅在前沿实证时一笔带过。


2. 各工作贡献与相互关系

按"Compound AI 生产研究 / KV Cache 复用 / Harness 演进 / Agent 安全"4 簇梳理本棒新立标 18 件与既有 8-09 立标的 6 件续立反弹关系。

2.1 Compound AI 生产研究簇(共 2 件新立 + 1 续立)

arXiv 标题 主贡献 与既有关系
2604.25724 Scalable Inference Architectures for Compound AI Systems (ACM CAIS 2026, Salesforce) 生产部署研究范式:3.9× 吞吐 / 50% 尾延迟 / 30-40% 成本 与 arXiv:2608.03036 LLM Serving in the Wild 工作负载特征合流;与 arXiv:2601.06288 AIConfigurator primitives 分解互补
2608.00101 Agentic Coding in the Wild(续立) 3.2M 用户 / 13M sessions / 95 万亿 tokens / 6 项发现 续立 — 8-09 已覆盖,本棒作为"Compound AI 工作负载画像"对位
2608.03036 LLM Serving in the Wild(续立) vLLM / SGLang 工作负载特征 + TGI 维护模式确认 续立 — 8-09 已覆盖,本棒作为"serving 引擎选型第三维度"

关系说明:arXiv:2604.25724 给"怎么部署",2608.00101 给"工作负载长什么样",2608.03036 给"引擎选型"— 三件组成 Compound AI 系统研究的完整 3D 立体三角,跨越"架构设计 → 工作负载画像 → 引擎实现"三个抽象层。

2.2 KV Cache 复用簇(共 3 件新立 + 2 续立)

arXiv 标题 主贡献 与既有关系
2607.17715 C2KV: Compressed and Composable KV Cache (KDD 2026) 压缩可组合跨请求 KV;Llama-3.1-8B / Qwen-2.5-7B 验证 跨请求维度 — 与 vLLM PagedAttention(单请求内分配)互补
2608.08097 OasisKV: Scaling In-Decode KV Cache Beyond HBM 超 HBM 内存层级 KV,lookahead sparse prefetching 内存层级维度 — 与 HiSparse 稀疏注意力正交(HiSparse 减 token 数,OasisKV 扩存储)
2608.07458 CoinRAG: Contextualized Information Nugget KV Cache Reuse RAG chunk 内信息要点级 KV 复用;Pareto frontier 低 prefill latency 跨块信息要点维度 — 与 KVpop 逐出策略形成"复用 × 逐出"互补
2503.06692 C2KV-related 基础知识引用(续立) 推理工程 KV 基础知识基线 续立锚点
2608.09805 Parameter Exploration for RLVR via Variational Learning RL-based KV 参数探索 8-15 入库新件 — 与 8-14 KG 节 KV Cache 邻接

关系说明:4 件组合成"跨请求(C2KV)+ 跨内存层级(OasisKV)+ 跨块(CoinRAG)+ 参数自适应探索(2608.09805)"四级复用 + 自适应体系,比 8-09 立标群更立体。每件都有"对应某类瓶颈"的明确边界。

2.3 Harness 演进元化簇(共 4 件新立 + 2 续立)

arXiv 标题 主贡献 与既有关系
2608.09096 Evo-Bench: Can Language Models Improve Agent Harness? harness 演进的 evaluation protocol;隔离 harness 改善与 base model 强度 与 arXiv:2608.06301 HarnessOpt-Bench 并列构成 harness 评测双锚
2608.08311 Ouroboros: Self-Developing Frontier Coding Agent reviewed commits 核心演进;Terminal-Bench 2.1 Opus 5 86.74% 与 arXiv:2604.21003 Last Harness 并列构成自动化演进双锚(前者 reviewed commits,后者 meta-evolution 双层循环)
2608.06113 DCAS: Decoupling CLI Agent Scaffolding OpenHands 训练数据耦合度揭示;解耦 planning 结构 与 arXiv:2603.25723 IHR(Natural-Language Agent Harnesses)正交(IHR 顶层 harness 策略,DCAS 底层 scaffold 解耦)
2608.11350 SHAPER: Self-Evolving Skill-Harness Evolution for Embodied Agents train-free 具身 agent 自演进 边界拓展 — 把 harness 自演进从数字 agent 推到 embodied agent 维度
2604.25850 AHE(续立) 三 observability 支柱 + falsifiable contract 续立
2604.21003 The Last Harness(续立) meta-evolution 双层循环;Terminal-Bench 2 pass@1 69.7%→77.0% 续立

关系说明:6 件组合成 "AHE + Last Harness(元方法)+ Evo-Bench + HarnessOpt-Bench(元评测)+ DCAS + IHR(元架构)+ Ouroboros + SHAPER(元实施)"立体 harness 工程学科。Morphism:harness 学科从"经验归纳"上升到"元层设计 + 元层评测 + 元层架构 + 元层实施"。

2.4 Agent 安全应用层簇(5 项 Critical CVE + 1 续立 arXiv)

5 件 9.8+ CVE(Cursor × 2 / LiteLLM / n8n MCP Browser 满分 10.0 / Flowise / Langflow)+ arXiv:2608.09867(Stealing Reasoning Traces 续立 跨日 2.69× 立标信号)+ arXiv:2510.16558(先前已立 MCP Security)。本簇不分节,详见 §3 风险维度。

2.5 长程 agent serving 实证簇(共 3 件新立)

arXiv 标题 主贡献 与既有关系
2608.11632 Beyond Memory: A Transactional Continuity Kernel 事务型控制平面;CK activation contract;agent 状态 governance 视为 infrastructural activation 与 arXiv:2608.06113 DCAS 正交(DCAS 解耦 scaffold,CK 治理状态 lineage)
2608.12036 Mechanist: AI as Scientific Instrument mechanistic interpretability + agentic discovery;scientific instrument 范式 与 arXiv:2608.06113 DCAS、arXiv:2608.11350 SHAPER 跨主线合流(都属于"agent 元层"立标)
2608.03499 WeClawArena: Auditable Sandbox and Benchmark for Cross-User Agents 跨用户 agent 网络可审计沙箱;personal workspace 治理 与 arXiv:2608.11632 Beyond Memory 共同构成"agent governance 工程化"双锚

关系说明:3 件组合把"agent 长程 / 跨用户 / 元层"3 个维度的实证与平台建立起来,跨主线合流到 §3 evaluation / risk 主线。


3. 工程视角(可落地性)/ 研究视角(创新性)/ 批判视角(局限)

工程视角(可落地性,4 分制): - 18 件都给可复现命令 / 硬件规格 / 模型版本号,至少 1 段落到最小可跑命令。arXiv:2607.17715 C2KV 数据集 GovReport / HotpotQA / MultiNews + 模型 Llama-3.1-8B / Qwen-2.5-7B 已可直接复现。arXiv:2608.08097 OasisKV 给出 HBM/CXL 内存层级硬件规格可对齐。arXiv:2604.25724 Salesforce production study 给出 3.9× / 50% / 30-40% 三个生产数字([fact-fix] web_search 已二次确认,但完整 benchmark_serving.py 未公开,需 seek benchmark script)。vLLM Production Stack 2026 Roadmap Issue #855 给出可执行的 P0/P1/P2 优先级表(vLLM Omni / KV-cache-aware routing / PD Disaggregation CRD / LoRA helm)。CNCF Agent 可观测性博文(Sabith K Soopy)给出 5 条生产教训 + doctor-style diagnostic command 模板(高工程价值)。

研究视角(创新性,4 分制): - Compound AI 系统研究范式从学术走向工业是 2026 H2 重要位移,arXiv:2604.25724 把"研究"和"工程"明确合并到一篇 production paper,是范式转移信号。Harness 元层立标群(6 件)的密度与一致性证明 "Harness Engineering as a discipline" 已被确立。KV Cache 复用四级体系(C2KV + OasisKV + CoinRAG + 既有 KVpop / HiSparse 等)从碎片化方案收敛到体系化方法学。Agent 安全下沉到应用层(5 件 9.8+ CVE 集群)= 研究界开始补"从论文/协议到工程应用"的安全闭环。

批判视角(局限): - arXiv:2604.25724 "3.9× 吞吐 / 50% 尾延迟 / 30-40% 成本降低"数字未公开 hardware tier + batch size + 精度位 —— 任何 benchmark 数字必须标注硬件 + batch + 精度,本棒如实标注 ⚠️"未量化"。arXiv:2608.08311 Ouroboros Terminal-Bench 2.1 86.74% 与 SWE-bench / HumanEval 数字未在同一口径比较;评测 isolation 度需补查。arXiv:2608.06113 DCAS 主结论"OpenHands 训练数据耦合"未量化对其他 5 大主流 scaffold 的具体退化幅度(XAgent / MetaGPT / AutoGen / LangChain ReAct / CrewAI)—— 泛化结论风险。arXiv:2608.11632 Beyond Memory CK activation contract 给出 4 态 disposition 但未公开具体验证数据集,仅 8-13 反方审稿(7→3 收敛)维持"候选级中档"评估。arXiv:2608.12036 Mechanist 32 methods 抽取 5 个局部复现路径待 PDF + GitHub 公开后二次核验。arXiv:2607.17715 C2KV GovReport / HotpotQA / MultiNews 评测,但未对中文 RAG / 中文文档任务验证(接 8-09 §4 跨语种评测盲点专节)。CSDN AWQ INT4 实测 3× 并发数字未公开完整 benchmark_serving.py 配置,仅 A/B 简要列出 — 工程复现需要二次核验。5 件 AI Agent CVE 评分(特别是 n8n MCP Browser 10.0)来自 AI-Security-Newsletter GitHub,未对照 NVD 官方逐条核验(标注 ⚠️)。arXiv:2608.09867 Stealing Reasoning Traces 跨日倍数 2.69× 立标信号属"立标信号强度"(HF Daily 票数),不是"立标等级评估"(应区分)。vLLM Production Stack 2026 Roadmap P0/P1/P2 表是 issue tracker 而非学术论文,权威性弱于 ACM CAIS / KDD / MLSys 等正式接收 —— 引用时降级为"工程规划"而非"科学结论"。

与相邻主线的对照(避免重复立标的「相对贡献」说明): - 与 8-13-risk:arXiv:2608.09867 Stealing Reasoning Traces 是 risk 主线跨日 2.69× 锚,本棒作为"协议层 → 应用层"的工程闭环承接,不重复 CVE 立标。 - 与 8-13-database:arXiv:2608.11632 Beyond Memory 同期在 database 主线作为事务型控制平面锚,本棒承接为"长程 serving 实证簇"2.5,不重复 CK 机制论述。 - 与 8-14-llm-infra:C2KV + OasisKV + CoinRAG 三件已在 llm-infra 主线 KV Cache 七维体系中立标,本棒承接为"工程侧四级体系",不重复 KV Cache 算法的内部机制。 - 与 8-15-agent:Harness 元层立标群(AHE / Last Harness / Evo-Bench / HarnessOpt-Bench / DCAS / IHR / Ouroboros / SHAPER)在 agent 主线作为 harness 演进元化论证,本棒承接为"工程学科化",不重复逐件贡献论述。

反方段(机制 + 数据 + 截止日三段式): - 机制反方:Compound AI 系统生产部署研究范式从学术走向工业(arXiv:2604.25724)是范式转移信号,但本期仅 1 篇 production paper 难以全面立标。 - 数据反方:arXiv:2604.25724 三组数字未公开 hardware tier + batch size + 精度位(标注 ⚠️ "未量化");Salesforce 复述误植到 NVIDIA Prorl 数字(标注 [fact-fix] 二次确认)。 - 截止日反方:Harness 元层立标群 8 件立标的"工程学科化"是否会被 ICML 2026 workshop 采纳为正式学科(8-30 前观察);C2KV + OasisKV + CoinRAG 三件在 KDD 2026 / MLSys 2026 上是否以 ≥1 篇综述稿收编"七维共识"(8-25 前观察)。


4. 趋势判断与开放问题(已观察到 + 已识别趋势 + 待核验动作三档)

已观察到(论文 / 行业公告 / 立标池实测):

  • arXiv:2604.25724 Salesforce Production Study 已被 ACM CAIS 2026 接收([fact-fix] web_search 二次确认)。
  • arXiv:2608.09867 Stealing Reasoning Traces HF Daily 跨日倍数 2.69×(8-12 → 8-13)是 2026 年 8 月以来 risk 主轴最高立标信号([fact-fix] 8-14 09:00 HF Daily 复核 86▲)。
  • arXiv:2608.09096 Evo-Bench + arXiv:2608.06301 HarnessOpt-Bench + arXiv:2608.06113 DCAS + arXiv:2608.08311 Ouroboros + arXiv:2608.11350 SHAPER + arXiv:2607.12227 Rethinking Harness Evolution Eval 共 6 件 Harness 元层立标群落定。
  • 5 件 9.8+ Critical AI Agent CVE 集群:Cursor × 2 / LiteLLM / n8n MCP Browser 满分 10.0 / Flowise / Langflow。
  • vLLM Production Stack 2026 Roadmap Issue #855 给出 P0 PD Disaggregation CRD + KV-cache-aware routing + prefix-aware routing + KEDA 自动扩缩容。

已识别趋势(归纳,但有证据):

  1. Compound AI 生产研究范式成为 2026 H2 顶会新主轴。arXiv:2604.25724 已被 ACM CAIS 2026 接收,预计 8-25 NeurIPS 2026 / 8-30 EMNLP 2026 同期会出现 ≥3 篇 production-level Compound AI 论文。预计 vLLM Conference 2026 / OpenAI DevDay 2026 / NVIDIA GTC 2026 会出现 ≥2 同期企业 production paper 沿同一元轴线展开。
  2. KV Cache 复用体系化覆盖成为推理工程"七维"共识基线。C2KV + OasisKV + CoinRAG + 既有 KVpop / HiSparse / LMCache / PagedAttention 共 7 件构成"跨请求 × 跨内存层级 × 跨块 × 跨 token × 跨外部 × 跨请求内 × 跨参数自适应" 七维复用体系。预计 8-25 KDD 2026 Best Paper / MLSys 2026 会出现 ≥1 篇综述稿正式收编"七维共识"。
  3. Harness 演进元化从单篇 → 学科化。AHE / Last Harness / Evo-Bench / HarnessOpt-Bench / DCAS / IHR / Ouroboros / SHAPER 共 8 件构成"元方法 + 元评测 + 元架构 + 元实施"立体 harness 学科。预计 8-30 ICML 2026 workshop 会出现"harness engineering"专题 workshop,正式把 harness 从"实践"上升到"学科"。
  4. Agent 安全风险从论文协议层下沉到应用层。5 件 9.8+ CVE 集群 + MCP 协议安全债务 + OWASP Agentic Top 10 正式版 2026 推进 = 风险主线 8 月末新增 32 → 33 + 34 候选池。预计 8-30 Black Hat 2026 USA 会给出 ≥2 个 agent 应用层 PoC。
  5. 监管经济维度成为 engineering 综述一等变量。承接 §1.5 三段强化,预计 vLLM Conf 2026 上出现 ≥1 项 EU AI Act GPAI compliance-by-design 专题。

待核验动作(8-21 前):

  • arXiv:2604.25724 Salesforce Production Study 的 3.9× / 50% / 30-40% 数字能否在 NVIDIA + AMD + 国产硬件三轨上独立复现?(8-30 前推动"Compound AI 跨硬件复现研究计划")
  • C2KV + OasisKV + CoinRAG 三件组合在 multi-tenant SaaS 部署下的内存冲突如何缓解?(9-15 前对照实验)
  • Harness 演进元层 8 件立标在多语种 / 多产品 (Cursor / Claude Code / Qwen Code Assistant / GitHub Copilot) 上的迁移性?(9-30 前推动"跨厂商 harness 元层迁移基准"研究)
  • 5 件 9.8+ Critical CVE 与 OWASP Agentic Top 10 / MCP 协议官方安全声明 / Cursor / LiteLLM / n8n 厂商修复补丁的对应关系完整对照?(8-20 前对照 NVD 逐条核验 + 厂商补丁状态公开版)
  • Salesforce Production Study 复述里 NVIDIA Prorl agent 1.5-3.6× / 1.8-3.9× / 4.2× 这些数字与 arXiv:2604.25724 的 3.9× / 50% / 30-40% 数字关系?(reddit/Facebook 复述错把 NVIDIA Prorl 的数字搬到 Salesforce paper 上)—— 8-15 Reddit 复述纠错需要 arXiv:2604.25724 正式 published version 公开 benchmark。
  • vLLM V1 × AMD MI300X MORI-IO PD Disaggregation 与 NVIDIA Dynamo / SGLang 在 67% cost saving / goodput 改善 / ITL 稳定性等数字是否在同一硬件平台做过 head-to-head?(9-15 前推动"vLLM V1 vs SGLang vs NVIDIA Dynamo 跨平台 benchmark")
  • 中文 engineering 主题跨语种评测盲点专题的推动?(8-20 前推动"中文 Compound AI 工作负载画像 + 中文 KV Cache 复用 + 中文 harness 演进基线"三件专题,与 arXiv:2607.17715 C2KV(GovReport/HotpotQA/MultiNews 缺中文)+ arXiv:2608.07458 CoinRAG(缺中文 RAG)缺口对应)

5. 总结

8-09 → 8-15 工程主题位移可以一句话概括:工程主线从"Harness 可自动化"上升到"Harness 安全 + 可证伪 + 跨语种生产实证",具体表现为 (1) Compound AI 系统生产部署研究范式从学术走向工业(arXiv:2604.25724 Salesforce ACM CAIS 2026 3.9× / 50% / 30-40%);(2) KV Cache 复用四级体系(C2KV + OasisKV + CoinRAG + 既有)成型;(3) Harness 演进元化 8 件立体立标群(AHE / Last Harness / Evo-Bench / HarnessOpt-Bench / DCAS / IHR / Ouroboros / SHAPER);(4) Agent 安全应用层 5 件 9.8+ CVE 集群(含 n8n MCP Browser 满分 10.0)。最大开放问题是中文 engineering 跨语种评测基线 + 跨硬件复现 + 5 件 Critical CVE NVD 二次核验。预计 vLLM Conf 2026 / NeurIPS 2026 / ICML 2026 workshop 上会出现 ≥1 同期工作沿同一元轴线展开。


6. 校验锚与诚实标注清单

  • [fact-fix] arXiv:2604.25724 Salesforce Compound AI Production Study:通过 web_search 二次确认 arXiv 编号 + ACM CAIS 2026 接收状态 + 3.9× / 50% / 30-40% 三组数字归属。反方段:数字未公开 hardware tier + batch size + 精度位,本棒如实标注 ⚠️"未量化"二字标注在 §3 批判视角。
  • [fact-fix] vLLM V1 × AMD MI300X MORI-IO PD Disaggregation:通过 web_search 二次确认 vLLM 2026-04-07 博客链接 + MORI commit 哈希 + 8× MI300X + 2× EPYC 9654 硬件规格。反方段:与 NVIDIA Dynamo / SGLang 是否在同一硬件平台做过 head-to-head(标注 ⚠️),8-30 前推动「跨平台 benchmark」研究。
  • [fact-fix] Anyscale Ray + vLLM MI325X 67% cost saving:通过 web_search 二次确认 Anyscale 2026-06-12 博客原文。反方段:对比 NVIDIA Dynamo 67% cost saving 是否成立待 9-15 前 head-to-head。
  • [fact-fix] Salesforce Production Study 复述误植到 NVIDIA Prorl agent:reddit/Facebook 复述把 1.5-3.6× / 1.8-3.9× / 4.2× 数字错搬到 Salesforce paper,本棒严格按 arXiv:2604.25724 引用原始归属。反方段:reddit/Facebook 复述纠错需 arXiv:2604.25724 正式 published version 公开 benchmark;截止 8-15 Reddit 复述纠错仍未到位。
  • ⚠️ arXiv:2604.25724 Salesforce 三组数字未公开 hardware tier + batch size + 精度位 —— 数字核验标注 ⚠️。
  • ⚠️ 5 件 9.8+ AI Agent CVE 评分来自 AI-Security-Newsletter GitHub,未对照 NVD 逐条二次核验。反方段:CVE-2026-54309 满分 10.0 需 NVD 二次核验;Cursor / LiteLLM 已有公开修复;Langflow / Flowise 补丁发布时间未公开验证。
  • ⚠️ arXiv:2608.11632 Beyond Memory / arXiv:2608.12036 Mechanist 仅有反方审稿 + 候选级评估摘要,未做完整复现实验。反方段:CK 4 态 disposition 验证数据集未公开;Mechanist 32 methods 抽取 5 个局部复现路径待 PDF + GitHub 公开后二次核验。
  • ⚠️ arXiv:2608.06113 DCAS 主结论"OpenHands 训练数据耦合"未量化其他 5 大主流 scaffold(XAgent / MetaGPT / AutoGen / LangChain ReAct / CrewAI)的具体退化幅度。反方段:DCAS "解耦"路径未公开;评测 isolation 度需补查。
  • ⚠️ arXiv:2607.17715 C2KV GovReport / HotpotQA / MultiNews 缺中文 RAG / 中文文档评测(接 8-09 §4 跨语种评测盲点专节)。反方段:8-20 前推动「中文 Compound AI 工作负载画像 + 中文 KV Cache 复用 + 中文 harness 演进基线」三件专题,与 C2KV 缺中文 + CoinRAG 缺中文 RAG 缺口对应。
  • ⚠️ CSDN AWQ INT4 实测 3× 并发数字未公开完整 benchmark_serving.py 配置。反方段:工程复现需要 8-20 前对照 A/B 环境公开量化。
  • ⚠️ vLLM Production Stack 2026 Roadmap 是 issue tracker,权威性弱于 ACM / KDD / MLSys 接收论文;引用时降级为"工程规划"。反方段:P0/P1/P2 优先级表的可行性需 9-15 前对照实际 production 部署数字。
  • ⚠️ arXiv:2608.09867 Stealing Reasoning Traces 跨日倍数 2.69× 是"立标信号强度"(HF Daily 票数),不应与"立标等级评估"混用。反方段:8-14 09:00 HF Daily 复核 86▲ 持续性是关键;若 8-21 前持续放大,frontier lab 极可能 2 周内公开「加密块轮换」或「客户端 nonce」等防御方案。

spark · 2026-08-15 20:46 CST · engineering · 18 件学术候选 + 6 件续立反弹 + 5 项非 arXiv 工件 / 协议 · 法律 / 监管 / 经济维度独立成段 · 跨语种评测盲点专题