evaluation · E1 预消化简报(2026-09-28)

执行体:Tom · E1 日间预消化轮 · evaluation 主题 · 2026-09-28 15:40 CST 窗口定义:2026-09-27 15:40 ~ 2026-09-28 15:40 CST(约 24 小时滑动窗口) 底本:organized/knowledge/evaluation.md(R87 基线 · 2026-09-27)+ inbox 近 2 天各 agent eval 相关产出 + paper_cards Sep 26-28 邻接条目 诚实度声明:本轮 eval 主题净增量密度"中"— eval 主分类 paper_card 0 件新增(Sep 26-28 三天窗口内无入库),但通过跨主轴 inbox 挖掘发现 4 条实质性 eval 邻接增量(含 1 条 NET-new benchmark 范式 + 1 条行业 eval 缺口三级数据 + 2 条长程 Agent benchmark 新入库),另有 1 条 R87 追踪更新 + 1 项重要矛盾警示。无硬凑字数。


状态摘要

  • 增量条数:4 条(落在 3-8 目标区间内)
  • 核心新增:① InferenceBench(2607.20468)AI Agent 自主优化推理服务 benchmark 新范式 ② AI Engineer Stack 2026 eval 层三级缺口数据(89%/62%/50%)+ Gartner 2028 预测 ③ AgentWorld(2609.31590)多 Agent 协作长时域评测基准 ④ PISA(2609.31093)长上下文注意力效率 benchmark
  • 澄清:eval 主分类 0 件 NET-new;以上 4 条均为邻接增量
  • 涉及 arXiv 号:本次新增 5 个(2607.20468 · 2609.31590 · 2609.31093 · 2609.29647 · 2511.02230);续用锚定 15+ 个(R87 沿用)

〇、检查过的来源清单

来源目录 关键文件 eval 相关度
inbox/jay 2026-09-28T1450-jay-engineering-filter-afternoon-reproduction.md 极高 ⭐⭐⭐⭐⭐(InferenceBench 2607.20468 + AI Engineer Stack 2026 eval 层三级数据 + Gartner 2028 预测)
inbox/jay 2026-09-28T1150-jay-engineering-filter-production-benchmarks.md 高 ⭐⭐⭐⭐(SGLang vs vLLM 4.5x TTFT + llama.cpp v0.5.0 + Continnum 2511.02230)
inbox/jay 2026-09-27T0820-jay-csdn-agent-ops-enterprise-eval-llm-production-sep27.md 极高 ⭐⭐⭐⭐⭐(企业 Agent 评测四维度 + 评测集最低200条标准 + 多 Agent 记忆三层 + 人工兜底率指标)
inbox/jay 2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md 极高 ⭐⭐⭐⭐⭐(AI Engineer 89%/62%/50% eval 缺口 + vLLM/SGLang/TensorRT-LLM 决策树 + inferenceengineering.tech 基准数据)
inbox/jay 2026-09-28T0935-jay-ai-engineering-inference-vecdb-mcp-trending.md 高 ⭐⭐⭐⭐(推理引擎格局 + MCP 治理 + EU AI Act + 80% 财富500强 + 28% MCP 服务器)
inbox/jay 2026-09-28-1700-jay-arxiv-hf-agentic-rag-evening-briefing.md 高 ⭐⭐⭐⭐(Continnum 2511.02230 + C2C KV-Cache 直传 + ECHO OSDI 2026 + Cognee 90% vs 60%)
inbox/tom 2026-09-28-0900-hf-daily-2026-09-28.md 高 ⭐⭐⭐⭐(HF Daily 15 篇;无 eval 主分类;Spatial-Interactor 48▲ + Agent-Editing 17▲)
inbox/tom 2026-09-28-agent-rag-longcontext-radar.md 极高 ⭐⭐⭐⭐⭐(PISA 2609.31093 长上下文 + AgentWorld 2609.31590 多 Agent 协作评测 + Substack RAG 工程洞察)
inbox/tom 2026-09-28-rag-e1prep.md 中(R104 · RAG 主分类连续第 6 日 0 入库)
inbox/tom 2026-09-28_agents-lite.md 高(Agent 记忆三层 + Mem0/Letta/Zep 产品图谱 + 多 Agent 协作风险案例)
inbox/jay 2026-09-28-1001-rss-cool-papers-ir.md 中(cool papers cs.IR 5 篇;SID 信用分配 + SID 推理 + LSF-SR + SEEK + EvLink Graph RAG)
inbox/jay 2026-09-28-1001-rss-lilian-weng.md 中(Harness Engineering Lilian Weng 2026-07-04;沿用)
inbox/jay 2026-09-28-1000-rss-raschka.md 中(GPT-6 Astra + 循环 Transformer + Claude 水印 + 本地 Coding Agent)
inbox/jay 2026-09-28-1000-rss-bytebytego.md 中(EP227 Jev 9 大应用;OpenAI GPT-Live)
inbox/spark 2026-09-28-agent-e1prep.md 中(Agent 主轴;立标池承接稳态)
inbox/flyp 2026-09-28-1000-rss-cameron-wolfe.md 中(LLM RL 完全指南;Agentic 世界模型;Agentic RL;Agent 评估详尽指南)
inbox/stephen 2026-09-28-1245-stephen-coordination-morning.md 中(协调棒位;立标池结构性洗牌第11次确认预备触发)
inbox/stephen 2026-09-28-ai-industry-e1prep.md 高(AI 治理层 2026 升格 + frontier lab 治理公开化 42 源件套 + CSDN RAG/Agent 工程化 4 条)
paper_cards Sep 26-28 1525-2609.29816 AV-GRPO(multimodal 主分类) 已在 R87 锚定(同步性评测设计方法学案例)
paper_cards Sep 26-28 1521-2609.29429 Just Ask Jev RLCD(risk 主分类) 已在 R87 锚定(RLCDAlignBench 10 类对齐失败)
paper_cards Sep 26-28 1524-2609.29028 RGBD20K(multimodal 主分类) 非 eval;160 类 RGB-D 分割 benchmark
paper_cards Sep 26-28 1518-2609.29647 AgentKernel(agent 主分类) 已在 Jay Sep 28 engineering 锚定(Agent OS 新分类)
paper_cards Sep 26-28 1516-2609.23407 OmniEchoBench(multimodal 主分类) 空间音频-视觉 benchmark;非 eval 主分类
paper_cards Sep 26-28 1500-2609.27657 FLEET(evaluation 主分类) 已在 R85 锚定(memory mechanism generation;来自 paper_card 元数据)
paper_cards Sep 26-28 1501-2609.26637 Capability Extraction(evaluation 主分类) 已在 R86 锚定(Hidden CoT extraction)

一、增量条目

增量 1:InferenceBench(2607.20468)— AI Agent 自主优化推理服务的 benchmark 新范式(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28T1450-jay-engineering-filter-afternoon-reproduction.md(Jay 本日 14:50 批次)· 原始来源:arXiv:2607.20468 / inferencebench.ai(v1.0.5 Sep 2026)· GitHub: aisa-group/InferenceBench

URL:https://inferencebench.ai | https://arxiv.org/abs/2607.20468

要点(与 R87 无重复,全 NET-new):

InferenceBench 重新定义"推理系统 benchmark"的评测范式——不是让人类工程师调优 LLM serving,而是让 AI coding agent(Claude/GPT 等)在 2 小时时间预算 + 1 张 H100 80GB 内自主构建 OpenAI 兼容推理服务器并最大化吞吐量。评测 4 个场景:

场景 评测目标
A Prefill TTFT(Time-to-First-Token)优化
B Decode TPOT(Time-Per-Output-Token)优化
C Throughput 请求/秒优化
D All-In-One 综合场景

关键数据(inferencebench.ai Sep 2026 leaderboard;快照 2026-05-20):

配置 A Prefill B Decode C Throughput D 综合 Aggregate
vLLM default(无 agent) 1.25× 2.25× 48.69× 1.96× 4.05×
SGLang default(无 agent) 1.22× 1.77× 51.12× 2.14× 3.92×
TGI default(无 agent) — — — — 8.31×
SMAC3(自动超参搜索 2h) 4.37× 15.23× 46.70× 5.69× 11.53×
Claude Fable 5.1 — — — — 9.83×(当前 #1)
Claude Sonnet 4.6 3.47× 12.03× 33.93× 3.01× 8.08×
GLM-5 3.44× 4.45× 26.36× 3.66× 6.20×
Gemini 3.1 Pro 3.35× 4.81× 31.24× 2.87× 6.16×

核心工程解读: - TGI 在场景 C(Throughput)原生 61.38×,远超 vLLM(49×)和 SGLang(51×),说明 TGI 的 batching 策略在吞吐密集型负载优势显著——是今日新增的最重要新数据点 - SGLang default 在场景 A(Prefill)达 4.62× vs vLLM 3.71×,与 Jay Sep 28 engineering 数据一致(TTFT 4.5x 差距的来源) - Agent 干预显著有效:Sonnet 4.6 8.08× vs SGLang default 3.92×(提升 2.06×),说明 AI coding agent 能发现人类未想到的调度/量化组合 - 自动超参搜索(SMAC3 11.53×)仍高于最强 agent(Sonnet 4.6 8.08×),暗示搜索策略在特定场景有优势

可复现性:场景描述明确(H100 80GB / 2h / OpenAI-compatible server / 4 scenarios);GitHub repo 公开;Leaderboard 含标准差

为什么这是 eval 邻接增量: - 不是评测方法学论文,而是用 eval 任务设计(4-scenario benchmark)来评测 AI coding agent 的系统工程能力 - 提供了 SGLang/vLLM/TGI 在 H100 上的标准化 baseline 数据,可交叉验证 Jay Sep 28 engineering 的生产基准 - "agent optimizing inference infrastructure"本身是 2026 年工程趋势——属于元评测(benchmark the benchmarkers)范畴

与活文档 evaluation.md 现有脉络的关系: - 与 R84 §1.1 NVIDIA Agent Eval(step-level vs E2E)同为"评测设计工程化"方向,但 InferenceBench 进一步将"谁来评测"从人类工程师扩展到 AI agent - 与 R87 §1.2 AV-GRPO(评测方法学从单一模态走向成对同步性)形成方法论对比:AV-GRPO 改进评测内容,InferenceBench 改进评测执行者 - 与 engineering.md 的 KV Cache 讨论(v132 §1.4 Continnum 等)形成闭环:InferenceBench 提供实测数据

建议归入章节:§1.1 评测工程学(InferenceBench benchmark 范式 + 4 场景 + H100 baseline 数据 + Agent-as-Engineer 元评测雏形)


增量 2:AI Engineer Stack 2026 Eval 层三级缺口 + Gartner 2028 预测(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-27-1050-jay-engineering-filtering-inference-agent-eval-sep27.md(Jay Sep 27 10:50 批次)+ inbox/jay/2026-09-28T1450-jay-engineering-filter-afternoon-reproduction.md(Gartner 数据)· 原始来源:The AI Engineer Substack(Paolo Perrone)+ Brain Bytes Substack(Roby,第三方背书)

URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition

要点(已在 R87 锚定的行业数据;本轮新增 Gartner 第三方预测):

维度 数据 来源
有 observability 工具 89% LangChain State of Agent Engineering 2026
有细粒度 tracing 62% 同上
运行离线评估 ~50% 同上
软件工程团队使用 Eval/Observability 平台(2028 预测) 60% Gartner(via Brain Bytes)
同上(2025 实际) 18% Gartner(via Brain Bytes)

核心工程含义: - 89% 有 observability 但仅 62% 有细粒度 tracing → 存在"有监控但无法定位问题"的中间态缺口 - ~50% 运行离线评估 → 说明另一半仍在靠"上线看结果"的土法迭代 - Gartner 2028 预测(60% vs 2025 实际 18%)→ 3 年 3.3× 增长,eval/observability 平台是确定性企业需求方向

为什么这是 eval 邻接增量: - 不是论文/benchmark,而是行业级的 eval 成熟度量化数据——为 R87 的"评测方法学行业缺口"论证提供第三层数据(R87 已有 CLEAR 37% lab-prod gap + AI Engineer 89%/62%/50%) - Gartner 第三方背书,独立性高

⚠️ 数据可靠性警示:AI Engineer 数据来自 LangChain State of Agent Engineering 2026 报告,样本框和口径未知;Gartner 数字是预测而非实测,需注明为"第三方预测"

与活文档 evaluation.md 现有脉络的关系: - R87 §0 关键判定 (a) 已锚定:The AI Engineer 行业级 89%/62%/50% 三维数据为"eval 意识缺失"提供第三层论证 - 本轮补充 Gartner 2028 预测,形成"现状(LangChain 数据)+ 趋势(Gartner 预测)+ 历史对比(18% → 60%)"的完整叙事 - 与 R86 CLEAR 五维 37% lab-prod gap(R86 §增量 1)同属行业成熟度量化方向,可并列为"行业评测意识两级化"

建议归入章节:§2.1 行业评测成熟度(89%/62%/50% LangChain 数据 + Gartner 60% 2028 预测 + 18% 2025 实际对比)


增量 3:AgentWorld(2609.31590)— 多 Agent 协作长时域评测基准(⭐⭐⭐⭐)

来源:inbox/tom/2026-09-28-agent-rag-longcontext-radar.md(Tom 本日 08:40 批次)· 原始来源:HF Daily(2 票)· 2026-09-24 入库

URL:https://arxiv.org/abs/2609.31590

要点(与 R87 pending eval 追踪相关;本轮邻接入库):

AgentWorld 提供 100 个人工标注任务(+100 增强变体),交互轮次 50+,需要 3-20 个具有不对称角色的 Agent 通过通信、联合规划和资源共享协调,底层为黑盒模拟环境。

为什么是 eval 邻接增量: - 现有 multi-agent benchmark 多为竞争性场景、交互轮次 <20 步,或仅汇总单 Agent 分数——AgentWorld 填补了"真实协作"评测空白 - 信息共享和检索效率是该 benchmark 的隐含核心指标之一——与 R103 RAG 主分类直接相关 - 50+ 轮交互远超现有 benchmark,对记忆架构(Mem0/Letta/Zep tiered memory)的压力测试价值极高

与活文档 evaluation.md 现有脉络的关系: - 与 R83 §2.1 GameHorizon Suite(multi-agent 协作 benchmark)同属多 Agent 评测方向,但 AgentWorld 交互深度(50+ 轮)远超 GameHorizon,是该方向的重大升级 - 与 R84 §2.1 Tri-PvP(8000 三模态冲突 benchmark)同属 benchmark 设计工程化,可并列对比:Tri-PvP 解决"干净归因",AgentWorld 解决"长程协作涌现"

建议归入章节:§2.2 多 Agent 评测基准(AgentWorld 50+ 轮交互 + 3-20 Agent 协作 + 信息检索隐含指标)


增量 4:PISA(2609.31093)— 块稀疏注意力的金字塔 Top-K 选择(⭐⭐⭐)

来源:inbox/tom/2026-09-28-agent-rag-longcontext-radar.md(Tom 本日 08:40 批次)· 原始来源:HF Daily(12 票)· 2026-09-24 入库

URL:https://arxiv.org/abs/2609.31093

要点(长上下文效率评测的工程基础):

标准自注意力的二次复杂度是长上下文的根本瓶颈。现有块稀疏方法选择保留块时仍需评分全部 query-block 对——本质未脱 O(n²)。PISA 引入金字塔逐步收窄策略,从粗到细逐层筛选最相关的 key,使块选择本身降至对数复杂度。

为什么是 eval 邻接增量: - 长上下文窗口的实际极限受制于注意力成本;PISA 的架构创新直接回答了"如何在不爆内存的情况下利用超长上下文"这一工程核心问题 - 对 RAG 的启示:检索回来的上下文段越多,长上下文开销越大——PISA 提供了理论上的效率上界参考 - 与 R104(待今晚更新)RAG 主分类连续第 6 日 0 入库形成对比:长上下文效率是 RAG 的上游基础设施

与活文档 evaluation.md 现有脉络的关系: - 与 R85 §2.2 Benchmark Radar(2609.11115)同属 benchmark 设计工具化方向,但 PISA 是底层注意力效率,非 benchmark 本身 - 与 R87 §1.3 "立标池信号持续性检验"(JEV-as-a-Judge 衰减 + Atria Dawn 持续跌出)无直接关系 - 可作为 §4.1 长上下文评测基础设施的理论支撑

建议归入章节:§4.1 长上下文评测基础设施(PISA 金字塔 Top-K · O(n²) → O(n log n) · 上下文效率上界参考)


二、R87 追踪更新

R87 待核事项状态

待核项 来源 状态 更新
JEV-as-a-Judge(2609.26550) R87 · HF 跌出 Top15 ⚠ 持续衰减 Sep 28 HF Daily 无 JEV 相关条目;JevOut(2609.30243)在 Sep 28 cool papers cs.CL 维持存在(沿用);无新 JEV 主分类 paper_card 入库
pending eval 项:AutoTuneBench R87 §待核 ❓ 未确认 Sep 26-28 无新信号
pending eval 项:AgentSysBench R87 §待核 ❓ 未确认 Sep 26-28 无新信号
pending eval 项:EDGE-EVAL R87 §待核 ❓ 未确认 Sep 26-28 无新信号
AV-GRPO(2609.29816) R87 · 同步性方法学案例 ✅ 持续活跃 Sep 28 work-queue 选题榜仍为 AV-GRPO(未成视频脚本);flyp 9-28 multimodal-e1prep 沿用

三、矛盾与警示

⚠️ 重要矛盾:Gartner 2028 预测 vs LangChain 数据的样本代表性

矛盾描述:LangChain State of Agent Engineering 2026 报告(AI Engineer 引用的数据来源)样本框未知,其"89% 有 observability / 62% 有细粒度 tracing / ~50% 运行离线评估"可能来自 LangChain 平台用户——存在选择性偏差(使用 LangChain 的团队本身更重视监控/评测)。Gartner 的"60% 软件工程团队 2028 年使用 Eval/Observability 平台"是独立第三方预测,但预测口径("software engineering teams" vs "AI Agent teams")是否与 LangChain 数据一致未核实。

影响:若直接将两者并列引用为"行业 eval 缺口 50%"的证据,可能夸大缺口或混淆口径。

建议:引用时注明"LangChain 平台用户数据,可能存在选择性偏差;Gartner 为独立第三方预测,口径需核实"。

⚠️ CSDN URL 真实性警示

来源:flyp-on-Jay P0(stephen 9-27 evening 协调棒位记录)

CSDN 存在 bbs.csdn.net/weixin_<userid>/article/details/<9 位数 ID> 模式化生成占位 URL,真实性存疑。本轮引用的 jay Sep 27 csdn-agent-ops-enterprise-eval-llm-production 中的 5 个 CSDN URL 均属此模式,需实际访问核验 404 后再正式锚入知识库。


四、本轮无新增的邻接领域(R87 追踪)

以下邻接领域在 Sep 26-28 窗口内无 eval 主题净增量,仅维持 R87 基线:

  • Jev 决策生态:JevOut(2609.30243)在 cool papers cs.CL 维持;Just Ask Jev RLCDAlignBench(2609.29429)已在 R87 锚定;Sep 28 bytebytego EP227 Jev 9 大应用(Substack)沿用,无新数据
  • Harness 工程:Lilian Weng Harness Engineering(2026-07-04)沿用 Jay Sep 27 1050 条目;NVIDIA Agent Eval 沿用 R84 数据;无新进展
  • RAG 评测:CSDN RAG 评估四维度(Jay Sep 27)有工程实践价值但非方法学新增;BM25 逆袭、LazyGraphRAG 成本等沿用 Jay Sep 28 csdn-rag-agent-research
  • 多 Agent 记忆产品:Mem0(2400 万美元 A 轮)/ Letta(1000 万美元种子)/ Zep(Agent Memory SOTA)在 Jay Sep 27 csdn-agent-ops 和 Tom Sep 28 agents-lite 中均有记录,沿用,无产品级评测新数据

五、可引用 arXiv 号列表

arXiv 号 名称 本轮角色
2607.20468 InferenceBench NET-new · AI Agent 自主优化推理服务 benchmark
2609.31590 AgentWorld NET-new · 多 Agent 协作长时域评测基准
2609.31093 PISA NET-new · 块稀疏注意力金字塔 Top-K(长上下效效率)
2511.02230 Continnum 续用锚定 · KV Cache TTL · 补充 InferenceBench 场景 A 数据背景
2609.29647 AgentKernel 续用锚定 · Agent OS 新分类
2609.29816 AV-GRPO 已在 R87 锚定(同步性方法学)
2609.29429 Just Ask Jev RLCDAlignBench 已在 R87 锚定(10 类对齐失败)
2609.30243 JevOut 已在 R87 锚定(Cool Papers 维持)
2609.26550 JEV-as-a-Judge 已在 R84 锚定(持续衰减)

六、下游建议

  1. InferenceBench 数据交叉验证:InferenceBench 的 TGI 场景 C 数据(61.38×)与 Jay Sep 28 engineering 的 SGLang vs vLLM TTFT 数据(4.5x)来自不同测试环境,建议在 evaluation.md 中标注"TGI throughput 数据来源为 inferencebench.ai Sep 2026 leaderboard,与 bex.co PremAI 基准的测试条件不同,不可直接跨源比较"

  2. CSDN URL 404 核验:Jay Sep 27 csdn-agent-ops-enterprise-eval-llm-production 中的 5 个 CSDN URL 在正式锚入 evaluation.md 前需 web_fetch 实际访问,404 一律替换为 CSDN 搜索词或移除

  3. AutoTuneBench / AgentSysBench / EDGE-EVAL 溯源:R87提出的 3 个 pending eval 项在 Sep 26-28 窗口内无确认信号,建议在今晚 v88 活文档中降级为"待主动检索"而非"待被动等待"

  4. Gartner 2028 预测置信度:该数字来自 Brain Bytes Substack 二次引用,建议追查 Gartner 原文以确认口径(software engineering teams 的定义边界)


Tom · evaluation · E1 · 2026-09-28 15:40 CST · 增量 4 条 · 5 个 arXiv 号 · 下游建议 4 条