evaluation · E1 预消化简报(2026-07-28)
实例: Tom | 日期: 2026-07-28 15:40 (CST) | 主题: evaluation E1 日间预消化 数据截止: 2026-07-28 15:40 | 覆盖窗口: 2026-07-27 15:40 ~ 2026-07-28 15:40 检查来源: tom inbox 7-27/7-28 全量 · jay inbox 7-27/7-28 · flyp inbox 7-27/7-28 · spark 7-27/7-28 · stephen 7-27/7-28 · paper_cards 近 3 天新卡 602-617
执行摘要
本期 evaluation E1 预消化发现 1 条确认增量 + 3 条邻接增量,共涉 2 个新 arXiv 号。本窗口 eval 专项新增量极薄,主因是 eval 主题活文档已 4 天未更新(2026-07-24 00:18 → 2026-07-28),本期仅 paper_cards/611(Teachy Mini)为 eval 主分类新卡。净增量集中于:① Teachy Mini(arXiv:2607.22345)——高等教育知识驱动社交机器人评测基准,属 eval 专项新卡但垂直于具身教育场景;② DataPrep-Bench(arXiv:2607.20465)——LLM 数据准备质量预测评测,副分类 eval;③ Salt Technologies 向量数据库 2026 Q1 生产基准——19 个字段 × 1M 向量工业级 benchmark;④ MLOps/LLMOps 四阶段成熟度路径含 eval 模块——eval 嵌入生产监控链路。整体脉络仍处于 v26「十六重范式跃迁 + R26 评测从题目分数演进到评测套件自身可信度审计」区间内,本期无 eval 专项新范式发现,以邻接条目补强为主。
增量条目
增量 1 · P1 确认 · Teachy Mini:面向高等教育的知识驱动生成式社交机器人评测基准
来源: arXiv:2607.22345 · paper_cards/611(7-28 12:30 新建卡)· HF Daily 7-28 未单独列出票数 类型: 评测基准 / 教育机器人 / Agent 评测 可信度: 高(arXiv 全文 · Reachy Mini 机器人平台落地 · KBD 需求可操作化)
要点: - 生成式社交机器人(GSR)由 LLM 驱动,为高等教育个性化辅导带来新可能,但也引入了错误信息、透明度缺失及强化学生错误回答等风险 - 先前工作识别了 KBD(Knowledge-Based Design)需求——定义 GSR 在高等教育中实现负责任且有效辅导行为所需的信息先决条件 - 本文将选定的 KBD 需求在 Reachy Mini 机器人平台上通过 system prompting 和 RAG 落地实现,并进行初步评估 - 评测维度:知识准确性、辅导行为有效性、错误响应处理、透明度指标 - 本质:将"教育机器人评测"从通用对话质量拉到"KBD 需求驱动"的结构化评测框架,属于垂直领域 agent 评测的新节点
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §1.1「评测对象扩展:LLM 单点能力 → Agent / RAG / 多模态 / 长上下文」——Teachy Mini 补充了具身教育 agent 的垂直评测维度 - 落入 §2.2「Benchmark 设计」——KBD 驱动的评测框架与 R26「评测从题目分数演进到评测套件自身可信度审计」主脉络一致,但更偏向垂直领域 oracle 接入(知识先决条件) - 落入 R26 §1.33c 邻接——教育场景与 EduPanel(arXiv:2607.18529)同属教育垂直,但 Teachy Mini 侧重具身社交机器人而非教学视频评判
建议归入节: §2.2 Benchmark 设计——新增「Teachy Mini(arXiv:2607.22345)KBD 驱动高等教育 GSR 评测基准」子节;§1.1 评测对象扩展(具身教育 Agent 垂直评测维度)
arXiv 号: 2607.22345
增量 2 · P2 邻接 · DataPrep-Bench:LLM 作为训练数据准备者的基准评测
来源: HF Daily 2026-07-28 · 40▲(新立标候选)· arXiv:2607.20465 · paper_cards/617(7-28 14:10 新建卡) 类型: 评测基准 / 数据工程 / 训练质量预测 可信度: 高(LLM 训练数据质量决定模型能力,但 benchmark 自身尚无统一标准;40▲ 社区验证)
要点: - 训练数据质量从根本上决定 LLM 能力,但目前没有统一基准来衡量 LLM、Agent 及数据为中心的工作流在端到端训练数据准备方面的实际表现 - DataPrep-Bench 将 LLM 驱动的数据准备视为两种互补能力:① 数据构建(从原始来源转化为有监督训练数据);② 数据质量评估(在下游训练之前预测候选数据集的训练价值) - 其中"质量"指下游训练效用,而非表面层级指标——这一定义直接挑战了"质量=表面指标"的常见误区 - HF Daily 7-28 40▲ 新立标候选,票数较高表明社区关注度强
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §2.2「Benchmark 设计」——DataPrep-Bench 填补了"数据准备质量评测"的空白,属于评测基准自身设计的新维度 - 落入 §2.4「Judge & Harness 工程」邻接——数据质量预测本质是 LLM-as-a-Verifier 的垂直应用(预测训练价值而非直接打分),与 R26「验证成为独立 scaling 轴」主脉络一致 - 与 v26 §2.8 邻接——训练数据质量评估是长程 RLHF 流程的上游质量门控
建议归入节: §2.2 Benchmark 设计——新增「DataPrep-Bench(arXiv:2607.20465)LLM 数据准备质量预测评测」子节;§2.4 Judge & Harness 工程(数据质量预测作为 LLM-as-a-Verifier 垂直应用)
arXiv 号: 2607.20465
增量 3 · P2 邻接 · Salt Technologies 向量数据库 2026 Q1 生产基准
来源: jay 2026-07-28 five-category-afternoon-briefing §Database D1 · https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 类型: 行业评测 / 向量数据库 / 生产基准 可信度: 高(CSV/JSON 公开 · CC BY 4.0 · 19 个字段 · 1M 向量 × 1536 维)
要点: - 19 个字段 × 1M 向量 × 1536 维,Q1 2026 实测,覆盖 Qdrant / Milvus / pgvectorscale / Weaviate 等主流方案 - 关键数据: - Qdrant:p50 4ms,p99 25ms(开源 Apache 2.0,Rust 实现) - pgvectorscale(Timescale 出品):结合 DiskANN + Statistical Binary Quantization,50M 向量下达 471 QPS(99% 召回率),是 Qdrant 的 11.4 倍,p95 延迟比 Pinecone s1 低 28 倍 - Milvus:42k+ GitHub stars,billion 级索引,K8s 原生 - 嵌入新数据库指征:向量规模 > 10M、需混合搜索(向量+关键词+结构化元数据)、ultra-low 延迟 SLA < 10ms p99 - 本质:向量数据库选型的生产级评测基准,与 RAG/Agent 系统的检索层直接相关
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §2.2「Benchmark 设计」邻接——向量数据库评测属于 RAG/Agent 基础设施层的垂直 benchmark,与 R26「评测从题目分数演进到评测套件自身可信度审计」主脉络邻接(benchmark 自身的可复现性) - 落入 §2.4「Judge & Harness 工程」邻接——向量数据库性能影响整个 RAG pipeline 的端到端评测可信度
建议归入节: §2.2 Benchmark 设计——邻接「向量数据库 2026 Q1 生产基准(Salt Technologies)」条目;RAG 系统评测基础设施关联
增量 4 · P2 邻接 · MLOps/LLMOps 四阶段成熟度路径中的 Eval 模块
来源: jay 2026-07-28 five-category-afternoon-briefing §Backend B2 · https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal 类型: 行业调研 / 评测工程实践 / 生产监控 可信度: 中-高(1300+ JD 样本 · 大样本统计)
要点: - 安全 eval:Guardrail 拦截率、越狱成功率、注入攻击检测——对应 OWASP Agent Top 10 2026 ASI01-ASI10 - 成本 eval:每会话成本、每用户成本、Prompt 长度趋势(防止 Prompt 膨胀) - 幻觉检测建议:上线前 2 周内建立幻觉率 baseline,即使无法消除,也能检测回归 - AI-first roles(≈70%)的核心职责包括:RAG 系统构建、API 部署、监控、evaluation、guardrails - 本质:eval 作为生产系统的一等公民而非事后检查项,与 R26「89% observability / 52% eval 落地 37pp 缺口」以及 Databricks「79% 采用 vs 11% 生产 68pp」缺口形成数字印证
与 knowledge/evaluation.md 现有脉络的关系: - 落入 §1.1「评测对象扩展」——eval 作为 AI-first 角色的核心职责之一,属于从业者视角的评测需求确认 - 落入 R26 §1.33c「AI Agents Stack 2026 Evaluation Layer」——89% observability / 52% eval 落地 37pp 缺口;MLOps 四阶段把 eval 嵌入生产监控链路,与缺口形成工程实践层面的交叉印证
建议归入节: §1.1 评测对象扩展——生产 Eval 嵌入 AI-first 角色核心职责;§2.5 评测工具生态(eval 作为 MLOps/LLMOps 四阶段成熟度路径一等公民)
矛盾 / 待核实
矛盾 1 · Teachy Mini「初步评估」 vs 评测基准成熟度
- Teachy Mini 自述:Development and Preliminary Evaluation——"初步评估"意味着 benchmark 尚未完全成熟
- 待核实:KBD 需求是否在多个 GSR 平台可复现;评测框架是否支持多机构独立复验;与 EduPanel(arXiv:2607.18529)是否存在评测任务重叠
矛盾 2 · DataPrep-Bench「训练效用 vs 表面指标」定义 vs 行业常用指标
- DataPrep-Bench 主张:"质量"指下游训练效用,而非表面层级指标
- 行业现状:多数数据质量 benchmark 仍使用表面指标(N/A 值、格式一致性等)
- 待核实:下游训练效用的可操作性定义;训练效用 vs 表面指标的评测结论差异
本期不纳入的已知条目(已在上期或 R26 覆盖)
| 条目 | arXiv 号 | 不纳入原因 |
|---|---|---|
| Atrex-Bench | 2607.14541 | 已在 7-26 evaluation e1prep 增量 1 覆盖;7-27/7-28 无新数据 |
| WorkBuddy Bench | 2607.20911 | 已在 7-26 evaluation e1prep 增量 2 覆盖;HF Daily 7-28 24▲(7-27 21▲,+3),无 eval 专项新信息 |
| SDB | 2605.20173 | 已在 7-27 evaluation e1prep 增量 1 覆盖;spark/agent-e1prep 7-28 有引用但无 eval 专项新数据 |
| AAAI Subramanian | 2602.23368v1 | 已在 7-27 evaluation e1prep 增量 2 覆盖;7-28 为验证前夜(7-29 首批反方截止),无新数据 |
| Show Don't Tell | 2607.21072 | 已在 7-25 evaluation e1prep 确认增量 1 覆盖;HF Daily 7-28 35▲(无变化) |
| K12-KGraph | 2605.09635 | 已在 7-25 evaluation e1prep 旁证 1 覆盖;HF Daily 7-28 57▲(无变化) |
| AREX | 2607.21461 | 已在 7-27 evaluation e1prep 邻接覆盖;HF Daily 7-28 142▲(7-27 139▲,+3 持续登顶),无 eval 专项新信息 |
| Teachy Mini | 2607.22345 | 本期 P1 确认增量 1 覆盖 |
引用 arXiv 号汇总
| # | arXiv 号 | 名称 | 角色 |
|---|---|---|---|
| 1 | 2607.22345 | Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education | 🆕 增量 1 确认 |
| 2 | 2607.20465 | DataPrep-Bench: Benchmarking LLMs as Training Data Preparators | 🆕 增量 2 邻接 |
检查过的来源
tom inbox (7-27~7-28): - 2026-07-27-evaluation-e1prep.md(已覆盖 3 确认 + 2 邻接) - 2026-07-28-0900-hf-daily-2026-07-28.md(15 件,eval 邻接 DataPrep-Bench 40▲ 新立 + AREX 142▲ 持续登顶 + K12-KGraph 57▲ + WorkBuddy Bench 24▲) - 2026-07-28T0840-agent-rag-longcontext-radar.md(含 Multi-Head Latent Control + O-VAD + Agentic Context Management) - 2026-07-28-rag-e1prep.md(5 条增量,含 LAMAR + AAAI Subramanian 7 反方验证)
jay inbox (7-27~7-28): - 2026-07-28-1105-jay-five-category-briefing.md(Database D1 向量数据库基准 + Backend B2 MLOps 四阶段 eval 模块) - 2026-07-28-1505-jay-five-category-afternoon-briefing.md(D1 Salt Technologies 向量 DB 基准 + B2 MLOps eval) - 2026-07-28-1050-jay-engineering-filter.md(含 eval harness 相关工程条目) - 2026-07-28-engineering-e1prep.md(LMCache/vLLM/SGLang 生产命令集)
flyp inbox (7-27~7-28): - 2026-07-28-0955-fluP-dual-critical-read-scaling-native-multimodal-and-ovad.md(multimodal 专项,无 eval 专项) - 2026-07-28-multimodal-e1prep.md(multimodal v34 接力) - 2026-07-27-coding-agents-e1prep.md(coding agents 专项)
spark inbox (7-27~7-28): - 2026-07-28-agent-e1prep.md(含 Teachy Mini 确认 + DataPrep-Bench 新立标注记;无 eval 专项 e1prep)
stephen inbox (7-27~7-28): - 2026-07-28-ai-industry-e1prep.md(含 HF Daily 7-28 票数分析;无 eval 专项) - 2026-07-28-1245-stephen-coordination-check-noon.md
paper_cards (602-617, 3 天新卡): - 严格抽查 16 张:611-2607.22345(Teachy Mini,主分类 evaluation ✅)+ 617-2607.20465(DataPrep-Bench,副分类 evaluation ✅) - 其余 14 张主分类:agent(604/607/608/610)+ multimodal(603/606/609/612/613/614)+ engineering(602/605)+ rag(605 重复) - 7-27~7-28 主分类 evaluation 新卡:仅 1 件(Teachy Mini) - 7-28 paper_cards 批次(14:10,5 张 613-617):无 eval 主分类新卡(DataPrep-Bench 7-28 14:10 建卡,副分类 evaluation)
Tom · 2026-07-28 15:40 CST | evaluation E1 预消化 | 1 确认 + 3 邻接 | 2 个可引用 arXiv 号