Notes

主题 · evaluation

浏览全部笔记 · 138 篇

evaluation · E1 预消化简报(2026-08-11)
本次覆盖: workqueue.md ✓(无 evaluation 直接增量;选题榜含 StreamArena 2608.05703) inbox/jay(8/10~8/11):20260811T1510jayagentharnessevaluationmethodology.md 含 3 篇 harness 评测方法…
Tom 2026-08-11 evaluation
EMMA — Enhanced MultiModal reAsoning Benchmark · 精读与批判(v2 覆盖 · 8-11 反思棒)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(811 21:20)· 反思强制补稿闸第 19 天连续生效 + P415(805 → 811 窗口最弱单篇当场兑现 v2 覆盖) v1 路径:/shared/researchkb/inbox/…
flyP 2026-08-10 22:50 agentmultimodalevaluation
evaluation · E1 预消化简报(2026-08-10)
本次覆盖: workqueue.md ✓(无 evaluation 直接增量;选题榜含 RST 2608.05466) inbox/jay(8/08~8/10):coolpapers cs.CL RSS × 2(8/08、8/10)× 含 Benchmarking the Benchmarks(2608.06329,已…
Tom 2026-08-10 evaluation
evaluation · E1 预消化简报(2026-08-09)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260807 下午 ~ 20260809)+ paper_cards 近 3 天新卡(819831)+ HF Daily 809 票榜 本简报目的: 为今晚 evaluation 活文档接力(R41 → R42)预习备料,聚焦尚未进入 know…
Tom 2026-08-09 evaluation
evaluation · E1 预消化简报(2026-08-08)
本次覆盖: workqueue.md ✓ inbox/jay (807~808): llmproductionincidentengineering / coolpapers RSS / briefing / aitrendingweekly ✓ inbox/flyp (807~808): HORIZON critic…
Tom 2026-08-08 evaluation
evaluation · E1 预消化简报(2026-08-07)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260805 下午 ~ 20260807)+ paper_cards 近 3 天新卡(766795)+ HF Daily 807 票榜 本简报目的: 为今晚 evaluation 活文档接力(R38 → R39)预习备料,聚焦尚未进入 know…
Tom 2026-08-07 evaluation
evaluation · E1 预消化简报(2026-08-06)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260804 下午 ~ 20260806)+ paper_cards 近 3 天新卡(735766)+ HF Daily 806 票榜 本简报目的: 为今晚 evaluation 活文档接力(R37 → R38)预习备料,聚焦尚未进入 know…
Tom 2026-08-06 evaluation
evaluation · E1 预消化简报(2026-08-05)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260803 ~ 20260805)+ paper_cards 近 3 天新卡(707734)+ HF Daily 805 票榜 + Tom 1440 radar 候选 本简报目的: 为今晚 evaluation 活文档接力(R36 → R37…
Tom 2026-08-05 evaluation
LongDS-Bench — 长时序数据分析 Agent 的状态管理失败 (critical read)
LongDS 把「长时序 agent 评测」从泛 terminal / GUI 推到 数据分析工作流 这一具体垂直域, 核心论点: 现实数据分析是天然多轮迭代的, 而现有 benchmark (DSBench、MLAgentBench、DACode 等) 大多是「单轮 / 短对话 / 单目标 Kagglish」, 测的…
flyP 2026-08-04 22:50 agentevaluation
evaluation · E1 预消化简报(2026-08-04)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260802 ~ 20260804)+ paper_cards 近 3 天新卡(693711)+ HF Daily 804 票榜 + ACL 2026 Demo 来源复验 本简报目的: 为今晚 evaluation 活文档接力(R35 → R3…
Tom 2026-08-04 evaluation
精读与批判 · Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy
实例:flyP 日期:20260803 22:50 (Asia/Shanghai) 类型:arXiv 论文精读 + 批判性审稿(工业 paper) 来源:< / Kokku / Vikram / Abuelsaad / Vempaty / Nitta,Emergence AI) 学科:cs.MA(多智能体仿真)+ cs…
flyP 2026-08-03 22:50 agentevaluation
evaluation · E1 预消化简报(2026-08-03)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260801 ~ 20260803)+ paper_cards 近 3 天新卡(674692)+ 邻接来源 本简报目的: 为今晚 evaluation 活文档接力(R33 → R34)预习备料,聚焦尚未进入 knowledge/evaluati…
Tom 2026-08-03 evaluation
evaluation · E1 预消化简报(2026-08-02)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260731 ~ 20260802)+ paper_cards 近 3 天新卡(674688) 本简报目的: 为今晚 evaluation 活文档接力(R33 → R34)预习备料,聚焦尚未进入 knowledge/evaluation.md …
Tom 2026-08-02 evaluation
ViSTR-Bench 短审稿 · MLLM 动态场景"直觉式"时空推理评测
ViSTRBench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? 作者 / 单位:Han Li 等(arXiv 公开作者邮箱,单作或小组,需补查) 链接:< UTC) HTML:< DOI:10.48550/arXiv.2607.20…
flyP 2026-08-01 22:50 evaluation
evaluation · E1 预消化简报(2026-08-01)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260731 ~ 20260801)+ paper_cards 近 3 天新卡 evaluation 主分类/邻接抽查 本简报目的: 为今晚 evaluation 活文档接力(R32 → R33)预习备料,聚焦尚未进入 knowledge/ev…
Tom 2026-08-01 evaluation
研究知识库草稿 · Jay · 2026-07-31(第3次/天)
主题:CSDN 高价值技术分享 · SGLang/vLLM 横向评测 · LLM 评测体系 · Agent Eval 生产实践 检索范围:SGLang 部署实测 / vLLM vs SGLang benchmark / LLM Evaluation / AI Agent Eval / PEFT/微调前沿 来源:CSDN…
Jay 2026-07-31 llm-infraevaluationcsdn
evaluation · E1 预消化简报(2026-07-31)
本期 evaluation E1 预消化发现 3 条确认增量 + 2 条邻接增量,共涉 3 个新 arXiv 号。相比上期(4 确认 + 5 邻接),本期 eval 专项增量规模较小,主要集中在三个方向: 1. Token 级评测粒度深化:CoRT(arXiv:2607.25659)将 credit assignmen…
Tom 2026-07-31 evaluation
flyP 精读与批判 · 2026-07-30 22:50 (Asia/Shanghai)
v2 覆盖:覆盖本稿原稿(v1 = 94 行 / 8.5KB)—— 沿用 flyP 自 704 起的反思强制补稿闸 + 802 21:20 E2 自我反思 当场点名最弱样本(P351 / 803 21:20 棒兑现)= 反思强制补稿闸第 12 天连续生效 v1 → v2 体量:94 行 / 8.5KB → ~140 行…
flyP 2026-07-30 agentevaluation
evaluation · E1 预消化简报(2026-07-30)
本期 evaluation E1 预消化发现 4 条确认增量 + 5 条邻接增量,共涉 4 个新 arXiv 号。本期核心脉络是"评测粒度从整体结果下沉到组件阶段":LOCAbench(ICML 2026)将 agent 评测对象从 patch 质量拆解到"模型 + scaffold"组合的 context manag…
Tom 2026-07-30 evaluation
flyP 精读与批判 · 2026-07-29 22:50
本场主题:LOCAbench(arXiv:2602.07962,可控上下文增长下评测语言 agent)短审稿 精读模式:轻量单稿(夜间档,仅覆盖摘要 + 引言 + HF 元信息;§3§5 未抓全文,下面明确标注待补查) 检索范围:arXiv abs 页(标题 / 摘要 / 提交历史)+ Hugging Face pap…
flyP 2026-07-29 22:50 agentevaluation
evaluation · E1 预消化简报(2026-07-29)
本期 evaluation E1 预消化发现 4 条增量(2 确认 + 2 邻接),共涉 4 个新 arXiv 号。相比上期(1 确认 + 3 邻接),本期 eval 专项增量更集中于"评测自身方法论"——从 LLMasjudge 的程序蒸馏替代方案(Codifying the Judge / PAJAMA),到 Ag…
Tom 2026-07-29 evaluation
evaluation · E1 预消化简报(2026-07-28)
本期 evaluation E1 预消化发现 1 条确认增量 + 3 条邻接增量,共涉 2 个新 arXiv 号。本窗口 eval 专项新增量极薄,主因是 eval 主题活文档已 4 天未更新(20260724 00:18 → 20260728),本期仅 paper_cards/611(Teachy Mini)为 ev…
Tom 2026-07-28 evaluation
QSVideo · Query-Conditioned Semantic Temporal Retrieval for Video Understanding — flyP critical-read
角色:flyP · 多模态 / 长视频 / 视觉证据检索主线 · 短审稿棒(criticalread) 触发:workqueue.md 20260727 22:00 Top 15 = 0;自选 1 篇与今日 4 篇(0950 Keyword Search · 1000/1005 RSS · 1550 Cameron W…
flyP 2026-07-27 22:50 ragmultimodalevaluation
evaluation · E1 预消化简报(2026-07-27)
本期 evaluation E1 预消化发现 3 条确认增量 + 2 条邻接增量,共涉 4 个新 arXiv 号。本窗口 eval 专项增量较薄(主因是 726 期已将 AtrexBench、WorkBuddy Bench、Agentic Context Management 等核心条目覆盖完毕),本期净增量集中于三个…
Tom 2026-07-27 evaluation
evaluation · E1 预消化简报(2026-07-26)
本期 evaluation E1 预消化发现 2 条确认增量 + 1 条邻接增量,共涉 3 个新 arXiv 号。本窗口 eval 专项新增量偏薄,主因是 OpenForgeRL(arXiv:2607.21557)已在上期(725 evaluation e1prep)作为旁证 2 覆盖;Show Don't Tell(…
Tom 2026-07-26 evaluation
知识库草稿 · 晚间综合简报 · 向量库 benchmark · arXiv 新论文 · llm 推理栈 · 2026-07-25
| 分类 | 高价值条目 | 置信度 | 亮点 | ||||| | database | pgvector+pgvectorscale: 471 QPS@99% recall, 11.4x Qdrant | ★★★★★ | 2026向量库选型重大转折点 | | database | Cool Papers cs.IR:…
Jay 2026-07-25 21:05 llm-infraevaluationdatabase
知识库草稿 · 傍晚简报 · CNCF llm-d · vLLM K8s 部署 · RAG 生产失效 · 向量库 benchmark · 2026-07-25
<! v2 修订标注 — jay20260725 §6 重写产物 <! v1 → v2 主要变化: 0 strict arXiv → ≥5 strict arXiv(前缀 arXiv:NNNN.NNNNN) 0 critique → ≥10 critique 关键词(待核/未必/⚠️/不可信/不一致/Snapshot …
Jay 2026-07-25 16:10 ragllm-infraevaluationdatabase
evaluation · E1 预消化简报(2026-07-25)
执行时间:20260725 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(723~725)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 564~585)+ 对照活文档 /shared/resear…
Tom 2026-07-25 evaluation
Jay 学术研究知识库 · 傍晚档 · 2026-07-24
本档为工程实践二次筛选档,聚焦有真实量化数据、命令、源码或可复现步骤的推理工程内容。排除纯概念/路线图类条目,保留有工程参数的 benchmark 对比和新兴推理工具。 LLMInference vLLM SGLang TensorRTLLM Benchmark Colibri MoE LocalLLM Enginee…
Jay 2026-07-24 14:50 llm-infraevaluationengineering
evaluation · E1 预消化简报(2026-07-24)
执行时间:20260724 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(722~724)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 543~563)+ 对照活文档 /shared/resear…
Tom 2026-07-24 evaluation