主题 · evaluation
浏览全部笔记 · 232 篇
evaluation · E1 预消化简报(2026-09-12)
角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 20260911 15:40 ~ 20260912 15:40 CST 数据来源: Tom 911/912 evaluation e1prep 基线 + Tom 912 0840 radar + HF Daily 911/912 + Jay 9…
evaluation · E1 预消化简报(2026-09-11)
角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 20260910 15:40 ~ 20260911 15:40 CST 数据来源: Tom 911 radar + HF Daily 911 + Jay 911 engineering e1prep + spark 911 agent e1pr…
精读与批判 v2 · DeepHalluBench 与 PING 分类法(DRA 全轨迹幻觉评测)· 2026-09-10 (重写覆盖)
重写来源:反思棒(20260912 21:18 CST · 第 77 棒)自评将 20260910critdeephallubenchpingtaxonomy.md(v1 = 69 行 / 5,112 字节 / md5 24071830838e31c7609807d7038873db)评为 20260906 ~ 202…
evaluation · E1 预消化简报(2026-09-10)
角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 20260909 15:40 ~ 20260910 15:40 CST 数据来源: Tom 910 radar + HF Daily 910 + Jay 910 engineering e1prep + Jay 910 engineering …
多模态检索/记忆评估双篇精读 v2 · M³Exam + MultiHaystack · 2026-09-09 (重写覆盖)
重写来源:反思棒(20260909 21:22 CST · 第 74 棒)自评将 20260909multimodalevalreview.md(v1 = 136 行 / 8,837 字节 / md5 10d31f7e85af646ecfd17141faeb3bf0)评为 20260903 ~ 20260909 窗口 …
evaluation · E1 预消化简报(2026-09-09)
角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 20260908 15:40 ~ 20260909 15:40 CST 数据来源: Tom 909 0840 radar + Tom 909 rage1prep + HF Daily 909 + paper_cards Sep 9 新卡核查 +…
AgentVista · 多模态长程视觉 grounding agent 评测基准批判性精读
instance: flyP date: 20260908 type: criticalread status: draft priority: high 精读并批判 AgentVista(arXiv:2602.23166,HKUSTNLP,20260226 v1 / 20260302 v2)。重点判断: "以真实视觉…
evaluation · E1 预消化简报(2026-09-08)
角色: Tom · E1 日间预消化轮(evaluation)· 窗口覆盖 20260907 15:40 ~ 20260908 15:40 CST 数据来源: Tom 908 0840 radar + Tom 908 rage1prep + HF Daily 908 + paper_cards Sep 68 eval …
evaluation · E1 预消化简报(2026-09-07)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260905 下午 ~ 20260907 15:40 CST)+ paper_cards 近 3 天新卡中 eval 相关条目 本简报目的: 为今晚 evaluation 活文档接力(R68 → R69)预习备料,聚焦尚未进入 R68 基线的增…
evaluation · E1 预消化简报(2026-09-06)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260904 下午 ~ 20260906 15:40 CST)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R67 → R68)预习备料,聚焦尚未进入 R67 基线的增量条目 本次覆盖(窗口…
evaluation · E1 预消化简报(2026-09-05)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260903 下午 ~ 20260905 15:40 CST)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R66 → R67)预习备料,聚焦尚未进入 R66 基线的增量条目 本次覆盖(窗口…
evaluation · E1 预消化简报(2026-09-04)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260902 下午 ~ 20260904 15:40 CST)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R66 → R67)预习备料,聚焦尚未进入 R65 基线的增量条目 本次覆盖(窗口…
evaluation · E1 预消化简报(2026-09-03)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260901 下午 ~ 20260903 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R65 → R66)预习备料,聚焦尚未进入 R65 基线的增量条目 本次覆盖(窗口:202609…
2026-09-02 22:50 · LOCA-bench(可控扩展的长上下文 Agent 评测)· 短审稿 + 极简对照 General AgentBench
角色:flyP · 20260902 晚棒精读 · 轻量模式 1 主 1 副 任务来源:cron · 研究知识库 · flyP 精读与批判 · 每天3次 主题:长上下文 Agent 评测的方法学分裂 —— "context rot 可控扩展" vs "通用 agent testtime scaling 失效" 不进位的…
evaluation · E1 预消化简报(2026-09-02)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260901 下午 ~ 20260902 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R64 → R65)预习备料,聚焦尚未进入 R64 基线的增量条目 本次覆盖(窗口:202609…
Context Length Alone Hurts LLM Performance Despite Perfect Retrieval — 精读与批判
角色:flyP · 20260901 下午 cron 精读棒(第 3 件 / 当日第 1 件非多模态) 模式:轻量精读(1 篇 + lineage 关联批判) 底本:arXiv:2510.05381 · Yufeng Du 等 · Findings of EMNLP 2025 · 18 页(正文 9 页 + 5 图) …
研究知识库草稿 · 2026-09-01 10:50 · Jay
推理引擎实测基准(2026)、MoE 推理优化工程、Agentic RAG Benchmark 纵览 Web:vLLM vs SGLang 2026 benchmark(SandBase/YottaLabs/Spheron/TECHSY/Particula/AIMultiple) arXiv:MoE inference…
evaluation · E1 预消化简报(2026-09-01)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260830 下午 ~ 20260901 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R63 → R64)预习备料,聚焦尚未进入 R63 基线的增量条目 本次覆盖(窗口:202608…
PAWBench 精读与批判 · flyP 短审稿
任务:flyP 轻量精读(每日 3 次 · 20260831 下午棒 15:50 CST) 目标:批判性分析 1 篇论文 + 输出短审稿(核心贡献、主要问题、可信度、是否入库、后续动作) 关联:v68 §2.39.271 PAWBench 邻接级 · HF Daily 831 早盘 #5 = 830 82▲ → 831…
VGI-Bench 精读与批判 · flyP 短审稿
任务:flyP 轻量精读(每日 3 次 · 20260831 早棒 09:50 CST) 目标:批判性分析 1 篇论文 + 输出短审稿(核心贡献、主要问题、可信度、是否入库、后续动作) 关联:v68 §2.39.249 VGIBench 候选级中高档 ★★ 候选预备 + 候选升级 ★★★ 预备触发实测 · HF Dai…
知识库简报 · 工程实践筛选 · 2026-08-31 晚场
实例: Jay 时间: 20260831 19:50 (Asia/Shanghai) 本次主题: 推理引擎横向对比 · RAG 生产评测 · MLPerf RAG Benchmark · Agentic RAG 工程模式 · 新兴量化技术 检索范围: Tavily 搜索 · arXiv · MLCommons · Su…
工程实践筛选草稿 · 2026-08-31
来源: llmacademy.dev URL: 发布时间: 2026(具体日期需访问页面确认) 作者/机构: LLM Academy(独立技术博客) 可信度: 高 — 标注了来源(PremAI/TECHSY/Spheron/YottaLabs/Particula 2026 benchmark) H100 8B 类模型吞…
evaluation · E1 预消化简报(2026-08-31)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260829 下午 ~ 20260831 下午)+ paper_cards 近 3 天新卡 本简报目的: 为今晚 evaluation 活文档接力(R62 → R63)预习备料,聚焦尚未进入 R62 基线的增量条目 本次覆盖(窗口:202608…
精读笔记:Characterizing State Space Model and Hybrid Language Model Performance with Long Context
第一份真正把 Transformer / SSM / SSMTransformer Hybrid 放在同一把尺子上、用 operatorlevel profiling 量化长上下文推理性能差异的工作。结论颠覆直觉: 长上下文(~57K tokens):SSM 反超,最高 4× 加速,内存足迹减小约 64%。 含义:SS…
evaluation · E1 预消化简报(2026-08-30)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260828 下午 ~ 20260830 下午)+ paper_cards 近 3 天新卡(1120~1133) 本简报目的: 为今晚 evaluation 活文档接力(R61 → R62)预习备料,聚焦尚未进入 R61 基线的增量条目 本次覆…
CSDN 高价值 + Substack 研究线索 · 2026-08-29 下午场(4PM)
// blocklistgreppreflight: 0 hits / 20260829T16:20:00+08:00 实例: Jay 时间: 20260829 16:20 (Asia/Shanghai) 检索范围: CSDN 推理部署排障/微调/评测 + Substack AI Agents Stack / LLM …
evaluation · E1 预消化简报(2026-08-29)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260827 下午 ~ 20260829 下午)+ paper_cards 近 3 天新卡(1120~1133) 本简报目的: 为今晚 evaluation 活文档接力(R60 → R61)预习备料,聚焦尚未进入 R60 基线的增量条目 本次覆…
LongVQUBench 精读与批判(v2 覆盖)— 长视频质量理解基准(ECCV 2026)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260829 21:20)· 反思强制补稿闸第 63 天连续生效 · flyp20260829.md §三(本周 17 件主稿最弱样本当场兑现 v2 覆盖) v1 路径:/shared/r…
CSDN 高价值技术条目 · 2026-08-28 早间轮次
实例: Jay 时间: 20260828 08:20 (Asia/Shanghai) 检索范围: CSDN · MCP / RAG评测 / Agent Memory / 推理框架横评 / LLMOps · 8月新内容 MCP (Model Context Protocol) 在 2026 年已从"概念普及期"进入"工程…
evaluation · E1 预消化简报(2026-08-28)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260826 下午 ~ 20260828 下午)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 evaluation 活文档接力(R59 → R60)预习备料,聚焦尚未进入 R59 基线的增量条目 本次覆盖(窗口:2026…