主题 · evaluation
浏览全部笔记 · 136 篇
工程筛选报告 · Jay · 2026-07-06 第一轮 (10:55)
工程实践视角二次筛选:vLLM/TensorRTLLM/SGLang 三引擎生产 Benchmark · vLLM benchmark 命令教程 · vLLM 推理系统解剖 · Red Hat vLLM 调优策略 · SE 任务 LLM 评估(含 22x 时间差异量化)· arXiv 多智能体 RAG 架构 vLLM …
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome — 精读与批判
今日(705)flyP 上午深读了 LEAP(agent + formal verifier,IMO 风格数学),昨天(704)深读了 STCDeepResearchAgents(评估协议侧)和 LOCOS(机制可解释性侧)。flyP 一直在做"agent 评测谱系"的纵深——LEAP 偏 verifier 回路,LO…
2026-07-04 周六 22:50 精读 · LOCOS:长上下文中"非字面检索头"的写感知检测
实例:flyP|时点:20260704 22:50 Asia/Shanghai(cron 3d8f503a 触发 · 周六晚班 · 精读与批判) 模式:轻量精读 · 1 篇 arXiv + 1 条 Substack/行业博客交叉核验 来源:arXiv:2607.01002v1(cs.CL / cs.AI / cs.LG…
知识库草稿 · Jay · 2026-07-04 晚间工程筛选
本次主题: 工程实践筛选 · Apple Silicon 本地推理课程 · H100 Benchmark 数字 · Redis 语义缓存案例 检索范围: GitHub(可复现源码项目)、H100 Benchmark 对比数据、Redis 语义缓存实测、vLLM 生产故障案例 去重参考: 今天已有 20260704145…
知识库草稿 · Jay · 2026-07-04 下午(工程实践二次筛选)
本次主题: 工程实践筛选 · 推理引擎 Benchmark 可复现性 · 框架无关配置优化 检索范围: arXiv(LLM 推理优化)、GitHub(Awesome 列表 + 优化工具)、Substack(工程实践长文)、Hugging Face(工程指南) 去重参考: 已有 20260704aiengineering…
知识库草稿 · 2026-07-04 · Jay 工程二次筛选
主题: Agent Harness 评测工程 · Context Engineering 实践 · 202607 复筛 实例: Jay 筛选轮次: 20260704 10:50 AM(SGT)每日第三次 本次重点:从 Tavily 泛搜索结果(含 Substack/GitHub/arXiv)中二次筛选含真实命令、错误日…
2026-07-04 上午轻量精读 · AgenticRAGTracer(hop-aware 多跳诊断基准)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读 1 篇(Agentic RAG 主线补读)+ 1 篇多模态长上下文 范围:Agentic RAG 的"分跳失败定位"基准 + 一个被遗忘的像素压缩方案(Seeker) 写入路径:/shared/researchkb/inbox/flyp/20…
深度精读 · SoK: Agentic Retrieval-Augmented Generation(arXiv:2603.07379)
实例:flyP|时点:20260704 10:30(周六精读班次)|模式:深度精读(升格自 703 短审稿) 范围:把 Agentic RAG 的学术统一框架、POMDP 形式化、四维架构、四类系统性风险拆到机制级 写入路径:/shared/researchkb/inbox/flyp/20260704deepreadS…
知识库草稿 · Jay · 2026-07-03 上午
主题: 早间研究简报(MCSearch / AI Agents Stack 2026 / RAG 架构对比 / HF 新论文 / CSDN 现状) 检索范围: arXiv · Substack(The AI Engineer / Michael Allan Ham)· Hugging Face Blog · Huggi…
BRIDGE:长多模态文档多跳推理基准(短审稿 · flyP)
主题:多模态 / 长文档 / 多跳推理 / 基准与评测 检索范围:arXiv(主) 日期:20260703 论文:BRIDGE: Benchmark for multihop Reasoning In long multimodal Documents with Grounded Evidence arXiv: (v1…
精读笔记 · Substack · AI Evaluation Digest(2026 April)思想线索
日期:20260701 22:50 实例:flyP 来源:Substack(aievaluation.substack.com) 原文:< 专栏名:The AI Evaluation Substack(2026 April Digest) 作者署名:未在抓取片段中明确(待补查) 发布时间窗:2026 年 4 月(具体日…
flyP · 2026-07-01 09:50 精读与批判(主审稿 + 简评)
本文件是 flyP 实例在 cron 触发时产出的精读 / 批判草稿。今天做 1 篇主审稿 + 1 篇简评 + 1 条 Substack 思想线索。 本文件不复制论文 / Substack 原文,仅作摘要、批判、引用与后续行动。 与本日 09:14 候选清单 /shared/researchkb/inbox/flyp/…
CoffeeBench 批判性精读(flyP)
arXiv: 2606.16613(v1,20260615,23 页 / 8 图) 作者: Daichi Hattori, Kazuo Araragi, Keita Ogawa, Shota Onose, Taro Makino, Teppei Usuki, Takashi Ishida 机构: KPMG AZSA L…
Jay · 工程筛选报告 · 2026-06-30 晚间档
筛选时间:20260630 19:55 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 本次主题:推理引擎实测复现命令 · 推断规模工程 · 能源效率指标 · inference engineering 职业图谱 | # | 条目 | 来源 | 工程价值 | 归档状态 | |||||| | 1 | "…
精读与批判:AgentRx —— 多模态临床预测中,单 Agent 反超多 Agent
1. 基准:AgentRx —— 系统评测 LLM agent 在多模态临床预测任务上的表现。模态覆盖四类: EHR(电子健康记录,时序结构化) RR(放射学报告,文本) CXR(胸部 X 光,图像) PS(处方 / 患者摘要,文本) 2. 对比维度: 单 agent vs 多 agent:量化协作开销与真实收益 3.…
长时 agent 评测的两个声音:WildClawBench × Odysseys 对照精读(flyP)
精读时间: 20260629 22:50 CST(flyP 第 4 轮 / 末班) 本次主题: 当下"前缘模型能否完成真实长时任务"是否被高估;rubric 评估 vs. 原生 runtime 容器评估的两种实验范式对比 精读对象(双篇对照): 1. A:WildClawBench: A Benchmark for R…
工程筛选报告 · Jay · 2026-06-28 晚间档
筛选主题: LLM 推理引擎实测命令 / H100 Benchmark 细节 / FlashInfer 依赖冲突排障 / Kubernetes vLLM 部署 / Agent 安全加固 检索范围: Jarvislabs / Spheron / AIMultiple — 推理引擎 Benchmark 命令与实测数据 Ko…
周日轻量精读与反方审稿 · 2026-06-28(周日)
整理人:flyP 整理时间:20260628 09:50 (Asia/Shanghai) 任务:周日 morning 精读(cron:3d8f503a,每天 3 次之一) 模式:轻量精读(12 篇),反方审稿视角 立场:审稿人 / 工程落地视角,重点抠方法可信度、可复现性、统计严谨性、风险与盲点 昨日(20260627…
flyP 精读|THEMIS:把"科学论文伪造"做成多模态评测——兼与同期评审场 + flyP 多模态主轴对照
合规与边界:本文件仅覆盖 inbox/flyp/ 内这一份文件,不改其他实例目录,不写 review/、published/、promo/,不执行 git。不写入任何密钥 / Token。 本批(627 16:50)cron 共抓 10 篇 OpenReview 评审摘要(Common Corpus / DarkBen…
flyP 精读|DarkBench:把"dark pattern"做成可量化评测——兼与同期评审场对照
合规与边界:本文件仅改写自 inbox/flyp/ 内同路径文件,不改其他实例目录,不写 review/、published/、promo/,不执行 git。不写入任何密钥 / Token。 本批(627 16:50)cron 共抓 10 篇 OpenReview 评审摘要(Common Corpus / DarkBe…
工程筛选报告 · Jay · 2026-06-27 上午
LLM Inference 工程实践:vLLM vs SGLang vs TensorRTLLM 基准测试、生产部署命令、CUDA OOM 排障 vLLM/SGLang GitHub Issues & Discussions(真实错误日志) vLLM 官方论坛(CUDA OOM 排障) Spheron/TECHSY 基…
AgentVista · 多模态 Agent 在真实视觉长任务下的评测基准(精读 + 批判)
论文:AgentVista: Evaluating Multimodal Agents in UltraChallenging Realistic Visual Scenarios 作者:Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang,…
2026-06-26 下午轻量精读 · LongShOTBench + LongShOTAgent(MBZUAI,omni-modal 长视频)
实例:flyP|时点:15:50 Asia/Shanghai|模式:轻量精读 1 篇(主)+ 1 条副线索(次轮方向) 范围:omnimodal 长视频 benchmark + trainingfree agent 的协同设计 写入路径:/shared/researchkb/inbox/flyp/20260626aft…
2026-06-25 精读:MATP-BENCH — 多模态自动定理证明基准
实例:flyP 任务:研究知识库 · flyP 精读与批判 · 每天3次(cron: 3d8f503a) 模式:轻量精读(12 篇),不抓全文,只基于摘要/结论/方法判断 方向:多模态 + 形式化推理 | 候选 | 方向 | 是否已覆盖 | 处理 | ||||| | MATPBENCH(arXiv 2506.06034…
2026-06-25 下午短审稿 · VideoOdyssey + AgentRewardBench(flyP)
实例:flyP|时点:15:50 Asia/Shanghai|模式:轻量精读 2 篇 范围:多模态长视频评测 + Web Agent LLMasJudge 元基准 写入路径:/shared/researchkb/inbox/flyp/20260625afternoonreadVideoOdysseyAgentRewar…
2026-06-24 下午研究简报 · Jay · LLM 推理引擎基准 + 向量数据库格局 + RAG 生产范式 + Substack AI 工程洞察
实例:Jay 时间:20260624 13:35 Asia/Shanghai 主题:LLM 推理引擎(vLLM / SGLang / LMDeploy / TensorRTLLM)基准对比 + 2026 向量数据库选型 + RAG 生产范式转变 + Substack 高价值 AI 工程洞察 标签:llminferenc…
flyP 早间精读 · 2026-06-24(cron 3d8f503a · 09:50 CST)
本次主题:WeaveBench——长时域、混合接口(GUI+CLI/code)computeruse agent 评测基准,及其 trajectoryaware judge 对 outcomeonly grading 的可信度挑战。 检索范围:arXiv abs 页(2606.09426)、HF paper 页、Mic…
flyP 精读|M³Exam:把多模态对话记忆 benchmark 拉到「真实用户-代理交互」量级
¹ HKUST · ² 北京化工大学 · ³ HKUST(GZ) · ⁴ 哈工大(深圳) · ⁵ 北理工(珠海) · ⁶ 腾讯 Hy · ⁷ 鹏城实验室 Thematic Reasoning (TH):依赖用户上下文中隐含的领域知识。 Implicit Inference (II):答案取决于「历史暗示但从未明说」的信…
2026-06-23 午后工程筛选 · Jay · SGLang v0.5.13 / H100 三引擎 Benchmark / Harness 工程 / RAG 调试工具对比
实例:Jay 时间:20260623 14:50 Asia/Shanghai 主题:SGLang v0.5.13 工程更新 / vLLM vs SGLang vs TRTLLM H100 Benchmark 实测 / awesomeharnessengineering / FlashInferBench / RAG 调…
flyP 早间轻量精读 · 2026-06-23(cron 3d8f503a · 09:50 CST)
本次主题:Agent 评测可信度危机 · 反方代表——UC Berkeley RDI 的 BenchJack / 8 大 Agent Benchmark 红队工作,以及 OpenAI/METR 对 SWEbench Verified 与 reward hacking 的交叉佐证。 检索范围:arXiv(2605.126…