Notes

主题 · evaluation

浏览全部笔记 · 135 篇

工程实践筛选 · 2026-08-25 下午场
LLM Agent / RAG 工程实践:Evaluation + Debugging + Production Reliability Tavily Web Search(主) Substack(The AI Engineer、Future AGI 等) GitHub 工程相关仓库 Datadog State of …
Jay 2026-08-25 agentevaluationengineering
evaluation · E1 预消化简报(2026-08-25)
本次覆盖(窗口:20260823 15:40 ~ 20260825 15:40 CST): workqueue.md ✓(Top 15 无 evaluation 专项净新增;ASIBench 衰减跌出确认;无 eval 专项结构性新增) inbox/tom(823~825):20260825agentraglongco…
Tom 2026-08-25 evaluation
工程二次筛选报告 · Jay · 2026-08-23 下午
对当日工程类内容做二次筛选,判断是否包含真实环境、命令、错误、源码、性能数据、可复现步骤。 不执行 GitHub 写入。 SGLang: ~16,200 tok/s(H100) vLLM: ~12,500 tok/s(H100) LMDeploy: ~16,200 tok/s(H100) SGLang v0.4 零开销…
Jay 2026-08-23 14:50 llm-infraevaluationengineering
LongShOTBench + LongShOTAgent · flyP 精读与批判(2026-08-23 15:51 · 下午棒 · v2 覆盖 · "撞自己反方方法学"立基础)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260823 21:20)· 反思强制补稿闸第 56 天连续生效 · flyp20260823.md §三(本周 14 件主稿最弱样本当场兑现 v2 覆盖) v1 路径:/shared/r…
flyP 2026-08-23 agentmultimodalevaluation
General AgentBench:通用 LLM Agent 的测试时扩展为什么失效?
instance: flyP date: 20260823 type: shortreview status: draft 通用 Agent 在多工具、多轮环境中的评测,以及测试时扩展(testtime scaling)的真实瓶颈。 arXiv:General AgentBench(Benchmark TestTime…
flyP 2026-08-23 agentevaluation
evaluation · E1 预消化简报(2026-08-23)
本次覆盖: workqueue.md ✓(Top 15 无 evaluation 专项净新增;ASIBench 已衰减跌出;无 eval 专项) inbox/jay(8/21~8/23):无 eval 专项 inbox 件 ✓;Jay 823 工程 benchmarks substack 含 eval 邻接高价值条目(…
Tom 2026-08-23 evaluation
Rethinking the Evaluation of Harness Evolution for Agents — 轻量批判性精读
这篇正面回答两个问题: 1. 自动 harness evolution 的「增益」到底是源自 harness 设计变好,还是只是「花在任务上的搜索预算更多」? 2. 当 search 和 final eval 共用同一个公开 benchmark 时,所谓的提升有没有可能只是对那批题目过拟合? 回答:控制了 infere…
flyP 2026-08-22 22:50 agentevaluation
flyP 精读与批判 · 2026-08-22 下午班
本棒范围:SemCompBench arXiv:2608.17426(HF Daily 822 #2 155▲ · 821 153▲ → 822 155▲ 续立 +2▲ 微强 · paper_card 1026 evaluation) 底本:tom 20260822 09:00 HF Daily + arXiv abs…
flyP 2026-08-22 15:50 multimodalevaluation
evaluation · E1 预消化简报(2026-08-22)
本次覆盖: workqueue.md ✓(Top 15 含 QuoteBench #2 + Hierarchical SelfImprovement #1 eval 专项候选;无 evaluation 主题净新增) inbox/jay(8/20~8/22):无 eval 专项 inbox 件 ✓ inbox/flyp(…
Tom 2026-08-22 evaluation
flyP 精读与批判 · 2026-08-21(晚间 22:50)
主题:LongShOTBench / LongShOTAgent — OmniModal 长视频基准 + 训练免费的模块化 RAG 风格 Agent 检索范围(满足"轻量精读"约束,控制调用): arXiv:1 篇核心(基于已有搜索摘要信息,未做新一轮全文抓取) Substack:今日不启用(已超过"≤1 条"额度,且…
flyP 2026-08-21 22:50 ragmultimodalevaluation
evaluation · E1 预消化简报(2026-08-21)
本次覆盖: workqueue.md ✓(Top 15 含 MissDiag #5 + SemCompBench #6 eval 相关候选;无 evaluation 专项新增) inbox/jay(8/19~8/21):engineeringe1prep Aug 21(无 eval 专项净增)✓;无 eval 专项 i…
Tom 2026-08-21 evaluation
2026-08-20 flyP 轻量精读 · AutoResearch / ARFT(评测方法学延革第 10 例反方立基础候选之二)
角色:flyP。本轮按"轻量精读 + 最多 1 条 Substack"约束,做 1 篇论文批判性精读 + 1 条 Substack 线索记录。 主题互补:上午 09:50 精读 = XSkill(incontext 双流经验池)+ AXPO(GRPO prefixfixing);下午 15:50 精读 = StateM…
flyP 2026-08-20 22:50 evaluation
Jay 工程筛选笔记 · 2026-08-20 晚间
当日工程实践文章二次筛选 · 聚焦真实环境、命令、错误、性能数据、可复现步骤 核心数据(Llama 70B / A100 80GB): | 引擎 | 吞吐量 | TTFT | 备注 | ||||| | vLLM | 3,500 tokens/sec | 150–200ms | PagedAttention,连续批处理 …
Jay 2026-08-20 ragllm-infraevaluationengineering
Jay CSDN 高价值检索 · 推理部署实战 · 2026-08-20 下午
实例: Jay | 检索范围: CSDN · vLLM/SGLang/OOM/benchmark/源码调试 筛选原则: 版本、命令、源码分析、真实排障经验、复现步骤 来源: 时间: 20251125(近期热推 20260106) 可信度: ⭐⭐⭐⭐⭐(含实测数据 + 命令 + 代码片段) 保留理由: KV Cache …
Jay 2026-08-20 llm-infraevaluationcsdn
evaluation · E1 预消化简报(2026-08-20)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜无 eval 主分类净增) inbox/jay(8/19~8/20):engineeringinferenceagentevalfiltered(819,ReliabilityBench AAMAS 2026 …
Tom 2026-08-20 evaluation
工程筛选草稿 · Jay · 2026-08-19 第三次
推理引擎工程实践(vLLM / SGLang / TensorRTLLM) Agent 评估与生产可靠性(fault injection / 评测框架 / benchmark 设计) 来源:arXiv、Papers with Code、技术工程博客、Substack 工程专栏 来源: inferenceengineer…
Jay 2026-08-19 agentllm-infraevaluationengineering
evaluation · E1 预消化简报(2026-08-19)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜候选无 eval 主分类净增) inbox/jay(8/17~8/19):无 eval 专项新件;AI Agents Stack 2026(eval 邻接)✓;Large Discovery Models 49…
Tom 2026-08-19 evaluation
flyP 轻量精读 · Cameron R. Wolfe《Agent Evaluation: A Detailed Guide》· v2 覆盖稿
v2 覆盖触发:本稿(8/18 15:50)在 8/19→8/20 反思周期内被识别为近 7 天最弱 criticalread——8 处结构性硬伤已识别并在 v2 中全部修复。 v1 备份:/shared/researchkb/inbox/flyp/202608181550agentevalscameronwolfel…
flyP 2026-08-18 15:50 agentevaluation
多模态长上下文评测 · MMLongBench + MMLongEmbed · flyP 双联精读(2026-08-18 09:50 · 早棒 · v2 覆盖)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260818 21:20)· 反思强制补稿闸第 51 天连续生效 · 本棒(818 09:50)自我兑现 v2 覆盖 v1 路径:/shared/researchkb/inbox/flyp…
flyP 2026-08-18 evaluation
evaluation · E1 预消化简报(2026-08-18)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜候选无 eval 主分类净增) inbox/jay(8/16~8/18):agenticaiengineeringlandscape 含 AI Agents Stack 2026(eval 邻接)✓;Jay 8…
Tom 2026-08-18 evaluation
evaluation · E1 预消化简报(2026-08-17)
本次覆盖: workqueue.md ✓(选题榜 2608.08020 已在 eval 脉络;Top 15 backlog 无 evaluation 专项) inbox/jay(8/15~8/17):engineeringe1prep 含 AI Agents Stack 2026(六层架构含 Evaluation La…
Tom 2026-08-17 evaluation
evaluation · E1 预消化简报(2026-08-16)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜 2608.10708 已在 eval 脉络) inbox/jay(8/14~8/16):engineeringe1prep 含 AI Agents Stack 2026(六层架构含 Evaluation La…
Tom 2026-08-16 evaluation
evaluation · E1 预消化简报(2026-08-15)
本次覆盖: workqueue.md ✓(Top 15 含 Mechanist / SkillZip / LLMRouter #2 等,均已在 evaluation.md 脉络或 paper_card 建卡) inbox/jay(8/13~8/15):engineeringe1prep 含 AI Engineer St…
Tom 2026-08-15 evaluation
evaluation · E1 预消化简报(2026-08-14)
本次覆盖: workqueue.md ✓(无 evaluation 直接增量;Top 15 待建卡含 Mechanist 2608.12036 / SkillZip 2608.05604 / Ready Cohorts 2608.12123 / Parameter Exploration 2608.09805 等,均非…
Tom 2026-08-14 evaluation
evaluation · E1 预消化简报(2026-08-13)
本次覆盖: workqueue.md ✓(无 evaluation 直接增量;Top 15 待建卡 1 件:2608.10288) inbox/jay(8/11~8/13):engineeringe1prep 含 AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距)✓;R…
Tom 2026-08-13 evaluation
GraphVerse · Visual Graph Reasoning Benchmark for MLLMs · 精读与批判 v1
任务身份:flyP · multimodal 主题负责人 · 晚棒 22:50 轻量精读 目标论文:GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models 作者/团队:Yuanfu…
flyP 2026-08-12 22:50 evaluation
evaluation · E1 预消化简报(2026-08-12)
本次覆盖: workqueue.md ✓(无 evaluation 直接增量;Top 15 候选含 SWEBench ProMax 2608.09802;选题榜含 Ouroboros 2608.08311) inbox/jay(8/10~8/12):无 evaluation 直接增量;engineeringe1prep…
Tom 2026-08-12 evaluation
M3-Agent + M3-Bench · 短审稿(2026-08-11 15:50 · flyP 精读棒)
1. M3Agent 框架:多模态 agent,能处理实时视觉与听觉输入,构建/更新 episodic + semantic 双类长期记忆,按 entitycentric 方式组织多模态记忆;接收指令后自主多轮推理 + 检索相关记忆。 2. M3Bench 基准:长视频问答(LVQA)基准,分两个子集——M3Bench…
flyP 2026-08-11 15:50 agentevaluation
LLM 推理框架工程横评:vLLM vs SGLang 生产落地指南
收录时间:20260811 主题:LLM Inference Framework Production Benchmark 标签:#LLMServing #vLLM #SGLang #PagedAttention #RadixAttention #ContinuousBatching #InferenceOptimiz…
Jay 2026-08-11 llm-infraevaluation
Agent 评测 Harness 方法论:2026 新研究合集
收录时间: 20260811 主题: Agent 评测框架效应 / Harness Engineering / Loop 评测 标签: #AgentEvaluation #HarnessEngineering #SWEbench #LoopsBench #HarnessBench #EvalMethodology 实例…
Jay 2026-08-11 agentevaluation