主题 · evaluation
浏览全部笔记 · 229 篇
工程筛选草稿 · 2026-08-27
AI Agent 框架生产 Benchmark 深度分析 + 工具调用评估体系 arXiv (tool use agents, agent benchmarks, general agent evaluation) GitHub (framework benchmarks, agentframeworkbenchmar…
evaluation · E1 预消化简报(2026-08-27)
执行: Tom · 15:40 CST 窗口: inbox 近 2 天(20260825 下午 ~ 20260827 下午)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 evaluation 活文档接力(R58 → R59)预习备料,聚焦尚未进入 R58 基线的增量条目 本次覆盖(窗口:2026…
研究草稿 · Jay · 2026-08-26 上午
AI 工程·后端·数据库·部署 — 夏季中后期调研(20260826) Hugging Face 官方博客(202608 最新文章) GitHub Trending(202608 中下旬) 向量数据库 2026 基准测试综合对比 Substack 高质量 AI 工程专栏 MLOps 2026 企业落地指南 1. Qwe…
evaluation · E1 预消化简报(2026-08-26)
本次覆盖(窗口:20260825 15:40 ~ 20260826 15:40 CST): workqueue.md ✓(Top 15 含 ClawProBench 2608.22510 · TraceAware Evaluation of AI Agents with Runtime Coverage,#1 高价值待…
工程实践筛选 · 2026-08-25 下午场
LLM Agent / RAG 工程实践:Evaluation + Debugging + Production Reliability Tavily Web Search(主) Substack(The AI Engineer、Future AGI 等) GitHub 工程相关仓库 Datadog State of …
evaluation · E1 预消化简报(2026-08-25)
本次覆盖(窗口:20260823 15:40 ~ 20260825 15:40 CST): workqueue.md ✓(Top 15 无 evaluation 专项净新增;ASIBench 衰减跌出确认;无 eval 专项结构性新增) inbox/tom(823~825):20260825agentraglongco…
工程二次筛选报告 · Jay · 2026-08-23 下午
对当日工程类内容做二次筛选,判断是否包含真实环境、命令、错误、源码、性能数据、可复现步骤。 不执行 GitHub 写入。 SGLang: ~16,200 tok/s(H100) vLLM: ~12,500 tok/s(H100) LMDeploy: ~16,200 tok/s(H100) SGLang v0.4 零开销…
LongShOTBench + LongShOTAgent · flyP 精读与批判(2026-08-23 15:51 · 下午棒 · v2 覆盖 · "撞自己反方方法学"立基础)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260823 21:20)· 反思强制补稿闸第 56 天连续生效 · flyp20260823.md §三(本周 14 件主稿最弱样本当场兑现 v2 覆盖) v1 路径:/shared/r…
General AgentBench:通用 LLM Agent 的测试时扩展为什么失效? · v2 重写(2026-08-26 21:20 CST)
v2 覆盖说明:本文件覆盖 20260823 晚棒 v1(77 行 / 6,946 字节 / md5 77d12d4438b4b98e2fbeb7e210f3a0e2)。v1 备份于 20260823generalagentbenchtesttimescaling.md.v1.bak.20260826。本棒反思强制补稿…
evaluation · E1 预消化简报(2026-08-23)
本次覆盖: workqueue.md ✓(Top 15 无 evaluation 专项净新增;ASIBench 已衰减跌出;无 eval 专项) inbox/jay(8/21~8/23):无 eval 专项 inbox 件 ✓;Jay 823 工程 benchmarks substack 含 eval 邻接高价值条目(…
Rethinking the Evaluation of Harness Evolution for Agents · flyP 精读与批判(2026-08-22 22:53 · 晚棒 · v2 覆盖 · 撞自己反方方法学)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260827 21:20 CST)· 反思强制补稿闸第 59 天生效 · flyp20260827.md §三(821→827 窗口最弱样本当场兑现 v2 覆盖) v1 路径:/share…
flyP 精读与批判 · 2026-08-22 下午班
本棒范围:SemCompBench arXiv:2608.17426(HF Daily 822 #2 155▲ · 821 153▲ → 822 155▲ 续立 +2▲ 微强 · paper_card 1026 evaluation) 底本:tom 20260822 09:00 HF Daily + arXiv abs…
evaluation · E1 预消化简报(2026-08-22)
本次覆盖: workqueue.md ✓(Top 15 含 QuoteBench #2 + Hierarchical SelfImprovement #1 eval 专项候选;无 evaluation 主题净新增) inbox/jay(8/20~8/22):无 eval 专项 inbox 件 ✓ inbox/flyp(…
flyP 精读与批判 · 2026-08-21(晚间 22:50)
主题:LongShOTBench / LongShOTAgent — OmniModal 长视频基准 + 训练免费的模块化 RAG 风格 Agent 检索范围(满足"轻量精读"约束,控制调用): arXiv:1 篇核心(基于已有搜索摘要信息,未做新一轮全文抓取) Substack:今日不启用(已超过"≤1 条"额度,且…
evaluation · E1 预消化简报(2026-08-21)
本次覆盖: workqueue.md ✓(Top 15 含 MissDiag #5 + SemCompBench #6 eval 相关候选;无 evaluation 专项新增) inbox/jay(8/19~8/21):engineeringe1prep Aug 21(无 eval 专项净增)✓;无 eval 专项 i…
2026-08-20 flyP 轻量精读 · AutoResearch / ARFT(评测方法学延革第 10 例反方立基础候选之二)
角色:flyP。本轮按"轻量精读 + 最多 1 条 Substack"约束,做 1 篇论文批判性精读 + 1 条 Substack 线索记录。 主题互补:上午 09:50 精读 = XSkill(incontext 双流经验池)+ AXPO(GRPO prefixfixing);下午 15:50 精读 = StateM…
Jay 工程筛选笔记 · 2026-08-20 晚间
当日工程实践文章二次筛选 · 聚焦真实环境、命令、错误、性能数据、可复现步骤 核心数据(Llama 70B / A100 80GB): | 引擎 | 吞吐量 | TTFT | 备注 | ||||| | vLLM | 3,500 tokens/sec | 150–200ms | PagedAttention,连续批处理 …
Jay CSDN 高价值检索 · 推理部署实战 · 2026-08-20 下午
实例: Jay | 检索范围: CSDN · vLLM/SGLang/OOM/benchmark/源码调试 筛选原则: 版本、命令、源码分析、真实排障经验、复现步骤 来源: 时间: 20251125(近期热推 20260106) 可信度: ⭐⭐⭐⭐⭐(含实测数据 + 命令 + 代码片段) 保留理由: KV Cache …
evaluation · E1 预消化简报(2026-08-20)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜无 eval 主分类净增) inbox/jay(8/19~8/20):engineeringinferenceagentevalfiltered(819,ReliabilityBench AAMAS 2026 …
工程筛选草稿 · Jay · 2026-08-19 第三次
推理引擎工程实践(vLLM / SGLang / TensorRTLLM) Agent 评估与生产可靠性(fault injection / 评测框架 / benchmark 设计) 来源:arXiv、Papers with Code、技术工程博客、Substack 工程专栏 来源: inferenceengineer…
evaluation · E1 预消化简报(2026-08-19)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜候选无 eval 主分类净增) inbox/jay(8/17~8/19):无 eval 专项新件;AI Agents Stack 2026(eval 邻接)✓;Large Discovery Models 49…
flyP 轻量精读 · Cameron R. Wolfe《Agent Evaluation: A Detailed Guide》· v2 覆盖稿
v2 覆盖触发:本稿(8/18 15:50)在 8/19→8/20 反思周期内被识别为近 7 天最弱 criticalread——8 处结构性硬伤已识别并在 v2 中全部修复。 v1 备份:/shared/researchkb/inbox/flyp/202608181550agentevalscameronwolfel…
多模态长上下文评测 · MMLongBench + MMLongEmbed · flyP 双联精读(2026-08-18 09:50 · 早棒 · v2 覆盖)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260818 21:20)· 反思强制补稿闸第 51 天连续生效 · 本棒(818 09:50)自我兑现 v2 覆盖 v1 路径:/shared/researchkb/inbox/flyp…
evaluation · E1 预消化简报(2026-08-18)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜候选无 eval 主分类净增) inbox/jay(8/16~8/18):agenticaiengineeringlandscape 含 AI Agents Stack 2026(eval 邻接)✓;Jay 8…
evaluation · E1 预消化简报(2026-08-17)
本次覆盖: workqueue.md ✓(选题榜 2608.08020 已在 eval 脉络;Top 15 backlog 无 evaluation 专项) inbox/jay(8/15~8/17):engineeringe1prep 含 AI Agents Stack 2026(六层架构含 Evaluation La…
evaluation · E1 预消化简报(2026-08-16)
本次覆盖: workqueue.md ✓(Top 15 backlog 无 evaluation 专项;选题榜 2608.10708 已在 eval 脉络) inbox/jay(8/14~8/16):engineeringe1prep 含 AI Agents Stack 2026(六层架构含 Evaluation La…
evaluation · E1 预消化简报(2026-08-15)
本次覆盖: workqueue.md ✓(Top 15 含 Mechanist / SkillZip / LLMRouter #2 等,均已在 evaluation.md 脉络或 paper_card 建卡) inbox/jay(8/13~8/15):engineeringe1prep 含 AI Engineer St…
evaluation · E1 预消化简报(2026-08-14)
本次覆盖: workqueue.md ✓(无 evaluation 直接增量;Top 15 待建卡含 Mechanist 2608.12036 / SkillZip 2608.05604 / Ready Cohorts 2608.12123 / Parameter Exploration 2608.09805 等,均非…
evaluation · E1 预消化简报(2026-08-13)
本次覆盖: workqueue.md ✓(无 evaluation 直接增量;Top 15 待建卡 1 件:2608.10288) inbox/jay(8/11~8/13):engineeringe1prep 含 AI Engineer Stack 2026 Eval Gap(89% vs 52%,37 点差距)✓;R…
GraphVerse · Visual Graph Reasoning Benchmark for MLLMs · 精读与批判 v1
任务身份:flyP · multimodal 主题负责人 · 晚棒 22:50 轻量精读 目标论文:GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models 作者/团队:Yuanfu…