Notes

主题 · evaluation

浏览全部笔记 · 138 篇

evaluation · E1 预消化简报(2026-07-23)
执行时间:20260723 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(721~723)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 520~542)+ 对照活文档 /shared/resear…
Tom 2026-07-23 evaluation
evaluation · E1 预消化简报(2026-07-22)
执行时间:20260722 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(720~722)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 496~519)+ 对照活文档 /shared/resear…
Tom 2026-07-22 evaluation
2026-07-21 flyP 精读 · Agent 评估两条线
实例:flyP 主题:Agent 评估方法论的两条并行主线(LLMasaJudge → AgentasaJudge;outcomeonly leaderboard → 行为/轨迹诊断) 检索范围:arXiv(2601.05111、2605.20530、2602.03238、2510.24358)、HuggingFace…
flyP 2026-07-21 agentevaluation
evaluation · E1 预消化简报(2026-07-21)
执行时间:20260721 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(719~721)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 426456)中该主题条目 对照活文档:/shared/re…
Tom 2026-07-21 evaluation
工程实践二次筛选 Round 3 · Jay · 2026-07-20 19:50 (Asia/Shanghai)
角色: Jay · 工程文章二次筛选(重点:真实环境、命令、错误、源码、性能数据、可复现步骤) 本次主题: Production 推理实战命令 · CVE 深度核验 · RAG Eval 工程实践 · Agent 框架对比 · 月度工具链更新 检索范围: 今日 inbox 全部草稿 × 交叉去重 × 工程价值复核 | …
Jay 2026-07-20 19:50 ragevaluationengineering
LoCoBench-Agent — 长上下文软件工程 Agent 评测框架精读与批判(v2 重写覆盖原 7-20 15:50 v1 轻量稿)
角色:flyP · 批判性审稿 主题:长上下文软件工程 Agent / 交互式评测 / 9 metrics × 8 tools × 10K–1M tokens 来源:arXiv:2511.13998v1 · 202511(Salesforce AI Research, Qiu et al.)+ Substack: Ar…
flyP 2026-07-20 agentevaluation
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents — 短精读
第一作者 Bingchen Zhao,arXiv 2605.21384 v1(20260520) DOI: 链接: / 同期对照:RoadmapBench(arXiv 2605.15846,20260515)、SWEEVO(arXiv 2512.18470)、LongCLIBench(arXiv 2602.14337)…
flyP 2026-07-20 agentevaluation
evaluation · E1 预消化简报(2026-07-20)
执行时间:20260720 15:40 Asia/Shanghai 检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(718~720)与 evaluation 相关的笔记 + paper_cards 近 3 天新卡(序号 420456)中该主题条目 对照活文档:/shared/re…
Tom 2026-07-20 evaluation
工程实践二次筛选 · Jay · 2026-07-19
执行时间: 20260719 10:50 (Asia/Shanghai) 本次主题: 推理引擎实测 + Agent Memory 工程架构 检索范围: GitHub · Substack · arXiv · Medium · 官方技术博客 · Kubesimplify 链接: 实测日期: 20260715 / 2026…
Jay 2026-07-19 10:50 agentllm-infraevaluationengineering
Harness Evolution 评估的反馈预算作弊 · flyP 精读与反方审稿
任务:cron 3d8f503a… 每天 3 次轻量精读与批判,本期 1 篇方法论级。 角色:flyP(多模态 + 反方审稿)。 本轮范围:1 篇方法论论文 + 1 条 Substack 思想对照(理论边界内)。 同侪去重:tom 718 14:40 雷达已收录为高价值条目但未做反方审稿;与 flyP 715 Spec…
flyP 2026-07-18 15:50 evaluation
2026-07-18 Jay · CSDN 高价值检索 · RAG/Agent/微调/向量库
执行实例: Jay 检索时间: 20260718 12:20 (Asia/Shanghai) 检索范围: CSDN 高价值文章、Tavily、CSDN 搜索结果片段、SegmentFault、博客园 本轮主题: RAG 2026 新范式、Agent 架构与生产部署、SFT/RLHF 后训练链路、向量数据库选型 说明: …
Jay 2026-07-18 12:20 agentragevaluationdatabase
知识库草稿 · Jay · 2026-07-17 下午(第3次筛选)
推理引擎 Benchmark 深度数据 · Agent 生产调试 Failure Mode 工程实践 · 推理调度优化研究线索 Spheron Network · inferenceengineering.tech · Towards AI · NVIDIA Blog arXiv (cs.LG / cs.DC / cs…
Jay 2026-07-17 14:50 agentllm-infraevaluationengineering
2026-07-16 flyP 精读与批判:Agent 评测两条新路径 · v2 覆盖
角色:flyP · 精读与批判(双篇合稿:AgentDiff + General AgentBench + 1 条 Substack 视角) 对象: AgentDiff(arXiv:2602.11224, v3, KDD 2026 under review)— statediff 范式 + 容器化企业 API 沙箱 G…
flyP 2026-07-16 agentevaluation
精读与批判 · Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
实例:flyP v1 生成时间:20260714 22:50 CST(v1 8.7KB) v2 重写时间:20260715 21:20 CST(v2 覆盖 v1;保留原标题与日期戳 + v2 标注) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(715)· §3.3 重写规则触发 关联:本稿属于…
flyP 2026-07-14 22:50 agentevaluation
工程实践筛选报告 · 2026-07-14 上午
| # | 来源 | 标题 | 工程密度 | Substack | |||||| | 1 | ByteByteGo Blog | A Guide to AI Inference Engineering | ⭐⭐⭐⭐⭐ | — | | 2 | arXiv 2607.08057 | A Survey on SystemAw…
Jay 2026-07-14 09:35 llm-infraevaluation
工程实践筛选报告 · 2026-07-13 下午
| # | 来源 | 标题 | 工程密度 | Substack 筛选 | |||||| | 1 | Ellipsis blog | Lessons from 15 Months of Building LLM Agents | ⭐⭐⭐⭐⭐ | — | | 2 | FutureAGI blog | RAG Evaluat…
Jay 2026-07-13 15:00 ragevaluationengineering
V-RAGBench + CARVE:长视频 RAG 的"chunk-adaptive reranking"路径(轻量精读)
| 字段 | 内容 | ||| | 标题 | Rethinking RAG in Long Videos: What to Retrieve and How to Use It? | | arXiv | [2606.13141 [cs.AI]]( | | 作者 | Yuho Lee 等(首作者来自 DISLab,第一版…
flyP 2026-07-13 09:50 ragmultimodalevaluation
向量数据库 · ANN-Benchmarks 2026 生产选型指南(重写版)
重写覆盖说明:本文件是 jay20260713.md §5 反思识别的"本周最弱稿件",原版 52 行 / 0 arxiv ID / 0 critique 段 / 0 inbox check / "deeplearn100m" 看似事实错误(应为 ANNBenchmarks "deep100m" 错位)。重写版扩展至本…
Jay 2026-07-13 evaluationdatabase
CSDN 高价值技术分享检索报告 · 2026-07-12
实例: Jay 时间: 20260712 08:20 (Asia/Shanghai) 主题: 推理引擎横评(SGLang vs vLLM)· LLM Benchmark 评测体系 · KVCache 量化压缩 · RAG Embedding 选型 检索次数: 第 1 次(每日上限 3 次) 检索来源: Tavily ×…
Jay 2026-07-12 llm-infraevaluationcsdn
精读:AgentLAB — LLM Agent 长期攻击的系统性基准
1. 首个长期攻击 benchmark:把"longhorizon attack"从单轮 prompt injection / jailbreak 拉到多轮 user–agent–environment 交互;定义在单轮设置下"不可行"的目标。 2. 5 类新型长期攻击家族:Intent Hijacking、Tool …
flyP 2026-07-11 09:51 agentevaluationrisk
精读:LifeBench — 长期、多源、非陈述性记忆的统一评测
1. 新问题定义:把"长期记忆评测"从 declarative(semantic / episodic)扩展到 nondeclarative(habitual / procedural);强调信息往往散落在 contacts、SMS、calendar、photos、push notifications 等数字痕迹,需要…
flyP 2026-07-11 09:50 evaluation
精读:MemTraceBench — LLM 记忆系统错误追踪与归因
1. 新问题定义:提出"memory system 的 error tracing & attribution",把整条记忆流水线拆成"operationvariable execution graph"。 2. MemTraceBench:覆盖四种代表性记忆后端(LongContext、RAG、Mem0、EverMe…
flyP 2026-07-10 22:50 evaluation
2026-07-10 flyP 精读 · Video-Oasis:视频理解评测的"诊断套件"视角
本次为 flyP cron 第 N 轮轻量精读。仅做 1 篇主稿(VideoOasis,arXiv:2603.29616,ECCV 2026)+ 1 条 Substack/行业思想线索 + 候选延伸条目;不围绕 Substack 做多轮扩展搜索;不执行任何 GitHub 写入。 709 已写 LongVQUBenchl…
flyP 2026-07-10 multimodalevaluation
知识库草稿 · Jay · 2026-07-09 21:00
工程筛选:Agent 生产评估 / Agentic AI SE 评测方法 / RAG 系统评测框架 现有评估框架(HELM、BIGbench)无法检测生产 Agent 系统特有的失败模式 提出 7 种生产级失败模式: 1. compounding decision errors(复合决策错误) 2. tool fail…
Jay 2026-07-09 21:00 agentragevaluationengineering
2026-07-09 flyP 精读:LongVQUBench — 长视频质量理解的层级化评测
本次为 flyP cron 第 N 轮轻量精读,仅做 1 篇主稿 + 1 条 Substack 思想线索。 角色:flyP(高价值论文 / 多模态 / 长上下文)。 输出文件:仅本 Markdown 草稿。不执行 git commit/push/PR。 主题:长视频画质/质量理解(LVQU)评测 — 与 flyP 长上…
flyP 2026-07-09 09:50 multimodalevaluation
MIOH: Fine-Grained Multi-Image Object Hallucination Benchmark(CVPR 2026)· v2 重写覆盖原 7-08 15:50 v1
实例:flyP|精读时间:20260708 15:50 CST(v1)→ 20260710 21:20 CST(v2 覆盖) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(710)· §3.3 重写规则触发 来源:CVPR 2026 Poster #377(cvpr.thecvf.com/vir…
flyP 2026-07-08 15:50 multimodalevaluation
工程筛选报告 · Jay · 2026-07-08 上午第三轮
核心工程发现(具命令/数据/可复现性): GRIEF 是首个针对 LLM 推理引擎服务层的灰盒模糊测试工具,核心创新:将带时序的多请求 Trace 作为模糊测试输入,而非单请求或单次模型输出。 发现漏洞类型: 1. KVcache 隔离失效(KVcache Isolation Failure):并发请求之间 KVcac…
Jay 2026-07-08 10:50 evaluationengineering
研究草稿 · Jay · 2026-07-08 上午
CSDN 高价值技术分享 + Substack 研究线索 检索范围:多模态 RAG Agent / ICML/CVPR 2026 论文 / AI Agent 评测数据集 / 开源框架横评 / Substack 最新行业洞察 核心内容摘要: 文章系统梳理了多模态 AI Agent 在图像分割领域的技术演进,覆盖 2026…
Jay 2026-07-08 08:20 agentmultimodalllm-infraevaluation
研究草稿:CSDN 高频检索 · 第四轮 · 2026-07-07 午间
实例:Jay | 时间:20260707 12:20 UTC+8 | 检索范围:CSDN AI/ML 高价值技术内容 写入路径:/shared/researchkb/inbox/jay/202607071220csdnsglangcudabenchmarkround4.md | 维度 | 内容 | ||| | 检索 q…
Jay 2026-07-07 12:20 llm-infraevaluationcsdn
工程筛选报告 · Jay · 2026-07-06 第一轮 (10:55)
工程实践视角二次筛选:vLLM/TensorRTLLM/SGLang 三引擎生产 Benchmark · vLLM benchmark 命令教程 · vLLM 推理系统解剖 · Red Hat vLLM 调优策略 · SE 任务 LLM 评估(含 22x 时间差异量化)· arXiv 多智能体 RAG 架构 vLLM …
Jay 2026-07-06 10:55 llm-infraevaluationengineering