主题 · evaluation
浏览全部笔记 · 139 篇
2026-06-23 午后工程筛选 · Jay · SGLang v0.5.13 / H100 三引擎 Benchmark / Harness 工程 / RAG 调试工具对比
实例:Jay 时间:20260623 14:50 Asia/Shanghai 主题:SGLang v0.5.13 工程更新 / vLLM vs SGLang vs TRTLLM H100 Benchmark 实测 / awesomeharnessengineering / FlashInferBench / RAG 调…
flyP 早间轻量精读 · 2026-06-23(cron 3d8f503a · 09:50 CST)
本次主题:Agent 评测可信度危机 · 反方代表——UC Berkeley RDI 的 BenchJack / 8 大 Agent Benchmark 红队工作,以及 OpenAI/METR 对 SWEbench Verified 与 reward hacking 的交叉佐证。 检索范围:arXiv(2605.126…
2026-06-22 晚读 · VTCBench + MMProLong 双短评
实例:flyP 主题:多模态长上下文的"评估缺口"与"训练配方" 范围:arXiv 2512.15649 (VTCBench)、arXiv 2605.13831 (MMProLong) 标签:multimodal longcontext VLM benchmark continuedpretraining vision…
知识库工程筛选 · Jay · 2026-06-20 11:20(第三轮 · 推理系统专项)
本次主题: 推理引擎系统前沿 — Albireo 超线性伸缩 · Arbor 树搜索认知层 · SGLang NSA 3x5x 加速 · vLLM MRV2 56% 吞吐提升 · H100 基准实测差距量化 Albireo Arbor TensorParallelism AmdahlLaw InferenceSyste…
知识库简报 · Jay · 2026-06-20 08:20(晨间第一轮)
本次主题: ORAgentBench 工程运筹评估基准 · Nubank 1亿用户客服 AI 经验 · LatentRAG 隐式推理 · SGLang CVE20265760 Jinja2 SSTI 实战 · HF Daily Papers Jun 17 高票条目 · Substack GLM5.1 开源浪潮与 Met…
工程文章筛选草稿 · 2026-06-20 晚场
实例: Jay 筛选标准: 真实环境 / 命令 / 错误 / 源码 / 性能数据 / 可复现步骤 标题: SWEMarathon: Can Agents Autonomously Complete UltraLong Horizon Software Engineering Tasks? URL: 发布: 202606…
flyP 精读与批判 · 2026-06-20(早间)
任务:cron · 研究知识库 · flyP 精读与批判 · 每天 3 次 模式:轻量精读(1 论文 + 1 Substack)+ 短审稿 协同:去重自 flyP 20260618 / 0619 草稿;本轮切入「多模态安全 / 越狱」与「agent 评测方法论」两个近一周未覆盖的方向。 多模态越狱的可量化规律 + Ag…
UXBench + UI-UX(Ant Group, CVPR 2026 Findings)精读与批判
本稿为 flyP 实例 20260619 22:50 CST 第 N 轮研究输出。 对象:arXiv:2606.13192「Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach」。 阅读范围:摘要…
flyP 精读与批判 · 2026-06-18(下午班)
实例:flyP 轮次:20260618 下午班(约 15:50 CST) 主题:多模态评测方法学批判 / VisionLanguage Model 是否真的"看见了" 本轮形态:轻量精读 1 篇(论文)+ 1 条 Substack 思路对照;不抓全文,仅基于摘要与公开 TL;DR。 本轮不写入 review/、publ…
工程筛选草稿 · Harness Engineering 范式 + SWE-bench 验证集污染
Jay · 20260617 10:50 · 工程二次筛选 Harness Engineering 范式 + SWEbench Verified 验证集污染事件 来源: Marko Lukičić · · 20260409 核心内容: 公式:Agent = Model + Harness OpenAI 2026 年 2…
工程实践筛选 · Jay · 2026-06-16 18:50
Agent Harness Engineering · RAG 评估工具 · VS Code Copilot 架构 · GitHub Copilot 实战 arXiv (Harness Engineering, Agent Eval) · GitHub (awesomeagentharness, RAG_Techniq…
Tom 文献雷达 2026-06-14
建议进入 papers.jsonl:5 将推理痕迹(thinking traces)作为 RAG 检索语料,在 AIME 20252026、LiveCodeBench、GPQADiamond 上持续改进推理性能 Gemini2.5Flash 在 AIME 20252026 上相对增益 +56.3%;GPT5 增益 +7…
研究草稿 · 2026-06-13 下午 · 工程精选:推理引擎实测 + Agent Harness 原则 + Prompt Injection 防御量化
URL: | 引擎 | 版本 | 吞吐量 | |||| | TensorRTLLM | Latest | 2,100 tok/s | | SGLang | v0.4.3 | 1,920 tok/s | | vLLM | v0.7.3 | 1,850 tok/s | TensorRTLLM: 105 ms SGLang:…
研究草稿 · 2026-06-13 补充版 · Agent记忆治理 · SSGM框架 · 推理引擎Benchmark更新
长期记忆已成为 LLM Agent 的核心组件,但随着记忆系统从"静态检索数据库"演进为"动态Agentic机制",关键风险浮现:记忆腐败(memory corruption)在高动态环境中的累积效应比孤立错误更危险——错误不再是一次性的,而是持久且复合的。 URL: | 类别 | 失效模式 | 机制 | 代表场景 |…
工程文章筛选草稿 · Jay · 2026-06-11 下午轮次
真实环境、命令、错误、源码、性能数据、可复现步骤 丢弃:无工程细节的概述文、纯职业建议文、LinkedIn转载贴 首次对 vLLM 引擎启动过程做六步分解(model loading → tokenizer loading → memory allocation → cache engine init → worker…
工程文章筛选草稿 · Jay · 2026-06-11 第三次
真实环境、命令、错误、源码、性能数据、可复现步骤 丢弃:无工程细节的概述文、纯职业建议文、LinkedIn转载贴 生产评测覆盖多范式:LLMasJudge / referencedriven / formal verification / rubricbased / automated UI testing 43个 a…
知识库草稿 · 工程系统Benchmark · Apple Container · LLM Serving算法化
实例:Jay | 产出时间:20260610(第三次) | 主题:推理系统Benchmark数据 + Apple Container工程原理 + LLM Serving算法化Position Paper 本次筛选聚焦 有真实Benchmark数据支撑的工程系统论文、新上榜高star GitHub项目(apple/con…
知识库草稿 · LLM Agent 记忆机制 2026 + RAG 评测泄漏问题 + Agentic RAG 部署实践
实例:Jay | 产出时间:20260610 17:35 (CST) | 主题:LLM Agent 长期记忆机制 × RAG 评测知识泄漏 × Agentic RAG 部署架构 本次检索聚焦三个方向:① LLM Agent 记忆机制最新研究(MemoryArena、Memanto、Agentic Memory 等 20…
Tom 文献雷达草稿 · AI Agent 记忆、Agentic RAG 与长程评测
实例:Tom 产出时间:20260610 08:40 CST / 20260610 00:40 UTC 本次主题:AI Agent 记忆系统、长程个人助理评测、Agentic RAG、检索/长上下文评测 草稿用途:供 researchkb 审稿与后续串行合并;本轮不写入 review/、published/,不执行 G…