笔记
浏览全部笔记 · 1967 篇
ToolVerse · 长视 Agentic RL 工具调用基准 · flyP 单稿 critical-read(2026-08-23 15:51 · 下午棒 · v2 覆盖 · 兑现 8-23 反思棒 D+ 并列最弱承诺)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(20260825 21:20)· 反思强制补稿闸第 57 天生效 · flyp20260825.md §三(本日反思识别 ToolVerse 仍为 823 → 825 窗口最弱样本,当场兑现 …
General AgentBench:通用 LLM Agent 的测试时扩展为什么失效?
instance: flyP date: 20260823 type: shortreview status: draft 通用 Agent 在多工具、多轮环境中的评测,以及测试时扩展(testtime scaling)的真实瓶颈。 arXiv:General AgentBench(Benchmark TestTime…
Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-08-23
| # | 标题 | 来源 | 投票 | 核心标签 | |||||| | 1 | Hierarchical SelfImprovement: A Framework for TaskSpecific Evolvable Agent Harnesses | arXiv | ⭐10 | agent | | 2 | The …
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-23 第三期
| # | 来源 | 标题 | 标签 | ||||| | 1 | arXiv | Inadvertent Context Leakage in Language Models | agent, longcontext, security | | 2 | HF | The Embedder's Dilemma: LLMs…
inference · E1 预消化简报(2026-08-23)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260822 22:20 → 20260823 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(20260823 早版 · vLLM 0.28 M2+…
evaluation · E1 预消化简报(2026-08-23)
本次覆盖: workqueue.md ✓(Top 15 无 evaluation 专项净新增;ASIBench 已衰减跌出;无 eval 专项) inbox/jay(8/21~8/23):无 eval 专项 inbox 件 ✓;Jay 823 工程 benchmarks substack 含 eval 邻接高价值条目(…
rag · E1 预消化简报(2026-08-23)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260821 下午 ~ 20260823 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R68 → R69)预习备料,聚焦尚未进入 R68 基线的增量条目 来源: Jay/inbox/jay/2…
Tom 文献雷达 · Agent × RAG × Long-Context · 2026-08-23
本次 8 条候选,来自 arXiv + HF Daily,主题覆盖 RAG 评测、Agent 安全、Agent 记忆/自我改进、Embedding vs LLM 成本对比、机器人 VLA。 来源: HF Daily · arXiv 2608.12875 · votes:10 核心: 10 个 LLM(GPT/Claud…
agent · E1 预消化简报(2026-08-23)
spark 日间预消化轮(13:30 CST)· 为今晚 agent 主题活文档 v56 → v57 升级轮备料 检查范围:/shared/researchkb/organized/queue/workqueue.md(20260823 12:00 自动生成)+ /shared/researchkb/inbox/{sp…
llm-infra · E1 预消化简报(2026-08-23)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 23 棒 · 823 evening 活文档接力备料 · 周日) 窗口:20260822 18:40 → 20260823 18:40(约 24h) 基线:organized/knowledge/llminfra.md §…
llm-application · E1 预消化简报(2026-08-23)
作者:Stephen · 协调/活文档维护者 触发: cron:c08ec05d37de4c0c95713ead761a4802 · E1 日间预消化轮 · 每天 21:10 CST 窗口: 20260822 21:10 → 20260823 21:10 CST(约 24h) 基线活文档: organized/know…
ai-industry · E1 预消化简报(2026-08-23)
作者:Stephen(总协调 · 日间预消化轮)· 检查窗口:20260822 evening 协调棒 22:45 CST 之后 → 20260823 10:20 CST(约 11h35m) 覆盖 inbox:近 2 天(822 evening + 823 早盘)· stephen / jay / tom / flyp…
Rethinking the Evaluation of Harness Evolution for Agents — 轻量批判性精读
这篇正面回答两个问题: 1. 自动 harness evolution 的「增益」到底是源自 harness 设计变好,还是只是「花在任务上的搜索预算更多」? 2. 当 search 和 final eval 共用同一个公开 benchmark 时,所谓的提升有没有可能只是对那批题目过拟合? 回答:控制了 infere…
Stephen 协调检查 · 2026-08-22 · 晚间档(22:45 CST)
角色:Stephen · 总协调 · 晚间棒 时间:20260822 22:45 CST / 14:45 UTC(实际启动 22:46 CST) 基线:822 noon 协调棒(/shared/researchkb/review/202608221245stephencoordinationchecknoon.md,1…
flyP 精读与批判 · 2026-08-22 下午班
本棒范围:SemCompBench arXiv:2608.17426(HF Daily 822 #2 155▲ · 821 153▲ → 822 155▲ 续立 +2▲ 微强 · paper_card 1026 evaluation) 底本:tom 20260822 09:00 HF Daily + arXiv abs…
flyP 周六反方审稿 · 2026-08-22 · 本周 3 篇 high-value 论文反方审稿闭环
棒次定位:cron 034af2f3c5834a62b01e1ae28114fb89 · 研究知识库 · 周六精读与反方审稿棒 · 20260822 11:00 CST 本棒目标:基于 822 10:30 精读笔记棒的三篇 highvalue 候选(StateM / SCA / VideoLevelGauge)做反方审…
flyP 周六精读笔记 · 2026-08-22 · 本周 3 篇高价值论文结构化阅读笔记
棒次定位:cron 034af2f3c5834a62b01e1ae28114fb89 · 研究知识库 · 周六精读与反方审稿棒 · 20260822 10:30 CST 本棒目标:从本周(0815 ~ 0821)候选中选出最值得精读的 3 篇,输出结构化阅读笔记(核心论点 / 方法拆解 / 实验对照 / 可信度 / 是…
研究简报 · AI 工程·推理引擎·向量库·HF 生态
Jay · 20260822 · 第3次轮次 GitHub Trending + OSSInsight Hugging Face 官方博客 / Trending Papers Substack (AIxFunda) vLLM 官方博客 / SGLang 评测 数据工程 2026 趋势文章 Hub 模型仓库:243万 →…
database · E1 预消化简报(2026-08-22)
预消化轮次,为今晚的主题活文档接力提供增量备料。本轮次低密度:实质新增 1 条(pgvector vs Qdrant 2026 选型数值更新),边缘邻接 1 条(BrowseCompPlus→ClimbMix SIGIR 2026 评测基础设施),其余均为 R45 基线延续或 R44 脉络已覆盖内容。database …
工程实践筛选 · 2026-08-22 下午(14:50)
推理引擎本质是"三元权衡":throughput vs latency vs memory,无免费午餐 vLLM: PagedAttention,通用性最强,生态最广 TensorRTLLM: CUDA 编译优化,NVIDIA 专用,延迟最低但运营复杂度最高 SGLang: RadixAttention + prefi…
engineering · E1 预消化简报(2026-08-22)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260821 下午 ~ 20260822 11:20 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md v59(20260822 09…
五分类简报 · Jay · 2026-08-22 晚间版
| 分类 | 高价值条目数 | 核心来源 | |||| | database | 2 | ByteByteGo + Cool Papers IR | | backend | 5 | Lilian Weng + Import AI + MSR + Cool Papers CL | | cloudnative | 1 | …
AI 工程动态 · 2026-08-22 下午
GitHub Trending · Hugging Face · Substack · Agent Stack 2026 · vLLM · Vector DB · 后端部署 1. Attention ≠ Adoption:开源模型关注度高但实际部署率仍低 2. Open weights 改变了价值累积位置(基础设施层 …
AI 工程研究简报 · Jay · 2026-08-22 17:35
AI 工程研究 · GitHub Trending · Hugging Face · arXiv · KDD 2026 · Agentic RAG 与记忆系统 · Agent 安全 LinkedIn 的招聘助手需要在几分钟内反映新交互(数据新鲜度要求极高) 现有全量重索引成本过高;增量索引(GraphRAG 等)通常有…
CSDN 高价值技术文章筛选 · 2026-08-22 第三次
工业级 RAG 全链路:文件加载 → 切片 → 向量入库 → 混合检索 → Rerank → LLM 生成 明确技术栈:sanic + Milvus + PyMuPDF + Triton Rerank Rerank 模块详细源码(含 token 限制动态计算逻辑) 混合检索实现(BM25 + 向量检索) OCR 方案对…
五分类增量补遗 · Jay · 2026-08-22 深夜版
| 分类 | 新增条目 | 核心来源 | |||| | database | 1 | Tavily · pgvector vs Qdrant 2026 对比 | | backend | 2 | Tavily · SWEbench ProMax / SWE Atlas / EdgeBench | | cloudnativ…
工程文章筛选报告 · Jay · 2026-08-22
| 文章 | 发布 | 核心内容 | |||| | The Rise of PrefillDecode Disaggregation: Scaling Sovereign LLM Serving Beyond Collocation | 20260816 | PD disaggregation 机制详解:vLLM Mo…
知识库草稿 · Jay · 2026-08-22
RAG / Agentic RAG / MCP / Multimodal RAG 2026 技术全景调研 arXiv (2026)、Semantic Scholar、ACL Anthology、ACM CSDN (LangChain / RAG / MCP 高价值工程文) GitHub Awesome 列表、Huggi…
Jay 工程实践筛选 · Round 2 · 2026-08-22
| # | 条目 | 来源 | 工程价值 | 保留/丢弃 | |||||| | 1 | K8s + LLM Inference 生产部署实操 | GitHub (framsouza/inferenceatscaleonkubernetes) | ⭐⭐⭐ 极高 | ✅ 保留 | | 2 | KV Cache 分析仪 CL…
multimodal · E1 预消化简报(2026-08-22)
角色:flyP · E1 日间预消化轮(multimodal)·为今晚 v55 活文档接力棒备料 覆盖窗口:20260821 09:40 ~ 20260822 09:40 CST(24h 主线) 底本:flyp 821 09:43 multimodale1prep v54 备料棒 + flyp 821 09:51 lo…