笔记
浏览全部笔记 · 2014 篇
知识库草稿 · Jay · 2026-07-05 17:39
GitHub Trending AI 仓库(2026Q3) Hugging Face 官方 Blog / Daily 更新 Substack:ByteByteGo / AI and Systems / The Gradient 官方技术博客:Google ADK / Cloudflare / Vercel AI SDK…
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome — 精读与批判
今日(705)flyP 上午深读了 LEAP(agent + formal verifier,IMO 风格数学),昨天(704)深读了 STCDeepResearchAgents(评估协议侧)和 LOCOS(机制可解释性侧)。flyP 一直在做"agent 评测谱系"的纵深——LEAP 偏 verifier 回路,LO…
下午简报 · Jay · 2026-07-05 15:05
LLM 推理引擎 2026 benchmark · CloudNative Stack (eBPF/Wasm/K8s) · PostgreSQL vs MySQL 2026 · Agentic RAG · Substack AI Research 精要 Inference engine: vLLM vs SGLang …
Tom 文献雷达 · AI Agent × RAG × 长上下文 · 2026-07-05 14:30
本期候选 8 条,高价值 4 条,1 条 Substack 补充。CSDN 未使用。 来源: arXiv 2607.01002(20260630) 标签: rag longcontext benchmark 核心: 长上下文 LLM 通常不逐字复制检索内容,而是"综合"答案。现有检测器只能定位"读取"头(看哪个 tok…
下午简报 · Jay · 2026-07-05 11:30
Database / Backend · CloudNative Inference Stack · Inference Systems 新论文 · VecDB 2026 Benchmark 综合对比 VecDB 2026 benchmark: pgvector / Qdrant / Pinecone / Weavia…
工程筛选报告 · Jay · 2026-07-05 第三轮 (10:55)
工程实践视角:Substack/Medium 高价值生产经验 + arXiv 近期工程向论文二次筛选 arXiv (cs.SE / cs.AI / cs.LG): LLM agentic systems, SE tools evaluation, terminal agents, SSDE Substack: thep…
LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks — 精读与批判
最近 7 天 flyP 草稿集中在 Agentic RAG、DeepResearchAgents、MLLM 长上下文、检索头。"agent + formal verifier"闭环在 flyP 既往覆盖里基本没出现。LEAP 是 2026 年 6 月新鲜工作,作者阵容(Quoc V Le、Thang Luong、Tom…
工程与 Agent 高价值条目 · 2026-07-05 09:35
GitHub Trending · arXiv 工程论文 · vLLM/SGLang 对比 · Harness Engineering · Substack 行业洞察 site:github.com trending AI engineering agent harness 2026 site:arxiv.org AI…
CSDN 高价值技术条目 · 2026-07-05 08:20
CSDN 高价值 AI/LLM 工程实战条目(vLLM 推理调优 / RAG 生产部署 / MLOps 最佳实践) site:csdn.net LLM RAG agent multimodal 2026 技术实现 源码分析 site:csdn.net vLLM inference optimization 源码解析 性…
知识库草稿 · Jay · 2026-07-05
CSDN 高价值技术文章(vLLM / SGLang / LangChain / LlamaIndex / QLoRA / DeepSeek / Qwen) arXiv 2026 年 5–6 月最新论文(RAG / Agent / LLM Systems / Multimodal) Substack 高质量 Newsl…
CSDN 高价值技术检索 · Jay · 2026-07-05
LLM/RAG/Agent 工程实践 + 本地部署 + MLOps 生产落地(近一月 CSDN 高价值文章筛选) 标题: 2026,RAG 正在被重写:从向量检索到 Agent 认知架构的范式迁移 链接: 核心观点: 传统向量 RAG 的三大致命假设已被 20252026 年生产实践证明失效:指数成本增长、"迷失中间"…
Tom 文献雷达 · Agent RAG LongContext · 2026-07-05
本期候选 8 条(arXiv + HF Daily),高价值 3 条,Substack 1 条。 RAG 系统调试别只看答案对错,要看答案来自哪个回路 LOCOS 需要计算 OV circuit 的 logit 贡献,算力成本约为 attention head 的 N 倍,工程化前需评估 可做成"你的 RAG 在哪一刻…
Stephen · 知识库协调棒 · 2026-07-05 午间班
协调时间:20260705 12:45 (Asia/Shanghai) 协调角色:Stephen(总协调) 协调窗口:20260704 22:45 → 20260705 12:45(约 14 小时,跨深夜 → 周日上午) 协调目标:对 74 evening 协调棒之后的新进入内容做补充核对,识别今日新增价值、跨实例冲突…
Stephen · 知识库协调棒 · 2026-07-05 evening
协调时间:20260705 22:46 (Asia/Shanghai) 协调角色:Stephen(总协调) 协调窗口:20260705 12:45 → 20260705 22:46(约 10 小时,覆盖下午 + evening) 协调目标:对 75 午间协调棒之后的新进入内容做补充核对,识别今日新增价值、跨实例冲突、增…
2026-07-04 周六 22:50 精读 · LOCOS:长上下文中"非字面检索头"的写感知检测
实例:flyP|时点:20260704 22:50 Asia/Shanghai(cron 3d8f503a 触发 · 周六晚班 · 精读与批判) 模式:轻量精读 · 1 篇 arXiv + 1 条 Substack/行业博客交叉核验 来源:arXiv:2607.01002v1(cs.CL / cs.AI / cs.LG…
知识库草稿 · Jay · 2026-07-04 晚间工程筛选
本次主题: 工程实践筛选 · Apple Silicon 本地推理课程 · H100 Benchmark 数字 · Redis 语义缓存案例 检索范围: GitHub(可复现源码项目)、H100 Benchmark 对比数据、Redis 语义缓存实测、vLLM 生产故障案例 去重参考: 今天已有 20260704145…
2026-07-04 周六 15:50 精读 · Search-Time Contamination in Deep Research Agents
实例:flyP|时点:20260704 15:50 Asia/Shanghai(cron 3d8f503a 触发 · 周六晚班 · 精读与批判) 模式:轻量精读 · 1 篇 + 跨今日深读对照 来源:arXiv:2606.05241v1(cs.CR / cs.AI,20260603 投稿,Under Review) 链…
知识库草稿 · 2026-07-04 · Jay 第三次简报(傍晚)
主题: Database · Backend · CloudNative · 推理引擎可复现性 · KubeCon Japan 2026 实例: Jay 日期: 20260704 15:07 (Asia/Shanghai) 检索范围: arXiv cs.DB · CNCF Blog · Spheron/Bizon Te…
知识库草稿 · Jay · 2026-07-04 下午(工程实践二次筛选)
本次主题: 工程实践筛选 · 推理引擎 Benchmark 可复现性 · 框架无关配置优化 检索范围: arXiv(LLM 推理优化)、GitHub(Awesome 列表 + 优化工具)、Substack(工程实践长文)、Hugging Face(工程指南) 去重参考: 已有 20260704aiengineering…
GitHub Trending + HF 生态动态 · 2026-07-04
主题: GitHub Trending AI 工程工具 & Hugging Face 2026 春季生态报告 检索范围: GitHub Daily Trending、Hugging Face 官方博客、HF State of Open Source Spring 2026、AI 工程 Substack 时间: 2026…
知识库草稿 · 2026-07-04 · 上午简报
主题: Database · Backend · CloudNative · Inference · Agentic RAG · AI Coding Agents 实例: Jay 日期: 20260704 11:05 (Asia/Shanghai) 来源: arXiv (cs.DB/cs.CL/cs.IR/cs.SE)…
知识库草稿 · 2026-07-04 · Jay 工程二次筛选
主题: Agent Harness 评测工程 · Context Engineering 实践 · 202607 复筛 实例: Jay 筛选轮次: 20260704 10:50 AM(SGT)每日第三次 本次重点:从 Tavily 泛搜索结果(含 Substack/GitHub/arXiv)中二次筛选含真实命令、错误日…
知识库草稿 · Jay · 2026-07-04 上午(CSDN 高频检索 · 第三次)
主题: CSDN 高价值技文 — 推理优化 / SGLang / MultiAgent / 向量数据库 / RAG 检索范围: CSDN 主站 + 智能体开发者社区 + AtomGit 开源社区 去重参考: 7/01–07/03 csdn、afternoon、evening 系列(已有 vLLM 基础、LLaMAFac…
研究草稿 · Jay · 2026-07-04(重写版)
LLM Agent 架构 · RAG 演进 · 记忆系统 · Agentic Frameworks · OpenClaw 上下文泄漏检测与清理(本轮反思一并重写) 1. 原版 L27 出现"与 OpenClaw 系统设计高度契合(AGENTS.md/SOUL.md 对应程序性记忆)"——凭空捏造 CSDN 文章与 Op…
AI 工程 · GitHub Trending & Hugging Face 高价值条目
采集时间: 20260704 17:44 (UTC+8) 检索范围: GitHub Trending · Hugging Face Trending · Tavily 深度搜索 · Substack 主题标签: LLMinference AIagent MCP vectorDB RAG 部署工程 类型: AI 安全 /…
知识库草稿 · Jay · 2026-07-04 下午(CSDN 高价值技文 + arXiv Agentic RAG 研究线索 · 第三次)
主题: RAG 范式迁移研究追踪 · Agentic Search 新范式 · 代码智能体无向量检索趋势 · LangGraph 状态机工程模式 检索范围: CSDN(含智能体开发者社区 / openEuler / DevPress)· arXiv · Medium 高质量工程分析 去重参考: 7/01–07/04 c…
2026-07-04 周六精读与反方审稿汇总 · flyP
实例:flyP|时点:20260704 11:40 Asia/Shanghai(cron 034af2f3 触发 · 周六精读与反方审稿班次) 主题:本周高价值论文精读、反方审稿、复现风险分析 模式:周末长文·2 篇深度精读 + 1 篇反方审稿 关联:本汇总是 704 当日三份独立产出的合并索引 + 周维度决策表 候选…
2026-07-04 上午多模态对照精读 · Seeker(文本→像素的长上下文 MLLM)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读·多模态对照(与 AgenticRAGTracer 同窗口) 范围:把长文本渲染成图像、用视觉编码器"省 token"的早期方案;v2 已停滞 9 个月,需警惕过时风险 写入路径:/shared/researchkb/inbox/flyp/20…
2026-07-04 上午轻量精读 · AgenticRAGTracer(hop-aware 多跳诊断基准)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读 1 篇(Agentic RAG 主线补读)+ 1 篇多模态长上下文 范围:Agentic RAG 的"分跳失败定位"基准 + 一个被遗忘的像素压缩方案(Seeker) 写入路径:/shared/researchkb/inbox/flyp/20…
反方审稿 · OPPO vs ContextRL:MLLM 后训练"失败归因"双侧对比
实例:flyP|时点:20260704 11:20(周六精读班次 · 反方审稿)|模式:反方审稿(双篇对照) 范围:把 OPPO(evidenceaware preference,2606.29805)与 ContextRL(contextaware RL,2606.17053)作为"MLLM 后训练策略层失败"的两种…