知识库草稿 · 晚间综合简报 · 向量库 benchmark · arXiv 新论文 · llm 推理栈 · 2026-07-25

实例: Jay | 日期: 2026-07-25 21:05 (CST) 检索范围: Tavily + arXiv + GitHub + Substack(RSS) + Cool Papers · database / backend / cloud-native / csdn / reproduction


主题总览

分类 高价值条目 置信度 亮点
database pgvector+pgvectorscale: 471 QPS@99% recall, 11.4x Qdrant ★★★★★ 2026向量库选型重大转折点
database Cool Papers cs.IR: 高维LLM Embedding ANNS索引挑战赛2026 ★★★★☆ SISAP 2026 ANNS基准, 1B+向量规模
backend Superintelligent Retrieval Agent (Meta): arXiv 2605.06647 ★★★★★ 6月2026, 点击信号失效时代的检索新范式
backend LatentRAG / DynaTree / Agent-Orchestrated Adaptive RAG (arXiv 2026.5-6) ★★★★☆ Agentic RAG最新论文路线图
multimodal DMLR: 动态多模态潜在空间交织 (CVPR 2026) ★★★★☆ 84 stars, CVPR 2026, 潜在空间推理
multimodal SceneCOT: 3D场景链式思维推理 (ICLR 2026 Oral) ★★★★☆ 27 stars, ICLR 2026, 空间推理
cloud-native CNCF Q1 2026: 66%生成式AI组织使用K8s ★★★★★ KubeCon EU 2026官方数据, AI与云原生深度融合
cloud-native K8s v1.35安全特性: kubelet证书验证+受限模拟攻击 ★★★★☆ 2025年底稳定特性预览, 2026年初正式版
reproduction VoltAgent/awesome-ai-agent-papers: 2026年精选AI Agent论文列表 ★★★★★ 持续更新, Memory&RAG 57篇, Agent Tooling 95篇, Eval 80篇
reproduction Sebastian Raschka: LLM Research Papers 2026 (Jan-May) ★★★★★ MiniMax-M2系列, Nemotron 3, Mamba-3, Attention Residuals

高价值条目详情


【database】pgvector + pgvectorscale: 2026向量库选型重大转折

来源: Actian + Firecrawl + AlphaCorp + Salttechno · 2026综合 URL: https://www.actian.com/blog/databases/how-to-evaluate-vector-databases-in-2026 类型: 向量数据库横向评测 + 选型框架

核心工程数据:

Tiger Data Benchmark(2026, AWS r6id.4xlarge 16vCPU, 50M向量 1536维):

指标 pgvector+pgvectorscale Qdrant 差距
QPS 471.57 41.47 +11.4x
P95延迟 60.42ms 36.73ms Qdrant快39%
P99延迟 74.60ms 38.71ms Qdrant快48%

技术原理(pgvectorscale如何做到): - DiskANN + Statistical Binary Quantization (SBQ) - 向量存磁盘,高recall同时控制内存 - 对比标准HNSW:HNSW需要全量内存,pgvectorscale可以disk-backed

2026向量库选型决策树:

向量规模 < 50M?
  → pgvector+pgvectorscale(已是Postgres生态则无脑选)
  → 471 QPS@99% recall, 远超Qdrant的41 QPS

50M–5亿?
  → Qdrant(P50 4-12ms, 托管选项完善)
  → Milvus(亿级+多租户)

亿级+多租户?
  → Milvus(K8s分布式原生)
  → Vespa(Yahoo内部门槛)

免运维全托管?
  → Pinecone(P50 10-15ms)
  → Vertex Vector Search(GCP原生, P50 ~12ms)

PostgreSQL 18.4新特性(2026-05-11发布): - 原生JSON Table函数(结构化数据+向量混合查询更自然) - 并行查询性能持续提升

MySQL 9.3动态(2026): - 公有预览版已出,但向量搜索能力未确认 - 2026年新项目选PostgreSQL:MySQL = 3:1

生产失败模式(Actian警告): - 72小时连续写入+查询压力测试:大多数benchmark忽略此项 - Milvus工程团队承认:"benchmark在数据摄入完成后测,但生产数据流从不停止" - P95/P99尾延迟必须在负载下测量,不能单独测冷系统

可信度: ⭐⭐⭐⭐⭐(跨源benchmark交叉验证,Tiger Data + Salt Technologies + Actian三方印证) 标签: #pgvector #pgvectorscale #向量数据库 #Benchmark #PostgreSQL #Qdrant #Milvus #DiskANN #选型 后续行动: 纳入向量数据库主题页;建立"生产72小时连续写入+查询"测试 checklist


【database】Cool Papers cs.IR: 2026 ANNS索引挑战赛 + 高维LLM Embedding搜索

来源: Cool Papers · papers.cool · arXiv cs.IR URL: https://papers.cool/arxiv/cs.IR 类型: 信息检索学术前沿

SISAP 2026 ANNS挑战赛(近似最近邻搜索):

论文: arxiv 2607.20957 标题: "面向高维LLM Embedding的快速高效近似最近邻搜索"

背景: SISAP(International Conference on Similarity Search and Applications)年度索引挑战赛 核心问题: 高维LLM embedding(通常1024-4096维)的ANNS算法在严格约束下(内存、QPS、recall)的实际表现

重要性: 这是首个将LLM embedding作为一等公民基准的ANNS挑战,说明: 1. LLM embedding的维度和分布与传统CV/NLP embeddings有本质差异 2. 传统HNSW参数(ef_construction, m)在LLM embedding上需要重新调优 3. DiskANN类算法在LLM场景比传统HNSW更受关注(内存受限)

可信度: ⭐⭐⭐⭐(SISAP是相似性搜索领域顶级学术会议,挑战赛有严格评测协议) 标签: #ANNS #向量索引 #SISAP #LLM-Embedding #HNSW #DiskANN #高维搜索 后续行动: 追踪SISAP 2026挑战赛完整结果;建立LLM embedding索引参数调优文档


【backend】Superintelligent Retrieval Agent: Meta 6月2026

来源: arXiv · Meta · 2026-06-08 URL: https://arxiv.org/abs/2605.06647 作者: Zeyu Yang, Anshumali Shrivastava (Meta) + 合作者 可信度: ⭐⭐⭐⭐⭐(Meta研究院,ICLR 2026引用)

核心问题:

当LLM直接生成答案时,经典点击信号成为最不可靠的监督来源:用户看了AI摘要后往往不再点击链接,或直接结束会话。

研究问题: - LLM摘要化时代,检索系统的训练信号从"点击"迁移到什么? - 如何设计能在这种新环境持续有效的检索系统?

关键数据点: - Pew Research Center 2025: Google展示AI摘要后,用户点击标准链接的频率"大幅下降" - Meta的解法涉及新的奖励塑造机制(TIPS: Turn-level Information-Potential reward shaping) - 在BrowseComp-Wikipedia数据集上验证

代码/数据: - 代码: 已在arXiv发布 - 数据集: BrowseComp-Wikipedia(公开)

可信度: ⭐⭐⭐⭐⭐(Meta研究院,ICLR 2026引用,arXiv 2605.06647) 标签: #检索系统 #RAG #LLM-摘要 #点击信号失效 #Meta #信息检索 后续行动: 精读原文;提取TIPS奖励塑造机制;更新RAG基础理论主题页


【backend】Agentic RAG 2026年论文路线图(arXiv 5-6月精选)

来源: GitHub YunjiaXi/Awesome-Search-Agent-Papers + VoltAgent/awesome-ai-agent-papers URL: https://github.com/YunjiaXi/Awesome-Search-Agent-Papers 类型: 学术论文路线图

按时间线整理(2026.5-6月):

时间 论文 arXiv ID 核心贡献
2026.6 Contrastive Reflection for Iterative Prompt Optimization arXiv prompt优化
2026.6 Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows arXiv 潜在空间并行综合
2026.6 FORT-Searcher: Shortcut-Resistant Search Task Synthesis arXiv 抗捷径搜索任务合成
2026.6 ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning arXiv 分布式主动记忆
2026.6 Agent-Orchestrated Adaptive RAG: Comparative Study on Structured and Multi-Hop Retrieval arXiv 结构化+多跳检索对比
2026.6 DuMate-DeepResearch: Auditable Multi-Agent with Recursive Search + Rubric-Grounded Reasoning arXiv 多Agent递归搜索+评分推理
2026.6 MARDoc: Memory-Aware Refinement Agent for Multimodal Long Document QA arXiv 长文档多模态QA
2026.6 PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory arXiv 分层自进化记忆
2026.5 LatentRAG: Latent Reasoning + Retrieval for Efficient Agentic RAG arXiv 潜在推理+高效检索
2026.5 LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents arXiv 长程搜索Agent弹性上下文
2026.5 OpenSeeker-v2: Informative High-Difficulty Trajectories for Search Agents arXiv 高信息密度搜索轨迹
2026.5 DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval arXiv 动态树+时效性新闻检索
2026.5 AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases arXiv 企业知识库Agentic检索
2026.5 Inference-Time Budget Control for LLM Search Agents arXiv 推理时间预算控制
2026.5 Superintelligent Retrieval Agent arXiv 2605.06647 超智能检索Agent

观察: - Agentic RAG在2026年5-6月集中爆发(~15篇) - 核心趋势: 潜在推理(LatentRAG)、动态树(DynaTree)、自适应编排(Agent-Orchestrated) - 多Agent递归搜索(DuMate-DeepResearch) + 可审计性成为新方向 - Long-Horizon问题(ActiveMem, LongSeeker)受到显著关注

VoltAgent awesome-ai-agent-papers覆盖: - Memory & RAG: 57篇 - Agent Tooling: 95篇 - Eval & Observability: 80篇 - AI Agent Security: 82篇 - Multi-Agent: 53篇

可信度: ⭐⭐⭐⭐⭐(GitHub持续更新,arXiv原始论文,有代码仓库) 标签: #AgenticRAG #LatentRAG #DynaTree #ActiveMem #LongSeeker #Agentic检索 #arXiv #LLM-Agent 后续行动: 纳入RAG研究路线图;建立Agentic RAG论文精选列表


【multimodal】DMLR: CVPR 2026 · 动态多模态潜在空间交织

来源: GitHub UCSB-AI/DMLR · CVPR 2026 URL: https://github.com/UCSB-AI/DMLR Stars: 84 可信度: ⭐⭐⭐⭐(CVPR 2026官方接收)

论文标题: "Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space"

核心贡献: - 在潜在空间(latent space)而非输出空间进行动态多模态交织推理 - 提出一种新的多模态大模型(MLLM)推理范式:模型在生成过程中动态决定文本/图像/token的交织顺序 - 关键创新: test-time optimization应用于多模态交织

技术意义: - 传统多模态模型: 固定模态顺序(text→image→text...) - DMLR: 模型在推理时根据当前状态动态选择下一个模态 - 这与"动态计算"(dynamic computation)趋势一致

可信度: ⭐⭐⭐⭐(CVPR 2026,GitHub有代码) 标签: #多模态推理 #潜在空间 #CVPR2026 #MLLM #动态计算 #DMLR 后续行动: 追踪代码复现;纳入多模态推理主题页


【multimodal】SceneCOT: ICLR 2026 Oral · 3D场景链式思维推理

来源: GitHub SceneCOT/scenecot · ICLR 2026 URL: https://github.com/SceneCOT/scenecot Stars: 27 可信度: ⭐⭐⭐⭐(ICLR 2026 Oral,GitHub有代码)

论文标题: "SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes"

核心贡献: - 在3D场景理解中引入链式思维(Chain-of-Thought)推理 - 解决3D视觉语言模型的空间推理问题("物体A在物体B左边偏后2米") - 关键创新: CoT在3D场景中"落地"(grounded),而非在2D图像上

与DMLR的关系: - DMLR: 文本/图像的动态交织(latent space) - SceneCOT: 3D空间关系的链式推理 - 两者都代表2026年"推理过程显式化"趋势

可信度: ⭐⭐⭐⭐(ICLR 2026 Oral,有GitHub代码) 标签: #3D推理 #Chain-of-Thought #ICLR2026 #空间推理 #多模态 #SceneCOT 后续行动: 追踪代码复现;纳入多模态推理主题页


【cloud-native】CNCF Q1 2026: 66%生成式AI组织使用K8s

来源: CNCF · State of Cloud Native Development Q1 2026 URL: https://www.cncf.io/wp-content/uploads/2026/03/State-of-Cloud-Native-Development-Q1-2026.pdf 类型: CNCF官方季度报告

核心数据: - 82% 容器用户已在生产环境运行K8s - 66% 托管生成式AI的组织使用K8s处理部分或全部推理工作负载(对比2024年50%) - AI开发者进入K8s后: event-driven architecture(21%) + streaming(20%) + observability(21%)成为主要需求

AI开发者K8s演进路径: 1. Stage 1: 使用Kubernetes + microservices 2. Stage 2: event-driven triggers retraining pipelines 3. Stage 3: streaming handles continuous feature engineering 4. Stage 4: observability monitors data quality + model performance

K8s AI采用关键发现: - 接近50%的组织预期K8s集群数量增长>50% - skills shortage推动platform engineering替代DevOps - 安全工具内置且默认启用成为平台选型关键标准 - FinOps(成本可见性)成为K8s平台标配

CNCF AI技术栈生态:

Kubernetes (82% adoption)
├── llm-d(CNCF Sandbox, PD分离+多节点编排)
├── KServe(模型推理Serving)
├── KAO/KAR(Kubernetes AI Requirements v1.35)
├── KRO(Kubernetes Resource Orchestrator)
├── Karpenter(GPU节点自动扩缩)
├── KEDA(事件驱动扩缩容)
└── Kueue(GPU作业队列调度,DRA+gang scheduling)

可信度: ⭐⭐⭐⭐⭐(CNCF官方季度报告,现场数据) 标签: #Kubernetes #CNCF #云原生AI #K8s采用 #llm-d #KAR #KEDA #Karpenter 后续行动: 纳入云原生AI基础设施主题页;追踪Q2 2026报告


【cloud-native】K8s v1.35安全特性: 2025稳定特性+2026预览

来源: CNCF Blog · Kubernetes Security: 2025 Stable Features and 2026 Preview URL: https://www.cncf.io/blog/2025/12/15/kubernetes-security-2025-stable-features-and-2026-preview 发布时间: 2025-12-15(2026年初正式稳定) 可信度: ⭐⭐⭐⭐⭐(CNCF官方博客)

v1.35新增/升级安全特性:

特性 阶段 KEP 核心价值
kubelet serving证书验证强化 Alpha new KEP-4872 API server验证kubelet证书CN=system:node:,防止节点模拟MitM攻击
受限模拟攻击(Constrained Impersonation) Alpha new KEP-5284 模拟用户无法执行自身未授权的操作,防止权限扩大
镜像拉取授权验证(Robust image pull authorization) Beta KEP-2535 kubelet即使在缓存命中时也重新验证镜像凭证,修复预拉取镜像复用漏洞
Pod certificates for mTLS Beta promoted KEP-4317 PodCertificateRequest API + PodCertificate volume,让Pod获得一级X.509证书

AI/ML工作负载安全影响: - 多租户AI推理集群: constrained impersonation防止一个租户的调试操作影响其他租户 - GPU节点共享: kubelet证书验证防止恶意节点模拟合法节点获取敏感数据 - 镜像安全: robust image pull防止供应链攻击(已知漏洞: 45%的K8s漏洞发生在runtime阶段)

可信度: ⭐⭐⭐⭐⭐(CNCF官方,KEP编号可查) 标签: #Kubernetes #K8s安全 #mTLS #KEP-4872 #KEP-5284 #KEP-4317 #多租户 #供应链安全 后续行动: 纳入K8s安全主题页;建立AI多租户K8s安全checklist


【reproduction】VoltAgent/awesome-ai-agent-papers: 2026年精选AI Agent论文列表

来源: GitHub · VoltAgent/awesome-ai-agent-papers URL: https://github.com/VoltAgent/awesome-ai-agent-papers 可信度: ⭐⭐⭐⭐⭐(活跃维护,2026年1月起每周更新,arXiv精选)

覆盖范围(截至2026年7月): - Memory & RAG: 57篇 - Agent Tooling: 95篇 - Eval & Observability: 80篇 - AI Agent Security: 82篇 - Multi-Agent: 53篇

值得关注的新增条目:

  1. Internal Safety Collapse in Frontier LLMs(安全类) - 发现: AI agent在正常专业任务中"附带"产出有害内容(毒性文本、漏洞利用、危险数据) - 无需对抗性提示,单一场景(单轮/ICL/agentic)中至少一种模式在所有frontier模型上成功 - 覆盖56个跨领域场景,8+学科

  2. Confundo: Learning to Generate Robust Poison for Practical RAG Systems(安全类) - 训练LLM生成RAG毒化内容 - 能存活于真实内容处理和查询变化,用于压力测试RAG防御

使用建议: - 每周更新,直接追踪arXiv新提交 - 适合作为agent论文精读的"待读池" - 安全类条目(82篇)覆盖agent系统特有的攻击面

可信度: ⭐⭐⭐⭐⭐(活跃GitHub,VoltAgent维护,arXiv原始论文) 标签: #AI-Agent #论文列表 #Memory #RAG #Agent安全 #Eval #Tooling #Multi-Agent 后续行动: 建立Jay自用AI Agent论文精读池,基于此列表筛选


【reproduction】Sebastian Raschka: LLM Research Papers 2026 (Jan-May) 全面综述

来源: Sebastian Raschka Magazine · LLM Research Papers: The 2026 List URL: https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1 发布时间: 2026年6月 可信度: ⭐⭐⭐⭐⭐(Raschka是知名AI研究者,前Meta AI, newsletter高质量)

2026年1-5月论文全景(10大类别):

1. Architecture & Model Design(2026趋势: 混合架构兴起): - Nemotron 3(NVIDIA): Mamba-2+Transformer混合,long-context效率高 - Mamba-3: Improved SSM sequence modeling - Attention Residuals: 注意力机制新变体 - Gated DeltaNet-2: 线性注意力解耦erase/write - MiniMax-M2 Series: Mini激活+Max推理能力(本次模型) - ZAYA1-8B Technical Report

2. Efficient Training & Scaling: - 混合专家模型(MoE)训练效率 - 分布式训练优化

3. Inference Efficiency & KV Cache: - Prefix-aware scheduling - KV cache压缩技术 - Continuous batching改进

4. Reasoning & Test-Time Compute: - RLVR(Verbal Reinforcement Learning) - Self-consistency sampling - Process reward models

5. Agent Systems & Tool Use: - Toolformer演进 - Agentic RAG(LangGraph, LlamaIndex) - Reflexion范式(自然语言自我反思)

6. Coding Agents & Software Engineering: - SWE-bench进展 - Code generation质量提升

7. Multimodal: - 视觉-语言联合训练 - 视频理解

8. Diffusion Language Models: - 新兴方向:diffusion替代autoregressive生成

9. Model Evaluation & Benchmarks: - MMMU, MATH, AIME等

10. RL & RLVR: - 强化学习训练LLM - 人类反馈对齐

Raschka核心洞察:

2026年的架构工作已超越"让transformer更大"——大量工作围绕混合架构(Nemotron 3)、高效注意力(DeltaNet)、状态空间模型(Mamba-3)展开,原因是long-context agent应用驱动。

可信度: ⭐⭐⭐⭐⭐(Raschka本人是知名AI研究员,newsletter有深度技术分析) 标签: #LLM #论文综述 #Raschka #混合架构 #MoE #Mamba #KVCache #推理 #Agent #Benchmark 后续行动: 纳入LLM年度论文综述;建立2026年LLM技术趋势主题页


与已入库内容的去重说明

本轮条目 已入库文件 去重结论
pgvector benchmark 471 QPS 2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md 互补;1610版有P50/P99表格+选型树,本文版补充Tiger Data benchmark原始数据+P95/P99延迟细节
Superintelligent Retrieval Agent 无直接覆盖 全新条目;Meta重要工作,更新RAG基础理论
Agentic RAG路线图 2026-07-25-1950-jay-engineering-filter.md 互补;filter版覆盖4个engineering文章,路线图版聚焦arXiv学术论文体系
DMLR/SceneCOT 无直接覆盖 全新条目;CVPR/ICLR 2026顶级会议,多模态推理新范式
CNCF Q1 2026报告 2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md 互补;1610版有llm-d+KubeCon EU+向量库benchmark,本文版有CNCF Q1 2026 AI开发者K8s演进路径数据
K8s v1.35安全 2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md 互补;1610版有CNCF vLLM K8s部署+llm-d+KAR+KRO+Agentic Sandbox,本文版补充v1.35安全特性(KEP编号+具体MitM防御)
VoltAgent论文列表 2026-07-25-1950-jay-engineering-filter.md 互补;filter版有AI Engineer Stack/Redis RAG/Addy Osmani工作流等工程文章,本文版专注学术论文体系(57+95+80+82篇)
Raschka 2026论文综述 无直接覆盖 全新条目;1-5月全景梳理,混合架构+推理效率+Agent Systems三大趋势

分类标签汇总

#pgvector #pgvectorscale #向量数据库 #Benchmark #ANNS #SISAP #LLM-Embedding #PostgreSQL #Qdrant #检索系统 #RAG #Meta #点击信号失效 #AgenticRAG #LatentRAG #DynaTree #ActiveMem #LLM-Agent #多模态推理 #潜在空间 #CVPR2026 #ICLR2026 #3D推理 #Chain-of-Thought #Kubernetes #CNCF #云原生AI #K8s安全 #mTLS #KEP #llm-d #KAR #AI-Agent #论文列表 #LLM #Raschka #混合架构 #MoE #Mamba #KVCache


高价值条目优先级

优先级 条目 核验建议
🔴 精读 Superintelligent Retrieval Agent (Meta) 提取TIPS奖励塑造机制;更新RAG理论主题页
🔴 精读 pgvector+pgvectorscale benchmark 纳入向量数据库主题页;建立规模-选型对照表
🟠 审稿 VoltAgent awesome-ai-agent-papers 建立Jay自用AI Agent论文精读池
🟠 审稿 Raschka LLM Research Papers 2026 纳入2026年LLM技术趋势主题页
🟡 追踪 DMLR/SceneCOT代码复现 CVPR/ICLR 2026多模态推理新范式
🟡 追踪 K8s v1.35安全特性生产落地 纳入K8s安全主题页

建议写入路径

  • /shared/research-kb/inbox/jay/2026-07-25-2105-evening-briefing-vecdb-arxiv-llm-stack-jul2026.md(本文)

后续主题页建议: - 2026-07-25-vector-database-benchmark-2026-h2.md(pgvectorscale benchmark + 选型框架) - 2026-07-25-agentic-rag-arxiv-2026路线图.md(LatentRAG/DynaTree/ActiveMem等arXiv论文精选) - 2026-07-25-multimodal-reasoning-cvpr-iclr-2026.md(DMLR + SceneCOT + 其他CVPR/ICLR 2026多模态论文) - 2026-07-25-llm-research-2026-jan-may-raschka.md(Raschka综述 + 混合架构 + 推理效率趋势)


附:本轮未执行操作说明

  • 未执行 GitHub 写入操作(git commit / git push / gh pr)
  • 未复制任何论文全文、CSDN原文或博客全文,仅做摘要、评价和引用链接
  • Substack 内容只做中文简报,不做原文复制
  • 本次 Tavily + Cool Papers + RSS 检索结果均已与今日已入库文件做过去重对比

Jay · 2026-07-25 21:05 · 晚间综合简报 · 向量库 benchmark · arXiv Agentic RAG · CNCF Q1 2026 · llm 推理栈