Jay · 知识库简报 · 2026-08-08(第三次)

实例: Jay · 第三次简报 时间: 2026-08-08 11:05 CST 主题: AI Systems / LLM / Agent / RAG + Database 近期高价值内容整理


📂 分类速览

类别 条目数 最高价值
AI Systems / LLM 7 ⭐⭐⭐
RAG 4 ⭐⭐⭐
Multimodal 3 ⭐⭐
Database 5 ⭐⭐⭐
Cloud-Native / Backend 3
MLOps / Inference 3 ⭐⭐

🔷 AI Systems / LLM / Agent(7 条)

1. ⭐⭐⭐ Agent Skills for Large Language Models

  • 来源: arXiv:2602.12430 (cs.MA)
  • 作者: 多作者
  • 会议: Agent Skills '26 Workshop @ ACM Conference on AI and Agentic Systems 2026
  • 内容: LLM Agent 的架构设计、技能获取、安全威胁与路径展望的系统性综述,覆盖工具调用、多步推理、记忆管理、安全评测等核心议题。
  • 评价: Agent Skills '26 是今年 ACM AI Agentic Systems 会议的专项 Workshop,该文为受邀接受论文,代表了 LLM Agent 工程化的前沿共识,适合作为 Agent 系统设计的参考基准。
  • 可信度: 高(arXiv + 学术会议接收)
  • 链接: https://arxiv.org/abs/2602.12430
  • 后续行动: 精读 architecture + security 章节;考虑写入 topics/llm-agent-architecture.md

2. ⭐⭐⭐ AI Agent Systems: Architectures, Applications, and Evaluation

  • 来源: arXiv:2601.01743 (cs.AI)
  • 内容: AI Agent 的架构、应用场景与评估方法的综合综述。
  • 评价: 覆盖面广,适合建立 Agent 系统全景认知。
  • 可信度: 高(arXiv 2026 年 1 月)
  • 链接: https://arxiv.org/abs/2601.01743
  • 后续行动: 泛读,提取架构分类框架

3. ⭐⭐⭐ VoltAgent/awesome-ai-agent-papers

  • 来源: GitHub · VoltAgent
  • 内容: 2026 年精选 AI Agent 论文列表,持续从 arXiv 过滤,按多智能体(53)、记忆与 RAG(57)、评测与可观测性(80)、工具调用(95)、安全(82)分类。
  • 评价: 目前最活跃的 AI Agent 论文追踪仓库,覆盖广且更新及时;推荐收藏并每周浏览一次。
  • 可信度: 高(社区维护,持续更新)
  • 链接: https://github.com/VoltAgent/awesome-ai-agent-papers
  • 后续行动: 纳入每周例行浏览清单

4. ⭐⭐⭐ SoK: Agentic RAG 系统化研究

  • 来源: awesome-generative-ai-guide / RAG Research Table(2026-03 更新)
  • 作者: Şakar & Emekci 等
  • 内容: Agentic RAG 的系统化综述,以控制理论框架(control-theoretic framing)为基础,补充了 2025 年早期 Agentic RAG 调研,提供更形式化的风险分析(幻觉传播、记忆污染、检索错位)。
  • 评价: 2026 年 3 月最新 RAG Survey,将 Agentic RAG 定位为"记忆+推理+治理的统一层",对 RAG 系统可靠性和安全性的分析有重要参考价值。
  • 可信度: 高(学术综述,2026-03)
  • 链接: https://github.com/aishwaryanr/awesome-generative-ai-guide/blob/main/research_updates/rag_research_table.md
  • 后续行动: 精读;提取 Agentic RAG 评估维度

5. ⭐⭐⭐ EvoEmbedding

  • 来源: awesome-generative-ai-guide / RAG Research Table(2026-06)
  • 内容: 演化式长上下文 Embedding 模型,可在超出训练窗口 10 倍的上下文中保持检索性能;在一系列长上下文检索基准上超越了 Qwen3-Embedding-8B 等更大的专用模型。配备朴素 RAG 管道后即可超越专用 Agentic Memory 系统。
  • 评价: 2026 年 6 月最新 Embedding 研究;核心创新在于演化式上下文扩展方法,嵌入层状态追踪成为 Agentic 工作流的关键杠杆。高优先级精读。
  • 可信度:
  • 链接: 同上 RAG Research Table(GitHub)
  • 后续行动: 精读论文;评估工程复现可行性

6. ⭐⭐ MemoRAG

  • 来源: awesome-generative-ai-guide / RAG Research Table(2026-06)
  • 内容: 双系统 RAG 架构:轻量级大模型生成草稿答案并引导检索,强大模型生成最终答案;增强长程记忆能力,处理传统 RAG 难以胜任的复杂任务。
  • 评价: 下一代 RAG 的代表性方向之一,双系统设计是当前 Agentic Memory 的主流范式;适合在主题页"Advanced RAG"部分引用。
  • 可信度:
  • 链接: 同上 RAG Research Table(GitHub)
  • 后续行动: 泛读;记录双系统设计要点

7. ⭐⭐ Agentifying Agentic AI(AAAI WMAC 2026 Bridge)

  • 来源: arXiv:2511.17332v2
  • 内容: 论证在 Agentic AI 系统中引入结构化推理(BDI 架构)、形式化交互协议和制度治理模型的必要性;主张将 AAMAS 社区的经典多智能体系统工具与基础模型结合。
  • 评价: 从自主智能体社区视角审视 Agentic AI 的治理与协调问题;适合在 Agent 安全性与治理讨论中引用。
  • 可信度: 高(arXiv + AAAI 2026 Bridge Program)
  • 链接: https://arxiv.org/html/2511.17332v2
  • 后续行动: 泛读;提取治理/协调相关论点

🔷 RAG(补充 4 条)

8. ⭐⭐⭐ All you need to know about RAG (in 2026)

  • 来源: Aishwaryan Srinivasan Substack(付费)
  • 内容: 2026 RAG 实战指南,覆盖 Chunking 策略、Cross-Encoder Re-Ranker(优于 bi-encoder)、Hybrid Search(稀疏+密集向量融合)、Cohere Rerank 3.5 / BGE-Reranker 使用方法。
  • 核心 Pipeline(2026): Hybrid Search 取 Top 100 → Re-Ranker 精排 → Top 5-10 送 LLM
  • 评价: 工程实用性强,作者为 Substack 高质量 AI 写作者;建议记录核心结论但不引用原文大段内容。Naive RAG 已死("Hello World" is officially dead),高级 RAG 需要端到端优化。
  • 可信度: 高(作者为 ML/NLP 从业者,付费内容不代表错误)
  • 链接: https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-rag-in
  • 后续行动: 记录核心 Pipeline 结论;按需精读

9. ⭐⭐ Agentic RAG 的 20 种进阶类型

  • 来源: TuringPost(2026)
  • 内容: 20 种 Advanced RAG 模式总结,涵盖:A-RAG(层级化 Agentic 检索接口)、多步自适应检索、多模态 RAG、多语言 QA、图推理 RAG、安全增强等。
  • 评价: 系统梳理了 2026 年 RAG 的演进方向,可作为 RAG 主题页的分类索引。
  • 可信度: 中高(技术媒体整理)
  • 链接: https://www.turingpost.com/p/ragtypes
  • 后续行动: 补充进 topics/rag-advanced-types.md

10. ⭐⭐ ACM WebConf 2026 RAG 相关论文(3 篇)

  • 来源: ACM Digital Library — WWW 2026 1. Dense Retriever 在 RAG 中的性能退化问题(Pages 2160–2170) 2. 图增强 RAG:实体中心 vs Chunk 中心的局限性(Pages 2477–2488) 3. AgenticShop:RAG 在电商商品推荐中的多源融合评测(Pages 2114–2125)
  • 评价: WWW 2026 的 RAG 论文偏向系统与评测,宽泛检索与图结构是两个主流改进方向。
  • 可信度: 高(ACM 同行评审)
  • 链接: https://dl.acm.org/doi/proceedings/10.1145/3774904
  • 后续行动: 按需精读

11. ⭐⭐ RAG Survey(Springer, 2026-01)

  • 来源: Springer · Data Science and Engineering(2026)
  • 内容: RAG for AI-Generated Content 综合调研,涉及时空预测、时序基础模型等跨学科应用;指出"噪声检索可能反而提升生成质量"这一反直觉结论(The Power of Noise)。
  • 评价: 开放获取论文,系统性较强;"噪声的力量"一节值得工程落地时参考。
  • 可信度: 高(Springer 期刊,2026-01)
  • 链接: https://link.springer.com/article/10.1007/s41019-025-00335-5
  • 后续行动: 泛读;提取 RAG 评估指标

🔷 Multimodal(3 条)

12. ⭐⭐ LiME: Lightweight MoE Multimodal Multi-task Learning

  • 来源: ICML 2026(Spotlight 2%)
  • 内容: 轻量级专家混合模型,用于高效多模态多任务学习。
  • 评价: ICML 2026 Spotlight 论文,稀疏化 MoE 是 2026 多模态模型压缩的主流方向。
  • 可信度: 高(ICML Spotlight)
  • 链接: https://arxiv.org(搜索 LiME ICML 2026)
  • 后续行动: 精读;关注参数效率与任务泛化权衡

13. ⭐⭐ SciVideoBench: Scientific Video Reasoning Benchmark

  • 来源: ICML 2026
  • 内容: 科学视频推理评测基准,评估大型多模态模型在科学视频理解上的能力。
  • 评价: 填补了科学视频推理领域基准空白;与 Vision-DeepResearch 形成互补。
  • 可信度: 高(ICML 2026)
  • 后续行动: 泛读;关注 benchmark 设计方法

14. ⭐⭐ Vision-DeepResearch Benchmark

  • 来源: arXiv:2602.02185v1
  • 内容: 评估 MLLM 在视觉+文本联合搜索、多跳推理方面的深度研究能力;测试集涵盖 10 个视觉领域,包括 Gemini 2.5 Pro、GPT-5、Claude-4-Sonnet、Qwen3-VL 等主流模型。
  • 评价: 首个视觉深度研究能力评测基准,对 VLM 的视觉信息定位与多步推理能力区分度较高。
  • 可信度: 高(arXiv 2026)
  • 链接: https://arxiv.org/html/2602.02185v1
  • 后续行动: 泛读;记录 benchmark 评测维度

🔷 Database(5 条)

15. ⭐⭐⭐ Learned Query Optimizer in MaxCompute

  • 来源: arXiv 2026(阿里 MaxCompute 团队)
  • 内容: 阿里 MaxCompute 生产环境 Learned Query Optimizer 的实战挑战与分析,包括成本模型训练、规划空间设计、在线调优闭环。
  • 评价: 代表了工业界 Learned Optimizer 从研究到落地的完整经验分享;对自研数据库团队有直接参考价值。
  • 可信度: 高(工业界生产系统)
  • 链接: https://github.com/LumingSun/ML4DB-paper-list(引用来源)
  • 后续行动: 精读;提取生产级 Learned Optimizer 关键设计点

16. ⭐⭐⭐ Divo: Stable Learned Query Optimizer with Diverse Workload

  • 来源: SIGMOD 2026
  • 内容: 通过多样化工作负载学习稳定、有效的查询优化器,解决 Learned Optimizer 过拟合历史工作负载、泛化能力差的问题。
  • 评价: SIGMOD 2026 论文;Diversity-driven Learning 是 Learned Optimizer 稳定性的核心问题,值得深入。
  • 可信度: 高(SIGMOD 2026 同行评审)
  • 后续行动: 精读;对比 MaxCompute 方案的异同

17. ⭐⭐ LazyAttention: Efficient RAG with Deferred Positional Encoding

  • 来源: ICML 2026(Yongjoo Park 等)
  • 内容: 用延迟位置编码实现高效 RAG,在长上下文检索中降低注意力开销。
  • 评价: ICML 2026;作者 Yongjoo Park 为数据库学习领域活跃研究者(SIGMOD 2017 "Database Learning" 论文引用很高),该文将 DB 优化思想引入 LLM 推理,值得关注。
  • 可信度: 高(ICML 2026 + 知名研究者)
  • 链接: https://yongjoopark.com/publication(论文列表页)
  • 后续行动: 精读;关注 Deferred PE 的工程实现

18. ⭐⭐ OmniTune: Universal Query Refinement via LLMs

  • 来源: SIGMOD 2026
  • 内容: 基于 LLM 的通用查询优化与重写框架,支持跨数据库系统的查询精炼。
  • 评价: SIGMOD 2026;代表了 LLM 在查询优化中的实际工程应用。
  • 可信度: 高(SIGMOD 2026)
  • 后续行动: 泛读;记录 LLM Query Rewrite 技术路线

19. ⭐⭐ Graph Transformers for Query Plan Representation

  • 来源: VLDB 2026
  • 内容: 图Transformer在查询计划表示中的潜力与挑战分析。
  • 评价: VLDB 2026;图表示是 Learned Query Optimizer 的重要分支,有助于将优化器从规则系统迁移到可学习表示。
  • 可信度: 高(VLDB 2026)
  • 后续行动: 泛读;提取 Query Plan GNN 表示要点

🔷 Cloud-Native / Backend(3 条)

20. ⭐ Service Mesh 市场报告 2034

  • 来源: DataIntelo 市场调研
  • 内容: 2025 年市场 $1.8B → 2034 年 $13.6B,CAGR 25.1%;Cilium eBPF 原生方案和 Istio Ambient Mode 为 2026 年领先实现。
  • 评价: 市场规模数据可参考 Cilium/Istio 趋势;但无技术深度。
  • 可信度: 中(市场报告,非学术)
  • 链接: https://dataintelo.com/report/global-service-mesh-market
  • 后续行动: 低优先级;关注 Cilium eBPF 动向

21. ⭐ KubeCon + CloudNativeCon 2026 日程

  • 来源: CNCF
  • 内容: 2026 年三场活动: Mumbai(6 月 18-19)、日本横滨(7 月 29-30)、上海(9 月 8-9);上海站值得关注。
  • 评价: 可作为云原生技术趋势的年度参考节点。
  • 可信度: 高(CNCF 官方)
  • 链接: https://www.cncf.io/blog/(相关博客页)
  • 后续行动: 关注上海站(9 月)后续资料释放

  • 来源: Medium · Orlando Hurtado
  • 内容: 2026 年编排趋势:Kubernetes 仍是大型多云部署首选,K3s 适合轻量边缘,Nomad 提供多语言调度;平台工程从"管理单个技术"转向"组合最佳工具"。
  • 评价: 非原创性研究,但汇总了 2026 年平台工程的主流认知。
  • 可信度:
  • 后续行动: 低优先级

🔷 MLOps / LLM Inference(3 条)

23. ⭐⭐ LLM Inference Engines 2026 Comparison

  • 来源: YouTube / Uplatz;Spheron Blog
  • 内容: vLLM vs SGLang vs TensorRT-LLM vs NVIDIA Dynamo 四大推理引擎对比:
  • vLLM v0.19.0: 最广泛部署,chunked prefill,OpenAI API 兼容,AMD/Intel 硬件支持
  • TensorRT-LLM: NVIDIA H100/B200 上最高原始吞吐,但运营复杂、需要专业团队
  • SGLang: 高吞吐量长上下文场景优选
  • NVIDIA Dynamo: 新兴框架,定位介于 vLLM 和 TRT-LLM 之间
  • 评价: 实用选型指南;推理已超越训练成为 2026 年 GPU 算力主要消耗。
  • 可信度: 中高(技术博客 + 视频综合)
  • 链接: https://www.spheron.network/blog/inference-engineering-guide-2026
  • 后续行动: 记录选型决策树;更新 MLOps 主题页

24. ⭐⭐ 2026 LLM Inference 延迟基准(欧洲)

  • 来源: Lyceum Technology(2026-06)
  • 内容: 欧洲市场 H100 推理延迟实测;数据主权要求驱动本地部署需求;vLLM + TensorRT-LLM 开源方案在欧洲 AI 团队中的采用率上升。
  • 评价: 提供了 2026 年推理基础设施的成本-性能参考框架;TTFT/TPS 指标对工程团队有直接参考价值。
  • 可信度: 中高(技术媒体实测)
  • 链接: https://lyceum.technology/magazine/llm-inference-latency-europe-benchmark-2026
  • 后续行动: 泛读;提取 TTFT/TPS 优化策略

25. ⭐⭐ MLOps in 2026: From MLflow to LLMOps

  • 来源: Medium · Codex
  • 内容: 从 MLOps 到 LLMOps 的范式转变;传统 MLOps 假设模型是离散制品,LLMOps 需要管理:API 成本(10-100x 传统推理)、非确定性输出、幻觉风险、Prompt 敏感性;研究显示全面 MLOps 策略带来 189%-335% 的 3 年 ROI。
  • 评价: 综述性强,适合建立 LLMOps 认知框架;核心洞见:API 成本管理与幻觉监控是 LLMOps 区别于传统 MLOps 的两大新挑战。
  • 可信度:
  • 链接: https://medium.com/codex/mlops-in-2026-from-mlflow-to-llmops-the-complete-guide-to-shipping-ai-in-production-0024955b70c4
  • 后续行动: 泛读;提炼 LLMOps checklist

🏷️ 分类标签

AI-Systems  LLM  Agent  RAG  Multimodal
Database  Query-Optimizer  Learned-DB  Cloud-Native
MLOps  LLMOps  Inference-Engine  vLLM  TensorRT-LLM
ACM-2026  ICML-2026  VLDB-2026  SIGMOD-2026

📋 建议写入路径

优先级 路径 内容
topics/llm-agent-architecture.md 条目 1、2(Agent Skills + Survey)精读结论
topics/rag-advanced-types.md 条目 8、9、15、16(RAG Pipeline + MaxCompute + Divo)
topics/inference-engineering.md 条目 23、24(vLLM/TensorRT-LLM/SGLang 对比,欧洲基准)
topics/multimodal-mllm-2026.md 条目 12、13、14(LiME、SciVideoBench、Vision-DeepResearch)
topics/ml4db-learned-optimizer.md 条目 15、16、17、18、19(MaxCompute/Divo/LazyAttention/OmniTune/GraphTR)
topics/cloud-native-2026.md 条目 20、21(Cilium/Istio、KubeCon 上海)

✅ 本次行动清单

  • [ ] 精读 arXiv:2602.12430(Agent Skills)→ 写入 topics/llm-agent-architecture.md
  • [ ] 精读 EvoEmbedding(2026-06 RAG Table)→ 评估复现可行性
  • [ ] 精读 MemoRAG → 补充 Agentic Memory 主题页
  • [ ] 泛读 LazyAttention(ICML 2026, Yongjoo Park)
  • [ ] 记录 vLLM vs TRT-LLM 选型决策树 → 更新 inference-engineering.md
  • [ ] 关注 2026-09 KubeCon 上海站后续资料
  • [ ] 检查 /shared/research-kb/inbox/ 其他实例草稿(去重)

Jay · 2026-08-08 第三次简报 · 共 25 条条目,3 条⭐⭐⭐