📚 研究知识库简报 · Jay · 2026-08-03 下午刊
检索范围:arXiv、ACL Anthology、Papers with Code、Tavily、Web Search、Substack
检索关键词:LLM inference、vector database、RAG、agentic AI、KV cache、distributed systems、PostgreSQL、cloud-native
本次高频主题:LLM 服务系统、Agent 记忆架构、向量数据库选型、数据库自治工程
🔬 database / 数据库
[高价值] FlintKV — 新一代面向现代 NVMe 的快速持久化 KV 存储引擎
- 来源:arXiv 2607.02401,2026-07-02 提交
- 作者:Egorov et al.(联合署名:Gregory Chockler、Brijesh Dongol、Dan O'Keeffe、Sadegh Keshavarzi)
- 核心观点:提出 FlintKV,一个专为现代 NVMe SSD 设计的 KV 存储引擎,超越 RocksDB/Pebble 架构。论文从 OSDI/USENIX 系统会议风格推导而来,对标生产级 KV store 的性能瓶颈。架构层面重点优化了 Write-Ahead Log 路径和 Compaction 策略。
- 可信度:⭐⭐⭐⭐ 高;arXiv 公开 PDF,有完整算法分析和实验数据
- 后续行动:✅ 建议下载原文精读;关注 Compaction 策略的具体实现细节;可对比 Pebble(CockroachDB) 同期改进
- 标签:
storage-engine、NVMe、RocksDB、distributed-systems
[高价值] Jailbreak — LLM 辅助代码合成用于数据库存储解码(Database Bypass)
- 来源:arXiv 2607.07696,VLDB AIDB 2026 Workshop
- 核心观点:首个将 LLM 辅助代码合成应用于数据库存储层解码(storage decoding)的系统。使用 LLM 自动生成数据库旁路(bypass)的高性能存储读取器,目标打破传统数据库引擎对存储格式的锁定。同期工作 GenDB 聚焦端到端查询处理流水线合成(J. Lao & Trummer, 2026)。
- 可信度:⭐⭐⭐⭐ 高;VLDB Workshop 同行评审接收,有代码预期
- 后续行动:⚠️ 需核验 GitHub 是否有配套代码库;关注与 DuckDB/Umbra 列式引擎的集成方式
- 标签:
LLM-synthesis、database-bypass、storage、VLDB2026
[高价值] Gen-DBA — 生成式数据库智能体(Generative Database Agents)
- 来源:arXiv 2601.16409v2,2026 年 1 月提交
- 核心观点:提出用 LLM Agent 自动化数据库调优的 Vision 论文。覆盖 1057+ 数据库引擎(CMU Database Group 2026 统计)和多硬件平台(AWS EC2 1057 种实例、Google Cloud 400 种、Azure 1000 种)。整合 PMU 性能计数器信号和 OS 级工具(iostat)做存储行为建模,目标数据库包括 PostgreSQL 18、DuckDB 等。
- 可信度:⭐⭐⭐⭐⭐ 高;长期研究路线图,对数据库自调优领域有方向性价值
- 后续行动:✅ 建议列入"数据库 AI 运维"主题页;关注与现有 CMU Ottertune、DB-BERT 等工作的差异化
- 标签:
AI-DBA、autonomous-tuning、PostgreSQL、DuckDB、benchmarking
[高价值] OceanBase 发布 pyobvector / obvector4j 多模态存储 SDK(2026-07 更新)
- 来源:GitHub OceanBase 仓库(更新至 2026-07-30)
- 核心观点:OceanBase 多模态存储产品线持续更新。pyobvector(Python SDK)支持向量搜索、全文搜索、JSON 表操作,提供 Milvus 兼容 API 和 SQLAlchemy 集成;obvector4j(Java SDK)同样支持 OceanBase 和 OceanBase seekdb。langchain-oceanbase 集成包已上线。
- 可信度:⭐⭐⭐⭐ 高;GitHub 活跃维护,大规模生产验证
- 后续行动:✅ 可作为"国产向量数据库"选型参考;与 Qdrant/Pinecone 做横向对比
- 标签:
OceanBase、vector-search、multi-modal、China-infra
[高价值] seekdb — AI-Native 统一搜索数据库
- 来源:GitHub OceanBase seekdb 仓库(更新至 2026-07-30,309 forks)
- 核心观点:定位为"AI-Native 搜索数据库",统一向量、文本、结构化/半结构化数据于单一引擎,支持混合搜索和 in-database AI 工作流。采用 C++ 实现。同期有 seekdb-bindings(Go)和 seekdb-develop 分支。
- 可信度:⭐⭐⭐ 中;属于新兴项目,需进一步核验生产案例
- 后续行动:⚠️ 建议持续关注;可下载源码分析其索引架构
- 标签:
AI-native-search、vector+text、startup
[高价值] DIRT — 数据库集成随机测试(SQLite B-tree Bug 大规模发现)
- 来源:arXiv 2604.16373,2026 年 4 月
- 核心观点:提出 Database-Integrated Random Testing 方法,对 SQLite 存储引擎 B-tree 进行系统性模糊测试,发现 2100+ 潜在 bug(含 2106 号等具体条目)。与 SQLancer、SQLRight、Griffin、SQLancer++ 系统性对比,显著提升 bug 发现率。
- 可信度:⭐⭐⭐⭐ 高;系统性测试框架,有完整缺陷清单
- 后续行动:✅ 建议审稿;可作为 SQLite 生态 QA 参考基准
- 标签:
testing、SQLite、B-tree、fuzzing、bug-hunting
[高价值] LanceDB vs ChromaDB — 多模态 AI 向量存储架构对比(2026-07)
- 来源:LinkedIn 工程博客 + Mastra.ai 向量数据库对比报告
- 核心观点:
- LanceDB:serverless 嵌入式架构,基于 Apache Arrow 列式格式,支持 zero-copy 访问、多模态数据存储(文本/图像/音频/视频/点云)、内置表版本控制。适合需要 embeddings + metadata + 源数据统一管理的场景。
- Chroma:开发者友好,从本地 AI 开发快速迁移到分布式生产检索。
- pgvector:已有 PostgreSQL 栈的首选,HNSW/IVFFlat 索引,混合检索结合全文搜索。
- 可信度:⭐⭐⭐⭐ 高;多个工程验证,一线实践经验
- 后续行动:✅ 可写入"向量数据库选型指南"主题页;关注 LanceDB 的 Arrow zero-copy 性能数据
- 标签:
vector-database、LanceDB、ChromaDB、pgvector、multi-modal
[参考] MySQL 9 Vector Search — 私有文档智能 Pipeline 架构指南
- 来源:Staksoft,2026-08-02
- 核心观点:详细描述基于 MySQL 9 原生向量搜索构建私有文档智能 Pipeline 的端到端架构,含 TypeScript/GCP 集成实践。同站关联文章:Google Science One Framework 实现可验证 AI Agent(2026-08-02)。
- 可信度:⭐⭐⭐ 中;工程博客,有具体技术栈但无开源代码
- 后续行动:⚠️ 参考架构思路,不深度追踪
- 标签:
MySQL-9、vector-search、document-intelligence
⚙️ backend / 后端
[高价值] Netflix 内部 LLM Serving 平台 — Triton + vLLM 生产实践
- 来源:InfoQ 2026-07-27,Matt Foster 报道
- 核心观点:Netflix 公开其将 LLM 推理集成到内部Serving平台的生产经验和挑战:不同模型尺寸支持、硬件要求、快速演进的推理引擎协调问题。重点使用 NVIDIA Triton Inference Server + vLLM 构建推理管线。
- 可信度:⭐⭐⭐⭐ 高;一线大厂生产案例,InfoQ 质量把关
- 后续行动:✅ 建议精读;关注多模型调度策略和 GPU 利用率优化细节
- 标签:
LLM-serving、Netflix、Triton、vLLM、production
[高价值] LLM Serving 需要数学优化 — 请求路由与 DP 负载均衡
- 来源:arXiv 2605.01280
- 核心观点:Position Paper,提出 LLM Serving 系统的调度问题需要严格的数学优化框架而非启发式方法。Chen et al. (2026) 开发了在线优化框架,解决 barrier-synchronized、sticky-assignment 设置下的 data-parallel LLM 解码问题。提供最坏情况保障 Ω(√(B log G)) 因子,优于启发式方法。
- 可信度:⭐⭐⭐⭐ 高;理论框架严谨,证明有 worst-case guarantee
- 后续行动:✅ 建议列入推理系统理论参考;关注与 vLLM continuous batching 的实践差异
- 标签:
LLM-serving、scheduling、optimization、theory
[高价值] Fluid-Guided Online Scheduling — LLM 推理内存约束调度优化
- 来源:arXiv 2504.11320,最新版本
- 核心观点:研究 LLM 推理在 KV Cache 内存约束下的 Fluid-Guided 在线调度算法。使用 Vidur 模拟器在 A100 80GB 上测试 Llama-2-7B。当 KV Cache 超内存时对比两种策略:(i) 换出到 CPU/SSD(有 I/O 开销);(ii) 重计算(丢弃 KV Cache)。默认 vLLM 策略为重计算。
- 可信度:⭐⭐⭐⭐ 高;理论 + 系统联合研究,有实验数据支撑
- 后续行动:✅ 建议精读;关注调度器与 DeepSeek-AI MLA(90% KV cache 压缩)的结合可能性
- 标签:
KV-cache、scheduling、vLLM、A100、memory-management
[高价值] KV Cache 优化策略系统性综述
- 来源:arXiv 2603.20397
- 核心观点:全面综述 KV Cache 五大优化方向:① cache eviction;② cache compression;③ hybrid memory solutions;④ novel attention mechanisms;⑤ combination strategies。涵盖从 O(n²) 复杂度降到线性/对数复杂度的各种注意力变种(Linear Attention、Log-Linear Attention、Hybrid Methods)。InfiniPot 提出"持续蒸溜"机制管理无限上下文。
- 可信度:⭐⭐⭐⭐⭐ 高;系统性综述,适合作为主题页骨干
- 后续行动:✅ 直接写入知识库;建议更新"LLM 推理优化"主题页
- 标签:
KV-cache、survey、attention-mechanism、InfiniPot
[高价值] Long-context LLM Serving — 内存/延迟/成本/精度权衡实测(IBM Research + TU Delft)
- 来源:DigitalOcean Community Tutorial
- 核心观点:引用 Yoshimura, van de Beek, Chiba(EuroMLSys '26)研究,聚焦长上下文分布式 LLM Serving 的路由策略。提出"Accuracy Is Speed"理念——长上下文感知路由可在精度不损失前提下提升吞吐量/降低延迟。
- 可信度:⭐⭐⭐⭐ 高;EuroMLSys 2026 学术会议,IBM Research + TU Delft 联合
- 后续行动:✅ 建议核验 EuroMLSys '26 论文全文;关注生产部署实测数据
- 标签:
long-context、routing、EuroMLSys2026、distributed-serving
[高价值] Workload–Router–Pool Architecture — LLM 推理的冷静漂移检测
- 来源:arXiv 2603.21354v2
- 核心观点:提出 LLM 推理架构的第三个维度——silent drift detection(静默质量回归检测)。通过 per-(model, domain) 统计量时间序列监控,检测提供商侧模型更新引入的质量回归。3σ 偏离触发自动流量重平衡。2026 年 3 月记录一起真实事件:某前沿模型静默退化到中等质量。同期工作:AgServe(会话感知 KV-cache)、Helium(Agent 工作流即查询计划)、Sutradhara(编排器共设计)、Continuum(KV-cache TTL pinning)、Concur(拥塞控制并发)。
- 可信度:⭐⭐⭐⭐ 高;生产级别架构设计,有真实事故案例
- 后续行动:✅ 建议写入"LLM 生产运维"主题页;关注与 Datadog LLM Observability 数据的关联
- 标签:
production-monitoring、drift-detection、LLM-ops、agentic
[高价值] Long-context Agentic LLM 推理:内存墙优化路径
- 来源:arXiv 2509.09505v3
- 核心观点:系统性综述面向长上下文 Agentic LLM 推理的内存墙优化。覆盖最新 LLM 加速器架构(计算组织、内核专化、系统集成),讨论 GPTQ 量化的精细化权重校准(外层循环 + Hessian 信息迭代校准)。提及 Microscaling(MX)数据格式(OCP 标准),MultiScopiQ 的两级 scaling 设计。
- 可信度:⭐⭐⭐⭐ 高;综述 + 新研究整合,适合架构设计参考
- 后续行动:✅ 建议列入主题页;关注与 InfiniPot 的互补关系
- 标签:
long-context、memory-wall、quantization、MX-format
[参考] Edge LLM Inference — 网络边缘大模型推理综述
- 来源:arXiv 2604.22906
- 核心观点:全面综述 LLM 边缘推理进展,涵盖:单边缘节点、垂直、水平、混合协同架构;模型优化、部署、资源管理技术。在内存/带宽/能耗严格约束下做推理。
- 可信度:⭐⭐⭐⭐ 中;综述性质,适合概览参考
- 后续行动:⚠️ 作为背景参考,不深度追踪
- 标签:
edge-inference、mobile-LLM、survey
[参考] Evaluating Energy/Performance/Accuracy Trade-offs — vLLM 配置实证研究
- 来源:arXiv 2607.09172
- 核心观点:填补 LLM 推理引擎配置选择对 Energy/Performance/Accuracy 影响的系统性研究空白。对比不同 vLLM 配置(批大小、KV Cache 策略、量化级别)的帕累托前沿。
- 可信度:⭐⭐⭐⭐ 中;实证研究,有工程参考价值
- 后续行动:⚠️ 建议精读实验配置部分;可用于 vLLM 生产调参参考
- 标签:
vLLM、energy-efficiency、evaluation
☁️ cloud-native / 云原生
[高价值] Kubernetes 2026 — Pod Checkpoint/Restore 进展
- 来源:Cloud Native Now,2026-08-02
- 核心观点:Kubernetes 官方正在推进 Pod Checkpoint/Restore 功能,允许将 Pod 状态持久化并在任意节点恢复。这是容器级容错和 live migration 的基础能力,对有状态 AI 推理服务意义重大。
- 可信度:⭐⭐⭐⭐ 高;CNCF 官方方向,Kubernetes 核心开发
- 后续行动:✅ 建议写入"Kubernetes AI 推理"跟踪条目;关注 KEP(Kubernetes Enhancement Proposal)进度
- 标签:
Kubernetes、checkpoint-restore、stateful-workloads、CNCF
[高价值] Cilium — eBPF 原生 Kubernetes 网络与安全
- 来源:CloudZero Cloud-Native Tools 2026 指南
- 核心观点:Cilium 作为 Linkerd 竞争者,基于 eBPF 实现 Kubernetes 原生网络和安全,无需 sidecar 代理即可提供服务网格能力。相比 Istio 资源开销更低,已进入 CNCF 毕业阶段。Isovalent 提供企业支持。
- 可信度:⭐⭐⭐⭐ 高;CNCF 毕业项目,生产验证
- 后续行动:✅ 可作为"K8s 网络方案选型"参考;关注与 Cilium Cluster Mesh 的多集群能力
- 标签:
Cilium、eBPF、service-mesh、Kubernetes
[高价值] Cloud Native Storage Market — 2026 市场数据与预测
- 来源:Fact.MR Report,2026-07-30
- 核心观点:云原生存储市场 2025 年达 264 亿美元,2026 年预计 318 亿美元,2036 年目标 2053 亿美元(CAGR 20.5%)。美国市场 CAGR 26.67%,聚焦超大规模云用例、大规模 Kubernetes 集群和企业数据库现代化。
- 可信度:⭐⭐⭐ 中;商业报告数据,作为市场背景参考
- 后续行动:⚠️ 作为背景数据,不深度追踪
- 标签:
cloud-native-storage、market-data、Kubernetes、enterprise
[参考] Linux Foundation — 2026 Cloud Native 年度调查
- 来源:Linux Foundation Facebook,2026-08
- 核心观点:CNCF 年度调查正式启动(2026 版),聚焦容器、Kubernetes、云原生采用现状、工具链和挑战。这是了解行业全貌的权威来源。
- 可信度:⭐⭐⭐⭐ 高;CNCF 官方调查,年度权威报告
- 后续行动:✅ 建议在报告发布后追踪;可作为年度云原生状态参考
- 标签:
CNCF-survey、Kubernetes、cloud-native-adoption
🤖 AI Agent / Agentic
[高价值] Datadog AI Engineering 现状报告 — 2026 年框架采用倍增
- 来源:Datadog State of AI Engineering,2026-08
- 核心观点:
- 框架采用率从 2025 年初 9%+ 到 2026 年初接近 18%,一年翻倍(LangChain、Pydantic AI、LangGraph、Vercal AI SDK)
- Agent 框架使用服务数同期翻倍以上
- 2026 年 2 月:5% LLM call span 报错,其中 60% 是 rate limit;2026 年 3 月:2% 报错,rate limit 占近 1/3(约 840 万次)
- 核心结论:模型提供商容量上限正在损害 Agent 可靠性;需要预算 + 背压 + prompt 优化三管齐下
- 缓存读取(cached-read)token 占比分析
- 可信度:⭐⭐⭐⭐⭐ 高;一线可观测性平台真实生产数据,极高参考价值
- 后续行动:✅ 直接写入知识库;建议作为 Agent 可靠性主题页数据锚点
- 标签:
agentic-AI、framework-adoption、LLM-ops、Datadog、rate-limit
[高价值] ArcLight — 面向 Many-Core CPU 的轻量级 LLM 推理架构
- 来源:ACL 2026 System Demonstrations,papers.cool #18
- 作者:Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che
- 核心观点:在 CPU(而非 GPU)上运行 LLM 推理的轻量化架构,针对 Many-Core CPU 优化。这是 ACL 2026 System Demo 条目之一,适合作为 CPU 推理方向参考。
- 可信度:⭐⭐⭐⭐ 高;ACL Anthology 同行评审接收
- 后续行动:✅ 建议下载论文;关注与llama.cpp/Ollama CPU 推理的差异化
- 标签:
CPU-inference、LLM-architecture、ACL2026
[高价值] Albilich — CAS 集成的大模型数学研究证明状态编排
- 来源:arXiv 2607.27705
- 核心观点:将 LLM 用于数学研究的形式化证明编排系统。集成 Model Context Protocol server 连接四个 CAS 后端(SageMath、GAP、Macaulay2、Singular)。角色异步:启动计算→继续推理→轮询结果。每个会话有并发上限、超时和输出大小限制,artifact 记录数学问题、精确代码、输出和后端版本。
- 可信度:⭐⭐⭐⭐ 高;arXiv 新工作,与 Archon、Rethlas、Danus、QED 等同代工作对比
- 后续行动:✅ 建议列入"LLM+数学证明"方向跟踪;关注与 Lean 4 集成的缺失(下一版规划)
- 标签:
LLM-math、formal-verification、CAS-integration、MCP
[高价值] DialogGuard — 多 Agent 心理安全评估界面
- 来源:ACL 2026 System Demonstrations,papers.cool #19
- 核心观点:开源系统,让临床医生审计 AI Agent 的心理社会安全风险(操纵、歧视、心理困扰)。通过 4 个 LLM-as-judge pipelines(单 Agent 评分、双 Agent 纠正等)评分 5 个心理安全维度。研究发现商业治疗聊天机器人在临床场景中仅约 50% 情况响应适当。
- 可信度:⭐⭐⭐⭐ 高;ACL 2026 Demo,开源,有量化数据
- 后续行动:✅ 建议写入"Agent 安全评估"主题页;关注生产部署可行性
- 标签:
agent-safety、psychosocial-safety、LLM-as-judge、ACL2026
[高价值] Rankify — 检索/重排/RAG 全流程 Python 工具包
- 来源:ACL 2026 System Demonstrations,papers.cool #21
- 核心观点:Python 工具包,覆盖检索(Retrieval)、重排(Re-ranking)、RAG 全流程。与 RankGPT 等业界工具链对齐。
- 可信度:⭐⭐⭐⭐ 高;ACL 2026 Demo,有工具属性
- 后续行动:✅ 建议核实 GitHub 代码库;可作为 RAG 工程工具链参考
- 标签:
RAG、re-ranking、toolkit、ACL2026
[高价值] PROTEA — 多 Agent LLM 工作流离线评测与迭代改进
- 来源:ACL 2026 System Demonstrations,papers.cool #3
- 作者:Kazuki Kawamura, Satoshi Waki, Kei Tateno
- 核心观点:解决多 Agent LLM 工作流调试困难的问题。PROTEA 执行工作流、用可配置评估器对中间 artifact 评分,在工作流图上叠加每节点状态和理由定位瓶颈。提出 Backward Node Evaluation(从终端监督推导每个节点的理想输出),自动生成 prompt patch diff 并重新运行对比。
- 可信度:⭐⭐⭐⭐ 高;ACL 2026 Demo,工程价值明确
- 后续行动:✅ 建议精读;可作为 Agent 开发工具链重要补充
- 标签:
multi-agent、evaluation、debugging、workflow、ACL2026
[高价值] GovScape — 7000 万政府 PDF 多模态搜索系统
- 来源:ACL 2026 System Demonstrations,papers.cool #23
- 核心观点:面向 7000 万页政府 PDF 的多模态检索系统。大规模生产级 PDF OCR + 检索 + 语义搜索 pipeline。
- 可信度:⭐⭐⭐⭐ 高;ACL 2026 Demo,工程规模显著
- 后续行动:⚠️ 关注系统架构设计,可作为大规模 RAG 参考
- 标签:
large-scale-RAG、PDF-search、government-data、ACL2026
[参考] The ML Engineer #398 — Kimi K3 架构、Raschka 分析、Netflix LLM-Native 推荐系统
- 来源:The Machine Learning Engineer Substack,Issue #398
- 核心观点:本周重点条目 — ① Kimi K3 架构分析(Sebastian Raschka);② Netflix LLM-Native 推荐系统;③ OpenAI 数学推理 10 项进步;④ 前沿模型"作弊行为"研究;⑤ OpenAI HF Hack 时间线分析。
- 可信度:⭐⭐⭐⭐ 高;70,000+ ML 从业者订阅,工程洞察为主
- 后续行动:✅ 建议列入 AI 工程周报来源;关注 Raschka 对 Kimi K3 的架构解读
- 标签:
Kimi-K3、Netflix-RecSys、LLM-math、Substack-ML-engineering
[参考] Mind and Machine Weekly — 2026-07-27 至 2026-08-02 周刊
- 来源:Mind and Machine Weekly Substack
- 核心观点:本周 AI 新闻周刊,含 ApexSP(机器学习 cargo 特异性信号肽设计框架)和 GyRot(低比特 LLM 推理旋转+细粒度分组量化)。提及 DeepMind 视频生成视觉提示工程研究。
- 可信度:⭐⭐⭐ 中;一般周刊,关注度一般
- 后续行动:⚠️ 参考关注,不深度追踪
- 标签:
weekly-newsletter、GyRot、signal-peptide
[参考] Epoch AI — OpenAI Codex 贡献者 AI 加速效率分析
- 来源:Epoch AI Substack,2026-07-31
- 核心观点:分析 41 名 OpenAI Codex 仓库核心贡献者,2026 年 Q2 有 8% 的贡献者工作反映超过 24 小时无辅助人力工时(较 2025 Q2 的 2% 大幅上升)。说明 AI 辅助编码的复杂度边界在提升。
- 可信度:⭐⭐⭐⭐ 高;Epoch AI 独立研究机构,数据方法论透明
- 后续行动:✅ 建议写入"AI 工程效率"主题页;可与 SWE-bench 等基准交叉验证
- 标签:
AI-productivity、Codex、Epoch-AI、engineering-efficiency
🔧 csdn / CSDN 高价值
本次检索未发现本周符合 CSDN 筛选标准的高价值文章(需有版本/环境/命令/源码分析/真实排障经验)。CSDN 近期内容以概述性为主,暂不收录。
CSDN 收录标准(严格): 版本明确、环境可复现、命令源码分析、真实排障经验。本次无条目达标。
🔁 reproduction / 可复现
[建议复现] Fluid-Guided Online Scheduling — KV Cache 内存约束实验
- 目标:使用 Vidur 模拟器复现 arXiv 2504.11320 中的 A100 80GB Llama-2-7B 调度实验
- 环境依赖:Vidur(LLM 模拟器)、NVIDIA A100 或模拟配置
- 复现难度:⭐⭐⭐ 中;模拟器路径,无需真实 GPU
- 参考:arXiv 2504.11320
[建议复现] DIRT — SQLite B-tree 模糊测试
- 目标:使用 DIRT 方法论对 SQLite 最新版本(2026)重新执行模糊测试,验证 bug 清单
- 环境依赖:SQLite 源码、DIRT 测试框架(待查 GitHub)
- 复现难度:⭐⭐⭐ 中
- 参考:arXiv 2604.16373
📊 分类标签汇总
| 标签 | 数量 |
|---|---|
LLM-serving |
6 |
KV-cache |
4 |
vector-database |
5 |
agentic-AI |
4 |
ACL2026 |
5 |
Kubernetes |
3 |
storage-engine |
3 |
production-monitoring |
2 |
RAG |
3 |
PostgreSQL |
2 |
📁 建议写入路径
| 主题 | 目标路径(草稿) |
|---|---|
| KV Cache 优化系统性综述 | /shared/research-kb/inbox/jay/2026-08-03-kv-cache-optimization-survey.md |
| Datadog AI Engineering 报告摘要 | /shared/research-kb/inbox/jay/2026-08-03-datadog-ai-engineering-report.md |
| ACL 2026 System Demo 精选(ArcLight/PROTEA/Rankify/DialogGuard/GovScape) | /shared/research-kb/inbox/jay/2026-08-03-acl-2026-system-demos.md |
✅ 精读 / 审稿 / 主题页更新建议
本次优先精读(Top 5)
- [必读] Datadog State of AI Engineering — 真实生产数据锚点
- [必读] KV Cache 优化策略系统性综述(arXiv 2603.20397)— 主题页骨干
- [建议] Netflix LLM Serving 平台生产实践(InfoQ)— 工程参考
- [建议] Fluid-Guided Online Scheduling(arXiv 2504.11320)— 理论+系统联合
- [建议] PROTEA 多 Agent 工作流评测(ACL 2026)— 工程工具链价值
建议新增/更新知识库主题页
LLM 推理优化:纳入 KV Cache 综述 + Fluid-Guided + Netflix 三个来源Agent 工程实践:纳入 Datadog 报告 + PROTEA + DialogGuard向量数据库选型:纳入 LanceDB vs ChromaDB vs pgvector 对比 + OceanBase 更新
简报生成:Jay | 时间:2026-08-03 15:05 CST | 检索来源:arXiv、Tavily、Web Search、Substack、ACL Anthology