研究草稿 · Jay · 2026-10-11

本次主题

Agentic Systems · Vector DB 生产选型 · MLOps 工程实践 · LLM Inference Serving · Substack 高价值 Newsletter

检索范围

  • GitHub Trending(今日)
  • Hugging Face Models Trending(Text Generation)
  • arXiv(2026 年 Agentic / RAG / Inference Serving)
  • Tavily 深度搜索(Substack + 技术博客)
  • Vector DB 生产对比(2026)

⭐⭐⭐ morluto/rea — Reverse Engineering with Agents

  • 链接: https://github.com/morluto/rea
  • 语言: TypeScript
  • 星: 73,468(今日 +25,793)
  • Fork: 15,511
  • 描述: 用 agents 从应用行为到底层二进制完整逆向工程任意目标。支持 claude、rudycelekli 等多作者协作。
  • 工程价值:
  • 展示了 Agent + 逆向工程的具体工程实现路径
  • 多 agent 协作模式值得参考
  • TypeScript 实现,可直接用于 JS/TS 生态集成
  • 可信度: 高(多贡献者,活跃增长)
  • 后续行动: 建议精读源码,理解 agent 任务拆解 + 工具调用模式

⭐⭐ mksglu/context-mode — Context Window Optimization for AI Coding Agents

  • 链接: https://github.com/mksglu/context-mode
  • 语言: TypeScript
  • 星: 26,327(今日 +178)
  • 描述: AI coding agent 的上下文窗口优化方案,通过沙箱隔离工具输出(减少 98%)、持久化 session memory、跨 17 个平台通过 MCP + hooks 做路由。
  • 工程价值:
  • MCP 协议在 agent 生态中的生产级实践
  • 98% 工具输出裁减对 context window 利用率有重大意义
  • 跨平台路由设计对复杂 agent 系统有参考价值
  • 可信度: 高
  • 后续行动: 可用于 agent 系统 context 工程化参考

⭐ mattpocock/skills — Skills for Real Engineers

  • 链接: https://github.com/mattpocock/skills
  • 描述: 从 .agents 目录提炼的真实工程师技能集,mattpocock(TypeScript 知名布道师)出品。
  • 工程价值: 了解真实 agent 技能系统设计
  • 可信度: 中高

模型 参数量 下载量 亮点
Qwen/Qwen3-0.6B 0.6B 30.8M 极小参数,高下载量,边缘/移动端友好
prism-ml/Ternary-Bonsai-2-27B-gguf 27B 4.46M 三值量化 GGUF,资源受限场景首选
JonathanColetti/Qwen3.8-27B-Uncensored-GGUF 27B 2.36M 无审查版 Qwen3.8
zai-org/GLM-5.3 753B 1.67M 超大杯,GLM 家族旗舰
XiaomiMiMo/MiMo-V2.6-Pro-RL 1T 95.2k 小米端侧 RL 模型
Cactus-Compute/needle3 - 134k 新兴,快速增长

观察: Qwen3-0.6B 极小但极受欢迎,说明边缘部署需求强劲;GGUF 量化版持续主导非官方模型分发。


三、arXiv 高价值论文(2026)

⭐⭐⭐ AgentSysBench: From LLM Inference to Agentic Workloads

  • 论文: arXiv:2608.15127(2026-08-15)
  • 作者: HKUST + Alibaba Group + ByteDance
  • 链接: https://www.alphaxiv.org/abs/2608.15127 | https://sparsenotes.com/posts/2026/08/papers/agentsysbench-agentic-workloads
  • 核心发现:
  • 10 个真实 agentic 应用 + 178,799 生产 session 实测
  • 模型推理不再是主要成本中心——sandbox、搜索、embedding、向量数据库操作在工具密集型应用中占主导
  • 识别出 6 个区分 agentic 与传统 LLM serving 的关键属性
  • 任务分解式 serving(disaggregated serving)vs 共享组件:延迟降低 29-40%(同 GPU 数量对比)
  • 工程启示:
  • 传统 LLM serving 假设不适用于 agentic 场景
  • 监控需覆盖非 LLM 组件(工具调用延迟、沙箱开销)
  • 资源隔离是关键优化方向
  • 可信度: 极高(工业界联合研究,大规模生产数据支撑)
  • 后续行动: 建议精读,关注 serving stack 模块化设计

⭐⭐ Skill Retrieval Augmentation for Agentic AI

  • 论文: arXiv:2604.24594v1
  • 描述: 探索 RAG 在 agent 技能检索中的扩展——超越简单工具调用,把模块化技能作为 agent 设计的核心抽象。
  • 评估模型: Qwen3-4B/32B/235B-A22B, Llama-3.1-8B, Llama-3.3-70B, Mistral-Small-3.1, GLM-5.1, GPT-5.4
  • 工程价值: 为 agent 技能库动态加载提供方法论
  • 后续行动: 关注 RAG → Skill-RAG 的演化

⭐ Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective (Extended)

  • 论文: arXiv:2603.16104v1
  • 描述: 从数据系统角度全面分析 agentic workflow 高效 serving,涉及 SGLang、KV cache 管理、speculative decoding 等
  • 覆盖技术栈: Kernel optimization, KV cache, disaggregated serving, speculative decoding, SGLang

⭐⭐ VoltAgent/awesome-ai-agent-papers

  • 链接: https://github.com/VoltAgent/awesome-ai-agent-papers
  • 内容: 2026 AI agent 论文精选集,涵盖 agent 工程、memory、evaluation、workflows、autonomous systems
  • 亮点条目:
  • BackdoorAgent:统一框架分析 LLM agent 后门攻击(规划/记忆/工具调用三阶段)
  • HoneyTrap:多 agent 协作防御 jailbreak 攻击
  • SoK: RAG 隐私风险系统化综述
  • Subgraph Reconstruction Attacks:图 RAG 知识图谱重建攻击
  • Zero-Trust Runtime Verification for Agentic Payment Protocols

四、Substack Newsletter 高价值条目

⭐⭐⭐ State-of-MLOps Weekly(Keigo Hattri)

  • Substack: https://stateofmlops.substack.com
  • 本期条目(Jun 1, 2026): 1. OpenAI: Building self-improving tax agents with Codex(May 27, 2026)
    • 自改进 tax agent 的工程实践,OpenAI 官方博客 2. Comet: What Held Up at 3 AM: One Engineer's RAG Case Study(May 20, 2026)
    • 真实 RAG 排障经验,凌晨 3 点的调试故事,生产教训 3. Comet: The Best AI Observability Tools for Agentic Systems in 2026(May 27, 2026)
    • Agentic 系统可观测性工具年度评测 4. MongoDB: The Agent Harness: Why the LLM Is the Smallest Part of Your Agent System(May 11, 2026)
    • 核心观点:LLM 只是 agent 系统的最小部分;harness、memory、tool orchestration 更关键 5. Pinterest Engineering: An Engineer's Guide to Better AI Skills(May 13, 2026)
    • 在任意仓库实现 agent 性能测试流程
  • 可信度: 高(Pinterest、OpenAI、Comet 均为知名公司工程团队)
  • 后续行动: MongoDB Agent Harness 文章建议精读;Comet Observability 文章可作为工具选型参考

⭐⭐ The ML Engineer #393(A Alejandro Saucedo)

  • Substack: https://machinelearning.substack.com
  • O'Reilly 2026 Radar Trends 要点:
  • Agent 基础设施新边界:自动注册账号、域名、发起支付、获取凭证、部署应用
  • MLOps 边界正在扩展:不仅要管模型质量和服务延迟,还需管理授权、支出控制、审计追踪、沙箱隔离、依赖风险
  • 通用 frontier 模型在专业化场景中越来越强,模型格局碎片化加剧
  • Sebastian Raschka Local Agent Setup 要点:
  • 主推 Ollama 作为 serving 层
  • Agent harness:Qwen Code、Codex CLI、Claude Code
  • Local agent 工作流关键指标:inference speed、long-context behavior、tool-call reliability、permissions、telemetry、task-specific evaluation
  • 30-35B MoE coding models(如 Qwen3.6)推荐
  • 可信度: 高(工程实践导向,A伴 Alejandro Saucedo 是知名 ML 布道师)
  • 后续行动: Raschka local agent setup 全文值得参考

⭐ Jam with AI(Shirin Khosravi Jam)

  • Substack: https://jamwithai.substack.com/p/data-science-roadmap-2026
  • Modern AI Systems Track 要点:
  • 核心技能:RAG 架构、向量数据库(Pincone/Weaviate/Chroma)、LLM 应用开发、Prompt 工程、AI agents & tool use
  • 强调分层技能积累,而非追逐趋势
  • MLOps & Production ML 是数据科学真正落地的地方

五、Vector DB 生产选型(2026 综合判断)

核心结论(2026-07 更新的行业共识)

从 pgvector 开始,只有当你能明确说出具体瓶颈时,才迁移到专用向量数据库。

场景化选型

场景 推荐 理由
通用生产 RAG(不确定) pgvector 已有 Postgres 基础设施支撑,pgvectorscale 支持扩展
性能敏感生产 RAG Qdrant Rust 实现,量化+混合搜索强,开源
强混合搜索需求 Weaviate GraphQL 风格查询,向量+标量过滤成熟
十亿级向量 + Kubernetes Milvus CNCF,水平扩展,分布式架构
多模态 + PB 级 Milvus / Vespa Milvus 3.0 lake-native redesign
轻量原型 / 开发者 RAG Chroma / LanceDB 快速启动
已有 Redis 基础设施 Redis 向量搜索 + 缓存 + 操作数据统一管理
  • 纯向量搜索丢失 exact-match
  • 纯 BM25 丢失语义相似性
  • 2026 生产 RAG 必须具备 hybrid search(向量 + lexical,RRF 融合)

Milvus 3.0 新动态(2025-08 以来)

  • Lake-native 重新架构
  • 2.6 版本降低存储成本
  • K8s Helm chart 生产部署成熟
  • 注意:先建索引再插入(常见坑)

基准工具

  • vectordb-bench(Milvus 官方)vs ann-benchmarks:用于生产配置选型前实测

六、分类标签

#AI工程 #AgenticSystems #MLOps #LLMServing #VectorDB #RAG
#GitHubTrending #HuggingFace #arXiv #Substack
#InferenceOptimization #ContextWindow #AgentSecurity
#Database #PostgreSQL #pgvector #Qdrant #Milvus #Weaviate
#ProductionEngineering #Observability

七、建议写入路径

主文件: /shared/research-kb/inbox/jay/2026-10-11-agentic-systems-vector-db-mlops.md

建议后续精读文件(可创建独立主题页): - 2026-10-11-agentsysbench-agentic-serving.md(AgentSysBench 论文深度笔记) - 2026-10-11-vector-db-production-selection.md(Vector DB 选型决策树)


八、本次是否写入

✅ 已写入主草稿:/shared/research-kb/inbox/jay/2026-10-11-agentic-systems-vector-db-mlops.md

待后续操作(不建议本实例执行): - GitHub PR / commit 由同步任务串行处理 - 精读笔记(AgentSysBench、MongoDB Agent Harness)可作为后续主题页更新


九、本次 Top 3 高价值条目(精读建议排序)

  1. AgentSysBench (arXiv:2608.15127) — 工业界联合研究,重新定义 agentic serving 成本模型
  2. MongoDB: The Agent Harness(State-of-MLOps 引用)— LLM 只是最小部分,理解 harness 设计
  3. Qdrant vs pgvector 生产对比(aiml.qa 完整评测)— 2026 Vector DB 选型决策必备