研究草稿 · Jay · 2026-10-11
本次主题
Agentic Systems · Vector DB 生产选型 · MLOps 工程实践 · LLM Inference Serving · Substack 高价值 Newsletter
检索范围
- GitHub Trending(今日)
- Hugging Face Models Trending(Text Generation)
- arXiv(2026 年 Agentic / RAG / Inference Serving)
- Tavily 深度搜索(Substack + 技术博客)
- Vector DB 生产对比(2026)
一、GitHub Trending 高价值条目
⭐⭐⭐ morluto/rea — Reverse Engineering with Agents
- 链接: https://github.com/morluto/rea
- 语言: TypeScript
- 星: 73,468(今日 +25,793)
- Fork: 15,511
- 描述: 用 agents 从应用行为到底层二进制完整逆向工程任意目标。支持 claude、rudycelekli 等多作者协作。
- 工程价值:
- 展示了 Agent + 逆向工程的具体工程实现路径
- 多 agent 协作模式值得参考
- TypeScript 实现,可直接用于 JS/TS 生态集成
- 可信度: 高(多贡献者,活跃增长)
- 后续行动: 建议精读源码,理解 agent 任务拆解 + 工具调用模式
⭐⭐ mksglu/context-mode — Context Window Optimization for AI Coding Agents
- 链接: https://github.com/mksglu/context-mode
- 语言: TypeScript
- 星: 26,327(今日 +178)
- 描述: AI coding agent 的上下文窗口优化方案,通过沙箱隔离工具输出(减少 98%)、持久化 session memory、跨 17 个平台通过 MCP + hooks 做路由。
- 工程价值:
- MCP 协议在 agent 生态中的生产级实践
- 98% 工具输出裁减对 context window 利用率有重大意义
- 跨平台路由设计对复杂 agent 系统有参考价值
- 可信度: 高
- 后续行动: 可用于 agent 系统 context 工程化参考
⭐ mattpocock/skills — Skills for Real Engineers
- 链接: https://github.com/mattpocock/skills
- 描述: 从
.agents目录提炼的真实工程师技能集,mattpocock(TypeScript 知名布道师)出品。 - 工程价值: 了解真实 agent 技能系统设计
- 可信度: 中高
二、Hugging Face Trending 模型(Text Generation)
| 模型 | 参数量 | 下载量 | 亮点 |
|---|---|---|---|
Qwen/Qwen3-0.6B |
0.6B | 30.8M | 极小参数,高下载量,边缘/移动端友好 |
prism-ml/Ternary-Bonsai-2-27B-gguf |
27B | 4.46M | 三值量化 GGUF,资源受限场景首选 |
JonathanColetti/Qwen3.8-27B-Uncensored-GGUF |
27B | 2.36M | 无审查版 Qwen3.8 |
zai-org/GLM-5.3 |
753B | 1.67M | 超大杯,GLM 家族旗舰 |
XiaomiMiMo/MiMo-V2.6-Pro-RL |
1T | 95.2k | 小米端侧 RL 模型 |
Cactus-Compute/needle3 |
- | 134k | 新兴,快速增长 |
观察: Qwen3-0.6B 极小但极受欢迎,说明边缘部署需求强劲;GGUF 量化版持续主导非官方模型分发。
三、arXiv 高价值论文(2026)
⭐⭐⭐ AgentSysBench: From LLM Inference to Agentic Workloads
- 论文: arXiv:2608.15127(2026-08-15)
- 作者: HKUST + Alibaba Group + ByteDance
- 链接: https://www.alphaxiv.org/abs/2608.15127 | https://sparsenotes.com/posts/2026/08/papers/agentsysbench-agentic-workloads
- 核心发现:
- 10 个真实 agentic 应用 + 178,799 生产 session 实测
- 模型推理不再是主要成本中心——sandbox、搜索、embedding、向量数据库操作在工具密集型应用中占主导
- 识别出 6 个区分 agentic 与传统 LLM serving 的关键属性
- 任务分解式 serving(disaggregated serving)vs 共享组件:延迟降低 29-40%(同 GPU 数量对比)
- 工程启示:
- 传统 LLM serving 假设不适用于 agentic 场景
- 监控需覆盖非 LLM 组件(工具调用延迟、沙箱开销)
- 资源隔离是关键优化方向
- 可信度: 极高(工业界联合研究,大规模生产数据支撑)
- 后续行动: 建议精读,关注 serving stack 模块化设计
⭐⭐ Skill Retrieval Augmentation for Agentic AI
- 论文: arXiv:2604.24594v1
- 描述: 探索 RAG 在 agent 技能检索中的扩展——超越简单工具调用,把模块化技能作为 agent 设计的核心抽象。
- 评估模型: Qwen3-4B/32B/235B-A22B, Llama-3.1-8B, Llama-3.3-70B, Mistral-Small-3.1, GLM-5.1, GPT-5.4
- 工程价值: 为 agent 技能库动态加载提供方法论
- 后续行动: 关注 RAG → Skill-RAG 的演化
⭐ Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective (Extended)
- 论文: arXiv:2603.16104v1
- 描述: 从数据系统角度全面分析 agentic workflow 高效 serving,涉及 SGLang、KV cache 管理、speculative decoding 等
- 覆盖技术栈: Kernel optimization, KV cache, disaggregated serving, speculative decoding, SGLang
⭐⭐ VoltAgent/awesome-ai-agent-papers
- 链接: https://github.com/VoltAgent/awesome-ai-agent-papers
- 内容: 2026 AI agent 论文精选集,涵盖 agent 工程、memory、evaluation、workflows、autonomous systems
- 亮点条目:
- BackdoorAgent:统一框架分析 LLM agent 后门攻击(规划/记忆/工具调用三阶段)
- HoneyTrap:多 agent 协作防御 jailbreak 攻击
- SoK: RAG 隐私风险系统化综述
- Subgraph Reconstruction Attacks:图 RAG 知识图谱重建攻击
- Zero-Trust Runtime Verification for Agentic Payment Protocols
四、Substack Newsletter 高价值条目
⭐⭐⭐ State-of-MLOps Weekly(Keigo Hattri)
- Substack: https://stateofmlops.substack.com
- 本期条目(Jun 1, 2026):
1. OpenAI: Building self-improving tax agents with Codex(May 27, 2026)
- 自改进 tax agent 的工程实践,OpenAI 官方博客 2. Comet: What Held Up at 3 AM: One Engineer's RAG Case Study(May 20, 2026)
- 真实 RAG 排障经验,凌晨 3 点的调试故事,生产教训 3. Comet: The Best AI Observability Tools for Agentic Systems in 2026(May 27, 2026)
- Agentic 系统可观测性工具年度评测 4. MongoDB: The Agent Harness: Why the LLM Is the Smallest Part of Your Agent System(May 11, 2026)
- 核心观点:LLM 只是 agent 系统的最小部分;harness、memory、tool orchestration 更关键 5. Pinterest Engineering: An Engineer's Guide to Better AI Skills(May 13, 2026)
- 在任意仓库实现 agent 性能测试流程
- 可信度: 高(Pinterest、OpenAI、Comet 均为知名公司工程团队)
- 后续行动: MongoDB Agent Harness 文章建议精读;Comet Observability 文章可作为工具选型参考
⭐⭐ The ML Engineer #393(A Alejandro Saucedo)
- Substack: https://machinelearning.substack.com
- O'Reilly 2026 Radar Trends 要点:
- Agent 基础设施新边界:自动注册账号、域名、发起支付、获取凭证、部署应用
- MLOps 边界正在扩展:不仅要管模型质量和服务延迟,还需管理授权、支出控制、审计追踪、沙箱隔离、依赖风险
- 通用 frontier 模型在专业化场景中越来越强,模型格局碎片化加剧
- Sebastian Raschka Local Agent Setup 要点:
- 主推 Ollama 作为 serving 层
- Agent harness:Qwen Code、Codex CLI、Claude Code
- Local agent 工作流关键指标:inference speed、long-context behavior、tool-call reliability、permissions、telemetry、task-specific evaluation
- 30-35B MoE coding models(如 Qwen3.6)推荐
- 可信度: 高(工程实践导向,A伴 Alejandro Saucedo 是知名 ML 布道师)
- 后续行动: Raschka local agent setup 全文值得参考
⭐ Jam with AI(Shirin Khosravi Jam)
- Substack: https://jamwithai.substack.com/p/data-science-roadmap-2026
- Modern AI Systems Track 要点:
- 核心技能:RAG 架构、向量数据库(Pincone/Weaviate/Chroma)、LLM 应用开发、Prompt 工程、AI agents & tool use
- 强调分层技能积累,而非追逐趋势
- MLOps & Production ML 是数据科学真正落地的地方
五、Vector DB 生产选型(2026 综合判断)
核心结论(2026-07 更新的行业共识)
从 pgvector 开始,只有当你能明确说出具体瓶颈时,才迁移到专用向量数据库。
场景化选型
| 场景 | 推荐 | 理由 |
|---|---|---|
| 通用生产 RAG(不确定) | pgvector | 已有 Postgres 基础设施支撑,pgvectorscale 支持扩展 |
| 性能敏感生产 RAG | Qdrant | Rust 实现,量化+混合搜索强,开源 |
| 强混合搜索需求 | Weaviate | GraphQL 风格查询,向量+标量过滤成熟 |
| 十亿级向量 + Kubernetes | Milvus | CNCF,水平扩展,分布式架构 |
| 多模态 + PB 级 | Milvus / Vespa | Milvus 3.0 lake-native redesign |
| 轻量原型 / 开发者 RAG | Chroma / LanceDB | 快速启动 |
| 已有 Redis 基础设施 | Redis | 向量搜索 + 缓存 + 操作数据统一管理 |
2026 新增趋势:Hybrid Search 是标配
- 纯向量搜索丢失 exact-match
- 纯 BM25 丢失语义相似性
- 2026 生产 RAG 必须具备 hybrid search(向量 + lexical,RRF 融合)
Milvus 3.0 新动态(2025-08 以来)
- Lake-native 重新架构
- 2.6 版本降低存储成本
- K8s Helm chart 生产部署成熟
- 注意:先建索引再插入(常见坑)
基准工具
vectordb-bench(Milvus 官方)vsann-benchmarks:用于生产配置选型前实测
六、分类标签
#AI工程 #AgenticSystems #MLOps #LLMServing #VectorDB #RAG
#GitHubTrending #HuggingFace #arXiv #Substack
#InferenceOptimization #ContextWindow #AgentSecurity
#Database #PostgreSQL #pgvector #Qdrant #Milvus #Weaviate
#ProductionEngineering #Observability
七、建议写入路径
主文件: /shared/research-kb/inbox/jay/2026-10-11-agentic-systems-vector-db-mlops.md
建议后续精读文件(可创建独立主题页):
- 2026-10-11-agentsysbench-agentic-serving.md(AgentSysBench 论文深度笔记)
- 2026-10-11-vector-db-production-selection.md(Vector DB 选型决策树)
八、本次是否写入
✅ 已写入主草稿:/shared/research-kb/inbox/jay/2026-10-11-agentic-systems-vector-db-mlops.md
待后续操作(不建议本实例执行): - GitHub PR / commit 由同步任务串行处理 - 精读笔记(AgentSysBench、MongoDB Agent Harness)可作为后续主题页更新
九、本次 Top 3 高价值条目(精读建议排序)
- AgentSysBench (arXiv:2608.15127) — 工业界联合研究,重新定义 agentic serving 成本模型
- MongoDB: The Agent Harness(State-of-MLOps 引用)— LLM 只是最小部分,理解 harness 设计
- Qdrant vs pgvector 生产对比(aiml.qa 完整评测)— 2026 Vector DB 选型决策必备