研究草稿 · Jay · 2026-07-08 上午(第二轮)

本次主题

推理引擎生态 + Agent 协议 + Vector DB 对比 + GitHub Trending 检索范围:vLLM/SGLang 2026横评、MCP/A2A 协议、Vector DB benchmark、GitHub 热门项目、Substack 行业洞察


🔴 高价值(AI 工程相关)


条目1:addyosmani/agent-skills(⭐72k,1.3k stars today)

  • URL: https://github.com/addyosmani/agent-skills
  • 作者: Addy Osmani(Google Chrome 团队,JS 布道者)
  • 语言: JavaScript
  • 可信度: 高(Google 工程师背书,社区活跃)

核心内容: 生产级 AI 编码 Agent 工程技能库。目标:让 AI coding agent 在真实项目中达到 production-grade 标准。涵盖: - 工程规范:代码审查、测试、部署 - Agent 工具链:shell、git、CI/CD 集成 - 多语言支持(Python、JS/TS、Rust)

工程价值: ⭐⭐⭐⭐⭐ - 72k stars,Google 工程师维护,质量有保证 - 可作为 Agent coding skill 的参考实现 - 覆盖 SWE-agent、Claude Code 等主流工具集成

建议分类: AI Coding Agent / Engineering Skills / JavaScript 是否精读: 是,可参考其 skill 格式设计 后续行动: 核验 agent-skills 目录结构,评估引入到知识库 skill 系统的可行性


条目2:TencentCloud/CubeSandbox(⭐8.4k,664 stars today)

  • URL: https://github.com/TencentCloud/CubeSandbox
  • 作者: 腾讯云
  • 语言: Rust
  • 可信度: 高(腾讯官方,背书企业级)

核心内容: 为 AI Agent 打造的 Instant、Concurrent、Secure、Lightweight 沙箱。基于 Rust 实现,强调: - Instant:毫秒级启动 - Concurrent:支持高并发沙箱实例 - Secure:进程级隔离,适合 untrusted agent code 执行 - Lightweight:资源占用低

工程价值: ⭐⭐⭐⭐ - 解决 Agent 执行外部代码的安全隔离问题 - Rust 实现,性能有保障 - 腾讯背书,生产可用性高

建议分类: AI Agent / Security / Rust / Sandbox / Tencent 是否精读: 中,优先度低于 agent-skills 后续行动: 关注其与 MCP tool execution 的集成方式


条目3:bradautomates/claude-video(⭐5.1k,965 stars today)

  • URL: https://github.com/bradautomates/claude-video
  • 作者: 个人开发者
  • 语言: Python
  • 可信度: 中

核心内容: 赋予 Claude 视频理解能力。流程:下载视频 → 提取帧 → 转录 → 交给 Claude 分析。核心是用 ffmpeg + Whisper 做视频预处理。

工程价值: ⭐⭐⭐ - 视频理解是 2026 Agent 多模态能力的短板 - ffmpeg + Whisper pipeline 可参考 - 集成到现有 Agent 工具箱的价值待评估

建议分类: Multimodal Agent / Video Understanding / Python 是否精读: 低,仅作为 pipeline 参考


条目4:iOfficeAI/OfficeCLI(⭐10k,893 stars today)

  • URL: https://github.com/iOfficeAI/OfficeCLI
  • 作者: 社区
  • 语言: C#
  • 可信度: 中

核心内容: 首个为 AI Agent 打造的 Office 套件操作工具。无需安装 Office 即可读写 Word/Excel/PPT,单 binary,支持自动化。

工程价值: ⭐⭐⭐⭐ - 解决 Agent 办公自动化的"最后一公里"问题 - 单 binary 部署,零依赖 - 对接企业 OA 场景有直接价值

建议分类: AI Agent / Office Automation / C# / Enterprise 是否精读: 中 后续行动: 评估与 MCP 工具的集成可行性


条目5:kyutai-labs/pocket-tts(⭐6.1k,531 stars today)

  • URL: https://github.com/kyutai-labs/pocket-tts
  • 语言: Python
  • 可信度: 中(kyutai-labs 专注嵌入式 AI)

核心内容: CPU 可运行的轻量级 TTS 模型。适合边缘部署、嵌入式场景。

工程价值: ⭐⭐⭐ - 本地 TTS 能力,减少 API 依赖 - 边缘部署场景有参考价值

建议分类: TTS / Edge AI / Python / Embedded 是否精读: 低


🔴 高价值


条目1:zai-org/GLM-5.2(⭐282k)

  • URL: https://huggingface.co/zai-org/GLM-5.2
  • 发布方: Zhipu AI(智谱)
  • 参数: 753B
  • 可信度: 高(国内头部大模型公司)

核心内容: GLM-5.2 是智谱最新一代千亿参数模型,在多项 benchmark 超越 GPT-4。强调多模态和长上下文支持。

工程价值: ⭐⭐⭐⭐ - 国产高性能模型,适合国内部署场景 - 支持中文长文本任务

建议分类: LLM / Chinese / Multimodal / GLM / Zhipu 是否精读: 是,关注其开源许可和部署要求


条目2:InternScience/Agents-A1(⭐14.7k)

  • URL: https://huggingface.co/InternScience/Agents-A1
  • 发布方: InternScience
  • 参数: 35B
  • 可信度: 中高

核心内容: Agent 专用模型,35B 参数,专注于 tool use 和 multi-step reasoning。GGUF 量化版已上线。

工程价值: ⭐⭐⭐⭐ - Agent 专用模型,不是通用 chat 模型 - 35B 适合单卡部署 - 适合作为 Agent 系统的核心模型

建议分类: Agent / Tool Use / 35B / InternScience 是否精读: 是,关注其 tool call 能力评估


条目3:deepseek-ai/DeepSeek-V4-Pro-DSpark(⭐15.5k)

  • URL: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark
  • 发布方: DeepSeek
  • 参数: 889B(MoE)
  • 可信度: 高(DeepSeek 官方)

工程价值: ⭐⭐⭐⭐⭐ - DeepSeek 最新 Pro 版本,MoE 架构节省推理资源 - 889B 总参数,激活参数少,推理成本低 - DSpark 平台已上线

建议分类: LLM / MoE / DeepSeek / Production / 889B 是否精读: 是,评估生产部署性价比


三、推理引擎深度对比(vLLM vs SGLang 2026)

综合 Yotta Labs、Spheron、TECHSY 三方 benchmark 来源

🔴 核心结论

TGI 2025年12月进入维护模式,Hugging Face 建议迁移到 vLLM 或 SGLang。

对比维度总结表

维度 vLLM SGLang
H100 吞吐量 (Llama 3.1 8B) ~12,500 tok/s ~16,200 tok/s
多轮对话 / RAG 一般 优(RadixAttention 前缀复用)
结构化输出 支持 原生支持 pipeline
prefix-heavy TTFT 一般
硬件支持广度 最广 较窄
社区规模 最大 较小
MRV2 加速 +56% (GB200) N/A
生产落地 AWS/GCP/Azure 最稳 多轮对话/RAG 优先选

选型建议

选 vLLM:需要最广硬件支持、最大社区、生产路径成熟(AWS/GCP/Azure) 选 SGLang:多轮对话、结构化输出、prefix-heavy RAG 场景 新部署:两者都是安全选择,取决于 workload 特征

工程价值: ⭐⭐⭐⭐⭐ - 直接指导生产推理引擎选型 - 避免 TGI 技术债

建议分类: LLM Inference / vLLM / SGLang / Benchmark / Production 是否精读: 是,建议配合 Spheron 完整报告


四、Agent 协议对比(MCP vs A2A)

🟡 中高价值

MCP vs A2A 定位

协议 定位 主导方 生态
MCP LLM ↔ Tools(client-server) Anthropic/OpenAI/Google/Microsoft 最广,2026年事实标准
A2A Agent ↔ Agent(peer-to-peer) Google,2025年4月开源 快速增长中

关键洞察

  1. MCP 是 tool access 协议:解决"Agent 如何调用外部工具"问题
  2. A2A 是 multi-agent 协调协议:解决"两个 Agent 如何协作"问题
  3. Gateway Pattern 兴起:Future AGI 等方案建议统一路由 MCP + A2A
  4. Linux Foundation 托管:A2A 1.0 规范稳定中

工程价值: ⭐⭐⭐⭐ - Agent 互联互通是 2026 年重要趋势 - MCP 已成事实标准,新项目优先支持 - A2A 值得观望但不必立即跟进

建议分类: Agent Protocol / MCP / A2A / Multi-Agent 是否精读: 中,优先实现 MCP server


五、Vector DB 生产选型指南(2026)

综合 CallSphere、Lushbinary、KalviumLabs 等来源

🔴 选型决策树

Scale < 10M vectors + Postgres 已用
  → pgvector 0.9(默认选择)

Scale > 10M + 需要超低延迟
  → Qdrant(~850 QPS @ p95~8ms on 1M vectors)

Managed cloud 偏好
  → Pinecone(sub-20ms p95 @ 5M+ vectors,但贵 3-8x)

需要 hybrid search + GraphQL
  → Weaviate

最大规模(billion vectors)
  → Milvus

pgvector 0.9 新特性(2026)

  • Hybrid search 改进
  • Late-interaction 支持增强
  • 与 Postgres 生态深度整合

量化数据参考

DB 1M vectors QPS p95 latency 优势场景
pgvector 0.9 ~500 ~15ms SQL 团队,~70% RAG 场景
Qdrant ~850 ~8ms Self-hosted,高吞吐
Pinecone ~600 <20ms Managed,无运维
Weaviate ~400 ~20ms Hybrid + GraphQL
Milvus ~700 ~12ms 亿级向量

工程价值: ⭐⭐⭐⭐ - 避免选型踩坑 - pgvector 作为默认选择风险最低

建议分类: Vector DB / pgvector / Qdrant / Production / Benchmark 是否精读: 中


六、Substack 高价值条目

🔴 高价值


条目1:The AI Engineer — The AI Agents Stack (2026 Edition)

  • URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者: The AI Engineer(行业垂直 newsletter)
  • 可信度: 高(专注 AI 工程,读者为 AI 工程师群体)

核心洞察: 2026 年 Agent 技术栈已演化为 6 层架构(2024 年 Letta 的原图只有 4 层):

  1. LLM(基础模型)
  2. Tool Layer(MCP 等协议)
  3. Memory Layer(向量 DB + 知识图谱)
  4. Orchestration Layer(LangGraph / CrewAI 等框架)
  5. Evaluation Layer(Agent 评测体系)
  6. Infrastructure Layer(推理引擎 + 部署)

新增三层:Evaluation、Infrastructure、Memory 在 2024 年还不是独立层。

工程价值: ⭐⭐⭐⭐⭐ - 系统性理解 Agent 技术栈 - 可作为知识库主题页更新的参考框架

建议分类: AI Agent / Stack / Architecture / Substack 后续行动: 建议更新知识库 Agent 系统架构主题页


条目2:Alex Werenlof — OWASP Top 10 Agents & AI (2026 Cheat Sheet)

  • URL: https://open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
  • 作者: Alex Werenlof(AI 安全方向)
  • 可信度: 中高(OWASP 官方背书)

核心内容: 整合 OWASP Top 10 LLM (LLM01-LLM10) + OWASP Top 10 Agents (ASI01-ASI10),含: - 威胁场景描述 - 代码级示例 - 实际缓解建议

关键威胁: - LLM01:Prompt Injection - ASI01:Agent 权限滥用(工具级别) - Semantic Firewall:输入/输出语义过滤方案

工程价值: ⭐⭐⭐⭐ - Agent 安全是 2026 年生产部署必须解决的问题 - 直接可用的安全 checklist

建议分类: AI Security / OWASP / Agent Security / Substack


七、arXiv 推理系统工程论文

🟡 中高价值

Online Scheduling for LLM Inference with KV Cache Constraints

  • arXiv: https://arxiv.org/abs/2502.07115
  • 核心贡献
  • 理论建模:LLM inference + KV cache 约束
  • Hindsight-optimal benchmark(整数规划)
  • 证明:任意确定性在线算法无法在任意到达过程下获得常数竞争比
  • WAIT 算法:已知输出长度时的阈值 admission rule
  • Nested WAIT:未知输出长度时的扩展

工程价值: ⭐⭐⭐⭐ - 理论基础扎实 - 对 vLLM/SGLang 调度优化有指导意义 - 适合作为推理引擎调度层的主题页引用

建议分类: LLM Inference / KV Cache / Scheduling / arXiv / Theory 后续行动: 关注 WAIT 算法在实际推理引擎中的实现


八、综合摘要

本轮高价值条目(按优先级)

# 条目 优先级 标签
1 addyosmani/agent-skills ⭐⭐⭐⭐⭐ AI Coding Agent / Engineering
2 vLLM vs SGLang 2026 benchmark ⭐⭐⭐⭐⭐ LLM Inference / Benchmark
3 DeepSeek-V4-Pro-DSpark (889B MoE) ⭐⭐⭐⭐⭐ LLM / MoE / Production
4 The AI Agents Stack 2026 ⭐⭐⭐⭐⭐ AI Agent / Architecture / Substack
5 OWASP Top 10 Agents 2026 ⭐⭐⭐⭐ AI Security / Agent
6 MCP vs A2A 协议对比 ⭐⭐⭐⭐ Agent Protocol / MCP
7 TencentCloud/CubeSandbox ⭐⭐⭐⭐ AI Agent / Sandbox / Rust
8 pgvector 0.9 vs Qdrant 选型 ⭐⭐⭐⭐ Vector DB / Production
9 Agents-A1 (35B Agent 专用) ⭐⭐⭐⭐ Agent / Tool Use
10 WAIT/Nested WAIT 调度算法 ⭐⭐⭐ LLM Inference / KV Cache

建议写入路径

/shared/research-kb/inbox/jay/2026-07-08-0935-morning-briefing-inference-agents-vecdb-substack.md

建议精读 / 审稿

  • ⭐⭐⭐⭐⭐ addyosmani/agent-skills(目录结构 + skill 格式参考)
  • ⭐⭐⭐⭐⭐ The AI Agents Stack 2026(知识库主题页更新)

后续行动

  1. 核验 agent-skills 的 skill 格式,评估引入可行性
  2. 更新知识库 Agent 系统架构主题页(纳入新增 3 层)
  3. 生产推理引擎选型优先参考 vLLM/SGLang benchmark
  4. 关注 DeepSeek-V4-Pro-DSpark 开源动态

草稿生成时间:2026-07-08 09:35 CST 来源:GitHub Trending、Hugging Face、Tavily Web Search、Substack 撰写:Jay