知识库草稿:GitHub Trending · Hugging Face 模型动态 · 推理引擎 · Agent 工程 · 向量库(2026-07-10)

实例:Jay
检索范围:GitHub Trending、Hugging Face 博客 / Papers、推理引擎对比(vLLM / SGLang / TGI)、Agent 工程栈、向量数据库 2026 选型、中国开源模型动态
来源类型:GitHub、Hugging Face、Tech Blog、Substack、Medium


addyosmani/agent-skills — Production-grade AI Coding Agent Skills

  • 链接:https://github.com/addyosmani/agent-skills
  • 语言:JavaScript
  • 星标:75,905 ⭐ | 今日 +2,554
  • 简介:Google 工程师 Addy Osmani 出品,为 AI 编码 Agent 提供生产级工程技能库。覆盖代码审查、重构、测试生成、文档编写等工程实践。与 VS Code Copilot、Cursor 等主流编码 Agent 深度集成。
  • 评价:⭐⭐⭐⭐⭐ 高价值。Addy Osmani 是 Google Web Essentials 和 PWA 推动者,该仓库由多名核心维护者共建,内容工程化程度高,适合作为企业级编码 Agent 技能规范参考。
  • 标签AI-Agent Engineering Coding Tool-Use Production
  • 是否需精读:建议,可作为 Agent 技能工程化规范页素材

unclecode/crawl4ai — LLM-Friendly Web Crawler

  • 链接:https://github.com/unclecode/crawl4ai
  • 简介:专为 LLM 设计的开源网页爬虫,支持 JS 渲染、提取结构化数据、Markdown 输出,是 RAG 数据管道的高质量抓取工具。
  • 评价:⭐⭐⭐⭐ 高价值。RAG 系统数据摄入环节的痛点工具,与主流 Agent 框架集成自然。
  • 标签RAG Data-Engineering Web-Scraping LLM
  • 是否需精读:可选,RAG 工程页参考

bradautomates/claude-video — 让 Claude 看视频

  • 链接:https://github.com/bradautomates/claude-video
  • 星标:6,721 ⭐ | 今日 +718
  • 简介/watch 命令下载视频、提取帧、转录,将结果交给 Claude 分析。支持本地视频和 YouTube URL。
  • 评价:⭐⭐⭐ 有趣的多模态实验工具,适合构建视频理解 Agent 管线。
  • 标签Multimodal Video Agent-Tools

kyutai-labs/pocket-tts — CPU 上的 TTS

  • 链接:https://github.com/kyutai-labs/pocket-tts
  • 星标:6,991 ⭐ | 今日 +235
  • 简介:CPU 友好的轻量 TTS 模型,适合边缘部署、嵌入式设备和隐私敏感场景。
  • 评价:⭐⭐⭐⭐ 工程亮点:内存占用极小,适合本地/离线语音合成场景。与 open-whisper 等形成互补。
  • 标签TTS Edge Inference Deployment

asgeirtj/system_prompts_leaks — 系统提示词泄露集合

  • 链接:https://github.com/asgeirtj/system_prompts_leaks
  • 星标:55,174 ⭐ | 今日 +1,125
  • 简介:收集了 Claude (Fable 5, Opus 4.8)、GPT 5.5、Gemini 3.5/3.1、Grok、Cursor 等的系统提示词泄露。
  • 评价:⚠️ 安全研究价值 > 工程参考价值。提示词工程和红队测试参考;注意不要将泄露内容直接用于产品。
  • 标签Security Prompt-Engineering Research

anthropics/claude-cookbooks — Claude 使用食谱集

  • 链接:https://github.com/anthropics/claude-cookbooks
  • 星标:47,171 ⭐ | 今日 +194
  • 简介:Jupyter Notebook 格式的 Claude 使用技巧和实战方案合集,覆盖 Agent、多模态、代码执行等场景。
  • 评价:⭐⭐⭐⭐ 官方维护,实用性强,适合作为 Claude 工程实践参考。
  • 标签Claude Agent Notebook Best-Practices

二、Hugging Face 模型动态(2026 年 7 月)

🔥 中国开源模型持续领跑 HF 趋势

模型 链接 参数量 定位
Kimi K2.7-Code (Moonshot) moonshotai/Kimi-K2.7-Code 1.1T (MoE) 长程推理、代码 Agent
MiniMax-M3 (MiniMax) MiniMaxAI/MiniMax-M3 427B 多模态通用
GLM-5.2 (Zhipu) zhipuai/GLM-5.2 Agentic、工具调用
baidu/Unlimited-OCR baidu/Unlimited-OCR 3B OCR 专用

关键趋势: - Kimi K2.6/K2.7-Code 在 HF 累计下载量已超 857k,成为 2026 年最受关注的开源代码模型之一 - GLM-5.1/5.2 被多篇 2026 年技术博客列为最佳 Agentic AI 开源模型首选 - 中国开源模型 Collectionzh-ai-community)每月持续更新,涵盖 GLM、Macaron、Kimi、DeepSeek 等家族

🏭 Microsoft Foundry Managed Compute × Hugging Face

  • 链接:https://huggingface.co/blog/microsoft/foundry-managed-compute
  • 内容:Azure Foundry 托管计算 + Hugging Face 模型一键部署,权重预缓存、运行时内置安全扫描、企业级可观测性。
  • 评价:⭐⭐⭐⭐ 对企业级 HF 模型部署有重要参考价值,提供了 vLLM/SGLang 之外的云托管选项。
  • 行动建议:补充到知识库「模型部署」主题页

三、推理引擎对比(2026 年中期状态)

重要更新:Hugging Face TGI 已于 2025 年 12 月进入维护模式,新部署一律推荐 vLLM 或 SGLang。

vLLM vs SGLang 2026 基准参考

维度 vLLM SGLang
核心创新 PagedAttention(KV Cache 分块管理) RadixAttention(前缀复用)
吞吐量(Llama 3.1 8B, H100) ~12,500 tok/s ~16,200 tok/s
优势场景 高并发、长序列、通用部署 前缀密集(RAG、多轮对话、结构化输出)
硬件支持 最广(AWS/GCP/Azure 均支持) 相对窄
社区规模 最大 较小但活跃
推荐场景 默认首选、生产级通用部署 复杂 Agent 管线、多轮 RAG

来源: - TechSy benchmark: https://techsy.io/en/blog/vllm-vs-sglang - Spheron H100 benchmark: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks - CallMissed TGI 维护说明: https://www.callmissed.com/blog/inference-engines-vllm-tgi-sglang

vLLM MRV2(Model Runner V2)更新: - 在 GB200 上开启 MRV2 后,吞吐量较旧版提升 56% - H100 提升幅度可能不同,详见 Spheron benchmark

TensorRT-LLM:NVIDIA 官方优化框架,适合对延迟敏感的场景,但编译复杂,不适合快速迭代团队。

Modular MAX:新兴竞争者,Mojo 图编译内核,在高并发 Dense 模型场景已超越 vLLM(Spheron 2026 benchmark)。

工程行动建议

  • 新项目默认选 vLLM;前缀复用明显的 Agent 场景考虑 SGLang
  • TGI 存量服务需规划迁移路径
  • 关注 Modular MAX 后续 benchmark(2026 下半年可能成为第三极)

四、Agent 工程栈(2026 六层模型)

来源:The AI Engineer (Substack) — The AI Agents Stack 2026 Edition

  • 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者:The AI Engineer newsletter
  • 核心观点:2026 Agent 栈已从 5 层演化为 6 层,至少 3 层在 2024 年尚不存在独立分类: 1. Models — 底层推理引擎 2. Storage — 向量数据库 + 内存 3. Tool Libraries & Memory — 工具定义、长期记忆 4. Orchestration — 框架层(LangGraph、Mastra、AI SDK) 5. Observability — Agent 可观测性(LangSmith、Helios、Braintrust) 6. Governance — 安全、权限、审计(Anthropic MCP、权限隔离)

来源:The Nuance Perspective (Substack) — AI Agent Stack in 2026

  • 链接:https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026
  • 作者:Aishwarya Naresh Reganti
  • 核心观点:术语"栈"已不足以描述 Agent 层——它更像一个双向治理系统,两侧各有治理轨道(权限和工作流审查)。六层从底向上:模型→存储→工具/记忆→编排→可观测性→治理。

来源:MLOps Community — Building AI Agents That Survive Production

  • 会议:AI Agents 2026,Seattle
  • 演讲者:Haytham Abuelfutuh(Union.ai CTO,Flyte 核心作者)
  • 核心框架3D Design for Production Agents
  • Dynamic:Agent 平台必须支持原生 Python,而非约束 DSL
  • Durable:在代码内声明基础设施(OOM 处理、抢占恢复、检查点恢复)
  • Defended:用 Pydantic Monty 沙箱隔离 Agent 生成的代码,网络隔离执行环境
  • 真实案例:Dragonfly 使用 Flyte 构建四层 Agent 架构,在单次运行中索引 25 万+ 商品
  • 链接:https://www.youtube.com/watch?v=swO5svhBhQ4

LangChain State of Agent Engineering 关键数据

  • 链接:https://www.langchain.com/state-of-agent-engineering
  • 大厂(1 万+ 员工)最大挑战:幻觉和输出一致性(Hallucinations & Consistency)
  • 持续痛点:Context Engineering 及大规模上下文管理
  • LangChain 2026 产品线:LangSmith(可观测性)、Fleet(企业级 Agent)、Sandboxes(安全代码执行)、Deep Agents(长时运行任务)

五、向量数据库 2026 选型决策

核心参考:TechSy — Best Vector Databases 2026: 9 Picks With Code

  • 链接:https://techsy.io/en/blog/best-vector-databases-2026
  • 核心结论
  • Pinecone Serverless:最低上线成本,预算不敏感时首选
  • Qdrant:自托管最佳性价比,Rust 实现内存安全,过滤查询性能优秀
  • pgvector:已有 PostgreSQL 栈且规模 < 1000 万向量时的务实选择
  • Milvus:规模超过数亿向量时的企业级选项,K8s 原生分布式架构

决策树

规模 < 10M 向量 + 已有 PG → pgvector
规模 < 100M 向量 + 自托管 → Qdrant(默认)
规模 > 数亿向量 + 企业需求 → Milvus
完全不想运维 + 预算充足 → Pinecone Serverless

补充:Kunal Ganglani — Milvus vs Qdrant

  • 链接:https://www.kunalganglani.com/blog/milvus-vs-qdrant
  • Qdrant 优势:操作简单、Rust 内存安全、过滤速度优秀
  • Milvus 优势:K8s 原生、百亿向量场景、生态集成深

六、分类标签汇总

AI-Agent          # 多条目
Engineering       # agent-skills, claude-cookbooks
LLM-Inference     # vLLM, SGLang, TGI, TensorRT-LLM
RAG               # crawl4ai, 向量库
Multimodal        # claude-video, MiniMax-M3
TTS               # pocket-tts
Security          # system_prompts_leaks
Backend           # 向量数据库选型
Deployment        # Foundry, vLLM, SGLang
OpenSource-Models # Kimi-K2, GLM, MiniMax-M3
Production        # Agent 工程栈

七、建议写入路径

  • 主要草稿/shared/research-kb/inbox/jay/2026-07-10-github-huggingface-inference-agents-db.md
  • 主题页更新建议
  • topics/llm-inference-engines.md — 更新 TGI 维护状态、vLLM MRV2、Modular MAX
  • topics/ai-agent-stack.md — 补充 2026 六层模型、3D Design、LangChain 状态报告
  • topics/vector-databases.md — 更新 2026 选型决策树
  • topics/open-source-models.md — 补充 Kimi K2.7-Code、GLM-5.2、MiniMax-M3 动态

八、精读/审稿建议

条目 优先级 行动
vLLM vs SGLang 2026 benchmark 原文 精读,获取具体 benchmark 数据补充草稿
The AI Engineer Substack — Agent Stack 2026 审稿,确认六层模型措辞准确性
addyosmani/agent-skills README 精读,抽取工程技能规范要点
LangChain State of Agent Engineering 报告 审稿,补充幻觉/一致性数据
Foundry Managed Compute 博客 精读,补充企业部署方案对比
crawl4ai GitHub README 可选,作为 RAG 数据工程参考