知识库草稿:GitHub Trending · Hugging Face 模型动态 · 推理引擎 · Agent 工程 · 向量库(2026-07-10)
实例:Jay
检索范围:GitHub Trending、Hugging Face 博客 / Papers、推理引擎对比(vLLM / SGLang / TGI)、Agent 工程栈、向量数据库 2026 选型、中国开源模型动态
来源类型:GitHub、Hugging Face、Tech Blog、Substack、Medium
一、GitHub Trending 高价值条目(2026-07-10)
⭐ addyosmani/agent-skills — Production-grade AI Coding Agent Skills
- 链接:https://github.com/addyosmani/agent-skills
- 语言:JavaScript
- 星标:75,905 ⭐ | 今日 +2,554
- 简介:Google 工程师 Addy Osmani 出品,为 AI 编码 Agent 提供生产级工程技能库。覆盖代码审查、重构、测试生成、文档编写等工程实践。与 VS Code Copilot、Cursor 等主流编码 Agent 深度集成。
- 评价:⭐⭐⭐⭐⭐ 高价值。Addy Osmani 是 Google Web Essentials 和 PWA 推动者,该仓库由多名核心维护者共建,内容工程化程度高,适合作为企业级编码 Agent 技能规范参考。
- 标签:
AI-AgentEngineeringCodingTool-UseProduction - 是否需精读:建议,可作为 Agent 技能工程化规范页素材
⭐ unclecode/crawl4ai — LLM-Friendly Web Crawler
- 链接:https://github.com/unclecode/crawl4ai
- 简介:专为 LLM 设计的开源网页爬虫,支持 JS 渲染、提取结构化数据、Markdown 输出,是 RAG 数据管道的高质量抓取工具。
- 评价:⭐⭐⭐⭐ 高价值。RAG 系统数据摄入环节的痛点工具,与主流 Agent 框架集成自然。
- 标签:
RAGData-EngineeringWeb-ScrapingLLM - 是否需精读:可选,RAG 工程页参考
⭐ bradautomates/claude-video — 让 Claude 看视频
- 链接:https://github.com/bradautomates/claude-video
- 星标:6,721 ⭐ | 今日 +718
- 简介:
/watch命令下载视频、提取帧、转录,将结果交给 Claude 分析。支持本地视频和 YouTube URL。 - 评价:⭐⭐⭐ 有趣的多模态实验工具,适合构建视频理解 Agent 管线。
- 标签:
MultimodalVideoAgent-Tools
⭐ kyutai-labs/pocket-tts — CPU 上的 TTS
- 链接:https://github.com/kyutai-labs/pocket-tts
- 星标:6,991 ⭐ | 今日 +235
- 简介:CPU 友好的轻量 TTS 模型,适合边缘部署、嵌入式设备和隐私敏感场景。
- 评价:⭐⭐⭐⭐ 工程亮点:内存占用极小,适合本地/离线语音合成场景。与 open-whisper 等形成互补。
- 标签:
TTSEdgeInferenceDeployment
asgeirtj/system_prompts_leaks — 系统提示词泄露集合
- 链接:https://github.com/asgeirtj/system_prompts_leaks
- 星标:55,174 ⭐ | 今日 +1,125
- 简介:收集了 Claude (Fable 5, Opus 4.8)、GPT 5.5、Gemini 3.5/3.1、Grok、Cursor 等的系统提示词泄露。
- 评价:⚠️ 安全研究价值 > 工程参考价值。提示词工程和红队测试参考;注意不要将泄露内容直接用于产品。
- 标签:
SecurityPrompt-EngineeringResearch
anthropics/claude-cookbooks — Claude 使用食谱集
- 链接:https://github.com/anthropics/claude-cookbooks
- 星标:47,171 ⭐ | 今日 +194
- 简介:Jupyter Notebook 格式的 Claude 使用技巧和实战方案合集,覆盖 Agent、多模态、代码执行等场景。
- 评价:⭐⭐⭐⭐ 官方维护,实用性强,适合作为 Claude 工程实践参考。
- 标签:
ClaudeAgentNotebookBest-Practices
二、Hugging Face 模型动态(2026 年 7 月)
🔥 中国开源模型持续领跑 HF 趋势
| 模型 | 链接 | 参数量 | 定位 |
|---|---|---|---|
| Kimi K2.7-Code (Moonshot) | moonshotai/Kimi-K2.7-Code |
1.1T (MoE) | 长程推理、代码 Agent |
| MiniMax-M3 (MiniMax) | MiniMaxAI/MiniMax-M3 |
427B | 多模态通用 |
| GLM-5.2 (Zhipu) | zhipuai/GLM-5.2 |
— | Agentic、工具调用 |
| baidu/Unlimited-OCR | baidu/Unlimited-OCR |
3B | OCR 专用 |
关键趋势:
- Kimi K2.6/K2.7-Code 在 HF 累计下载量已超 857k,成为 2026 年最受关注的开源代码模型之一
- GLM-5.1/5.2 被多篇 2026 年技术博客列为最佳 Agentic AI 开源模型首选
- 中国开源模型 Collection(zh-ai-community)每月持续更新,涵盖 GLM、Macaron、Kimi、DeepSeek 等家族
🏭 Microsoft Foundry Managed Compute × Hugging Face
- 链接:https://huggingface.co/blog/microsoft/foundry-managed-compute
- 内容:Azure Foundry 托管计算 + Hugging Face 模型一键部署,权重预缓存、运行时内置安全扫描、企业级可观测性。
- 评价:⭐⭐⭐⭐ 对企业级 HF 模型部署有重要参考价值,提供了 vLLM/SGLang 之外的云托管选项。
- 行动建议:补充到知识库「模型部署」主题页
三、推理引擎对比(2026 年中期状态)
重要更新:Hugging Face TGI 已于 2025 年 12 月进入维护模式,新部署一律推荐 vLLM 或 SGLang。
vLLM vs SGLang 2026 基准参考
| 维度 | vLLM | SGLang |
|---|---|---|
| 核心创新 | PagedAttention(KV Cache 分块管理) | RadixAttention(前缀复用) |
| 吞吐量(Llama 3.1 8B, H100) | ~12,500 tok/s | ~16,200 tok/s |
| 优势场景 | 高并发、长序列、通用部署 | 前缀密集(RAG、多轮对话、结构化输出) |
| 硬件支持 | 最广(AWS/GCP/Azure 均支持) | 相对窄 |
| 社区规模 | 最大 | 较小但活跃 |
| 推荐场景 | 默认首选、生产级通用部署 | 复杂 Agent 管线、多轮 RAG |
来源: - TechSy benchmark: https://techsy.io/en/blog/vllm-vs-sglang - Spheron H100 benchmark: https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks - CallMissed TGI 维护说明: https://www.callmissed.com/blog/inference-engines-vllm-tgi-sglang
vLLM MRV2(Model Runner V2)更新: - 在 GB200 上开启 MRV2 后,吞吐量较旧版提升 56% - H100 提升幅度可能不同,详见 Spheron benchmark
TensorRT-LLM:NVIDIA 官方优化框架,适合对延迟敏感的场景,但编译复杂,不适合快速迭代团队。
Modular MAX:新兴竞争者,Mojo 图编译内核,在高并发 Dense 模型场景已超越 vLLM(Spheron 2026 benchmark)。
工程行动建议
- 新项目默认选 vLLM;前缀复用明显的 Agent 场景考虑 SGLang
- TGI 存量服务需规划迁移路径
- 关注 Modular MAX 后续 benchmark(2026 下半年可能成为第三极)
四、Agent 工程栈(2026 六层模型)
来源:The AI Engineer (Substack) — The AI Agents Stack 2026 Edition
- 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 作者:The AI Engineer newsletter
- 核心观点:2026 Agent 栈已从 5 层演化为 6 层,至少 3 层在 2024 年尚不存在独立分类: 1. Models — 底层推理引擎 2. Storage — 向量数据库 + 内存 3. Tool Libraries & Memory — 工具定义、长期记忆 4. Orchestration — 框架层(LangGraph、Mastra、AI SDK) 5. Observability — Agent 可观测性(LangSmith、Helios、Braintrust) 6. Governance — 安全、权限、审计(Anthropic MCP、权限隔离)
来源:The Nuance Perspective (Substack) — AI Agent Stack in 2026
- 链接:https://thenuancedperspective.substack.com/p/the-ai-agent-stack-in-2026
- 作者:Aishwarya Naresh Reganti
- 核心观点:术语"栈"已不足以描述 Agent 层——它更像一个双向治理系统,两侧各有治理轨道(权限和工作流审查)。六层从底向上:模型→存储→工具/记忆→编排→可观测性→治理。
来源:MLOps Community — Building AI Agents That Survive Production
- 会议:AI Agents 2026,Seattle
- 演讲者:Haytham Abuelfutuh(Union.ai CTO,Flyte 核心作者)
- 核心框架:3D Design for Production Agents
- Dynamic:Agent 平台必须支持原生 Python,而非约束 DSL
- Durable:在代码内声明基础设施(OOM 处理、抢占恢复、检查点恢复)
- Defended:用 Pydantic Monty 沙箱隔离 Agent 生成的代码,网络隔离执行环境
- 真实案例:Dragonfly 使用 Flyte 构建四层 Agent 架构,在单次运行中索引 25 万+ 商品
- 链接:https://www.youtube.com/watch?v=swO5svhBhQ4
LangChain State of Agent Engineering 关键数据
- 链接:https://www.langchain.com/state-of-agent-engineering
- 大厂(1 万+ 员工)最大挑战:幻觉和输出一致性(Hallucinations & Consistency)
- 持续痛点:Context Engineering 及大规模上下文管理
- LangChain 2026 产品线:LangSmith(可观测性)、Fleet(企业级 Agent)、Sandboxes(安全代码执行)、Deep Agents(长时运行任务)
五、向量数据库 2026 选型决策
核心参考:TechSy — Best Vector Databases 2026: 9 Picks With Code
- 链接:https://techsy.io/en/blog/best-vector-databases-2026
- 核心结论:
- Pinecone Serverless:最低上线成本,预算不敏感时首选
- Qdrant:自托管最佳性价比,Rust 实现内存安全,过滤查询性能优秀
- pgvector:已有 PostgreSQL 栈且规模 < 1000 万向量时的务实选择
- Milvus:规模超过数亿向量时的企业级选项,K8s 原生分布式架构
决策树
规模 < 10M 向量 + 已有 PG → pgvector
规模 < 100M 向量 + 自托管 → Qdrant(默认)
规模 > 数亿向量 + 企业需求 → Milvus
完全不想运维 + 预算充足 → Pinecone Serverless
补充:Kunal Ganglani — Milvus vs Qdrant
- 链接:https://www.kunalganglani.com/blog/milvus-vs-qdrant
- Qdrant 优势:操作简单、Rust 内存安全、过滤速度优秀
- Milvus 优势:K8s 原生、百亿向量场景、生态集成深
六、分类标签汇总
AI-Agent # 多条目
Engineering # agent-skills, claude-cookbooks
LLM-Inference # vLLM, SGLang, TGI, TensorRT-LLM
RAG # crawl4ai, 向量库
Multimodal # claude-video, MiniMax-M3
TTS # pocket-tts
Security # system_prompts_leaks
Backend # 向量数据库选型
Deployment # Foundry, vLLM, SGLang
OpenSource-Models # Kimi-K2, GLM, MiniMax-M3
Production # Agent 工程栈
七、建议写入路径
- 主要草稿:
/shared/research-kb/inbox/jay/2026-07-10-github-huggingface-inference-agents-db.md - 主题页更新建议:
topics/llm-inference-engines.md— 更新 TGI 维护状态、vLLM MRV2、Modular MAXtopics/ai-agent-stack.md— 补充 2026 六层模型、3D Design、LangChain 状态报告topics/vector-databases.md— 更新 2026 选型决策树topics/open-source-models.md— 补充 Kimi K2.7-Code、GLM-5.2、MiniMax-M3 动态
八、精读/审稿建议
| 条目 | 优先级 | 行动 |
|---|---|---|
| vLLM vs SGLang 2026 benchmark 原文 | 高 | 精读,获取具体 benchmark 数据补充草稿 |
| The AI Engineer Substack — Agent Stack 2026 | 高 | 审稿,确认六层模型措辞准确性 |
| addyosmani/agent-skills README | 中 | 精读,抽取工程技能规范要点 |
| LangChain State of Agent Engineering 报告 | 中 | 审稿,补充幻觉/一致性数据 |
| Foundry Managed Compute 博客 | 中 | 精读,补充企业部署方案对比 |
| crawl4ai GitHub README | 低 | 可选,作为 RAG 数据工程参考 |