Jay 研究草稿 · 2026-10-08 13:35 (UTC+8)

本次主题

GitHub Trending · Hugging Face Trending · LLM 推理引擎对比 · Vector DB 生产选型 · RAG/Agent 工程动态

检索范围

  • GitHub Trending Daily
  • Hugging Face Models Trending
  • Tavily: LLM inference engines 2026, Vector DB comparison, RAG 2026, AI deployment CI/CD
  • Substack: 纳入候选来源(agent engineering, RAG, MLOps newsletter)

🔥 高价值条目

morluto/rea — Reverse Engineer Anything with Agents ⭐ 16,837

  • 链接: https://github.com/morluto/rea
  • 语言: TypeScript
  • 今日 Stars: 4,655
  • 核心功能: 连接 AI coding agent 与逆向工具链,可对原生二进制、JS/Electron、.NET Assembly、网站、Android APK、固件等进行有证据的逆向分析。通过 MCP 与 agent 通信,返回发现结果及其证据,支持 Claude Code、Codex、Cursor、Gemini CLI 等。
  • 评价: 高度工程化的 MCP 工具,面向需要理解竞品闭源行为或二进制协议的 agent 场景。案例详实(Dx-Ball 游戏重建、Notion clipboard API 跟踪)。
  • 可信度: 高——多 maintainer,真实 case study,npm 发布活跃。
  • 后续行动: 评估为 agent 工具链条目;关注 MCP 集成模式。

addyosmani/agent-skills — Production-grade Engineering Skills for AI Coding Agents ⭐ 高关注

  • 链接: https://github.com/addyosmani/agent-skills
  • 评价: Addy Osmani 出品,工程化程度高,聚焦生产级 coding agent 技能。
  • 后续行动: 纳入 agent 工程能力清单。

thedotmack/claude-mem ⭐ 97,885

  • 链接: https://github.com/thedotmack/claude-mem
  • 今日 Stars: 578
  • 功能: 跨 session 持久化上下文,压缩 agent 会话历史并注入未来 session。
  • 评价: Agent 记忆持久化的开源参考实现,支持 Claude Code、OpenClaw、Codex 等多 agent。
  • 后续行动: 对比 OpenClaw 内置 memory 机制。

cloudflare/security-audit-skill ⭐ 26,199

  • 链接: https://github.com/cloudflare/security-audit-skill
  • 今日 Stars: 576
  • 功能: 多阶段安全审计 skill,面向 coding agent,输出机器可读 findings。
  • 评价: Cloudflare 官方维护,生产安全审计流程化工具。
  • 后续行动: OWASP agent security 工作流补充参考。

2. Hugging Face Trending(2026-10-08)

模型 类型 规模 下载量 备注
autotrust/JEV-27B-VL Image-Text-to-Text 28B 1.53M 3h 前更新,JEV 系列新成员
Cloudflare/clef Image-Text-to-Text 27B 9.51k Cloudflare 自研,14h 更新
Qwen/Qwen3.8-27B Image-Text-to-Text 28B 6.76M Qwen3.8 系列主力模型
deepseek-ai/DeepSeek-V4.1-Flash Image-Text-to-Text 763B 1.26M 超大杯,Flash 推理优化
Lightricks/LTX-2.5 Image-to-Video — 1.67M 5d 前更新,LTX 视频生成
Qwen/Qwen3.8-Flash-Next Image-Text-to-Text 180B 1.61M 旗舰 Flash 版本

观察: - Qwen3.8 系列持续主导 HF trending,27B 和 180B 两个规格均上榜 - DeepSeek-V4.1-Flash(763B)以 Flash 后缀强调推理优化 - Cloudflare clef 低调上榜,27B 多模态,CF 自研模型值得关注


3. LLM 推理引擎 2026 决策框架

来源: multiple Tavily results (premai.io, winder.ai, spheron.network, leetllm.com, AIMultiple)

核心对比矩阵

引擎 吞吐量 TTFT 内存效率 适用场景
vLLM ~1,850 tok/s ~380 ms 良(PagedAttention) 稳定优先,模型兼容最广
SGLang ~1,920 tok/s ~360 ms 良(RadixAttention) 多轮/Agentic 工作流,Groq 规模部署
TensorRT-LLM ~2,100 tok/s ~340 ms 最优 NVIDIA H100,延迟敏感
LMDeploy ~2,100+ tok/s — 量化友好 受限硬件,本地部署

决策建议(2026 最新)

  • 默认选 vLLM:生态最成熟,模型覆盖最广,文档完善,适合首次生产部署
  • 选 SGLang:多轮对话、agent 系统、共享 prefix 场景;RadixAttention 对 batch prefix caching 有优势
  • 选 LMDeploy:量化模型在受限 GPU,本地 OpenAI 兼容 API
  • 选 TensorRT-LLM:延迟敏感、连续 batch、明确 NVIDIA 栈

冷知识: 在 H100 上 SGLang serving Qwen3.8-27B(50 并发),成本约 $0.56/M 输出 token(卡满载),而 Ollama 同样卡约 $29.48/M——选错引擎代价 50 倍。


4. Vector DB 生产选型 2026

来源: encore.dev, digitalapplied.com, medium/@pratik-rupareliya, firecrawl.dev, cohorte.co

四层格局

Tier 代表 定位
托管领袖 Pinecone, Vertex Vector 全托管,零运维
开源主力 Qdrant, Weaviate, Milvus 自建,性能优先
Postgres 集成 Chroma, pgvector 现有 PG 栈,<50M 向量
大规模混合 Vespa 十亿级,混合检索

pgvector vs Qdrant 2026 最新

  • pgvector:Postgres 扩展,50M 向量内够用,SQL 联合查询,迁移成本低;新版 HNSW 索引改善性能
  • Qdrant:Rust 实现,HNSW 原生优化,metadata filtering 语法强,50M 向量内性能领先;Qdrant Edge 支持边缘部署
  • 选 pgvector:已有 Postgres 栈,向量规模 <50M,需要事务一致性
  • 选 Qdrant:需要 sub-50ms p99,metadata filtering 复杂,可投入独立运维

Enterprise RAG 定价参考(Onyx 2026-05)

  • 自托管开源:基础设施 $1,000–10,000/月 + 工程人力
  • 云 RAG 服务:$0.10–1.00/1,000 查询
  • 200 用户 Glean 年 TCO:$300K–1M+

5. RAG 2026 现状

来源: Harness blog, winder.ai, Agile Infoways, Reddit r/RAG

默认 RAG,Fine-tune 仅用于:

  1. 将前沿模型蒸馏到小模型(成本 + 延迟)
  2. 锁定固定的 style/tone/output schema(prompt 无法保持时)

MVP RAG Pipeline 2026 标准组件

Embedding  → text-embedding-3-large / Cohere embed-v3 / bge-large
Vector Store → pgvector / Qdrant / Pinecone
Chunking   → 语义分块 / 层次分块(避免 naive fixed-size)
Reranker   → Cohere Rerank / cross-encoder(Recall@10: 78% → 91%)
Eval       → Ragas / TruLens / DeepEval
Orchestration → LangChain / LlamaIndex

Reddit 生产 RAG Stack(2026)

  • 文档处理:PageIndex(私有部署),视觉 LLM:Gemma 3 27B → Gemma 4 26B A4B
  • 小报告生成:Qwen 3.5 9B
  • 路由/治理:LangChain + IBM watsonx

分类标签

LLM-Inference Vector-DB RAG Agent-Engineering GitHub-Trending HuggingFace MLOps

建议写入路径

/shared/research-kb/inbox/jay/2026-10-08T1335-jay-github-trending-hf-inference-vecdb-oct08.md

后续行动

  • [ ] morluto/rea 作为 MCP agent 工具链案例归档
  • [ ] Qwen3.8-Flash-Next 180B 规模部署性价比研究(vs DeepSeek-V4.1-Flash 763B)
  • [ ] vLLM vs SGLang 生产 benchmark 2026-10 最新数据核实
  • [ ] pgvector vs Qdrant 具体 benchmark 数据来源核实

本次是否写入

✅ 是(/shared/research-kb/inbox/jay/2026-10-08T1335-jay-github-trending-hf-inference-vecdb-oct08.md)


Jay · 2026-10-08 13:35 UTC+8 · 实例 jay · 本轮未执行任何 GitHub 写入操作