Jay 研究草稿 · 2026-10-08 13:35 (UTC+8)
本次主题
GitHub Trending · Hugging Face Trending · LLM 推理引擎对比 · Vector DB 生产选型 · RAG/Agent 工程动态
检索范围
- GitHub Trending Daily
- Hugging Face Models Trending
- Tavily: LLM inference engines 2026, Vector DB comparison, RAG 2026, AI deployment CI/CD
- Substack: 纳入候选来源(agent engineering, RAG, MLOps newsletter)
🔥 高价值条目
1. GitHub Trending · Agent 工程工具链
morluto/rea — Reverse Engineer Anything with Agents ⭐ 16,837
- 链接: https://github.com/morluto/rea
- 语言: TypeScript
- 今日 Stars: 4,655
- 核心功能: 连接 AI coding agent 与逆向工具链,可对原生二进制、JS/Electron、.NET Assembly、网站、Android APK、固件等进行有证据的逆向分析。通过 MCP 与 agent 通信,返回发现结果及其证据,支持 Claude Code、Codex、Cursor、Gemini CLI 等。
- 评价: 高度工程化的 MCP 工具,面向需要理解竞品闭源行为或二进制协议的 agent 场景。案例详实(Dx-Ball 游戏重建、Notion clipboard API 跟踪)。
- 可信度: 高——多 maintainer,真实 case study,npm 发布活跃。
- 后续行动: 评估为 agent 工具链条目;关注 MCP 集成模式。
addyosmani/agent-skills — Production-grade Engineering Skills for AI Coding Agents ⭐ 高关注
- 链接: https://github.com/addyosmani/agent-skills
- 评价: Addy Osmani 出品,工程化程度高,聚焦生产级 coding agent 技能。
- 后续行动: 纳入 agent 工程能力清单。
thedotmack/claude-mem ⭐ 97,885
- 链接: https://github.com/thedotmack/claude-mem
- 今日 Stars: 578
- 功能: 跨 session 持久化上下文,压缩 agent 会话历史并注入未来 session。
- 评价: Agent 记忆持久化的开源参考实现,支持 Claude Code、OpenClaw、Codex 等多 agent。
- 后续行动: 对比 OpenClaw 内置 memory 机制。
cloudflare/security-audit-skill ⭐ 26,199
- 链接: https://github.com/cloudflare/security-audit-skill
- 今日 Stars: 576
- 功能: 多阶段安全审计 skill,面向 coding agent,输出机器可读 findings。
- 评价: Cloudflare 官方维护,生产安全审计流程化工具。
- 后续行动: OWASP agent security 工作流补充参考。
2. Hugging Face Trending(2026-10-08)
| 模型 | 类型 | 规模 | 下载量 | 备注 |
|---|---|---|---|---|
autotrust/JEV-27B-VL |
Image-Text-to-Text | 28B | 1.53M | 3h 前更新,JEV 系列新成员 |
Cloudflare/clef |
Image-Text-to-Text | 27B | 9.51k | Cloudflare 自研,14h 更新 |
Qwen/Qwen3.8-27B |
Image-Text-to-Text | 28B | 6.76M | Qwen3.8 系列主力模型 |
deepseek-ai/DeepSeek-V4.1-Flash |
Image-Text-to-Text | 763B | 1.26M | 超大杯,Flash 推理优化 |
Lightricks/LTX-2.5 |
Image-to-Video | — | 1.67M | 5d 前更新,LTX 视频生成 |
Qwen/Qwen3.8-Flash-Next |
Image-Text-to-Text | 180B | 1.61M | 旗舰 Flash 版本 |
观察: - Qwen3.8 系列持续主导 HF trending,27B 和 180B 两个规格均上榜 - DeepSeek-V4.1-Flash(763B)以 Flash 后缀强调推理优化 - Cloudflare clef 低调上榜,27B 多模态,CF 自研模型值得关注
3. LLM 推理引擎 2026 决策框架
来源: multiple Tavily results (premai.io, winder.ai, spheron.network, leetllm.com, AIMultiple)
核心对比矩阵
| 引擎 | 吞吐量 | TTFT | 内存效率 | 适用场景 |
|---|---|---|---|---|
| vLLM | ~1,850 tok/s | ~380 ms | 良(PagedAttention) | 稳定优先,模型兼容最广 |
| SGLang | ~1,920 tok/s | ~360 ms | 良(RadixAttention) | 多轮/Agentic 工作流,Groq 规模部署 |
| TensorRT-LLM | ~2,100 tok/s | ~340 ms | 最优 | NVIDIA H100,延迟敏感 |
| LMDeploy | ~2,100+ tok/s | — | 量化友好 | 受限硬件,本地部署 |
决策建议(2026 最新)
- 默认选 vLLM:生态最成熟,模型覆盖最广,文档完善,适合首次生产部署
- 选 SGLang:多轮对话、agent 系统、共享 prefix 场景;RadixAttention 对 batch prefix caching 有优势
- 选 LMDeploy:量化模型在受限 GPU,本地 OpenAI 兼容 API
- 选 TensorRT-LLM:延迟敏感、连续 batch、明确 NVIDIA 栈
冷知识: 在 H100 上 SGLang serving Qwen3.8-27B(50 并发),成本约 $0.56/M 输出 token(卡满载),而 Ollama 同样卡约 $29.48/M——选错引擎代价 50 倍。
4. Vector DB 生产选型 2026
来源: encore.dev, digitalapplied.com, medium/@pratik-rupareliya, firecrawl.dev, cohorte.co
四层格局
| Tier | 代表 | 定位 |
|---|---|---|
| 托管领袖 | Pinecone, Vertex Vector | 全托管,零运维 |
| 开源主力 | Qdrant, Weaviate, Milvus | 自建,性能优先 |
| Postgres 集成 | Chroma, pgvector | 现有 PG 栈,<50M 向量 |
| 大规模混合 | Vespa | 十亿级,混合检索 |
pgvector vs Qdrant 2026 最新
- pgvector:Postgres 扩展,50M 向量内够用,SQL 联合查询,迁移成本低;新版 HNSW 索引改善性能
- Qdrant:Rust 实现,HNSW 原生优化,metadata filtering 语法强,50M 向量内性能领先;Qdrant Edge 支持边缘部署
- 选 pgvector:已有 Postgres 栈,向量规模 <50M,需要事务一致性
- 选 Qdrant:需要 sub-50ms p99,metadata filtering 复杂,可投入独立运维
Enterprise RAG 定价参考(Onyx 2026-05)
- 自托管开源:基础设施 $1,000–10,000/月 + 工程人力
- 云 RAG 服务:$0.10–1.00/1,000 查询
- 200 用户 Glean 年 TCO:$300K–1M+
5. RAG 2026 现状
来源: Harness blog, winder.ai, Agile Infoways, Reddit r/RAG
默认 RAG,Fine-tune 仅用于:
- 将前沿模型蒸馏到小模型(成本 + 延迟)
- 锁定固定的 style/tone/output schema(prompt 无法保持时)
MVP RAG Pipeline 2026 标准组件
Embedding → text-embedding-3-large / Cohere embed-v3 / bge-large
Vector Store → pgvector / Qdrant / Pinecone
Chunking → 语义分块 / 层次分块(避免 naive fixed-size)
Reranker → Cohere Rerank / cross-encoder(Recall@10: 78% → 91%)
Eval → Ragas / TruLens / DeepEval
Orchestration → LangChain / LlamaIndex
Reddit 生产 RAG Stack(2026)
- 文档处理:PageIndex(私有部署),视觉 LLM:Gemma 3 27B → Gemma 4 26B A4B
- 小报告生成:Qwen 3.5 9B
- 路由/治理:LangChain + IBM watsonx
分类标签
LLM-Inference Vector-DB RAG Agent-Engineering GitHub-Trending HuggingFace MLOps
建议写入路径
/shared/research-kb/inbox/jay/2026-10-08T1335-jay-github-trending-hf-inference-vecdb-oct08.md
后续行动
- [ ]
morluto/rea作为 MCP agent 工具链案例归档 - [ ] Qwen3.8-Flash-Next 180B 规模部署性价比研究(vs DeepSeek-V4.1-Flash 763B)
- [ ] vLLM vs SGLang 生产 benchmark 2026-10 最新数据核实
- [ ] pgvector vs Qdrant 具体 benchmark 数据来源核实
本次是否写入
✅ 是(/shared/research-kb/inbox/jay/2026-10-08T1335-jay-github-trending-hf-inference-vecdb-oct08.md)
Jay · 2026-10-08 13:35 UTC+8 · 实例 jay · 本轮未执行任何 GitHub 写入操作