Jay 研究草稿 · GitHub Trending × HF × Inference × VectorDB × Substack
时间:2026-09-25 13:35 (Asia/Shanghai) 主题:AI 工程 × Inference × VectorDB × System-1 Decision × Substack Newsletter
一、GitHub Trending 高价值项目
🔥 新兴项目(本周活跃创建,星数 200-1100)
| 项目 | Stars | 语言 | 主题 | 可信度 |
|---|---|---|---|---|
deepopen-com/deepopen |
1011 | Python | 非自回归 System 1 决策引擎,结构化类型决策 | ⭐⭐⭐ 新兴,架构新颖 |
Contrastive-LM/CLM |
922 | Python | 对比语言模型 | ⭐⭐⭐ 待调研 |
nokia-applied-research/AnyJev |
519 | Python | 将任意 LLM 转为 Jev 风格决策模型,带类型校准 | ⭐⭐⭐ Nokia 背书 |
kydlikebtc/awesome-jev |
349 | Python | Jev/TypeSafe AI System One 资源目录(1207 条) | ⭐⭐ 高质量资源列表 |
malevrigns/agent-jev |
295 | Python | 0.6B System One 决策模型,50ms 前向传播,无 output token 解码 | ⭐⭐⭐ 工程亮点突出 |
jev-chat/jev-chat-windows |
535 | Python | Win 端屏幕感知 + 本地 OCR + LLM 判断意图 | ⭐⭐ 工程 Demo |
rgem227/knoweldge-base |
513 | Python | MCP API 调用知识库 | ⭐⭐ |
评价: Jev/TypeSafe AI System One 决策范式正在形成一个小生态,围绕"typed decision + calibrated probability + zero token decode"展开。非自回归决策引擎(deepopen)是值得关注的新方向。
🏆 成熟项目(持续高活跃)
| 项目 | Stars | 方向 |
|---|---|---|
openclaw/openclaw |
390K | 通用 AI Agent 框架 |
obra/superpowers |
291K | Agentic Skills 框架 |
n8n-io/n8n |
205K | 工作流自动化 + MCP |
ollama/ollama |
181K | 本地 LLM 推理 |
firecrawl/firecrawl |
184K | Web 数据提取 |
NousResearch/hermes-agent |
248K | Agent 框架 |
二、LLM Inference Engine 三强对比(2026 最新数据)
来源: Spheron、DeployBase、Morph、Yotta Labs、GMI Cloud(2026 年评测)
核心数据(H100 单卡)
| Engine | 版本 | 吞吐量 (H100) | 关键特性 | 最佳场景 |
|---|---|---|---|---|
| SGLang | v0.4.3 | ~16,200 tok/s | RadixAttention prefix caching | RAG、多轮对话等 prefix-heavy 场景 |
| LMDeploy | Latest | ~16,200 tok/s | Persistent batch scheduling | 高吞吐服务 |
| vLLM | v0.7.3 | ~12,500 tok/s | PagedAttention,Blackwell 支持 | 灵活部署,频繁换模型 |
| TensorRT-LLM | Latest | 最高(编译后) | 编译 CUDA kernel | 单模型、长期生产部署 |
关键决策框架
SGLang vs vLLM(prefix-heavy 负载): - 在 Llama 3.1 8B + prefix-heavy 流量下,SGLang 比 vLLM 快约 29%(16,200 vs 12,500 tok/s) - 优势全部来自 RadixAttention 的 prefix 缓存复用 - 独立 prompt 场景下两者差距 < 5%
TensorRT-LLM vs vLLM: - TensorRT-LLM 编译 Llama 3.3 70B FP8 需约 28 分钟(一次性成本) - vLLM 无编译,冷启动到首请求约 62 秒 - 高并发(>50 请求)下 TensorRT-LLM 吞吐量领先约 12-16% - 并发 <20 时,两者成本差距 <5%,工程维护成本是更大因素
vLLM prefix caching 配置示例:
llm = LLM(model="meta-llama/Llama-2-70b-hf", enable_prefix_caching=True)
可带来多轮场景 15-25% 吞吐提升。
gpu_memory_utilization 参考值: 7B→0.95,13B→0.85,70B→0.90
建议: RAG/多轮 Chat 场景优先 SGLang;需要灵活换模型/快速迭代优先 vLLM;单模型长期运行且关注成本优先 TensorRT-LLM。
精读建议: Spheron vLLM vs TensorRT-LLM vs SGLang Decision Framework — 2026 年最新实测数据
三、VectorDB 选型指南(2026 Q3 最新)
来源: Digital Applied、Firecrawl、aiml.qa、Kunal Ganglani、DEV Community
核心对比矩阵(10M 向量规模)
| DB | p99 延迟 | 规模上限 | 混合搜索 | 元数据过滤 | 开源协议 |
|---|---|---|---|---|---|
| Qdrant | ~12ms | ~5000 万(单节点) | BM42 | 原生,零额外开销 | Apache 2.0 |
| Weaviate | ~16ms | 亿级 | 原生 | 支持 | BSD |
| Milvus | ~18ms | 十亿级 | 原生(2.6+) | 支持 | Apache 2.0 |
| pgvector | ~25-40ms | ~500 万 | 需扩展 | 原生 SQL | PostgreSQL |
| pgvectorscale | 竞争力强 | 5000 万+ | 需扩展 | 原生 SQL | Apache 2.0 |
关键洞察
pgvector 复兴: pgvectorscale(Timescale)使用 DiskANN + Statistical Binary Quantization,在 50M 向量 99% recall 下达到 471 QPS,是 Qdrant 的 11.4 倍,延迟比 Pinecone s1 低 28 倍。如果已用 Postgres,pgvector 是 70% 场景的正确默认选择。
Qdrant 优势: Rust 实现,内存占用低,过滤查询性能极强(>90% 过滤条件下 2-4x 领先 Milvus),适合边缘/IoT 部署。单节点性能优秀,但 50M+ 向量时性能显著下降。
Milvus 2.6: 支持 Storage Format V2(列式布局对齐对象存储),BM25 吞吐量比 Elasticsearch 高约 400%,可在单一系统内替代"ES + 向量 DB"双系统组合。HNSW 索引构建速度在 50M+ 向量规模明显快于 Qdrant。
选型决策树:
已有 Postgres + <10M 向量?→ pgvector
需要极致延迟 + 开源?→ Qdrant
需要十亿级 + Kubernetes 原生?→ Milvus
需要完全托管 + 企业生态?→ Pinecone
四、Substack 高价值 Newsletter 要点
4.1 Piers Stobbs · RSG DS&AI Section(September 2026)
来源: https://rssdsaisection.substack.com/p/september-2026-newsletter
核心观点: 1. Latent Feedback:非verbalized 计算可重新进入 stack 并保持标准 transformer 架构、KV cache 和语言建模目标。使用 scheduled multi-pass objective 训练全带宽 transformer。 2. Speculative Decoding 突破:DSpark 提出 Confidence-Scheduled Speculative Decoding,可将 LLM serving 速度提升 85%。 3. 结构化存储 vs 文件:固定模型下,结构化存储比文件在 held-out 问题上的准确率高 28.7 分(95% CI [22.1, 35.4]),且 tokens per correct answer 更少。 4. 微软 Enterprise Agent 架构:探讨企业级自主 Agent 可靠运行所需的架构层次。 5. KV Cache 即虚拟内存:现代推理引擎能在相同 GPU 上服务 2-4x 更多用户,原理等同于 OS 虚拟内存(1960 年代技术移植到 LLM KV cache)。 6. Aleksa Gordić 深度文章:Inside vLLM: Anatomy of a High-Throughput LLM Inference System — vLLM 内部架构详解
可信度: ⭐⭐⭐⭐ 作者为专业 quant/AI 研究员,数据严谨
4.2 Jon Barrett · Token Efficiency for Agentic AI Agents(2026-07-09)
来源: https://barrettrestore.substack.com/p/how-to-engineer-token-efficiency
核心观点: - 2026 年 arXiv 研究(8 个主流模型)表明:token 使用量增加≠输出准确率提升(Bai et al., 2026) - 运营成本随系统规模线性增长 - Token 优化从第一次 API 调用前开始 - 具体 prompt 输入始终优于模糊指令
可信度: ⭐⭐⭐ 工程实践经验,有实验数据支撑
4.3 AI Evaluation Digest · May 2026(Substack)
来源: https://aievaluation.substack.com/p/2026-may-ai-evaluation-digest
核心观点: - GroupMemBench:当前 LLM 在多人对话中维持记忆时"灾难性崩溃",模型缺乏基本的认知对象永久性(cognitive object permanence) - EvalAgent:AI 测 AI 代码评测,自动化 Agent 评估劳动,但发现前沿模型执行成功率仅 30%,且生成的测试"过度工程化"——关注表面指标而非任务成功 - BenchGuard:让前沿 LLM 作为 Agent benchmark 审计员,发现许多"Agent 失败"实为测试本身缺陷(指令指向错误文件、评分器拒绝正确答案),费用 <$15/run
可信度: ⭐⭐⭐⭐ 研究级评测,方法论严谨
五、分类标签
#LLM-Inference #SGLang #vLLM #TensorRT-LLM #VectorDB #Qdrant #pgvector #Milvus #System-One-Decision #Jev #TypeSafe-AI #Agentic-RAG #Substack #Token-Efficiency #AI-Evaluation
六、建议写入路径
主草稿路径: /shared/research-kb/inbox/jay/2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md
七、后续行动
| 优先级 | 行动 |
|---|---|
| 🔴 高 | 精读 Spheron vLLM vs TensorRT-LLM vs SGLang Decision Framework,更新 Inference Engine 选型页 |
| 🔴 高 | 关注 Jev/TypeSafe AI System One 生态(awesome-jev 1207 条资源可做专题梳理) |
| 🟡 中 | 关注 pgvectorscale 在 50M+ 向量规模的生产案例(与 Qdrant 的竞争) |
| 🟡 中 | DSpark Confidence-Scheduled Speculative Decoding 论文核验(85% 提速 CLAIM) |
| 🟢 低 | Aleksa Gordić vLLM 深度剖析文章 — 可作为 inference 栈培训素材 |
本条记录可信度:⭐⭐⭐(综合 GitHub 数据 + 多源 Web 搜索,部分数据依赖第三方博客,非一手论文)