Jay 研究草稿 · GitHub Trending × HF × Inference × VectorDB × Substack

时间:2026-09-25 13:35 (Asia/Shanghai) 主题:AI 工程 × Inference × VectorDB × System-1 Decision × Substack Newsletter


🔥 新兴项目(本周活跃创建,星数 200-1100)

项目 Stars 语言 主题 可信度
deepopen-com/deepopen 1011 Python 非自回归 System 1 决策引擎,结构化类型决策 ⭐⭐⭐ 新兴,架构新颖
Contrastive-LM/CLM 922 Python 对比语言模型 ⭐⭐⭐ 待调研
nokia-applied-research/AnyJev 519 Python 将任意 LLM 转为 Jev 风格决策模型,带类型校准 ⭐⭐⭐ Nokia 背书
kydlikebtc/awesome-jev 349 Python Jev/TypeSafe AI System One 资源目录(1207 条) ⭐⭐ 高质量资源列表
malevrigns/agent-jev 295 Python 0.6B System One 决策模型,50ms 前向传播,无 output token 解码 ⭐⭐⭐ 工程亮点突出
jev-chat/jev-chat-windows 535 Python Win 端屏幕感知 + 本地 OCR + LLM 判断意图 ⭐⭐ 工程 Demo
rgem227/knoweldge-base 513 Python MCP API 调用知识库 ⭐⭐

评价: Jev/TypeSafe AI System One 决策范式正在形成一个小生态,围绕"typed decision + calibrated probability + zero token decode"展开。非自回归决策引擎(deepopen)是值得关注的新方向。

🏆 成熟项目(持续高活跃)

项目 Stars 方向
openclaw/openclaw 390K 通用 AI Agent 框架
obra/superpowers 291K Agentic Skills 框架
n8n-io/n8n 205K 工作流自动化 + MCP
ollama/ollama 181K 本地 LLM 推理
firecrawl/firecrawl 184K Web 数据提取
NousResearch/hermes-agent 248K Agent 框架

二、LLM Inference Engine 三强对比(2026 最新数据)

来源: Spheron、DeployBase、Morph、Yotta Labs、GMI Cloud(2026 年评测)

核心数据(H100 单卡)

Engine 版本 吞吐量 (H100) 关键特性 最佳场景
SGLang v0.4.3 ~16,200 tok/s RadixAttention prefix caching RAG、多轮对话等 prefix-heavy 场景
LMDeploy Latest ~16,200 tok/s Persistent batch scheduling 高吞吐服务
vLLM v0.7.3 ~12,500 tok/s PagedAttention,Blackwell 支持 灵活部署,频繁换模型
TensorRT-LLM Latest 最高(编译后) 编译 CUDA kernel 单模型、长期生产部署

关键决策框架

SGLang vs vLLM(prefix-heavy 负载): - 在 Llama 3.1 8B + prefix-heavy 流量下,SGLang 比 vLLM 快约 29%(16,200 vs 12,500 tok/s) - 优势全部来自 RadixAttention 的 prefix 缓存复用 - 独立 prompt 场景下两者差距 < 5%

TensorRT-LLM vs vLLM: - TensorRT-LLM 编译 Llama 3.3 70B FP8 需约 28 分钟(一次性成本) - vLLM 无编译,冷启动到首请求约 62 秒 - 高并发(>50 请求)下 TensorRT-LLM 吞吐量领先约 12-16% - 并发 <20 时,两者成本差距 <5%,工程维护成本是更大因素

vLLM prefix caching 配置示例:

llm = LLM(model="meta-llama/Llama-2-70b-hf", enable_prefix_caching=True)

可带来多轮场景 15-25% 吞吐提升。

gpu_memory_utilization 参考值: 7B→0.95,13B→0.85,70B→0.90

建议: RAG/多轮 Chat 场景优先 SGLang;需要灵活换模型/快速迭代优先 vLLM;单模型长期运行且关注成本优先 TensorRT-LLM。

精读建议: Spheron vLLM vs TensorRT-LLM vs SGLang Decision Framework — 2026 年最新实测数据


三、VectorDB 选型指南(2026 Q3 最新)

来源: Digital Applied、Firecrawl、aiml.qa、Kunal Ganglani、DEV Community

核心对比矩阵(10M 向量规模)

DB p99 延迟 规模上限 混合搜索 元数据过滤 开源协议
Qdrant ~12ms ~5000 万(单节点) BM42 原生,零额外开销 Apache 2.0
Weaviate ~16ms 亿级 原生 支持 BSD
Milvus ~18ms 十亿级 原生(2.6+) 支持 Apache 2.0
pgvector ~25-40ms ~500 万 需扩展 原生 SQL PostgreSQL
pgvectorscale 竞争力强 5000 万+ 需扩展 原生 SQL Apache 2.0

关键洞察

pgvector 复兴: pgvectorscale(Timescale)使用 DiskANN + Statistical Binary Quantization,在 50M 向量 99% recall 下达到 471 QPS,是 Qdrant 的 11.4 倍,延迟比 Pinecone s1 低 28 倍。如果已用 Postgres,pgvector 是 70% 场景的正确默认选择。

Qdrant 优势: Rust 实现,内存占用低,过滤查询性能极强(>90% 过滤条件下 2-4x 领先 Milvus),适合边缘/IoT 部署。单节点性能优秀,但 50M+ 向量时性能显著下降。

Milvus 2.6: 支持 Storage Format V2(列式布局对齐对象存储),BM25 吞吐量比 Elasticsearch 高约 400%,可在单一系统内替代"ES + 向量 DB"双系统组合。HNSW 索引构建速度在 50M+ 向量规模明显快于 Qdrant。

选型决策树:

已有 Postgres + <10M 向量?→ pgvector
需要极致延迟 + 开源?→ Qdrant
需要十亿级 + Kubernetes 原生?→ Milvus
需要完全托管 + 企业生态?→ Pinecone

四、Substack 高价值 Newsletter 要点

4.1 Piers Stobbs · RSG DS&AI Section(September 2026)

来源: https://rssdsaisection.substack.com/p/september-2026-newsletter

核心观点: 1. Latent Feedback:非verbalized 计算可重新进入 stack 并保持标准 transformer 架构、KV cache 和语言建模目标。使用 scheduled multi-pass objective 训练全带宽 transformer。 2. Speculative Decoding 突破:DSpark 提出 Confidence-Scheduled Speculative Decoding,可将 LLM serving 速度提升 85%。 3. 结构化存储 vs 文件:固定模型下,结构化存储比文件在 held-out 问题上的准确率高 28.7 分(95% CI [22.1, 35.4]),且 tokens per correct answer 更少。 4. 微软 Enterprise Agent 架构:探讨企业级自主 Agent 可靠运行所需的架构层次。 5. KV Cache 即虚拟内存:现代推理引擎能在相同 GPU 上服务 2-4x 更多用户,原理等同于 OS 虚拟内存(1960 年代技术移植到 LLM KV cache)。 6. Aleksa Gordić 深度文章:Inside vLLM: Anatomy of a High-Throughput LLM Inference System — vLLM 内部架构详解

可信度: ⭐⭐⭐⭐ 作者为专业 quant/AI 研究员,数据严谨

4.2 Jon Barrett · Token Efficiency for Agentic AI Agents(2026-07-09)

来源: https://barrettrestore.substack.com/p/how-to-engineer-token-efficiency

核心观点: - 2026 年 arXiv 研究(8 个主流模型)表明:token 使用量增加≠输出准确率提升(Bai et al., 2026) - 运营成本随系统规模线性增长 - Token 优化从第一次 API 调用前开始 - 具体 prompt 输入始终优于模糊指令

可信度: ⭐⭐⭐ 工程实践经验,有实验数据支撑

4.3 AI Evaluation Digest · May 2026(Substack)

来源: https://aievaluation.substack.com/p/2026-may-ai-evaluation-digest

核心观点: - GroupMemBench:当前 LLM 在多人对话中维持记忆时"灾难性崩溃",模型缺乏基本的认知对象永久性(cognitive object permanence) - EvalAgent:AI 测 AI 代码评测,自动化 Agent 评估劳动,但发现前沿模型执行成功率仅 30%,且生成的测试"过度工程化"——关注表面指标而非任务成功 - BenchGuard:让前沿 LLM 作为 Agent benchmark 审计员,发现许多"Agent 失败"实为测试本身缺陷(指令指向错误文件、评分器拒绝正确答案),费用 <$15/run

可信度: ⭐⭐⭐⭐ 研究级评测,方法论严谨


五、分类标签

#LLM-Inference #SGLang #vLLM #TensorRT-LLM #VectorDB #Qdrant #pgvector #Milvus #System-One-Decision #Jev #TypeSafe-AI #Agentic-RAG #Substack #Token-Efficiency #AI-Evaluation


六、建议写入路径

主草稿路径: /shared/research-kb/inbox/jay/2026-09-25T1335-jay-github-hf-inference-vecdb-substack-trending-sep25.md


七、后续行动

优先级 行动
🔴 高 精读 Spheron vLLM vs TensorRT-LLM vs SGLang Decision Framework,更新 Inference Engine 选型页
🔴 高 关注 Jev/TypeSafe AI System One 生态(awesome-jev 1207 条资源可做专题梳理)
🟡 中 关注 pgvectorscale 在 50M+ 向量规模的生产案例(与 Qdrant 的竞争)
🟡 中 DSpark Confidence-Scheduled Speculative Decoding 论文核验(85% 提速 CLAIM)
🟢 低 Aleksa Gordić vLLM 深度剖析文章 — 可作为 inference 栈培训素材

本条记录可信度:⭐⭐⭐(综合 GitHub 数据 + 多源 Web 搜索,部分数据依赖第三方博客,非一手论文)