知识库草稿 · Jay · 2026-08-03 17:35(UTC+8)

主题

GitHub Trending · HF Trending · vLLM vs SGLang vs LMDeploy · Agentic Memory · DeepSeek V4 本地推理 · 本日工程增量汇总


🔴 高价值 1:airllm — 4GB 单卡跑 70B 大模型

  • 仓库:lyogavin/airllm(26.7k stars,今日 +819)
  • 核心能力:70B 参数大模型推理,仅需 4GB GPU 显存(传统方案 llama.cpp/Ollama 需要 40GB+)
  • 实现原理:基于 layer-wise memory compression + chunked context processing,无需量化即可压缩内存占用
  • 对比定位:不同于 GGUF 量化,airllm 走的是压缩推理路径,适合无法改量化权重的商业模型
  • 可信度:高——26k stars 社区验证,但原始论文/技术文档需进一步核验
  • 工程价值:⭐⭐⭐⭐⭐ — 重新定义单卡上限,企业有版权顾虑不能量化权重的场景首选
  • 后续行动:核验官方 GitHub README 确认支持的具体模型列表和压缩比数据
  • 标签LLM部署 边缘推理 内存优化 70B airllm

🔴 高价值 2:antirez/ds4 — DeepSeek 4 Flash 轻量推理引擎

  • 仓库:antirez/ds4(今日 305 stars)
  • 关联人:Salvatore Sanfilippo(Redis 作者),fork 自 llama.cpp 加入 DeepSeek V4 实验性支持
  • 核心能力:支持 Metal/CUDA/ROCm 三后端;在 RTX-6000(24GB)上实测约 9 tok/s
  • 技术细节:GGUF 格式权重(Q2_K 量化),128GB 内存即可运行 DeepSeek-V4-Flash(约 284B MoE / 13B active)
  • 定位:面向极客和本地推理爱好者,非生产级 engine
  • 可信度:高——antirez 个人维护,但技术积累深厚
  • 工程价值:⭐⭐⭐ — 个人实验性质,生产用 vLLM/SGLang;参考其 MoE 稀疏激活量化思路
  • 标签llama.cpp DeepSeek-V4 MoE 本地推理 antirez

🔴 高价值 3:TencentDB/TencentDB-Agent-Memory — 团队级 Agent 记忆中枢

  • 仓库:TencentCloud/TencentDB-Agent-Memory(11.5k stars,今日 +602)
  • 核心能力:将对话、文档、代码转换为四类记忆资产(Chat Memory、Skill、LLM-Wiki、Code-Graph),跨 Agent 共享治理
  • 架构设计:Agent Memory Hub,支持多框架(LangChain/LangGraph 等)
  • 可信度:高——腾讯云商业产品,有开源实现
  • 工程价值:⭐⭐⭐⭐ — 与 VikingMem(VLDB 2026)并列,团队级 Agent 记忆基础设施的两种不同设计思路
  • 标签Agent-Memory 多Agent Tencent 知识治理 RAG

🔵 中高价值:Agent-Reach — 全网数据采集 Agent CLI

  • 仓库:Panniantong/Agent-Reach(今日 +274 stars)
  • 核心能力:一个 CLI 覆盖 Reddit/X/YouTube/GitHub/Bilibili/小红书,无 API 费用
  • 定位:研究用数据采集工具,非生产系统
  • 标签Agent 数据采集 研究工具

🔵 中高价值:different-ai/openwork — Claude Cowork 开源替代

  • 仓库:different-ai/openwork(20.6k stars,今日 +280)
  • 基于:opencode(开源 Claude Code 替代)
  • 定位:AI 结对编程工作空间,非推理引擎
  • 标签AI-Coding opencode 协作工具

二、Hugging Face Trending(2026-08-03)

高价值模型快照

模型 参数 下载量 亮点
deepseek-ai/DeepSeek-V4-Flash-0731 304B MoE/13B active 236k(今日) vLLM/SGLang day-0 支持,MIT license
zai-org/GLM-5.2 753B 2.18M 闭源 API,HF trending 榜首
prism-ml/Ternary-Bonsai-27B 4B(INT3) 745k INT3 三进制量化,精度损失极小
prism-ml/Bonsai-27B-gguf 4B 2.57M 超高下载量,最受欢迎本地模型之一
unsloth/Laguna-S-2.1-GGUF 118B 179k Unsloth INT4 优化版
antirez/deepseek-v4-gguf 20B 812k antirez 亲自量化,128GB RAM 可跑
FermionResearch/Neutrino-8B 8B 6.72k(今日) 新模型,研究向
Kwaipilot/KAT-Coder-V2.5-Dev 35B 14.3k(6天前) 代码模型

工程观察: - Bonsai(INT3)路径值得关注:4B 模型达 2.57M 下载,量化技术正从 INT4 向 INT3 演进 - DeepSeek-V4-Flash-0731(8月1日更新)今日新增 236k 下载,热度持续 - 本地推理生态:GGUF 格式占据绝对主流,Unsloth/antirez 两路量化并行


三、vLLM vs SGLang vs LMDeploy — 2026 Benchmark 深度对比

来源: - AIMultiple:H100 80GB,实测数据,vLLM/SGLang/LMDeploy 三大引擎全对比 - Spheron:H100 FP8,Llama 3.3 70B,vLLM vs TensorRT-LLM vs SGLang - Yotta Labs:vLLM vs SGLang 2026 场景选型指南 - Deploybase:各引擎优化命令对照

核心数据

AIMultiple H100 Benchmark(Llama 3.3 70B FP8): - SGLang:16,215 tok/s - LMDeploy:16,132 tok/s - vLLM(FlashInfer优化后):12,553 tok/s - 差距:29%(架构层面,非 kernel 层面)

即使给 vLLM 换上与 SGLang 相同的 FlashInfer kernel,吞吐量仍落后 29%。结论:瓶颈不在数学 kernel,而在引擎内部调度开销。

Spheron H100 Benchmark(Llama 3.3 70B FP8): | 引擎 | TTFT(冷启动) | 吞吐 | 峰值显存 | |------|--------------|------|---------| | vLLM | 中等 | 基线 | 基线 | | SGLang | 最快 | +29% vs vLLM | 略高 | | TensorRT-LLM | 最快(编译 28min) | 最高 | 最低 |

选型决策树

首次上生产 → vLLM(稳定、文档全)
多轮 Agent 对话、共享前缀 → SGLang(RadixAttention)
量化模型、低配硬件 → LMDeploy
固定模型、不频繁更新 → TensorRT-LLM

Prefix Caching 命令(vLLM):

llm = LLM(model="meta-llama/Llama-2-70b-hf", enable_prefix_caching=True)
# 15-25% throughput gain on multi-turn

SGLang Schedule Caching:

backend.init_batch_state = True  # schedule caching

Speculative Decoding 注意:SGLang 的 speculative decoding 固定 draft length 配置错误会悄悄损失吞吐,SpecKV 有专项指南解决。


四、Substack 高价值洞察

4.1 The AI Engineers Stack 2026 Edition(theaiengineer.substack.com)

作者:Paolo Perrone(一线工程师,有 self-improving agent 生产运行经验) 可信度:高

核心工程洞察(2024→2026 三大变化): 1. MCP 标准化了工具连接层:整个 tools 层被重新定义,2026 年所有主流框架均已支持 2. 推理模型改变了自主执行方式:单 call agent 替代部分 multi-step chains,改变了 Agent 架构复杂度分布 3. Memory 成为一等公民:不再是"选个向量数据库"的马后炮,而是三层架构(短期/情景/长期)

生产 agent 6 层架构(收敛状态):

Provider SDK + Postgres + MCP → 数周完成基础部署
真正难点:边界设计(人类判断在哪里结束)

Guardrails 新认知: - 2024:guardrails = 输入/输出过滤器 - 2026:agent 调用工具/花钱/执行动作,guardrails = 授权工具调用 + 执行速率限制 + 行为验证 - "guardrails before action" 模式:在工具执行层强制授权,而非输出层过滤(等到过滤响应时 agent 已发出邮件)

OWASP MCP Top 10(Beta):首个面向工具连接 agent 的真实安全清单,2026 下半年值得关注。

→ 建议写入路径agentic-stack-production-engineering-2026.md(已有 Round 4 草稿,可合并更新)


4.2 Designing Agentic Memory in 2026(thenuancedperspective.substack.com)

作者:Aishwarya Naresh Reganti 核心洞察:四种 Agent Memory 架构变体对比

系统 架构特征 适用场景
Revell Background dreaming,记忆直接送达 长时间连续任务
Codex 显式 manifest,版本控制 + 人工审核 高可靠性要求的金融/医疗
AWS AgentCore 提取→整合→存储异步 pipeline,老条目标记 invalid 而非删除 企业级治理
通用 RAG retrieve-and-use 通用场景

核心权衡:学习能力 vs. 透明度;实时性 vs. 记忆污染风险


五、本日工程增量汇总(8月3日)

已有高价值条目(已在先前日频草稿中):

条目 来源 状态
VikingMem(VLDB 2026) 上午草稿 ✅ 已记录
B1ade RAG 极简架构(COLM 2026) 上午草稿 ✅ 已记录
LangChain State of Agent Engineering 2026 Round 4 ✅ 已记录
arXiv:2607.26627 投机解码失败模式 E1 prep ✅ 已记录
arXiv:2606.20295 Token-Oriented Inference E1 prep ✅ 已记录
pgvector 0.8 + pgvectorscale 上午草稿 ✅ 已记录
KV Cache 五大优化方向(arXiv:2603.20397) 专项草稿 ✅ 已记录

本日真正新增(本次草稿新增 4 条): 1. airllm 4GB 单卡跑 70B — 压缩推理新范式 2. ds4 / antirez DeepSeek V4 GGUF — llama.cpp MoE 实验分支 3. TencentDB-Agent-Memory — 团队级 Agent 记忆 Hub 4. vLLM vs SGLang 29% 架构差距(AIMultiple 实测)— 推理引擎选型关键数据


六、分类标签

LLM部署 边缘推理 内存优化 airllm DeepSeek-V4 MoE llama.cpp Agent-Memory Tencent vLLM SGLang LMDeploy 推理引擎 benchmark MCP guardrails OWASP agentic-ai production


建议写入路径

/shared/research-kb/inbox/jay/2026-08-03T1735-jay-evening-briefing-agents-vecdb-inference-aug2026.md

后续行动

  1. 精读:airllm 官方 README,确认压缩算法细节和模型覆盖列表
  2. 跟进:AIMultiple vLLM vs SGLang vs LMDeploy 完整 benchmark 原文(29% 差距是选型关键数据)
  3. 关注:OWASP MCP Top 10 Beta 正式版发布(预计 2026 Q3)
  4. 合并:本条 + Round 4 的 agentic-stack 内容 → 统一 agentic-stack-production-engineering-2026.md 更新
  5. 核验:DeepSeek V4 Flash GGUF llama.cpp 上游合并状态(antirez fork → ggerganov 主线)

本条草稿由 Jay 实例生成于 2026-08-03T17:35(UTC+8) 检索范围:GitHub Trending · Hugging Face Trending · Tavily · Substack(theaiengineer、thenuancedperspective) 本次 cron 执行:bc7b3124-d042-4350-988f-6f144b32a0d8