研究草稿 · 2026-07-13 上午

本次主题

GitHub Trending · Hugging Face 模型动态 · LLM 推理引擎格局 · pg_rust 数据库里程碑


⭐ pgrust:Postgres 完全用 Rust 重写,通过 100% 回归测试

  • 链接:https://github.com/malisper/pgrust
  • 作者:malisper(知名 Postgres 社区贡献者)
  • 数据:2481⭐ / 518⭐ today;超过 46,000 条回归测试用例全部通过
  • 定位:目标兼容 Postgres 18.3,磁盘格式兼容现有 Postgres 数据目录
  • 核心亮点
  • 两周内由 AI agents 辅助开发,约 250k 行 Rust 代码
  • 已有可用 WASM 浏览器 demo(pgrust.com)和 Docker 镜像
  • 路线图:多线程内部设计、内置连接池、无 vacuum 存储、AI 生成 SQL 运行时 guardrails
  • 不追求fork,而是从零重建,用 Postgres 真实测试套件作为 oracle
  • 可信度判断:⭐⭐⭐⭐⭐(作者为资深 Postgres 开发者;HN 24h 内 566 条评论;完全开源 AGPL-3)
  • 后续行动:值得在数据库系统工程专题页更新;关注 vs SQLight、RQLite 的定位差异;核验其与 pgx 生态的关系

值得关注的 Agent/工程工具

项目 语言 今日⭐ 定位
wonderwhy-er/DesktopCommanderMCP TypeScript 210 Claude MCP 服务器:终端+文件系统+diff 编辑
Dicklesworthstone/destructive_command_guard Rust 444 拦截 AI agent 的危险 git/shell 命令
ColeMurray/background-agents TypeScript 16 开源后台 agents 编码系统
hallmark/Nutlope CSS 155 Anti-AI-slop 设计 skill(Claude Code/Cursor/Codex)

模型 参数量 类型 下载量 关键信息
tencent/Hy3 299B Text Generation 8.66k MoE 架构,多模态支持
zai-org/GLM-5.2 753B Text Generation 441k 超大dense模型,中国团队
bottleapai/ThinkingCap-Qwen3.6-27B 27B Img-Text 4.46k Qwen3.6 推理加速封装
InternScience/Agents-A1 35B Text Generation 29k Agent 专用对齐训练
baidu/Unlimited-OCR 3B Img-Text 1.43M OCR 新秀,下载量极高
unsloth/DeepSeek-V4-Flash-GGUF 284B Text 44.6k GGUF 量化推理
google/tabfm-1.0.0-pytorch - Tabular Classify 21k 表格数据分类,独特赛道
nvidia/Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 45B Text 34.8k FP4 量化,NVIDIA 自家推理

观察:2026-07 结构化输出(RAG/Agent)方向有 Agents-A1;表格模型 tabfm 是一个被低估的垂直赛道;百度 Unlimited-OCR 下载量异常高(1.43M)值得关注。


三、LLM 推理引擎格局(2026-07)

关键结论(来源:Zylos Research / Spheron / Techsy / Yotta Labs)

1. vLLM:生产部署最高采用率 - 社区最大,硬件兼容最广(AWS/GCP/Azure) - H100 80GB FP8 下 Llama 70B 约 3,500 tokens/sec - PagedAttention:将 KV cache 内存浪费从 60-80% 降至 <4% - 量化支持:FP8(Hopper 推荐)、GPTQ+Marlin 内核

2. SGLang:吞吐领先,prefix 友好 - RadixAttention 优化 prefix 复用,RAG 多轮对话场景优势明显 - H100 上 Llama 3.1 8B 约 16,200 tok/s(vs vLLM 12,500) - 结构化输出和多轮对话场景首选

3. TensorRT-LLM:NVIDIA 官方,单模型长期部署最优 - 低层 GPU 优化榨取最大性能,适合单模型稳态服务

4. Hugging Face TGI:进入维护模式(2025-12) - 官方已引导新项目转向 vLLM 或 SGLang

5. 量化格局:FP8 成为 Hopper GPU 质量/性能最佳平衡点;KV cache FP8 可节省 50% 内存

建议:多模型/快速迭代选 vLLM;多轮对话/RAG prefix 密集选 SGLang;单模型稳态部署选 TensorRT-LLM。


四、高价值来源记录

推理优化综合指南

  • Zylos Research · LLM Inference Optimization and Quantization 2026 https://zylos.ai/research/2026-01-15-llm-inference-optimization ⭐⭐⭐⭐ 参考性强的量化/框架对比,含代码示例

推理引擎 Benchmark(2026-07 最新)

  • Spheron · vLLM vs TensorRT-LLM vs SGLang H100 Benchmarks https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
  • Techsy · vLLM vs SGLang 2026 H100 Benchmarks https://techsy.io/en/blog/vllm-vs-sglang ⭐⭐⭐⭐ 两篇均为实测数据,含 TTFT/throughput 对比

pgrust 作者原文

  • malisper.me · pgrust: Rebuilding Postgres in Rust with AI https://malisper.me/pgrust-rebuilding-postgres-in-rust-with-ai ⭐⭐⭐⭐⭐ 必读:AI agents 工作流细节、 Postgres 改造思路

五、分类标签

github-trending huggingface llm-inference postgresql rust vllm sglang quantization agentic-systems pgrust


六、建议写入路径

/shared/research-kb/inbox/jay/2026-07-13-github-trending-hf-inference-pgrust.md


七、后续行动

  • [ ] 精读 pgrust 作者博客,重点关注 AI agents 工作流设计模式
  • [ ] 关注 pgrust 路线图中"无 vacuum 存储"设计的技术可行性
  • [ ] 在数据库系统工程专题页补充 pg_rust vs pgx vs SQLight 定位对比
  • [ ] Agents-A1 模型页面核验其在 multi-agent 协作中的实际表现
  • [ ] 表格分类模型(tabfm)赛道调研:企业数据分析场景价值