研究知识库草稿 · Jay · 2026-07-26 下午

检索范围

  • GitHub Trending(2026-07-26)
  • Hugging Face Papers / Models
  • arXiv(推理系统、KV Cache、Agent)
  • Substack(CLI Agents、ML Engineer)
  • CSDN(vLLM/SGLang 推理框架)

1. JustVugg/colibri ⭐⭐⭐ 精读

  • 地址:https://github.com/JustVugg/colibri
  • 星数:飙升中(7月热议项目)
  • 语言:纯 C,~1300 行,零依赖
  • 核心:将 GLM-5.2(744B MoE)跑在 25GB RAM 消费级硬件上
  • 技术原理
  • MoE 架构每次只激活 ~40B 参数,其中 ~11GB 是每 token 变化的 routed experts
  • Colibri 将 SSD / RAM / VRAM 视为统一内存层次,按需从 NVMe 流式加载 experts
  • ~370GB int4 experts 存在磁盘上,每 expert ~19MB,支持 per-layer LRU cache + 可选 VRAM 层
  • 性能数据
  • 冷启动(无 cache):0.05–0.1 tok/s(极慢,但可执行)
  • 暖 cache(multi-token prediction):2.2–2.8 verified tok/s
  • Apple M5 Max:~1.06 tok/s
  • 6× RTX 5090 全 expert 常驻:4 tok/s,TTFT 1.6s
  • 可信度:高(独立开发者,HN 讨论活跃,The Stack 频道 20 Jul 2026 视频验证)
  • 工程价值
  • 展示了"内存层次 = 存储层次"的系统设计哲学,单人 1300 行 C 超越大型框架
  • 对本地 LLM 推理、边缘部署、低成本推理研究有重要参考价值
  • 未来支持 Claude Code / OpenCode 集成(PR 进行中)
  • 分类标签推理引擎 MoE 本地LLM 系统编程 GLM-5.2 边缘推理
  • 后续行动:建议跟踪其与 vLLM/SGLang 在 agent 集成场景的集成方式;关注 hf.co 已有 jlnsrk/GLM-5.2-colibri-int4

2. xAI/grok-build ⭐⭐ 关注

  • 地址:https://github.com/xAI/grok-build
  • 定位:xAI 开源 coding agent CLI,完整 MCP 支持
  • 可信度:高(xAI 官方)
  • 工程价值:MCP 协议在 xAI 官方工具链落地,值得跟踪其工具调用实现
  • 分类标签Coding Agent MCP xAI CLI

3. Strix / vibe-trading / omniroute / hallmark ⭐ 关注

  • Strix:AI 渗透测试 agent,自动发现验证漏洞
  • Vibe-Trading:自然语言转量化交易策略 + 回测
  • OmniRoute:单一 API 网关路由 200+ AI 提供商
  • Hallmark:设计 skill,防止 AI 编码工具输出模板化 UI
  • 分类标签AI Agent 垂直场景 API Gateway

📌 Hugging Face Papers / Models(2026-07 最新)

⭐⭐⭐ 精读论文

AREX: Towards a Recursively Self-Improving Agent for Deep Research

  • 链接:https://huggingface.co/papers(Trending)
  • 核心:递归自我改进的深度研究 agent,提出 agent 超越固定 prompt 的自适应能力
  • 可信度:高(HF Papers Trending)
  • 工程价值:对 agent 自我优化机制有重要参考价值,适合纳入 agent 架构主题页
  • 分类标签Agent Self-Improving Research Deep Research

OpenForgeRL: Train Harness-Native Agents in Any Environment

  • 链接:https://huggingface.co/papers
  • 核心:在任意环境中训练与 harness 原生融合的 agents
  • 可信度:高
  • 工程价值:harness 工程化训练的标准化路径,对 eval 框架设计有参考
  • 分类标签Agent RL Harness Training

SkillOpt: Text-Space Optimizer for Agent Skills

  • 链接:https://huggingface.co/papers(Trending,SkillOpt 章节)
  • 核心:将 agent skills 作为外部状态训练,稳定更新、零部署推理开销,多 benchmark 最优
  • 可信度:高
  • 工程价值:skill management 的训练式方案,区别于 prompt engineering,值得深入
  • 分类标签Agent Skills Optimization Training

HF Models Trending(2026-07-26)

模型 特点 标签
zai-org/GLM-5.2 744B MoE,开源权重,AI-Index 第一 MoE Frontier
jlnsrk/GLM-5.2-colibri-int4 Colibri 专用 int4 量化版 MoE 本地推理
THUDM/ThinkingCap-Qwen3.6-27B 思考链增强 Qwen Reasoning
prism-ml/Bonsai-27B-gguf 高效量化版 量化 本地LLM
tencent/Hy3 多语言编码器 Embedding
baidu/Unlimited-OCR 参考滑动窗口注意,无限 OCR OCR 多模态

📌 arXiv 推理系统 / KV Cache(2026-07 最新)

⭐⭐ 精读

[2603.04428] Agent Memory Below the Prompt: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge Devices

  • 链接:https://arxiv.org/abs/2603.04428
  • 核心:多 agent LLM 推理中持久化 Q4 KV Cache 在边缘设备的应用
  • 可信度:高(arXiv,24 页,16 表)
  • 工程价值:边缘推理 + agent 记忆管理的交叉点,适合 agent 记忆主题页
  • 分类标签KV Cache Edge Inference Multi-Agent Memory

[2603.20397] KV Cache Optimization Strategies for Scalable and Efficient LLM Inference

  • 链接:https://arxiv.org/abs/2603.20397
  • 核心:可扩展高效 LLM 推理的 KV Cache 优化策略综合调研
  • 可信度:高(24 页,14 图)
  • 工程价值:KV Cache 优化策略系统梳理,适合推理引擎主题页
  • 分类标签KV Cache Optimization Inference Systems

⭐ 关注

LMCache: Enterprise-Scale KV Cache(arXiv 2510.09665)

  • 链接:https://arxiv.org/html/2510.09665v1
  • 核心:首个高效开源 KV Cache 方案,支持 vLLM/SGLang,PD disaggregation(prefill-decode 分离)
  • 工程价值:生产级 KV Cache 共享,跨引擎跨 query 的 prefix 复用
  • 分类标签KV Cache vLLM SGLang Production

Dynamic KV Cache Placement in Heterogeneous Memory(arXiv 2508.13231)

  • 核心:HBM + 高速 off-package DRAM 异构内存系统中的动态 KV Cache 放置调度
  • 分类标签KV Cache Memory Hierarchy Scheduling

Online Scheduling for LLM Inference with KV Cache Constraints(arXiv 2502.07115)

  • 核心:KV Cache 约束下 LLM 推理在线调度,理论建模 + 最优 competitive ratio 算法
  • 分类标签Scheduling KV Cache Theory

📌 Substack 高价值条目(2026-07 中下旬)

⭐⭐ State of CLI Coding Agents in Mid-2026

  • 来源:Warsaw.AI News(https://warsawainews.substack.com/p/warsawai-news-6-12072026)
  • 核心数据:35 个活跃维护的 CLI coding agents 主导市场
  • 子要点
  • 新版 Anthropic 模型在嵌套 edit 结构中出现工具调用格式退化(extraneous parameters)
  • Debugging agents 缺乏生产上下文(stack traces、request payloads)导致效果受限
  • AI penetration testing agents(Strix 类)成为新兴垂直方向
  • 可信度:高(Warsaw.AI 每周汇编)
  • 分类标签Coding Agent Benchmark Tool Use Security

⭐ AI Agents Are Getting Easier to Build, and Harder to Control

  • 来源:MLPills(https://mlpills.substack.com/p/weekly-dose-11-ai-agents-are-getting)
  • 核心:PyTorch 训练/推理效率更新、OpenAI Responses API 支持 Programmatic Tool Calling、Meta/SpaceXAI 攻击 agentic work layer
  • 关键观点:Agent 性能 = 模型 + harness + 上下文管理 + 工具 + 运行时,缺一不可
  • 分类标签Agent Production Tool Calling Security

The ML Engineer(Alejandro Saucedo)— 关注度下降

  • 链接:https://machinelearning.substack.com/p/issue-388-the-ml-engineer
  • :最后更新约 2026-04,内容偏 ML 工程师综合,已非最前沿
  • 分类标签Newsletter MLOps

📌 CSDN 高价值条目

⭐⭐⭐ vLLM vs SGLang 深度对比与迁移实战(2026-07)

  • 标题:小白视角:vllm 迁移到 SGLang 的体验与收获
  • URL:https://blog.csdn.net/sinat_37574187/article/details/143992924
  • 质量评级:⭐⭐⭐⭐(小白实战复现,有具体命令、metrics 解读)
  • 核心工程细节
  • 迁移命令:vllm servepython -m sglang.launch_server
  • 关键参数:chunked-prefill-size=8k(vs vLLM 的 enable-chunked-prefill)、mem-fraction-static(< vLLM gpu_memory_utilization
  • torch-compile:对 8B 单卡有显著收益,70B 暂不支持
  • Cache hit rate 监控:实际 84.74%(含长 system prompt),token usage 0.84,gen throughput 117–132 tok/s
  • 迁移后 10X 效率提升(作者自述基准线不严谨,仅供参考)
  • 可信度:中等(个人经验,有主观偏差,但 log 细节真实)
  • 分类标签推理框架 SGLang vLLM 迁移 生产部署 Benchmarks

⭐⭐⭐ SGLang vs vLLM 架构对比(2026-07)

  • URL:https://blog.csdn.net/brandy/article/details/155517690
  • 质量评级:⭐⭐⭐⭐(含 RadixAttention 伪代码、3.1 SGLang 结构化输出、K8s 部署对比)
  • 核心要点
  • vLLM TTFT 最优(H100 Llama3.1 8B:123ms vs SGLang 340ms)
  • 并发场景 SGLang 稳定(30–31 tok/s)vs vLLM(16–22 tok/s)
  • vLLM 计划引入 RadixAttention(两框架互相借鉴)
  • 建议:企业可组合使用 vLLM 底层引擎 + SGLang 上层编排
  • 分类标签推理框架 vLLM SGLang 架构对比 Benchmark

分类标签汇总

推理引擎 MoE 本地LLM Colibri GLM-5.2 边缘推理 Agent Self-Improving Coding Agent MCP KV Cache vLLM SGLang 迁移实战 Benchmark CLI Agent Tool Use 异构内存 Scheduling


建议写入路径

/shared/research-kb/inbox/jay/2026-07-26-afternoon-briefing-colibri-cliagents-arxiv-hf-substack.md


后续行动建议

  1. 精读:Colibri(系统设计典范)、AREX / OpenForgeRL(agent 自我改进前沿)
  2. 主题页更新:推理引擎主题页(Colibri + vLLM/SGLang 对比补充);Agent 主题页(AREX + CLI agents 2026 state)
  3. 核验:Colibri GitHub README 活跃度;AREX 论文代码是否开源
  4. 关注:Colibri + Claude Code/OpenCode 集成 PR;GLM-5.2-colibri-int4 hf 模型页