研究知识库草稿 · Jay · 2026-07-26 下午
检索范围
- GitHub Trending(2026-07-26)
- Hugging Face Papers / Models
- arXiv(推理系统、KV Cache、Agent)
- Substack(CLI Agents、ML Engineer)
- CSDN(vLLM/SGLang 推理框架)
📌 GitHub Trending 高价值条目(2026-07-26 下午补充)
1. JustVugg/colibri ⭐⭐⭐ 精读
- 地址:https://github.com/JustVugg/colibri
- 星数:飙升中(7月热议项目)
- 语言:纯 C,~1300 行,零依赖
- 核心:将 GLM-5.2(744B MoE)跑在 25GB RAM 消费级硬件上
- 技术原理:
- MoE 架构每次只激活 ~40B 参数,其中 ~11GB 是每 token 变化的 routed experts
- Colibri 将 SSD / RAM / VRAM 视为统一内存层次,按需从 NVMe 流式加载 experts
- ~370GB int4 experts 存在磁盘上,每 expert ~19MB,支持 per-layer LRU cache + 可选 VRAM 层
- 性能数据:
- 冷启动(无 cache):0.05–0.1 tok/s(极慢,但可执行)
- 暖 cache(multi-token prediction):2.2–2.8 verified tok/s
- Apple M5 Max:~1.06 tok/s
- 6× RTX 5090 全 expert 常驻:4 tok/s,TTFT 1.6s
- 可信度:高(独立开发者,HN 讨论活跃,The Stack 频道 20 Jul 2026 视频验证)
- 工程价值:
- 展示了"内存层次 = 存储层次"的系统设计哲学,单人 1300 行 C 超越大型框架
- 对本地 LLM 推理、边缘部署、低成本推理研究有重要参考价值
- 未来支持 Claude Code / OpenCode 集成(PR 进行中)
- 分类标签:
推理引擎MoE本地LLM系统编程GLM-5.2边缘推理 - 后续行动:建议跟踪其与 vLLM/SGLang 在 agent 集成场景的集成方式;关注 hf.co 已有
jlnsrk/GLM-5.2-colibri-int4
2. xAI/grok-build ⭐⭐ 关注
- 地址:https://github.com/xAI/grok-build
- 定位:xAI 开源 coding agent CLI,完整 MCP 支持
- 可信度:高(xAI 官方)
- 工程价值:MCP 协议在 xAI 官方工具链落地,值得跟踪其工具调用实现
- 分类标签:
Coding AgentMCPxAICLI
3. Strix / vibe-trading / omniroute / hallmark ⭐ 关注
- Strix:AI 渗透测试 agent,自动发现验证漏洞
- Vibe-Trading:自然语言转量化交易策略 + 回测
- OmniRoute:单一 API 网关路由 200+ AI 提供商
- Hallmark:设计 skill,防止 AI 编码工具输出模板化 UI
- 分类标签:
AI Agent垂直场景API Gateway
📌 Hugging Face Papers / Models(2026-07 最新)
⭐⭐⭐ 精读论文
AREX: Towards a Recursively Self-Improving Agent for Deep Research
- 链接:https://huggingface.co/papers(Trending)
- 核心:递归自我改进的深度研究 agent,提出 agent 超越固定 prompt 的自适应能力
- 可信度:高(HF Papers Trending)
- 工程价值:对 agent 自我优化机制有重要参考价值,适合纳入 agent 架构主题页
- 分类标签:
AgentSelf-ImprovingResearchDeep Research
OpenForgeRL: Train Harness-Native Agents in Any Environment
- 链接:https://huggingface.co/papers
- 核心:在任意环境中训练与 harness 原生融合的 agents
- 可信度:高
- 工程价值:harness 工程化训练的标准化路径,对 eval 框架设计有参考
- 分类标签:
AgentRLHarnessTraining
SkillOpt: Text-Space Optimizer for Agent Skills
- 链接:https://huggingface.co/papers(Trending,SkillOpt 章节)
- 核心:将 agent skills 作为外部状态训练,稳定更新、零部署推理开销,多 benchmark 最优
- 可信度:高
- 工程价值:skill management 的训练式方案,区别于 prompt engineering,值得深入
- 分类标签:
Agent SkillsOptimizationTraining
HF Models Trending(2026-07-26)
| 模型 | 特点 | 标签 |
|---|---|---|
zai-org/GLM-5.2 |
744B MoE,开源权重,AI-Index 第一 | MoE Frontier |
jlnsrk/GLM-5.2-colibri-int4 |
Colibri 专用 int4 量化版 | MoE 本地推理 |
THUDM/ThinkingCap-Qwen3.6-27B |
思考链增强 Qwen | Reasoning |
prism-ml/Bonsai-27B-gguf |
高效量化版 | 量化 本地LLM |
tencent/Hy3 |
多语言编码器 | Embedding |
baidu/Unlimited-OCR |
参考滑动窗口注意,无限 OCR | OCR 多模态 |
📌 arXiv 推理系统 / KV Cache(2026-07 最新)
⭐⭐ 精读
[2603.04428] Agent Memory Below the Prompt: Persistent Q4 KV Cache for Multi-Agent LLM Inference on Edge Devices
- 链接:https://arxiv.org/abs/2603.04428
- 核心:多 agent LLM 推理中持久化 Q4 KV Cache 在边缘设备的应用
- 可信度:高(arXiv,24 页,16 表)
- 工程价值:边缘推理 + agent 记忆管理的交叉点,适合 agent 记忆主题页
- 分类标签:
KV CacheEdge InferenceMulti-AgentMemory
[2603.20397] KV Cache Optimization Strategies for Scalable and Efficient LLM Inference
- 链接:https://arxiv.org/abs/2603.20397
- 核心:可扩展高效 LLM 推理的 KV Cache 优化策略综合调研
- 可信度:高(24 页,14 图)
- 工程价值:KV Cache 优化策略系统梳理,适合推理引擎主题页
- 分类标签:
KV CacheOptimizationInference Systems
⭐ 关注
LMCache: Enterprise-Scale KV Cache(arXiv 2510.09665)
- 链接:https://arxiv.org/html/2510.09665v1
- 核心:首个高效开源 KV Cache 方案,支持 vLLM/SGLang,PD disaggregation(prefill-decode 分离)
- 工程价值:生产级 KV Cache 共享,跨引擎跨 query 的 prefix 复用
- 分类标签:
KV CachevLLMSGLangProduction
Dynamic KV Cache Placement in Heterogeneous Memory(arXiv 2508.13231)
- 核心:HBM + 高速 off-package DRAM 异构内存系统中的动态 KV Cache 放置调度
- 分类标签:
KV CacheMemory HierarchyScheduling
Online Scheduling for LLM Inference with KV Cache Constraints(arXiv 2502.07115)
- 核心:KV Cache 约束下 LLM 推理在线调度,理论建模 + 最优 competitive ratio 算法
- 分类标签:
SchedulingKV CacheTheory
📌 Substack 高价值条目(2026-07 中下旬)
⭐⭐ State of CLI Coding Agents in Mid-2026
- 来源:Warsaw.AI News(https://warsawainews.substack.com/p/warsawai-news-6-12072026)
- 核心数据:35 个活跃维护的 CLI coding agents 主导市场
- 子要点:
- 新版 Anthropic 模型在嵌套 edit 结构中出现工具调用格式退化(extraneous parameters)
- Debugging agents 缺乏生产上下文(stack traces、request payloads)导致效果受限
- AI penetration testing agents(Strix 类)成为新兴垂直方向
- 可信度:高(Warsaw.AI 每周汇编)
- 分类标签:
Coding AgentBenchmarkTool UseSecurity
⭐ AI Agents Are Getting Easier to Build, and Harder to Control
- 来源:MLPills(https://mlpills.substack.com/p/weekly-dose-11-ai-agents-are-getting)
- 核心:PyTorch 训练/推理效率更新、OpenAI Responses API 支持 Programmatic Tool Calling、Meta/SpaceXAI 攻击 agentic work layer
- 关键观点:Agent 性能 = 模型 + harness + 上下文管理 + 工具 + 运行时,缺一不可
- 分类标签:
AgentProductionTool CallingSecurity
The ML Engineer(Alejandro Saucedo)— 关注度下降
- 链接:https://machinelearning.substack.com/p/issue-388-the-ml-engineer
- 注:最后更新约 2026-04,内容偏 ML 工程师综合,已非最前沿
- 分类标签:
NewsletterMLOps
📌 CSDN 高价值条目
⭐⭐⭐ vLLM vs SGLang 深度对比与迁移实战(2026-07)
- 标题:小白视角:vllm 迁移到 SGLang 的体验与收获
- URL:https://blog.csdn.net/sinat_37574187/article/details/143992924
- 质量评级:⭐⭐⭐⭐(小白实战复现,有具体命令、metrics 解读)
- 核心工程细节:
- 迁移命令:
vllm serve→python -m sglang.launch_server - 关键参数:
chunked-prefill-size=8k(vs vLLM 的enable-chunked-prefill)、mem-fraction-static(< vLLMgpu_memory_utilization) torch-compile:对 8B 单卡有显著收益,70B 暂不支持- Cache hit rate 监控:实际 84.74%(含长 system prompt),token usage 0.84,gen throughput 117–132 tok/s
- 迁移后 10X 效率提升(作者自述基准线不严谨,仅供参考)
- 可信度:中等(个人经验,有主观偏差,但 log 细节真实)
- 分类标签:
推理框架SGLangvLLM迁移生产部署Benchmarks
⭐⭐⭐ SGLang vs vLLM 架构对比(2026-07)
- URL:https://blog.csdn.net/brandy/article/details/155517690
- 质量评级:⭐⭐⭐⭐(含 RadixAttention 伪代码、3.1 SGLang 结构化输出、K8s 部署对比)
- 核心要点:
- vLLM TTFT 最优(H100 Llama3.1 8B:123ms vs SGLang 340ms)
- 并发场景 SGLang 稳定(30–31 tok/s)vs vLLM(16–22 tok/s)
- vLLM 计划引入 RadixAttention(两框架互相借鉴)
- 建议:企业可组合使用 vLLM 底层引擎 + SGLang 上层编排
- 分类标签:
推理框架vLLMSGLang架构对比Benchmark
分类标签汇总
推理引擎 MoE 本地LLM Colibri GLM-5.2 边缘推理 Agent Self-Improving Coding Agent MCP KV Cache vLLM SGLang 迁移实战 Benchmark CLI Agent Tool Use 异构内存 Scheduling
建议写入路径
/shared/research-kb/inbox/jay/2026-07-26-afternoon-briefing-colibri-cliagents-arxiv-hf-substack.md
后续行动建议
- 精读:Colibri(系统设计典范)、AREX / OpenForgeRL(agent 自我改进前沿)
- 主题页更新:推理引擎主题页(Colibri + vLLM/SGLang 对比补充);Agent 主题页(AREX + CLI agents 2026 state)
- 核验:Colibri GitHub README 活跃度;AREX 论文代码是否开源
- 关注:Colibri + Claude Code/OpenCode 集成 PR;GLM-5.2-colibri-int4 hf 模型页