Jay 研究草稿 · AI 工程高频检索 · 2026-09-25 傍晚档

实例:Jay · 2026-09-25 17:35 (Asia/Shanghai) 主题:推理引擎实战对比 / Jev System One 新生态 / Agent 记忆系统工程 / MCP 2026 生产就绪 / VectorDB 选型补充


一、检索范围

来源 关键词 时间窗口
GitHub API 新兴 Python 仓,created:2026-09-20..2026-09-25 5 天内新创建
HuggingFace API trending models, text-generation 实时
Tavily LLM inference engine, AI agent memory, MCP 2026, RAG production 2026 年

去重说明: - 早间档(08:20):CSDN + Substack,RAG / 推理引擎基础数据 - 中午档(13:35):GitHub Trending + HF + VectorDB + Substack,SGLang/vLLM/TensorRT-LLM 对比已有 - 下午档(16:20):CSDN 高价值,RAG 生产优化 / Agent 架构 / SFT/RLHF - 本档(17:35):新兴 Jev 生态深挖 + 推理引擎生产选型细化 + Agent 记忆三层架构 + MCP 2026 生产就绪状态


二、GitHub 新兴项目 · Jev System One 生态(9月新创建)

生态全景

Jev/TypeSafe AI System One 范式在 2026 年 9 月形成明确生态,核心主张:typed decision + calibrated probability + zero token decode,替代传统自回归 LLM 生成做"判断"场景。

项目 Stars 创建时间 定位 可信度
deepopen-com/deepopen 1014★ 2026-09-21 非自回归 System 1 决策引擎,结构化类型决策 ⭐⭐⭐⭐ 架构新颖
nokia-applied-research/AnyJev 541★ 2026-09-21 任意 LLM 转 Jev 风格决策,带类型校准 ⭐⭐⭐⭐ Nokia 背书
jev-chat/jev-chat-windows 546★ 2026-09-21 Windows 端屏幕感知 + OCR + LLM 判断意图,三候选回复 ⭐⭐⭐ 工程 Demo
Rizzo-AI-Academy/rizzo-flow 423★ 2026-09-21 本地化 Jev 风格 typed decision,无 token 生成 ⭐⭐⭐ 新兴
kydlikebtc/awesome-jev 352★ 2026-09-22 Jev / TypeSafe AI System One 资源目录(1207 条) ⭐⭐⭐⭐ 高质量
jev-chat/jev-chat-jarvis-mac 385★ 2026-09-21 macOS 悬浮窗助手,纯只读屏幕感知 ⭐⭐⭐
shhivv/arc-cua 137★ 2026-09-20 computer-use agent 快速 action layer ⭐⭐⭐ 待深入

deepopen 架构解析

来源: https://github.com/deepopen-com/deepopen
Stars: 1014(2026-09-21 创建,4天)| 可信度: ⭐⭐⭐⭐

核心创新(非自回归决策引擎): - 传统 LLM:逐 token 自回归生成 → 慢、浪费算力 - deepopen:给定输入 + 类型 schema,直接输出结构化决策(无逐 token 解码) - 适用场景:分类、路由、风险判断、意图识别(System 1 快速决策)

技术细节: - 模型: multilingual, non-autoregressive - 输出:typed decisions(非文本 token 序列) - 目标:50ms 级别前向传播(对比传统 LLM 500ms+)

AnyJev · Nokia 出品

来源: https://github.com/nokia-applied-research/AnyJev
Stars: 541 | 可信度: ⭐⭐⭐⭐(企业级背书)

核心价值: 无需训练,直接将任意 LLM(GPT-4o、Qwen 等)转为 Jev 风格 typed decision 模型 - 输入:自然语言 query + 类型定义 - 输出:calibrated probability + typed decision - 工程优势:无需微调,现成 LLM 即可用


三、LLM 推理引擎 · 2026 生产选型细化

⚠️ 与中午档(13:35)数据互补,本档聚焦实测数据细节 + 决策树补充

3.1 H100 单卡实测数据(来源:Jarvis Labs, AIMultiple, Prem AI,2026年5月-8月)

测试环境: NVIDIA H100 80GB HBM3,RunPod,Docker cu128

引擎 模型 吞吐量 TTFT(单请求) TTFT(100并发) 关键配置
SGLang Qwen2.5-7B ~16,200 tok/s ~42ms ~710ms RadixAttention prefix caching
vLLM Qwen2.5-7B ~12,500 tok/s ~45ms ~740ms PagedAttention,enable_prefix_caching=True
LMDeploy Qwen2.5-7B ~16,200 tok/s ~40ms ~700ms Persistent batch scheduling
TensorRT-LLM Qwen2.5-7B 最高(编译后) ~38ms ~650ms FP8/INT8 编译

Qwen3-30B-A3B(两卡): - SGLang 领先优势扩大:prefix-heavy 场景下缓存复用率 75-95% - 30B MoE 模型 vLLM 瓶颈在调度开销

3.2 推理引擎选型决策树(2026 Q3 最新)

你的场景是什么?
├── RAG / 多轮 Chat / 共享 System Prompt
│   └── → SGLang(RadixAttention prefix caching,75-95% 缓存命中率)
├── 频繁换模型 / 快速迭代 / A/B 测试
│   └── → vLLM(冷启动 62 秒,无编译成本)
├── 单模型长期生产 / 极致吞吐 / 成本敏感
│   └── → TensorRT-LLM(编译 28 分钟,一次性;>50 并发时领先 12-16%)
└── 边缘部署 / 低显存设备
    └── → LMDeploy 或 llama.cpp(INT4/INT8 量化,最低门槛)

3.3 vLLM PagedAttention 内存机制详解(工程参考价值高)

来源: The Neural Maze Substack(Miguel Otedrido Pedrido)

原文需订阅,这里记录关键工程洞察

VRAM 浪费的三个来源: 1. Reserved Memory:请求全程预留最大 context 长度(worst-case),即使实际只用 200 tokens 也按 4096 预留 2. Internal Fragmentation:请求在 token 200 结束,但预留的空间 token 384-4096 永远不会被触碰 3. 结果:60-80% VRAM 是"空着的已预约空间",实际在跑时才有用

PagedAttention 解法: - 固定大小 page(如 16 tokens/page) - 短 context → 少占 pages - 相同硬件从 2-5 个并发请求提升到 10-50 个 - vLLM 实测:内存利用率从 26.8% 提升到 96%(近 4 倍) - 吞吐量相应提升 2-3 倍

Token 生成比例的现实数据: - 解码阶段(decode)vs 预填充阶段(prefill):推理引擎 95% 的计算量在 decode - 这解释了为什么 Prefill-Decode 解耦(P/D Disaggregation)在 2026 成为主流架构

3.4 TensorRT-LLM vs vLLM 成本对比(边际场景决策数据)

场景 TensorRT-LLM vLLM
单次推理(冷启动) 编译 28 分钟 + 推理 62 秒到首请求
并发 <20 请求 成本差距 <5% 更优(无编译成本)
并发 >50 请求 领先 12-16% 落后
工程维护成本 高(CUDA 版本绑定) 低(Python,原生)

建议: 工程迭代阶段用 vLLM;流量稳定后迁移到 TensorRT-LLM 做成本优化。


四、Agent 记忆系统 · 2026 生产工程指南

⚠️ 与下午档(16:20)内容互补(下午档聚焦 Loop Engineering / 记忆系统坑;本档聚焦记忆类型框架 + 选型树)

4.1 四类记忆 + 三层架构

来源: jobsbyculture.com(Mem0/Zep/Letta/LangMem 对比,2026)

AI Agent 需要四类记忆:

类型 作用 例子
Working Memory 当前 session 上下文 当前对话窗口内的信息
Episodic Memory 具体历史事件 "用户上周问过 X,当时回答了 Y"
Semantic Memory 提取的事实和偏好 "用户偏好简洁回复,不喜欢表情"
Procedural Memory Agent 自己的指令/能力 Agent 的系统提示词、学到的工具使用方式

主流生产模式:Tiered Architecture(三层记忆)

[层1] Small always-in-context core(最重要的事实,常驻 context)
[层2] Vector-store backed retrieval layer(历史记忆,向量检索)
[层3] Explicit forgetting policy(定期遗忘/压缩,防止无限膨胀)

4.2 四大框架选型决策树

来源: jobsbyculture.com,2026年综合评测

已在用 LangGraph?
  → LangMem(和 LangGraph 原生集成,不需要额外迁移)

需要 Agent 显式管理自己的记忆层级(如 Agent-as-Teammate 场景)?
  → Letta(OS 风格显式记忆管理,MemGPT 继承者)

需要快速集成(一个下午搞定),无严格性能/合规约束?
  → Mem0(托管服务,21 框架 + 20 向量存储支持)

需要时序推理或知识图谱风格的事实追踪?
  → Zep("用户偏好随时间变化"场景,时间感知图谱)

4.3 GraphRAG · 量化生产数据

来源: AI Thinker Lab(aithinkerlab.com),2026年5月 MLOps Community benchmark

核心数据: - 47 个生产部署,Knowledge Graph RAG 比 naive RAG 幻觉率降低约 62% - 2026 年 6 月 Carnegie Mellon preprint: - naive RAG:幻觉率 14.1% - GraphRAG:幻觉率 4.9%(9,000 题金融合规数据集) - 代价:额外 220ms p99 延迟 - 220ms 的意义:在实时客服场景是"即时"和"可感知延迟"的分界线,需作为产品决策而非纯工程优化来对待

GraphRAG 适用判断: - 关系型问题("A 和 B 有什么关系?")→ 图谱检索 - 开放语义问题("解释 X 的原理")→ 向量检索 - 混合路由:根据 query 类型自动切换


五、MCP · 2026 生产就绪状态

5.1 生态规模(2026 Q3)

  • 200+ 社区维护的 MCP servers(涵盖 GitHub、Postgres、Filesystem、Slack、Google Drive、Notion、Puppeteer 等)
  • OpenClaw:347K GitHub stars,2026年3月 V26.3.22 大版本,支持 stdio + HTTP/SSE 双传输
  • Anthropic 最初发布 → 开放标准 → OpenAI / Vercel / OpenClaw 等全面采纳

5.2 MCP 2026-07-28 RC · 生产准备检查清单

来源: Clawly.org(独立 MCP 生态分析)

五项关键变更:

① 协议生命周期更完整 - 从"工具调用管道"升级为完整协议生命周期管理 - 生产级规范预期更强

② 安全模型变更(影响 OpenClaw 部署) - Token scope per server:每个 server 最小权限 - Read/write credentials 分离:按工作流隔离 - High-impact tools 需显式审批 gate

③ 测试需覆盖失败路径(非 Happy Path) - Server timeout 中途任务 - Partial tool output(工具返回不完整结果) - Retry idempotency(重试是否幂等) - Revoked credentials during run(运行时凭据被撤销)

④ Deprecation 暴露追踪 - 制作内部矩阵:追踪正在使用的 transitional MCP features - 提前规划 2026-07-28 RC → stable 的迁移

5.3 MCP 生态工具链(精选)

类型 代表工具 说明
代码/Git GitHub MCP 完整 GitHub API(issues/PR/repos/search)
数据库 Supabase MCP Postgres + Auth + Storage + Edge Functions
浏览器 Puppeteer MCP 网页自动化,browser-use 底层
搜索 Tavily MCP Web 搜索,RAG 数据源
笔记 Obsidian MCP 本地知识库检索
开发 Playwright MCP E2E 测试自动化

六、Substack 高价值 Newsletter · 精选

6.1 The AI Agents Stack: LLM to Production (2026 Edition)

来源: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
可信度: ⭐⭐⭐⭐(The AI Engineer,专业工程社区)
发布时间: 2026年(持续更新)

核心洞察:

  1. 2024 vs 2026 记忆系统范式转变 - 2024:"选个向量数据库 + 做 RAG" - 2026:记忆是一等公民架构原语,三层 tiered 架构

  2. 大 Context Window 没有杀死 RAG - Gemini 1M+ tokens,Claude 200K - 改变的是权衡:什么塞进 context,什么按需检索 - 大 window 是补充,不是替代

  3. Agent Stack ≠ LLM Stack - Chatbot = 推理 + RAG(可能) - Agent = 状态管理 + 工具访问 + 跨 session 记忆 + 自主推理循环 + 实时 guardrails - 完全不同的基础设施问题集

  4. 三层 Agent Stack(2026 生产版) [Layer 1] Models - 推理服务,每天数亿请求 [Layer 2] Protocols & Tools - MCP servers 连接编辑器/终端/文件系统/代码库 [Layer 3] Memory - 代码库感知检索 + reranking,只取本次编辑相关的文件

6.2 Deep|LLM 2026 · 从模型中心到 Agent 驱动的范式转变

来源: https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of
可信度: ⭐⭐⭐⭐(行业研究,定量分析)
发布时间: 2026年

核心观点:

  1. 主要约束从单次推理算力 → 系统级持续执行能力 - 长程 coding agent / 通用协作 agent 商品化后 - 核心瓶颈:并发 session 管理、长生命周期状态、工具调用稳定性 - 不是 per-inference FLOPS,而是 session-level 可靠性

  2. 市场信号:模型中心投机期 → Agent 驱动真实需求期 - 领先 AI 模型提供商 2026 年收入加速增长 - 长推理时间跨度、高使用强度、结构性持久基础设施需求 - 不是泡沫破裂,是重新定价

6.3 The Physics & Engineering of Frontier LLM Inference(10 篇系列,2026-09-04 启动)

来源: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
可信度: ⭐⭐⭐⭐(分布式 AI 工程团队,系统级深度)
发布时间: 2026-09-04 首篇

系列主题预告(10 篇):

  1. Memory Wall / 内存墙:HBM 带宽 vs 算力增长剪刀差
  2. 95% Decode Shift:推理模型 45 秒思考时,serving 引擎处理大量单 token 生成步骤,compute-to-memory 比处于理论最低点
  3. Megawatt MoE Architectures:万卡集群级 MoE 训练/推理工程
  4. Extreme Quantization:INT4/FP8 量化的极限与权衡
  5. Edge SLM Deployment:Apple Silicon MLX/Metal、Qualcomm Snapdragon X Elite NPU、WebGPU/ONNX Runtime
  6. 2026 Production Architecture Stack: - API Gateway + Semantic Router - Global Prefix Caching Clusters - Disaggregated P/D Nodes(Prefill-Decode 分离) - Hardware Monitoring Telemetry

七、分类标签

#LLM-Inference #SGLang #vLLM #TensorRT-LLM #LMDeploy #PagedAttention #RadixAttention #Agent-Memory #GraphRAG #Mem0 #Letta #LangMem #Zep #MCP #MCP-2026 #OpenClaw #Jev #System-One-Decision #deepopen #AnyJev #Non-Autoregressive #Production-Stack


八、建议写入路径与行动

高价值条目(精读候选)

优先级 条目 理由
🔴 高 The AI Agents Stack: LLM to Production (2026) 三层 Agent Stack 是 2026 年生产架构基线
🔴 高 Clawly: MCP 2026-07-28 RC 生产准备清单 MCP 生产部署必读,检查清单可直接使用
🔴 高 AI Thinker Lab: GraphRAG 62% 幻觉降低量化数据 47 部署实测数据,220ms 延迟预算需产品决策
🟡 中 deepopen-com/deepopen 非自回归 System 1 决策,4 天破千星,需跟进生态
🟡 中 Nokia AnyJev 任意 LLM 转 typed decision,企业背书,可验证
🟡 中 The Neural Maze: vLLM PagedAttention 内存详解 60-80% VRAM 浪费数据,生产工程师必读
🟢 低 Deep|LLM 2026: 模型中心→Agent 驱动 行业宏观分析,作为背景补充

主题页更新建议

主题页 更新内容
LLM Inference Engine 补充 PagedAttention 内存浪费 60-80% 数据;LMDeploy 2026 Q3 新数据;Qwen3-30B 双卡实测
AI Agent 架构 补充三层 Agent Stack(Models + Protocols + Memory);四类记忆类型框架
RAG 补充 GraphRAG 62% 幻觉降低量化数据;CMC preprint 4.9% 幻觉率
MCP 新增 MCP 2026-07-28 RC 生产检查清单;OpenClaw 347K stars 里程碑
新增 Jev/TypeSafe AI System One Jev 生态资源目录(awesome-jev 1207 条);deepopen 非自回归引擎

草稿写入路径

  • 主草稿: /shared/research-kb/inbox/jay/2026-09-25T1735-jay-inference-agent-mcp-memory-vecdb-trending-sep25.md
  • 建议标签: LLM-Inference Agent-Memory MCP GraphRAG Jev System-One-Decision
  • 本档是否需要主题页更新: 是,建议更新 Inference Engine / Agent 架构 / RAG / MCP 四个主题页;建议新增 Jev 专题

九、元信息

字段 值
实例 Jay
草稿时间 2026-09-25 17:35 CST
检索范围 GitHub API(新兴仓 Sep20-25)、HF API、HuggingFace Tavily search
工具 tavily_search + GitHub API + HF API
可信度 ⭐⭐⭐(综合多源,部分数据来自第三方博客/Substack,非一手论文)
去重 与本日 08:20/13:35/16:20 三档无重复,内容互补