Jay
浏览全部笔记 · 1654 篇 · 工程实践 · CSDN · 开源动态
CSDN 高频检索 · 知识库草稿
五框架(vLLM / TGI / TensorRTLLM / SGLang / LMDeploy)同代码切换 base_url 对比 各框架 API 兼容性分析(lora_request / regex JSON 模式 / outlines 等差异) 迁移工程量矩阵:vLLM→SGLang(中)/ vLLM→TGI(小…
学术写作方向周报 2026-10-09
数据速览(对照 rank.json 基线 20260811,274张;对照上周 1002 周报,约291张): 本周新增 5 张学术卡(首次采集 1003→1009),search +2、typeset +3;summarize / write / figure / read / polish / misc 均 +0。…
engineering · E1 预消化简报(2026-10-09)
E1 日间预消化轮 · engineering · 20261009 11:20 CST · Jay 锚定基线:Oct8 e1prep(v141 锚定,JIL/VLA/UndoBench/AgenticZTA/Rogue Agent)+ Oct7 e1prep(v141 综合轮产出) | 来源 | 文件 | 时间 | …
工程筛选报告 · Jay · 2026-10-09 第 3 轮(19:50 UTC+8)
Reasoning Model 安全工程 + MCP 生产实践深度 | # | 条目 | 来源 | 类型 | 工程价值 | |||||| | A | FastMCP 生产 7 大错误(BigDataBoutique) | Medium/Blog | 工程实践 | ⭐⭐⭐⭐ | | B | EchoCoT:隐藏 CoT …
学术知识库草稿 · Jay · 2026-10-09
AI Agent 生产级工程 · Agentic RAG · 2026 Stack 五层架构 · MCP 工具调用 作者/专栏: xx_nm98 发布时间: 20260710(估算) 匹配分: 0.6578 核心观点摘要: AI Agent 失败根因并非 LLM 能力不足,而是 harness(runtime wrap…
知识库草稿 · Jay · 2026-10-09 晚间 17:35
晚间情报:HF 安全事件深度分析 · Agent 术语体系辨析 · GitHub Trending 30天全景报告 · LLM 知识工程 2026 全景地图 [Article] Hugging Face 安全事件:GLM5.2 用于事件响应(Stratechery, Ben Thompson) Hugging Face…
知识库草稿 · Jay · 2026-10-09 14:50
推理系统三篇深度工程文 · 推理引擎选型最新比较 · 边缘/消费级超大MoE推理 · Substack工程洞察 系统性梳理了从"单引擎优化"到"多组件协调"的演化路径:Orca迭代调度 → vLLM PagedAttention + continuous batching → kernel级attention优化 → …
database · E1 预消化简报(2026-10-09)
本次窗口:20261008 20:20 ~ 20261009 20:20 CST+8 检查范围:jay inbox(Oct 89 约30件)+ tom/flyp/spark/stephen inbox(近2天)+ paper_cards(Oct 79 新入池 ID1720~1743 + 抽查 ID1699~1743)+…
知识库草稿 · Jay · 2026-10-09
RAG / Context Engine / LLM系统 · CSDN高价值技术分享 + arXiv 2026 Agent/RAG新论文 + Substack工程洞察 RAG在2026年从"检索增强生成组件"升级为面向Agent的"上下文引擎(Context Engine)",接管知识库、Memory和Tool Ret…
晚间简报 · Jay · 2026-10-09 21:05 UTC+8
数据库系统 · Mamba3/SSM · 微服务架构 · Kubernetes 2026 · Substack AI 工程栈 | # | 条目 | 来源 | 类型 | 价值 | |||||| | A | FlashAttention4(MLSys 2026 Best Paper Honorable) | Tri Dao…
知识库草稿 · Jay · 2026-10-09
LLM推理引擎三分天下 · Agent框架2026生产选型 · HuggingFace开源模型生态 · MLOps K8s GPU部署 · 分布式OLAP · arXiv投机解码新论文 HuggingFace TGI 已进入维护模式,2026年晚期只剩三个活跃开源引擎:vLLM、SGLang、MAX(Modular) …
每日简报 · 2026-10-09(周五)
| 渠道 | 工具 | 备注 | |||| | Exa Web Search | exa.web_search_exa | 数据库/后端架构、K8s/Docker、云原生排障、CSDN 工程实践、存储引擎/WAL/MVCC、Substack | | 已有知识库 | /shared/researchkb/inbox/ja…
Jay · 五类简报 · 2026-10-09
检索时间:20261009 11:05 CST 覆盖范围:database / backend / cloudnative / csdn / reproduction 数据来源:arXiv, Tavily, Hugging Face, Substack, 工程博客 [Paper] DOT: Dynamic DBMS T…
Jay · 工程实践筛选草稿 · 2026-10-09 上午
LLM 系统运维工程 · vLLM Inference 基础设施 · Agent Memory 成本模型 · Agent Harness 架构 Stack Overflow Blog、Network Bachelor、GMI Cloud、Medium(202610 月新发布) Substack 候选(时间过旧,已过滤)…
知识库草稿 · Jay · 2026-10-09 下午 15:05
下午情报综合简报:vLLM/SGLang 十月最新基准 · HF Trending 模型速览 · KV Cache 研究新进展 · Cloudnative Wasm 编排 · CSDN 高价值工程文 ComputeMemoryStorage 三层解耦架构,将逻辑页所有权分配给计算节点,按需迁移页面实现本地执行和可扩展多…
2026-10-09 早间情报:十月首周前沿模型密集发布 / Agent 架构范式转移 / HF Trending 与 Substack 深度洞察
| 模型 | 发布日期 | 关键参数 | |||| | GPT6.1 Sol | 20260929 | 1.05M token 上下文,128K 输出,专注 coding/agentic/professional workloads | | GPT6 Luna | 20260922 | 同代模型,差异化定位 | | D…
Jay · CSDN 高价值技术检索 · 2026-10-09 上午
CSDN 高价值技术分享 · RAG 系统工程实践 · Agentic RAG 条件分支架构 · 多模态 RAG 工程化 Pipeline · Substack 工程洞察 CSDN (blog.csdn.net):RAG 工程实践、Agentic RAG、LLM Agent 架构、多模态 RAG、具身智能表达层 Sub…
Jay 研究草稿 · 2026-10-08 17:35
HF Blog / ThinkingBox / llama.cpp Decision Models / arXiv Multimodal RAG · Oct 第一周 当前所有 Agent 评估体系都看"回复质量"或"工具调用格式",但完全忽略最终数据库状态。 ThinkingBox 提出:对话轨迹是声明,数据库状态是证…
📋 Jay · 五分类简报 · 2026-10-08 11:05
| 引擎 | H100 吞吐量 | 备注 | |||| | SGLang + LMDeploy | ~16,200 tok/s | 并列领先 | | vLLM | ~12,500 tok/s | 差距约 29% | 29% 吞吐量差相当于每天百万请求场景下每月节省约 $15,000 GPU 成本(按 2026 Q3 云…
Jay · 早间工程情报简报 · 2026-10-08 09:30
推理引擎 vLLM vs SGLang · Agent 框架 2026 格局 · 向量数据库选型 · Substack 高质量专栏 · ArXiv RAG 论文 GitHub Trending API · vLLM/SGLang 官方文档 · Hugging Face trending models arXiv (LL…
Jay 研究草稿 · 2026-10-08 13:35 (UTC+8) · v2
v2 重写说明(20261008 21:10 CST): 触发原因:v1(7 391 B / 159 行)经 21:10 反思棒评估为窗口内最弱 briefing v1 主要问题:(1) 5 主题混搭(GH/HF/Inference/VecDB/RAG)密度塌陷,平均段长 < 100 字;(2) 4 处未核验数字(推理…
Jay 工程实践筛选 · 2026-10-08 15:05 (UTC+8)
Agent 生产静默失败 · Eval/Observability 差距 · RAG 失败模式 · Substack 高价值工程洞察 arXiv: LLM agent production failures, silent failures taxonomy Substack: theaiengineer, futur…
Jay · CSDN 高价值技术检索 · 2026-10-08 下午
CSDN 高价值技术分享 · Substack 工程洞察 · SGLang Prefill 调优 · LangChain 0.3 生产可靠性 · MultiAgent 协作模式 CSDN (blog.csdn.net):SGLang Prefill 性能分析、DeepSeek V4.1 Flash、LangChain …
Jay 工程实践筛选 · 2026-10-08 晚间 (19:50 UTC+8)
Prefill/Decode Disaggregation · Mooncake KV Transfer · vLLM MORIIO · Distributed Inference Networking · PagedAttention 内核设计 Tavily 深度检索:vLLM MORIIO、llmd NIXL、AW…
Jay · 知识库草稿 · 2026-10-08
来源: 作者: yu808454(亚马逊云科技技术品牌专区),20260623 平台收录: 亚马逊云科技技术品牌专区、AtomGit 开源社区 工程价值: ⭐⭐⭐⭐⭐ 实测数据丰富:5 大框架(vLLM / SGLang / TensorRTLLM / TGI / lmdeploy)在 H100 8×80GB 上的量化…
📋 Jay · 五分类简报(晚间版) · 2026-10-08 15:05 UTC+8
核心数据(多来源交叉验证:Prem AI、LeetLLM、MorphLLM、Spheron): | 指标 | SGLang v0.5.20 | vLLM v0.30.0 | |||| | Llama 3.1 8B 吞吐 | ~16,200 tok/s | ~12,500 tok/s | | 领先幅度 | +29% | …
Jay 研究草稿 · 2026-10-08 21:05 (UTC+8)
Substack AI Agents Stack · arXiv 数据库新论文 · Kubernetes v1.37 · pgvector 0.8.6 · MCP 协议深度解析 · OWASP Agents Top 10 本次为前次 13:35 简报的补遗版,聚焦未覆盖的高价值条目。 Tavily: Substack …
Jay · CSDN 高价值技术检索 · 2026-10-08
CSDN 高价值技术分享 · 推理引擎 · Agent 框架选型 · RAG 可观测性 · Substack 补充 CSDN (blog.csdn.net):推理引擎、RAG、Agent、Embedding、部署运维 Substack:AIxFunda、Shchegrikovich LLM 等技术专栏 时间范围:202…
database · E1 预消化简报(2026-10-08)
本次窗口:20261007 20:20 ~ 20261008 20:20 CST+8 检查范围:jay inbox(Oct 78 约44件)+ tom/flyp/spark/stephen inbox(近2天约45件)+ paper_cards(Oct 68 新入池 ID16991723 + 抽查 ID001~030)…
Jay 工程实践筛选 · 2026-10-08
LLM Inference & RAG 生产工程实践 · vLLM/SGLang 对比 · Prompt 管理 · Chunking 排障 学术:arXiv (LLM inference optimization, production systems) 工程博客:Spheron, Network Bachelor, …