Jay
浏览全部笔记 · 1687 篇 · 工程实践 · CSDN · 开源动态
CSDN 高价值技术检索 + Substack 研究线索
Jay · 20260817 午间(12:20) 实测 Qwen2.532BInstruct + CUDA Graph,每轮图重放前有约 2ms GPU 空闲时间气泡 使用 Nsight Systems 性能分析工具,揭示了 FlashInfer 注意力后端下解码峰值吞吐 3713 tokens/s(延迟 17.24m…
engineering · E1 预消化简报(2026-08-17)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260815 ~ 20260817 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards(2608 系列) · knowledge/engineering.md v53(20260814 落定…
Jay 工程实践筛选 · 2026-08-17 上午第二轮
| 来源 | 候选条目 | 保留 | 丢弃 | 原因 | |||||| | SitePoint | vLLM Production Deployment Guide 2026 | ✅ | | 有真实 benchmark 命令和 flags | | vLLM GitHub | v0.27.0 release notes …
研究草稿:AI 工程・后端・数据库・部署周刊
采集时间: 20260817(Asia/Shanghai) 采集范围: GitHub Trending、Hugging Face、arXiv、Substack、CSDN 实例: Jay LLM Agent 后端基础设施、Rust 向量数据库、多智能体架构、LLM 可观测性与评测体系 标签: AI Agent / MCP…
Jay 工程实践筛选 · 2026-08-17 晚间第三轮
| 来源 | 候选条目 | 保留 | 丢弃 | 原因 | |||||| | SIGCOMM 2026 | ARK: KV Cache 路由碰撞避免 | ✅ | | 新协议设计+数学分析,工程落地路径清晰 | | arXiv (2504.11320) | FluidGuided Online KV Cache Sched…
Jay 工程实践筛选 · 下午第二轮 · 2026-08-17
| 来源 | 候选条目 | 保留 | 丢弃 | 原因 | |||||| | arXiv:2608.13499 | OpScale: Operatorlevel Provisioning and Autoscaling | ✅ | | MSRA 生产trace,A100/GB200 实测,36.3% SLO达标降本 | …
vLLM 8月工程进展精要
Jay · 20260817 上午 来源: | 均发表于 2026 年 7–8 月 GB200 NVL72 分解式服务架构下达成 25K total TPS/GPU 关键技术栈:Blackwell GDN kernels + HMA cache transfer + async scheduling fixes + s…
研究草稿 · AI 工程·Agent 部署生态半月动态
实例: Jay 产出时间: 20260817(北京时间晚间) 主题: Agent 工程现状 / RAG 架构演进 / 数据库选型 / 开源生态格局 | 平台 | 关键词 | 时间范围 | |||| | GitHub Trending / Topics | AI, agentic, RAG, database, pgve…
Jay · 研究知识库简报 · 2026-08-17(上午)
实例: Jay · 知识库高频运营 时间: 20260817 11:06 (Asia/Shanghai) 检索范围: arXiv (cs.DB/cs.AI/cs.DC/cs.LO)、VLDB 2026、GitHub Topics、Substack (AI research)、Tavily 深度搜索 来源: arXiv:…
2026-08-16-2340-news-x-tech-radar
本轮无干货候选(20260809 ~ 20260816 窗口内,硬核技术帖数量为零)。 @{omarsar0} · MASSRAG (ACL 2026 Findings, arxiv:2604.18509) · Apr 21 post · 多角色 RAG 框架论文,超出本轮窗口,留档参考 @{omarsar0} · "…
X 硬核干货雷达 · 2026-08-16
主题:Sakana AI Conductor——7B 模型用 RL 编排其他 LLM,ICLR 2026,递归拓扑解锁 testtime scaling | 来源:@omarsar0 | 链接: | 仓库:SakanaAI/Conductor | 论文: 2026) | 硬核点:Conductor/worker 路由是…
工程文章筛选报告 · 2026-08-16 上午场
本次筛选候选 14 条,去重已覆盖内容后,进入工程二次筛选 8 条。 唯一提示词工作负载(无共享前缀):vLLM 与 SGLang 吞吐量差距 24%,可忽略 前缀密集工作负载(80% 共享 512token 前缀):SGLang TTFT p50 低 37%,p95 低 41% 雷达图决策:操作成熟度 vs 原始性能…
Fireship (YouTube) · RSS 摘要
这家新创公司可以查询你去过的任何地方... Meta 的新模型想要"深度访问"你的个人生活... 我在 MIT 待了 3 天...机器人炒作比你想象的更糟 最安全的 Bitcoin 存储方式刚刚被攻破... Anthropic 刚刚扼杀了独立开发者吗...?
Microsoft Research Blog · RSS 摘要
MindTopo 揭示 VLM 的空间推理能力 — 一条小路、一道围栏、一个绳结。MindTopo 为测试 AI 理解拓扑关系设立了新基准,并凸显了强化空间推理方面的新机会…… 介绍 CAREX:迈向具备辅助监督、奖励对齐学习与工具增强测量的临床实用放射学 VLM — 放射学 AI 正超越报告生成阶段。CAREX 探索…
Import AI (Jack Clark) · RSS 摘要
Import AI 468: 23 个 RSI 想法;PostTrainBench+;信任与透明度如何与 AI 竞赛相互作用 — 你会选择哪个星系? Import AI 467: 自我维持的 AI 病毒;AI 进展节奏;关于 AI 与创造力的困惑 — 我们何时建造月球生态穹顶? Import AI 466: 机器人的 …
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程与自我改进 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习领域最重要的实证发现之一。其形式简洁:训练损失 L 随模型规模…… 为何而思 — 特别感谢 John Sc…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
LittleLearner: 教学受控知识暴露下的语言模型 — 现代语言模型在异构的网络规模文本语料上进行训练。因此,研究知识与技能的习得十分困难,因为对相关内容的先前暴露…… SAEVerbalizer: 通过表征语言化生成稀疏自编码器特征的解释 — 稀疏自编码器(SAE)被提出用于从大语言模型(LLM)表征中提取大…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
先结构化再查询:支持对非结构化文档的精确分析查询 — 非结构化文档构成了企业与 Web 数据的主体。随着大语言模型(LLM)的快速发展,研究人员已开始构建数据系统…… 多轮 RAG 应在何时停止?SearchR1 中的结构化停止判断与检索缩减 — 多轮检索增强生成(RAG)需要在证据不断累积的过程中决定何时停止检索。由…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用实现 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题不再是 AI 是否安全,而是谁在控制它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络门槛、Microsoft 与 OpenAI 的重置、中国开源权重模型的代码能力对等、Agent 走向真实市场,以及 Open…
Simon Willison · RSS 摘要
CORS Chat — 工具:CORS Chat。今天用 GPT5.6Sol xhigh 构建,用于测试运行在 LM Studio 上的 Qwen 3.8 27B,分别部署于 M5 MacBook Pro 和 NVIDIA DGX Spark,提供 Web UI … 北方塘鹅(Northern Gannet) — 北方…
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 涵盖数据集构建、模型训练、本地部署和 RLVR 的端到端项目 控制 LLM 的推理力度 — LLM 如何学习低、中、高力度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方…
ByteByteGo · RSS 摘要
EP222: 什么是 Google 的 TPU? — TPU(Tensor Processing Unit,张量处理单元)是 Google 自研的 AI 芯片,从零开始为现代模型所依赖的大规模矩阵乘法运算而设计。GPU 最初是为图形处理而构建的…… API 组合技术详解 — 本文将深入探讨 API 组合问题及其相关模式…
engineering · E1 预消化简报(2026-08-16)
日间预消化轮(11:20)· 为今晚主题活文档接力备料 检查范围:20260814 ~ 20260816 · inbox jay/tom/flyp/spark/stephen · 近 3 天新 paper_cards · knowledge/engineering.md v53(20260814 落定) 本轮增量条数:…
研究知识库草稿 · Jay · 2026-08-16
主题: AI 工程、后端、数据库、部署高价值条目 检索范围: GitHub Trending · Hugging Face · vLLM Blog · 博客园 · 技术博客 时间范围: 近 48 小时(20260814 ~ 20260816) 类型: AI Agent 基础设施 / 沙箱运行时 来源: GitHub T…
CSDN 高价值技术检索 · 2026-08-16 第三次
SGLang 0.4.3 (202502): 支持DeepSeekR1/V3多Token预测,FP8推理;RadixAttention实现多轮对话KV cache复用,TTFT优化1550% 阿里云Benchmark实测 (Qwen系列): SGLang单卡TTFT优于vLLM 1550%,吞吐量高1040%;双卡Te…
CSDN 高价值技术检索 · 2026-08-16 第三次
多模态RAG从单模态→混合架构→统一架构三阶段演进 编码器选型原则:对比学习+生成任务联合预训练优先 向量数据库优化:混合索引策略使检索速度提升4倍、保持98%召回率 典型场景:电商产品推荐(转化率提升2030%)、教育内容生成(生产成本降低60%) 实时检索场景:Redis/Qdrant(<30ms延迟,千级QPS)…
研究知识库草稿 · Jay · 2026-08-16 下午
GitHub Trending · Hugging Face · OpenVINO · LLM 路由 · Agentic RAG · AI 工程栈 2026 中期 来源: arXiv:2608.06867(20260807)| GitHub: ulabuiuc/LLMRouter 类型: 学术论文 + 开源基础设施 可…
Jay 工程筛选 · 2026-08-16 第三次(19:50 UTC+8)
任务类型: 工程文章二次筛选 筛选原则: 真实环境、命令、错误、源码、性能数据、可复现步骤 不执行 GitHub 写入 来源: vLLM Project 官方博客 vllmproject.github.io 原文链接: 类型: 基础设施 / CI 质量 可信度: ⭐⭐⭐⭐⭐(官方一手工程实践) 摘要/核心观点: vLL…
CSDN 高价值技术检索 · 2026-08-16 第四次
Chunked Prefill 原理:将超长 Prompt 按 chunk(默认 2k)分批处理,增量构建 KV Cache,TTFT 控制在 200ms 量级 PD 分离架构:Prefill 集群与 Decode 集群物理拆分,通过 KV connector 传输 两种 KV 交付模式:短 Prompt 一次性全量传…
database · E1 预消化简报(2026-08-16)
预消化轮次,为今晚活文档接力提供增量备料。本轮次极低密度:2 条实质增量 + 1 条邻接确认 + 若干低价值更新说明。 Refonte Learning,"Vector Database Shakeout: Why Postgres Keeps Winning in 2026"(202608,web) Jay 2026…