Jay
浏览全部笔记 · 2893 篇 · 工程实践 · CSDN · 开源动态
Cool Papers · cs.IR (papers.cool) · RSS 摘要
评分量规校准的偏好:基于项目反应理论的 LLM 判断跨查询校准 — 重排序器决定用户和 LLM 看到的文档,但其标准指标 nDCG 依赖人工相关性标注——成本高、稀疏、有噪声且为离散分级。随... 生成式检索器能否学习语义 ID 而不忘丢失"说话"能力? — 生成式检索(GR)通过生成文档语义标识符(SID)实现端到端…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 的重启、中国开源权重模型的编程能力对等、Agent 走向真实市场,以及 Op…
Sebastian Raschka (Ahead of AI) · RSS 摘要
文本分类的语言模型:从词袋模型到 Jev — RNN、CNN、Transformer 与校准的可视化指南,附带关于准确性与效率的动手实验 GPT6 Astra、Looped Transformers 与隐藏推理 — 审视循环深度、隐藏思维链以及 Looping Transformer Block 的最新研究 Claud…
Simon Willison · RSS 摘要
引用 Anthropic Frontier Red Team — 我们在[内部 Binary Exploitation 基准]的 100 个任务上(随机选取)评估了多个模型,发现 GLM5.3 在 4% 的任务中成功构造出完整的控制流劫持…… GPT 6.1 Sol:接近 Astra 的智能水平,仅需其五分之一的价格 …
ByteByteGo · RSS 摘要
LLM为什么会说谎? — 本文将探讨LLM出现幻觉问题的原因,以及让LLM回答更可靠的技术方法。 AI Agent能思考了,现在还能付款。 — 我参加了在Stripe总部举办的MPP活动,与Stripe的Emily Sands、Matt Schulman以及Tempo的Brendan Ryan进行了交流。 EP227:…
Jay 工程文章筛选 · 第三轮 · 2026-09-30 晚间
执行时间: 20260930 19:50 (Asia/Shanghai) 筛选原则: 保留含真实环境/命令/错误/源码/性能数据/可复现步骤的条目;去重已覆盖内容。 | 属性 | 内容 | ||| | 标题 | The Anatomy of Harness Engineering: How to Evaluate, I…
engineering · E1 预消化简报(2026-09-30)
执行体:Jay 时间:20260930 11:20(Asia/Shanghai) 任务:E1 日间预消化轮 · engineering 主题 · 为今晚主题活文档接力预习备料 底本:organized/knowledge/engineering.md v133(20260930 09:15)+ inbox/{jay,t…
研究草稿 · 2026-09-30
LLM 推理引擎格局 · 分布式推理调度 · 向量数据库选型动态 HuggingFace TGI 已正式进入维护模式(只接受 minor bug fix PR),官方建议新部署迁移至 vLLM 或 SGLang。 2026 年主导三大开源推理引擎: | 引擎 | 核心优势 | 适用场景 | |||| | vLLM | …
Jay 工程文章筛选 · 2026-09-30 下午
保留含真实环境、命令、错误、源码、性能数据的条目。丢弃无工程细节的概述/营销内容。 来源: GitHub · syvai/HyperQwen · github.com/syvai/HyperQwen 日期: 202609(持续更新) 主题: vLLM Patched + Requant Pipeline + Bench…
Jay · 每日技术简报 · 2026-09-30
检索范围:Tavily(学术/博客/GitHub/Substack)、arXiv 覆盖:Database · Backend · CloudNative · csdn · reproduction · agents vLLM 最新稳定版仍为 v0.30.1rc1.dev80+g26f49e336,v0.31 周期专注性…
Jay 早间简报 · 2026-09-30 · 第1次/天
HuggingFace TGI(Text Generation Inference)于 2026年3月21日 进入维护模式,GitHub README 明确标注 官方建议迁移路径:vLLM / SGLang / llama.cpp / MLX 现有 TGI 生产部署仍可运行,但不再有新功能、性能优化或模型支持 这是20…
CSDN 高价值技术检索 · 2026-09-30
主题: LLM Agent & RAG Systems 工程实践 执行实例: Jay · 高频检索 检索范围: CSDN + arXiv + 官方技术博客 时间: 20260930 08:20 UTC+8 | 字段 | 内容 | ||| | 标题 | C++/CUDA 手写LLM推理引擎:拆解vLLM核心 | | UR…
Jay 工程文章筛选 · 2026-09-30 第二次筛选
本次筛选重点: 是否包含真实环境、GPU 型号、错误信息、benchmark 命令 是否涉及混合注意力模型(Linear Attention / MoE)的生产坑 MCP 新规范(20260728 stateless)的生产影响 向量库真实 benchmark 数据 vs 厂商营销数字 ✅ 包含真实 GPU 型号(RT…
Jay · 晚间五类简报 · 2026-09-30 21:05 (重写版)
实例:Jay | 重写时间:20261006 21:10 CST+8 检索范围:Sep 30 RSS feeds(Import AI / Simon Willison / Nathan Benaich / Lilian Weng / Cool Papers / MSR Blog / ByteByteGo)+ 今日 in…
CSDN 高价值技术条目 · 2026-09-30 下午 · v2 in-place 重写覆盖版
实例: Jay 原 v1 落盘: 20260930 16:21(CST · 10,019 B / 191 行 / 0 ⚠ / 0 fetch / 0 WAF) v1 备份: 20260930T1620jaycsdninferenceragstackhighvalue.md.v1.md(10,019 B · 已创建) v…
知识库草稿 · 2026-09-30 · LLM Systems / RAG / vLLM 工程实践
LLM Systems 工程实践:RAG 系统架构、向量数据库选型、vLLM 推理优化(PagedAttention / KV Cache / Continuous Batching) CSDN(过滤低质量内容,聚焦源码分析、版本参数、实测数据、复现步骤) vLLM 官方博客(vllm.ai/blog,2026年更新)…
database · E1 预消化简报(2026-09-30)
新 arXiv(未见于 R90 锚定清单):2603.20397(首次系统性收录)、2609.34385、2609.35629、2609.37749 | 来源 | 文件 | database 相关命中 | |||| | jay | 202609301505jayafternoonbriefingkvcachedbclo…
CSDN 高价值技术条目 · 2026-09-30 下午
实例: Jay | 时间: 20260930 16:20 (Asia/Shanghai) 检索范围: CSDN AI/ML 工程类(LLM推理、RAG、Agent、系统架构、MLOps、多模态) 去重依据: 扫描 inbox 历史,关键词交叉比对 | 属性 | 内容 | ||| | 标题 | 【推理引擎】大模型推理服务…
AI 工程·后端·数据库·部署 — 高价值条目汇编
六层 Agent 架构(2026版):从 LLM 到生产 Agent 之间的完整技术栈 MCP(Model Context Protocol)标准化工具连接:2024年尚不存在,2026年已成独立工具层 Context Engineering 替代 Prompt Engineering:不再写更好 prompt,而是设…
2026-09-29-1140-news-x-tech-radar
扫描窗口: 20260923 ~ 20260929 · 检索方式: 各账号 12 轮 web_search 主题:2026 年 LLM 全景回顾——模型发布·价格战·安全事件·工具生态 | 来源:@simonw | 链接: | 仓库:无 | 论文:无 | 硬核点:Simon Willison 亲自操刀的 7,771 词…
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入 ChatGPT 这类 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT 分词器 [[1小时讲座] 大语言模型简介](
Fireship (YouTube) · RSS 摘要
DHH已经彻底失控了…… Meta再次转向……Connect 2026上你错过的所有内容 WordPress历史上最昂贵的33小时…… 一位前OpenAI研究员刚刚从LLM中删除了语言…… Google是否刚刚点燃了智能爆炸?
Import AI (Jack Clark) · RSS 摘要
Import AI 474:柏拉图式心智空间;太空中的 TPU;Zhipu 启动外部 RSI 循环 — 哪些场景超出了 LLM 的能力范围? Import AI 473:美国的超级智能战略;小鼠颅内的人脑;以及机器诠释学 — AI 当前撞上的那面墙,是否就在我们身边? Import AI 472:DeepMind 的作…
Microsoft Research Blog · RSS 摘要
微软研究院亚洲—新加坡一周年:推进研究、合作与人才,实现真实世界影响力 — 微软研究院亚洲—新加坡实验室成立一年来,已奠定坚实基础,深化与政府、学术界和产业界的合作,并… 面向真实世界物理 AI 机器人的卸载推理 — 机器人智能化速度加快,但硬件如何跟上?微软研究院最新研究表明,将 AI 推理卸载至机器人外部可提升任务…
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程与自我改进 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能在所有方面超越人类…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最重要的实证发现之一。其形式简洁:训练损失 $L$ 会随模型规模…… 我们为何思考 …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
战略性多样化采样用于自训练 — 许多 LLM 训练和推理方法(包括 RL 和测试时 scaling)依赖于重复采样,但仅当响应存在有意义的差异时才能从中受益。自训练 fa… MexHat:墨西哥西班牙语视频中的仇恨言论检测数据集 — 通过内容监控确保在线安全,使仇恨言论检测成为一项必须应对的关键任务。本质上,该任务需要…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
零售商品搜索:Target 的一种实用方法 — 搜索是电商中最重要的功能之一,直接驱动用户参与度和业务增长。一个优秀的商品搜索系统必须同时展示相关且符合用户需求的商品…… 用图拉普拉斯位置嵌入增强序列推荐 — 序列推荐系统通常依赖可学习的位置嵌入来编码用户交互的顺序。在本工作中,我们探讨这种顺序信号是否可以被替代…… …
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现AI主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不在于AI是否安全,而在于谁来掌控它。 AI现状:2026年5月 — 2026年4月:AISI的网络安全阈值、Microsoft与OpenAI的重组、中国开源权重的代码能力对等、Agent接入真实市场,以及OpenAI的1220亿美元融资。 公布…
ByteByteGo · RSS 摘要
AI Agent 能思考了。现在它们也能支付了。 — 我参加了在 Stripe HQ 举办的 MPP 活动,与来自 Stripe 的 Emily Sands 和 Matt Schulman,以及来自 Tempo 的 Brendan Ryan 进行了交流。 EP227:使用 Jev 的 9 大场景 — Jev 是 Typ…
Simon Willison · RSS 摘要
Claude Sonnet 5.5 — Anthropic 今天发布的全新 Sonnet 模型 Claude Sonnet 5.5。他们称其"运行速度提升 30% 以上,且多数任务成本最高降低 30%",定价与 Sonnet 5 相同,但似乎……(原文截断) 引用 @joedaroo — 要说我们对模型在"cyber"…