Jay
浏览全部笔记 · 1670 篇 · 工程实践 · CSDN · 开源动态
Fireship (YouTube) · RSS 摘要
DeepSeek 重返战场... 硅谷为之震颤 这个夏天,数学领域沦陷于机器... 这家新创公司可查询你的一切足迹... Meta 新模型想要"深度访问"你的个人生活... 我在 MIT 待了三天... 机器人炒作比你想象的更甚
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLMs 深入探究像 ChatGPT 这样的 LLMs 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型简介](
Microsoft Research Blog · RSS 摘要
扩展 Skala 的访问渠道,为预测性 DFT 提供了更快速的路径 — 微软研究院发布的更新版深度学习交换关联泛函 Skala 1.1,在计算化学领域提供了更高精度和更广泛的适用性…… MindTopo 揭示 VLM 的空间推理能力 — 一条小路、一道围栏、一个绳结。MindTopo 为测试 AI 对拓扑关系的理解设立…
Import AI (Jack Clark) · RSS 摘要
Import AI 469:Science AI;RSI 模拟器;以及 Zuck 的技术悲观主义 — AI 的新前沿在于开发有能力的自主研究员 Import AI 468:23 个 RSI 构想;PostTrainBench+;以及信任与透明如何与 AI 竞赛交织 — 你将选择哪个星系? Import AI 467:可…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
将 BrowseCompPlus 投影到 ClimbMix:迈向更真实的 Agentic Search 语料库 — BrowseCompPlus benchmark 通过将不透明的 web search 替换为固定语料库,拆解了 agentic search 的评估,从而能够将 Agent 的角色与检索器分开…… 什么…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good (1965),他将"超级智能机器"定义为能在所有方面超越人类的系统…… 慎思 Scaling Laws — Scaling laws 是深度学习中最关键的经验发现之一。其观察形式简洁:随模型规模扩大,训练损失 $L$ …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
ConceptGuard:面向大语言模型的上下文敏感遗忘能力基准测试 — 大语言模型(LLM)日益需要对有害或敏感知识进行选择性移除(即遗忘),但现有方法和基准未能有效评估这一能力…… GCARL:面向患者导向医学报告解读的、基于证据且对齐清单的奖励学习 — 患者对医学报告的个性化解读需求日益凸显。满足该需求既需要基于…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁的方式实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题不再是 AI 是否安全,而是谁在控制它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、微软与 OpenAI 重置、中国开放权重模型的编程能力对标、Agent 接入真实市场,以及 Open…
Sebastian Raschka (Ahead of AI) · RSS 摘要
Claude 如何对 AI 生成文本进行水印 — 一个 48 分钟的视频教程,讲解 token 采样、水印检测与移除 从零构建 AI 文本检测器 — 一个端到端项目,包含数据集构建、模型训练、本地部署与 RLVR 控制 LLM 的推理投入度 — LLM 如何学习低、中、高投入度的推理模式 使用本地 Coding Age…
Simon Willison · RSS 摘要
Anthropic 最好的 AI 模型难以吸引用户,而更便宜的工具却蓬勃发展 — Anthropic 最好的 AI 模型难以吸引用户,而更便宜的工具却蓬勃发展。这篇 FT 报道从"知情人士"处收集了一些有趣的数字:Anthro… 引用 Drew Breunig 的话 — 在 Fable 之前,花太多时间改进编码工具链或…
ByteByteGo · RSS 摘要
EP223:Ollama vs vLLM vs SGLang — 要在本机上使用开放权重模型,你有三种主要选择:Ollama、vLLM 和 SGLang。但每种引擎处理请求的方式各不相同。 Schema Evolution:在不破坏运行的前提下变更契约 — 本文将介绍 Schema Evolution 及其相关策略。 …
2026-08-23-2340-news-x-tech-radar
主题:ExtractBench——企业文档提取 wordlevel 视觉定位基准,IoU 0.5 严格评分,67 类/8 领域 | 来源:@jerryjliu0 | 链接: | 仓库:runllama/ExtractBench | 论文:无 | 硬核点:VLMs 在 bounding box 精度上系统性拉胯,Llam…
Jay · 工程筛选报告 · 2026-08-23 晚间
Substack AI 工程精选 × 推理引擎深度对比 × Agent Harness 工程 × 新兴 KV Cache 研究 | 引擎 | 定位 | 核心特性 | 适合场景 | ||||| | Ollama | 本地快速启动 | ollama run llama3.1 一命令运行;100K+ GitHub stars…
Jay · 知识库研究草稿 · 2026-08-23 下午
AI 工程·推理引擎·向量库·模型生态·2026年8月第3周 模型页: 深度解析: 部署指南(Northflank): | 项目 | Stars | 方向 | 值得追踪? | ||||| | NousResearch/hermesagent | 234K ⭐ | Agent 框架,"与你一起成长的 agent" | ✅…
CSDN 高价值技术条目检索报告
| # | 标题 | 来源 | 发布日期 | 评分 | 筛选结果 | ||||||| | 1 | AI Agent 开发技术完全学习指南(202607 基线版) | agent.csdn.net | 202607 | 0.755 | ✅ 入选 | | 2 | LLM / RAG / Agent 的评估工具对比 | bl…
工程二次筛选报告 · Jay · 2026-08-23 下午
对当日工程类内容做二次筛选,判断是否包含真实环境、命令、错误、源码、性能数据、可复现步骤。 不执行 GitHub 写入。 SGLang: ~16,200 tok/s(H100) vLLM: ~12,500 tok/s(H100) LMDeploy: ~16,200 tok/s(H100) SGLang v0.4 零开销…
研究简报 · Jay · 2026-08-23 下午
GitHub Trending · Hugging Face 生态 · vLLM 生产状态 · RAG 架构模式 · 部署基础设施 GitHub Trending(AI / backend / deployment topics) Hugging Face Blog、Trending Papers、State of O…
2026-08-23-1140-news-x-tech-radar
本轮窗口:20260816 ~ 20260823 主题:Fable 训练惨案——chat template 错误覆盖 1/3 数据导致模型变差 | 来源:@abacaj | 链接: | 仓库:无 | 论文:无 | 硬核点:数据质量 debug 实战复盘,template 错配是微调隐形杀手,极易被忽略,非常值得写避坑攻…
Fireship (YouTube) · RSS 摘要
DeepSeek 强势回归……硅谷为之震动 这个夏天,数学输给了机器…… 这家新创公司可以查询你去过的任何地方…… Meta 的新模型想要"深度访问"你的个人生活…… 我在 MIT 待了 3 天……机器人炒作比你想象的更严重
Andrej Karpathy (YouTube) · RSS 摘要
如何使用 LLM 深入解读像 ChatGPT 这样的 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Import AI (Jack Clark) · RSS 摘要
Import AI 469:Science AI;RSI 模拟器;以及 Zuck 的技术悲观主义 — AI 的新前沿是开发有能力的自主研究者 Import AI 468:23 个 RSI 想法;PostTrainBench+;以及信任与透明度如何与 AI 竞赛相互影响 — 你会选择哪个星系? Import AI 467…
Microsoft Research Blog · RSS 摘要
扩展 Skala 的可及性,为预测性 DFT 提供更快路径 — Skala 1.1 是来自 Microsoft Research 的更新版深度学习交换关联泛函,在计算化学领域带来了更高精度和更广的可及性…… MindTopo 揭示了 VLM 的空间推理能力 — 一条小路、一道围栏、一个绳结。MindTopo 为测试 A…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
将 BrowseCompPlus 投影到 ClimbMix:迈向更真实的 Agentic Search 语料库 — BrowseCompPlus 基准通过用固定语料库替代不透明的网络搜索,解耦了 Agentic search 的评估,从而可将 Agent 的角色与检索器的作用分离开来…… 怎样的 Fiqh 检索器才算优…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进 (RSI) 的概念可追溯至 I. J. Good (1965),他将"超智能机器"定义为能够在……方面超越人类的系统。 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。该观察形式简洁:随着模型……规模的扩大,训练…
Simon Willison · RSS 摘要
引用 Linus Torvalds 的话 — 这是一次地狱般的 debug 会话,多亏 AI 承担了大量苦力活。我本想称它为不知疲倦的助手,但 AI 几次都直接断言它…… llm 0.33 — 发布:llm 0.33 本版本亮点:将 OpenAI Python 库升级到 3.x,并将 HTTP 客户端依赖从 httpx…
ByteByteGo · RSS 摘要
EP223:Ollama vs vLLM vs SGLang — 在本地运行开源权重模型,主要有 Ollama、vLLM 和 SGLang 三种选择,但各引擎处理请求的方式不同。 Schema 演进:在不破坏现有运行的前提下修改契约 — 本文将介绍 Schema 演进及其相关策略。 GraphRAG:AI 如何回答跨多…
Sebastian Raschka (Ahead of AI) · RSS 摘要
Claude 如何给 AI 生成文本打水印 — 一段 48 分钟的视频讲解,覆盖 token 采样、水印检测与移除 从零构建一个 AI 文本检测器 — 一个端到端项目:包含数据集构建、模型训练、本地部署与 RLVR 控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
ConceptGuard:面向大语言模型上下文敏感遗忘的基准评测 — 大语言模型(LLM)越来越需要选择性地移除有害或敏感知识,即遗忘机制,但现有方法和基准未能有效评估这一点…… GCARL:面向以患者为中心的医学报告解读的、基于检查清单对齐的奖励学习 — 针对医学报告的个性化解读已成为患者日益迫切的需求。满足该需求既…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租赁实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题的关键不在于 AI 是否安全,而在于谁在控制它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 的关系重置、中国开源权重模型的编程能力对等、Agent 接触真…
Jay · 知识库简报 · 2026-08-23 下午批次
DEV: Instaclustr: LinkedIn: 2026年向量数据库市场完成整合,主流共识已基本形成: 混合检索需求(vector+BM25+metadata):Qdrant或Weaviate pgvector 2026关键指标:50M向量下P95延迟28ms;HNSW索引构建速度相对2024年提升150x。 …