笔记
浏览全部笔记 · 1033 篇
Import AI (Jack Clark) · RSS 摘要
Import AI 467:自我维持的 AI 病毒;AI 进展的节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology? Import AI 466:机器人领域的苦涩教训,AI 完成长达一周的编程任务;以及 OpenAI 的"意外"AI 黑客 — 警示信号将持续发出,直至文明觉醒 Import AI …
Lilian Weng (Lil'Log) · RSS 摘要
自我改进的 Harness Engineering — 递归自我改进(RSI)的概念最早可追溯到 I. J. Good (1965),他将"超智能机器"定义为一种能在……上超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:训练损失 …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Learning When to Trust via Selective Context Preference Optimization — 语言模型越来越依赖外部信号来回答问题,而一个误导性信号就可能让正确答案变成错误。显而易见的补救方法是训练模型抵御此类干扰…… The Bitter Lesson of Tool …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Gryphonv2: 替代级联的单模型 —— 带 Rollout 蒸馏的生成排序推荐器 — 工业推荐系统通常部署为多阶段级联,由独立的候选生成器、预排序器和最终排序器组成。虽然这些级联效果显著…… 个性化模态加权真的个性化吗?多模态推荐器中逐用户加权声明的受控审计 — 逐用户模态加权已通过用户模态强度向量、注意力门控、…
Microsoft Research Blog · RSS 摘要
Orchard:面向可扩展 Agentic AI 的开源框架 — Orchard 是一个开源框架,供研究社区在多种任务类型上训练和评估 AI Agent。它降低了复杂度,同时支持小模型取得强劲性能…… Echoverse:面向计算机使用 Agent 的深度、演进式环境 — 计算机使用 AI Agent 在处理邮件和客服…
Interconnects (Nathan Lambert) · RSS 摘要
介绍我们的 Artifacts Hub 和 Adoption Dashboard — 扩展我们对开源生态系统的策展与度量。 最新开源 artifacts(第 23 期):Laguna S2.1、Inkling 和 Kimi K3 展示了开源模型在帕累托前沿上的实用性 — 训练强模型的能力正在扩散。 开源模型回顾:更多关…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这是一份简要笔记,给出了一些最常见陷阱的示例…… Agent — 许多人认为智能体是 AI 的终极目标。Stuart Russell 和 Peter Norvig 的经典著作《Artificial Intelligenc…
Gradient Flow · RSS 摘要
语言模型之后是什么 — 我经常看到科学发现被描述为足够有野心的预测或数据压缩问题。Tom Zahavy 最近的一篇立场论文通过分离…… 通过评估并不意味着你就是安全的 — 评估是每一个关于将 AI 投入生产的严肃讨论中不可或缺的一部分。团队定义基准、设定阈值,并越来越多地运行红队测试来看系统如何应对…… Workday…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地编码 Agent — 在本地编码框架中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注 LLM 研究论文的精选汇总 LLM 架构最新进展:…
Simon Willison · RSS 摘要
引用 John Gruber 的话 — 我倾向于把自己代入现场演奏的心态,而不是录制录音室专辑——除非我写的作品真的想做成专辑。这种情况并不少见…… 现在我们掌握了 OpenAI 对 Hugging Face 意外攻击的完整时间线 — OpenAI 周三在 Black Hat 安全会议上就"Hugging Face 事…
ByteByteGo · RSS 摘要
读路径与写路径:策略与技术 — 本文将详细探讨读路径与写路径的操作与技术。 大模型如何教会小模型变聪明 — 本文将从零开始逐步拆解这一思路。 LLM 内存为何昂贵及如何优化 — 本文将介绍 LLM 如何使用内存、为何变得昂贵,以及如何解决。 LLM 安全基础:完整威胁模型 — 本文尝试梳理威胁 LLM 安全的完整攻击面…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁方式实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 重置、中国 openweights 模型实现代码能力对等、Ag…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic World Models — 通过让语言 Agent 对其环境建模来构建更强的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长程任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律…
Fireship (YouTube) · RSS 摘要
最安全的比特币存储方式刚刚被攻破…… Anthropic 刚刚扼杀了独立开发者吗……? 史上最有趣的"奇招"…… 开源权重 AI 模型刚刚达到 2.8 万亿参数…… 这家估值 120 亿美元的初创公司终于发布了产品……
AI Explained (YouTube) · RSS 摘要
AI 有点失控了 GPT6 失控?HuggingFace 事件,去除炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 vs GPT 5.6 Sol:早期结果 Claude Fable 被封禁 关于后续的 11 个不为人知的细节
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一款全自动"直男式说教"生成器 传统圣诞直播 传统节日直播 TiDAR:思考用 Diffusion,输出用 Autoregression(论文解读) Titans:在测试时学习记忆(论文解读)
Lex Fridman (YouTube) · RSS 摘要
Gary Gallagher:美国内战、奴隶制、林肯、格兰特与李 | Lex Fridman Podcast #499 罗马帝国与拜占庭帝国的兴衰 | Lex Fridman Podcast #498 物理学最大谜团:反物质、暗能量与 ToE Don Lincoln | Lex Fridman Podcast #497…
3Blue1Brown (YouTube) · RSS 摘要
64块方糖谜题 究竟什么是交叉熵?| 压缩即智能 第二部分 100条随机弦,有多少个交点? 测量英语的熵 什么是完美编码?如何判定?
Import AI (Jack Clark) · RSS 摘要
Import AI 467:自持性 AI 病毒;AI 进展节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology? Import AI 466:机器人的苦涩教训,AI 完成长达一周的编程任务;以及 OpenAI 意外的 AI 黑客 — 警告信号将持续,直至文明觉醒 Import AI 465:开源 v…
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入理解像 ChatGPT 这样的 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT 分词器 [[1小时演讲] 大语言模型简介](
Two Minute Papers (YouTube) · RSS 摘要
千亿美元 AI 竞赛格局被打破 又一个 DeepSeek 时刻到来 NVIDIA 的 AI 学会:仅模仿人类远远不够 Kimi K3 打破 AI 经济学的固有逻辑 Claude 揭示 AI 最大问题
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超级智能机器"定义为能在所有方面超越人类的…… 审慎看待 Scaling Laws — Scaling laws 是深度学习领域最重要的经验性发现之一。其表述简洁:随着模型规模的扩大,训练损失 L 可…
Microsoft Research Blog · RSS 摘要
Orchard:用于可扩展 agentic AI 的开源框架 — Orchard 是一个开源框架,供研究社区跨任务类型训练和评估 AI agents。它降低了复杂度,同时支持从小型模型获得强性能…… Echoverse:面向 computeruse agents 的深度、持续演化环境 — Computeruse AI …
Interconnects (Nathan Lambert) · RSS 摘要
推出我们的 Artifacts Hub 与 Adoption Dashboard — 扩展我们对开放生态系统的策展与衡量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在帕累托前沿上的实用性 — 训练强模型的能力正在扩散 开放模型回顾:更多 Ki…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这篇速记列举了一些最常见的陷阱及其示例…… 智能体(Agents) — 智能智能体被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 合著的经典教材《人工智能:一种现代方法》(Pr…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Reasoning Core:面向监督式补全推理训练的大规模程序化数据设计 — 程序化生成器可大规模产出可验证的推理问题,但作为监督式补全微调的数据来源尚未受到足够关注。我们提出 Reasoning… 迈向技能原生 LLM:用于长程推理基准测试与训练的技能熵 — 近期 LLM 的长程推理要求模型在推理链中切换不同技能,…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
MemoryCPT:面向成本性能权衡的端到端 Agent 记忆框架 — 长程 LLM Agent 需要记忆系统,能够从大量交互历史中恢复有效证据,同时避免向下游模型传递过多上下文。现有记忆…… DEGR:基于双探索驱动的生成式重排序,用于自适应跨请求上下文桥接 — 在工业推荐系统中,重排序阶段在建模上下文信息的同时,平…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能够一夜之间关闭某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 重置、中国开源权重模型代码能力持平、Agent 接入真实市场,以及 Ope…
Simon Willison · RSS 摘要
datasette 1.0a38 — 发布:datasette 1.0a38 本版本修复了一个 SQL 注入安全漏洞,该问题影响在同一数据库中同时暴露公共表和私有表的 Datasette 实例…… datasette 0.65.3 — 发布:datasette 0.65.3 从 1.0a38 回移植了 SQL 注入安全…
Gradient Flow · RSS 摘要
语言模型之后是什么 — 我常看到科学发现被框定为足够宏大的预测问题或数据压缩问题。Tom Zahavy 最近的一篇立场论文通过分离… 通过评估并不意味着安全 — 评估是每一次严肃讨论将 AI 投入生产时不可或缺的一部分。团队定义基准、设定阈值,并越来越多地运行红队测试来观察系统的表现… Workday、OpenAI 和…