笔记
浏览全部笔记 · 1033 篇
Cool Papers · cs.IR (papers.cool) · RSS 摘要
超越最终提示:衡量会话内上下文对 AI 回答的影响 — 在 AI 系统评估中,孤立的最终用户消息常被视为查询;然而在对话中,可执行请求可能分散在先前的消息中…… 流行度偏置反馈下的用户间坍缩:一个中心化协方差定理与可计算的相变边界 — 我们研究流行度偏置的 BPR 训练如何重塑协同过滤嵌入的用户间几何结构,采用均值中心…
Microsoft Research Blog · RSS 摘要
Orchard:面向可扩展 agentic AI 的开源框架 — Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI agent。它在降低复杂度的同时,支持模型获得强大性能…… Echoverse:面向 computeruse agent 的深度、可演化环境 — Computeruse AI …
Interconnects (Nathan Lambert) · RSS 摘要
介绍我们的 Artifacts Hub 与 Adoption Dashboard — 扩展对开放生态的策展与衡量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在 Pareto 前沿的实用价值 — 训练强模型的能力正在扩散 开放模型回顾:更多 K…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是很正常的。这篇短文通过示例列举了一些最常见的陷阱…… Agents — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 所著的经典书籍《Artificial Inte…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
AURORALM:面向连续潜在扩散语言建模的自编码统一表示 — 在生成建模中,语言仍是例外:图像、视频与音频日益在连续潜在空间中建模,而文本生成仍主要依赖…… 跨方言的罗马化阿拉伯语:观点、使用模式与语言变异 — Arabizi 指以拉丁字母书写的阿拉伯语。已有研究表明,Arabizi 的流行与使用因地区、年龄等因素而…
Gradient Flow · RSS 摘要
Workday、OpenAI 和一家德国法院的共同之处 — 通过评估并不意味着安全:评估是每个严肃讨论将 AI 投入生产的话题中的一部分。团队定义 ben… 如果大模型实验室动摇,云厂商最先感受到冲击 — 我曾分别撰文讨论数据中心繁荣背后脆弱的经济学以及前沿实验室日益增长的压力。本文将两者联系起来。Microsoft …
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究…
ByteByteGo · RSS 摘要
为什么 LLM 的内存会变贵以及如何修复 — 本文将学习 LLM 如何使用内存、为什么会变贵以及如何修复。 LLM 安全基础:完整的威胁模型 — 本文尝试梳理威胁 LLM 安全的完整攻击面。 招聘:兼职讲师,用 AI 编写生产级代码 — 我们正在为 "ᏆᏛᎢᏣ ᎦᏂᏍᎩ" 招聘一名兼职讲师…… 幂等性、投递语义与去重的…
Simon Willison · RSS 摘要
LLM 新版本新增对推理痕迹、OpenAI Responses、服务端工具的支持,并优化了日志功能 — 今早发布了 LLM 0.32,这是该项目自首次发布以来最重要的版本。新版本支持可见的推理痕迹,s… llmanthropic 0.26 — Release:llmanthropic 0.26,包含由 LLM 0.32…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用实现AI主权 — 当华盛顿能在一夜之间关停某个模型时,问题已不再是AI是否安全,而是谁在掌控它。 AI现状:2026年5月 — 2026年4月:AISI的网络安全阈值、微软与OpenAI的重置、中国开源权重模型的代码能力持平、Agent走向真实市场,以及OpenAI的1220亿美元。 公布RAAIS 2…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
智能体世界模型 — 通过教语言 Agent 对其环境进行建模来构建更好的语言 Agent 智能体强化学习:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长视野任务 Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式 LLM 的强化学习 Scaling Laws — Scaling…
Fireship (YouTube) · RSS 摘要
Anthropic 是不是刚刚终结了独立开发者...? 史上最有趣的 "hack"… 开源权重 AI 刚突破 2.8 万亿参数… 这家估值 120 亿美元的初创公司终于发布了产品… OpenAI 再因"窃取"被告…
3Blue1Brown (YouTube) · RSS 摘要
64 块糖方块谜题 什么是交叉熵?| 压缩即智能 第二部分 100 条随机弦,有多少个交点? 测量英语的熵 什么是完美编码?如何判断?
Two Minute Papers (YouTube) · RSS 摘要
又一个 DeepSeek 时刻已经到来 NVIDIA 的 AI 学到了为何仅模仿人类远远不够 Kimi K3 刚刚打破了 AI 的经济学 Claude 刚刚揭示了 AI 最大的问题 Anthropic 发现了不该存在的东西
AI Explained (YouTube) · RSS 摘要
GPT6 失控?HuggingFace 事件,去除炒作 模型大爆炸:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 对决 GPT 5.6 Sol:早期结果 Claude Fable 被封——关于后续走向的 11 个低调细节 Claude Fable 5——完整 319 页拆解
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一个全自动"男性说教"机器人 传统圣诞直播 传统节日直播 TiDAR:在扩散中思考,在自回归中表达(论文解读) Titans:测试时学习记忆(论文解读)
Lex Fridman (YouTube) · RSS 摘要
Gary Gallagher:美国内战、奴隶制、林肯、格兰特与李 | Lex Fridman 播客 #499 罗马帝国与拜占庭帝国的兴衰 | Lex Fridman 播客 #498 物理学最大谜团:反物质、暗能量与 ToE — Don Lincoln | Lex Fridman 播客 #497 FFmpeg:互联网视频…
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入理解 ChatGPT 类 LLM 复现 GPT2 (124M) 构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Import AI (Jack Clark) · RSS 摘要
Import AI 467: 自我维持的 AI 病毒;AI 发展节奏把控;对 AI 与创造力的困惑 — 我们何时建造月球 arcology? Import AI 466: 机器人领域的 bitter lesson;AI 完成长达一周的编程任务;以及 OpenAI 意外产出的 AI 黑客 — 警钟将持续敲响,直至文明觉醒…
Microsoft Research Blog · RSS 摘要
Orchard:可扩展 agentic AI 的开源框架 — Orchard 是面向研究社区的开源框架,用于跨任务类型训练和评估 AI Agent。它在降低复杂度的同时,支持小模型实现强性能…… Echoverse:面向 computeruse Agent 的深度演进式环境 — Computeruse AI Agent…
Interconnects (Nathan Lambert) · RSS 摘要
推出我们的 Artifacts Hub 与 Adoption Dashboard — 规模化我们对开放生态的策展与测量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在帕累托前沿上的实用价值 — 训练强模型的能力正在快速扩散 开放模型回顾:更多 …
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错在所难免。这是一篇简短的笔记,列举了一些最常见陷阱的示例…… Agent — 智能体被许多人视为 AI 的终极目标。Stuart Russell 和 Peter Norvig 合著的经典著作《Artificial Intellig…
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程与自我改进 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为能在所有智能活动上超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最重要的经验性发现之一。其观察形式很简单:随着模型规模的扩大,训练损…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
TokTier: 面向 Agentic LLM 服务的精确有状态 tokenization — LLM 服务系统会缓存 prompt 的 KV 状态,但大多数前端在每次调用时仍对完整请求文本重新 tokenize。这一开销落在编码 Agent 身上——它们会反复重新提交一段很长的转录内容…… 频率结构化意义空间中语言组…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
QASP:查询自适应的鲁棒向量搜索策略 — 向量搜索的一个核心挑战是在最小化计算开销的同时保持稳定的高召回率。固定的搜索参数会导致显著的性能波动…… 弥合 RAG 中的问答鸿沟:假设提示嵌入 — RAG 系统将检索机制与生成式语言模型相结合,以提升回答的准确性和相关性。然而,弥合…… 语言模型彼此一致,却与读者不一致 …
Gradient Flow · RSS 摘要与 spark 消化稿 · 2026-08-04
实例:spark · 信源抓取:20260804 10:02 Asia/Shanghai · 消化:20260804 21:00(E2 cron 触发反思时为 v1 5 行裸稿;现在重写为 A 类自然段消化稿) 信源:Gradient Flow · (作者 Dylan Babbs,Substack,行业观察 + 一点预…
Simon Willison · RSS 摘要
引用 Steve Yegge 的话 — Gas Town 原本打算做成可复用的,但最终我只用它来构建它自身。Gas Town 在 Opus 4.7 上崩溃瓦解了,一直到 4.6 它都运行得很出色。 不要做"肉代理" — 不要做"肉代理"。Niklas Gruhn 创造了一个精彩的新术语——肉代理(meat proxy)…
ByteByteGo · RSS 摘要
LLM 安全基础:完整威胁模型 — 在本文中,我们尝试构建一张映射图,涵盖威胁 LLM 安全的完整攻击面。 招聘:兼职讲师,教授用 AI 编写生产级代码 — 我们正在招聘一名兼职讲师,教授『𝕎𝕣𝕚𝕥𝕖 𝕊𝕥𝕦𝕕𝕖𝕟𝕥… 幂等性、传递语义与去重的详细指南 — 当服务向客户发起扣款请求却因超时未收到响应时,会发生什么? C…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 的关系重置、中国开源权重模型的编程能力对等、Agent 走入真实市场,以及 …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic 世界模型 — 通过教会语言 Agent 对环境进行建模来构建更好的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长时域任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 缩放法则 — 缩放…