笔记
浏览全部笔记 · 1033 篇
Cool Papers · cs.IR (papers.cool) · RSS 摘要
仅分数蒸馏用于紧凑型密集检索 — 大型 embedding 模型能提升检索质量,但在线部署大编码器成本高昂。本文研究紧凑型检索器能否仅从打分中学习教师模型的排序行为…… FAIR GraphRAG:一种用于语义数据分析的检索增强生成方法 — 检索增强生成(RAG)缓解了 LLM 在回答领域特定问题时的局限。基于图的 R…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
LLM 中的元认知:基础、进展与机遇 — 元认知是智力的基础组成部分,对有效学习、问题解决、决策、沟通等至关重要。近年来,它已成为…… 一个已验证教学反馈分类协议的耐久性与跨语言迁移基准 — 机构收集的开放式教学评估反馈远多于其实际阅读量。先前的研究提出了一种已验证的协议,用于按主题类别对此类评论进行分类…… Adva…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260715 10:02 Asia/Shanghai · 消化:20260720 21:00(第 2 次重写:v1(0715 10:02 抓取后未清洗,5 行裸稿 + 0 判断 + 0 [v1 factfix] 标注 = 第 15 次 v1 风格复发 + 主线 I「Agent Ant…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能在一夜之间关停某个模型时,问题已不再是 AI 是否安全,而是谁在控制它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络门槛、Microsoft 与 OpenAI 关系重置、中国开源权重的代码能力对等、Agent 接入真实市场,以及 Open…
Simon Willison · RSS 摘要
引用 GitHub Changelog — Dependabot 现在会在新版本在其 registry 上可用至少三天后,才打开版本更新 pull request。该冷却期已成为默认设置…… simonw/pedalican — simonw/pedalican 显然我之前没注意到这些在五月首次发布的消息,但今天我在 …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长程任务... Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的 RL 扩展定律(Scaling Laws) — 扩展定律如何从预训练演进到强化学习... LLM Benchmark 的剖析 …
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 清单(1 月至 5 月) — 精选本年度值得关注的 LLM 研究论文汇总 LLM 架构最新进展:KV Sharing、mHC 与 C…
ByteByteGo · RSS 摘要
LLM 如何学会变得有用(RLHF vs DPO) — 本文将探讨这种学习过程是如何实际发生的,从为什么仅靠指令遵循还不够讲起,然后介绍两种主要的方法…… 微软如何在企业规模交付 AI Agent — 为了解在如此规模下交付 agent 实际需要什么,我们采访了 Microsoft Core AI 产品副总裁 Marc…
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入剖析类似 ChatGPT 的大语言模型 让我们复现 GPT2(124M) 让我们构建 GPT 分词器 [[1小时演讲] 大语言模型入门](
Fireship (YouTube) · RSS 摘要
OpenAI 强势回归……GPT 5.6 Sol 首发速览 Claude 绝对没有意识…… 互联网的离奇历史…… Midjourney 的新支线任务……死亡 地球上最受信赖的代码正被用 Rust 重写
AI Explained (YouTube) · RSS 摘要
模型井喷:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 对比 GPT 5.6 Sol:初步结果 Claude Fable 受阻——下一步值得关注的 11 个细节 Claude Fable 5:完整 319 页详解 新版 Claude Opus 4.8:你可能错过的 15 个…
Two Minute Papers (YouTube) · RSS 摘要
Minecraft 一直缺少一个绝妙的想法 DeepSeek 堪称疯狂的 AI 速度优化方案 他们说这根本无法实时运行 AI 正式迈入新时代 DeepSeek 攻克了 AI 的十亿美元难题
Lex Fridman (YouTube) · RSS 摘要
罗马帝国与拜占庭帝国的兴衰 | Lex Fridman 播客 #498 物理学最大的谜团:反物质、暗能量与万有理论 (ToE) Don Lincoln | Lex Fridman 播客 #497 FFmpeg:互联网视频背后令人惊叹的技术 | Lex Fridman 播客 #496 维京人、拉格纳、狂战士、英灵殿与维京…
Yannic Kilcher (YouTube) · RSS 摘要
我造了一个全自动"直男说教机" 传统圣诞节直播 传统节日直播 TiDAR: 在扩散中思考,在自回归中说话(论文解读) Titans: 在测试时学习记忆(论文解读)
3Blue1Brown (YouTube) · RSS 摘要
100 条随机弦,有多少个交点? 测量英语的熵 什么是完美编码?如何判断? Reinventing Entropy | Compression is Intelligence Part 1 随机连接端点:会形成多少个环?
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernels;AI 自动化;模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进机器人;一个 10k 规模的中国 GPU 集群;悼念人类时代的挽歌式随笔 — 我们的"间歇期"由哪些时代框定起止? Import AI 462:超级说服;自我维持的…
Microsoft Research Blog · RSS 摘要
在 SymCrypt 中验证 Rust 密码学:从标准到代码 — 加密代码为现代计算系统提供关键保护。了解一种新方法如何在开发者编写代码的同时进行验证,并保持速度与适应性…… Aurora 1.5:拓展面向天气与地球系统应用的开源基础模型 — Aurora 1.5 在 Aurora 基础模型中新增 22 个变量、逐小时…
Interconnects (Nathan Lambert) · RSS 摘要
开源模型仅剩 6 个月 — 迄今为止对开源 AI 可行性最严峻的考验正在发生。 最新开源制品(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的跨越式进步 — 我一直在密切关注的一项能力阈值。 禁…
Chip Huyen · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260714 10:12 Asia/Shanghai · 消化:20260715 21:00(第 2 次重写:v1(0714 10:12 抓取后未清洗,5 行裸稿 + 0 判断 + 0 [v1 factfix] 标注 = 新信源 Chip Huyen 第 1 例 = 714 反思 §…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为能够在所有方面超越人类的系统…… 审慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式简洁:随着模型规模扩大,训练损失 …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
从原始 ID 到语义规划:推荐系统如何规模化利用信息 — 推荐系统的演进可通过考察其如何规模化利用信息加以探究。在过去所考察的绝大部分历史时期中…… 超越主题相关性:社会相关性的概念分析及其在搜索结果与 AI 回复中的应用 — 本文探讨了"社会相关性"这一概念,该概念由 Haider 与 Sundin 提出,旨在解决传…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
面向 QANTA 2026 的任务特定多模态问答 Agent:通过置信度校准与增量推理 — 我们提交了 QANTA 2026 共享挑战赛的作品,该赛事为 ICML 2026 高效多模态问答(EMMQA)研讨会的一部分。Quanta 评估多模态 quizbowl …… 面向实时句子级手语翻译 — 多数手语理解系统作用于孤…
Gradient Flow · RSS 摘要
你的 CLI 是为人类设计的,不是为 Agent 设计的 — 开发者之间有一场友好的争论:如何为 AI Agent 提供可靠的方式使用外部工具、数据和服务,让它们能够完成超越文本生成的有用工作…… 当你的 Agent 能触及资金时会发生什么 — 订阅 • 往期内容 你的 CLI 是为人类设计的,不是为 Agent 设计…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究论文精选汇编 LLM 架构的最新进展:KV Sharing、mHC 与…
Simon Willison · RSS 摘要
以缓存友好的方式在 GitHub Actions 中使用 uvx — TIL:以缓存友好的方式在 GitHub Actions 中使用 uvx。我终于找到了一个我喜欢的、在 GitHub Actions workflow 中使用 uvx toolname 的缓存友好方案。诀窍是设置…… DOOMQL — DOOMQL。…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重置、中国开放权重模型的代码能力对等、Agent 接入真实市场,以及 Ope…
ByteByteGo · RSS 摘要
微软如何在企业级规模部署 AI Agent — 为了解在该规模部署 agent 真正需要什么,我们采访了 Marco Casalaina,微软 Core AI 产品副总裁。 EP221:Docker 底层是如何工作的 — 一个 Docker 容器从一个命令启动,但该命令需要被转换为一个正在运行的 Linux 进程。以下…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长视野任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进至强化学习…… LLM 基准的解剖 — 用于构建最有效 LLM 评估数据集的常见模式…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU 内核;AI 自动化;模拟计算 — 这是否是新世界的开端? Import AI 463:自我改进机器人;万卡中国 GPU 集群;写给人类时代的悼亡文 — 哪些时代框定了我们过渡期的两端? Import AI 462:超级说服;自我维持的 AI;通往 ASI 的路径 —…
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程:通往自我改进之路 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超级智能机器"定义为在所有领域都能超越人类…… 审慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一:其核心观察形式简洁——训练损失 $L$ 随模型…