笔记
浏览全部笔记 · 1033 篇
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Scientific ClaimSource Retrieval Revisited: A Comparative Study of Style Transfer and ReRanking — 社交媒体上分享的科学声明往往难以核实,可能助长错误信息传播。为应对这一挑战,自动化事实核查系统…… What Do Chin…
Interconnects (Nathan Lambert) · RSS 摘要
Kimi K3:开源权重的升级 — 对 AI 生态系统的全球性影响 开源模型的 6 个月生存期 — 开源 AI 可行性迄今最严峻的考验正在发生 最新开源成果(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态广度 — 对开源生态的评估以及发布模型背后的动机 GLM5.2:开源 Agent 的…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这是一份简要笔记,列举了一些最常见的陷阱示例…… Agent — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 合著的经典著作《Artificial Int…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用方式实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,核心问题不再是 AI 是否安全,而是谁来掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 关系重置、中国开源权重模型实现代码能力对等、Agent …
Simon Willison · RSS 摘要
逆向工程现在成本很低 — 我不断听到有人用 coding agent 对家中设备进行逆向工程并实现自动化的案例。我认为这是一个有趣的例证,展示了 t… 的影响 谁在害怕中国模型? — 谁在害怕中国模型?Ben Thompson 提出了一个有趣的方案,既指出了实验室一边在未授权数据上训练、一边禁止针对其模型进行蒸馏的虚伪…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证 — 多模态科学声明验证(MSCV)要求模型利用论文中视觉锚定的证据来验证科学声明,包括图、表格、图表及文本…… 语言编码的率效用前沿:在受控语言内容下对比 token、字节与像素 — 语言模型将文本编码为子词 token、原始字节或渲染像素,但这些编码…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260721 10:01 Asia/Shanghai · 消化:20260721 21:00(第 2 次重写:v1(0721 10:01 抓取后未清洗,5 行裸稿 + 0 判断 + 0 [v1 factfix] 标注 = 第 21 次 v1 风格复发 + 5 行裸稿第 1 条 = "…
ByteByteGo · RSS 摘要
MCP vs A2A vs ACP:AI Agent 之间是如何实际通信的 — Agent 本身已具备能力,与工具及其他 Agent 结合后,其能力会进一步叠加放大。 多租户架构指南:优势与挑战 — 本文将从基础出发,理解多租户架构及其各项优势与挑战。 大规模 AI 客服:旅游业的十亿美元豪赌 — 本文将沿客服流程从第…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 中的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅之外的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
智能体世界模型 — 通过教会语言智能体建模其环境来构建更好的语言智能体 智能体强化学习:框架与最佳实践 — 如何训练 LLM 处理复杂环境中的长视野任务 智能体评估:详细指南 — 有效评估 AI 智能体的最佳实践与常见模式 LLM 的强化学习缩放定律 — 缩放定律如何从预训练演进到强化学习 LLM 基准测试解析 — 构…
Fireship (YouTube) · RSS 摘要
OpenAI 再陷剽窃诉讼…… 史上最具争议的重写已发布…… OpenAI 强势回归——GPT 5.6 Sol 首发速览 Claude 绝对没有意识…… 互联网的离奇历史……
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深度剖析像 ChatGPT 这样的 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
AI Explained (YouTube) · RSS 摘要
模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 对比 GPT 5.6 Sol:早期结果 Claude Fable 被封锁——关于下一步的 11 个低调细节 Claude Fable 5——全 319 页详解 新版 Claude Opus 4.8:你可能错过的 15…
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一台全自动 mansplainer(居高临下说教生成器) 传统圣诞直播 传统节日直播 TiDAR:在 Diffusion 中思考,在 Autoregression 中表达(论文解读) Titans:在测试时学习记忆(论文解读)
Lex Fridman (YouTube) · RSS 摘要
罗马帝国与拜占庭帝国的兴衰 | Lex Fridman Podcast #498 物理学最大的谜团:反物质、暗能量与 ToE | Lex Fridman Podcast #497 FFmpeg:互联网视频背后的不可思议技术 | Lex Fridman Podcast #496 维京人、拉格纳、狂战士、英灵殿与维京时代的…
3Blue1Brown (YouTube) · RSS 摘要
什么是交叉熵?| 压缩即智能 第2部分 100 条随机弦,有多少个交点? 测量英语的熵 何为完美编码?如何确认? 重新发明熵 | 压缩即智能 第1部分
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernels;AI 自动化;模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进的机器人;一万卡中国 GPU 集群;为人类时代谱写的挽歌式随笔 — 哪些时代为我们的过渡期划定起止? Import AI 462:超级说服;自我维持的 AI;通往 …
Microsoft Research Blog · RSS 摘要
在 SymCrypt 中验证 Rust 密码学:从标准到代码 — 密码学代码为现代计算系统提供关键保护。了解一种新方法如何在开发人员编写代码时验证代码,同时保持速度与适应性…… Aurora 1.5:扩展面向天气与地球系统应用的开源基础模型 — Aurora 1.5 为 Aurora 基础模型新增 22 个变量、小时级…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Partition、Prompt、Aggregate:语言模型中的统计自一致性 — 上下文学习通常被解释为一种条件推断形式,其中 prompt 指定一个上下文,模型的输出被视为对相应... SciDiagramEdit:从论文修订中学习编辑科学图表 — 编辑研究论文中的图表是日常科研中一项常规且耗时的环节:作者会重新标…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Bridge Evidence:静态检索效用无法预测多步 Agentic Search 中的因果效用 — 检索系统在训练与评估时基于一种静态的"有用性"观念:将文档与问题交给 reader 模型,观察答案是否改善,并对文档进行打分…… CoSimRec:衡量推荐系统反馈循环中协调内容的渗透程度 — 推荐系统越来越深刻地…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超级智能机器"定义为一种能够在所有方面超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。该观察形式简洁:随着模型规模的扩大,训…
Interconnects (Nathan Lambert) · RSS 摘要
开源模型只剩 6 个月寿命 — 迄今为止对开源 AI 生存能力最严峻的考验正在发生。 最新开源成果(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的跨越式进步 — 我一直在密切观察的一项能力阈值…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于基于基础模型构建应用的早期阶段,犯错在所难免。这份简短的笔记列举了一些最常见陷阱的示例…… Agent — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 合著的经典著作《Artificial Intel…
Gradient Flow · RSS 摘要
初创公司让我看到 AI 基础设施的下一层 — 前段时间我写过团队如何用强化学习(RL)让 Agent 更可靠。此后我不断遇到一些初创公司,RL 在它们那里不再是研究注脚…… 25+ 家初创公司都在补同一块拼图 — 订阅 • 往期内容 初创公司让我看到 AI 基础设施的下一层 前段时间我写过团队如何用强化学习(RL)让……
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁在控制它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 的关系重置、中国在开放权重编程上实现对等、Agent 走进真实市…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理力度 — LLM 如何学习低、中、高力度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的…
ByteByteGo · RSS 摘要
MCP vs A2A vs ACP:AI Agent 之间实际如何通信 — Agent 本身就具备能力。结合工具和其他 Agent 后,其能力会复利式增长。 多租户架构指南:优势与挑战 — 本文将从基础出发理解多租户架构,并介绍其各项优势与挑战。 大规模 AI 客服:旅游业的数十亿美元押注 — 本文将沿着客服流水线从第…
Simon Willison · RSS 摘要
AI 狂热正在削弱全球决策能力 — AI 狂热正在削弱全球决策能力。本文呈现了 Nik Suresh 的一个有趣视角,讲述 AI 热潮如何压垮他所咨询的大公司。 Claude Code 现已使用 Rust 编写的 Bun — 在《Rewriting Bun in Rust》中,Jarred Sumner 声称:Clau…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长时程任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习…… LLM Benchmark 的结构剖析 — 用于构建最有效 LLM …
Fireship (YouTube) · RSS 摘要
OpenAI 因剽窃再次被起诉… 史上最具争议的重写刚刚发布... OpenAI 强势回归…GPT 5.6 Sol 首发体验 Claude 绝对没有意识… 互联网的离奇历史…