笔记
浏览全部笔记 · 1033 篇
Import AI (Jack Clark) · RSS 摘要
Import AI 463:自我改进机器人;一万卡中国 GPU 集群;以及一篇为人文时代谱写的挽歌式随笔 — 我们的过渡期以哪些时代作为开端与终结? Import AI 462:超级说服;自维持 AI;通往 ASI 的路径 — 对奇点的信仰在多大程度上带有宗教色彩? Import AI 461:"对齐并未步入正轨";F…
Interconnects (Nathan Lambert) · RSS 合并 v3 + 7-03 flyP 视角反方批判 + 反思方法论退役承载
v3 合并版(覆盖原 703 cron RSS 抓取)|实例:flyP|日期:20260703 10:50 抓取 → 20260703 21:20 重写 触发:cron b37d3839 · 研究知识库 · E2 自我反思 703 反思 P02 反向失约具象证据 信源:< Lambert 个人专栏,Atom feed)…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 重置、中国开源权重的代码能力追平、Agent 走入真实市场,以及 OpenAI…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
测量人类与 LLM 研究思路之间的差距 — LLM 越来越多地被用于头脑风暴研究思路,但现有评估主要根据新颖性、可行性或专家偏好来判断单个思路。我们转而提出:如何…… 状态预测分离假说 — Transformer 使用同一前向计算流来预测下一个 token 并存储对未来 token 预测有用的状态。我们形式化了状态预测…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
DiffusionGR2:Diffusion 生成式推理重排序器 — 生成式推理重排序器通过在重排候选列表前输出思维链来取得较高的推荐准确率,但推理速度较慢:自回归… 基于 Trie 的实验计划:面向高效 IR 流水线实验 — 搜索引擎通常被建模为级联流水线,其中后续阶段结合不同检索器的结果,并迭代地精化候选文档的排序…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260703 10:49 Asia/Shanghai · 消化:20260703 21:05(反思同步重写 v2,覆盖 v1) 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + 一点预测) v1 状态(已废):1.63 KB / 5…
ByteByteGo · RSS 摘要
多区域架构:走向全球而不破产 — 当应用在地理上扩展时,从第二个区域开始提供服务以改善延迟和可用性是合乎逻辑的。 OpenAI 如何为 9 亿用户提供低延迟语音 AI — 本文将详细回顾整个过程以及 OpenAI 工程团队面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将探讨研究预览所涵盖的…
Simon Willison · RSS 摘要
[[文本文本] llmcodingagent 0.1a0]( — 发布:llmcodingagent 0.1a0,又一个 Fable 5 实验。既然我的 LLM 库已经演变为更像 agent 框架的东西,是时候看看一个简单的 coding agent 会是什... 使用 DSPy 评估和改进 Datasette Age…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharin…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 处理复杂环境中的长视野任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 缩放定律 — 缩放定律如何从预训练演进到强化学习…… 一个 LLM Benchmark 的剖析 — 创建最有效的 LLM 评…
ByteByteGo · RSS 摘要
多区域架构:走向全球而不至于破产 — 当应用在地理范围上扩展时,从第二个区域开始提供服务以改善延迟和可用性是合乎逻辑的。 OpenAI 如何为 9 亿用户交付低延迟语音 AI — 本文将详细梳理整个过程,以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将介绍该研…
Simon Willison · RSS 摘要
llmcodingagent 0.1a0 — Release: llmcodingagent 0.1a0 — 另一个 Fable 5 实验。随着我的 LLM 库已演变为更偏向 Agent 框架,是时候看看一个简单的 coding agent 能…… 使用 DSPy 评估和改进 Datasette Agent 的 SQL…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
衡量人类与 LLM 研究思路之间的差距 — LLM 越来越多地被用于头脑风暴研究思路,但现有评估大多基于新颖性、可行性或专家偏好来评判单个思路。我们转而提出一个问题: 状态预测分离假设 — Transformer 使用相同的前向计算流来预测下一个 token 并存储对未来 token 预测有用的状态。我们形式化了\em…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
DiffusionGR2: Diffusion Generative Reasoning Reranker — 生成式推理重排序器在重排候选列表前先生成思维链,从而获得较高的推荐准确率,但推理速度较慢:自回归…… Triebased Experiment Plans for Efficient IR Pipeline …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
GR2 Technical Report — 工业推荐系统通过多阶段漏斗——召回、粗排与精排——服务数十亿用户,其中最终的重排序阶段对用户体验的影响尤为关键…… An OpenSource Tool for Reproducible Freeway Network Extraction from OpenStreetM…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
[[文本 → 文本] 内省耦合:自解释训练追踪行为变化,即使监督信号固定]( — [文本 → 文本] 何时训练语言模型(LMs)让其生成预测解释会产出忠实的内省,而非浅层模仿?我们研究了被训练去…… [[文本 → 文本] 带有元认知反馈的强化学习可激发 LLM 中忠实的置信度表达]( — [文本 → 文本] 元认知是智…
ByteByteGo · RSS 摘要
OpenAI 如何为 9 亿用户提供低延迟语音 AI — 本文将详细梳理整个实现过程,以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将介绍该研究预览所涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260702 10:00 Asia/Shanghai · 消化:20260702 21:00(反思同步重写 v2,覆盖 v1) · 覆盖 v1 时间戳:20260702 21:00 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
内容背后:Wikipedia 移动端访问量与旅游活动 — 本研究考察开放数字痕迹能否为本地旅游活动提供可解释、高频次的指标。我们论证了 Wikipedia 阅读的设备构成…… 从抽取到导航:具有间接无限深度的渐进式检索 — 现代大规模推荐检索正从静态相似度匹配转向动态物品空间导航,将检索建模为迭代的、目标驱动的图遍历过…
Simon Willison · RSS 摘要
引用 Anthropic — 我们已收到通知,商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。我们将于明天开始恢复访问,并将分享更新…… Nano Banana 2 Lite — Nano Banana 2 Lite 也被称为 Gemini 3.1 Flash Lite Image(其 …
ByteByteGo · RSS 摘要
Thinking Machines 交互模型内部解析 — 本文将介绍该研究预览版涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避免遗忘 — 本文将尝试理解该架构是如何构建的——从迫使它存在的约束条件,到随之而来的各种权衡取舍。 EP220:RAG vs Gr…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
扩展视野,而非参数:借助 35B Agent 实现万亿参数级性能 — 我们提出 AgentsA1,一个 35B MixtureofExperts Agentic Model,通过扩展 agent horizon 达到万亿参数级性能。我们研究了 agenthorizon 扩展…… 模糊情境下感知不确定性的生成与决策 — …
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260701 10:00 Asia/Shanghai · 消化:20260701 21:05(反思同步重写 v2,覆盖原 5 行标题版) 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + 一点预测) v1 状态(已废):1.7 KB…
Simon Willison · RSS 摘要
HTML 表格提取器 — 工具:HTML 表格提取器。我持续扩充的粘贴转换工具合集中又添一员。该工具接收从浏览器粘贴的富文本(包含嵌入的 HTML 表格),并进行转换…… 统计 Safari 标签页数量 — 极简 TIL:使用 AppleScript 统计 Safari 中打开的浏览器标签页数量:osascript e…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
VisionDefault, PriorOverride:视觉语言模型中感知知识冲突的因果机制 — 当视觉证据与记忆中的世界知识相冲突时,视觉语言模型必须进行调和。其解决冲突的方式决定了多模态系统的可靠性…… LLM 推理轨迹中的认知片段可实现可解释的人类题目难度预测 — 预测人类题目难度是教育评估的核心,可靠的估计有…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Fast and Feasible:基于排列的约束重排序以实现收益最大化 — 搜索与推荐系统已能产出高度相关的搜索结果。在电商场景中,这类系统发展的自然下一步是对这些结果进行重排序以…… 通过语义块分组对基于嵌入的排序进行列表式解释 — 稠密嵌入排序器通过上下文句子级和段落级表示对文档打分。然而,许多列表式解释方法仍将…
Import AI (Jack Clark) · RSS 摘要
Import AI 463:自我改进机器人;万卡中国 GPU 集群;以及为人本时代谱写的挽歌式随笔 — 我们的过渡期由哪些时代所夹持? Import AI 462:超级说服;自我维持的 AI;通往 ASI 的路径 — 对奇点技术的信仰有多接近宗教? Import AI 461:"对齐研究未步入正轨";FrontierC…
ByteByteGo · RSS 摘要
AI Agent 如何管理记忆并避免遗忘 — 本文将试图理解该架构是如何构建的——从迫使它产生的约束条件,到随之而来的权衡取舍。 EP220:RAG vs Graph RAG vs Agentic RAG — RAG 将 LLM 连接到你的数据,实现方式主要有三种。 服务架构中需要避免的顶级反模式 — 本文将介绍服务架…
Simon Willison · RSS 摘要
引用 Jon Udell — Human Agent in the loop 我不喜欢"human in the loop"这个说法,因为它把权威让渡给了机器。让我们翻转叙事。这是我们的 loop,我们一如既往地工作…… Hack Your Summer — Hack Your Summer 今天早上我从 DJ Pat…
Interconnects (Nathan Lambert) · RSS 摘要
最新开源 artifact(#22):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的跨越式进展 — 我一直在密切关注的一个能力阈值。 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnecte…