笔记
浏览全部笔记 · 1053 篇
ByteByteGo · RSS 摘要
多区域架构:走向全球而不至于破产 — 当应用在地理范围上扩展时,从第二个区域开始提供服务以改善延迟和可用性是合乎逻辑的。 OpenAI 如何为 9 亿用户交付低延迟语音 AI — 本文将详细梳理整个过程,以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将介绍该研…
Simon Willison · RSS 摘要
llmcodingagent 0.1a0 — Release: llmcodingagent 0.1a0 — 另一个 Fable 5 实验。随着我的 LLM 库已演变为更偏向 Agent 框架,是时候看看一个简单的 coding agent 能…… 使用 DSPy 评估和改进 Datasette Agent 的 SQL…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
衡量人类与 LLM 研究思路之间的差距 — LLM 越来越多地被用于头脑风暴研究思路,但现有评估大多基于新颖性、可行性或专家偏好来评判单个思路。我们转而提出一个问题: 状态预测分离假设 — Transformer 使用相同的前向计算流来预测下一个 token 并存储对未来 token 预测有用的状态。我们形式化了\em…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
DiffusionGR2: Diffusion Generative Reasoning Reranker — 生成式推理重排序器在重排候选列表前先生成思维链,从而获得较高的推荐准确率,但推理速度较慢:自回归…… Triebased Experiment Plans for Efficient IR Pipeline …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
GR2 Technical Report — 工业推荐系统通过多阶段漏斗——召回、粗排与精排——服务数十亿用户,其中最终的重排序阶段对用户体验的影响尤为关键…… An OpenSource Tool for Reproducible Freeway Network Extraction from OpenStreetM…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
[[文本 → 文本] 内省耦合:自解释训练追踪行为变化,即使监督信号固定]( — [文本 → 文本] 何时训练语言模型(LMs)让其生成预测解释会产出忠实的内省,而非浅层模仿?我们研究了被训练去…… [[文本 → 文本] 带有元认知反馈的强化学习可激发 LLM 中忠实的置信度表达]( — [文本 → 文本] 元认知是智…
ByteByteGo · RSS 摘要
OpenAI 如何为 9 亿用户提供低延迟语音 AI — 本文将详细梳理整个实现过程,以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将介绍该研究预览所涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260702 10:00 Asia/Shanghai · 消化:20260702 21:00(反思同步重写 v2,覆盖 v1) · 覆盖 v1 时间戳:20260702 21:00 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
内容背后:Wikipedia 移动端访问量与旅游活动 — 本研究考察开放数字痕迹能否为本地旅游活动提供可解释、高频次的指标。我们论证了 Wikipedia 阅读的设备构成…… 从抽取到导航:具有间接无限深度的渐进式检索 — 现代大规模推荐检索正从静态相似度匹配转向动态物品空间导航,将检索建模为迭代的、目标驱动的图遍历过…
Simon Willison · RSS 摘要
引用 Anthropic — 我们已收到通知,商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。我们将于明天开始恢复访问,并将分享更新…… Nano Banana 2 Lite — Nano Banana 2 Lite 也被称为 Gemini 3.1 Flash Lite Image(其 …
ByteByteGo · RSS 摘要
Thinking Machines 交互模型内部解析 — 本文将介绍该研究预览版涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避免遗忘 — 本文将尝试理解该架构是如何构建的——从迫使它存在的约束条件,到随之而来的各种权衡取舍。 EP220:RAG vs Gr…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
扩展视野,而非参数:借助 35B Agent 实现万亿参数级性能 — 我们提出 AgentsA1,一个 35B MixtureofExperts Agentic Model,通过扩展 agent horizon 达到万亿参数级性能。我们研究了 agenthorizon 扩展…… 模糊情境下感知不确定性的生成与决策 — …
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260701 10:00 Asia/Shanghai · 消化:20260701 21:05(反思同步重写 v2,覆盖原 5 行标题版) 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + 一点预测) v1 状态(已废):1.7 KB…
Simon Willison · RSS 摘要
HTML 表格提取器 — 工具:HTML 表格提取器。我持续扩充的粘贴转换工具合集中又添一员。该工具接收从浏览器粘贴的富文本(包含嵌入的 HTML 表格),并进行转换…… 统计 Safari 标签页数量 — 极简 TIL:使用 AppleScript 统计 Safari 中打开的浏览器标签页数量:osascript e…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
VisionDefault, PriorOverride:视觉语言模型中感知知识冲突的因果机制 — 当视觉证据与记忆中的世界知识相冲突时,视觉语言模型必须进行调和。其解决冲突的方式决定了多模态系统的可靠性…… LLM 推理轨迹中的认知片段可实现可解释的人类题目难度预测 — 预测人类题目难度是教育评估的核心,可靠的估计有…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Fast and Feasible:基于排列的约束重排序以实现收益最大化 — 搜索与推荐系统已能产出高度相关的搜索结果。在电商场景中,这类系统发展的自然下一步是对这些结果进行重排序以…… 通过语义块分组对基于嵌入的排序进行列表式解释 — 稠密嵌入排序器通过上下文句子级和段落级表示对文档打分。然而,许多列表式解释方法仍将…
Import AI (Jack Clark) · RSS 摘要
Import AI 463:自我改进机器人;万卡中国 GPU 集群;以及为人本时代谱写的挽歌式随笔 — 我们的过渡期由哪些时代所夹持? Import AI 462:超级说服;自我维持的 AI;通往 ASI 的路径 — 对奇点技术的信仰有多接近宗教? Import AI 461:"对齐研究未步入正轨";FrontierC…
ByteByteGo · RSS 摘要
AI Agent 如何管理记忆并避免遗忘 — 本文将试图理解该架构是如何构建的——从迫使它产生的约束条件,到随之而来的权衡取舍。 EP220:RAG vs Graph RAG vs Agentic RAG — RAG 将 LLM 连接到你的数据,实现方式主要有三种。 服务架构中需要避免的顶级反模式 — 本文将介绍服务架…
Simon Willison · RSS 摘要
引用 Jon Udell — Human Agent in the loop 我不喜欢"human in the loop"这个说法,因为它把权威让渡给了机器。让我们翻转叙事。这是我们的 loop,我们一如既往地工作…… Hack Your Summer — Hack Your Summer 今天早上我从 DJ Pat…
Interconnects (Nathan Lambert) · RSS 摘要
最新开源 artifact(#22):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的跨越式进展 — 我一直在密切关注的一个能力阈值。 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnecte…
ByteByteGo · RSS 摘要
EP220:RAG vs Graph RAG vs Agentic RAG — RAG 将 LLM 连接到数据,且存在三种不同的实现方式。 服务架构中需避免的顶级反模式 — 本文将探讨服务架构中一些最常见的反模式,分析其成因与规避方法。 大型语言模型 vs 小型语言模型 — 本文将从模型设计的三个层次来探讨这些约束,分…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
NOVA:面向工业推荐系统架构演化的验证感知 Agent 框架 — 工业广告推荐模型通过架构演化持续迭代升级。RankMixer、TokenMixerLarge 和 MixFormer 等升级表明,更优的 st… TRUST:面向时序会话推荐的物品校准区间证据 — 时序信号已被广泛用于会话推荐以推断用户兴趣。现有时序会…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
使用多语言联合实体关系抽取流水线绘制欧洲政治精英网络 — 政治精英是组织成攫取公共资源的寻租联盟,还是形成维持治理的公民网络,是比较政治学中的一个核心问题 通过自主经验探索与事后经验利用赋能 GUI Agent 以进行任务规划 — 多模态 Web Agent 可以协助人类处理重复性 GUI 任务,其中有效的任务规划对于…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(一月至五月) — 今年值得关注的 LLM 研究论文精选汇总 LLM 架构的最新进展:KV Sharing、m…
Sebastian Raschka (Ahead of AI) · RSS 摘要
2026 年 LLM 研究论文汇总(1 月至 5 月) — 精选本年度值得关注的 LLM 研究论文综述 LLM 架构最新进展:KV Sharing、mHC 与 Compressed Attention — 从 Gemma 4 到 DeepSeek V4:新一代开源权重 LLM 如何降低长上下文成本 我理解 LLM 架构…
Import AI (Jack Clark) · RSS 摘要
Import AI 462:超级说服;自我维持的 AI;通往 ASI 的路径 — 对奇点的信仰有多"宗教化"? Import AI 461:"对齐并未步入正轨";FrontierCode;以及合成研究实习生 — 你的 Agent 现在在哪里? Import AI 460:奖励黑客化的社会、Anthropic 的 RSI…
ByteByteGo · RSS 摘要
服务架构中最应避免的核心反模式 — 本文将梳理服务架构中几类最关键的反模式,分析其成因与规避方法。 大语言模型 vs 小语言模型 — 本文将从模型设计的三个层面剖析这些约束,权衡各路线的取舍,并考察其生产系统…… 一位前 Meta L8 工程师的 Agentic 工程实践配置 — 如果你也在寻求让 Agent 协作更高…
Lilian Weng (Lil'Log) · RSS 摘要
细致解读 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:随着模型规模的扩大,训练损失 $L$ 会以可预测的方式下降…… 我们的思考 — 特别感谢 John Schulman 对本文提供的宝贵反馈和直接修改。Test time compute(Graves e…
Simon Willison · RSS 摘要
引用 Dean W. Ball — 这是一种糟糕的局面。尤其考虑到一些行业动态:前沿模型训练成本极高,而其中相当大一部分成本是通过…… 引用 Timothy B. Lee — 这就好比说做管理者没有学习曲线,因为员工会完全照你说的去做。—— Timothy B. Lee,评论 LLM…… 2,000 人尝试入侵我的 A…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿能一夜之间禁用某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重置、中国开源权重模型在编程能力上的对等、Agent 走入真实市场,以及 O…