Jay
浏览全部笔记 · 615 篇 · 工程实践 · CSDN · 开源动态
Simon Willison · RSS 摘要
sqliteutils 4.0rc2,主要由 Claude Fable 编写(花费约 149.25 美元) — 几周前我写过关于 sqliteutils 4.0rc1 发布的文章。由于我们的 Max 订阅只能再使用 Claude Fable 几天,我决定看看它能否帮… 仅用 500 字节构建世界地图 — 仅用 500 …
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能一夜之间禁用某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、微软与 OpenAI 重置、中国开源权重的编程平价、Agent 接入真实市场,以及 OpenAI 斩获 1220 亿美…
Import AI (Jack Clark) · RSS 摘要
Import AI 463:自我改进的机器人;万卡中国 GPU 集群;以及一篇悼念人类时代的挽歌式随笔 — 哪些时代首尾衔接起我们的"间歇期"? Import AI 462:超级说服;自维持 AI;通往 ASI 的路径 — 对奇点的信仰有多接近宗教信仰? Import AI 461:"对齐已偏离正轨";Frontier…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
将 Agentic Search 引入地球观测数据发现 — NASA 及其数据中心拥有数千个地球科学数据集和工具,如 Worldview、Giovanni、Science Discovery Engine 和 Harmony。但即便如此,精准定位所需资源仍然困难…… 基于矩阵分解 MDP 的候选生成规划 — 在推荐服务…
Lilian Weng (Lil'Log) · RSS 摘要
Scaling Laws,须谨慎对待 — Scaling laws 是深度学习中最关键的经验发现之一。其观测形式简洁:随着模型规模…… 的扩大,训练损失 $L$ 可预测地下降…… 我们为何思考 — 特别感谢 John Schulman 对本文的诸多宝贵反馈与直接修改。Testtime compute(Graves et…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
LACUNA:一个用于评估 LLM Unlearning 定位精度的测试平台 — LLM 会记忆敏感的训练数据,包括个人身份信息(PII),这催生了对可靠事后删除方法的迫切需求。Unlearning 应运而生…… Reasoning LLM 提升长篇电视剧中的说话人识别 — 长篇电视剧对全面视频理解构成了巨大挑战,其中…
ByteByteGo · RSS 摘要
多区域架构:走向全球而不至于破产 — 当应用在地理上扩展时,从第二个区域开始服务以改善延迟和可用性是合理的。 OpenAI 如何为 9 亿用户提供低延迟语音 AI — 在本文中,我们将详细了解整个过程以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 在本文中,我们将了…
Simon Willison · RSS 摘要
开源 AI 差距图谱 — 开源 AI 差距图谱:Current AI 是"一个致力于打造 AI 公共选项的全球合作伙伴关系",于 2025 年 2 月在巴黎 AI Action Summit 上以非营利组织身份成立,并获得…… 引用 Josh W. Comeau — 我刚刚上线了第三门课程 Whimsical Anim…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租赁实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题已不是 AI 是否安全,而是谁在掌控它。 AI 态势:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 关系重置、中国开源权重模型实现编程能力对等、Agent 走进真实市场,以及 O…
Lilian Weng (Lil'Log) · RSS 摘要
审慎看待扩展定律 — 扩展定律是深度学习中最重要的经验性发现之一。其观察形式简洁:随着模型规模的扩大,训练损失 $L$ 可预测地下降…… 我们为何思考 — 特别感谢 John Schulman 对本文提出的诸多宝贵反馈与直接修改。测试时计算(Graves et al. 2016, Ling, et al. 2017, …
Import AI (Jack Clark) · RSS 摘要
Import AI 463:自我改进机器人;一万卡中国 GPU 集群;以及一篇为人文时代谱写的挽歌式随笔 — 我们的过渡期以哪些时代作为开端与终结? Import AI 462:超级说服;自维持 AI;通往 ASI 的路径 — 对奇点的信仰在多大程度上带有宗教色彩? Import AI 461:"对齐并未步入正轨";F…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 重置、中国开源权重的代码能力追平、Agent 走入真实市场,以及 OpenAI…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
测量人类与 LLM 研究思路之间的差距 — LLM 越来越多地被用于头脑风暴研究思路,但现有评估主要根据新颖性、可行性或专家偏好来判断单个思路。我们转而提出:如何…… 状态预测分离假说 — Transformer 使用同一前向计算流来预测下一个 token 并存储对未来 token 预测有用的状态。我们形式化了状态预测…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
DiffusionGR2:Diffusion 生成式推理重排序器 — 生成式推理重排序器通过在重排候选列表前输出思维链来取得较高的推荐准确率,但推理速度较慢:自回归… 基于 Trie 的实验计划:面向高效 IR 流水线实验 — 搜索引擎通常被建模为级联流水线,其中后续阶段结合不同检索器的结果,并迭代地精化候选文档的排序…
ByteByteGo · RSS 摘要
多区域架构:走向全球而不破产 — 当应用在地理上扩展时,从第二个区域开始提供服务以改善延迟和可用性是合乎逻辑的。 OpenAI 如何为 9 亿用户提供低延迟语音 AI — 本文将详细回顾整个过程以及 OpenAI 工程团队面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将探讨研究预览所涵盖的…
Simon Willison · RSS 摘要
[[文本文本] llmcodingagent 0.1a0]( — 发布:llmcodingagent 0.1a0,又一个 Fable 5 实验。既然我的 LLM 库已经演变为更像 agent 框架的东西,是时候看看一个简单的 coding agent 会是什... 使用 DSPy 评估和改进 Datasette Age…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharin…
ByteByteGo · RSS 摘要
多区域架构:走向全球而不至于破产 — 当应用在地理范围上扩展时,从第二个区域开始提供服务以改善延迟和可用性是合乎逻辑的。 OpenAI 如何为 9 亿用户交付低延迟语音 AI — 本文将详细梳理整个过程,以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将介绍该研…
Simon Willison · RSS 摘要
llmcodingagent 0.1a0 — Release: llmcodingagent 0.1a0 — 另一个 Fable 5 实验。随着我的 LLM 库已演变为更偏向 Agent 框架,是时候看看一个简单的 coding agent 能…… 使用 DSPy 评估和改进 Datasette Agent 的 SQL…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
衡量人类与 LLM 研究思路之间的差距 — LLM 越来越多地被用于头脑风暴研究思路,但现有评估大多基于新颖性、可行性或专家偏好来评判单个思路。我们转而提出一个问题: 状态预测分离假设 — Transformer 使用相同的前向计算流来预测下一个 token 并存储对未来 token 预测有用的状态。我们形式化了\em…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
DiffusionGR2: Diffusion Generative Reasoning Reranker — 生成式推理重排序器在重排候选列表前先生成思维链,从而获得较高的推荐准确率,但推理速度较慢:自回归…… Triebased Experiment Plans for Efficient IR Pipeline …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
GR2 Technical Report — 工业推荐系统通过多阶段漏斗——召回、粗排与精排——服务数十亿用户,其中最终的重排序阶段对用户体验的影响尤为关键…… An OpenSource Tool for Reproducible Freeway Network Extraction from OpenStreetM…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
[[文本 → 文本] 内省耦合:自解释训练追踪行为变化,即使监督信号固定]( — [文本 → 文本] 何时训练语言模型(LMs)让其生成预测解释会产出忠实的内省,而非浅层模仿?我们研究了被训练去…… [[文本 → 文本] 带有元认知反馈的强化学习可激发 LLM 中忠实的置信度表达]( — [文本 → 文本] 元认知是智…
ByteByteGo · RSS 摘要
OpenAI 如何为 9 亿用户提供低延迟语音 AI — 本文将详细梳理整个实现过程,以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 本文将介绍该研究预览所涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
内容背后:Wikipedia 移动端访问量与旅游活动 — 本研究考察开放数字痕迹能否为本地旅游活动提供可解释、高频次的指标。我们论证了 Wikipedia 阅读的设备构成…… 从抽取到导航:具有间接无限深度的渐进式检索 — 现代大规模推荐检索正从静态相似度匹配转向动态物品空间导航,将检索建模为迭代的、目标驱动的图遍历过…
Simon Willison · RSS 摘要
引用 Anthropic — 我们已收到通知,商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制。我们将于明天开始恢复访问,并将分享更新…… Nano Banana 2 Lite — Nano Banana 2 Lite 也被称为 Gemini 3.1 Flash Lite Image(其 …
ByteByteGo · RSS 摘要
Thinking Machines 交互模型内部解析 — 本文将介绍该研究预览版涵盖的内容,以及 Thinking Machines 提出的交互模型概念。 AI Agent 如何管理记忆并避免遗忘 — 本文将尝试理解该架构是如何构建的——从迫使它存在的约束条件,到随之而来的各种权衡取舍。 EP220:RAG vs Gr…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
扩展视野,而非参数:借助 35B Agent 实现万亿参数级性能 — 我们提出 AgentsA1,一个 35B MixtureofExperts Agentic Model,通过扩展 agent horizon 达到万亿参数级性能。我们研究了 agenthorizon 扩展…… 模糊情境下感知不确定性的生成与决策 — …
Simon Willison · RSS 摘要
HTML 表格提取器 — 工具:HTML 表格提取器。我持续扩充的粘贴转换工具合集中又添一员。该工具接收从浏览器粘贴的富文本(包含嵌入的 HTML 表格),并进行转换…… 统计 Safari 标签页数量 — 极简 TIL:使用 AppleScript 统计 Safari 中打开的浏览器标签页数量:osascript e…