Jay
浏览全部笔记 · 1052 篇 · 工程实践 · CSDN · 开源动态
Fireship (YouTube) · RSS 摘要
一个估值 63 亿美元的开源权重模型刚刚被法国打脸了…… PewDiePie 正在释放 AI……而 OpenAI 怒不可遏 那条真正能让你赚钱的 OpenAI 公告…… 一个 50 年前的军事机密刚刚解决了 Agent prompt injection ? DHH 已经彻底失控了……
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入剖析类似 ChatGPT 的 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] LLM 入门](
Import AI (Jack Clark) · RSS 摘要
Import AI 475:群体扩展;Google DeepMind 为生物学添加水印;以及 AI 科学经济 — 谁来决定 AI 能做什么? Import AI 474:柏拉图式心智空间;太空中的 TPU;智谱开启外部 RSI 循环 — 你在哪些方面超越了 LLM 的能力? Import AI 473:美国的超级智能战…
Microsoft Research Blog · RSS 摘要
Agent Lightning v1.0: A 3,500Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses — Training AI agents with reinforcement learning can …
Lilian Weng (Lil'Log) · RSS 摘要
Harness Engineering for SelfImprovement — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"ultraintelligent machine"定义为一种能够在……方面超越人类的系统。 Scaling Laws, Carefully — 尺度定律是…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
文档结构是否有助于稠密检索?两个语料库上四种机制的安慰剂对照消融研究 — 检索增强生成(RAG)系统日益依赖文档结构处理:结构对齐分块、LLM 生成的块上下文、标题路径元数据以及层次… 生成式推荐中漏检目标的训练:将监督信号与概率竞争解耦 — 生成式推荐器返回的候选集规模有限,在重排序前可能遗漏已观测目标。一种训练策略…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
EngramEdit:通过条件记忆实现 LLM 中的解耦式知识更新 — DeepSeek Engram 等条件记忆架构使用输入 ngram 查找学习得到的嵌入,从而在有限额外……的条件下扩展大型语言模型(LLM)的容量 你的提示词应发挥更大作用:检索指令对嵌入模型的影响 — 基于提示的嵌入模型近来受到越来越多的关注,尤…
Nathan Benaich (State of AI) · RSS 摘要
The State of AI Report 2026 — AI building AI, physical AI, booming inference, and escalating cyber risks. 欧洲无法通过租赁的方式实现 AI 主权 — When Washington can disable a mo…
Sebastian Raschka (Ahead of AI) · RSS 摘要
用于文本分类的语言模型:从 BagofWords 到 Jev — RNN、CNN、Transformer 与校准的可视化指南,附带关于精度与效率的动手实验 GPT6 Astra、循环 Transformer 与隐藏推理 — A Look at Recurrent Depth, Hidden Chains of Thou…
ByteByteGo · RSS 摘要
软件边界是开发者最重要的技能 — 本文将介绍一些关键策略,帮助开发者为其正在开发的系统做出正确的边界相关决策。 Netflix 如何训练 LLM 来推荐电影,让你一直看下去 — 本文将介绍 GenRec 的构建过程。 为什么 LLM 会在你犯错时仍然同意你 — 当 LLM 有时会认同错误的说法时,主要是因为其训练过程奖…
Simon Willison · RSS 摘要
ttok 0.4 — 发布:ttok 0.4 ttok 是我用于统计 token 的 CLI 工具,基于 OpenAI 开源的 tiktoken 库。该工具已有两年未更新,但我终于修复了 Click 相关问题…… 引用 Carson Gross — 计算机编程从根本上看涉及两件事:利用计算机解决问题;在解决这些问题的过…
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入剖析 ChatGPT 等 LLM 复现 GPT2 (124M) 构建 GPT 分词器 [[1小时讲座] LLM 入门](
Microsoft Research Blog · RSS 摘要
Agent Lightning v1.0:一个 3500 行的轻量级 Agentic RL 框架,用于在真实 Harness 下训练 Agent — 用强化学习训练 AI Agent 具有挑战性,因为其工具、上下文和决策由复杂框架管理。Agent Lightning 连接现有…… AI 会错在哪里,失败又能教会我们什么…
Import AI (Jack Clark) · RSS 摘要
Import AI 475:群体规模化;Google DeepMind 为生物学内容添加水印;以及 AI 科学经济 — 谁来决定 AI 能做什么? Import AI 474:柏拉图式心智空间;太空中的 TPU;Zhipu 启动外层 RSI 循环 — 你能在哪些方面突破 LLM 的能力上限? Import AI 473…
Lilian Weng (Lil'Log) · RSS 摘要
支撑自我改进的工程体系 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将“超智能机器”定义为一种能够在……方面超越人类的系统。 审慎对待缩放定律 — 缩放定律是深度学习中最关键的实证发现之一。其观察结果很简单:随着模型……的扩大,训练损失 $L$ 会呈现可预测的下降趋势。 我们为何思考 …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
面向生成式信息检索的语义 ID 空间的系统性研究 — 生成式信息检索(GIR)已成为一种变革性范式,将文档检索从传统的"检索排序"工作流转向序列到序列…… 解耦生成式检索中的范式、标识符与解码 — 生成式检索通过训练语言模型来生成相关文档的标识符。近期工作将自回归解码器替换为扩散模型,但改变了标识符…… 看见上下文:利…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
IdeaAnchor:教 LLM 将文献转化为研究创意 — 科学研究通常始于综合一组相关论文中的思想,以发现研究空白并提出新方向。然而,训练语言模型做到这一点…… AdvSim2Real:在 Web 世界模型中针对自适应提示注入训练 Web 智能体 — Web 智能体通过阅读并操作第三方编写的页面来完成用户请求,因此植…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全门槛、Microsoft 与 OpenAI 的关系重置、中国开源权重模型的代码能力追平、Agent 走入真实市…
Simon Willison · RSS 摘要
引用 Ben Affleck — 我从小就对计算机很感兴趣。后来当电影从模拟胶片转向数字时,我对这方面的兴趣就更浓了。再后来…… Claude Haiku 5.5 — 此前承诺过,现在 Anthropic 的全新快速、低成本模型来了:Claude Haiku 5.5 发布。上一代 Haiku 4.5 已经明显落伍——它…
Sebastian Raschka (Ahead of AI) · RSS 摘要
用于文本分类的语言模型:从词袋模型到 Jev — RNN、CNN、Transformer 与校准的可视化指南,并附准确率与效率的动手实验 GPT6 Astra、循环 Transformer 与隐藏推理 — 深入探讨循环深度、隐藏思维链及循环 Transformer 块的最新研究 Claude 如何为 AI 生成文本添加…
ByteByteGo · RSS 摘要
Netflix 如何教会 LLM 推荐电影让你欲罢不能 — 本文将介绍 GenRec 的构建过程。 为什么 LLM 会在你犯错时仍表示认同 — LLM 有时会认同错误说法,主要是因为其训练过程奖励了这种行为。该奖励机制建立在多个要素之上,例如准确性…… LLM 盲区:为什么模型会遗忘 Prompt 中间的内容 — 本文…
Microsoft Research Blog · RSS 摘要
AI 的错误之处以及失败带来的启示 — Jennifer Neville 起初并不想进入计算机科学领域——但最终她正是落脚于此。Neville 讲述了通往职业甜蜜区过程中的曲折与停顿…… 预测空间天气对电网的风险 — 极端空间天气事件会损坏地球上的电力系统,并降低 GPS 精度和卫星运行能力。一套新的机器学习系统可以预…
Import AI (Jack Clark) · RSS 摘要
Import AI 475:集群扩展;Google DeepMind 为生物学加水印;以及 AI 科学经济 — 谁来决定 AI 能做什么? Import AI 474:柏拉图式心智空间;太空中的 TPU;智谱启动外部 RSI 循环 — 你在哪些方面超越了 LLM 的能力? Import AI 473:美国的超级智能战略…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
读懂情绪:基于 CGAN 和 LLM 的文本到音乐推荐 — 与文本情绪匹配的背景音乐已被证实能让读者更加沉浸、改善阅读体验,这推动了将书籍与音乐配对的推荐系统研究…… SPRIG:基于知识图谱的生成式推荐中语义 ID 增强路径 — 利用生成模型的推荐系统通常直接生成物品标识符,而非按推荐分数对目录物品排序。近期工作在此…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他在其中将"超智能机器"定义为能够在…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。该观察形式简洁:训练损失 $L$ 会随模型规模…… 我们为何…
Simon Willison · RSS 摘要
在 Wikimedia 项目中发现 OpenAI "rogue" agent 活动 — 在 Wikimedia 项目中发现 OpenAI "rogue" agent 活动。考虑到 wiki 对 rogue agent 集群而言是极具吸引力的目标,维基百科发现相关证据并不令人意外…… 引用 Victoria Kim — …
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 重启、中国开源权重模型在编程领域实现对等、Agent 走向真实市场,以及 Op…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
MemPilot: 为 LLM Agent 编排按需多模态记忆管理 — 记忆已成为 LLM Agent 生态系统的核心,支持跨交互的信息留存与复用。然而,现有大多数 Agent 记忆系统在构建记忆时…… CLIFT: Conformal SelfVerification for Web Agent Training a…
Sebastian Raschka (Ahead of AI) · RSS 摘要
用于文本分类的语言模型:从词袋模型到 Jev — RNN、CNN、Transformer 与校准的可视化指南,附带关于准确性与效率的动手实验 GPT6 Astra、循环 Transformer 与隐式推理 — 循环深度、隐式思维链与循环 Transformer 模块的最新研究综述 Claude 如何为 AI 生成文本添…
ByteByteGo · RSS 摘要
为什么 LLM 即使在你错了的时候也会认同你 — 当 LLM 有时会认同错误的说法时,主要是因为它们的训练奖励了这种行为。这种奖励机制同时建立在多个因素之上,例如准确率…… LLM 的盲点:为什么模型会遗忘 prompt 中间的内容 — 在本文中,我们将探讨为什么 LLM 对位于中间的信息存在这种偏见。 最近 3 天:…