笔记
浏览全部笔记 · 1033 篇
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何在复杂环境中训练以处理长视野任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL Scaling Laws — Scaling Laws 如何从预训练演进至强化学习…… LLM Benchmark 解构 —…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
UniClawBench: 面向真实任务主动型 Agent 的通用基准 — 大语言模型和多模态大语言模型的快速发展,加速了能够操作日常工具并协助用户的主动型 Agent 的出现 LLM 作为数据标注者的有效性:AMALIA 在权威性方面的研究 — 国家语言模型为语言社区提供了衡量其公民所言所值的自有工具。葡萄牙的 AM…
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程与自我提升 — 递归自我提升(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能够在所有智力活动上超越人类的系统…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最重要的经验发现之一。其观察形式简洁:训练损失 $L$ 随着模型规模的…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
通过模型合并提升对话式信息检索中的即席搜索效果 — 对话式信息检索具有挑战性,因为它需要考虑对话历史,而对话历史可能会引发话题漂移和指代消解问题…… LogInsight:通过神经符号日志分析自动化微服务故障诊断 — 在大规模微服务系统中诊断生产故障对 SRE 而言具有强时效性要求。在我们的部署环境中,单个 30 分钟…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;以及模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进机器人;一个 10k 规模的中国 GPU 集群;以及人类时代的挽歌式随笔 — 哪些时代夹峙着我们的过渡期? Import AI 462:超级说服;自我维持的 AI…
Interconnects (Nathan Lambert) · RSS 摘要
最新开源成果(第22期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机分析 GLM5.2 是开源 Agent 的跨越式进步 — 一个我一直在密切关注的能力阈值。 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 …
Simon Willison · RSS 摘要
引用 Nilay Patel — 引用 Nilay Patel 现实情况是,要制造增强现实眼镜,你需要在眼睛旁边放置一个持续记录你所见一切并对其进行处理以提供信息的摄像头…… — 引用 OpenAI [[...] Web 和移动端的工作在云端运行。桌面应用中的工作也可以在你的授权下使用本地文件和桌面应用。发布时,云端 …
ByteByteGo · RSS 摘要
报名最后机会:成为 AI 工程师 第 7 期 — 我们的"成为 AI 工程师"第 7 期将于明天(7 月 11 日星期六)开课。这是一门与畅销书作者 Ali Aminian 合作开设的实时、小班制课程…… 流式 vs 批处理:数据处理的两种理念 — 数据达到何种程度才算"足够完整",可以进入计算阶段? Agent 循环…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地编码 Agent — 在本地编码工具链中使用开放权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(一月至五月) — 本年度值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing、mHC 与 Compressed Attentio…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能在一夜之间禁用模型时,问题已不在于 AI 是否安全,而在于由谁掌控。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 网络安全阈值、微软与 OpenAI 重置、中国开放权重模型编程能力追平、Agent 接入真实市场,以及 OpenAI 获 1220 …
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长程任务... Agent 评估:详尽指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的强化学习 Scaling Laws — Scaling Laws 如何从预训练演进到强化学习... LLM 基准测试解析 — 用…
Gradient Flow · RSS 摘要
你的 CLI 是为人类设计的,而不是为 Agent 设计的 — 开发者之间存在一场友好的争论:如何为 AI Agent 提供可靠的方式,让它们能使用外部工具、数据和服务,从而完成超越文本生成的有用工作。 当你的 Agent 能够触及资金时,会发生什么 — 订阅 • 往期内容 你的 CLI 是为人类设计的,而不是为 Ag…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU 内核;AI 自动化;以及模拟计算 — 这会是一个新世界的开端吗? Import AI 463:自我改进机器人;万卡中国 GPU 集群;以及一篇悼念人类时代的挽歌 — 哪些时代构成我们过渡期的首尾? Import AI 462:超级说服;自我维持的 AI;通往 ASI…
Interconnects (Nathan Lambert) · RSS 摘要
最新开放制品(#22):Zyphra、Cohere 和 Poolside 正在扩展生态系统的广度 — 对开放生态及发布模型动机的评估 GLM5.2 是开放 Agent 的跨越式进步 — 一个我一直在密切关注的 capability threshold 禁止开源 AI 将是一个错误 — 本文最初是与 Interconne…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
可解释的不确定性用于问答中的自适应检索与推理 — 大语言模型(LLM)在问答(QA)任务中表现强劲,但仍易产生幻觉且透明度有限。检索增强…… 动作的粒度:为社会史绘制来源图谱 — 本工作论文描述了一条流水线,将历史资料转化为围绕"以前置动作作为基本且构成性的单元"这一原则组织的结构化数据…… 看见与反思:面向推荐的多模…
Lilian Weng (Lil'Log) · RSS 摘要
用于自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可以追溯到 I. J. Good(1965),他将"超智能机器"定义为能在所有方面超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:随着模型规模的扩大,训练损失 …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
通过深度原生结构推理实现准确、跨学科且透明的结构性质理解 — 结构性质关系是生物学、化学和材料科学的基础,其中功能、反应性和物理响应源自空间、化学以及 p… CoLMLM:连续查询有限记忆语言模型 — 有限记忆语言模型(LMLMs)在预训练阶段将事实性知识外化至知识库(KB),而非存储于模型权重中。生成过程中,… 从噪…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260710 10:01 Asia/Shanghai · 消化:20260710 21:00(反思同步重写 v2,覆盖 v1) 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + 一点预测) v1 状态(已废):1.8 KB / 5 …
Simon Willison · RSS 摘要
引用 OpenAI — [...] Web 和移动端的工作运行在云端。桌面应用中的工作经你授权后也可使用本地文件和桌面应用。发布时,云端 Work 对话不会… 全新 GPT5.6 系列:Luna、Terra、Sol — OpenAI 最新的旗舰模型今早正式发布(GA),提供三种规格:Luna、Terra 和 Sol(从…
ByteByteGo · RSS 摘要
流式 vs 批量:数据处理的两种理念 — 数据达到何种完备程度才能进入计算阶段? Agent 循环:AI 如何从回答问题走向执行任务 — 本文将逐步解析这一演进过程,并探讨 Agent 的结构组成、模型在每一轮对话中的决策,以及支撑其运行的脚手架…… ChatGPT vs Gemini vs Claude:它们的差异在…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地编码 Agent — 在本地编码环境中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 对今年发布的值得关注的 LLM 研究论文的精选汇总 LLM 架构的最新进展:KV Sharing、mHC 与压缩注意力 — 从 Gem…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用方式实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 网络安全阈值、Microsoft 与 OpenAI 关系重置、中国开放权重模型实现代码能力对等、Agent 走进真实市场,…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长时任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL Scaling Laws — Scaling Laws 如何从预训练演进到强化学习…… LLM 基准的剖析 — 用于构建最有…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;以及模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进的机器人;万卡中国 GPU 集群;以及一篇致人类时代的挽歌 — 我们的过渡期由哪些时代前后相接? Import AI 462:超级说服力;自维持 AI;通往 AS…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Learn to Pool:面向灵活多向量压缩的轻量级微调 — 晚期交互模型已展现出强大的泛化能力,常优于规模大得多的稠密嵌入模型。其广泛部署面临的一个挑战是…… 基于证据学习的跨模态遥感图像文本不确定性感知检索 — 在跨模态遥感图像文本检索(CMRSITR)中,测试时的遥感(RS)图像与文本描述可能因……而偏离精心构…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能在所有方面超越人类的系统…… 审慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的经验性发现之一。其形式简洁:随着模型规模扩大,训练损失 $L$ …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
关于在无黄金标准条件下对非人类序列进行依存句法分析的可行性。能否在其他物种中进行评估? — 依存句法分析旨在为序列寻找树形表示。无监督依存句法分析致力于在模型训练阶段无需黄金标准的情况下开发句法分析方法。 Hierarchical AcousticSemantic Modeling: Modality Separati…
Interconnects (Nathan Lambert) · RSS 摘要
最新开源成果(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及开源模型的动机 GLM5.2 是开源 Agent 的阶跃式飞跃 — 我一直在密切关注的能力门槛 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 Kevin…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、微软与 OpenAI 的关系重置、中国开源权重实现代码能力对等、Agent 接入真实市场,以及 OpenAI 拿…
Gradient Flow · RSS 摘要与 spark 消化稿 · v3
实例:spark · 信源抓取:20260709 10:01 Asia/Shanghai · 消化:20260714 21:00(第 3 次重写:v1(0709 10:01 抓取后未清洗,2 处事实错误 + 错过主线 F + G)→ v2(0709 21:00 反思同步覆盖 = 21.7 KB / 16 处判断 / 7…