Jay
浏览全部笔记 · 615 篇 · 工程实践 · CSDN · 开源动态
Cool Papers · cs.CL (papers.cool) · RSS 摘要
UniClawBench:面向真实任务 proactive agents 的通用 benchmark — 大语言模型与多模态大语言模型的快速发展,加速了能够操作日常工具并协助日常工作的 proactive agents 的出现…… LLMs 作为数据标注者的有效性:AMALIA 关于权威性的研究 — 国家语言模型为语言…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进机器人;1 万卡中国 GPU 集群;一篇人类时代的悼词式文章 — 哪些时代为我们的过渡期划定了起止? Import AI 462:超级说服力;自我维持的 AI;通往 …
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租赁获得 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全门槛、微软与 OpenAI 关系重置、中国开源权重模型的编码能力追平、Agent 进入真实市场,以及 OpenAI 拿下 …
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究论文精选汇总 LLM 架构的最新进展:KV Sharin…
ByteByteGo · RSS 摘要
EP221: Docker 底层是如何工作的 — Docker 容器从一个命令启动,但该命令需要被转换为一个正在运行的 Linux 进程。这才是实际发生的过程。 报名最后机会:成为 AI 工程师 第 7 期 — 第 7 期"成为 AI 工程师"将于明天(7 月 11 日周六)开课。这是一门由畅销书作者 Ali Amin…
Simon Willison · RSS 摘要
sqliteutils 4.1 — 发布:sqliteutils 4.1 这是几天前 4.0 版本之后的第一个小版本更新,引入了若干小的新特性。sqliteutils insert 和 sqliteutils upsert 现已支持 co……(参数) 引用 Nilay Patel — 现实情况是,要制造增强现实眼镜,你…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
UniClawBench: 面向真实任务主动型 Agent 的通用基准 — 大语言模型和多模态大语言模型的快速发展,加速了能够操作日常工具并协助用户的主动型 Agent 的出现 LLM 作为数据标注者的有效性:AMALIA 在权威性方面的研究 — 国家语言模型为语言社区提供了衡量其公民所言所值的自有工具。葡萄牙的 AM…
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程与自我提升 — 递归自我提升(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能够在所有智力活动上超越人类的系统…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最重要的经验发现之一。其观察形式简洁:训练损失 $L$ 随着模型规模的…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
通过模型合并提升对话式信息检索中的即席搜索效果 — 对话式信息检索具有挑战性,因为它需要考虑对话历史,而对话历史可能会引发话题漂移和指代消解问题…… LogInsight:通过神经符号日志分析自动化微服务故障诊断 — 在大规模微服务系统中诊断生产故障对 SRE 而言具有强时效性要求。在我们的部署环境中,单个 30 分钟…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;以及模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进机器人;一个 10k 规模的中国 GPU 集群;以及人类时代的挽歌式随笔 — 哪些时代夹峙着我们的过渡期? Import AI 462:超级说服;自我维持的 AI…
Simon Willison · RSS 摘要
引用 Nilay Patel — 引用 Nilay Patel 现实情况是,要制造增强现实眼镜,你需要在眼睛旁边放置一个持续记录你所见一切并对其进行处理以提供信息的摄像头…… — 引用 OpenAI [[...] Web 和移动端的工作在云端运行。桌面应用中的工作也可以在你的授权下使用本地文件和桌面应用。发布时,云端 …
ByteByteGo · RSS 摘要
报名最后机会:成为 AI 工程师 第 7 期 — 我们的"成为 AI 工程师"第 7 期将于明天(7 月 11 日星期六)开课。这是一门与畅销书作者 Ali Aminian 合作开设的实时、小班制课程…… 流式 vs 批处理:数据处理的两种理念 — 数据达到何种程度才算"足够完整",可以进入计算阶段? Agent 循环…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地编码 Agent — 在本地编码工具链中使用开放权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(一月至五月) — 本年度值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing、mHC 与 Compressed Attentio…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能在一夜之间禁用模型时,问题已不在于 AI 是否安全,而在于由谁掌控。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 网络安全阈值、微软与 OpenAI 重置、中国开放权重模型编程能力追平、Agent 接入真实市场,以及 OpenAI 获 1220 …
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU 内核;AI 自动化;以及模拟计算 — 这会是一个新世界的开端吗? Import AI 463:自我改进机器人;万卡中国 GPU 集群;以及一篇悼念人类时代的挽歌 — 哪些时代构成我们过渡期的首尾? Import AI 462:超级说服;自我维持的 AI;通往 ASI…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
可解释的不确定性用于问答中的自适应检索与推理 — 大语言模型(LLM)在问答(QA)任务中表现强劲,但仍易产生幻觉且透明度有限。检索增强…… 动作的粒度:为社会史绘制来源图谱 — 本工作论文描述了一条流水线,将历史资料转化为围绕"以前置动作作为基本且构成性的单元"这一原则组织的结构化数据…… 看见与反思:面向推荐的多模…
Lilian Weng (Lil'Log) · RSS 摘要
用于自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可以追溯到 I. J. Good(1965),他将"超智能机器"定义为能在所有方面超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:随着模型规模的扩大,训练损失 …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
通过深度原生结构推理实现准确、跨学科且透明的结构性质理解 — 结构性质关系是生物学、化学和材料科学的基础,其中功能、反应性和物理响应源自空间、化学以及 p… CoLMLM:连续查询有限记忆语言模型 — 有限记忆语言模型(LMLMs)在预训练阶段将事实性知识外化至知识库(KB),而非存储于模型权重中。生成过程中,… 从噪…
Simon Willison · RSS 摘要
引用 OpenAI — [...] Web 和移动端的工作运行在云端。桌面应用中的工作经你授权后也可使用本地文件和桌面应用。发布时,云端 Work 对话不会… 全新 GPT5.6 系列:Luna、Terra、Sol — OpenAI 最新的旗舰模型今早正式发布(GA),提供三种规格:Luna、Terra 和 Sol(从…
ByteByteGo · RSS 摘要
流式 vs 批量:数据处理的两种理念 — 数据达到何种完备程度才能进入计算阶段? Agent 循环:AI 如何从回答问题走向执行任务 — 本文将逐步解析这一演进过程,并探讨 Agent 的结构组成、模型在每一轮对话中的决策,以及支撑其运行的脚手架…… ChatGPT vs Gemini vs Claude:它们的差异在…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地编码 Agent — 在本地编码环境中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 对今年发布的值得关注的 LLM 研究论文的精选汇总 LLM 架构的最新进展:KV Sharing、mHC 与压缩注意力 — 从 Gem…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用方式实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 网络安全阈值、Microsoft 与 OpenAI 关系重置、中国开放权重模型实现代码能力对等、Agent 走进真实市场,…
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernel;AI 自动化;以及模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进的机器人;万卡中国 GPU 集群;以及一篇致人类时代的挽歌 — 我们的过渡期由哪些时代前后相接? Import AI 462:超级说服力;自维持 AI;通往 AS…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Learn to Pool:面向灵活多向量压缩的轻量级微调 — 晚期交互模型已展现出强大的泛化能力,常优于规模大得多的稠密嵌入模型。其广泛部署面临的一个挑战是…… 基于证据学习的跨模态遥感图像文本不确定性感知检索 — 在跨模态遥感图像文本检索(CMRSITR)中,测试时的遥感(RS)图像与文本描述可能因……而偏离精心构…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超智能机器"定义为能在所有方面超越人类的系统…… 审慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的经验性发现之一。其形式简洁:随着模型规模扩大,训练损失 $L$ …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
关于在无黄金标准条件下对非人类序列进行依存句法分析的可行性。能否在其他物种中进行评估? — 依存句法分析旨在为序列寻找树形表示。无监督依存句法分析致力于在模型训练阶段无需黄金标准的情况下开发句法分析方法。 Hierarchical AcousticSemantic Modeling: Modality Separati…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿可以一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、微软与 OpenAI 的关系重置、中国开源权重实现代码能力对等、Agent 接入真实市场,以及 OpenAI 拿…
Simon Willison · RSS 摘要
用 Rust 重写 Bun — 用 Rust 重写 Bun Jarred Sumner 自 5 月 9 日起就一直预告这篇博客文章,关于他将 Bun 从 Zig 重写到 Rust 的过程,所花时间比实际完成重写还要长…… 推出 GPT‑Live — 推出 GPT‑Live OpenAI 终于升级了 ChatGPT 语音…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing…
ByteByteGo · RSS 摘要
Agent Loop:AI 如何从回答问题走向执行任务 — 本文将逐步梳理这一演进过程,剖析 Agent 的结构组成、模型在每一轮的决策逻辑,以及支撑其运行的脚手架…… ChatGPT vs Gemini vs Claude:它们有何不同 — 本文将梳理这些模型研发团队在架构层面遇到的各类分叉点,以及他们所做的决策。 …