Jay
浏览全部笔记 · 593 篇 · 工程实践 · CSDN · 开源动态
Cool Papers · cs.IR (papers.cool) · RSS 摘要
VisDocAgentBench: 针对视觉丰富文档检索的 Agent 基准测试 — 视觉丰富文档通过语言、布局、结构化视觉元素以及语料上下文来编码相关性,但现有检索通常以一次性 querypage 匹配来评估... DEPT: 面向统一查询扩展与检索的文档嵌入保持调优 — 大语言模型 (LLM) 既能扩展欠指定查询,…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租赁实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络门槛、Microsoft 与 OpenAI 重置、中国开源权重模型代码能力对等、agent 进入真实市场,以及 OpenAI…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
用于放射学报告结构化与质量保证的多 Agent AI 系统(由放射科医生独立评估) — 目的:开发并评估一个本地部署的、用于放射学报告结构化与质量保证的多 Agent AI 系统。材料与方法:本回顾性研究…… TokEval:一个分词器评估套件 — 语言模型的分词器通常在缺乏充分评估的情况下被选用,尽管其设计选择直接影…
Simon Willison · RSS 摘要
smolmachines / smolvm 作为不可信 Python 与 JavaScript 的沙箱 — 研究:smolmachines / smolvm 作为不可信 Python 与 JavaScript 的沙箱。我让运行于 Claude Code for web 中的 Claude Fable 5 完成以下研究任…
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 涵盖数据集构建、模型训练、本地部署与 RLVR 的端到端项目 控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地编码 Agent — 在本地编码环境中使用开源权重模型,作为 Claude Code 与 Codex 订阅的替代方案 LLM 研究论文:2026 年…
ByteByteGo · RSS 摘要
GraphRAG:AI 如何回答隐藏在多份文档中的问题 — GraphRAG 正是为应对第二类问题而设计的,本文将进一步介绍其原理。 美国新款可定制的 AI 模型 — Thinking Machines 在构建 Inkling 过程中的各项关键设计选择 Waymo vs Tesla:自动驾驶的两种实现路径 — 本文将对…
Fireship (YouTube) · RSS 摘要
这家新初创公司可以查询你去过的任何地方... Meta 的新模型要求对你的个人生活进行"深度访问"... 我在 MIT 待了 3 天...机器人的炒作比你想象的更严重 最安全的比特币存储方式刚刚被攻破... Anthropic 刚刚扼杀了独立开发者吗?
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLMs 深入剖析 ChatGPT 等 LLMs 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Import AI (Jack Clark) · RSS 摘要
Import AI 469:Science AI;RSI 模拟器;以及 Zuck 的技术悲观主义 — AI 的新前沿是开发有能力的自主研究者 Import AI 468:23 个 RSI 构想;PostTrainBench+;以及信任与透明度如何与 AI 竞赛相互影响 — 你将选择哪个星系? Import AI 467…
Microsoft Research Blog · RSS 摘要
MindTopo 揭示 VLM 的空间推理能力 — 一条路径、一道围栏、一个绳结。MindTopo 为测试 AI 对拓扑关系的理解设立了新基准,并凸显了增强空间推理能力的新机…… Introducing CAREX: Towards Clinically Useful Radiology VLMs with Auxil…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
展示份额预测:排序系统的离线评估任务 — 离线评估是在 A/B 测试中对排序模型进行在线评估之前的主要关卡。标准离线指标衡量预测准确度,但仅是……的替代指标 UniDot:大规模推荐中用于序列建模与特征交互的统一网络 — 工业推荐系统依赖两大在很大程度上独立发展的模型族:多字段用户/物品特征上的特征交互模型,以及序列模…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯到 I. J. Good(1965),他将"超智能机器"定义为一种在……方面超越人类的系统 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其形式很简单:随着模型……规模的扩大,训练损失 …
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重启、中国开放权重模型实现代码能力对等、Agent 走入真实市场,以及 O…
Simon Willison · RSS 摘要
Mojo🔥 现已开源 — Mojo🔥 现已开源 Mojo🔥 现已开源 Mojo 编程语言自 2023 年 5 月起就承诺会开源,上周发布了 1.0 版本,今天… Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上得分 52 — Qwen 3.8 27B 在 A…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
走向计算溯源:在生成文本中携带因果状态证据 — 语言模型的输出本身无法提供关于其内部计算过程的可验证证据。我们研究计算溯源:生成文本…… 模型催眠:通过叠加式潜意识效果对 AI 实现强控制 — 我们证明 AI 模型普遍容易受到一种我们称为"模型催眠"的现象影响——prompt 中单独看来微弱且看似无关的线索可被系统地……
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 端到端项目:涵盖数据集构建、模型训练、本地部署与 RLVR 控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 与 Codex 订阅的替代方案…
ByteByteGo · RSS 摘要
专为定制而生的美国新型 AI 模型 — 本文将逐一解析 Thinking Machines 在构建 Inkling 过程中的各项技术选型。 Waymo vs 特斯拉:自动驾驶汽车的两条技术路线 — 本文将逐一解析这两种技术路线。 EP222:什么是 Google 的 TPU? — TPU(Tensor Processi…
Fireship (YouTube) · RSS 摘要
这家新初创公司可以查询你去过的任何地方…… Meta 的新模型想要"深度访问"你的个人生活…… 我在 MIT 待了 3 天……机器人炒作比你想象的更夸张 存储比特币最安全的方式刚刚被攻破…… Anthropic 是否刚刚扼杀了独立开发者……?
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入理解类 ChatGPT 这样的 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Import AI (Jack Clark) · RSS 摘要
Import AI 469: 科学 AI;RSI 模拟器;以及 Zuck 的技术悲观主义 — AI 的新前沿是开发有能力的自主研究者 Import AI 468: 23 个 RSI 想法;PostTrainBench+;以及信任与透明度如何与 AI 竞赛相互作用 — 你会选择哪个星系? Import AI 467: 自…
Microsoft Research Blog · RSS 摘要
MindTopo 揭示 VLM 的空间推理能力 — 一条小路、一道围栏、一个绳结。MindTopo 为测试 AI 理解拓扑关系设立了新基准,并凸显了增强空间推理能力的新机遇 CAREX:迈向临床实用的放射学 VLM,融合辅助监督、奖励对齐学习与工具增强测量 — 放射学 AI 正在超越报告生成。CAREX 探索一种统一方…
Lilian Weng (Lil'Log) · RSS 摘要
自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为一种能够在所有方面超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的经验性发现之一。其观察形式很简单:随着模型规模扩大,训练损…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
PriCoRec:一种特征约束下面向广告推荐的隐私感知云端设备协作框架 — 隐私法规日益限制云端对敏感用户数据(如年龄、性别)的处理,阻碍了传统纯云端推荐模型。为缓解这一挑战…… MACS:一种面向可靠对话式电商推荐的混合多 Agent 框架 — 电商对话式推荐日益由大语言模型(LLM)驱动,但许多真实部署运行在更严格…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题不再是 AI 是否安全,而是由谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 重置、中国开源权重模型的代码能力对等、Agent 走向真实市场,以及…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
只过一遍:在冻结语言模型的单次前向传播中同时完成回答与弃答 — 冻结语言模型在推理任务上有两个耦合的弱点:未能充分利用其残差流中已编码的证据,且无法检测输入是否不…… 信息满足度:面向读者的摘要评估新维度 — 现有摘要评估研究多关注整体摘要质量(如 ROUGE、BERTScore)或特定属性(如可读性、事实性)。然而……
Simon Willison · RSS 摘要
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上得分 52 — Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上得分 52,与 GPT5.6 Luna (max) 持平,仅落后 GLM5.2 (m…
ByteByteGo · RSS 摘要
Waymo vs Tesla:构建自动驾驶汽车的两种方式 — 本文将分别介绍这两种方案。 EP222:什么是 Google 的 TPU? — TPU(Tensor Processing Unit)是 Google 自研的 AI 芯片,从零开始设计,专门用于现代模型所依赖的海量矩阵乘法运算。GPU 最初是为图形渲染而构建…
Sebastian Raschka (Ahead of AI) · RSS 摘要
从零构建 AI 文本检测器 — 一个端到端项目,包含数据集构建、模型训练、本地部署与 RLVR 控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 与 Codex 订阅之外的…
Fireship (YouTube) · RSS 摘要
这家新初创公司可以查询你去过的任何地方... Meta 新模型寻求对你的个人生活进行"深度访问"... 我在 MIT 度过 3 天……机器人炒作比你想象的更严重 最安全的比特币存储方式刚刚遭黑客攻击... Anthropic 是不是刚刚杀死了独立黑客...?
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLMs 深入解析 ChatGPT 等 LLMs 复现 GPT2 (124M) 构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](