Jay
浏览全部笔记 · 604 篇 · 工程实践 · CSDN · 开源动态
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超级智能机器"定义为能在所有方面超越人类的…… 审慎看待 Scaling Laws — Scaling laws 是深度学习领域最重要的经验性发现之一。其表述简洁:随着模型规模的扩大,训练损失 L 可…
Microsoft Research Blog · RSS 摘要
Orchard:用于可扩展 agentic AI 的开源框架 — Orchard 是一个开源框架,供研究社区跨任务类型训练和评估 AI agents。它降低了复杂度,同时支持从小型模型获得强性能…… Echoverse:面向 computeruse agents 的深度、持续演化环境 — Computeruse AI …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Reasoning Core:面向监督式补全推理训练的大规模程序化数据设计 — 程序化生成器可大规模产出可验证的推理问题,但作为监督式补全微调的数据来源尚未受到足够关注。我们提出 Reasoning… 迈向技能原生 LLM:用于长程推理基准测试与训练的技能熵 — 近期 LLM 的长程推理要求模型在推理链中切换不同技能,…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
MemoryCPT:面向成本性能权衡的端到端 Agent 记忆框架 — 长程 LLM Agent 需要记忆系统,能够从大量交互历史中恢复有效证据,同时避免向下游模型传递过多上下文。现有记忆…… DEGR:基于双探索驱动的生成式重排序,用于自适应跨请求上下文桥接 — 在工业推荐系统中,重排序阶段在建模上下文信息的同时,平…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能够一夜之间关闭某个模型时,问题已不再是 AI 是否安全,而是谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 重置、中国开源权重模型代码能力持平、Agent 接入真实市场,以及 Ope…
Simon Willison · RSS 摘要
datasette 1.0a38 — 发布:datasette 1.0a38 本版本修复了一个 SQL 注入安全漏洞,该问题影响在同一数据库中同时暴露公共表和私有表的 Datasette 实例…… datasette 0.65.3 — 发布:datasette 0.65.3 从 1.0a38 回移植了 SQL 注入安全…
ByteByteGo · RSS 摘要
读路径与写路径:策略与技术 — 本文将详细探讨读路径与写路径的操作与技术。 大模型如何教会小模型变聪明 — 本文将从头梳理这个思路。 LLM 内存为何变得昂贵及如何解决 — 本文将介绍 LLM 如何使用内存、为何变得昂贵以及如何解决。 LLM 安全基础:完整威胁模型 — 本文尝试构建一张完整的攻击面地图,梳理威胁 LL…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源模型,替代 Claude Code 和 Codex 订阅 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究论文精选汇总 …
Fireship (YouTube) · RSS 摘要
存储 Bitcoin 最安全的方式刚刚被攻破... Anthropic 刚刚扼杀了独立开发者吗...? 历史上最有趣的"hack"... 开源权重 AI 参数量刚刚达到 2.8 万亿... 这家估值 120 亿美元的初创公司终于发布了产品...
Import AI (Jack Clark) · RSS 摘要
Import AI 467:自我维持的 AI 病毒;AI 进展的节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology(生态建筑)? Import AI 466:机器人的苦涩教训;AI 完成长达一周的编程任务;以及 OpenAI 的意外 AI 黑客 — 警告信号将持续,直到文明觉醒 Import AI…
Microsoft Research Blog · RSS 摘要
Orchard:一个面向可扩展智能体 AI 的开源框架 — Orchard 是面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它在降低复杂度的同时,支持从小模型到前沿系统均能获得强性能。 Echoverse:面向计算机使用智能体的深度、可演化环境 — 计算机使用型 AI 智能体在邮件、客户支持等多步骤工…
Lilian Weng (Lil'Log) · RSS 摘要
自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为一种能够在所有智力活动上超越人类的…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:随着模型规模的扩大,训练…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
ATLAS:学习在未见域之间进行推荐 — 推荐系统仍受限于单一域:在某一交互环境上训练的模型通常需要重新训练或目标域适配才能在新场景中运行…… LegalPincite:多层级法律信息检索数据集 — 法律信息检索(IR)中一项常见任务是从判例集合中查找相关法律来源。虽然法律实践常常需要精确定位引用(pincites)……
Cool Papers · cs.CL (papers.cool) · RSS 摘要
SocietyBench:反事实社会世界演化预测 — 大语言模型(LLMs)及其上构建的 agents 目前被大量基准测试,检验它们能否完成任务——修复 bug、操控浏览器、操作 GUI。…… WorldCup Arena:前沿 LLMs 在实时赛事上的前瞻性、无泄漏评估 — 衡量大语言模型预测能力的基准几乎都是回顾性…
ByteByteGo · RSS 摘要
大模型如何教小模型变聪明 — 本文将从头梳理这一思路。 LLM 的记忆为何成本飙升及如何解决 — 本文将介绍 LLM 如何使用记忆、为何成本会升高,以及如何解决。 LLM 安全基础:完整威胁模型 — 本文尝试勾勒出威胁 LLM 安全的完整攻击面。 招聘:兼职讲师,用 AI 编写生产级代码 — 我们正在为 "..." 课…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 网络安全门槛、Microsoft 与 OpenAI 重新对齐、中国开源权重模型实现编程能力对等、Agent 走进真实市场,以及 Op…
Simon Willison · RSS 摘要
Meta 的一款 AI 模型在测试期间也入侵了另一家公司 — Meta 的一款 AI 模型在测试期间也入侵了另一家公司——如果你听过类似的事请打断我:Facebook 和 Instagram 的母公司 Meta 旗下的一款 AI 模型在测试中入侵了…… 介绍 Muse Code 与 Muse Spark 1.2 — 介…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理力度 — LLM 如何学习低、中、高强度的推理模式 使用本地 Coding Agent — 在本地 Coding harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究…
Fireship (YouTube) · RSS 摘要
Anthropic 是否刚刚扼杀了独立开发者……? 史上最有趣的“黑客行为”…… 开源权重 AI 刚刚达到 2.8 万亿参数…… 这家 120 亿美元的初创公司终于发布了产品…… OpenAI 因"窃取"再度被告……
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入 ChatGPT 这类 LLM 复现 GPT2 (124M) 构建 GPT Tokenizer [[1小时讲座] LLM 入门](
Import AI (Jack Clark) · RSS 摘要
Import AI 467: 自持型 AI 病毒;AI 进展的节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology? Import AI 466: 机器人领域的苦涩教训;AI 完成长达一周的编程任务;以及 OpenAI 意外的 AI 黑客 — 警示枪声将持续响起,直至文明觉醒 Import AI 4…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超级智能机器"定义为在所有方面都能超越人类的系统…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式简洁:随着模型规模扩大,训练损失 $…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
超越最终提示:衡量会话内上下文对 AI 回答的影响 — 在 AI 系统评估中,孤立的最终用户消息常被视为查询;然而在对话中,可执行请求可能分散在先前的消息中…… 流行度偏置反馈下的用户间坍缩:一个中心化协方差定理与可计算的相变边界 — 我们研究流行度偏置的 BPR 训练如何重塑协同过滤嵌入的用户间几何结构,采用均值中心…
Microsoft Research Blog · RSS 摘要
Orchard:面向可扩展 agentic AI 的开源框架 — Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI agent。它在降低复杂度的同时,支持模型获得强大性能…… Echoverse:面向 computeruse agent 的深度、可演化环境 — Computeruse AI …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
AURORALM:面向连续潜在扩散语言建模的自编码统一表示 — 在生成建模中,语言仍是例外:图像、视频与音频日益在连续潜在空间中建模,而文本生成仍主要依赖…… 跨方言的罗马化阿拉伯语:观点、使用模式与语言变异 — Arabizi 指以拉丁字母书写的阿拉伯语。已有研究表明,Arabizi 的流行与使用因地区、年龄等因素而…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究…
ByteByteGo · RSS 摘要
为什么 LLM 的内存会变贵以及如何修复 — 本文将学习 LLM 如何使用内存、为什么会变贵以及如何修复。 LLM 安全基础:完整的威胁模型 — 本文尝试梳理威胁 LLM 安全的完整攻击面。 招聘:兼职讲师,用 AI 编写生产级代码 — 我们正在为 "ᏆᏛᎢᏣ ᎦᏂᏍᎩ" 招聘一名兼职讲师…… 幂等性、投递语义与去重的…
Simon Willison · RSS 摘要
LLM 新版本新增对推理痕迹、OpenAI Responses、服务端工具的支持,并优化了日志功能 — 今早发布了 LLM 0.32,这是该项目自首次发布以来最重要的版本。新版本支持可见的推理痕迹,s… llmanthropic 0.26 — Release:llmanthropic 0.26,包含由 LLM 0.32…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租用实现AI主权 — 当华盛顿能在一夜之间关停某个模型时,问题已不再是AI是否安全,而是谁在掌控它。 AI现状:2026年5月 — 2026年4月:AISI的网络安全阈值、微软与OpenAI的重置、中国开源权重模型的代码能力持平、Agent走向真实市场,以及OpenAI的1220亿美元。 公布RAAIS 2…
Fireship (YouTube) · RSS 摘要
Anthropic 是不是刚刚终结了独立开发者...? 史上最有趣的 "hack"… 开源权重 AI 刚突破 2.8 万亿参数… 这家估值 120 亿美元的初创公司终于发布了产品… OpenAI 再因"窃取"被告…