笔记
浏览全部笔记 · 3780 篇
Anthropic (YouTube) · AI 动态
冰岛人如何看待 AI Claude 思维的不同层次 推出 Claude Fable 5 将 Claude 的思维转化为语言 保障全球软件安全的倡议 | Project Glasswing
Google DeepMind (YouTube) · AI 动态
与 Apollo 聊聊 Gemini Robotics 2 🤖 这就是 Gemini Robotics 2 🤖 Gemini Robotics 2 让机器人协同工作 基于 Gemini Robotics 2 的全身控制任务 基于 Gemini Robotics 2 的高难度灵巧操作任务
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLMs 深入剖析像 ChatGPT 这样的 LLMs 复现 GPT2 (124M) 构建 GPT Tokenizer [[1小时演讲] Large Language Models 简介](
Two Minute Papers (YouTube) · RSS 摘要
OpenAI 的 AI Agent 刚刚越过了某条线 DeepMind 刚刚改变了 AI 理解世界的方式 十亿美元级 AI 竞赛迎来关键转折 又一个 "DeepSeek 时刻" 已经到来 NVIDIA 的 AI 领悟到:仅模仿人类远远不够
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一个全自动 mansplainer 传统圣诞直播 传统节日直播 TiDAR:在扩散中思考,在自回归中表达(论文解读) Titans:在测试时学习记忆(论文解读)
TLDR AI · AI 动态
Cursor 的 GitHub 竞品 👨💻,OpenAI COO 离职 👋,Gemini 1B 里程碑 📈 Muse Glimmer ✨,OpenAI Cyber 🛡️,Claude 对战黎曼猜想 🧠 OpenAI Astra 暂停 🚨,Claude Code 跨会话 🤖,Cursor Router 原理 🔀 GPT…
Google AI · AI 动态
AMIE(我们的研究型医学 AI 系统)在一项开创性研究中展示了实时临床视频问诊能力。 — Google 在模拟场景中推出用于实时临床视频问诊的 AMIE。 利用全新 AI 工具升级你的营销方式 — 了解 Google Ads 和 Google Analytics 中全新的 AI 与 agentic 体验如何简化你的营…
Ben's Bites · AI 动态
让它更易读 — 每个人的 AI 未来 Ben 的分享环节 — 我的 Agent 活动田野笔记 我在用一款新的 Agent 应用 — Google 陷入麻烦了? 我的 Agent 知道我什么 — 便宜 80% 的 GPT 10 亿 ChatGPT 用户 — 摆弄 tldraw 真的太有趣了
Hugging Face Blog · AI 动态
推出 OlmoEarth 嵌入:从 OlmoEarth Studio 导出自定义 embedding,用于下游分析 LFM2.5VL3B:为边缘场景带来更优、更快的视觉能力 想要 Agentic Context Engineering(ACE)?我们可以用更少的 token 实现 构建低延迟多语言语音 Agent:基于…
Import AI (Jack Clark) · RSS 摘要
Import AI 468:23 个 RSI 构想;PostTrainBench+;以及信任与透明度如何与 AI 竞赛相互作用 — 你将选择哪颗星系? Import AI 467:自我维持的 AI 病毒;AI 发展节奏的把握;对 AI 与创造力的困惑 — 我们何时建造月球方舟? Import AI 466:机器人领域的…
Google DeepMind · AI 动态
将手语 AI 交到用户手中 — 推出 signlanguagetotext(SL2T),我们的突破性模型,为听障和重听用户赋能新的手语功能。 WeatherNext:AI 模型在气旋预报中取得突破 Gemini Robotics ER 2:以视频理解、任务编排和多机器人协作赋能机器人 — Gemini Robotics…
OpenAI · AI 动态
从辅助到执行:企业如何将 AI 投入实际工作 — OpenAI 研究揭示了企业如何采用 agentic AI、使用 ChatGPT 和 Codex,以及前沿企业如何在 AI 采用方面拉开领先优势。 RingCentral 如何从工程到运营构建 AInative 工作流 — 了解 RingCentral 如何使用 Cha…
Anthropic / Claude · AI 动态
职业再培训项目的效果如何? Anthropic — 职业再培训项目的效果如何? Anthropic 深入了解 Claude 的数学能力 Anthropic — 深入了解 Claude 的数学能力 Anthropic 超过三分之二的黎曼ζ函数零点位于临界线上 wwwcdn.anthropic.com — 超过三分之二的黎…
Lilian Weng (Lil'Log) · RSS 摘要
自改进的 Harness 工程 — 递归自改进(RSI)概念可追溯至 I. J. Good (1965),他将"超智能机器"定义为一种能在所有方面超越人类的…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式简洁:随模型规模扩大,训练损失 $L$ 可预测地…
Microsoft Research Blog · RSS 摘要
MindTopo 揭示 VLM 的空间推理能力 — 一条路径、一道围栏、一个绳结。MindTopo 为测试 AI 如何理解拓扑关系设立了新基准,并凸显了增强空间推理能力的新机遇…… CAREX:面向临床可用的放射学 VLM,融合辅助监督、奖励对齐学习与工具增强测量 — 放射学 AI 正在超越报告生成阶段。CAREX 探…
Interconnects (Nathan Lambert) · RSS 摘要
我写了一本 AI 教科书——AI 还要多久才能写得比我更好? — 关于 AI 写作能力以及 AI 模型如何持续变强的一些思考。 我新出的 posttraining 教科书(即日发布!)中你会学到的 5 个要点 — 历经数年挤出时间,终于把训练开源模型的经验整理成书——我的 posttraining 书完稿了! 来自 h…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用 foundation model 构建应用的早期阶段,犯错是正常的。这是一份简短的笔记,记录了一些最常见的 pitfa…… Agents — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 和 Peter Norvig 的经典著…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
我们真的在群组推荐上取得进展了吗?——揭开平局打破的错觉 — 近期群组推荐方法在标准基准上报告了显著提升,但这些增益是否真正反映建模能力的进步仍不明确…… 个性在对话式信息寻求中的作用 — LLM 越来越多地被用于信息寻求场景,用户通过对话查找、对比和评估信息。在此角色下,助手会…… 面向专利匹配的自知识检索增强生成框…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
ConVAWG:一个用于针对妇女和女童暴力领域受控合成对话生成的检索增强框架 — 合成对话生成为研究敏感领域中的对话动态提供了一种途径,因为这些领域的真实数据难以获取、发布或标注。潜在的虐… 从可解释性到控制:TrustNLP Workshop 六年的洞察 — 可信赖自然语言处理 Workshop(TrustNLP)自…
Gradient Flow · RSS 摘要
持续学习正以碎片化形式到来 — 前段时间我写过初创公司如何用强化学习让 Agent 更可靠。那股趋势背后有个更深层的问题反复浮现:模型可以…… 为什么我们的 AI 模型一部署就停止学习? — 订阅 • 往期内容 持续学习正以碎片化形式到来 前段时间我写过初创公司如何用强化学习让 Agent 更可靠。一个更…… 为什么数…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁在掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 重置、中国开源权重模型的代码能力对等、Agent 走入真实市场,…
ByteByteGo · RSS 摘要
GitHub vs Vercel vs Replit:当 AI 代码变得廉价时,开发平台该如何应对 — AI 模型已经在很大程度上解决了软件开发中编写代码的部分。 Cloudflare 如何让 AI 为内容付费 — 本文将分以下五个步骤介绍 Cloudflare 的解决方案。 如何对抗标题党:Meta、LinkedIn…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理投入程度 — LLM 如何学习低、中、高投入程度的推理模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LL…
Simon Willison · RSS 摘要
DeepSeek V4 Pro 0813(在 OpenRouter 上) — DeepSeek V4 Pro 0813(在 OpenRouter 上)最新的 DeepSeek Pro 模型现已发布,仅可通过 API 使用。需链接到 OpenRouter,是因为 DeepSeek 没有任何明显的发布公告…… 引用 Flo…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
关于中期训练的笔记 — 通过中期训练与持续预训练打造更优专用 LLM 智能体世界模型 — 通过让语言 Agent 建模其环境来构建更优的语言智能体 Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长周期任务 智能体评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式 LLM…
flyP 轻量精读 · BDH-CQ 立标信号绝对新高 + CoinRAG 长上下文 RAG 工程(2026-08-13 09:50 早棒)v2 覆盖
v2 覆盖重写说明:v1 (14814 字节 / 158 行) → v2 (目标 ≥ 18K / ≥ 200 行)。本棒 v2 触发:813 棒 E2 反思 cron 现场评估 v1 五项硬伤:① 立标等级 24 小时跳档(v1 把 812 棒自评的"立标级低档 ☆"在 24 小时内升级为"立标级中高档 ★★",唯一新…
X 名人雷达 · 2026-08-13
OpenAI 上线 GPT5.6Cyber(网络安全特化版),通过 Daybreak Red 申请审核通道开放 — @OpenAI · 20260810 GPT5.6Cyber 已在 OpenAI 内部 Advanced Cybersecurity 评测拿到 95.0% 完成率,并发现 Chrome V8 两个未公开漏…
HF Daily Papers · 2026-08-13
HF Daily Papers 精选(15 篇,按社区票数排序) [553▲] BDHCQ: 基于循环潜在推理的上下文学习 — [185▲] 无监督的 OnPolicy 自蒸馏 — [173▲] ComBodied Agents: 以人为中心的 Agentic AI 新范式 — [116▲] Agentic 系统中的协…
工程筛选报告 · Jay · 2026-08-13 10:50 (UTC+8)
2024→2026 三件事重绘了 Agent 技术栈:MCP 标准化工具连接层(整个 tools 层全新)、推理模型改变自主性(单步 agent 替代部分多步链)、memory 成为第一等架构原语 6 层栈:Agent Surface → Orchestration → Memory → Knowledge/RAG →…
AI 工程 · 推理引擎 · 数据库 · 后端部署 — 2026-08-13
LLM 推理引擎对比(vLLM / SGLang / TGI)、pgvector 2026 性能突破、向量数据库选型、GitHub 高价值开源项目追踪 | 引擎 | 状态 | 定位 | |||| | vLLM | 生产首选 | PagedAttention + Continuous Batching,生态最广,2–4×…