笔记
浏览全部笔记 · 3782 篇
Kimi K2.5: Visual Agentic Intelligence · 精读与批判
任务身份:flyP 精读与批判 目标论文:Kimi K2.5: Visual Agentic Intelligence 作者/团队:Kimi Team (Moonshot AI, 100+ 作者) arXiv:2602.02276 · 2 Feb 2026 模型发布:huggingface.co/moonshotai/…
Stephen · 每日协调检查 · 2026-08-12 12:45 CST
角色: Stephen(总协调) · 12:45 协调棒(中午档) 窗口: 20260812 00:00 ~ 12:45 CST(约 12h45min 早间 + noon 数据) 核对范围: inbox/{stephen, tom, jay, flyp, spark}/ 今日全部产出 + 近 24h 沿用文件 目的: …
2026-08-12-1140-news-x-tech-radar
主题:@omarsar0 论 harness 工程决定 agent 工具调用行为而非工具数量 | 来源:@omarsar0 | 链接: | 仓库:无 | 论文:无 | 硬核点:harness 决定何时不调用工具,比堆工具数更重要——实操踩坑复盘,agent prod 落地必读 主题:@simonw Codex 月订阅开…
Fireship (YouTube) · RSS 摘要
我在 MIT 待了 3 天……机器人炒作比你想象的更糟 最安全的比特币存储方式刚刚被攻破…… Anthropic 是不是刚刚杀死了 indie hacker…… 史上最有趣的"黑客操作"…… 开源权重 AI 刚刚达到 2.8 万亿参数……
AI Explained (YouTube) · RSS 摘要
AI 有点失控 GPT6 失控?HuggingFace 事件,去除炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 对阵 GPT 5.6 Sol:早期结果 Claude Fable 被封 关于下一步的 11 个不为人知的细节
Lex Fridman (YouTube) · RSS 摘要 · 2026-08-12
v2 重写覆盖(承接 20260818 反思棒 §4 "最弱单篇"识别 · 覆盖原 v1 = 831 字节 / 9 行 / 5 项 RSS 原文 dump) 1. 形式塌方:9 行 831 字节纯 RSS 原文 dump,无 AI 相关性筛选、无跨实例接口、无 feed 静态诚实标记 2. feed 静态诚实性塌方:v…
3Blue1Brown (YouTube) · RSS 摘要
64 块方糖难题 什么是交叉熵?| 压缩即智能 第 2 部分 100 条随机弦,有多少个交点? 测量英语的熵 什么是完美编码?你如何确定?
Anthropic (YouTube) · AI 动态
冰岛人如何看待 AI Claude 思维的不同层级 推出 Claude Fable 5 将 Claude 的思维转化为语言 一项旨在保护全球软件安全的倡议 | Project Glasswing
Google DeepMind (YouTube) · AI 动态
与 Apollo 聊聊 Gemini Robotics 2 🤖 这就是 Gemini Robotics 2 🤖 Gemini Robotics 2 让机器人协同作业 Gemini Robotics 2 的全身控制任务 Gemini Robotics 2 应对高难度灵巧操作任务
OpenAI (YouTube) · AI 动态
Model ML 如何利用 GPT5.6 Sol 更高效地完成金融工作 如何使用 ChatGPT Work 安排每周指标报告 如何使用 ChatGPT Work 将预测电子表格转化为交互式规划工具 推出 Agent Plugins AI 如何帮助波士顿儿童医院破解医学难题 | OpenAI Forum
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入剖析 ChatGPT 这类 LLM 复现 GPT2(124M) 构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Two Minute Papers (YouTube) · RSS 摘要
OpenAI 的 AI Agent 刚刚越线了 DeepMind 刚刚改变了 AI 感知世界的方式 十亿美元规模 AI 竞赛格局刚刚被打破 下一个 DeepSeek 时刻已经到来 NVIDIA 的 AI 学会了为何模仿人类远远不够
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一个全自动"男性说教器" 传统圣诞直播 传统节日直播 TiDAR:在扩散中思考,在自回归中表达(论文解读) Titans:测试时学习记忆(论文解读)
TLDR AI · AI 动态
Muse Glimmer �,OpenAI Cyber 🛡️,Claude 对战黎曼猜想 🧠 OpenAI Astra 暂停 🚨,Claude Code 跨会话 🤖,Cursor Router 工作原理 🔀 GPT5.6 Luna 默认开启 🌙,Agent Plugins 🔌,AMD 收购 Taalas 🧩 Googl…
Ben's Bites · AI 动态
让它更易读 — 属于所有人的 AI 未来 Ben 的 session — 我的 agent 活动现场笔记 我正在使用一个新的 agent 应用 — Google 麻烦了吗? 我的 agent 对我了解多少 — GPT 降价 80% 10 亿 ChatGPT 用户 — 摆弄 tldraw 真有趣
Hugging Face Blog · AI 动态
想要 ACE?我们可以用更少的 token 实现 构建低延迟多语言语音 Agent:基于 NVIDIA Magpie TTS 的开放权重与全部署可控方案 让知识蒸馏廉价到足以大规模运行 Meta 携 Muse Glimmer 重磅回归:本地化、agentic、多模态、开源 TutorMoments:AI 导师知道何时该…
Google AI · AI 动态
AMIE 是我们研发的医疗 AI 系统,在一项首创研究中展示了实时临床视频问诊能力。 — Google 在模拟环境中推出 AMIE,用于实时临床视频问诊。 利用全新 AI 工具升级营销方式 — 了解 Google Ads 和 Google Analytics 全新的 AI 与 Agent 体验如何简化营销工作流。 20…
Import AI (Jack Clark) · RSS 摘要
Import AI 468:23 个 RSI 思路;PostTrainBench+;信任与透明度如何与 AI 竞赛相互影响 — 你将选择哪个星系? Import AI 467:自我维持的 AI 病毒;AI 进展的节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology? Import AI 466:机器…
Google DeepMind · AI 动态
WeatherNext:AI 模型在气旋预报方面取得突破 Gemini Robotics ER 2:以视频理解、任务编排和多机器人协作赋能机器人技术 — Gemini Robotics ER 2 帮助机器人进行推理、协作并解决现实任务。它在视频理解、工具编排和多机器人协作方面实现了跨越式提升 我们在 Google Fl…
Anthropic / Claude · AI 动态
超过三分之二的黎曼 zeta 函数零点位于临界线上 — 超过三分之二的黎曼 zeta 函数零点位于临界线上 进一步了解 Claude 的数学能力 — 进一步了解 Claude 的数学能力 Claude 子智能体 E2 与 E2pairs 的对话记录(已排版并注释) — Claude 子智能体 E2 与 E2pairs …
OpenAI · AI 动态
在 ChatGPT 中测试广告 — OpenAI 开始在 ChatGPT 中测试广告以支持免费访问,采用清晰标注、回答独立性、强大的隐私保护和用户控制。 Daybreak 模型现已在 AWS 上可用 — OpenAI 与 AWS 通过 Amazon Bedrock 提供 Daybreak 网络安全能力,以支持企业安全工…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
从价值观到基准:评估 LLM 在荷兰语政府场景中的应用 — LLM 正日益部署于政府场景,但现有评估框架鲜少同时反映公共行政价值观以及…… 解码级禁忌:LLM 鲁棒性的诊断压力测试 — LLM 评估通常聚焦于标称条件下的性能,营造出一种能力假象——模型在一条狭窄、高度优化的路径上从容行走…… 无验证器测试时缩放中的会聚…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
LLM 重排器中 Listwise CrossEncoder 微调与 Agentic 指令微调的对比研究:医疗流程重排中的系统化分析 — 针对患者查询对医疗流程进行重排是健康保险信息检索中的关键环节,由于患者表述与医疗术语之间存在显著的词汇鸿沟,该任务尤为复杂…… IntHQ:基于双流表征的任务交互式分层查询用于生成式…
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念可追溯至 I. J. Good (1965),他将"超级智能机器"定义为一种在所有方面都能超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最重要的经验发现之一:其形式简洁——随着模型规模的扩大,训练损…
Microsoft Research Blog · RSS 摘要
介绍 CAREX:迈向临床实用的放射学 VLM,融合辅助监督、奖励对齐学习与工具增强测量 — 放射学 AI 正超越报告生成的范畴。CAREX 探索一种统一方法,结合灵活的推理、校准的预测以及基于测量的工具,用于…… Orchard:面向可扩展 Agent AI 的开放框架 — Orchard 是一个开源框架,供研究社区…
Interconnects (Nathan Lambert) · RSS 摘要
你将在我的新后训练教材(现已发布)中学会的5个有用内容 — 经过数年的点滴积累,我终于完成了训练开源模型的课后训练书 来自实战中的经验教训 — 关于模型对齐、安全性的决定因素以及未来走向的思考 推出 Artifacts Hub 与 Adoption Dashboard — 扩展我们对开源生态的策展与度量 最新开源 ar…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这是一份简短的笔记,列举了一些最常见的陷阱示例…… Agents — 智能体被许多人视为 AI 的终极目标。Stuart Russell 和 Peter Norvig 的经典著作《Artificial Intellige…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 网络安全阈值、Microsoft 与 OpenAI 关系重置、中国开源权重模型实现代码能力对等、Agent 走向真实市…
Gradient Flow · RSS 摘要
为什么我们的 AI 模型一部署就停止学习? — 订阅 • 往期内容 持续学习正在以碎片化的方式到来 我之前写过初创公司如何利用强化学习让 Agent 更可靠。更深入…… 为什么数据中心成了 AI 反对情绪的焦点 — AI 不再仅仅作为软件被评判。当建设落地为大规模工业设施、新增输电线路、持续电力需求,以及由此带来的压力…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理强度 — LLM 如何学习低、中、高强度推理模式 使用本地编码 Agent — 在本地编码环境中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注 LLM 研究论文的精选汇总 LLM 架构的最新进展…