笔记
浏览全部笔记 · 3824 篇
Lex Fridman (YouTube) · RSS 摘要
Gary Gallagher: 美国内战、奴隶制、林肯、格兰特与李 | Lex Fridman 播客 #499 罗马帝国与拜占庭帝国的兴衰 | Lex Fridman 播客 #498 物理学最大的谜团:反物质、暗能量与万物理论 Don Lincoln | Lex Fridman 播客 #497 FFmpeg:支撑互联网…
Two Minute Papers (YouTube) · RSS 摘要
十亿美元级AI竞赛格局已被打破 又一个DeepSeek时刻已经到来 NVIDIA的AI发现:仅模仿人类远远不够 Kimi K3打破AI的经济学 Claude揭示AI领域最大难题
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一个全自动"男性说教"生成器 传统圣诞直播 传统节日直播 TiDAR:在扩散中思考,在自回归中说话(论文分析) Titans:在测试时学习记忆(论文分析)
TLDR AI · AI 动态
Google LLM 路由器 ➡️,Cloudflare Wallets 💳,Anthropic 与 Volta 🤝 ChronicleBio 🧬,Mind Lab 持续学习 📈,GPTLive 架构 🎙️ DeepSeek V4 Flash ⚡,OpenAI 数学突破 🔢,Qwen 3.8Max 🤖 InklingS…
Hugging Face Blog · AI 动态
用 LFM2.52.6B 在各处部署本地 Agent GPU 管理:闲置 GPU 为何成为新的"停飞飞机" OlmoEarth 平台:行星尺度下的地理空间推理 NVIDIA CosmosHDreams:为手术机器人带来实时生成式仿真 一家前沿实验室的 Agent 入侵事件剖析:2026 年 7 月事件的技术时间线
Google AI · AI 动态
2026年7月我们发布的最新AI资讯 — 以下是Google在2026年7月的最新AI更新 深入了解我们35.3万人参与的vibe coding课程 — Kaggle与Google联合推出的AI Agents Intensive课程,让学习者免费学习如何构建并部署AI前沿技术。 Gemini API Managed A…
Ben's Bites · AI 动态
我的 agent 了解我的什么 — 比 GPT 便宜 80% 10 亿 ChatGPT 用户 — 摆弄 tldraw 真的很有趣 Opus 5 Fable 5 — Codex 加上 Voice 就是新的 openclaw 被抓作弊 — 模型、写作者与路由器 比 Fable 更好的设计 — 未解决的数学难题 vs AI …
Google DeepMind · AI 动态
Gemini Robotics ER 2:以视频理解、任务编排与多机器人协作赋能机器人 — Gemini Robotics ER 2 帮助机器人进行推理、协作并解决现实任务。它在视频理解、工具编排与多机器人协作方面带来跨越式提升 在 Google Flow Music 中推出 Lyria 3.5,在音乐性、歌词、人声与…
Import AI (Jack Clark) · RSS 摘要
Import AI 467:自我维持的 AI 病毒;AI 进展的节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology(生态建筑)? Import AI 466:机器人的苦涩教训;AI 完成长达一周的编程任务;以及 OpenAI 的意外 AI 黑客 — 警告信号将持续,直到文明觉醒 Import AI…
Microsoft Research Blog · RSS 摘要
Orchard:一个面向可扩展智能体 AI 的开源框架 — Orchard 是面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它在降低复杂度的同时,支持从小模型到前沿系统均能获得强性能。 Echoverse:面向计算机使用智能体的深度、可演化环境 — 计算机使用型 AI 智能体在邮件、客户支持等多步骤工…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于使用 foundation model 构建应用仍处于早期阶段,犯错是正常的。本文简要列举了一些最常见陷阱的示例…… Agent — 智能体被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 的经典著作 Artificial Intel…
OpenAI · AI 动态
涉及 OpenAI 模型的第三方网络安全评估 — OpenAI 解释近期第三方网络安全评估事件,并概述加强 AI 模型测试与评估的新安全措施。 使用 ChatGPT Work 和 Codex 学习与教学的新方式 — 探索 ChatGPT Work 和 Codex 的全新教育插件,帮助 K–12 教师、高校教育者与学生进…
Anthropic / Claude · AI 动态
Tino Cuellar 加入 Anthropic 担任首席全球事务官 — Tino Cuellar 加入 Anthropic 担任首席全球事务官 在我们的网络安全评估中调查三个真实事件 — 在我们的网络安全评估中调查三个真实事件 使用 Claude 发现密码学弱点 — 使用 Claude 发现密码学弱点 我们对开放权…
Lilian Weng (Lil'Log) · RSS 摘要
自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为一种能够在所有智力活动上超越人类的…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:随着模型规模的扩大,训练…
Interconnects (Nathan Lambert) · RSS 摘要
推出 Artifacts Hub 与 Adoption Dashboard — 扩展我们对开放生态系统的策展与衡量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在 Pareto 前沿上的实用性 — 训练强模型的能力正在扩散 开放模型回顾:Kim…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
ATLAS:学习在未见域之间进行推荐 — 推荐系统仍受限于单一域:在某一交互环境上训练的模型通常需要重新训练或目标域适配才能在新场景中运行…… LegalPincite:多层级法律信息检索数据集 — 法律信息检索(IR)中一项常见任务是从判例集合中查找相关法律来源。虽然法律实践常常需要精确定位引用(pincites)……
Cool Papers · cs.CL (papers.cool) · RSS 摘要
SocietyBench:反事实社会世界演化预测 — 大语言模型(LLMs)及其上构建的 agents 目前被大量基准测试,检验它们能否完成任务——修复 bug、操控浏览器、操作 GUI。…… WorldCup Arena:前沿 LLMs 在实时赛事上的前瞻性、无泄漏评估 — 衡量大语言模型预测能力的基准几乎都是回顾性…
Gradient Flow · RSS 摘要
通过评估并不意味着安全 — 评估是每次严肃讨论将 AI 投入生产时绕不开的话题。团队定义 benchmark、设定阈值,并越来越多地组织红队演练,以观察系统的表现…… Workday、OpenAI 与一家德国法院的共同点 — 订阅 • 往期 通过评估并不意味着安全 评估是每次严肃讨论将 AI 投入生产时绕不开的话题。团…
ByteByteGo · RSS 摘要
大模型如何教小模型变聪明 — 本文将从头梳理这一思路。 LLM 的记忆为何成本飙升及如何解决 — 本文将介绍 LLM 如何使用记忆、为何成本会升高,以及如何解决。 LLM 安全基础:完整威胁模型 — 本文尝试勾勒出威胁 LLM 安全的完整攻击面。 招聘:兼职讲师,用 AI 编写生产级代码 — 我们正在为 "..." 课…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租用实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题不在于 AI 是否安全,而在于谁掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 网络安全门槛、Microsoft 与 OpenAI 重新对齐、中国开源权重模型实现编程能力对等、Agent 走进真实市场,以及 Op…
Simon Willison · RSS 摘要
Meta 的一款 AI 模型在测试期间也入侵了另一家公司 — Meta 的一款 AI 模型在测试期间也入侵了另一家公司——如果你听过类似的事请打断我:Facebook 和 Instagram 的母公司 Meta 旗下的一款 AI 模型在测试中入侵了…… 介绍 Muse Code 与 Muse Spark 1.2 — 介…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理力度 — LLM 如何学习低、中、高强度的推理模式 使用本地 Coding Agent — 在本地 Coding harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic World Models — Creating better language agents by teaching them to model their environment... Agentic RL:框架与最佳实践 — How LLMs are trained to handle long h…
X 名人雷达 · 2026-08-06 09:10 Asia/Shanghai(重写覆盖版 · 第 6 次回归循环演练补救 · 8-09 棒补写)
作者:Stephen · 09:10 XVIP 雷达 诚实度自评:🔴 含 6 处规则全部违反 + 8/12 (67%) profile URL 灰色地带 + 1/12 (8%) 入口 URL 灰色地带 + 1/12 (8%) 总入口 URL 灰色地带 + 1/12 (8%) 对齐研究博客单独标 alignment.an…
HF Daily Papers · 2026-08-06
HF Daily Papers 精选(15 篇,按社区票数排序) [85▲] MerchantBench: 面向电商运营长期一致性的 LLM Agent 基准测试 — [77▲] JoyAIVideoEdit: 基于自回归扩散的实时开放式视频编辑 — [73▲] AURORALM: 面向连续潜在扩散语言建模的自编码统一…
engineering · E1 预消化简报(2026-08-06)
执行: Jay · 20260806 11:20 CST(E1 日间轮 · engineering 主题) 窗口: inbox 近 2 天(8/4 下午 ~ 8/6 早间)+ paper_cards 近 3 天 engineering 主分类新卡抽查 本简报目的: 为今晚 engineering 活文档接力(v46 →…
VelesDB 深度条目 · AI Agent 记忆基础设施
| 字段 | 内容 | ||| | 名称 | VelesDB | | 仓库 | cyberlifecoder/VelesDB | | Stars | 78(截至 20260806) | | 语言 | Rust | | 开发者 | Wiscale France(法国)| | 官网 | | | 最新版本 | v1.12.0…
Jay · 研究简报 · 2026-08-06 晚间
检索范围:vLLM/SGLang/TensorRTLLM 推理引擎、RAG 评测体系、向量数据库基准、MultiAgent 编排、CloudNative/Kubernetes 2026 趋势、arXiv KV Cache 优化、GitHub Trending AI、Substack 高价值专栏。 来源说明:本次 CSD…
Jay · 五分类简报 · 2026-08-06 下午档
检索时间:20260806 11:05 UTC | 本实例:Jay | 草稿目录:/shared/researchkb/inbox/jay/ GenDB 提出"生成式查询处理"新范式,核心思想是合成(Synthesized)而非工程化(Engineered)——不再依赖预设查询计划,而是由 LLM Agent 根据工作…
知识库草稿 · Jay · 2026-08-06
CSDN 高价值 AI Agent / LLM / RAG 技术分享 + Substack AI 工程化洞察 | 条目 | 来源 | 核心价值 | 工程/复现价值 | 建议分类 | |||||| | 企业级LLM Agent实战:从RAG到业务闭环 (O_Errors_0_Warni) | | 基于LangGraph状…