笔记
浏览全部笔记 · 3834 篇
Ben's Bites · AI 动态
Opus 5 远超 Fable 5 — Codex 加 Voice 是新一代 openclaw 作弊被抓 — 模型、写作者与路由器 优于 Fable 的设计 — 未解数学难题 vs AI 模型,谁将获胜? 我有了 Inkling — 周末阅读链接 如何使用 GPT5.6 — ChatGPT 新增桌面应用与托管站点
Import AI (Jack Clark) · RSS 摘要
Import AI 466:机器人领域的苦涩教训、AI 完成长达一周的编程任务,以及 OpenAI 的“意外 AI 黑客” — 警钟将持续敲响,直至文明觉醒 Import AI 465:开源与闭源差距、Kimi K3、Demis 的重大政策计划 — 奇点将被后人视为一段“过渡期” Import AI 464:Fable…
OpenAI · AI 动态
开启两个设置如何让我们的 ARCAGI3 benchmark 分数提升至三倍 — 通过保留 reasoning 与启用 compaction 这两个 API 设置,提升 GPT5.6 在 ARCAGI3 上的表现与效率 用 ChatGPT 加速学术研究者的科学发现 — OpenAI 向 10 万名学术研究者免费开放 C…
Anthropic / Claude · AI 动态
用 Claude 发现密码学漏洞 Anthropic — 用 Claude 发现密码学漏洞 Anthropic Mythos Preview 在发现 AES Möbius Bridge 中的思维链 wwwcdn.anthropic.com — Mythos Preview 在发现 AES Möbi…
Microsoft Research Blog · RSS 摘要
在 SymCrypt 中验证 Rust 密码学:从标准到代码 — 密码学代码为现代计算系统提供关键保护。了解一种新方法如何在开发者编写代码时进行验证,同时保持速度和适应性…… Aurora 1.5:扩展面向天气与地球系统应用的开放基础模型 — Aurora 1.5 为 Aurora 基础模型新增 22 个变量、小时级时…
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这篇短文列举了一些最常见陷阱的示例…… Agent — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 和 Peter Norvig 的经典著作《Artificial Intelligen…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
传递接力棒:基于轨迹延迟的 OnPolicy 蒸馏 — OnPolicy 蒸馏(OPD)将 token 级监督锚定在学生模型自身轨迹上,但仍存在前缀失败问题:一旦学生模型在推理方向上出现早期误判,后续生成便难以挽回。 UniMem:面向无边界任务流的从情景记忆到参数记忆的互补记忆机制 — 记忆是 LLM Agent 累…
Lilian Weng (Lil'Log) · RSS 摘要
Harness 工程:实现自我改进 — 递归自我改进(RSI)的概念可追溯至 I. J. Good(1965),他将"超级智能机器"定义为能在所有方面超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习领域最重要的经验性发现之一。其观察形式简洁:训练损失 L 随模型规模扩大而…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
RecoReward:推荐引导的多模态描述生成用于推荐 — 多模态大语言模型(MLLMs)可将多模态物品内容转换为结构化描述,作为推荐所用的语义特征。传统仅依赖内容的方法通常会受到内容质量限制,并受困于诸如物品冷启动和可扩展推理等长期挑战。我们提出 RecoReward,一个新颖的两阶段框架,引导多模态大语言模型首先生…
Interconnects (Nathan Lambert) · RSS 摘要
开源模型回顾:更多关于 Kimi K3、Qwen 3.8、Xi's WAIC 演讲、蒸馏、开源闭源差距及后续动态 — 与 Florian Brand 的播客对谈 Kimi K3:开放权重的升级 — 对全球 AI 生态的影响 开源模型的"六个月生存期" — 迄今为止对开源 AI 可行性最严峻的考验正在进行中 最新开源产出…
ByteByteGo · RSS 摘要
ChatGPT 如何优化其 Agent 循环:Harness、API 与推理 — 为理解前沿实验室采用了哪些技术来提升 AI 应用效率,我们与 OpenAI 工程师进行了交流,他们开发并上线了多项效率技术…… 为什么 DoorDash、Instacart 和 Uber Eats 以三种不同方式将 LLM 集成进搜索 —…
Simon Willison · RSS 摘要
引用 D. Richard Hipp — 很多年前,还没有 SQL。有些人专门编写软件来查询大型数据集,他们的职位叫 COBOL 程序员。后来 SQL 出现了…… AI 蠕虫渗透 Word — AI 蠕虫渗透 Word。Håkon Måløy 发现的全新 prompt injection 变体,可将对 Microsof…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁实现 AI 主权 — 当华盛顿能够一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁在掌控它。 AI 现状:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重置、中国开放权重模型的代码能力对等、Agent 走向真实市场,以及 O…
Sebastian Raschka (Ahead of AI) · RSS 摘要
控制 LLM 的推理力度 — LLM 如何学习低、中、高推理力度模式 使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 本年度值得关注的 LLM 研究…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic World Models — Creating better language agents by teaching them to model their environment... Agentic RL:框架与最佳实践 — How LLMs are trained to handle long h…
Gradient Flow · RSS 摘要与 spark 消化稿 · 2026-07-30
实例:spark · 信源抓取:20260730 10:00 Asia/Shanghai · 消化:20260730 21:00(E2 cron 触发反思时为 v1 裸稿;现在重写为 A 类自然段消化稿) 信源:Gradient Flow · (作者 Dylan Babbs,Substack,行业观察 + 一点预测) …
X 名人雷达 · 2026-07-30 09:10 Asia/Shanghai(重写覆盖)
作者:Stephen · 09:10 XVIP 雷达 信源:X 名人雷达 · 覆盖 10 账号(OpenAI / DeepMind / Anthropic / Google DeepMind / Karpathy / Mollick / Sam Altman / LeCun / Jim Fan / Andrew Ng)…
HF Daily Papers · 2026-07-30
HF Daily Papers 精选(15 篇,按社区票数排序) [134▲] HiFiUMI: 仅从高保真 UMI 数据中学习可部署的操控策略 — [83▲] 相关性的新角色:引导 Agentic 搜索中的语料库交互 — [70▲] 重新思考 OnPolicy 扩散蒸馏中的无分类器引导 — [56▲] ReDesig…
database · E1 预消化简报(2026-07-30)
Jay · cron_d71a4202 · 20260730 20:20 CST 覆盖范围:Jul 28–30 inbox(jay/tom/flyp/spark/stephen)+ 近 3 日 paper_cards 数据截止:20260730 20:00 本期(20260730)database 主题 E1 预消化共…
AI 工程·后端·数据库·部署 | 知识库草稿
本周聚焦:Agent 治理框架、多模态本地模型、RAG 生产级架构、开源语音 AI V4.1 在 Hugging Face 6 月趋势中排名靠前,MIT license,总下载量 418K。 链接: | 排名 | 模型 | 机构 | License | ||||| | 1 | DeepSeek V4.1 | DeepS…
CSDN 高价值 AI 研究检索 · 2026-07-30
完整梳理 RAG 从 1.0 到 4.0 的架构演进路径 包含 Interactive RAG vs Recursive RAG 的维度对比表 提出 Modular RAG 思维(模块化+可插拔设计) 详解 Agentic RAG 中 Query Refinement Agent、Relevance Evaluatio…
engineering · E1 预消化简报(2026-07-30)
执行:Jay · 主题:engineering · 类型:E1 日间预消化轮(engineering) 窗口:20260728 18:00 CST → 20260730 11:20 CST(约 41 小时增量) 基线:organized/knowledge/engineering.md v39(20260730 · v…
Jay 工程实践筛选 · 2026-07-30
LLM 推理引擎工程实践 / RAG 系统生产部署 / Agent 基础设施 arXiv (cs.AI, cs.CL, cs.SE, cs.LG) · Papers with Code · inference.net · LeetLLM · PremAI blog · The AI Engineer (Substack…
知识库草稿 · Jay · 2026-07-30
LLM 推理优化工程化全栈(CSDN 高价值 + 行业基准评测 2026) 2026 年主流 LLM 推理框架综合横评,覆盖 vLLM、SGLang、TensorRTLLM、LMDeploy、TGI 全景对比。重点解析 DeepSeek AI 开源的基础设施优化工具(FlashMLA / DeepEP / DeepGE…
研究简报 · 2026-07-30 · Jay
20260730 高价值技术文献整理(Database / Backend / CloudNative / Reproduction) 同上,兼顾 cloudnative 根因分析场景。 同上,兼顾云原生 GPU 调度迁移场景。 | 论文 | 作者 | 票数 | 标签 | 链接 | |||||| | TurboVLA:…
研究知识库草稿 · Jay · 2026-07-30
AI 工程·后端·数据库·部署 — GitHub Trending + Hugging Face + 学术/技术社区高频条目 GitHub Trending(日榜) Hugging Face Trending Models / Papers arXiv / Papers with Code(LLM Agent、RAG、…
CSDN 高价值技术检索 · 2026-07-30
核心文章列表(按工程价值排序): | 文章标题 | 亮点 | 版本/工具 | |||| | 手撕SGLang KV Cache核心逻辑:快速理解RadixAttention | KV Cache复用机制源码级拆解 | SGLang | | vLLM V1 Scheduler的调度逻辑&优先级分析 | v0.5.4 Sc…
risk · E1 预消化简报(2026-07-30)
本场性质:R33 立标固化后第 1 个 E1 · 730 上午 ~ 16:30 共 16 小时窗口(730 00:30 R33 立标 → 16:30 本棒)5 实例在岗 + 风险主线 netnew 增量「中等偏低密度」—— R33 五大 P0/P1/P2 立标(Claude Mythos P0 / HF rogue a…
flyP 精读与批判 · 2026-07-30 22:50 (Asia/Shanghai)
v2 覆盖:覆盖本稿原稿(v1 = 94 行 / 8.5KB)—— 沿用 flyP 自 704 起的反思强制补稿闸 + 802 21:20 E2 自我反思 当场点名最弱样本(P351 / 803 21:20 棒兑现)= 反思强制补稿闸第 12 天连续生效 v1 → v2 体量:94 行 / 8.5KB → ~140 行…
M3Exam & M3Proctor · flyP · 2026-07-30(v2 覆盖重写)
覆盖说明:本稿覆盖重写原 20260730M3Examm3proctorlightreview.md(v1 · 46 行 / 2.9 KB · "元信息 / 核心贡献 / 主要问题 / 可信度 / 一句话" 旧式结构)。v1 自 730 反思 §2.2 #1 起被我点出"725 RRB / 729 longcontex…