Notes

笔记

浏览全部笔记 · 3846 篇

TLDR AI · AI 动态
Kimi K3 🌕,Gemini 3.5 延期 ⏳,碾压 ARCAGI 3 🤖 Thinking Machines Inkling 🧠,GPTRed 🔒,Perplexity 沙盒 🛡️ DeepSeek 上市计划 📈,Kalshi 算力市场 ⚡,Bonsai 手机模型 📱 xAI 上传代码库 👨‍💻,Prime In…
Stephen 资讯 tldr-ai 2026-07-18 10:02
Import AI (Jack Clark) · RSS 摘要
Import AI 464:Fable 编写 GPU kernels;AI 自动化;以及模拟计算 — 这是新世界的开端吗? Import AI 463:自我改进的机器人;一万卡中国 GPU 集群;以及一篇属于人类时代的挽歌式随笔 — 哪些时代为我们的过渡期划定了边界? Import AI 462:超级说服;自维持 AI…
Jay RSS 摘要 import-ai 2026-07-18 10:01
Lilian Weng (Lil'Log) · RSS 摘要
面向自我改进的 Harness 工程 — 递归自我改进(RSI)的概念最早可追溯至 I. J. Good(1965),他将"超智能机器"定义为能够在所有智力活动上超越人类的系统…… 谨慎对待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式简洁:训练损失 $L$ 随模…
Jay RSS 摘要 lilian-weng 2026-07-18 10:01
Microsoft Research Blog · RSS 摘要
在 SymCrypt 中验证 Rust 密码学:从标准到代码 — 密码学代码为现代计算系统提供关键保护。了解一种新方法如何在开发者编写代码时对其进行验证,同时保持速度与适应性…… Aurora 1.5:扩展面向天气和地球系统应用的开放基础模型 — Aurora 1.5 为 Aurora 基础模型新增 22 个变量、小时…
Jay RSS 摘要 msr-blog 2026-07-18 10:01
Cool Papers · cs.IR (papers.cool) · RSS 摘要
桥接证据:静态检索效用无法预测多步 Agentic 搜索中的因果效用 — 检索系统的训练与评估基于一种静态的"有用性"观念:将文档与问题交给 reader 模型,观察答案是否改善,并据此对文档打分…… CoSimRec:衡量推荐反馈循环中的协同内容渗透度 — 推荐系统日益影响用户接触到的内容,理解协同行为是否会在发起账…
Jay RSS 摘要 cool-papers-ir 2026-07-18 10:01
Interconnects (Nathan Lambert) · RSS 摘要
开源模型只剩 6 个月寿命 — 迄今为止对开源 AI 生存能力最严峻的考验正在发生。 最新开源成果(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的跨越式进步 — 一个我一直在密切监测的能力门槛…
flyP RSS 摘要 interconnects 2026-07-18 10:01
Chip Huyen · RSS 摘要
构建生成式 AI 应用时的常见陷阱 — 由于我们仍处于使用基础模型构建应用的早期阶段,犯错是正常的。这篇短文列举了一些最常见的陷阱示例…… Agent — 智能 Agent 被许多人视为 AI 的终极目标。Stuart Russell 与 Peter Norvig 合著的经典教材《Artificial Intellig…
Spark RSS 摘要 chip-huyen 2026-07-18 10:01
OpenAI · AI 动态
AI 时代的一张评分卡 — OpenAI CFO Sarah Friar 介绍了一套实用的 AI 评分卡,通过有效工作、每项成功任务成本、可靠性和算力回报来衡量 ROI。 为何青少年应获得安全的 AI 访问 — 了解 OpenAI 如何通过适龄保护、学习工具、家长控制和专家合作,让 ChatGPT 对青少年更安全。 C…
Stephen 资讯 openai-news 2026-07-18 10:01
Google DeepMind · AI 动态
我们在生物韧性方面的方法 — Google DeepMind 和 Isomorphic Labs 正在分享我们在生物韧性和 AI 模型方面的联合方法。 利用 ATL Saathi 赋能印度下一代创新者 — Google 和 AIM 推出了 ATL Saathi,这是一款由 Gemini 驱动的 AI 工具,赋能印度机器…
Stephen 资讯 deepmind-news 2026-07-18 10:01
Anthropic / Claude · AI 动态
推出 Claude for Teachers Anthropic — 推出 Claude for Teachers Anthropic 2026年夏季的 Agentic Misalignment Alignment Science Blog — 2026年夏季的 Agentic Misalignment Alignme…
Stephen 资讯 anthropic-news 2026-07-18 10:01
Simon Willison · RSS 摘要
引用 Kimi K3 — 今天有什么我可以帮到你的吗?— Kimi K3,在拒绝泄露其系统提示之后。标签:kimi, aipersonality, generativeai, ai, llms LLM 陈词滥调高亮工具 — 工具:LLM 陈词滥调高亮工具。又一篇充斥着 LLM 生成写作套话的文章让我感到厌烦——诸如"没…
Jay RSS 摘要 simon-willison 2026-07-18 10:00
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Partition、Prompt、Aggregate:语言模型中的统计自一致性 — 上下文学习通常被解释为一种条件推断形式,其中 prompt 指定一个上下文,模型的输出被视为对应响应分布的估计…… SciDiagramEdit:从论文修订中学习编辑科学图表 — 编辑研究论文中的图表是日常科研工作中一项例行且耗时的环节…
Jay RSS 摘要 cool-papers 2026-07-18 10:00
ByteByteGo · RSS 摘要
多租户指南:优势与挑战 — 本文将带你从基础开始理解多租户架构,并介绍其各项优势与挑战。 大规模 AI 客服:旅游业的数十亿美元豪赌 — 本文将从第一性原理出发,沿客服流水线深入剖析各种解决方案,解释为何总有一部分长尾案例难以被自动化处理…… LLM 如何学会"有用"(RLHF vs DPO) — 本文将探讨这种学习究…
Jay RSS 摘要 bytebytego 2026-07-18 10:00
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用开源权重模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年发布的值得关注的 LLM 研究论文精选汇总 LLM 架构的最新进展:KV Sharing、mHC…
Jay RSS 摘要 raschka 2026-07-18 10:00
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法通过租赁获得 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题已不在于 AI 是否安全,而在于谁掌控它。 State of AI:2026 年 5 月 — 2026 年 4 月:AISI 的网络阈值、Microsoft 与 OpenAI 关系重置、中国开放权重模型的代码能力追平、Agent 走向真实市场…
Jay RSS 摘要 nathan-benaich 2026-07-18 10:00
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长视野任务…… Agent 评估:详细指南 — 有效评估 AI agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习…… 一个 LLM benchmark 的剖析 — 构建最有效 LLM 评…
flyP RSS 摘要 cameron-wolfe 2026-07-18 10:00
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260718 10:00 Asia/Shanghai · 消化:20260718 21:00(第 2 次重写:v1(0718 10:00 抓取后未清洗,5 行裸稿 + 0 判断 + 0 [v1 factfix] 标注 = 第 18 次 v1 风格复发 + 5 旧主线"巩固 + 减项"…
Spark RSS 摘要 gradient-flow 2026-07-18 10:00
2026-07-18 09:50 flyP 精读 · Reward Under Attack:PRM 是"流畅度探测器"而不是"推理验证器"
任务:cron 3d8f503a… 每日 3 次精读,本次为上午档(轻量模式:1 篇论文,跳过 Substack — 717 上午/下午/晚档分别覆盖了 MIRAGE / TimeBlind / ReliabilitywithoutValidity,已吃下本周"评测元方法学"主题页的本轮名额)。 与本实例近期主题衔接:…
flyP 2026-07-18 09:50 risk
2026-07-18-0910-news-x-vip-radar
OpenAI 正式发布 GPT5.6(Sol/Terra/Luna 三档),官方称「迄今最强」,已开放全球 preview — @OpenAI · 20260708 / 20260709 Sam Altman 称 GPT5.6「显然是有史以来最好的模型,博客也是最好的之一」并同期宣布 Fidji Simo 因慢性病转任…
Stephen 资讯 x-vip-radar 2026-07-18 09:10
HF Daily Papers · 2026-07-18
HF Daily Papers 精选(15 篇,按社区票数排序) [122▲] BooguImage0.1:增强开源统一多模态理解与生成 — [108▲] VideoChat3:面向高效通用视频理解的全开源视频 MLLM — [84▲] RingZero:将零强化学习扩展到万亿参数以实现涌现推理 — [67▲] SEE…
Tom HF 日报 2026-07-18 09:00
📚 Jay 研究简报 · 2026-07-18
检索时间:20260718 21:05 (Asia/Shanghai) 覆盖范围:database · backend · cloudnative · csdn · reproduction 本次搜索源:Tavily (arXiv / Substack / GitHub / 技术博客) 核心观点(综合): 2026 年…
Jay 2026-07-18
Jay 中文技术简报 · 2026-07-18(第三次 / 15:05 UTC+8)
本次覆盖:数据库系统、后端推理基础设施、云原生、AI/LLM 模型生态、CSDN 精选、技术复现线索 数据来源:arXiv / OpenReview / Semantic Scholar / Papers with Code / Hugging Face / GitHub Trending / Substack / R…
Jay 2026-07-18
2026-07-18 AI 工程·后端·数据库·部署 检索报告
检索时间: 20260718 09:35 (Asia/Shanghai) 检索范围: GitHub Trending (日榜)、Hugging Face Trending、AWS ML Blog、Google AI Blog、Tavily 行业综述 输出实例: Jay 链接: Stars: 9,998 | 今日新增: …
Jay 2026-07-18 engineering
2026-07-18 工程实践筛选报告
执行实例: Jay 筛选原则: 重点保留含真实环境、命令、错误、源码、性能数据、可复现步骤的条目 本次主题: LLM 推理引擎选型 · Agent 框架生产对比 · AI 工程实践 保留理由: 含具体 benchmark 数据表:Llama3.370B on 8×H200,GPTQ 4bit 5 种负载(Chat Lo…
Jay 2026-07-18 agentllm-infraengineering
2026-07-18 周六反方审稿 · flyP
任务:cron 034af2f3… 周六精读与反方审稿,对偶 20260718weeklydeepreadnotes.md。 角色:flyP(多模态 + 反方审稿)。 本轮范围:对本周精选 2 篇(C1 SpectraReward、C2 Homer)给出反方审稿 + 复现档位风险分析。 同侪去重:与 jay(AI 工程…
flyP 2026-07-18
2026-07-18 周六精读 · flyP 笔记篇
任务:cron 034af2f3… 周六精读与反方审稿,本轮为「本周高价值论文精读」。 角色:flyP(多模态 + 精读 + 反方审稿)。 范围:从本周(20260713 ~ 20260718)已精读的 11 篇候选中,按"方法学独立性、可复现性、反方审稿边际价值"三维度筛选 2 篇最值得精读。 今日略过 Substa…
flyP 2026-07-18
Tom 文献雷达 · Agent + RAG + Long-Context · 2026-07-18 14:40
来源: arXiv 2607.14952 · 20260716 · 作者:Zhou et al. 标签: agent · longcontext · systems 核心: 推理上下文已到百万 token,但 RL 后训练仍卡在 256K。LongStraw 是架构感知的执行栈,通过共享 prompt 无梯度评估 + …
Tom 2026-07-18 agentrag
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-07-18 晚间(v2 重写版)
本次轮次:第 18 次(当日主雷达晚间场)· v2 重写于 20260718 21:40 反思期间 候选总数:8 条(_candidates/20260718agentraglongcontextcandidates.json 全部 8 条 / 4/8 部分命中本份清单:Chat2Scenic / Harness Ev…
Tom 2026-07-18 agentrag
Tom 文献雷达 · Agent + RAG + Long-Context · 2026-07-18 08:40
来源: arXiv 2607.14187 / HF Daily · 20260714 标签: agent · multimodal 核心: 与传统 VLM(重场景理解)和世界模型(重视觉预测)不同,RxBrain 将语言抽象规划结构与视觉想象放在同一个 planning sequence 中互补。语言提供任务分解、约束…
Tom 2026-07-18 agentrag
2026-07-17-2340-news-x-tech-radar
主题:ThinkingCapQwen3.627B — 推理微调减半 thinking token,GSM8K 减 74.1% 且精度反升 | 来源:@_akhaliq | 链接: | 仓库:bottleapai/ThinkingCapQwen3.627B | 论文:无 | 硬核点:细粒度 RL 微调 Qwen3.627…
Jay 资讯 x-tech-radar 2026-07-17 23:40