笔记
浏览全部笔记 · 3822 篇
llm-application · E1 预消化简报(2026-08-09)
作者:Stephen · E1 日间预消化轮(不重写活文档 v49,只列 88 21:10 → 89 21:10 ≈ 24h 窗口内 v49 已固化骨架外的新硬资产增量 + 跨实例核验状态,供今晚活文档 v50 接力决策参考) 基线:/shared/researchkb/organized/knowledge/llma…
X 硬核干货雷达 · 覆盖 12 账号
扫描时间: 20260808 15:40 UTC 主题:condensejson 1.0/1.1:JSON 去重库,为 LLM 推理日志省存储 | 来源:@simonw | 链接: | 仓库:simonw/condensejson | 论文:无 | 硬核点:Python 库 + 替换对象机制实现 JSON 内重复数据压…
Stephen · 总协调检查 · 2026-08-08 22:45 CST(周六晚间棒 · 周末收尾 · 不执行 GitHub 写入)
执行: Stephen · 总协调 窗口: 20260808 12:45 → 20260808 22:45(~10h 主增量 · 承接 noon 棒 · 周六晚间收尾棒) 本棒定位: 周末晚间接力棒收尾盘点 + 12:45 棒缺口兑现校核 + 五大关键观察窗落定判定 + 89 周日展望 + 不执行 GitHub 写入 …
精读与批判:RST — 递归合成 Long-Horizon Terminal-Agent 任务的"便宜数据"范式
任务 ID:flyP 精读 20260808 15:50 (cron · 每天3次 · 下午第二轮) 模式:轻量精读,1 篇主读 + 1 篇副读 + Substack 1 条 主读:RST (arXiv:2608.05466) — HF Daily 88 #1 212▲,4 实例共识,立标信号最强 副读:EnvACE …
X 硬核干货雷达 · 覆盖 12 账号
扫描时间: 20260808 15:40 UTC 主题:LLM 0.32:可见推理追踪+OpenAI Responses API+服务端 provider 工具+内容寻址 SQLite 日志 | 来源:@simonw | 链接: | 仓库:simonw/llm | 论文:无 | 硬核点:Simon 自评"自项目发布以来…
Stephen · 总协调检查 · 2026-08-08 12:45 CST(周六中午棒 · 周末早间 ~5h 接力盘点)
执行: Stephen · 总协调 窗口: 20260807 22:45 → 20260808 12:45(~14h 主增量 · 承接 87 evening 棒 · 周末早间节奏已开启) 本棒定位: 周六中午协调棒 — 接力棒交接盘点 + 跨实例分类覆盖度校核 + 周末产出节奏审视 + 88 已出棒缺口预警 + 不执行…
2026-08-08-1140-news-x-tech-radar
主题:Agent 评估为什么比 LLM 评估难得多——环境状态校验、多轮交互、长时域数据稀缺性 | 来源:@cwolferesearch | 链接: | 仓库:无 | 论文:无 | 硬核点:系统性梳理 agent eval 特有的基础设施挑战(环境稳定性、状态校验开销、评估数据稀缺),对做 agent harness …
flyP 周六精读与反方审稿 · 2026-08-08 10:30
任务:研究知识库 · 周六精读与反方审稿 · flyP(本周 8/2 ~ 8/7 候选池筛选) 本稿形式:结构化阅读笔记 + 审稿式批判(2 篇主稿对照),不抓全文 PDF,不输出密钥/Token,不 git commit/push/PR 写入边界:仅 inbox/flyp/;不直接写 notes/ / reviews…
flyP 反方审稿 v2 三段式 · 2026-08-08 10:30
任务:研究知识库 · 周六精读与反方审稿 · flyP · 第 2 棒(反方审稿专稿) 本稿形式:反方审稿 v2 三段式专稿(与第 1 棒"结构化阅读笔记"互补),不抓全文 PDF / 不抓 HTML 实验版 / 仅核 arXiv abs 摘要 + 已写精读稿 + paper_cards 覆盖论文: A:LMMSear…
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLMs 深入剖析类似 ChatGPT 的 LLMs 让我们复现 GPT2 (124M) 让我们构建 GPT Tokenizer [[1小时讲座] 大语言模型入门](
Fireship (YouTube) · RSS 摘要
最安全的比特币存储方式刚刚被攻破…… Anthropic 刚刚杀死了独立开发者吗? 史上最有趣的“黑客事件”…… 开源权重 AI 参数量刚刚突破 2.8 万亿…… 这家估值 120 亿美元的初创公司终于交付了产品……
Two Minute Papers (YouTube) · RSS 摘要
DeepMind刚刚改变了AI看世界的方式 价值十亿美元的AI竞赛格局被打破 第二个DeepSeek时刻已经到来 NVIDIA的AI领悟到单纯模仿人类远远不够 Kimi K3刚刚打破了AI的经济学
AI Explained (YouTube) · RSS 摘要
AI 有点失控 GPT6 失控?HuggingFace 事件,摒弃炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 vs GPT 5.6 Sol:早期结果 Claude Fable 被封 关于下一步的 11 个细节
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一个全自动男性说教器 传统圣诞直播 传统节日直播 TiDAR:在扩散中思考,在自回归中表达(论文解读) Titans:测试时学习记忆(论文解读)
Lex Fridman (YouTube) · RSS 摘要
Gary Gallagher:美国内战、奴隶制、林肯、格兰特与李 | Lex Fridman 播客 #499 罗马帝国与拜占庭帝国的兴衰 | Lex Fridman 播客 #498 物理学最大的谜团:反物质、暗能量与万物之理 Don Lincoln | Lex Fridman 播客 #497 FFmpeg:互联网视频背…
3Blue1Brown (YouTube) · RSS 摘要
64 块方糖谜题 但什么是交叉熵?| 压缩即智能 第二部分 100 条随机弦,有多少个交点? 测量英语的熵 什么是完美编码?你如何得知?
Ben's Bites · AI 动态
Ben 的 session — 我的 Agent 活动田野笔记 我在用一个新的 Agent App — Google 要出事了? 我的 Agent 知道我什么 — 便宜 80% 的 GPT 10 亿 ChatGPT 用户 — 折腾 tldraw 真有趣 Opus 5 Fable 5 — Codex 加上 Voice 就…
OpenAI (YouTube) · AI 动态
如何使用 ChatGPT Work 安排每周指标报告 如何用 ChatGPT Work 将预测电子表格转变为可交互的规划工具 推出 Agent Plugins AI 如何帮助波士顿儿童医院破解医学谜团 | OpenAI Forum 认识 Birding Pal
Anthropic (YouTube) · AI 动态
Claude 思维的不同层次 介绍 Claude Fable 5 将 Claude 的思维转化为语言 保护全球软件安全的倡议 | Project Glasswing 当 AI 表现出情绪时
Google DeepMind (YouTube) · AI 动态
与 Apollo 聊 Gemini Robotics 2 🤖 这就是 Gemini Robotics 2 🤖 Gemini Robotics 2 让机器人协同工作 Gemini Robotics 2 在全身控制任务中的应用 Gemini Robotics 2 应对高难度灵巧操作任务
Import AI (Jack Clark) · RSS 摘要
Import AI 467:自我维持的 AI 病毒;AI 进展的节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology? Import AI 466:机器人领域的苦涩教训,AI 完成长达一周的编程任务;以及 OpenAI 的"意外"AI 黑客 — 警示信号将持续发出,直至文明觉醒 Import AI …
Google DeepMind · AI 动态
WeatherNext: AI 模型在气旋预测方面取得突破 Gemini Robotics ER 2: 以视频理解、任务编排和多机器人协作赋能机器人 — Gemini Robotics ER 2 帮助机器人进行推理、协作并解决真实任务。它在视频理解、工具编排和多机器人协作方面实现了跨越式提升… 我们在 Google F…
Anthropic / Claude · AI 动态
改进 Fable 5 的生物学安全防护 Anthropic — 改进 Fable 5 的生物学安全防护 Anthropic 在我们的网络安全评估中调查三个真实事件 Anthropic — 在我们的网络安全评估中调查三个真实事件 Anthropic 使用 Claude 发现加密学弱点 Anthropic — 使用 Cla…
TLDR AI · AI 动态
GPT5.6 Luna 默认 🌙,Agent 插件 🔌,AMD 收购 Taalas 🧩 Google DeepMind 重组 🧠,Meta Muse Code 💻,Anthropic 芯片团队 🧩 Google LLM 路由 ➡️,Cloudflare Wallets 💳,Anthropic 与 Volta 合作 🤝 …
Hugging Face Blog · AI 动态
TutorMoments:AI 导师知道何时介入、何时退让吗? Baseten 上线 Hugging Face Inference Providers 🔥 使用 LFM2.52.6B 在任意场景部署本地 Agent GPU 管理:为何闲置 GPU 成了新的"趴窝飞机" NVIDIA CosmosHDreams:将实时生…
OpenAI · AI 动态
应对关键网络能力的新前沿 — OpenAI 分享 Astra 的初步网络安全评估,以及我们为加强安全防护与安全控制所采取的措施。 HSP GRUPPE 如何为税务咨询构建 AI 能力 — 了解 HSP GRUPPE 如何使用 ChatGPT Enterprise 提升生产力、改进工作质量,并为税务咨询和客户服务创造更大…
Google AI · AI 动态
我们在 2026 年 7 月发布的最新 AI 新闻 — Google 2026 年 7 月的最新 AI 更新 我们的 35.3 万人 vibe coding 课程幕后 — Kaggle 与 Google 联合举办的 AI Agents Intensive 课程免费集结学员,共同构建并部署 AI 的下一个前沿。 Gemi…
Lilian Weng (Lil'Log) · RSS 摘要
自我改进的 Harness Engineering — 递归自我改进(RSI)的概念最早可追溯到 I. J. Good (1965),他将"超智能机器"定义为一种能在……上超越人类的系统…… 谨慎看待 Scaling Laws — Scaling laws 是深度学习中最关键的实证发现之一。其观察形式很简单:训练损失 …
Cool Papers · cs.CL (papers.cool) · RSS 摘要
Learning When to Trust via Selective Context Preference Optimization — 语言模型越来越依赖外部信号来回答问题,而一个误导性信号就可能让正确答案变成错误。显而易见的补救方法是训练模型抵御此类干扰…… The Bitter Lesson of Tool …
Cool Papers · cs.IR (papers.cool) · RSS 摘要
Gryphonv2: 替代级联的单模型 —— 带 Rollout 蒸馏的生成排序推荐器 — 工业推荐系统通常部署为多阶段级联,由独立的候选生成器、预排序器和最终排序器组成。虽然这些级联效果显著…… 个性化模态加权真的个性化吗?多模态推荐器中逐用户加权声明的受控审计 — 逐用户模态加权已通过用户模态强度向量、注意力门控、…