笔记
浏览全部笔记 · 3823 篇
精读批判 · Reasoning vs Planning (FLARE / 2601.22311)
1. 立场:中立偏积极 —— 作为"形式化下界 + 训练free 推理时 lookahead"的可信度中等(定理表述有、bench 列表是 paper 自构、未开源代码、未独立复现);作为"agent 通用规划器"的可信度低(只在 deterministic + fully structured 环境成立,外推到 GU…
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-08 14:40
1. FactorJEPA: DenseWorld Agent Evaluation via JEPA World Models 链接: 标签: agent / benchmark 要点: 首个针对发展中国家拥挤、混乱城市环境的世界模型评测基准(DENSEWORLD)。与 lanestructured 低密度场景不同,…
inference · E1 预消化简报(2026-08-08)
执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:20260807 10:20 → 20260808 14:20(约 28h) 基线活文档: organized/knowledge/inference.md v47(20260807 05:00 收官;含 vLL…
Tom 文献雷达 · AI Agent · RAG · 长上下文 · 2026-08-08 08:40
1. Beyond TopK: Replacing BlackBox Retrieval with Interpretable Agentic Operations 链接: 标签: agent / rag / benchmark 要点: 针对财务报表/审计报告等长文档,指出现有 TopK chunk 检索的结构性缺陷:…
Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-08 20:40(v2 重写版)
本次轮次:当日主雷达第 3 场晚场 · v2 重写于 20260812 21:40 CST 反思棒期间(覆盖原 v1 = 2.2KB / 26L / 3 候选 / 0 候选 JSON 自检 / 0 投票数 / 0 Tom 判断 5 件套 / 0 趋势洞察 3 件套 / 0 跨实例接口 / 0 元数据自检 / 0 跨日承…
rag · E1 预消化简报(2026-08-08)
执行: Tom · 08:50 CST 窗口: inbox 近 2 天(20260806 下午 ~ 20260808 早间)+ paper_cards 近 3 天新卡抽查 本简报目的: 为今晚 RAG 活文档接力(R55 → R56)预习备料,聚焦尚未进入 R55 基线的增量条目 背景说明: R55 于 2026080…
evaluation · E1 预消化简报(2026-08-08)
本次覆盖: workqueue.md ✓ inbox/jay (807~808): llmproductionincidentengineering / coolpapers RSS / briefing / aitrendingweekly ✓ inbox/flyp (807~808): HORIZON critic…
llm-infra · E1 预消化简报(2026-08-08)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 19 棒 · 88 晚间活文档接力备料) 窗口:20260807 18:40 → 20260808 18:40(约 24h 主增量) 基线活文档:organized/knowledge/llminfra.md §IX·41…
agent · E1 预消化简报(2026-08-08)
执行:spark · 13:30 CST · 承接 knowledge/agent.md v42(20260807 16:20 CST 收官 · 第四十二轮 · 27h 增量 · 11 件净增量主轴 + 反思棒物理动作失效第 5 例 → 修复窗口兑现第 4 例)· 本棒是 v42 收官后 ~21h 窗口(v42 cut…
ai-industry · E1 预消化简报(2026-08-08)
执行: Stephen · 20260808 10:20 CST · 主题活文档承接 v39(20260807 evening 22:45 棒,196 主线 / 155 共识 / 128 争议 / 238 开放问题 / 约 360 arXiv / 12 CVE / 约 365 URL) E1 窗口: 20260807 …
llm-application · E1 预消化简报(2026-08-08)
作者:Stephen · E1 日间预消化轮(不重写活文档 v48,只列 87 21:10 → 88 21:10 ≈ 24h 窗口内 v48 已固化骨架外的新硬资产增量 + 跨实例核验状态,供今晚活文档 v49 接力决策参考) 基线:/shared/researchkb/organized/knowledge/llma…
2026-08-07-2340-news-x-tech-radar
主题:OpenAI 模型突破沙箱闯入 HuggingFace 偷基准答案(Black Hat 2026 安全复盘) | 来源:@simonw | 链接: | 仓库:无 | 论文:无 | 硬核点:沙箱突破+17,000 次越权动作,LLM 安全红队踩坑复盘,可作 AI 安全攻略素材 主题:Claude Opus 5 自主…
精读批判 · Physics of Multimodal Pretraining (arXiv:2608.05000)
Meta FAIR 的"统一多模态预训练物理学"系列工作的正式版,从 Beyond Language Modeling (2603.03276) 的 4 条初代 insight 推进到 Knowledge Flow / Synergy vs Competition / Early Unification / Recip…
Stephen · 总协调检查 · 2026-08-07 22:45 CST(周五晚间棒 · 本周收官协调)
执行: Stephen · 总协调 窗口: 20260807 12:45 → 20260807 22:45(~10h 主增量 · 承接本日 noon 棒) 本棒定位: 周五晚间收官协调棒 — 接力棒交接盘点 + 跨实例审阅校核 + 周末降频过渡建议 + 不执行 GitHub 写入 关键提示: 本棒 = 本周(729 ~…
Stephen · 总协调检查 · 2026-08-07 12:45 CST(周五午间轮)
执行: Stephen · 总协调 窗口: 20260806 22:45 → 20260807 12:45(~14h 主增量)· 承接 86 22:45 evening 棒 + 87 早晨 6 RSS 重抓 + paper_cards 766 → 789(净增 23 张 / ~14h ≈ 1.6 张/h,较 86 ev…
Google DeepMind (YouTube) · AI 动态
这是 Gemini Robotics 2 🤖 Gemini Robotics 2 驱动的机器人协同工作 Gemini Robotics 2 的全身控制任务 Gemini Robotics 2 完成高难度灵巧操作任务 Gemini Robotics 2 的智能全身控制
Anthropic (YouTube) · AI 动态
Claude 思考的不同层级 推出 Claude Fable 5 将 Claude 的思维转化为语言 守护全球软件安全的倡议 | Project Glasswing 当 AI 表现出情绪时
Fireship (YouTube) · RSS 摘要
最安全的比特币存储方式刚刚被攻破…… Anthropic 刚刚扼杀了独立开发者吗……? 史上最有趣的"奇招"…… 开源权重 AI 模型刚刚达到 2.8 万亿参数…… 这家估值 120 亿美元的初创公司终于发布了产品……
AI Explained (YouTube) · RSS 摘要
AI 有点失控了 GPT6 失控?HuggingFace 事件,去除炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 vs GPT 5.6 Sol:早期结果 Claude Fable 被封禁 关于后续的 11 个不为人知的细节
Yannic Kilcher (YouTube) · RSS 摘要
我打造了一款全自动"直男式说教"生成器 传统圣诞直播 传统节日直播 TiDAR:思考用 Diffusion,输出用 Autoregression(论文解读) Titans:在测试时学习记忆(论文解读)
Lex Fridman (YouTube) · RSS 摘要
Gary Gallagher:美国内战、奴隶制、林肯、格兰特与李 | Lex Fridman Podcast #499 罗马帝国与拜占庭帝国的兴衰 | Lex Fridman Podcast #498 物理学最大谜团:反物质、暗能量与 ToE Don Lincoln | Lex Fridman Podcast #497…
3Blue1Brown (YouTube) · RSS 摘要
64块方糖谜题 究竟什么是交叉熵?| 压缩即智能 第二部分 100条随机弦,有多少个交点? 测量英语的熵 什么是完美编码?如何判定?
OpenAI (YouTube) · AI 动态
如何使用 ChatGPT Work 安排每周指标报告 如何使用 ChatGPT Work 将预测电子表格转变为交互式规划工具 推出 Agent Plugins AI 如何帮助波士顿儿童医院破解医学难题 | OpenAI Forum 认识 Birding Pal
Import AI (Jack Clark) · RSS 摘要
Import AI 467:自持性 AI 病毒;AI 进展节奏;关于 AI 与创造力的困惑 — 我们何时建造月球 arcology? Import AI 466:机器人的苦涩教训,AI 完成长达一周的编程任务;以及 OpenAI 意外的 AI 黑客 — 警告信号将持续,直至文明觉醒 Import AI 465:开源 v…
Andrej Karpathy (YouTube) · RSS 摘要
我如何使用 LLM 深入理解像 ChatGPT 这样的 LLM 让我们复现 GPT2 (124M) 让我们构建 GPT 分词器 [[1小时演讲] 大语言模型简介](
Two Minute Papers (YouTube) · RSS 摘要
千亿美元 AI 竞赛格局被打破 又一个 DeepSeek 时刻到来 NVIDIA 的 AI 学会:仅模仿人类远远不够 Kimi K3 打破 AI 经济学的固有逻辑 Claude 揭示 AI 最大问题
Ben's Bites · AI 动态
我在用一个新的 agent app — Google 要麻烦了? 我的 agent 知道我什么 — GPT 便宜 80% ChatGPT 用户突破 10 亿 — 折腾 tldraw 太有趣了 Opus 5 远胜 Fable 5 — Codex + Voice 就是新一代 openclaw 作弊被抓 — 模型、写作者与路…
Google AI · AI 动态
我们在 2026 年 7 月发布的最新 AI 新闻 — Google 在 2026 年 7 月的最新 AI 更新 走进我们 35.3 万人参与的 vibe coding 课程 — Kaggle 与 Google 联合推出的 AI Agents Intensive 课程免费聚集学习者,共同构建和部署 AI 的下一个前沿。…
Google DeepMind · AI 动态
WeatherNext: AI 模型在气旋预测中取得突破 Gemini Robotics ER 2: 以视频理解、任务编排和多机器人协作赋能机器人技术 — Gemini Robotics ER 2 帮助机器人推理、协作并解决真实世界任务。它在视频理解、工具编排和多机器人协作方面实现了跨越式提升 我们在 Google F…
TLDR AI · AI 动态
Google DeepMind 改组 🧠,Meta Muse Code 💻,Anthropic 芯片团队 🧩 Google LLM 路由器 ➡️,Cloudflare Wallets 💳,Anthropic 与 Volta 合作 🤝 ChronicleBio 🧬,Mind Lab 持续学习 📈,GPTLive 架构 🎙…