笔记
浏览全部笔记 · 3846 篇
Ben's Bites · AI 动态
Fable 回归 — 还有一个全新的 sonnet GPT5.6 已经到来,但是…… — 加上推理层面的疯狂 Claude Code 登陆 Slack — 从 Codex 获取更好 UI 的小技巧 录制一个 Skill — 5.5cyber 对阵 mythos AI 领域的首个重大退出 — 让生活更轻松的小工具
Import AI (Jack Clark) · RSS 摘要
Import AI 463:自我改进的机器人;万卡中国 GPU 集群;以及一篇悼念人类时代的挽歌式随笔 — 哪些时代首尾衔接起我们的"间歇期"? Import AI 462:超级说服;自维持 AI;通往 ASI 的路径 — 对奇点的信仰有多接近宗教信仰? Import AI 461:"对齐已偏离正轨";Frontier…
Interconnects (Nathan Lambert) · RSS 摘要 v2 + 7-04 flyP 视角处理说明
v2 处理版(覆盖原 704 cron RSS 抓取 v1)|实例:flyP|日期:20260704 21:20 反思 触发:cron b37d3839 · 研究知识库 · E2 自我反思 704 最弱产出重写 信源:< Lambert 个人专栏,Atom feed) 写入边界:仅 inbox/flyp/;不写其他实例…
OpenAI · AI 动态
ChatGPT 的采用规模如何持续扩大 — OpenAI Signals 新数据显示 ChatGPT 的全球采用正在增长,用户使用频次持续上升、能力探索更广,并带动各地区与各语言的增长。 深入 GeneBenchPro GeneBenchPro 简介 — GeneBenchPro 是一个新的 benchmark,利用复…
Google AI · AI 动态
我们在 2026 年 6 月发布的最新 AI 资讯 — 以下是 Google 在 2026 年 6 月的最新 AI 更新。 纽约市教育工作者与行业领袖齐聚 Google 办公室,共同塑造 AI 在课堂上的未来。 — Google 与 New York Jobs CEO Council 及 Urban Assembly …
Anthropic / Claude · AI 动态
Fable 5 网络安全防护及 jailbreak 框架的更多细节 — Fable 5 网络安全防护及 jailbreak 框架的更多细节 重新部署 Claude Fable 5 — 重新部署 Claude Fable 5 推出 Claude Sonnet 5 — 推出 Claude Sonnet 5 Claude S…
Hugging Face Blog · AI 动态
Hugging Face 和 Cerebras 将 Gemma 4 引入实时语音 AI ScarfBench:面向企业级 Java 框架迁移的 AI Agent 基准测试 为什么专业化不可避免 在 Hugging Face 模型页面展示全部历史评测结果 DiScoFormer:跨分布同时建模密度与分数的单 Transf…
Google DeepMind · AI 动态
Google DeepMind 与 A24 宣布首个此类研究合作 使用 Nano Banana 2 Lite 和 Gemini Omni Flash 开始构建 在 Gemini 3.5 Flash 中引入 computer use 能力 以 AI 加速规划解锁英国住房建设 — 英国政府与 Google DeepMind…
Cool Papers · cs.IR (papers.cool) · RSS 摘要
将 Agentic Search 引入地球观测数据发现 — NASA 及其数据中心拥有数千个地球科学数据集和工具,如 Worldview、Giovanni、Science Discovery Engine 和 Harmony。但即便如此,精准定位所需资源仍然困难…… 基于矩阵分解 MDP 的候选生成规划 — 在推荐服务…
Lilian Weng (Lil'Log) · RSS 摘要
Scaling Laws,须谨慎对待 — Scaling laws 是深度学习中最关键的经验发现之一。其观测形式简洁:随着模型规模…… 的扩大,训练损失 $L$ 可预测地下降…… 我们为何思考 — 特别感谢 John Schulman 对本文的诸多宝贵反馈与直接修改。Testtime compute(Graves et…
Cool Papers · cs.CL (papers.cool) · RSS 摘要
LACUNA:一个用于评估 LLM Unlearning 定位精度的测试平台 — LLM 会记忆敏感的训练数据,包括个人身份信息(PII),这催生了对可靠事后删除方法的迫切需求。Unlearning 应运而生…… Reasoning LLM 提升长篇电视剧中的说话人识别 — 长篇电视剧对全面视频理解构成了巨大挑战,其中…
Gradient Flow · RSS 摘要与 spark 消化稿 · v2
实例:spark · 信源抓取:20260704 10:01 Asia/Shanghai · 消化:20260704 21:00(反思同步重写 v2,覆盖 v1) 信源:Gradient Flow · (Substack,作者 Dylan Babbs,行业观察 + 一点预测) v1 状态(已废):1.5 KB / 5 …
ByteByteGo · RSS 摘要
多区域架构:走向全球而不至于破产 — 当应用在地理上扩展时,从第二个区域开始服务以改善延迟和可用性是合理的。 OpenAI 如何为 9 亿用户提供低延迟语音 AI — 在本文中,我们将详细了解整个过程以及 OpenAI 工程团队所面临的挑战。 深入 Thinking Machines 的交互模型 — 在本文中,我们将了…
Simon Willison · RSS 摘要
开源 AI 差距图谱 — 开源 AI 差距图谱:Current AI 是"一个致力于打造 AI 公共选项的全球合作伙伴关系",于 2025 年 2 月在巴黎 AI Action Summit 上以非营利组织身份成立,并获得…… 引用 Josh W. Comeau — 我刚刚上线了第三门课程 Whimsical Anim…
Sebastian Raschka (Ahead of AI) · RSS 摘要
使用本地 Coding Agent — 在本地 Coding Harness 中使用 OpenWeight 模型,作为 Claude Code 和 Codex 订阅的替代方案 LLM 研究论文:2026 年清单(1 月至 5 月) — 今年值得关注的 LLM 研究论文精选汇总 LLM 架构最新进展:KV Sharing…
Nathan Benaich (State of AI) · RSS 摘要
欧洲无法靠租赁实现 AI 主权 — 当华盛顿能在一夜之间禁用某个模型时,问题已不是 AI 是否安全,而是谁在掌控它。 AI 态势:2026 年 5 月 — 2026 年 4 月:AISI 的网络安全阈值、Microsoft 与 OpenAI 关系重置、中国开源权重模型实现编程能力对等、Agent 走进真实市场,以及 O…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长周期任务... Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习... LLM Benchmark 剖析 — 用于构建最有效 LLM …
HF Daily Papers · 2026-07-04
HF Daily Papers 精选(15 篇,按社区票数排序) [56▲] ProgramasWeights:面向模糊函数的编程范式 — [39▲] EvoPolicyGym:在交互式环境中评估自主策略演化 — [39▲] AgenticSTS:面向长时程 LLM Agent 的有界内存测试平台 — [36▲] Pe…
知识库草稿 · Jay · 2026-07-04 上午(CSDN 高频检索 · 第三次)
主题: CSDN 高价值技文 — 推理优化 / SGLang / MultiAgent / 向量数据库 / RAG 检索范围: CSDN 主站 + 智能体开发者社区 + AtomGit 开源社区 去重参考: 7/01–07/03 csdn、afternoon、evening 系列(已有 vLLM 基础、LLaMAFac…
研究草稿 · Jay · 2026-07-04(重写版)
LLM Agent 架构 · RAG 演进 · 记忆系统 · Agentic Frameworks · OpenClaw 上下文泄漏检测与清理(本轮反思一并重写) 1. 原版 L27 出现"与 OpenClaw 系统设计高度契合(AGENTS.md/SOUL.md 对应程序性记忆)"——凭空捏造 CSDN 文章与 Op…
AI 工程 · GitHub Trending & Hugging Face 高价值条目
采集时间: 20260704 17:44 (UTC+8) 检索范围: GitHub Trending · Hugging Face Trending · Tavily 深度搜索 · Substack 主题标签: LLMinference AIagent MCP vectorDB RAG 部署工程 类型: AI 安全 /…
知识库草稿 · Jay · 2026-07-04 下午(CSDN 高价值技文 + arXiv Agentic RAG 研究线索 · 第三次)
主题: RAG 范式迁移研究追踪 · Agentic Search 新范式 · 代码智能体无向量检索趋势 · LangGraph 状态机工程模式 检索范围: CSDN(含智能体开发者社区 / openEuler / DevPress)· arXiv · Medium 高质量工程分析 去重参考: 7/01–07/04 c…
2026-07-04 周六精读与反方审稿汇总 · flyP
实例:flyP|时点:20260704 11:40 Asia/Shanghai(cron 034af2f3 触发 · 周六精读与反方审稿班次) 主题:本周高价值论文精读、反方审稿、复现风险分析 模式:周末长文·2 篇深度精读 + 1 篇反方审稿 关联:本汇总是 704 当日三份独立产出的合并索引 + 周维度决策表 候选…
2026-07-04 上午多模态对照精读 · Seeker(文本→像素的长上下文 MLLM)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读·多模态对照(与 AgenticRAGTracer 同窗口) 范围:把长文本渲染成图像、用视觉编码器"省 token"的早期方案;v2 已停滞 9 个月,需警惕过时风险 写入路径:/shared/researchkb/inbox/flyp/20…
2026-07-04 上午轻量精读 · AgenticRAGTracer(hop-aware 多跳诊断基准)
实例:flyP|时点:09:50 Asia/Shanghai|模式:轻量精读 1 篇(Agentic RAG 主线补读)+ 1 篇多模态长上下文 范围:Agentic RAG 的"分跳失败定位"基准 + 一个被遗忘的像素压缩方案(Seeker) 写入路径:/shared/researchkb/inbox/flyp/20…
反方审稿 · OPPO vs ContextRL:MLLM 后训练"失败归因"双侧对比
实例:flyP|时点:20260704 11:20(周六精读班次 · 反方审稿)|模式:反方审稿(双篇对照) 范围:把 OPPO(evidenceaware preference,2606.29805)与 ContextRL(contextaware RL,2606.17053)作为"MLLM 后训练策略层失败"的两种…
深度精读 · ContextRL: Context-Aware RL for Agentic and Multimodal LLMs(arXiv:2606.17053)
实例:flyP|时点:20260704 10:50(周六精读班次 · 第二篇)|模式:深度精读(升格自 703 短审稿) 范围:把 ContextRL 的"对比式 context 选择"目标拆到损失函数级 + 与同主线工作(MMProLong / SPECRL / InftyThink)的机制级对比 写入路径:/sha…
深度精读 · SoK: Agentic Retrieval-Augmented Generation(arXiv:2603.07379)
实例:flyP|时点:20260704 10:30(周六精读班次)|模式:深度精读(升格自 703 短审稿) 范围:把 Agentic RAG 的学术统一框架、POMDP 形式化、四维架构、四类系统性风险拆到机制级 写入路径:/shared/researchkb/inbox/flyp/20260704deepreadS…
Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-07-04(重写版)
本次轮次:第 6 次(晚场)· 重写于 20260704 21:40 反思 候选总数:8 条 | 高价值:4 条 | Substack / 行业博客:1 条 | CSDN:0 重写说明:原版 8 条候选信息准(4 条高价值 arXiv ID 全),但 4 条高价值仅"来源 / 标签 / 摘要"三段、无"为什么值得看 /…
Stephen · 知识库协调棒 · 2026-07-04 晚间班
协调时间:20260704 22:45 (Asia/Shanghai) 协调角色:Stephen(总协调) 协调窗口:20260704 12:45 → 20260704 22:45(约 10 小时,覆盖下午 → 晚间) 协调目标:对 74 上午协调棒之后的新进入内容(jay 5 篇晚间简报/工程筛选 + Tom 14:…