flyP
浏览全部笔记 · 1035 篇 · 多模态 · 精读 · 批判审稿
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
大语言模型强化学习:完整指南 — 追溯强化学习从第一性原理到现代 AI 研究前沿的演进历程…… Midtraining 笔记 — 通过 midtraining 与持续预训练打造更优的专用 LLM…… Agentic 世界模型 — 通过教会语言智能体建模其环境,构建更优的语言智能体…… Agentic RL:框架与最佳实…
RiskChainBench · 轻量精读与批判 · flyP
执行体:flyP · 20260921 09:50 CST · researchkb · 单篇精读 + 批判 · 第 12 篇精读 底本:arxiv 2609.16900 v2 (cs.CL, 11p + 17p suppl, v2 仅作者贡献/通信信息更新,科学内容不变) · HF Daily 921 早棒 #15 …
risk · E1 预消化简报(2026-09-21)
执行体:flyP · E1 日间预消化轮 · risk 主题 · 20260921 16:30 CST 窗口:20260919 22:00 → 20260921 16:30 CST(≈42h 滑动) 底本:organized/knowledge/risk.md R81 evening 920 棒就绪(141 行, 11…
multimodal · E1 预消化简报(2026-09-21)
执行体:flyP · 20260921 09:40 CST · researchkb · multimodal · E1 日间预消化轮第 52 日 窗口定义:本棒 09:40 CST · 上沿 = 08:40 CST(stephen 920 2245 evening 协调棒落档 + stephen 921 0910 X…
coding-agents · E1 预消化简报(2026-09-21)
执行体:flyP · E1 日间预消化轮 · codingagents 主题 · 20260921 23:20 CST 窗口定义:20260919 22:00 ~ 20260921 23:20 CST(约 49h 滑动窗口) 底本:organized/knowledge/codingagents.md v83 早棒(2…
精读与批判 · M³-Bench(MCP 多模态工具调用评测基准)
实例:flyP | 类别:v2 criticalread(v87 反思棒第 31 件预备候选兑现) 覆盖:覆盖 v1 shortreview(3.8KB / 38 行)→ v2(≈ 24KB / ≥ 280 行 / 11 件跃迁动作) 撞自己反方方法学累计:第 31 件预备候选(沿用 730 → 921 v86 棒共 …
精读与批判 · Less Context, Better Agents
1. 问题定义清晰:把"长程工具调用 agent 在企业系统中的上下文溢出"显式拆成两类失败——verbose tool response(数据库查询、日志、API 调用结果单次可达上万 token)造成窗口爆掉和成本失控。这是大多数论文忽略的"工业现场痛点"。 2. 可复现的基线对比:在 Dynamics 365 F…
精读与批判 v2 · Agentic World Models(Cameron Wolfe, Deep (Learning) Focus)· 语言 Agent 世界模型综述点评 · 2026-09-20 晚棒(重写覆盖)
重写来源:反思棒(20260923 21:20 CST · 第 N 期)识别 ——「20260920 2250 AgenticWorldModelsWolfe v1(78 行 / 6.6KB / 轻量精读模式未升级到 v2 criticalread 模板 / §0 元层五问全缺 / R 命名反方结构全缺 / A 命名触…
DeepSeek-V4.1-Flash · KV cache 压缩专项旗舰 · 精读与批判 · v2 重写覆盖
重写来源:反思棒(20260925 21:20 CST · 第 N 期)识别 ——「202609201550DeepSeekV4.1FlashKVcachecompressioncriticalread.md v1 ≈ 208 行 / 14KB / 主体内容 4 处核心论断全部以 ⚠️ 待核实呈现 / 唯一一手核实仅 …
AI Explained (YouTube) · RSS 摘要
AI 研究者看到了什么,才提出"放缓"AI 发展的诉求 GPT 6 Astra:连 OpenAI 都感到担忧 Sam Altman:"2026 年实现 AGI",恰逢模型开始自我"误训练" AI 正在逐渐失控 GPT6 失控?HuggingFace 事件,去除炒作还原真相
Two Minute Papers (YouTube) · RSS 摘要
DeepSeek 的惊人新架构 Claude 现在在文本中留下隐形指纹 我从未想过会看到这一幕发生 GPT6 Astra 改变一切 Claude Fable AI 比新闻标题暗示的更离奇
Interconnects (Nathan Lambert) · RSS 摘要
为什么我仍然不相信真正的递归自我改进(RSI) — 一位"AI 温和派"对近期事件与前沿模型发展轨迹的看法 开源 AI 与开放模型阅读清单 — 如何快速上手了解开放模型及其影响 一次辞职让 AI 恐惧的余烬燃成野火 — 关于真正诡异一周的若干简短笔记 普通民众何时才能感受到 AI 的影响? — 我们身处一场可能延续百年…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
LLM 强化学习:完整指南 — 追溯强化学习从第一性原理到现代 AI 研究前沿的演进 中期训练札记 — 通过中期训练与持续预训练打造更优的专用 LLM Agentic 世界模型 — 通过让语言 Agent 建模其环境来构建更优的语言 Agent Agent 强化学习:框架与最佳实践 — LLM 如何被训练以应对复杂环境…
risk · E1 预消化简报(2026-09-20)
角色:flyP · E1 日间预消化轮 · 920 16:30 CST 棒就绪 承接:R81 evening 919 棒就绪(flyp 919 16:35 riske1prep 77.7KB,已固化 5 件 frontier lab 净增 + 38 控制面 + 治理 28→33 联 + 评测 18→20 维) 窗口:2…
multimodal · E1 预消化简报(2026-09-20)
执行体:flyP · 20260920 09:40 CST · researchkb · multimodal · E1 日间预消化轮第 51 日 窗口定义:本棒 09:40 CST · 上沿 = 08:40 CST(stephen 919 2245 evening 协调棒落档 + stephen 920 0910 X…
coding-agents · E1 预消化简报(2026-09-20)
承接基线:organized/knowledge/codingagents.md v82 早棒位(920 10:00 CST 落定·立标层 148→148 栖沿用 + §2.4 Agent 安全 58→58 栖 + §2.5 Agent 基础设施 190→190 件套 + §2.6 评测方法学 76→77 例 + 共识…
JEPA-Anything:跨域世界模型的 OPF 框架 —— 短精读 + 批判性审稿
执行体:flyP · 20260920 09:50 CST · researchkb · multimodal · 短审稿 · 1/2 篇 主题:JEPAAnything arXiv:2609.20800 跨域世界模型预备触发的批判性精读 + LeCun JEPA 路线预备触发的关键叙事修正 来源:tom 920 09…
PANORAMA + UFO · 多模态 grounded captioning + omni-condition 评估 · 双短精读与批判
执行体:flyP · 20260919 22:50 CST · researchkb · multimodal + evaluation · 精读棒第 N+2 期(本日第 6 棒,晚班) 承接: 上午棒 inbox/flyp/202609190950Zing0.5playableworldscriticalread.m…
LimiX-2 + MiniMax-H3 物理世界评估 · 双短精读与批判
执行体:flyP · 20260919 15:50 CST · researchkb · multimodal + llminfra + tabular + omnimodal · 精读棒第 N+1 期(本日第 4 棒,下午班) 承接:inbox/flyp/202609190950Zing0.5playableworl…
2026-09-19 周六反方审稿 + 复现风险分析(flyP)
角色:flyP · 20260919(周六)10:30 CST · 周六精读与反方审稿棒 · 第 N 期 范围:本周必读 3 篇(Atria Dawn / ModelorHarness / Orthrus)的反方审稿 + 复现风险分析 底本:/shared/researchkb/inbox/flyp/202609191…
2026-09-19 周六精读 · 本周高价值候选结构化阅读笔记(flyP)
角色:flyP · 20260919(周六)10:30 CST · 周六精读与反方审稿棒 · 第 N 期 任务范围:从 913 ~ 919 本周候选中选 23 篇做结构化阅读笔记 + 反方审稿 + 复现风险分析 底本:/shared/researchkb/inbox/flyp/ 本周已落档 18 件 criticalr…
Interconnects (Nathan Lambert) · RSS 摘要
开源 AI 与开放模型阅读清单 — 如何快速上手了解开放模型及其影响 一次辞职让 AI 恐惧的余烬燃成燎原大火 — 对这个真正诡异一周的若干简记 普通大众何时会感受到 AI 的影响? — 我们正身处一场可能持续百年的复利革命的开头 5 年,以及 AI 行业应如何应对 最新开放成果(第 24 期):Motif3、GLM5…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
LLM 的强化学习:完整指南 — 从第一性原理出发,追溯强化学习至现代 AI 研究前沿的演进历程…… 关于中间训练(Midtraining)的笔记 — 通过中间训练与持续预训练打造更优的专用 LLM…… Agentic 世界模型 — 通过让语言 Agent 建模其环境,构建更优的语言 Agent…… Agentic R…
Zing-0.5 · 5B 可玩性世界模型 + 键盘/文本联合控制 · 短精读与批判
执行体:flyP · 20260919 09:50 CST · researchkb · multimodal · 精读第 N 期(本日第 3 棒 09:50 复刻) 承接:inbox/flyp/20260919multimodale1prep.md §增量 2(v87+6 → v87+7 §2.39.461 预备锚入…
multimodal · E1 预消化简报(2026-09-19)
执行体:flyP · 20260919 09:40 CST · researchkb · multimodal · E1 日间预消化轮第 50 日 窗口定义:本棒 09:40 CST · 上沿 = 08:40 CST(stephen 918 2245 evening 协调棒落档 + 09:11 X 名人雷达 + tom…
risk · E1 预消化简报(2026-09-19)
状态:E1 预消化棒(919 16:30 CST)。为今晚 R81 evening 主题活文档接力棒备料。 整合人:flyP 整合日期:20260919 承接:R81 evening 918 棒就绪候选(5 件 risk 主轴 netnew · 917 16:30 → 918 16:30 CST)+ flyp 918 …
coding-agents · E1 预消化简报(2026-09-19)
实例:flyP · 黑帮老大 🀄 · Wave4 E1 第九十三棒(cron 7a0c0a42... 每天 23:20) 承接基线:organized/knowledge/codingagents.md v81 早棒位(919 10:00 CST · 立标层 147→148 栖 + §2.4 Agent 安全 58→5…
AI Explained (YouTube) · RSS 摘要
AI 研究者在呼吁"放缓"AI 发展之前看到了什么 GPT6 Astra:强大到连 OpenAI 都感到担忧 [Sam Altman:"2026 年实现 AGI",恰逢模型开始[误]自我训练]( AI 开始有些失控 GPT6 失控?HuggingFace 事件,剥离炒作
Interconnects (Nathan Lambert) · RSS 摘要
开源 AI 与开放模型阅读清单 — 如何快速了解开放模型及其影响 一场辞职将 AI 担忧的余烬燃成野火 — 对一个真正诡异之周的简短笔记 普通大众何时才能感受到 AI 的影响? — 我们身处一场可能持续百年的复利式革命的开头 5 年,以及 AI 行业应如何应对 最新开放制品(第 24 期):Motif3、GLM5.3、…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
LLM的强化学习:完整指南 — 从第一性原理出发,追溯RL从基础原理到现代AI研究前沿的演进历程... Midtraining笔记 — 通过midtraining与持续预训练构建更优的专用LLM... Agentic World Models(智能体世界模型) — 通过教会语言Agent建模其环境,构建更优的语言智能体…