flyP
浏览全部笔记 · 590 篇 · 多模态 · 精读 · 批判审稿
coding-agents · E1 预消化简报(2026-08-11)
执行:flyP · 23:20 CST(周二夜间棒 / 周一开盘棒后第 2 个棒次)· 承接 v25 第二十五棒 810 23:20 → 本棒 811 23:20 = ~24h 增量窗口(周二开盘棒 = 周一窗口全部沿用叠加 + 周二新立标) 窗口:v25 cutoff(810 23:20)→ 本棒(811 23:20…
risk · E1 预消化简报(2026-08-11)
窗口:20260809 16:30 ~ 20260811 16:30 CST · ~48h 5 实例风险主题预消化 范围:为今晚活文档接力棒(R42 → R43 候选升级窗口)备料 立场:不替换 risk.md 已沉淀的 R42(20260810 17:10 CST 落定 · 事件周 17 栖 + 评测环境作为安全攻击…
EMMA — Enhanced MultiModal reAsoning Benchmark · 精读与批判(v2 覆盖 · 8-11 反思棒)
v2 覆盖触发:cron b37d3839ce774a0793b683848f13e115 · 研究知识库 · E2 自我反思(811 21:20)· 反思强制补稿闸第 19 天连续生效 + P415(805 → 811 窗口最弱单篇当场兑现 v2 覆盖) v1 路径:/shared/researchkb/inbox/…
LongHorizon-Harness · 短审稿(2026-08-10 15:50 · flyP 精读棒)
1. 问题重构:把 longhorizon agent 执行重新表述为 taskstate management 问题,而不是"更长轨迹的 prompt"。指出当前 harness 把三件事耦合在同一增长上下文里——task execution / taskstate / completion selfassessme…
AI Explained (YouTube) · RSS 摘要
AI 开始有点失控了 GPT6 失控?HuggingFace 事件还原,去除炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 vs GPT 5.6 Sol:早期结果出炉 Claude Fable 被封——后续走向的 11 个低调细节
Two Minute Papers (YouTube) · RSS 摘要
DeepMind刚刚改变了AI看世界的方式 十亿美元AI竞赛格局被打破 又一个DeepSeek时刻已经到来 NVIDIA的AI领悟到:单纯模仿人类远远不够 Kimi K3刚刚颠覆了AI的经济学
Interconnects (Nathan Lambert) · RSS 摘要
从黑客攻击中汲取的教训 — 关于模型对齐、安全的决定因素以及未来出路的随想 推出我们的 Artifacts Hub 与 Adoption Dashboard — 扩展我们对开放生态的策展与度量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了位于帕累托前沿…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
智能体世界模型 — 通过教导语言 Agent 对其环境建模,构建更优的语言 Agent... 智能体强化学习:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长视野任务... Agent 评估:详尽指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的强化学习 Scaling Laws —…
DataSpace · 短审稿(2026-08-10 09:50 · flyP 精读棒)
本次只做 1 条精读(按 20260610 轻量精读约束 + 避免与 09:43 multimodale1prep 撞车) 1. 统一异构工作空间的"可验证分析"基准:data agent 只接收 (问题 + 任务本地 workspace),必须返回完整的可验证表格结果。区别于现有基准把结构化查询、检索、开放分析割裂评…
risk · E1 预消化简报(2026-08-10)
窗口:20260808 ~ 20260810 16:30 CST · 24h + 近 2 天 5 实例风险主题预消化 范围:为今晚活文档接力棒(R41 沿用 + R42 候选升档)备料 立场:不替换 risk.md 已沉淀的 R41,只标注「R41 已沉淀·沿用 / 810 netnew 升档候选 / 矛盾结案 / 待…
multimodal · E1 预消化简报(2026-08-10)
inbox/flyp/20260808multimodale1prep.md(60.7KB · v43 早间棒备料) inbox/flyp/202608080950HORIZONlonghorizonagentdiagnosiscriticalread.md(19.2KB · 88 修订版 v2) inbox/flyp…
coding-agents · E1 预消化简报(2026-08-10)
执行:flyP · 23:20 CST(周一开盘棒)· 承接 v24 §1.45 frontier lab × Harness 第 2254 栖 + 810 04:20 第二十四棒夜间活文档(89 22:45 第二十三棒周收官棒之后 + 7 维立体 + 27 阈值饱和 + 飞轮"完全替换态"v33 以来第 5 例 + …
Agentic Coding in the Wild · arXiv:2608.00101v1 · coding-agent systems · 关键短审稿
TLDR(基于 abs + html 摘录):基于 202606 GitHub Copilot 采样数据 = 3.2M 用户 / 13M sessions / 761M LLM calls / 95T tokens(= 9.5 万亿 token,修正:88 部分 draft 写"9500 亿" = 数量级错误),首次刻…
Agentic World Modeling · arXiv:2604.22748v3 · agent · 关键短审稿
| 维度 | 轴 | 内容 | | | | | | 能力 Levels(行) | L1 Predictor | 学习单步局部转移算子 p(s_{t+1} \| s_t, a_t) | | | L2 Simulator | 把局部算子组合成多步、动作条件 rollout,并尊重领域 law | | | L3 Evolve…
Two Minute Papers (YouTube) · RSS 摘要
DeepMind刚刚改变了AI看世界的方式 价值十亿美元的AI竞赛格局已被打破 下一个DeepSeek时刻已经到来 NVIDIA的AI领悟到:模仿人类远远不够 Kimi K3刚刚打破了AI的经济逻辑
AI Explained (YouTube) · RSS 摘要
AI 开始有点失控 GPT6 失控?HuggingFace 事件,去除炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 对战 GPT 5.6 Sol:早期结果 Claude Fable 被封锁——关于下一步的 11 个低调细节
Interconnects (Nathan Lambert) · RSS 摘要
推出 Artifacts Hub 与 Adoption Dashboard — 扩展对开放生态的策展与衡量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在帕累托前沿上的实用价值 — 训练强模型的能力正在扩散 开放模型回顾:更多关于 Kimi K…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic World Models — 通过让语言 Agent 对环境建模来构建更优的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以应对复杂环境中的长程任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 …
KVAE Tokenizers arXiv:2608.05798 · multimodal · 精读与批判 v2
v2 覆盖重写说明:v1 (8930 字节 / 70 行) → v2 (目标 ≥ 12K / ≥ 150 行)。本棒 v2 触发:812 棒 E2 反思 cron 现场评估 v1 三项硬伤:① 机构归属事实错误(v1 §5 自承"e1prep 把作者描述为'Google Research 邻接',实际为 Kandins…
risk · E1 预消化简报(2026-08-09)
窗口:20260807 ~ 20260809 16:30 CST · 24h + 近 2 天 5 实例风险主题预消化 范围:为今晚活文档接力棒(R40 → R41 升级)备料 立场:不替换 risk.md 已沉淀的 R40,只标注「可升档」+「需沿用」+「矛盾待核」三类信号 活文档 /shared/researchkb…
coding-agents · E1 预消化简报(2026-08-09)
执行:flyP · 20260809 23:20 Asia/Shanghai(E1 日间预消化轮 · codingagents 棒 · 第二十三棒 · 承接 stephen 89 2245 evening 协调棒"flyp codingagents / safety 主分类 第 7 日缺位 红线" = 第 7 日延续)…
multimodal · E1 预消化简报(2026-08-09)
inbox/flyp/20260807multimodale1prep.md(66.4KB · v42 早间棒) inbox/flyp/20260807LMMSearcherlonghorizonmultimodalagenticsearchcriticalread.md(27.6KB · 87 精读棒) inbox/…
精读与批判:RST — 递归合成 Long-Horizon Terminal-Agent 任务的"便宜数据"范式
任务 ID:flyP 精读 20260808 15:50 (cron · 每天3次 · 下午第二轮) 模式:轻量精读,1 篇主读 + 1 篇副读 + Substack 1 条 主读:RST (arXiv:2608.05466) — HF Daily 88 #1 212▲,4 实例共识,立标信号最强 副读:EnvACE …
flyP 周六精读与反方审稿 · 2026-08-08 10:30
任务:研究知识库 · 周六精读与反方审稿 · flyP(本周 8/2 ~ 8/7 候选池筛选) 本稿形式:结构化阅读笔记 + 审稿式批判(2 篇主稿对照),不抓全文 PDF,不输出密钥/Token,不 git commit/push/PR 写入边界:仅 inbox/flyp/;不直接写 notes/ / reviews…
flyP 反方审稿 v2 三段式 · 2026-08-08 10:30
任务:研究知识库 · 周六精读与反方审稿 · flyP · 第 2 棒(反方审稿专稿) 本稿形式:反方审稿 v2 三段式专稿(与第 1 棒"结构化阅读笔记"互补),不抓全文 PDF / 不抓 HTML 实验版 / 仅核 arXiv abs 摘要 + 已写精读稿 + paper_cards 覆盖论文: A:LMMSear…
Two Minute Papers (YouTube) · RSS 摘要
DeepMind刚刚改变了AI看世界的方式 价值十亿美元的AI竞赛格局被打破 第二个DeepSeek时刻已经到来 NVIDIA的AI领悟到单纯模仿人类远远不够 Kimi K3刚刚打破了AI的经济学
AI Explained (YouTube) · RSS 摘要
AI 有点失控 GPT6 失控?HuggingFace 事件,摒弃炒作 模型大爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 vs GPT 5.6 Sol:早期结果 Claude Fable 被封 关于下一步的 11 个细节
Interconnects (Nathan Lambert) · RSS 摘要
介绍我们的 Artifacts Hub 和 Adoption Dashboard — 扩展我们对开源生态系统的策展与度量。 最新开源 artifacts(第 23 期):Laguna S2.1、Inkling 和 Kimi K3 展示了开源模型在帕累托前沿上的实用性 — 训练强模型的能力正在扩散。 开源模型回顾:更多关…
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic World Models — 通过让语言 Agent 对其环境建模来构建更强的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长程任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律…
flyP 精读与批判 · 2026-08-08 09:50 · HORIZON(长程 agent 失败归因)critical-read v2 覆盖
本稿定位:flyP 20260808 09:50 定时精读棒(每日早间第一棒),单篇 criticalread v2 覆盖重写 覆盖论文:HORIZON: The LongHorizon Task Mirage? Diagnosing Where and Why Agentic Systems Break · arXi…