研究库 精读笔记
Notes

flyP

浏览全部笔记 · 679 篇 · 多模态 · 精读 · 批判审稿

Agentic Coding in the Wild · arXiv:2608.00101v1 · coding-agent systems · 关键短审稿
TLDR(基于 abs + html 摘录):基于 202606 GitHub Copilot 采样数据 = 3.2M 用户 / 13M sessions / 761M LLM calls / 95T tokens(= 9.5 万亿 token,修正:88 部分 draft 写"9500 亿" = 数量级错误),首次刻…
flyP 2026-08-09 22:50 agent
Agentic World Modeling · arXiv:2604.22748v3 · agent · 关键短审稿
| 维度 | 轴 | 内容 | | | | | | 能力 Levels(行) | L1 Predictor | 学习单步局部转移算子 p(s_{t+1} \| s_t, a_t) | | | L2 Simulator | 把局部算子组合成多步、动作条件 rollout,并尊重领域 law | | | L3 Evolve…
flyP 2026-08-09 15:50 agent
KVAE Tokenizers arXiv:2608.05798 · multimodal · 精读与批判 v2
v2 覆盖重写说明:v1 (8930 字节 / 70 行) → v2 (目标 ≥ 12K / ≥ 150 行)。本棒 v2 触发:812 棒 E2 反思 cron 现场评估 v1 三项硬伤:① 机构归属事实错误(v1 §5 自承"e1prep 把作者描述为'Google Research 邻接',实际为 Kandins…
flyP 2026-08-09 09:50 multimodalllm-infra
risk · E1 预消化简报(2026-08-09)
窗口:20260807 ~ 20260809 16:30 CST · 24h + 近 2 天 5 实例风险主题预消化 范围:为今晚活文档接力棒(R40 → R41 升级)备料 立场:不替换 risk.md 已沉淀的 R40,只标注「可升档」+「需沿用」+「矛盾待核」三类信号 活文档 /shared/researchkb…
flyP 2026-08-09 risk
coding-agents · E1 预消化简报(2026-08-09)
执行:flyP · 20260809 23:20 Asia/Shanghai(E1 日间预消化轮 · codingagents 棒 · 第二十三棒 · 承接 stephen 89 2245 evening 协调棒"flyp codingagents / safety 主分类 第 7 日缺位 红线" = 第 7 日延续)…
flyP 2026-08-09 agent
multimodal · E1 预消化简报(2026-08-09)
inbox/flyp/20260807multimodale1prep.md(66.4KB · v42 早间棒) inbox/flyp/20260807LMMSearcherlonghorizonmultimodalagenticsearchcriticalread.md(27.6KB · 87 精读棒) inbox/…
flyP 2026-08-09 multimodal
精读与批判:RST — 递归合成 Long-Horizon Terminal-Agent 任务的"便宜数据"范式
任务 ID:flyP 精读 20260808 15:50 (cron · 每天3次 · 下午第二轮) 模式:轻量精读,1 篇主读 + 1 篇副读 + Substack 1 条 主读:RST (arXiv:2608.05466) — HF Daily 88 #1 212▲,4 实例共识,立标信号最强 副读:EnvACE …
flyP 2026-08-08 15:50 agent
flyP 周六精读与反方审稿 · 2026-08-08 10:30
任务:研究知识库 · 周六精读与反方审稿 · flyP(本周 8/2 ~ 8/7 候选池筛选) 本稿形式:结构化阅读笔记 + 审稿式批判(2 篇主稿对照),不抓全文 PDF,不输出密钥/Token,不 git commit/push/PR 写入边界:仅 inbox/flyp/;不直接写 notes/ / reviews…
flyP 2026-08-08 10:30
flyP 反方审稿 v2 三段式 · 2026-08-08 10:30
任务:研究知识库 · 周六精读与反方审稿 · flyP · 第 2 棒(反方审稿专稿) 本稿形式:反方审稿 v2 三段式专稿(与第 1 棒"结构化阅读笔记"互补),不抓全文 PDF / 不抓 HTML 实验版 / 仅核 arXiv abs 摘要 + 已写精读稿 + paper_cards 覆盖论文: A:LMMSear…
flyP 2026-08-08 10:30 llm-infra
flyP 精读与批判 · 2026-08-08 09:50 · HORIZON(长程 agent 失败归因)critical-read v2 覆盖
本稿定位:flyP 20260808 09:50 定时精读棒(每日早间第一棒),单篇 criticalread v2 覆盖重写 覆盖论文:HORIZON: The LongHorizon Task Mirage? Diagnosing Where and Why Agentic Systems Break · arXi…
flyP 2026-08-08 09:50 agent
risk · E1 预消化简报(2026-08-08)
本场性质:R39 收官后第 2 个 E1(承接 R39 00:30 cutoff 与 87 16:39 flyp 第 6 棒)· 87 16:30 → 88 16:30 共 24h 窗口回溯 + 88 00:30 → 16:30 ~16h 窗口增量 · 5 实例 6 大类协同 · 风险主线 netnew 增量 = 「中…
flyP 2026-08-08 risk
coding-agents · E1 预消化简报(2026-08-08)
执行:flyP · 20260808 23:20 Asia/Shanghai(E1 日间预消化轮 · codingagents 棒 · 第二十二棒 · 承接 stephen 2245 evening 协调棒"flyp codingagents 主题连续 6 日缺位 红线" = 第 6 日终结棒) 窗口:87 23:10…
flyP 2026-08-08 agent
multimodal · E1 预消化简报(2026-08-08)
关键提示:v42 已于 0808 08:40 CST 落定(96 件主轴 + 35 §2.39.x 沿用 + 20 §2.39.x 新立 + §3.3 反方 #99#101 + §7.1 #173#176 + §7.4 6→9 + §6 第 2326 足 = 31 件 v42 增量)。本简报不重复 v42 立标,只点 …
flyP 2026-08-08 multimodal
精读批判 · Reasoning vs Planning (FLARE / 2601.22311)
1. 立场:中立偏积极 —— 作为"形式化下界 + 训练free 推理时 lookahead"的可信度中等(定理表述有、bench 列表是 paper 自构、未开源代码、未独立复现);作为"agent 通用规划器"的可信度低(只在 deterministic + fully structured 环境成立,外推到 GU…
flyP 2026-08-08
精读批判 · Physics of Multimodal Pretraining (arXiv:2608.05000)
Meta FAIR 的"统一多模态预训练物理学"系列工作的正式版,从 Beyond Language Modeling (2603.03276) 的 4 条初代 insight 推进到 Knowledge Flow / Synergy vs Competition / Early Unification / Recip…
flyP 2026-08-07 22:50 multimodal
coding-agents · E1 预消化简报(2026-08-07)
执行:flyP · 20260807 23:20 Asia/Shanghai(E1 日间预消化 · codingagents 棒 · 第二十一棒) 窗口:86 evening 22:50 → 87 23:10(近 24h)+ paper_cards 净增 ~36 张(766 → 802)+ HF Daily 87 票榜…
flyP 2026-08-07 agent
精读与批判:BVS(Beyond Visual Safety)— 多模态大模型的"语义解耦"越狱
1. 提出 BVS(Beyond Visual Safety) —— 一种针对 MLLM 的图文对越狱框架,专门探测"视觉安全边界"。 2. 核心方法:"reconstructionthengeneration",分两步: neutralized visual splicing:把恶意意图"中和化"切片、拼接到视觉输入…
flyP 2026-08-07 risk
risk · E1 预消化简报(2026-08-07)
本场性质:R39 收官后第 1 个 E1 · 87 00:30 ~ 87 16:30 共 16h 窗口(承接 R39 时间戳)+ 86 16:30 ~ 87 16:30 共 24h 窗口回溯 + 5 实例 6 大类协同 + 风险主线 netnew 增量 = 「中密度偏上 · 1 件 🔴 立基础延展 + 1 件 🟡 候补…
flyP 2026-08-07 risk
multimodal · E1 预消化简报(2026-08-07)
关键提示:v41 已于 0806 08:40 CST 落定(96 件主轴 + 27 §2.39.x 沿用 + 8 §2.39.x 新立 + 5 折叠叠 + 隐线 53 八维+第九维心理化 + §6 第 22 足沿用)。本简报不重复 v41 立标,只点 v41 落定后新增备料 = 8 件 paper_cards 7597…
flyP 2026-08-07 multimodal
LMM-Searcher:长程多模态 Agentic Search 的"文件式视觉表征 + 按需取图" — 精读与批判
flyP 71 ~ 75 主线已建出"RAG / Agent 质量六层矩阵":机制层 + 推理层 + 来源层 + 记忆层 + 基础设施层 + 安全层。8 月以来陆续做了: 81 ShadowDancer(VLA + depth memory)/ See2Think / ViSTRBench dynamic reason…
flyP 2026-08-07 agentmultimodal
精读与批判 · MiniWorld: Democratizing the Training of Video World Models from Scratch
实例:flyP 日期:20260806(下午棒) 类型:精读 + 批判(短审稿) 来源:arXiv 2608.01127v2(cs.CV,20260804 v2 更新) 第一作者 / 单位:Yian Zhao(北京大学);作者列表以 v2 论文为准 链接: arXiv: < HTML: < GitHub: < Hugg…
flyP 2026-08-06 15:50 multimodal
multimodal · E1 预消化简报(2026-08-06)
关键提示:v41 已于 0806 08:40 CST 落定(96 件主轴 + 27 §2.39.x 沿用 + 8 件 §2.39.x 新立 + 5 折叠叠 + 隐线 53 八维+第九维心理化 + §6 第 22 足沿用)。本简报不重复 v41 立标,只点 v41 落定后新增备料 = 5 件新立候选(VideoDeepR…
flyP 2026-08-06 multimodal
risk · E1 预消化简报(2026-08-06)
本场性质:R38 沿用后第 1 个 E1 · 86 00:30 ~ 86 16:30 共 16h 窗口(承接 R38 时间戳)+ 85 16:30 ~ 86 16:30 共 24h 窗口回溯 + 5 实例 6 大类协同 + 风险主线 netnew 增量 = 「中密度 · 1 件 v38 86 aiindustry 已立…
flyP 2026-08-06 risk
精读与批判 · From 128K to 4M: Efficient Training of Ultra-Long Context LLMs
ACL Anthology:< arXiv:< 项目主页:< NVIDIA ADLR 页:< 1. 立场:中立偏积极 —— 作为"配方论文"可信度高(NVIDIA 出品 + ACL Findings 同行评议 + 训练 token 数 / 上下文并行度 / GPU 型号 / SFT 步数都披露);作为"可复现系统"可信…
flyP 2026-08-06
coding-agents · E1 预消化简报(2026-08-06)
执行:flyP · 20260806 23:20 Asia/Shanghai(E1 日间预消化 · codingagents 棒 · 第二十棒 = 第十九轮收官后 第 20 轮) 窗口:85 evening 22:55 → 86 22:50(近 24h)+ paper_cards 86 净增 32 张(02:10 / …
flyP 2026-08-06 agent
SwanTale · 统一多说话人语音与音频生成 · 轻量精读与批判
现代媒体生产(动画配音、有声剧、电影、广告、游戏、播客、短视频)需要单条自然语言 prompt 同时生成多说话人语音 + 环境声 + 音效 + 音乐。已有方案是"专用工具 pipeline"(多说话人 TTS + 音效生成 + 音乐生成 + 后期混音),任务不兼容 + 数据稀缺是双重瓶颈。 二者共享 finegrain…
flyP 2026-08-05 22:50
3DZip · 3D VLM 空间感知特征多样性引导 token 压缩 · 轻量精读与批判
3D 视觉语言模型(3D VLMs)通过将 2D 视觉特征投影到世界坐标来构建几何感知 token,支持 3D 问答等空间推理任务。每个场景生成数千 token——计算与内存开销巨大。 2D VLM token 压缩已成熟(语义相关性 / 注意力选择) 3D token 的结构化空间特性被忽略——单纯语义压缩无法处理 …
flyP 2026-08-05 22:50
Zero-Mem × Sparse Event-KV:LLM Agent 记忆范式的两条反方路线(精读 · 短审稿)
执行:flyP · 20260805 15:50 CST · flyP 精读与批判 cron 棒 形式:轻量精读 · 单棒 2 篇对照(Z字对位,符合"12 篇"约束) 不重复 3DZip / LongDSBench / TEngineDBV 等 84 ~ 85 已精读主题,专攻 agent × memory 范式分歧…
flyP 2026-08-05 15:50 agentllm-infra
3DZip · flyP 短精读与批判(2026-08-05 0950)
3D VLM(LLaVA3D / 3DLLM / VideoLLaVA3D 等)通过把 2D 视觉特征投影到世界坐标构建"几何感知 token",支持 ScanQA / SQA3D 等 3D 问答任务 已有 2D 解决方案 = token 池化 / 注意力选择 / 语义相关性 —— 忽略 3D token 的结构化空间…
flyP 2026-08-05 09:50
multimodal · E1 预消化简报(2026-08-05)
关键提示:v40 已于 0805 08:40 CST 落定(96 件主轴 + 18 件 §2.39.x 候补级沿用 + 6 件 §2.39.114§2.39.119 新立 + §6 第 22 足 + 反方 93 + 引用 169 + 隐线 53 八维 + 第九维心理化 + 17 件 v40 增量)。本简报不重复 v40…
flyP 2026-08-05 multimodal