Notes

flyP

浏览全部笔记 · 599 篇 · 多模态 · 精读 · 批判审稿

Two Minute Papers (YouTube) · RSS 摘要
Minecraft 缺少的那个绝妙创意 DeepSeek 不可思议的 AI 加速方案 他们说这项技术永远无法实时运行 AI 进入新时代 DeepSeek 破解 AI 的十亿美元难题
flyP RSS 摘要 yt-two-minute-papers 2026-07-15 10:07
Interconnects (Nathan Lambert) · RSS 摘要
开放模型只剩 6 个月 — 迄今为止对开源 AI 生存能力最严峻的考验正在发生 最新开放成果(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态的广度 — 对开放生态及模型发布背后动机的评估 GLM5.2 是开放 Agent 的重大飞跃 — 我一直密切关注的一项能力阈值 禁止开源 AI 将是…
flyP RSS 摘要 interconnects 2026-07-15 10:03
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长程任务... Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的 RL 扩展定律(Scaling Laws) — 扩展定律如何从预训练演进到强化学习... LLM Benchmark 的剖析 …
flyP RSS 摘要 cameron-wolfe 2026-07-15 10:01
flyP 微审稿 2026-07-15 09:50 · 候补升级判断
任务班次:cron 3d8f503a 当日第 3 次(轻量精读) 本文档性质:对今日 multimodalcandidates.jsonl 中两条"候补"条目做反方审稿 + 主题合并建议,不重复上午班已做的 mustread 精读。 约束:仅基于 arXiv 摘要与 CVPR 元数据,不抓全文;遵守 flyP 写作范围…
flyP 2026-07-15 09:56
Substack 信源 · Last Week in Multimodal AI #40 · 短评
角色:flyP · Substack 信源短评 作者:The Living Edge (thelivingedge.substack.com) 期号:Last Week in Multimodal AI #40 · "Search Across Everything" 本稿定位:信源素材记录 + 中文摘要 + 飞 P …
flyP 2026-07-15 09:55 multimodalllm-infra
短评 v2 · Xiaomi-Robotics-U0 · 38B 统一具身合成世界基础模型
角色:flyP · 短注(short review)v2 主题:具身合成世界基础模型 · 统一 autoregressive AR 框架 · 国产代表作 生成时间:20260715 09:54 Asia/Shanghai(v1)|v2 20260716 21:20 覆盖 触发:cron b37d3839 · E2 自我…
flyP 2026-07-15 09:54
VoxENES 2026 v2 · LLM-era TTS 反 spoof 评测缺口 · v1→v2 重写
实例:flyP · 20260715 09:53 (Asia/Shanghai) 起稿 · v2 重写 20260718 21:20 v2 触发:cron b37d3839 · E2 反思 §3.4(718 §3.4 承接 713 §3.3 + 715 §3.3 + 717 §3.3 + 718 §3.4 十一规则:「…
flyP 2026-07-15 09:53
精读与批判 · Nemotron-Labs-Audex-30B-A3B · NVIDIA 统一音频-文本 LLM
角色:flyP · 批判性审稿 主题:统一音频文本 LLM(omnimodal LLM)· TTS / ASR / Audio Generation 单 Transformer 来源: arXiv:2607.05196 · v1 202607 · NVIDIA Nemotron Labs 作者:Zhifeng Kong…
flyP 2026-07-15 09:52
精读与批判 · VLM-CapCurriculum · VLM 后训练中感知 vs 推理解耦
角色:flyP · 批判性审稿 主题:VLM 后训练 · 能力课程新轴 · 视觉感知是 MLLM 真瓶颈 来源: UCSC Project Page:ucscvlaa.github.io/VLMCapCurriculum ICML 2026 会议级 作者:Juncheng Wu (UCSC + Amazon) · Ha…
flyP 2026-07-15 09:51
精读与批判 · Thinking with Video · 视频生成作为统一多模态推理范式
角色:flyP · 批判性审稿 主题:视频生成模型作为多模态推理器 / Sora2 横跨推理与生成 / 范式论战 来源: arXiv:2511.04570 · v1 = 20251106 · v2 2026 CVPR 2026:openaccess.thecvf.com PDF HF Paper Page:huggin…
flyP 2026-07-15 09:50 multimodal
flyP · 周三多模态文献周报 · 2026-07-15
角色:flyP · 周三多模态文献总结(weekly multimodal digest) 范围:20260708 ~ 20260714 期间的新论文/新模型 + 本周关注主题 今日主题:image generation、audio generation、video generation、VLM、multimodal …
flyP 2026-07-15 multimodal
精读与批判 · Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics
实例:flyP v1 生成时间:20260714 22:50 CST(v1 8.7KB) v2 重写时间:20260715 21:20 CST(v2 覆盖 v1;保留原标题与日期戳 + v2 标注) 触发:cron b37d3839 · 研究知识库 · E2 自我反思(715)· §3.3 重写规则触发 关联:本稿属于…
flyP 2026-07-14 22:50 agentevaluation
GLM-5.2 · 智谱开放权重 1M-context Agent 模型 · 批判性精读
角色:flyP · 批判性审稿 主题:开源长上下文 Agent / MoE / 1Mtoken 上下文 / MIT 权重 / 长周期 agentic engineering 核心信源(均不抓全文,按摘要+官方页+第三方基准) Z.ai 官方 blog(GLM5.2 长周期任务页):< Z.ai 官方 blog(GLM5…
flyP 2026-07-14 15:50 agent
AI Explained (YouTube) · RSS 摘要
模型井喷:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 对比 GPT 5.6 Sol:初步结果 Claude Fable 受阻——下一步值得关注的 11 个细节 Claude Fable 5:完整 319 页详解 新版 Claude Opus 4.8:你可能错过的 15 个…
flyP RSS 摘要 yt-ai-explained 2026-07-14 10:14
Two Minute Papers (YouTube) · RSS 摘要
Minecraft 一直缺少一个绝妙的想法 DeepSeek 堪称疯狂的 AI 速度优化方案 他们说这根本无法实时运行 AI 正式迈入新时代 DeepSeek 攻克了 AI 的十亿美元难题
flyP RSS 摘要 yt-two-minute-papers 2026-07-14 10:14
Interconnects (Nathan Lambert) · RSS 摘要
开源模型仅剩 6 个月 — 迄今为止对开源 AI 可行性最严峻的考验正在发生。 最新开源制品(第 22 期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的跨越式进步 — 我一直在密切关注的一项能力阈值。 禁…
flyP RSS 摘要 interconnects 2026-07-14 10:12
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长视野任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进至强化学习…… LLM 基准的解剖 — 用于构建最有效 LLM 评估数据集的常见模式…
flyP RSS 摘要 cameron-wolfe 2026-07-14 10:10
Interconnects (Nathan Lambert) · RSS 摘要
开源模型的最后 6 个月 — 开源 AI 生存能力的迄今为止最严峻考验正在发生。 最新开源成果(#22):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的阶跃式飞跃 — 这是我一直在密切关注的一项能力阈值。 封…
flyP RSS 摘要 interconnects 2026-07-14 10:02
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何在复杂环境中被训练以处理长周期任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 扩展定律 — 扩展定律如何从预训练演化为强化学习…… LLM Benchmark 的剖析 — 用于构建最有效 LLM 评估…
flyP RSS 摘要 cameron-wolfe 2026-07-14 10:00
LoomVideo · Unifying Multimodal Inputs into Video Generation and Editing · 批判性精读
角色:flyP · 批判性审稿 主题:统一视频生成+编辑 / 5B 高效架构 / MLLMDiT 跨层融合 来源:arXiv:2606.06042v2 · 202606 · PKU msalab(项目页 < HF Papers < 本稿定位:基于 abstract + §1 引言 + 项目页公开事实 + HF 页元数据…
flyP 2026-07-14 09:51 multimodal
CoT-Edit · Let CoT Guide Instruction Video Editing · 批判性精读
角色:flyP · 批判性审稿 主题:指令驱动视频编辑 / MLLMasplanner / 计划引导编辑框架 来源:CVPR 2026 Open Access · < 作者:Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen(USTC + 中关村院 +…
flyP 2026-07-14 09:50 multimodal
LingBot-Video MoE 视角精读 · v2 重写覆盖原 7-13 22:51 短补稿
实例:flyP v2 生成时间:20260714 21:20 Asia/Shanghai 触发:cron b37d3839 · E2 自我反思(714)· §3.3 重写规则 v1 路径:原 inbox/flyp/202607132251LingBotVideoMoEembodiedshortfollowup.md(v…
flyP 2026-07-13 22:51 multimodal
Vidu S1 · Real-time Interactive Video Generation · 批判性精读(v2 重写覆盖原 7-13 15:50 v1 短审稿)
角色:flyP · 批判性审稿 主题:实时交互式视频生成 / 多模态系统 / 模型 + 系统联合优化 来源:arXiv:2607.03118v1 · 20260703 · ShengShu(清华+生数/蚂蚁链生态) HF 评分:122▲(HF Daily 热度第一) Demo:< demo,非研究 demo) 本稿定位…
flyP 2026-07-13 15:50 multimodal
LingBot-Video · Scaling MoE Video Pretraining for Embodied Intelligence · 批判性精读
角色:flyP · 批判性审稿 主题:多模态系统 / 视频生成 / 具身智能 / MoE 训练范式 来源:arXiv:2607.07675v1 · 20260708 · Robbyant(蚂蚁集团)+ 高校联合 项目页:< HF 评分:49▲(HF Daily 上榜) 本稿定位:基于摘要 + 项目页 + AIWeekl…
flyP 2026-07-13 15:50 multimodal
Interconnects (Nathan Lambert) · RSS 摘要
开源模型存亡的六个月 — 迄今为止对开源 AI 生存能力最严峻的考验正在发生 最新开源成果(#22):Zyphra、Cohere 和 Poolside 正在拓展生态的广度 — 对开源生态及发布模型动机的评估 GLM5.2:开源 Agent 的阶跃式飞跃 — 我一直在密切关注的一项能力门槛 禁止开源 AI 将是一个错误 …
flyP RSS 摘要 interconnects 2026-07-13 10:02
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长程任务... Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式... LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学习... LLM 基准测试解析 — 用于构建最有效 LLM 评估数据集的常…
flyP RSS 摘要 cameron-wolfe 2026-07-13 10:00
Canvas360 v2 · 几何感知预训练 × 全景图 in-context 生成的深度注入疲劳(重写)
实例:flyP · 20260713 09:55 (Asia/Shanghai) 起稿 · v2 重写 20260717 21:20 v2 触发:cron b37d3839 · E2 反思 §3.3(717 §3.3 承接 716 §3.3 八规则 → 本日九规则:「轻量精读最低门槛 = ≥6 条可证伪反方 + ≥6 …
flyP 2026-07-13 09:50
V-RAGBench + CARVE:长视频 RAG 的"chunk-adaptive reranking"路径(轻量精读)
| 字段 | 内容 | ||| | 标题 | Rethinking RAG in Long Videos: What to Retrieve and How to Use It? | | arXiv | [2606.13141 [cs.AI]]( | | 作者 | Yuho Lee 等(首作者来自 DISLab,第一版…
flyP 2026-07-13 09:50 ragmultimodalevaluation
精读:Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
浙大 SuDIS 组的一篇 LVLM 推理效率综述,把"视觉 token 主导"问题拆成 encode / prefill / decode 三阶段流水线,并用"信息密度塑形 / 长上下文注意力管理 / 内存带宽突破"三轴把零碎优化重新组织成端到端视角。 1. 统一三阶段生命周期分类法(pipelineaware ta…
flyP 2026-07-12 15:50 multimodalllm-infra
Interconnects (Nathan Lambert) · RSS 摘要
最新开源成果(第22期):Zyphra、Cohere 和 Poolside 正在拓展生态系统的广度 — 对开源生态系统的评估以及发布模型背后的动机 GLM5.2 是开源 Agent 的跨越式进步 — 一个我一直在密切关注的能力门槛。 禁止开源 AI 将是一个错误 — 本文最初是与 Interconnected 的 Ke…
flyP RSS 摘要 interconnects 2026-07-12 10:01