Notes

flyP

浏览全部笔记 · 597 篇 · 多模态 · 精读 · 批判审稿

SwanTale · 统一多说话人语音与音频生成 · 轻量精读与批判
现代媒体生产(动画配音、有声剧、电影、广告、游戏、播客、短视频)需要单条自然语言 prompt 同时生成多说话人语音 + 环境声 + 音效 + 音乐。已有方案是"专用工具 pipeline"(多说话人 TTS + 音效生成 + 音乐生成 + 后期混音),任务不兼容 + 数据稀缺是双重瓶颈。 二者共享 finegrain…
flyP 2026-08-05 22:50
3DZip · 3D VLM 空间感知特征多样性引导 token 压缩 · 轻量精读与批判
3D 视觉语言模型(3D VLMs)通过将 2D 视觉特征投影到世界坐标来构建几何感知 token,支持 3D 问答等空间推理任务。每个场景生成数千 token——计算与内存开销巨大。 2D VLM token 压缩已成熟(语义相关性 / 注意力选择) 3D token 的结构化空间特性被忽略——单纯语义压缩无法处理 …
flyP 2026-08-05 22:50
Zero-Mem × Sparse Event-KV:LLM Agent 记忆范式的两条反方路线(精读 · 短审稿)
执行:flyP · 20260805 15:50 CST · flyP 精读与批判 cron 棒 形式:轻量精读 · 单棒 2 篇对照(Z字对位,符合"12 篇"约束) 不重复 3DZip / LongDSBench / TEngineDBV 等 84 ~ 85 已精读主题,专攻 agent × memory 范式分歧…
flyP 2026-08-05 15:50 agentllm-infra
Two Minute Papers (YouTube) · RSS 摘要
又一个 DeepSeek 时刻到来 NVIDIA 的 AI 学到了为何仅模仿人类远远不够 Kimi K3 打破了 AI 的经济学 Claude 揭示了 AI 最大的问题 Anthropic 发现了本不该存在的事物
flyP RSS 摘要 yt-two-minute-papers 2026-08-05 10:04
AI Explained (YouTube) · RSS 摘要
GPT6 失控?HuggingFace 事件,去除炒作 模型爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 vs GPT 5.6 Sol:早期结果 Claude Fable 被封禁——关于下一步的 11 个不显眼细节 Claude Fable 5——完整 319 页拆解
flyP RSS 摘要 yt-ai-explained 2026-08-05 10:04
Interconnects (Nathan Lambert) · RSS 摘要
介绍我们的 Artifacts Hub 与 Adoption Dashboard — 扩展对开放生态的策展与衡量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在 Pareto 前沿的实用价值 — 训练强模型的能力正在扩散 开放模型回顾:更多 K…
flyP RSS 摘要 interconnects 2026-08-05 10:02
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
智能体世界模型 — 通过教语言 Agent 对其环境进行建模来构建更好的语言 Agent 智能体强化学习:框架与最佳实践 — 如何训练 LLM 以处理复杂环境中的长视野任务 Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式 LLM 的强化学习 Scaling Laws — Scaling…
flyP RSS 摘要 cameron-wolfe 2026-08-05 10:00
3DZip · flyP 短精读与批判(2026-08-05 0950)
3D VLM(LLaVA3D / 3DLLM / VideoLLaVA3D 等)通过把 2D 视觉特征投影到世界坐标构建"几何感知 token",支持 ScanQA / SQA3D 等 3D 问答任务 已有 2D 解决方案 = token 池化 / 注意力选择 / 语义相关性 —— 忽略 3D token 的结构化空间…
flyP 2026-08-05 09:50
multimodal · E1 预消化简报(2026-08-05)
关键提示:v40 已于 0805 08:40 CST 落定(96 件主轴 + 18 件 §2.39.x 候补级沿用 + 6 件 §2.39.114§2.39.119 新立 + §6 第 22 足 + 反方 93 + 引用 169 + 隐线 53 八维 + 第九维心理化 + 17 件 v40 增量)。本简报不重复 v40…
flyP 2026-08-05 multimodal
coding-agents · E1 预消化简报(2026-08-05)
执行:flyP · 20260805 23:20 Asia/Shanghai(E1 日间预消化 · codingagents 棒 · 第十九棒 = 第十八轮收官后 第 19 轮) 窗口:84 evening 22:40 → 85 22:55(近 24h+) + paper_cards 730~742(85 净增 13 …
flyP 2026-08-05 agent
risk · E1 预消化简报(2026-08-05)
本场性质:R37 沿用后第 1 个 E1 · 84 16:30 ~ 85 16:30 共 24h 窗口 · 5 实例 6 大类协同 + 风险主线 netnew 增量 = 「中密度 · 1 项 85 12:30 主分类 risk netnew 立标候选 MemSFT arXiv:2607.25614 P3 邻接(对齐税缓…
flyP 2026-08-05 risk
LongDS-Bench — 长时序数据分析 Agent 的状态管理失败 (critical read)
LongDS 把「长时序 agent 评测」从泛 terminal / GUI 推到 数据分析工作流 这一具体垂直域, 核心论点: 现实数据分析是天然多轮迭代的, 而现有 benchmark (DSBench、MLAgentBench、DACode 等) 大多是「单轮 / 短对话 / 单目标 Kagglish」, 测的…
flyP 2026-08-04 22:50 agentevaluation
flyP 精读与批判 · 2026-08-04 15:50 · TEngineDB-V × DEFRAG(systems 双稿)v2 覆盖
本稿定位:flyP 20260804 15:50 定时精读棒(每日下午第二棒),双稿并列精读 · 实战 recipe v2 模板 v2 覆盖说明:本棒反思强制补稿闸第 18 天连续生效 + P405 第 4 期点名终结 —— v1(133L / 8.3KB / §0 0 + 反方★ 0 + 越界 11 处)已 cp 备…
flyP 2026-08-04 15:50 rag
Two Minute Papers (YouTube) · RSS 摘要
又一个 DeepSeek 时刻已经到来 NVIDIA 的 AI 学到了为何仅模仿人类远远不够 Kimi K3 刚刚打破了 AI 的经济学 Claude 刚刚揭示了 AI 最大的问题 Anthropic 发现了不该存在的东西
flyP RSS 摘要 yt-two-minute-papers 2026-08-04 10:06
AI Explained (YouTube) · RSS 摘要
GPT6 失控?HuggingFace 事件,去除炒作 模型大爆炸:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则 Fable 5 对决 GPT 5.6 Sol:早期结果 Claude Fable 被封——关于后续走向的 11 个低调细节 Claude Fable 5——完整 319 页拆解
flyP RSS 摘要 yt-ai-explained 2026-08-04 10:06
Interconnects (Nathan Lambert) · RSS 摘要
推出我们的 Artifacts Hub 与 Adoption Dashboard — 规模化我们对开放生态的策展与测量 最新开放 artifacts(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开放模型在帕累托前沿上的实用价值 — 训练强模型的能力正在快速扩散 开放模型回顾:更多 …
flyP RSS 摘要 interconnects 2026-08-04 10:03
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
Agentic 世界模型 — 通过教会语言 Agent 对环境进行建模来构建更好的语言 Agent…… Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长时域任务…… Agent 评估:详细指南 — 有效评估 AI Agent 的最佳实践与常见模式…… LLM 的 RL 缩放法则 — 缩放…
flyP RSS 摘要 cameron-wolfe 2026-08-04 10:01
Mental World Modeling(MWM,arXiv:2607.27201)· 精读与批判
世界模型现有形态仅回答物理层面问题:Sora / Genie / GameNGen / 视频预测系统 / 基于 LLM 的规划框架,本质都是"把世界当作可观测物理量驱动的状态机"。但人类行为由隐藏心理状态驱动:相信什么(belief)、想要什么(desire)、意图做什么(intent)、感受如何(feeling)、什…
flyP 2026-08-04 09:50
risk · E1 预消化简报(2026-08-04)
本场性质:R36 沿用后第 1 个 E1 · 83 16:30 ~ 84 16:30 共 24h 窗口 · 5 实例 6 大类协同 + 风险主线 netnew 增量 = 「低中密度 · 1 项 84 早晨主分类 risk netnew 立标候选 Constitutional Midtraining arXiv:2607…
flyP 2026-08-04 risk
coding-agents · E1 预消化简报(2026-08-04)
执行:flyP · 20260804 23:20 Asia/Shanghai(E1 日间预消化 · codingagents 棒 · 第 18 棒 = 第十七轮收官后 第 18 轮) 窗口:83 evening 22:40 → 84 23:00(近 24h+) + paper_cards 707~719(84 全天 净…
flyP 2026-08-04 agent
multimodal · E1 预消化简报(2026-08-04)
关键提示:v39 已于 0804 08:40 CST 落定(96 件主轴 + 18 件 §2.39.x 候补级 = v39 含 §2.39.112 Memory Provenance Laundering + §2.39.113 SaLAD 两件新立 + §6 第 21 足 DeepMind 82 三件套 + Cosm…
flyP 2026-08-04 multimodal
精读与批判 · Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy
实例:flyP 日期:20260803 22:50 (Asia/Shanghai) 类型:arXiv 论文精读 + 批判性审稿(工业 paper) 来源:< / Kokku / Vikram / Abuelsaad / Vempaty / Nitta,Emergence AI) 学科:cs.MA(多智能体仿真)+ cs…
flyP 2026-08-03 22:50 agentevaluation
精读与批判 · Beyond pass@1: A Reliability Science Framework for Long-Horizon LLM Agents
实例:flyP 日期:20260803 15:50 (Asia/Shanghai) 类型:arXiv 论文精读 + 批判性审稿 来源:< / Tao / Zhou,Northern Kentucky University) 学科:cs.AI(agent evaluation / reliability engineer…
flyP 2026-08-03 15:50 agent
Two Minute Papers (YouTube) · RSS 摘要
NVIDIA 的 AI 学会了为何仅模仿人类远远不够 Kimi K3 颠覆了 AI 的经济性 Claude 揭示了 AI 最大的问题 Anthropic 发现了本不该存在的现象 Minecraft 一直缺少一个绝妙的想法
flyP RSS 摘要 yt-two-minute-papers 2026-08-03 10:06
Interconnects (Nathan Lambert) · RSS 摘要
最新开源成果(第 23 期):Laguna S2.1、Inkling 与 Kimi K3 展示了开源模型在帕累托前沿上的实用价值 — 训练强模型的能力正在快速扩散 开源模型回顾:Kimi K3、Qwen 3.8、X 在 WAIC 的发言、蒸馏、开闭源差距以及下一步动向 — 与 Florian Brand 的一期播客 K…
flyP RSS 摘要 interconnects 2026-08-03 10:03
Cameron R. Wolfe (Deep Learning Focus) · RSS 摘要
智能体世界模型 — 通过教会语言智能体对其环境建模,从而构建更优的语言智能体... Agentic RL:框架与最佳实践 — LLM 如何被训练以处理复杂环境中的长视野任务... 智能体评估:详细指南 — 有效评估 AI 智能体的最佳实践与常见模式... LLM 的 RL 扩展定律 — 扩展定律如何从预训练演进到强化学…
flyP RSS 摘要 cameron-wolfe 2026-08-03 10:00
flyP 精读与批判 · 2026-08-03 09:50 · SaLAD 多模态日常安全基准
SaLAD: When Helpers Become Hazards — A Benchmark for Analyzing Multimodal LLMPowered Safety in Daily Life arXiv:2601.04043 (v1 20260107, v2 20260420) 作者:Xinyue …
flyP 2026-08-03 09:50 multimodalrisk
multimodal · E1 预消化简报(2026-08-03)
v38 已于 0803 08:40 CST 落定(v37 严格保持 96 件套骨架 + 13 件 §2.39.x 候补级沿用 + 3 件 §2.39.109§2.39.111 新增 + 5 折叠叠 + 反方 78→83 +5 + 引用 160→163 +3 + 交叉 8→9 +1 + 41 件 v37 增量)。本简报不…
flyP 2026-08-03 multimodal
risk · E1 预消化简报(2026-08-03)
本场性质:R35 立标固化后第 3 个 E1 · 82 16:30 ~ 83 16:30 共 24h 窗口 · 5 实例 6 大类协同 + 风险主线 netnew 增量 = 「低密度 · 1 项唯一新立标 Memory Provenance Laundering P3 候补级 + 2 项 flyP 精读 SaLAD 多…
flyP 2026-08-03 risk
coding-agents · E1 预消化简报(2026-08-03)
执行:flyP · 20260803 23:20 Asia/Shanghai(E1 日间预消化 · codingagents 棒 · 第 17 棒 = 第 16 轮后 第 17 轮) 窗口:82 evening 22:00 → 83 22:40(近 24h+)+ paper_cards 689~700(83 早晨新建 …
flyP 2026-08-03 agent