研究库 深度解读
Explainers · 学术推广产出

解读

2634 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

2609-29647
日期:20260926 · 轮次 R2 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260926_R2_agenttrustossubstrate_shortvideoscript.md 标题:Agent 治理 别只靠中间件 目标观众:AI 安全 / 治理…
视频脚本 arXiv:2609.29647 2026-09-26
还在用 GAN 画人脸?——一篇 2020 年的综述把上百种 GAN 变体压成"六族分类",现在读懂它依然有用
你有没有这种感觉—— 你刷到一张"不存在的人"的高清人脸,肤纹毛孔清晰到能骗过人眼,身份证都敢用作参考图。你大概率以为这是 Stable Diffusion / FLUX 干的——因为现在 AI 画图早就是扩散模型的天下。 但 2020 年 1 月,香港中文大学(深圳)等团队发表的 GAN 综述 A Review on…
科普版 arXiv:2001-06937 2026-09-25
直接问 Jev:RLCD 校准决策作为 AI 对齐失败零样本检测器
Q1 这篇真正解决的是什么 alignment 痛点? 当下对齐评测要么靠 LLMasjudge 每条标准解码一次,要么靠 token 概率分类器一次给一个固定标签;这两类都很贵且 tokenlevel 粒度不够细。 Q2 它比 Llama Guard / 生成式 judge 改在哪? Jev 来自 RLCD 训练范式…
深度解读 arXiv:2609.29429 2026-09-25
DeltaWAM:面向双手操作的 Delta 世界动作模型
Q1 论文真正解决的是哪个 robotics 痛点? 把预训练视频生成器当作世界模型塞给机器人做双手操作控制时,"未来帧冗余"与"重视频专家推理过慢"两个具体工程痛点。 Q2 它比上一代 WAM/FastWAM 改在哪? 不再预测稠密未来帧,而预测"视觉 delta";并用 Streaming Delta Memory…
深度解读 arXiv:2609.28811 2026-09-25
用于广义任务与运动规划问题的编程智能体
Q1 这篇真正解决的是什么 TAMP 痛点? 任务与运动规划(TAMP)即使在完全可观测、objectcentric 状态下也难,因为离散决策与几何/运动学/动力学耦合;广义 TAMP 想跨实例复用,但需要大量 TAMPspecific engineering。 Q2 它比手工 planner / 一次生成 / LLM…
深度解读 arXiv:2609.30233 2026-09-25
Neural Spectral Capacity:从架构规格就能算的「网络容量标尺」
⚠️ 读本节时建议先看 §六 边界声明:本文以 arxiv v1 abstract 与 paper card 为依据。 1. 谁在意这个问题:做 NAS、设计 Transformer family、做训练无关剪枝(trainingfree pruning)、做模型压缩选型的工程团队。 2. 现有方案差在哪:用 #Par…
深度解读 arXiv:2609.23087 2026-09-25
OmniEcho:让具身智能体「用耳朵看世界」的统一基准 + 模型
⚠️ 本解读基于 arxiv v2 abstract(20260923,30.8 MB,HTML 版可读)+ paper card TLDR;HTML 全文细节本文未独立逐图复述。 1. 谁在意这个问题:做 embodied AI、audiovisual navigation、机器人/AR 音频感知、做多模态融合的团队…
深度解读 arXiv:2609.23407 2026-09-25
视频选题榜 2026-09-25(v2 重写覆盖 · 反思棒 #58 触发)
v1 → v2 修复:v1 文件 788B / 4 行 stub,仅 3 条单行 bullet(GeoPair R1 + MemoryAthena R2 + IterSynth R3)— v1 还隐藏 1 个 markdown 渲染 bug(R2 + R3 之间缺换行,R3 直接接在 R2 末尾连成一行),完全未体现 …
选题榜 2026-09-25
你训的模型为什么「越训越长」?——arXiv 2609.20511 找到 OPD 长度膨胀的真正元凶(v2 重写覆盖 v1)
arXiv 2609.20511(When EOS Tokens Disagree: Understanding Length Inflation in OnPolicy Distillation,Weitong Zhang 等,UNC Scientific ML,20260917 v1 / 30 页 / 12 图 /…
科普版 arXiv:2609.20511 2026-09-25
ViRDM:让视频扩散模型「丢开老师」也能 few-step 生成
⚠️ 本解读基于 arxiv v1 abstract(20260924,43.8 MB)+ paper card TLDR;本文未独立精读 PDF 全实验节。 1. 谁在意这个问题:做 fewstep / realtime 视频扩散、AR/Streaming 生成、video LDM 蒸馏的研究与工程团队。 2. 现有…
深度解读 arXiv:2609.28923 2026-09-25
Rufus-Air:一份完全开源可复现的 LLM 后训练配方(八阶段串行管线)
| # | 元层问题 | 本稿回答 | |||| | Q1 | 这篇论文要解决的真问题是什么? | 开源 LLM 后训练的「工程黑箱」:业内大多只发权重,不发数据配方、reward 设计、阶段顺序与基础设施 | | Q2 | 它给出的最核心方法机制是什么? | 在 GLM4.5AirBase(106BA12B)上跑一条…
深度解读 arXiv:2609.29421 2026-09-25
PUBG Ally:作为「AI 队友」的对话式具身 Agent
| # | 元层问题 | 本稿回答 | |||| | Q1 | 这篇论文要解决的真问题是什么? | 在 强延迟约束 + 不断变化的游戏世界 中,让 LLM agent 既能像队友一样说话、又能像玩家一样行动——把「agentic tool use」与「实时控制」两层叠加 | | Q2 | 它给出的最核心方法机制是什么?…
深度解读 arXiv:2609.29837 2026-09-25
主题综述 · rag(2026-09-24 · v2 重写覆盖)
① CJK 实测 3,867 ≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §5.1§5.6(机制/数据/截止日),各主线 ≥100 字 ✅ | ④ ⚠️ 实测 29 处 密度 7.5/K ≤10/K ✅ | ⑤ verifiability 5/…
周综述 2026-09-24
主题综述 · multimodal(2026-09-25)
元信息:本稿遵循 W37 反思棒 #47 八件套 + W38 反思棒 #50 + #51 + #52 + #53 + #54 + #55 + #56 硬约束清单。§0 自检栏 9 维实测 + 三处一致 + 数字预算数学一致。 ① 字数三层一致:CJK 实测 3,889(主体 3,289 + 反方 460 + 元信息 1…
周综述 2026-09-25
别让一个 AI 同时"当裁判又当运动员":IterSynth 把搜索 Agent 拆成两个人
arXiv 2609.29444(IterSynth,20260925 v1)做了一件反常识的事——它不再让一个 LLM Agent(智能体:能自主规划、调用工具、完成任务的 AI 系统)同时承担"规划"和"综合答案"两种能力,而是把它显式拆成两个角色:Planner(规划者)专门判断"还需要什么证据",Synthes…
科普版 arXiv:2609.29444 2026-09-25
你家 AI 的"记性"到底该查字典还是靠直觉?MemoryAthena 让模型自己决定
arXiv 2609.25853(MemoryAthena,20260922 v1)做了一件特别接地气的事——它不再让 AI 记忆系统在"死查表"和"凭记忆瞎编"之间二选一,而是训练一个 201M 参数的小路由器(参数量约 2 亿,相当于 GPT3 175B 的千分之一),让模型自己判断这一次该查表、还是让生成路径帮忙…
科普版 arXiv:2609.25853 2026-09-25
IterSynth:角色解耦的迭代式深度搜索 Agent
IterSynth 通过将搜索 Agent 的「规划者」与「综合者」角色解耦,并用 summary 作为持久状态,解决了传统 ReAct 式 Agent 的能力耦合与上下文噪声两大顽疾,8B 模型在 5 个长程深度搜索基准上平均得分 50.7,较同规模最强 baseline 提升 +4.2%。 深度搜索任务(如 Bro…
深度解读 arXiv:2609.29444 2026-09-25
AgentKernel:面向 AI Agent 的信任原生操作系统
AgentKernel 首次提出将传统 OS 的安全原则下推到语义平面,围绕 Identity、Perception、Cognition、Execution 四个支柱构建 Agent 的信任原生操作系统 substrate,为 Agent 的安全治理提供 mandatory、nonbypassable 的底层基础设施。…
深度解读 arXiv:2609.29647 2026-09-25
World Action Agent:用 VLM 操控机器人的世界-动作排练框架
World Action Agent(WAA)提出让 VLM 在一个视觉动作工作空间中直接「排练修正执行」机器人操作,通过 Contact Views、Action Rehearsal 和 InView Correction 三项机制,在 LIBEROPro 上以 75.6% 平均成功率刷新 SOTA,并将 9B 模型…
深度解读 arXiv:2609.29964 2026-09-25
主题综述 · llm-infra(2026-09-25)
① 字数三层一致:CJK 实测 3,876(主体 3,006 + 反方 685 + 元信息 185)≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §3.1/§3.2/§3.3 三主线(机制/数据/截止日),各主线 CJK 242 / 235 / …
周综述 2026-09-25
MemoryAthena:Adaptive Routing over Latent and Generated Memories
authored_by:Jay · R2 0925 中午档自撰 explainer · 首篇自撰 explainer(沿用 dailyplan §4 范式) date:20260925 触发:cron fff1e54857b54da1a4e709b7de706448 · 视频矩阵 · Jay 选题雷达 R2 · 每天1…
深度解读 arXiv:2609.25853 2026-09-25
能力出众却简洁高效:从前沿模型中提取并刻画隐藏的思维链
1. 真问题:前沿闭源模型的"原生 CoT"被隐藏,能否不破解模型就重建一份与原生 CoT 行为等价的推理轨迹? 2. 新颖处:方法是方法学——API 标准功能(自定义 tool + toolchoice 控制)就能诱导模型把推理倾倒到工具参数里。 3. 实验验证什么:(a) 开源模型上提取 CoT ≈ 原生 CoT;…
深度解读 arXiv:2609.26637 2026-09-25
自组织 Agent 团队学习协同推理
提出 SelfOrganizing Agent Teams(SAT)——一组固定成员的多智能体从过往协作中学习可复用的"团队策略"(角色、对话阶段、参与度、信息流),在不做显式任务分解、不依赖路由器的情况下,让团队在数学与物理基准上达到 66.7% 平均准确率,比最强单成员(48.8%)、与该成员算力对齐的单体推理(5…
深度解读 arXiv:2609.22682 2026-09-25
线性表示假说需要一个群作用
本文主张"线性表示假说(Linear Representation Hypothesis, LRH)"并不是一个假说,而是一族以表示等价性区分的假说;为了在跨模型之间讨论表示,必须显式声明"何时两个表示应被视为等价"。论文用群作用(group action)作为形式化工具,把"被研究的表示对象 / 生成它的过程 / 最…
深度解读 arXiv:2609.27158 2026-09-25
面向持续文档撰写的知识 Pull Request
提出 Knowledge Pull Requests(KPR)——一种让"持续修订文档"变得可解释的框架。它把每一次修订拆成两层:一层是知识变化(新提取的 claim、过滤、路由、冲突检测),另一层是文本变化(最终的文档 diff),并产出 ChangeLog 让审稿人能看到"为什么改"。在跨语言维基百科修订与查询驱动…
深度解读 arXiv:2609.26634 2026-09-25
睡眠 AI 这件事的"祖师爷"回来了:2017 年那篇论文用 61 个 PSG 记录把整个赛道撬起来
arXiv 1707.03321(Chambon 等人 2017 年的开创性工作)是 PSG(多导睡眠图)信号分类领域的第一篇「不抽频谱图、不手工特征、端到端训练、用全 PSG 模态」的深度学习方案——它把「空间时间双卷积 + 30 秒窗口 + ±30 秒时序上下文」封装为统一网络,在 61 个公开 PSG 记录上达到…
科普版 arXiv:1707.03321 2026-09-25
"以图搜图"还能告诉你在图里哪个位置?这篇 2015 年的论文悄悄给整个行业打地基
arXiv 1511.05879(Tolias 等人 2015 年的开创性工作)做了一件工程界等了五年的事——让 CNN 在单次前向里同时产出「整图检索向量」+「物体定位框」两个输出,把"以图搜图"和"指出图里在哪"这两件原本割裂的事合并到同一条 pipeline 里。它靠一招"积分图 + maxpooling"扩展(…
科普版 arXiv:1511.05879 2026-09-25
把校准列为 LLM 评估的一等标准
NLP 评估长期把「模型的置信度是否有意义」当作可选项,论文主张把校准当作每一项 benchmark 与每一个模型发布的硬性必报项,并指出 LLMasajudge、合成数据生成、active learning 三类研究流水线已经悄悄踩进「未校准就使用」的坑里。 LLM 评估的工业实践里存在两段割裂: 1. 校准是一个研…
深度解读 arXiv:2609.26489 2026-09-25
Six Layers Less:面向 Whisper 的无标签恢复编码器剪枝
Whisper 的解码器剪枝(whisperlargev3turbo 把 32 层减到 4 层,DistillWhisper 减到 2 层)已经成熟,但编码器侧长期缺乏可广泛落地的方案。论文给出「按 leaveonelayerout 的 WER 变化排名 → 砍掉最不重要的 6 层 → 用无标签单语语音数据做无监督蒸馏…
深度解读 arXiv:2609.27980 2026-09-25
FLEET:从 logits 熵到文本生成中的增强轨迹
传统温度采样是无记忆的——每条新样本都不知道前几条采过什么,结果是随着采样数增多,语义重复答案的比例不断上升,准确率收益递减。FLEET 把「记忆机制」嵌进生成过程:把每次生成表示为穿过「熵超过阈值的状态」的稀疏轨迹,再用这些轨迹推断每个 token 的 utility 分数去调整 logits——同预算下与 repe…
深度解读 arXiv:2609.27657 2026-09-25