解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
VeriPhy:让视频世界模型的物理错误"逐判决可审计"
视频世界模型(video world model)在 VA 类比 / 物理仿真等任务上视觉上很流畅,但视觉流畅 ≠ 物理正确——单标量质量分(FVD / IS / VBench 等)无法告诉开发者"片段违反了哪条物理约束 / 在哪一帧失效"。Adobe Research 等机构提出的 VeriPhy 把这一痛点转化为可…
DRACO:没有 ground-truth 时,如何让 rubric 优势在 GRPO 中"按步分配"
IBM Research 在 AppWorld、TauBench 上验证:当长视野(longhorizon)agent 没有可程序化校验的成功信号时,DRACO(Distributing Rubricbased Advantage for Credit Optimization)通过在训练中动态生成多维 rubric、…
优化中的渗流动力学:方差级联与离散尺度不变性
一句话结论:把随机梯度下降(SGD)的"简化子网络"动力学建模为渗流过程,揭示架构对称性让子网络以离散同步块合并而非逐个合并,宏观序参量出现方差尖峰 — 类似物理相变;这一机制在显式重尾噪声模型下同样延伸至 Adam / AdamW,串起 SGD 与自适应优化器的训练动力学理论。 深度学习理论有一条反复被实证但难以严格…
选择、压缩、再投入:长视频多模态大模型视觉 Token 分配的控制变量研究
⚠️ 关键发现摘要:长视频 MLLM 的视觉 token 预算"怎么花"远比"花多少"重要;一个近 30 年前的稀疏近似老算法(OMP)在控制变量测试里追平所有专用训练式选择器;节省的预算若不再投入到更多帧,压缩本身几乎白做;同一套规则在不同评测 harness 下能差出 0.07–3.74 分,跨论文数字横向比较很危…
Scal3R:学习高效多相对位姿查询以实现可扩展的在线 3D 重建
⚠️ 关键发现摘要:在线 3D 重建在长视频上崩在"全局位姿头"而不是"局部几何头"——主干网络的单帧深度从头到尾都稳,崩的是相对首帧锚点的外推漂移;Scal3R 把这个解耦观察变成了方法论,用仅约 1% 参数的可学习 token 通过非对称注意力查询多个历史关键帧的相对位姿,再叠一个带 loop closure 的在…
LatentStream:流式视频理解中渐进式潜在记忆演化
LatentStream 将流式视频记忆从「存了再取」范式转变为「取完内化」范式,通过三层层次化流式记忆 + 渐进式记忆 receptive field + 层级信心引导的 latent memory 优化,在在线和离线视频 benchmark 上均达到新 SOTA。 流式视频理解(streaming video un…
Puffin-World:联合原生三维世界状态的统一多模态架构
PuffinWorld 把物理(重力场与纬度)、几何(深度)、外观(图像)三类原生世界状态与一个 OmniCamera 相机表征塞进同一个生成式主干,并配套发布 Puffin16M 数据集(1500 万视觉语言相机三元组 + 100 万轨迹),目标是让"理解+模拟+生成+重建 3D 世界"摆脱对外部离线模块的依赖,走向…
Compile by Training:把自然语言规范"编译"成本地可复用神经函数
Compile by Training 是 Yuntian Deng 团队继 ProgramasWeights(PaW) 之后提出的"重编译器":用教师模型在编译期合成任务数据 → 蒸馏到小适配器 → 产出一个无教师依赖、可版本化、可组合的本地神经函数;在 FuzzyBenchHard 子集上取得 83.6% 语义准确…
LLAMIA-Bench:揭示"语言化债务",用 latent state internalization 让 LLM 与非语言 agent 协作
LLAMIABench 用 6 个国际象棋协作任务证明:把非语言 agent 的连续表征通过 latent state internalization 投到 LLM 的 token 流,比 verbalization(文本摘要)显著更强——verbalization debt 随训练与模型规模扩大而扩大,单个 14B …
WHALE:联合 Harness-权重优化的简洁方案
WHALE(WeightHarness Alternating LEarning)把 Agent 训练拆成"用当前 harness 更新权重"和"用更新后的权重搜索更好的 harness"两个阶段,并交替迭代——在 Qwen3.52B/4B agent 上,跨 search QA、数学推理、国际象棋谜题 3 个领域,b…
Debias-SparseGPT:面向 LLM 的偏置感知剪枝
SparseGPT 剪枝会放大 LLM 的社会偏置,而 DebiasSparseGPT 通过在剪枝目标中加入基于人口学对比输入的二阶去偏项,在保持模型困惑度(perplexity)和零样本准确率的同时,显著降低剪枝引入的偏置,并在 2:4 结构化稀疏下仍具竞争力。 模型压缩(剪枝 + 量化)是 LLM 高效部署的核心手…
剧本驱动音视频生成的时间上下文路由(TCR)
针对当前 joint audiovideo 生成模型「视频与音频虽然彼此同步、却都不跟随剧本时间线」这个根因级不对齐问题,作者提出 Temporal Context Routing(TCR),把脚本时刻映射到视频/音频共享的时间轴并按位置路由 prompt 引导;在 200 条测试剧本上,Shot Boundary M…
MachCSL:用 AI agent 在硬件语义层验证 xv6 内核(RISC-V)
作者把基于 Iris 的并发分离逻辑(CSL)沿着 Sail RISCV 形式化语义向下推到了「亚指令级」(页表翻译、TLB、特权级、配置寄存器、fetch/decode/execute、trap、DMA、共享内存、掉电等),做出 MachCSL 框架,用 LLMbased agent 做繁琐证明,并把它用于端到端验证…
Anchor-Align:用表征锚定 + 语言-动作对齐让 VLA 微调不丢预训练先验
针对 VLA(VisionLanguageAction)策略用行为克隆(BC)微调 VLM 时「一边学到动作、一边悄悄抹掉预训练视觉/语义表示」的灾难性遗忘问题,论文提出 AnchorAlign:在 BC 损失之外补两个轻量目标——VisionLanguage Anchoring 把 VLA 的逐层表示对齐到一份冻结的…
小语言模型作为基于评分标准的强化学习评判器
用 Qwen31.7B 探针式 Probe judge 取代 8B 生成式评判器,作为 rubricbased RL 的奖励模型,在 RaRScience 上把策略从 0.232 训到 0.643,绝对分超过 8B baseline 的 0.594,而 rewardjudge 时间仅为后者的约 1/10.7,首次系统证…
Knowledge-Gated Verifiable Tasks:把"无知的失败"与"无能的失败"在 benchmark 里分开
本文提出一套 knowledgegated 任务构造协议:把任务指令与"私有规约 / 参考表 / 工具算子"的 compact artefact 解耦,并在提供 / 扣留 artefact 两个条件下做 byteidentical 任务对照,让"agent 失败是因为不知道规约"与"agent 失败是因为能力不够"在评…
面向对话推荐系统的零数据引导:把"评论/元数据/交互"榨成对话语料
对话推荐系统(CRS)通常依赖昂贵的领域对话数据;本文做了一次系统实证,证明仅靠非对话信号(评论 + 元数据 + 用户物品交互)就能"零数据"引导出一个可用的 CRS,并给出在多个数据集与微调范式下稳定胜出的选择策略与合成配方。 CRS 落地最大的拦路虎不是模型,而是数据——高质量、领域内的多轮推荐对话数据获取成本高、…
超越视觉相似性:面向知识库视觉问答的实体对齐检索(KBMR)
KBMR 是首个专为知识库视觉问答(KBVQA)设计的 MLLM 嵌入检索器:把"图像→实体"的对齐从 CLIP 风格的表层视觉相似性,转到 MLLM 自回归语义空间里"概念身份保真"的连续语义蒸馏范式;Recall@1 较 CLIP 基线最高 +14.7%,端到端 VQA 准确率 +9.4%。 KBVQA 的核心难点…
空间因子模型的 Wasserstein-重心交互场:用 LM 表征把"互动矩阵"翻译成可解释的同伴错位
传统空间收益模型把"公司之间的互动矩阵"当成既定输入,反馈难以解释。本文用公司新闻的 LM 嵌入分布做 目标锚定的 Wasserstein 重心重建,构造一个无带宽场(bandwidthfree field),把交互强度翻译成"同伴错位惩罚比";实证显示该比在样本外稳定高于等权同伴与 RBF 加权基线。 空间收益(sp…
无需跨资产协方差的组合风险边界:LM 表征给出"单边证书"与可实施配置
投资组合风险评估传统上依赖跨资产收益协方差,但在短样本、高维面板中估计极不稳定。本文证明:只要公司层面的"分布型特征" 满足从特征→系统性暴露→收益的既定联系,就可用多公司 Wasserstein2 离散度给出系统性组合方差的紧上界,并据此构造一个不需要跨资产协方差的、可实施的配置规则。 组合风险评估的核心量是 Σ(收…
NE-R1:通过强化学习增强命名实体识别模型
NER1 把"按需检索"机制(retrievalondemand)系统性地引入命名实体识别(NER),用两阶段训练(多任务指令微调初始化 + 带 CoT 的端到端强化学习)让模型在"自己知道就跳过检索 / 不知道再拉外部知识"之间学会合理切换;在多个 benchmark 上域内 F1 平均 +2.52%,零样本跨域 F…
FoldingAgent:从折纸演示视频推断可执行参数化折纸流程
FoldingAgent 提出一个 VLM 驱动的 Agent 框架,从非结构化折纸演示视频中推断出显式的参数化折叠程序(parametric folding program),而不是一次性预测静态折痕图,从而在多步折叠过程中通过再规划缓解误差累积。 人类折纸知识几乎全部以演示视频这种非结构化视觉形式传播——你看到的不…
ViSAR:面向视觉文档问答的无训练自适应 $k$ 检索
ViSAR(Visual Semantic Activation Retrieval)是一种 trainingfree 的自适应 top$k$ 检索策略,直接在 lateinteraction 视觉文档编码器的 embedding 空间里构造"queryconditioned pagelevel 相似度矩阵",动态决定…
Radiology Lay Summary:RAG 与 BioNER 在放射科报告通俗化中的实证对比
本文在放射科报告通俗化(lay summarization)任务上,严格对比 NER、纯 RAG、NER+RAG 组合在 fewshot 和微调设定下的效果,结论是 NER 单独使用最稳健(改善可读性与整体质量),纯 RAG 反而会引入无关检索项的幻觉,只有在微调设定下 NER+RAG 才能在保持可读性的同时不显著退化…
VibeVoice-ASR-Streaming:首个端到端流式说话人归因 ASR
VibeVoiceASRStreaming 把"谁说了什么"做成一个 7B LLM 驱动的端到端流式模型——把固定大小音频块、小窗口 lookahead 音频与上文文本交错输入,省去独立 diarization 阶段,达成 SOTA 转写精度与说话人归属精度的双重领先。 传统 speakerattributed ASR…
NeoMME:单塔多模态原生多语言基础编码器,面向高效文档检索微调与推理
NeoMME 提出一个单塔、双向 Transformer 编码器(260M / 800M 两个尺寸),直接从零预训练,统一处理多语言文本与原始图像 patch,以"掩码离散扩散文本目标 + 可见图像 patch 条件"为目标,在 ViDoRe v3 文档检索基准上 260M 档位超过所有 <800M 模型、800M 档…
无梯度自适应:仿射统计迁移与一个机制专属证书
CASTER 提出了一种完全不需要反向传播、也不需要源特征库的测试时自适应(TTA)方法:把源的类统计量压缩到一个判别性子空间,从目标 batch 的矩估出一个类共享的仿射变换,解析地把源的类分布搬到目标域上再分类;并配套一个 residualtomargin transportability certificate(…
A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss
SimLoss 通过在 embedding 空间做 InfoNCE 对比学习,让 VLM 在生成文本之前就先对齐视觉表征,实现了「单次推理」达到「多阶段验证」质量的细粒度图像描述,且推理速度提升约 20 倍,全程无需人工标注的细粒度描述文本。 现代 VisionLanguage Model(VLM)能生成流畅的图像描述…
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
HarnessDev 将 Agent 评测的焦点从「任务输出质量」转向「执行基础设施本身的质量」——当前 LLM 能从零构建可运行的 Harness,但在代码和搜索类任务上与成熟人工系统仍有显著差距,且 Evolution 阶段的改进不稳定、跨模型迁移效果有限。 一个 LLM Agent 的能力,并不只由模型权重决定,…
CRISP:利用"注意力悬崖"实现输入自适应的稀疏 Prefilling 优化
CRISP(CliffawaRe Inputadaptive Sparse Prefilling)针对 LLM 长上下文推理中 Prefilling 阶段 quadratic 算力瓶颈问题,提出了两个核心改进:C_struct 结构化代理替代 JSD 路由以消除计算开销,以及 sinkaware 阈值机制解决累积背景噪…