解读
1755 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
音视频模型中的注意力三角
1. 它解决什么真问题? 音视频扩散模型里,文本/音频/视频三路生成要靠跨模态 attention 协同,但同一机制会引入「语义泄漏」——提示词说 A,模型却生成符合学习先验但语义上错误的 B。这种系统性偏差长期被当成「attention 飘了」一笔带过,缺乏机制级解释。 2. 为什么以前的办法不够? 既有可解释性多盯…
PNPL 2026 竞赛:LibriBrain100 上的词分类与高效跨被试泛化
blocklistgreppreflight: 0 hits / 20260908T14:30+08:00 · v1 · anchor: arxiv:2609.03231 / LibriBrain100 / PNPL 2026 / 16 pages, 2 figures / 提交日期 20260903 2026 PNP…
Dr. Claw:一个面向氛围研究的人机协作 AI 科学家工作台
blocklistgreppreflight: 0 hits / 20260908T14:30+08:00 · v1 · anchor: arxiv:2609.00365 / GitHub:OpenLAIR/drclaw / EMNLP 2026 System Demonstrations / AGPL3.0 / 4,…
双层协同反思:多 Agent LLM 系统的博弈论方法
1. 它解决什么真问题? 现在的多 Agent LLM 系统(orchestrator + workers + textual reflection)工程上跑得不错,但学界一直没有一个统一的形式化框架来解释:协同、记忆改进、外部验证这三件事到底是怎么耦合在一起的。 2. 为什么以前不够? 既有研究要么是纯工程的 pro…
思维链表象之下:LLM 中推理操作的机制化解读
1. 它解决什么真问题? CoT(ChainofThought)在文本里把「问题建模 / 目标分解 / 演绎」等推理操作明确写出来,但这些操作的几何结构在 hidden representation 里长什么样,此前几乎没人系统刻画。 2. 为什么以前不够? 既有 mechanistic interpretabilit…
τ^τ-Bench:面向端到端真实 Agent 构建的环境
1. 它解决什么真问题? LLM Agent 已经被部署到客服、纠纷裁定、内部系统运维,但「构建 Agent 这件事本身」越来越被交给 coding Agent。现有基准(SWEbench、AgentBench、τbench 等)测的是「单个 Agent 干一件事干得多好」,没人测「能不能在真实客户协作条件下交付一个能…
于鲜活情境中观世界:HoloWorld 统一的室内-室外城市世界生成
HoloWorld 用一个持续更新的"跨尺度世界上下文",把城市尺度规划、单体建筑外观、几何受限的室内布局串成一个可自回归生长的统一 3D 城市世界,首次在统一 3D 框架内把室内与室外生成长期割裂的两条线缝合起来。 文本驱动 3D 生成在过去两年沿着两条独立路径爆炸式发展:一类是大规模室外场景(CityDreamer…
Enoki:高效多层级幻觉检测
Enoki 用一个"开放信息抽取(OpenIE)→ 关系事实验证 → 不支持事实反投影到原文 span"的统一 pipeline,把 claim 层级与 span 层级的幻觉检测统一在同一组"文本锚定的关系事实"上,让单次推理既能给出可解释的事实单元、又能精确定位幻觉 span,避免了既有方法"做两次对齐"的额外开销。…
ShallowStream:先浅层索引再深层回答的流式视频理解
ShallowStream 把流式视频理解的"编码"与"检索索引构建"两条路径合二为一——用 MLLM 的浅层 KV cache 同步完成帧编码 + 索引维护,查询时再用浅层 attention 分数做"上下文帧打分 + 多样性感知选择"取证据,最后才触发深层模型回答,把每帧 prefill 与端到端 10 秒延迟分别…
MaxKernel:面向 TPU 的 Agentic Kernel 生成系统
MaxKernel 是一个多 Agent 系统,让 LLM 自己生成和优化 TPU 自定义内核:三种范式(人机协作 / 全自动 / 图搜索)均能在 JaxBench 50 个 TPU 内核任务上匹配专家手调基线,并在真实大模型工作负载上带来显著性能提升。 为 TPU 等 AI 加速器写高性能自定义内核(custom k…
Does Your Agent's Memory Survive a Model Upgrade?模型升级后 Agent 记忆还能用吗?
Agent 升级底座模型后,记忆系统可能"静默失效":用知识图谱固定 schema 的记忆迁移最稳(跨模型精度只差 ±0.0004),但压缩成自然语言笔记的记忆高度依赖原模型(换方向精度可差 13 个百分点),且 storeonly 修复几乎不可能成功。 生产环境里,给 LLM Agent 升级底座模型是常态(更强的推…
RISE:用「自外推教师」把 RLVR 的稀疏回报变成稠密逐 token 监督
RISE(Recursive Improvement via SelfExtrapolating Policy Distillation)把 onpolicy distillation(OPD)卡了很久的「教师从哪来」问题拆掉:教师不用外部模型、不用 privileged context,直接从学生自己的 RLVR 训…
OR-Clarify + InterOPT:让 LLM 在建模之前先学会「问还是不问」
上海交大团队提出 ORClarify(preformulation clarification benchmark)与 InterOPT(两阶段交互框架),把「LLM 自动建模 OR 问题」这件事从「给定完整描述 → 输出数学模型」拆成两段:先判断当前信息是否 modelready,再决定是追问、停止还是默默补默认。b…
Substrate-Aware AI Agents:执行上下文作为 Agent 规划的第一等输入
告诉 LLM Agent 可用 RAM 和执行时间上限,Agent 会主动把代码从"大内存、长时间"重构为"省资源、快速"——无需改变任务目标,仅靠披露执行契约就能诱导出结构性自适应代码。 当前 LLM Agent 在规划时,只拿到"任务描述",完全不知道目标机器的内存、算力、时间预算等物理约束。这种 Substrat…
Motion-Omni:让对话虚拟人能"边说边动"的端到端统一框架
MotionOmni 提出了一个端到端的"语音 + 全身体运动"联合生成框架:用同一个大模型从对话语境同时输出语音与面部/手/上半身/下半身的运动,避免传统 "先语音后运动" 串行级联的两段独立推理与错位。⚠️ 原文未明确最终发表/录用场所,仅在 arXiv v1 公开(20260828),并附项目页与开源代码/数据。…
量化会破坏记忆:低精度循环推理中的状态回写陷阱
本文提出并命名了 "循环状态回写(recurrentstate writeback)" 这一被忽略的设计自由度,并通过 GRU/LSTM 上的实验证明:量化后"用什么规则把循环状态写回"本身会决定推理是否崩塌——固定 4bit 状态在荧光寿命成像任务上把 τ1/τ2 估计误差分别放大约 70× / 300×,而 err…
模型改得太多:最小化代码编辑的"忠实度"维度
本文把代码修复里的"过度编辑(overediting)" 拎出来作为与正确性并列的独立质量维度——同一个 bug,修得越短越忠于原代码越好;并基于 400 道 BigCodeBench 题构造了一个已知最小补丁的评测框架,证明前沿 LLM 即使 Pass@1 很高也普遍过度编辑;而一条"保护原实现"的提示能把平均多余 …
模仿学习是否保留灵巧操作的时间鲁棒性?专家与学习者的跨速度对比
在 ParcelStow(包裹抓取重定向插入)接触丰富任务中,基于 Action Chunking with Transformers(ACT)策略在标称速度下与脚本化专家一样达到 100% 任务成功率,但加速条件下性能急剧分化:专家保持 84% 成功率,而 ACT 骤降至 53%——插入阶段的对齐错误是主要失效模式,…
Aspire: Can Models Self-Evolve from Vague Goals?
当前 LLM Agent 能完整跑完训练和工具链编辑循环,但无法将局部改进稳定迁移到隐藏评测集——模糊目标下的自进化核心瓶颈不是「优化能力」而是「目标理解与数据选择」。 人类学习往往从一个模糊目标开始,比如「成为更好的物理学家」或「提升研究能力」。这个目标既没有现成的数据集,也没有明确的评估指标,学习者必须自己完成:诊…
DramaChain Bench:面向短剧生成的端到端基准
DramaChain Bench 是首个覆盖"剧本→分镜→关键帧→镜头视频→成片"全链路五阶段的短剧生成质量评估基准,通过 63 个叶子维度的标准化评价体系与基于 LLM Agent 的自动化评分 Agent,首次在工业级流水线层面系统性回答了"各阶段是否忠实于原始剧本意图"这一核心问题。 当前几乎所有视频生成评估基准…
知道何时不重用:自主 LLM Post-Training 中的条件经验迁移
BCIT 方法将「经验是否可重用」的判断从隐式假设变为显式决策,在 finance reasoning、texttoSQL、function calling 三个领域证明,减少有害更新的授权能将等预算下的最终模型质量推至更高水平。 LLM 落地一个领域后,需要持续 posttraining 来适应新工具、新数据、新需求…
CORD:校准后预测不变,信心变了——Post-hoc 校准的预测保留修复
CORD 是首个在 postfit 阶段实现精确预测保留的 adapter:不改变已训练好的 calibrator,不加超参数调优,在 CIFAR10/100 和 ImageNet1K 上实现零 TPCR(top1 prediction change rate)的同时,降低 ECE、NLL 和 Brier 分数。 Po…
PACE:揭示用户请求中的"隐性冲突"——从 KB 检索到多智能体冲突感知
PACE 论文提出"个性化助手冲突评估"任务与数据集 PACE,要求助手在执行看似合理的请求前,先从用户自我中心的知识库(KB)中多跳检索隐性约束,判断请求是否与用户当前处境冲突;并配套提出多智能体框架 PaceMaker(查询改写 + 多跳图遍历 + 冲突感知过滤),在 evidence retrieval 与 co…
Sparse Readout Prism:用特征而非 token 解释 Logit-Lens 分数
Sparse Readout Prism(SRP)把语言模型的 unembedding(readout)矩阵按其权重分解成稀疏的 readout features,让任何 token 的 logit 或 logit 差都可以写成这些稀疏特征的贡献之和,从而把"LogitLens 看到的 token"这一不稳定、易随拟合…
AutoTraceGT:把扎根理论搬上 Agent 行为分析的工程化流水线
一句话结论:AutoTraceGT 是首个把社会科学经典「扎根理论(Grounded Theory)」搬到 Agent 轨迹分析的多 Agent 流水线,靠 open → axial → theoretical 三阶段迭代直至 saturation,把"几千条 agent trace"自动变成一份可审计、可下游使用的行…
锁于入口,开于内里:RLVR 收窄解空间的位置
RLVR(可验证奖励强化学习)在提升 pass@1 的同时,会导致策略的解空间在「入口」处(即首个运算操作符附近)急剧收缩,使得 alternative solution 无法被发起,但一旦发起仍可执行——这是测试时扩展(testtime scaling)收益受损的根源。 当前 LLM 后训练广泛使用 RLVR 来提升…
语音脑机接口的通用通信度量:Open-Vocabulary Mutual Information (OVMI)
Speech BCI(语音脑机接口)领域长期缺乏跨系统可比指标;本文提出 OVMI(openvocabulary mutual information),以信息论为基础,在用户实际想表达的词分布上统一度量任意 BCI 系统的通信能力,使得不同词表、不同实验条件下的系统性能第一次可以在同一尺度上直接比较。 Speech …
RoboTok:互联网规模的机器人示范检索与灵巧操作学习
RoboTok 是一个互联网规模的数据引擎,给定一条人类操控视频作为 query,从海量网络视频中检索出与任务相关的灵巧操作示范,用于训练机器人 manipulation 策略——通过学习 3D 手部轨迹的潜在运动空间(latent motion space), RoboTok 实现了跨视角、跨场景、跨遮挡的鲁棒检索。…
QCell:重组与对齐细胞查询用于重叠实例分割
一句话结论:QCell 把重叠显微镜细胞的实例分割问题形式化为「查询在潜空间中先分解再重组」的全局推理任务,通过实例重组模块 + 对比查询对齐损失同时获得完整形状推理与重叠区域判别力,在 ISBI2014 上拿到 +2.2 AP / +2.7 AJI 的稳定增益,并贡献了一个新的 Organoid 重叠细胞基准。 显微…
终极翻译基准:当机器翻译指标失灵时,我们如何诚实地度量"还没翻对"的句子
机器翻译(machine translation, MT)研究用了几十年的 BLEU / chrF / COMET 等自动指标正在被更强的 LLM 攻破或被 rewardhacking 污染,连黄金标准的人工评估也缺乏可复现性与可扩展性;本文推出 Last Translation Benchmark(LTB):一份众包…