解读
1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Codifying the Judge:通过程序蒸馏实现可扩展评估
将 LLMasaJudge 的评判逻辑蒸馏为一组可执行程序(Programmatic Judges),在消除逐样本 API 成本的同时匹配 13B LLM 的评判准确率,并可作为廉价奖励信号反哺 RewardBench。 LLMasaJudge 已成为 LLM 评测的事实标准——让一个 LLM 扮演评审,给候选答案打分…
Reasoning Denoiser:通过推理轨迹去噪提升大推理模型的幻觉检测
识别并过滤大推理模型(LRM)推理轨迹中的两类噪声(无关步骤与重复步骤),用"终态注意力"作为自动监督信号去噪,使幻觉检测器在清理后的轨迹上表现显著提升。 大推理模型(Large Reasoning Models,LRM)——如 OpenAI o1、DeepSeekR1——在给出最终答案前会先生成一段很长的推理链(Co…
UltraViT:面向大视觉-语言模型的端侧延迟优化视觉编码器
论文提出 UltraViT——一个为「端侧(ondevice)延迟」而非仅 FLOPs 设计的 LVLM 视觉编码器:采用异构空间混合器(heterogeneous spatial mixers)按 macroblock 装配的金字塔架构,并配套两阶段生成式预训练(密集蒸馏 + 冻结 LLM 的生成式监督),在多项 L…
DEFRAG:从云到群——面向 RAG 的去中心化边缘协作系统
DEFRAG 用"知识图谱压缩共享 + 混合检索"解决边缘 SLM 的知识覆盖问题,再用"自适应 SLM 选择器 + RAG 参数调优"解决准确率与成本的平衡,最终在 heterogeneous edge testbed 上让 SLM 的准确率逼近云端 LLM,同时相比集中式云服务最高降本 98.4%、提升峰值吞吐 9…
TEngineDB-V:面向大 k 工作负载的 OLAP 原生向量搜索系统(腾讯)
TEngineDBV 把向量搜索提升为腾讯 OLAP 引擎的"一等分析原语",通过全局段解耦索引 + 关系算子化 + 方向感知量化(DPPQ),在 10³–10⁵ 的大 k 分析型向量检索上,比 StarRocks 等竞品最多快 145×,并在腾讯内部 100 亿规模生产环境取得 52× 提升。 LLM 数据管理、推荐…
宪法式中训练:内容存在驱动对齐收益
在 120B token 规模的中训练(midtraining)阶段插入 394M token 的"宪法"语料,可在不付出能力代价的前提下,让模型在后续 SFT 与良性微调中仍维持更稳健的价值观对齐——但其优势只在"静态价值观"层面成立,面对需要主动抵抗上下文压力或价值冲突的场景,优势会在 SFT 后被削弱。 当下大模…
超越"感觉更好":能力维持型情感对话作为纵向研究范式
当前情感对话研究几乎全部聚焦"让用户当下感觉更好",作者提出能力维持型情感对话(CSED, CapabilitySustaining Emotional Dialogue)——把目标重定义为在整个交互生命周期中维持用户的情绪调节、应对、自我决策与社会联结能力,并以此重组数据、模型、系统设计、评测与治理。 情感对话领域存…
EMBL AI Librarian:面向 AI Agent 的生命科学知识层
EMBL AI Librarian 把 Europe PMC(4000 万+ 文献索引)从"为人设计的检索系统"升级为"为 Agent 设计的知识层"——Agent 用自然语言提问,由一个 LLM 编排器(orchestrator)规划互补子查询、调用活体 Europe PMC 检索、阅读入选论文并定位证据段,最终直接…
多 Agent 自动化研究系统的词汇表
论文提出了一套用于描述和比较「多 Agent 自动化研究系统(autoresearch system)」的工程词汇表,把五花八门的 AutoResearch / AI Scientist 设计拆成 8 个轴——Agents、Operations、Permissions、Communication、Memory、Cont…
Evaluating Large Language Models Trained on Code
OpenAI 将 GPT 模型在 GitHub 代码上微调得到 Codex,发现重复采样(repeated sampling)是一种出乎意料地有效的代码生成策略:单个样本只能解决 28.8% 的编程问题,但用 100 个样本时即可解决 70.2%;同期 GPT3 完全无法通过 HumanEval 的任何题目。 在 Co…
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
针对 Diffusion Transformer 视频生成中长序列 attention 的推理瓶颈,提出训练free 的 SolAttn 框架,在单次 onlinesoftmax 过程中统一完成动态路由选择、稀疏计算和近似修正,实现注意力稀疏化精度与效率的帕累托最优。 Diffusion Transformer(DiT…
LLaDA-V:基于视觉指令微调的大语言扩散模型
LLaDAV 是首个纯扩散范式的多模态大语言模型,用 masked diffusion 替代自回归生成,展示了不依赖 AR 范式也能做有竞争力的多模态理解的可能性。 自回归(AR)生成长期以来是多模态大语言模型(MLLM)的主流范式——无论是 LLaVA 系列还是 Qwen2VL,视觉理解最终都服务于「预测下一个 to…
Recursive Language Models:突破上下文窗口限制的通用推理范式
Recursive Language Models(RLM)不把长 prompt 塞进 Transformer,而是将其作为外部环境,让 LLM 以编程方式递归地审视、分解、自调用 prompt 片段——在 8B 参数规模下即可超越 vanilla GPT5 在三个长上下文任务上的表现。 Context Window …
Verifiable Software Worlds for Computer-Use Agents
OpenComputer 通过为真实桌面应用编写硬编码状态验证器,为 ComputerUse Agent 提供了可审计的、部分可评分的自动化评估框架,证明了硬编码验证器比 LLMasjudge 更贴近人类裁判——尤其在任务成败取决于细粒度应用状态的场景。 ComputerUse Agent(能操控桌面软件完成任务的 A…
并非所有 Token 都应获得同等贡献:面向长链思维推理的反事实敏感度贡献重分配
CSCR(Counterfactual Sensitivity Credit Reallocation)通过"反事实再评分 + 敏感度引导的优势重加权",把 GRPO 一刀切的 token 级信用分配改造成"按敏感度打折、保留总预算与方向"的形式,在长链思维推理任务上以同等策略更新次数稳定跑赢 GRPO 基线。 在大模…
RL²-VLA:面向 VLA 模型的自适应强化学习潜在组合引导与测试时缩放
RL²(Reinforcement Learning on VLA Latents)通过在 VLA 动作专家的潜空间训练一个轻量离线 RL 策略,将其 flow velocity 与冻结 VLA 的 flow velocity 进行组合式引导,并仅在"基础策略可能失败"时激活该引导,在 SIMPLER 与 PolaRi…
面向暗光场景的鲁棒 3D 感知 RGB-NIR 成像
3DarkFusion 借"3D 感知神经建模"重构了 RGBNIR 暗光融合的范式:不依赖干净 RGB 监督,通过让模型在 3D 空间中隐式融合极度含噪的 RGB 观测与 NIR 线索,输出干净的 RGB 图像,并对不同噪声等级保持鲁棒。 低光照 RGB 成像的标准做法是靠 paired 数据(暗光 RGB ↔ 干净…
SAF-OPD:面向 On-Policy 蒸馏的稳定优势融合
把 RLVR(可验证奖励的强化学习)和 OPD(onpolicy 蒸馏)的优势信号用一个稳定、可调的双向融合管线拼起来,既不抹除稀疏奖励信号,也不把学生模型死死按在教师分布里。 RLVR 和 OPD 是当下小模型后训练的两条主干路线。RLVR(如 GRPO)给整条响应一个可验证奖励(数学题对错、单元测试是否通过),再把…
更少澄清,更优代码:面向编程助手的跨会话个性化歧义自适应基准
把"同一用户过去解决过的编程歧义"当作跨会话长期记忆来复用,提出 CAPA 基准(600 个会话 × 60 个用户歧义单元格)量化 12 个 LLM 在"少澄清 + 出对代码"上的真实差距。 AI 编程助手正在从"单轮问答"走向"长期协作"。但当用户第二天打开新会话时,上次已经澄清过的偏好(例如"我的项目用 4 空格缩…
Mental World Modeling:把"心智变量"放进世界模型
把"人相信什么、想要什么、打算做什么"这类心智变量从世界模型的后验解释升级为与物理状态并列的核心状态变量,提出 MWM 框架与训练免费的 MENTIS 基线。 现有世界模型(world model)只能回答物理层问题:场景里有什么、它在哪里、它下一步怎么动。但人类决策并不是被物理场景单独驱动的——你看到同事沉默,没说话…
Vision Mamba:用双向状态空间模型做高效视觉骨干
Vision Mamba(Vim)首次把纯 SSM(State Space Model)类结构(Mamba)做成视觉通用骨干,通过"双向 SSM + 位置嵌入"的简单设计,在 ImageNet 分类、COCO 检测、ADE20K 分割上同时跑赢 DeiT 等成熟 ViT,并且推理速度与显存显著更优,验证了"视觉表征学习…
PaLM-E:把连续感官信号注入大语言模型的"具身多模态"路线
PaLME 把"图像、机器人状态估计等连续感官模态"通过专门的编码器投影到 LLM(PaLM)的词表嵌入空间,与文本 token 拼成一个多模态序列,端到端训练,从而把 PaLM 这种纯文本大模型直接升级为可以看图、看机器人状态、输出机器人动作规划的多模态通用模型,并且在 OKVQA 等视觉问答上达到 SOTA,同时不…
SimVLM:用海量弱监督 + 单一目标做极简视觉-语言预训练
SimVLM(Simple Visual Language Model)主张"VLP 不需要复杂的多任务目标与精细标注",仅靠海量图文弱对齐数据(alttext / web caption)配合单一 prefix language modeling 目标做端到端预训练,就在 VQA、NLVR2、SNLIVE、image…
PathRouter: Aligning Rewards with Retrieval Quality in Agentic Graph RAG
PathRouter 针对 Agentic GraphRAG 中 outcomeonly RL 的两大痼疾——答案路径奖励混叠(answerpath reward aliasing)和搜索更新歧义(searchupdate ambiguity)——提出四类轨迹分治 + 差异化 GRPO 优势缩放 + 冻结 goldev…
WorldDiT:面向世界建模与动作建模的统一扩散架构
论文提出 WorldDiT——一种把「动作生成(action generation)」与「视觉世界建模(visual world modeling)」耦合在同一个 diffusion transformer 里的统一架构,不依赖大预训练 VLM 作为动作骨干,就在 LIBERO 四个仿真套件上落在已报告方法的「总参数 …
PerceptionBench:把 MLLM 的"原子视觉感知"单独拎出来打分的基准
PerceptionBench 给 MLLM 出了一份"剥离推理与领域知识"的纯感知考卷:在 16 个前沿模型上跑下来,没有任何一个跨过 60% 准确率,感知相关幻觉(perceptionrelated hallucination)是所有能力中平均最弱的一项,并且总分相近的模型在能力剖面上差异巨大——这把 MLLM 评…
Mage-VL:面向实时多模态的 Codec-Native 流式基础模型
MageVL 提出了一种 codecnative 的流式多模态基础模型:核心是自定义 tokenizer MageViT,通过对 I/P 帧做"动态 + 残差能量"选择性编码,把视觉 token 削减 75% 以上,并配合一个"类脑双系统"架构(轻量 System 1 事件门 + 因果 System 2 解码器),在 …
RARG:把"相关性"重新定位为 Agentic Search 的执行先验
RARG(RelevanceAware RipGrep Search Agent)把"相关性"从一个文档级的筛选分数,重新定位为"在语料里执行 grep 式交互时的执行先验"——它在粗到细三个粒度上引导直接语料交互(DCI):用文档级相关性决定 ripgrep 顺序、用段落级相关性初始化入口、用匹配片段级相关性重排,让…
InMind:定位 Agent 长期记忆的"隐式关联盲点"
InMind 是一个 125 题、专家验证、覆盖 10 个生活领域的 Agent 长期记忆评测基准。它揪出了一个长期被忽视的失败模式——隐式关联盲点(implicitassociation blind spot):当一条记忆和当前查询之间没有共享字面线索时(典型例子:"坚果过敏"→"马卡龙含杏仁粉"),现有六种主流向量…
VisualPatchWorld:用「代码世界模型」做规划,神经与符号的折中路线
VisualPatchWorld(VPW)把世界动力学表示为可执行的代码程序而非隐式神经网络:先用少量主动探针选定定性动力学形式(如线性、阻尼、弹簧),再用观测到的状态动作轨迹拟合参数;得到的程序既能像 simulator 一样向前 rollout,又能被人读懂、可编辑,并直接接入 modelpredictive co…