解读
1088 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Xiaomi-Robotics-1:基于 10 万小时真实轨迹的 VLA 基础模型
小米机器人团队用 10 万小时真实操作轨迹 + UMI 采集装置 + 自动语言标注流水线 训练了一个通用 VisionLanguageAction(VLA)基础模型,在未见环境中可零样本执行移动操控指令,并用极少数据就能微调到新任务。 通用机器人目前有三个长期痛点: 1. 数据规模:互联网级数据对机器人不适用,真实轨迹…
Lucid:当 Agent 开始「做梦」——多模态长期记忆的黑盒视觉攻击
提出 Lucid —— 一种严格 imagebounded(不接触目标 MLLM、不接触检索编码器、不接触文本通道)的黑盒对抗框架,可对多模态 Agent 的长期视觉记忆管道实现 61.6% 的"记忆投毒"成功率与 58.4% 的"记忆注入"成功率,揭示当前主流多模态记忆管线存在结构性漏洞。 2026 上半年 Agen…
S1-Omni:把 200 个科学任务塞进一个统一多模态推理模型
S1Omni 是面向 AI4Science 的统一多模态推理模型,把 CIF(晶体)、SMILES(分子)、蛋白序列、谱图、科学图像等异构数据统一表征为单一共享空间,在 200 个科学任务 / 60+ benchmark 上训练与评估,大多数任务上超越 GPT5.5 与 Gemini3.1Pro,并在多项任务上打平或超…
Maglev:滑动循环记忆——固定大小记忆的并行可训练循环 Transformer
首段自检:机制 3 段(双模型耦合 / 记忆一致性损失 / 滑动窗口 K/V 循环注入)+ 工程 2 段(共享参数 + 与滑动窗口基线对比)+ ⚠️ 数字核验 2 处("validation loss 与 pretraining benchmark 提升"未给具体数值;"参数共享保留大部分增益"未给比例,abstrac…
从不可听到不可信:LALM 的低频安全风险与 DRG 防御
首段自检:机制 2 段(ILL 攻击管线 / DRG 检测重录防御)+ 工程 2 段(跨 6 个 LALM / 通用波形黑盒设定)+ ⚠️ 数字核验 3 处(67pp / 1.33 / 28.5%→46.1% 均来自 abstract 原文但需 PDF 复核任务清单;6 个 LALM 模型名单 abstract 未给;…
Gambit:把测试时计算从"撒网"变成"投资"的思维级束搜索
首段自检:机制 2 段(思维级束搜索算法 / 隐藏状态轻量打分器)+ 工程 2 段(硬件利用率 vs 并行采样 / 端到端 vs 减法剪枝)+ ⚠️ 数字核验 4 处(HMMT24 +6.7pp / AIME25 +3.3pp / 2× 吞吐 / 68.5% token 均来自 abstract 但属"up to"上限…
规范优先收敛与 AI 编码 Agent:拆除 717k 行代码库核心不变量的案例研究
首段自检:机制 4 段(规范→精炼→原子实现→验证循环)+ 工程 3 段(717k 行/189 文件/三天/$2430)+ ⚠️ 数字核验 3 处(提交统计 / 审计缺陷 / 成本)均来自 abstract 单源,单案例无横向对照。 在没有人工代码审查、也没有现成测试预言机的条件下,一个 AI 编码 Agent 通过"…
上下文匹配蒸馏(CMD):自回归视频蒸馏里的教师因果性
首段自检:机制 5 段(causal teacher / prefix scoring / prefix corruption / 同构 formulation / 因果边界对齐)+ 工程 3 段(帧级/块级/长视频/相机条件四场景外推)+ ⚠️ 数字核验 3 处(SOTA aggregate 表述、benchmark…
用于可组合非结构化知识编辑的混合策略自编辑(HPSE)
首段自检:机制 4 段(composability / selfdistillation / hybrid rollout / 理论保证)+ 工程 3 段(4 backbone × 2 editor + plugandplay)+ ⚠️ 数字核验 2 处(数字均未在 abstract 给出,标注原文未明确)。 HPSE…
Recursive Agent Harnesses:将代码优先的 Agent 递归推向长上下文推理
RAH 将递归 LLM(RLM)中"模型调用递归"拓展为"完整 Agent harness 递归"——父 Agent 生成并运行可执行脚本,脚本内并行 spawn 子 Agent harness,在 OolongSynthetic 上以 GPT5 为 backbone 将基线从 71.75% 提升至 81.36%,用更…
TRACE:通过 Token 影响归因追踪投毒检索语料中的目标答案
TRACE 是一种无需辅助分类器、无需额外 LLM 调用的轻量级 RAG 投毒攻击检测框架,通过 Token 影响归因(Token Influence Attribution)追踪答案相关 Token 在检索文档中的高影响关键词,在 3 个 QA 基准和 6 个 LLM 上验证了检测能力,并能同步揭示攻击者指定的目标答…
Tatoxa:面向低资源语言鞑靼语的文本去毒系统
Tatoxa 是一个面向鞑靼语(Tatar)文本去毒(Text Detoxification)的 SOTA 系统,在关键质量指标上同时超越开源和商用闭源 LLM,并发布了一个新的鞑靼语去毒数据集;其跨语言迁移实验揭示了一个重要结论:从文化相近语言(如俄语)迁移的效果,显著差于使用原生鞑靼语数据训练的模型,这一发现对低资…
BigBird:把 Transformer 的注意力从二次方压到线性,且不丢「通用逼近」性质
Google Research 提出的 BigBird(Zaheer et al., 2020, NeurIPS 2020)通过「全局 + 局部 + 随机」三种稀疏注意力模式叠加,把 Transformer 的注意力复杂度从 O(n²) 降到 O(n),同时在理论上证明:稀疏注意力机制仍是序列函数的通用逼近器且具备图灵…
GAN 综述(2020):在扩散模型崛起前夕的算法、理论与应用全景盘点
香港中文大学(深圳)等团队 2020 年 1 月发表的 GAN 综述(Gui et al., 2020)系统整理了 2014 年 GAN 提出以来 5 年内主要算法变体的数学结构、理论性质与跨学科应用,覆盖图像、语音、自然语言、医学与数据科学等领域——是「GAN 范式总结」的代表性综述,也是扩散模型崛起前夕GAN 研究…
银河系漫游指南:面向科学基础模型的 Tokenizer 基准
把 Affine、AIM、JetFormer、VQVAE 四种 tokenization 策略套进同一个 Transformer 框架、用 64 万张 DESI Legacy Survey 星系图像和共享的 AstroPT backbone 跑了一轮"重建 + 表示"双维度评估后,论文给出一个不太浪漫的结论:重建质量与…
DZIRI Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统
DZIRI Voicebot 用一条模块化 pipeline 把 Whisperbased ASR、Transformerbased NLU(intent + entity)、RAG、神经 TTS 串起来,给没有标准正字法、频繁与法语 codeswitch 的阿尔及利亚方言搭出一个"电信领域可复现的端到端语音对话基线"…
ABACUS:把统一基础模型改造成"会数数也会画数"的图像计数系统
ABACUS 在 3B 参数的统一视觉语言模型基础上,靠三招创新(密度感知自适应缩放 + 基于 GRPO 的边界感知计数策略 + 循环一致 GRPO 让理解分支自己给生成打分),把"物体计数 / 人群计数 / 指代表达计数 / 忠实计数的图像生成"四件原来各做各的事塞进同一个模型、零基准特定训练,在 7 个基准上同时拿…
开源权重 LLM 中的约束税:结构化输出约束下工具调用抑制的实证研究
这篇论文在生产 Agent 系统中复现了一个被长期忽视的可靠性问题:当 Tool Calling 与 JSON Schema 结构化输出同时启用时,多个开源权重 LLM 会出现"工具调用抑制"(Tool Suppression)——schema 约束被严格遵守,但工具不再被调用。论文给出实现层解释(schema 编译为…
ScoreGate:基于双分数统计融合的 RAG 自适应 Chunk 选择
ScoreGate 是一个零额外模型推理的 RAG 检索 cardinality 自适应机制:复用线上已有的 biencoder 相似度 $s_i$ 和 crossencoder reranker 分数 $r_i$,通过"双分数统计融合"决定每个 query 该召回多少 chunk,从而在 MS MARCO 和真实生产…
监督学习自然语言推理数据中的通用句子表示
这篇论文给出了一条后来被广泛验证的迁移学习路线:不要只从无标签语料学习句向量,而可以利用 Stanford Natural Language Inference(NLI)的监督信号训练一个通用句子编码器;得到的表示在多种下游任务上稳定超过 SkipThought 等无监督方法。 在 2017 年前后,word embe…
DSWorld:让数据科学 Agent 拥有「世界模型」的预测能力
DSWorld 把数据科学 Agent 类比为游戏 Agent,引入 Data Science World Model(数据科学生成式世界模型),让它在真正执行昂贵的 ETL / 训练 / SQL 之前,能预测「如果我现在做这步操作,工作流状态会怎么变」,从而把基于 RL 的训练加速约 14×、基于搜索的推理加速约 3…
TARS:用于 IDE 内个性化代码理解的 Theory-of-Mind Agent
TARS 是一个集成进 VS Code 的 LLM Agent,通过「轻量级心智理论(Theory of Mind, ToM)」先推断开发者画像,再据此调节解释深度与措辞,并用 RAG 把解释锚定到项目文档,在 18 人受控实验里把非平凡 Java 代码理解任务完成时间缩短 26%,并降低主观认知负荷。 如果一定要再压…
面向魁北克保险合同解释的 RAG 系统:以人为中心的评估
本文用 154 位 Laval University 受试者对一个为魁北克汽车保险合同解释而设计的 SOTA RAG 系统做外在、以人为中心的评估,发现系统被体验为「认知均衡器(cognitive equalizer)」:满意度、信任、清晰度都拿到高分,且用户对系统给予的「自主感」的看重程度甚至超过系统本身传递的知识—…
RMM:把 Transformer 矩阵乘法按"输入自适应"砍一刀
一句话结论:RMM(Reduced Matrix Multiplication)是一个训练免、改权免、输入自适应的推理加速方法 —— 它在矩阵乘法的缩并维度(contraction dimension)上按 token 动态挑选"信息量大的切片"参与计算,其余切片丢掉;在不修改模型权重的条件下,1B–70B 模型上获得…
Syfer:在多语多跳问答里把"翻译"和"分解"都关掉一次
一句话结论:Syfer 是一个"延后翻译 + 有条件分解"的 mRAG 框架 —— 默认在原语种内做子问题图分解与逐步回答,只有当分解质量自检失败时才走"翻译到英语 + 双语子问题图对齐"的兜底分支;它在多语多跳 QA 上以更少 token 拿到与 SOTA 接近的精度,把"先翻译再做"和"贪心分解 + 路径聚合"两类…
SKILLER:用大模型当"教练",给小语言模型写技能
一句话结论:SKILLER 是一个用自然语言做信号的强化学习框架,专门给小型开源 LLM(4B/9B 级别、消费级 GPU 可跑)自动生成"技能"(skill) —— 它把强模型同时当 actor 和 critic,把小模型 agent 系统当 environment,所有 RL 信号完全用自然语言传递;在五个相关基准…
CoRe:面向 Web 规模视频搜索中多阶段上下文感知相关性的连续奖励微调 LLM 查询改写器
CoRe 是一个被部署在大型短视频搜索系统中、每周重新训练并连续运行超过五个月的 LLM 查询改写器,通过「以线上多模态相关性模型为奖励源 + 乘性比值奖励形式 + 半在线 DPO 风格训练循环」三件套,把改写器和生产级 ranker 之间的仿真生产 gap 真正闭环。 LLM 查询改写器是搜索/推荐系统里很常见的一类…
ABACUS:桥接图像计数理解与生成的统一视觉语言模型
ABACUS 在一个 3B 参数的统一视觉语言模型上同时搞定物体计数 / 人群计数 / 指代计数 / 计数忠实图像生成四类任务,无需任何基准特定训练,在 7 个基准上同时击败任务专用专家和更大的通用多模态模型(review 中)。 "数清楚"(counting)是视觉里看似简单、实际棘手的能力,也是判断 VLM 是否真…
The Galaxy's Guide to the Tokenizer:科学 Foundation Model 的 Tokenizer 基准评测
通过 64 万张星系图像的受控实验,系统揭示了四种 Tokenizer 策略(Affine / AIM / JetFormer / VQVAE)在科学 Foundation Model 中对重建质量与物理属性预测能力的差异化影响,首次证明了"重建质量"与"表示质量"之间存在显著解耦。 Tokenization(分词/标…
DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
DreamXPhi 1.0 是一个动作条件视频世界模型(actionconditioned video world model),用于机器人操作任务:给定一帧观测、语言指令、一串由末端执行器位姿 + 夹爪状态组成的动作序列,预测未来的视频观测;它通过 PRoPE 风格的几何编码把每条机械臂的 SE(3) 变换注入注意力…