解读
1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
CoCa:用对比损失 + 描述损失,把图像-文本基础模型做「一锅端」
CoCa(Contrastive Captioner)把 CLIP 的对比学习(contrastive loss)和 SimVLM 的描述生成(captioning loss)塞进同一个 encoderdecoder Transformer,用「前半段 decoder 不做 crossattention / 后半段做」…
MiniGPT-4:当「视觉 + Vicuna + 投影层」组合被简化到极致
MiniGPT4 把 LLaVA 的「CLIP + Vicuna + 投影层」配方再简化:把 QFormer 之类的中间件全砍掉,只用一个投影层对齐冻结的 ViT + 冻结的 Vicuna,再用少量 detailed caption 数据做二次微调,就复现了 GPT4 那种「看图写诗、看图生成网页、看图讲笑话」的能力。…
ViLT:让视觉-语言预训练摆脱「重检测器」
ViLT(VisionandLanguage Transformer)第一次把 vision encoder 砍到「纯 ViT patch embedding」级别:不再依赖 Faster RCNN 抽 region feature,整张图直接当 32×32 个 patch 喂进 Transformer,与文本 tok…
VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
VideoMAE 证明视频 masked autoencoder 可以在极小数据集(3k–4k 视频)上高效自监督预训练,极高 masking ratio(90%–95%)不仅无害,反而提升了表征质量。 视频自监督预训练长期依赖超大规模预训练数据集(如 Kinetics700),对小样本场景(如 SomethingSo…
InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning
InstructBLIP 在 BLIP2 预训练模型基础上,对 26 个公开数据集做系统性的 visionlanguage instruction tuning,首次实现零样本泛化到 13 个 heldout 数据集上全面超越 Flamingo 等更大模型,并在 ScienceQA 上达到 90.7% 准确率。 GPT…
From Foundation to Application: Improving VLA Models in Practice
LingBotVLA 2.0 通过扩展预训练数据覆盖机器人全身自由度,显著提升了跨具身(crossembodiment)长时程移动操作能力,在 GM100 基准的通用设置下验证有效,有效弥合了 VLA 基础模型在实验室环境与真实落地之间的差距。 VLA(VisionLanguageAction)基础模型在论文实验中表现…
TSseek:面向分布式时序数据集的正则表达式相似性搜索
TSseek 是一套面向大规模分布式时序数据的正则表达式驱动相似性搜索框架:把时序片段抽象为「保留斜率方向 + 值域」的线段序列,把正则查询转译成有界矩形,再在自研的分布式空间索引 TSseekX 上做全匹配与子序列匹配两种查询,论证并实证了 PAA/SAX 等传统近似索引在「正则模式查询」上根本不适用。 时序相似性搜…
Bespoke-Card:用代码生成替代手工调优的基数估计器合成系统
BespokeCard 是一个由 Agent 驱动的基数估计(cardinality estimation)系统——它针对一个具体的工作负载(schema + 真实查询),让规划 Agent 决定估计策略、让编码 Agent 直接生成可执行的 Python 估计器、用结构化 qerror 反馈 + 回归分析 + 课程式…
MAGMaR 2026 共享任务综述:以多模态检索驱动文章生成
ACL 2026 第二届 MAGMaR(Multimodal Augmented Generation via Multimodal Retrieval)共享任务概述了当年参赛系统在两个赛道的整体表现——视频检索(2 队 17 系统,全部超越上届冠军基线)与基于检索视频的接地文章生成(4 队 16 系统,所有参赛队都有…
CoRe:面向 Web 规模视频搜索的多阶段上下文感知查询改写器(连续奖励微调 LLM)
在大型短视频搜索引擎里,CoRe 把一个 LLM 查询改写器做成"用部署中的多模态相关性模型做奖励、乘性比值形式对齐生产融合代数、半在线 Mixed Preference Optimization 周更重训"的工业流水线,五个月内每周重新部署一次,线上 A/B 在 recall/rawrank/finerank 三段同…
ScoreGate:基于双分数统计融合的 RAG 自适应 Chunk 选择
ScoreGate 用"双编码器相似度 s_i + 交叉编码器 reranker 分 r_i"两条已经存在于标准 RAG 管线里的分数做 scorespace 决策,在不增加任何模型推理的前提下动态决定每个 query 要保留几个 chunk,在 MS MARCO 与真实生产流量上同时实现了"少 35% chunk、M…
多教师在策略蒸馏里工具调用边界漂移的诊断与校准
在多教师 onpolicy 蒸馏(OPD)训练 agentic LLM 时,聚合 KL/JS 散度会把"过度调用工具"这类行为漂移藏起来;论文给出"行为杠杆不均"(behavior leverage imbalance)的诊断视角,并用逐 token 的 Soft Clamp 把极端的 token 级 JS 散度压下去…
开源权重 LLM 中的"约束税":结构化输出约束下工具调用被抑制的实证研究
当 Tool Calling 与 JSON Schema 结构化输出约束同时启用时,多个开源权重(openweight)LLM 会出现 Tool Suppression——尽管工具执行与 schema 合规各自独立都能工作,联合部署下模型干脆不再调用工具;论文把原因归到"JSON Schema 被编译成 grammar…
DeepSearch-World:可验证环境中深度搜索 Agent 的自蒸馏
作者把"深度搜索 Agent"训练里 SFT 轨迹死板、RL 奖励稀疏两大痛点,合并成一个方案:先造一个确定性可验证的环境(DeepSearchWorld),再让 Agent 在里面自己跑、自己筛、自己蒸馏(DeepSearchEvolve)。结果 9B 模型没靠更强教师蒸馏,就在 BrowseComp 上拿到 31.…
Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)
mRNN(Baidu Research / UCLA, Mao et al., 2014)提出一种端到端的多模态循环神经网络,直接建模「给定图像和前文词序列条件下生成下一个词」的概率分布,在四个基准数据集上超越当时 SOTA,同时在图文双向检索任务上也取得了显著提升。 在 2014 年,image captioning…
RL-Index:把推理前移到索引阶段的检索增强生成
本文提出 RLIndex——一个把「检索索引推理」建模为强化学习问题的 agentic indexing 框架:在索引阶段用 LLM 生成显式编码「查询知识潜在关系」的 rationale,再用 GRPO(Group Relative Policy Optimization) 配合「检索相似度」作为可验证 reward…
GigaAM Multilingual:面向代表性不足语言的基础模型
针对中亚三种长尾语言(Kazakh、Kyrgyz、Uzbek),作者用 2M 小时音频训了一个 Conformer 编码器,在预训练阶段做聚类级数据平衡、在微调阶段做域感知采样,让"小语种 ASR"在自发语音上明显超过 Whisper Large v3 和 Omnilingual1B 等开源强基线,同时算力开销可控。 …
MAGE-RAG:面向长文档问答中 Agentic 多模态 RAG 的多粒度自适应图证据框架
MAGERAG 通过"离线建图 + 查询时动态子图构建"的混合架构,在长文档多模态问答中首次实现了证据覆盖率与噪声控制的动态平衡:在 LongDocURL 达到 52.75% 准确率,在 MMLongBenchDoc 达到 53.26% 准确率(51.19 F1),显著优于固定 Topk Text RAG 和 Page…
Xiaomi-Robotics-1:基于 10 万小时真实轨迹的 VLA 基础模型
小米机器人团队用 10 万小时真实操作轨迹 + UMI 采集装置 + 自动语言标注流水线 训练了一个通用 VisionLanguageAction(VLA)基础模型,在未见环境中可零样本执行移动操控指令,并用极少数据就能微调到新任务。 通用机器人目前有三个长期痛点: 1. 数据规模:互联网级数据对机器人不适用,真实轨迹…
Lucid:当 Agent 开始「做梦」——多模态长期记忆的黑盒视觉攻击
提出 Lucid —— 一种严格 imagebounded(不接触目标 MLLM、不接触检索编码器、不接触文本通道)的黑盒对抗框架,可对多模态 Agent 的长期视觉记忆管道实现 61.6% 的"记忆投毒"成功率与 58.4% 的"记忆注入"成功率,揭示当前主流多模态记忆管线存在结构性漏洞。 2026 上半年 Agen…
S1-Omni:把 200 个科学任务塞进一个统一多模态推理模型
S1Omni 是面向 AI4Science 的统一多模态推理模型,把 CIF(晶体)、SMILES(分子)、蛋白序列、谱图、科学图像等异构数据统一表征为单一共享空间,在 200 个科学任务 / 60+ benchmark 上训练与评估,大多数任务上超越 GPT5.5 与 Gemini3.1Pro,并在多项任务上打平或超…
Maglev:滑动循环记忆——固定大小记忆的并行可训练循环 Transformer
首段自检:机制 3 段(双模型耦合 / 记忆一致性损失 / 滑动窗口 K/V 循环注入)+ 工程 2 段(共享参数 + 与滑动窗口基线对比)+ ⚠️ 数字核验 2 处("validation loss 与 pretraining benchmark 提升"未给具体数值;"参数共享保留大部分增益"未给比例,abstrac…
从不可听到不可信:LALM 的低频安全风险与 DRG 防御
首段自检:机制 2 段(ILL 攻击管线 / DRG 检测重录防御)+ 工程 2 段(跨 6 个 LALM / 通用波形黑盒设定)+ ⚠️ 数字核验 3 处(67pp / 1.33 / 28.5%→46.1% 均来自 abstract 原文但需 PDF 复核任务清单;6 个 LALM 模型名单 abstract 未给;…
Gambit:把测试时计算从"撒网"变成"投资"的思维级束搜索
首段自检:机制 2 段(思维级束搜索算法 / 隐藏状态轻量打分器)+ 工程 2 段(硬件利用率 vs 并行采样 / 端到端 vs 减法剪枝)+ ⚠️ 数字核验 4 处(HMMT24 +6.7pp / AIME25 +3.3pp / 2× 吞吐 / 68.5% token 均来自 abstract 但属"up to"上限…
规范优先收敛与 AI 编码 Agent:拆除 717k 行代码库核心不变量的案例研究
首段自检:机制 4 段(规范→精炼→原子实现→验证循环)+ 工程 3 段(717k 行/189 文件/三天/$2430)+ ⚠️ 数字核验 3 处(提交统计 / 审计缺陷 / 成本)均来自 abstract 单源,单案例无横向对照。 在没有人工代码审查、也没有现成测试预言机的条件下,一个 AI 编码 Agent 通过"…
上下文匹配蒸馏(CMD):自回归视频蒸馏里的教师因果性
首段自检:机制 5 段(causal teacher / prefix scoring / prefix corruption / 同构 formulation / 因果边界对齐)+ 工程 3 段(帧级/块级/长视频/相机条件四场景外推)+ ⚠️ 数字核验 3 处(SOTA aggregate 表述、benchmark…
用于可组合非结构化知识编辑的混合策略自编辑(HPSE)
首段自检:机制 4 段(composability / selfdistillation / hybrid rollout / 理论保证)+ 工程 3 段(4 backbone × 2 editor + plugandplay)+ ⚠️ 数字核验 2 处(数字均未在 abstract 给出,标注原文未明确)。 HPSE…
Recursive Agent Harnesses:将代码优先的 Agent 递归推向长上下文推理
RAH 将递归 LLM(RLM)中"模型调用递归"拓展为"完整 Agent harness 递归"——父 Agent 生成并运行可执行脚本,脚本内并行 spawn 子 Agent harness,在 OolongSynthetic 上以 GPT5 为 backbone 将基线从 71.75% 提升至 81.36%,用更…
TRACE:通过 Token 影响归因追踪投毒检索语料中的目标答案
TRACE 是一种无需辅助分类器、无需额外 LLM 调用的轻量级 RAG 投毒攻击检测框架,通过 Token 影响归因(Token Influence Attribution)追踪答案相关 Token 在检索文档中的高影响关键词,在 3 个 QA 基准和 6 个 LLM 上验证了检测能力,并能同步揭示攻击者指定的目标答…
Tatoxa:面向低资源语言鞑靼语的文本去毒系统
Tatoxa 是一个面向鞑靼语(Tatar)文本去毒(Text Detoxification)的 SOTA 系统,在关键质量指标上同时超越开源和商用闭源 LLM,并发布了一个新的鞑靼语去毒数据集;其跨语言迁移实验揭示了一个重要结论:从文化相近语言(如俄语)迁移的效果,显著差于使用原生鞑靼语数据训练的模型,这一发现对低资…