解读
1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
WGAN-GP:用梯度惩罚替代权重裁剪,稳定训练 Wasserstein GANs
把 WGAN 中用来强行施加 1Lipschitz 约束的权重裁剪(weight clipping)替换成对 critic 输入梯度的 L2 范数惩罚(gradient penalty),从而在几乎不调超参的情况下稳定训练包括 101 层 ResNet 与离散语言模型在内的多种 GAN 架构,并在 CIFAR10 / …
Whisper:用 68 万小时弱监督多任务数据训练一个零样本语音识别/翻译基础模型
把"在网上能爬到的大量带弱字幕的音频"当成天然监督信号,用 encoderdecoder Transformer 在 68 万小时多语种多任务数据上做大规模弱监督训练,得到的 Whisper 在标准 ASR 基准(LibriSpeech、FLEURS、TEDLIUM 等)上无需任何任务专属微调即可达到与有监督 SOTA…
LMCache:面向企业级 LLM 推理的高效 KV Cache 层级
LMCache 是首个开源、生产级的 LLM KV Cache offloading 方案,把 KV Cache 从 GPU 显存中提取出来,跨 CPU / 存储 / 网络层级存储和共享,同时支持 prefix 复用与 prefilldecode(PD)disaggregation,在多轮 QA、文档分析等场景下,与 …
LLM 多智能体系统:挑战与开放问题
这是一篇偏定位 + 展望的综述论文,聚焦 LLM MultiAgent System(MAS)在 任务分配 / 协作推理 / 上下文管理 / 记忆机制 四个核心机制上的开放问题,并把多智能体范式推到 区块链与分布式系统 这一相对少见的应用场景,借此为 LLM MAS 在真实分布式环境中的落地提供思路。 LLM 单 ag…
GLM-5: 从 Vibe Coding 到 Agentic Engineering
引用:GLM5Team (Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng 等), "GLM5: From Vibe Coding to Agentic Engineering", arXiv:2602.15763v2, 20260217 v1, 20…
HDR:面向多步视觉推理的分层去噪框架
提出 HDR(Hierarchical Denoising for Visual Reasoning),把因果视频生成的潜变量组织成树状层级,先粗后细地做多步视觉推理;用稀疏层级注意力(SHAP)压低时序注意力成本,0.70 秒 / latent 的流式速度下,多步任务成功率从 34.22 提到 60.29,相对提升 …
超越成功率:攻击性与防御性安全 Agent 的成本感知评估
现有安全 Agent 评估只问"能不能成功",而这篇论文认为真正重要的是"花多少钱能成功"——提出成本成功率联合评估框架,对攻击(CTF)和防御(SOC 调查)两种场景分别发现截然不同的 scaling 规律:攻击任务靠加大推理预算就能显著提升,防御任务的成功率更多取决于工具使用的纪律性,而非砸更多算力。 当前安全 A…
分区、提示、聚合:语言模型中的统计自一致性
本文提出一种「参考无关」的 LLM 评估新准则——统计自一致性(statistical selfconsistency):用二叉树把总体递归切成越来越细的子群体,让模型分别估计每个子群体,再聚合回总体估计;只要结果对树的切分粒度敏感、且与人类基线有显著差距,就说明模型存在「宏观谬误(macro fallacy)」——子…
HowTo100M:让互联网叙事字幕自动变成 1 亿级视频-文本对训练语料
Miech、Zhukov、Alayrac 等人用 YouTube 上 1.22M 个「howto / instructional」视频的自动 ASR 字幕切割出 1.36 亿个 clipcap pairs,从此把「视频文本」对齐学习从昂贵的人工标注(30K–100K 级别)一举推到亿级训练数据规模;他们用 MILNCE…
ALBEF(Align Before Fuse):先对齐再融合 + 动量蒸馏,让视觉-语言预训练进入「对噪声鲁棒」的实用时代
Li、Selvareanu、Gotmare 等 Salesforce 研究者提出 ALign BEfore Fuse(ALBEF):先用对比损失 (ITC) 在单模态编码器上把图像和文本编码到共享空间,再用跨模态 Transformer 融合;同时为应对网络爬来的图文对天然带噪声,引入 momentum distill…
GPTs are GPTs:LLM 对美国劳动力市场的冲击全景评估
OpenAI、OpenResearch 与宾夕法尼亚大学的研究团队合作,首次系统评估了 GPT 类大语言模型对美国劳动力市场的潜在影响:约 80% 的劳动者至少有 10% 的工作任务可被 LLM 影响,约 19% 的人面临至少 50% 的工作任务被颠覆;LLM 驱动的软件工具可将任务自动化比例从 15% 提升至 47–…
CoCa:用对比损失 + 描述损失,把图像-文本基础模型做「一锅端」
CoCa(Contrastive Captioner)把 CLIP 的对比学习(contrastive loss)和 SimVLM 的描述生成(captioning loss)塞进同一个 encoderdecoder Transformer,用「前半段 decoder 不做 crossattention / 后半段做」…
MiniGPT-4:当「视觉 + Vicuna + 投影层」组合被简化到极致
MiniGPT4 把 LLaVA 的「CLIP + Vicuna + 投影层」配方再简化:把 QFormer 之类的中间件全砍掉,只用一个投影层对齐冻结的 ViT + 冻结的 Vicuna,再用少量 detailed caption 数据做二次微调,就复现了 GPT4 那种「看图写诗、看图生成网页、看图讲笑话」的能力。…
ViLT:让视觉-语言预训练摆脱「重检测器」
ViLT(VisionandLanguage Transformer)第一次把 vision encoder 砍到「纯 ViT patch embedding」级别:不再依赖 Faster RCNN 抽 region feature,整张图直接当 32×32 个 patch 喂进 Transformer,与文本 tok…
VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training
VideoMAE 证明视频 masked autoencoder 可以在极小数据集(3k–4k 视频)上高效自监督预训练,极高 masking ratio(90%–95%)不仅无害,反而提升了表征质量。 视频自监督预训练长期依赖超大规模预训练数据集(如 Kinetics700),对小样本场景(如 SomethingSo…
InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning
InstructBLIP 在 BLIP2 预训练模型基础上,对 26 个公开数据集做系统性的 visionlanguage instruction tuning,首次实现零样本泛化到 13 个 heldout 数据集上全面超越 Flamingo 等更大模型,并在 ScienceQA 上达到 90.7% 准确率。 GPT…
From Foundation to Application: Improving VLA Models in Practice
LingBotVLA 2.0 通过扩展预训练数据覆盖机器人全身自由度,显著提升了跨具身(crossembodiment)长时程移动操作能力,在 GM100 基准的通用设置下验证有效,有效弥合了 VLA 基础模型在实验室环境与真实落地之间的差距。 VLA(VisionLanguageAction)基础模型在论文实验中表现…
TSseek:面向分布式时序数据集的正则表达式相似性搜索
TSseek 是一套面向大规模分布式时序数据的正则表达式驱动相似性搜索框架:把时序片段抽象为「保留斜率方向 + 值域」的线段序列,把正则查询转译成有界矩形,再在自研的分布式空间索引 TSseekX 上做全匹配与子序列匹配两种查询,论证并实证了 PAA/SAX 等传统近似索引在「正则模式查询」上根本不适用。 时序相似性搜…
Bespoke-Card:用代码生成替代手工调优的基数估计器合成系统
BespokeCard 是一个由 Agent 驱动的基数估计(cardinality estimation)系统——它针对一个具体的工作负载(schema + 真实查询),让规划 Agent 决定估计策略、让编码 Agent 直接生成可执行的 Python 估计器、用结构化 qerror 反馈 + 回归分析 + 课程式…
MAGMaR 2026 共享任务综述:以多模态检索驱动文章生成
ACL 2026 第二届 MAGMaR(Multimodal Augmented Generation via Multimodal Retrieval)共享任务概述了当年参赛系统在两个赛道的整体表现——视频检索(2 队 17 系统,全部超越上届冠军基线)与基于检索视频的接地文章生成(4 队 16 系统,所有参赛队都有…
CoRe:面向 Web 规模视频搜索的多阶段上下文感知查询改写器(连续奖励微调 LLM)
在大型短视频搜索引擎里,CoRe 把一个 LLM 查询改写器做成"用部署中的多模态相关性模型做奖励、乘性比值形式对齐生产融合代数、半在线 Mixed Preference Optimization 周更重训"的工业流水线,五个月内每周重新部署一次,线上 A/B 在 recall/rawrank/finerank 三段同…
ScoreGate:基于双分数统计融合的 RAG 自适应 Chunk 选择
ScoreGate 用"双编码器相似度 s_i + 交叉编码器 reranker 分 r_i"两条已经存在于标准 RAG 管线里的分数做 scorespace 决策,在不增加任何模型推理的前提下动态决定每个 query 要保留几个 chunk,在 MS MARCO 与真实生产流量上同时实现了"少 35% chunk、M…
多教师在策略蒸馏里工具调用边界漂移的诊断与校准
在多教师 onpolicy 蒸馏(OPD)训练 agentic LLM 时,聚合 KL/JS 散度会把"过度调用工具"这类行为漂移藏起来;论文给出"行为杠杆不均"(behavior leverage imbalance)的诊断视角,并用逐 token 的 Soft Clamp 把极端的 token 级 JS 散度压下去…
开源权重 LLM 中的"约束税":结构化输出约束下工具调用被抑制的实证研究
当 Tool Calling 与 JSON Schema 结构化输出约束同时启用时,多个开源权重(openweight)LLM 会出现 Tool Suppression——尽管工具执行与 schema 合规各自独立都能工作,联合部署下模型干脆不再调用工具;论文把原因归到"JSON Schema 被编译成 grammar…
DeepSearch-World:可验证环境中深度搜索 Agent 的自蒸馏
作者把"深度搜索 Agent"训练里 SFT 轨迹死板、RL 奖励稀疏两大痛点,合并成一个方案:先造一个确定性可验证的环境(DeepSearchWorld),再让 Agent 在里面自己跑、自己筛、自己蒸馏(DeepSearchEvolve)。结果 9B 模型没靠更强教师蒸馏,就在 BrowseComp 上拿到 31.…
Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)
mRNN(Baidu Research / UCLA, Mao et al., 2014)提出一种端到端的多模态循环神经网络,直接建模「给定图像和前文词序列条件下生成下一个词」的概率分布,在四个基准数据集上超越当时 SOTA,同时在图文双向检索任务上也取得了显著提升。 在 2014 年,image captioning…
RL-Index:把推理前移到索引阶段的检索增强生成
本文提出 RLIndex——一个把「检索索引推理」建模为强化学习问题的 agentic indexing 框架:在索引阶段用 LLM 生成显式编码「查询知识潜在关系」的 rationale,再用 GRPO(Group Relative Policy Optimization) 配合「检索相似度」作为可验证 reward…
GigaAM Multilingual:面向代表性不足语言的基础模型
针对中亚三种长尾语言(Kazakh、Kyrgyz、Uzbek),作者用 2M 小时音频训了一个 Conformer 编码器,在预训练阶段做聚类级数据平衡、在微调阶段做域感知采样,让"小语种 ASR"在自发语音上明显超过 Whisper Large v3 和 Omnilingual1B 等开源强基线,同时算力开销可控。 …
MAGE-RAG:面向长文档问答中 Agentic 多模态 RAG 的多粒度自适应图证据框架
MAGERAG 通过"离线建图 + 查询时动态子图构建"的混合架构,在长文档多模态问答中首次实现了证据覆盖率与噪声控制的动态平衡:在 LongDocURL 达到 52.75% 准确率,在 MMLongBenchDoc 达到 53.26% 准确率(51.19 F1),显著优于固定 Topk Text RAG 和 Page…
Xiaomi-Robotics-1:基于 10 万小时真实轨迹的 VLA 基础模型
小米机器人团队用 10 万小时真实操作轨迹 + UMI 采集装置 + 自动语言标注流水线 训练了一个通用 VisionLanguageAction(VLA)基础模型,在未见环境中可零样本执行移动操控指令,并用极少数据就能微调到新任务。 通用机器人目前有三个长期痛点: 1. 数据规模:互联网级数据对机器人不适用,真实轨迹…