解读
1535 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
GAN 综述(2020):在扩散模型崛起前夕的算法、理论与应用全景盘点
香港中文大学(深圳)等团队 2020 年 1 月发表的 GAN 综述(Gui et al., 2020)系统整理了 2014 年 GAN 提出以来 5 年内主要算法变体的数学结构、理论性质与跨学科应用,覆盖图像、语音、自然语言、医学与数据科学等领域——是「GAN 范式总结」的代表性综述,也是扩散模型崛起前夕GAN 研究…
银河系漫游指南:面向科学基础模型的 Tokenizer 基准
把 Affine、AIM、JetFormer、VQVAE 四种 tokenization 策略套进同一个 Transformer 框架、用 64 万张 DESI Legacy Survey 星系图像和共享的 AstroPT backbone 跑了一轮"重建 + 表示"双维度评估后,论文给出一个不太浪漫的结论:重建质量与…
DZIRI Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统
DZIRI Voicebot 用一条模块化 pipeline 把 Whisperbased ASR、Transformerbased NLU(intent + entity)、RAG、神经 TTS 串起来,给没有标准正字法、频繁与法语 codeswitch 的阿尔及利亚方言搭出一个"电信领域可复现的端到端语音对话基线"…
ABACUS:把统一基础模型改造成"会数数也会画数"的图像计数系统
ABACUS 在 3B 参数的统一视觉语言模型基础上,靠三招创新(密度感知自适应缩放 + 基于 GRPO 的边界感知计数策略 + 循环一致 GRPO 让理解分支自己给生成打分),把"物体计数 / 人群计数 / 指代表达计数 / 忠实计数的图像生成"四件原来各做各的事塞进同一个模型、零基准特定训练,在 7 个基准上同时拿…
开源权重 LLM 中的约束税:结构化输出约束下工具调用抑制的实证研究
这篇论文在生产 Agent 系统中复现了一个被长期忽视的可靠性问题:当 Tool Calling 与 JSON Schema 结构化输出同时启用时,多个开源权重 LLM 会出现"工具调用抑制"(Tool Suppression)——schema 约束被严格遵守,但工具不再被调用。论文给出实现层解释(schema 编译为…
ScoreGate:基于双分数统计融合的 RAG 自适应 Chunk 选择
ScoreGate 是一个零额外模型推理的 RAG 检索 cardinality 自适应机制:复用线上已有的 biencoder 相似度 $s_i$ 和 crossencoder reranker 分数 $r_i$,通过"双分数统计融合"决定每个 query 该召回多少 chunk,从而在 MS MARCO 和真实生产…
监督学习自然语言推理数据中的通用句子表示
这篇论文给出了一条后来被广泛验证的迁移学习路线:不要只从无标签语料学习句向量,而可以利用 Stanford Natural Language Inference(NLI)的监督信号训练一个通用句子编码器;得到的表示在多种下游任务上稳定超过 SkipThought 等无监督方法。 在 2017 年前后,word embe…
DSWorld:让数据科学 Agent 拥有「世界模型」的预测能力
DSWorld 把数据科学 Agent 类比为游戏 Agent,引入 Data Science World Model(数据科学生成式世界模型),让它在真正执行昂贵的 ETL / 训练 / SQL 之前,能预测「如果我现在做这步操作,工作流状态会怎么变」,从而把基于 RL 的训练加速约 14×、基于搜索的推理加速约 3…
TARS:用于 IDE 内个性化代码理解的 Theory-of-Mind Agent
TARS 是一个集成进 VS Code 的 LLM Agent,通过「轻量级心智理论(Theory of Mind, ToM)」先推断开发者画像,再据此调节解释深度与措辞,并用 RAG 把解释锚定到项目文档,在 18 人受控实验里把非平凡 Java 代码理解任务完成时间缩短 26%,并降低主观认知负荷。 如果一定要再压…
面向魁北克保险合同解释的 RAG 系统:以人为中心的评估
本文用 154 位 Laval University 受试者对一个为魁北克汽车保险合同解释而设计的 SOTA RAG 系统做外在、以人为中心的评估,发现系统被体验为「认知均衡器(cognitive equalizer)」:满意度、信任、清晰度都拿到高分,且用户对系统给予的「自主感」的看重程度甚至超过系统本身传递的知识—…
ARC-AGI 难题:150M 小模型用 $0.0007 一次的成本,把 SOTA 推到新位
你有没有试过 🧩: 看一张"网格变换"题目(几排彩色方块按某种规则变形),让你猜下一张图的形态—— GPT4 / Claude 都经常答错。 这正是 Francois Chollet 设计 ARCAGI 的初衷:测的不是"会不会背答案",而是"会不会抽象"。ARCAGI 是当下公认的"反大模型记忆"基准。 但现有打法都…
让 AI 自己当科学家:它读 13000 篇论文,只为搞清楚"模型为什么会犯傻"
你有没有想过 🤔: 你训了一个大模型,它有时拒绝回答无害问题、有时对错误答案异常自信、有时 pretraining 阶段"突然"学会新技能…… 这些行为是怎么来的? 以前,要回答这种问题,人类研究员得花几周到几个月:设计对照实验、加 probing、写 intervention、写论文。可模型迭代速度早已超过人脑的解析…
RMM:把 Transformer 矩阵乘法按"输入自适应"砍一刀
一句话结论:RMM(Reduced Matrix Multiplication)是一个训练免、改权免、输入自适应的推理加速方法 —— 它在矩阵乘法的缩并维度(contraction dimension)上按 token 动态挑选"信息量大的切片"参与计算,其余切片丢掉;在不修改模型权重的条件下,1B–70B 模型上获得…
Syfer:在多语多跳问答里把"翻译"和"分解"都关掉一次
一句话结论:Syfer 是一个"延后翻译 + 有条件分解"的 mRAG 框架 —— 默认在原语种内做子问题图分解与逐步回答,只有当分解质量自检失败时才走"翻译到英语 + 双语子问题图对齐"的兜底分支;它在多语多跳 QA 上以更少 token 拿到与 SOTA 接近的精度,把"先翻译再做"和"贪心分解 + 路径聚合"两类…
SKILLER:用大模型当"教练",给小语言模型写技能
一句话结论:SKILLER 是一个用自然语言做信号的强化学习框架,专门给小型开源 LLM(4B/9B 级别、消费级 GPU 可跑)自动生成"技能"(skill) —— 它把强模型同时当 actor 和 critic,把小模型 agent 系统当 environment,所有 RL 信号完全用自然语言传递;在五个相关基准…
CoRe:面向 Web 规模视频搜索中多阶段上下文感知相关性的连续奖励微调 LLM 查询改写器
CoRe 是一个被部署在大型短视频搜索系统中、每周重新训练并连续运行超过五个月的 LLM 查询改写器,通过「以线上多模态相关性模型为奖励源 + 乘性比值奖励形式 + 半在线 DPO 风格训练循环」三件套,把改写器和生产级 ranker 之间的仿真生产 gap 真正闭环。 LLM 查询改写器是搜索/推荐系统里很常见的一类…
ABACUS:桥接图像计数理解与生成的统一视觉语言模型
ABACUS 在一个 3B 参数的统一视觉语言模型上同时搞定物体计数 / 人群计数 / 指代计数 / 计数忠实图像生成四类任务,无需任何基准特定训练,在 7 个基准上同时击败任务专用专家和更大的通用多模态模型(review 中)。 "数清楚"(counting)是视觉里看似简单、实际棘手的能力,也是判断 VLM 是否真…
The Galaxy's Guide to the Tokenizer:科学 Foundation Model 的 Tokenizer 基准评测
通过 64 万张星系图像的受控实验,系统揭示了四种 Tokenizer 策略(Affine / AIM / JetFormer / VQVAE)在科学 Foundation Model 中对重建质量与物理属性预测能力的差异化影响,首次证明了"重建质量"与"表示质量"之间存在显著解耦。 Tokenization(分词/标…
DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型
DreamXPhi 1.0 是一个动作条件视频世界模型(actionconditioned video world model),用于机器人操作任务:给定一帧观测、语言指令、一串由末端执行器位姿 + 夹爪状态组成的动作序列,预测未来的视频观测;它通过 PRoPE 风格的几何编码把每条机械臂的 SE(3) 变换注入注意力…
UniSwap:面向说话视频的流式音视觉身份替换
UniSwap 是首个面向 talkingvideo(说话视频)的流式、联合音视觉身份替换框架:给定源视频、参考人脸图、参考音色片段,在单一音视觉扩散 Transformer 内同步迁移外貌与声纹,并保持源视频的嘴型动作、场景、文本内容和音视频时序对齐;同时通过三阶段训练(Incontext Pretraining →…
多轮 RAG 何时停止检索?基于结构化判定的检索削减方案
把"何时停止检索"重写为序列选择问题,在冻结的 SearchR1 流水线上外挂一个 Qwen3.52B 结构化判定器,在 900 题互不相交的 HotpotQA 上训练并在确认集上评估:检索调用相比 Native SearchR1 减少 3.70%(77 次),Exact Match 仅下降 0.625 个百分点——一…
AVA-Encoder:面向 Agent 的原生视频表征学习框架
提出 AVAEncoder——一种"agentic autoencoding"框架,把视频先编码成知识图谱(KG)再重建回视频,由视频重建差异驱动一个文本梯度优化框架,使 Agent 能像操作文本知识图谱一样编辑和创作电影级视频。 Creative agent 能写代码、能调 API、能写剧本,但要"学习人类高质量电影…
RAGSieve:自参考局部对比的 RAG 知识投毒检测
自检:机制 5 段 · 工程 3 段 · ⚠️ 数字核验 4 处。 RAGSieve 是一个自参考(selfreferenced)的 RAG 知识投毒检测框架——把"被检系统自己"当作参考集,在不依赖外部可信语料、不依赖已知攻击特征的前提下,分两路(RSQ 查询局部对比 + RSG 语料局部对比)定位被投毒的文档。在三…
CogniRoute:全模态模型中的社交证据路由学习
CogniRoute 提出schema 引导的 MixtureofExperts(MoE)框架用于社交视频问答,配合路由感知强化学习同时优化 token 生成与专家分配,并伴随发布 OmniSocialBench(118K 标注样本),在社交多模态推理上把最强闭源基线提升 15.33 个百分点、最强开源全模态基线提升 …
Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统
Dziri Voicebot 是首个完整的阿尔及利亚方言(Algerian Darija)端到端语音对话系统,通过模块化 Pipeline 整合 ASR / NLU / RAG / TTS,在低资源标注数据极度匮乏的条件下,ASR 达到 13.74% WER,NLU 意图分类与实体识别均获高分,语音合成质量稳定,为方言…
Randomized YaRN:用 OOD 位置课程让长上下文推理真正泛化
Randomized YaRN 在训练阶段把 YaRN 位置外推与随机位置采样 + 长度课程结合,让模型在短上下文数据上就见到 OOD 位置分布,从而把长上下文推理能力从 8K 训练窗口推广到 16K ~ 128K——在 BABILong 与 MRCR 两个高难度推理基准上一致优于标准 finetune,最大增益出现在…
当 AI 还在凭"长相"认人时,2013 年的这篇综述就告诉你:距离才是核心
你有没有试过让 kNN 分类器跑一个真实业务? 鸢尾花上准到 96%,换到人脸识别就掉到 60% 出头——不是因为模型不行,是距离函数用错了。 欧氏距离把人脸的高维像素"摊平"到一根尺上,鼻子到眼睛的距离和嘴角到下巴的距离等量齐观——但人眼根本不是这样认人的。我们看的是"五官比例的协调",是"局部关系的匹配",是一个有…
AutoPrune:让 LLM 自己设计视觉 Token 剪枝算法的 AI4AI 框架
AutoPrune 把视觉 Token 剪枝"算法设计"本身当成搜索问题,用 LLM 在一个叫 TPDSL 的小型领域语言里搜索"对强基线策略的残差修改",不必训练任何模型就能在 14 个多模态基准、3 个 MLLM backbone 上做到「砍掉 94.4% 视觉 token,仍保留 99% 全 token 性能,F…
LLMRouter:让 LLM 路由研究从"东拼西凑"走向"统一基础设施"
LLMRouter 把"模型路由"这种"看似简单、实则接口混乱"的任务抽象成一个 5 组件的序列决策过程(context encoder / model encoder / scoring function / decision rule / learning signal),并配套发布了 xRouteBench 基准…
LiveAnimate:实时长流人体动画的 14B DiT 方案
LiveAnimate 是首个同时实现实时流式与稳定长视频的十亿级(billionscale)人体动画系统,基于 14B 参数的视频 Diffusion Transformer(DiT),通过两阶段训练把双向 DiT 改造为块因果自回归生成器,并以 PoseRetrieval Sink Attention(PRSink…