解读
1098 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Teaching Nemotron Greek:把现代希腊语拉进 NVIDIA Nemotron 检索栈,并配套首个希腊语 RAG 大规模基准 HERA
把 NVIDIA Nemotron 检索栈(embedding + reranker + MoE reader)端到端适配到现代希腊语四类专业领域(法律、能源、金融、医疗),并发布首个大规模希腊语 RAG 基准 HERA;适配后 embedder 在 specialist 语料上 nDCG@10 从 0.362 飙到 …
MultiPathFormer:把多径传播当作预训练对象的无线基础模型
提出 MultiPathFormer——一个把"多径传播"(multipath propagation)作为基本预训练 token 的无线基础模型,每个发射接收链路被表示成一条由连续值 path token 组成的有序序列,用 nextpath prediction 自回归训练;并引入 Environmental RA…
Switch Transformer:把 MoE 路由简化到极致,训练出首个万亿参数稀疏语言模型
Fedus、Zoph、Shazeer(Google Brain)将 MixtureofExperts 的"每 token 路由到 topk 个专家"简化成 top1(即 Switch),用更稳定的训练技巧(路由 dropout、专家容量因子、可选择性精度)让稀疏 MoE 第一次能在 bfloat16 下训练到万亿参数级…
BERTopic:用预训练 Transformer + 类 TF-IDF 重新定义主题建模
BERTopic 把主题建模拆成"三段流水线"——预训练 Transformer 文档嵌入 → 密度聚类 → 类级 TFIDF 抽取主题词——用极其轻量的工程结构把 LDA 之后十余年停滞的主题建模重新拉回到 SOTA 区间,并成为首个工业级广泛落地的主题建模开源工具。 主题建模长期面临两难: Embedding + …
FinIndices:用长周期财报实测 LLM 的"真结构推理"还是"表层模式匹配"
用一套最大 32K token、未裁剪的真实财报构建的自动化 benchmark FinIndices,系统性地打脸了"LLM 懂金融"这个直觉——结论是:在去掉公式提示后,Gemini3.1Pro 在表格任务上的准确率从 70.70% 掉到 38.22%,证明现有 SOTA 模型更多是"背下了公式模板",而不是真正具…
STAMP / STAMPlus:让"对话 + 分割" 同时在 MLLM 里跑得快、跑得准、还兼顾多目标
论文直面了 MLLM(多模态大模型)做分割的"三难困境"(高分割性能 + 保留对话能力 + 快速推理),提出 AllMask Prediction 把自回归对话与非自回归 mask 预测解耦,首个二值实例 STAMP 在一次前向中对所有 token 做前景/背景分类;进一步升级到 Structured AllMask …
PosterMELD:面向可控设计多样化的多 Agent 论文转海报生成,输出可编辑的可印刷成品
PosterMELD 用"模板条件化 + 容量感知槽位 + 确定性门控/VLM 审核"把论文转海报做成一条可失败路由的多 Agent 流水线,在 621 篇论文评测中 PrintReady Rate(PRR)达到 81.3%,约为 P2P 的 3.4 倍、PosterGen 的 5.2 倍,并把单次请求的"原生可编辑性…
多任务多帧视觉钢琴转写:V2N(Video to Notes)
V2N 是首个"完整"的视觉钢琴转写(Visual Piano Transcription, VPT)系统:用共享时序 backbone 同时接 onset / offset / key hold / velocity 四个任务头,并以逐帧监督(perframe)取代"仅窗口中心监督",在 PianoVAM 与 R3 …
ContinualSkillBench:LLM Agent 的"技能库"是真进化,还是只在临场上下文里打补丁?
ContinualSkillBench 是一个专门测"agent 能不能跨任务把经验沉淀为可复用 skill"的动态评测框架——它在 5 个领域各设 100 个难度递增的子任务,并对比"显式维护 skill 库"和"纯上下文学习",结论是:incontext 持续学习与显式 skill 维护在平均水平上效果相当,意味着…
LegalPincite:多级法律信息检索数据集,把"段落级 pincite"从装饰品做成可评估的硬指标
LegalPincite 把欧盟法院 (CJEU) 判决书里的"段落级精确引用 (pincite)"做成一个去泄露、可人工校验、支持 casetocase / paragraphtocase / paragraphtoparagraph 三种检索粒度的大规模法律 IR 数据集,把现有公开法律 IR benchmark …
RestoreKV:用可学习恢复补全 query-agnostic 的 KV cache 压缩
RestoreKV 提出一种「在同一 KV 预算内,先选择再恢复」的两阶段范式:在 queryagnostic eviction 之后,让少量 restore tokens 在一次 LoRApass 中去 attend 完整的 evicted KV cache,生成一段紧凑的、由上下文条件化的 restore cach…
ARCHead:用激活度量残差校正把 LM-head 压到 BF16 的 25%
ARCHead 提出一种针对 LLM 最后一层 LMhead 的打包式压缩方案,把原本「H × V 大矩阵、BF16 持久保留」的一块存储替换成 量化低秩核 + 组内 INT4 残差 + 基于激活度量拟合的低秩校正;在 Qwen38BBase 上只用 25.6% BF16 头存储就达到了 1.007 相对 perple…
学会适时停止:面向减少过度思考的片段级信用分配(DASH)
提出 DASH(DriftAware advantage SHaping):在 GRPO 训练中按"推理片段是靠近还是远离正确答案"分配优势,把奖励塑形从 token/序列粒度下沉到 段(segment)粒度,让模型同时学会"答对"和"及时停"。 推理类 LLM 的"过度思考"(overthinking)不是单纯的长度…
当多个答案都有效时,投票失效:CALVER —— Best-of-K 因果推理的符号验证器
提出 CALVER(Causal AxiomLevel VERification):一种 无需训练 的符号验证器,把每条 LLM 推理轨迹按 Pearl 因果准则(d分离、后门调整、do算子干预)逐条打分,在没有参考答案的前提下选出因果最合法的候选——在 CLEAR 等 findonevalid 查询上把 Bestof…
ReflectRL:从 Golden Negative Trajectories 中学习的反思—直推双阶段推理训练
提出 ReflectRL:在 onpolicy RL 训练中,把专家模型 做错 的"金负样本轨迹"(Golden Negative Trajectories, GNT)当成 反思对象 而非 模仿对象,先让模型在 GNT 上做反思式推理(Reflective Reasoning),再通过 ReflectivetoDire…
ChronoLens:跨时间、语言与语言学层面的历史语言变化测量
ChronoLens 提出一个把"历史语言变化"放进同一分析空间的评测框架:用冻结的多语 LLM + featurealigned crosscoders + posthoc linguistic interventions 提取稀疏的、语言学可解读的特征表示,在 44.98 M 文档 / ~17.2 B token、…
当注意力"失明":ALiBi 位置编码中的数值失效
论文揭示了 ALiBi(Attention with Linear Biases)位置编码一个此前被忽视的失效模式:其线性偏置缩放在浮点精度下发生下溢,导致大量注意力权重被置零,使受影响的头"部分失明";在 148M 参数 decoder 的对照预训练中,这种失效会显著损害 token 检索能力,但对标准 decode…
解码儿童步态行为:用普通 RGB 视频做脑瘫、偏瘫等发育性疾病的非侵入式评估
论文把"用标准 RGB 视频做 317 岁儿童细粒度步态分析"立成一个新的动作识别问题,发布了一个 110 名儿童、1,100 段 60 FPS 同步视频与姿态序列的数据集,并实证当前最强的步态基础模型与多模态大模型在儿童这种"非典型、抖动、微小"步态模式上普遍失败,给出统一端到端框架建立基线。 临床意义的真问题: 脑…
MiniWorld:把视频世界模型"从零训练"的门槛压到一台 8 卡服务器、几天内可跑
MiniWorld 是一个完全开源、可复现、面向 streaming(流式、自回归因果)场景的视频世界模型训练框架。它用 blockcausal Video Diffusion Transformer + 潜空间 Flow Matching,结合 chunkwise 非递减噪声调度和两阶段续训,配合滚动 KV cach…
Pointer Sentinel Mixture Models:把"复制"与"生成"融合的早期经典
Merity 等人提出 PointerSentinel Mixture(PSM)架构,把 LSTM 语言模型拆成两条路径——一条基于上下文位置做 pointer(指针式复制),一条基于词表的 softmax 生成——通过门控 p_gen 决定每一步从哪条路径出词;该模型在 Penn Treebank(PTB)上以更少参…
多模态紧凑双线性池化(MCB):用可控维度的外积思路打通 VQA 的视觉-语言融合
MCB(Multimodal Compact Bilinear pooling)用一种"近似外积、可微、可控维度"的方式,代替了 VQA 里被默认使用多年的 elementwise 加/乘或 concat,在 Visual7W 和 VQA Challenge 上把当时的 SOTA 推到了新高,而且两次复用同一个池化模块…
用 CNN 学立体匹配代价(MC-CNN):用"小块相似度二分类"重做立体匹配第一阶段
把传统立体匹配 pipeline 里最关键也最"手工"的一步——匹配代价(matching cost)——换成一个小 CNN,以"两块小图 patch 像不像"的二分类方式训练,然后把网络输出喂给一整套经典后处理(cost aggregation、SGM、左右一致性检查等),在 KITTI 2012/2015 和 Mi…
图神经网络:方法与应用综述
Zhou 等人提出了一套面向图数据的通用 GNN 设计 pipeline(图的预处理 → 传播 step → 采样 → 层级聚合 → 预测/解码),并据此系统梳理了图卷积网络(GCN)、图注意力网络(GAT)、图循环网络(GRN)、图门控网络(GGNN)等代表性变体,最后给出四个未来方向,是后续几乎所有 GNN 综述的…
Random Erasing 数据增强:在训练图像中随机"擦掉"一块
Random Erasing 是一种零学习成本、与现有 CNN 训练管线完全解耦的数据增强方法——在每张训练图上随机选一块矩形区域并以随机像素值覆盖,从而人为制造"遮挡"样本,提升模型对遮挡的鲁棒性,并在分类、检测、行人重识别三个任务上一致涨点。 视觉模型在受控数据集上很容易学到"完整对象"的偏置,一旦部署到真实世界,…
Few-Shot Learning 综述:用"先验知识"重新定义小样本学习
这是一篇把小样本学习(FewShot Learning, FSL)从"零散技巧的集合"重构为"基于先验知识的统一框架"的综述——把 FSL 的本质问题归结为"经验风险最小化在极小样本下不可靠",并按先验知识的注入方式把全部方法归到 Data / Model / Algorithm 三条主线,是后续几乎所有 FSL 综述…
IteraSim RAG:面向 OpenFOAM CFD 的多阶段检索增强 Agent 后端
IteraSim RAG 通过多阶段检索管道(查询扩展 → 融合排序 → MMR 重排 → 路由分发)和 Architect/InputWriter/Reviewer 三 Agent 分工,将 OpenFOAM 求解器配置从专家专属技能变为可自动生成的工程流程,在 28 个基准案例上达到平均 77.9% 检索覆盖率,全…
训练模型,而非读者:用于可验证激活解释的可解码性监督
当前主流的"可解码性"可解释性测试在结构上无法惩罚单个虚假声明——论文提出 RECAP 框架,通过辅助预测器实现对模型内部内容的独立核查,填补了这一根本性缺陷。 大语言模型的内部激活(hidden activations)到底在编码什么信息?这是可解释性研究(interpretability research)的核心问…
OpenForgeRL:在任意环境中端到端训练 Harness 原生 Agent
OpenForgeRL 给出了一个把"推理侧 harness"和"训练侧 RL 栈"解耦的开源框架——用一个轻量代理(proxy)把 harness 内部的模型调用重新服务化为一次普通的推理请求,同时在 Kubernetes 上为每次 rollout 拉起独立容器,让任意 harness(Claude Code / C…
Wasserstein 重心(barycenter)的快速算法
针对"求一组经验分布的最优传输(OT)均值"在高维离散情形下计算量爆炸的痛点,本文给出基于熵正则 OT(Sinkhorn 距离)的子梯度算法 + 矩阵 scaling 加速器,把 Wasserstein 重心(barycenter)的计算从原先每次迭代要解一次大 LP 的复杂度降到接近 Sinkhorn 迭代的线性规模…
迁移学习综合综述
这是一篇覆盖面极广的迁移学习综述,从"数据视角"和"模型视角"两条主线对 40+ 主流迁移学习方法做了系统分类,并在 Amazon Reviews、Reuters21578、Office31 三个标准数据集上对 20+ 模型的实证结果做横向比较,为研究者快速定位方法选择和工程团队理解迁移学习的本质差异提供了一张清晰路线…