解读
1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
360CityArena:在 360° 重建的秋叶原街区上考 LMM 具身导航
ECCV 2026 投稿 360CityArena 把"具身智能体在真实城市街区中的导航与推理"做成了一个以 360° 视频重建的高真实感基准:秋叶原 85 条街、602 段全景视频、175 道人工任务,覆盖环境理解 / 路径推理 / 空间推理三类;结果给整个 LMMagent 圈泼了一盆冷水——最强 Gemini 2…
Decision Transformer:通过序列建模做强化学习
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 1 处("matches or exceeds SOTA" 的具体分数未在 abstract 中给出)。 Decision Transformer 把离线强化学习(offline RL)改写成一个条件序列建模问题:用 GPT 风格的 causal Transfo…
Minerva:用语言模型解决定量推理问题
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 1 处(论文未给具体百分比 / 题量 / 推理时延,abstract 只说"nearly a third")。 Minerva 是 Google 用 8B / 62B / 540B 参数规模的 PaLM 变体,在自然语言 + arXiv 风格的「技术语料」上继续…
系统化报告机器学习能耗与碳足迹
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 1 处(论文 abstract 未给能耗 / 碳排放的具体数字指标)。 Henderson 等(Stanford / MILA 等)提出了一个 ML 碳排放与能耗记账框架,配套一个实时追踪库(后来成为 codecarbon)和标准化在线附录格式,并以「强化学习」…
PEGASUS: Pre-training with Extracted Gap-sentences for Abstractive Summarization
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 2 处(被引数 / 12 数据集 SOTA 边界)。 PEGASUS 提出"GapSentence Generation(GSG)"自监督预训练目标——把文档里"最重要"的句子整体 mask 掉,让 Transformer 编码器解码器从剩余句子中把它们生成出来…
A Survey on Multi-Task Learning
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 2 处(被引数 / 期刊状态)。 这篇 IEEE TKDE 综述按"算法建模 + 应用 + 理论"三轴对 MultiTask Learning(MTL)做了系统分类,把 MTL 算法归入五大族(feature learning / lowrank / task …
Towards A Rigorous Science of Interpretable Machine Learning
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 2 处(被引数 / 历史版本)。 这是一篇给「可解释机器学习」立学科规范的位置论文(position paper):先定义 interpretability、再回答"何时需要 / 何时不需要",最后给出可复现的评估 taxonomy,是 2017 年之后几乎所有…
基于半自动化内容可信度检测的帕累托最优重排序
本文把"信息流可信度"建模成对原排序的双目标优化:用 Spearman's footrule distance 保住原排序形态,再叠加一条"期望可信度"的线性目标,从而在 Pareto 前沿上找到改动最小、却能显著提升内容可信度的重排序方案;并配套一条"检索增强打分 + 人工事实核查"的半自动化可信度标注流水线,让该方…
Scaling Instruction-Finetuned Language Models
FlanPaLM 通过在大规模任务集上做 Instruction Finetuning,将 LLM 的零样本/少样本泛化能力推至 SOTA 水平,540B 模型在 MMLU 上达到 75.2%(5shot),并开源了 FlanT5 全系列(80M~11B)供社区使用。 GPT3 以来,LLM 已经展现出强大的 InCo…
Momentum Contrast for Unsupervised Visual Representation Learning
MoCo 将无监督视觉表征学习建模为「动态字典查询」,通过动量更新的查询编码器和队列机制,在不需要任何人工标签的情况下学习到可迁移到下游检测/分割任务的强大视觉特征,在 7 项任务上超越了同期 ImageNet 有监督预训练的表现。 在 NLP 领域,无监督预训练(GPT、BERT)已经取得了巨大成功,但 Comput…
EvolvingWorld:让角色与世界共同演化的开放式文学世界框架
EvolvingWorld 把"交互式文学世界模拟"重新定义为长视野的角色世界共同演化过程:不再做静态人格扮演,也不再做孤立的场景生成。它用一个 openschema 框架 容纳任意世界观,内部由「Character Agent(多角色扮演 + 人设持续演化)」与「LLM 驱动的 World Model(全局/地点/实…
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
TimeLens2 通过将时序证据建模为区间集合(interval set)并用 temporal Wasserstein 奖励提供密集反馈,让一个多模态 LLM 在任意长度、领域、查询形式和视角的视频中精准定位多段支持性证据片段,在多项基准上超越参数量高达 397B 的开源模型。 Video MLLM 已经能描述视频…
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
TOPL(TokenLevel OffPolicy Labeling)将 posttraining 重构为逐 token 正确性预测任务,通过训练模型区分"好 token"和"坏 token"来引导模型生成优质回答,在 11 个 summarization 数据集上实现强跨分布泛化,并证明 token 级学习信号是成功…
PixelEyes:解耦感知与推理以实现精准视觉证据定位
PixelEyes 针对多轮视觉推理中 MLLM 反复定位失败、推理轨迹冗长的问题,首次提出将 reasoner(推理器) 与 perception tool(感知工具) 显式解耦:reasoner 决定"要找什么",specialized perception tool 回答"在哪里",通过 maskguided v…
基于非对称互变分学习的多模态连续推理
AMVL 提出 Asymmetric Mutual Variational Learning,通过双向 KL 散度校准目标——前向 KL 让 prior 去匹配 posterior(获得推理方向),反向 KL 约束 posterior 不 collapse(防止答案泄漏),在 BLINK 复杂推理基准上平均得分提升 +…
高维场景下基于网格的近似最近邻搜索的标度律
对 multiprobe grid(基于网格的 ANN)算法在数据集规模 $N$ 与维度 $d$ 上做了系统性标度分析,发现了一个以前未被报告的 $d$scaling 交叉点:在 GloVe 词嵌入族上,网格方法在维度上保持近似常数标度,而图、树、划分等主流 ANN 方法的吞吐量都随维度退化——这意味着网格方法在重建频…
DistilVDR:基于双学生蒸馏的紧凑端到端视觉文档检索器
视觉文档检索(VDR)一直被 multibillion 参数模型主导,索引百万级语料既慢又贵——本文用单一 8B 视觉语言教师 + 双侧蒸馏,炼出一个 524M 的端到端单向量检索器,无需相关性标签、无需负采样、无需对比损失,在 ViDoRe v1+v2+v3 上拿到 61.74 平均 NDCG@5(达到 8B 教师 …
iFAN:让普通 Mask Transformer 学会"推理感知"的训练框架
Mask Transformer(如 Mask2Former、MaskFormer 类)在推理时靠最后一层 query 之间的像素级"竞争"生成 segmentation,但训练时完全没把这一推理过程纳入优化目标——iFAN 通过 Adjusted ProbabilityMask Ranking (APMR) + Cr…
ComBodied Agents:把"人的状态与能动性"立为 Agentic AI 的一等建模对象
提出 ComBodied Agents(人本具身智能体) 这一新范式,把 Agentic AI 的建模、干预与评估对象从"软件/物理状态变换"转向"个体人类状态轨迹",以"个人世界模型(Personal World Models)+ 可执行干预策略 + 闭环反馈"作为统一闭环骨架,并主张以 agencypreserva…
AdvFD:用对抗学习特征空间,跳出视觉生成的 Fréchet Hacking
提出 Adversarial Fréchet Distance(AdvFD)——在 Fréchet distance(FD) 类训练目标之外,额外引入一个对抗式可学习表征,使其在真实/生成分布差异最大化的方向上动态调整特征空间;同时用 realfeature whitening 抑制对抗表征的尺度/协方差放大,稳定 m…
MiLMMT-46-v1.0:在 46 语言上用 GRPO + 参考无关奖励做开放式 LLM 多语翻译后训练
针对开放 LLM 的多语翻译,提出 "参考无关参考无关奖励 + 语言识别门控 + SFT/RL 权重线性插值" 的三段式后训练配方:在 SFT 模型 MiLMMT46v0.1 上用 GRPO 训练,以两个 quality estimation(QE)模型的均值作为奖励,以语言识别(LID)置信度做门控,再用 SFT/R…
静止状态下的关节物体三维重建:从单帧闭态恢复几何、运动学与运动先验
针对"无法采集多状态运动视频"的静止闭态场景,本文提出把"显式 mesh"作为跨模型验证与融合的中间表示,并用 video diffusion model 合成关节运动假设、再用几何一致性做验证,把"几何 + 语义 + 运动先验"三轨补偿的欠定问题做到与"已观测运动"基线方法相当的部件分解与物理合理铰接重建精度。 数字…
TSDS-Toolbox:时序数据集相似度的统一基准框架
本文给出 TimeSeries Dataset Similarity Toolbox (TSDSToolbox)——一个把"时序数据集相似度"方法在数据集级(datasetlevel)与序列级(serieslevel)做统一复现的框架,重点解决三件事:可复现比较、可插拔扩展(自定义数据集 / 相似度方法 / 下游任务)…
MMOOC:多模态大模型的上下文外评估基准
一个真正可靠的 MLLM 必须同时具备两件事:对真正越界(OOC、主体级偏移)的问题拒绝回答,与对偏移但在上下文内(Shifted IC、非主体级偏移)的问题正常回答。现有基准几乎只测前者,MMOOC 是第一个把这两个能力放进同一张评分表的综合基准(41K 题量、八类偏移、六类视觉场景)。 多模态大模型(MLLMs)在…
Omega-S:把"灾难性遗忘"压成一个 3 行正则项
OmegaS 是一个只用当前权重矩阵就能算出来的"功能韧性"正则项,3 行代码塞进训练循环里,单步成本 +4% 以下;在 Llama38B + LoRA 上把"代码→散文"微调后的 HumanEval 保留率从 62.9% 拉到 84.1%,并在 10 个种子上稳定赢过权重衰减和 EWC。 大模型微调的最大副作用从来不…
多不值一个 Token:面向高效 Deep Research Agent 的边际价值估计
Deep research agent 的 token 预算浪费,主因不是检索器弱、不是 prompt 差,而是上下文管理缺少阶段感知的边际价值估计——本文是首篇系统比较 preretrieval / postretrieval / presynthesis 三个阶段剪枝策略的工作,关键发现是剪枝效果更取决于"在哪里剪…
KGCaRe:用 LLM 自动构建知识图谱 + 上下文检索的可解释复杂条件问答
KGCaRe 是一个面向复杂条件问答(complex conditional QA)的混合方法,把神经检索(向量 RAG)和符号推理(在 LLM 自动构建的知识图谱上做迭代图遍历)结合起来,并用"路径形式的三元组 + 检索段落"作为可解释证据,让 LLM 不仅给出答案,还能给出推理路径。 "复杂条件问答"指需要多步条件…
WeClawArena:人本 Agent 网络中跨用户 Agent 协作与安全的可审计沙箱与基准
WeClawArena 是首个面向"人本 Agent 网络(humancentered agent network)"的可审计沙箱与基准——每位用户的 AI Agent 既是个人助理也是协作节点;它用 124 个基础任务 × 5 个变体(1 个良性 + 4 个攻击向量)= 620 个场景变体,对跨用户协作中的隐私泄漏、…
视觉-语言接地作为双向概念对应
把视觉语言 grounding 从"已知短语→找图像区域"的单向定位,重新形式化为图像文本对上的双向概念对应:在不知道哪段文本有视觉指代的前提下,同时预测 text mask、image mask 与对应存在分,从而把 phrase grounding / referring expression / openvoca…
Ego-OSCAR:自我中心开源立体捕获系统
顶部自检:机制 3 段 + 工程 3 段 + ⚠️ 数字核验 3 处;弧线 = 开源硬件 + 大规模众包数据 + 完整软件栈;关键词:egocentric、stereoinertial、open hardware、BOM < $200。 EgoOSCAR 是一个开源硬件 + 低成本头戴式立体惯性采集系统,BOM 单价 …