解读
1543 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Towards A Rigorous Science of Interpretable Machine Learning
自检:机制 3 段 + 工程 2 段 + ⚠️ 数字核验 2 处(被引数 / 历史版本)。 这是一篇给「可解释机器学习」立学科规范的位置论文(position paper):先定义 interpretability、再回答"何时需要 / 何时不需要",最后给出可复现的评估 taxonomy,是 2017 年之后几乎所有…
基于半自动化内容可信度检测的帕累托最优重排序
本文把"信息流可信度"建模成对原排序的双目标优化:用 Spearman's footrule distance 保住原排序形态,再叠加一条"期望可信度"的线性目标,从而在 Pareto 前沿上找到改动最小、却能显著提升内容可信度的重排序方案;并配套一条"检索增强打分 + 人工事实核查"的半自动化可信度标注流水线,让该方…
Scaling Instruction-Finetuned Language Models
FlanPaLM 通过在大规模任务集上做 Instruction Finetuning,将 LLM 的零样本/少样本泛化能力推至 SOTA 水平,540B 模型在 MMLU 上达到 75.2%(5shot),并开源了 FlanT5 全系列(80M~11B)供社区使用。 GPT3 以来,LLM 已经展现出强大的 InCo…
Momentum Contrast for Unsupervised Visual Representation Learning
MoCo 将无监督视觉表征学习建模为「动态字典查询」,通过动量更新的查询编码器和队列机制,在不需要任何人工标签的情况下学习到可迁移到下游检测/分割任务的强大视觉特征,在 7 项任务上超越了同期 ImageNet 有监督预训练的表现。 在 NLP 领域,无监督预训练(GPT、BERT)已经取得了巨大成功,但 Comput…
你训练的 AI 模型换个场景就"翻车"?这篇被引近 6000 次的论文给出了"迁移学习"完整地图
你有没有这种感觉: 你训练了一个超准的"猫狗分类器",准确率 95%。 但老板说:"换个医院场景,给 CT 影像分类。" 你把模型拿过去——准确率直接掉到 60%。💥 这是 AI 落地最大的"坑"—— 模型在源领域(A 场景)训练得很好,但换到目标领域(B 场景)就水土不服。这种现象,业内叫"分布漂移"或"域差异"。 …
你以为大模型越"胖"越聪明?这篇被引 7600+ 次的论文把它打脸了
你有没有一种感觉: 大模型这两年,就是一个字——大。参数从几亿飙到几千亿,公司堆算力、堆数据、堆显卡,仿佛「更大 = 更强」是宇宙真理。 但 2019 年的一篇论文说:这个真理是错的。 arXiv 1909.11942(ALBERT) 做的事很反直觉—— 把 BERTlarge 的参数量从 3.4 亿压到 1800 万…
EvolvingWorld:让角色与世界共同演化的开放式文学世界框架
EvolvingWorld 把"交互式文学世界模拟"重新定义为长视野的角色世界共同演化过程:不再做静态人格扮演,也不再做孤立的场景生成。它用一个 openschema 框架 容纳任意世界观,内部由「Character Agent(多角色扮演 + 人设持续演化)」与「LLM 驱动的 World Model(全局/地点/实…
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
TimeLens2 通过将时序证据建模为区间集合(interval set)并用 temporal Wasserstein 奖励提供密集反馈,让一个多模态 LLM 在任意长度、领域、查询形式和视角的视频中精准定位多段支持性证据片段,在多项基准上超越参数量高达 397B 的开源模型。 Video MLLM 已经能描述视频…
Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift
TOPL(TokenLevel OffPolicy Labeling)将 posttraining 重构为逐 token 正确性预测任务,通过训练模型区分"好 token"和"坏 token"来引导模型生成优质回答,在 11 个 summarization 数据集上实现强跨分布泛化,并证明 token 级学习信号是成功…
PixelEyes:解耦感知与推理以实现精准视觉证据定位
PixelEyes 针对多轮视觉推理中 MLLM 反复定位失败、推理轨迹冗长的问题,首次提出将 reasoner(推理器) 与 perception tool(感知工具) 显式解耦:reasoner 决定"要找什么",specialized perception tool 回答"在哪里",通过 maskguided v…
基于非对称互变分学习的多模态连续推理
AMVL 提出 Asymmetric Mutual Variational Learning,通过双向 KL 散度校准目标——前向 KL 让 prior 去匹配 posterior(获得推理方向),反向 KL 约束 posterior 不 collapse(防止答案泄漏),在 BLINK 复杂推理基准上平均得分提升 +…
高维场景下基于网格的近似最近邻搜索的标度律
对 multiprobe grid(基于网格的 ANN)算法在数据集规模 $N$ 与维度 $d$ 上做了系统性标度分析,发现了一个以前未被报告的 $d$scaling 交叉点:在 GloVe 词嵌入族上,网格方法在维度上保持近似常数标度,而图、树、划分等主流 ANN 方法的吞吐量都随维度退化——这意味着网格方法在重建频…
DistilVDR:基于双学生蒸馏的紧凑端到端视觉文档检索器
视觉文档检索(VDR)一直被 multibillion 参数模型主导,索引百万级语料既慢又贵——本文用单一 8B 视觉语言教师 + 双侧蒸馏,炼出一个 524M 的端到端单向量检索器,无需相关性标签、无需负采样、无需对比损失,在 ViDoRe v1+v2+v3 上拿到 61.74 平均 NDCG@5(达到 8B 教师 …
iFAN:让普通 Mask Transformer 学会"推理感知"的训练框架
Mask Transformer(如 Mask2Former、MaskFormer 类)在推理时靠最后一层 query 之间的像素级"竞争"生成 segmentation,但训练时完全没把这一推理过程纳入优化目标——iFAN 通过 Adjusted ProbabilityMask Ranking (APMR) + Cr…
ComBodied Agents:把"人的状态与能动性"立为 Agentic AI 的一等建模对象
提出 ComBodied Agents(人本具身智能体) 这一新范式,把 Agentic AI 的建模、干预与评估对象从"软件/物理状态变换"转向"个体人类状态轨迹",以"个人世界模型(Personal World Models)+ 可执行干预策略 + 闭环反馈"作为统一闭环骨架,并主张以 agencypreserva…
AdvFD:用对抗学习特征空间,跳出视觉生成的 Fréchet Hacking
提出 Adversarial Fréchet Distance(AdvFD)——在 Fréchet distance(FD) 类训练目标之外,额外引入一个对抗式可学习表征,使其在真实/生成分布差异最大化的方向上动态调整特征空间;同时用 realfeature whitening 抑制对抗表征的尺度/协方差放大,稳定 m…
MiLMMT-46-v1.0:在 46 语言上用 GRPO + 参考无关奖励做开放式 LLM 多语翻译后训练
针对开放 LLM 的多语翻译,提出 "参考无关参考无关奖励 + 语言识别门控 + SFT/RL 权重线性插值" 的三段式后训练配方:在 SFT 模型 MiLMMT46v0.1 上用 GRPO 训练,以两个 quality estimation(QE)模型的均值作为奖励,以语言识别(LID)置信度做门控,再用 SFT/R…
静止状态下的关节物体三维重建:从单帧闭态恢复几何、运动学与运动先验
针对"无法采集多状态运动视频"的静止闭态场景,本文提出把"显式 mesh"作为跨模型验证与融合的中间表示,并用 video diffusion model 合成关节运动假设、再用几何一致性做验证,把"几何 + 语义 + 运动先验"三轨补偿的欠定问题做到与"已观测运动"基线方法相当的部件分解与物理合理铰接重建精度。 数字…
TSDS-Toolbox:时序数据集相似度的统一基准框架
本文给出 TimeSeries Dataset Similarity Toolbox (TSDSToolbox)——一个把"时序数据集相似度"方法在数据集级(datasetlevel)与序列级(serieslevel)做统一复现的框架,重点解决三件事:可复现比较、可插拔扩展(自定义数据集 / 相似度方法 / 下游任务)…
主题综述 · RAG(2026-08-05 · v2 重写版)
重写说明:v1 版定位偏移——本应作为"对 20260805 RAG 主题的独立深度综述",实际却是 R 序列私域节点 16 处 + 团队内实例显式署名 2 处的私域污染叠加(v1 私域污染 SUM = 18,居 805 ~ 812 窗口 15 篇综述第一)。v2 修正:(1) R 序列私域节点脱敏为通用描述;(2) …
让 AI 看图回答问题,为什么"一句话概括"成了天花板?——LLaVA 用 GPT-4 合成 158k 条指令,把视觉对话打成 92.53% SOTA
你有没有试过这种体验 🖼️: 你把一张客厅照片丢给 AI,说"扮演一个室内设计师,分析这张图里沙发的摆放缺点并给出 3 条改进建议"—— 它回你"图像里有沙发、桌子、台灯" 🫠 它在背 caption。 不是它不聪明,而是它根本没学过"看图 + 按指令回答"。它只学过"看图 + 描述一句话"。 这件事有个名字:视觉指令…
这张图里有多少辆汽车?——SegFormer 如何用一个 84M 参数的 Transformer 看清每一条街
你有没有试过这种体验 🛣️: 你让 AI 看一张街景图,问"这条路上有几辆汽车、几棵树、几个行人"—— 它回你"这是一条繁忙的城市街道" 🫠 听起来"对",但完全没用。 城市街道、卫星图像、工厂表面、医学切片——这些场景里你真正需要的是逐像素的精确类别(哪里是车、哪里是路、哪里是墙),不是一句概括。 这件事有个专门的名…
视频选题榜 2026-08-12
· Ouroboros: A SelfDeveloping Frontier Coding Agent with Reviewed Core Evolution · 自演化 Agent harness 用 review commit 治理 · round=R1 · Stealing Reasoning Traces f…
主题综述 · RAG(2026-08-12)
20260805 的 RAG 综述把主线收束在「七元 Runtime Stack」。七天过去,arXiv 8 月 512 日窗口的 RAGprimary 新工作呈现共同模式:不再往上加模块,而是把 RAG 默认管线里被默认接受多年的隐含假设逐条拆掉重做。本文聚焦 8 篇核心 arXiv 工作——EAHR(2608.07…
MMOOC:多模态大模型的上下文外评估基准
一个真正可靠的 MLLM 必须同时具备两件事:对真正越界(OOC、主体级偏移)的问题拒绝回答,与对偏移但在上下文内(Shifted IC、非主体级偏移)的问题正常回答。现有基准几乎只测前者,MMOOC 是第一个把这两个能力放进同一张评分表的综合基准(41K 题量、八类偏移、六类视觉场景)。 多模态大模型(MLLMs)在…
Omega-S:把"灾难性遗忘"压成一个 3 行正则项
OmegaS 是一个只用当前权重矩阵就能算出来的"功能韧性"正则项,3 行代码塞进训练循环里,单步成本 +4% 以下;在 Llama38B + LoRA 上把"代码→散文"微调后的 HumanEval 保留率从 62.9% 拉到 84.1%,并在 10 个种子上稳定赢过权重衰减和 EWC。 大模型微调的最大副作用从来不…
多不值一个 Token:面向高效 Deep Research Agent 的边际价值估计
Deep research agent 的 token 预算浪费,主因不是检索器弱、不是 prompt 差,而是上下文管理缺少阶段感知的边际价值估计——本文是首篇系统比较 preretrieval / postretrieval / presynthesis 三个阶段剪枝策略的工作,关键发现是剪枝效果更取决于"在哪里剪…
KGCaRe:用 LLM 自动构建知识图谱 + 上下文检索的可解释复杂条件问答
KGCaRe 是一个面向复杂条件问答(complex conditional QA)的混合方法,把神经检索(向量 RAG)和符号推理(在 LLM 自动构建的知识图谱上做迭代图遍历)结合起来,并用"路径形式的三元组 + 检索段落"作为可解释证据,让 LLM 不仅给出答案,还能给出推理路径。 "复杂条件问答"指需要多步条件…
WeClawArena:人本 Agent 网络中跨用户 Agent 协作与安全的可审计沙箱与基准
WeClawArena 是首个面向"人本 Agent 网络(humancentered agent network)"的可审计沙箱与基准——每位用户的 AI Agent 既是个人助理也是协作节点;它用 124 个基础任务 × 5 个变体(1 个良性 + 4 个攻击向量)= 620 个场景变体,对跨用户协作中的隐私泄漏、…
视觉-语言接地作为双向概念对应
把视觉语言 grounding 从"已知短语→找图像区域"的单向定位,重新形式化为图像文本对上的双向概念对应:在不知道哪段文本有视觉指代的前提下,同时预测 text mask、image mask 与对应存在分,从而把 phrase grounding / referring expression / openvoca…