Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

PosterMELD · 失败可路由
date: 20260806 round: R2 arxiv: source: /shared/videokb/scripts/tom/20260806_R2_postermeldmultiagentpostershortvideoscript.md title: PosterMELD · 失败可路由 round: R…
视频脚本 arXiv:2608.02218 2026-08-06
解码儿童步态行为:用普通 RGB 视频做脑瘫、偏瘫等发育性疾病的非侵入式评估
论文把"用标准 RGB 视频做 317 岁儿童细粒度步态分析"立成一个新的动作识别问题,发布了一个 110 名儿童、1,100 段 60 FPS 同步视频与姿态序列的数据集,并实证当前最强的步态基础模型与多模态大模型在儿童这种"非典型、抖动、微小"步态模式上普遍失败,给出统一端到端框架建立基线。 临床意义的真问题: 脑…
深度解读 arXiv:2608.00371 2026-08-06
MiniWorld:把视频世界模型"从零训练"的门槛压到一台 8 卡服务器、几天内可跑
MiniWorld 是一个完全开源、可复现、面向 streaming(流式、自回归因果)场景的视频世界模型训练框架。它用 blockcausal Video Diffusion Transformer + 潜空间 Flow Matching,结合 chunkwise 非递减噪声调度和两阶段续训,配合滚动 KV cach…
深度解读 arXiv:2608.01127 2026-08-06
Pointer Sentinel Mixture Models:把"复制"与"生成"融合的早期经典
Merity 等人提出 PointerSentinel Mixture(PSM)架构,把 LSTM 语言模型拆成两条路径——一条基于上下文位置做 pointer(指针式复制),一条基于词表的 softmax 生成——通过门控 p_gen 决定每一步从哪条路径出词;该模型在 Penn Treebank(PTB)上以更少参…
深度解读 arXiv:1609.07843 2026-08-06
多模态紧凑双线性池化(MCB):用可控维度的外积思路打通 VQA 的视觉-语言融合
MCB(Multimodal Compact Bilinear pooling)用一种"近似外积、可微、可控维度"的方式,代替了 VQA 里被默认使用多年的 elementwise 加/乘或 concat,在 Visual7W 和 VQA Challenge 上把当时的 SOTA 推到了新高,而且两次复用同一个池化模块…
深度解读 arXiv:1606.01847 2026-08-06
用 CNN 学立体匹配代价(MC-CNN):用"小块相似度二分类"重做立体匹配第一阶段
把传统立体匹配 pipeline 里最关键也最"手工"的一步——匹配代价(matching cost)——换成一个小 CNN,以"两块小图 patch 像不像"的二分类方式训练,然后把网络输出喂给一整套经典后处理(cost aggregation、SGM、左右一致性检查等),在 KITTI 2012/2015 和 Mi…
深度解读 arXiv:1510.05970 2026-08-06
图神经网络:方法与应用综述
Zhou 等人提出了一套面向图数据的通用 GNN 设计 pipeline(图的预处理 → 传播 step → 采样 → 层级聚合 → 预测/解码),并据此系统梳理了图卷积网络(GCN)、图注意力网络(GAT)、图循环网络(GRN)、图门控网络(GGNN)等代表性变体,最后给出四个未来方向,是后续几乎所有 GNN 综述的…
深度解读 arXiv:1812.08434 2026-08-06
Random Erasing 数据增强:在训练图像中随机"擦掉"一块
Random Erasing 是一种零学习成本、与现有 CNN 训练管线完全解耦的数据增强方法——在每张训练图上随机选一块矩形区域并以随机像素值覆盖,从而人为制造"遮挡"样本,提升模型对遮挡的鲁棒性,并在分类、检测、行人重识别三个任务上一致涨点。 视觉模型在受控数据集上很容易学到"完整对象"的偏置,一旦部署到真实世界,…
深度解读 arXiv:1708.04896 2026-08-06
Few-Shot Learning 综述:用"先验知识"重新定义小样本学习
这是一篇把小样本学习(FewShot Learning, FSL)从"零散技巧的集合"重构为"基于先验知识的统一框架"的综述——把 FSL 的本质问题归结为"经验风险最小化在极小样本下不可靠",并按先验知识的注入方式把全部方法归到 Data / Model / Algorithm 三条主线,是后续几乎所有 FSL 综述…
深度解读 arXiv:1904.05046 2026-08-06
IteraSim RAG:面向 OpenFOAM CFD 的多阶段检索增强 Agent 后端
IteraSim RAG 通过多阶段检索管道(查询扩展 → 融合排序 → MMR 重排 → 路由分发)和 Architect/InputWriter/Reviewer 三 Agent 分工,将 OpenFOAM 求解器配置从专家专属技能变为可自动生成的工程流程,在 28 个基准案例上达到平均 77.9% 检索覆盖率,全…
深度解读 arXiv:2607.20346 2026-08-06
训练模型,而非读者:用于可验证激活解释的可解码性监督
当前主流的"可解码性"可解释性测试在结构上无法惩罚单个虚假声明——论文提出 RECAP 框架,通过辅助预测器实现对模型内部内容的独立核查,填补了这一根本性缺陷。 大语言模型的内部激活(hidden activations)到底在编码什么信息?这是可解释性研究(interpretability research)的核心问…
深度解读 arXiv:2607.20379 2026-08-06
OpenForgeRL:在任意环境中端到端训练 Harness 原生 Agent
OpenForgeRL 给出了一个把"推理侧 harness"和"训练侧 RL 栈"解耦的开源框架——用一个轻量代理(proxy)把 harness 内部的模型调用重新服务化为一次普通的推理请求,同时在 Kubernetes 上为每次 rollout 拉起独立容器,让任意 harness(Claude Code / C…
深度解读 arXiv:2607.21557 2026-08-06
Wasserstein 重心(barycenter)的快速算法
针对"求一组经验分布的最优传输(OT)均值"在高维离散情形下计算量爆炸的痛点,本文给出基于熵正则 OT(Sinkhorn 距离)的子梯度算法 + 矩阵 scaling 加速器,把 Wasserstein 重心(barycenter)的计算从原先每次迭代要解一次大 LP 的复杂度降到接近 Sinkhorn 迭代的线性规模…
深度解读 arXiv:1310.4375 2026-08-06
迁移学习综合综述
这是一篇覆盖面极广的迁移学习综述,从"数据视角"和"模型视角"两条主线对 40+ 主流迁移学习方法做了系统分类,并在 Amazon Reviews、Reuters21578、Office31 三个标准数据集上对 20+ 模型的实证结果做横向比较,为研究者快速定位方法选择和工程团队理解迁移学习的本质差异提供了一张清晰路线…
深度解读 arXiv:1911.02685 2026-08-06
高效鲁棒的近似最近邻搜索:层次可导航小世界图(HNSW)
HNSW 通过多层可导航小世界图实现对数级查询复杂度,在高召回率场景下大幅超越纯向量索引 SOTA,是现代向量数据库(Milvus、Pinecone、FAISS 等)的底层核心算法。 近似最近邻搜索(Approximate KNearest Neighbor,AKNN)是向量检索的核心问题:在 d 维向量空间中,给定查…
深度解读 arXiv:1603.09320 2026-08-06
机器学习数据收集综述:从大数据与 AI 集成视角
这篇综述第一次把"机器学习中的数据收集"放在数据管理(database / data management)视角下系统化,把它拆成数据获取(Data Acquisition)、数据标注(Data Labeling)、已有数据/模型的改进(Data/Model Improvement)三大阶段,给出了每个阶段的 rese…
深度解读 arXiv:1811.03402 2026-08-06
计算机视觉中的 GAN 综述与分类学
这篇 2019 年的综述以「高质量生成、多样性、稳定训练」三大约束为视角,把 2019 年之前 GAN 在视觉方向上的架构变体与损失变体系统归类,并给出可执行的开源代码索引,后续被广引为「GAN in CV」事实基线。即便 Diffusion、Transformer 等新生成范式成为主流,这篇综述依然是理解 GAN 思…
深度解读 arXiv:1906.01529 2026-08-06
一个 AI 模型同时输出两种检索向量?arXiv 2608.02583 把搜索系统的"双胞胎架构"打成了"一个人"
你有没有困惑过这种瞬间 🔍: 你做一个电商 RAG 系统,搜"耐克篮球鞋"—— 你希望能精准命中"耐克"这个词(sparse retrieval 的活儿) 但你又希望能理解语义——搜"鸳鸯配色篮球鞋"也能召回"耐克鸳鸯色"(dense retrieval 的活儿) 今天你的解决方案是:维护两套模型。一套 BM25/SP…
科普版 arXiv:2608.02583 2026-08-05
让 AI 干 100 步任务总在第 8 步崩溃?arXiv 2608.01964 把「任务状态」搬出了大模型脑子
你有没有抓狂过这种瞬间 😩: 你让 AI 帮你"在 Ubuntu 虚拟机里下载一个模型、解压、配置环境变量、跑一次推理测试"—— 它前三步做得像模像样。 第 5 步开始就开始瞎编。 第 8 步直接告诉你"任务已完成"——但你打开文件夹一看,差得远呢。 你以为这是模型不够强?不。 这是今天所有「AI Agent 评测框架…
科普版 arXiv:2608.01964 2026-08-05
用 AI 与言语/语言处理监测阿尔茨海默病:一项系统综述
本综述以 PROSPERO 注册的系统综述方法,从 3654 篇初筛文献里筛出 51 项原创研究,系统性地把过去 20 年间「用 AI 处理语音和语言来预测和监测阿尔茨海默病 (AD) 认知衰退」的研究方法、数据、可复现性与临床可应用性整理成四张对照表;其核心结论不是某项算法胜出,而是指出该领域三大系统性短板——研究标…
深度解读 arXiv:2010.06047 2026-08-05
AntiSkillBench:Persona Skill 把"你"打包给下游 Agent 时的隐私与冒充风险
AntiSkillBench 是第一个端到端评测"persona skill 流水线"(把个人交互历史提炼成可执行 skill 包、再喂给下游 Agent)隐私与冒充风险的基准:含 7500 条 personagrounded 对话、覆盖 50 个行为丰富的人物 profile、3 种 skill 蒸馏策略、4 类防御…
深度解读 arXiv:2608.03700 2026-08-05
Quo Vadis, World Modeling? — 把世界建模从「物理状态预测」重构为「以 Agent 为中心的交互式世界代理」
这篇工作把"世界模型(World Model)"从以"预测未来物理状态"为主的狭义范式,扩展为"以 Agent 为中心的交互式世界代理(AgentCentric Interactive World Proxies)":世界建模不再只回答"下一步像素/状态长什么样",而是回答"我现在这个动作,能不能产生对 Agent 有…
深度解读 arXiv:2608.02713 2026-08-05
PAST-Bench — 给"个人 AI Agent 的递归自我改进"做严格基准与诊断
PASTBench(Personal Agent Selfimprovement TestBench)是一个专门用来回答「保留经验是否真的让 personal AI agent 变好」的基准:它把"经验开启/关闭"做对照实验,用 26 个场景、204 个 episode,横跨 memory、procedural reu…
深度解读 arXiv:2608.04003 2026-08-05
Video-DeepResearch — 把多模态深度研究 Agent 从静态图像推到连续视频流
VideoDeepResearch(VideoDR)把 multimodal agent 从"对单张静态图像做检索增强推理"推到"对连续视频流做稠密时空 grounding + 开放网络探索"的设置;通过解耦的 perception–exploration pipeline + 阶段性工具解锁强制 agent 先把视觉…
深度解读 arXiv:2608.03979 2026-08-05
Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
通过将行为知识与任务几何解耦为独立参数集,KGD 让预训练推荐模型在流式更新时无需从头重训,即可将可迁移知识持续刷新,兼顾行为分布漂移下的知识保鲜与下游任务适配。 工业级推荐系统越来越多采用 pretrainthentransfer 范式:先在大规模行为序列上预训练,再将预训练模型迁移到下游任务(如 CTR 预估、排序…
深度解读 arXiv:2608.02738 2026-08-05
主题综述 · risk(2026-07-30)
今日年积日 211,按八主题轮换(rag / agent / multimodal / llminfra / evaluation / engineering / database / risk)推演并经 72 小时未覆盖窗口顺延,落点为 risk。 本文综合材料: organized/paper_cards/ 中主分…
周综述 2026-07-30
ExplainBench:把"代码解释的可信度"也变成可量化指标
ExplainBench 提出"用 LLM 答多选题"来反推解释的可信度,首次把"软件工程 agent 写出来的解释到底可不可信"变成可量化、可对比、可迭代优化的指标;并基于此引入 ExplanationAuditAgent,对任意 agent 的解释做差分测试审计,实验显示它能普遍提升所有被测 agent 的解释质量…
深度解读 arXiv:2607.26451 2026-08-05
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
STWAM 通过 DINOv3 语义表征替代传统 VAE 潜在空间进行未来预测,并引入 DualSpace Future Experts 同时保留细粒度 VAE 动态,诊断并解决了 World Action Model 在视觉分布漂移下的"训练分布幻觉"(TrainingDistribution Hallucinati…
深度解读 arXiv:2607.28993 2026-08-05
Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories
PushWiper 将高粘度污渍清洁重新定义为"聚合分离"问题,用海绵通过分段推动轨迹逐步聚集污渍,再统一分离回收,Cleaning Score(CS)最高达 baseline 的 230%(提升 130%),并可在零样本条件下迁移到未见过的污渍和曲面。 机器人表面清洁长期面临两大流派的选择困境: Stage 1: 分…
深度解读 arXiv:2608.00730 2026-08-05
你手机里那个能看懂图片的 AI,其实是在「跨模态接力赛」中学会的——Flamingo 给了它起步的姿势
你有没有过这种体验: 给 AI 发一张街景照片,配一行字「这图里有几个穿红衣服的人?」——它秒答「3 个」。你感叹「AI 现在真的会看图了」。 但你大概率不知道的是: 2022 年之前,绝大多数 AI 看图必须先专门训练一遍——你要让它认数字、就训「数字」;让它识人脸、再训「人脸」;让它看图答题、又得重新训一遍。 20…
科普版 arXiv:2204.14198 2026-08-05