解读
1758 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
基于 FLISP 的大规模隧道空地协同:Fast LiDAR-IMU Synchronized Path Planner
FLISP 用一套 UGV 搭载的 LiDARIMU 同步驱动 UGV 与 UAV 路径,在 1.2 km 真实水工隧道里实现 100% 成功率、7 ms 规划延迟,比栅格基线快 7 倍,比采样基线快三个数量级,首次在特征退化的线性基础设施里把"无地图规划"做成可落地的工程方案。 水电站引水隧洞、排沙洞、压力管道一类长…
Running the Gauntlet:重新评估 Agent 在熟悉环境之外的能力
针对当前 Web Agent 评测被简单、热门、单一能力的基准"刷分式饱和"的问题,提出 GauntletBench——一套聚焦"时间感知 / 图形理解 / 3D 推理"三类被忽视能力的 Web 基准,覆盖 5 个冷门但实用的专业场景,共 100 个视觉密集型任务;结果显示 SOTA Agent 仅 19.1% 成功率…
CanvasAgent:通过视觉工具编排实现复杂图像创建与编辑
针对复杂图像创建与编辑需要多步多工具协作,而现有多模态 tooluse 数据集与 Agent 多以感知/检索为中心、缺乏大规模"可执行图像创作轨迹"监督的痛点,提出 CanvasCraft 大规模数据集(140K 全标注可执行轨迹 + 10K RL 任务规范),并在 SFT+GRPO(混合 outcome+proces…
基于 RAG 增强 LLM 的空域图像隐写术代码级代价函数生成
针对空域图像隐写中"代价函数手工调参繁琐、深度学习方案又缺乏可解释性"的老问题,提出一个以 SelfEvolving RAG (SERAG) 为核心的进化式代码生成系统:先用 Code Semantic Signature (CSS) 把过程式代码转成对齐查询,从静态文献知识库与动态经验知识库中检索显式领域知识来约束 …
PluraMath:将数学推理评估拓展至低资源语言
PluraMath 通过将 PolyMath 扩展至 18 种低资源语言,证实了数学推理能力在高低资源语言之间的系统性差距,且该差距与模型指令遵循能力高度相关。 当前主流数学推理 Benchmark(如 GSM8K、MATH)几乎全部被英语和中文垄断——这些语言在 LLM 预训练语料中占绝对主导地位。这意味着:即便同一…
HETERQA:跨异构来源记录检索的基准测试与现状分析
HETERQA 构建了一个包含 857 个 QA 对、覆盖 5 种异构数据源(关系表、文本文档、图像库、空间数据库,知识图谱)的综合基准,证实当前主流检索方法在该场景下仍有巨大提升空间——Hybrid Retrieval 最高 Recall@10,SelfRAG 最高 MRR@10,但均远未饱和基准。 真实世界的信息系…
MV-Forcing:通过 4D 几何约束实现任意长度多视角视频生成
MVForcing 在单一扩散模型中融合时间与视角双重自回归,通过 3D 重建模型构建相邻视角间的 4D 几何桥梁,并用时空自强迫(SelfForcing)弥合训练推理的曝光偏差,实现任意长度、任意视角数的动态场景多视角视频生成。 视频生成领域有两个独立进展良好的方向: 但两者的交集——长+多视角——是未解问题。具体痛…
CONFLUX:面向胸部 CT 的可控 3D 潜在扩散模型 + GRPO 后训练
CONFLUX 把 3D 变分自编码器 + 整流流 Transformer(rectifiedflow transformer)拼成一套原生 3D 的胸部 CT 潜在扩散生成器,再以组相对策略优化(GRPO)作为后训练阶段,用一个独立分类器对"请求病征的恢复可靠性"打分当作奖励,把整体 FID 压到 32.3(vs. …
AI Wizards 参加 EXIST 2026:分层软标签学习用于迷因中的多模态性别歧视识别
本文是 CLEF 2026 EXIST Lab 挑战赛的一个参赛系统笔记:用 Gemini Embedding 2 提取固定 768 维多模态表征,套一个仅 3.5M 参数的 SwiGLU Gated MLP 头,以 KL 散度 + 同方差不确定性加权联合训练三个层级子任务(性别歧视识别 / 来源意图 / 五类细分),…
实时 RAG 系统提升历史档案的可访问性
本文把"LLM 改 OCR"与"语义检索 + 跨编码器重排 + 流式生成"组合成一条端到端历史档案管道,在 50 万段 1762–2001 年的瑞士报纸语料上,OCR 字符错误率降 44.52%、词错误率降 60.95%,NDCG@10 从 65.99% 提到 87.05%(+31.9%),并把响应延迟压到秒级,证明把…
OpenRCA 2.0:从结果标签到因果过程监督
LLM Agent 在跨系统根因分析(RCA)中能以 76% 的准确率定位到正确服务,但真正把该服务锚定在经验证因果传播路径上的仅有 61.5%;现有数据集只标注根因、不标传播路径,是这个 gap 的根本原因。 SRE 场景中,LLM Agent 被用于自动根因分析——给定一段告警和系统遥测数据,让模型找出哪个组件导致…
知道太多的智能体:面向 LLM 智能体隐私的数据中心化综述
LLM Agent 接触的数据源越多、保留的状态越久、跨系统协作越深,隐私泄露的维度就越广;但现有防护机制只覆盖部分泄露路径,且没有基准能完整衡量 Agent 在单一隐私策略下跨所有数据面的风险。 传统隐私研究按攻击类型组织(Prompt Injection、DPA 等),割裂了 Agent 与数据交互的整体视图。本文…
运行与否:分析基于 LLM 的程序修复中代码执行的成本效益
LLM Agent 在 SWEbench 上禁用代码执行后,修复成功率几乎不变(仅差 1.25pp),但仍平均消耗 8.8 次测试运行;当前 Agent 对执行的使用是「不加区分」的,执行应该被当作有明确成本收益权衡的资源,而非默认能力。 基于 LLM 的程序修复 Agent 普遍采用「generaterunrevis…
联邦学习中的非独立同分布数据:用 Earth Mover's Distance 量化权重发散,并以 5% 全局共享数据恢复 30% 精度
联邦学习在非独立同分布(NonIID)数据下精度最高下降 55%,其根因是各客户端模型权重相对于全局最优的发散,这种发散可以用 Earth Mover's Distance(EMD,推土机距离) 在类分布层度量;作者证明,只要在所有边缘设备之间共享 5% 的全局数据,即可在 CIFAR10 上把精度恢复约 30 个百分…
用对比预测编码(CPC)学表征:高维信号到紧凑潜空间的通用无监督路径
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:实验数字以 abstract 范围内可核验项为限,未引未在公开 abstract 中给出的精确指标。 CPC(Contrastive Predictive Coding)提出一种与模态无关的无监督表征学习方法:通过一个编码器把高维信号压成紧凑潜空间 z,再用一个…
T5:用统一的 Text-to-Text 框架探索 NLP 迁移学习的极限
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:C4(Colossal Clean Crawled Corpus)命名、texttotext 范式、覆盖任务类型(summarization / QA / text classification)来自 abstract 直接陈述;具体 GLUE/SuperGLU…
两时间尺度更新规则(TTUR)与 Fréchet Inception Distance(FID):让 GAN 训练首次有了收敛保证与可靠评估
自检:机制段 ✓ · 工程路径段 ✓ · ⚠️ 数字核验:CelebA/CIFAR10/SVHN/LSUN/One Billion Word 等数据集名与 TTUR/FID 命名来自 abstract 直接陈述;具体 FID 数值与 baseline 对比表未在 abstract 给出,标注「需 PDF 验证」。 He…
FedAvg:把通信效率抬到中心化 SGD 的 10-100 倍,联邦学习的奠基算法
McMahan 等人提出的 Federated Averaging(FedAvg)用「客户端本地多步 SGD + 周期性参数平均」的极简范式,在非 IID、不平衡、跨设备的真实数据上,把达成目标精度所需的通信轮数压到同步 SGD 的 1/10 至 1/100,从而把「数据不出端」的联邦学习从概念推向可工程化的算法。 2…
mixup:用凸组合造数据,把泛化、对抗鲁棒性、GAN 稳定性一并拉满
Zhang 等人提出的 mixup 用「把两张图(及其标签)按 λ 凸组合,送进网络训练」的极简数据增强,在 ImageNet、CIFAR、Google commands、UCI 五个数据集上一致抬高 SOTA 模型的泛化精度,同时减少对损坏标签的过拟合、提升对对抗样本的鲁棒性、并显著稳定 GAN 训练——以不到十行代…
FVAttn:带运行时负载均衡的自适应稀疏注意力,专治视频生成
FVAttn 是一个面向视频 DiT(Video Diffusion Transformer)的训练free 自适应稀疏注意力系统。它把「Topp 路由 + Topk 安全底 + 视频块结构」作为稀疏前端的策略,同时在多卡序列并行(sequence parallelism)下做运行时 P2P 负载均衡与 slack 填…
为「主动观察者」准备的考试:ActiveVision 基准如何暴露 MLLM 的视觉死穴
ActiveVision 是一个用来「量化 MLLM 是否像人一样主动观察图像」的评测基准。它用 17 个任务 3 类题型,强制模型反复做视觉感知,而非一次性静态描述。结果在最强模型 GPT5.5(最高 reasoning effort 档)上也只拿到 10.6%,Claude Fable 5 仅 3.5%,远低于三位…
MANCE:流形感知的概念擦除
MANCE 提出流形约束假设(Manifold Constraint Hypothesis),认为自然表征集中于低维流形上,干预应被投影到该流形内执行——在这一假设指导下,MANCE++ 在非线性概念擦除任务上达到 SOTA,在移除目标概念信息的同时更好地保留其他语义属性。 概念擦除(Concept Erasure)的…
CheckRLM:检索增强推理中的知识-思维一致性校验
CheckRLM 在推理过程中实时提取关键事实主张并检索外部知识库比对,发现错误后以最小改动精确修正,从而有效阻断错误在长推理链中的累积传播,在长程推理上以更低成本达到 SOTA 性能。 以 DeepSeekR1、OpenAIo1 为代表的推理语言模型(Reasoning Language Model, RLM)通过扩…
Know Your Source:面向媒体事实核查的公共知识库 MEDIAREF
提出 MEDIAREF——一个覆盖 200 家媒体来源、可公开下载、可复现更新的网络文档知识库,作为 RAG 时代"sourcecritical reasoning / Media Background Check (MBC)"任务的低成本公共评测底座,并系统评测了主流 LLM 在 MBC 生成上的表现。 基于 LLM…
WARP:从权重空间反推训练数据混合比例
WARP(Weightspace Analysis for Recovering training data Portfolios) 是一个从已发布模型权重反向推断其微调阶段训练数据"领域混合比例"的框架:在 base 与 finetuned 模型之间做 model merging,生成伪检查点,从权重空间的几何特征映…
AgenticSTS:长周期 LLM Agent 的"有界记忆"测试平台
提出一种 boundedmemory contract(有界记忆契约):每次决策都基于一条由"类型化检索"组装出的"新鲜"用户消息,不再追加跨决策的原始历史,从而在 Slay the Spire 2(杀戮尖塔 2)这一长周期决策游戏中对 LLM Agent 的各记忆层做可隔离消融(A0 固定对照),并开源 298 条带…
MultAttnAttrib:长文档问答中免训练的多模态归因生成
MultAttnAttrib 是一种免训练的归因(attribution)生成方法,通过利用模型自身 prefill 阶段的注意力头与校准阈值,在长文档问答里精准定位答案所对应的源证据,在多模态(图表+文本)归因上一致优于多种强 promptbased 方法,推理延迟仅为同等 base model 直接 prompti…
OrbitQuant:面向图像与视频扩散 Transformer 的数据无关量化
OrbitQuant 是一种数据无关(dataagnostic)的 PTQ 方案,通过在归一化的旋转基空间中量化,绕过传统 PTQ 必须的 range estimation,让单个 LloydMax codebook 同时适配所有 timestep、prompt 与 layer——首次把图像 DiT 的 PTQ 推到 …
AGVBench:面向静脉识别数据增强的可靠性基准
AGVBench 在 5 个公开掌/指静脉数据集、7 个骨干网络上系统评测了 30 种数据增强策略,首次明确指出「准确率最高的增强(多图混合类)反而最脆弱、校准最差」,为静脉识别这一安全敏感领域建立了一个兼顾干净准确率、对抗鲁棒性与概率校准的标准化评测协议。 静脉识别(掌静脉、指静脉)被认为是一种「活体、难伪造」的生物…
EvoPolicyGym:在交互式环境中评估 Agent 的自主策略演化能力
EvoPolicyGym 把"Agent 能否通过反馈迭代改写可执行策略"这件事做成了一个有固定交互预算的受控评测——16 个紧凑的 RL 环境、24 页论文,把"会改代码"和"能持续调优"分开来看,并跑出 GPT5.5 是当前最强。 Agent 评测里有个长期被绕开的痛点:最终分数高,不等于 Agent 真会"演化"…