解读
1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
SAM-MT:实时交互式多目标视频分割
SAMMT 把 SAM2 从"单目标视频分割"扩展为"实时多目标交互式视频分割",通过 显式 target queries + 共享全局表示 + 解耦 masked attention + 稀疏 memory,把分割延迟从"随目标数线性增长"解耦为常数级,在 10 个目标时仍保持 36 FPS,同时不牺牲 SAM2 原…
Agentic 谈判中的行为隐私泄露:用随机化策略形式化并缓解推理攻击
针对自主谈判 Agent 在多轮交互中暴露出的「行为隐私泄露」——即攻击者能从让步轨迹、时机、收敛模式反推出对手私有约束——本文设计了一种自适应随机谈判策略,在不依赖密码学的前提下,同时给出 $(\varepsilon, \delta)$行为差分隐私保证、报价序列的几乎处处收敛和较高的谈判效用,并在 3,000 次合成…
REBASE:用「参考背景子空间消除」做无训练的上下文分割
面向一次性参考图像驱动的无训练上下文分割(InContext Segmentation, ICS),REBASE 在闭式(训练零、参数零更新)条件下显式识别并消除参考图像中的低秩背景子空间,把参考与查询特征投影到其正交补上,再用相似度加权最远点采样生成正点提示,喂给 SAM 类可提示分割网络,在 PACOPart、FS…
沉默失败:当 LLM Agent 出错时,它在对你撒谎——一项来自生产 runtime 的纵向研究
这篇论文对一个自 2026 年 3 月起在生产中连续运行的"个人助理 Agent 运行时"做了八周的纵向研究,记录了 22 起完整 rootcause 复盘的事故,其中"错误信号从未以可行动形式到达人"的元模式至少出现 28 次;论文由此提炼出一个五类机制导向的静默失败分类法(环境怪癖、设计假设错位、错误吞咽、链式幻觉…
EvoGraph-R1:面向 Agentic 检索的自演化多模态知识超图
EvoGraphR1 将知识图谱从静态数据结构重新定义为由 Agent 交互驱动动态演化的「环境」,用 MDP 框架统一了检索、搜索、编辑三类操作,让知识图谱在推理过程中实时自我修正。 GraphRAG 已成 MLLM(Multimodal Large Language Model)知识增强的主流范式,但现有方法存在三…
UniClawBench:面向真实世界任务的主动 agent 能力驱动基准
港大 MMLab 提出的 UniClawBench 是首个能力驱动(capabilitydriven)的主动 agent 真实世界基准,围绕五项基础模型能力(技能使用、探索、长上下文推理、多模态理解、跨平台协同)设计了 400 个中英双语任务,采用活体 Docker 容器 + 闭环多智能体评估,第一次把「基模型能力 v…
Tree of Thoughts:让 LLM 学会"深思熟虑"的搜索式推理
Tree of Thoughts(ToT)把 ChainofThought 的一次性"线性思考"扩展成显式树结构搜索——把推理拆成"思想"(thoughts)作为中间节点、用 LM 自己评估(selfevaluation)来打分、必要时回溯或前瞻——在 Game of 24、创意写作、迷你填字三个需要非平凡规划的难题上…
A Survey on Evaluation of Large Language Models:把"如何评 LLM"做成一个独立学科
Chang 等人 2023 年 7 月发表、被 ACM TIST 接收的 LLM 评估综述(S2 引用 3500+,影响力引用 130+),提出 "评什么 / 在哪里评 / 怎么评" 三维框架,系统覆盖通用 NLP、推理、医疗、伦理、教育、Agent 等 8 大评估任务族,并维护持续更新的开源材料库,是把"LLM 评估…
A Comprehensive Overview of Large Language Models
本文是 20232024 年 LLM 领域最系统的全景综述之一,覆盖从 Transformer 架构原理、预训练方法到多模态扩展、效率优化和 Benchmark 评估的完整知识图谱,帮助研究者和工程师在 LLM 知识过载的时代快速建立全局视野。 LLM 领域在 20232024 年呈现爆发式增长:每周都有数十篇新论文面…
历史监狱压迫记录的对话式检索与即时知识建模
本文提出一种面向历史数字图书馆的文档分析系统,把 RAG 的检索对象从「单文档」扩展为「文档 + 即时构建的知识图谱」,让档案专家在对话中持续往图谱里沉淀事实,使 LLM 在跨文档的复杂查询上能够调用专家知识与文档证据两个来源。 历史档案数字化有两个固有难题: 1. 跨文档关联:一份监狱压迫记录可能援引同一个人在不同时…
LongE2V:基于视频扩散模型的长时间跨度事件驱动视频重建、预测与帧插值
LongE2V 通过微调预训练视频扩散模型,用 Autoregressive Unrolling、Adaptive Context Switching、Reencoding Alignment 和 Event Voxel Density Augmentation 四项技术创新,在事件相机(Event Camera)视频…
Remember When It Matters:面向长视野 Agent 的主动记忆 Agent
REMEMBER WHEN IT MATTERS 将 Agent 的记忆问题重新定义为"主动干预控制"而非"被动检索",通过一个独立运行的 Memory Agent 并行于 Action Agent,根据结构化记忆库决定何时主动向主 Agent 注入提醒、何时保持沉默,在 TerminalBench 2.0 和 τ²B…
SVR-R1:在强化学习中通过自验证自举多模态推理
SVRR1 让 VLM 在 GRPO 训练过程中自己判断答案对错——"No"就再想一次,"Yes"或达到轮次上限才定稿——由此将自我验证本身变成学习信号,在无需外部监督的情况下自举多模态推理能力。 多模态推理(看图说话、图表问答等)长期落后于纯语言推理,核心瓶颈在于:如何让视觉语言模型(VLM)具备自我纠错能力,而无需…
像机器人一样看:面向 VLA 的机器人中心点图方法
面对大规模机器人演示数据中视角多样性不断增长的挑战,机器人中心点图(RobotCentric Pointmaps)将每个像素的 3D 坐标以机器人坐标系为基准编码为稠密图像,使 VLA 可以在不改变架构的前提下获得一致的 3D 几何感知,在仿真和真机实验中均显著优于纯 RGB 策略,且未见视角下的优势最为明显。 视场框…
用知识蒸馏把 LLM 变成高效的 RAG 重排序 Cross-Encoder
针对 RAG(RetrievalAugmented Generation)流水线中的重排序(reranker)环节,作者用两阶段流水线把 LLaMA 3 8B 改造成 dropin reranker:先用 Unsloth + LoRA 监督微调、相关任务上做知识蒸馏,再用 4bit 量化压轻推理。接进「BM25 + 稠…
VideoChat3:4B 参数打平更大视频 MLLM 的完全开源新基线
本文推出 VideoChat3——一个"完全开源、以视频为中心、4B 参数级别"的多模态大模型。它通过 I3DViT(Inflated 3D Vision Transformer)+ Adaptive Frame Resolution for Streaming Video Perception 解决效率问题,通过 V…
Digital Pantheon:用 LLM 智能体模拟与审计政治联盟形成
提出 Digital Pantheon,一个把 SFT + DPO + RAG 三件套组合起来的多智能体框架,让 LLM 党派代理在事实性与意识形态之间保持平衡;并配套 MILT(多层信息谱系拓扑)+ CIS(联盟影响分数)做可解释审计,结果在 2019 年佛兰德大选中复现出 NVA 胜出、稳定排名,且"宣言锚定的谱系…
On-Policy Delta Distillation:用「差量」而非「分布」蒸馏推理能力
OPD²(OnPolicy Delta Distillation)把 onpolicy distillation 的监督信号从「模仿 teacher 的输出分布」换成「teacher 与 base 之间的 delta 分布」,让 token 级监督直接对应「推理能力增量」,在数学、科学、代码推理 benchmark 上…
稀疏截断态向量模拟器:面向 Peaked Circuits 的高效量子电路经典模拟
本文针对"peaked circuits"这一类特殊量子电路,提出了用稀疏表示存储仅非零振幅的截断态向量(truncated state vector)实现高效经典模拟,放弃了传统量子模拟器使用的密集表示,并用向量化操作和硬件加速最大化计算效率,在开源实现中验证了该方法的实用可行性。 经典计算机模拟量子电路面临指数级内…
MMAgent-R²:面向 Agentic 多模态 RAG 的「重排序 + 拒答」联合学习
针对 KBVQA 中「视觉相似但事实错误」的检索干扰物,MMAgentR² 把多模态 RAG 的检索器从「全局特征匹配」升级为「视觉重排序 + 主动拒答 + GRPO 联合训练」,在 InfoSeek、EVQA、MMhops 三个多跳/多图基准上达到 SOTA,已被 ECCV 2026 接收。 KBVQA(Knowle…
DynaKRAG:把多跳 RAG 改造成「状态条件控制」的统一框架
DynaKRAG 把多跳 RAG 的多步证据获取抽象成「状态条件 + 原子操作 + 可学习控制器」的决策过程,在 HotpotQA/2Wiki/MuSiQue 三个多跳 QA 基准上用 Qwen2.57BInstruct 取得 SOTAF1(0.5998 / 0.5340 / 0.3061),证明显式建模「证据状态 →…
优化器状态该放在哪?面向内存高效 MoE 训练的分层状态分配
SkewAdam 通过识别 MoE 模型中稠密主干 / Expert / 路由器三类参数群体的梯度统计差异,为每类分配不同的优化器状态形式,将峰值训练内存从 81.4 GB 压缩至 31.3 GB(减少 61%),同时在相同 token 预算下取得更低的验证困惑度。 MoE(MixtureofExperts)训练长期以…
基于 RAG 记忆与多模态教练智能体的端到端 LLM 飞行规划(FRAMe)
FRAMe 把一个 LLM Planner、一个会看图的 Multimodal Coach Agent 和一个 RAG 记忆模块拼在一起,让 eVTOL(电动垂直起降)飞行规划从「拍脑袋选候选路线」升级成「自然语言指令 → 端到端生成符合偏好的安全航线」,并配套了一套不依赖人工标注的量化偏好评估框架。 在 Advanc…
WildCity:把 AI 空间认知拉到城市规模的真实世界测试平台
WildCity 是一个由自动驾驶车队在城市复杂环境采集的真实世界多模态数据集(18 条轨迹,平均 83.7 km/条),配套城市级重建 baseline 和闭环仿真器,系统分析「扩展性 / 外推性 / 不确定性」三大挑战,目标是推动 AI 在空间感知记忆推理上达到与人类认知相当的规模,已被 ECCV 2026 接收。…
转写策略即潜变量:通过词级时序激活可控逐字 ASR
现代 ASR 系统将转写风格(verbatim / intended)视为不可控的潜变量,导致解码不稳定和评估混淆(高达 60% 的 WER 损失实为风格不匹配);本文证明模型已同时编码两种风格,只需通过 coverageaware 解码器任务标记显式激活,在英语仅训练条件下将德语不流畅 F1 从 10% 提升至 79…
用 LLM + Transformer 混合流水线缓解英→罗机器翻译中的性别偏见
针对英语 → 罗马尼亚语机器翻译中默认男性化的问题,本文提出"LLM 识别性别 + 标签注入 + Transformer 阅读标签"的混合流水线,并在 WinoMT / WinoGender 上把性别准确率相对基线提升 40+ 个百分点,是首个同时利用 LLM 推理与标签感知翻译来显式处理英罗性别偏见的方案。 罗马尼亚…
RibAssist 3D:双平面 CT 投影的肋骨骨折检测 + 选择性 3D 定位
通过把两路正交 CT 投影(前后位 / 侧位)上的独立骨折检测结果配对并三角化,RibAssist 3D 在控制 false positive 率的前提下实现精确 3D 定位(封闭测试集上 median 1.49 mm,93% 肋骨级精确),但大幅 confidencegated 弃权导致最终承诺率仅 2.50%——揭…
AgentLens:面向编码 Agent 评估的生产级轨迹评审
AgentLens 是一个面向交互式代码 Agent 的生产级评估基准,把「形式化验证」与「LLM 编写的轨迹评审 + 并排比较」配成一对,让每次跑分都同时给出一个分数和一份带证据的可读解释,从而既能排名模型,也能诊断行为、对比版本、抓回归。 当前绝大多数代码 Agent 基准(HumanEval、MBPP、SWEbe…
超越攻击成功率:面向工具使用 AI Agent 的动作分级严重性量表
这篇论文把「Agent 红队评测」的二元 ASR(attacksuccess rate,攻击成功率)一刀切升级为 L0–L6 七级有序严重性量表,由可逆性、跨域性、权限扩张性三个效果轴定义,并配套一个程序化 oracle 和一个三模型 frontier judge 面板,量化证明二元指标会同时漏掉严重的高风险事件和误报…
面向 Agentic 强化学习的单 Rollout 异步优化
SAO 通过将 GRPO 的组采样替换为单轨迹采样并引入双侧 Token 级裁剪,解决了异步 RL 训练 LLM 中的稳定性与 offpolicy 难题,在 SWEBench Verified 等 Agentic 任务上稳定超越 GRPO,已成功部署于 GLM5.2(750BA40B)的训练流程。 传统的 LLM 后训…