解读
1096 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
PerceptionRubrics:将多模态评估校准至人类感知
PerceptionRubrics 是一个面向多模态生成的"评分量表式"评测框架,用 1038 张信息密集图像与 1 万余条实例级 rubric,把"语义整体相似度"换成"原子级事实审计",并通过 Gated Scoring 让"漏掉关键视觉事实"直接判失败,从而暴露出当前 SOTA 模型在密集合上"看着都对但连起来就…
Erase-then-Delta Attention:解耦 Delta 规则线性注意力中的擦除地址与写入地址
本文提出 ErasethenDelta Attention (EDA):在 Deltarule 线性注意力的更新规则里,把"在哪里擦除陈旧记忆"与"在哪里写入新内容"解耦——先沿一个学习到的擦除方向做定点擦除,再沿当前写地址做 Deltastyle 修正写入。在 2.5B 稠密模型和 25BA2.8B MoE 模型家族…
LOCOS:用 Logit 贡献度评分定位「非字面意义检索」注意力头
LOCOS(LogitContribution Scoring)提出一种 writeaware 的注意力头检测器:不看 head「读了什么 token」,而是直接把 head 的 OV 电路输出投影到「最终答案 token 的 unembedding 方向」,据此打分;通过 meanablating 得到的 topk …
SPIRE:将幻灯片个性化建模为「逆向规划 + 结构去噪」的 Agentic 框架
SPIRE 把「页级幻灯片个性化 (PSP)」形式化为一个 inverse planning 问题,并提出一种故意破坏再让 agent 去噪的训练策略:在不依赖特定 PowerPoint/Beamer 工具的前提下,让两个 agent 通过强化学习协作去噪结构化破损,从而「绕过对工具内部 API 的依赖」间接学到设计意…
轻量级 IIoT 入侵检测模型在跨域场景下的泛化失效
针对工业物联网(IIoT)训练的轻量级入侵检测模型,在「同域内训同域内测」时表现尚可,但放到结构不同的 IIoT 网络上(不重训)就会严重失效;失效原因并不是模型容量不足,而是它们普遍把粗粒度「端口类别」当成捷径特征,而不同 IIoT 数据集的端口分布差异巨大。 「在边缘设备上做入侵检测」是 IIoT 安全的标准配置。…
Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback:从 HH-RLHF 到"周更"在线对齐
Anthropic 团队用偏好建模 + RLHF 把一个语言模型微调成既"有用"又"无害"的助手,并把整套流程跑成了"周更"的迭代式在线训练范式,识别出 KL 散度与 RL 奖励之间的近似线性关系——这篇论文是 HHRLHF 的方法论奠基,也是 InstructGPT 之后 RLHF 工业化的代表案例。 把一个大语言模…
Large Language Models Are Human-Level Prompt Engineers(APE):把"提示工程"做成"程序合成"
APE(Automatic Prompt Engineer)把"自动提示工程"形式化成程序合成问题——让大模型自己生成一批候选指令,再用目标评分函数挑选最优——在 24 个 NLP 任务上,机器生成的指令在 19 个任务上达到甚至超过人类写作者的提示水平。 "提示工程"从 GPT3 时代起就是依赖人力的手艺活:同一个模…
Atlas:Few-shot Learning with Retrieval Augmented Language Models
Atlas 是 Meta AI(原 Facebook AI)推出的检索增强型预训练语言模型,用精心设计的 retriever + encoder + decoder 三件套,把"知识密集型任务"做到仅靠 64 条标注样本即可在 Natural Questions 上超过 540B 参数的纯参数化模型——以 50× 更少…
当多机器人系统遇上 Agentic AI:迈向具身集体智能
本文提出具身集体智能(Embodied Collective Intelligence, ECI)这一多机器人新范式,主张机器人团队不再只共享地图、任务与数据集,而是共享"具身 agent 闭环产生的状态"——世界上下文、任务进度、技能经验——并以 CoPerception / CoAction / CoEvoluti…
RedVox:语音模型跨语言的安全性与公平性差距
RedVox 是首个基于真实人声构建的多语言(英、法、意、西、德五语)语音 / 音频模型安全性与公平性基准,作者对 8 个 SOTA 模型做评测后发现:即便在非对抗条件下,漏洞依然存在;非英语明显更严重;语音输入比文本输入更放大风险——并系统记录了用真人参与者采集语音数据所特有的隐私与社会技术挑战。 语音模型(spee…
针对 LLM Agent 提示注入的"带外防御"自适应评估
本文把工具型 LLM Agent 的「带外防御」(outofband defenses,例如 CaMeL、FIDES、Progent、RTBAS、FORGE)用经典信息安全三件套(Biba 完整性 / 引用监控 / 最小权限)重新组织,并警告「静态基准 → 自适应攻击」这条已知陷阱:作者独立复现并扩展了 Progent…
MIRROR:面向智能体 RAG 的新颖性约束记忆引导 MCTS 红队对抗
本文提出 MIRROR——一个跨攻击面的红队框架,把"记忆引导的蒙特卡洛树搜索(MCTS)"与"显式新颖性约束下的检索条件生成"组合起来,专门攻击多模态 Agentic RAG 系统。它附带发布 ARTSafeBench(41,815 条 inpackage 记录 + 跨 4 个攻击面共 41,991+ 条记录)。在四…
PhysRAG:通过检索增强生成提升视频生成中的物理感知
PhysRAG 通过检索增强生成(RAG)将物理知识注入视频 diffusion 模型,在 PhyGenBench 和 VBench 上同时刷新视觉质量与物理规则合规性,被 ECCV 2026 接收。 视频生成模型(如 Sora、Gen3)的一个核心缺陷是忽视物理规律:物体违反重力飘浮、碰撞不合逻辑、光照不符合物理模型…
线性模型在时间序列预测中能做到多好?——SearchCast 与"预处理 > 容量"的复辟
本文用 Ridge 回归作为"白板",在 8 个标准时序基准上系统搜索了回看长度、局部归一化、正则化、数据增强四个预处理维度,得出三条反直觉结论——最优回看长度是序列相关的、最佳归一化窗口是上下文尾部的一个分数、最优的跨序列共享程度因数据集而异——并据此把线性模型推到 6/8 基准上超过 Transformer / M…
MemStrata:用时序账本消灭 RAG 的"过时事实错误"
MemStrata 把"事实随时间被新版本取代"这一结构性失效从 RAG 系统中拆出来:用一组基于 (subject, relation, object) 三元组的确定性 supersession 规则维护一个双时态账本,在被要求回答时不再返回已被取代的旧值——6 个基准上静态知识与 RAG 持平,演化知识准确率从 0…
LCAi:融合大数据与检索增强生成辅助解释的生命周期评估
LCAi 提出一个视角条件化 RAG 框架(perspectiveconditioned RAG),把生命周期评估(LCA, Life Cycle Assessment)的"结果解释"环节从"人写一句话"变成"四视角证据检索 + 中性合成",目标是让 AI 生成的解读有出处、有结构、有边界,从而支撑真正面向落地实施的战…
Learning to Fold: LeHome Challenge 2026 获奖方案(线上第一、线下第二)
一个融合 AWR + RECAP 的 RL 增强型 VLA 系统,让双机械臂自主学会叠衣服,在 ICRA 2026 的 LeHome Challenge 中从 62 支队伍里脱颖而出,仿真轮第一名、实机轮第二名。 LeHome Challenge 2026 是 ICRA 2026 旗下的机器人竞赛,聚焦可变形物体(衣物…
AgentDebugX:面向 LLM Agent 的失败可观测性、根因定位与修复开源工具链
AgentDebugX 把 LLM Agent 调试组织成「检测(Detect)→ 归因(Attribute)→ 修复(Recover)→ 重跑(Rerun)」闭环,核心模块 DeepDebug 用全局轨迹理解 + 结构化指引 + 交叉盘问做多轮根因诊断;在 Who&When 基准上对开源 backbone 取得最严格…
RF-Agent:把 LLM 带进射频集成电路设计的「教科书蒸馏 + 多智能体」实战框架
射频集成电路(RFIC)设计领域缺乏公开的大规模领域数据与标准化基准,阻碍了 LLM 在该方向的落地。RFAgent 给出了一套「教科书蒸馏 → 多智能体生成 → 评测」的端到端方案:用 QTSA(QuestionThinkingSolutionAnswer)四阶段多智能体 pipeline 把 7 本权威 RF 教材…
AILQA:把 RAG 与多模型嵌入/生成组合做成印度法律问答的可评测体系
AILQA(Artificial Intelligence for Indian Legal Question Answering) 把「印度法律」这一高度专业化、文本庞杂且多语言的领域,作为 LLMRAG 系统的严肃试验场:用一整套 embedding 模型与生成式 LLM 的组合搭建 RAG 流水线,在词汇/语义度…
HACO:对冲式 Agent Computing——面向长流程 LLM 系统的运行时可靠性调度
HACO(Hedged Agent Computing)把「roletoinstance 绑定」当成一个带可靠性约束的候选选择问题——每次 role 请求到来时,它先按乐观排序挑出最优候选,再用保守的可靠性累加规则挑出 hedge 集,直至集合的成功概率满足目标阈值才下发执行;执行完的所有 candidate trac…
终身心智:Transformer 需要参数化注意力才能实现终身上下文学习
论文论证了一个核心命题:在固定硬件预算下,用 Transformer 实现真正的终身学习(lifelong learning),必须用参数化注意力(parametric attention)替代标准 softmax attention——后者因 keyvalue cache 随序列长度二次增长而不可扩展;前者通过在线可…
基于 FLISP 的大规模隧道空地协同:Fast LiDAR-IMU Synchronized Path Planner
FLISP 用一套 UGV 搭载的 LiDARIMU 同步驱动 UGV 与 UAV 路径,在 1.2 km 真实水工隧道里实现 100% 成功率、7 ms 规划延迟,比栅格基线快 7 倍,比采样基线快三个数量级,首次在特征退化的线性基础设施里把"无地图规划"做成可落地的工程方案。 水电站引水隧洞、排沙洞、压力管道一类长…
Running the Gauntlet:重新评估 Agent 在熟悉环境之外的能力
针对当前 Web Agent 评测被简单、热门、单一能力的基准"刷分式饱和"的问题,提出 GauntletBench——一套聚焦"时间感知 / 图形理解 / 3D 推理"三类被忽视能力的 Web 基准,覆盖 5 个冷门但实用的专业场景,共 100 个视觉密集型任务;结果显示 SOTA Agent 仅 19.1% 成功率…
CanvasAgent:通过视觉工具编排实现复杂图像创建与编辑
针对复杂图像创建与编辑需要多步多工具协作,而现有多模态 tooluse 数据集与 Agent 多以感知/检索为中心、缺乏大规模"可执行图像创作轨迹"监督的痛点,提出 CanvasCraft 大规模数据集(140K 全标注可执行轨迹 + 10K RL 任务规范),并在 SFT+GRPO(混合 outcome+proces…
基于 RAG 增强 LLM 的空域图像隐写术代码级代价函数生成
针对空域图像隐写中"代价函数手工调参繁琐、深度学习方案又缺乏可解释性"的老问题,提出一个以 SelfEvolving RAG (SERAG) 为核心的进化式代码生成系统:先用 Code Semantic Signature (CSS) 把过程式代码转成对齐查询,从静态文献知识库与动态经验知识库中检索显式领域知识来约束 …
PluraMath:将数学推理评估拓展至低资源语言
PluraMath 通过将 PolyMath 扩展至 18 种低资源语言,证实了数学推理能力在高低资源语言之间的系统性差距,且该差距与模型指令遵循能力高度相关。 当前主流数学推理 Benchmark(如 GSM8K、MATH)几乎全部被英语和中文垄断——这些语言在 LLM 预训练语料中占绝对主导地位。这意味着:即便同一…
HETERQA:跨异构来源记录检索的基准测试与现状分析
HETERQA 构建了一个包含 857 个 QA 对、覆盖 5 种异构数据源(关系表、文本文档、图像库、空间数据库,知识图谱)的综合基准,证实当前主流检索方法在该场景下仍有巨大提升空间——Hybrid Retrieval 最高 Recall@10,SelfRAG 最高 MRR@10,但均远未饱和基准。 真实世界的信息系…
MV-Forcing:通过 4D 几何约束实现任意长度多视角视频生成
MVForcing 在单一扩散模型中融合时间与视角双重自回归,通过 3D 重建模型构建相邻视角间的 4D 几何桥梁,并用时空自强迫(SelfForcing)弥合训练推理的曝光偏差,实现任意长度、任意视角数的动态场景多视角视频生成。 视频生成领域有两个独立进展良好的方向: 但两者的交集——长+多视角——是未解问题。具体痛…
CONFLUX:面向胸部 CT 的可控 3D 潜在扩散模型 + GRPO 后训练
CONFLUX 把 3D 变分自编码器 + 整流流 Transformer(rectifiedflow transformer)拼成一套原生 3D 的胸部 CT 潜在扩散生成器,再以组相对策略优化(GRPO)作为后训练阶段,用一个独立分类器对"请求病征的恢复可靠性"打分当作奖励,把整体 FID 压到 32.3(vs. …