解读
1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
MMAgent-R²:面向 Agentic 多模态 RAG 的「重排序 + 拒答」联合学习
针对 KBVQA 中「视觉相似但事实错误」的检索干扰物,MMAgentR² 把多模态 RAG 的检索器从「全局特征匹配」升级为「视觉重排序 + 主动拒答 + GRPO 联合训练」,在 InfoSeek、EVQA、MMhops 三个多跳/多图基准上达到 SOTA,已被 ECCV 2026 接收。 KBVQA(Knowle…
DynaKRAG:把多跳 RAG 改造成「状态条件控制」的统一框架
DynaKRAG 把多跳 RAG 的多步证据获取抽象成「状态条件 + 原子操作 + 可学习控制器」的决策过程,在 HotpotQA/2Wiki/MuSiQue 三个多跳 QA 基准上用 Qwen2.57BInstruct 取得 SOTAF1(0.5998 / 0.5340 / 0.3061),证明显式建模「证据状态 →…
优化器状态该放在哪?面向内存高效 MoE 训练的分层状态分配
SkewAdam 通过识别 MoE 模型中稠密主干 / Expert / 路由器三类参数群体的梯度统计差异,为每类分配不同的优化器状态形式,将峰值训练内存从 81.4 GB 压缩至 31.3 GB(减少 61%),同时在相同 token 预算下取得更低的验证困惑度。 MoE(MixtureofExperts)训练长期以…
基于 RAG 记忆与多模态教练智能体的端到端 LLM 飞行规划(FRAMe)
FRAMe 把一个 LLM Planner、一个会看图的 Multimodal Coach Agent 和一个 RAG 记忆模块拼在一起,让 eVTOL(电动垂直起降)飞行规划从「拍脑袋选候选路线」升级成「自然语言指令 → 端到端生成符合偏好的安全航线」,并配套了一套不依赖人工标注的量化偏好评估框架。 在 Advanc…
WildCity:把 AI 空间认知拉到城市规模的真实世界测试平台
WildCity 是一个由自动驾驶车队在城市复杂环境采集的真实世界多模态数据集(18 条轨迹,平均 83.7 km/条),配套城市级重建 baseline 和闭环仿真器,系统分析「扩展性 / 外推性 / 不确定性」三大挑战,目标是推动 AI 在空间感知记忆推理上达到与人类认知相当的规模,已被 ECCV 2026 接收。…
转写策略即潜变量:通过词级时序激活可控逐字 ASR
现代 ASR 系统将转写风格(verbatim / intended)视为不可控的潜变量,导致解码不稳定和评估混淆(高达 60% 的 WER 损失实为风格不匹配);本文证明模型已同时编码两种风格,只需通过 coverageaware 解码器任务标记显式激活,在英语仅训练条件下将德语不流畅 F1 从 10% 提升至 79…
用 LLM + Transformer 混合流水线缓解英→罗机器翻译中的性别偏见
针对英语 → 罗马尼亚语机器翻译中默认男性化的问题,本文提出"LLM 识别性别 + 标签注入 + Transformer 阅读标签"的混合流水线,并在 WinoMT / WinoGender 上把性别准确率相对基线提升 40+ 个百分点,是首个同时利用 LLM 推理与标签感知翻译来显式处理英罗性别偏见的方案。 罗马尼亚…
RibAssist 3D:双平面 CT 投影的肋骨骨折检测 + 选择性 3D 定位
通过把两路正交 CT 投影(前后位 / 侧位)上的独立骨折检测结果配对并三角化,RibAssist 3D 在控制 false positive 率的前提下实现精确 3D 定位(封闭测试集上 median 1.49 mm,93% 肋骨级精确),但大幅 confidencegated 弃权导致最终承诺率仅 2.50%——揭…
AgentLens:面向编码 Agent 评估的生产级轨迹评审
AgentLens 是一个面向交互式代码 Agent 的生产级评估基准,把「形式化验证」与「LLM 编写的轨迹评审 + 并排比较」配成一对,让每次跑分都同时给出一个分数和一份带证据的可读解释,从而既能排名模型,也能诊断行为、对比版本、抓回归。 当前绝大多数代码 Agent 基准(HumanEval、MBPP、SWEbe…
超越攻击成功率:面向工具使用 AI Agent 的动作分级严重性量表
这篇论文把「Agent 红队评测」的二元 ASR(attacksuccess rate,攻击成功率)一刀切升级为 L0–L6 七级有序严重性量表,由可逆性、跨域性、权限扩张性三个效果轴定义,并配套一个程序化 oracle 和一个三模型 frontier judge 面板,量化证明二元指标会同时漏掉严重的高风险事件和误报…
面向 Agentic 强化学习的单 Rollout 异步优化
SAO 通过将 GRPO 的组采样替换为单轨迹采样并引入双侧 Token 级裁剪,解决了异步 RL 训练 LLM 中的稳定性与 offpolicy 难题,在 SWEBench Verified 等 Agentic 任务上稳定超越 GRPO,已成功部署于 GLM5.2(750BA40B)的训练流程。 传统的 LLM 后训…
Large Behavior Model:零售客户可提示数字孪生
LBM 通过将零售客户的交易历史建模为持续性行为画像(Person)与动态产品上下文(Environment)的统一框架,并结合 RAG + 持续预训练 + SFT + RL 全链路训练,使语言模型能够学习并模拟真实消费者的购买决策,在零样本跨零售商迁移场景中持续超越通用大模型。 零售业 customer behavi…
TESSERA v2:像素级地球基础模型的可控规模扩展
TESSERA v2 完成了迄今最大规模的地球观测(EO)基础模型控制扩展研究(395 次训练,1,024 块 GH200 超算),核心发现是预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),而编码器与数据应协同扩展、投影器保持固定的规则才是计算最优策略;基于此规则训练的 21M 参数蒸馏模型 TE…
ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
ReflectWorldMM 把"持续看世界并基于累积经验推理"的多模态 Agent,拆成「感知前端 + 分层长期记忆 + 即插即用接口」三件套,以「实体」(entity) 而非「帧」为记忆单位组织记忆,从而在六个长视频/终身记忆基准上全部取得最佳准确率,优于强记忆 Agent 和前沿基座模型。 多模态 Agent 看…
RoboTALES:用任务对齐的模拟未来,学习推理引导的机器人策略
RoboTALES 是一个单阶段(singlestage)框架,把「用预训练视频生成模型当世界模型」和「用推理信号去约束它的想象」这两件事在同一轮训练里同时做完:通过 LLM 分层规划器把复杂任务拆成子目标来引导视频模型的「想象」方向,再用一个 VLM 评判器给这些想象的未来打 reward、回过头约束生成器的内部表征…
具身智能体架构设计的自动化:当架构搜索走出文本,走进模拟器
把 Agent Architecture Search(AAS)从纯文本 Agent 领域迁移到具身 Agent:在自家研发的 AgentCanvas 类型化图运行时之上,由 KDLoop(提议—批评—实验—蒸馏 + 停滞触发的反思)这一代码 Agent 搜索过程,遍历四种具身执行器 × 三种 AAS 变体共 3×4 …
当规则学会学习:面向法律案例检索的自进化 Agent
LLM 作为 Agent,无需参数训练,通过「自进化」循环自动构建、验证和淘汰查询改写规则,显著提升 BM25 在中文法律案例检索上的效果,揭示了 LLM 的「实验结果利用能力」和「规则消除内在知识」是自进化的两大核心驱动力。 法律案例检索长期面临两个挑战:一是法律语言高度复杂,专业术语多、长尾表述多,查询与案例之间的…
MedEasy:为临床问诊训练设计 AI 标准化病人
MedEasy 是一个面向临床问诊训练的多 Agent 系统,通过「患者对话→临床操作→决策提交→文档记录→反馈」的五阶段工作流,让医学生在虚拟环境中完成逼真的病例练习,其设计研究揭示了 AI 辅助职业训练系统的核心原则:用案例特定标准连接情境化实践。 临床问诊是医学教育的核心技能,但传统训练方式面临三重困境: 1. …
可信自组合 Big-Data-as-a-Service:LLM 编排多 Agent 的全生命周期自动化
Trustworthy SelfComposable BDaaS 框架将传统 AutoML 的能力边界扩展至完整的数据工程→模型训练→部署→漂移监控全生命周期,通过 LLM 编排的专门化 MultiAgent 协作,在保持竞争力的预测性能同时,实现了工作流可完成性、制品可追溯性、部署就绪度、可复现性和漂移恢复能力的系统…
医疗 Agentic AI 的两道安全闸:抑制过早诊断交接与静默幻觉
针对 LLM 医疗 Agent 的两类高危失效(过早诊断交接 / 静默临床幻觉),论文提出多 Agent 框架,把 "LLMasajudge" 路由换成确定性编排约束:NeuroSymbolic 状态闸强制 OLDCARTS 临床问诊协议的全部维度(Onset/Location/Duration/Character/A…
Paxos vs Raft:我们对分布式共识达成共识了吗?
Paxos 与 Raft 在核心机制上几乎等价,唯一的真实差异在于 leader election 阶段是否允许 leader 在选举过程中补齐日志;Raft 的"易懂"更多来自论文表述的清晰度,而非算法本身不可化约的简洁性。 分布式共识是构建容错、强一致分布式系统的基础原语,自 Lamport 提出 Paxos 以来…
Matterport3D: Learning from RGB-D Data in Indoor Environments
Matterport3D 是首个大规模建筑级别 RGBD 室内数据集,包含 90 个真实场景的 10,800 个全景视图和 194,400 张深度图,提供了精确全局对齐、语义分割标注和多种 2D/3D 任务基准,直接催生了室内场景理解这一计算机视觉重要子领域。 2017 年前,室内 RGBD 数据集的普遍局限: | 数…
用深度强化学习做交通信号控制:DTSE 与 SUMO 上的里程碑式工作
这篇 2016 年的工作把深度 Q 网络(DQN)+ 经验回放搬进交通信号控制场景,提出一种新的离散交通状态编码(Discrete Traffic State Encoding, DTSE)作为卷积网络的输入,并在 SUMO 仿真器上把平均累计延误降低 82%、平均队列长度降低 66%、平均行程时间降低 20%。它是把…
RAG 系统安全与隐私:构建可信知识增强系统的全面综述
RAG 将外部知识检索与 LLM 生成结合,已成为企业知识管理、医疗、金融、法律等隐私敏感领域的核心架构。然而,RAG 的引入同时也扩展了攻击面:检索索引、查询日志、上下文构建过程、联邦更新等多个环节都可能泄露敏感信息;对抗性知识库污染则可直接操纵生成结果。 RAG 将外部知识检索与 LLM 生成结合,已成为企业知识管…
Post-training 被遗忘的免费午餐:Progress Advantage 让 LLM Agent 无需专门奖励模型即可实现过程级评估
RL 后训练本身就是过程级奖励信号的现成来源——通过推导 RL 策略与参考策略的对数概率比(Progress Advantage),无需人工标注、无需专门奖励模型训练,就能在 Agent 场景中实现 SOTA 级别的 steplevel 评分。 Process Reward Model(PRM) 能对 LLM Agen…
超越函数调用:ToolBench-X 揭示工具不可靠环境下 Agent 的严重可靠性鸿沟
现有工具使用基准都假设工具稳定可信,但真实环境中工具随时可能故障、降级或返回错误数据;ToolBenchX 通过5类结构化可靠性 hazard 测试证明:能在可靠环境下工作的 Agent,遇到可恢复的可靠性危害时大量失败——诊断能力和恢复策略比调用量更重要。 工具调用(Tooluse)是 LLM Agent 完成真实世…
解开 GraphRAG 的「结」:VectorRAG 几乎够用 — 评 UnWeaver 框架
这篇论文主张:GraphRAG 那种繁重的图索引在多数实际问答场景里并不划算——用 LLM 把文档里的实体先解耦、再据此回收原文块,单凭 entity 这一中间表示就能把 VectorRAG 的端到端 QA 精度顶到接近 SOTA 图方法,但索引成本大幅压低。 RAG 系统有两个老毛病: 1. 块级检索把信息「混编」进…
LoopCoder-v2:仅循环一次以实现高效测试时计算扩展
LoopCoderv2 通过 GainCost 分析框架证明:Parallel Loop Transformer(PLT)在两次循环时达到最优平衡——第二轮循环带来表示精炼,但超过两轮后 CLP 位置错配成本将超过收益,导致性能回落。 Looped Transformer 通过反复堆叠同一组 Shared Blocks…
集成商优势:面向中小型企业的受控 Agentic AI
本文认为 Agentic AI 的近期价值不在于「替代人类」或「完全自主」,而在于为中小企业(SMC)的简单与中等复杂度业务流程提供「受控的部分自主」能力——以人为中心,责任与问责由人承担,AI 作为生产力杠杆。 Agentic AI 正在引发企业自动化的新一轮范式转变。与传统 RPA( Robotic Process…
Ricci-Filtration:通过离散 Ricci Flow 将 RAG 重排序器提升至 Query-Answer 任务
RicciFiltration 将 RAG 检索出的 Chunk 集合建模为加权图,利用归一化离散 Ricci Flow 的几何性质——正曲率区域收缩、负曲率区域扩张——在图上识别并过滤「噪声 Chunk」(相对于 Query 节点具有大权重与负 Ricci 曲率),再将过滤后的 Chunk 送入 Reranker,显…