解读
1532 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
稀疏截断态向量模拟器:面向 Peaked Circuits 的高效量子电路经典模拟
本文针对"peaked circuits"这一类特殊量子电路,提出了用稀疏表示存储仅非零振幅的截断态向量(truncated state vector)实现高效经典模拟,放弃了传统量子模拟器使用的密集表示,并用向量化操作和硬件加速最大化计算效率,在开源实现中验证了该方法的实用可行性。 经典计算机模拟量子电路面临指数级内…
MMAgent-R²:面向 Agentic 多模态 RAG 的「重排序 + 拒答」联合学习
针对 KBVQA 中「视觉相似但事实错误」的检索干扰物,MMAgentR² 把多模态 RAG 的检索器从「全局特征匹配」升级为「视觉重排序 + 主动拒答 + GRPO 联合训练」,在 InfoSeek、EVQA、MMhops 三个多跳/多图基准上达到 SOTA,已被 ECCV 2026 接收。 KBVQA(Knowle…
DynaKRAG:把多跳 RAG 改造成「状态条件控制」的统一框架
DynaKRAG 把多跳 RAG 的多步证据获取抽象成「状态条件 + 原子操作 + 可学习控制器」的决策过程,在 HotpotQA/2Wiki/MuSiQue 三个多跳 QA 基准上用 Qwen2.57BInstruct 取得 SOTAF1(0.5998 / 0.5340 / 0.3061),证明显式建模「证据状态 →…
优化器状态该放在哪?面向内存高效 MoE 训练的分层状态分配
SkewAdam 通过识别 MoE 模型中稠密主干 / Expert / 路由器三类参数群体的梯度统计差异,为每类分配不同的优化器状态形式,将峰值训练内存从 81.4 GB 压缩至 31.3 GB(减少 61%),同时在相同 token 预算下取得更低的验证困惑度。 MoE(MixtureofExperts)训练长期以…
基于 RAG 记忆与多模态教练智能体的端到端 LLM 飞行规划(FRAMe)
FRAMe 把一个 LLM Planner、一个会看图的 Multimodal Coach Agent 和一个 RAG 记忆模块拼在一起,让 eVTOL(电动垂直起降)飞行规划从「拍脑袋选候选路线」升级成「自然语言指令 → 端到端生成符合偏好的安全航线」,并配套了一套不依赖人工标注的量化偏好评估框架。 在 Advanc…
WildCity:把 AI 空间认知拉到城市规模的真实世界测试平台
WildCity 是一个由自动驾驶车队在城市复杂环境采集的真实世界多模态数据集(18 条轨迹,平均 83.7 km/条),配套城市级重建 baseline 和闭环仿真器,系统分析「扩展性 / 外推性 / 不确定性」三大挑战,目标是推动 AI 在空间感知记忆推理上达到与人类认知相当的规模,已被 ECCV 2026 接收。…
主题综述 · evaluation(2026-08-12)
date +%j=224, mod 8 = 0 → agent; surveys 目录 72h 内已存 7 个非 agent 主题,本期主题按未覆盖顺序顺延至 evaluation 落点(最近一次 evaluation 综述为 20260804,距今 ~187h,超 72h,满足未覆盖条件)。本期窗口:20260804…
转写策略即潜变量:通过词级时序激活可控逐字 ASR
现代 ASR 系统将转写风格(verbatim / intended)视为不可控的潜变量,导致解码不稳定和评估混淆(高达 60% 的 WER 损失实为风格不匹配);本文证明模型已同时编码两种风格,只需通过 coverageaware 解码器任务标记显式激活,在英语仅训练条件下将德语不流畅 F1 从 10% 提升至 79…
用 LLM + Transformer 混合流水线缓解英→罗机器翻译中的性别偏见
针对英语 → 罗马尼亚语机器翻译中默认男性化的问题,本文提出"LLM 识别性别 + 标签注入 + Transformer 阅读标签"的混合流水线,并在 WinoMT / WinoGender 上把性别准确率相对基线提升 40+ 个百分点,是首个同时利用 LLM 推理与标签感知翻译来显式处理英罗性别偏见的方案。 罗马尼亚…
RibAssist 3D:双平面 CT 投影的肋骨骨折检测 + 选择性 3D 定位
通过把两路正交 CT 投影(前后位 / 侧位)上的独立骨折检测结果配对并三角化,RibAssist 3D 在控制 false positive 率的前提下实现精确 3D 定位(封闭测试集上 median 1.49 mm,93% 肋骨级精确),但大幅 confidencegated 弃权导致最终承诺率仅 2.50%——揭…
让 AI "听懂人话"这件事的转折点——Whisper 凭什么成了语音识别的默认基线?
你有没有想过:为什么 2022 年之前的语音识别(ASR)总是"换场景就崩"? 在安静的办公室里转写挺好,一到地铁、商场、电话会议,立刻变成听不懂的乱码——专有名词乱猜、英文夹中文乱飞、专业术语全错。 不是 AI 不努力。是整个 ASR 领域长期处于两个极端: 1. 有监督路线:高质量标注数据集规模有限(LibriSp…
让 GAN 训练不再"三天两头崩"——一篇被引 1.1 万次的论文,靠"梯度惩罚"救活了整个领域
你有没有想过:为什么 2017 年之前的 GAN 训练,总是玄学? loss 一会儿上天一会儿下地,生成器画出来的脸忽男忽女,训到一半突然「模式崩塌」——所有猫都长成一个样。 不是研究者手笨。是整个领域缺一条"稳定训练"的工程底线。直到 2017 年 4 月挂上 arXiv 的 1704.00028(WGANGP) 出…
主题综述 · evaluation(2026-08-16)
date +%j=228, mod 8 = 4 → evaluation; surveys 目录近 72h 内 evaluation 主题未覆盖(最近一次 evaluation 综述 20260812, 距今 ~96h 超 72h),本期主题: evaluation。窗口 20260809 → 0816。 材料: (1…
AgentLens:面向编码 Agent 评估的生产级轨迹评审
AgentLens 是一个面向交互式代码 Agent 的生产级评估基准,把「形式化验证」与「LLM 编写的轨迹评审 + 并排比较」配成一对,让每次跑分都同时给出一个分数和一份带证据的可读解释,从而既能排名模型,也能诊断行为、对比版本、抓回归。 当前绝大多数代码 Agent 基准(HumanEval、MBPP、SWEbe…
超越攻击成功率:面向工具使用 AI Agent 的动作分级严重性量表
这篇论文把「Agent 红队评测」的二元 ASR(attacksuccess rate,攻击成功率)一刀切升级为 L0–L6 七级有序严重性量表,由可逆性、跨域性、权限扩张性三个效果轴定义,并配套一个程序化 oracle 和一个三模型 frontier judge 面板,量化证明二元指标会同时漏掉严重的高风险事件和误报…
面向 Agentic 强化学习的单 Rollout 异步优化
SAO 通过将 GRPO 的组采样替换为单轨迹采样并引入双侧 Token 级裁剪,解决了异步 RL 训练 LLM 中的稳定性与 offpolicy 难题,在 SWEBench Verified 等 Agentic 任务上稳定超越 GRPO,已成功部署于 GLM5.2(750BA40B)的训练流程。 传统的 LLM 后训…
Large Behavior Model:零售客户可提示数字孪生
LBM 通过将零售客户的交易历史建模为持续性行为画像(Person)与动态产品上下文(Environment)的统一框架,并结合 RAG + 持续预训练 + SFT + RL 全链路训练,使语言模型能够学习并模拟真实消费者的购买决策,在零样本跨零售商迁移场景中持续超越通用大模型。 零售业 customer behavi…
TESSERA v2:像素级地球基础模型的可控规模扩展
TESSERA v2 完成了迄今最大规模的地球观测(EO)基础模型控制扩展研究(395 次训练,1,024 块 GH200 超算),核心发现是预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),而编码器与数据应协同扩展、投影器保持固定的规则才是计算最优策略;基于此规则训练的 21M 参数蒸馏模型 TE…
ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
ReflectWorldMM 把"持续看世界并基于累积经验推理"的多模态 Agent,拆成「感知前端 + 分层长期记忆 + 即插即用接口」三件套,以「实体」(entity) 而非「帧」为记忆单位组织记忆,从而在六个长视频/终身记忆基准上全部取得最佳准确率,优于强记忆 Agent 和前沿基座模型。 多模态 Agent 看…
RoboTALES:用任务对齐的模拟未来,学习推理引导的机器人策略
RoboTALES 是一个单阶段(singlestage)框架,把「用预训练视频生成模型当世界模型」和「用推理信号去约束它的想象」这两件事在同一轮训练里同时做完:通过 LLM 分层规划器把复杂任务拆成子目标来引导视频模型的「想象」方向,再用一个 VLM 评判器给这些想象的未来打 reward、回过头约束生成器的内部表征…
具身智能体架构设计的自动化:当架构搜索走出文本,走进模拟器
把 Agent Architecture Search(AAS)从纯文本 Agent 领域迁移到具身 Agent:在自家研发的 AgentCanvas 类型化图运行时之上,由 KDLoop(提议—批评—实验—蒸馏 + 停滞触发的反思)这一代码 Agent 搜索过程,遍历四种具身执行器 × 三种 AAS 变体共 3×4 …
当规则学会学习:面向法律案例检索的自进化 Agent
LLM 作为 Agent,无需参数训练,通过「自进化」循环自动构建、验证和淘汰查询改写规则,显著提升 BM25 在中文法律案例检索上的效果,揭示了 LLM 的「实验结果利用能力」和「规则消除内在知识」是自进化的两大核心驱动力。 法律案例检索长期面临两个挑战:一是法律语言高度复杂,专业术语多、长尾表述多,查询与案例之间的…
MedEasy:为临床问诊训练设计 AI 标准化病人
MedEasy 是一个面向临床问诊训练的多 Agent 系统,通过「患者对话→临床操作→决策提交→文档记录→反馈」的五阶段工作流,让医学生在虚拟环境中完成逼真的病例练习,其设计研究揭示了 AI 辅助职业训练系统的核心原则:用案例特定标准连接情境化实践。 临床问诊是医学教育的核心技能,但传统训练方式面临三重困境: 1. …
可信自组合 Big-Data-as-a-Service:LLM 编排多 Agent 的全生命周期自动化
Trustworthy SelfComposable BDaaS 框架将传统 AutoML 的能力边界扩展至完整的数据工程→模型训练→部署→漂移监控全生命周期,通过 LLM 编排的专门化 MultiAgent 协作,在保持竞争力的预测性能同时,实现了工作流可完成性、制品可追溯性、部署就绪度、可复现性和漂移恢复能力的系统…
医疗 Agentic AI 的两道安全闸:抑制过早诊断交接与静默幻觉
针对 LLM 医疗 Agent 的两类高危失效(过早诊断交接 / 静默临床幻觉),论文提出多 Agent 框架,把 "LLMasajudge" 路由换成确定性编排约束:NeuroSymbolic 状态闸强制 OLDCARTS 临床问诊协议的全部维度(Onset/Location/Duration/Character/A…
一篇 2015 年的 CNN 综述,为什么今天还在被引?——读懂「卷积神经网络设计手册」
你有没有这种感觉—— 「为什么这个网络要加残差连接?」 「为什么换 ReLU 比 sigmoid 好?」 「为什么 BatchNorm 之后训练快很多?」 这些都是CNN 时代每个工程师都踩过的坑。2015 年底挂上 arXiv 的 1512.07108 做了一件事:把"现代卷积网络是怎么搭、怎么训、怎么用"拆成六个维…
AI 看 CT 片,第一次能像放射科医生一样"既看局部又看全局"
你有没有想过:为什么 2021 年之前,AI 看医学影像总是「抓不到完整器官」? 左边肺看对了,右边肺却漏一块;心脏边界切得准,但胰腺、肾脏这种小器官又糊成一团。 不是 AI 不努力。是它只有「局部眼睛」没有「全局眼睛」: CNN(卷积神经网络) 像显微镜:看得清像素级边缘、毛细血管,但视野只有一小块。它看的 CT 切…
2606-25819
日期: 20260816 · 轮次: R2 arxiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260816_R2_shortvideoscript.md 标题:Agent 工具调用能力 vs 不可靠下恢复能力 目标观众:Agent 系统开发者 / Agent 评测工…
Paxos vs Raft:我们对分布式共识达成共识了吗?
Paxos 与 Raft 在核心机制上几乎等价,唯一的真实差异在于 leader election 阶段是否允许 leader 在选举过程中补齐日志;Raft 的"易懂"更多来自论文表述的清晰度,而非算法本身不可化约的简洁性。 分布式共识是构建容错、强一致分布式系统的基础原语,自 Lamport 提出 Paxos 以来…
Matterport3D: Learning from RGB-D Data in Indoor Environments
Matterport3D 是首个大规模建筑级别 RGBD 室内数据集,包含 90 个真实场景的 10,800 个全景视图和 194,400 张深度图,提供了精确全局对齐、语义分割标注和多种 2D/3D 任务基准,直接催生了室内场景理解这一计算机视觉重要子领域。 2017 年前,室内 RGBD 数据集的普遍局限: | 数…