研究库 深度解读
Explainers · 学术推广产出

解读

1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Large Behavior Model:零售客户可提示数字孪生
LBM 通过将零售客户的交易历史建模为持续性行为画像(Person)与动态产品上下文(Environment)的统一框架,并结合 RAG + 持续预训练 + SFT + RL 全链路训练,使语言模型能够学习并模拟真实消费者的购买决策,在零样本跨零售商迁移场景中持续超越通用大模型。 零售业 customer behavi…
深度解读 arXiv:2607.06993 2026-08-16
TESSERA v2:像素级地球基础模型的可控规模扩展
TESSERA v2 完成了迄今最大规模的地球观测(EO)基础模型控制扩展研究(395 次训练,1,024 块 GH200 超算),核心发现是预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),而编码器与数据应协同扩展、投影器保持固定的规则才是计算最优策略;基于此规则训练的 21M 参数蒸馏模型 TE…
深度解读 arXiv:2607.03949 2026-08-16
ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
ReflectWorldMM 把"持续看世界并基于累积经验推理"的多模态 Agent,拆成「感知前端 + 分层长期记忆 + 即插即用接口」三件套,以「实体」(entity) 而非「帧」为记忆单位组织记忆,从而在六个长视频/终身记忆基准上全部取得最佳准确率,优于强记忆 Agent 和前沿基座模型。 多模态 Agent 看…
深度解读 arXiv:2607.09759 2026-08-16
RoboTALES:用任务对齐的模拟未来,学习推理引导的机器人策略
RoboTALES 是一个单阶段(singlestage)框架,把「用预训练视频生成模型当世界模型」和「用推理信号去约束它的想象」这两件事在同一轮训练里同时做完:通过 LLM 分层规划器把复杂任务拆成子目标来引导视频模型的「想象」方向,再用一个 VLM 评判器给这些想象的未来打 reward、回过头约束生成器的内部表征…
深度解读 arXiv:2607.06018 2026-08-16
具身智能体架构设计的自动化:当架构搜索走出文本,走进模拟器
把 Agent Architecture Search(AAS)从纯文本 Agent 领域迁移到具身 Agent:在自家研发的 AgentCanvas 类型化图运行时之上,由 KDLoop(提议—批评—实验—蒸馏 + 停滞触发的反思)这一代码 Agent 搜索过程,遍历四种具身执行器 × 三种 AAS 变体共 3×4 …
深度解读 arXiv:2606.30111 2026-08-16
当规则学会学习:面向法律案例检索的自进化 Agent
LLM 作为 Agent,无需参数训练,通过「自进化」循环自动构建、验证和淘汰查询改写规则,显著提升 BM25 在中文法律案例检索上的效果,揭示了 LLM 的「实验结果利用能力」和「规则消除内在知识」是自进化的两大核心驱动力。 法律案例检索长期面临两个挑战:一是法律语言高度复杂,专业术语多、长尾表述多,查询与案例之间的…
深度解读 arXiv:2606.17220 2026-08-16
MedEasy:为临床问诊训练设计 AI 标准化病人
MedEasy 是一个面向临床问诊训练的多 Agent 系统,通过「患者对话→临床操作→决策提交→文档记录→反馈」的五阶段工作流,让医学生在虚拟环境中完成逼真的病例练习,其设计研究揭示了 AI 辅助职业训练系统的核心原则:用案例特定标准连接情境化实践。 临床问诊是医学教育的核心技能,但传统训练方式面临三重困境: 1. …
深度解读 arXiv:2606.17512 2026-08-16
可信自组合 Big-Data-as-a-Service:LLM 编排多 Agent 的全生命周期自动化
Trustworthy SelfComposable BDaaS 框架将传统 AutoML 的能力边界扩展至完整的数据工程→模型训练→部署→漂移监控全生命周期,通过 LLM 编排的专门化 MultiAgent 协作,在保持竞争力的预测性能同时,实现了工作流可完成性、制品可追溯性、部署就绪度、可复现性和漂移恢复能力的系统…
深度解读 arXiv:2606.17915 2026-08-16
医疗 Agentic AI 的两道安全闸:抑制过早诊断交接与静默幻觉
针对 LLM 医疗 Agent 的两类高危失效(过早诊断交接 / 静默临床幻觉),论文提出多 Agent 框架,把 "LLMasajudge" 路由换成确定性编排约束:NeuroSymbolic 状态闸强制 OLDCARTS 临床问诊协议的全部维度(Onset/Location/Duration/Character/A…
深度解读 arXiv:2606.18068 2026-08-16
Paxos vs Raft:我们对分布式共识达成共识了吗?
Paxos 与 Raft 在核心机制上几乎等价,唯一的真实差异在于 leader election 阶段是否允许 leader 在选举过程中补齐日志;Raft 的"易懂"更多来自论文表述的清晰度,而非算法本身不可化约的简洁性。 分布式共识是构建容错、强一致分布式系统的基础原语,自 Lamport 提出 Paxos 以来…
深度解读 arXiv:2004.05074 2026-08-16
Matterport3D: Learning from RGB-D Data in Indoor Environments
Matterport3D 是首个大规模建筑级别 RGBD 室内数据集,包含 90 个真实场景的 10,800 个全景视图和 194,400 张深度图,提供了精确全局对齐、语义分割标注和多种 2D/3D 任务基准,直接催生了室内场景理解这一计算机视觉重要子领域。 2017 年前,室内 RGBD 数据集的普遍局限: | 数…
深度解读 arXiv:1709.06158 2026-08-16
用深度强化学习做交通信号控制:DTSE 与 SUMO 上的里程碑式工作
这篇 2016 年的工作把深度 Q 网络(DQN)+ 经验回放搬进交通信号控制场景,提出一种新的离散交通状态编码(Discrete Traffic State Encoding, DTSE)作为卷积网络的输入,并在 SUMO 仿真器上把平均累计延误降低 82%、平均队列长度降低 66%、平均行程时间降低 20%。它是把…
深度解读 arXiv:1611.01142 2026-08-16
RAG 系统安全与隐私:构建可信知识增强系统的全面综述
RAG 将外部知识检索与 LLM 生成结合,已成为企业知识管理、医疗、金融、法律等隐私敏感领域的核心架构。然而,RAG 的引入同时也扩展了攻击面:检索索引、查询日志、上下文构建过程、联邦更新等多个环节都可能泄露敏感信息;对抗性知识库污染则可直接操纵生成结果。 RAG 将外部知识检索与 LLM 生成结合,已成为企业知识管…
深度解读 arXiv:2606.25533 2026-08-16
Post-training 被遗忘的免费午餐:Progress Advantage 让 LLM Agent 无需专门奖励模型即可实现过程级评估
RL 后训练本身就是过程级奖励信号的现成来源——通过推导 RL 策略与参考策略的对数概率比(Progress Advantage),无需人工标注、无需专门奖励模型训练,就能在 Agent 场景中实现 SOTA 级别的 steplevel 评分。 Process Reward Model(PRM) 能对 LLM Agen…
深度解读 arXiv:2606.26080 2026-08-16
超越函数调用:ToolBench-X 揭示工具不可靠环境下 Agent 的严重可靠性鸿沟
现有工具使用基准都假设工具稳定可信,但真实环境中工具随时可能故障、降级或返回错误数据;ToolBenchX 通过5类结构化可靠性 hazard 测试证明:能在可靠环境下工作的 Agent,遇到可恢复的可靠性危害时大量失败——诊断能力和恢复策略比调用量更重要。 工具调用(Tooluse)是 LLM Agent 完成真实世…
深度解读 arXiv:2606.25819 2026-08-16
解开 GraphRAG 的「结」:VectorRAG 几乎够用 — 评 UnWeaver 框架
这篇论文主张:GraphRAG 那种繁重的图索引在多数实际问答场景里并不划算——用 LLM 把文档里的实体先解耦、再据此回收原文块,单凭 entity 这一中间表示就能把 VectorRAG 的端到端 QA 精度顶到接近 SOTA 图方法,但索引成本大幅压低。 RAG 系统有两个老毛病: 1. 块级检索把信息「混编」进…
深度解读 arXiv:2603.29875 2026-08-16
LoopCoder-v2:仅循环一次以实现高效测试时计算扩展
LoopCoderv2 通过 GainCost 分析框架证明:Parallel Loop Transformer(PLT)在两次循环时达到最优平衡——第二轮循环带来表示精炼,但超过两轮后 CLP 位置错配成本将超过收益,导致性能回落。 Looped Transformer 通过反复堆叠同一组 Shared Blocks…
深度解读 arXiv:2606.18023 2026-08-16
集成商优势:面向中小型企业的受控 Agentic AI
本文认为 Agentic AI 的近期价值不在于「替代人类」或「完全自主」,而在于为中小企业(SMC)的简单与中等复杂度业务流程提供「受控的部分自主」能力——以人为中心,责任与问责由人承担,AI 作为生产力杠杆。 Agentic AI 正在引发企业自动化的新一轮范式转变。与传统 RPA( Robotic Process…
深度解读 arXiv:2606.16649 2026-08-16
Ricci-Filtration:通过离散 Ricci Flow 将 RAG 重排序器提升至 Query-Answer 任务
RicciFiltration 将 RAG 检索出的 Chunk 集合建模为加权图,利用归一化离散 Ricci Flow 的几何性质——正曲率区域收缩、负曲率区域扩张——在图上识别并过滤「噪声 Chunk」(相对于 Query 节点具有大权重与负 Ricci 曲率),再将过滤后的 Chunk 送入 Reranker,显…
深度解读 arXiv:2606.15482 2026-08-16
WGAN-GP:用梯度惩罚替代权重裁剪,稳定训练 Wasserstein GANs
把 WGAN 中用来强行施加 1Lipschitz 约束的权重裁剪(weight clipping)替换成对 critic 输入梯度的 L2 范数惩罚(gradient penalty),从而在几乎不调超参的情况下稳定训练包括 101 层 ResNet 与离散语言模型在内的多种 GAN 架构,并在 CIFAR10 / …
深度解读 arXiv:1704.00028 2026-08-16
Whisper:用 68 万小时弱监督多任务数据训练一个零样本语音识别/翻译基础模型
把"在网上能爬到的大量带弱字幕的音频"当成天然监督信号,用 encoderdecoder Transformer 在 68 万小时多语种多任务数据上做大规模弱监督训练,得到的 Whisper 在标准 ASR 基准(LibriSpeech、FLEURS、TEDLIUM 等)上无需任何任务专属微调即可达到与有监督 SOTA…
深度解读 arXiv:2212.04356 2026-08-16
LMCache:面向企业级 LLM 推理的高效 KV Cache 层级
LMCache 是首个开源、生产级的 LLM KV Cache offloading 方案,把 KV Cache 从 GPU 显存中提取出来,跨 CPU / 存储 / 网络层级存储和共享,同时支持 prefix 复用与 prefilldecode(PD)disaggregation,在多轮 QA、文档分析等场景下,与 …
深度解读 arXiv:2510.09665 2026-08-16
LLM 多智能体系统:挑战与开放问题
这是一篇偏定位 + 展望的综述论文,聚焦 LLM MultiAgent System(MAS)在 任务分配 / 协作推理 / 上下文管理 / 记忆机制 四个核心机制上的开放问题,并把多智能体范式推到 区块链与分布式系统 这一相对少见的应用场景,借此为 LLM MAS 在真实分布式环境中的落地提供思路。 LLM 单 ag…
深度解读 arXiv:2402.03578 2026-08-16
GLM-5: 从 Vibe Coding 到 Agentic Engineering
引用:GLM5Team (Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng 等), "GLM5: From Vibe Coding to Agentic Engineering", arXiv:2602.15763v2, 20260217 v1, 20…
深度解读 arXiv:2602.15763 2026-08-16
HDR:面向多步视觉推理的分层去噪框架
提出 HDR(Hierarchical Denoising for Visual Reasoning),把因果视频生成的潜变量组织成树状层级,先粗后细地做多步视觉推理;用稀疏层级注意力(SHAP)压低时序注意力成本,0.70 秒 / latent 的流式速度下,多步任务成功率从 34.22 提到 60.29,相对提升 …
深度解读 arXiv:2607.15278 2026-08-15
超越成功率:攻击性与防御性安全 Agent 的成本感知评估
现有安全 Agent 评估只问"能不能成功",而这篇论文认为真正重要的是"花多少钱能成功"——提出成本成功率联合评估框架,对攻击(CTF)和防御(SOC 调查)两种场景分别发现截然不同的 scaling 规律:攻击任务靠加大推理预算就能显著提升,防御任务的成功率更多取决于工具使用的纪律性,而非砸更多算力。 当前安全 A…
深度解读 arXiv:2607.15263 2026-08-15
分区、提示、聚合:语言模型中的统计自一致性
本文提出一种「参考无关」的 LLM 评估新准则——统计自一致性(statistical selfconsistency):用二叉树把总体递归切成越来越细的子群体,让模型分别估计每个子群体,再聚合回总体估计;只要结果对树的切分粒度敏感、且与人类基线有显著差距,就说明模型存在「宏观谬误(macro fallacy)」——子…
深度解读 arXiv:2607.15277 2026-08-15
HowTo100M:让互联网叙事字幕自动变成 1 亿级视频-文本对训练语料
Miech、Zhukov、Alayrac 等人用 YouTube 上 1.22M 个「howto / instructional」视频的自动 ASR 字幕切割出 1.36 亿个 clipcap pairs,从此把「视频文本」对齐学习从昂贵的人工标注(30K–100K 级别)一举推到亿级训练数据规模;他们用 MILNCE…
深度解读 arXiv:1906.03327 2026-08-15
ALBEF(Align Before Fuse):先对齐再融合 + 动量蒸馏,让视觉-语言预训练进入「对噪声鲁棒」的实用时代
Li、Selvareanu、Gotmare 等 Salesforce 研究者提出 ALign BEfore Fuse(ALBEF):先用对比损失 (ITC) 在单模态编码器上把图像和文本编码到共享空间,再用跨模态 Transformer 融合;同时为应对网络爬来的图文对天然带噪声,引入 momentum distill…
深度解读 arXiv:2107.07651 2026-08-15
GPTs are GPTs:LLM 对美国劳动力市场的冲击全景评估
OpenAI、OpenResearch 与宾夕法尼亚大学的研究团队合作,首次系统评估了 GPT 类大语言模型对美国劳动力市场的潜在影响:约 80% 的劳动者至少有 10% 的工作任务可被 LLM 影响,约 19% 的人面临至少 50% 的工作任务被颠覆;LLM 驱动的软件工具可将任务自动化比例从 15% 提升至 47–…
深度解读 arXiv:2303.10130 2026-08-15