Explainers · 学术推广产出

解读

1541 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

AIConfigurator:把 LLM 推理配置搜索从「GPU profiling」解放到「秒级闭环」
这是一套不依赖 GPU 实测 profiling 的 LLM 推理配置自动调优系统:把推理分解为 GEMM / Attention / Communication / Memory 四个可解析 primitives,配套校准过的 kernel 性能数据库,再加一层「自动解析最优启动参数」的抽象层。生产评测显示它能把稠密…
深度解读 arXiv:2601.06288 2026-08-14
MedRLM:递归多模态健康智能框架
MedRLM 将患者案例视为"可递归检查的外部临床环境",通过专门化 Agent 协调文本、EHR、医学影像、生理传感器、指南检索和转诊规划,配合 Clinical Evidence Graph Memory 连接患者观测与证据知识,为临床决策支持提供从单点问答到多源异构证据链推理的根本范式升级。 现实中的临床决策支持…
深度解读 arXiv:2606.20164 2026-08-14
SAC:基于 CXL 的稀疏注意力 LLM disaggregated KV Cache 系统
SAC 利用 CXL 的细粒度 load/store 语义,在稀疏注意力 LLM Serving 场景下实现 KV Cache 的按需获取,将 RDMA 方案中"全量预取"导致的传输瓶颈和本地内存浪费问题一举解决,在 DeepSeekV3.2 + SGLang 真实 Serving 环境中达到 2.1× 吞吐提升和 9…
深度解读 arXiv:2606.19746 2026-08-14
HAKARI-Bench:同条件轻量基准,把 5 类检索架构 + 效率变体放在同一张图上比
HAKARIBench 把 MTEB、MMTEB、BEIR 等大型检索基准拆解、再封装成 35 个 Nanoset × 551 个任务 × 43 种语言的统一格式小数据集,让 55 个模型在 BM25 / dense / sparse / late interaction / reranker 五类检索架构及其降维、量…
深度解读 arXiv:2606.22778 2026-08-14
ReAct:在语言模型中协同推理与行动
ReAct 把 ChainofThought(CoT)的"思考"和 Action Plan Generation(行动生成)合并到同一个 prompt 里的交错序列(Thought → Action → Observation → Thought → ...),让 LLM 在推理时即时调用外部工具(搜索/查询/执行)来…
深度解读 arXiv:2210.03629 2026-08-14
Chinchilla:算力最优的大模型训练法则
Chinchilla 通过对 400+ 个 70M–16B 参数、5B–500B tokens 的 Transformer LM 做系统性消融拟合,得到一条"算力最优训练"的近 IsoFLOP 边界:模型参数与训练 tokens 应按等比例同步放大——并以此把 Gopher(280B)换成一个 70B / 4× 数据的…
深度解读 arXiv:2203.15556 2026-08-14
Skip-Thought Vectors:句子级分布式表示的早期里程碑
SkipThought 把"跳格阅读"的自监督思路从 word2vec(CBOW/Skipgram,预测中心词 / 上下文词)扩展到句子级:用一个 GRU encoder 把当前句子编码成向量,再用两个 GRU decoder 分别重建"前一句"和"后一句"——最终得到的 sentence vector 在 8 个下游…
深度解读 arXiv:1506.06726 2026-08-14
When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
LLM Agent 普遍存在「过度特权」问题——明明低权限工具就够用,偏偏选高权限工具,而且临时故障反而加剧这种倾向;通用的 Safety Alignment 并不自动迁移到 LeastPrivilege 原则;通过特权感知的 PostTraining 防御(privilegeaware posttraining),可…
深度解读 arXiv:2606.20023 2026-08-14
人-AI 协同进化动力学:用形式化动力学解释「社交智能」为何只在长期交互中涌现
论文提出 HACDH(HumanAI Coevolution Dynamics Framework),把长期人AI 对话视为一个「自组织的社会认知动力系统」,并用 14700 轮的实证数据证明:社交智能来自于跨时间尺度的协同进化,而不是任何单轮的对话技巧。 当前「社交型 AI」(陪伴、角色扮演、个性化助手)普遍存在三个…
深度解读 arXiv:2606.19144 2026-08-14
Qiskit Code Migration with LLMs:基于 Taxonomy-RAG 的量子代码自动化迁移
针对 Qiskit 版本演进带来的 API 弃用和代码技术债问题,该工作提出用 Taxonomybased RAG 架构引导 LLM(Gemini Flash2.5 / Gptoss20b)完成量子代码迁移;限制性检索模式(Restrictive Scheme)显著降低幻觉率并提升迁移建议质量,Gemini Flash…
深度解读 arXiv:2606.20173 2026-08-14
Muon 何时有助于 Agentic 强化学习?
本文在 ALFWorld 稀疏奖励 agentic RL 场景下系统比较了 Muon 与 AdamW 优化器,证实「Muon 仅作用于隐藏层权重矩阵 + 与合适的优势估计器与学习率匹配」时能显著提升 agentic RL 训练效率,并把 finalwindow validation success 从 0.290 推到…
深度解读 arXiv:2607.16169 2026-08-14
NOWJ@COLIEE 2026:面向法律检索与推理的自适应流水线
NOWJ 团队在 COLIEE 2026 全部五项任务中采用「按任务难度与查询特性自适应切换」的设计思路,用稠密检索 + 多阶段重排序 + 少样本/零样本提示 LLM 的组合,在法律案例检索、案例蕴含、法条检索、法律文本蕴含与判决预测五个赛道上分别给出流水线方案。 法律 NLP 长期面对两个痛点:其一,法律文本高度专业…
深度解读 arXiv:2607.16603 2026-08-14
Distilled RL:把教师监督塞进 RL 目标,做更细粒度的 LLM 后训练
针对 LLM 后训练里 RL(粗粒度 outcome 监督、credit assignment 难)与 OnPolicy Distillation / OPD(用 KL 无条件对齐教师 logits,要么"学不到新东西"要么"教师信号失效")的两难,本文提出 Distilled Reinforcement Learni…
深度解读 arXiv:2607.17247 2026-08-14
"为什么 AI 认识猫的图片,却搞不定你朋友的关系网?"——一篇 7200+ 引的论文揭开了图神经网络的底层逻辑
你有没有想过:同样是深度学习,为什么 AI 看一张猫的照片能认出是猫,却不能直接看懂"你朋友 A 通过朋友 B 认识了你朋友 C"这种关系? 因为图像、文本是欧氏空间——规则网格,CNN 和 RNN 这套"在格子上滑动"的招式天然吃得上。但现实中绝大多数数据天然是图:社交网络、好友关系、分子结构、交通路网、推荐系统的"…
科普版 arXiv:1812.08434 2026-08-13
"AI 每读一个字就要算 N 次"的时代被终结了——一篇 8326 引的论文让大模型推理速度翻 5 倍
想象一下你读一本 10 万字的小说:每一页你都要回头翻一遍前面所有页,确认"这个人物是不是第三章出现过"。这就是今天几乎所有大语言模型读长文本时干的事——Transformer 的注意力机制决定了它每读一个字,都要和前面所有字重新算一遍关系。当文本从 1000 字涨到 10 万字,计算量不是涨 10 倍,是涨 100 …
科普版 arXiv:2312.00752 2026-08-13
MCompassRAG:用「主题元数据」做语义罗盘,把段落检索的天花板抬高一个量级
论文提出 MCompassRAG,一种「主题元数据 + 同空间 embedding + LLM 教师蒸馏」的检索框架:在 chunk embedding 里同时塞进主题元数据,让轻量级 retriever 自己学会「按主题找段落」,无需推理时再调 LLM,在 6 个复杂检索基准上把信息效率平均提升 8.24%,延迟降到…
深度解读 arXiv:2606.18508 2026-08-13
TRAP:把「任务完成 vs 隐私泄露」的不可调和 trade-off 钉死,并给出唯一出路
论文提出 TRAP(Taskcompletion and Resistance to Active Privacyextraction) 这一基准,并给出一个有点反直觉的硬结论:只要模型还用 softmax 输出 token,任何「软约束」防御(prompt / 系统提示 / 拒绝规则)都不可能同时做到「高任务成功 +…
深度解读 arXiv:2606.18996 2026-08-13
Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement
仅在仿真中训练、以物体位姿(object pose)为条件学习修正策略,无需任何真实机器人数据或额外演示,即可将 VLA 零样本从 42% 成功率提升至 76%。 VisionLanguageAction(VLA)模型通过海量互联网数据预训练,已具备一定的跨任务泛化能力,但其底层策略依赖 Imitation Learn…
深度解读 arXiv:2606.18953 2026-08-13
ScanNet:为 RGB-D 室内场景理解打造的"工业化数据集"
ScanNet 用一套易扩展的 RGBD 采集 + 自动重建 + 众包语义标注流水线,构建了 1513 个室内场景、2.5M 视角、含 3D 相机位姿、表面重建与逐体素语义标签的数据集,把"小作坊式 3D 场景数据"升级为可驱动 SOTA 的工业级基准,并在 3D 物体分类、语义体素标注、CAD 模型检索三个任务上一举…
深度解读 arXiv:1702.04405 2026-08-13
Toolformer: Language Models Can Teach Themselves to Use Tools
Toolformer 证明 LLM 可以在完全自监督的方式下自主学会调用外部工具(如计算器、搜索引擎、翻译系统),零样本性能大幅提升,且不损失原有语言建模能力——这标志着 Tool Use 从"人类手工设计"走向"模型自主习得"的转折点。 LLM 的一个根本性悖论:规模化能带来强大的泛化推理能力,却在精确算术和实时 f…
深度解读 arXiv:2302.04761 2026-08-13
VQA (Visual Question Answering):把「图像 + 自然语言问答」变成可评测的视觉推理任务
Antol、Agrawal、Yang、Batra 等 21 位作者集合 CV、NLP、ML 三方力量,构建并系统化定义了 VQA 任务:给定图像 + 自然语言问题,输出自然语言答案;公开了一个约 26.4 万图 / 76 万问 / 1000 万答的视觉问答基准(VQA v1.0),并配套了视觉语义推理可量化评测的协议和…
深度解读 arXiv:1505.00468 2026-08-13
SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History
SkillHone 通过持久化 Agent 决策历史,将 skill 进化从"单次优化"升级为"跨会话积累",无需预置搜索栈即可在 GAIA 基准上领先商业 Deep Research Agent 15.8 分,并实现平均 18.8 分的内部工具分析场景提升。 大模型 Agent 的 skill(任务特定程序、脚本、参…
深度解读 arXiv:2606.08671 2026-08-13
在共享工作空间的人机协作中寻找协同效应
把「协作结构」而不是「成员能力」摆到变量表的第一位——同样的总能力,搭出三种协调模式,团队产出天差地别:没有协调结构的扩员甚至会拉低性能,而加入共享记忆 + 人在环审核的双层支架后,三人会提升最显著。 近两年 Agent 在 benchmark 上突飞猛进,但只要进入真实组织环境,多人 + 多 Agent 协同时经常出…
深度解读 arXiv:2606.18413 2026-08-13
AI Agent 的运行时合规验证(C-Trace)
CTrace 是一个把 GDPR 的若干关键要求(同意、目的限制、数据最小化、被遗忘权)编码成针对 Agent 执行轨迹的正式策略谓词,并在运行时拦截每一次工具调用、模型输出的验证框架;用 DSPy 生成 + 红队语料拼接的攻击对话去测,4 个 GDPR 重构的 case study 中:在每类别 ≤10% 的抽取噪声…
深度解读 arXiv:2606.19242 2026-08-13
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
多模态 LLM 的「图文思考」范式(如 cropandzoom)在准确率上取得了边际提升,但通过因果图审计发现:大多数情况下返回的视觉证据对最终答案没有因果效应——这本质上是一种「视觉工具使用的幻象」。 「thinkingwithimages」(以图推理)已成为多模态 Agent 的标配范式:模型主动执行 crop、z…
深度解读 arXiv:2608.06270 2026-08-13
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
OpenART 通过环境演化与 EMHA 攻击策略,在 50 个领域、超过 10,000 个有状态场景中对 AI Agent 安全进行了系统性红队评估,揭示了 Agent 运行时实现方式对安全性的影响远超底层模型本身——_pooled ASR 达 85.0%_。 现有 Agent 安全基准聚焦于短时、静态任务,无法捕捉…
深度解读 arXiv:2608.00677 2026-08-13
AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models
AtlasVLA 通过双记忆架构(4D 持久化世界状态记忆 + 自我工作状态记忆)解决了 VLA 模型在单目摄像机下的「感知遗忘」与「任务进度遗忘」问题,在 LIBEROLong 和真实世界长时序任务中分别提升 9.4% 和 17.5% 的成功率。 VLA(VisionLanguageAction)模型是当前 Embo…
深度解读 arXiv:2608.06729 2026-08-13
当 LLM 玩起剧本杀:长程一致性基准 NCP-Bench 撕开"语言流畅 = 逻辑一致"的幻觉
自检:机制 2 段 + 工程 2 段 + ⚠️ 数字核验 3 处(survival rate 42% / fact conflict 4068% / 100 叙事 / ICML 2026 accepted)。全文基于 arXiv abstract 公开内容,未下载 PDF。 NCPBench 把"叙事一致性"从感觉层面…
深度解读 arXiv:2608.08160 2026-08-13
手部关键点可见性检测器:把"被遮挡"这件事从辅助信号升级成独立任务
自检:机制 2 段 + 工程 2 段 + ⚠️ 数字核验 2 处(GitHub 链接 / 数据集未在 abstract 量化)。全文基于 arXiv abstract 公开内容,未下载 PDF。 Hand Visibility Detector 把"手部每个关键点是否被遮挡"从 HPE(Hand Pose Estima…
深度解读 arXiv:2608.11574 2026-08-13
Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer QA — v2 精修覆盖
自检:机制 4 段(任务形式化 / 评测方法学 / 12 支系统技术路径 / leaderboard 状态)+ 工程 3 段(多语言切块 / 跨语言检索 / 答案生成)+ ⚠️ 数字核验 6 处(256 题 / 32 公司 / 5 语言 / 12 系统 / ROUGE1 macro / 前 4 名 1pp 差距)+ 反…
深度解读 arXiv:2607.19867 2026-08-13