研究库 深度解读
Explainers · 学术推广产出

解读

1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

NAPE:用「下一段嵌入预测」做极简自监督音频学习
NAPE(NextAudioPatchEmbedding prediction)把 LLM 时代「下一 token / 下一 embedding 预测」的因果范式搬到 logmel 频谱上:只用一个因果 Transformer + causal mask + stopgradient,无重建解码器、无声学 tokeni…
深度解读 arXiv:2608.19863 2026-08-21
超越记忆:面向长寿 AI Agent 的事务性连续性内核
Continuity Kernel(CK)将 AI Agent 的长期状态管理从"存储保留"升级为"带权限验证的正式激活协议",以分支头谱系代替版本号、以原子事务代替直接覆写,为跨越多年运行的 Agent 提供 Persistent Cognitive Identity(PCI)基础设施。 当一个 AI Agent 持…
深度解读 arXiv:2608.11632 2026-08-21
基于 Skill-Harness 演化的自演化具身智能体
SHAPER 提出免训练(trainfree)的具身智能体自适应框架:冻结 VLA 模型的权重参数,通过目标环境 rollouts 演化可复用的文本 skill 与 contextcode harness,让同一个冻结模型既能做规划器(planner)又能做优化器(optimizer)。 将基础模型部署到具身智能体时,…
深度解读 arXiv:2608.11350 2026-08-21
利用检索增强 LLM 构建用于复杂系统诊断的动态主逻辑知识图谱
KGDML 框架将 RAG 与 LLM 结合,实现从技术文档自动构建动态主逻辑(Dynamic Master Logic)知识图谱,使 LLM 能对核电站级复杂系统进行可追溯的诊断推理——包括故障传播方向推断、安全性评估和依赖追溯。 Complex engineered systems(核电站、飞机引擎、工业控制系统)…
深度解读 arXiv:2608.12304 2026-08-21
量化 ASR 模型对公开基准的"过拟合":从行为探针到因果干预
自检:机制 1 段 + 工程 2 段(行为探针 + 因果干预)+ ⚠️ 数字核验 3 处 + 反方 1 段 + 跨主线合流节点 1(v33 评测治理)。 公开 ASR(Automatic Speech Recognition,自动语音识别)基准(LibriSpeech / CommonVoice / GigaSpeec…
深度解读 arXiv:2608.19936 2026-08-21
Chain-of-Experience:让 LLM 在推理时持续从经验中改进
ChainofExperience(CoE)把"LLM 在测试时通过多轮交互累积经验、形成超越 zeroshot 的持续改进回路"作为一类正式问题建模,并用 8 个主流 LLM(含 GPT5 / Gemini2.5 Pro / Claude4.5 Sonnet)在数学、编程、知识三类任务上验证:仅靠自反馈就能稳定超越无…
深度解读 arXiv:2608.18027 2026-08-21
SWE-bench Science:科学软件工程是否仍是 Coding Agents 的硬骨头
SWEbench Science 用 119 个真实科学软件工程任务(来自 98 个 GitHub 仓库、跨 20 个科学领域)建立仓库级评测基准,结果显示最强编码 Agent(Claude Code + Opus5 max)pass@1 也低于 50%;同时通过配对消融证明:科学知识并不总是正面增益——对齐良好的领域…
深度解读 arXiv:2608.19799 2026-08-21
Self-Improvements in Modern Agentic Systems: A Survey
这篇 97 页综述将现代具备自我改进能力的 Agent 建模为"基础模型 + 运行支撑层"(prompt / memory / tools / 控制逻辑)的耦合配置,把 selfimprovement 形式化为一个自我驱动的更新算子,可作用于模型权重或 scaffold 组件,为理解、设计和评测 Agent 自我改进系…
深度解读 arXiv:2607.13104 2026-08-21
KeyFrame-Compass:迈向关键帧条件视频生成的综合评估
KeyFrameCompass 是首个面向"关键帧条件视频生成(keyframeconditioned video generation)"的综合评测基准与自动化打分框架,将关键帧执行拆成 6 个互补指标,并用证据驱动的 MLLM 判定整体视频质量,揭示了当前 9 个主流系统在"忠实执行关键帧"与"自然视频合成"之间存…
深度解读 arXiv:2607.14202 2026-08-21
DeepLoop:循环 Transformer 的深度扩展
DeepLoop 给"循环 Transformer(Looped Transformer)"提供了一套与参数访问次数对齐的残差缩放规则(residual scaling rule),通过一个一阶扰动上界与"访问对齐系数 κ_R"推导得到:当循环次数 N 增加时,PostLN DeepNorm 的指数必须从 1/4 上升…
深度解读 arXiv:2607.13491 2026-08-21
Function-Aware Fill-in-the-Middle:面向 Coding Agent 基础模型的中期训练
本文提出 FunctionAware FillintheMiddle(FIM) 作为 Coding Agent 基础模型的中期训练(midtraining) 自监督目标:通过程序依赖图分析与"复杂度可推断性"双重标准筛选可遮蔽函数,让 Qwen2.5CoderInstruct(7B/14B)与 Qwen38B 在 SW…
深度解读 arXiv:2607.12463 2026-08-21
SCAR:面向高效上下文扩展的语义连续性感知检索
SCAR(Semantic ContinuityAware Retrieval)是一种自适应相邻分块扩展策略:它把"是否把邻居分块并入上下文"这一问题,转化为一个相对查询相关性的决策——只有当邻居与查询的相关性接近当前最相关分块时才扩展,从而在边界碎片化场景下用更少的分块恢复更高的召回率,并且同一条规则无需重训就能在不…
深度解读 arXiv:2606.16661 2026-08-21
Islamic LLMs:从知识获取到可信、抗幻觉 AI
这是一篇针对 Islamic LLM 与可信 Islamic AI 的综述论文,核心论点是:阿拉伯语流利度 ≠ Islamic AI 能力——构建可靠的伊斯兰领域 LLM 需要权威语料、检索与验证模块、引用感知生成、madhhabaware 推理、专家评估和面向忠实度/源有效性的基准,并据此提出抗幻觉 Islamic …
深度解读 arXiv:2606.16629 2026-08-21
SwiftCache:面向多轮对话的高效 LLM Serving(异构 KV Cache 共享)
SwiftCache 是一个协同推理系统:在同一台服务器内,让 KV cache 需求不同的异构 LLM 通过 NVLink 共享彼此闲置的 GPU 显存与带宽,高需求模型把前缀 KV cache 卸载到低需求模型"捐赠"的显存中,避免慢速 PCIe 传输;同时只把"当前活跃层"的 KV cache 留在本地显存,进一…
深度解读 arXiv:2606.16135 2026-08-21
MuseCPEval:音乐编辑系统的"上下文保留"多面评估框架
首次系统提出"音乐上下文保留(MuseCP)"概念与 MuseCPEval 评估框架,把"编辑过程中哪些音乐面应保持不变"拆为四大类并配以细粒度指标,再通过客观验证 + 人为研究 + 案例研究三路证明其有效性,从而把音乐编辑系统的评估从"改得好不好"推进到"该留的有没有留住"。 音乐编辑系统近年能力飙升:音色迁移、乐器…
深度解读 arXiv:2512.14629 2026-08-21
MissDiag:KGQA 与 KG-RAG 中不完整知识鲁棒性的诊断式评估
MissDiag 是一个面向 KGQA / KGRAG 的"诊断式"鲁棒性评估框架:它把"删证据后系统表现下降多少"这一聚合指标拆解为"缺失证据的类型 × 被评估系统的响应 × 答案匹配协议的敏感度"三个轴上的归因分析,用结构化缺损算子(typed missingness interventions)对同一 bench…
深度解读 arXiv:2608.18489 2026-08-21
VA-Judger:从人类偏好反馈学习联合音视频生成的奖励模型
VAJudger 是首个面向联合音视频生成(Joint VideoAudio Generation)的"思维链 + 维度分解"奖励模型:通过 VAPref10K(9K 提示 / 10.3K 细粒度对比)和 VAJudgerBench 两套数据,配合三阶段训练(清晰偏好对 → 近质量对的拒采解释蒸馏 → 维度分解 RL)…
深度解读 arXiv:2608.18607 2026-08-21
Bounded Agents:多 Agent 系统的委派安全架构
把 Agent 的每一次工具调用放进一条"代理主链(Agentic Principal Chain, APC)"中做六项授权检查,并用组合闭包阻止跨调用的危险组合,让提示注入风险从"模型问题"被重写为"授权架构问题"。 LLM Agent 在一次会话中通常被授予一组静态权限,每个请求被独立放行。然而真实攻击并非单次请求…
深度解读 arXiv:2608.15888 2026-08-21
When More Cores Hurts: HPC环境中向量数据库扩展悖论
在 HPC 超算集群上对 Qdrant、Milvus、Weaviate 三种 SOTA 向量数据库的规模化评估揭示了一个反直觉的"扩展悖论":增加核心反而可能降低查询吞吐,从 16 worker 扩展到 256 worker 仅获得 5.46 倍的性能提升,远低于理想的 16 倍线性扩展。 向量数据库(Vector D…
深度解读 arXiv:2606.08950 2026-08-21
Stratum: Agent 生成流水线的 Rust 高性能运行时
Stratum 是一个统一系统基础设施,将 Agent 生成流水线的执行与规划和推理解耦,通过编译批量流水线为优化执行图并由新型 Rustbased runtime 高效执行,在大规模 MLE Agent 场景下实现最高 16.6 倍加速。 LLM 驱动的机器学习工程(MLE)Agent 已经能够自动生成、验证和优化完…
深度解读 arXiv:2603.03589 2026-08-21
FROAV: RAG 观察与 Agent 验证的统一框架
FROAV(Framework for RAG Observation and Agent Verification)是一个开源研究平台,通过将可视化工作流编排、多阶段 RAG 流水线、"LLMasaJudge"评估体系与可扩展 Python 集成结合,降低 LLM Agent 研究的门槛——让研究者专注于假设验证和算…
深度解读 arXiv:2601.07504 2026-08-21
Tangram:为多轮 LLM Serving 解锁非均匀 KV Cache 压缩
Tangram 是一套面向多轮对话场景的 LLM serving 框架,将原本在运行时动态处理的「非均匀 KV Cache 预算」全部提前到调度期静态解析,在不损失精度的前提下端到端吞吐量较全 KV 基线最高提升 2.6×,首次让非均匀 KV Cache 压缩在生产 vLLM 栈中真正可用。 多轮 LLM servin…
深度解读 arXiv:2606.06302 2026-08-21
MatryoshkaLoRA:用单一训练产出可任意切分的层级化 LoRA 适配器
MatryoshkaLoRA 通过在已有 LoRA adapter 之间插入一个固定的对角矩阵 P 来按比例缩放子秩,让单一训练产出即可在任意子秩下保持精度,无需为每个候选 rank 重训或网格搜索,从根本上终结 LoRA 工程中「设多大 rank」的代价。 LoRA(LowRank Adaptation)已是 LLM…
深度解读 arXiv:2605.07850 2026-08-21
Securing the Agent:用分层隔离架构终结多租户 RAG / Agent 的「相关性冒充授权」漏洞
《Securing the Agent》一文提出面向多租户企业 RAG / Agentic 系统的分层隔离架构,把策略感知 ingestion、retrievaltime gating、服务端 agentic 编排三类执行点协同起来,首次形式化指出「检索按相关性排序而非授权」是 RAG 在企业场景的根性漏洞,并以开源 …
深度解读 arXiv:2605.05287 2026-08-21
LabVLA:让 Vision-Language-Action 模型真正进入科学实验室
LabVLA 把 VLA(VisionLanguageAction)模型从"家庭 / 桌面演示数据集"挪到了"科学实验室"这个全新场景:先用仿真数据引擎 RoboGenesis 从原子技能组合出可执行的实验室工作流并筛掉无效 rollout,再用两阶段训练——先 FAST 动作 token 预训练让 Qwen3VL4B…
深度解读 arXiv:2606.13578 2026-08-21
Attention Residuals:用 softmax attention 替换固定残差,让深层 LLM 的信息聚合更聪明
Attention Residuals(AttnRes)把 Transformer 里"每层都用权重 1 累加上一层输出"的固定 PreNorm 残差,改成"用 softmax attention 在前面所有层的输出上做加权聚合",从而让深层模型不再被"残差稀释"问题拖垮;它已经作为 dropin 替换集成进 Kimi…
深度解读 arXiv:2603.15031 2026-08-21
DCD(Domain-Collection-Document):面向异构语料的层级化 RAG 控制架构
DCD 提出"领域—集合—文档"三层级知识组织 + 多阶段路由:在不修改底层 LLM 的前提下,把异构语料切成可路由的层级结构,先路由到 Domain、再路由到 Collection、最后才落到 Document,让 RAG 的检索和生成范围在每一步都被显式约束,同时配合 smart chunking、hybrid r…
深度解读 arXiv:2604.07590 2026-08-21
CTIFoundry:面向网络威胁情报的 Agent 原生语料架构
CTIFoundry 把"网络威胁情报(CTI)语料"从「RAG 友好的不透明 chunk 集合」升级为agent 原生语料架构——构建期把 CVE / CWE / CAPEC / ATT&CK 四个权威库的官方交叉引用物化成可遍历的本体图,并对威胁报告做去别名、跨厂商实体对齐;查询期通过 7 个 typed tool…
深度解读 arXiv:2608.18613 2026-08-21
AsySplat:用「几何-外观非对称」双分支把长序列 3D 高斯泼溅的冗余计算砍到 1/800
AsySplat 把可泛化的 3D Gaussian Splatting(3DGS)长序列新视角合成(NVS)流水线拆成「重几何 / 轻外观」非对称双分支:粗粒度 token 在重参数几何分支里重建几何,少数参数的外观分支在细粒度 token 上抓细节,两者通过双向连接互相引导。结果是在 32view 960P 输入上…
深度解读 arXiv:2607.10995 2026-08-21
MythraGen:检索 + LoRA 加权融合的「文生艺术图像」两阶段 RAG 框架
MythraGen 是一个面向「文生艺术图像」的检索增强生成(RAG)框架:先用 BLIP2 + FAISS 在 WikiArt 上按 prompt 检索最相似的画作,再用检索结果训练两路 LoRA(流派+风格、艺术家+风格),最后把两路 LoRA 加权融合后注入 Stable Diffusion 进行生成。在 Wik…
深度解读 arXiv:2606.22924 2026-08-21