研究库 深度解读
Explainers · 学术推广产出

解读

1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

怎样的 Fiqh 检索器才算好?阿拉伯伊斯兰法学的"答案承载"检索评测
本文把"端到端 RAG 在 Islamic QA 上分数更高"这一常用论断拆成两段,专门测量检索阶段——只在「段落真的陈述了问题所需裁决」时才判为相关——并发现 dense+lexical hybrid 在强模型上几乎不增益,而按 madhhab(法学派)做后置过滤能把学派特化题的 MRR@5 翻一倍多。 RAG 已经…
深度解读 arXiv:2608.20246 2026-08-22
RapidLiDAR:实时且自适应的 LiDAR 场景补全
针对自动驾驶中 LiDAR 场景补全的两难——生成式方法精度高但慢、非生成式方法快但要手工调噪声尺度——RapidLiDAR 把"初始化"本身也学成一个数据驱动的模块,先用一个自适应初始化模块对每个部分观测点预测一个空间变化的位移生成粗场景,再用多尺度重建模块结合 3D voxel 与 2D BEV 特征图把粗场景精化…
深度解读 arXiv:2608.16490 2026-08-22
COMA:针对 Security-RAG 的组合式误导攻击类别与因果反事实防御
在面向 SOC 分析师的 Security Copilot 中,攻击者可以通过 COMA(Compositional Misleading Attack)让所有被检索到的文档单独看都真实、无指令、无矛盾、分布良性,却仅靠"组合效应"误导 copilot 给出"漏洞存在但修复无效"或"漏洞不可利用"两种致命错判;论文同时…
深度解读 arXiv:2608.17960 2026-08-22
SkillGate:在长视野 Agent 中训练"策略内技能选择"
当 Agent 框架把过程性知识封装成"按需读取的技能指令"后,"该读哪一份技能"本身就是 episode 中途要做的决策,但现有的"对候选技能列表施加结果奖励的 RL"会因为选择器信用饥饿(selector credit starvation)而结构性失败;SkillGate 用"outcome 信用只到执行 tok…
深度解读 arXiv:2608.18852 2026-08-22
QuoteBench:匹配分数为什么掩盖了命令路径里的失败
LLM 编程 Agent 评测里那些"匹配执行得分"实际上把生成阶段错误和"生成之后再被解析器改坏的"错误混在了一起;QuoteBench 用 14 个源自真实事件、56 个一次性任务的最小可复现边界测试证明:同一份回复再过一个未转义的解析器会让成功率下跌 55.4 ~ 73.2 个百分点,而"声明边界 + 转义"对其…
深度解读 arXiv:2608.13547 2026-08-22
TinyCast:基于计算周期性的概率性零样本预测
TinyCast 是一个 146,505 参数、零注意力的零样本时序预测器,靠"显式算周期 + 膨胀卷积编码 + 分块自回归分位数解码"在 GIFTEval 概率精度榜单上划出了 sizeaccuracy 前沿,并能在嵌入式设备上以静态 INT8 全链路推理。 零样本时序预测(zeroshot timeseries f…
深度解读 arXiv:2608.15767 2026-08-22
τ_0-VLA:基于世界模型引导测试时计算的分层机器人基础模型
τ_0VLA 是一个把"高层子任务生成"建模为可扩展推理问题的分层 VLA(visionlanguageaction)机器人基础模型——通过世界模型引导的测试时计算(testtime computation),在 40,115 小时真实异构数据上联合训练,在分布内与分布偏移设置下都把更多推理算力转化为更高的长周期闭环成…
深度解读 arXiv:2608.16885 2026-08-22
Consciousness in Artificial Intelligence: Insights from the Science of Consciousness
当前 AI 系统(包括 GPT4、Claude 等)均未满足任何主流意识理论的核心判据,这篇报告以实证神经科学框架为尺,宣告"AI 尚无意识"。 "AI 是否有意识"是 2023 年公共舆论与学术界的共同困惑。一方面,媒体与部分研究者热衷于声称大模型已具备感知能力;另一方面,这一判断缺乏可操作的方法论——既无公认的评测…
深度解读 arXiv:2308.08708 2026-08-22
Large Language Models: A Survey —— LLM 生态的方法论与代表模型全景图
Minaee 等人 2024 年初发表的 LLM 综述(S2 引用超千),按"主流模型家族 → 训练与增强技术 → 数据集 → 评估指标 → 主流 benchmark 横评 → 开放挑战"六条主线系统梳理 LLM 生态,覆盖 GPT、LLaMA、PaLM 三大族谱与若干开源/闭源代表,是 2024 年初最常被引用的 L…
深度解读 arXiv:2402.06196 2026-08-22
ChatGPT is not all you need: A State of the Art Review of Large Generative AI Models
该综述对 20212023 年间的主要 Generative AI 模型进行了多模态分类,涵盖 TexttoText、TexttoImage、ImagetoText、TexttoVideo、Textto3D、TexttoAudio、TexttoCode 等多个生成范式,并分析了生成式 AI 对各行业的影响,是理解 20…
深度解读 arXiv:2301.04655 2026-08-22
本地化部署企业 RAG 的 AI 工程蓝图(4+1 视图 + 参考实现)
这篇论文是 2026 年少有的"严肃讨论企业本地化 RAG"的工作:作者给出一套完整的 AI 工程蓝图(AI Engineering Blueprint),以 4+1 视图模型描述端到端参考架构,并配套发布一个 onpremises reference application 与 CI/CD 最佳实践,专门解决"数据合…
深度解读 arXiv:2604.01395 2026-08-22
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
TTKV 将人类记忆系统的层次性(工作记忆 / 情景记忆 / 长期记忆)映射到 LLM 推理的 KV Cache 中,通过 HBM + DRAM 的异构存储分层 + 基于时间相关性的 tier 内容分配 + blockwise streaming attention 隐藏跨层访问延迟,在 128K 上下文任务上实现了 …
深度解读 arXiv:2604.19769 2026-08-22
Gemini for Google (GfG):用万亿 token 内部代码数据微调一个企业版 Gemini
Google 把 Gemini 在内部 29,000 名开发者身上做了端到端定制:先从 PB 级的内部代码/CI/评审系统中清洗出 ~1T token 的私有语料,再走「中段训练(midtraining) + 后训练」两段路线把 Gemini 适配到自家 Monorepo,最终在盲测 A/B 中把平均「每轮迭代数」降低…
深度解读 arXiv:2605.16517 2026-08-22
GPU LLM Serving 也会「老化」:216 小时实证与可复现框架
UNC Charlotte 的研究团队用 216 小时、6 个共址部署、相同压力条件的对照实验,第一次实证地证明:基于 GPU 的 LLM serving 系统存在「软件老化(software aging)」现象——host 内存、device 显存、客户端延迟都会随时间出现统计显著的劣化,且老化速率强依赖于 serv…
深度解读 arXiv:2606.11916 2026-08-22
Speculative Decoding 的可解释延迟模型:为什么加速比会随负载塌掉
本文为 LLM serving 中的 Speculative Decoding(SD)建立了一个简单且可解释的延迟模型:用 Little's Law 推出 effective batch size,并把每个请求的服务时间拆成「与负载无关 + 与负载有关」两部分,从而定量解释「为什么 SD 的加速比常常随服务器负载上升而…
深度解读 arXiv:2605.15051 2026-08-22
TAA-k:基于尾部感知的自适应上下文选择——把 EVT 真正落地到 RAG 检索
TAAk(TailAware Adaptivek)把 Extreme Value Theory(EVT)在 RAG 自适应截断上的应用从"全局拟合"重写成"局部窗口内 EVT 验证":先用膝点检测把候选区域压成 √(N log N) 量级,再在这个窗口里跑 EVT 拟合优度检验,从而把复杂度从 O(N²M) 降到 O(…
深度解读 arXiv:2606.11907 2026-08-22
Scaling LLM Inference Beyond Amdahl's Limits via Eliminating Non-Scalable Overheads
Albireo 通过调度 I/O 与计算的重叠,以及序列并行采样,将 LLM 推理中不可扩展部分的占比压缩到最低,从而使张量并行(TP)可以推进到更高度数,在不改变模型架构的前提下实现最高 1.9 倍吞吐量和 48% 延迟降低。 在线 LLM 服务的核心约束是:在固定 GPU 数量下最大化集群级别的服务吞吐量。张量并行…
深度解读 arXiv:2606.01927 2026-08-22
Post-Deterministic Distributed Systems: A New Foundation for Trustworthy Autonomous Infrastructure
PDDS 提出了一种协调异构环境的分布式计算模型——在同一个系统中,确定性代码、随机模型和自主 Agent 共存——并证明经典分布式计算模型是其"零模糊特例",为下一代自主基础设施提供了理论基础。 过去四十年,分布式系统理论建立在一条核心假设之上:参与者行为是确定性的(deterministic)——正确的节点执行协议…
深度解读 arXiv:2606.01722 2026-08-22
DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch
DeNovoSWE 提出了一套包含 4,818 个真实仓库级代码生成任务的大规模评测基准,通过沙箱化 Agent 工作流自动构建,解决了长程仓库级代码生成训练数据匮乏的核心难题;在该数据集上微调的 Qwen330BA3B 在 BeyondSWEDoc2Repo 基准上从 5.8% 跃升至 47.2%。 现有代码生成评测…
深度解读 arXiv:2606.10728 2026-08-22
MoE-ViE:面向图像与视频理解的细粒度混合专家视觉编码器
MoEViE 把 LLM 侧的细粒度 MoE 范式搬进 CLIP 式视觉编码器,用「细粒度专家拓扑 + 无辅助损失均衡 + 帧级蒸馏 + 专用 MoE kernel」四件套,在不到稠密基线 76% 推理时延下匹配 1.7× 参数量 SOTA 编码器的零样本性能,搭配 LLM 后在多模态基准上压过激活参数多至 5× 的同…
深度解读 arXiv:2608.17402 2026-08-21
FAR:把数学发现流水线从「挑题」改造为「方向 → 级联 → 复核」
FAR(Find / Attempt / Recommend)提出了一种新的人机协同数学发现范式:人类输入不再是一个具体问题,而是「研究方向」;系统沿「Find 检索 → Attempt 推理 → Recommend 筛选」三级级联把 5,245 篇 combinatorics 论文过滤到 77 条送审,最终在 Dav…
深度解读 arXiv:2608.16977 2026-08-21
打破失败级联:面向医学多模态推理的步骤感知强化学习(MRPO)
MRPO(Medical Reasoningaware Policy Optimization)是一种面向医学多模态 VQA 的步骤感知 RL 算法,它在最终答案错误时对早期无效推理步施加指数级递增的惩罚,从而把"早期一错、步步皆错"的级联失败从 64% 砍到 13%,并在 Qwen3VL8BInstruct 上反超规…
深度解读 arXiv:2606.31825 2026-08-21
AgentCompass:把 Agent 评测拆成 Benchmark / Harness / Environment 三层的统一基础设施
本文提出 AgentCompass——一个开源、轻量、可扩展的 LLMAgent 评测基础设施。它把整个评估流程拆成 Benchmark / Harness / Environment 三个独立组件,配上容错异步 runtime 与轨迹分析工具,原生支持 20+ 个 benchmark、五大能力维度,让团队不必再为"换…
深度解读 arXiv:2607.13705 2026-08-21
RxBrain:具备语言-视觉联合推理与想象的具身认知基础模型
提出 HyEmbodiedRxBrain,用一套多模态 MixtureofTransformers 架构把"语言视觉联合推理与想象"塞进同一段规划序列,并以视频自动化流水线构造"文本规划+视觉状态对齐"的训练监督,使模型在无需大规模动作数据预训练的前提下具备真机操作能力。 具身智能长期存在两种割裂的范式: 1. VLM…
深度解读 arXiv:2607.14187 2026-08-21
把秘密写在上下文里,模型替你悄悄泄露——Inadvertent Context Leakage
论文揭示了一种系统性的"非对抗性"上下文泄露:把 2 位/4 位秘密(密码片段、SSN 段、卡号段等)放进模型上下文,模型即便在直接询问时拒绝输出,也会把秘密信息以"统计相关性"的形式泄露到日常无害输出里;8 个商用模型在受控实验中,2 位秘密几乎可被完美重建,4 位秘密 82% 精确匹配,且更强的指令遵循能力反而放大…
深度解读 arXiv:2608.19857 2026-08-21
Repo0:从自然语言一路生成整库的"设计驱动"代码 Agent
Repo0 把"从需求建一个完整软件仓库"这件事从单轮 LLM 直生成,升级为先维护一张显式架构状态(DualDAG),再用模块化指标驱动的结构演化收敛到一个稳定架构,最后才进入 TDD 代码生成;在 RepoCraft 6 个真实仓库上比最强基线 RPG 的 Functionality Coverage 提升最多 2…
深度解读 arXiv:2608.19854 2026-08-21
FlashPrefill V2:把 block-sparse 预填充推到生产的注意力后端
FlashPrefill V2 用"均值修正 + PackGQA/warp specialization/pingpong 流水线 + paged KV/continuous batching"三件套,把 blocksparse 预填充从算法原型推到生产可用的 attention 后端,在 H20 GPU、128K 上…
深度解读 arXiv:2608.19758 2026-08-21
让 LLM 用低资源语言思考:SFT 搭骨架、RL 修缺陷、准确率却看不到的变化
把三个前沿 MoE 模型(Alibaba / OpenAI / NVIDIA 各家,激活参数 3.64.0B)微调到用希腊语这种低资源语言推理,准确率 benchmark 几乎不动——因为 benchmark 本身在该尺度上噪声太大(仅换随机种子就能移动 7.7 分,比所有数据/配方效应都大);真正的变化藏在"准确率看…
深度解读 arXiv:2608.17744 2026-08-21
4DAnyone:单目视频生成"可重建级"多视角,再提升到 4DGS
4DAnyone 把"单目视频 → 4D 人体重建"拆成两步——先用相机可控视频扩散模型生成"可重建级"的多视角一致视频,再把这些视频提升到 4D Gaussian Splatting(4DGS);针对 DiT 单次前向注意力容量有限导致的"分组建模"瓶颈,分别用 Reference Context Packing(把…
深度解读 arXiv:2608.20335 2026-08-21
NARU:面向日语超长视频的叙事演进与文化微妙理解基准
NARU 是一个针对日语长视频的「叙事演进 + 文化微妙」双轨评测基准:1481 道题、155 段视频、共 146.8 小时,横跨 4 个叙事维度与 5 个文化维度,揭示现有 MLLM 在长程叙事整合与文化语境推理上同时存在显著短板。 长视频理解评测长期被两类任务统治:孤立事件检索(谁在第几分钟推开门)和显式动作问答。…
深度解读 arXiv:2608.13210 2026-08-21