Explainers · 学术推广产出

解读

1087 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation
Hallo4D 提出了"生成检测修正"(GenerationDetectionCorrection)范式,利用 LMM(大型多模态语言模型)对多视角和多帧渲染结果进行时空一致性检测,并引导基于共识驱动的图像空间优化,无需重训练或修改模型架构,即可显著缓解 3D/4D 内容生成中的空间幻觉和时间抖动问题。 3D/4D 内…
深度解读 arXiv:2607.12752 2026-08-20
CoAL-RAG:复杂度感知的法律 RAG,让「单一检索策略」不再硬扛「单条退订」到「劳动连环案」的全谱问题
一句话结论:把「问题复杂度」从单一 tokenconfidence / 单一难度分类器升格为「5 维内在复杂度 × 检索一致性能量竞争」双轴评估,再以 3 档阈值在 4 条检索路径之间动态路由,使简单法条问答不必被知识图谱淹没、复杂多步推理性案件不会被纯向量检索的零碎片段带偏。 法律咨询问题的「复杂度方差」远高于通用 …
深度解读 arXiv:2608.17536 2026-08-20
PLENA:长上下文 Agentic LLM 推理的硬件—软件协同优化
PLENA 提出了一套面向 Agentic LLM 推理场景的硬件—软件协同设计系统,通过扁平化 systolic array、非对称量化与 FlashAttention 原生支持三条优化路径,在等量乘法器和等量内存配置下,把 LLaMA 系 Agentic 推理的吞吐相对 A100 / TPU v6e 分别提升到 2…
深度解读 arXiv:2509.09505 2026-08-20
DeepSeek-V3 Technical Report
DeepSeekV3 是一个 671B 参数的 MoE(MixtureofExperts)LLM,激活参数仅 37B/token,通过 MLA 注意力、DeepSeekMoE、AuxiliaryLossFree 负载均衡、MultiToken Prediction(MTP)和 FP8 混合精度训练等创新,在仅 2.78…
深度解读 arXiv:2412.19437 2026-08-20
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
该综述将 LLM Hallucination(幻觉)系统分为 InputConflicting、ContextConflicting、FactConflicting 三大类型,全面梳理了检测方法、评估基准和缓解技术,为 LLM 在真实场景中可靠部署提供了完整的知识地图;论文据 Semantic Scholar 估计被引…
深度解读 arXiv:2309.01219 2026-08-20
Preference Is Not Intervention:读者特定证据效用的结构与稳定性边界
在 RAG 系统中,"不同模型偏好不同证据"这件事是真的,但稳定的偏好排序并不能授权"帮助/伤害"决策的跨读者迁移——论文用受控干预实验把"读者效用"拆成 activity、ordinal preference、conditional signed direction 三层,并证明前两层稳定、第三层塌方,得出"偏好 ≠…
深度解读 arXiv:2608.17781 2026-08-20
EDITBRIDGE:面向忠实且高效的超高分辨率图像编辑
把"低分辨率编辑 + 独立超分"的两阶段 pipeline 重写成"扩散桥式 datatodata 翻译":以原 HR 图为条件约束、引入 priorguided blockwise sparse attention 把跨图交互限制在语义对齐区域,从而在 4K 分辨率下做到 61 秒实用编辑、2K 分辨率上 3.6–8…
深度解读 arXiv:2608.18063 2026-08-20
跨模型记忆迁移:Engram 在目标侧靠 Reader 适配对齐
Engram 这种"外部哈希记忆表 + 小型 reader"的中间形态,跨模型迁移时记忆内容本身可以冻结,但能否真正被用起来,几乎完全取决于目标侧 reader 是否与目标 backbone 对齐——配上对齐的 reader,跨模型几乎追平同模型复用。 大模型的知识使用改进,长期被两条路线分治: 参数化适配(finet…
深度解读 arXiv:2608.17050 2026-08-20
DiSCO:在提示层面做分布引导的对比防御,保护文本到图像生成
DiSCO 是一种严格黑盒、零样本、即插即用的提示层防御方法,专门解决"语言上无害但因模型学到的数据分布仍生成有害图像"的良性对抗问题——在 I2P benchmark 上对未防御模型降低 ASR 37.7%,对已防御模型再降 25.13%,同时保住语义一致性与图像连贯性。 文本到图像(T2I)模型的安全防御,长期被两…
深度解读 arXiv:2608.17067 2026-08-20
沿成功之流反推 Agent 失败:OAT 的无监督失效归因方法
论文提出 OAT(Oneclass Anomaly detection on Trajectories),把 LLM Agent 失败归因重新定义为「只学成功轨迹、用动力学偏离度判失败步」的单类异常检测问题:训练只需 100 条成功轨迹、推理比 prompt 基线快 200–5000×,indomain / OOD 上…
深度解读 arXiv:2607.12747 2026-08-20
PTXBench:用架构特定 PTX 衡量并提升 LLM 的 GPU Kernel 优化能力
PTXBench 用一组在 H100 / B200 上跑得动的真实 GPU kernel 任务(含 GEMM 和 attention 正反向),搭出一个可审计、可度量、可训练的测试床,并诚实告诉业界:LLM 在"写出架构特定 PTX"这件事上,目前仍没有稳定 SOTA——这是该方向第一次系统的体检报告。 LLM 写 C…
深度解读 arXiv:2608.17379 2026-08-20
LakeQuest:面向数据湖根植式问答的三领域基准
论文提出 LakeQuest——一个人工校验、跨 AI/ML 元数据 / 零售银行 / 多模态生物医药 三领域的 9,846 条根植式问答基准,每个问题都附带 modalityaware 的证据指针,专门用来评估「在真实数据湖上做端到端检索 + 综合」全流程;并通过基线实验证明:高质量检索并不保证正确推理,现代 RAG…
深度解读 arXiv:2607.12310 2026-08-20
PalmClaw:手机端原生在设备运行的 Agent 框架
论文提出 PalmClaw——一个完全运行在手机端的开源 Agent 框架,把 session、memory、skill、tool 与 agent loop 都搬到本地:它把手机能力以「device tool」形式暴露给 LLM,每个动作都带显式参数与结构化结果、清晰执行边界;实验显示相对最强基线取得 +11.5% 相…
深度解读 arXiv:2607.13027 2026-08-20
揭秘 Agent Skill:为什么它们有效——直到失效
Agent Skill 不是在"注入新知识",而是在"把噪声轨迹压缩成稳定执行的过程性锚点"——它有效是结构性的,但这个结构的脆弱性同样决定了它何时会失效。 LLM agent 框架过去一年普遍引入"Skill"机制:把工具调用模式、错误恢复策略、工作流模板打包成结构化知识包,让模型在推理时按需加载,以期提升任务成功率…
深度解读 arXiv:2608.14036 2026-08-20
LATO.2:基于顶点流与拓扑流分解的 3D 网格生成
LATO.2 把 3D 网格生成拆成两阶段:先学"顶点几何流(vertex flow)",再学"以已实现顶点为条件的拓扑流(connectivity flow)"——两阶段都锚定同一个粗体素支架(coarse voxel scaffold),由两套专用 VAE 把离散拓扑也嵌入到连续潜空间。论文称在几何保真度与连通性质…
深度解读 arXiv:2607.10623 2026-08-19
Evidence-Backed Video Question Answering:用像素级证据回答视频问题
论文提出 EVQA(EvidenceBacked Video QA) 这一新任务:模型必须同时输出"语义答案 + 像素级时空证据(时间片段 + 稠密、跟踪的物体 masklet)";配套发布首个人工验证的双重 grounding benchmark STEvidence,以及 16 万规模、衔接高层推理与细粒度 gro…
深度解读 arXiv:2607.11862 2026-08-19
EgoSteer:从第一人称视频出发的可控制灵巧操作系统
EgoSteer 是一个全栈(fullstack)系统:用 EgoSmith 数据管线把野外第一人称(egocentric)人类视频清洗成 9600 小时高质量预训练数据,配套一套遥操 + 人在回路纠错的统一机器人栈,再训练一个带世界模型增强的 VLA(VisionLanguageAction)——EgoSteer。它…
深度解读 arXiv:2607.09701 2026-08-19
MET:理论支撑且文化感知的多语言道德推理
论文给出三件套:MCLASH 多语言道德决策 benchmark(覆盖文化情境化的道德直觉与社会规范)、MET(Multilingual Ethics with Theorygrounded reasoning)两步提示法(先按情境/文化选"理论依据",再用用户母语推理)、METD 自蒸馏训练(无需外部监督即可加强第二…
深度解读 arXiv:2607.11736 2026-08-19
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
BooguImage0.1 是一个完全开源的统一多模态图文模型家族(Base / Turbo / Edit / EditTurbo 四款变体),在约 40 万美元的受限算力预算下,通过系统性提升模型理解能力、数据质量与训练流程,并引入 Agent 化的推理时缩放(agentic inferencetime scalin…
深度解读 arXiv:2607.13125 2026-08-19
下一代云原生内存键值存储:从 Redis 到 Valkey 的全景评测
⚠️ 重要前置事实:本文 v1 由第一作者撤回(arXiv:2510.19805v2 已 withdrawn),原作者声明"未被告知也未同意发表,且报告的数值结果存在多处重大错误,相关结论不被基准数据支持"。本文解读基于公开 v1 摘要与 TLDR,作为「该问题域的存在性证明」与「评测方法学参考」使用,不应直接引用其具…
深度解读 arXiv:2510.19805 2026-08-19
CATS:内存受限设备上的自投机级联验证推理加速
论文全名:Cascaded Adaptive Tree Speculation for MemoryLimited LLM Inference Acceleration(arXiv:2605.11186v1,20260511,作者 Yuning Han 等)。本研究面向边缘设备上 LLM 自回归解码加速。 提出 CAT…
深度解读 arXiv:2605.11186 2026-08-19
ByteHouse:字节跳动的云原生实时多模态数据仓库
论文全名:ByteDance's CloudNative Data Warehouse for RealTime Multimodal Data Analytics(arXiv:2602.08226v2,20260209 第一版,作者 Yuxing Han 等字节跳动 ByteHouse 团队)。本文是字节跳动内部数据…
深度解读 arXiv:2602.08226 2026-08-19
Experience as a Compass: Multi-agent RAG with Evolving Orchestration and Agent Prompts
HERA 是一个分层演化框架,通过全局编排拓扑优化与局部角色感知 Prompt 进化双层协同,让多 Agent RAG 系统在多跳知识推理任务上平均提升 38.69%,同时实现 emergent selforganization——稀疏探索自发收敛为紧凑高效的 Agent 网络。 多 Agent RAG(Multiag…
深度解读 arXiv:2604.00901 2026-08-19
Motion4Motion: Motion Transfer Across Subjects at Inference
Motion4Motion(M4M)是一个免训练(trainingfree)的跨主体运动迁移框架,彻底抛弃了传统的基于预定义人体骨骼结构的运动迁移范式,改为直接对视频中角色的 motion flow(运动流)进行建模,从而在推理阶段实现从人类到动物、从真人到卡通、从一种形态到任意物种的高质量运动迁移,无需任何骨架标注或…
深度解读 arXiv:2607.11644 2026-08-19
VideoRAE:用冻结视频基础模型做生成式表征自编码器
VideoRAE 提出 Representation AutoEncoder 范式:把冻结的视频基础模型(VFM,如 VJEPA 2、VideoMAEv2)当成「教师特征源」,用 1D selfattention projector 压缩多尺度层级特征得到紧凑 latent,再以 localglobal 表征对齐替代传…
深度解读 arXiv:2607.14088 2026-08-19
RAGU:把 7B 模型训成 GraphRAG 引擎核心,单卡可跑的开源多步管线
RAGU 是一个开源、模块化、pip install 可装的 GraphRAG 引擎,通过把"抽取"与"融合"解耦的两阶段管线 + 用 7B 的 MenoLite0.1 替代传统 32B+ 抽取器,在 GraphRAGBench (Medical) 上把 evidence recall 拉到 0.84(SOTA 对照 …
深度解读 arXiv:2607.11683 2026-08-19
How AI Agents Are Restructuring the Software Paradigm
本文从软件工程学科视角,论证 AI Agent 的出现是对"软件"本身的根本性重构——从"代码是决策逻辑的载体"到"Agent 本身就是软件,决策逻辑在运行时生成",并提出 Agentic Engineering 作为扩展软件工程学科的新范式。 过去半个世纪,软件工程建立在同一套基础假设上:人类工程师分解问题 → 将决…
深度解读 arXiv:2606.05608 2026-08-19
AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases
AgenticRAG 在现有企业搜索基础设施之上叠加一层轻量级 Agent harness,为推理型 LLM 配备 search / find / open / summarize 工具,实现迭代式检索、跨文档导航与证据自主分析,在 FinanceBench 上达到 92% 正确率——比传统 RAG 高出 3.8 倍,…
深度解读 arXiv:2605.05538 2026-08-19
MathForm:用知识检索与验证驱动迭代,把数学自动形式化从「翻译」拉到「可用」
MathForm 把「自动形式化(autoformalization)」从一个靠模型死记 Mathlib 的「翻译活」重做成一条「检索 + 编译器反馈 + 语义一致性反馈」驱动的数据训练流水线,并在 6 个 Lean 4 基准上用 8B 模型打平乃至超过多个专用 32B 形式化器。 数学自动形式化长期有两个隐性失败模式…
深度解读 arXiv:2608.14221 2026-08-19
Personalized Auto-Research:面向真正的 AI 协作科学家的个性化研究框架
当前 SOTA AI coscientist 系统以"研究者无关"的方式优化 novelty、validity 或 reviewer score,忽略了科研工作的本质:什么算创新、价值或可行,取决于具体研究者。Personalized AutoResearch 首次提出将研究者个体建模为研究过程的核心条件,通过"图锚定…
深度解读 arXiv:2608.14881 2026-08-19