研究库 深度解读
Explainers · 学术推广产出

解读

1756 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

DiSCO:在提示层面做分布引导的对比防御,保护文本到图像生成
DiSCO 是一种严格黑盒、零样本、即插即用的提示层防御方法,专门解决"语言上无害但因模型学到的数据分布仍生成有害图像"的良性对抗问题——在 I2P benchmark 上对未防御模型降低 ASR 37.7%,对已防御模型再降 25.13%,同时保住语义一致性与图像连贯性。 文本到图像(T2I)模型的安全防御,长期被两…
深度解读 arXiv:2608.17067 2026-08-20
沿成功之流反推 Agent 失败:OAT 的无监督失效归因方法
论文提出 OAT(Oneclass Anomaly detection on Trajectories),把 LLM Agent 失败归因重新定义为「只学成功轨迹、用动力学偏离度判失败步」的单类异常检测问题:训练只需 100 条成功轨迹、推理比 prompt 基线快 200–5000×,indomain / OOD 上…
深度解读 arXiv:2607.12747 2026-08-20
PTXBench:用架构特定 PTX 衡量并提升 LLM 的 GPU Kernel 优化能力
PTXBench 用一组在 H100 / B200 上跑得动的真实 GPU kernel 任务(含 GEMM 和 attention 正反向),搭出一个可审计、可度量、可训练的测试床,并诚实告诉业界:LLM 在"写出架构特定 PTX"这件事上,目前仍没有稳定 SOTA——这是该方向第一次系统的体检报告。 LLM 写 C…
深度解读 arXiv:2608.17379 2026-08-20
LakeQuest:面向数据湖根植式问答的三领域基准
论文提出 LakeQuest——一个人工校验、跨 AI/ML 元数据 / 零售银行 / 多模态生物医药 三领域的 9,846 条根植式问答基准,每个问题都附带 modalityaware 的证据指针,专门用来评估「在真实数据湖上做端到端检索 + 综合」全流程;并通过基线实验证明:高质量检索并不保证正确推理,现代 RAG…
深度解读 arXiv:2607.12310 2026-08-20
PalmClaw:手机端原生在设备运行的 Agent 框架
论文提出 PalmClaw——一个完全运行在手机端的开源 Agent 框架,把 session、memory、skill、tool 与 agent loop 都搬到本地:它把手机能力以「device tool」形式暴露给 LLM,每个动作都带显式参数与结构化结果、清晰执行边界;实验显示相对最强基线取得 +11.5% 相…
深度解读 arXiv:2607.13027 2026-08-20
揭秘 Agent Skill:为什么它们有效——直到失效
Agent Skill 不是在"注入新知识",而是在"把噪声轨迹压缩成稳定执行的过程性锚点"——它有效是结构性的,但这个结构的脆弱性同样决定了它何时会失效。 LLM agent 框架过去一年普遍引入"Skill"机制:把工具调用模式、错误恢复策略、工作流模板打包成结构化知识包,让模型在推理时按需加载,以期提升任务成功率…
深度解读 arXiv:2608.14036 2026-08-20
LATO.2:基于顶点流与拓扑流分解的 3D 网格生成
LATO.2 把 3D 网格生成拆成两阶段:先学"顶点几何流(vertex flow)",再学"以已实现顶点为条件的拓扑流(connectivity flow)"——两阶段都锚定同一个粗体素支架(coarse voxel scaffold),由两套专用 VAE 把离散拓扑也嵌入到连续潜空间。论文称在几何保真度与连通性质…
深度解读 arXiv:2607.10623 2026-08-19
Evidence-Backed Video Question Answering:用像素级证据回答视频问题
论文提出 EVQA(EvidenceBacked Video QA) 这一新任务:模型必须同时输出"语义答案 + 像素级时空证据(时间片段 + 稠密、跟踪的物体 masklet)";配套发布首个人工验证的双重 grounding benchmark STEvidence,以及 16 万规模、衔接高层推理与细粒度 gro…
深度解读 arXiv:2607.11862 2026-08-19
EgoSteer:从第一人称视频出发的可控制灵巧操作系统
EgoSteer 是一个全栈(fullstack)系统:用 EgoSmith 数据管线把野外第一人称(egocentric)人类视频清洗成 9600 小时高质量预训练数据,配套一套遥操 + 人在回路纠错的统一机器人栈,再训练一个带世界模型增强的 VLA(VisionLanguageAction)——EgoSteer。它…
深度解读 arXiv:2607.09701 2026-08-19
MET:理论支撑且文化感知的多语言道德推理
论文给出三件套:MCLASH 多语言道德决策 benchmark(覆盖文化情境化的道德直觉与社会规范)、MET(Multilingual Ethics with Theorygrounded reasoning)两步提示法(先按情境/文化选"理论依据",再用用户母语推理)、METD 自蒸馏训练(无需外部监督即可加强第二…
深度解读 arXiv:2607.11736 2026-08-19
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
BooguImage0.1 是一个完全开源的统一多模态图文模型家族(Base / Turbo / Edit / EditTurbo 四款变体),在约 40 万美元的受限算力预算下,通过系统性提升模型理解能力、数据质量与训练流程,并引入 Agent 化的推理时缩放(agentic inferencetime scalin…
深度解读 arXiv:2607.13125 2026-08-19
下一代云原生内存键值存储:从 Redis 到 Valkey 的全景评测
⚠️ 重要前置事实:本文 v1 由第一作者撤回(arXiv:2510.19805v2 已 withdrawn),原作者声明"未被告知也未同意发表,且报告的数值结果存在多处重大错误,相关结论不被基准数据支持"。本文解读基于公开 v1 摘要与 TLDR,作为「该问题域的存在性证明」与「评测方法学参考」使用,不应直接引用其具…
深度解读 arXiv:2510.19805 2026-08-19
CATS:内存受限设备上的自投机级联验证推理加速
论文全名:Cascaded Adaptive Tree Speculation for MemoryLimited LLM Inference Acceleration(arXiv:2605.11186v1,20260511,作者 Yuning Han 等)。本研究面向边缘设备上 LLM 自回归解码加速。 提出 CAT…
深度解读 arXiv:2605.11186 2026-08-19
ByteHouse:字节跳动的云原生实时多模态数据仓库
论文全名:ByteDance's CloudNative Data Warehouse for RealTime Multimodal Data Analytics(arXiv:2602.08226v2,20260209 第一版,作者 Yuxing Han 等字节跳动 ByteHouse 团队)。本文是字节跳动内部数据…
深度解读 arXiv:2602.08226 2026-08-19
Experience as a Compass: Multi-agent RAG with Evolving Orchestration and Agent Prompts
HERA 是一个分层演化框架,通过全局编排拓扑优化与局部角色感知 Prompt 进化双层协同,让多 Agent RAG 系统在多跳知识推理任务上平均提升 38.69%,同时实现 emergent selforganization——稀疏探索自发收敛为紧凑高效的 Agent 网络。 多 Agent RAG(Multiag…
深度解读 arXiv:2604.00901 2026-08-19
Motion4Motion: Motion Transfer Across Subjects at Inference
Motion4Motion(M4M)是一个免训练(trainingfree)的跨主体运动迁移框架,彻底抛弃了传统的基于预定义人体骨骼结构的运动迁移范式,改为直接对视频中角色的 motion flow(运动流)进行建模,从而在推理阶段实现从人类到动物、从真人到卡通、从一种形态到任意物种的高质量运动迁移,无需任何骨架标注或…
深度解读 arXiv:2607.11644 2026-08-19
VideoRAE:用冻结视频基础模型做生成式表征自编码器
VideoRAE 提出 Representation AutoEncoder 范式:把冻结的视频基础模型(VFM,如 VJEPA 2、VideoMAEv2)当成「教师特征源」,用 1D selfattention projector 压缩多尺度层级特征得到紧凑 latent,再以 localglobal 表征对齐替代传…
深度解读 arXiv:2607.14088 2026-08-19
RAGU:把 7B 模型训成 GraphRAG 引擎核心,单卡可跑的开源多步管线
RAGU 是一个开源、模块化、pip install 可装的 GraphRAG 引擎,通过把"抽取"与"融合"解耦的两阶段管线 + 用 7B 的 MenoLite0.1 替代传统 32B+ 抽取器,在 GraphRAGBench (Medical) 上把 evidence recall 拉到 0.84(SOTA 对照 …
深度解读 arXiv:2607.11683 2026-08-19
How AI Agents Are Restructuring the Software Paradigm
本文从软件工程学科视角,论证 AI Agent 的出现是对"软件"本身的根本性重构——从"代码是决策逻辑的载体"到"Agent 本身就是软件,决策逻辑在运行时生成",并提出 Agentic Engineering 作为扩展软件工程学科的新范式。 过去半个世纪,软件工程建立在同一套基础假设上:人类工程师分解问题 → 将决…
深度解读 arXiv:2606.05608 2026-08-19
AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases
AgenticRAG 在现有企业搜索基础设施之上叠加一层轻量级 Agent harness,为推理型 LLM 配备 search / find / open / summarize 工具,实现迭代式检索、跨文档导航与证据自主分析,在 FinanceBench 上达到 92% 正确率——比传统 RAG 高出 3.8 倍,…
深度解读 arXiv:2605.05538 2026-08-19
MathForm:用知识检索与验证驱动迭代,把数学自动形式化从「翻译」拉到「可用」
MathForm 把「自动形式化(autoformalization)」从一个靠模型死记 Mathlib 的「翻译活」重做成一条「检索 + 编译器反馈 + 语义一致性反馈」驱动的数据训练流水线,并在 6 个 Lean 4 基准上用 8B 模型打平乃至超过多个专用 32B 形式化器。 数学自动形式化长期有两个隐性失败模式…
深度解读 arXiv:2608.14221 2026-08-19
Personalized Auto-Research:面向真正的 AI 协作科学家的个性化研究框架
当前 SOTA AI coscientist 系统以"研究者无关"的方式优化 novelty、validity 或 reviewer score,忽略了科研工作的本质:什么算创新、价值或可行,取决于具体研究者。Personalized AutoResearch 首次提出将研究者个体建模为研究过程的核心条件,通过"图锚定…
深度解读 arXiv:2608.14881 2026-08-19
Agent Lightning v1.0:把 Agent Harness 拉进 RL,把训练和部署解耦
Agent Lightning v1.0 提出并实现「harnessed agentic RL」——把任意已经部署的 Agent Harness 当成「环境」,让 RL 训练器只观察 LLM 请求响应对,由此把训练和部署彻底解耦;并以约 3,500 行代码实现完整框架,在 6K 样本上把 Qwen3.59B 在 SWE…
深度解读 arXiv:2608.17528 2026-08-19
Embodied-Navigator(TAMP-Nav):把 VLM 拉回 2D 视觉舒适区,用稀疏推理 + 两层对齐做高效具身导航
TAMPNav(EmbodiedNavigator)把具身导航拆成四个动作——Point(2D 像素 → 3D 坐标)、Think(按需触发 ChainofThought)、Memorize(关键节点保留 + 其余压缩为时空指示)、Align(GRPO 上叠加过程奖励做两层对齐),让 VLM 在自己的 2D 视觉先验里…
深度解读 arXiv:2608.17512 2026-08-19
大语言模型是否在玩「六度分隔」?长上下文流形的拓扑压缩测量
这篇论文把 transformer 隐状态的相似度矩阵稀疏化成无向图,发现深层推理层在 long context 上天然构成 SmallWorld 网络——任意两个语义锚点之间最多 6 跳可达,并把这个拓扑度量当作 RAG 幻觉的零样本检测器:事实正确的生成与源上下文保持 ≈3 跳的结构连通,幻觉则表现为严重的拓扑塌缩…
深度解读 arXiv:2608.17950 2026-08-19
Registers 对像素空间 Diffusion Transformer 至关重要
在像素空间(pixelspace)训练的 Diffusion Transformer(DiT)虽然不像 ViT 那样出现 patchtoken 高范数异常值,但额外引入 register tokens 仍能显著改善生成质量,并且在像素空间 DiT 中的收益明显大于潜空间 DiT,由此本文还提出一种新推理技巧——Regi…
深度解读 arXiv:2605.16147 2026-08-19
从受控环境到真实世界:面向实际场景的渗透测试 Agent 评估
针对 AI 渗透测试 Agent 现有基准过度依赖 CTF/RCE 等"任务完成"指标、难以反映真实目标的复杂性这一问题,本文提出 ethiBench 评估协议——把评估重心从"是否完成子任务"转到"是否真正发现并验证漏洞",并配套结构化真值 + LLM 语义匹配、连续真值维护、累积评估、效率指标与精简子集等机制,目标…
深度解读 arXiv:2605.10834 2026-08-19
When Bots Join the Team:Bot 采纳与开源软件项目的制度性结构
通过对 2,991 个 GitHub 项目在引入第一个 bot 前后两年的事件级数据进行因果识别风格的差分分析,本文发现 bot 采纳与"重复协作增加、特定 bot 在讨论中被点名增多、冲突级联减少、产出更具区分度"四种社区级变化在时间上精准共变,并据此论证:可预测、规则驱动的 bot 完全可以成为开源社区"制度性基础…
深度解读 arXiv:2607.13679 2026-08-19
代理探索与可复用引导:一种通过代理引导更新信号实现的模块化 LLM 后训练范式
PUST 通过引入轻量级代理模型将「探索高奖励行为」与「策略对齐」解耦,让更新信号可以异步生成、缓存并跨模型复用,把 LLM 后训练从昂贵的在线优化变成模块化的离线工程。 Posttraining(后训练)是 LLM 落地绕不开的环节——无论是数学推理、代码生成还是领域适配,都需要对基础模型做微调。但现有方法存在根本性…
深度解读 arXiv:2607.11505 2026-08-19
AdvancedMathBench:面向高等数学证明生成与验证的基准套件
本文提出 AdvancedMathBench,一个聚焦"高等数学"(本科高年级到博士资格考难度)的双轨基准:一轨 ProverBench 测"证得出",另一轨 VerifierBench 测"判得对",并配套一个与人类专家高一致性的自动验证 pipeline。实验显示前沿模型 GPT5.5xhigh 在证明生成上 UG…
深度解读 arXiv:2607.11849 2026-08-19