Explainers · 学术推广产出

解读

1527 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

DiSCO:在提示层面做分布引导的对比防御,保护文本到图像生成
DiSCO 是一种严格黑盒、零样本、即插即用的提示层防御方法,专门解决"语言上无害但因模型学到的数据分布仍生成有害图像"的良性对抗问题——在 I2P benchmark 上对未防御模型降低 ASR 37.7%,对已防御模型再降 25.13%,同时保住语义一致性与图像连贯性。 文本到图像(T2I)模型的安全防御,长期被两…
深度解读 arXiv:2608.17067 2026-08-20
沿成功之流反推 Agent 失败:OAT 的无监督失效归因方法
论文提出 OAT(Oneclass Anomaly detection on Trajectories),把 LLM Agent 失败归因重新定义为「只学成功轨迹、用动力学偏离度判失败步」的单类异常检测问题:训练只需 100 条成功轨迹、推理比 prompt 基线快 200–5000×,indomain / OOD 上…
深度解读 arXiv:2607.12747 2026-08-20
PTXBench:用架构特定 PTX 衡量并提升 LLM 的 GPU Kernel 优化能力
PTXBench 用一组在 H100 / B200 上跑得动的真实 GPU kernel 任务(含 GEMM 和 attention 正反向),搭出一个可审计、可度量、可训练的测试床,并诚实告诉业界:LLM 在"写出架构特定 PTX"这件事上,目前仍没有稳定 SOTA——这是该方向第一次系统的体检报告。 LLM 写 C…
深度解读 arXiv:2608.17379 2026-08-20
为什么 ChatGPT 能"听懂人话"?——一篇 2022 年的论文给出了完整答案
你有没有过这种体验👇 你问 GPT:"帮我把这篇文章用大白话翻译一下" GPT 没问你要 fewshot 示例,也没让你精确措辞,直接就翻译好了。 或者你问:"我女朋友生日快到了,给我列 5 个她可能喜欢的礼物" GPT 没让你"先给个例子",直接给你 5 条。 这事看起来理所当然。但你可能不知道——在 2022 年 …
科普版 arXiv:2210.11416 2026-08-20
2016 年的那篇"老论文",怎么就成了今天 ChatGPT 也会用的底层技巧?
你有没有想过——为什么 ChatGPT 跟你聊到一半,能突然引用你五分钟前说过的那个词? 或者:你让它"总结一下第三段的某某观点",它居然能把原文里的原话一字不差地"抄"出来? 这事听起来理所当然,背后其实藏着一个 2016 年才被系统解决的小难题——AI 怎么学会"复制粘贴"自己上下文里出现过的字? arXiv 16…
科普版 arXiv:1609.07843 2026-08-20
2026-08-20 · R2 · DeepSeek-V4-Pro H20 多场景优化 · 2608.14376 CoRun
arxiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260820_R2_deepseekv4proh20multisceneoptimizationshortvideoscript.md 标题:H20 逼近 B300 · 1.6T MoE 工程实证(14 字 · 5/…
视频脚本 arXiv:2608.14376 2026-08-20
LakeQuest:面向数据湖根植式问答的三领域基准
论文提出 LakeQuest——一个人工校验、跨 AI/ML 元数据 / 零售银行 / 多模态生物医药 三领域的 9,846 条根植式问答基准,每个问题都附带 modalityaware 的证据指针,专门用来评估「在真实数据湖上做端到端检索 + 综合」全流程;并通过基线实验证明:高质量检索并不保证正确推理,现代 RAG…
深度解读 arXiv:2607.12310 2026-08-20
PalmClaw:手机端原生在设备运行的 Agent 框架
论文提出 PalmClaw——一个完全运行在手机端的开源 Agent 框架,把 session、memory、skill、tool 与 agent loop 都搬到本地:它把手机能力以「device tool」形式暴露给 LLM,每个动作都带显式参数与结构化结果、清晰执行边界;实验显示相对最强基线取得 +11.5% 相…
深度解读 arXiv:2607.13027 2026-08-20
揭秘 Agent Skill:为什么它们有效——直到失效
Agent Skill 不是在"注入新知识",而是在"把噪声轨迹压缩成稳定执行的过程性锚点"——它有效是结构性的,但这个结构的脆弱性同样决定了它何时会失效。 LLM agent 框架过去一年普遍引入"Skill"机制:把工具调用模式、错误恢复策略、工作流模板打包成结构化知识包,让模型在推理时按需加载,以期提升任务成功率…
深度解读 arXiv:2608.14036 2026-08-20
当 AI 助手被"教会"攻击自己——为什么 80% 的 Agent 风险藏在"看不见"的地方
你昨天让 AI 帮你订机票、写邮件、改代码。它很聪明、很快、看起来"无害"——但你知道吗?它背后那个叫做 Harness 的"工具壳",正可能是整个系统最脆弱的一环。 arXiv 2608.17597(HarnessRisk)做了一件没人做过的事:把 Agent 系统从"装好工具 → 执行任务 → 出错就修"这条线,拉…
科普版 arXiv:2608.17597 2026-08-19
LATO.2:基于顶点流与拓扑流分解的 3D 网格生成
LATO.2 把 3D 网格生成拆成两阶段:先学"顶点几何流(vertex flow)",再学"以已实现顶点为条件的拓扑流(connectivity flow)"——两阶段都锚定同一个粗体素支架(coarse voxel scaffold),由两套专用 VAE 把离散拓扑也嵌入到连续潜空间。论文称在几何保真度与连通性质…
深度解读 arXiv:2607.10623 2026-08-19
Evidence-Backed Video Question Answering:用像素级证据回答视频问题
论文提出 EVQA(EvidenceBacked Video QA) 这一新任务:模型必须同时输出"语义答案 + 像素级时空证据(时间片段 + 稠密、跟踪的物体 masklet)";配套发布首个人工验证的双重 grounding benchmark STEvidence,以及 16 万规模、衔接高层推理与细粒度 gro…
深度解读 arXiv:2607.11862 2026-08-19
EgoSteer:从第一人称视频出发的可控制灵巧操作系统
EgoSteer 是一个全栈(fullstack)系统:用 EgoSmith 数据管线把野外第一人称(egocentric)人类视频清洗成 9600 小时高质量预训练数据,配套一套遥操 + 人在回路纠错的统一机器人栈,再训练一个带世界模型增强的 VLA(VisionLanguageAction)——EgoSteer。它…
深度解读 arXiv:2607.09701 2026-08-19
MET:理论支撑且文化感知的多语言道德推理
论文给出三件套:MCLASH 多语言道德决策 benchmark(覆盖文化情境化的道德直觉与社会规范)、MET(Multilingual Ethics with Theorygrounded reasoning)两步提示法(先按情境/文化选"理论依据",再用用户母语推理)、METD 自蒸馏训练(无需外部监督即可加强第二…
深度解读 arXiv:2607.11736 2026-08-19
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
BooguImage0.1 是一个完全开源的统一多模态图文模型家族(Base / Turbo / Edit / EditTurbo 四款变体),在约 40 万美元的受限算力预算下,通过系统性提升模型理解能力、数据质量与训练流程,并引入 Agent 化的推理时缩放(agentic inferencetime scalin…
深度解读 arXiv:2607.13125 2026-08-19
下一代云原生内存键值存储:从 Redis 到 Valkey 的全景评测
⚠️ 重要前置事实:本文 v1 由第一作者撤回(arXiv:2510.19805v2 已 withdrawn),原作者声明"未被告知也未同意发表,且报告的数值结果存在多处重大错误,相关结论不被基准数据支持"。本文解读基于公开 v1 摘要与 TLDR,作为「该问题域的存在性证明」与「评测方法学参考」使用,不应直接引用其具…
深度解读 arXiv:2510.19805 2026-08-19
CATS:内存受限设备上的自投机级联验证推理加速
论文全名:Cascaded Adaptive Tree Speculation for MemoryLimited LLM Inference Acceleration(arXiv:2605.11186v1,20260511,作者 Yuning Han 等)。本研究面向边缘设备上 LLM 自回归解码加速。 提出 CAT…
深度解读 arXiv:2605.11186 2026-08-19
ByteHouse:字节跳动的云原生实时多模态数据仓库
论文全名:ByteDance's CloudNative Data Warehouse for RealTime Multimodal Data Analytics(arXiv:2602.08226v2,20260209 第一版,作者 Yuxing Han 等字节跳动 ByteHouse 团队)。本文是字节跳动内部数据…
深度解读 arXiv:2602.08226 2026-08-19
Experience as a Compass: Multi-agent RAG with Evolving Orchestration and Agent Prompts
HERA 是一个分层演化框架,通过全局编排拓扑优化与局部角色感知 Prompt 进化双层协同,让多 Agent RAG 系统在多跳知识推理任务上平均提升 38.69%,同时实现 emergent selforganization——稀疏探索自发收敛为紧凑高效的 Agent 网络。 多 Agent RAG(Multiag…
深度解读 arXiv:2604.00901 2026-08-19
Motion4Motion: Motion Transfer Across Subjects at Inference
Motion4Motion(M4M)是一个免训练(trainingfree)的跨主体运动迁移框架,彻底抛弃了传统的基于预定义人体骨骼结构的运动迁移范式,改为直接对视频中角色的 motion flow(运动流)进行建模,从而在推理阶段实现从人类到动物、从真人到卡通、从一种形态到任意物种的高质量运动迁移,无需任何骨架标注或…
深度解读 arXiv:2607.11644 2026-08-19
VideoRAE:用冻结视频基础模型做生成式表征自编码器
VideoRAE 提出 Representation AutoEncoder 范式:把冻结的视频基础模型(VFM,如 VJEPA 2、VideoMAEv2)当成「教师特征源」,用 1D selfattention projector 压缩多尺度层级特征得到紧凑 latent,再以 localglobal 表征对齐替代传…
深度解读 arXiv:2607.14088 2026-08-19
RAGU:把 7B 模型训成 GraphRAG 引擎核心,单卡可跑的开源多步管线
RAGU 是一个开源、模块化、pip install 可装的 GraphRAG 引擎,通过把"抽取"与"融合"解耦的两阶段管线 + 用 7B 的 MenoLite0.1 替代传统 32B+ 抽取器,在 GraphRAGBench (Medical) 上把 evidence recall 拉到 0.84(SOTA 对照 …
深度解读 arXiv:2607.11683 2026-08-19
How AI Agents Are Restructuring the Software Paradigm
本文从软件工程学科视角,论证 AI Agent 的出现是对"软件"本身的根本性重构——从"代码是决策逻辑的载体"到"Agent 本身就是软件,决策逻辑在运行时生成",并提出 Agentic Engineering 作为扩展软件工程学科的新范式。 过去半个世纪,软件工程建立在同一套基础假设上:人类工程师分解问题 → 将决…
深度解读 arXiv:2606.05608 2026-08-19
AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases
AgenticRAG 在现有企业搜索基础设施之上叠加一层轻量级 Agent harness,为推理型 LLM 配备 search / find / open / summarize 工具,实现迭代式检索、跨文档导航与证据自主分析,在 FinanceBench 上达到 92% 正确率——比传统 RAG 高出 3.8 倍,…
深度解读 arXiv:2605.05538 2026-08-19
MathForm:用知识检索与验证驱动迭代,把数学自动形式化从「翻译」拉到「可用」
MathForm 把「自动形式化(autoformalization)」从一个靠模型死记 Mathlib 的「翻译活」重做成一条「检索 + 编译器反馈 + 语义一致性反馈」驱动的数据训练流水线,并在 6 个 Lean 4 基准上用 8B 模型打平乃至超过多个专用 32B 形式化器。 数学自动形式化长期有两个隐性失败模式…
深度解读 arXiv:2608.14221 2026-08-19
视频选题榜 · 2026-08-15
v2 重写覆盖(承接 20260819 反思棒 §3"7 天最弱单篇"识别 · 覆盖原 v1 = 545 字节 / 9 行 / 2 entries / 缺 R2 round) 触发:20260819 21:40 CST 反思棒明确把 815 selection 列为 7 天(813 ~ 819)最弱单篇 v1 4 重塌…
选题榜 2026-08-15
AgentKGV:让小模型也能"查到底"的知识图谱事实核查——动态路由 + 迭代查询改写 + 蒸馏 SFT + GRPO 把检索调用砍掉一半
你有没有遇到过这种瞬间 🔍: 你问 AI:"A 是 B 公司的创始人吗?" 它自信回答"是"。 然后你点开参考来源,发现文档里写的是"B 公司 创立于 1998 年,由 C 创立"——A 只是早期投资人,根本不是 founder。 AI 答错不是因为不会推理,而是因为它没找到真正能反驳/支持这个三元组的证据。这种"答得…
科普版 arXiv:2607.09092 2026-08-19
Personalized Auto-Research:面向真正的 AI 协作科学家的个性化研究框架
当前 SOTA AI coscientist 系统以"研究者无关"的方式优化 novelty、validity 或 reviewer score,忽略了科研工作的本质:什么算创新、价值或可行,取决于具体研究者。Personalized AutoResearch 首次提出将研究者个体建模为研究过程的核心条件,通过"图锚定…
深度解读 arXiv:2608.14881 2026-08-19
HarnessRisk:面向 Agent Harness 全生命周期的安全基准
HarnessRisk 是首个覆盖 Agent Harness 从配置、扩展、运行、状态持久化、动作控制到事件恢复全生命周期六阶段的安全基准;在 128 个沙箱测试用例上,攻击成功率从 12.6% 到 80.9%,Utility 维持在 75.0%–97.6% 之间,揭示了现有安全评估只看单点攻击、忽视多阶段协同失效的…
深度解读 arXiv:2608.17597 2026-08-19
主题综述 · RAG(2026-08-16 · v2 重写版)
重写说明:v1 三项硬约束失守——(1) 8 篇主稿全 arXiv 8 月批次 v1 预印本,0 篇公开 GitHub / 0 篇公开权重 / 0 篇明示评测脚本;ParliamentRAG(2608.13410)S2 被引 0 + OpenAlex 被引 0 + 影响力被引 0 → "全 0 元数据"高风险;(2) …
周综述 2026-08-16