Explainers · 学术推广产出

解读

1527 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

当 AI 学会"看图听指令"——2023 年这篇被引 3871 次的论文,第一次让视觉模型真正"听懂人话"
你用过 GPT4V、Gemini、QwenVL 这种能"看图"的多模态 AI 吗? 如果你觉得它们"好像懂你在说什么"——不是错觉。但这种"懂",并不是从天上掉下来的。 2023 年之前,整个 visionlanguage(视觉语言)圈子都有一个尴尬: 图像模型很会"看",但很不会"听人指挥"。 你给一张图,它能做图像…
科普版 arXiv:2305.06500 2026-08-21
MoE-ViE:面向图像与视频理解的细粒度混合专家视觉编码器
MoEViE 把 LLM 侧的细粒度 MoE 范式搬进 CLIP 式视觉编码器,用「细粒度专家拓扑 + 无辅助损失均衡 + 帧级蒸馏 + 专用 MoE kernel」四件套,在不到稠密基线 76% 推理时延下匹配 1.7× 参数量 SOTA 编码器的零样本性能,搭配 LLM 后在多模态基准上压过激活参数多至 5× 的同…
深度解读 arXiv:2608.17402 2026-08-21
LEGO-RL:把策略梯度塞进原生编码 Agent Harness
LEGORL 给「已经在跑 OpenHands / Claude Code / OpenCode 这种长链路编码 Agent harness」的团队一套外挂式的策略梯度 RL 训练框架,不改 harness 内部一行控制流,靠进程内 LLM proxying + 沙箱编排 + 可观测插件,把 Qwen3.535BA3B…
深度解读 arXiv:2608.17393 2026-08-21
FAR:把数学发现流水线从「挑题」改造为「方向 → 级联 → 复核」
FAR(Find / Attempt / Recommend)提出了一种新的人机协同数学发现范式:人类输入不再是一个具体问题,而是「研究方向」;系统沿「Find 检索 → Attempt 推理 → Recommend 筛选」三级级联把 5,245 篇 combinatorics 论文过滤到 77 条送审,最终在 Dav…
深度解读 arXiv:2608.16977 2026-08-21
打破失败级联:面向医学多模态推理的步骤感知强化学习(MRPO)
MRPO(Medical Reasoningaware Policy Optimization)是一种面向医学多模态 VQA 的步骤感知 RL 算法,它在最终答案错误时对早期无效推理步施加指数级递增的惩罚,从而把"早期一错、步步皆错"的级联失败从 64% 砍到 13%,并在 Qwen3VL8BInstruct 上反超规…
深度解读 arXiv:2606.31825 2026-08-21
AgentCompass:把 Agent 评测拆成 Benchmark / Harness / Environment 三层的统一基础设施
本文提出 AgentCompass——一个开源、轻量、可扩展的 LLMAgent 评测基础设施。它把整个评估流程拆成 Benchmark / Harness / Environment 三个独立组件,配上容错异步 runtime 与轨迹分析工具,原生支持 20+ 个 benchmark、五大能力维度,让团队不必再为"换…
深度解读 arXiv:2607.13705 2026-08-21
RxBrain:具备语言-视觉联合推理与想象的具身认知基础模型
提出 HyEmbodiedRxBrain,用一套多模态 MixtureofTransformers 架构把"语言视觉联合推理与想象"塞进同一段规划序列,并以视频自动化流水线构造"文本规划+视觉状态对齐"的训练监督,使模型在无需大规模动作数据预训练的前提下具备真机操作能力。 具身智能长期存在两种割裂的范式: 1. VLM…
深度解读 arXiv:2607.14187 2026-08-21
把秘密写在上下文里,模型替你悄悄泄露——Inadvertent Context Leakage
论文揭示了一种系统性的"非对抗性"上下文泄露:把 2 位/4 位秘密(密码片段、SSN 段、卡号段等)放进模型上下文,模型即便在直接询问时拒绝输出,也会把秘密信息以"统计相关性"的形式泄露到日常无害输出里;8 个商用模型在受控实验中,2 位秘密几乎可被完美重建,4 位秘密 82% 精确匹配,且更强的指令遵循能力反而放大…
深度解读 arXiv:2608.19857 2026-08-21
Repo0:从自然语言一路生成整库的"设计驱动"代码 Agent
Repo0 把"从需求建一个完整软件仓库"这件事从单轮 LLM 直生成,升级为先维护一张显式架构状态(DualDAG),再用模块化指标驱动的结构演化收敛到一个稳定架构,最后才进入 TDD 代码生成;在 RepoCraft 6 个真实仓库上比最强基线 RPG 的 Functionality Coverage 提升最多 2…
深度解读 arXiv:2608.19854 2026-08-21
FlashPrefill V2:把 block-sparse 预填充推到生产的注意力后端
FlashPrefill V2 用"均值修正 + PackGQA/warp specialization/pingpong 流水线 + paged KV/continuous batching"三件套,把 blocksparse 预填充从算法原型推到生产可用的 attention 后端,在 H20 GPU、128K 上…
深度解读 arXiv:2608.19758 2026-08-21
让 LLM 用低资源语言思考:SFT 搭骨架、RL 修缺陷、准确率却看不到的变化
把三个前沿 MoE 模型(Alibaba / OpenAI / NVIDIA 各家,激活参数 3.64.0B)微调到用希腊语这种低资源语言推理,准确率 benchmark 几乎不动——因为 benchmark 本身在该尺度上噪声太大(仅换随机种子就能移动 7.7 分,比所有数据/配方效应都大);真正的变化藏在"准确率看…
深度解读 arXiv:2608.17744 2026-08-21
4DAnyone:单目视频生成"可重建级"多视角,再提升到 4DGS
4DAnyone 把"单目视频 → 4D 人体重建"拆成两步——先用相机可控视频扩散模型生成"可重建级"的多视角一致视频,再把这些视频提升到 4D Gaussian Splatting(4DGS);针对 DiT 单次前向注意力容量有限导致的"分组建模"瓶颈,分别用 Reference Context Packing(把…
深度解读 arXiv:2608.20335 2026-08-21
NARU:面向日语超长视频的叙事演进与文化微妙理解基准
NARU 是一个针对日语长视频的「叙事演进 + 文化微妙」双轨评测基准:1481 道题、155 段视频、共 146.8 小时,横跨 4 个叙事维度与 5 个文化维度,揭示现有 MLLM 在长程叙事整合与文化语境推理上同时存在显著短板。 长视频理解评测长期被两类任务统治:孤立事件检索(谁在第几分钟推开门)和显式动作问答。…
深度解读 arXiv:2608.13210 2026-08-21
NAPE:用「下一段嵌入预测」做极简自监督音频学习
NAPE(NextAudioPatchEmbedding prediction)把 LLM 时代「下一 token / 下一 embedding 预测」的因果范式搬到 logmel 频谱上:只用一个因果 Transformer + causal mask + stopgradient,无重建解码器、无声学 tokeni…
深度解读 arXiv:2608.19863 2026-08-21
超越记忆:面向长寿 AI Agent 的事务性连续性内核
Continuity Kernel(CK)将 AI Agent 的长期状态管理从"存储保留"升级为"带权限验证的正式激活协议",以分支头谱系代替版本号、以原子事务代替直接覆写,为跨越多年运行的 Agent 提供 Persistent Cognitive Identity(PCI)基础设施。 当一个 AI Agent 持…
深度解读 arXiv:2608.11632 2026-08-21
基于 Skill-Harness 演化的自演化具身智能体
SHAPER 提出免训练(trainfree)的具身智能体自适应框架:冻结 VLA 模型的权重参数,通过目标环境 rollouts 演化可复用的文本 skill 与 contextcode harness,让同一个冻结模型既能做规划器(planner)又能做优化器(optimizer)。 将基础模型部署到具身智能体时,…
深度解读 arXiv:2608.11350 2026-08-21
利用检索增强 LLM 构建用于复杂系统诊断的动态主逻辑知识图谱
KGDML 框架将 RAG 与 LLM 结合,实现从技术文档自动构建动态主逻辑(Dynamic Master Logic)知识图谱,使 LLM 能对核电站级复杂系统进行可追溯的诊断推理——包括故障传播方向推断、安全性评估和依赖追溯。 Complex engineered systems(核电站、飞机引擎、工业控制系统)…
深度解读 arXiv:2608.12304 2026-08-21
视频选题榜 · 2026-08-16
v2 重写覆盖(承接 20260821 反思棒 §3 "7 天最弱单篇"识别 · 覆盖原 v1 = 626 字节 / 4 行 / 23 entries / 5 段标配全缺) 触发:20260821 21:40 CST 反思棒明确把 816 selection v1 列为 7 天最弱 selection 单篇(820 棒…
选题榜 2026-08-16
Agent + RL 的训练-部署鸿沟:一份科普级解读(事实守约版 · A/B/C 类不确定性划分已落实)
⚠️ 事实守约声明 · A/B/C 类划分版(20260821 反思棒修订) 本稿解读对象是 arXiv 2608.17528("Agent Lightning v1.0" 提案)。上一版(820 21:30 重写版)反向创造了错误的不确定性——把 TLDRverifiable 知识(3,500 行代码 / 5 个工程…
科普版 arXiv:2608.17528 2026-08-21
量化 ASR 模型对公开基准的"过拟合":从行为探针到因果干预
自检:机制 1 段 + 工程 2 段(行为探针 + 因果干预)+ ⚠️ 数字核验 3 处 + 反方 1 段 + 跨主线合流节点 1(v33 评测治理)。 公开 ASR(Automatic Speech Recognition,自动语音识别)基准(LibriSpeech / CommonVoice / GigaSpeec…
深度解读 arXiv:2608.19936 2026-08-21
主题综述 · multimodal(2026-08-21)
本综述聚焦 20260809 → 20260821 窗口的多模态研究。HF Daily 单日 ≈ 6 件 multimodal 主分类候选,立标池双向锚进入 v33 以来首次 8 向并存实测(819)并向 9 向并存预备(821),评测方法学延革第 810 例反方立基础候选全部完成。围绕四条主线:(A) 长视频理解与评…
周综述 2026-08-21
Chain-of-Experience:让 LLM 在推理时持续从经验中改进
ChainofExperience(CoE)把"LLM 在测试时通过多轮交互累积经验、形成超越 zeroshot 的持续改进回路"作为一类正式问题建模,并用 8 个主流 LLM(含 GPT5 / Gemini2.5 Pro / Claude4.5 Sonnet)在数学、编程、知识三类任务上验证:仅靠自反馈就能稳定超越无…
深度解读 arXiv:2608.18027 2026-08-21
SWE-bench Science:科学软件工程是否仍是 Coding Agents 的硬骨头
SWEbench Science 用 119 个真实科学软件工程任务(来自 98 个 GitHub 仓库、跨 20 个科学领域)建立仓库级评测基准,结果显示最强编码 Agent(Claude Code + Opus5 max)pass@1 也低于 50%;同时通过配对消融证明:科学知识并不总是正面增益——对齐良好的领域…
深度解读 arXiv:2608.19799 2026-08-21
标签贵到买不起?12 年前这篇 NeurIPS 论文,用 VAE 把"无标签数据"变成了救命稻草
如果你做医学影像标注,你一定算过这笔账💸:请主任医师标一张 CT 要 30 分钟、5000 张就要 2500 小时;但医院每天能攒下来的无标注影像,5 万张都不止。问题是——这些无标签数据,真的就扔掉吗? 2014 年 Kingma 等人在 NeurIPS 上发表了一篇叫 "SemiSupervised Learnin…
科普版 arXiv:1406.5298 2026-08-21
你的图神经网络训不出深度?10 年前 ICLR 这篇论文,把 GNN 升级成了「序列预测器」
你有没有遇到过这种情况🙋:跑 GNN 训练,2 层还行,3 层就开始 loss 抖、4 层直接 NaN;想从图里吐出一串节点标签(比如代码搜索里"按依赖顺序输出函数调用链"),但手头的 GCN/GraphSAGE 只能给你一个节点分类,序列根本出不来? 如果你点头了——你踩到的两个坑,刚好是 2016 年那篇 GGSN…
科普版 arXiv:1511.05493 2026-08-21
视频选题榜 2026-08-21
· DecisionMetric Alignment in Latent World Models: Diagnostics and ActionConditioned Objectives for MPC Planning · JEPAMPC 潜码欧氏距离 ≠ 真实奖励排序 · PlanReal Spearman +…
选题榜 2026-08-21
主题综述 · llm-infra(2026-08-21)
⚠️ 窗口双警示:(1)今日 821 spark llminfrae1prep 主棒缺位(沿用 820 18:40 落定棒);(2)CoRun / DASH / HBF Sucks 三件 arXiv 截至本棒尚无 paper_card,按"沿用 + 待建"标记。 承接 20260814 spark 综述「vLLM 0.…
周综述 2026-08-21
Self-Improvements in Modern Agentic Systems: A Survey
这篇 97 页综述将现代具备自我改进能力的 Agent 建模为"基础模型 + 运行支撑层"(prompt / memory / tools / 控制逻辑)的耦合配置,把 selfimprovement 形式化为一个自我驱动的更新算子,可作用于模型权重或 scaffold 组件,为理解、设计和评测 Agent 自我改进系…
深度解读 arXiv:2607.13104 2026-08-21
KeyFrame-Compass:迈向关键帧条件视频生成的综合评估
KeyFrameCompass 是首个面向"关键帧条件视频生成(keyframeconditioned video generation)"的综合评测基准与自动化打分框架,将关键帧执行拆成 6 个互补指标,并用证据驱动的 MLLM 判定整体视频质量,揭示了当前 9 个主流系统在"忠实执行关键帧"与"自然视频合成"之间存…
深度解读 arXiv:2607.14202 2026-08-21
DeepLoop:循环 Transformer 的深度扩展
DeepLoop 给"循环 Transformer(Looped Transformer)"提供了一套与参数访问次数对齐的残差缩放规则(residual scaling rule),通过一个一阶扰动上界与"访问对齐系数 κ_R"推导得到:当循环次数 N 增加时,PostLN DeepNorm 的指数必须从 1/4 上升…
深度解读 arXiv:2607.13491 2026-08-21