Explainers · 学术推广产出

解读

1541 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统
Dziri Voicebot 是首个完整的阿尔及利亚方言(Algerian Darija)端到端语音对话系统,通过模块化 Pipeline 整合 ASR / NLU / RAG / TTS,在低资源标注数据极度匮乏的条件下,ASR 达到 13.74% WER,NLU 意图分类与实体识别均获高分,语音合成质量稳定,为方言…
深度解读 arXiv:2606.26003 2026-08-14
Randomized YaRN:用 OOD 位置课程让长上下文推理真正泛化
Randomized YaRN 在训练阶段把 YaRN 位置外推与随机位置采样 + 长度课程结合,让模型在短上下文数据上就见到 OOD 位置分布,从而把长上下文推理能力从 8K 训练窗口推广到 16K ~ 128K——在 BABILong 与 MRCR 两个高难度推理基准上一致优于标准 finetune,最大增益出现在…
深度解读 arXiv:2606.23687 2026-08-14
当 AI 还在凭"长相"认人时,2013 年的这篇综述就告诉你:距离才是核心
你有没有试过让 kNN 分类器跑一个真实业务? 鸢尾花上准到 96%,换到人脸识别就掉到 60% 出头——不是因为模型不行,是距离函数用错了。 欧氏距离把人脸的高维像素"摊平"到一根尺上,鼻子到眼睛的距离和嘴角到下巴的距离等量齐观——但人眼根本不是这样认人的。我们看的是"五官比例的协调",是"局部关系的匹配",是一个有…
科普版 arXiv:1306.6709 2026-08-14
AutoPrune:让 LLM 自己设计视觉 Token 剪枝算法的 AI4AI 框架
AutoPrune 把视觉 Token 剪枝"算法设计"本身当成搜索问题,用 LLM 在一个叫 TPDSL 的小型领域语言里搜索"对强基线策略的残差修改",不必训练任何模型就能在 14 个多模态基准、3 个 MLLM backbone 上做到「砍掉 94.4% 视觉 token,仍保留 99% 全 token 性能,F…
深度解读 arXiv:2608.07193 2026-08-14
LLMRouter:让 LLM 路由研究从"东拼西凑"走向"统一基础设施"
LLMRouter 把"模型路由"这种"看似简单、实则接口混乱"的任务抽象成一个 5 组件的序列决策过程(context encoder / model encoder / scoring function / decision rule / learning signal),并配套发布了 xRouteBench 基准…
深度解读 arXiv:2608.06867 2026-08-14
LiveAnimate:实时长流人体动画的 14B DiT 方案
LiveAnimate 是首个同时实现实时流式与稳定长视频的十亿级(billionscale)人体动画系统,基于 14B 参数的视频 Diffusion Transformer(DiT),通过两阶段训练把双向 DiT 改造为块因果自回归生成器,并以 PoseRetrieval Sink Attention(PRSink…
深度解读 arXiv:2608.11745 2026-08-14
H2R-Bench:评估视频世界模型从人到机器人跨具身迁移能力
H2RBench 是一份评估"视频世界模型把第一人称人类操作视频转换成机器人视角操作视频"能力的系统化基准,覆盖 11 个 SOTA 模型 × 6 类操作任务 × 2 种机器人具身,用五维指标诊断当前模型在跨具身迁移上的真实瓶颈,结论是当前 SOTA 在 embodiment consistency、functiona…
深度解读 arXiv:2608.13049 2026-08-14
ParliamentRAG:意大利议会辩论的权威感知多视角检索增强生成
ParliamentRAG 是一套面向意大利众议院辩论记录的 RAG 系统,核心贡献是话题相关的发言者权威模型(topicdependent authority model),把发言者的职业、教育、过往发言等可解释特征与当前查询绑定,联合缓解高频发言人主导、专长无法加权、引用错配三大政治敏感文本 RAG 风险,已被 I…
深度解读 arXiv:2608.13410 2026-08-14
AI 帮你看财报,你敢信吗?——一份 2026 年的金融 QA 评测,给"指标单一"这件事狠狠打了脸
你有没有想过一件事 🤔: 你在某银行 App 里问"2024 Q3 净利润多少"——AI 助手秒答:"约 35 亿美元"。 你信吗? 按说,这种"金融短答案问答"系统应该已经很成熟了——但 2026 年的一份评测直接揭底: 前 4 名的 ROUGE1 F1 差距不足 1 个百分点——但具体数字完全没公开。 这是 arX…
科普版 arXiv:2607.19867 2026-08-14
Deep Research Agent 烧钱太快?这篇论文告诉你:问题不在模型,在"哪里丢 token"
你有没有这种感觉 🤔: 每次让 ChatGPT / Gemini / Claude 帮你"深度研究"一个开放问题—— 比如"调研一下 2026 年有哪些 AI Agent 框架值得学"—— 上下文窗口跑着跑着就撑满了,钱也跟着飞。 最离谱的是——最后看报告,发现大量段落其实没什么用。 为什么? 因为现在几乎所有 dee…
科普版 arXiv:2608.08389 2026-08-14
主题综述 · multimodal(2026-08-14)
承接 810 综述四象限(原生多模态基座 → VLA / 世界模型具身 → 评测 / 生成质量 → 鲁棒性 / 安全),811 ~ 814 这 4 天的多模态研究出现三条合流信号: 1. 世界模型从「视频预测 + 反向动力学」切到「训练期当陪练 + 推理期丢弃」(SimWAM),再推进到「读扩散潜做轨迹预测」(Drea…
周综述 2026-08-14
Vibe-Coded 应用的安全困境:当 AI Agent 接管软件开发
论文系统研究了"vibe coding"——用户通过自然语言与 AI Agent 协作开发应用——这一新范式下的安全态势,构建了"AI Agent 辅助审计 + 人工验证"的漏洞分析框架,揭示 VibeCoded 应用存在三类特有漏洞模式(占位逻辑、未过滤输入、密钥泄露),根因是 Agent 的记忆丢失、局部目标优化与…
深度解读 arXiv:2606.23130 2026-08-14
RaysUp:基于几何感知光线表示的超轻量通用特征上采样
RaysUp 将特征图上采样从 2D 插值空间「升维」到几何感知的光线(Ray)域,以仅 AnyUp 16% 的参数量实现了 7 倍推理加速且精度全面超越,打破了通用特征上采样长期无法同时兼顾语义保真度与效率的困境。 预训练 Vision Foundation Model(VFM,DINO 系列、CLIP 系列、Sig…
深度解读 arXiv:2606.22749 2026-08-14
AOHP:面向个性化、高效与安全交互的开源操作系统级 Agent 框架
AOHP(Android Open Harness Project)将 Android 操作系统改造为「以 Agent 为一等公民」的运行时——在 AOSP 之上引入自适应 UI、并行后台执行、跨应用记忆和安全信息流追踪,使 AI Agent 在移动端的任务完成率提升 21%、Token 消耗和延迟近乎减半,从根本上重…
深度解读 arXiv:2606.23449 2026-08-14
概念驱动的视觉注视目标估计:GazeAnywhere 与 PGE 新范式
一句话结论:把野外注视目标估计(gaze target estimation)从「检测头框→估计姿态→回归视线」的多阶段脆弱管线,改造成一个端到端、可自然语言或视觉提示(promptable)的概念驱动范式 PGE,配套发布 120K 数据集 GazeCo 与首个 PGE 模型 GazeAnywhere,在多个 ben…
深度解读 arXiv:2608.11367 2026-08-14
Mechanist:作为科学仪器的 AI,自主发现智能的机制
一句话结论:Mechanist 把 AI 当"科学仪器"使用——构建约 13000 篇可解释性论文的知识图谱 + 26 个学科 4300 万篇的多学科语料库 + 32 个机制分析/因果干预/验证的基础方法库,组合成 agentic 系统,让 AI 自主提出关于模型行为的机制假设并执行实验,与 Claude Code 与…
深度解读 arXiv:2608.12036 2026-08-14
Ready Cohorts:LLM-Agent 控制中界定 GPU 机会并避免 Host 来回
一句话结论:Ready Cohorts 把 LLMagent 服务里"模型调用 ↔ 工具调用"的确定性小转换形式化为两个可度量闸门——deadlinefeasible cohort supply(F / P / U / A 四量纲)与 observation placement(设备驻留决策是否绕开 host roun…
深度解读 arXiv:2608.12123 2026-08-14
参数空间探索的变分视角:3PO 让 RLVR 摆脱温度缩放束缚
首段自检(机制 N 段 + 工程 M 段 + ⚠️ 数字核验 K 处)。 自报条数:机制 3(§3 parameterspace posterior / §4 3PO 策略族 / §5 rollout grouping 与 reward 估计)/ 工程 2(§6 实验配置 OLMo3 + Qwen2.5Math / §…
深度解读 arXiv:2608.09805 2026-08-14
离散扩散的单纯形松弛(Simplax)
一句话结论:在不改 uniform discrete diffusion 主流程的前提下,用 Dirichlet–categorical 增广把每个被 corruption 的类别状态耦合一个单纯形辅助变量,推出可解析的 Rao–Blackwellized reversebridge 训练目标与对应采样器,让 deno…
深度解读 arXiv:2608.10615 2026-08-14
AI 在 360° 重建的秋叶原街考导航:最强 Gemini 只拿 17.1%,人类 77.3% —— 60 个百分点的"具身鸿沟"到底有多深
你有没有试过让 AI 帮你在陌生城市找路? 你给它一张街景图、问"附近有什么地标"—— 它答得头头是道。但一旦让它真的从 A 走到 B,半路就崩。 这是为什么? 因为今天大多数 AI 评测基准都长这样: 仿真渲染(Carla / AirSim) → 纹理过于干净 稀疏街道地图(VLNCE / Touchdown) → …
科普版 arXiv:2608.08814 2026-08-14
AI Agent 跨天跨月不"长记性"?这篇论文把"谁能写、写什么、何时生效"做成了协议级硬约束
你有没有想过一件事 🤔: 你让一个 AI Agent 跨天、跨周帮你管项目—— 它今天告诉你的"待办清单",三个月后可能根本不是它真正看到的事实。 为什么? 因为 Agent 跨天运行的时候,模型、工具、后台 worker 都在不停地往共享状态里写。旧版本模型还拿着过期凭据在写、外部工具读到了没经过权限校验的中间状态、…
科普版 arXiv:2608.11632 2026-08-14
2608-08814
date: 20260814 round: R2 arxiv_id: 2608.08814 source_script: /shared/videokb/scripts/tom/20260814_R2_360cityarena360embodiedurbannavshortvideoscript.md <! mirro…
视频脚本 arXiv:2608.08814 2026-08-14
Memory for Autonomous LLM Agents:机制、评估与开放前沿
这是一份把「LLM Agent 记忆」从工程经验拉回到可分析、可设计、可评估的工程学科的综述:作者把记忆建模为 write–manage–read 闭环,给出时间范围 / 表示基底 / 控制策略三维分类法,覆盖 2022 至 2026 初的五大机制族与四大评测基准,并明确指出现有系统「在多轮、跨会话、长程决策」上的顽固…
深度解读 arXiv:2603.07670 2026-08-14
AI Agent Reliability:12 个指标把「成功率」拆成可工程化的四维画像
本文撕掉「用单一成功率评估 Agent」的做法,提出 12 个具体指标把 Agent 可靠性分解为 consistency(一致性)/ robustness(鲁棒性)/ predictability(可预测性)/ safety(安全性) 四维,在 15 个模型、2 个 benchmark 上证明:能力分数持续上涨,可靠…
深度解读 arXiv:2602.16666 2026-08-14
Diffusion-LLM:分布感知 Diffusion + LLM 融合,实现鲁棒超长期时间序列预测
DiffusionLLM 创新性地将条件扩散模型(Conditional DDPM)嵌入 LLM 预测管道,以「分布感知正则化」方式同时解决 LLM 跨模态对齐难题和长期预测的均值回归问题——在 ETT、Weather、ECL 等 6 个基准上全面超越现有 LLMbased 方法,尤其在超长期预测(3000+ 步)和少…
深度解读 arXiv:2606.23391 2026-08-14
Character-Aware Neural Language Models:从字符出发的神经语言模型
仅以字符序列作为输入的神经语言模型在英语 Penn Treebank 上即可与当时最强词级 LSTM 基线持平(且参数减少约 60%),并在阿拉伯语、捷克语、法语、德语、西班牙语、俄语等形态丰富语言上一致超越词级/语素级 LSTM——证明"对很多语言,字符级输入已足够"。 2015 年的神经语言模型主流仍是 wordl…
深度解读 arXiv:1508.06615 2026-08-14
Lumiere Project:基于 Bayesian 用户建模推断软件用户的目标与需求
Horvitz 等在 Lumiere 项目中把"用户建模"显式建模成 Bayesian 推理问题——以概率与效用为统一框架,从用户背景、动作、查询中推断其时变目标与需求,并将整套思路落到 Microsoft Office '97 Office Assistant 这一大规模商用智能助手中。 1990 年代中期的智能助手…
深度解读 arXiv:1301.7385 2026-08-14
SkillZip:面向可扩展 Agent 技能库的契约保持型图压缩
SkillZip 把 LLM Agent 的"技能库"显式建模成可执行过程图,在 sectionlevel 进行契约保持型压缩——把反复出现的合法子图改写成可逆的 ported macro,保留边界签名、依赖闭包、verifier 可达性、源码可展开性,从而在 3.46× 压缩率、99.2% 依赖保留、98.7% ve…
深度解读 arXiv:2608.05604 2026-08-14
AFTER:评估 LLM Agent 程序性记忆的 382 个企业任务基准
AFTER 是评估「程序性记忆(procedural memory)」在 LLM Agent 中的可迁移性基准:382 个真实企业任务 × 6 个专业角色 × 22 项程序性技能;关键发现是——程序性记忆确实在工业流程中稳定提升 3.7–6.7 分,但部分技能会退化为角色专属,迁移后失效;且多模型执行轨迹混合演化出的技…
深度解读 arXiv:2606.23127 2026-08-14
当置信度走上歧路:诊断 RAG 中的「检索状态锁定」
RAG 系统的「置信度」经常被骗——同一个坏掉的检索状态会反复产生高度一致的错误答案,传统「多次采样看一致性」的不确定性方法对此完全失效;本文把这现象命名为「retrievalstate lockin」,给出可测量的诊断信号与一条「答案/证据/检索状态三方一致才接受」的决策规则。 RAG 系统里一个常见做法:用 LLM…
深度解读 arXiv:2606.22728 2026-08-14