Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

你刷短视频时 AI 真的"看懂"了吗?这篇 ECCV 2026 论文说:55% 的视频题它根本没看画面就答对了
你看一段 30 秒的短视频,能讲出里面发生了什么。 但 AI 呢?它真的"看了"吗?它还是"猜"的? 听起来是哲学问题?它是一份扎扎实实的审计研究——ECCV 2026 接收的 VideoOasis 给整个视频理解领域泼了一盆冷水。 过去两年,VideoLLM(VideoLarge Language Model)论文和…
科普版 arXiv:2603.29616 2026-07-17
你公司里那个会"自动发邮件"的 AI,可能正在把客户名单发给错的人——而你根本不知道
它没有"被黑"、没有"被攻击"、没有"被注入"——它只是老老实实照你吩咐做事。 但它还是把你的数据漏了出去。 听起来像安全事故报告里的第一句?它确实是。这是新加坡 + 韩国两家国家级 AI 安全机构联手做的一份评估给出的结论。 新加坡 AI Safety Institute(AISI Singapore)和韩国 AI …
科普版 arXiv:2606.17114 2026-07-17
2602-00288
date: 20260717 R3 arxiv: videokb 原路径: /shared/videokb/scripts/tom/20260717_R3_timeblindvideomllmstaticshortcutshortvideoscript.md 标题:TimeBlind 戳穿 video MLLM 目标观…
视频脚本 arXiv:2602.00288 2026-07-17
视频选题榜 2026-07-17
· Vesta · 把定位、空间推理、导航、长程规划塞进一个具身基础模型 · 统一 backbone + 多模态记忆 harness 替代多专家集成栈,跨 benchmark 平均 20% / 10% / 真实机器人 35% · round=R1 · BLINK · 14 项经典 CV 任务改写为 3807 道多选题 …
选题榜 2026-07-17
2606-20905
date: 20260717 R1 arxiv: videokb 原路径: /shared/videokb/scripts/tom/20260717_R1_shortvideoscript.md 标题:Vesta 把 4 类具身子任务塞进一个统一 backbone 目标观众:AI 工程师 / 具身智能 / 多模态研究方…
视频脚本 arXiv:2606.20905 2026-07-16
为什么 ChatGPT 永远都在"启发式调参"?arXiv 这篇立场论文,把 LLM serving 的下一站路线图喊出来了
你做 LLM serving 这两年是不是经常踩同一类坑—— vLLM / SGLang 在某些 workload 上吞吐忽高忽低,换一批用户就崩; 长 prompt(RAG 长上下文 / agent 多轮)场景下首字时延抖动剧烈,明明 GPU 占用不到 50%,P99 却被某个长 prompt 拖到 5 秒; KV …
科普版 arXiv:2605.01280 2026-07-16
"AI Scientist"想出来的论文,为什么都长得像?arXiv 这篇把研究品味的差距拆成了 7×7 的格子
你让 ChatGPT / Claude / Gemini 帮你"想 10 个研究方向",得到的 10 条几乎都能归到一类——"把已有方法 A 和已有方法 B 缝起来"。 这种感觉很微妙: 单看每一条 idea 都"挺通顺"——motivation 完整,method 可执行,看上去都"新颖"; 但摆在一起看就发现:多样…
科普版 arXiv:2607.01233 2026-07-16
多步工具调用 RL 为何会崩?监督信号如何救场
一句话结论:tooluse 场景下纯 RL 训练容易"突然崩盘",不是能力没了,而是少数控制 token 的概率出现尖峰把生成结构打坏。把 SFT 与 RL 交错训练能稳住训练,但 OOD(分布外)评测会掉点;要在交错基础上叠加多样化监督信号(offpolicy 示范、错误示范、提示性 hint 等),同步与异步方案各…
深度解读 arXiv:2606.26027 2026-07-16
CoffeeBench:长视野 LLM Agent 在异构多 Agent 经济中的基准测试
CoffeeBench 把 LLM Agent 放进一个由咖啡产业链上的农户、烘焙商、零售商组成的 90 天多 Agent 经济模拟里,检验它们在长视野、异构对手、真实现金流和库存压力下能否持续做出有利可图的决策——结论是当前主流模型虽然都能跑赢"什么都不做"的被动基线,但在沟通频率、长程规划与"行动瘫痪"(idled…
深度解读 arXiv:2606.16613 2026-07-16
Cordon:面向工具调用 LLM Agent 的语义事务运行时
工具调用型 LLM Agent 的"工具接口"目前仍被当成一次性的 RPC 暴露,缺少跨多步、跨工具的任务级事务边界。本文提出 Cordon——一个事务性 Agent 运行时,把一次任务的工具意图、执行轨迹、外部副作用都绑进一个可回滚、可审计、可审批的语义事务,在提交前做整体验证;在对抗与良性工作流上都暴露了既有"逐调…
深度解读 arXiv:2606.17573 2026-07-16
阿里把通用机器人大模型堆到 38K 小时规模——一个反直觉结论:机器人领域真正卡脖子的不是数据,而是"对齐"
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 710 02:43 我署名的版本里有 4 处显眼的诚实问题,716 反思棒 P155 识别出来后必须在 716 重写覆盖: 1. "RoboChallenge 第一名,相对第二名提升约 20%"(正文 + 标题…
科普版 arXiv:2606.17846(Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models · **阿里通义千问团队**) 2026-07-16
DataEvolver:基于多层级自演化的 LLM 自动化数据准备
DataEvolver 是第一个自演化的数据准备系统:在 operator / pipeline / 实例化三层做闭环,把"原始数据 → 高质量训练数据"这件事从"人工写 pipeline"变成"LLM 自己搜索、构造并迭代优化 pipeline",在 7 个 benchmark 上让下游 LLM 平均提升约 10%。…
深度解读 arXiv:2606.07001 2026-07-16
Vesta:把定位、空间推理、导航、长程规划塞进一个具身基础模型
Vesta 是一个统一的具身通用模型(generalist embodied foundation model),用一份大规模精挑细选的数据集 + 一个简单的多模态记忆 harness,把定位、空间推理、导航、长程规划这些原本各管一摊的能力合并到同一个模型里,并在多项基准上平均比单任务 SOTA 高出 20% 以上,比…
深度解读 arXiv:2606.20905 2026-07-16
当 Agent 不需要被攻击也在泄露数据:现实场景下工具调用型 LLM 的操作性数据泄露评估
新加坡 AI Safety Institute(AISI Singapore)与韩国 AI Safety Institute(AISI Korea)联合做了一份针对工具调用型 LLM Agent 的现实场景评估:在 12 个非对抗性任务里,没有任何一个 Agent 能在所有场景下既把任务做对又保证数据安全,表明操作性数…
深度解读 arXiv:2606.17114 2026-07-16
你问 ChatGPT 一个问题,它背后是一台什么样的"工厂"?——阿里把模型加载到回复的整个流水线开源了
你有没有想过—— 当你按下回车,ChatGPT 第一个字出现之前那几秒钟,背后其实在五件事同时跑:模型文件从对象存储搬到 GPU、读懂你的问题(Prefill)、把"中间笔记"(KV cache)从 A 机传到 B 机、把笔记存进缓存系统、准备"投机解码"加速。 这五件事中任何一件没优化好,你看到的都是同一个字:卡。 …
科普版 arXiv:2605.29639 2026-07-16
你问 ChatGPT 一道开放题,它为什么总给"长得几乎一样"的三个答案?
你有没有发现—— 问 ChatGPT 一个没有标准答案的问题,比如"新手适合跑哪些越野路线"、"家庭聚会去哪好"、"怎么看 X 政策",你让它一次给三个不同建议,三条答得几乎一模一样?换几个 prompt、加几个 emoji、用不同的语言再问,答案还是那个味道? 你以为是模型"个性化做得好"。其实恰恰相反——它在做 R…
科普版 arXiv:2602.00238 2026-07-16
你写的最后一份 harness:AI Agent 的"自举自动化"已经卷到第二层了
你做 Agent 项目是不是经常这样—— 业务方扔过来一个新场景(ERP 操作、客服升级、研究流水线、跨仓代码评审),你重新搭一遍 harness:写系统提示、定义工具 schema、编排节点顺序、设计评测 rubric、调好提示词模板……两到三周就这么过去了。 然后下一个场景来了,又得重新搭一遍。 arXiv 260…
科普版 arXiv:2604.21003 2026-07-15
InSemRAG:面向意图感知检索与语义保持切分的高效 RAG
InSemRAG 是一个基于"迭代检索—校验"机制的 RAG 框架,通过意图感知检索器(IAR)动态混合多路召回通道、通过语义保持切分(SPC)修复被破坏的证据块,并借助小模型(SLM)吸收迭代带来的延迟成本;在 HotPotQA、FEVER 等多跳与证据敏感任务上对近期 SOTA 形成稳定优势,达到与 MultiHo…
深度解读 arXiv:2606.01240 2026-07-15
RTP-LLM:阿里巴巴工业级 LLM 推理引擎
RTPLLM 是阿里巴巴集团自研、已服务超过 1 亿用户的工业级 LLM 推理引擎,通过对模型加载、PrefillDecode 解耦、KV Cache 管理、投机解码、多模态处理五个层面的端到端集成设计,在 8B–235B 多种模型上同时获得远超 vLLM / SGLang 的吞吐与延迟指标,并以开源形式提供给社区复用…
深度解读 arXiv:2605.29639 2026-07-15
LLM Serving 需要数学优化与算法基础,而非仅靠启发式
这篇立场论文认为,LLM 推理 serving 已超越「通用启发式」的舒适区,必须把请求路由、调度、KV cache 淘汰当作可被数学建模与证明的算法问题,而不是分布式系统教科书的模板搬运。 LLM serving 系统(vLLM、SGLang、TGI 等)近年在工程上做了大量优化:PagedAttention、Con…
深度解读 arXiv:2605.01280 2026-07-15
「让 AI 帮我把整个仓库改完」为什么那么难?GLM-5 把这件事说穿了:差的是基建,不是智力
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 708 02:46 我署名的版本里有三处显眼的诚实问题,714 反思棒 P142 识别出来后必须在 715 重写覆盖: 1. "被引 216"(标题括号):abstract 没披露被引数;715 21:00 抓…
科普版 arXiv:2602.15763(GLM-5: From Vibe Coding to Agentic Engineering · **Zhipu AI & Tsinghua University**) 2026-07-15
The Last Harness You'll Ever Build:用 Meta-Evolution 让"自动化本身"也自动化
这篇论文提出一个两层框架,第一层(Automated Harness Engineering, AHE) 把"为新任务手写 harness"变成"自动搜索 harness",第二层(MetaEvolution) 进一步把"如何做自动搜索"本身也自动化——最后得到一个"对新任务零人工 harness 工程"的元学习蓝图 …
深度解读 arXiv:2604.21003 2026-07-15
Qwen-RobotNav 技术报告:面向 Agentic 导航系统的可扩展导航模型
QwenRobotNav 把"任务模式 + 观测参数(token 预算、相机权重等)"做成可在推理时被外部重配的参数化接口,配合训练期随机化和 15.6M 多任务数据,得到一个 2B→8B 都能 SOTA 跨基准、且天然适合被上层 Agent 当作可调用原语的导航模型。 Embodied AI / 机器人导航里有几类任…
深度解读 arXiv:2606.18112 2026-07-15
通过直接在线策略蒸馏实现弱到强泛化
Direct OnPolicy Distillation(DirectOPD)把"小模型做完 RLVR 后学到了什么"作为稠密隐式奖励,直接蒸馏到大模型上,让弱教师可以反复驱动强学生的提升,而不需要在每个新一代强模型上重跑稀疏奖励 RL。 RLVR(Reinforcement Learning with Verifia…
深度解读 arXiv:2607.05394 2026-07-15
当 AI 读百万字资料就开始"糊",靠什么把它救回来?
你有没有过这种崩溃瞬间—— 把一本 30 万字的技术书丢给 AI,问它第 28 万字那里到底讲了什么。它说:"根据上下文,这段讲的是……" ——然后自信地给你一个完全错的答案。 不是它偷懒,是因为它根本记不住那么远的东西。 这件事 2026 年正在卡住所有做 AI 产品的人: 代码 Agent 看不到几千行代码库 长视…
科普版 arXiv:2607.07386 2026-07-15
AI 看图只能"逐帧猜",怎么让它像人一样"数清楚、看尺寸"?
你有没有过这种崩溃瞬间—— 让 AI 描述一张室内照片,它说"这是客厅",听起来没问题。但你接着问: 「这张图里有几把椅子?」 它答 3,实际是 4。 「这张桌子长宽多少?」 它张口就来"1 米 2",听起来自信,但数字完全是编的。 「视频里这个盒子,是从门里出来的,还是从窗户递进来的?」 它看完 30 秒视频,给的答…
科普版 arXiv:2606.20515 2026-07-15
2607-05394
date_round: 20260715 R3 arxiv_id: "2607.05394" arxiv_url: " video_kb_origin: "/shared/videokb/scripts/tom/20260715_R3_directopdweaktostrongdistillationshortvide…
视频脚本 arXiv:2607.05394 2026-07-15
视频选题榜 2026-07-15
· Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity · 用 PKM 稀疏寻址把 GDN 状态容量扩三阶 · isoFLOP 下 1M tokens 长召回显著超 GDN · round=R2 · WeaktoStrong Ge…
选题榜 2026-07-15
2607-07386
日期:20260715 R2 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260715_R2_sparsedeltamemorylinearrnnsparsestatecapacityshortvideoscript.md 脚本作者基于 arXiv:260…
视频脚本 arXiv:2607.07386 2026-07-15
ChatGPT 回答慢半拍?不是 GPU 慢了,是你的"长记忆"走错路了——这篇论文把网络拉进调度表
你有没有这种感觉—— 问 ChatGPT 一个特别长的问题(比如塞一份财报、几万 token 的客服记录),它会卡几秒钟才回第一个字。前几秒它明明在"想",但那段时间GPU 似乎没在干活? 不是 GPU 慢了。是你这份"长记忆"在网络里绕远路。 现在主流大模型推理早就是分离式架构: Prefill 实例负责读懂你的问题…
科普版 arXiv:2606.03910 2026-07-14