Explainers · 学术推广产出

解读

1524 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

FlavourBench · 可执行真值给前沿 LLM 排名
日期与轮次:20260825 R2 · FlavourBench · 可执行真值给前沿 LLM 排名 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260825_R2_flavourbenchexecutablegroundtruthllmrankingsh…
视频脚本 arXiv:2608.20574 2026-08-25
视频选题榜 2026-08-25
· IAR: Inject, Align, Recover · 免检索后训练三段式把文档压进参数 · round=R1 · Repo0 · DualDAG 设计驱动代码 Agent · Functionality Coverage +20.08pp · round=R1 · AIDGuard · stateful au…
选题榜 2026-08-25
RAPID:基于检索增强的推测解码长上下文推理
RAPID 用 RAG 思路重构 Speculative Decoding:通过一个基于检索后短上下文工作的「RAG Drafter」为长上下文目标 LLM 起草候选 token,并设计推理时知识迁移机制使 RAG 分布得以增强目标分布,在 LLaMA3.1 与 Qwen2.5 上同时拿到 2× 以上加速与质量提升(例…
深度解读 arXiv:2502.20330 2026-08-25
LLM 推理在线调度的最优性视角:hindsight benchmark + 多项式在线算法
在 KV cache 内存约束下为 LLM 推理提出一个后视最优(hindsight optimal)基准——把"假设能看穿未来"的形式化为整数规划——然后证明确定性在线算法无法达到常数竞争比,并给出一个多项式时间在线调度算法,在合成和真实数据集上都明显优于 vLLM 等基线。 LLM 服务系统每秒钟都在做一类隐式决策…
深度解读 arXiv:2502.07115 2026-08-25
InftyThink:把长链推理从「单条长河」拆成「短段+摘要」的迭代式推理范式
InftyThink 把 LLM 的复杂推理从"一次性把所有思考塞进一个超长上下文"改成"短推理段 + 中间摘要"的迭代循环,让推理深度不再受最大上下文长度限制,同时把每步计算复杂度从 O(n²) 量级降下来;它在不修改模型架构的前提下,让 Qwen2.5Math7B 在 MATH500 / AIME24 / GPQA…
深度解读 arXiv:2503.06692 2026-08-25
分割支持集、重建残差:用于视频生成与世界模型的免训练稀疏注意力
SparsePR 把"按行集中度"拆成"分块几何 + 残差可预测性"两个可独立量化的子问题,在 22–26% 实际执行 pair 密度下实现 1.48×–2.61× 端到端加速,且不损害 4 个异构视频生成/世界模型的生成质量。 视频 Transformer 的 attention 是扩散式视频生成与世界模型的主要瓶颈…
深度解读 arXiv:2608.18484 2026-08-25
FlavourBench:用可执行烹饪真值给前沿语言模型排名
FlavourBench 用一个版本化的"烹饪系统(culinary system)"生成 dense、可执行 ground truth:在 534 道统一任务上对 27 个前沿端点排名,每个模型严格 89 道有效响应/面板 × 14 家族,最强点估计 Grok 4.6 = 65.1(同步 95% CI 61.0–69…
深度解读 arXiv:2608.20574 2026-08-25
同侪投票的 LLM-Agent 压力测试:发现 feed 诱导的词汇收敛,但分布式信源没有可靠的匹配暴露优势
PVSST 是一个"同侪投票社交平台"测试床;在 448 次试验、112 个完整 model×topic×seed block 的预注册实验里,被同侪点赞排序的 feed 把最终轮词汇相似度推高了 +0.0082(核心面板)到 +0.0109(size 扩展),但 4 个分布式信源相对于 1 个信源在诚实 agent …
深度解读 arXiv:2608.20438 2026-08-25
Taming the Titans:高效 LLM 推理服务综述
这是一篇由苏州大学与华为云联合发布的 LLM 推理服务(LLM Serving)领域系统综述,把当前零散分布在系统、调度、存储、硬件等方向的优化手段,第一次按"实例级 → 集群级 → 新兴场景 → 杂项"四级层级串成一张可索引的地图,并指出 LLM Serving 正从"工程调优"向"理论优化"升级的研究范式转变。 L…
深度解读 arXiv:2504.19720 2026-08-25
ReMemR1:让长上下文 LLM Agent 能"回头看"的记忆回调与多级奖励
ReMemR1 把"记忆检索"机制嵌入到"边读边记"记忆更新过程中,并在强化学习训练阶段同时使用最终答案奖励与 step 级密集信号,使长上下文问答 Agent 能在数百万 token 文档里做非线性多跳推理,并以极小计算开销取得对 SOTA 的大幅领先。 长上下文问答(LongContext QA)是当前 LLM 的…
深度解读 arXiv:2509.23040 2026-08-25
LongVideoAgent:长视频多智能体推理
LongVideoAgent 提出一个"主 Agent + grounding Agent + vision Agent"三层多智能体框架,让一个 master LLM 显式规划、分工调度,专门解决小时级长视频问答中"压缩丢细节、工具太单一、规划不稳定"的老毛病,并在新数据集 LongTVQA / LongTVQA+ …
深度解读 arXiv:2512.20618 2026-08-25
Continuum:面向多轮 Agent 工作负载的 KV Cache TTL 调度系统
Continuum 提出一种基于 KV Cache TTL(timetolive)的多轮 Agent 请求调度策略,按 reload 成本与排队延迟选择性地把 KV cache pin 在 GPU 上,使多轮 Agent 工作流在 SWEBench、BFCL、OpenHand 等真实负载下的平均 Job Complet…
深度解读 arXiv:2511.02230 2026-08-25
STEP3-VL-10B 技术报告:10B 参数的多模态小巨人
StepFun(阶跃星辰)发布的多模态基础模型 STEP3VL10B,用 10B 的紧凑参数体量,借助"全参数解冻预训练 1.2T tokens + 1k+ 轮强化学习 + PaCoRe 并行协调推理"三板斧,在 MMBench、MMMU、AIME2025、MathVision、ScreenSpotV2 等基准上达到或…
深度解读 arXiv:2601.09668 2026-08-25
Compound AI Systems:从"单体大模型"到"集成智能体"的系统级综述
引用:Jiayi Chen 等,"From Standalone LLMs to Integrated Intelligence: A Survey of Compound AI Systems",arXiv:2506.04565v2,20250605 v1 提交,20260508 v2 更新。分类:cs.MA(多智能…
深度解读 arXiv:2506.04565 2026-08-25
UniSpace:把"理解-生成-编辑"压进同一套 ViT 视觉空间的统一表征
UniSpace 提出一种 Patch Reparameterization(Patch 重参数化)技巧,把一个已经预训练好的纯语义 ViT 同时改造成"既懂语义又看得清像素"的统一视觉表征,进而在此之上扩出一个 8B 的 MixtureofTransformerExperts 模型,让理解、生成、编辑三件事共用同一套…
深度解读 arXiv:2608.08676 2026-08-25
Hydra-0:用"像素级动作流"做通用世界模型与机器人控制的统一接口
Hydra0 把所有机器人动作都表示成 像素级运动(action flow)——也就是"动作在画面里造成哪些像素怎么动"——作为通用世界模型与控制的共享视觉接口,实现了跨 embodiment、跨任务、跨环境的统一条件信号,并在此基础上发现了一种反向模式:能从人类示教视频里的物体运动直接推出可执行的机器人动作。 通用机…
深度解读 arXiv:2608.18077 2026-08-25
Human-Centric Intelligence 综述:把"以人为中心"的 AI 重新装回 Foundation Model 的语境
这是一篇把"以人为中心的智能(HumanCentric Intelligence)"这条碎片化、跨任务跨模态跨社区的研究脉络 重新装回 Foundation Model 框架 的综述:用一套六层人类语境分类法 + 数据 / 架构 / 训练推理优化的方法论分层,把视觉外观、空间几何、运动学、交互、世界模拟、具身 agen…
深度解读 arXiv:2608.18184 2026-08-25
Scaling Embeddings Outperforms Scaling Experts:LongCat-Flash-Lite 与正交于 MoE 的稀疏维度
说明:工作队列中本条目最初以「LLM Research Papers: 2026 List」为标题索引(来自 Sebastian Raschka 的 newsletter 列表),但其对应的 arXiv ID 2601.21204 实际指向美团 LongCat 团队的 LongCatFlashLite 论文。本文按 a…
深度解读 arXiv:2601.21204 2026-08-24
Mamba-3:基于状态空间原理改进序列建模
Mamba3 通过"更富表达力的 SSM 离散化递推 + 复数值状态更新 + 多输入多输出(MIMO)"三项正交改进,在不增加 decode 延迟的前提下,把次二次(subquadratic)线性序列模型在检索、状态追踪与下游语言建模任务上推到了新的 Pareto 前沿,1.5B 规模相比 Gated DeltaNet…
深度解读 arXiv:2603.15569 2026-08-24
Agent UQ:LLM 智能体不确定性量化的基础、挑战与机遇
这篇论文主张 LLM 不确定性量化(UQ)研究必须从"单轮 QA"切到"交互式 Agent"场景,给出第一个能涵盖现有 UQ 设置的通用 Agent UQ 形式化,并系统列出 Agent 场景下四类独有挑战,在 τ²bench 上做了实证。 过去两年 LLM UQ 主流路线(verbalized confidence、…
深度解读 arXiv:2602.05073 2026-08-24
推广选题榜 · 2026-08-25
本周从 795 篇近 30 天新卡片中综合评审分(机制 + 工程双轨)、话题热度与新近度,选出 Top 8。 1. FreeToken:带宽自适应执行的边缘原生 MoE 高效服务 arxiv: 2608.16157 边缘原生 MoE serving 系统,将个人设备视为统一弹性推理平台而非「小型 GPU」,把开放权重转…
选题榜 2026-08-25
视频选题榜 · 2026-08-18
v2 重写覆盖(承接 20260825 反思棒 §3 "最弱单篇"识别 · 覆盖原 v1 = 664 字节 / 4 行 / 3 entries · R1+R2+R3 物理结构 OK 但内容塌方) 触发:20260825 21:40 CST 反思棒明确把 818 selection 列为近 7 天剩余未覆盖 v1 sel…
选题榜 2026-08-18
AID-Guard 短脚本镜像
日期 20260825 · 轮次 R2 arxiv 链接: videokb 脚本原路径: /shared/videokb/scripts/tom/20260825_R2_aidguardstatefulauthorizationagentclosureshortvideoscript.md 标题:Agent 授权闭环 …
视频脚本 arXiv:2608.21159 2026-08-24
当所有人都在堆大模型时,这篇论文说"小一点、多喂点"才是真相
2022 年初,AI 圈有一种近乎狂热的信仰:模型越大越聪明。于是各家开始堆参数——GPT3 175B、Gopher 280B、Jurassic1 178B、MegatronTuring NLG 530B——动辄几百 B 参数,训练数据相对抠门,几千亿 token 就算"丰富"。 然后 DeepMind 的一篇论文,啪…
科普版 arXiv:2203.15556 2026-08-24
当 AI 终于"读得进"一百万字——Google Gemini 1.5 到底改变了什么
你有没有过这种经历:把一本几十万字的书塞给一个 AI,让它"读完告诉我第三十七章讲了什么",结果它要么胡编,要么答非所问? 这背后的真实原因是——到 2024 年初,所有主流商用大模型能"一次性看进去"的文字量,最多也就 200K 个 token(差不多是一本中等长度小说的体量)。百万字年报、整本技术手册、一小时的会议…
科普版 arXiv:2403.05530 2026-08-24
LLM 驱动的 AI Agent 系统及其行业应用综述
这是一篇定位为「行业工程师入门地图」的 LLM Agent 综述:它把从 preLLM 时代规则 agent,到当前 LLM 驱动的软件型 / 物理型 / 混合型 agent 的演化一次性梳理,并按行业(客服、软件开发、制造、个性化教育、金融交易、医疗)给出落地形态、挑战与缓解路径,最终指向一个结论——LLM agen…
深度解读 arXiv:2505.16120 2026-08-23
DualPath:打破 Agentic LLM 推理的存储带宽瓶颈
原文标题:Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference,arXiv:2602.21548v2(20260226),cs.DC。 作者:Yongtong Wu、Shaoyuan Chen、Yinmin Zhong 等共 13 人。 D…
深度解读 arXiv:2602.21548 2026-08-23
Natural-Language Agent Harnesses:把 Agent Harness 变成可执行的自然语言对象
这是一篇重新定义 agent harness 表示形式的论文:它提出 NaturalLanguage Agent Harnesses(NLAH)——用可编辑的自然语言文档描述运行级 harness 策略——以及 Intelligent Harness Runtime(IHR),一个把这些文档解释为 agent 调用、交…
深度解读 arXiv:2603.25723 2026-08-23
视频选题榜 · 2026-08-23
v2 重写覆盖(承接 20260823 反思棒 §3 "最弱单篇"识别 · 覆盖原 v1 = 396 字节 / 4 行 / 2 entries / R2 缺位) 触发:20260823 21:40 CST 反思棒明确把 823 selection 列为 7 天最弱单篇 v1 双重塌方识别: 1. 形式塌方(模式 AD …
选题榜 2026-08-23
AI 修图已经"会"了,可你怎么知道谁真的修得好?——CPI-Bench 给出的新标尺
⚠️ 事实守约声明 · A/B/C 类划分版(20260823 反思棒重写) 本稿解读对象是 arXiv 2608.14546(CPIBench)。上一版(823 14:41 CST minitemplate 产出版)完全缺失 A 类 ✅ verbatim 标注 + C 类 ⚠️ agent 推断标注 + 适用 vs …
科普版 arXiv:2608.14546 2026-08-23