Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

给"会自己删库"的 AI 上保险:这家论文居然想用金融工程的招,给 Agent 算清"赔多少钱"
你的 AI 助手刚刚自作主张调用了 db.query、api.call、send_email,而且这些调用是不可逆的——数据库被删、邮件被发错群组、CRM 改了一条客户记录。 最让你睡不着觉的不是它做错了,而是——出了事,谁来赔? 模型供应商?合同里写着"不承担后果性损害"。 你自己?全扛,但你根本不知道该备多少钱应对…
科普版 arXiv:2606.16465 2026-07-14
基于 Gist Token 的简化稀疏注意力
提出 Simplified Sparse Attention (SSA):在 不改动任何模型架构 的前提下,仅靠一段「gist token + 受限 attention mask」的继续预训练,让模型学会把每个 chunk 的关键信息压缩到少量 gist token 之中;推理时用 query 仅与各 chunk 的 …
深度解读 arXiv:2604.20920 2026-07-14
MLOps 工具系统综述:工具采纳、生命周期覆盖与关键洞察
对聚焦 MLOps 工具 的学术文献做了一次系统综述(Systematic Review),把分散的工具映射到 MLOps 生命周期各阶段,揭示它们的功能、边界与所针对的挑战;指出 没有任何一款工具能覆盖完整生命周期,真实工程中必然是「多工具组合 + 互操作性」取胜,呼吁学术界与产业界重视跨工具互操作问题。 过去几年 …
深度解读 arXiv:2604.16371 2026-07-14
AlphaEval:在生产环境中评估 Agent —— 一份来自七家公司的 94 个真实任务基准
AlphaEval 提出了一份 productiongrounded 的 Agent 评测基准——94 个任务直接来自 7 家正在核心业务里部署 AI Agent 的真实公司,覆盖 6 个 ONET 领域,并把评估对象从"模型"抬升到"完整的 Agent 产品(如 Claude Code、Codex 等商业系统)",同…
深度解读 arXiv:2604.12162 2026-07-14
主动式 AI 助手测试基准:把"主动发现隐藏需求"从口号变成可量化指标
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 昨天(714 20:47)我署名的版本里有两处显眼的诚实问题,714 21:30 反思棒识别出来后必须在当天重写覆盖: 1. 占位符标签(原表): 原表第四、五行用了"其他模型 A / 其他模型 B",PROC…
科普版 arXiv:2605.14678 2026-07-14
PAST-TIDE:原型锚定的语句调优与主题不变归一化方法用于立场检测
PASTTIDE 是一套面向低资源阿拉伯语立场检测(Stance Detection)的轻量方案:用「MLM cloze 式的语句调优(Statement Tuning)」替换随机初始化的分类头,叠加「原型对比学习(Prototypical Contrastive Learning)」与「主题条件层归一化(TopicC…
深度解读 arXiv:2607.04690 2026-07-14
衡量人类与 LLM 研究思路之间的差距
本文用一套两轴"研究品味(researchtaste)"分类法对人类与 LLM 在同一文献上下文下产出的研究思路做"分布级"对比,发现 LLM 的思路分布范围明显比人类更窄、且系统性偏向"桥接式动机 + 综合式方法"——即 LLM 更倾向把已有工作缝起来,而人类更愿意去发现失败、提出反例、暴露结构性缺口。 LLM 被大…
深度解读 arXiv:2607.01233 2026-07-14
Sparse Delta Memory:通过稀疏性扩展线性 RNN 的状态容量
本文提出 Sparse Delta Memory(SDM),在 Gated DeltaNet(GDN)的基础上用 ProductKey Memory(PKM)式稀疏寻址 把"密集 KV 外积更新"替换成"稀疏读 / 稀疏写到一个大容量显式 memory",在同等参数、同等 FLOPs 的约束下把隐状态容量扩展了三个数量…
深度解读 arXiv:2607.07386 2026-07-14
把 GPT/Claude/Gemini 投票一下,能超过单模型吗?67 个前沿模型告诉你一个残酷真相
工程师们都有一个美好幻想—— "既然单模型都有盲区,那我把 GPT5 + Claude Opus + Gemini + DeepSeek + Qwen 几个模型凑一起投票、路由、级联一下,准确率应该能蹭蹭往上涨吧?" 残酷真相:基本不能。 最近 arXiv 上的 2606.27288 给这种"白嫖提升"的幻想泼了一盆严…
科普版 arXiv:2606.27288 2026-07-14
视频选题榜 2026-07-14
· Mamba3: Improved Sequence Modeling using State Space Principles · 三项正交改进(trapezoidal + complex + MIMO)推进次二次 Pareto 前沿 · round=R2 · Nemotron 3 Super: Open, Eff…
选题榜 2026-07-14
2603-15569
日期:20260714 R2 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260714_R2_mamba3ssmmimocomplexstateshortvideoscript.md Mamba3(arXiv:2603.15569v1 · ICLR 202…
视频脚本 arXiv:2603.15569 2026-07-14
AI 画图时"脑补"了什么?——这篇论文让文生图的"黑箱想象"变成可编辑的场景图
你有没有过这种崩溃瞬间—— 让 AI 画一张"客厅沙发旁有一只橘猫在窗台上晒太阳",它给的图确实漂亮,但—— 沙发是皮的,你想要布的; 橘猫在客厅中央,你想要窗台上; 阳光从左边来,你想要从右边来。 你只能重新输一遍 prompt,然后祈祷它这次画对。因为它"脑补"的那些细节,全部锁在模型权重里,你摸不到、改不了。 这…
科普版 arXiv:2405.03650 2026-07-13
让 AI Agent "记起做过什么"——比 ChatGPT 长记忆更深一层的工程革命
你有没有过这种崩溃瞬间—— 让 AI 帮你做一件"跨十步的工具活":登录 → 查数据 → 整理 → 校验 → 调用 API → 截图 → 写邮件 → 提交 → 复查 → 回复用户。 第 6 步它突然开始胡说八道—— 明明前 5 步做得好好的,怎么到第 6 步就乱了?你以为是模型"不够聪明",但真相更扎心:它从来就不是"…
科普版 arXiv:2606.06090 2026-07-13
公共部门机器学习流水线的工程教训:从预标注到生产化
arXiv 链接: + cs.CY,11 页,2 图,4 表) 标题全称:From Prelabeling to Production: Engineering Lessons from a Machine Learning Pipeline in the Public Sector 参考资料:arXiv abstra…
深度解读 arXiv:2511.01545 2026-07-13
Generated Contents Enrichment(GCE):让图像生成的"脑补"过程白箱化
arXiv 链接: MB PDF) 参考资料:arXiv abstract 与 HTML 全文、研究知识库 paper card 002240503650.md。 这篇论文把"稀疏场景描述生成图像"重新定义为一个两步任务——先用显式的场景图(scene graph)把描述补全,再用下游图像生成器渲染,并通过联合训练的对…
深度解读 arXiv:2405.03650 2026-07-13
LogicalRAG:把 Agentic RAG 的控制权交回 LLM,把检索后端退化为倒排索引
arXiv 链接: 参考资料:arXiv abstract 与第三方解读(agentpatterns.ai 的 Boolean Queries over an Inverted Index)、研究知识库 paper card 161260527123.md。 LogicalRAG 主张 Agentic RAG 的瓶颈不…
深度解读 arXiv:2605.27123 2026-07-13
生成无知识泄漏的 RAG 评测基准:SeedRG 与 Reasoning Graph 重写机制
SeedRG 是一个"半合成"RAG 评测基准生成流水线:它先从 seed 题目里抽出一张 reasoning graph(推理图),再用"类型约束的实体替换"把图上的节点换成 LLM 参数化记忆里不大可能见过的新实体,从而制造出结构同构、但答案落在模型参数化知识之外的新题目,让评测分数不再被 parametric m…
深度解读 arXiv:2605.08838 2026-07-13
EvoArena + EvoMem:在"环境会变化"的真实世界里评测与改造 LLM Agent
EvoArena 是一个把"环境会演化"显式建模进评测的 Agent 基准套件,配套的 EvoMem 则是一种 git 风格的 patchbased 记忆机制——它把每一次记忆更新写成带 prestate、poststate、rationale、evidence 的结构化补丁,让 Agent 在面对跨版本规则/接口/用…
深度解读 arXiv:2606.13681 2026-07-13
让 AI 帮你发小红书,它会发错群组吗?——这篇 ICML 2026 论文给所有"接工具的 Agent"提了个醒
想象一个场景: 你跟 AI 助手说"把我昨天那个帖子发到组里"。 它接到指令,啪地一下真的发出去了——但发到了你老板的工作群,而不是你的摄影爱好者小群。 你下次再让它"把那个客户跟进一下",它二话不说给一个陌生号码发了串报价单。 你问它"我上次收藏的那个餐厅在哪",它看了一眼就回"我没有这个信息"——但你明明三天前在它…
科普版 arXiv:2606.02470 2026-07-13
你以为 ChatGPT 在「回忆」,其实它在「搜」——这篇论文把它的记忆升级成人类的「想起」
你有没有这种感觉—— 和 ChatGPT 聊了十几轮以后,它好像越来越不记得你前面说过什么?你说"上次那个餐厅",它要么答非所问,要么干脆说"我没有这个信息";你换了一个完全相关的话题再问,它又奇迹般地把"那个餐厅"调出来了。 它不是不记得。它是记不住怎么找。 最近 arXiv 上的 2606.06036(ICML 2…
科普版 arXiv:2606.06036 2026-07-13
推广选题榜 · 2026-07-13
选自近 30 天 paper_cards,重点考量:被引、影响力被引、⭐评级、新近度、话题热度。控制 800 字内。 1. QwenRobotManip · arxiv: 2606.17846 对齐释放机器人操作基础模型的规模化潜力 被引 8 | 影响力被引 2 | RoboChallenge 第1(SOTA)| 真实…
选题榜 2026-07-13
Tom 视频脚本镜像 · arXiv 2607.07740 · Jet-Long
本镜像为 besteffort 副本,仅含视频生产所需的 3 节(标题与观众 / 口播稿 / 镜头分镜)。完整脚本含 §0/§2/§5/§6/§7/§8/§9 等详见 videokb 脚本原路径。 目标观众:AI 工程师 / 大模型架构师 / 推理优化工程师(关心 RoPE 实战 / 长上下文扩展工程代价 / Qwen…
视频脚本 arXiv:2607.07740 2026-07-13
视频选题榜 2026-07-13
· JetLong: Efficient LongContext Extension with Dynamic Bifocal RoPE · 动态双焦 RoPE 拆短程保真 + 长程可缩放窗口 · H100 长上下文 prefill = FA2 1.39× · RULER +4.79/+2.18/+2.03 pp · …
选题榜 2026-07-13
长上下文 LLM 推理为什么越来越贵?这篇 24 页综述把 KV cache 优化的「五大流派」一次性讲清楚了
你有没有注意到一件事: 同一个 ChatGPT,问一句"今天天气怎么样" 和 丢给它一本 50 万字的小说让它总结,后台花的钱可能差出几十倍; 你公司想上一套 RAG(RetrievalAugmented Generation,让模型先检索外部知识再回答)知识库,问答窗口一旦拉到 100K token,GPU 集群账单…
科普版 arXiv:2603.20397 2026-07-12
KV Cache 队列论稳定性分析:首个把「显存」纳入 LLM 推理服务容量规划的排队论框架
本文提出首个同时把「算力」与「GPU 显存(KV Cache)」显式纳入模型的 LLM 推理排队论框架,给出严格的「稳定服务率」条件;运维只需把请求到达率与该条件对照,就能算出「避免无界排队」所需的最小 GPU 集群规模。实验在真实 GPU 产线环境跑过,预测偏差通常在 10% 以内。 LLM 在线推理服务(ChatG…
深度解读 arXiv:2605.04595 2026-07-12
AgenticRAGTracer:面向 Agentic RAG 的 Hop-Aware 多跳诊断基准
AgenticRAGTracer 是首个为 Agentic RAG 量身设计、由 LLM 自动构造并具备 hop 级逐步验证能力的多跳检索推理诊断基准;它在 1,305 条样例上让 GPT5 也只拿到 22.6% 的 EM 准确率,并揭示了"推理链提前坍缩"与"过度延伸"这两类传统评测无法捕捉的失败模式。 Agenti…
深度解读 arXiv:2602.19127 2026-07-12
DIVERGE:面向开放域信息检索的多样性增强 RAG 框架
DIVERGE 是一个即插即用的 agentic RAG 框架,通过"反思驱动的视角生成 + 视角条件化 RAG"的迭代循环,把开放域问答中的多样性提升约 2 倍而不损失答案质量;同时它定义了一套新的"多样性—质量"评估指标,把传统 RAG 在"知识坍缩"上的系统性短板量化暴露了出来。 绝大多数 RAG 系统都建立在"…
深度解读 arXiv:2602.00238 2026-07-12
周综述 · LLM 推理服务优化(2026-W28)
本周(20260706 至 20260712,ISO W28)的研究知识库新进论文中,最显著的主题是 LLM 推理服务(LLM Serving)优化。一个明显的信号是:在本周 explainers/ 新增的 8 篇深度解读里,有 8 篇直接落在"推理引擎 / KV cache / 服务调度 / 容量规划"这条主线上,覆…
周综述 arXiv:2603.20397, 2604.20920, 2605.01280, 2605.04595, 2605.29639, 2606.03910, 2606.07362, 2606.09441 2026-07-12
Video-Oasis:重新审视视频理解的评估方式 —— 一份把"视觉捷径"暴露在阳光下的诊断套件
VideoOasis 是一个 针对现有视频理解基准的"审计工具":通过对一组系统化的诊断测试(decoupling visual and temporal cues),它揭示出 约 55% 的现有 benchmark 样本 可以不靠视觉输入或时序上下文就被答对;剔除这些"捷径样本"后,剩余真正依赖视觉与时序的视频原生挑…
深度解读 arXiv:2603.29616 2026-07-12
KV Cache 优化全景综述:五大方向与自适应多阶段流水线
这是一篇针对 LLM 推理场景下 KV cache 优化 的 24 页系统性综述,把目前散落在文献里的 KV cache 优化技术归纳为五大方向(eviction / compression / hybrid memory / novel attention / combination),并把每条技术映射到 7 类实际…
深度解读 arXiv:2603.20397 2026-07-12