Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

2607-22091
日期与轮次:20260728 R3 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260728_R3_spectralalignmentdiffusionexposurebiasfreqsnrshortvideoscript.md 标题:SPA · 34% …
视频脚本 arXiv:2607.22091 2026-07-28
视频选题榜 2026-07-28
· LAMAR: An Open LanguageAware Multilingual Alignment Reranker · 英文锚定 relevance 蒸馏 + 语言一致性偏好对齐修复 multilingual RAG reranker 跨语种偏好 · round=R1 · Learning on the Jo…
选题榜 2026-07-28
主题综述 · RAG(2026-07-28)
距上一轮(20260724)RAG 综述四天,本轮把焦点集中在两件事上:(1) RAG 与 Agent Memory 的边界正在从「外部化 vs 内部化」二分,被三个新工作(Learning on the Job arXiv:2607.22157、Agentic Context Management arXiv:260…
周综述 2026-07-28
你的输入法比你更懂你,但它从不上传你的聊天记录 —— 一篇被引 145 次的综述讲清楚"联邦学习"是怎么做到的
你有没有想过这件事? 你的 Gboard 输入法每天学会你打出的新词、你的拼写习惯、你的方言偏好。 但 Google 从没拿到过你的聊天记录、你的搜索历史、你的搜索关键词。 你的相册自动分组"孩子"、"宠物"、"风景",但相册 App 从没把这些照片上传。 不是它们不想。是 2018 年 GDPR 发布后,"数据不上传…
科普版 arXiv:1909.11875 2026-07-28
当你的好友推荐系统把"喜欢李白"和"喜欢杜甫"算成无关 —— 一篇被引 153 次的综述告诉你为什么
你有没有想过这件事? 你在抖音关注了三个李白相关的号,系统却对你说"没发现明确兴趣标签"。 你在微信读书收藏了 20 本余华,内容池却一个都不给你推。 不是算法不知道。是算法不认识"图"。 arXiv:1709.07604(2017 TKDE,被引 153 次)做了一件为整个图嵌入领域立规矩的事——把"如何把一张图(社…
科普版 arXiv:1709.07604 2026-07-28
2026-07-28 · R2 · arXiv 2607.22157
arXiv: videokb script: /shared/videokb/scripts/tom/20260728_R2_frozenweightsagentexternalmemorydeploymentfeedbackcontinuallearningshortvideoscript.md 标题:LoJ · 冻…
视频脚本 arXiv:2607.22157 2026-07-28
LAMAR · Language-Aware Multilingual Alignment Reranker
arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260728_R1_lamarmultilingualalignmentrerankershortvideoscript.md 标题:LAMAR · 让多语 Reranker 选对语言 目标观众:AI 工程师 /…
视频脚本 arXiv:2607.22042 2026-07-27
AI 自己搞科研的"创新瓶颈"被它治了——arXiv 2607.22375 让 AI 想出 3.89 倍多的好点子
你有没有这种崩溃时刻? 让 AI 帮你"想 10 个新产品创意"——结果 10 个长得都差不多。换个名字、调个变量,本质上是同一个点子。 让 AI "大胆创新"(把 temperature 拉高)?倒是给得不一样了,但逻辑不通、没法落地。 arXiv:2607.22375(IDEAgent)做了一件范式级的事——把"科…
科普版 arXiv:2607.22375 2026-07-27
给 LLM Agent 装个"小脑"——arXiv 2607.14277 把它每次"动不动就调大模型"治好了
你有没有这种体验? 让 AI Agent 帮你订外卖、查订单——它每一步都要"调一次最贵的大模型"。账单月底一看几百块,80% 的任务其实小模型就能搞定。 更扎心的是——它分不清什么时候该用大模型、什么时候该直接答、什么时候该问一句、什么时候该放弃。 arXiv:2607.14277(MultiHead Latent …
科普版 arXiv:2607.14277 2026-07-27
IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation
将科研 ideation 从"生成+过滤"或"多样性单独优化"的旧范式中解放出来,用 QualityDiversity(QD)联合搜索框架重新建模——IDEAgent 通过多 Agent 世系管理、修复与细化机制,在 32 个 CS 课题上将最优基线的 Yield 指标提升 3.89 倍,并在 8 倍更多的课题上实现了…
深度解读 arXiv:2607.22375 2026-07-27
LAMAR: An Open Language-Aware Multilingual Alignment Reranker
多语 RAG 场景下,现有 multilingual reranker 不考虑文档语言,导致在语义等价的跨语言文档中出现排序不稳定,直接影响最终答案质量。LAMAR 通过"英文锚定 relevance 蒸馏 + 语言一致性偏好对齐"两阶段训练,让 reranker 同时建模语义相关性和语言同质性,在语言一致性评估和通用…
深度解读 arXiv:2607.22042 2026-07-27
Closing the Loop:不重训,修掉 AR 视频生成里的「回访一致性」烂摊子
这篇论文提出了一种「零后训练」(trainingfree) 的回访一致性补丁,专门解决自回归视频生成模型在长程生成中「相机回到老地方却画出新外观」的几何—视觉不匹配问题。它直接复用 3D 引擎已经提供的两条对应关系(temporal 与 spatial),把历史 latent 拽回 KV 缓存当 loopclosure…
深度解读 arXiv:2607.21848 2026-07-27
Molt: An Agentic Reinforcement Learning Training Framework for Scale
NVIDIA NeMo Labs 开源的 Molt 是一个 PyTorchNative 的 Agentic RL 训练框架:代码紧凑精炼、可被 AI Coding Assistant 完整读取推理;通过完全异步的单一训练循环同时训练 multimodal 和 MoE 策略;在 matched fully async 协…
深度解读 arXiv:2607.21653 2026-07-27
VisCo:把 LLM 自身当作内禀编码器用于视觉 Token 压缩
VisCo 提出了一种参数共享的自编码器式视觉 Token 压缩框架,直接复用预训练 VLM 自身的 Transformer 层作为压缩器与解码器,用少量 memory tokens 承载压缩后的视觉信息,并在编码—解码之间逐层传递多粒度特征;它在所有压缩比下都优于既有方案,且在高压缩、极限单 token 设置下仍稳定…
深度解读 arXiv:2607.12756 2026-07-27
Multi-Head Latent Control:给 LLM Agent 决策做一条「不伤主干的旁路」
MultiHead Latent Control(MHLC)是一个极轻量的「外挂层」——只读取冻结 LLM/VLM 的隐状态轨迹,就能为 Agent 在部署时输出两类控制信号:「能不能解决 vs 是否该升级到更大模型」与「该澄清、调用工具、放弃,还是直答」。整套机制不需要改动 backbone,可以在 routed e…
深度解读 arXiv:2607.14277 2026-07-27
主题综述 · database(2026-07-27)
本文综合 KB 内 paper_cards/ 主题 = database 的 15 篇纯标签卡片(含 HNSW/RAG 综述/DINOv2 等历史锚点)+ 跨主题多标签论文 4 篇(2606.16707 User as Code / 2607.21503 Agentic Context Management / 260…
周综述 2026-07-27
ChatGPT 是怎么"炼"出来的 —— 一篇被引 153 次的综述,把 BERT/GPT 到 ChatGPT 的演进一次讲透
"AI 已经能写邮件、画画、编曲、写代码、做研究助手。" "它是怎么从'只会填空'走到'什么都能聊'的?" 这个故事,不讲 Transformer、不讲 attention 公式也能听明白。 arXiv 编号 2302.09419,2023 年 2 月发布的预训练基础模型综述,被引 153 次——它给"从 BERT 到…
科普版 arXiv:2302.09419 2026-07-27
你问 ChatGPT 一个事实,它可能一本正经地编造 —— 史上最完整的"AI 胡说八道"地图来了
ChatGPT、Claude、Gemini 都越来越会"看起来对"。 但只要它们还在写句子,就一定还会"瞎说"。 这不是 bug——这是开放域生成模型的统计必然。 一篇被引用 218 次的综述,把这件事掰开揉碎讲清楚了:AI 为什么会胡说八道、怎么分类、怎么测、怎么治,以及为什么 RAG 不是万能解药。 全文最重要的一…
科普版 arXiv:2311.05232 2026-07-27
Tom 视频脚本镜像 · arXiv 2607.21653 · Molt
本镜像为 besteffort 副本,仅含视频生产所需的 3 节(标题与观众 / 口播稿 / 镜头分镜)。完整脚本含 §0/§2/§5/§6/§7/§8/§9 等详见 videokb 脚本原路径。 目标观众:AI 工程师 / 训练基础设施研究员 / Agent 框架研究员 一句话核心观点:Molt 用紧凑 codeba…
视频脚本 arXiv:2607.21653 2026-07-27
视频选题榜 2026-07-27
· SANAVideo 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation · 用"门控线性 + 周期 softmax 锚点 + 块级注意力残差"的混合架构,把 5B/14B 视频 DiT 推到单 H1…
选题榜 2026-07-27
主题综述 · agent(2026-07-27)
本文承接 surveys/20260723agent.md(v32 收官后第 1 棒)与 surveys/20260719agent.md(v32 收官后第 2 棒),聚焦 20260723 → 20260727 五天的 agent 主线增量——以「RAG 范式转折:Agentic 搜索替代向量检索」+「生产 agen…
周综述 2026-07-27
你的 RAG 系统"答得对"但"慢得要死"?——可能是你连哪一段在拖时间都不知道
你做 RAG(检索增强生成)是不是这样: 调 embedding 模型 → 答得准一点 加 reranker(重排模型) → 答得又准一点 换向量库 → 好像又快了一点 部署上线 → 用户说"怎么这么慢?" 然后你盯着整条 pipeline 一筹莫展,不知道瓶颈到底在 embedding、检索、rerank 还是 LL…
科普版 arXiv:2603.10765 2026-07-27
看图说话的 AI,为什么推理到第三步就"瞎"了?
你有没有过这种体验: 让 AI 看一张图,问它"左边有几个红色方块",它答得挺准。 但你追问:"那跟中间那个蓝色圆相比,谁更靠左?"——它就开始胡说八道。 这不是 AI "不努力"。 这是 2026 年多模态大模型(MMULM)最隐蔽、最要命的一个 bug:视觉信息在推理过程中被慢慢"稀释"了。 2026 年 2 月的…
科普版 arXiv:2602.04476 2026-07-27
Tom 短视频脚本 · 2026-07-27 R2 · ProVisE · 像素回答空间题
日期与轮次: 20260727 R2 arXiv 链接: videokb 脚本原路径: /shared/videokb/scripts/tom/20260727_R2_spatialcognitiongenerativepixelsvisualanswerprotocolshortvideoscript.md 标题: …
视频脚本 arXiv:2607.21072 2026-07-27
推广选题榜 · 2026-07-27
综合「被引 + 评审分(星标)+ SOTA 性 + 新近度 + 话题热度」,选出以下 8 篇本周最值得推广的论文。 1. User as Code:面向个性化 Agent 的可执行记忆 arxiv: 2606.16707 为什么值得推广:提出将用户记忆从「检索对象」变为「可执行代码」的范式转变,规则直接编码为 Pyth…
选题榜 2026-07-27
SANA-Video 2.0 · 单卡 13 秒出片
arxiv: 2607.21553 date: 20260727 round: R1 source: /shared/videokb/scripts/tom/20260727_R1_sanavideo2mixedlinearattentionsinglegpushortvideoscript.md 标题:SANAVid…
视频脚本 arXiv:2607.21553 2026-07-27
AI 帮你点鼠标——但你根本不知道它点对了没有
2026 年最热闹的 AI 故事之一,是"AI 帮你用电脑"—— 你说一句"帮我订明天去上海的机票",AI 自动开浏览器、登账号、填表单、付款。 听起来很爽。但有个问题: 你怎么知道 AI 真的订对了? 🎯 它可能订的是去北京的、可能是下周的、可能票根本没出——而你不知道,因为你根本不会逐项核对。 更尴尬的是,今天所有…
科普版 arXiv:2605.19769 2026-07-26
AI 记不住"我妈对虾过敏"——它记的方式从根上就错了
你有没有这种崩溃时刻: AI 助手和你聊到第 20 句,你说"我对虾过敏",它乖乖记下; 过两天你又提"我上周吃了虾没事啊",它又乖乖记下; 再过一个月,它看着这两条"事实",一脸真诚地告诉你:"你没说过你对虾过敏" 🤦 这不是 AI 健忘,是 AI 记东西的方式从根上就错了。 2026 年 7 月的 arXiv 26…
科普版 arXiv:2606.16707 2026-07-26
移动边缘网络联邦学习综述:挑战、应用与未来方向
Federated Learning(FL)将模型训练推到数据所在边缘侧——设备本地训练,仅上传梯度而非原始数据,从而在保护隐私的同时实现协作式模型构建;本篇综述系统梳理了 FL 在移动边缘网络中的挑战、应用与前沿方向。 传统 Machine Learning 的数据流水线是:数据从边缘设备上传云端 → 云端集中训练 …
深度解读 arXiv:1909.11875 2026-07-26
图嵌入综述:问题、技术与应用
Graph Embedding 将图结构数据压缩到低维向量空间,同时最大化保留图的拓扑结构信息和图属性,为节点分类、链接预测等下游任务提供高效输入。 真实世界充满图结构数据——社交网络、知识图谱、分子网络、交通路网。这些数据的分析需求巨大(节点分类、节点推荐、链接预测等),但大多数图分析方法面临高计算成本和高存储开销两…
深度解读 arXiv:1709.07604 2026-07-26