解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
在线学习综述:算法、反馈类型与未来方向
Online Learning 通过逐条处理数据序列,让模型在"边猜边学"的过程中不断调整,目标是让后悔值(Regret)随时间增长尽量缓慢——这篇 100 页、引用约 400 篇的综述系统梳理了这个领域的算法图谱与核心原理。 传统 Batch Learning 要求事先拥有完整数据集,然后一次性训练模型。但现实中有大…
你和 ChatGPT 聊到第 5 轮,它就开始"忘了"你最初要什么 —— ICLR 2026 获奖团队的新论文告诉你为什么
论文: v1: 21:14:44 UTC 提交 · 1,802 KB) PDF: DOI: DOI via DataCite) HF: 提交人邮箱: 你有没有过这种体验:跟 ChatGPT 聊了一个复杂任务,聊到一半改了主意、改了约束、甚至完全换了个方向,结果 AI 就开始"装糊涂"——它好像只记得你最近两句话,你一开…
大型语言模型幻觉综述:原则、分类、挑战与开放问题
LLM 幻觉不是 bug,而是开放域生成模型的固有特性:本文系统梳理了幻觉的定义、成因、检测与缓解方法,提出"事实性幻觉 + 忠实性幻觉"二分法,为构建可靠的 LLM 应用提供了完整的知识地图。 LLM 被广泛部署于搜索引擎、聊天机器人、推荐系统等日常信息获取场景,但其"一本正经地胡说八道"(幻觉)会直接导致错误信息传…
预训练基础模型综述:从 BERT 到 ChatGPT 的发展历程
Pretrained Foundation Models(PFM)是 AI 基础设施范式的根本转变:一份跨模态(文本/图像/图)的全景式综述,梳理了从 BERT/GPT 到 ChatGPT 的技术演进脉络,并指出 scalability、security、reasoning、crossdomain 是通向 AGI 的四…
MahNMF:曼哈顿距离下的非负矩阵分解
把非负矩阵分解(NMF)目标函数从 KL 散度 / 欧氏距离换成 ℓ1 范数(曼哈顿距离),从而能稳健建模重尾拉普拉斯噪声与离群点,并配套两类快速优化算法(RRI 与 Nesterov 平滑法)和一族带约束的扩展(Box、流形正则、组稀疏、弹性网、对称)。 经典 NMF 把非负矩阵 X ≈ WᵀH 的目标函数建在两种噪…
主题综述 · risk(2026-07-26)
今日由 cron a7d6254f9c7d48629b58cf778b1bee03 触发。date +%j = 207,207 % 8 = 7 → risk。surveys/ 下最近一份 risk 综述为 20260723,距今 72h 外(3 天前),按"已覆盖则顺延"规则检查其余 7 主题:agent (723) …
机器人导航不再依赖"深度相机"了?——一篇 2026 论文用 8B 模型 + 单目 RGB 刷了两个 SOTA
你有没有这种感觉—— 看各种机器人 demo,什么"家庭服务机器人"、"仓储巡检机器人"、"酒店送餐机器人",视频里都很酷。但你点开技术细节,几乎清一色写着:RGBD 相机、立体相机、IMU、激光雷达、预建地图、SLAM 模块…… 一台能"看见路"的机器人,传感器堆得比车还贵,部署一个项目要校准一两周。 但 2026 …
AI 看视频时"自欺欺人"了多久?——一篇论文把"相机抖"和"东西在动"终于分开了
你有没有这种感觉—— 你刷短视频的时候,人脑会自动把"画面在晃"和"物体在动"区分开: 镜头摇过去 → 整条街在画面里平移,但街上的车没动; 车开过去 → 镜头稳住,只有车在画面里前进; 你边走边拍 → 相机在动,小孩也在跑,两种运动叠在一起。 这件事对人类是本能,对 AI 视频理解却是地狱难度。 过去所有"视频大模型…
Tencent WorkBuddy Bench · Tom 脚本镜像 · 2026-07-26 R3
date: 20260726 (Sunday) · round: R3 arXiv: videokb 原路径: /shared/videokb/scripts/tom/20260726_R3_workbuddybenchcodingagentantileakshortvideoscript.md 标题:反向工程 · 防…
视频选题榜 2026-07-26
· LLMs Get Lost in Evolving User Intent · 单轮 FullySpecified 性能无法迁移到多轮 evolvingintent 场景,各模型家族均出现显著性能下降 · round=R1 · Recurrent Sinusoidal INRs for Efficient High…
主题综述 · engineering(2026-07-26)
今日 date +%j 取 207,对 8 取模得 7,本应写 risk;但 surveys/ 中 risk 已有 20260723 综述(72 小时内),按规则顺延到下一个未覆盖主题——index = (7+1) % 8 = 0(agent,已覆盖 0723)→ 1(rag,0724)→ 2(multimodal,0…
13 秒生成 720p 5 秒视频,比 Wan 2.2 快 120 倍 —— 一篇新论文把视频生成推到"单卡实时可用"的临界点
2026 年 7 月底,NVIDIA Research 团队在 arXiv 上挂出了一篇新论文 SANAVideo 2.0(arXiv 2607.21553),做了一件听起来像吹牛但实测数据确实顶得住的事:在一块 H100 上,用 13 秒生成一段 720p 5 秒的视频,质量与同期顶级视频生成模型(阿里 Wan 2.…
2607-21485
日期与轮次:20260726 R2 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260726_R2_spectralenrichmentrecurrentinrshortvideoscript.md 标题:共享正弦块,反复撑开频谱 目标观众:3D 重建研究…
2607-20734
日期与轮次:20260726 R1 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260726_R1_evolvinguserintentmultiturnfailureshortvideoscript.md 标题:动态意图 · 单轮评测全面失效 目标观众:…
LLMs Get Lost in Evolving User Intent:当用户意图在对话中演变,LLM 全面失效
当前 LLMs 在单轮 FullySpecified 任务上表现优异,但用户的真实意图在多轮对话中是动态演变的(逐步披露、修正、转向),而主流 Benchmarks 仍基于单轮静态设定;论文构建了一个将静态任务转化为动态多轮对话的框架,揭示了一个一致现象:强单轮性能无法迁移到意图演变场景,各模型家族均出现显著性能下降。…
SANA-Video 2.0:用"混合线性注意力"把视频生成打到单 GPU
SANAVideo 2.0 把视频扩散 Transformer 中"二次复杂度的 softmax 注意力"替换成"门控线性注意力 + 周期性 softmax 锚点 + 块级注意力残差"的混合架构,让 5B / 14B 模型在单块 H100 上以 13 秒生成 720p 5 秒视频,比 Wan 2.2A14B 快 120…
从视频中自监督学习结构化动态(SDM)
Structured Dynamics Model(SDM)提出将视频帧间变化显式分解为相机运动和物体运动两部分,通过未来特征预测 + 弱监督合成数据的混合训练策略,从冻结的预训练图像 ViT 特征中蒸馏出结构化运动表征,在含相机运动、物体运动及二者混合的 ProbeMotion 评测集上显著超越全局特征基线。 视频理…
当 ChatGPT 又卡了:你买的不是「算力不够」,是「显存锁」没解开——一篇 ICML 2026 论文把这件事讲清楚了
⚠️ 20260725 重写声明(P252 兑现 · Stephen 反思棒 725 21:30): 元失败 #S「机构归因 overconfidence hallucination」首次识别:724 14:46 旧版第 §3 节自评段落明确写「缺机构(Cerebras Systems 暗示但未明)」—— 这是凭空捏造…
主题综述 · llm-infra(2026-07-25)
主题:llminfra(LLM 推理与服务系统)。本综述以 spark 20260725 的 E1 llminfra 预消化(inbox/spark/20260725llminfrae1prep.md,6 主线 + 3 旁证 + 8 矛盾点)为主干,叠加 2026 H1 的 10 篇代表性论文(KV cache 五分类…
Agent 自己交互过的经验,怎么"蒸馏"成永久技能——arXiv 2607.21051 给了一条新路
你有没有这种感觉? 你做了一个 AI Agent 帮你跑代码、debug、修 bug。它在对话里"学到"了——你提醒它"别忘了检查依赖冲突"、它下次确实改进了。 但你一刷新会话、或者换个任务——它又"忘了"。你要重新教一遍。 这种"学到的东西只在当前对话里有效,一出 Context 就归零"的现象,是 2026 年 A…
Agent 越用越"傻"、账单越用越贵——arXiv 2607.21503 把这个病给治了
你有没有这种感觉? 你做了个 AI Agent 帮你处理客户咨询、查订单、跑工作流。刚开始几次还挺聪明——对话越长,它越能"记得"你说过什么。 但用着用着:响应越来越慢、token 账单越来越离谱、关键信息开始"丢"——它明明在 Context 里看过"用户三个月前投诉过物流",但下一次再问就完全失忆。 这不是 Bug…
2607-21557
日期与轮次:20260725 R3 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260725_R3_openforgerlharnessnativerltraindeploybridgeshortvideoscript.md 标题:OF · proxy 解…
视频选题榜 2026-07-25
· SampleEfficient Learning from Agent Experience · ED 把 Agent 交互历史蒸馏进模型权重 · 保留 64.8% ICL 增益 · Direct SFT 仅 3.8% · 749 SWE + 6 文字冒险跨域验证 · 9.6× RL 样本效率 · weightle…
主题综述 · multimodal(2026-07-25)
主题:multimodal(多模态大模型)。本稿以 20260722 → 20260725 这一周的 arXiv、HF Daily、inbox 笔记与 industry signals 为主轴,对 v31 活文档(multimodal.md)已立的"周末 722~723 立标集体爆发 25 件 + 724 立标续立 +…
2607-20785
日期与轮次:20260725 R2 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260725_R2_robostralnavigateimagespacewaypointvlnsotashortvideoscript.md 标题:RN · 用单目 RGB …
2607-21051 · Experience Distillation 短视频脚本镜像
日期与轮次:20260725 R1 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260725_R1_experiencedistillationagentweightpersistenceshortvideoscript.md 标题:ED · 把 Agen…
Agentic Context Management:把 Agent 记忆与成本当作生命周期与架构问题来解
Production AI Agent 失败的主要原因不是推理能力不足,而是上下文管理失控——对话历史、巨大 Prompt、工具定义与工具输出不断膨胀,导致 token 成本呈二次增长,同时跨会话记忆衰退;该论文提出 Agentic Context Management(ACM)学科,将其分解为五个原语,并证明只有经过…
Experience Distillation:让 Agent 从自身交互历史中高效学习,无需额外环境交互
Realworld Agent Learning 受限于昂贵环境交互(如运行耗时的实验或获取人类反馈),InContext Learning 能从交互历史中高效率学习,但历史一出 Context 增益就消失;论文提出 Experience Distillation,将 Agent 的交互历史(无需额外环境交互)蒸馏进模…
Robostral Navigate:单目 RGB、8B 参数、把视觉导航推到 SOTA 的纯图像空间策略
一个 8B 参数的视觉语言模型(VLM)只用单目 RGB 视频流做输入,直接在当前画面上"指出下一个目标点"作为航点预测,不依赖深度相机、不依赖多相机、不依赖预建地图,在 R2RCE / RxRCE 两个连续环境视觉语言导航基准上同时刷新 SOTA。 视觉语言导航(VisionandLanguage Navigatio…
32B 开源模型凭什么追上前沿闭源?——AutoMem:不是靠"大",而是靠"会记"这件事被系统化训练出来
你有没有这种感觉—— 你团队花大价钱调了一个 70B 的闭源 Agent,在 NetHack 这种长视野游戏里死活打不过对手。换个 32B 开源模型,跑出来的分数还差不多。 你大概率以为:Agent 想干好活,只能堆模型规模。 但 2026 年 7 月这篇论文 AutoMem(arXiv:2607.01224)给了一个…