解读
2620 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
层次近似最近邻的贪心导航:何时能又快又准,几何条件首次给出
§0 自检栏 选题维度:垂直链路 / 数据结构 / RAG 与推荐系统的向量召回内核 / 几何分析 + 概率过程 受众:ANN 索引工程师、RAG 检索栈设计者、推荐系统召回层研究者、计算几何/概率论方向研究生 风险:抽象级高、无工程 bench 直接可跑、对生产 HNSW/IVFPQ 类参数选择只给条件、不给具体值 …
ORCAGen:用 RAG 引导生成式 AI 编出可执行的反欺骗剧本
§0 自检栏 选题维度:水平链路 / 网络安全 + LLM 应用 / RAG × 主动防御 / 恶意软件侧 受众:安全研究员、主动防御工程师、LLM 应用开发者、对 RAG 落地非问答场景感兴趣的同学 风险:依赖 2026 时期 LLM 产品代号、抽象级高、顶会 anchor 弱化(W39 已失势) 为什么读:把"主动…
WorldGuide:用闭环视觉世界模型做程序化任务,从"生成好看视频"走到"按生成结果决定下一步"
§0 自检栏 选题维度:水平链路 / 多模态 × 智能体 / 程序化视频生成 + 闭环世界模型 受众:视频生成研究者、具身/世界模型研究者、agent × multimodal 跨方向工程师 风险:作者署名较新、模型代号 "MiniMaxH3" 未在公开模型库出现、benchmark 自建 为什么读:把程序化视频生成从…
MiMo-V2.6:把强化学习算力作为自我改进主轴的全模态模型族
小米 LLMCore Team 发布的 MiMoV2.6 系列(Pro 1.02T 总参 / 42B 激活、Flash 310B 总参 / 15B 激活)把"RL 算力规模化"作为驱动 agentic 自我改进的核心杠杆:通过更大的异步 batch、更长上下文的 rollout、更复杂的多 harness 环境与 gr…
RAG 不擦除记忆,只重塑它:上下文敏感的前缀记忆提取
Groningen / Leiden 团队(Satvaty 等,已收 EMNLP 2026)通过对 prefixsuffix 样本做 paired itemlevel 后缀概率测量,证明上下文并不会"擦除"LLM 的训练记忆,而是把它拆成 contextrobust core(跨上下文稳健可提取的核心)+ contex…
LLM 集成应用的七种架构形态:从 Chat 到 Agent 系统
Irene Weber(Kempten 应用技术大学)发表的这一综述,把市面上被叫作 chatbot / copilot / RAG / workflow / coding agent / AI agent 等的"标签"逐一拆开,证明这些词汇在大厂原始语境下确实承载了可识别的架构差异 —— 综述在统一的"agent 与…
用于 X 射线衍射的自学习科学 Agent
Gan Jiang 是一个面向粉末 X 射线衍射(XRD)的自学习 LLM Agent,它不重训语言模型也不改物理模型,而是把分析经验自动诊断、修订、验证后沉淀为可复用技能,在 DeltaXRDbench 等多基准上把单相 top1 准确率从最强对照组的 58.00% / 58.47% / 26.45% 提升到 96.…
Inherit-MAS:通过工作流与执行继承实现多 Agent 系统的测试时演化
InheritMAS 把生物进化里的「继承 + 选择」拆成两件独立的事:让工作流图本身可以被结构化继承而不是每次整体重写,让已跑过的执行结果可以被精确复用而不是无脑重跑;在 WorkBench / HotpotQA FullWiki 上同时做到 SOTA 完成率和显著 token 节流。 由 LLM 组成的多 Agen…
Self-Retrospection Distillation:把事后经验变成事前远见
SelfRetrospection Distillation(SRD)抓住 RLVR 在「整组 rollout 都得同分」时信号消失的盲点,把事后才看得到的成败教训回灌成 Agent 在行动前就该有的远见预测——只在训练时用,推理时不开销,让 2B 模型在 98% 全失败组里从 0.0% 升到 60.6%。 RLVR(…
主题综述 · risk(2026-10-09)
| # | 维度 | 实测 | 状态 | ||||| | 1 | ⚠️ 密度 | 14+ 处(§1§五独立计数) | ✅ | | 2 | 主线三段式 | §1.1§1.10 全部按"机制 / 数据 / 截止日证伪" | ✅ | | 3 | 反方 v2 三段式 | §3.1§3.6 ≥6 段 × ≥150 字 | ✅ |…
你家 MLLM 的"音视频描述"分数可能是假的——2026 这篇 NeurIPS 论文,把"整段打分"拆成"逐原子单元打分"
arXiv 2610.12458(OmniCapBench)是 2026 年 10 月公开、NeurIPS 2026 接收的 benchmark 论文 —— 它把多模态大模型(MLLM)的"音视频描述"评测,从依赖不稳定 LLM 判官的整段打分,重写为对 786 个视频、跨「实体指代 / 视觉镜头 / 音频事件」三轨的…
你玩过的 3D 场景全是"死"的——2026 这篇论文,把"会动的 3D 循环世界"做成了无掩码、可任意走入的 cinemagraph
arXiv 2610.12461(OuroWorld)是 2026 年 10 月公开的工作 —— 它把任一 3D Gaussian Splatting 静态场景无掩码地提升为「任意视角无缝循环」的 3D 动态影像。先用 VLM 推断合理动态,再用视频模型合成参考视频,最后用「Fourier 级数变形场(构造性保证循环)…
Foundations of Large Language Models:一本给工程读者用的 LLM 基础「地图册」
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「LLM 综合综述」吗? | 不是综合综述,是基础概念书,明确「primary focus on foundational concepts rather than comprehensi…
OmniCapBench:把音视频描述评估从「整段打分」拆成「可验证原子单元」
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「音视频描述」这一个任务吗? | 不是仅一个任务,而是把评测目标改写为结构化诊断:把整段自由文本预测换成三轨「实体指代 / 视觉镜头 / 音频事件」的原子单元集合 | | Q2 | 谁在为…
OuroWorld:把任意 3D Gaussian Splatting 场景「无掩码」变成无缝循环的 3D Cinemagraph
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「动态 3D 场景生成」吗? | 是——且特别强调maskfree 与 endlessly looping:把任一静态 3DGS 场景提升为「任意视角无缝循环」的 3D 动态影像 | | …
视频选题榜 2026-10-09
· FastOPD: OnPolicy Distillation for Lightweight VLA Deployment · 蒸馏 VLA 别压每一轮 denoise · onpolicy 单状态对齐 + selfconsistency · round=R1 · CADFather: Autonomous CAD…
主题综述 · engineering(2026-10-09)
主题选择链:date +%j=282 → 282 mod 8=2 → 主题=multimodal;/shared/researchkb/organized/promo/surveys/ 近 72h 已覆盖 multimodal(20261008)+ llminfra(20261007 v2bak 20261007T21…
文档结构真能帮稠密检索?一份安慰剂对照消融把四种流行机制拆给你看
RAG 里四处常见的"利用文档结构"的小技巧(结构对齐分块、LLM 补的 chunk context、heading path 元数据、分层两阶段检索)并不是在同等条件下被验证的——这篇论文把它们拉到同一协议下跑了对照实验,结论是"真结构"确实帮得上(约 +0.010~+0.022 covnDCG@10),但"分块前加…
5000 万 token 的"长期记忆":靠 KV 落盘而不是重计算,让 12B/31B 模型"记得更久也更便宜"
"长上下文"不是只能靠更大的 attention 窗口——论文实测了一个公开包 galahadkv,把每个 ~16k token 块的 KV 状态加密落盘到本地 NVMe,加载时字节级一致不重计算,在单卡 H100 + vLLM 上用 Gemma 4 12B / 31B 跑了 5000 万 token 的真实文本,10…
RoboJEPA:把机器人潜变量世界模型做大——8B 参数 + 二阶幂律 + 12 种机器人形态
RoboJEPA 是目前最大的 JEPA 预测器(8B 参数),在涵盖 12 种机器人形态的大规模数据上训练,首次为多形态机器人世界模型建立了关于算力的二阶幂律——这意味着你不用真跑到目标规模,就能从拟合的曲线预测想象误差(imagination error)会到多少;更进一步,想象误差与真实机器人规划性能强相关,让"…
Agent Plasticity:通过经验衡量自我改进
Agent Plasticity 把「AI Agent 能不能从经验中学到东西」这件事从单点性能比较改写成了一个效率量纲——用「训练期间投入多少 cost 能在多大程度上转化为对未见过的环境的提升」来刻画 Agent 的可塑性,并用这个量纲发现前沿模型之间的能力差异更多来自学习效率与泛化而不是终点能力。 主流 Agen…
CADFather:通过协同工具调用实现自主 CAD 重建
CADFather 是一个"零额外训练"的自主 Agent 系统,把视觉语言模型(VLM)作为调度器,协同一组互补的 CAD 操作提案工具与数值优化器,从 3D 网格逐步恢复出可编辑的参数化 CAD 程序,并在 DeepCAD、Fusion360、MCB 全量测试集与 CADENABench / CADBench / …
UniSkill:为持续进化的策略学习与执行者对齐的技能提案
UniSkill 提出一种「无新 rollout 的对比式动作反馈」机制,让 LLM Agent 的技能库(skillbank)与执行策略(actor)共享同一策略但解耦训练目标,从而在 ALFWorld 上达到 98.4%、WebShop 上达到 84.7% 的成功率,规避了"靠后续 rollout 复用率打分候选技…
2505.16120 · 小红书推广卡片文案
1. 「我们到底要不要上 LLM Agent?」arXiv 这篇综述终于给了答案 📋 2. 做 Agent 的姐妹看过来:你以为你在解决幻觉,其实致命问题根本不是它 🚨 3. AI 工程师刷到这篇就够了——LLM Agent 落地的 4 个真挑战 + 6 个行业全景图 家人们谁懂啊 📋 每次技术规划会上听到「我们要上 …
2607.04434 · 小红书推广卡片文案
1. 机器人策略仿真 99%,真机一上就腰斩?arXiv 这篇把「虚实两把尺」焊一起了 🤖 2. 做 VLA 的姐妹注意了:你刷的 LIBERO 分数可能「不算数」了——新基准 simreal 同跑 3. RoboDojo 把 30 种机器人基础模型拉到一起比,仿真真机同一接口 家人们谁懂啊 🤖 做机器人策略的姐妹是不…
机器人策略练到 99% 不算数,真机那一刻才会"原形毕露"——arXiv 2607.04434 把仿真和真机焊在了一起
如果你做过机器人策略训练,2026 年你大概率被这件事折磨过—— 你在 Isaac Sim 里把策略训到了 99% 成功率,搬上真机直接腰斩到 40%。不是你的代码有问题,是仿真和真机之间那道隐形的墙一直没被系统量化过。 更头疼的是:业内根本没有统一基准。有的用 RLBench、有的用 LIBERO、有的干脆自造场景—…
「我们到底要不要上 LLM Agent?」——arXiv 2505.16120 这篇综述,给你一张行业选型地图
过去 18 个月,几乎每个公司的技术规划会上都出现过这句话:"我们要不要上 LLM Agent?" 然后散会——因为没人能回答这三个问题: 1. 我们的场景到底跑得通吗?是 demo,还是生产级? 2. 真正卡脖子的工程问题是延迟、不确定性、评估、还是安全? 3. 是先做客服、先做代码助手、先做金融、还是先做医疗? a…
2610-09127
date: 20261009 round: R2 arxiv_link: video_kb_script_path: /shared/videokb/scripts/tom/20261009_R2_cadfatherzerotrainreverse_shortvideoscript.md 标题:CADFather 零训…
SheetSage2:用合成监督学习连贯的 lead-sheet 转录
SheetSage2 证明,音乐转录的关键不只是"把每个时间点预测得更准",而是要让 tempo grid、chord、melody 和 section 在同一条可解码的序列里彼此一致;它先用结构化 Prober 把噪声标签整理成完整伪标签,再蒸馏给一个更简单的 autoregressive student。 lead…
NAMVIS:把多视图新视角合成改成几何条件下的 next-scale 自回归
NAMVIS 不再用几十次 diffusion denoising 反复"擦"出每个目标视角,而是把目标图像拆成由粗到细的离散 residual token,在每个尺度内并行生成所有 token 和所有目标视图,再用显式相机几何把 source observation 与 target view 对齐;在论文评测设置中…