解读
2626 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
视频选题榜 2026-10-10
· One Block, Multiple Depths: Recurrent Vision Transformers with DepthProgrammed Experts · 视觉 Transformer 工程化反 hook · 单 block + 专家库凸组合 + 70% 参数减 · round=R1
reViT:一个 Transformer block 在多个深度里循环
reViT 用一个 Transformer block 循环应用 N 次匹配全深度视觉编码器的精度,每个循环深度的 FFN 由"小型共享专家库的凸组合"表示,连续归一化深度坐标控制这个混合系数,从而在 FFN 参数空间走出一条可重采样的轨迹。 视觉 Transformer(ViT)的标准做法是把 L 个独立 Trans…
AgenticBBO-Bench:把 LLM Agent 拉进黑盒优化的同一张考卷
AgenticBBOBench 给"用 LLM Agent 做黑盒优化"这件事提供了第一个跨 5 个领域、统一个有限预算评测协议的横向基准,结论是 Agentic BBO 在所有领域家族平均分都强过纯 LLM 直接出解、并在 4/5 领域上击败最强数值优化器。 黑盒优化(BBO)在科学和工程里无处不在——超参调优、数据…
REMORY:用残差记忆做上下文压缩
REMORY 提出一种神经网络记忆模块,为长时程 LLM Agent 在压缩上下文后追加一串"软记忆 token",用近似残差连接的方式让冻结 LLM 在只看到摘要时也能逼近完整历史的续写质量。 长时程 Agent(BrowseComp、TerminalBench 这类多步工具调用场景)天然要面对"上下文窗口有限、历史…
传统 RAG 找不到答案?2026 这篇论文说:那是因为你需要的不是"找材料",而是"算出材料"
你有没有这种经历:问公司财务系统"过去六个月哪个月的运营利润率最高",传统的 RAG(检索增强生成)把相关行翻出来给你,结果你还是要自己算。其实你问的不是"哪个 chunk 含答案",而是"基于已有数据,应该查哪些记录、用什么公式、保留哪些中间结果、什么时候算够了"。换句话说,context engineering(上…
把"被骗"变成"反杀"——2026 这篇论文用 RAG 让 AI 写出能真的骗回去的剧本
你有没有想过:黑客用勒索软件、键盘记录器、信息窃取工具攻击你的时候,为什么你只能"发现 → 隔离 → 删除"?这一套被动流程最大的浪费是——你明明抓到了一只攻击者,却没能趁机布下陷阱让他踩雷。Lasse B. Strand 等人在 arXiv 2610.12415 里提了一个思路:用 RAG(检索增强生成)让 AI 离…
层次近似最近邻的贪心导航:何时能又快又准,几何条件首次给出
§0 自检栏 选题维度:垂直链路 / 数据结构 / RAG 与推荐系统的向量召回内核 / 几何分析 + 概率过程 受众:ANN 索引工程师、RAG 检索栈设计者、推荐系统召回层研究者、计算几何/概率论方向研究生 风险:抽象级高、无工程 bench 直接可跑、对生产 HNSW/IVFPQ 类参数选择只给条件、不给具体值 …
ORCAGen:用 RAG 引导生成式 AI 编出可执行的反欺骗剧本
§0 自检栏 选题维度:水平链路 / 网络安全 + LLM 应用 / RAG × 主动防御 / 恶意软件侧 受众:安全研究员、主动防御工程师、LLM 应用开发者、对 RAG 落地非问答场景感兴趣的同学 风险:依赖 2026 时期 LLM 产品代号、抽象级高、顶会 anchor 弱化(W39 已失势) 为什么读:把"主动…
WorldGuide:用闭环视觉世界模型做程序化任务,从"生成好看视频"走到"按生成结果决定下一步"
§0 自检栏 选题维度:水平链路 / 多模态 × 智能体 / 程序化视频生成 + 闭环世界模型 受众:视频生成研究者、具身/世界模型研究者、agent × multimodal 跨方向工程师 风险:作者署名较新、模型代号 "MiniMaxH3" 未在公开模型库出现、benchmark 自建 为什么读:把程序化视频生成从…
MiMo-V2.6:把强化学习算力作为自我改进主轴的全模态模型族
小米 LLMCore Team 发布的 MiMoV2.6 系列(Pro 1.02T 总参 / 42B 激活、Flash 310B 总参 / 15B 激活)把"RL 算力规模化"作为驱动 agentic 自我改进的核心杠杆:通过更大的异步 batch、更长上下文的 rollout、更复杂的多 harness 环境与 gr…
RAG 不擦除记忆,只重塑它:上下文敏感的前缀记忆提取
Groningen / Leiden 团队(Satvaty 等,已收 EMNLP 2026)通过对 prefixsuffix 样本做 paired itemlevel 后缀概率测量,证明上下文并不会"擦除"LLM 的训练记忆,而是把它拆成 contextrobust core(跨上下文稳健可提取的核心)+ contex…
LLM 集成应用的七种架构形态:从 Chat 到 Agent 系统
Irene Weber(Kempten 应用技术大学)发表的这一综述,把市面上被叫作 chatbot / copilot / RAG / workflow / coding agent / AI agent 等的"标签"逐一拆开,证明这些词汇在大厂原始语境下确实承载了可识别的架构差异 —— 综述在统一的"agent 与…
用于 X 射线衍射的自学习科学 Agent
Gan Jiang 是一个面向粉末 X 射线衍射(XRD)的自学习 LLM Agent,它不重训语言模型也不改物理模型,而是把分析经验自动诊断、修订、验证后沉淀为可复用技能,在 DeltaXRDbench 等多基准上把单相 top1 准确率从最强对照组的 58.00% / 58.47% / 26.45% 提升到 96.…
Inherit-MAS:通过工作流与执行继承实现多 Agent 系统的测试时演化
InheritMAS 把生物进化里的「继承 + 选择」拆成两件独立的事:让工作流图本身可以被结构化继承而不是每次整体重写,让已跑过的执行结果可以被精确复用而不是无脑重跑;在 WorkBench / HotpotQA FullWiki 上同时做到 SOTA 完成率和显著 token 节流。 由 LLM 组成的多 Agen…
Self-Retrospection Distillation:把事后经验变成事前远见
SelfRetrospection Distillation(SRD)抓住 RLVR 在「整组 rollout 都得同分」时信号消失的盲点,把事后才看得到的成败教训回灌成 Agent 在行动前就该有的远见预测——只在训练时用,推理时不开销,让 2B 模型在 98% 全失败组里从 0.0% 升到 60.6%。 RLVR(…
主题综述 · risk(2026-10-09)
| # | 维度 | 实测 | 状态 | ||||| | 1 | ⚠️ 密度 | 14+ 处(§1§五独立计数) | ✅ | | 2 | 主线三段式 | §1.1§1.10 全部按"机制 / 数据 / 截止日证伪" | ✅ | | 3 | 反方 v2 三段式 | §3.1§3.6 ≥6 段 × ≥150 字 | ✅ |…
你家 MLLM 的"音视频描述"分数可能是假的——2026 这篇 NeurIPS 论文,把"整段打分"拆成"逐原子单元打分"
arXiv 2610.12458(OmniCapBench)是 2026 年 10 月公开、NeurIPS 2026 接收的 benchmark 论文 —— 它把多模态大模型(MLLM)的"音视频描述"评测,从依赖不稳定 LLM 判官的整段打分,重写为对 786 个视频、跨「实体指代 / 视觉镜头 / 音频事件」三轨的…
你玩过的 3D 场景全是"死"的——2026 这篇论文,把"会动的 3D 循环世界"做成了无掩码、可任意走入的 cinemagraph
arXiv 2610.12461(OuroWorld)是 2026 年 10 月公开的工作 —— 它把任一 3D Gaussian Splatting 静态场景无掩码地提升为「任意视角无缝循环」的 3D 动态影像。先用 VLM 推断合理动态,再用视频模型合成参考视频,最后用「Fourier 级数变形场(构造性保证循环)…
Foundations of Large Language Models:一本给工程读者用的 LLM 基础「地图册」
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「LLM 综合综述」吗? | 不是综合综述,是基础概念书,明确「primary focus on foundational concepts rather than comprehensi…
OmniCapBench:把音视频描述评估从「整段打分」拆成「可验证原子单元」
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「音视频描述」这一个任务吗? | 不是仅一个任务,而是把评测目标改写为结构化诊断:把整段自由文本预测换成三轨「实体指代 / 视觉镜头 / 音频事件」的原子单元集合 | | Q2 | 谁在为…
OuroWorld:把任意 3D Gaussian Splatting 场景「无掩码」变成无缝循环的 3D Cinemagraph
| # | 问题 | 回答(基于 paper_card + arxiv abstract) | |||| | Q1 | 它真的是在做「动态 3D 场景生成」吗? | 是——且特别强调maskfree 与 endlessly looping:把任一静态 3DGS 场景提升为「任意视角无缝循环」的 3D 动态影像 | | …
视频选题榜 2026-10-09
· FastOPD: OnPolicy Distillation for Lightweight VLA Deployment · 蒸馏 VLA 别压每一轮 denoise · onpolicy 单状态对齐 + selfconsistency · round=R1 · CADFather: Autonomous CAD…
主题综述 · engineering(2026-10-09)
主题选择链:date +%j=282 → 282 mod 8=2 → 主题=multimodal;/shared/researchkb/organized/promo/surveys/ 近 72h 已覆盖 multimodal(20261008)+ llminfra(20261007 v2bak 20261007T21…
文档结构真能帮稠密检索?一份安慰剂对照消融把四种流行机制拆给你看
RAG 里四处常见的"利用文档结构"的小技巧(结构对齐分块、LLM 补的 chunk context、heading path 元数据、分层两阶段检索)并不是在同等条件下被验证的——这篇论文把它们拉到同一协议下跑了对照实验,结论是"真结构"确实帮得上(约 +0.010~+0.022 covnDCG@10),但"分块前加…
5000 万 token 的"长期记忆":靠 KV 落盘而不是重计算,让 12B/31B 模型"记得更久也更便宜"
"长上下文"不是只能靠更大的 attention 窗口——论文实测了一个公开包 galahadkv,把每个 ~16k token 块的 KV 状态加密落盘到本地 NVMe,加载时字节级一致不重计算,在单卡 H100 + vLLM 上用 Gemma 4 12B / 31B 跑了 5000 万 token 的真实文本,10…
RoboJEPA:把机器人潜变量世界模型做大——8B 参数 + 二阶幂律 + 12 种机器人形态
RoboJEPA 是目前最大的 JEPA 预测器(8B 参数),在涵盖 12 种机器人形态的大规模数据上训练,首次为多形态机器人世界模型建立了关于算力的二阶幂律——这意味着你不用真跑到目标规模,就能从拟合的曲线预测想象误差(imagination error)会到多少;更进一步,想象误差与真实机器人规划性能强相关,让"…
Agent Plasticity:通过经验衡量自我改进
Agent Plasticity 把「AI Agent 能不能从经验中学到东西」这件事从单点性能比较改写成了一个效率量纲——用「训练期间投入多少 cost 能在多大程度上转化为对未见过的环境的提升」来刻画 Agent 的可塑性,并用这个量纲发现前沿模型之间的能力差异更多来自学习效率与泛化而不是终点能力。 主流 Agen…
CADFather:通过协同工具调用实现自主 CAD 重建
CADFather 是一个"零额外训练"的自主 Agent 系统,把视觉语言模型(VLM)作为调度器,协同一组互补的 CAD 操作提案工具与数值优化器,从 3D 网格逐步恢复出可编辑的参数化 CAD 程序,并在 DeepCAD、Fusion360、MCB 全量测试集与 CADENABench / CADBench / …
UniSkill:为持续进化的策略学习与执行者对齐的技能提案
UniSkill 提出一种「无新 rollout 的对比式动作反馈」机制,让 LLM Agent 的技能库(skillbank)与执行策略(actor)共享同一策略但解耦训练目标,从而在 ALFWorld 上达到 98.4%、WebShop 上达到 84.7% 的成功率,规避了"靠后续 rollout 复用率打分候选技…
2505.16120 · 小红书推广卡片文案
1. 「我们到底要不要上 LLM Agent?」arXiv 这篇综述终于给了答案 📋 2. 做 Agent 的姐妹看过来:你以为你在解决幻觉,其实致命问题根本不是它 🚨 3. AI 工程师刷到这篇就够了——LLM Agent 落地的 4 个真挑战 + 6 个行业全景图 家人们谁懂啊 📋 每次技术规划会上听到「我们要上 …