研究库 深度解读
Explainers · 学术推广产出

解读

2626 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

2607.04434 · 小红书推广卡片文案
1. 机器人策略仿真 99%,真机一上就腰斩?arXiv 这篇把「虚实两把尺」焊一起了 🤖 2. 做 VLA 的姐妹注意了:你刷的 LIBERO 分数可能「不算数」了——新基准 simreal 同跑 3. RoboDojo 把 30 种机器人基础模型拉到一起比,仿真真机同一接口 家人们谁懂啊 🤖 做机器人策略的姐妹是不…
视频文案 arXiv:2607.04434(点格式) 2026-10-09
机器人策略练到 99% 不算数,真机那一刻才会"原形毕露"——arXiv 2607.04434 把仿真和真机焊在了一起
如果你做过机器人策略训练,2026 年你大概率被这件事折磨过—— 你在 Isaac Sim 里把策略训到了 99% 成功率,搬上真机直接腰斩到 40%。不是你的代码有问题,是仿真和真机之间那道隐形的墙一直没被系统量化过。 更头疼的是:业内根本没有统一基准。有的用 RLBench、有的用 LIBERO、有的干脆自造场景—…
科普版 arXiv:2607.04434 2026-10-09
「我们到底要不要上 LLM Agent?」——arXiv 2505.16120 这篇综述,给你一张行业选型地图
过去 18 个月,几乎每个公司的技术规划会上都出现过这句话:"我们要不要上 LLM Agent?" 然后散会——因为没人能回答这三个问题: 1. 我们的场景到底跑得通吗?是 demo,还是生产级? 2. 真正卡脖子的工程问题是延迟、不确定性、评估、还是安全? 3. 是先做客服、先做代码助手、先做金融、还是先做医疗? a…
科普版 arXiv:2505.16120 2026-10-09
2610-09127
date: 20261009 round: R2 arxiv_link: video_kb_script_path: /shared/videokb/scripts/tom/20261009_R2_cadfatherzerotrainreverse_shortvideoscript.md 标题:CADFather 零训…
视频脚本 arXiv:2610.09127 2026-10-09
SheetSage2:用合成监督学习连贯的 lead-sheet 转录
SheetSage2 证明,音乐转录的关键不只是"把每个时间点预测得更准",而是要让 tempo grid、chord、melody 和 section 在同一条可解码的序列里彼此一致;它先用结构化 Prober 把噪声标签整理成完整伪标签,再蒸馏给一个更简单的 autoregressive student。 lead…
深度解读 arXiv:2610.05336 2026-10-09
NAMVIS:把多视图新视角合成改成几何条件下的 next-scale 自回归
NAMVIS 不再用几十次 diffusion denoising 反复"擦"出每个目标视角,而是把目标图像拆成由粗到细的离散 residual token,在每个尺度内并行生成所有 token 和所有目标视图,再用显式相机几何把 source observation 与 target view 对齐;在论文评测设置中…
深度解读 arXiv:2610.04722 2026-10-09
FastOPD:把 foundation VLA 蒸馏成少步、可部署的轻量策略
FastOPD 不试图把大 VLA 的每一轮 denoising 都压缩掉,而是先让轻量 student 在 onpolicy 状态下对齐 teacher 的局部 velocity,再用"一步跳转应等于中点两步跳转"的 selfconsistency 约束把知识延伸到有限区间 flow map;论文报告它在 LIBER…
深度解读 arXiv:2610.02832 2026-10-09
LLM 长推理"塞不下又算不动"怎么办?InftyThink 把推理从一条长河切成短段+摘要,ICLR 2026 收录的真实解法
如果你用 DeepSeekR1、Qwen3、QwQ 这些"会思考"的模型跑过数学题或代码生成,你大概率撞过这三堵墙: 1. 算力随推理长度二次增长——推理链越长,GPU 显存和延迟被迅速吃光。 2. 被最大上下文长度锁死——32K、200K 都有顶,模型必须在中途截断。 3. 超出预训练窗口后掉点——不只是放不下,而是…
科普版 arXiv:2503.06692 2026-10-08
把 Transformer 的"加号残差"换成"跨层 attention",48B 的 Kimi Linear 居然真的把它训起来了——Attention Residuals 这事比你想象的更工程
如果你用过 LLaMA、Qwen、Kimi,或者你自己训过一个超过 70 亿参数的模型,你大概率踩过一个"玄学坑":模型越深,效果不一定越好。很多团队甚至发现,从 32 层加到 64 层,验证集 perplexity 不降反升,loss 出现平台甚至掉点。 这事在 2023 年之前还有过几次小范围讨论。但真正把锅摆到台…
科普版 arXiv:2603.15031 2026-10-08
RECAST:让模型学会"算出正确的上下文",而不只是检索上下文
RECAST 把 RAG 的"找材料"升级为"主动构造证据":轻量 RouterLM 在多轮决策中选择检索或计算操作,必要时让 CompilerLM 临时生成代码,直到它判断证据充分,再交给冻结的 AnswerLM 作答。 传统 RAG 默认"答案所需证据已经以可直接检索的形式存在于某个片段中"。但在财报表格、数据库、…
深度解读 arXiv:2610.10507 2026-10-08
ExperienceIndex:把 Agent 的长期记忆从"会什么"改成"熟悉哪些资料"
ExperienceIndex(ExpIdx)以 artifact 而非用户或抽象 reasoning pattern 为记忆锚点,从历史任务轨迹中积累单 artifact 的用途和 artifact pair 的关系,再作为 middleware 引导后续 Agent 更快找到更完整的证据集合。 法律、咨询、科研和企…
深度解读 arXiv:2610.10091 2026-10-08
Agentic RAG 系统分类综述:自主 AI 驱动的检索增强生成
Agentic RAG 通过将 AI Agent 的反思(Reflection)、规划(Planning)、工具调用(Tool Use)和多智能体协作(MultiAgent)四大设计模式嵌入 RAG 流水线,使静态检索问答系统升级为能够动态管理检索策略、迭代精调上下文、自适应编排工作流的自主推理伙伴。 传统 RAG 系…
深度解读 arXiv:2501.09136 2026-10-08
LLM Agent 评估与基准测试综述:面向真实场景部署的系统性评估框架
这篇 KDD 2025 综述为 LLM Agent 评估提供了一个二维分类体系:沿"评估目标"(评估什么)和"评估流程"(如何评估)两个正交维度组织现有工作,并指出企业场景中常被学术研究忽视的特殊挑战,为研究者和从业者提供了系统性评估 LLM Agent 的实用框架。 LLM Agent(基于大语言模型的自主智能体)正…
深度解读 arXiv:2507.21504 2026-10-08
LLaDA-V:纯扩散范式多模态大语言模型的视觉指令微调
LLaDAV 是首个完全基于 Masked Diffusion 架构的多模态 LLM(MLLM),将视觉指令微调与扩散语言模型相结合——在视觉编码器(SigLIP)+ MLP 连接层 + LLaDA 扩散语言模型的标准架构下,LLaDAV 在多项基准上取得了纯扩散 MLLM 的 SOTA 表现,且在同规模数据下展现出优…
深度解读 arXiv:2505.16933 2026-10-08
SkillForge:让 Agent 的技能库在 RL 中生老病死,而不是越写越臃肿
SkillForge 不再把 procedural memory 当只增不减的仓库,而是让每个 skill 在 trial → active → stable → retired 生命周期中随 Agent 能力变化接受淘汰、降级、稳定和重写;预训练先过滤,SFT 冷启动,随后 RL 与 skill library 协同…
深度解读 arXiv:2610.09832 2026-10-08
EngramEdit:只改条件记忆,在不碰 Transformer 主干的情况下更新事实
EngramEdit 把 DeepSeek Engram 一类 conditional memory 从"增加模型容量的查表层"改造成可编辑的知识接口:先为同一事实的多种表达求出共同的记忆目标,再联立更新共享 ngram embeddings,并对高频、短 ngram 施加更强约束,从而在保持通用能力的同时获得更好的跨…
深度解读 arXiv:2610.10533 2026-10-08
PersonTTS:从优化 Pareto 前沿转向满足每个用户的联合偏好
PersonTTS 把 TestTime Scaling 的优化单位从"单一边缘上的固定 tradeoff"改成"用户 profile 下的可执行 controller",以 accuracy、latency、inference cost 三项同时达标为 JSR;再通过相似需求 controller warmstart…
深度解读 arXiv:2610.09684 2026-10-08
主题综述 · database(2026-10-08)
本棒 netnew = 6 件:① Salt VecDB Benchmark 2026 Q1(10 DB × 19 fields · CC BY 4.0)② Turbopuffer v3 退出(20260930 · Notion 10B+ 向量真实负载)③ EngramEdit arXiv:2610.10533 条件记…
周综述 2026-10-08
AI Agent 怎么"越用越聪明"?——2026 这篇 ACL 综述,把所有记忆设计画在同一张图上
arXiv 2605.06716(From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms, ACL 2026 Findings)是一作 Lin Hongzhan 的综述 —— 它把近两年 LLM Agent…
科普版 arXiv:2605.06716 2026-10-08
AI 工程师都在糊"胶水代码"——2026 这篇论文,把"Agent 周边那一坨"变成了一份"可审阅的文档"
arXiv 2603.25723(NaturalLanguage Agent Harnesses, NLAH)是 Linyue Pan 等 2026 年 3 月发表的工作 —— 它把 AI Agent 周围那一坨"胶水代码"(怎么组织上下文、怎么路由工具、怎么校验、怎么交接状态)从耦合度极高的 Python 文件里拆出…
科普版 arXiv:2603.25723 2026-10-08
Diffusion On-Policy Context Distillation(D-OPCD):把 Agent Harness 的能力烧进扩散模型权重
DOPCD 提出「OnPolicy Context Distillation」——把 agent harness 反复打磨后的 prompt 当作 privileged context,通过 onpolicy 蒸馏把 harness 的知识烧进 TexttoImage 扩散模型的权重里,让模型在只接收原始 query …
深度解读 arXiv:2610.07250 2026-10-08
PhysEvo:让 Astra 既能动又能自改进的物理递归自改进框架
PhysEvo 提出「物理递归自改进(Physical Recursive Selfimprovement, RSI)」框架,围绕一个冻结的 Astra 模型,让 task agent 负责执行、metaagent 负责诊断失败与修订工具/技能,且 metaagent 还能改进自己的诊断工具——所有修订都不动模型权重;…
深度解读 arXiv:2610.08995 2026-10-08
Robo-COP:VLA 策略与 VLM Orchestrator 的部署中共进化
RoboCOP 提出一个让机器人在部署过程中自改进的飞轮:用 VLM orchestrator 与 VLA policy 共同在真实部署里 coevolve——policy 升级前先验证、orchestrator 随 policy 调整而调整,从而把 VLA policy 从「系统的瓶颈」变成「可被吸收进 harnes…
深度解读 arXiv:2610.09228 2026-10-08
主题综述 · multimodal(2026-10-08)
本棒 netnew = 3 件(paper_card 1705 Taming VLAs arXiv:2609.37334 multimodal 主分类 + paper_card 1710 DiffGate arXiv:2610.04596 multimodal 主分类 + paper_card 1699 ECRAG a…
周综述 2026-10-08
DeCoPrune:用"去噪一致性"作为 KV-Cache 剪枝的内在信号
DeCoPrune 把自回归视频扩散的 KVCache 压缩当作"去噪一致性问题"处理,无需训练:度量当前 chunk 中每个 token 的"中间预测与最终去噪结果之间的不一致度"作为长期保留信号,把高不一致的 token 留在长期 cache、低不一致的丢弃,从而在 LingBot World v2 上实现"剪掉 …
深度解读 arXiv:2609.39096 2026-10-08
摩洛哥 Turba 施肥机器学习技术栈:把「场地特异性施肥推荐」做成可复现的开源三层栈
arXiv 编号 + 提交日期连贯性声明:arXiv:2610.05949(v1,提交时间 20261005 08:04:09 UTC),与论文页所示 4 天前提交一致。 Turba 把摩洛哥场地特异性施肥推荐拆成 turbaclient / turbadata / turbamodels 三层开源栈,把「可程序化访问…
深度解读 arXiv:2610.05949 2026-10-08
DMAD:把分布匹配蒸馏重写成对抗蒸馏,丢掉辅助扩散模型
DMAD 把 DMD 系列的"分数差"路线重写为"对抗式 logdensity 比"路线,在 ImageNet64×64 上以一步生成实现 FID 1.04,在 SDXL 4 步上把 FID 推到 14.47,在 Wan2.1T2V14B 4 步上拿到 VBench 85.15(反超多步教师),并把 DMD 系列一直背…
深度解读 arXiv:2610.02188 2026-10-08
为 Agentic RL 重塑 MoE 路由:让专家选择跟着操作走
作者把长程 LLM agent 的"行为结构"(READ/UPDATE/... 等回合级操作)与 MoE 的"专家路由"显式对齐——回合一级的专家选择要跟着操作走,token 一级的专家选择要做局部一致——并在所有评测基准上拿到 10 个百分点以上的成功率提升,同时给出熵门控机制稳定 RL 后训练。 长程 LLM ag…
深度解读 arXiv:2610.07332 2026-10-08
Sensor-Language-Action:用语言做传感器与动作之间的统一接口
作者提出 SensorLanguageAction(SLA) 框架,把多模态传感器观测、自然语言与动作统一进一个模型,用语言作为感知与动作之间的语义接口;并发布覆盖 116,000+ 个体、79 种传感器模态、60 类动作组的大规模基准,以及统一模型 OpenSLA,在临床预测、手术室与代谢健康等真实任务上反超 SOT…
深度解读 arXiv:2610.08244 2026-10-08
企业 RAG 别再"凭直觉调"——2026 这篇论文把"调参"升级成"对话式调优",准确率 77% 时成本只要 58%
如果你们公司在用 RAG(RetrievalAugmented Generation)搭企业内部问答——无论是客服知识库、医疗病历检索、还是多跳推理 QA——你大概率会撞到同一个场景:调一晚上 RAG,chunk size 调到 256 还是 512、embedding 模型换不换、reranker 选哪个、topk …
科普版 arXiv:2610.08452 2026-10-08