Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

给编码 Agent 装上"眼睛"之后,token 立刻省 26%——但千万别做全视觉
你有没有过这种时候—— 你在 Cursor / Copilot 里让它修一个 bug,它在二十几个文件之间反复 grep 路径,刷了几千行源码进去,最后给你一个看似合理其实完全跑偏的 patch。 你让它"重构支付模块",它花了一整个 session 试图弄清"支付模块到底有哪些文件、依赖谁、被谁依赖",结果 toke…
科普版 arXiv:2606.14061 2026-07-21
2026-07-21 R3 · Muon 何时救 Agentic RL · 2607.16169
标题: Muon 何时救 Agentic RL 目标观众: AI 工程师 / 训练栈负责人 一句话核心观点: Muon 不是 AdamW 即插即用替代品,必须与 estimator 和学习率协同设计 想把 AdamW 换成 Muon?先看完。ALFWorld + 0.5B 上,论文做 2×2×2 网格:优化器、估计器、…
视频脚本 arXiv:2607.16169 2026-07-21
视频选题榜 2026-07-21
· SpecBench: Measuring Reward Hacking in LongHorizon Coding Agents · 把 reward hacking 做成 0/1 可测的 hacking gap · round=R1 · AgentLens: ProductionAssessed Trajecto…
选题榜 2026-07-21
主题综述 · llm-infra(2026-07-21)
主题:llminfra(LLM 推理与服务系统)。本文以 20260717 → 20260721 这一周的 spark e1prep、Jay 工程筛选、HF Blog / vLLM Roadmap 与少量外部 web 信号为主,叠加 2025Q4 至 2026Q2 的 5 篇代表性高引/锚点工作做深度综述。所有观点均挂…
周综述 2026-07-21
在 Kubernetes 上跑 LLM 又嫌性能不行——一篇工业论文说:用 Kueue + DAS + GAIE 三件套,TTFT 尾延迟压 90%
如果你是平台 / SRE / MLOps 工程师,或者你是 LLM 应用的架构师,过去几年大概率在做一个进退两难的取舍: 到底要不要为了 LLM 单独搭一套推理平台? 选项 A:把 LLM 塞进现有的 Kubernetes 集群——好处是多租户、弹性、声明式一套搞定,坏处是kubescheduler 不懂 GPU 分片…
科普版 arXiv:2602.04900 2026-07-21
当机器人"找东西"还要 4 个模型并行——Qwen-RobotNav 把导航变成一个"可重配"的统一底座
如果你是做机器人、AR/VR、家庭服务机器人的工程师,过去几年大概都被同一件事反复折磨: 为什么一个送货机器人,要为"跟人走、找东西、按指令走、看路标"这 4 件事分别训 4 个模型? "找钥匙"挂一个 ObjectNav 模型; "去厨房左转"挂一个 InstructionFollowing 模型; "跟着前面那个人…
科普版 arXiv:2606.18112 2026-07-21
视频脚本镜像 · AgentLens · 2607.06624
日期: 20260721 · 轮次: R2 arxiv 链接: videokb 脚本原路径: /shared/videokb/scripts/tom/20260721_R2_agentlenstrajectoryreviewcodingevalshortvideoscript.md 标题: 可读的评估 AgentLen…
视频脚本 arXiv:2607.06624 2026-07-21
2605-21384
日期与轮次: 20260721 R1 arxiv 链接: videokb 脚本原路径: /shared/videokb/scripts/tom/20260721_R1_specbenchrewardhackinglonghorizoncodingshortvideoscript.md 标题: SpecBench 可测的…
视频脚本 arXiv:2605.21384 2026-07-20
当 Sora 们还在卷"画面美感"——这个团队把视频模型改成"机器人的大脑"了
你有没有想过这件事—— Sora、Wan、MovieGen 这类视频生成模型,画质越来越逆天,但它生成出来的"开抽屉"动作,你家机器人照着学一遍,十次有八次会把手穿过抽屉面板。 为什么? 因为今天最强的视频模型都是给电影、短视频、广告训练的——它们追求的是"画面好不好看"、"镜头语言流不流畅"、"prompt 跟不跟得…
科普版 arXiv:2607.07675 2026-07-20
当 AI 公司跟你吹"我们让 Agent 越来越聪明"——他们可能只是"让 AI 多试了几次"
你有没有过这种体验—— 你让 AI 帮你写一封"礼貌但坚定地拒绝合作"的邮件。 第一次它写得太软。 你说"再硬一点"。 它给了个更狠的版本。 你又让"专业一点,别带情绪"。 它终于给了你想要的——你把第三次结果发出去,跟同事说"AI 帮我写的,特别好用"。 但这真的意味着 AI"变聪明"了吗?还是只是它多答了几遍? 2…
科普版 arXiv:2607.12227 2026-07-20
VaseMuseum:古希腊陶器的数字智能博物馆
VaseMuseum 是一个面向古希腊陶器的轻量化、模块化多模态智能体框架 VaseAgent,它把 2D/3D 视觉证据、权威知识检索与「源级 + 响应级」两层可靠性控制串起来,在不更新 VLM backbone 的前提下显著提升引用有效性与回答中立性。 把视觉语言模型(VLM)直接接入文化遗产数字博物馆是当下热点,…
深度解读 arXiv:2607.06374 2026-07-20
Flow-ERD:面向多样化交通仿真的 Agent 类型感知 Flow Matching 与熵正则蒸馏
FlowERD 通过「Agent 类型感知 Flow Matching (AFM) + 熵正则蒸馏 (ERD)」两阶段设计,让多智能体交通仿真同时跑出真实运动和多样化轨迹,在 WOSAC 基准上排名第一并主导真实性多样性的 Pareto 前沿。 自动驾驶仿真需要海量「既真实又多样」的交通流。真实的轨迹能让规划算法学到符…
深度解读 arXiv:2607.06957 2026-07-20
PolicyShiftGuard:可适配策略的图像护栏及其评测
PolicyShiftGuard 提出「PolicyShiftBench 基准 + 紧凑策略条件护栏 PolicyShiftGuard 模型 + RPSFT/BPAdapt 两阶段训练」组合,把图像护栏从「图像固有安全」范式转向「策略条件决策」,在 7B 规模上达到 76.9 Avg.F1 / 72.1 Avg.PSS…
深度解读 arXiv:2607.05910 2026-07-20
基于音韵激活映射的音素切分与识别
作者提出 SPAM(S3Mbased Phonological Activation Mapping)框架,主张自监督语音模型(S3M)的表征里已经隐含了音素结构,只需用一个轻量、无梯度的"音韵激活向量"把它显式引出,再叠两个超轻的预测头就能同时做音素切分(segmentation)和识别(recognition),且…
深度解读 arXiv:2607.09020 2026-07-20
长上下文 LLM 的自引导测试时训练
针对长上下文 LLM 直接做 testtime training(TTT)容易引入噪声、退化基础能力的问题,本文提出 SelfGuided TTT(STTT):在正式做 instancespecific 参数更新之前,先让模型自己挑出"和当前问题最相关的 span",然后只对这部分 span 做语言建模目标训练,从而在…
深度解读 arXiv:2607.09415 2026-07-20
LongMedBench:面向长程临床决策的医疗 Agent 基准
LongMedBench 是一个基于真实电子健康记录(EHR)的长程临床决策基准。它面向"agent 在多院次、长时间窗口下做临床决策"这一被现有医疗 NLP 评测严重低估的场景,提出三套评测(事实型问答、时序推理、长程决策),并通过实验揭示了当前 LLM agent 在隐性时间推理与决策任务上的关键短板——RAG 和…
深度解读 arXiv:2607.09322 2026-07-20
主题综述 · multimodal(2026-07-20)
主题:multimodal(多模态大模型)。本文以 20260716 → 20260720 这一周的 arXiv 与 HF Daily 信号为主,叠加两条历史锚点(Flamingo、Gemini 1.5)做深度综述。所有观点均挂出处,不编造数字;未公开数字一律用「未披露」/「待核」标注。 把 2026 年上半年的多模态…
周综述 2026-07-20
当 AI Agent 删了你的数据库、转错了一笔钱、发错了一封邮件——我们需要"事务"来兜底
想象一下这个场景。 你让一个 AI 助手帮你处理今天的工作: "帮我把上周的销售报告整理一下,把更新后的版本同步到共享盘,然后给客户 A 发封邮件说进度OK。" AI 接到指令,开始干活—— 然后你打开共享盘一看—— "上周销售报告"里的关键数据全是错的。 AI 在第 2 步拉错了表,第 3 步基于错误结果发了邮件,第…
科普版 arXiv:2606.17573(Cordon:面向工具调用 LLM Agent 的语义事务运行时 · flyP · 2026-07-11 更新) 2026-07-20
你的聊天机器人正在悄悄泄露别人的隐私——而传统的"先脱敏再入库"思路根本挡不住
假设你是一家医院的信息科主任。 医生现在越来越多地用「AI 病历助手」——把既往病历、检验报告、医学指南塞进一个外库(可以理解为 AI 的「外接硬盘」),让大模型边查边写。 这天,隔壁科室的张医生问了一句:"帮我写一段关于糖尿病的科普"。 AI 答得很溜。 一小时后,急诊科的李医生问:"把最近三个月所有糖尿病确诊患者的…
科普版 arXiv:2607.14811(PA-HDP:用 Prompt-Aware 动态分层差分隐私重写 RAG 外库 · flyP · 2026-07-19 更新) 2026-07-20
2607-15901
日期:20260720 · 轮次:R3 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260720_R3_dsworlddatascienceworldmodel_shortvideoscript.md 标题:数据科学 World Model 目标观众:Au…
视频脚本 arXiv:2607.15901 2026-07-20
视频选题榜 2026-07-20
· HyEmbodiedRxBrain: 具备语言视觉联合推理与想象的具身认知基础模型 · 同段规划序列压 VLM 派 vs 世界模型派两半割裂 · round=R1 · Demystifying OnPolicy Distillation · 三类角色 + 五类病态 + 三条调控 · 信号质量 教师规模 · roun…
选题榜 2026-07-20
主题综述 · rag(2026-07-20)
本文综合研究知识库中 rag 主分类下的 27 篇代表性 arXiv 工作(含 2 篇 SoK/综述、12 篇方法、5 篇基准/评测、4 篇系统/工程、2 篇安全/隐私、2 篇推理性能),并交叉 inbox/tom 的 RAG E1 预消化与 inbox/jay 的近 7 天 RAG 雷达,对 2026 年中后期 RA…
周综述 2026-07-20
自动驾驶仿真脚本不用手写了——一篇论文说:把法规文本"喂"给 chatbot,76% 能直接编译通过
如果你是自动驾驶仿真工程师,或者你做过 ADAS / ISO 26262 合规测试,过去几年大概率被同一个苦活反复折磨过: 把"法规文本"翻译成"仿真场景脚本"。 你打开 NHTSA 一份 200 页 PDF,看到「主车以 60 km/h 直行,遇前车减速」——要把它写成 Scenic DSL 脚本; 你打开 UN E…
科普版 arXiv:2607.14387 2026-07-20
AI Agent 想"长记性",先撞穿显存墙——一篇论文说:别再只换模型,把训练执行图拆开,百万 token 的 RL 后训练在 8 张 H20 上就跑起来了
如果你是 AI Agent 平台的负责人,或者你在做长上下文训练栈,过去一年大概率被同一个问题反复折磨过: 为什么推理侧已经能跑 100 万 token,后训练侧仍然卡在 256K? 你给 agent 配更长的 trajectory,prompt 越攒越长; 你换更大的集群,显存还是先爆; 你调 group size,…
科普版 arXiv:2607.14952 2026-07-20
2607.13399
date_round: 20260720 R2 arxiv_url: video_kb_script_origin: /shared/videokb/scripts/tom/20260720_R2_opddemystifyrolespathologiesshortvideoscript.md 标题:OPD 病态与调控 …
视频脚本 2026-07-20
推广选题榜 · 2026-07-20
1. Agentic RAG Survey · arxiv: 2501.09136 353 citations / ACL 2026,Agentic RAG 最全分类法(规划/检索编排/记忆/工具调用),入门必读图谱。→ 深度解读 2. InftyThink · arxiv: 2503.06692 ICLR 2026,…
选题榜 2026-07-20
2607-14187
日期:20260720 R1 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260720_R1_rxbrainembodiedjointplanningmotshortvideoscript.md 标题:RxBrain同段序列 目标观众:具身智能 / 多模态…
视频脚本 arXiv:2607.14187 2026-07-20
视觉推理的「局部性」与「长度泛化」:全局卷积是组合泛化的隐性瓶颈
在视觉状态跟踪(visual state tracking)类任务上,全局一次性输入的 vision model 会像 LLM 一样「学会走捷径」,无法随任务长度(序列/对象数)外推;只有严格 local perception 的循环视觉策略才能在长度维度上保持泛化——这提示 local attention 可能不是工…
深度解读 arXiv:2607.09061 2026-07-19
重新审视「Agent Harness 自动演化」:它赢得还是 test-time scaling 赢了?
在 TerminalBench 2.1 上,用 GPT5.4 与 Claude Opus 4.6 做后端的实验显示,自动 harness evolution 并不一致地胜过简单的 testtime scaling 基线,且演化得到的 harness 在「未见过的任务」上泛化有限——也就是说,过去报告的 harness …
深度解读 arXiv:2607.12227 2026-07-19
Chat2Scenic:用迭代 RAG 把法规文本「写」成自动驾驶仿真场景脚本
Chat2Scenic 是第一个把「法规文本 → 自动驾驶仿真场景 DSL 脚本」做成 迭代式 RAG + 交互式 chatbot 的端到端框架,并配套发布一个 123 个场景的开源 benchmark——它把 RetrievalAssemble 与 Retrieval 全脚本生成两类前辈方法的成功率双双显著提升(CS…
深度解读 arXiv:2607.14387 2026-07-19