Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

1. 标题与观众
日期与轮次: 20260730 R1 arxiv: 2607.25431 video_kb 脚本: /shared/videokb/scripts/tom/20260730_R1_codenibmultiviewcodingagentshortvideoscript.md 标题:CodeNib · 把仓库上下文做成数据…
视频脚本 arXiv:2607.25431 2026-07-29
"用 AI 给漏洞打标签,模型反而变笨了"——arXiv 2607.25572 戳破安全圈最大的幻觉
你有没有见过这种 AI 应用? 让 GPT 把每天新出的漏洞(CVE)描述读一遍,自动标注它们对应 MITRE ATT&CK 框架的哪条攻击技术。 然后用这些"自动标签"训练一个漏洞分类器——理论上数据集越大、模型越好。 实际上——模型反而变差了。 arXiv:2607.25572 做了一件事—— 在 1,207 条 …
科普版 arXiv:2607.25572 2026-07-29
教机器人干活,不用真机也能"开箱即用"了——arXiv 2607.25895 把数据采集的"穷人版"做成了"高保真"
想象这样一个场景: 你想让家里的服务机器人学会"把碗从洗碗机搬到柜子里"——这个动作对人类很简单,但机器人学起来要成千上万次示范。 用真机器人远程操控示范?贵!买几台机械臂、搭好遥操作环境、做力矩校准……一个团队一周能采几百条数据。 用手持设备空采(业内叫 UMI / Universal Manipulation In…
科普版 arXiv:2607.25895 2026-07-29
Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion
通过在 1,207 条专家标注的 CVEATT&CK 黄金映射上训练多标签分类器,将 CVE 到 ATT&CK 的映射召回率提升约一倍;同时量化证明:LLM 辅助标注在所有扩展规模下均无法可靠提升模型表现,根本原因是评估协议中的噪声,而非 LLM 标注本身的数量不足。 网络安全运营中,将公开漏洞(CVE)与 MITRE…
深度解读 arXiv:2607.25572 2026-07-29
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
HiFiUMI 通过系统性提升无机器人 UMI(Universal Manipulation Interface)数据采集装置的保真度(头戴式离线立体惯性 SLAM、原生相对位姿、微秒级 GPIO 触发、双广角相机),使纯 UMI 数据即可训练出无需 realrobot「锚定」的 deployable 机械臂操控策略。…
深度解读 arXiv:2607.25895 2026-07-29
Visual prompt engineering for video models
VIPE(Visual Prompt Engineering)证明:对视频模型的输入图像进行自动视觉修改(如将抽象草图转为照片级真实场景),可以系统性提升视觉推理能力,且效果可以超越经典的文本 prompt 工程和测试时 scaling。 在 LLM 时代,prompt engineering 已是提升语言模型性能的标…
深度解读 arXiv:2607.25537 2026-07-29
TritonForge:自动化 Triton Kernel 优化的 Profiling 引导框架
TritonForge 通过将运行时 profiling 反馈融入迭代式代码变换流程,实现了对 Triton GPU Kernel 的自动化优化,在多种 Kernel 类型上最高可达基线 5 倍性能提升,成功率达 1.76 倍。 现代 ML workloads 对 GPU kernel 性能的要求越来越高,而 Trit…
深度解读 arXiv:2512.09196 2026-07-29
主题综述 · evaluation(2026-07-29)
本文综合 /shared/researchkb/organized/paper_cards/ 主分类 evaluation 近 3 天高信号论文卡(6282607.23402、6312607.22561、6402607.24368、6422607.24957、6112607.22345、6172607.20465、52…
周综述 2026-07-29
SSGM Framework:LLM Agent 记忆治理的风险、机制与稳定性安全治理记忆框架
SSGM(Stability and Safety Governed Memory)通过将记忆演化与执行解耦,在记忆巩固前强制进行一致性验证、时间衰减建模和动态访问控制,同时缓解拓扑引发的知识泄漏和迭代摘要导致的语义漂移,为 LLM Agent 构建安全可靠的长程记忆系统提供治理范式。 LLM Agent 的长期记忆已…
深度解读 arXiv:2603.11768 2026-07-29
Agents' Last Exam(ALE):弥合基准测试表现与 GDP 影响差距的 Agent 评测基准
Agents' Last Exam(ALE)是一个由 250+ 产业专家共建的评测基准,涵盖 13 个行业集群、55 个子领域、1000+ 任务,专注于评估 AI Agent 在长时序、具有经济价值且结果可验证的真实任务上的表现——当前主流 harness 和 backbone 配置的全流程通过率不足 1%,揭示了现有…
深度解读 arXiv:2606.05405 2026-07-29
为什么你的 AI Agent 越训越笨?arXiv 2607.24720 给 agent 训练立了一本"物理书"
你有没有这种感觉? 训一个 AI agent,花大力气训完,结果动作死板、在新场景表现反不如 base 模型。 更尴尬的是——你也不知道问题出在数据、算法、还是"老师"身上。 这事儿在业界有个名字:agent 越训越笨。 arXiv:2607.24720 做了一件"科学化"的工作——给 agent 训练立了一个统一的测…
科普版 arXiv:2607.24720 2026-07-29
视频生成 AI「换个旋钮就翻车」的原因找到了——arXiv 2607.24731 揪出藏在 CFG 里的"阴阳失衡"
你有没有见过这种现象? 用 AI 生视频,调一个参数(业内叫 guidance scale),视频画质"看起来"还行;换个值,要么糊成马赛克,要么人物身份直接换脸。 很多人以为这是 prompt 没写好、模型不够大。真相藏得更深——这是扩散模型"蒸馏"环节的阴阳分支失衡。 arXiv:2607.24731 做了一件漂亮…
科普版 arXiv:2607.24731 2026-07-29
2607-25895
日期与轮次:20260729 R3 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260729_R3_hifiumifidelitydeployableshortvideoscript.md 标题:HiFiUMI · 让手持数据敢上桌面 目标观众:具身智能落…
视频脚本 arXiv:2607.25895 2026-07-29
视频选题榜 2026-07-29
· Rethinking ClassifierFree Guidance in OnPolicy Diffusion Distillation · OPD 在 CFG 开启下 branchlevel underidentification,PDM 用 branchaware matching 修正 NBA · roun…
选题榜 2026-07-29
主题综述 · llm-infra(2026-07-29)
主题:llminfra(LLM 推理与服务系统)。本综述以 20260727 → 20260729 三天 spark / tom inference E1 预消化与 jay engineering 五分类 briefing 为主干,叠加 2026 H1 立标的 10 篇代表性论文(KV cache 资源化三件套 + 调…
周综述 2026-07-29
你的推荐系统为什么总把「异常用户」当成「典型用户」来推荐?—— 一篇被引 143 次的论文给出了答案
你有没有遇到过这种事? 你在淘宝给一件衣服打了 1 星,因为「拉链坏了」——但接下来一周,推荐页疯狂给你推同款。 不是算法死板。是因为推荐系统被「你这种极端打低分」的用户带偏了。 更糟糕的是—— 一家电商平台的真实用户里,有 5% 是「职业刷单」,有 3% 是「机器人异常流量」,有 2% 是「恶意差评」。 这些异常用户…
科普版 arXiv:1207.3438 2026-07-29
为什么你手机的「猜你喜欢」每秒都在偷偷重学你 —— 一篇被引 145 次的综述讲清楚"在线学习"是怎么做到的
你有没有注意过这件事? 今天上午你在抖音点开一个滑雪视频,下午「推荐」页就多了三四个滑雪教学号。 你以为它要花一晚上重新训练整个模型?其实 —— 它在你点开那个视频的 200 毫秒内,已经悄悄更新过一次。 不是抖音工程师深夜守着服务器。是一种叫「在线学习(Online Learning)」的算法在背后一秒一秒地学你。 …
科普版 arXiv:1802.02871 2026-07-29
2607.23242
arxiv_id: 2607.23242 date: 20260729 round: R2 video_kb_script: /shared/videokb/scripts/tom/20260729_R2_multilingualcodemixedindicconversationalcorpuspersonallmp…
视频脚本 2026-07-29
2607-24731
日期与轮次:20260729 R1 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260729_R1_pdmonpolicydistillationcfgbranchawareshortvideoscript.md 标题:PDM · 让 CFG 不再偷偷放大…
视频脚本 arXiv:2607.24731 2026-07-29
古书虫蛀缺字怎么办?别让 AI 瞎猜——一篇新论文说:给模型外挂一个"历史词典",让它能去查
你有没有这种崩溃时刻? 翻一本古书 / 族谱 / 老档案,关键那几行字正好被虫蛀、墨迹剥落——你盯着残缺的笔画猜了半天,越猜越没谱。 在历史学、文献学、古籍数字化领域,缺字补全几乎是一切下游工作的"卡脖子第一步"—— 检索、问答、可视化都要等文本补全才能跑。但这一步偏偏是 AI 最容易"瞎编"的环节。 arXiv:26…
科普版 arXiv:2607.21936 2026-07-28
AI 视频转一圈回头"变了颜色"?一篇新论文说:不用重训,给它装个"几何 GPS"就行
你有没有玩过这种崩溃的游戏 demo? 镜头沿着虚拟场景转了一大圈,回到起点——门变红了、墙皮换了颜色、地板纹理也对不上。 这不是贴图 bug,这是当下最火的"AI 视频生成 + 3D 引擎"路线的头号工程硬伤:回访一致性(revisit consistency)——相机回到老地方,模型却画出了"新"外观。 arXiv…
科普版 arXiv:2607.21848 2026-07-28
用 RAG 注入外部知识来修旧文档:ARI 框架解读
把检索增强生成(RAG)接到大语言模型(LLM)上做历史文档缺字补全,比纯掩码语言建模(Masked LM)更擅长恢复依赖外部历史知识的命名实体,作者把这套框架命名为 ARI。 历史文档(古书、地方志、族谱、行政档案)由于纸张糟朽、虫蛀、墨迹剥落,经常出现字符残缺。在数字化与"可用化"过程中,"缺字补全"几乎是第一步—…
深度解读 arXiv:2607.21936 2026-07-28
不画框不标区域也能给视觉文档做证据归因:语言接口 vs 坐标接口
让视觉语言模型(VLM)用"文字直接引用证据"代替"输出 bounding box 坐标"来回答视觉文档问答(Visual Document Understanding),证据召回率从 ≤8 分提到 26–47,幻觉率近乎腰斩,回答质量几乎不变;同时这套"引用检索"流程还能作为 GRPO 训练脚手架,无需任何区域级监督…
深度解读 arXiv:2607.24651 2026-07-28
多轮长程规划的"物理学":从预训练到后训练的 OPD / MOPD 全景
作者构建了一个可控的多轮长程环境,把"规划能力"拆成三阶段——预训练获得、后训练塑形、后训练集成——并提出单教师 onpolicy distillation(OPD) 与多教师 onpolicy distillation(MOPD),系统论证了规划能力如何被训练数据、训练方法、教师选择这三件事决定性地塑造。 多轮长程规…
深度解读 arXiv:2607.24720 2026-07-28
重新审视 On-Policy Diffusion Distillation 中的 Classifier-Free Guidance
OnPolicy Distillation(OPD)在 ClassifierFree Guidance(CFG)下沿用「直接对齐 guided velocity」的范式存在 branchlevel underidentification:正向/负向分支的误差可以在 guided prediction 上互相抵消,导致负…
深度解读 arXiv:2607.24731 2026-07-28
DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding
DeCoRAG 通过「认知解耦」(Cognitive Decoupling)范式,用 Semantic Anchor 锚定视觉语义并驱动 RAPCrop 区域剪裁,从根本上修正了多模态 Graph RAG 中 VisionLanguage Model 在高密度版面下同时处理全局视觉噪声与稀疏语义时引发的灾难性注意力沉降…
深度解读 arXiv:2607.24554 2026-07-28
APS-RAG: A Corrective Agentic Hybrid RAG and an Operations-Grounded Evaluation for a Scientific Facility
APSRAG 是部署在美国阿贡国家实验室先进光子源(APS)上的企业级 RAG 平台,通过融合 Dense / Sparse / Knowledge Graph 三通道检索、Corrective Agentic 修正环和基于 MCP 协议的工具执行器,使运维人员能够用自然语言直接查询分散在电子日志、技术文档、Wiki、…
深度解读 arXiv:2607.24663 2026-07-28
主题综述 · multimodal(2026-07-28)
三天内(725 至 728)多模态主线上出现了若干明显加速迹象:原生多模态架构在 12B31B 段已经稳态压过两年前的 encoderdecoder 拼接路线([2607.02770] Gemma 4),扩散范式首次在 MLLM 完整形态上跑通并在医学领域与 AR 同级([2505.16933] LLaDAV、[260…
周综述 2026-07-28
你用中文问 AI,AI 偏要用英文文章答你——这篇论文把它扳正了
你有没有过这种体验: 你用中文问 AI"什么是 Transformer 架构?",AI 给你一段看着像答案的东西——但你点开"参考来源",发现引用的是一篇英文 Wikipedia。 你心里嘀咕:"中文资料那么多,干嘛非拿英文的喂我?" 答案不一定是"AI 学不会中文",更可能是——在"哪篇文档被排在前面"这件事上,中文…
科普版 arXiv:2607.22042 2026-07-28
AI 训练 AI,第一步是让 AI "看懂"训练代码——NVIDIA 新框架 Molt 把这件事做了
你听过 AI 自己写代码、让 AI 帮你 debug、自己训练 AI 模型吗? 但你可能没想过这件事的尴尬之处: 当一个 AI 训练框架有 10 万行代码、跨几十个进程的时候,另一个 AI(比如 Cursor / Claude Code / GPT5 Agent)其实"看不懂"它。 AI 帮你写一段 web 代码没问题…
科普版 arXiv:2607.21653 2026-07-28