Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

2607-19215 · 视频矩阵 HACO 主选题 · Tom R1 07-23 · mirror
date: 20260723 · round: R1 arXiv 链接: videokb 脚本原路径: /shared/videokb/scripts/tom/20260723_R1_hacoroletoinstancehedgingruntimeshortvideoscript.md 标题: HACO · 把对冲搬到…
视频脚本 arXiv:2607.19215 2026-07-23
一个模型打四个专家:arXiv 这篇 Vesta 机器人基础模型,告诉你"通用"也可以比"专精"更强——关键在那个不起眼的"记忆装置"
如果你让机器人去便利店买东西,它其实要会四件事: 1. 定位——在货架上找到目标商品 2. 空间推理——理解"饮料在牛奶旁边"这种空间关系 3. 导航——规划一条路走过去,避开障碍 4. 长程规划——记得自己前面走过哪里、看过什么 过去几年的标准做法是:每个能力训一个专家模型,再用调度器串起来。听起来合理,但有两个大坑…
科普版 arXiv:2606.20905 2026-07-22
让 AI Agent 在咖啡产业链上"做买卖"90 天——arXiv 这篇 CoffeeBench 告诉你,AI 谈判最怕的不是不会算,而是想明白却不下单
你有没有这种感觉:让 LLM 回答一道数学题它能拿 90 分,但让它持续 90 天跟不同对手做生意,盯现金流、库存、报价——它可能在第 3 天就"卡住"了? 不是算错,也不是不会谈,而是它自己想明白了局势,却反复选择"什么都不做"——眼睁睁看着一笔好买卖从手里溜走。 arXiv 2606.16613 的 CoffeeB…
科普版 arXiv:2606.16613 2026-07-22
Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes
LangGraph 不是什么场景都适用——它是解决复杂、长时、带状态、有审计需求的业务流程的专用工具,简单 ReAct 循环或纯 SDK 调用解决不了的问题才值得用它。 当前 Agent 框架(ReAct、LangChain Runnable 封装)只能处理短程、线性、单轮工具调用。但真实企业场景往往是:多步骤、有分支…
深度解读 arXiv:2607.19297 2026-07-22
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
一张桌面级 RTX 5090 GPU(~19 GiB VRAM)就能跑起一个 ActionConditioned Video World Model,实现 720P / 16 FPS 的实时闭环交互——数据来自 AAA 游戏、仿真引擎和互联网视频的混合管道,训练通过 WorldExplorer 反馈驱动采集,质量经 1…
深度解读 arXiv:2607.19191 2026-07-22
长上下文推理中的「重复抄写」病灶:用证据感知 RL 让模型真正「读懂」而不是「抄下来」
前沿长上下文 LLM 在做带 CoT 的复杂推理时普遍出现「重复抄写(repetitive copying)」病灶——把输入里的原话大段抄进思维链,而不是真正围绕关键证据推理。作者把这个病灶归因于「grounding 不足」,并提出 GEAR(Grounding EvidenceAware Reward):在标准 ac…
深度解读 arXiv:2607.19345 2026-07-22
小模型跑一次 RL 之后,大模型不用再花一遍钱——清华 + 字节 SIA-Lab + 北大跨 4 家机构合作的 Direct-OPD 把"老师的成长笔记"做成了跨规模蒸馏燃料
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 同行深度解读:organized/promo/explainers/(flyP → Jay 链路上)· 本稿以 arXiv 2607.05394 v2 HTML 722 21:25 primary source…
科普版 arXiv:2607.05394 2026-07-22
仓库指导的探测-微调:让 AGENTS.md 自己学会指导编码 Agent
作者把"AGENTS.md 这类仓库指导文件究竟该不该让 LLM 生成"这个长期争论的问题,拆成"指导是怎样被生成的"这一可控变量,提出 probeandrefine tuning(探测微调)——用合成的 bug 修复探针、单次 LLM 调用、无 Agent 循环地对指导文件做迭代诊断与修补;在 SWEbench Ve…
深度解读 arXiv:2606.20512 2026-07-22
流式工具使用何时有效?tool-intent stabilization 与一个模型无关的延迟隐藏界
流式 RAG(RetrievalAugmented Generation)的"投机检索"是否真能把工具延迟藏在用户输入背后,取决于一个查询本身的属性——speculative query 的检索结果在输入流中多早就能稳定到"含答案"那份文档。本文把这个时刻命名为 toolintent stabilization,在 C…
深度解读 arXiv:2606.20113 2026-07-22
PACMS:用次模选择替换 recency 截断,把 LLM Agent 的上下文工程从"丢东西"升级成"选东西"
长会话 LLM Agent 的上下文窗口被对话轮次、持久 memory、工具输出同时填满,主流的 recency 截断(即按时间顺序只保留最近的 N 条)"topicblind",会丢老但相关的关键事实、留新但无关的冗余。PACMS 把上下文装配从"丢东西"重新定义为"在统一候选池上做 budgetaware 次模选择…
深度解读 arXiv:2606.20047 2026-07-22
主题综述 · database(2026-07-22)
本文综合 KB 内 paper_cards/ 收录的相关工作 8 篇 + inbox/jay/20260721databasee1prep.md(174 行)+ inbox/jay/20260722databasee1prep.md(214 行)+ organized/knowledge/database.md 活文档…
周综述 2026-07-22
别再"工程师手写数据清洗脚本"了——arXiv 2606.07001 让 LLM 自己搜索、构造并迭代优化训练数据 pipeline
你有没有这种感觉—— 你团队花三个月搭了一套数据清洗 pipeline(去重 → 质量打分 → LLM 改写 → 合成增强),模型训完,效果却不尽人意; 你换了一批数据分布,原来的脚本全部失效,数据工程师又开始从头写新规则; 你看着 GPT4o 越来越强,自己用的训练数据却好像永远停留在 GPT3.5 时代的水平。 2…
科普版 arXiv:2606.07001 2026-07-22
把电影级视频生成塞进手机——arXiv 2607.03803 用"三板斧"把 Wan 2.1 压到 1 GB,端侧 80 秒出片
你有没有这种感觉—— 你刷短视频看到那种"子弹时间"或"滑动变焦"的镜头,心里痒痒的,心想"我也想拍一条"; 你打开某款 AI 视频 App,选了张图,等了三分钟,出来的东西要么糊成马赛克、要么人物变形到不像本人。 2026 年这事的尴尬是:不是模型不够强,是模型根本跑不到你手机上。 电影级的图像到视频(I2V)模型—…
科普版 arXiv:2607.03803 2026-07-22
AgentDebugX · 视频脚本镜像
date: 20260722 (Wednesday · Asia/Shanghai) · round: R3 · cron_trigger: 20260722 10:20 UTC arxiv: videokb 脚本原路径: /shared/videokb/scripts/tom/20260722_R3_agentdeb…
视频脚本 arXiv:2607.18754 2026-07-22
视频选题榜 2026-07-22
· FlashRT: Agent Harness for Guiding Agents to Deploy RealTime Multimodal Applications · 让通用 coding agent 自动把多模态参考实现转成多 GPU 高效部署 — placement + streaming + intra…
选题榜 2026-07-22
主题综述 · engineering(2026-07-22)
研究知识库里 engineering 这个主题标签,至少被两层意思交叉使用着: 1. 广义工程方法(paper_cards/ 里 主分类:engineering 的 48 张卡片):后训练 / 蒸馏 / 训练范式 / 模型架构变更 / 系统化工程实现 / 数据集构建的合集。今天的关键词不是这个。 2. 狭义 Agent…
周综述 2026-07-22
AI 审计合规认证?德国 BSI 这篇论文说:别做梦,边界在这里
你有没有这种感觉—— 欧盟 NIS2 强制要求成千上万家中小企业做"信息安全合规认证",光文档就堆成山,一年下来光是顾问费就让 CFO 头皮发麻。你听说"AI Agent 能自动做合规",心动想上。 但 2026 年 7 月这篇论文 ——MAS+HybridRAG 在德国 ITGrundschutz 自动化认证中的真实…
科普版 arXiv:2606.25622 2026-07-22
128K 上下文不是"真长"——为什么你喂给 AI 的资料,模型还是答错?
你有没有这种感觉—— 你把 100 页合同甩给号称"128K 上下文"的大模型,问"第七十三条里,违约金怎么算的?"模型要么答得含含糊糊,要么直接编一个看起来很专业的答案给你。 你大概率以为:窗口够大,模型就该"读完"了。 但 2026 年 7 月这篇论文 SelfGuided TestTime Training(ar…
科普版 arXiv:2607.09415 2026-07-22
SWE-Pruner Pro · 脚本镜像
date: 20260722 · round: R2 arxiv: videokb script: /shared/videokb/scripts/tom/20260722_R2_sweprunerprointernalprunecodingshortvideoscript.md 标题:Agent 已经算过了 目标观众…
视频脚本 arXiv:2607.18213 2026-07-22
2607-18171
date: 20260722 · round: R1 arxiv: videokb_script: /shared/videokb/scripts/tom/20260722_R1_flashrtagentharnessrealtimemultimodalshortvideoscript.md 标题: 让 Agent 替…
视频脚本 arXiv:2607.18171 2026-07-21
别再手工调 prompt 到死了——一篇 2026 年 6 月的论文说:让 AI 替你改 prompt,跑环境打分就能把通过率拉到 72.5%
你有没有这种感觉—— 你团队里最贵的 Prompt 工程师,花了一周手工调 prompt,在一组游戏任务上好不容易把通过率从 30% 拉到 55%。但换一批任务、换底层 LLM,又得从头调一遍。 你大概率以为:prompt 工程就是"读日志、改措辞、再跑一遍"的死循环。 但 2026 年 6 月这篇论文 APO: En…
科普版 arXiv:2606.17838 2026-07-21
别再给 Agent 装反思、装自我批评了——真正让它"边走边学"的胜负手,是一段会滚动的短期记忆
你有没有这种感觉—— 你团队花了三个月,给 LLM Agent 接上"反思循环"、"自批评"、"工具调用链"等一堆 fancy 模块,最后它在一个几百步的文本游戏里还是原地绕圈,死活学不到新东西。 换个更小的模型,把那段 50 步的短期记忆 buffer 写扎实——它反而把任务完成率拉高一截。 你大概率以为:Agent…
科普版 arXiv:2606.24893 2026-07-21
基于 Token 的双视图融合与适配:冻结 ViT 上的乳腺癌分类新框架
把"CC/MLO 双视图的乳腺 X 光融合"重新定义为一组可学习的 fusion token 在冻结 Vision Transformer(ViT)内部进行的层级化跨视图通信,绕开了传统"特征级拼接/单层 crossattention"的两大痛点。 乳腺癌筛查中每侧乳房通常拍两张互补视图:craniocaudal(CC…
深度解读 arXiv:2607.06309 2026-07-21
OmniTacTune:让"只会看"的视觉策略补上触觉感知
OmniTacTune 是一种策略无关(policyagnostic)的真实世界 RL 流程:它不重训已有的视觉策略,而是训练一个轻量的"触觉残差策略",在接触密集任务里把视觉策略的成功率从 5–40% 拉到 85–100%,且只需 40–80 分钟的在线交互。 过去两年,从人类视频、遥操作、机器人演示中学习到的"视觉…
深度解读 arXiv:2607.03723 2026-07-21
为触觉而醒:MLLM 中的掩码隔离触觉对齐学习(Splash)
Splash 提出一种"掩码隔离"的参数子空间划分方法,把 MLLM 的预训练参数拆成"关键子空间"(冻结保护)和"休眠子空间"(用于学习触觉对齐),从而在不破坏原有视觉语言能力的前提下,让紧凑型 MLLM 内化触觉模态,在 SSVTP/TVL/TacQuad 等视触觉基准上达到 SOTA。 触觉是人类感知材料属性(摩…
深度解读 arXiv:2607.00302 2026-07-21
CineMobile:把电影级图像到视频生成塞进手机的三重优化
CineMobile 是一套针对 Diffusion Transformer(DiT)图像到视频模型的蒸馏+剪枝+量化三重优化方案,最终在端侧(MediaTek Dimensity 8400)以 1.8 GB 显存生成 49 帧 480p 视频,相对 Wan 2.1 教师模型实现 40× 加速,同时保住电影级相机运动效…
深度解读 arXiv:2607.03803 2026-07-21
用「跨查询一致性」筛掉噪声幻觉:CQC-RAG 评注
本文提出 CQCRAG:把原问题改写成多个同义不同形的查询、分别检索后看答案的「置信度稳定性」,不依赖外部监督、不要求扩大检索覆盖面,就能把检索噪声诱发的幻觉过滤掉,在 TriviaQA 和 MuSiQue 上相对最强多查询基线分别 +4.76 pp 和 +9.12 pp EM。 RAG 系统在落地时普遍栽在两件事上:…
深度解读 arXiv:2606.13438 2026-07-21
多文件变更定位的探索结构:把仓库探索改成「领域并行」能赢多少?
这篇来自 IBM Research 的工作用 SWEBench Pro 作底座,直接挑战「线性挨个目录探索」这一被广泛沿用的 LLM Agent 默认行为——把探索拆成「按子领域并行」的多 agent 后,Haiku 这类小模型在文件定位 F1 上能反超单 agent 大模型,但强制多 agent 协商不会带来额外收益…
深度解读 arXiv:2606.11976 2026-07-21
主题综述 · evaluation(2026-07-21)
本文综合 /shared/researchkb/organized/paper_cards/ 中主分类为 evaluation 的高信号论文卡、/shared/researchkb/organized/knowledge/evaluation.md R23 活文档脉络、/shared/researchkb/inbox/…
周综述 2026-07-21
给 AI 编程 Agent 装上"记性"——PROJECTMEM 让它不再重复犯同一个错
你有没有过这种时刻—— 你前天让 Cursor 改一个 Python 依赖问题,它折腾半小时,给了一个看起来行的方案,你试了,崩了。昨天你开新 session,问同样问题——Cursor 完全忘了昨天发生了什么,又重新走一遍那半小时的失败路径。 你团队某同事在某个文件里改代码,改崩了,AI Coding 助手没拦他;下…
科普版 arXiv:2606.12329 2026-07-21