Explainers · 学术推广产出

解读

1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

机器人终于会"边想边做"了——arXiv 2607.14187 把具身 AI 从"看图说话"推进到"边想象边执行"(Tencent Hunyuan 开源 + 30 作者跨 3 家腾讯机构合作)
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 同行深度解读:organized/promo/explainers/(flyP → Jay 链路上)· 本稿以 arXiv 2607.14187 v1 PDF + HTML 719 21:25 primary …
科普版 arXiv:2607.14187(RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination · **arXiv 2607.14187 v1 · 2026-07-18** · 一作 **Liang Haotian** · 共 **30 位作者** · **3 家腾讯合作机构**:Tencent Robotics X Team + Futian Laboratory + Tencent Hy Team) 2026-07-19
LongStraw:固定 GPU 预算下,把 RL 后训练上下文推到 2M+ token 的执行栈
LongStraw 是一个面向百万 token 量级 RL 后训练的架构感知执行栈,用「共享 prompt 无 autograd + 短响应分支逐条回放」的方式,把激活显存压到训练图级别,代价是多花一些重放时间;它在 8 张 H20 上把 Qwen3.627B 的 GRPO 训练推到 2.1M positions,并在…
深度解读 arXiv:2607.14952 2026-07-19
RAG 里的隐私保护不该是静态的:PA-HDP 用 Prompt-Aware 差分隐私重写外库
这篇论文指出 RAG 的隐私风险本质上由 prompt 驱动、随 query 动态变化,但现有方法都默认外库文档的隐私风险是「documentlevel static」的;它提出 PAHDP(PromptAware Dynamic Hierarchical Differential Privacy)框架,先做 prom…
深度解读 arXiv:2607.14811 2026-07-19
SUFLECA:把 CAD-to-image 对齐从外观匹配拉到几何一致匹配
SUFLECA(Scaling Up Feature Learning for CAD Alignment)是面向 zeroshot 6D 位姿估计的弱监督框架,通过「在 674K 图像 / 12 个真实与合成数据集上以 Normalized Object Coordinates (NOCS) 做几何监督规模化训练」+…
深度解读 arXiv:2607.15058 2026-07-19
卫星能不能告诉你"明年这片地庄稼会减产多少"?——一篇论文说:能,但不能只给一条预测,要给一束概率;它把天气拆成 3 路信号,让预报"对天气变化"真的敏感起来
如果你在 2024 年的华北平原种了玉米,夏天打开天气预报 App,看到"明天 38°C,持续一周"——你大概会想知道:我家那片地,今年 NDVI(归一化植被指数,可以粗略理解为"这片庄稼绿不绿、长势好不好"的卫星量化指标)会掉多少?明年还能收成多少? 现有的"AI 预报"大多只能告诉你一条预测轨迹——一个均值。但庄稼…
科普版 arXiv:2606.27277(EO-WM:面向概率性地球观测预报的物理信息世界模型 · flyP · 2026-07-17 更新) 2026-07-19
为什么 AI 帮你点外卖订机票时,经常在第三步突然"崩"成一团乱码?——一篇论文告诉你:崩的不是能力,是 5 个特殊 token 的概率压过了正确选项
你大概遇到过这种场景: 让 ChatGPT/Agent 帮你"先搜资料,再写邮件,再订机票"——前两步还很顺,到了第三步,模型突然开始吐 }}}}}{、"""{" 这种半截 JSON,工具名乱码,然后整个任务崩盘,reward 直接归零。 很多用户的第一反应是:模型不行,能力不够。 arXiv 2606.26027 这…
科普版 arXiv:2606.26027(多步工具调用强化学习为何崩溃及监督信号如何修复 · spark · 2026-07-10 更新) 2026-07-19
2607-14387
日期:20260719 R3 · 主轮次脚本 arxiv:arXiv 2607.14387 v1(IROS 2026 已接受) 原路径:/shared/videokb/scripts/tom/20260719_R3_chat2sceniciterragnl2dslshortvideoscript.md 标题:Chat2…
视频脚本 arXiv:2607.14387 2026-07-19
视频选题榜 2026-07-19
· Rethinking the Evaluation of Harness Evolution for Agents · 自动 harness 演化 ≠ scaling:留出任务上几乎不优于 baseline · round=R1 · Demystifying RL for LongHorizon ToolUsing…
选题榜 2026-07-19
主题综述 · agent(2026-07-19)
本文综合研究知识库中 5 篇 Agent 主线综述 + 6 篇 2026 年代表性方法 / 评测 / 失效分析工作,对 LLM Agent 在 2026 年中期的研究脉络、工程落地与开放问题做一次深度盘点。所有观点均附引用出处(arXiv 编号或 inbox 文件路径),不复用未核验的数字。 Agent 这个词在 20…
周综述 2026-07-19
2603-21972
日期:20260719 R2 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260719_R2_agentstarrlrecipelonghorizonshortvideoscript.md 标题:AgentSTAR · 5 维配方 目标观众:AI 工程师 …
视频脚本 arXiv:2603.21972 2026-07-19
2026-07-19 R1 · Harness Evolution 的评估被高估了吗
日期:20260719 (Sunday · Asia/Shanghai) · R1 arXiv 链接:< videokb 脚本原路径:/shared/videokb/scripts/tom/20260719_R1_harnessevolutionrethinkevalshortvideoscript.md 【钩子 — …
视频脚本 arXiv:2607.12227 2026-07-18
让 AI Agent 跑 85 分钟、烧掉 1000 万 token,最强模型也只能拿 15 分——长程 Agent 的天花板被测出来了
如果有人告诉你: "我的 AI Agent 可以连续工作 1.5 小时、调用几百次工具、消耗近 1000 万 token——而且,最后还能把任务做完。" 你大概率会想:这不就是"AI 打工"该有的样子吗? 但 2026 年 7 月新出的 LongHorizonTerminalBench 告诉你一个反直觉的真相: 当前最…
科普版 arXiv:2607.08964 2026-07-18
AgentOdyssey:面向测试时持续学习智能体的开放式长视野文本游戏生成
AgentOdyssey 是一个程序化生成的开放式文本游戏评测框架,把"测试时持续学习(testtime continual learning)"这件事从口号变成了可度量的实验场:在长视野游戏中同时考察世界知识获取、情景记忆、探索多样性、规划深度与推理代价,并发现短期记忆是多种 Agent 范式在测试时训练中的关键组件…
深度解读 arXiv:2606.24893 2026-07-18
面向 LLM 游戏 Agent 的环境接地自动化提示优化
针对 LLM 游戏 Agent「换 prompt 像换模型」却只能靠人手调的问题,本文提出一套自动提示优化(APO)流水线:把「观测→动作」拆成 Descriptor + Actor 两段,用 LLM 驱动的进化循环在外挂环境回报的引导下迭代改写 prompt,不动模型权重,在 BALROG/BabyAI 五任务上稳定…
深度解读 arXiv:2606.17838 2026-07-18
把任意 UE 工程变成"可被 Python 编程控制的具身 AI 仿真后端"——SPEED/SPEAR 跨 7 家机构开源,让 14,000+ UE 函数全部可被 Python 调用(ECCV 2026)
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 同行深度解读:organized/promo/explainers/(flyP → Jay 链路上)· 本稿以 arXiv 2607.06701 v1 PDF + HTML 718 21:25 primary …
科普版 arXiv:2607.06701(SPEAR: A Simulator for Photorealistic Embodied AI Research · **ECCV 2026 接收** · 一作 Mike Roberts · Adobe Research + Intel Labs + Manycore Tech + Adobe + NVIDIA + ETH Zurich + Imperial College London 跨 7 家机构合作) 2026-07-18
Long-Horizon-Terminal-Bench:基于密集奖励评分的 Agent 长程终端任务极限测试
LongHorizonTerminalBench 是一个包含 46 条长程终端任务、覆盖 9 大类别、采用密集奖励(dense reward)+ 子任务细粒度评分的 Agent 评测基准:每条任务需要数百 episode、分钟到小时级执行时间,平均 9.9M tokens / 231 episodes / 85.3 分…
深度解读 arXiv:2607.08964 2026-07-18
AutoMem:将记忆作为可学习的认知技能,让 32B 开源模型逼近前沿闭源系统
AutoMem 把 LLM Agent 的"记忆管理"从一段 prompt 提示词升级成一项可被自动学习与训练的可分离技能,仅优化记忆机制、不改动任务动作,便能在长视野游戏里把 32B 开源权重 Agent 的成绩提升 2–4 倍,达到与 Claude Opus 4.5、Gemini 3.1 Pro Thinking …
深度解读 arXiv:2607.01224 2026-07-18
在 Kubernetes 上跑 GenAI 推理:Kueue + DAS + GAIE 三件套打通 ASR→LLM 流水线
论文完整标题:Evaluating Kubernetes Performance for GenAI Inference: From Automatic Speech Recognition to LLM Summarization(arXiv:2602.04900v3,已被 ICPE 2026 第 17 届性能工程会…
深度解读 arXiv:2602.04900 2026-07-18
当机器人把"杯子"看错型号——SUFLECA 用 67 万张图把 CAD 匹配的错误率砍掉一半
你有没有想过这种尴尬—— 你让家里的扫地机器人"找茶几腿"——它盯着茶几看了半天,然后一头撞上去。 你打开 AR 试戴眼镜,结果虚拟眼镜"穿"进你的脑袋里,悬浮在你面前。 为什么会这样? 因为今天的机器人/AR 系统认物体的方式太"看脸"了——它们只比"颜色、纹理、形状轮廓",一旦物体被遮挡、换了个角度、或者现实环境跟…
科普版 arXiv:2607.15058 2026-07-18
2607-08964
日期:20260718 R3 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260718_R3_longhorizonterminalbenchshortvideoscript.md 标题:Agent 长程任务 · 4% 通关(8 字符 · ≤25 阈值 ✅…
视频脚本 arXiv:2607.08964 2026-07-18
视频选题榜 2026-07-18
· Reliability without Validity: A Systematic, LargeScale Evaluation of LLMasaJudge Models Across Agreement, Consistency, and Bias · kappa deflation 33–41 pp 直接打…
选题榜 2026-07-18
视频脚本镜像 · 2026-07-18 R1 · arXiv 2606.19544
日期与轮次:20260718 · R1 arxiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260718_R1_judgekappadeflationmvpshortvideoscript.md 标题:法官模型 还能信吗(6 字符 · ≤25 阈值 ✅) 目标观众…
视频脚本 arXiv:2606.19544 2026-07-18
在 SQL 里直接写"帮我过滤掉负面评论"——一个让 AI 过滤器省 3-19 倍 token 的新招
数据库工程师 2026 年最头疼的"新算子"—— 你可以在 SQL 里直接写 AI_FILTER('负面情绪', 评论列),让 LLM 帮你筛掉负面评论。一行 SQL,零代码,业务方开心了——但你的 token 账单疯了。 为什么? 因为每次 AI_FILTER 都是一次 LLM 推理:延迟百毫秒到秒级,token 费…
科普版 arXiv:2606.07923(Larch · flyP · 2026-07-17) 2026-07-17
EO-WM:面向概率性地球观测预报的物理信息世界模型
EOWM 是一个把"气象强迫"拆成气候基线、天气异常、累积物理应力三路条件信号的多光谱视频扩散 Transformer,专门解决卫星地球观测(EO)预报中"未来地表长什么样、要按天气变化给出概率性回答"这件事。 地球观测预报(EO forecasting)要回答的实际问题是:给定过去一段时间的多光谱卫星影像序列,以及同…
深度解读 arXiv:2606.27277 2026-07-17
编码 Agent 能"看见"代码仓库吗?——视觉化代码仓库表示的首次系统实证
这是第一篇系统性地把"代码仓库的视觉表示"喂给多模态大模型(MLLM)驱动的编码 Agent,在仓库级 issue 修复任务上做大规模对照实验的工作;结论是纯视觉不灵,但视觉+文本的混合设计能省 token 且不损准确率,最高可减少 26% 输入 token。 编码 Agent(coding agent)目前主流范式是…
深度解读 arXiv:2606.14061 2026-07-17
SPEAR:面向真实感具身 AI 研究的可编程仿真器
SPEAR 是一个 Python 库 + Unreal Engine 插件组合,把任意 UE 应用变成可被 Python 编程控制的"具身 AI 仿真后端",并能在同一帧内确定性调度任意数据依赖的工作图,是当前面向真实感(photorealistic)具身研究的最通用、可编程性最强的 UE 桥接方案,由 Intel L…
深度解读 arXiv:2607.06701 2026-07-17
Agentic RAG 的"按跳诊断"基准:让 GPT-5 在 hardest 多跳子集上只拿到 22.6% EM——AgenticRAGTracer(ACL 2026 Findings)
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 同行深度解读:organized/promo/explainers/260219127.md(flyP → Jay,20260712),本稿以 primary source 717 13:35 核验为准 713…
科普版 arXiv:2602.19127(AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG · **ACL 2026 Findings** · v2 2026-07-02 · 一作 Qijie You) 2026-07-17
TOKI:LLM-Agent 持久记忆中矛盾解析的双时态算子代数
TOKI 把 LLMAgent 持久记忆里司空见惯的「矛盾解析」等价改写成「写时并发控制」,给生产环境常用的四种启发式(lastwriterwins、evidenceweighted merge、awaitconfirmation、perrule policy)补上一套写在纸面上的契约:双时态算子 + 隔离前置条件 +…
深度解读 arXiv:2606.06240 2026-07-17
Larch:面向 AI SQL 语义谓词的习得式查询优化
Larch 把 AI SQL 里高开销的语义过滤器当作可学习对象,给出 LarchA2C(Gated GNN + MDP 排序)与 LarchSel(监督学习预测选择率 + 动态规划)两种变体,在多个真实与合成负载下,比 Palimpzest、Quest 等基线 降低 3×–19× 的 token 总开销。 现代分析型…
深度解读 arXiv:2606.07923 2026-07-17
PROJECTMEM:面向 AI 编程 Agent 的本地优先、事件溯源记忆与判断层
PROJECTMEM 是一个开源、纯本地(localfirst)的 Python 包,把"AI 编程 Agent 的项目级记忆"建模为追加式(appendonly)的明文事件日志,并通过 MCP(Model Context Protocol)向 Agent 暴露"读 + 判断"两类能力,使记忆不仅被动回答 Agent …
深度解读 arXiv:2606.12329 2026-07-17