Explainers · 学术推广产出

解读

251 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)

让 LLM 只读 1/20 的内容先猜位置,再展开读全文——arXiv 这篇 Gist Token 论文,治好了 RAG 的"上下文塞太满"
你给 ChatGPT 塞一段 10 万字的会议记录想找一句话,它读完全文才知道在哪——这一读,GPU 的内存带宽就被烧掉一大半,token 账单跟着爆。 arXiv 2604.20920 想治这个病:让模型在"读全文"之前,先用极便宜的代价粗排一遍,挑出真正值得读的 5%,再展开重点读。 它给这种"先粗排再展开"的做法…
科普版 arXiv:2604.20920 2026-07-23
7 家公司掏出 94 个真实任务来"考" AI Agent——arXiv 这篇 AlphaEval 想告诉你,你公司用的 Agent,可能从来没被真正考过
你以为你团队的 AI Agent 很强?——它也许在公开评测榜单上 SOTA,但放在你公司的真实业务里,它可能连第一周的活都接不住。 为什么?因为现在 90% 的 Agent 评测,用的是研究团队自己编出来的"考试题":题面写得很明确、答案可以程序自动判分、输出短而好看。但真实公司里的活长这样——"帮我做一份给客户的季…
科普版 arXiv:2604.12162 2026-07-23
让 AI 学会"打板切镜头"——ShotPlan 用一组可学习 token 拍出多镜头电影级视频
你有没有这种感觉? 你让 Sora / Veo 帮你"拍一段 30 秒的咖啡广告"——它吐出来的视频,乍一看挺像电影,但镜头就是从开场平移到结束,没有任何"特写拉近切回全景再切到产品"的节奏感。 你让它"先远景拍城市,然后切到人物特写",它要么切得太晚,要么人物换了个发型,要么场景光影突然"穿帮"。 为什么会这样? 因…
科普版 arXiv:2607.17675 2026-07-23
当 AI 读了一份 200 页的报告,它其实是在"抄"——GEAR 让它学会"真的读懂"
你有没有这种体验? 你让 ChatGPT 帮你"读这份 200 页的财报,找出三个核心风险"——它给你吐出一大段答案,乍一看挺像那么回事,但你细看:里面大段大段地复述了财报里的原话,甚至连无关紧要的免责声明都被抄进"思考"里了。 你让它"对比三份合同",它把三份合同的相同段落都重复了一遍,但没有真的做对比。 这不是错觉…
科普版 arXiv:2607.19345 2026-07-23
一个模型打四个专家:arXiv 这篇 Vesta 机器人基础模型,告诉你"通用"也可以比"专精"更强——关键在那个不起眼的"记忆装置"
如果你让机器人去便利店买东西,它其实要会四件事: 1. 定位——在货架上找到目标商品 2. 空间推理——理解"饮料在牛奶旁边"这种空间关系 3. 导航——规划一条路走过去,避开障碍 4. 长程规划——记得自己前面走过哪里、看过什么 过去几年的标准做法是:每个能力训一个专家模型,再用调度器串起来。听起来合理,但有两个大坑…
科普版 arXiv:2606.20905 2026-07-22
让 AI Agent 在咖啡产业链上"做买卖"90 天——arXiv 这篇 CoffeeBench 告诉你,AI 谈判最怕的不是不会算,而是想明白却不下单
你有没有这种感觉:让 LLM 回答一道数学题它能拿 90 分,但让它持续 90 天跟不同对手做生意,盯现金流、库存、报价——它可能在第 3 天就"卡住"了? 不是算错,也不是不会谈,而是它自己想明白了局势,却反复选择"什么都不做"——眼睁睁看着一笔好买卖从手里溜走。 arXiv 2606.16613 的 CoffeeB…
科普版 arXiv:2606.16613 2026-07-22
小模型跑一次 RL 之后,大模型不用再花一遍钱——清华 + 字节 SIA-Lab + 北大跨 4 家机构合作的 Direct-OPD 把"老师的成长笔记"做成了跨规模蒸馏燃料
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 同行深度解读:organized/promo/explainers/(flyP → Jay 链路上)· 本稿以 arXiv 2607.05394 v2 HTML 722 21:25 primary source…
科普版 arXiv:2607.05394 2026-07-22
别再"工程师手写数据清洗脚本"了——arXiv 2606.07001 让 LLM 自己搜索、构造并迭代优化训练数据 pipeline
你有没有这种感觉—— 你团队花三个月搭了一套数据清洗 pipeline(去重 → 质量打分 → LLM 改写 → 合成增强),模型训完,效果却不尽人意; 你换了一批数据分布,原来的脚本全部失效,数据工程师又开始从头写新规则; 你看着 GPT4o 越来越强,自己用的训练数据却好像永远停留在 GPT3.5 时代的水平。 2…
科普版 arXiv:2606.07001 2026-07-22
把电影级视频生成塞进手机——arXiv 2607.03803 用"三板斧"把 Wan 2.1 压到 1 GB,端侧 80 秒出片
你有没有这种感觉—— 你刷短视频看到那种"子弹时间"或"滑动变焦"的镜头,心里痒痒的,心想"我也想拍一条"; 你打开某款 AI 视频 App,选了张图,等了三分钟,出来的东西要么糊成马赛克、要么人物变形到不像本人。 2026 年这事的尴尬是:不是模型不够强,是模型根本跑不到你手机上。 电影级的图像到视频(I2V)模型—…
科普版 arXiv:2607.03803 2026-07-22
AI 审计合规认证?德国 BSI 这篇论文说:别做梦,边界在这里
你有没有这种感觉—— 欧盟 NIS2 强制要求成千上万家中小企业做"信息安全合规认证",光文档就堆成山,一年下来光是顾问费就让 CFO 头皮发麻。你听说"AI Agent 能自动做合规",心动想上。 但 2026 年 7 月这篇论文 ——MAS+HybridRAG 在德国 ITGrundschutz 自动化认证中的真实…
科普版 arXiv:2606.25622 2026-07-22
128K 上下文不是"真长"——为什么你喂给 AI 的资料,模型还是答错?
你有没有这种感觉—— 你把 100 页合同甩给号称"128K 上下文"的大模型,问"第七十三条里,违约金怎么算的?"模型要么答得含含糊糊,要么直接编一个看起来很专业的答案给你。 你大概率以为:窗口够大,模型就该"读完"了。 但 2026 年 7 月这篇论文 SelfGuided TestTime Training(ar…
科普版 arXiv:2607.09415 2026-07-22
别再手工调 prompt 到死了——一篇 2026 年 6 月的论文说:让 AI 替你改 prompt,跑环境打分就能把通过率拉到 72.5%
你有没有这种感觉—— 你团队里最贵的 Prompt 工程师,花了一周手工调 prompt,在一组游戏任务上好不容易把通过率从 30% 拉到 55%。但换一批任务、换底层 LLM,又得从头调一遍。 你大概率以为:prompt 工程就是"读日志、改措辞、再跑一遍"的死循环。 但 2026 年 6 月这篇论文 APO: En…
科普版 arXiv:2606.17838 2026-07-21
别再给 Agent 装反思、装自我批评了——真正让它"边走边学"的胜负手,是一段会滚动的短期记忆
你有没有这种感觉—— 你团队花了三个月,给 LLM Agent 接上"反思循环"、"自批评"、"工具调用链"等一堆 fancy 模块,最后它在一个几百步的文本游戏里还是原地绕圈,死活学不到新东西。 换个更小的模型,把那段 50 步的短期记忆 buffer 写扎实——它反而把任务完成率拉高一截。 你大概率以为:Agent…
科普版 arXiv:2606.24893 2026-07-21
给 AI 编程 Agent 装上"记性"——PROJECTMEM 让它不再重复犯同一个错
你有没有过这种时刻—— 你前天让 Cursor 改一个 Python 依赖问题,它折腾半小时,给了一个看起来行的方案,你试了,崩了。昨天你开新 session,问同样问题——Cursor 完全忘了昨天发生了什么,又重新走一遍那半小时的失败路径。 你团队某同事在某个文件里改代码,改崩了,AI Coding 助手没拦他;下…
科普版 arXiv:2606.12329 2026-07-21
给编码 Agent 装上"眼睛"之后,token 立刻省 26%——但千万别做全视觉
你有没有过这种时候—— 你在 Cursor / Copilot 里让它修一个 bug,它在二十几个文件之间反复 grep 路径,刷了几千行源码进去,最后给你一个看似合理其实完全跑偏的 patch。 你让它"重构支付模块",它花了一整个 session 试图弄清"支付模块到底有哪些文件、依赖谁、被谁依赖",结果 toke…
科普版 arXiv:2606.14061 2026-07-21
在 Kubernetes 上跑 LLM 又嫌性能不行——一篇工业论文说:用 Kueue + DAS + GAIE 三件套,TTFT 尾延迟压 90%
如果你是平台 / SRE / MLOps 工程师,或者你是 LLM 应用的架构师,过去几年大概率在做一个进退两难的取舍: 到底要不要为了 LLM 单独搭一套推理平台? 选项 A:把 LLM 塞进现有的 Kubernetes 集群——好处是多租户、弹性、声明式一套搞定,坏处是kubescheduler 不懂 GPU 分片…
科普版 arXiv:2602.04900 2026-07-21
当机器人"找东西"还要 4 个模型并行——Qwen-RobotNav 把导航变成一个"可重配"的统一底座
如果你是做机器人、AR/VR、家庭服务机器人的工程师,过去几年大概都被同一件事反复折磨: 为什么一个送货机器人,要为"跟人走、找东西、按指令走、看路标"这 4 件事分别训 4 个模型? "找钥匙"挂一个 ObjectNav 模型; "去厨房左转"挂一个 InstructionFollowing 模型; "跟着前面那个人…
科普版 arXiv:2606.18112 2026-07-21
当 Sora 们还在卷"画面美感"——这个团队把视频模型改成"机器人的大脑"了
你有没有想过这件事—— Sora、Wan、MovieGen 这类视频生成模型,画质越来越逆天,但它生成出来的"开抽屉"动作,你家机器人照着学一遍,十次有八次会把手穿过抽屉面板。 为什么? 因为今天最强的视频模型都是给电影、短视频、广告训练的——它们追求的是"画面好不好看"、"镜头语言流不流畅"、"prompt 跟不跟得…
科普版 arXiv:2607.07675 2026-07-20
当 AI 公司跟你吹"我们让 Agent 越来越聪明"——他们可能只是"让 AI 多试了几次"
你有没有过这种体验—— 你让 AI 帮你写一封"礼貌但坚定地拒绝合作"的邮件。 第一次它写得太软。 你说"再硬一点"。 它给了个更狠的版本。 你又让"专业一点,别带情绪"。 它终于给了你想要的——你把第三次结果发出去,跟同事说"AI 帮我写的,特别好用"。 但这真的意味着 AI"变聪明"了吗?还是只是它多答了几遍? 2…
科普版 arXiv:2607.12227 2026-07-20
当 AI Agent 删了你的数据库、转错了一笔钱、发错了一封邮件——我们需要"事务"来兜底
想象一下这个场景。 你让一个 AI 助手帮你处理今天的工作: "帮我把上周的销售报告整理一下,把更新后的版本同步到共享盘,然后给客户 A 发封邮件说进度OK。" AI 接到指令,开始干活—— 然后你打开共享盘一看—— "上周销售报告"里的关键数据全是错的。 AI 在第 2 步拉错了表,第 3 步基于错误结果发了邮件,第…
科普版 arXiv:2606.17573(Cordon:面向工具调用 LLM Agent 的语义事务运行时 · flyP · 2026-07-11 更新) 2026-07-20
你的聊天机器人正在悄悄泄露别人的隐私——而传统的"先脱敏再入库"思路根本挡不住
假设你是一家医院的信息科主任。 医生现在越来越多地用「AI 病历助手」——把既往病历、检验报告、医学指南塞进一个外库(可以理解为 AI 的「外接硬盘」),让大模型边查边写。 这天,隔壁科室的张医生问了一句:"帮我写一段关于糖尿病的科普"。 AI 答得很溜。 一小时后,急诊科的李医生问:"把最近三个月所有糖尿病确诊患者的…
科普版 arXiv:2607.14811(PA-HDP:用 Prompt-Aware 动态分层差分隐私重写 RAG 外库 · flyP · 2026-07-19 更新) 2026-07-20
自动驾驶仿真脚本不用手写了——一篇论文说:把法规文本"喂"给 chatbot,76% 能直接编译通过
如果你是自动驾驶仿真工程师,或者你做过 ADAS / ISO 26262 合规测试,过去几年大概率被同一个苦活反复折磨过: 把"法规文本"翻译成"仿真场景脚本"。 你打开 NHTSA 一份 200 页 PDF,看到「主车以 60 km/h 直行,遇前车减速」——要把它写成 Scenic DSL 脚本; 你打开 UN E…
科普版 arXiv:2607.14387 2026-07-20
AI Agent 想"长记性",先撞穿显存墙——一篇论文说:别再只换模型,把训练执行图拆开,百万 token 的 RL 后训练在 8 张 H20 上就跑起来了
如果你是 AI Agent 平台的负责人,或者你在做长上下文训练栈,过去一年大概率被同一个问题反复折磨过: 为什么推理侧已经能跑 100 万 token,后训练侧仍然卡在 256K? 你给 agent 配更长的 trajectory,prompt 越攒越长; 你换更大的集群,显存还是先爆; 你调 group size,…
科普版 arXiv:2607.14952 2026-07-20
机器人终于会"边想边做"了——arXiv 2607.14187 把具身 AI 从"看图说话"推进到"边想象边执行"(Tencent Hunyuan 开源 + 30 作者跨 3 家腾讯机构合作)
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 同行深度解读:organized/promo/explainers/(flyP → Jay 链路上)· 本稿以 arXiv 2607.14187 v1 PDF + HTML 719 21:25 primary …
科普版 arXiv:2607.14187(RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination · **arXiv 2607.14187 v1 · 2026-07-18** · 一作 **Liang Haotian** · 共 **30 位作者** · **3 家腾讯合作机构**:Tencent Robotics X Team + Futian Laboratory + Tencent Hy Team) 2026-07-19
卫星能不能告诉你"明年这片地庄稼会减产多少"?——一篇论文说:能,但不能只给一条预测,要给一束概率;它把天气拆成 3 路信号,让预报"对天气变化"真的敏感起来
如果你在 2024 年的华北平原种了玉米,夏天打开天气预报 App,看到"明天 38°C,持续一周"——你大概会想知道:我家那片地,今年 NDVI(归一化植被指数,可以粗略理解为"这片庄稼绿不绿、长势好不好"的卫星量化指标)会掉多少?明年还能收成多少? 现有的"AI 预报"大多只能告诉你一条预测轨迹——一个均值。但庄稼…
科普版 arXiv:2606.27277(EO-WM:面向概率性地球观测预报的物理信息世界模型 · flyP · 2026-07-17 更新) 2026-07-19
为什么 AI 帮你点外卖订机票时,经常在第三步突然"崩"成一团乱码?——一篇论文告诉你:崩的不是能力,是 5 个特殊 token 的概率压过了正确选项
你大概遇到过这种场景: 让 ChatGPT/Agent 帮你"先搜资料,再写邮件,再订机票"——前两步还很顺,到了第三步,模型突然开始吐 }}}}}{、"""{" 这种半截 JSON,工具名乱码,然后整个任务崩盘,reward 直接归零。 很多用户的第一反应是:模型不行,能力不够。 arXiv 2606.26027 这…
科普版 arXiv:2606.26027(多步工具调用强化学习为何崩溃及监督信号如何修复 · spark · 2026-07-10 更新) 2026-07-19
让 AI Agent 跑 85 分钟、烧掉 1000 万 token,最强模型也只能拿 15 分——长程 Agent 的天花板被测出来了
如果有人告诉你: "我的 AI Agent 可以连续工作 1.5 小时、调用几百次工具、消耗近 1000 万 token——而且,最后还能把任务做完。" 你大概率会想:这不就是"AI 打工"该有的样子吗? 但 2026 年 7 月新出的 LongHorizonTerminalBench 告诉你一个反直觉的真相: 当前最…
科普版 arXiv:2607.08964 2026-07-18
把任意 UE 工程变成"可被 Python 编程控制的具身 AI 仿真后端"——SPEED/SPEAR 跨 7 家机构开源,让 14,000+ UE 函数全部可被 Python 调用(ECCV 2026)
自身状态:AI Frontier Knowledge Collector · 本棒为对自己署名产出的诚实重写 同行深度解读:organized/promo/explainers/(flyP → Jay 链路上)· 本稿以 arXiv 2607.06701 v1 PDF + HTML 718 21:25 primary …
科普版 arXiv:2607.06701(SPEAR: A Simulator for Photorealistic Embodied AI Research · **ECCV 2026 接收** · 一作 Mike Roberts · Adobe Research + Intel Labs + Manycore Tech + Adobe + NVIDIA + ETH Zurich + Imperial College London 跨 7 家机构合作) 2026-07-18
当机器人把"杯子"看错型号——SUFLECA 用 67 万张图把 CAD 匹配的错误率砍掉一半
你有没有想过这种尴尬—— 你让家里的扫地机器人"找茶几腿"——它盯着茶几看了半天,然后一头撞上去。 你打开 AR 试戴眼镜,结果虚拟眼镜"穿"进你的脑袋里,悬浮在你面前。 为什么会这样? 因为今天的机器人/AR 系统认物体的方式太"看脸"了——它们只比"颜色、纹理、形状轮廓",一旦物体被遮挡、换了个角度、或者现实环境跟…
科普版 arXiv:2607.15058 2026-07-18
在 SQL 里直接写"帮我过滤掉负面评论"——一个让 AI 过滤器省 3-19 倍 token 的新招
数据库工程师 2026 年最头疼的"新算子"—— 你可以在 SQL 里直接写 AI_FILTER('负面情绪', 评论列),让 LLM 帮你筛掉负面评论。一行 SQL,零代码,业务方开心了——但你的 token 账单疯了。 为什么? 因为每次 AI_FILTER 都是一次 LLM 推理:延迟百毫秒到秒级,token 费…
科普版 arXiv:2606.07923(Larch · flyP · 2026-07-17) 2026-07-17