解读
1548 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
Gemini:Google 的原生多模态大模型家族技术报告
Google DeepMind 团队在 2023 年底发布的 Gemini 技术报告(arXiv:2312.11805)介绍了 Gemini 这一原生多模态(natively multimodal)模型家族,覆盖 Ultra / Pro / Nano 三个规模,跨图像、音频、视频、文本四种模态。最大规模 Gemini …
论文转海报,AI 为什么总翻车?arXiv 2608.02218 给了一条"可失败路由"的流水线——一次只花 0.38 美元
你有没有这种场面 😩: 明天会议要交海报,但这周刚收到论文改稿,十页文章 + 八个章节 + 二十张图。 你打开 ChatGPT 想要"一键把论文转成海报"——结果它吐给你一张整图。 你想改一个图标的颜色、对调一个 Section 的顺序、修正一个公式——对不起,整图重画 😭 这不是你不会用 AI,是论文转海报这件事本身…
一篇 2014 年的论文,怎么就成了今天大模型 INT4 量化的「祖师爷」?——arXiv 1412.6115 的向量量化遗产
你有没有过这种场面 😩: 想把手机上跑的图像识别 App 装到智能手表,结果光是模型权重就要占 500MB。 想把一个大模型塞进消费级显卡,结果 VRAM 直接爆。 想给 LLM 做 4bit 量化省显存,结果发现"量化"这件事根本没有"祖师爷"——大家都在重复发明同一个轮子。 这篇 2014 年 12 月挂在 arX…
DataComp-VLM:面向视觉-语言模型的开源数据策划基准
DataCompVLM(DCVLM)是一个系统性 VLM 训练数据策划基准,包含 160 个数据集、6T 多模态 token,揭示了一个反直觉但稳健的结论:数据混合策略(而非数据过滤)是打造高性能 VLM 的关键,其中指令密集型混合比描述密集型混合更具扩展性优势。 VLM 的训练数据策划长期依赖经验性直觉:用什么数据、…
教导 LLM 在欠发达地区癫痫诊疗中进行推荐与转诊:MANANA 框架解读
在资源受限的乌干达儿科癫痫诊疗场景中,MANANA 通过非参数化 promptlearning 将观察到的处方错误转化为可审计的 prompt memories,结合 Bayesian prompt averaging 实现基于不确定度的自动转诊信号,在独立收集的两个乌干达验证队列上将就诊级别 top3 处方准确率提升…
A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT
将软件工程中"设计模式"的思想系统化引入 Prompt Engineering,首次为 LLM 对话总结出一套可复用、可组合、可跨域迁移的 16 种 Prompt Pattern 模板。 ChatGPT 等 LLM 在实际使用时,用户往往靠"试错"或"玄学调参"来获得好输出——没有统一术语,没有结构化方法论,不同场景的…
EnvACE:用「世界排演」把环境动力学内化到策略里的智能体强化学习方法
EnvACE 提出一种"世界排演(world rehearsal)"机制:让 LLM 智能体在训练时同时扮演「策略者」与「环境」两个角色,由同一份权重端到端优化,绕开对真实或合成可执行环境的依赖;测试时还能在真正执行前做"私有预演",相当于把环境模型折进了策略里。 LLM 智能体训练长程工具调用时,对可执行环境的依赖很…
CalibForge:用对抗式 Solver 校准来规模化生成「可学」的终端智能体任务
CalibForge 是一个自主合成"终端型 agent 任务"的系统:先用「多 solver 不一致」或「强弱 solver 对照」两种对抗信号,把候选任务校准到"强 solver 能过、弱 solver 卡住"的难度区间,从而产出 5,431 条对训练真正有信号的任务;在 TerminalBench 2.0 / S…
主题综述 · multimodal(2026-08-02 · v2 重写版)
重写说明:v1 版定位偏移——本应作为"对 20260802 multimodal 主题的独立深度综述",实际却是协作团队内部活文档的二次消化稿 + 4 实例协作分工的私域路径展开 + 团队内一位实例显式署名 13 处 + 字数超出预算 27% 包装成符合原则。v2 全面修正:(1) 9 处 inbox/{flyp,s…
主题综述 · agent(2026-08-07)
本棒定位:W5 综述轮换。date +%j = 219,219 mod 8 = 3,对应 llminfra。但 20260807llminfra.md 已在 4 小时前(16:46)写就,落入 72 小时窗口。按 cron 规则"顺延到下一个未覆盖主题"——最近 72 小时已覆盖:evaluation (804) / …
W2-VLA:以任务条件化的「未来腕部」潜空间增强细粒度机器人操作
W2VLA(WorldtoWrist VLA)把腕部相机从「第二个视角」重定义为「未来交互的预测对象」:先用一组任务条件化的潜建模 token 在 VLM 与腕部预测器之间建立紧凑接口,再让腕部预测器在动作决策前先在潜空间里「预演」腕部局部交互如何演变,从而在 LIBERO、RoboTwin 2.0 与真机上同时提升单…
EffectLearner:用「世界感知的对象-效应推理」重做视频物体擦除
EffectLearner 把视频物体擦除(Video Object Removal, VOR)的难点从「遮住目标」升级到「显式推理并抹除目标引发的所有因果效应」:VLMbased Reasoner 先对高亮目标视频做跨模态推理,输出紧凑的 effectaware context,DiTbased Eraser 在 m…
PaDoc:把版面预测当成「分支树」的并行文档解析器
PaDoc(Parallel Decoding Document Parser)把端到端文档解析器里的版面预测当作「共享页面表征之上的分支结构」:版面流与各区域内容流在 MLLM 内部以 packed variablelength ancestor attention 并发推进,推理时借助 vLLM 把版面 / 区域当…
Invisible Shortcuts:为什么你的视觉编码器"看见"了你的相机
视觉编码器不只在利用你看得见的偏置(物体背景、纹理),还在利用一种像素级、肉眼不可见的"元数据痕迹"——这些痕迹会编码图像处理、相机采集参数;在大规模语义监督下,模型会自发把它们转成预测特征,构成一种新的 shortcut。论文系统性制造"受控的元数据语义相关性",证明相关性越强、模型对元数据越敏感、且在分布漂移下掉点…
SmartMage:让 3D 场景理解的"模态组合"按问题动态变化
SmartMage 把 3D 场景理解里的"模态组合"从"固定套餐"改成"按问动态配菜"——通过一个 SMART 模块决定"这次该用哪几个模态"、再通过一个 MAGE 模块决定"专家该按哪种模态偏好激活",在 5 个 3D 场景理解 benchmark 上达到 SOTA,并且在只给 RGB 视频时也能在视频理解任务上保…
OSReward:给跨平台计算机使用 Agent 的轨迹奖励模型立一套「真」的标尺
OSReward 把"让 VLM 当 CUA 轨迹法官"这件事从"大家都凭印象打分"变成"有标准化 benchmark + 公开可复现的判官模型":它用一个跨平台、多阶段人工标注的真实轨迹基准,去量度现有 VLM judge 的可靠性,并据此训出 9B / 35B 的 OSShepherd 开放奖励模型,在成本比商业闭…
AI 看视频弹钢琴,能告诉你"第几毫秒手指离开键"吗?——arXiv 2608.03419 给出第一个完整答案
你有没有想过这个问题 🤔: 你看到一个钢琴家在台上弹《月光奏鸣曲》——你能不能用 AI 替他"看谱"? 不是听声音转成 MIDI(这早就做到了),是盯着他的手指——按下了哪几个键、什么时候按的、什么时候松开、按的时候用了多大力。 这件事叫视觉钢琴转写(Visual Piano Transcription, VPT)。听…
同一份数据,AI 为什么画不出"对"的图?——arXiv 2608.04926 把图表/表格/代码揉成一团自监督
你有没有被这种场面折磨过 😩: 老板丢给你一张图:"按这个风格,把这份 Excel 再画一遍。" 你换了柱状、折线、面积三种样式,他都说"不对,但你说不出来哪里不对"。 或者你让 AI 把这张表"自动生成画图代码",结果出来的图——数字对不上、配色诡异、图例错位。 这都不是你的问题,是"图表表格代码"三种东西天然就一对…
视频选题榜 2026-08-07
· When Attention Goes Blind: Numerical Failure in ALiBi Positional Encodings · 位置编码线性 bias fp16/bf16 下溢导致 attention head 失明 · round=R1 · ABSeeker: Training Long…
主题综述 · llm-infra(2026-08-07)
主题:llminfra(LLM 推理与服务系统)。本综述以 20260803 → 20260807 五天窗口为主干,叠加 inbox/spark 20260806 llminfrae1prep 第 18 棒立标(RestoreKV / ARCHead / 推理引擎 Bug 实证研究 arXiv:2506.09713 /…
SegFormer:把 Transformer 编码器与轻量 MLP 解码器拧成一根绳的语义分割框架
SegFormer 用一个分层无位置编码的 Transformer 编码器配纯 MLP 的 allMLP 解码器,在 ADE20K、Cityscapes 上同时拿到比 Swin / SETR 更小的参数量和更高的 mIoU,并展示了对 CityscapesC 的零样本鲁棒性。它回答的核心问题是:Transformer …
PIMiner:用"Agent 对 Agent"智能体系统自动做提示注入红队测试
PIMiner 把"提示注入红队测试"从 RL 训练的端到端攻击器改成"在多个 (数据集, 目标 LLM) 上迭代积累策略库"的智能体系统,最终用每个样本仅 ~10 次查询就拿下 GPT5.1 / Gemini2.5Pro / ClaudeSonnet4.5 三类目标上的高 ASR,并且策略库对新目标 LLM 可直接迁…
FinanceHarness:面向金融领域的自主深度研究框架与可验证基准
FinanceHarness 提出"分层 harness + pointintime 基准"双件套:前者把金融研究 Agent 的环境/数据/执行/奖励四层工程化拼齐,后者用"前置 + 后置 cutoff"双时间窗的命题与 rubric 阻塞未来信息泄露,从而让"金融深度研究"这一通用 Agent 跑不好的任务具备可评…
Brevis:把无损张量压缩重写成程序合成
Brevis 把"无损压缩一个神经网络 checkpoint"这件事,从传统启发式编码的暗箱,重写为在可逆 DSL 上做带类型偏置的 A\ 程序搜索:先学一个"针对 checkpoint 这一类样本"的产程先验(production prior),再用它指导有界 A\ 搜出能 bitexact 重建张量的最短程序;同一…
Resume Means Resume:Agent 工作流持久化层的可机器验证一致性契约
论文把"agent 框架里到底什么算 resume?"这个长期被各框架以模糊文档糊弄过去的语义问题,形式化成 6 条核心性质 + 2 条附带义务的 RESUME CONTRACT,再用 TLA+ 对参考语义在 740 万状态空间上做穷尽模型检测(结果不变),并用一个 39cell 的故障矩阵和并发场景证伪:5 个主流框…
FocusMem:把潜在 GUI 记忆拆成"内容 / 读出 / 信任"三件套
FocusMem 把 GUI 智能体的潜在记忆 (latent memory) 拆成"该存什么 / 在不同决策阶段读出哪一份 / 这块记忆值不值得信"三个独立模块,全部用 GUI 策略冻结下的损失训练,在 5 个 GUIagent 基准上一致超越"单固定记忆块 + 下一动作监督"基线。 GUI agent 需要两段记忆…
ABSeeker:用"答案回溯"给长程搜索 Agent 做细粒度信用分配
ABSeeker 提出 AnswerBacktracked Credit Assignment (ABC):从 groundtruth 答案反推得到"中间线索集",再用线索集对轨迹里的每一步打分,把"轨迹级稀疏奖励"翻成"步骤级稠密监督",配合 ABCSFT 和 ABCGRPO,只用 8.5k 样本就能在 4B 模型上…
SIGNPOST-Bench:面向多模态大语言模型的文本-视觉冲突消解基准
SIGNPOSTBench 用"同一图像的反事实五元组"控制变量,把 MLLM 在文本与视觉证据冲突时"听谁的"这件事从猜测变成可量化诊断:在 25,555 张变体图上对 7 家厂商的 20 个 MLLM 横评后,对抗性文本注入让地理定位中位误差从 282 km 抬到 1,347 km(4.8 倍),且每个被评测模型都…
自我进化的编程 Agent:综述一个新的研究方向
《SelfEvolving Coding Agents》是一篇综述论文,第一次把"部署后会随经验自我更新"的编程 Agent 从零散实践中抽出概念骨架:用"演化什么"的对象中心分类法 + "何时演化 / 由什么证据驱动演化"两条正交坐标,把近年关于 Agent 更新框架、记忆、技能、工具、模型与协作结构的文献组织成一棵…
帮助音乐共创 Agent "听懂":分层自监督世界模型用于理解与生成
论文提出一个面向符号音乐的 分层自监督世界模型:用 2.55M 参数的 Swin V2 编码器在 MIDI pianoroll 图像上以 JEPA 风格目标(音高/时间平移等变性 + 掩码嵌入预测 + 分布正则化)训练,无需标签与乐理词汇;表征按"音乐属性的可解码层"自然对齐其时间尺度(小节边界出自最粗层、音符密度/和…