解读
2634 篇 · 选题榜 / 深度解读 / 科普 / 综述 / 视频脚本(学术推广产出)
ZooWork-ShopRanker:把电商搜索 reranker 从"主题相关"调到"用户偏好"
这是一族面向电商搜索的开放 reranker(0.6B / 4B / 8B),通过"跨家族 LLM judge 当 preference oracle"生成 pair 数据 + 8B 蒸馏 4B / 0.6B,在新发布的 ShopRankBench(~10,000 私有偏好对)上显著击败最强开源 reranker ba…
不再把网页"切碎成文本块"再检索——香港理工大学 PolyUQuest 用一张异构图,让 AI 问答能逐句对照原文找证据
你有没有这种感觉—— 你在企业内网 / 学校官网 / 政府门户问 AI 一个问题,AI 给你一段看上去"很靠谱"的回答。但你想追问"这段话到底来自哪个页面、哪个章节"——AI 答不上来。或者更糟:AI 把几个不相干的段落拼在一起,听着像那么回事,其实有一句是编的。 你大概率以为:这是大模型的"幻觉"问题,没法治。 但香…
把"用自然语言写软件"做成真——Yuntian Deng 团队 Compile by Training 让企业反复调用的任务一次编译成本地小函数
你有没有这种感觉—— 你公司里有一些反复要做的事:合同里的"甲方名称 / 金额 / 签章日期"字段抽取、客服回复的标准化改写、报表里某列的格式归一化。这些事每次都得调一次 GPT4 / Claude API,几万 token 一次,一年下来 token 账单能烧掉几十万。 你大概率想过:有没有办法把这种"重复 prom…
1705-08045
日期与轮次:20260928 R2 arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260928_R2_shortvideoscript.md 标题:10 视觉任务 一份骨干 目标观众:AI 工程师 / 开发者 一句话核心观点:2017年用一份共享骨干+每任务…
推广选题榜 · 2026-09-28
基于近 30 天论文卡片,从「被引 + SOTA + 新近度 + 话题热度」综合选 Top 8。 1. PUBG Ally:作为 AI 队友的对话式具身 Agent arxiv: 2609.29837 让 AI 在真实游戏(PUBG)中充当语音队友——同时处理实时游戏感知、玩家语音理解和动作同步。展示了 Agent 工…
用残差适配器学习多视觉域:参数高效的十任务共享表示
用一个共享骨干 + 每任务 <10% 的 adapter 残差分支,能在保持单任务精度的同时把 10 个视觉域塞进同一组权重,并提出 Visual Decathlon S 评分作为统一基准;这套思路是后续 LoRA/Adapter/PromptTuning 思路在视觉侧的先驱。 ImageNet 预训练 + 任务 fi…
2609.23038 · 小红书推广卡片文案
1. 反直觉版:视频帧打乱顺序准确率只掉 1.4 个点——arXiv 2609.23038 揭示 VLM 不懂状态转移,然后教它懂 2. 类比版:相当于给 VLM 上一堂「婴儿学物理」补习课——arXiv 2609.23038 用交互轨迹和三级课程让 AI 看懂动作前后的世界 3. 数字钩子版:从 88.7 跌到 23…
2609.29816 · 小红书推广卡片文案
1. 数字钩子版:训练成本砍到接近单模态 RL——arXiv 2609.29816 用「模态锚定」把音视频联合 RL 后训练拆成可控的三件事 2. 类比版:相当于给「视频 + 音频」的 RL 后训练装一个"轮流独舞而非双人舞"的开关——arXiv 2609.29816 用 anchorrollout 解耦训练协议 3.…
给 VLM 上一堂「物理感」补习课:arXiv 2609.23038 用「交互轨迹」让 AI 看懂动作前后的世界
arXiv 2609.23038(SpatialInteractor: Learning Spatial Reasoning through Interaction with the Observable Physical World,20260924 上传)做了一件对「具身智能 / VLM 空间推理」圈子影响很大的事…
让 AI 学会同时画画和配音:arXiv 2609.29816 用「模态锚定」把音视频联合 RL 后训练的成本砍到接近单模态
arXiv 2609.29816(AVGRPO: ModalityAnchored Decoupled Diffusion RL for Joint AudioVideo Generation,20260924 上传)做了一件对「音视频联合生成」模型圈影响很大的事——他们没有换 backbone、没有换 codec、没…
视频选题榜 2026-09-27(v2 重写覆盖 · 反思棒 #60 触发)
v1 → v2 修复:v1 文件 688B / 5 行 stub,仅 3 条单行 bullet(Coding Agents TAMP R1 + Linear Superposition R2 + RLCDAlignBench R3)——完全未体现 913 v2 / 914 v2 / 918 v2 / 919 v2 / …
主题综述 · risk(2026-09-27)
主题:risk(LLM 风险与安全) 本棒 netnew 主分类 paper_card 净增量 = 0 件(922 Geometry of Values 仍为 risk 主分类最新一条 ⚠ 第 5 日沿用)。 综合主线:6 条 = L1 幻觉综述 / L2 Agent 可靠性 + 对齐失败检测 / L3 MCP 与工具…
一次调用答多个对齐问题:arXiv 2609.29429 用 Jev 把 AI 对齐检测的成本砍到原来的 1/63
arXiv 2609.29429(Reinforcement Learning for Calibrated Decisions as a ZeroShot Detector of AI Alignment Failures,20260926 更新)把"对齐失败检测"这个赛道彻底换了一组接口——Jev 是 RLCD 范…
当 AI 自己给自己写规划器:三个 coding agent 在 28 个仿真环境里,用 9.8 万次试验打败了人类写的 TAMP 规划器
arXiv 2609.30233(Coding Agents for Generalized Task and Motion Planning Problems,20260926 更新)把"广义任务与运动规划"这个问题整个翻了过来——过去要靠工程师一个环境一个环境地写专属 TAMP planner,现在让 coding…
主题综述 · engineering(2026-09-27 · v1)
本棒 netnew = 6 件(自 0922 v2 重写覆盖后净增量):① arXiv:2604.25850 Agentic Harness Engineering(AHE,NexAUAHE TerminalBench 2 84.7% ± 2.1 pass@1 / GPT5.4 10 iter 69.7→77.0% 超…
训练一个更"扛揍"的图像分类模型,只要加 5 行代码?—— Manifold Mixup 这个被低估的正则化技巧
你有没有这种感觉? 你训练了一个 ResNet,测试集准确率挺高。但给它加一点噪声或遮挡,准确率就崩了。同事说"这模型泛化不行",你委屈——训练集表现明明很完美。 问题不在数据量、不在模型规模、不在优化器——问题在网络没有学到"平滑的决策边界"。通俗讲:它把训练集背得太死了,稍微一变脸就认不出。 arXiv 1806.…
为什么医生不敢信 AI 诊断结果?—— 一篇被引 641 次的论文,把医疗 AI 的"信任门槛"说透了
你有没有这种感觉? 医院推了一款 AI 辅助诊断,准确率写着 95%。医生看了一眼说:"准确率是挺高。但它说这张 CT 是肺癌,我凭什么信?" 这不是医生挑剔。这是一个真实存在的法律 + 信任双重门槛——准确率再高,如果 AI 说不出"我为什么这么判断",它在欧盟就不能上线。 arXiv 1712.09923(Open…
2026-09-27 R2 · Superposition · LLM 一次前向 出两路 · short-video-script
arXiv 链接: videokb 脚本原路径:/shared/videokb/scripts/tom/20260927_R2_superpositiononceforward_shortvideoscript.md 日期与轮次:20260927 · R2(中午档) 标题:LLM 一次前向 出两路 目标观众:LLM 推…
把 GPT / LLaMA / PaLM 三大族谱装进同一张图——Minaee 等 2024 LLM 综述成为后续所有 LLM 论文的"方法论骨架"
你有没有这种感觉—— 2022 年 11 月 ChatGPT 发布之后,LLM 论文像雨后春笋——每个月都有新模型、新对齐算法、新 benchmark、新 prompt 技巧。你如果想入门 LLM,大概率会卡在同一个地方: "这么多东西,到底谁是谁?怎么串起来?" 光看名字就能把人整晕:GPT 系列、LLaMA 系列、…
一篇论文让视觉模型学会"看粗看细、看静看动、看 RGB 看深度"——微软 Florence 把多任务视觉玩出"通用基础模型"的范式
你有没有这种感觉—— 你每天刷到的"通用视觉基础模型"动辄 10 亿参数、刷 40+ benchmark SOTA。但你如果回到 2021 年,问那个时代的 CV 研究者:"能不能用一个模型同时搞定分类、检测、VQA、视频动作识别、深度估计?"——大概率会被笑:"你太贪心。" 那时候的现实是: CLIP(202101)…
视频选题榜 2026-09-26(v2 重写覆盖 · 反思棒 #59 触发)
v1 → v2 修复:v1 文件 714B / 4 行 stub,仅 3 条单行 bullet(PoSasSAECategories R1 + AgentKernel R2 + RufusAir R3)——完全未体现 913 v2 / 914 v2 / 918 v2 / 919 v2 / 920 v2 / 921 v2…
Transformer 其实可以"同时想两件事":把两段文本叠加,一次前向生成两路续写
arXiv 2609.29845(Your Transformer Can Hold Two Thoughts at Once,20260926 更新)给出了一个反直觉的机制发现——Transformer 在 embedding 层天然支持"线性叠加":把两段独立文本的 token embedding 加权求和后送进模…
1024 个 AI Agent 同时干活,没人指挥:Agensh 把多 Agent 协作从"公司管理"变成"蜂群协议"
arXiv 2609.26781(Agensh,20260924 更新)做了一件反主流的事——把多 Agent 编排里那个"中心调度员"彻底干掉。 主流的 AutoGen / CrewAI / MetaGPT 都是"一个老板 + 一群小弟"的架构,所有任务派发、上下文传递、结果汇总都流经中心节点,于是规模上限被中心节点…
AV-GRPO:用于联合音视频生成的模态锚定解耦扩散强化学习
1. 真正解决的问题:把 RL 后训练(posttraining)适配到联合音视频生成这条多模态共享 backbone 的任务时,传统 GRPO / DPO 路径会被「异构奖励 + 跨塔动力学差异 + 同步性难评估」三件事搅在一起,导致信用分配混乱、训练代价爆炸、评测不公平。 2. 用什么范式解:把「耦合的多模态偏好学…
主题综述 · evaluation(2026-09-26)
| 维度 | 实测 | 通过 | |||| | ⚠️ 标注密度 | 14 处 | ✅ ≥10 | | 反方 v2 三段式按主线 ≥6 段 × ≥150 字 | 6 段 × 平均 165 字 | ✅ | | 立标池 4 件套 | 6 主表 + 3 待复核 | ✅ | | §七 合流 ≥150 字 × 7 处 | 7 处 …
Transformer 可同时容纳两个思考:LLM 中线性叠加的证据
数据范围:基于 arxiv abs 页 + paper_cards/1523260929845.md + lessons2026W38 flyP v2 模板。原文未给出具体数值处统一标注「原文未明确」。 1. 作者用一句话能向同实验室同事讲清这篇做了什么吗? —— 把两段独立文本 token embedding 线性相…
SpecFirst:把行为规约获取作为基于 Agent 从零程序合成的一等阶段
数据范围:基于 arxiv abs 页 + paper_cards/670260727167.md + lessons2026W38 flyP v2 模板。原文未给出具体数字处统一标注「原文未明确」。⚠️ 卡片字段「被引=0 / S2=0 / OpenAlex=0」截至 20260826 OpenAlex 更新,与作者…
词性作为 SAE 潜空间中的涌现类别:可恢复但不原子的语言结构
1. 真问题是什么:Sparse Autoencoder(SAE)把语言模型激活拆成过完备稀疏潜变量之后,到底哪些维度上能看到「语言学结构」?一个朴素的猜想是每个 latent 直接对应一个语法原子(如「专有名词」「定冠词」),但这一猜想从未在受控条件下被证伪。 2. 作者用词性做什么受控用例:他们故意选 PoS(pa…
RGBD20K:面向 RGB-D 语义分割的大规模基准
1. 真正解决的问题:现有 RGBD 语义分割基准(NYUv2 40 类、SUN RGBD 37 类、ScanNet 等)存在两个长期痛点——类别覆盖窄与标注噪声大,模型在受限的 37~40 类上学到的能力很难迁移到室内真实场景。 2. 用什么范式解:发布一个大规模、高质量、细粒度的数据集 RGBD20K(160 类、…
Learning to Discover Interesting Mathematics(学习发现有趣的数学)
1. 它真正解决的问题:当 LLM 已经能在 Olympiad / Lean 形式化证明上批量产出「新定理」时,数学共同体对「这个新定理值不值得继续推下去」缺乏可量化的信号;论文把「有趣度」从审美判断变成一个可计算、可验证的标量。 2. 它用什么范式解:定义内在有趣度 = proof_length / statemen…