日期与轮次:2026-09-28 R2 arXiv 链接:https://arxiv.org/abs/1705.08045v5 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-09-28_R2_short-video-script.md
1. 标题与观众
- 标题:10 视觉任务 一份骨干
- 目标观众:AI 工程师 / 开发者
- 一句话核心观点:2017年用一份共享骨干+每任务<10% adapter塞进10个视觉域
3. 45-90 秒口播稿
十张图像分类数据集,你还在每任务存一份ResNet副本吗?十个模型就是十倍存储、十份推理路径,部署成本按任务数线性爆炸。2017年Oxford VGG的Rebuffi给出了一个反直觉答案:把主干冻住共享,在每个残差块里并联一行域特异卷积,只占不到10%参数,任务切换只需换α权重,骨干完全不动。联合训练在十个数据集上跑一遍,S评分2641直接超过十个独立模型2500的基线,总参数约两倍单骨干,存储却省近五倍。整套思路是后续LoRA和Adapter Tuning在视觉侧的雏形。想看代码就到Oxford VGG官方仓库比对TPAMI版。
4. 镜头分镜
- 镜头 1 · 0-8s(冲突开场):屏幕文字「10 个 ResNet 副本?」画面:一个 ResNet-101 节点分裂成 10 个并排方块,逐渐变红,运动方式:从中心向外爆破展开。
- 镜头 2 · 8-18s(机制卡):屏幕文字「共享骨干 + α < 10%」画面:ResNet 残差块结构图,主干 90% 蓝色 + α 分支 10% 橙色叠加,运动方式:从左到右逐层滑入。
- 镜头 3 · 18-30s(证据卡):屏幕文字「S 2641 vs 2500」画面:左侧 10 个独立模型柱状图(基线 2500),右侧联合训练柱(S=2641)高出 141,运动方式:柱状图从下往上生长,数字弹跳到位。
- 镜头 4 · 30-42s(参数成本):屏幕文字「~2× 单骨干 · 省 ~5× 存储」画面:左 10× ResNet-101 ≈ 4.5×10⁸ 参数,右 1× 骨干 + 10× α ≈ 2× 体积,运动方式:对比两个体积块,右边高亮闪动一次。
- 镜头 5 · 42-56s(运行时路由):屏幕文字「切 α 不切骨干」画面:同一骨干示意,α slot 像换卡带一样逐个切换为 Traffic Signs / Omniglot / Aircraft 等,运动方式:slot 水平平移切换。
- 镜头 6 · 56-66s(历史坐标):屏幕文字「2017 比 LoRA 早 4 年」画面:时间轴 2017 Residual Adapter → 2019 Houlsby → 2021 LoRA → 2020+ ViT Adapter,运动方式:时间轴从左向右滚动,2017 节点放大闪动。
- 镜头 7 · 66-76s(风险卡):屏幕文字「单任务精度未公开」画面:左侧打钩机制正确,右侧打问号:ImageNet/Aircraft top-1 原文摘要未给,运动方式:左右分屏淡入。
- 镜头 8 · 76-86s(行动清单):屏幕文字「看 VGG 仓库 + TPAMI 版」画面:两个编号按钮依次高亮,运动方式:按钮从中心向上浮起。