"每个新类别只给你 5 张照片"——AI 怎么学?一篇被引 2,191 次的综述把这个问题讲透了

  • 关联论文:1904.05046

你接到一个新任务:

"我们公司新上了 20 个产品,每个产品的图片只有 5 张。AI 能不能自动识别客户上传的图片属于哪个产品?"

你可能脱口而出:"才 5 张图?肯定不够啊。"

但这个场景在现实中每天都在发生——医疗罕见病、工厂新缺陷类型、长尾品类识别、安防新威胁……

这就是 Few-Shot Learning(小样本学习) 要解决的问题:每个新类别只有 1–10 张样本的情况下,AI 还能不能学?

2019 年 Wang & Yao 的这篇综述 《Generalizing from a Few Examples: A Survey on Few-Shot Learning》 把这个领域从"零散技巧的集合"重新组织成一套统一的分类法,到今天被引 2,191 次(OpenAlex 2026 数据),是 Few-Shot 方向引用最多、被最广泛继承的综述


关键洞察:所有 Few-Shot 方法都在做同一件事——"注入先验知识"

你可能觉得 Few-Shot 方法五花八门:MAML、Prototypical Network、Matching Network、pretrain + fine-tune……看起来完全不一样。

这篇综述的颠覆性贡献是:它们本质上都是同一个动作——把"先验知识"从某条路径注入到模型里

按"先验从哪里来"分类,只有三条路:

路线 1:Data 路线——从数据里注入先验

"我样本不够?没关系,我去别的地方借数据。"

  • 在 ImageNet 等大数据集上预训练特征提取器
  • 用 GAN / VAE 在 5 张图的基础上生成新样本
  • 用文本描述、知识图谱等跨模态信息补足监督
  • 数据增强(旋转、裁剪、颜色扰动)

本质:扩大监督信号,让"经验风险最小化"变得可靠。

路线 2:Model 路线——从模型结构里注入先验

"我样本不够?没关系,我约束 AI 的搜索范围。"

  • Prototypical Network:每类用 5 个样本的平均特征作为"类原型",新样本看离哪个原型最近
  • Matching Network:用注意力机制对比新样本与支持集
  • 多任务学习:相关任务共享参数,互相约束

本质:把假设空间缩小到"已知合理的子集"。

路线 3:Algorithm 路线——从训练算法里注入先验

"我样本不够?没关系,我让 AI 学会怎么学。"

  • MAML:在大量相似任务上学一个"易 fine-tune 的初始化",新任务几步梯度就够
  • 学习优化器(用 LSTM 代替 SGD)
  • Refine 已有参数:先通用预训练,再 few-shot 微调

本质:在已固定的搜索空间里改变"搜索最优解的策略"。


一句话讲明白:什么是 Few-Shot Learning?

场景:你有 N 个新类别,每类 K 张样本(N-way K-shot,通常 K=1 或 5)
目标:让 AI 在这几张图上学到识别能力,泛化到没见过的测试图
核心矛盾:经验风险最小化(ERM)在样本极少时不可靠
解法:注入先验知识(从 Data / Model / Algorithm 三条路之一)

为什么 ERM 不可靠?

用 5 张图训练一个分类器,模型可以"完美拟合"这 5 张(经验风险 = 0),但学到的规律可能完全是噪声——对第 6 张测试图完全失效。

"Few-Shot 的本质问题:经验风险最小化器在极小样本下不可靠。先验知识是唯一的稳定剂。" —— 综述原文核心论点


真实类比:你是怎么在 5 分钟内认识一种新水果的?

你第一次见到"释迦果"(长得像佛头的那种水果),朋友给你看 1 张图片,告诉你"这叫释迦果"。

然后你见到另一个角度的释迦果,你立刻认出来了。

你是怎么做到的? 显然不是从 1 张图"训练"出来的——而是:

  • Data 路线:你调用了"所有水果"的记忆(见过 1000 种水果)
  • Model 路线:你的大脑天然知道"形状、颜色、纹理"是有意义的特征
  • Algorithm 路线:你有一套"快速归类"的学习算法("绿色 + 软刺 = 热带水果")

现代 AI 系统尝试模仿的就是这个过程。 不同方法只是从 Data / Model / Algorithm 不同路径注入"释迦果长什么样"的先验。


论文里的关键数据(miniImageNet 5-way 5-shot benchmark)

方法分类 代表方法 准确率(5-way 5-shot)
Data 路线 Pretrain + Fine-tune 约 70–75%
Model 路线 Prototypical Networks 约 65–78%
Algorithm 路线 MAML 约 63%
Hybrid Meta-Learner LSTM 约 60%

⚠️ 这是 2019 年综述的快照数字,今天的 SOTA 已大幅超过。但分类法本身至今仍被广泛沿用——包括斯坦福 CS231n 在内的几乎所有后续 FSL 综述都把 Data / Model / Algorithm 三分法作为章节骨架。


为什么这件事对(不搞 AI 的)你也重要

Few-Shot Learning 不是学术象牙塔——它已经渗透到你的日常 AI 产品:

  1. 手机相册"人物识别":每次新增一个人脸只需要 3–5 张照片,AI 就能从万千照片里找到他——这是 Few-Shot Learning。
  2. 企业客服意图识别:新业务上线 10 个新意图,每个意图只有少量历史对话——Few-Shot 范式让冷启动不再痛苦。
  3. 医疗罕见病辅助诊断:罕见病样本天然稀缺,传统深度学习完全失效——Few-Shot + 跨模态(影像 + 文本病历)成为必由之路。
  4. 工业质检新缺陷:工厂新产品上线、新缺陷类型出现——没时间攒几万张标注图,Few-Shot 让 AI 几小时就能上线。
  5. 大模型时代的 Prompt Engineering:GPT-3 之后,Few-Shot 的角色从"训练侧"转向"Prompt 侧"——给 LLM 3–5 个示例(in-context examples)就能让它学新任务,本质上是 Few-Shot 的 LLM 时代版本。

如果你是 AI 产品经理:当你听到"我们的样本量太少"时,别急着说"那没办法"——Few-Shot Learning 范式告诉你"5 张图也能学"是有理论支撑的成熟方向


⚠️ 工程坑清单(避免踩雷)

1. 不要在三分类上机械套用 "我的方法属于 Data / Model / Algorithm 哪一类?"——这是个常见错误问题。现代方法(如 MetaOptNet、DeepEMD)同时从两条路注入先验,分类边界已经模糊。正确的问题:你的先验知识到底从哪里来?

2. 不要在 miniImageNet 上过拟合 2019 年综述时代的 miniImageNet 5-way 5-shot 已经是低门槛任务。今天社区 SOTA 已迁移到 Meta-Dataset、BSCD-FSL、OD-test 等更复杂 benchmark。如果你只在 miniImageNet 上报 SOTA 数字,说明你的方法可能没准备好面对真实 domain shift

3. 不要混淆 Few-Shot 和其他少样本场景 "我们样本很少"——这可能是 FSL、可能是长尾(imbalanced learning)、可能是弱监督、可能是零样本(zero-shot)——它们的技术栈完全不同。先判断清楚问题类型再选方法。

4. 大模型时代重新审视 Few-Shot GPT-3 之后,Few-Shot Learning 的角色正在迁移:"先验从外部数据来"的强假设被"先验全部在 LLM 里"部分颠覆。今天很多 Few-Shot 场景已经可以用 in-context learning(给 LLM 3–5 个示例)解决,不一定需要训练新模型。

5. 三路线叠加才是工程常态 单纯走一条路线通常会被反例卡住。工程上最稳的方案往往是 Data(pretrain)+ Model(embedding + prototype)+ Algorithm(fine-tune schedule)的组合拳。


何时不要用 Few-Shot Learning 范式

  • 你有大量标注数据(> 1000 张/类)——直接监督学习收益更高
  • 你的任务有海量无标注数据——半监督 / 自监督范式更适合
  • 你的 LLM 已经能 in-context 解决——不需要训练新模型
  • 你的类别集合完全封闭(不会有新类别出现)——普通分类器就够

适合谁读 / 谁该用

角色 价值
研究生入门 FSL 形式化定义与分类法的起点必读
综述 / 调研作者 Data / Model / Algorithm 三分法可直接作为章节骨架
算法工程师 在产品化小样本分类任务前先读本综述,把方法选型放在统一框架内
大模型从业者 理解 few-shot learning 与 in-context learning 的理论衔接
AI 产品经理 冷启动场景的可行性背书

一句话给老板

"客户说'我们每个新类别只有 5 张图'——以前我们说'那没办法'。Few-Shot Learning 范式告诉我们'5 张图也能学'是 2019 年以来被 2,000+ 次研究证实的成熟方向。核心问题是'你的先验知识从哪里来'——Data / Model / Algorithm 三条路选对了,5 张图也能上线。"


三个标题变体

  1. 《"每个新类别只给你 5 张照片"——AI 怎么学?一篇被引 2,191 次的综述把这个问题讲透了》
  2. 《所有 Few-Shot 方法都在做同一件事:把"先验知识"从某条路径注入到模型里》
  3. 《5 张图训练 AI 真的可以吗?——一篇 2019 年综述给出的"Data / Model / Algorithm"三分法》

📱 小红书风格卡片文案

📌 "每个新类别只给你 5 张照片",AI 怎么学?

你接到一个任务:"20 个新产品,每类只有 5 张图,AI 能学会识别吗?"

你可能脱口而出:"才 5 张?肯定不够!"

但这个场景现实中每天都在发生—— 医疗罕见病、工厂新缺陷、长尾品类、安防新威胁……

2019 年 Wang & Yao 的综述 《Generalizing from a Few Examples》(被引 2,191 次)给出了一个颠覆性洞察:

🔸 核心洞察: 所有 Few-Shot 方法本质上都是同一个动作—— "把先验知识从某条路径注入到模型里"

按"先验从哪里来"分,只有三条路:

路线 1: Data 路线 —— 借数据 - 在大数据集预训练、用 GAN 生成新样本、跨模态补监督 - 核心:扩大监督信号

路线 2: Model 路线 —— 约束搜索范围 - Prototypical Network(每类 5 张图的平均特征作原型) - 核心:缩小假设空间

路线 3: Algorithm 路线 —— 学会怎么学 - MAML(在大量相似任务上学一个"易 fine-tune 的初始化") - 核心:改搜索策略

🔸 为什么 ERM 在 5 张图上不可靠? 模型可以"完美拟合"5 张图(经验风险 = 0),但学到的可能全是噪声—— 对第 6 张测试图完全失效。

🔸 真实类比: 你 5 分钟认识一种新水果——你不是从 1 张图训练的,而是: - Data 路线:你见过 1000 种水果(已有知识) - Model 路线:你大脑天然知道"形状、颜色"是有意义的 - Algorithm 路线:你有"快速归类"的学习算法

🔸 对普通人的意义: - 手机相册"人物识别"(3–5 张脸就能认人) - 企业客服新意图冷启动(Few-Shot + 文本描述) - 医疗罕见病辅助诊断(影像 + 文本病历 = 跨模态 Few-Shot) - 工业质检新缺陷上线(没时间攒几万张图) - 大模型 Prompt Engineering(给 GPT-3 个示例 = Few-Shot 的 LLM 版本)

⚠️ 2026 年警示: - 不要机械套用三分类 —— 现代方法常同时注入多条先验 - 不要在 miniImageNet 上过拟合 —— 真实 domain shift 才是考验 - 别混淆 FSL / 长尾 / 弱监督 / 零样本 —— 技术栈完全不同 - 大模型时代重新审视 —— In-context learning 可能替代训练

💡 何时该用 / 不该用: ✅ 新类别冷启动(医疗、工业、长尾) ✅ 每类样本 < 10 张 ✅ LLM in-context 解决不了 ❌ 已有大量标注数据(>1000/类) ❌ 类别集合完全封闭 ❌ 海量无标注数据(半监督更适合)

📎 arXiv 1904.05046 · 2019 年发布 · 被引 2,191 次(OpenAlex 2026) 📅 7 年来仍是 Few-Shot Learning 方向的事实基线综述

💬 评论区聊聊:你遇到过哪些"样本极少但必须上 AI"的场景?你会选 Data / Model / Algorithm 哪条路?

AI #FewShotLearning #小样本学习 #元学习 #论文分享 #综述 #机器学习 #深度学习 #AI科普 #技术分享 #人工智能 #MAML #PrototypicalNetwork