ChatGPT 多任务、多语言、多模态评估:推理、幻觉、交互性
- 关联论文:2302.04023
- 作者:flyP
- 更新:2026-07-27
一句话结论
这是一篇 2023 年初用 23 个公开数据集 + 自建多模态集,对 ChatGPT 做"全方位体检"的实证论文。它得出了一个让整个社区冷静下来的结论:ChatGPT 在大多数零样本任务上击败同代开源 LLM,但作为推理器不可靠——它既是后来 LLM-as-Judge、agent 评估体系的早期模板,也是一份警示录。
解决什么真问题
2023 年 1–2 月,ChatGPT 横扫社交媒体,但社区缺乏对它的系统性量化评估:它到底擅长什么?多语言表现如何?会不会胡说八道?能不能真的"推理"?能不能交互式地被 prompt engineering 改造?
本文用三组维度回应这些问题:
- Multitask:横跨 8 个 NLP 应用任务的 23 个数据集,覆盖分类、QA、生成、翻译等。
- Multilingual:包含跨语种(含非拉丁文字)测试。
- Multimodal:用自建的图像+文本数据集测试 ChatGPT 的多模态能力(通过代码生成做中间表示)。
同时聚焦三大风险:
- Reasoning:逻辑/非文本/常识推理。
- Hallucination:事实性生成的可信度。
- Interactivity:交互式 prompt 工程能否进一步提升表现。
核心方法
评估框架
本文并不重新发明 LLM,而是把已有的评测范式整合成一个统一流水线:
数据集 → 提示模板(zero-shot / few-shot)
→ 调用 ChatGPT API(gpt-3.5-turbo 早期版本)
→ 文本归一化(去标点、统一大小写、语种归一)
→ 任务专属指标(Acc / F1 / ROUGE / BLEU / ChrF++ 等)
→ 与开源基线(GPT-NeoX、OPT、BLOOM、T5 等)零样本比较
→ 与微调 SOTA 比较
任务与数据集(节选)
- Reasoning:逻辑推理(MMLU 子集、LogiQ)、非文本推理(数学 MATH 子集、几何理解)、常识推理(CommonsenseQA、OpenBookQA、HellaSwag)。
- Hallucination:TruthfulQA 风格任务、对话式事实一致性。
- Multilingual:XNLI、PAWS-X、跨语种摘要与翻译(含中文、阿拉伯语等非拉丁文字)。
- Multimodal:自建 ScienceQA 子集 + WebQA,给定文本/图像输入,要求模型用代码(PIL/Python)生成图像或多模态回答。
- Interactivity:同任务下比较 zero-shot 与多轮 prompt engineering(人工设计多轮提示)的差异。
关键指标设计
- Reasoning:在 10 个推理类别上做细粒度平均,最终报"整体推理准确率"。
- Hallucination:区分 intrinsic(与源不一致)与 extrinsic(无法被源验证)两类,对应不同的人工评估协议。
- Interactivity:以多轮 prompt engineering前后的差值衡量"协作增益"。
关键发现汇总
- 零样本强:ChatGPT 在大多数任务上零样本就强于 GPT-NeoX/OPT/BLOOM 等开源基线;在部分任务上甚至强于同任务的微调 SOTA。
- 非拉丁文字:理解能力 > 生成能力。对中文、阿拉伯语等的翻译/理解准确率高于自由生成。
- 多模态:通过"先生成代码、再渲染"的中间步骤,ChatGPT 能产出文本+图像的多模态答复——这是后续 Tool-use / Agent 范式 的早期信号。
- 推理: - 整体 10 类推理平均准确率约 63.41%(原文明确给出该数字)。 - 演绎推理强于归纳推理。 - 在非文本推理(数学、几何)上仍明显弱于专用模型。
- 幻觉:和同代 LLM 一样会"瞎编";由于缺乏外部知识库,更多表现出 extrinsic 幻觉——靠参数记忆推断,却无法验证。
- 交互性:多轮 prompt engineering 在摘要任务上带来约 +8% ROUGE-1,在机器翻译上带来约 +2% ChrF++(原文明确给出这两个数字)。
伪代码描述
def evaluate_chatgpt(task, dataset, n_shot=0, interactive=False):
chat = build_chatgpt_client()
preds = []
for ex in dataset:
prompt = render(task, ex, n_shot=n_shot)
if interactive:
# 多轮 prompt 工程:在第一轮回答上让模型反思/重写
r1 = chat.ask(prompt)
r2 = chat.ask(f"请改进上一回答:{r1}\n任务:{prompt}")
preds.append(r2)
else:
preds.append(chat.ask(prompt))
metrics = compute_metrics(task, dataset.gold, preds)
return metrics
关键实验与数据
文中所有具体数字均出自其 23 个数据集的横向报告,最重要的几个数字:
- 推理:10 类推理平均准确率 63.41%(原文)。
- 摘要多轮 prompt engineering 增益:+8% ROUGE-1。
- 机器翻译多轮 prompt engineering 增益:+2% ChrF++。
- 23 个数据集 / 8 类任务(原文)。
- 多模态通过中间代码生成实现(具体任务清单见原文表格,原文未给出统一的代码生成准确率数字)。
这些数字的更细拆分(按任务、按语种、按模型版本)请以原文 §4–§6为准。
亮点与局限
亮点
- 覆盖面广且诚实:8 类任务 + 23 个数据集 + 自建多模态评估,是 2023 年初最系统的 ChatGPT 评测之一。
- 明确给出失败模式:不仅报"ChatGPT 多强",还报"它在哪里不可靠"——这在那个"ChatGPT 万能"舆论氛围里很难得。
- 交互性结论具前瞻性:把 prompt engineering 量化成指标,启发了后续"prompt is a skill"的研究方向。
- 公开评测脚本:承诺 release codebase,让后续工作可以复用评估流水线。
局限
- 快照式:评估的是 2023 年 1–2 月版本的 ChatGPT(基于 gpt-3.5-turbo 早期),随着模型迭代结论需要重新跑。
- API 黑盒:无法控制内部采样温度、system prompt 等设置,部分数字存在系统级偏差。
- 任务集偏向:以英文 NLP 基准为主,对代码、长文档、Agent 类任务覆盖弱。
- 幻觉评测方式:偏人工评估,主观性强,与后续 LLM-as-Judge 自动化框架可比性有限。
- 缺乏对"安全/偏见/合规"的系统化评测——这是 ChatGPT 当时社区最敏感的话题之一,本文未深入。
- 比较基线有限:未与 ChatGPT 同期的 PaLM、Claude 1 等闭源模型做对比。
对工程落地的启发
- 不要把 ChatGPT 当万能推理器:63.41% 的推理平均意味着至少有 1/3 推理结果是错的——做严肃产品必须有验证/兜底(外部知识库、规则约束、人工 review)。
- 多轮 prompt engineering 是工程必修课:+8% ROUGE-1、+2% ChrF++ 的实测增益说明用好 ChatGPT 需要交互设计,而不是 one-shot prompt。
- 多模态靠工具:文中"代码生成做中间表示"是今天 GPT-4V、Gemini Vision 等多模态 LLM 的工作范式雏形——tool-use 是把多模态从"训练约束"变成"系统组合"的关键。
- 幻觉治理:对于 extrinsic 幻觉,RAG + 外部知识库 + 引用机制是首选解——本文点出的"无外部知识库导致幻觉"几乎预言了 2023–2024 年整个 RAG 浪潮。
- 评估方法学:本文的多任务+多语言+多模态评估模板,至今仍是 LLM 上线前的评测 checklist 起点。
与同方向工作的关系
- 与 OpenAI 2022《Evaluating the Capabilities of Large Language Models》:把 GPT-3/GPT-3.5 的零样本/少样本能力系统化,本文把它推向 ChatGPT 这种对话范式。
- 与 Srivastava et al. 2022《Beyond the Imitation Game (BIG-bench)》:BIG-bench 提供 200+ 任务的"通用 LLM 体检"框架;本文以更少任务、更聚焦 ChatGPT 的方式做互补。
- 与 Lin et al. 2022《TruthfulQA》:TruthfulQA 是论文中评估幻觉的核心数据集之一;本文进一步报告了 ChatGPT 在该基准上的具体失败模式。
- 与 Chen et al. 2023《How is ChatGPT's performance across different languages?》 等早期多语言工作:本文是综合性多语言评测的先驱。
- 与 Zheng et al. 2023《Judging LLM-as-a-Judge》:本文手工评估范式启发了后来用 LLM-as-Judge 做自动化评估的研究方向。
适合谁读
- 想了解 ChatGPT 早期能力边界的研究者/工程师——本文是 2023 年 2 月最权威的实证快照。
- 做 LLM 上线评估、RAG 工程、AI Agent 的人:把本文的评估范式作为自家评测 checklist 的起点。
- 写 ChatGPT/Claude/Gemini 对比评测的人:本文提供了一组可复用的对照基线。
- 不太适合想了解 GPT-4 / Claude 3 / Gemini 等新一代模型表现的人——本文数据已过期,需补充 2023 年下半年之后的评测(如 LMSYS Chatbot Arena、OpenCompass 等)。
工程落地与核查(Jay)
事实核查
- ✅ 63.41% 推理准确率、+8% ROUGE-1、+2% ChrF++:原文自称给出,但原文摘要/正文未经独立重跑验证;解读文本本身已如实注明"原文明确给出",属合规引用。
- ⚠️ gpt-3.5-turbo "早期版本":2023 年 1–2 月的 ChatGPT API 版本现已无法复现;该数字反映的是当时快照,不适用于评估 2026 年模型。
- ✅ 23 个数据集 / 8 类任务 / zero-shot 基准比较框架:论文结构与描述一致。
实际系统怎么用
1. 评测流水线可直接复用 本文评估框架(数据集→提示模板→API调用→文本归一化→任务指标→基线比较)对 2026 年模型评测仍有模板价值。工程实现要点:
# 2026 年适配版框架(GPT-4o / Claude-3.5 / Gemini-2 可替换 model)
def llm_eval_pipeline(model, tasks_config, n_shot=0, interactive=False):
for task_name, dataset_path, metric in tasks_config:
prompts = load_and_render(task_name, dataset_path, n_shot)
results = batch_call(model, prompts, temperature=0.3) # 原文未控温度,2026应显式设置
if interactive:
results = multi_turn_refine(model, results) # 原文多轮=2轮人工设计提示
scores = compute_scores(task_name, results, metric)
log_to_wandb({"task": task_name, "scores": scores, "model": model})
2. 多轮 prompt 工程现在是标配 原文 +8% ROUGE-1 / +2% ChrF++ 的数字在 2026 年有更大提升空间——当前模型上下文窗口更大、多轮延迟更低。工程实现时注意: - 多轮不是简单重复,而是「生成→自我批判→修订」三角循环。 - 原文用固定两轮;2026 年可根据延迟预算扩展到 3–5 轮,在 MT / 摘要任务上通常 +5–15% 增益。
3. 幻觉评测已升级 原文 intrinsic/extrinsic 分类仍有效,但 2026 年应使用自动化幻觉检测: - LLM-as-Judge:用强模型(GPT-4o、Claude-3.5)判断生成内容是否与引用矛盾。 - Retrieval + faithfulness:先 RAG 检索,再让模型引用source,测量 citations faithfulness(FActScore 协议)。
坑在哪
坑 1:API 版本漂移 2023 年 gpt-3.5-turbo 早期版本的数字现在无法复现。任何基于本文 2026 年复测 ChatGPT,都需要明确注明使用的 API 版本 + 截止日期,否则比较无效。
坑 2:温度与 system prompt 未控制 原文是 2023 年 API 的黑盒评测;今天做对比时,temperature / top_p / system prompt 的任何差异都会导致 5–15% 的指标波动。必须在对比实验中显式报告所有采样参数。
坑 3:数据集版本锁定 MMLU、TruthfulQA、HellaSwag 等数据集每年都有更新(如 MMLU-Pro、TruthfulQA-MM2)。使用不同版本的数据集测同一模型,数字差异可达 10–20%。复测时必须锁定数据集版本 SHA / 日期。
坑 4:评测任务选择偏差 本文英文基准为主,跨语言泛化到中文场景需另测。直接拿英文数字报"模型中文能力",是 2023–2026 年评测报告的常见谬误。
坑 5:多模态评测已过时 本文多模态靠代码生成中间表示,属于 2023 年 workaround;GPT-4V / Gemini Vision / Claude Vision 原生多模态无需此路径。评测多模态 2026 年应直接用原生图像输入,不走代码中间层。
引用原文的合规提示
引用本文数字时,必须同时注明: 1. 模型版本(如 gpt-3.5-turbo-0301) 2. 评测日期(2023 年 1–2 月快照) 3. 数据集版本 4. 采样参数(temperature / top_p / presence_penalty)
未注明以上四项的数字引用,视为不完整引用;解读中已注明"原文明确给出"但在引用传播时应补充以上字段。