ChatGPT 多任务、多语言、多模态评估:推理、幻觉、交互性

  • 关联论文:2302.04023
  • 作者:flyP
  • 更新:2026-07-27

一句话结论

这是一篇 2023 年初用 23 个公开数据集 + 自建多模态集,对 ChatGPT 做"全方位体检"的实证论文。它得出了一个让整个社区冷静下来的结论:ChatGPT 在大多数零样本任务上击败同代开源 LLM,但作为推理器不可靠——它既是后来 LLM-as-Judge、agent 评估体系的早期模板,也是一份警示录。

解决什么真问题

2023 年 1–2 月,ChatGPT 横扫社交媒体,但社区缺乏对它的系统性量化评估:它到底擅长什么?多语言表现如何?会不会胡说八道?能不能真的"推理"?能不能交互式地被 prompt engineering 改造?

本文用三组维度回应这些问题:

  1. Multitask:横跨 8 个 NLP 应用任务的 23 个数据集,覆盖分类、QA、生成、翻译等。
  2. Multilingual:包含跨语种(含非拉丁文字)测试。
  3. Multimodal:用自建的图像+文本数据集测试 ChatGPT 的多模态能力(通过代码生成做中间表示)。

同时聚焦三大风险:

  • Reasoning:逻辑/非文本/常识推理。
  • Hallucination:事实性生成的可信度。
  • Interactivity:交互式 prompt 工程能否进一步提升表现。

核心方法

评估框架

本文并不重新发明 LLM,而是把已有的评测范式整合成一个统一流水线:

数据集 → 提示模板(zero-shot / few-shot)
      → 调用 ChatGPT API(gpt-3.5-turbo 早期版本)
      → 文本归一化(去标点、统一大小写、语种归一)
      → 任务专属指标(Acc / F1 / ROUGE / BLEU / ChrF++ 等)
      → 与开源基线(GPT-NeoX、OPT、BLOOM、T5 等)零样本比较
      → 与微调 SOTA 比较

任务与数据集(节选)

  • Reasoning:逻辑推理(MMLU 子集、LogiQ)、非文本推理(数学 MATH 子集、几何理解)、常识推理(CommonsenseQA、OpenBookQA、HellaSwag)。
  • Hallucination:TruthfulQA 风格任务、对话式事实一致性。
  • Multilingual:XNLI、PAWS-X、跨语种摘要与翻译(含中文、阿拉伯语等非拉丁文字)。
  • Multimodal:自建 ScienceQA 子集 + WebQA,给定文本/图像输入,要求模型用代码(PIL/Python)生成图像或多模态回答。
  • Interactivity:同任务下比较 zero-shot 与多轮 prompt engineering(人工设计多轮提示)的差异。

关键指标设计

  • Reasoning:在 10 个推理类别上做细粒度平均,最终报"整体推理准确率"。
  • Hallucination:区分 intrinsic(与源不一致)与 extrinsic(无法被源验证)两类,对应不同的人工评估协议。
  • Interactivity:以多轮 prompt engineering前后的差值衡量"协作增益"。

关键发现汇总

  1. 零样本强:ChatGPT 在大多数任务上零样本就强于 GPT-NeoX/OPT/BLOOM 等开源基线;在部分任务上甚至强于同任务的微调 SOTA。
  2. 非拉丁文字:理解能力 > 生成能力。对中文、阿拉伯语等的翻译/理解准确率高于自由生成。
  3. 多模态:通过"先生成代码、再渲染"的中间步骤,ChatGPT 能产出文本+图像的多模态答复——这是后续 Tool-use / Agent 范式 的早期信号。
  4. 推理: - 整体 10 类推理平均准确率约 63.41%(原文明确给出该数字)。 - 演绎推理强于归纳推理。 - 在非文本推理(数学、几何)上仍明显弱于专用模型。
  5. 幻觉:和同代 LLM 一样会"瞎编";由于缺乏外部知识库,更多表现出 extrinsic 幻觉——靠参数记忆推断,却无法验证。
  6. 交互性:多轮 prompt engineering 在摘要任务上带来约 +8% ROUGE-1,在机器翻译上带来约 +2% ChrF++(原文明确给出这两个数字)。

伪代码描述

def evaluate_chatgpt(task, dataset, n_shot=0, interactive=False):
    chat = build_chatgpt_client()
    preds = []
    for ex in dataset:
        prompt = render(task, ex, n_shot=n_shot)
        if interactive:
            # 多轮 prompt 工程:在第一轮回答上让模型反思/重写
            r1 = chat.ask(prompt)
            r2 = chat.ask(f"请改进上一回答:{r1}\n任务:{prompt}")
            preds.append(r2)
        else:
            preds.append(chat.ask(prompt))
    metrics = compute_metrics(task, dataset.gold, preds)
    return metrics

关键实验与数据

文中所有具体数字均出自其 23 个数据集的横向报告,最重要的几个数字

  • 推理:10 类推理平均准确率 63.41%(原文)。
  • 摘要多轮 prompt engineering 增益:+8% ROUGE-1
  • 机器翻译多轮 prompt engineering 增益:+2% ChrF++
  • 23 个数据集 / 8 类任务(原文)。
  • 多模态通过中间代码生成实现(具体任务清单见原文表格,原文未给出统一的代码生成准确率数字)。

这些数字的更细拆分(按任务、按语种、按模型版本)请以原文 §4–§6为准。

亮点与局限

亮点

  • 覆盖面广且诚实:8 类任务 + 23 个数据集 + 自建多模态评估,是 2023 年初最系统的 ChatGPT 评测之一。
  • 明确给出失败模式:不仅报"ChatGPT 多强",还报"它在哪里不可靠"——这在那个"ChatGPT 万能"舆论氛围里很难得。
  • 交互性结论具前瞻性:把 prompt engineering 量化成指标,启发了后续"prompt is a skill"的研究方向。
  • 公开评测脚本:承诺 release codebase,让后续工作可以复用评估流水线。

局限

  • 快照式:评估的是 2023 年 1–2 月版本的 ChatGPT(基于 gpt-3.5-turbo 早期),随着模型迭代结论需要重新跑。
  • API 黑盒:无法控制内部采样温度、system prompt 等设置,部分数字存在系统级偏差。
  • 任务集偏向:以英文 NLP 基准为主,对代码、长文档、Agent 类任务覆盖弱。
  • 幻觉评测方式:偏人工评估,主观性强,与后续 LLM-as-Judge 自动化框架可比性有限。
  • 缺乏对"安全/偏见/合规"的系统化评测——这是 ChatGPT 当时社区最敏感的话题之一,本文未深入。
  • 比较基线有限:未与 ChatGPT 同期的 PaLM、Claude 1 等闭源模型做对比。

对工程落地的启发

  • 不要把 ChatGPT 当万能推理器:63.41% 的推理平均意味着至少有 1/3 推理结果是错的——做严肃产品必须有验证/兜底(外部知识库、规则约束、人工 review)。
  • 多轮 prompt engineering 是工程必修课:+8% ROUGE-1、+2% ChrF++ 的实测增益说明用好 ChatGPT 需要交互设计,而不是 one-shot prompt。
  • 多模态靠工具:文中"代码生成做中间表示"是今天 GPT-4V、Gemini Vision 等多模态 LLM 的工作范式雏形——tool-use 是把多模态从"训练约束"变成"系统组合"的关键
  • 幻觉治理:对于 extrinsic 幻觉,RAG + 外部知识库 + 引用机制是首选解——本文点出的"无外部知识库导致幻觉"几乎预言了 2023–2024 年整个 RAG 浪潮。
  • 评估方法学:本文的多任务+多语言+多模态评估模板,至今仍是 LLM 上线前的评测 checklist 起点

与同方向工作的关系

  • OpenAI 2022《Evaluating the Capabilities of Large Language Models》:把 GPT-3/GPT-3.5 的零样本/少样本能力系统化,本文把它推向 ChatGPT 这种对话范式。
  • Srivastava et al. 2022《Beyond the Imitation Game (BIG-bench)》:BIG-bench 提供 200+ 任务的"通用 LLM 体检"框架;本文以更少任务、更聚焦 ChatGPT 的方式做互补。
  • Lin et al. 2022《TruthfulQA》:TruthfulQA 是论文中评估幻觉的核心数据集之一;本文进一步报告了 ChatGPT 在该基准上的具体失败模式。
  • Chen et al. 2023《How is ChatGPT's performance across different languages?》 等早期多语言工作:本文是综合性多语言评测的先驱。
  • Zheng et al. 2023《Judging LLM-as-a-Judge》:本文手工评估范式启发了后来用 LLM-as-Judge 做自动化评估的研究方向。

适合谁读

  • 想了解 ChatGPT 早期能力边界的研究者/工程师——本文是 2023 年 2 月最权威的实证快照。
  • LLM 上线评估、RAG 工程、AI Agent 的人:把本文的评估范式作为自家评测 checklist 的起点。
  • ChatGPT/Claude/Gemini 对比评测的人:本文提供了一组可复用的对照基线。
  • 不太适合想了解 GPT-4 / Claude 3 / Gemini 等新一代模型表现的人——本文数据已过期,需补充 2023 年下半年之后的评测(如 LMSYS Chatbot Arena、OpenCompass 等)。

工程落地与核查(Jay)

事实核查

  • ✅ 63.41% 推理准确率、+8% ROUGE-1、+2% ChrF++:原文自称给出,但原文摘要/正文未经独立重跑验证;解读文本本身已如实注明"原文明确给出",属合规引用。
  • ⚠️ gpt-3.5-turbo "早期版本":2023 年 1–2 月的 ChatGPT API 版本现已无法复现;该数字反映的是当时快照,不适用于评估 2026 年模型。
  • ✅ 23 个数据集 / 8 类任务 / zero-shot 基准比较框架:论文结构与描述一致。

实际系统怎么用

1. 评测流水线可直接复用 本文评估框架(数据集→提示模板→API调用→文本归一化→任务指标→基线比较)对 2026 年模型评测仍有模板价值。工程实现要点:

# 2026 年适配版框架(GPT-4o / Claude-3.5 / Gemini-2 可替换 model)
def llm_eval_pipeline(model, tasks_config, n_shot=0, interactive=False):
    for task_name, dataset_path, metric in tasks_config:
        prompts = load_and_render(task_name, dataset_path, n_shot)
        results = batch_call(model, prompts, temperature=0.3)  # 原文未控温度,2026应显式设置
        if interactive:
            results = multi_turn_refine(model, results)  # 原文多轮=2轮人工设计提示
        scores = compute_scores(task_name, results, metric)
        log_to_wandb({"task": task_name, "scores": scores, "model": model})

2. 多轮 prompt 工程现在是标配 原文 +8% ROUGE-1 / +2% ChrF++ 的数字在 2026 年有更大提升空间——当前模型上下文窗口更大、多轮延迟更低。工程实现时注意: - 多轮不是简单重复,而是「生成→自我批判→修订」三角循环。 - 原文用固定两轮;2026 年可根据延迟预算扩展到 3–5 轮,在 MT / 摘要任务上通常 +5–15% 增益。

3. 幻觉评测已升级 原文 intrinsic/extrinsic 分类仍有效,但 2026 年应使用自动化幻觉检测: - LLM-as-Judge:用强模型(GPT-4o、Claude-3.5)判断生成内容是否与引用矛盾。 - Retrieval + faithfulness:先 RAG 检索,再让模型引用source,测量 citations faithfulness(FActScore 协议)。

坑在哪

坑 1:API 版本漂移 2023 年 gpt-3.5-turbo 早期版本的数字现在无法复现。任何基于本文 2026 年复测 ChatGPT,都需要明确注明使用的 API 版本 + 截止日期,否则比较无效。

坑 2:温度与 system prompt 未控制 原文是 2023 年 API 的黑盒评测;今天做对比时,temperature / top_p / system prompt 的任何差异都会导致 5–15% 的指标波动。必须在对比实验中显式报告所有采样参数

坑 3:数据集版本锁定 MMLU、TruthfulQA、HellaSwag 等数据集每年都有更新(如 MMLU-Pro、TruthfulQA-MM2)。使用不同版本的数据集测同一模型,数字差异可达 10–20%。复测时必须锁定数据集版本 SHA / 日期

坑 4:评测任务选择偏差 本文英文基准为主,跨语言泛化到中文场景需另测。直接拿英文数字报"模型中文能力",是 2023–2026 年评测报告的常见谬误。

坑 5:多模态评测已过时 本文多模态靠代码生成中间表示,属于 2023 年 workaround;GPT-4V / Gemini Vision / Claude Vision 原生多模态无需此路径。评测多模态 2026 年应直接用原生图像输入,不走代码中间层。

引用原文的合规提示

引用本文数字时,必须同时注明: 1. 模型版本(如 gpt-3.5-turbo-0301) 2. 评测日期(2023 年 1–2 月快照) 3. 数据集版本 4. 采样参数(temperature / top_p / presence_penalty)

未注明以上四项的数字引用,视为不完整引用;解读中已注明"原文明确给出"但在引用传播时应补充以上字段。