A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity
- 类型:arxiv
- 标识:2302.04023
- 链接:https://arxiv.org/abs/2302.04023
- 主题:multimodal
- 主分类:multimodal
- 形态:benchmark
- 被引:1809
- 被引来源:Semantic Scholar
- S2被引:1809
- OpenAlex被引:357
- 影响力被引:66
- TLDR:It is found that ChatGPT outperforms LLMs with zero-shot learning on most tasks and even outperforms fine-tuned models on some tasks and is better at understanding non-Latin script languages than generating them.
- OpenAlex ID:W4319793302
- OpenAlex DOI:10.48550/arxiv.2302.04023
- DOI:10.48550/arxiv.2302.04023
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2302.04023
- OpenAlex更新:2026-07-30
- 副分类:evaluation
- 待LLM分类:否
- 标题中文:ChatGPT 在推理、幻觉与交互性方面的多任务、多语言、多模态评估
- TLDR中文:研究发现 ChatGPT 在大多数任务上以零样本学习优于其他 LLM,在部分任务上甚至超过微调模型,并且对非拉丁文字语言的理解能力优于生成能力。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]