Training Compute-Optimal Large Language Models
- 类型:arxiv
- 标识:2203.15556
- 链接:https://arxiv.org/abs/2203.15556
- 主题:rag
- 主分类:engineering
- 形态:method
- 被引:3649
- 被引来源:Semantic Scholar
- S2被引:3649
- OpenAlex被引:669
- 影响力被引:346
- TLDR:This work trains a predicted compute-optimal model, Chinchilla, that uses the same compute budget as Gopher but with 70B parameters and 4$\times$ more more data, and reaches a state-of-the-art average accuracy, greater than a 7% improvement over Gopher.
- OpenAlex ID:W4225591000
- OpenAlex DOI:10.48550/arxiv.2203.15556
- DOI:10.48550/arxiv.2203.15556
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2203.15556
- OpenAlex更新:2026-08-22
- 待LLM分类:否
- 标题中文:Training Compute-Optimal Large Language Models
- TLDR中文:本工作训练了一个预测的计算最优模型 Chinchilla,使用与 Gopher 相同的计算预算,但参数量为 70B、数据量为 4 倍,达到 SOTA 平均准确率,比 Gopher 提升超过 7%。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]