GPT‑3 之所以具备强大语言能力,关键在于它的预训练文本规模远远超过人类整理的维基百科,海量数据是模型涌现能力的基础条件之一。

英文维基百科全部文章大约 40 亿单词。GPT‑3 的训练数据约 5000 亿 tokens ,英文里平均 1 个 token 约对应 0.75 个单词 ,5000 亿 tokens 折算后大约 3750 亿英文单词。而训练 GPT‑3 所用的数据量大约是它的 100 倍。GPT‑3 之所以具备强大语言能力,关键在于它的预训练文本规模远远超过人类整理的维基百科,海量数据是模型涌现能力的基础条件之一。

核心观点展开解读

  1. 数据量级差距直观感受 人类花费漫长时间编撰整理的英文维基百科,凝聚了无数人编纂成果,只有 40 亿单词;GPT‑3 训练文本折合英文单词达到 3750 亿,体量高出近百倍。除此之外 GPT‑3 的训练素材还包含书籍、网页、论坛文章、新闻、小说、技术文档等海量互联网文本,维基百科仅仅是它数据集里很小一部分。
  2. 涌现能力和大数据的关系 大模型里的涌现(Emergent ability)有一个重要现象:很多能力(逻辑推理、翻译、概括、常识、简单因果推导)在模型规模、训练数据不足的时候几乎看不到;当参数量和训练数据跨过一定阈值后,模型突然具备这些能力。
  • 足够海量、多样化的文本,让模型学习到人类语言里隐藏的语法习惯、常识知识、语境关联、事实信息、推理范式;
  • 只有看过千亿级别的文本,模型才能统计式地掌握词语之间深层关联;仅依靠维基百科这种规模的数据,GPT‑3 只能做到基础填空,不可能完成写长文、复杂问答、逻辑论证。
  1. 补充客观局限(不能过度神化数据) ① 数据量大只是必要条件,不是充分条件。除数据体量外,GPT‑3 强大同样依赖:1750 亿模型参数、Transformer 架构、高质量数据筛选、合理的上下文窗口、预训练‑微调范式。只堆砌文本但模型结构落后,依然达不到对应效果; ② 海量互联网数据良莠不齐,网页内容存在谣言、偏见、错误信息,这也是大模型产生幻觉、输出片面看法的根源;维基百科经过人工审核,事实可靠性反而高于大部分网页文本; ③ 现在新一代大模型(GPT‑4 等)训练数据不再只是单纯扩充单词数量,会更加注重高质量数据配比,减少低质量冗余网页,依靠更高质量素材进一步提升效率。

精简版总结

GPT‑3 的训练文本是英文维基百科近 100 倍,庞大的数据储备为模型涌现出强大语言能力打下基础;大数据配合超大参数与优秀模型架构,共同造就了 GPT‑3 出色的语言表现,但海量互联网脏数据也带来了幻觉等缺陷。

现代大型语言模型更进一步:它们学习数万亿个词汇,消化来自书籍、网站、代码仓库、科研论文以及更多来源的文本。 打个比方:倘若你每周读完一本书,看完 GPT‑3 的全部训练内容,要耗费 18 万年。

现代大模型会摄入规模极其庞大的数据:素材涵盖海量图书、网页内容、程序代码、学术论文等资料,整体文本总量达到数万亿词语。 用生活化的例子体会体量:假设你坚持效率很高,一周读完一整本书,读完 GPT‑3 全部训练素材,一共需要 18 万年。

补充一点延伸信息
  1. 数据体量的现实意义 GPT‑3 训练数据集规模大约数百 GB 级别,之所以算出 18 万年,是它整合了海量碎片化短文、论坛内容、论文片段,并不只是完整成书。互联网里大量短句、段落合在一起折算成书,总量就极其恐怖。海量文本让模型掌握语法、常识、不同领域知识、人类惯用逻辑。
  2. 这里存在一个关键误区 模型并不是像人一样 “读懂理解内容”,它只是统计词语之间的接续概率,哪怕看过海量资料,它并不会产生自我意识;只是见过足够多人类的文字,学会合理接续下文。
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐