什么是预训练?读懂大模型诞生最关键的第一步
摘要:预训练是现代大模型的起点,没有预训练,ChatGPT、各类国产大模型都无从谈起。它不是让 AI 死记硬背题库,而是让模型在海量互联网文本中,通过 “预测下一个词” 这个简单任务,自主习得语法、常识、逻辑乃至基础推理能力。本文用通俗语言对比传统 AI 训练模式,拆解预训练完整工作流程,解释基座模型的能力与局限,理清预训练、指令微调、人类反馈对齐三者之间的关系。前言
很多人使用 AI 聊天机器人,只看到它流畅的回答、丰富的知识,却并不了解它的能力从何而来。大模型并不是拿到问答样本直接训练出来的,预训练才是整个大模型体系的地基。
一句话概括预训练:大模型正式上岗之前,先阅读海量文本,搭建语言与世界认知的基础底座,而不是针对某一个具体任务从零学起。
很多人会产生误解,以为预训练就是给 AI 背海量题库。事实恰恰相反,预训练教会模型的是生成逻辑,而不是背诵标准答案。
一、新旧 AI 训练模式对比:从昂贵的监督学习,到预训练范式革新
在大模型普及之前,传统 AI 训练大多采用监督学习模式。
举个例子,要训练一个情感分析 AI,用来判断电影评论是好评还是差评,工程师需要人工标注几千条样本,明确标记哪一句是正面评价、哪一句是负面评价,再喂给模型学习。这就好比教一个完全不懂中文的外星人,分辨 “这部电影让我泪流满面” 是感动还是批评,每一句话都需要人为打上标签。
这种模式的痛点非常明显:
[*]标注成本极高,需要大量人力做标签;
[*]任务迁移能力差。换做垃圾邮件过滤,又要重新标注一整套数据,从头训练;
[*]AI 起点相当于一张白纸,全部知识都来自少量标注样本,知识储备非常有限。
预训练彻底改写这套逻辑。它的思路十分朴素:先不去管具体要完成什么任务,直接投喂海量无标注文本,互联网网页、书籍、新闻、论文、百科全部纳入训练素材,数据规模达到数万亿词。
这个阶段不要求模型做分类、写答案,只分配一个简单任务:预测下一个词(token)。比如输入句子:“今天阳光很好,我们决定去公园____”,让模型推断空白处最合理的内容,可能是散步、野餐、放风筝。
这种任务叫做自回归语言建模。文章本身就自带上下文,不需要人工打标签,天然就可以生成训练信号。
仅仅是做 “猜下一个词” 这件事,却逼迫模型必须理解深层关联:想要猜对 “散步”,就要明白好天气和户外活动的联系,理解语法句式,明白公园对应的场景含义。
当模型读完万亿级别的文本,词语搭配、语法规则、常识因果,就全部内化进模型海量参数之中。经过预训练产出的成品,叫做基座模型(Base Model)。
我们可以打一个生活化比方:预训练如同小孩子大量读绘本。不需要专门讲解名词动词,不需要做阅读理解习题,只是大量阅读。读得足够多之后,孩子自然学会说话,甚至可以自己编出新故事。预训练就是让模型消化人类文明沉淀下来的海量文字,把世界的统计规律压缩进亿万参数,而不是简单存储原文。
传统监督学习依赖少量人工标注数据;预训练依托互联网规模的无标注文本,直接把模型从知识匮乏变成知识储备丰厚。
二、预训练的完整工作流程:三个核心动作
底层架构以 Transformer 为主,这里跳过复杂数学公式,只讲模型学习的三个核心步骤:
[*]文本切分为 Token:把原始文字切割成最小单元,单元可以是完整词语,也可以是词语片段,这是模型能够识别的基础单位。
[*]上下文预测任务:给定上文,让模型预测后续 token,完成填空、续写任务。
[*]误差回传调整参数:对比模型预测出来的词和真实文本,计算误差,调整模型内部上亿、甚至上千亿参数,让下一次预测更加准确。
整套流程会在 GPU 集群上持续运行数月,处理数万亿 token 数据。
在反复训练的过程中,模型能力会分层浮现:
[*]底层:学到字词组合关系,例如 “葡萄” 后面经常跟着酒、芽,很少搭配电视机;掌握基础语法,主谓句式的对应关系。
[*]高层:自动涌现出常识与简单推理。比如读到 “小明把杯子摔碎,地上有水和玻璃碎片”,模型可以推断后续更可能发生妈妈责备,而不是小明开心大笑。
物理常识、情绪因果,从来没有被单独教给模型,全部来自海量文本中隐藏的统计规律,被 “预测下一个词” 这个简单目标压进参数内部。这就是预训练最神奇的地方:用一个极简训练目标,倒逼模型生长出复杂能力,也就是行业所说的涌现能力。
重要澄清:模型并不是记住互联网全部答案,而是学到一套内在生成逻辑。遇到全新的输入,它依靠学到的概率规律生成合理文本,这就是 AI 回答问题的雏形。
三、预训练的短板:基座模型不能直接拿来聊天
预训练完成,基座模型知识储备很丰富,但它本质只是一台高级文本续写机器,并不能直接当做聊天助手使用。
如果你向原始基座模型提问:“写一首关于猫的诗”,它不会完整给你一首诗,而是自顾自无限续写文本,可能输出 “和它一起看夕阳,狗在远方吠叫……” 一直往下延伸,完全不理解 “写一首诗” 这个指令,不知道什么时候该停下。
因为它训练目标只有续写文本,没有学会听懂人类指令、遵守对话格式。想要得到可以正常对话的 AI,还需要后续两步关键处理:指令微调(SFT)、人类反馈对齐(RLHF/DPO)。
[*]指令微调:使用少量高质量人工标注的指令‑回答样本,教会模型看懂人类提问,学会问答格式;
[*]人类反馈对齐:让模型学习人类偏好,让回答更有用、得体、安全,相当于给脱缰的野马装上缰绳。
关键点:后面的微调、对齐只是挖掘预训练已经具备的能力上限,预训练才是能力的天花板。如果预训练阶段没有学到对应的知识,后续无论怎么微调,都很难凭空生成对应能力。
举一个垂直场景例子帮助理解:搭建医疗问答 AI。过去老方案,需要成千上万条人工标注 “头痛怎么办、高血压饮食建议” 的标准答案。现在经过预训练的基座模型,已经读过海量医学论文、百科科普。即便没有专门医疗问答标注,你向它提问高血压饮食注意事项,它就可以重组已有知识给出靠谱回答。它不是背诵固定答案,而是基于学到的知识分布重新生成文本,这就是从 “背答案” 走向 “理解生成” 的跨越。
四、完整大模型训练链路梳理
整个大模型的诞生可以划分为三个阶段:
[*]预训练阶段:使用互联网级海量无标注文本,产出基座模型,搭建知识与语言底座;
[*]指令微调阶段:少量高质量标注对话样本,教会模型听懂指令,学会问答交互;
[*]人类反馈对齐阶段:优化回答质量、安全性、价值观,最终产出普通用户可以直接使用的对话 AI 产品。
简单理解:预训练给模型装满知识;微调对齐负责引导模型怎么好好说话。
写在最后
预训练的本质,就是通过 “猜下一个词” 这个简单任务,让模型从海量文本中学习人类语言背后的世界。它让机器拥有常识雏形,摆脱过去一个任务就要重新训练一套模型的旧模式。当下大模型的各种奇迹,全部始于这朴素的第一步。
免责声明:本文属于科普内容,不同厂商大模型在预训练、微调的实现细节会存在差异,仅供学习参考。
页:
[1]