本文目录导读:

这是一个非常核心且重要的话题,我们来系统地梳理一下预训练语言模型。
核心概念:什么是预训练语言模型?
预训练语言模型 是一种通过在海量、无标注的文本数据上学习,从而掌握通用语言知识和能力的深度学习模型。
可以把它想象成一个“通才”学生:
- 预训练(Pre-training): 这个学生先读完了全世界的图书馆(海量无标注数据),虽然没有老师给他具体考题(无监督学习),但他通过“上下文猜词”这类练习,学会了语法、词汇、逻辑、常识等所有基础知识。
- 微调(Fine-tuning): 之后,针对一个特定任务(比如写诗、写代码、分类新闻),只需要给他少量、具体的高质量示例,他就能迅速把之前学到的通用知识转化为解决这个问题的专业能力。
关键点: 它不依赖人工标注数据,而是直接从原始文本中学习。
发展历程:从词向量到大型语言模型
-
词向量时代(静态模型):Word2Vec, GloVe
- 特点: 将一个词映射成一个固定的向量,词“苹果”只有一个向量,无法区分“我要吃苹果”和“我要买苹果手机”中的不同含义。
- 局限: 无法处理一词多义。
-
上下文表示时代(动态模型):ELMo
- 特点: 模型根据上下文动态生成词向量。“苹果”在“吃”和“手机”前的向量会不同,解决了多义词问题。
-
Transformer与自回归/自编码时代:
- GPT系列(自回归模型): 使用Transformer的解码器,任务是从左到右预测下一个词,擅长生成。
- BERT(自编码模型): 使用Transformer的编码器,任务是完形填空(随机遮盖15%的词来预测),擅长理解(分类、命名实体识别等)。
-
大语言模型时代(LLMs):规模即力量
- 代表: GPT-3、PaLM、LLaMA、GPT-4、Claude、Gemini。
- 特点: 模型参数规模巨大(从百亿到万亿),训练数据量史诗级,在达到一定规模后,涌现出涌现能力,如上下文学习、思维链推理等,无需微调就能处理复杂任务。
工作原理:它到底在学什么?
预训练语言模型的核心学习任务通常是语言建模,主要有两种形式:
-
自回归语言模型(Autoregressive,如GPT): 给定前文,预测下一个词的概率,输入“今天天气真”,模型预测下一个最可能的词是“好”、“棒”、“不错”等。
目标和损失函数:最大化整个序列出现的概率(最大似然估计)。
-
自编码语言模型(Autoencoding,如BERT): 将输入文本随机遮盖掉一些词(用 [MASK] 标记),然后让模型预测被遮盖的词,输入“今天天气真 [MASK]”,模型预测 [MASK] 位置应该是“好”。
目标和损失函数:最小化预测词与真实词之间的差距(交叉熵损失)。
核心规律:模型通过这种“猜词游戏”来学习
- 语法: “我今天去 了 学校”,“了”常跟在动词后。
- 语义: “苹果”常与“吃”、“水果”、“甜”等词共现。
- 上下文: “汤姆打了破窗户,因此他 ___ 。”模型会学习到结果是“被惩罚”或“感到抱歉”。
- 世界知识: “中国、法国、美国这样的词可以被称为 国家”。
著名模型速览(截至2024年底)
| 家族 | 代表模型 | 架构 | 参数量 | 特点与擅长领域 |
|---|---|---|---|---|
| GPT | GPT-3, GPT-3.5, GPT-4, o1 | 仅解码器 (自回归) | 175B ~ 1.8T+ | 全能王,强大的生成、对话、推理能力,第一次让世界见识到LLM的涌现能力。 |
| BERT | BERT-Base, BERT-Large | 仅编码器 (自编码) | 110M ~ 340M | 理解王,在问答、情感分析、命名实体识别等自然语言理解任务上统治了很长时间。 |
| T5 | T5-Base, T5-Large | 编码器-解码器 | 220M ~ 11B | 统一框架,将所有自然语言处理任务都转换为“文本到文本”格式,非常灵活。 |
| LLaMA | LLaMA, LLaMA 2, LLaMA 3 | 仅解码器 (自回归) | 7B ~ 405B | 开源标杆,性能出色,且开源了不同规模(7B, 13B, 70B,405B),极大地推动了开源社区的发展。 |
| 其他 | PaLM, Gemini (Google), Claude (Anthropic), 文心一言 (Baidu), 通义千问 (Alibaba) | 多为仅解码器 | 大多数百亿到万亿 | 各家巨头的旗舰产品,各具特色(如Claude强调安全和诚实,Gemini强调多模态)。 |
核心技术:预训练的支柱
- Transformer架构: 几乎所有现代预训练语言模型的基础,其核心是自注意力机制,允许模型在处理一个词时,以不同的权重关注句子中其他所有词,从而捕捉长距离依赖关系。
- 大规模数据与计算: 没有海量数据(如从互联网爬取的Common Crawl, 书籍, 维基百科)和强大的计算资源(成千上万的GPU/TPU, 训练数周或数月),就不可能成功。
- 缩放定律(Scaling Laws): 理论和实践都表明,模型性能会随模型大小、数据量和计算量的增加而可预测地提升,这驱动了模型越来越大,数据越来越多。
- 涌现能力: 当模型规模达到某个临界点时,模型会展现出在更小模型上完全不存在的能力,如指令遵循、数学推理、代码生成、和人类进行复杂对话等。
主要应用:预训练语言模型能做什么?
- 文本生成: 写作、写诗、写代码、写邮件、故事创作、对话系统(ChatGPT的本质)。
- 自然语言理解:
- 文本分类: 情感分析(正面/负面)、主题分类。
- 信息抽取: 命名实体识别(识别人名、地名、组织名)、关系抽取。
- 问答系统: 基于给定文本回答用户问题。
- 机器翻译: 将一种语言翻译成另一种语言。
- 文本摘要: 自动生成文章或文档的摘要。
- 代码生成与理解: 如GitHub Copilot、Codex。
- 多模态应用: 最新的预训练语言模型(如GPT-4V, Gemini)已扩展为能同时处理文本、图像、音频、视频。
挑战与局限
- 计算资源与能耗: 训练和部署大模型需要极高的成本和能源消耗。
- 数据偏见与毒性: 训练数据来自互联网,不可避免地包含社会偏见(如性别、种族歧视)和有害内容(如仇恨言论)。
- 事实错误(幻觉): 模型可能会自信地生成看似合理但却是虚假的信息。
- 缺乏真正理解: 模型是基于统计模式工作,而非像人类那样的因果推理和真实世界理解。
预训练语言模型是当代人工智能,尤其是自然语言处理领域最基础、最重要的技术范式,它让机器从“学习特定任务”转向了“学习通用语言能力”,再通过少量数据适配具体任务,从早期的词向量到如今像GPT-4这样能进行复杂推理的超级模型,预训练语言模型已经深刻地改变了我们与计算机交互的方式,并正在成为新的技术基础设施。