预训练语言模型

wen IT资讯 23

本文目录导读:

预训练语言模型

  1. 核心概念:什么是预训练语言模型?
  2. 发展历程:从词向量到大型语言模型
  3. 工作原理:它到底在学什么?
  4. 著名模型速览(截至2024年底)
  5. 核心技术:预训练的支柱
  6. 主要应用:预训练语言模型能做什么?
  7. 挑战与局限

这是一个非常核心且重要的话题,我们来系统地梳理一下预训练语言模型。

核心概念:什么是预训练语言模型?

预训练语言模型 是一种通过在海量、无标注的文本数据上学习,从而掌握通用语言知识和能力的深度学习模型。

可以把它想象成一个“通才”学生:

  • 预训练(Pre-training): 这个学生先读完了全世界的图书馆(海量无标注数据),虽然没有老师给他具体考题(无监督学习),但他通过“上下文猜词”这类练习,学会了语法、词汇、逻辑、常识等所有基础知识。
  • 微调(Fine-tuning): 之后,针对一个特定任务(比如写诗、写代码、分类新闻),只需要给他少量、具体的高质量示例,他就能迅速把之前学到的通用知识转化为解决这个问题的专业能力。

关键点: 它不依赖人工标注数据,而是直接从原始文本中学习。

发展历程:从词向量到大型语言模型

  1. 词向量时代(静态模型):Word2Vec, GloVe

    • 特点: 将一个词映射成一个固定的向量,词“苹果”只有一个向量,无法区分“我要吃苹果”和“我要买苹果手机”中的不同含义。
    • 局限: 无法处理一词多义
  2. 上下文表示时代(动态模型):ELMo

    • 特点: 模型根据上下文动态生成词向量。“苹果”在“吃”和“手机”前的向量会不同,解决了多义词问题。
  3. Transformer与自回归/自编码时代:

    • GPT系列(自回归模型): 使用Transformer的解码器,任务是从左到右预测下一个词,擅长生成
    • BERT(自编码模型): 使用Transformer的编码器,任务是完形填空(随机遮盖15%的词来预测),擅长理解(分类、命名实体识别等)。
  4. 大语言模型时代(LLMs):规模即力量

    • 代表: GPT-3、PaLM、LLaMA、GPT-4、Claude、Gemini。
    • 特点: 模型参数规模巨大(从百亿到万亿),训练数据量史诗级,在达到一定规模后,涌现出涌现能力,如上下文学习、思维链推理等,无需微调就能处理复杂任务。

工作原理:它到底在学什么?

预训练语言模型的核心学习任务通常是语言建模,主要有两种形式:

  1. 自回归语言模型(Autoregressive,如GPT): 给定前文,预测下一个词的概率,输入“今天天气真”,模型预测下一个最可能的词是“好”、“棒”、“不错”等。

    目标和损失函数:最大化整个序列出现的概率(最大似然估计)。

  2. 自编码语言模型(Autoencoding,如BERT): 将输入文本随机遮盖掉一些词(用 [MASK] 标记),然后让模型预测被遮盖的词,输入“今天天气真 [MASK]”,模型预测 [MASK] 位置应该是“好”。

    目标和损失函数:最小化预测词与真实词之间的差距(交叉熵损失)。

核心规律:模型通过这种“猜词游戏”来学习

  • 语法: “我今天去 了 学校”,“了”常跟在动词后。
  • 语义: “苹果”常与“吃”、“水果”、“甜”等词共现。
  • 上下文: “汤姆打了破窗户,因此他 ___ 。”模型会学习到结果是“被惩罚”或“感到抱歉”。
  • 世界知识: “中国、法国、美国这样的词可以被称为 国家”。

著名模型速览(截至2024年底)

家族 代表模型 架构 参数量 特点与擅长领域
GPT GPT-3, GPT-3.5, GPT-4, o1 仅解码器 (自回归) 175B ~ 1.8T+ 全能王,强大的生成、对话、推理能力,第一次让世界见识到LLM的涌现能力。
BERT BERT-Base, BERT-Large 仅编码器 (自编码) 110M ~ 340M 理解王,在问答、情感分析、命名实体识别等自然语言理解任务上统治了很长时间。
T5 T5-Base, T5-Large 编码器-解码器 220M ~ 11B 统一框架,将所有自然语言处理任务都转换为“文本到文本”格式,非常灵活。
LLaMA LLaMA, LLaMA 2, LLaMA 3 仅解码器 (自回归) 7B ~ 405B 开源标杆,性能出色,且开源了不同规模(7B, 13B, 70B,405B),极大地推动了开源社区的发展。
其他 PaLM, Gemini (Google), Claude (Anthropic), 文心一言 (Baidu), 通义千问 (Alibaba) 多为仅解码器 大多数百亿到万亿 各家巨头的旗舰产品,各具特色(如Claude强调安全和诚实,Gemini强调多模态)。

核心技术:预训练的支柱

  1. Transformer架构: 几乎所有现代预训练语言模型的基础,其核心是自注意力机制,允许模型在处理一个词时,以不同的权重关注句子中其他所有词,从而捕捉长距离依赖关系。
  2. 大规模数据与计算: 没有海量数据(如从互联网爬取的Common Crawl, 书籍, 维基百科)和强大的计算资源(成千上万的GPU/TPU, 训练数周或数月),就不可能成功。
  3. 缩放定律(Scaling Laws): 理论和实践都表明,模型性能会随模型大小、数据量和计算量的增加而可预测地提升,这驱动了模型越来越大,数据越来越多。
  4. 涌现能力: 当模型规模达到某个临界点时,模型会展现出在更小模型上完全不存在的能力,如指令遵循、数学推理、代码生成、和人类进行复杂对话等。

主要应用:预训练语言模型能做什么?

  1. 文本生成: 写作、写诗、写代码、写邮件、故事创作、对话系统(ChatGPT的本质)。
  2. 自然语言理解:
    • 文本分类: 情感分析(正面/负面)、主题分类。
    • 信息抽取: 命名实体识别(识别人名、地名、组织名)、关系抽取。
    • 问答系统: 基于给定文本回答用户问题。
  3. 机器翻译: 将一种语言翻译成另一种语言。
  4. 文本摘要: 自动生成文章或文档的摘要。
  5. 代码生成与理解: 如GitHub Copilot、Codex。
  6. 多模态应用: 最新的预训练语言模型(如GPT-4V, Gemini)已扩展为能同时处理文本、图像、音频、视频。

挑战与局限

  • 计算资源与能耗: 训练和部署大模型需要极高的成本和能源消耗。
  • 数据偏见与毒性: 训练数据来自互联网,不可避免地包含社会偏见(如性别、种族歧视)和有害内容(如仇恨言论)。
  • 事实错误(幻觉): 模型可能会自信地生成看似合理但却是虚假的信息。
  • 缺乏真正理解: 模型是基于统计模式工作,而非像人类那样的因果推理和真实世界理解。

预训练语言模型是当代人工智能,尤其是自然语言处理领域最基础、最重要的技术范式,它让机器从“学习特定任务”转向了“学习通用语言能力”,再通过少量数据适配具体任务,从早期的词向量到如今像GPT-4这样能进行复杂推理的超级模型,预训练语言模型已经深刻地改变了我们与计算机交互的方式,并正在成为新的技术基础设施。

上一篇Prompt Engineering

下一篇微调策略

抱歉,评论功能暂时关闭!