Transformer变体

wen IT资讯 30

本文目录导读:

Transformer变体

  1. 核心架构改进型
  2. 预训练策略优化型
  3. 生成任务优化型
  4. 跨模态适配型
  5. 高效推理与压缩型
  6. 总结与趋势

Transformer 变体是指在原始 Transformer 架构(2017 年由 Vaswani 等人提出)的基础上,针对特定任务、计算效率、长序列处理或不同类型数据(如图像、语音)进行改进和演进而产生的模型。

以下是对主要 Transformer 变体的系统性分类与详解:

核心架构改进型

这类变体直接更改了 Transformer 的核心组件(如自注意力机制),以解决其根本性的问题。

  • XLNet

    • 核心改进排列语言模型,它解决了 BERT 中 [MASK] 标记在预训练和微调之间不一致的问题。
    • 机制:通过随机排列输入序列的顺序,使模型能像自回归模型(从左到右)那样学习双向上下文,同时避免了自编码模型(如 BERT)的独立性假设。
    • 优势:在多项 NLP 基准测试中优于 BERT。
  • LongformerBigBird

    • 核心改进稀疏注意力机制,标准 Transformer 的注意力是 $O(n^2)$ 复杂度,无法处理长文本。
    • 机制
      • Longformer:将完整注意力替换为滑动窗口注意力 + 全局注意力(用于少数特殊标记,如 [CLS])。
      • BigBird:结合了滑动窗口 + 随机注意力 + 全局注意力
    • 优势:能将输入长度扩展到数千甚至上万 tokens(如处理整本书或医学文档)。
  • Reformer

    • 核心改进LSH(局部敏感哈希)注意力,同样为了解决 $O(n^2)$ 复杂度。
    • 机制:通过哈希函数将相似的查询(Query)和键(Key)分到同一个桶中,只在桶内计算注意力。
    • 优势:内存消耗从 $O(n^2)$ 降至 $O(n \log n)$,同时保持了不错的模型质量。
  • Linformer

    • 核心改进线性注意力
    • 机制:利用低秩近似将原始注意力矩阵分解,将 $n \times n$ 矩阵转化为两个低维矩阵的乘积,将复杂度降至 $O(n)$。
    • 优势:理论复杂度最低,适合超长序列。

预训练策略优化型

这类变体通过改变预训练目标或增加额外的任务,来提升模型对语言的理解能力。

  • BERT(Bidirectional Encoder Representations from Transformers):

    • 核心改进Masked Language Model (MLM)Next Sentence Prediction (NSP)
    • 机制:随机遮蔽 15% 的输入 token,让模型基于双向上下文预测它。
    • 影响:开创了 “预训练 + 微调” 范式,但属于 Encoder-only 模型。
  • RoBERTa

    • 核心改进优化 BERT 的预训练
    • 机制
      1. 训练更久(更多数据、更大 batch size)。
      2. 移除 NSP 任务。
      3. 使用动态 Masking(每次输入序列时随机遮蔽不同 token)。
    • 优势:证明 BERT 原本的预训练策略并非最优,简单改进即可大幅提升性能。
  • ALBERT

    • 核心改进参数共享句子顺序预测 (SOP)
    • 机制
      1. 跨层共享所有参数(大幅减少参数量)。
      2. 用 SOP 替换 NSP(SOP 预测两个句子的顺序,难度更高)。
    • 优势:以更少的参数量达到接近 BERT 的性能。
  • ELECTRA

    • 核心改进判别式预训练
    • 机制替换 Token 检测 (RTD),用一个小生成器网络替换输入中的一些 token,然后训练一个判别器来识别哪些 token 是被替换过的。
    • 优势:计算效率远高于 BERT(学习所有 token 而非仅 15% 的 masked token)。

生成任务优化型

这类变体专注于自回归生成,是当前大语言模型(如 GPT)的基础。

  • GPT 系列(GPT-1, 2, 3, 4, etc.)

    • 核心改进Decoder-only 架构 + 自回归生成
    • 机制:使用因果掩码(Causal Mask),确保每个 token 只能关注其左侧的 token,通过极大扩展模型参数和数据量,展现出强大的涌现能力(如上下文学习、指令跟随)。
    • 优势:强大的语言生成能力,是生成式 AI 的基石。
  • T5(Text-to-Text Transfer Transformer):

    • 核心改进统一的文本到文本框架
    • 机制:所有 NLP 任务(翻译、分类、摘要等)都转化为 “输入文本 -> 输出文本” 的形式,使用 Encoder-Decoder 架构。
    • 优势:统一了研究范式,便于迁移学习。

跨模态适配型

这类变体将 Transformer 应用到图像、视频、语音等领域。

  • ViT(Vision Transformer):

    • 核心改进将图像分割为图像块(Patch)
    • 机制:将一幅图像裁剪为固定大小的正方形小块(如 16x16 像素),将这些小块拉平后作为 token 序列输入标准 Transformer。
    • 影响:证明纯 Transformer 无需 CNN 即可在图像分类任务上达到一流水平。
  • Swin Transformer

    • 核心改进移动窗口注意力
    • 机制:在局部窗口内计算自注意力,并在连续层之间移动窗口以实现跨窗口信息交互。
    • 优势:计算复杂度与图像大小成线性关系,适合作为图像分割、目标检测的通用骨干网络。
  • DETR(Detection Transformer):

    • 核心改进端到端目标检测
    • 机制:将目标检测视为一个集合预测问题,直接输出一组对象(类别 + 边界框),无需传统的锚框或非极大值抑制(NMS)等后处理。

高效推理与压缩型

这类变体专注于减小模型大小、提高推理速度,以便在边缘设备或低延迟场景下使用。

  • DistilBERT

    • 核心改进知识蒸馏
    • 机制:训练一个较小的学生模型(学生)来模仿一个大的教师模型(如 BERT-base)的行为,保留 97% 的性能但减小 40% 大小并提速 60%。
  • MobileBERT

    • 核心改进瓶颈结构,通过精心设计的深度可分离卷积和窄瓶颈结构,专为移动端和低延迟环境设计。

总结与趋势

  1. 效率至上:稀疏注意力(Longformer, BigBird)、线性复杂度(Linformer)和模型蒸馏是主流方向。
  2. 从 NLP 到多模态:ViT 和 Swin Transformer 宣示 Transformer 成为视觉领域的通用架构。
  3. Decoder-only 的崛起:受 GPT 系列的成功影响,当前大模型几乎都采用 Decoder-only 架构(如 LLaMA, Mistral, Claude, Gemini)。
  4. 混合架构:最新的趋势是在 Transformer 中引入状态空间模型 (SSM)MambaJamba,试图在注意力机制的高效与长距离依赖之间找到新平衡,这对处理超长序列(如数十万 tokens)至关重要。
变体类型 代表模型 核心思想 主要优势
架构改进 XLNet 排列语言模型 解决 BERT 的独立性假设
长序列 Longformer 稀疏注意力 (滑动窗口) 支持万级 token 输入
预训练优化 RoBERTa 动态 masking + 移除 NSP 更优的预训练策略
生成模型 GPT-3/4 自回归 Decoder-only 强大的涌现能力
跨模态 ViT 图像块序列化 视觉领域的 Transformer 基础
高效推理 DistilBERT 知识蒸馏 40% 体积,60% 速度,97% 性能

抱歉,评论功能暂时关闭!