本文目录导读:

Transformer 变体是指在原始 Transformer 架构(2017 年由 Vaswani 等人提出)的基础上,针对特定任务、计算效率、长序列处理或不同类型数据(如图像、语音)进行改进和演进而产生的模型。
以下是对主要 Transformer 变体的系统性分类与详解:
核心架构改进型
这类变体直接更改了 Transformer 的核心组件(如自注意力机制),以解决其根本性的问题。
-
XLNet:
- 核心改进:排列语言模型,它解决了 BERT 中
[MASK]标记在预训练和微调之间不一致的问题。 - 机制:通过随机排列输入序列的顺序,使模型能像自回归模型(从左到右)那样学习双向上下文,同时避免了自编码模型(如 BERT)的独立性假设。
- 优势:在多项 NLP 基准测试中优于 BERT。
- 核心改进:排列语言模型,它解决了 BERT 中
-
Longformer 与 BigBird:
- 核心改进:稀疏注意力机制,标准 Transformer 的注意力是 $O(n^2)$ 复杂度,无法处理长文本。
- 机制:
- Longformer:将完整注意力替换为滑动窗口注意力 + 全局注意力(用于少数特殊标记,如
[CLS])。 - BigBird:结合了滑动窗口 + 随机注意力 + 全局注意力。
- Longformer:将完整注意力替换为滑动窗口注意力 + 全局注意力(用于少数特殊标记,如
- 优势:能将输入长度扩展到数千甚至上万 tokens(如处理整本书或医学文档)。
-
Reformer:
- 核心改进:LSH(局部敏感哈希)注意力,同样为了解决 $O(n^2)$ 复杂度。
- 机制:通过哈希函数将相似的查询(Query)和键(Key)分到同一个桶中,只在桶内计算注意力。
- 优势:内存消耗从 $O(n^2)$ 降至 $O(n \log n)$,同时保持了不错的模型质量。
-
Linformer:
- 核心改进:线性注意力。
- 机制:利用低秩近似将原始注意力矩阵分解,将 $n \times n$ 矩阵转化为两个低维矩阵的乘积,将复杂度降至 $O(n)$。
- 优势:理论复杂度最低,适合超长序列。
预训练策略优化型
这类变体通过改变预训练目标或增加额外的任务,来提升模型对语言的理解能力。
-
BERT(Bidirectional Encoder Representations from Transformers):
- 核心改进:Masked Language Model (MLM) 和 Next Sentence Prediction (NSP)。
- 机制:随机遮蔽 15% 的输入 token,让模型基于双向上下文预测它。
- 影响:开创了 “预训练 + 微调” 范式,但属于 Encoder-only 模型。
-
RoBERTa:
- 核心改进:优化 BERT 的预训练。
- 机制:
- 训练更久(更多数据、更大 batch size)。
- 移除 NSP 任务。
- 使用动态 Masking(每次输入序列时随机遮蔽不同 token)。
- 优势:证明 BERT 原本的预训练策略并非最优,简单改进即可大幅提升性能。
-
ALBERT:
- 核心改进:参数共享 和 句子顺序预测 (SOP)。
- 机制:
- 跨层共享所有参数(大幅减少参数量)。
- 用 SOP 替换 NSP(SOP 预测两个句子的顺序,难度更高)。
- 优势:以更少的参数量达到接近 BERT 的性能。
-
ELECTRA:
- 核心改进:判别式预训练。
- 机制:替换 Token 检测 (RTD),用一个小生成器网络替换输入中的一些 token,然后训练一个判别器来识别哪些 token 是被替换过的。
- 优势:计算效率远高于 BERT(学习所有 token 而非仅 15% 的 masked token)。
生成任务优化型
这类变体专注于自回归生成,是当前大语言模型(如 GPT)的基础。
-
GPT 系列(GPT-1, 2, 3, 4, etc.):
- 核心改进:Decoder-only 架构 + 自回归生成。
- 机制:使用因果掩码(Causal Mask),确保每个 token 只能关注其左侧的 token,通过极大扩展模型参数和数据量,展现出强大的涌现能力(如上下文学习、指令跟随)。
- 优势:强大的语言生成能力,是生成式 AI 的基石。
-
T5(Text-to-Text Transfer Transformer):
- 核心改进:统一的文本到文本框架。
- 机制:所有 NLP 任务(翻译、分类、摘要等)都转化为 “输入文本 -> 输出文本” 的形式,使用 Encoder-Decoder 架构。
- 优势:统一了研究范式,便于迁移学习。
跨模态适配型
这类变体将 Transformer 应用到图像、视频、语音等领域。
-
ViT(Vision Transformer):
- 核心改进:将图像分割为图像块(Patch)。
- 机制:将一幅图像裁剪为固定大小的正方形小块(如 16x16 像素),将这些小块拉平后作为 token 序列输入标准 Transformer。
- 影响:证明纯 Transformer 无需 CNN 即可在图像分类任务上达到一流水平。
-
Swin Transformer:
- 核心改进:移动窗口注意力。
- 机制:在局部窗口内计算自注意力,并在连续层之间移动窗口以实现跨窗口信息交互。
- 优势:计算复杂度与图像大小成线性关系,适合作为图像分割、目标检测的通用骨干网络。
-
DETR(Detection Transformer):
- 核心改进:端到端目标检测。
- 机制:将目标检测视为一个集合预测问题,直接输出一组对象(类别 + 边界框),无需传统的锚框或非极大值抑制(NMS)等后处理。
高效推理与压缩型
这类变体专注于减小模型大小、提高推理速度,以便在边缘设备或低延迟场景下使用。
-
DistilBERT:
- 核心改进:知识蒸馏。
- 机制:训练一个较小的学生模型(学生)来模仿一个大的教师模型(如 BERT-base)的行为,保留 97% 的性能但减小 40% 大小并提速 60%。
-
MobileBERT:
- 核心改进:瓶颈结构,通过精心设计的深度可分离卷积和窄瓶颈结构,专为移动端和低延迟环境设计。
总结与趋势
- 效率至上:稀疏注意力(Longformer, BigBird)、线性复杂度(Linformer)和模型蒸馏是主流方向。
- 从 NLP 到多模态:ViT 和 Swin Transformer 宣示 Transformer 成为视觉领域的通用架构。
- Decoder-only 的崛起:受 GPT 系列的成功影响,当前大模型几乎都采用 Decoder-only 架构(如 LLaMA, Mistral, Claude, Gemini)。
- 混合架构:最新的趋势是在 Transformer 中引入状态空间模型 (SSM),Mamba 和 Jamba,试图在注意力机制的高效与长距离依赖之间找到新平衡,这对处理超长序列(如数十万 tokens)至关重要。
| 变体类型 | 代表模型 | 核心思想 | 主要优势 |
|---|---|---|---|
| 架构改进 | XLNet | 排列语言模型 | 解决 BERT 的独立性假设 |
| 长序列 | Longformer | 稀疏注意力 (滑动窗口) | 支持万级 token 输入 |
| 预训练优化 | RoBERTa | 动态 masking + 移除 NSP | 更优的预训练策略 |
| 生成模型 | GPT-3/4 | 自回归 Decoder-only | 强大的涌现能力 |
| 跨模态 | ViT | 图像块序列化 | 视觉领域的 Transformer 基础 |
| 高效推理 | DistilBERT | 知识蒸馏 | 40% 体积,60% 速度,97% 性能 |