按模型架构来分类,现在主流LLM基本可以分为几大类。
这是最经典、也是目前仍然大量存在的架构。特点:
输入 Token
│
▼
┌─────────────┐
│ 所有层全部计算 │
└─────────────┘
│
▼
输出优点:推理简单、GPU 利用率高、微调方便(LoRA等)。
缺点:参数越大,计算量线形增加。推理成本很高。
MoE 是 Mixture of Experts 专家混合。
核心思想:模型有很多专家,但每次只调用少数几个。
256 个专家
Token 1
↓
Router
↓
Expert 5
Expert 89
Expert 173
其它 253 个专家完全不计算经常看到
Qwen3.6-35B-A3B
35B = 总参数
A3B = Active Parameters也就是说,总共有 35B 真正推理 只算 3B。
MoE 的优势:
缺点:
很多最新模型已经不是纯 Transformer。
Attention
+
MoE
+
Mamba
+
其它模块混合架构就是把不同模块组合起来,各取所长。
近年来最火的非 Transformer 架构。
代表: Mamba
核心思想:不用 Attention。而是维护一个连续状态:
输入
↓
State
↓
State
↓
State
↓
输出优点:
缺点:
严格来说,Dense 和 MoE 大多仍然属于 Transformer 家族。
Embedding
↓
Attention
↓
MLP
↓
Attention
↓
MLP几乎所有 GPT 都是这个路线。
这是目前开源模型最流行的组合。把 Transformer 里的 FFN(MLP)替换成专家网络。
原来
Attention
↓
MLP现在
Attention
↓
Router
↓
Expert1
Expert2
Expert3实际上 Attention 通常还是 Dense,只是 FFN 变成了 MoE。
传统 Attention
O(n²)上下文越长越慢,于是出现
O(n)长上下文优势明显。
这是 DeepSeek 提出的 Multi-head Latent Attention(MLA)。
目的不是替代 Attention,而是减少 KV Cache。
普通 Attention:
Q
K
V每层都保存 K/V。
MLA:
Q
↓
Latent Space
↓
恢复 K/V显著降低显存占用,因此 DeepSeek 能支持超长上下文且推理成本更低。
结构
Encoder
↓
Decoder现在做聊天的大模型很少使用。
Decoder Only(目前绝对主流)
GPT 系列都是:
Token
↓
Decoder
↓
Decoder
↓
Decoder| 架构 | 是否主流 | 特点 |
|---|---|---|
| Dense Transformer | ⭐⭐⭐⭐ | 简单、稳定、易训练 |
| Sparse MoE | ⭐⭐⭐⭐⭐ | 当前最热门,大模型首选 |
| Hybrid(Attention + MoE + Mamba 等) | ⭐⭐⭐⭐⭐ | 最新趋势,融合多种模块 |
| Mamba / SSM | ⭐⭐⭐ | 长上下文、高效率,但生态仍在发展 |
| Linear Attention | ⭐⭐⭐ | 长上下文潜力大,逐步进入主流 |
| MLA | ⭐⭐⭐⭐ | 降低 KV Cache,提升长上下文效率 |
| Encoder-Decoder | ⭐⭐ | 更多用于翻译、摘要等任务 |
| Decoder Only | ⭐⭐⭐⭐⭐ | 聊天、代码、推理模型的事实标准 |