模型架构

按模型架构来分类,现在主流LLM基本可以分为几大类。

Dense 稠密模型

这是最经典、也是目前仍然大量存在的架构。特点:

输入 Token


 ┌─────────────┐
 │ 所有层全部计算 │
 └─────────────┘


    输出

优点:推理简单、GPU 利用率高、微调方便(LoRA等)。

缺点:参数越大,计算量线形增加。推理成本很高。

MoE 专家混合

MoE 是 Mixture of Experts 专家混合。

核心思想:模型有很多专家,但每次只调用少数几个。

256 个专家

Token 1

 Router

 Expert 5
 Expert 89
 Expert 173

其它 253 个专家完全不计算

经常看到

Qwen3.6-35B-A3B
35B = 总参数
A3B = Active Parameters

也就是说,总共有 35B 真正推理 只算 3B。

MoE 的优势:

缺点:

Hybird 混合架构

很多最新模型已经不是纯 Transformer。

Attention
+
MoE
+
Mamba
+
其它模块

混合架构就是把不同模块组合起来,各取所长。

SSM(State Space Model)

近年来最火的非 Transformer 架构。

代表: Mamba

核心思想:不用 Attention。而是维护一个连续状态:

输入

State

State

State

输出

优点:

缺点:

Transformer 经典 Attention

严格来说,Dense 和 MoE 大多仍然属于 Transformer 家族。

Embedding

Attention

MLP

Attention

MLP

几乎所有 GPT 都是这个路线。

Transformer + MoE

这是目前开源模型最流行的组合。把 Transformer 里的 FFN(MLP)替换成专家网络。

原来

Attention

MLP

现在

Attention

Router

Expert1
Expert2
Expert3

实际上 Attention 通常还是 Dense,只是 FFN 变成了 MoE。

Transformer + Linear Attention

传统 Attention

O(n²)

上下文越长越慢,于是出现

O(n)

长上下文优势明显。

Transformer + MLA

这是 DeepSeek 提出的 Multi-head Latent Attention(MLA)。

目的不是替代 Attention,而是减少 KV Cache。

普通 Attention:

Q
K
V

每层都保存 K/V。

MLA:

Q

Latent Space

恢复 K/V

显著降低显存占用,因此 DeepSeek 能支持超长上下文且推理成本更低。

Encoder-Decoder

结构

Encoder

Decoder

现在做聊天的大模型很少使用。

Decoder Only

Decoder Only(目前绝对主流)

GPT 系列都是:

Token

Decoder

Decoder

Decoder

当前 2026 主流架构趋势

架构 是否主流 特点
Dense Transformer ⭐⭐⭐⭐ 简单、稳定、易训练
Sparse MoE ⭐⭐⭐⭐⭐ 当前最热门,大模型首选
Hybrid(Attention + MoE + Mamba 等) ⭐⭐⭐⭐⭐ 最新趋势,融合多种模块
Mamba / SSM ⭐⭐⭐ 长上下文、高效率,但生态仍在发展
Linear Attention ⭐⭐⭐ 长上下文潜力大,逐步进入主流
MLA ⭐⭐⭐⭐ 降低 KV Cache,提升长上下文效率
Encoder-Decoder ⭐⭐ 更多用于翻译、摘要等任务
Decoder Only ⭐⭐⭐⭐⭐ 聊天、代码、推理模型的事实标准