ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

MLP / Feed-Forward Network

MLP / Feed-Forward Network MLP / Feed-Forward Network第78-92行class MLP(nn.Module):def __init__(self, config):super().__init__()# 输入投影C → 4Cself.c_fc nn.Linear(config.n_embd, 4 * config.n_embd, biasconfig.bias)self.gelu nn.GELU() # 激活函数# 输出投影4C → Cself.c_proj nn.Linear(4 * config.n_embd, config.n_embd, biasconfig.bias)self.dropout nn.Dropout(config.dropout)def forward(self, x):x self.c_fc(x) # [B, T, C] → [B, T, 4C]x self.gelu(x) # GELU 激活x self.c_proj(x) # [B, T, 4C] → [B, T, C]x self.dropout(x)return x作用逐位置处理每个 token 独立变换为什么是 4 倍- GPT-2 论文中的标准设置- 扩大容量后再压缩学习更复杂的特征
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进