从零手写大模型

从理解模型如何推理,到学习模型如何训练。

推理篇

已完结 · 15 篇 · 从模型结构到文本生成与可解释性

  1. 01LLM From Scratch(从零手写大模型)
  2. 02Tokenizer(分词器)
  3. 03Embedding(嵌入层)
  4. 04Positional Encoding(位置编码)
  5. 05Self-Attention(自注意力机制)
  6. 06Multi-Head Attention(多头注意力机制)
  7. 07Residual Connection(残差连接)
  8. 08LayerNorm(层归一化)
  9. 09FFN(前馈神经网络)
  10. 10Activation Function(激活函数)
  11. 11Transformer Block(Transformer 模块)
  12. 12Transformer Stack(Transformer 堆叠)
  13. 13Loading Pretrained Weights(加载预训练权重)
  14. 14Text Generation(文本生成)
  15. 15Interpretability(可解释性 · 完结篇)

训练篇

已完结 · 共 5 篇 · 从损失函数到学习率调度

  1. 01Loss Function(损失函数)
  2. 02Backpropagation(反向传播)
  3. 03Gradient Descent(梯度下降)
  4. 04Adam Optimizer(Adam 优化器)
  5. 05Learning Rate Scheduling(学习率调度)