从零手写大模型
从理解模型如何推理,到学习模型如何训练。
推理篇
已完结 · 15 篇 · 从模型结构到文本生成与可解释性
- 01LLM From Scratch(从零手写大模型)
- 02Tokenizer(分词器)
- 03Embedding(嵌入层)
- 04Positional Encoding(位置编码)
- 05Self-Attention(自注意力机制)
- 06Multi-Head Attention(多头注意力机制)
- 07Residual Connection(残差连接)
- 08LayerNorm(层归一化)
- 09FFN(前馈神经网络)
- 10Activation Function(激活函数)
- 11Transformer Block(Transformer 模块)
- 12Transformer Stack(Transformer 堆叠)
- 13Loading Pretrained Weights(加载预训练权重)
- 14Text Generation(文本生成)
- 15Interpretability(可解释性 · 完结篇)
训练篇
已完结 · 共 5 篇 · 从损失函数到学习率调度