注意力机制
共 4 篇文章
Transformer 深度进阶:从矩阵视角到 FlashAttention 工程优化
以通俗视角深入解析 Transformer 注意力机制的数学本质、工程实现与 FlashAttention 优化,助力理解大模型核心原理。
Transformer 注意力机制:小白也能看懂的通俗指南
用生活化比喻和通俗语言,深入浅出讲解 Transformer 注意力机制、QKV、Self-Attention、Multi-Head、计算瓶颈与 FlashAttention 工程优化,适合入门和进阶读者。
GP
GPT完全指南(二):架构深度解析
深入剖析GPT的Decoder-only Transformer架构,包括注意力机制、位置编码、LayerNorm等核心组件
深度
深度学习完全指南(六):Transformer架构详解
从注意力机制到完整Transformer,深入理解这个改变NLP和CV的革命性架构