Transformer
共 5 篇文章
Transformer 深度进阶:从矩阵视角到 FlashAttention 工程优化
以通俗视角深入解析 Transformer 注意力机制的数学本质、工程实现与 FlashAttention 优化,助力理解大模型核心原理。
GP
GPT完全指南(六):从零实现miniGPT
从零开始用PyTorch实现一个完整的GPT模型,包括分词器、模型架构、训练循环和文本生成的全部代码
GP
GPT完全指南(二):架构深度解析
深入剖析GPT的Decoder-only Transformer架构,包括注意力机制、位置编码、LayerNorm等核心组件
深度
深度学习完全指南(十):自然语言处理应用
从文本分类到机器翻译、问答系统,全面掌握NLP的核心技术与实战应用
深度
深度学习完全指南(六):Transformer架构详解
从注意力机制到完整Transformer,深入理解这个改变NLP和CV的革命性架构