趋近智

APX AI

在线

我可以读取您正在浏览的页面。随时向我提问！

Transformer模型解析 | AI课程

所有课程

Transformer模型入门

章节 1: 序列建模与注意力机制基础

序列到序列任务的挑战

回顾：循环神经网络 (RNN)

传统循环神经网络方法的局限性

注意力机制原理介绍

注意力分数计算：一个宏观视角

来自注意力权重的上下文向量

第 1 章测验

章节 2: 自注意力与多头注意力

自注意力的原理

自注意力机制中的查询、键和值向量

缩放点积注意力机制

自注意力得分可视化

多头注意力简介

多头注意力机制如何运作

多头注意力机制的优势

动手实践：实现缩放点积注意力

第 2 章测验

章节 3: Transformer 编码器-解码器架构

整体架构概览

输入嵌入层

位置信息的必要性

位置编码说明

编码器层堆叠

加法与归一化层 (残差连接)

逐位置前馈网络

解码器堆栈

带掩码的多头自注意力

编码器-解码器注意力机制

最终线性层和Softmax

动手实践：构建编码器层

第 3 章测验

章节 4: Transformer模型的训练与实现

数据准备：分词

构建输入批次

序列任务的损失函数

正则化方法

基本实现概述

使用预训练模型库（简述）

实践：组装一个基本Transformer

第 4 章测验

Transformer模型入门

理解Transformer模型的根本构架与运作方式。本课程涵盖注意力机制 (attention mechanism)、编码器-解码器结构，以及其在自然语言处理方面取得顶尖成果的核心要素。

先修课程 机器学习与Python要点

级别:

专业级

可获证书:

结业

注意力机制
阐述注意力的含义，并区分不同的注意力机制。
自注意力
说明自注意力如何让模型评估序列中不同词语的重要性。
Transformer构架
概述Transformer模型的组成部分，包括编码器和解码器堆叠。
多头注意力
理解多头注意力的原理及实现方法。
位置编码
阐明引入序列顺序信息的必要性及具体做法。
初步实现
使用深度学习框架实现Transformer构架的核心构成。

© 2026 ApX Machine Learning