所有课程

LLM压缩与加速技术

章节 1: 大语言模型效率挑战：背景与基本原理

LLM的规模法则与计算成本

LLM推理中的内存带宽和计算瓶颈

实现效率的架构考量

评估LLM压缩与延迟的衡量标准

LLM 部署的硬件

压缩与加速的理论边界

章节 2: 进阶量化技术

量化基本原理回顾

训练后量化 (PTQ)

量化感知训练 (QAT)

混合精度量化策略

量化操作的硬件加速

评估量化大型语言模型的保真度与性能

实践操作：PTQ 和 QAT 的实现

章节 3: 高级剪枝方法

非结构化剪枝与结构化剪枝

移动剪枝与动态稀疏性

结构化剪枝技术

剪枝与量化的结合

编译器和运行时对稀疏操作的支持

评估剪枝对大型语言模型能力的影响

实践：应用结构化剪枝

章节 4: 大模型知识蒸馏

知识蒸馏的基本原理

自蒸馏与数据增强方法

任务专用蒸馏与任务通用蒸馏

将大型模型蒸馏成小型模型

生成模型蒸馏的难题

评估蒸馏模型性能

动手实践：生成式大型语言模型知识蒸馏

章节 5: 参数高效微调 (PEFT) 及适配

适配器模块

前缀微调、提示微调与P-Tuning

低秩适应（LoRA）

量化LoRA (QLoRA)

组合PEFT方法

PEFT技术性能分析

实践：使用LoRA和QLoRA进行微调

章节 6: 硬件加速与系统优化

将LLM操作映射到硬件架构

大型模型的内存管理技术

LLM层的优化算子

LLM的编译器优化

分布式推理策略

高级推理优化算法

大型语言模型在不同硬件上的性能基准测试

实践操作：使用运行时优化推理

章节 7: 综合优化策略与进阶内容

结合多种优化技术

神经网络架构搜索 (NAS) 面向高效大语言模型

条件计算与专家混合（MoE）

优化模型的持续学习

衡量对公平性和鲁棒性的影响

LLM 效率的研究前沿

实践：设计端到端优化流程

结合多种优化技术

全新 · 开源

Kerb - 大语言模型开发工具包

用于构建生产级 LLM 应用的 Python 工具包。提供提示词、RAG、智能体、结构化输出和多提供商支持等模块化实用工具。

这部分内容有帮助吗？

参考文献

QLoRA: Efficient Finetuning of Quantized LLMs, Tim Dettmers, Artidoro Pagnoni, Ari Holtzman, Luke Zettlemoyer, 2023 arXiv preprint arXiv:2305.14314 DOI: 10.48550/arXiv.2305.14314 - 介绍了QLoRA，一种结合4位量化和PEFT（LoRA）的高效LLM微调技术，直接涉及PEFT和量化的结合。
Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding, Song Han, Huizi Mao, William J. Dally, 2016 International Conference on Learning Representations (ICLR) DOI: 10.48550/arXiv.1510.00149 - 一篇基础性论文，介绍了一种三阶段流水线（剪枝、训练量化和霍夫曼编码），用于显著压缩深度神经网络，展示了结合多种技术的好处。
DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter, Victor Sanh, Lysandre Debut, Julien Chaumond, Thomas Wolf, 2019 5th Workshop on Energy Efficient Machine Learning and Cognitive Computing - NeurIPS 2019 DOI: 10.48550/arXiv.1910.01108 - 介绍了DistilBERT，一个通过知识蒸馏创建更小、更高效的大型语言模型的成功案例，同时保持了性能，说明了蒸馏在模型压缩中的作用。

© 2025 ApX Machine Learning用心打造