作品简介
本书旨在引领读者从基础知识起步,逐步深入探索大模型的算法原理、训练方法及微调技术。
全书共12章,涵盖了Transformer模型的基础理论,如Seq2Seq模型、分词、嵌入层和自注意力机制等关键概念;并深入剖析了GPT模型的核心实现与文本生成过程,以及BERT模型的预训练和微调技术。同时,也对ViT(视觉Transformer)模型的架构、训练方法,以及高阶微调策略如Adapter Tuning和P-Tuning进行了详尽讲解。
此外,还系统地介绍了数据处理、数据增强、模型性能优化(包括混合精度训练和分布式训练)、对比学习、对抗训练、自适应优化器、动态学习率调度,以及模型蒸馏与剪枝技术等多个方面。最后,通过应用案例,展示了模型训练和微调的完整流程,助力读者将理论知识转化为实践技能。
出版时间2025-04-01
共 16 章
作者简介试读
内容简介试读
前言试读
引言试读
第1章 Transformer模型基础试读
第2章 GPT模型文本生成核心原理与实现
第3章 BERT模型核心实现与预训练
第4章 ViT模型
第5章 高阶微调策略:Adapter Tuning与P-Tuning
第6章 数据处理与数据增强
第7章 模型性能优化:混合精度训练与分布式训练
第8章 对比学习与对抗训练
第9章 自适应优化器与动态学习率调度
第10章 模型蒸馏与剪枝
第11章 模型训练实战
第12章 模型微调实战

