作品简介
本书是一本从工程化角度讲解大语言模型的核心技术、构建方法与前沿应用的著作。
首先从语言模型的原理和大模型的基础构件入手,详细梳理了大模型技术的发展脉络,深入探讨了大模型预训练与对齐的方法;然后阐明了大模型训练中的算法设计、数据处理和分布式训练的核心原理,展示了这一系统性工程的复杂性与实现路径。
除了基座模型的训练方案,本书还涵盖了大模型在各领域的落地应用方法,包括低参数量微调、知识融合、工具使用和自主智能体等,展示了大模型在提高生产力和创造性任务中的卓越性能和创新潜力。
无论是人工智能领域的研究员、工程师,还是对前沿技术充满好奇的读者,本书都将是您了解和掌握大模型技术的必备指南。
出版时间2024-09-01
共 11 章
前言试读
第1章 语言模型简介试读
第2章 大模型网络结构
第3章 大模型学习范式的演进
第4章 大模型对齐训练
第5章 大模型评测与数据集
第6章 分布式训练与内存优化
第7章 大模型的垂直场景适配方案
第8章 知识融合与工具使用
第9章 大模型的进阶优化
第10章 大模型的局限性与未来发展方向

