
作品简介
内容简介
这是一本系统剖析DeepSeek系列大模型技术体系与实践路径的专著。本书立足于作者在大模型研发一线的深厚积累,结合深度学习、强化学习、分布式系统与模型优化等多领域知识,全面阐述 DeepSeek在模型架构、训练推理、基础设施及数据工程等方面的核心突破与工程实践。全书兼具理论严谨性与实践指导性,旨在帮助AI研究者、工程师和技术决策者深入理解当代大模型的关键技术,掌握高效、低成本构建和部署先进AI系统的方法。
本书分为两部分。
第一部分 DeepSeek学习前置知识(第15章)??11章)??
从DeepSeek的模型概述和重要突破切入,系统介绍经典Transformer架构、强化学习基础、大语言模型中的RLHF和量化技术,以及分布式训练的基础知识,为读者奠定坚实的理论和技术基础。
第二部分 DeepSeek核心技术(第6
首先,深入解析DeepSeek的模型架构创新,包括 MoE、MLA与分词器设计,探讨跨模态对齐、负载均衡、基础设施优化及数据处理等关键议题,揭示其在高性能、低资源消耗背后的系统级工程实现。
然后,聚焦DeepSeek V3、VL2及开源推理模型的训练逻辑、推理及优化,涵盖训练策略、超参数设计、数据构建以及Prefill、Decode等推理阶段的深度优化,为构建高效、可扩展的AI系统提供完整方法论和实战参考。
本书不仅透彻解读技术报告,更重视将前沿理论与工业实践相结合,帮助读者理解AI系统构建的本质规律与发展趋势,为学术界和工业界提供了一条清晰、可复现的高效能人工智能研发路径。
出版社机械工业出版社
出版时间2025-11-01
ISBN9787111792284
共 3 章
前言
第一部分DeepSeek学习前置知识
第二部分DeepSeek核心技术
