作品简介
全书分为3部分,共10章。首先,深入讲解模型格式、推理引擎、多GPU部署与嵌入生成技术;随后,围绕RAG系统构建、向量数据库、API接口封装、前端交互设计与私有化安全机制展开介绍;最后,通过项目案例,演示模型部署与知识库搭建的全流程。
读者可通过本书系统掌握LLaMA、Qwen、Baichuan等主流模型的部署方式,理解vLLM、TGI等推理引擎的性能调优手段,并掌握向量化表示、FAISS/Milvus索引构建及RAG问答系统的完整流程。
书中还特别强调私有部署中的安全合规、权限控制与攻击防御机制,并提供法律问答与企业助手两个实战案例,具备较强的可复用性与工程价值。
出版社清华大学出版社
出版时间2025-09-01
ISBN9787302700876
共 6 章
内容简介试读
作者简介试读
前言试读
第1部分 大模型私有化部署基础与技术生态试读
第2部分 大模型应用系统核心与性能优化
第3部分大模型平台落地与业务场景集成

