'deepseekDeeoSeek-V3技术报告DeepSeek-Alresearch@deepseek.com摘要日LZHZU由+Z0ZITDSJIPLS+61Z1ZX0我们推出了DepSek-V3,,这是一个强大的混合专家(MbE)语言模型,总参数为671日,每个token激活37B。为了实现高效推理和具有成本效益的训练,Seek-V3采用了多头潜在注意力(MLA)和DeepSeekMoE架构,这些架构在.DeepSeok-V3开创了一种辅助损失的负载平衡策略,并设定以实现更强的性能。我们在148万亿个样化和高质量的token上对Ded随后进行了监督微调和强化学习阶段,以充分发挥其能力。全面评估表明,DeepSeek-V3的表现优于其他开源模型,并且其性能可与领先的闭源模型相媲美。尽管表现出色,DeepSeek-V3的完整训练仅需2.788MH800GPU小时。此外,其训练过程非常稳定。在整个训练过程中,我们没有经历任何不可恢复的损失峰值,也没有进行任何回滚。模型检查点可在https://github.com/deepseek-ai/DeepSeek-V3|现名卧量
内容1引言42架构6678102.1基本架构2.1.1多头潜在注意力2.2多标记预测3基础设施113.1计算集群3.2训练框架3.2.1DualPipe和计算-通信重叠3.2.2跨节点全到全通信的高效实现3.2.3极低开销的极致内存节省3.3FP8训练3.3.1混合精度框架3.3.2量化和乘法带来的精度提升3.3.3低精度存储和通信3.4推理与部署3.4.1预填充3.4.2解码3.53.5.1通信硬件3.5.2计算硬件4预训练2222S2228824.1数据构建4.2超参数4.3长上下文扩展4.4评估4.4.1评估基准4.4.2评估结果4.5讨论4.5.1多标记预测的消融研究4.5.2辅助损失自由平衡策略的消融研究2
卤4.53批量负载平衡VS序列负载平衡275后训练288888888888苏苏85.1监督微调5.2强化学习5.2.1奖励模型5.2.2群体相对政策优化5.3评估5.3.1评估设置5.3.2标准评估5.3.3开放式评估5.3.4DeepSeek-V3作为生成奖励模型5.4讨论5.4.1从DeepSeek-R1蒸馏5.4.2自我奖励5.4.3多标记预测评估6结论、局限性和未来方向35A贡献与致谢45B低精度训练的消融研究47安子B.1FP8与BF16训练关干块级量化的讨论C专家专业化模式的16B辅助损失基础和无辅助损失模型48
1.引言近年来,大型语言模型(LLMs)正在经历快速的迭代和演变(Anthropic,2024;Google,2024OpenAl.2024a),逐渐缩小与人工通用智能(AG))之间的差距。除了闭源模型、开源模型,包括(DaepSeck-A,2024a.c; Guo etal, 2024),ILaMA系列(ANBMeta,2024ab2023a,b)、Qwen系列(Qwen,2023,2024a,b)和Mistral系列(Jiangeta,2023)步推动开源模型能力的边并推出DeenSeek-V3.这是一个具有671B参数的大型专家混合模型因此。在架构方面2024c)以实现高效推理,并采用推理的同时保持强大的模型性戏均衡而对模型性能-V3采用了多标记预测训练目标。我们观察到这增强了在评估基准上全面优化。低精度训练已成为高效1,2019;Narangetal, 2017;.2024;Micikevicius etal,2022;,并首次验证其在极大规模的有效性GPU内存使用。至于训冻框架,我们设计管道气泡、并通过计陈过程中隐藏了大部分通信,只要我们保持算-通信重叠恒定的计算与通信比率,我们仍然可以在节点之间使用细粒度专家同时实现接近零的全到全通信开销。此外,我们还开发了高效的跨节点全到全通信内核,以充分利用IntniBandIB)和NWLink带宽。此外我们还精心优化了内存占用,使得在不使用昂贵的张量并行的情况下训练DeepSeek-V3成为可能通过结合这些努力,我们实现了高训练效率。在预训练期间,我们在14.8T高质量和多样化的标记上训练DeepSeek-V3。预训练过程非常稳定。在整个训练过程中,我们没有遇到任何不可恢复的损失峰值,也不需要回滚。接下来,我们对DeepSeek-V3进行两阶段的上下文长度扩展。在第一阶段,最大上下文长度扩展到32K,在第二阶段,进一步扩展到128K。随后,我们进行后训练,包括对DeepSeek-V3基础模型的监督微调(SFT)和强化学习(RL)以使其与人类偏好对齐,并进一步释放其潜力。在后训练阶段,我们从DeepSeekR1系列模型中提炼推理能力,同时仔细保持模型准确性之间的平衡。
心培训成本预训练上下文扩展后训练总计在H800GPU小时2664K19K5K2788K,美元$5.328MAS0.23BM$0.O1M$5I576M我们从DeepSeekR1系列模型中提炼推理能力表1|DeepSeek-V3的训练成本,假设H800的...