把握DeepSeek时刻,携手同行华为异腾AI解决万案汇报HUAWEI2025年2月
0NTENTSDeepSeek洞察及昇腾适配进展2华为异腾AI基础软硬件介绍目录HunwelProprietany-RestrictedDishbutonHUAWEI
DeepSeekAI发展史上的一个关键里程碑,但远未达到AI终点重新定义ScalingLaw泛化性和经济性大幅提升补齐最后一块自主创新的版图延续智能涌现的方向LLM进入"CVResnet时刻真正形成中美两条AI技术路线DeepSeek-R1进一步验证”算力即性能CVNLPScaling Law升级,模型能力=算力x数据x思考计算机视觉自然语言处理国家战略清晰双轮驱动互锁1998LeNet2017谷歌发布首个战略坚定+技术创新首个CNN架构模型Transformer架构模型A根型算法:GPT,LLaMA算力x数据x思号2012AlecNet2023ChatGPTAI枢架:异思、飞桨模型能力突破模型能力突破开启CV时代开启NLP时代魅力x数据异构计算架构:CUDA异构计算架构:CANN.2015Resnet2025DeepSeck互联技术:NVLink互联技术:灵衢效率与成本双突破效革与成本双突破CV全面普及NLP全面普及A芯片:NV.AMDA芯片:昇腾、寒武记随着DerpSe提供了一种高效率训练的方法,同等DS对强化学习的创新使用,可以让大模型便捷的获得中国A公司首次以关键创新贡献者的身份加入到全球通用性+专用性。可以满足各应用场景需求AI竞争中,冲击美国A霸权在竞争背景下,头部玩家仍将追逐ScalingLaw,坚定D5对通过从模型结构到训推全流程的极致工程优化,打破NV-OPenA的资金、技术、人才的垄断,全球加速探索下一代A技术大幅提升A的计算效率,提升模型落地经济性面新思考中美技术路线的选择HunwelPropnetary-RestrictedDishbutonHUAWEI
DeepSeek V3:实现极致性能,稀疏MOE提质降本低成本完美对标OpenAl01,突破精确语义理解及复杂推理任务我是DeepSeckDeepSeek-V3是一款MoE模型,总参数量671B,激话参数量37B,采用2048张H800(节点内NVLink,节点间IB,非超节点架构)在14.8Ttoken数据集上基于自研HAF-LLM训练系统总计训练了1394h(58.08天)低成本性能优技术创新绕过CUDA挖掘FP8硬件潜力,MOE数学、科学和代码等领域领先业界硬件级、算法级、架构级、工程级、开和MLA技术实现不到10%的成本方案成为业界公认的LLM的领先模型源生态5大技术创新,轰动全球硬件级优化统过GUDA进行PTX编理~150M$5.57M$计算与通信优化,性能提升30%DeepSeek-V3训GRPO:群体进化的智慧筛选器练成本算法革命自我验证机制:AI的“错题本系统"混合专家模型的"智能路由器"架构创新多头潜在注意力MLA:空间压缩术16至13的量化压缩工程奇迹通信降低89%推理加速:预加载,动态批处理等模型、数据、工具链、部署全开源来源:DeepSeek模型测试数据&互联网开源生态DeepSek-R1推理成本仅为OpenAlo1的3%蒸馏技术使能第三方模型性能Huavel Proprletany-ResrictedDisrbutionHUAWEI
DeepSeek R1:在Reasoning任务达到了世界水平(OpenAl-o11DeepSeek-R1技术路线A-basedRMFiganlBenchmarkprfemancedDypisesk.RlDeepSeek-R1以DeepSeek-V3Base(671B)为其础模型,使以2阶段SFT+2阶段RL完成,从而解决R1-Zero可读性差、多种用GRPO算法作为RL框架来提升Reasoning1性能语言混合问题本次开源同时发布了6个基于DeepSeek-R1蒸馏的更小稠密模型(Qwen/LaMa1.5B7B14832870B)HUAWEIHunwelProprietany-RestrictedDishbufor
DeepSeekV3模型架构:Multi-Head Latent Attention(MLA)异腾1.推理阶段,理论上可以将KVCache降低1-2个数量级影响2.对异腾更亲和,大幅降低对HBM依赖,提升拍理Decode性能。MLA架构具体实现张量低秩压缩以降低KVCache资源开销:相比于传统MHA,MLA通过降维口只需存储图中的c汽K”即可;操作使得存储的张量维度大幅减小。(下图中仅红色阴影部分需要存储口考虑到矩阵乘法结合律,具体实现过程中Wa可以与Ww融合、Ww可以与W.融合,从而无需为每个query计算key-value值。(bs,b)wno(bsb)压绾后应度:《隐成层宽度广o000>MA架构:1)分别对Query.Key-Valuepari进行低秩压缩:2)使用ROPE获得位置信息;3)使用MHA计算得到输出。实验结果KVCacheperToken(#Element相比于MHA,MLA每token的KVCache量大幅减少,且精度更高AttentionMechanismMult-Head Attention(MHA)2nydalBenchmark(Metr...