A:D0A+研发数字修会NDD2024A+研发数字峰会Al+ Development DigitalsummitAI驱动研发变革促进企业隆本增效北京站08/16-17SUBLLM新架构:又本下采样机制革新大语言模型效率王全东小米大模型团队
演讲嘉宾NDDA土研发故字缝台王全东小米大模型团队大模型高级算法工程师中国科学院声学研究所博士、美国佐治亚理工访问学者、中科院认证高级工程师,长期从事大语言模型、多模态、语音识别等领域研究,曾获多项顶会竞赛冠亚军奖项,已发表顶会论文十余篇,拥有专列多项,深度参与了小米自研大模型从0到1的研发过程,荣获2024年度CCF计算机应用创新技术一等奖。近期和Daniel Povey等提出SUBLLM新架构,被量子位等科技媒体报道
NDDA+研发数字缝会长文本模型的技术挑战2SUBLLM架构目录3.主要实验结果CONTENTS分析与讨论4.5总结与展望
DDA+研发数字峰会PART01长文本模型的技术挑战
NDDA+研发数字峰会长文本模型的技术挑战长文本需求旺盛多人会议摘要行业报告学术论文分析长文写作新闻摘要长篇翻译
NDDA+研发数字峰会长文本模型的技术挑战长文本模型结构:Decoderonly Transformer结构:Llama 类似结构,attention的平方复杂度NxLLaMA.byMeta,2023
NDDA+研发数字峰会长文本模型的技术挑战训练成本高:attention的平方复杂度8k窗长32K窗长200K窗长1M窗长2~15T tokens5~10Btokens5~10Btokens5~10B tokens主要优化点
NDDA+研发数字峰会长文本模型的技术挑战模型窗长扩展方法:数据方向,训练成本不高1. Data Enqineerinq for Scaling Language Models to 128K Context0.6OriginalCut at 4K0.Cut at 128kPer-sourceUpsampling0.3GlobalUpsampleArxlv0.2UpsampleBook0.1Upsample Github0.0
长文本模型的技术挑战NDDA+研发数字峰会模型窗长扩展方法:位置编码方向,训练成本不高2.YaRN: Efficient Context Window Extension of Large LanquageModelsNTK-by-parts +温度控制The log-wavelength comparisons between various methods across the hidden statesROPE (context length=2048)Position Iinterpolation (s=16)NTK-aware(s=16)NTK-byparts(s=16,a=1,B=32)sup6uajaAem-6o今20d-thhiddenstate
NDDA+研发数字峰会长文本模型的技术挑战模型窗长扩展方法:位置编码方向,训练成本不高3.PoSE: Efficient Context Window Extension of LLMsvia Positional Skip-wise TrainingFull-lenath:8192 tokenstarget /original contextsize=8192/20488191POSE:2048tokensskipTrainExampleRelativePositions51165608095[1,1535]U[6049,8095]#1skip#2[1,1024]U[2529,4575]102335524575
长文本模型的技术挑战NDDA+研发数字峰会训练成本主要在8k预训练阶段:attention的平方复杂度8k窗长32K窗长200K窗长1M窗长2~15T tokens5~10Btokens5~10Btokens5~10B tokens主要优化点
长文本模型的技术挑战NDDA+研发数字峰会Decoder only Transformer长文本模型训练infra开发1. DeepSpeedUlysses:代垫·对Attention的实现不敏感适合各种attention方法劣势:序列并行度不能超过头数[N,.d](Lecal[N/B,EIIalltoall commalltoall commN:sequence lengthsad countP:totalprocessor(GPU) countAssumesP=hc=4
长文本模型的技术挑战NDDA+研发数字峰会Decoder only Transformer长文本模型训练infra开发2.Ring-attention:"大号"的flash attention优势:并行度的扩展性较好劣势:对Attention变种不友好,eg.SparseAttentionOuterLoopKI:dxNCopyBlocktoSRAMOuterLoopV:NXdQ:NxdXN:MOdoo7JauuCopyComputeBlockonSRAMInner LoopCopysm(QK')V:NxaInnerLoopFlashAttention
NDDA+研发数字峰会长文本模型的技术挑战推理成本高:attention的平方复杂度推理速度角度,200k比20k贵28倍,比2k贵112倍A1007B模型vllm框架解码速度(tokens/s)vs输入窗长605040320102k20k200k
NDDA+研发数字峰会长文本模型的技术挑战其他长文本模型结构:1. Infini-Transformer:长期压缩记忆和局部因果注意力attentionLinearprojectionConcatConcatRetrieveCompressivememory&Causalscaleddot-prod...