电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

SUBLLM新架构:文本下采样机制革新大语言模型效率会员免费

SUBLLM新架构:文本下采样机制革新大语言模型效率_第1页
1/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第2页
2/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第3页
3/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第4页
4/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第5页
5/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第6页
6/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第7页
7/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第8页
8/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第9页
9/44
SUBLLM新架构:文本下采样机制革新大语言模型效率_第10页
10/44
A:D0A+研发数字修会NDD2024A+研发数字峰会Al+ Development DigitalsummitAI驱动研发变革促进企业隆本增效北京站08/16-17SUBLLM新架构:又本下采样机制革新大语言模型效率王全东小米大模型团队

演讲嘉宾NDDA土研发故字缝台王全东小米大模型团队大模型高级算法工程师中国科学院声学研究所博士、美国佐治亚理工访问学者、中科院认证高级工程师,长期从事大语言模型、多模态、语音识别等领域研究,曾获多项顶会竞赛冠亚军奖项,已发表顶会论文十余篇,拥有专列多项,深度参与了小米自研大模型从0到1的研发过程,荣获2024年度CCF计算机应用创新技术一等奖。近期和Daniel Povey等提出SUBLLM新架构,被量子位等科技媒体报道

NDDA+研发数字缝会长文本模型的技术挑战2SUBLLM架构目录3.主要实验结果CONTENTS分析与讨论4.5总结与展望

DDA+研发数字峰会PART01长文本模型的技术挑战

NDDA+研发数字峰会长文本模型的技术挑战长文本需求旺盛多人会议摘要行业报告学术论文分析长文写作新闻摘要长篇翻译

NDDA+研发数字峰会长文本模型的技术挑战长文本模型结构:Decoderonly Transformer结构:Llama 类似结构,attention的平方复杂度NxLLaMA.byMeta,2023

NDDA+研发数字峰会长文本模型的技术挑战训练成本高:attention的平方复杂度8k窗长32K窗长200K窗长1M窗长2~15T tokens5~10Btokens5~10Btokens5~10B tokens主要优化点

NDDA+研发数字峰会长文本模型的技术挑战模型窗长扩展方法:数据方向,训练成本不高1. Data Enqineerinq for Scaling Language Models to 128K Context0.6OriginalCut at 4K0.Cut at 128kPer-sourceUpsampling0.3GlobalUpsampleArxlv0.2UpsampleBook0.1Upsample Github0.0

长文本模型的技术挑战NDDA+研发数字峰会模型窗长扩展方法:位置编码方向,训练成本不高2.YaRN: Efficient Context Window Extension of Large LanquageModelsNTK-by-parts +温度控制The log-wavelength comparisons between various methods across the hidden statesROPE (context length=2048)Position Iinterpolation (s=16)NTK-aware(s=16)NTK-byparts(s=16,a=1,B=32)sup6uajaAem-6o今20d-thhiddenstate

NDDA+研发数字峰会长文本模型的技术挑战模型窗长扩展方法:位置编码方向,训练成本不高3.PoSE: Efficient Context Window Extension of LLMsvia Positional Skip-wise TrainingFull-lenath:8192 tokenstarget /original contextsize=8192/20488191POSE:2048tokensskipTrainExampleRelativePositions51165608095[1,1535]U[6049,8095]#1skip#2[1,1024]U[2529,4575]102335524575

长文本模型的技术挑战NDDA+研发数字峰会训练成本主要在8k预训练阶段:attention的平方复杂度8k窗长32K窗长200K窗长1M窗长2~15T tokens5~10Btokens5~10Btokens5~10B tokens主要优化点

长文本模型的技术挑战NDDA+研发数字峰会Decoder only Transformer长文本模型训练infra开发1. DeepSpeedUlysses:代垫·对Attention的实现不敏感适合各种attention方法劣势:序列并行度不能超过头数[N,.d](Lecal[N/B,EIIalltoall commalltoall commN:sequence lengthsad countP:totalprocessor(GPU) countAssumesP=hc=4

长文本模型的技术挑战NDDA+研发数字峰会Decoder only Transformer长文本模型训练infra开发2.Ring-attention:"大号"的flash attention优势:并行度的扩展性较好劣势:对Attention变种不友好,eg.SparseAttentionOuterLoopKI:dxNCopyBlocktoSRAMOuterLoopV:NXdQ:NxdXN:MOdoo7JauuCopyComputeBlockonSRAMInner LoopCopysm(QK')V:NxaInnerLoopFlashAttention

NDDA+研发数字峰会长文本模型的技术挑战推理成本高:attention的平方复杂度推理速度角度,200k比20k贵28倍,比2k贵112倍A1007B模型vllm框架解码速度(tokens/s)vs输入窗长605040320102k20k200k

NDDA+研发数字峰会长文本模型的技术挑战其他长文本模型结构:1. Infini-Transformer:长期压缩记忆和局部因果注意力attentionLinearprojectionConcatConcatRetrieveCompressivememory&Causalscaleddot-prod...

1、当您付费下载文档后,您只拥有了使用权限,并不意味着购买了版权,文档只能用于自身使用,不得用于其他商业用途(如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利)。
2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。
3、如文档内容存在违规,或者侵犯商业秘密、侵犯著作权等,请点击“违规举报”。

查找下载文件的指引

一、电脑端

- Windows 系统:按下键盘快捷键 `Ctrl + J`,即可打开下载列表。  

- Mac 系统:按下键盘快捷键 `⌘ + J`,即可打开下载列表。  

二、手机端

1. 打开手机浏览器,点击浏览器右下角的 “≡”(或“更多”)图标。  

2. 在弹出的菜单中找到并点击 “下载内容”(或类似选项),即可查看已下载的文件。  

提示:不同浏览器界面略有差异,若未找到“下载”入口,可尝试在浏览器设置中搜索“下载”关键词。


SUBLLM新架构:文本下采样机制革新大语言模型效率

确认删除?
会员
教程
收藏
足迹
联系
  • 站长微信
回到顶部