下一场范式单命:谁是大模型架构新土者?大模型架构创新研究报告量子位智库量子位insights2025.06量子位智库QbitAlInsights,分析师王昕祎xinyi@qbitai.com
insights自2017年Attention IsAll YouNeed出世、提出Transformer架构以来,7年已过序言AI行业对Transformer的路依赖引发了越来越多的"过时”争论,优现出分新铂切的架构创新需求目前行业内针对这一问题主要存在两条架构层创新技术路径一是对Transformer架构进行改进,特别是针对其核心组件--Attention机制的优化与变体探索,例如稀疏Attention等技术、旨在提升计算效率和内存利用率,以更好地适应大规模训练场景。二是对非Transformer架构进行探索、如新型RNN架构等。这些架构试图从根本上摆脱对Attention机制的依赖,并在长序列建模、并行计算和推理效率上展现出独特优势值得注意的是,当前大模型架构的发展呈现出日益明显的混合趋势,不同架构之间的界限越来越模糊更多性能领先的创新架构具备"博采众家之长"的特点。本报告将围绕以上两条探索路径展开梳理,并拆解这些大模型架构创新的底层逻辑,对大模型架构层未来发展可能的演进方向及趋势作出分析。insights
insights目录01Transformer的主流与挑战02Transformer架构改进03非Transformer架构突围04架构创新底层逻辑insights
insightsnsighinsiantsghtsinsights1.0Transformer的地位与挑战insightsinsights
Transformer架构占据行业绝对主导地位insightsTransformer架构目前仍占领大横型架构绝对主液地位:架构的通用性、可扩展性以及丰富优化生态使其仍是国内外大规模语言、视觉、多模态模型的首选架构非Transformer架构2025年实现工业级落地0-1突破:Minimax推出MiniMax-01首次实现线性架构千亿参数(456B)工业级别落地验证,腾讯混元T1正式版基础模型Turbo-S采用Tran sformer+Mamba混合架构,标志着非Transfommer架构技术路径在2025年实现了从科研走向工业落地的0-1突破。国内主流模型架构线性架构海外主流模型架构GeminiDeepSock月之暗面智谐阶跃星辰GLM大模型Stp大模型GoogleAnthropic百度科大讯飞文心大模型星火大模型MistralAIMetaXAMistral大模型Lama大模型Grok大模型MINIMAX商汤周讯MiniMax日日新大模型混元大模生insiahts注:盘点不分排名先后顺序
大模型架构演进历史:从深度学习革到GPT开启Transformer时代insights前Transformer十年:Transformer时代开启:深度学习引入NLP预训练与ScalingLaw范式出现与主导2006-20172017-20192017Google,UofTAttentionIsAllYouNeed关健论文预训练与ScalingLaw式兴起GoogleTransformer成主流架构BERY':Pre-trainlingofDeepBldirectional,HintonAlexNetKyunghyunChGRUTransformersforLanguagaUndertanding用CNN做图像识别用LSTM做翻译提升RNN效率与性能训练+微调(fine-tunIng)范式兴起CNN(卷积神经网络)RNN(循环神经网络)RNNBERTBERT(2018)础菜构首个双向Transformer预训练模型,语言表示模型奠基之作健模型架构LSTM用于图像处理达到研究巅峰ChatGPT(2018)发展出LSTM、GRUChatGPT语言任务中有一定应用GRU首个Transformer自回归语言模型,开启生成式,AI先河筒洁轻量参数规慢逐步突破百亿期(GoogleT5-118)。特点缺乏并行性。调范式成为行业主流。难以处理超长序列。生成式模型、理解式模型、多模态模型路线开始分化。
大模型架构演进历史:主流范式从共识到见顶,后Transformer时代开启insightsTransformer时代巅峰:后Transformer时代:基础模型参数规模不断突破预训练范式见顶,创新架构探索兴起2020-20222023-至今20232021G0oglOpenAlllyaSwitchTsansfomer大建论文/进引I入MOE发表”预训练结束”观点2025DeepSeekRl技术报告20200penAlJaredKaplan等验证仅强化学习(RL)无监督提出ScalingLaw2023OpenAGPT-4技术报告迅速成为共识提出多阶段训练、精细化对齐(alignment)与稳健性能优化GPT-3(2020)GPT-4·GPT-4(2023)关键模型架构GPT-3突破千亿参数,生成式A里程碑。取得多模态生成和逻频推理(Ghain-oh-Thought),ToolUsw.SystemnPrampt等突破ScalingLawCLIP&DALL-E(2021)+Claude(Anthropic),Gemini (Google), Mistral等SDALL-E融合视觉和...