浙江大学智能金融:AI驱动的金融变革郑小林教授浙江大学人工智能研究所2025年03月24日
提纲浙江大学新一代人工智能金融智能研究金融智能应用新一代AI展望
一、新一代人工智能浙江大学A Proposalfor theDartmouth Summer人工智能(Artificial Intelligence,缩写定义:Research ProjectonArtificial Intelligence为AI),又称机器智能,指由人制造出来的机器August31,1955所表现出来的智能。一维基百科AI的核心问题:建构能够跟人类似甚至超卓的推理、知识、计划、学习、交流、感知、移动移物、使用工具和操控机械的能力等。Research Project on ArtificialIntelligence August31,1955,一维基百科Dartmouth
自然语言处理模型的演进浙江大学统计语言模型神经语言模型预训练语言模大语言模型(SLM)(NLM)型(PLM)(LLM)基于文本概率分布建模Seq2Seq建模"预训练-微调上下文学习、指令微调、通常基于马尔可夫假设建立词基于循环神经网络RNN描述单学习范式扩展规律预测模型(N-gram)词序列的概率(BERI、GPI)(GPT3、GPT4.)优点:可解释、计算速基于Transformer架构的语言模型优点:通过词嵌入和隐度快优点:藏层,上下文捕捉和泛缺点:从前向后单向计长距离依赖处理能力强:自注意力机制能捕捉任化能力较强;算;单纯基于统计频次、意距离的依赖关系。缺少对上下文的泛化;缺点:计算复杂度高,并行计算能力强:Transformer架构支持并行计算面对长文本序列仍会有随着n的增大,参数空训练速度更快。“灾难性遗忘"问题间呈指数增长缺点:资源消耗大
Google Transformer:引入注意力(Attention)学习,2017浙江大学解码器OutputDecoder生成输出序列前网络FeedForward编码器Encoder捕捉序列中元素之间复杂关系的多功能组件。通过使用线性变换和非线性激活处理输入序列函数,前馈网络使模型能够处理复杂语义,促进文本的稳健理解和生成。注意力Attention●自注意力机制:使序列中的每个单词都能“"关注”其他单词,包括自己在内,以更好地理解上下文。(通过计算输入序列中每个位置与其他位置之间的注意力权重。得到加权的位置向量作为输出)■多头注意力机制:多个独立计算的自注意力机制,将相同的输入映射到Nx不同的空间中进行上下文理解,使得模型获得了对输入序列有更细致透视,丰Multi-Head富了其表示,带有多样化的上下文信息。AttentionPositional嵌入层EmbeddingPositionalEncoding由EncadingWord Embeddina:目的是将这些非结构化的文本信息转化为结构化的信息,具体来说是将文本空间中的某个word,映射或者说嵌入(embedding)到另一个数值向量空间#PositionEmbedding:输入句子的所有word是同时处理的,没有考InputsOutputs(shiltedright)虑词的排序和位置信息,所以通过positional encoding来衡量word位置信息Google(2017):Attention isallyouneed
GShard:基于MoE探索巨型Transformer网络(Gooqle, 2020)浙江大学编码器和解码器里的部分前馈神经网络(FFN)层被混合专家MoE层替代,并采用too-2门控机制;当模型扩展到多个设备时,MoE层在这些设备间共享,而其他层则在每个设备上独立存在。有利于大规模计算营(128E,36L)-37B(120E,121)-12:50
新一代人工智能发展现状浙江大学语言模型架构路线探索Scaling-Law及训练优化探索推理能力探索20182023OCT2020MAR20252025BERTMAY20242019GPT-4MAR2017epSeek-V2OnlyEncPT-32022BARTJUNDE架构ChatGPTTransformer20242024202520192023DECAPRFEB2018FEB20192022FEBOpenAl-o1JUNMARGrok-3GPTJULLLaMALLaMA-3.1GPTPrRoBERTaDeopSeck-V3OnlyDaaodoOryEncader金花暴奶ANDREWBARTOANDRICHARDSUTION2018年图灵奖、深度机器学习2024年图灵奖、强化学习
强化学习莫基人获得2024图灵奖浙江大学3月5日公布了ACM图灵奖获得者Andrew Barto(MIT教授)和RichardSutton(强化学习之父,阿尔伯塔大学教授,DeepMind科学家)动作(Action)acm机器环境(Agent)(Environment)状态(State)奖赏(Reward)折扣因子ANDREWBARTO(DiscountFactor)ANDRICHARDSUTTON2024AGMAM.TURINGAWARD强化学习的目标是得到一个策略,用于判断在RECIPIENIS什么状态下选取什么动作才能得到最终奖赏
DeepSeek-R1:监督微调+...