多模态大语言模型领域进展分享殷述康/博士在读DataFunSummit #2024DataFun.
背景介绍多模态大语言模型介绍多模态大语言模型演进团队相关工作介绍未来展望DataFun.
01背景介绍DataFun.
背景-LLM正走向多模态大语言模型(L.LM)是近几年来最火热的方向之一可以解决各种传统NLP任务,如文本分类、命名实体识别等可以做更高级的任务作为聊天机器人,按照要求扮演某个角色(强大的指令遵循能力)。做高阶的推理任务、如写代码、解数学问题等(强大的推理能力,CoT进一步增强然而LLM存在固有的限制。无法处理多模态的输入,导致有此任务无法做或者很难做如根据站截图给出源代码、理解一张表情包的含义.无法获取更多的多模态的世界知识,如名画、名人等DataFun.
背景-LLM正走向多模态多模态大语言模型(MLLM)的兴起就在近两年,工业和学术界都在积极转向多模态模型,比如OpenAI的GPT-4V、GPT-40谷歌的Gemini-ProeMoE-LLaVAPubliclySPHINXQwen-VL-Max2Mobile-AgeatCN1-3MMICLOKEXT-GPT0-120o在短短的两年间,已有上百个模0SD-LLM@GPT-Vqnnrto型涌现,包括大企业的闭源模型POINL.LM@ASM和学术社区的开源模型探索。夏LLMA-VIDVICPMLISA@LengeageBIND2oeLLaVA-MedLLAVA-L5106.2Lavis@MatiMadLGPTSSICogVLMShikraMatienGPTPaLM-EGLLaMA-Adapter@LLAVAmco-1VideeChat0小MaIGPT-~13BLIP-3HegsingGPTLTU20232022MM-REACTViperGPTGPT4TeobPLUG-OwlDataFun.Yin, Shukang, et al."Asurvey on multimodal large language models." arXiv:2306.13549
背景-MLLM能做些什么能做传统视觉/多模态任务Prompt:描述强图片Prompt:GPT-4V:盒张图片是一双小猫在草地上走路的重面。小猫是橘色的,有蓝色的眼睛GPT-4V看起来很可爱。它的身髓很小,四肢There are4peoplein the image.撞钿,正在小心翼翼地在草地上行走Caption任务计数任务定位任务DataFun.Cited from arXiv:2309.17421
背景-MLLM能做些什么能做更复杂的复合型任务,比如基于视觉的感知和理解任务Prompt:hart Understanding and Reasoningapythan codesto generate sinGPT-4VF180OPT-4V82.66+70.56]+2=76.55heretore,thearernge tstalfueingcostlexclvtingthe FordF150/is$70.55图表推理根据图表写代码Cited from arXiv:2309.17421DataFun.
02多模态大语言模型介给DataFun.
介绍-MLLM的基本方面由于大企业的模型是闭源的,学术界正积极研究探索开源的模型。模型架构数据与训练方法模型评估DataFun.
介绍-MLLM的架构常用的架构一般包含三个部分编码器连接器大语言模型LLMModalityConnectorGeneratorEncoderCOLLMMH-Attn4Q4KQ-FormerMLPLearnableQueriesYin Shukane, et al. A survey on multimodal large language models" arXiv:2306. 13549>ataFun.
介绍-MLLM的架构视觉编码器常用的是基于CLIP预训练的ViTImageImageEncoderEncoder对于常见的224x224分辨率图片,patch大小为14,最后共ContrastiveLossContrastiveLoss得到14x14=256个tokens只金丝猴的照片TextText(PhatoofagoldenmonkeyEncoderEncoderCited from arXiv:2211.01335sDataFun.
介绍-MLLM的架松连接器LanguageResponseXaMLP结构LanguageModelfo不改变视觉token的数量,使用线性层或者多层感知机做投影。ProjectionWH4HqVisionEncoderX。LanguageInstructionX.,ImageCitedfrom arXiv:2304.08485Q-FormerQ-FormerOO-0压缩图片token至固定的数量,提高运算效率FeedForwardFeedForwardQ指query,使用一组可学习的CrossAttentionquery向量从视觉token中抽取更Self Attention紧凑的表征信息ImageEmbeddingsQueriesInstructionCited from arXiv:2305.06500sDataFun.
介绍-MLLM的数据和训练方法第一阶段:模态对齐训练Stage-1:Pre-training将视觉的语义空间与文本空间对齐米Pre-trainedLLM一种做法是冻结LLM,训练视觉编码器和连接器Visual Abstractor通常使用大量的图文配对数据训练。Visual Encoder如caption数据。输入图片、预测图片的文本描述>ad of hay andBunk bedwithanarrowshellsitting,The manatbat readiestoswingat theunderneath it.p...