电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

殷述康:多模态大语言模型领域进展分享会员免费

殷述康:多模态大语言模型领域进展分享_第1页
1/42
殷述康:多模态大语言模型领域进展分享_第2页
2/42
殷述康:多模态大语言模型领域进展分享_第3页
3/42
殷述康:多模态大语言模型领域进展分享_第4页
4/42
殷述康:多模态大语言模型领域进展分享_第5页
5/42
殷述康:多模态大语言模型领域进展分享_第6页
6/42
殷述康:多模态大语言模型领域进展分享_第7页
7/42
殷述康:多模态大语言模型领域进展分享_第8页
8/42
殷述康:多模态大语言模型领域进展分享_第9页
9/42
殷述康:多模态大语言模型领域进展分享_第10页
10/42
多模态大语言模型领域进展分享殷述康/博士在读DataFunSummit #2024DataFun.

背景介绍多模态大语言模型介绍多模态大语言模型演进团队相关工作介绍未来展望DataFun.

01背景介绍DataFun.

背景-LLM正走向多模态大语言模型(L.LM)是近几年来最火热的方向之一可以解决各种传统NLP任务,如文本分类、命名实体识别等可以做更高级的任务作为聊天机器人,按照要求扮演某个角色(强大的指令遵循能力)。做高阶的推理任务、如写代码、解数学问题等(强大的推理能力,CoT进一步增强然而LLM存在固有的限制。无法处理多模态的输入,导致有此任务无法做或者很难做如根据站截图给出源代码、理解一张表情包的含义.无法获取更多的多模态的世界知识,如名画、名人等DataFun.

背景-LLM正走向多模态多模态大语言模型(MLLM)的兴起就在近两年,工业和学术界都在积极转向多模态模型,比如OpenAI的GPT-4V、GPT-40谷歌的Gemini-ProeMoE-LLaVAPubliclySPHINXQwen-VL-Max2Mobile-AgeatCN1-3MMICLOKEXT-GPT0-120o在短短的两年间,已有上百个模0SD-LLM@GPT-Vqnnrto型涌现,包括大企业的闭源模型POINL.LM@ASM和学术社区的开源模型探索。夏LLMA-VIDVICPMLISA@LengeageBIND2oeLLaVA-MedLLAVA-L5106.2Lavis@MatiMadLGPTSSICogVLMShikraMatienGPTPaLM-EGLLaMA-Adapter@LLAVAmco-1VideeChat0小MaIGPT-~13BLIP-3HegsingGPTLTU20232022MM-REACTViperGPTGPT4TeobPLUG-OwlDataFun.Yin, Shukang, et al."Asurvey on multimodal large language models." arXiv:2306.13549

背景-MLLM能做些什么能做传统视觉/多模态任务Prompt:描述强图片Prompt:GPT-4V:盒张图片是一双小猫在草地上走路的重面。小猫是橘色的,有蓝色的眼睛GPT-4V看起来很可爱。它的身髓很小,四肢There are4peoplein the image.撞钿,正在小心翼翼地在草地上行走Caption任务计数任务定位任务DataFun.Cited from arXiv:2309.17421

背景-MLLM能做些什么能做更复杂的复合型任务,比如基于视觉的感知和理解任务Prompt:hart Understanding and Reasoningapythan codesto generate sinGPT-4VF180OPT-4V82.66+70.56]+2=76.55heretore,thearernge tstalfueingcostlexclvtingthe FordF150/is$70.55图表推理根据图表写代码Cited from arXiv:2309.17421DataFun.

02多模态大语言模型介给DataFun.

介绍-MLLM的基本方面由于大企业的模型是闭源的,学术界正积极研究探索开源的模型。模型架构数据与训练方法模型评估DataFun.

介绍-MLLM的架构常用的架构一般包含三个部分编码器连接器大语言模型LLMModalityConnectorGeneratorEncoderCOLLMMH-Attn4Q4KQ-FormerMLPLearnableQueriesYin Shukane, et al. A survey on multimodal large language models" arXiv:2306. 13549>ataFun.

介绍-MLLM的架构视觉编码器常用的是基于CLIP预训练的ViTImageImageEncoderEncoder对于常见的224x224分辨率图片,patch大小为14,最后共ContrastiveLossContrastiveLoss得到14x14=256个tokens只金丝猴的照片TextText(PhatoofagoldenmonkeyEncoderEncoderCited from arXiv:2211.01335sDataFun.

介绍-MLLM的架松连接器LanguageResponseXaMLP结构LanguageModelfo不改变视觉token的数量,使用线性层或者多层感知机做投影。ProjectionWH4HqVisionEncoderX。LanguageInstructionX.,ImageCitedfrom arXiv:2304.08485Q-FormerQ-FormerOO-0压缩图片token至固定的数量,提高运算效率FeedForwardFeedForwardQ指query,使用一组可学习的CrossAttentionquery向量从视觉token中抽取更Self Attention紧凑的表征信息ImageEmbeddingsQueriesInstructionCited from arXiv:2305.06500sDataFun.

介绍-MLLM的数据和训练方法第一阶段:模态对齐训练Stage-1:Pre-training将视觉的语义空间与文本空间对齐米Pre-trainedLLM一种做法是冻结LLM,训练视觉编码器和连接器Visual Abstractor通常使用大量的图文配对数据训练。Visual Encoder如caption数据。输入图片、预测图片的文本描述>ad of hay andBunk bedwithanarrowshellsitting,The manatbat readiestoswingat theunderneath it.p...

1、当您付费下载文档后,您只拥有了使用权限,并不意味着购买了版权,文档只能用于自身使用,不得用于其他商业用途(如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利)。
2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。
3、如文档内容存在违规,或者侵犯商业秘密、侵犯著作权等,请点击“违规举报”。

查找下载文件的指引

一、电脑端

- Windows 系统:按下键盘快捷键 `Ctrl + J`,即可打开下载列表。  

- Mac 系统:按下键盘快捷键 `⌘ + J`,即可打开下载列表。  

二、手机端

1. 打开手机浏览器,点击浏览器右下角的 “≡”(或“更多”)图标。  

2. 在弹出的菜单中找到并点击 “下载内容”(或类似选项),即可查看已下载的文件。  

提示:不同浏览器界面略有差异,若未找到“下载”入口,可尝试在浏览器设置中搜索“下载”关键词。


殷述康:多模态大语言模型领域进展分享

确认删除?
会员
教程
收藏
足迹
联系
  • 站长微信
回到顶部