电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

多模态大模型:开放世界理解会员免费

多模态大模型:开放世界理解_第1页
1/49
多模态大模型:开放世界理解_第2页
2/49
多模态大模型:开放世界理解_第3页
3/49
多模态大模型:开放世界理解_第4页
4/49
多模态大模型:开放世界理解_第5页
5/49
多模态大模型:开放世界理解_第6页
6/49
多模态大模型:开放世界理解_第7页
7/49
多模态大模型:开放世界理解_第8页
8/49
多模态大模型:开放世界理解_第9页
9/49
多模态大模型:开放世界理解_第10页
10/49
DataFunSummit # 2024多模态大模型:开放世界理解谢春宇 /360多模态团队负责人

背景 图文多模态大模型 360多模态大模型探索 业务落地实践1234

什么是大模型大参数大算力大数据

什么是大模型大数据大参数大算力

背景q人工智能AGI,我们需要什么?ChatGPT的发布标志着自然语言处理技术迈入了一个全新的阶段。自2022年底亮相以来,它凭借其惊人的语言生成能力,迅速成为AI领域的焦点。ChatGPT能够进行连贯、深度的对话,甚至创作诗歌、撰写文章,展现出了前所未有的创造力和理解力。这一突破不仅激发了公众对于AI技术的兴趣,还加速了科技界对通用人工智能(AGI)的研究步伐。在教育、写作、娱乐等多个领域,ChatGPT的应用潜力正在被不断挖掘。教育工作者利用它辅助教学,作家借助它激发灵感,企业则将其融入客户服务,提高了效率与体验。同时,ChatGPT也引发了关于AI伦理、隐私保护及就业市场变革的广泛讨论,促使社会各界思考如何在享受AI红利的同时,建立相应的监管框架,确保技术的健康发展。总之,ChatGPT的出现不仅是技术上的革新,更是对人类社会未来发展路径的一次深刻启示。

背景q人工智能AGI,我们需要什么?•GPT4做为新一代的GPT模型•增加了对视觉模态输入的支持,这意味着它能够理解图像并进行相应的自然语言生成•增加了多模态能力的GPT4也带来了应用层面的更多可能•GPT-4V•增强的视觉能力•分析和理解图像内容,提供描述、识别对象,甚至解释场景•根据图像生成创意文本格式•翻译图像中的文本,强大的OCR能力•GPT-4O•具备原生多模态能力•支持文本、音频、图像任意组合•性能提升,更快的响应速度

背景q视觉能力是通用人工智能AGI需必备的基础能力——人类智能本身高度依赖于视觉感知理解世界情境感知交互能力学习能力识别物体预测运动……

视觉-语言跨模态学习• Vision-language cross modal learning,亦称为VLP(Vision-Language Pretrain)、VLM(Vision-Language Model),代表性的工作是20年OpenAI的CLIP,开启和引领了CV多模态研究的大模型时代Li, Yingming, Ming Yang, and Zhongfei Zhang. "Multi-view representation learning: A survey from shallow methods to deep methods." arXiv preprint arXiv:1610.01206 1 (2016).

视觉-语言跨模态学习Radford, Alec, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry et al. "Learning transferable visual models from natural language supervision." In International conference on machine learning, pp. 8748-8763. PMLR, 2021.0.4B1.8B5B5BCLIP'20ALIGN'21BASIC'22DFN'23Data Size

视觉-语言跨模态学习中文图文跨模态模型 R2D2图文跨模态学习带来的基于内容的图文互检能力对于互联网搜索来说具有非常重要的落地价值,来自于360搜索的实际业务需求非常强烈。360搜索:使用跨模态模型之前的搜索结果360搜索:使用跨模态模型之后的搜索结果

视觉-语言跨模态学习中文图文跨模态模型 R2D2•2300万训练数据,在中文图文检索任务上达到SOTA•双塔base + 单塔head的混合模式•专门针对数据噪声设计的momentum-updated encoder和masked input + soft label双蒸馏[1] Xie Chunyu, et al. CCMB: A Large-scale Chinese Cross-modal Benchmark[C]//Proceedings of the 31st ACM International Conference on Multimedia. 2023: 4219-4227.

视觉-语言跨模态学习中文图文跨模态模型 R2D2•伴随着算法和模型,我们一同开源了对应的图文跨模态数据集Zero,包含2.5亿中文图文对数据•基于用户点击CTR筛选,数据质量更高https://zero.so.com2300万3000万1亿2.5亿Zero V1WenLan'21WuKong'22Zero V2Data Size

背景 图文多模态大模型 360多模态大模型探索 业务落地实践1234

图文多模态大模型LMM的研发回顾• LMM = Large Multimodal Model,之前亦称为MLLM(Multimodal Large Language Model),目前也有小部分工作为了强调视觉能力将其称...

1、当您付费下载文档后,您只拥有了使用权限,并不意味着购买了版权,文档只能用于自身使用,不得用于其他商业用途(如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利)。
2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。
3、如文档内容存在违规,或者侵犯商业秘密、侵犯著作权等,请点击“违规举报”。

查找下载文件的指引

一、电脑端

- Windows 系统:按下键盘快捷键 `Ctrl + J`,即可打开下载列表。  

- Mac 系统:按下键盘快捷键 `⌘ + J`,即可打开下载列表。  

二、手机端

1. 打开手机浏览器,点击浏览器右下角的 “≡”(或“更多”)图标。  

2. 在弹出的菜单中找到并点击 “下载内容”(或类似选项),即可查看已下载的文件。  

提示:不同浏览器界面略有差异,若未找到“下载”入口,可尝试在浏览器设置中搜索“下载”关键词。


多模态大模型:开放世界理解

确认删除?
教程
签到
收藏
足迹
微信
  • 站长微信
回到顶部