电脑桌面
添加运营动脉到电脑桌面
安装后可以在桌面快捷访问

SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估会员免费优质

SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第1页
1/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第2页
2/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第3页
3/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第4页
4/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第5页
5/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第6页
6/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第7页
7/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第8页
8/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第9页
9/80
SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估_第10页
10/80
中文大模型基准测评2024年10月报告 2024.11.08— 2024年度中文大模型阶段性进展评估SuperCLUE团队

报告核心结论摘要•OpenAI发布o1后,全球大模型竞争加剧o1-preview的推出进一步拉大了与其他模型的差距。经测评,目前国内大模型正在持续接近Claude 3.5 Sonnet和ChatGPT-4o-latest的能力,但与o1-preview在中文难任务(Hard任务)上相差约为14%,在中文通用能力上相差约8%。•国内大模型第一梯队竞争激烈,持续迭代表现不俗国内开源模型Qwen2.5-72B-Instruct、DeepSeek V2.5领跑全球开源模型,最新发布的TeleChat2-35B同样表现出色,超过了国内外众多开源模型;国内闭源模型GLM-4-Plus、SenseChat 5.5、AndesGPT-2.0表现优异,与ChatGPT-4o-latest相距2分以内。•国内外大模型在不同任务上表现各有优势国内外模型在不同维度任务表现各有特色。o1-preview在Hard任务中表现卓越,有较大领先性,国内大模型则更擅长理科和文科任务。•端侧小模型表现惊艳国内端侧小模型进展迅速,部分小尺寸模型表现要好于上一代的稍大尺寸模型,如Qwen2.5-1.5B-Instruct、MiniCPM3-4B,均展现出很高的性价比和落地可行性。2来源:SuperCLUE模型象限, 2024年11月8日

3. SuperCLUE-AI产品能力测评目 录•中文大模型基准SuperCLUE介绍•SuperCLUE测评体系及数据集•总榜、理科榜单、文科榜单、Hard榜单及模型象限•开源榜单及端侧小模型榜单•大模型对战胜率、成熟度指数•评测与人类一致性分析•优秀模型案例介绍 1. 国内大模型关键进展及趋势•2023-2024年大模型关键进展•2024年值得关注的中文大模型全景图•2023-2024年度国内外大模型技术发展趋势 2. SuperCLUE通用能力测评 5. SuperCLUE专项与行业基准测评 6. 优秀模型案例介绍•各行业、专项测评•未来两个月基准发布计划 4. SuperCLUE多模态能力测评•SuperCLUE-V多模态理解测评•AIGVBench视频生成测评•SuperCLUE-Image文生图测评•SuperCLUE-Coder代码助手产品测评•SuperCLUE-AISearch搜索产品测评•SuperCLUE-Voice实时语音产品测评

精准量化通用人工智能(AGI)进展,定义人类迈向AGI的路线图Accurately quantifying the progress of AGI, defining the roadmap for humanity's journey towards AGI.

第1部分 国内大模型关键进展及趋势1.2023-2024年大模型关键进进展 2.2024年值得关注的中文大模型全景图3.2023-2024年度国内外大模型技术发展趋势5

(关键进展)时间成长期自2022年11月30日ChatGPT发布以来,AI大模型在全球范围内掀起了有史以来规模最大的人工智能浪潮。国内学术和产业界在过去一年半也有了实质性的突破。 大致可以分为四个阶段,即准备期(ChatGPT发布后国内产学研迅速形成大模型共识)、成长期(国内大模型数量和质量开始逐渐增长)、爆发期(各行各业开 源闭源大模型层出不穷,形成百模大战的竞争态势)、繁荣期(更多模态能力的延伸和应用)。2023-2024大模型关键进展2022.122023.022023.122024.102023.06SuperCLUE:AI大模型2023-2024年关键进展6爆发期繁荣期准备期ChatGPT发布国内迅速形成大模型共识•OpenAI发布GPT4、Meta开源Llama•闭源模型:文心一言1.0、 360智脑、讯飞星火、通义千问、商量2.0、盘古3.0、从容大模型等相继发布。•开源模型:ChatGLM、Baichuan等模型相继开源•OpenAI发布GPT4 Turbo、GPT-4V•Google发布多模态大模型Gemini•闭源模型:腾讯混元、字节豆包、文心 一 言 4.0、 讯 飞 星 火 3 . 0 、 小 米MiLM、BlueLM、AndesGPT等模型相继发布。•开源模型:零一万物Yi、阿里Qwen、Baichuan2等模型相继开源。•OpenAI发布Sora、GPT-4o、o1;Gemini-1.5、Claude3.5、Grok2、Llama3等发布。•Gen-3、Luma、SD3、Flux等文生视频/图模型相继发布。•语言模型:GLM4、Baichuan4、Yi-Large、MiniMax-Abab6.5、Qwen2.5、商量5.5、DeepSeekV2、Kimi发布更新。•多模态模型:字节即梦、快手可灵、智谱清影、Vidu、hunyuan-vision、InternVL2、Step-1V、PixVerse V2、智谱实时多模态交互等多模态模型发布。•AI应用:代码助手、AI搜索等AI产...

1、当您付费下载文档后,您只拥有了使用权限,并不意味着购买了版权,文档只能用于自身使用,不得用于其他商业用途(如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利)。
2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。
3、如文档内容存在违规,或者侵犯商业秘密、侵犯著作权等,请点击“违规举报”。

查找下载文件的指引

一、电脑端

- Windows 系统:按下键盘快捷键 `Ctrl + J`,即可打开下载列表。  

- Mac 系统:按下键盘快捷键 `⌘ + J`,即可打开下载列表。  

二、手机端

1. 打开手机浏览器,点击浏览器右下角的 “≡”(或“更多”)图标。  

2. 在弹出的菜单中找到并点击 “下载内容”(或类似选项),即可查看已下载的文件。  

提示:不同浏览器界面略有差异,若未找到“下载”入口,可尝试在浏览器设置中搜索“下载”关键词。


SuperCLUE:中文大模型基准测评2024年10月报告-2024年度中文大模型阶段性进展评估

确认删除?
签到
收藏
足迹
微信
  • 站长微信
回到顶部