浙江大学ZHEJIANGUNIVEHSITYDeepSeek智能时代的全面到来和人机协作的新常态孙凌云教授计算机科学与技术学院2025年2月
浙江大学ZHEJIANGUNIVEHSITT一、智能演变二、人机协作三、产业现状四、教育成长
GPT背后的大数据浙江大学GPT训练数据规模史无前例维基杂志RedditCommon其他总计书籍Crawl数据从2018年的GPT-1百科期刊链接到2020年的GPT-3,GPT-14.64.6模型预训练数据量从4.6GB增加到了45TBGPT-24045TB相当于三千万本《西游记》GPT-311.42110150570753ThePilevl611824463227167825主要模型数据集包括:Megatron-3810711.44.616111B维基百科数据集(庞大的客观知识)MT-NLG6.411877639831271374-书籍(故事讲述能力与反应)Gopher12.52100164.43450482310550杂志期刊(语言生成的严谨)Github代码等其他数据(逻辑推理表:主要数据集大小汇总,以GB为单位。公开的数据集以粗体表示确定的数据以料体表示。Common Caaw数据集过滤乙前为451来源:OpenAl团队, Language Models are Few-ShotLearners, https:/ /arxiv, org/ abs/2005.14165,2022年7月22日
DeepSeek背后的数据:营养搭配+错题训练+循序渐进浙江大学ZHEJIANGUNIVERBIT对比维度GPT-3DeepSeek-V3发布时间2020年6月2024年12月训练数据量3000token14.8万亿token参数量175B(密集架构)671B(MoE架构)训练成本$12M$5.57M激活参数量175B(全激活)37B(5.5%激活率)主要数据类型通用互联网文本(含代码/数学)强化代码/数学的高质量数据官方来源OpenAl技术论文HuggingFace模型卡由AI(DeepSeekR1)搜集并整理,经人工检查
大模型带来大知识全体人类知识空间多媒体知识空间大模型知识空间个体知识空间观占来白:北京大学黄铁盟教授2023在3月31日
浙江大学ZHEJIANGUNIVERSITT三体人如何学习地球知识?
浙江大学ZHEJIANGUNIVERSITT三体人如何堂习地我知识电磁波探测器拯救派
浙江大学ZHEJIANGUNIVERSITT二休人如何学习地球知识?电磁波探测器拯救派地球文明信息探测器搜集数据集人类反馈实现对齐原始数据、无目标性精准观察、查漏补缺动态反馈、价值博弈
浙江大学ZHEJIANGUNIVERSITT二休人如何学习地球知识?电磁波探测器拯救派地球文明信息探测器搜集数据集人类反馈实现对齐原始数据、无目标件精准观察、查漏补缺动态反馈、价值博弈原始数据基建定向能力强化价值观校准
浙江大学ZHEJIANGUNIVERSITT三体人如何学习地球知识?电磁波探测器拯救派预训练监督微调人类反馈强化学习Pre-trainingSupervised Fine-TuningReinforcementlearning(SFT)human feedback(RLHF)参考GPTAssistantTrainingPpelneAndre Karpathy, How to train your (Chat) GPt Assistant-An emerging recipe, 2023年5月25日
浙江大学ZHEJIANGUNIVERSITT二休人如何学习地球知识?电磁波探测器+拯救派基础模型强化学习DeepSeek-V3-BaseReinforcement learning/GRPODeenSeek-R1-Zero的训练过程结合准确性奖励(数学、编程等任务的可验证结果)和格式奖励(强制输出结构化标签),通过GRPO算法优化模型htps:/ /huggingface. co/papers/2501.129482025年1月22日
浙江大学ZHEJIANGUNIVERSITT二休人如何学习地球知识?电磁波探测器+拯救派基础模型强化学习DeepSeek-V3-BaseReinforcement learnina /GRpo数学题自动判分/编程题实战演练/阶梯进化DeenSeek-R1-Zero的训练过程结合准确性奖励(数学、编程等任务的可验证结果)和格式奖励(强制输出结构化标签),通过GRPO算法优化模型htps:/huggingface.co/papers/2501.129482025年1月22日
思维链加入训练浙江大学ZHEJIANGUNIVERBIT强制输出过程A conversationbetweenUserandAssistantThe user asks a question, and the Assistant solves itThe assistant first thinks about the reasoning process in themind and then provides the user with the answer.<think></think>标签内The reasoning process and answer are enclosed withinsthink></think@ and <answer></answer> tags, respectively,是推理过程ie. sthink@ reasoninq process here</think><answer><answer</a...