全校Al公开课DeepSeeks禾来AI创新DeepSeek核心技术白话解读嘉宾:王鹏西北工业大学计算机学院教授国家级人才王鹏西北工业大学计算机学院2025年2月26日空天地海一体化大数据应用技术国家工程实验室报告主题:DeepSeek核心技术白话解读
全校AI公开课DeepSeeks禾来AI创新第一部分引言嘉宾:王鹏西北工业大学计算机学院教授国家级人才报告主题:DeepSeek核心技术白话解读
全校Al公开课DeepSeeks未来AI创新DeepSeek的突破性定位首个低成本、高性能的开源大语言模型性能比肩GPT-4、OpenAl-01等顶尖闭源大模型,训练成本仅为后者的5%-109嘉宾:王鹏西北工业大学计算机学院教授国家级人才DeepSeek-V3性能DeepSeek-R1性能报告主题:DeepSeek核心技术白话解读
全校Al公开课DeepSeeks禾来AI创新DeepSeek的几个版本通用计对标DeepSeek有语言和推理模型,及模型对应的满血蒸馏等诸多版本语言大模型DeepSeek-V3满血满血上线心DeepSeek完整的版本deepseek性能强大但计算开销大推理::版本通用语言大模型,探家未量之境对标ChatGPT模型不变,通量化过降低参数精嘉宾:王鹏推理大模型DeepSeek-R1版本提高推理度效率西北工业大学计算机学院教授国家级人才先思考后回答将大型模型的知对标OpenAl-01蒸馏识压编到更小的版本模型中,性能稍弱恒轻便高效报告主题:DeepSeek核心技术白话解读
全校Al公开课DeepSeeks禾来AI创新DeepSeek技术创新的核心逻辑核心逻辑:用更少的成本做更多的事技术创新功能实现终极目标更少的成本更少的模型参数学习策略更少的计算存储嘉宾:王鹏模型框架西北工业大学计算机学院教授更少的通讯开销国家级人才工程实现更少的数据标注报告主题:DeepSeek核心技术白话解读
全校AI公开课DeepSeek与禾来AI创瓶2.1学习策略创新:背景知识机器学习模型种映射,在给定输入情况(x)下、输出一定结果的函数f(x)机器学习:根据反馈信号调整模型的参数,以使模型的表现符合预期+输入模型输出嘉宾:王鹏西北工业大学计算机学院教授国家级人才反馈信号报告主题:DeepSeek核心技术白话解读
全校AI公开课DeepSeek与禾来AI创瓶2.1学习策略创新:背景知识监督学习和强化学习是两种常见的机器学习策略监督学习:直接的指导性的反馈类比:老师手把手教你做题,直接告诉你解题思路3星优势:学习目标明确,训练效率高,易收敛模型劣势:依赖标注数据,泛化能力受限嘉宾:王鹏强化学习:间接的评估性的反馈西北工业大学计算机学院教授类比:只告诉你答案是否正确,不指导解题思路国家级人才优势:无需标注数据,可处理开放性问题劣势:需大量试错,训练效率低,难收敛报告主题:DeepSeek核心技术白话解读
全校AI公开课DeepSeek与禾来AI创瓶2.1学习策略创新:背景知识在海监督大模型训练流程:预训练+后训练预训练后训练在海量文本数据上进行"下一词预测"的(自)监督微调,在少显带有思考过程(思维链)的监督学习,用于学习足够多的语言知识监督数据上进行"下一词预测"学习,用于激发推理能力预训练思维连监督微调嘉宾:王鹏西北工业大学计算机学院教授国家级人才随机初始化报告主题:DeepSeek核心技术白话解读
全校Al公开课DeepSeek与禾来AI创新2.1学习策略创新:算法实现DeepSeek:首次在后训练阶段用强化学习完全代替监督微调(R1-Zero)。采用的GRPO算法放弃了对思维过程进行监督的执念,去除了过程价值评分模型(critic)嘉宾:王鹏www西北工业大学计算机学院教授国家级人才DeepSeek-R1-Zero的强化学习曲线DeepSeek-R1-Zero平均响应长度逐渐增加神奇之处:通过一个不需要思维链标注、不需要过程监督、依靠最简单的反馈信号依赖很少的学习循环次数的极其简单的后训练流程,就可大幅提升模型的推理能力。报告主题:DeepSeek核心技术白话解读
全校AI公开课DeepSeek与禾来AI创新2.1学习策略创新:顿悟时刻行有不得,反求诸己,我悟出了更好的eaDeepSeek-R1-Zero中一个有趣的"顿悟时刻该模型学会了使用拟人化的Wai语气进行重新思考,<think4teequationyo-ya+x=,let'satby sqpuring both-sVa-Ve+xRearangetoisohate the inet squrerodtarme-fmatx2-207+(29-a+xo-2ot-x+(o-o)-0像人一样有顿悟的时刻,让嘉宾:王鹏我们见证了强化学习的...