Chatting or Acting?-DeepSeek的突破边界与浙大先生的未来图景陈文智浙江大学信息技术中心浙江大学人工智能教育教学研究中心2025年02月17日
小抖音浙江大学文发UNITREEB2-W天赐觉醒小鹏飞行汽车博!我是De上天了我你这不那然后好餐130
我也想来一套,在线用or本地部署?明天中午前,我要看到DS接入!@NVIDIAddeepseek用OpenAl训练的吧?吹!这就是传说中的国运级产品吗?我刚刚开发的智能体能用吗?成本这么低,西湖之光不用了吧?这玩意儿凭啥这么强?Agent是不是也要变强了?
DeepSeek关键词浙江大学DeepSeekDeepDrinkMoring开源生态-7AfoakeMOE架构面运级创新1方量化需求刚起热情款待,方案已至VS商谈愉快打破西方量杭州/神秘的季有有梦灵感闪现深入交流,国运级创新多token预测原型立现合作共赢混合专家模型(MoE)英作达南
01DeepSeek突破边界ChattingorActingDepSes的突破边界与浙大先生的未来图惯
DeepSeek席卷全球浙江大学deepseek引爆全球,高性能、低成本的国产、开源大模型超级产品增长1亿用户所用的时间产品增长1亿用户花费时间Depinsk7美年2个月DeepSeek-R1已发布并开源,性能对比OpenAlo1正式版,在目前大模型主流榜单中DeepSeek-V3在开源模型中位列榜近期因开源入大楼型和相关技术火爆全球,DeepSeek-DeepSeek一有史以来最快获得1首,与世界上最先进的闭源模型不分度在140多个国家的应用商店下载排行首位。亿注册用户的APP.伯仲。
DeepSeek模型架构创新浙江大学采用MoE架构并解决路由崩溃难题DeepSeekMoE用0000--0000RoutedExpertOutputHiddenh{SharedExpertN,-1Routerdhdal Top-K,0000--0000ImputHiddenu,O0C000000000000000000000000MOE
DeepSeek模型架构创新浙江大学MLA多头潜在注意力机制降低成本、提高效率柏拉图表征假说RNNee+HMM隐马尔卡夫链神经网络时代神经网络时代Transfoermer时代(HMM)(RNN)(LSTM)(Attention)
DeepSeek模型架构创新浙江大学MLA多头潜在注意力机制降低成本、提高效率startRainyWalkCleanShop中年中RNNee0HMM神经网络时代神经网络时代Transfoermer时代隐马尔卡夫链(RNN)(LSTM)(Attention)品星印印(HMM)
DeepSeek模型架构创新浙江大学MLA多头潜在注意力机制降低成本、提高效率RNN中甲ee+HMM隐马尔卡夫链神经网络时代神经网络时代Transfoermer时代(HMM)(RNN)(LSTM)(Attention)丽号如新
DeepSeek模型架构创新浙江大学MLA多头潜在注意力机制降低成本、提高效率RNNHMM隐马尔卡夫链神经网络时代神经网络时代Transfoermer时代(HMM)(RNN)(Attention)(LSTM)丽号如新
DeepSeek模型架构创新浙江大学MLA多头潜在注意力机制降低成本、提高效率RNNee0HMM隐马尔卡夫链神经网络时代神经网络时代Transfoermer时代(HMM)(RNN)(LSTM)(Attention)
DeepSeek模型架构创新浙江大学MLA多头潜在注意力机制降低成本、提高效率相同信息Multi-Head Latent Attention(MLA)CachedDuringInferenceOutputHiddenur0OOO0000多头Multi-HeadAttention(af;l(kE;k5concatenateconcatenate电饭煲盐桐牌新疆麻椒鸡国锅炒鸡使用信息opplyapplyROPEROPE[00-00]LatentcfLatentc'2黄焖鸡白切烤新疆大盘鸡InputHidenh,(Q000--0000台式三杯鸡地锅鸡口水鸡成号扣新
DeepSeek工程优化浙江大学DualPipe流水线并行:双向流水线设计(同时从两端馈送micro-batch),显著减少流水线气泡,GPU利用率提升30%+MLPB)AMLPYW)MLPF)AATTN(B)AATTN(W)AATTN(F)ADISPATCH(B)ACOMBINE(B)2:0239门..2012063103102中8。8ForwardBackwardBatkwardforinput通信优化:内存管理优化节点限制路由(每个Token最多重计算策略(反向传播时重新生跨4节点)、定制化AI-to-Al通成中间结果)、CPU存储EMA信内核,结合Warp专业化调度,参数,显存占用减少20%降低跨节点通信开销
DeepSeek预训练数据与策略浙江大学数据构建14.8万(7Token多样化语料,教学与编程数据比例提升,支持多语言任务。通多Token预测(MTP)同时预测多个未来Token,训练效率提升1.8倍,推理加速显著长上下文扩展:两阶段扩展训练(4K-32K—128K),结合YaRN方法,支持128K上下文窗口TransformerBlockTransformerBlockLinearProjectionTransformerBlockX...