NiDD2024A+研发数学峰会Al+ Development Digita summitAI驱动研发变革促进企业降本增效北京站08/16-17大语言模型服务管理的实践分享王夕宁/马元元阿里云
演讲嘉宾NDDA+研发数字峰会王夕宁阿里云容器服务技术研发负责人项相关领域的国际技术专利,专注于Kubemetes/云原生/服务网格等领域。曾在IBM研发中心工作,担任资深架构师和技术专家,主导和参与了一系外SOA中间件和云计算领域的产品研发,并曾担仟中国研发中心专利技术评审委员会主席。出席过行业内多个技术大会,包括Kubecon,InfoQ、ArchSummit, IstioCon和云栖大会等,同时,著有畅销书《Istio服务网格解析与实战》。
NDDA+研发数字缝会1LLM服务管理的特征与挑改N应对思路与方案目录3.现有的技术基础之上扩展支持CONTENTSMSM:用于管理GenAl/LLM工作4.负载的统一方式
DDA+研发数字峰会PART01LLM服务管理的特征与挑战
GenAI/LLM服务管理面临独特的挑战传统网络流量管理GenAI/LLM流量管理请求/响应大小较小由于多模态流量,请求/响应大小较大许多查询可以并行处理.单个大语言模型查询经常占用100%的TPU/GPL计曾叶问请求一到达就进行处理.请求等待可用的计算资源处理时间以毫秒计算处理时间从几秒到几分钟不等相似请求可以从缓存中得到处理·每次请求通常生成唯一内容请求成本由后端管理.根据请求将流量路由到更便宜或更昂贵的模型传统的轮询或基干利用率的流量管理具备AI感知的负载均衡能力2024AI+研发数字峰会|A驱动研发变革促进企业降本增效NDD
流量请求调度Traffic Request Scheduling由于GenAVLLM模型的自回归特性,LLM推理请求的有效服务面临不可预测的执行时间的挑战。LLM服务系统大多采用先进先出(FCFS)调度,遭受行首阻塞(head-of-line)问题,基于历史数据和模型特性,训练出一个代理模型,用于预测每个推理请求的序列长度利用代理模型的序列长度预测的推测最短作业优先(SSIF)调度器。2024Al+研发数字峰会|A驱动研发变革促进企业降本增效NDD
DDA+研发数字峰会PART02应对思路与万案
SSJF调度器-引入Token长度预测器SSJF调度器请求批GPU集群Request-SpeculativeShortestJob模型服务PoolFirst处理R10请求队列的处理000R2<Model,OutputTokenInput>LengthPredictorEndR3Users预测Token长度输出Token长度(N)决定了请求的执行时间(T),因为T=C+KxNK是生成一个标记的延识C是模型服务系统的开销,包括DNS查找、代理、排队和输入标记化K取决于模型优化技术(例如,量化》和执行环境(例如,硬件),对于所有输入都是相同的输出Token长度决定执行时间(线性关系)Ref: https://github.com/James-QiuHaoran/LLM-serving-with-proxy-models2024AI+研发数字峰会|A驱动研发变革促进企业降本增效NDD
智能工作负裁优先级调度令牌桶令牌填充率服务在处理每个请求之前都会与代理进行校验。令牌?获得令牌或者继续等待加权公平排队调度器实施优先级和公平性。高优先级WFQ调度器区日6日日熟尔获得令牌的请求处理中优先级目标服务白白白丢弃的请求处理对请求进行标记低优先级2024AI+研发数字峰会|A驱动研发变革促进企业降本增效NDD
智能工作负载管理-流量调度管理套件工作负载优先级调度策略并发调度策略小好优先处理工作负载,保障关键用通过限制并发中请求的数量,防范服务突然过载。户体验路径超出此限制的任何请求将进入队列,并根据它们的使用权重公平排队,根据业务价优先级在有能力提供服务时予以处理值和请求紧急程度调整资源分用于根据重要性调度请求,同时确保应用遵守并发配,来实现应用程序的优雅降级限制。流量调度管理套件并发速率限制策略统一的流量请求调度器负载坡道策略自适应调整请求速率限制,保护服统一的策略资源定义及基于闭环反馈来逐步增加系统的工作负务不受过载和级联故障的影响荷或请求量,而不是瞬间施加大的负通过细粒度标签识别单个用户根控制器载。据业务特定标签控制爆发能力和能够帮助系统逐步适应增加的负荷,从填充速率而确保系统在负载增加过程中仍然稳定限制每个用户或全局并发中请求运行,并最大限度地减少对系统的冲的并发量出。配额调度策略流量缓存策略·使用全局令牌桶和智能请求排队,根据重要性安...