大型语言模型大型语言模型简介
语言模型还记得简单的n元语言模型吗给单词序列分配概率通过对可能的下一个单词进行采样来生成文本根据从大量文本中计算出的计数进行训练大型语言模型既相似又不同给单词序列分配概率通过对可能的下一个单词进行采样来生成文本通过学习猜测下一个单词来训练
大型语言模型即使只通过预训练来预测单词学到很多有用的语言知识因为训练了大量的文本
大型语言模型的三种架构解码器编码器编码器-解码器GPT,克劳伯特一家,Flan-T5,小声点德,休伯特美洲驼混合的
编码器品种多!流行:掩蔽语言模型(MLMs)伯特家族拥过从内功的周用里词预测里词米训练通常被微调(在监督数据上训练)用于分类任务。
三三编码器-解码器被训练从一个序列映射到另一个序列非常受欢迎:机器翻译(从一种语言映射到另一种语言)语音识别(从声音到文字的映射
大型语言模型大型语言模型简介
大型语言模型大型语言模型:它们能完成什么任务?
好主意很多仟务都叫以变成预测单词的仟务
本次讲座:纯解码器模型也称为:因果LLM自回归LLMs从左到右线性最小二乘法从左到右预测单词
条件生成:根据以前的文本生成文本完成文本语言建模头Softmax未编码层U变压器块编码器因此长的谢谢前缀文本
很多实际的NLP仟务都可以铸为单词预测)情感分析:《我喜欢成龙》1我们给语言模型这个字符串:"我喜欢成龙”这句话的情绪是:2.看看它认为下一个单词是什么p(正句子"我喜欢成龙’的情绪是:)p(负/句子"我喜欢成龙’的情绪是:)
将大量任务框架化为条件生成问答:"物种起源是谁写的"1我们给语言模型这个字符串!问:谁写了《物种起源》这本书?答:2.看看它认为下一个单词是什么《物种起源》这本书是谁写的?答:)3并迭代:《物种起源》这本书是谁写的?查尔斯)
摘要唯一比被大雪困住的马萨诸塞州的一个家伙把粉状的白色东西装箱并在网上出售更疯狂的事情是什么?人们实际上正在购买它。他说,售价89美元,自封的企业家凯尔韦林(Kyle Waring)将把6磅波士顿地区的雪装在一个绝缘的聚苯乙烯泡沫塑料盒子里寄给你,足够10到15个雪球了J原创但如果你住在新英格兰或周围的州,就不是这样了。"我们不会运送雪到东北的任何州!"沃林的网站ShioSnowYo.com如县说,"我们在从事除雪工作!他的网站和社交媒体账户声称已经完成了超过133份雪花订单——仅周二一天就超过30份,这是他最忙的一天。总厚度超过45英寸,波士顿今年冬天创下了历史上降雪最多的月份的记录。大多数居民把堵塞他们院子和人行道的大堆积雪视为讨厌的东西,但韦林看到了机会。据Bos ton. com说,这一切都是从几周前开始的,当时韦林和他的妻子正在波斯顿北部沿海郊区曼彻斯特的院子里铲积雪。他开玩笑说要把这些东西运送给温暖的州的朋友和家人,于是一个想法诞牛了。[摘要凯尔·韦林会把6磅波士顿地区的雪装在一个绝缘的泡沫聚苯乙烯盒子里寄给你一一足够10到15个雪球,他说。但如果你住在新英格兰或周围的州,就不是这样了。
用干摘要的LLM(使用TL:博士)生成的摘要华林(一数学问吧LM磁头三丰丰丰仅仅想法天生的。TL:博士:农生犹连领华林(一数学问居)将原创故事定界符
大型语言模型大型语言模型:它们能完成什么任务?
大型语言模型LLM生成的采样
解码和采样根据模型的概率选择要生成的单词的任务被称为解码。LLM中最常用的解码方法:采样。从单词的模型分布中取样:根据模型分配的概率选择随机单词在每个标记之后,我们将根据基于我们先前选择的概率对要生成的单词进行采样。转换器语言模型将给出概率
随机抽样我wi~ p(w)while wi!=EOS ii+ 1wit:p(wi/wi)
随机抽样不太管片尽管随机抽样大多产生合理的、高概率的单词在分布的尾部有许多奇怪的低概率单词每一个都是低概率的,但是加起来它们构成了分布的大部分所以它们足够被挑选出来产生奇怪的句子
单词抽样的因素:质量和多样性强调高概率单词+质量:更准确,更连贯,申符合事实,-多样性:无聊,重复。强调中等概率单词+多样性:更有创意,甲多样化·质量:较少事实,不连贯
Top-k采样:1.选择单词数k2.对于词汇表V中的每个单词,在给定上下文p(wt|Wt)的情况下,使用语言模型来计算该单词的可能性3.按可能性对单词排序,...