近日, 谷歌公司发布了Gemini 1.5模型, 这一模型备受瞩目, 其放出的Pro版本的功能引发了业界广泛关注, Gemini 1.5 Pro模型的突破之处在于, 它稳定支持高达一百万(1M)长度的上下文, 这意味着在处理文本这种数据形式时, Gemini能更全面、准确地进行分析与理解, 在处理视频这种数据形式时, Gemini能更全面、准确地进行分析与理解, 在处理音频这种特殊数据形式时, Gemini能更全面、准确地进行分析与理解, 在处理代码另一种数据形式时, Gemini能更全面、准确地进行分析与理解。需要特别指出的是, 谷歌公司竟然宣称, 他们于研究里成功开展了对长达10M长度上下文情景的测试, 这给Gemini的后续发展开拓出了更为宽广的可能性。Gemini作为一款原生多模态大模型, 其能够处理的1M tokens信息量, 与一小时的视频、11个小时的音频、3万行的代码或者70万个单词的文本相当。这样的多样性数据处理能力, 让Gemini成为了当今技术领域中备受关注的有力工具。这种具备强大的信息处理能力, 能为模型于不同领域的应用供给无限的可能, 从深入剖析复杂的程序代码, 到理解长篇的文学作品, 从处理并生成高清视频, 到转写以及理解长时间的音频材料, Gemini 1.5模型的能力几乎覆盖了数字信息的所有形态 , 这一系列为数字化信息领域带来了变革性的应用潜力。
面对这样的背景情形, 透彻领会大模型的上下文技术变得格外关键重要, 上下文技术身为大语言模型能力的核心要点之一, 它对模型理解信息的深度广度起着决定性作用, 伴随技术的持续进步, 让模型对上下文处理能力持续得到提升, 而这会直接对模型的应用范围以及应用效果产生影响, 我们会深度探究大语言模型于上下文技术领域当中的技术发展态势以及进展情况, 以此来明白这一领域当下的最新进展状况以及所面临的挑战。
大模型上下文, 一般所讲的是大型语言模型里的上下文, 是指模型在开展生成文本、回答问题或者执行别的任务之际, 能够予以考虑并且参照的前置文本的数量或者范围。在自然语言处理即 NLP 中, 上下文对于理解以及生成连贯、相关且准确的文本意义重大。所以对于一个模型而言, 其能够支持的上下文的最大长度十分关键。
把大型语言模型的上下文长度予以扩展, 由此带来的益处, 大概能够归结于以下这几点:
给予更长的上下文长度, 这能让模型在进行生成文字操作时, 考虑更多之前的文本内容, 进而生成更连贯且与上下文关联度更高的输出, 还能够在回应文字时, 考虑更多前文, 以使生成的内容更连贯且与上下文更相关, 并且能够在继续一段文字时, 顾及更多之前的文本, 从而生成更连贯和与上下文联贯性更强的输出内容, 最终提升完成如文本翻译这类任务的质量。
提高记忆以及参考能力, 准许模型“记住”更多文本信息, 致使它能够生成包含更多信息量的回应, 这对于需要理解并整合一段文本里多个章节的复杂任务特别紧要, 比如对细节信息的探讨及多步骤问题地解答。
应对繁杂任务, 更长的上下文长度致使模型能够处理那些需对长文本具备广泛理解的复杂任务, 像是长文档归纳总结, 依据长文本回答问题等等。
不会丢失更为早期的“记忆”, 所以支持更长对话, 扩展上下文长度能让模型在处理长对话时更具成效, 这对客服聊天机器人等应用而言相当关键。
研究以及开发, 提升上下文长度属于持续改进大语言模型能力的研究工作的一部分, 探索怎样有效管理更长的上下文, 这有可能带动模型架构方面的进步, 还可能带动训练技巧方面的进步, 以及内存管理方面的进步, 进而使得大语言模型变得更强大且高效。
在大语言模型领域内, 尽管大上下文长度确实能够为其带来一连串多样的收益, 然而扩展上下文长度这一行为却实实在在地面临着数目众多的挑战。这些挑战并非局限于单一的某个范畴, 而是广泛地不仅涉及到技术层面的难点, 而且还涵盖了计算资源方面的相关问题以及优化策略等诸多不同的方面:
计算资源需求呈现出增加的态势, 处理更长的上下文, 这必然需要更多的计算能力, 这也就意味着, 模型训练的时间会增加, 并且推理的时间同样会增加, 与此同时, 对硬件, 诸如GPU或者TPU的需求也会增加, 进而导致成本上升。
随着上下文长度不断增加, 模型处理输入阶段所需内存也跟着增加, 当前硬件与模型架构在一定程度上限制了能用来处理这些大量数据的内存大小, 这有可能致使效率不高乃至于无法处理特别长的上下文。
在训练模型之际, 伴随模型深度的不断增加, 会有梯度消失或者爆炸, 也就是Vanishing/Exploding Gradients的情况出现。哪怕像残差连接, 即Residual Connections以及层归一化, 也就是Layer Normalization这类技术能够对该问题起到缓解作用, 然而在处理极为长的序列时, 此等问题依旧有可能对模型的学习能力产生影响。
注意力机制存在局限性, 现有的大语言模型一般是基于Transformer结构的, 注意力机制是这个结构的关键构成部分, 它的计算复杂度跟序列长度的平方呈现正相关, 这就表明增加上下文长度会让计算成本显著增长。
对于数据稀疏性而言, 上下文长度要是增加了, 那么就有可能致使数据稀疏性这个问题出现, 也就是说模型在进行训练的进程当中, 并没有充足的数据能用来学习长上下文中所存在的长距离依赖关系世界杯直播观看开云app在线入口,开云真人官方下载,而这个问题很容易使得模型出现过拟合现象。
能效平衡方面, 扩展上下文长度, 这一行为虽说能够使模型的性能得以提升, 然而却也存在会致使效率下降的可能性。开发者要在模型的计算效率以及任务性能之间再度探寻平衡点, 而达成此点或许需要进行复杂的优化策略调整。
训练成本
扩展大模型上下文长度存在难点, 其中之一便是训练成本, 这是因为此处涉及大型企业, 还关联个人用户的预算投入。OpenAI的CEO名为Sam Altman , 此人曾被问到GPT-3这样的项目花费是否达数百万美元, 他给出的回答是 “更高。” 依据此回答可推测出, GPT - 3的训成本有可能超出千万美元。国盛证券有一份报告, 报告中依据GPT - 3所需设备, 还有电力以及计算量能够得出下面的等式。这意味着, GPT - 3训练一次大概需要140万美元。GPT - 3在2020年就发布了,当下有参数更多且能力更强的大模型,可想而知这样情况下可能需投入数倍大于GPT - 3所需物品等。

现有大语言模型上下文长度
现存的大语言模型为其提供支持的那个上下文长度, 是各式各样的, 并不相同。需要你特别留意的是, 那个最大能够提供支持的上下文长度, 可不是用来衡量模型具备的能力的唯一一项指标, 能够支持更为大一些的上下文长度, 并不一定就意味着模型在各个方面都有着更为出色一些的时候表现。比如说GPT - 4最大能够支持128k的上下文, Claude 2.1最大能够支持200k的上下文, 然而这两个模型却各自有着各自的长处。下面陈列了出了一堆国内外的大模型产品以及它们所能够支持的上下文长度。

扩展上下文长度的技术有哪些
用来扩展上下文长度的技术, 通常能够被归结为内插法, 也就是interpolation, 以及外推法, 即extrapolation。内插法借助于从不一样的来源或者上下文中去合并信息, 以此来提升预测的准确性。此项技术适用于融合源自不同文本段落或者怀有不同上下文长度的模型的信息。与之相反, 外推法是作用于预测超出观察数据范围的值, 其目的在于扩大模型对于其原本设定的训练上下文长度之外的理解。每一种方法之下, 还能够进一步细分成零样本学习, 也就是zero-shot learning, 以及微调, 也就是fine-tuning。零样本学习的目的在于, 使模型学会正确地预测在训练期间从未明确见过的任务。而微调指的是, 为一个预训练模型在较小的、特定于某个任务的数据集上进一步训练或者调整, 进而提高其在具体任务上的表现。在下文当中, 将会着重介绍外推法下零样本学习的几种技术。
旋转位置嵌入, 也就是RoPE(Rotary Position Embedding)。
有这样一种编码方式, 叫旋转式位置编码, 也就是RoPE, 它会运用序列之内各个token的相对位置信息去施行编码操作, 这能让模型不被固定长度的输入所限制, 进而能够支持更长的上下文长度。在针对token开展编码之际, 凭借旋转矩阵, 以不一样的速度把query和key的投影矩阵的片段去进行旋转, 如此一来, 哪怕是两个有相同编码的token, 也都能够各自获取到唯一角度的旋转。跟最原始的绝对位置信息编码相比较, query和key的点积出现了改变, 进而使得注意力得分发生了变化。假如旋转加大了 query 与 key 的差异, 那么点积以及注意力得分就会降低;要是旋转让 query 和 key 更为对齐, 得分就会提升。RoPE 精细地规定了嵌入维度里 query 和 key 向量的全部二条目切片的旋转, 进而构建了一种能够精细化处理不同距离 token 的注意力得分函数。RoPE 有一个优势是它仅仅依赖 query 和 key 之间的相对距离, 去除了对绝对位置的需求。这种方式强化了模型针对token间关联的领会, 进而于注意力公式里推动了更为精确的预估。下方的图是一个RoPE原理的实例展示。

该论文所处位置由http://arxiv.org/abs/2104.09864所呈现 , 是这样的地址。
对带有线性偏差的注意力机制(ALiBi)予以关注 , 有线性偏差的注意力机制(ALiBi)。
RoPE在零样本学习这种情况下的外推, 一般是被认定为表现不太好的, 然而, ALiBi把这个状况给改进了。在最初始的Transformer架构里头, 对于一个长度被表示成L的输入序列而言, 标准的注意力层在每个头当中, 会为第i个query运用前i个key去计算注意力分数, 这些分数, 是会乘上一个缩放因子的, 之后再输入到softmax函数里面。在这一操作之后所得到的注意力分数, 随后又会乘上value向量, 以此来产生注意力层当下的输出。然而在ALiBi里, 神经网络之中的任何一个环节, 都不含有绝对位置编码。Alibi在计算得出query以及key的点积之时, 增添了一个静态的、并非通过学习而获取的偏差(bias)m。在一些文本当中, 单词跟其上下文的意义呈现出非线性关系, 而Alibi能够有效地应对这种情形。与此同时, 由于结构简单, Alibi能够被轻松适应融入已有的模型项目, 并且降低训练成本。下式是一个简单的示例。
论文的地址是, https://arxiv.org/pdf/2108.12409.pdf, 是这样的。
随机化的位置编码 , 是一种编码方式 , 其中位置是随机化的 , 且具有编码的特性。
随机位置编码 也就是 Randomized Positional Encodings , 它致力于去解决这样的问题 , 那就是 , 要是有一个配备了标准位置编码的transformer模型 , 它使用序列最大长度为N的数据来训练 , 当这个模型碰到一个测试序列长度超越M且M大于N时 , 位置编码就会重新分布 , 进而致使与训练时的编码不相同开运真人app下载苹果版,开运真人app下载,随着M的增大 , 这种不一致愈发显著。做法是随机位置编码, 在训练期间, 要通过从范围里均匀地进行抽取N个样本, 以此来随机生成位置向量, 当中N是训练上下文长度, L是一个预先设定好的大于模型最大支持上下文长度的那个值。这些被抽取的位置随后是按递增顺序来排序的, 然后会作为位置输入传递给模型。跟传统方法相比较的话, 随机位置编码允许在更短的序列之上进行训练, 在保持有较高测试准确率的同时还缩短了模型训练的时间。需要留意的是, 随机相对编码对先前方法觉得颇具挑战性的任务进行了处理, 像是解决反转字符串或者缺失重复项这类问题。下面的图是随机位置编码原理的一个简单示例。

论文地址https://aclanthology.org/2023.acl-short.161.pdf
可外推位置嵌入, 也就是xPos, 具备提高transformer对平移变化抵抗力的能力, 同时还拥有外推上下文长度的本事。xPos的作者觉得, RoPE外推效果不理想, 原因在于高频分量致使注意力得分里含有残余噪声, 哪怕token相隔甚远, 这种现象依旧会出现。于是呢, 在RoPE的基础之上, xPos于旋转向量的每个维度引入了独特的指数衰减, 其幅度会随着旋转度的增加而变小。这种特性致使这些噪声高频部分的衰减速率比低频部分更快, 进而缓和训练进程里伴随距离增加竟出现的不稳定性。实验证实, 此种方法于从头展开训练的大型语言模型上展现出了不错的成效。xPos的表达是这样的, 有一个ζ是优化好的值, 它能够减轻噪声的干扰效果标点符号。

“论文地址”, 这是一个特定指向的内容, 它是“http://arxiv.org/abs/2212.10554”这样一个网络链接地址。
LongNet
LongNet把扩张注意力(Dilated Attention)这个概念给引入了, 在LongNet里, 输入的(Q, K, V)被划分成长度是w的段, 这些段沿着序列的维度(序列维度是N), 利用行选择间隔r来进行稀疏化, 为了得到注意力, 进行稀疏化的段会被并行计算, 之后经过分散(scatter)以及连接(concatenation)进而形成输出。用来在注意力的全局性跟效率之间获取平衡的是段大小w, 而借助近似注意力矩阵来削减计算成本的是扩张行选择间隔r。借助分散以及连接的操作, 扩张注意力能够顺顺利利转换为稠密注意力, 所以能够运用为原始注意力机制设计的优化策略, 比如说flash attention。这种转换致使跟原始的注意力机制比较而言, 计算成本降低了N/w*r^2。下图是LongNet的原理示例。

这篇论文的地址是, http://arxiv.org/abs/, 2307.02486。
新技术推动人工智能处理复杂内容能力提升, 如Gemini 1.5模型所展示, 揭示未来AI发展新方向。大模型借助RoPE、ALiBi和随机位置编码等创新, 高效管理利用大量数据, 在多种任务中实现精准理解与生成。尽管进步伴随计算资源、内存限制和训练成本等挑战, 不过通过持续研究开发, 这些挑战会逐步被克服。往后, 跟着这种上下文技术持续地完善以及优化, 我们能够期望大模型在那些自然语言处理、多模态交互还有复杂问题解决等方面展现出更为重大的作用, 所以带来更为深远的影响。
标签: Gemini1.5Pro 大模型上下文 上下文技术 自然语言处理 多模态大模型
还木有评论哦,快来抢沙发吧~