
大型语言模型如何生成响应? | AI 监测常见问题
了解 LLM 如何通过分词、Transformer 架构、注意力机制和概率预测生成响应。深入学习 AI 答案生成的技术流程。

一种基于多头自注意力机制的神经网络架构,可并行处理序列数据,支撑了ChatGPT、Claude和Perplexity等现代大语言模型的发展。该架构于2017年论文《Attention is All You Need》中提出,已成为几乎所有最先进AI系统的基础技术。
一种基于多头自注意力机制的神经网络架构,可并行处理序列数据,支撑了ChatGPT、Claude和Perplexity等现代大语言模型的发展。该架构于2017年论文《Attention is All You Need》中提出,已成为几乎所有最先进AI系统的基础技术。
Transformer 架构是一种革命性的神经网络设计,由 Google 的研究人员在 2017 年论文《Attention is All You Need》中提出。它从根本上基于多头自注意力机制,使模型能够并行而非顺序地处理整个序列数据。该架构由堆叠的编码器和解码器层组成,每层包含自注意力子层和前馈神经网络,通过残差连接和层归一化相连。Transformer 架构已成为几乎所有现代大语言模型(LLM)(包括 ChatGPT、Claude、Perplexity 和 Google AI Overviews)的基础技术,可以说是过去十年中最重要的神经网络创新。
Transformer 架构的意义远不止于其技术优雅性。2017 年的《Attention is All You Need》论文已被引用超过 208,000 次,成为机器学习历史上最具影响力的研究论文之一。这一架构从根本上改变了 AI 系统处理和理解语言的方式,使得开发拥有数十亿参数、能够进行复杂推理、创造性写作和解决复杂问题的模型成为可能。几乎完全建立在 transformer 技术之上的企业 LLM 市场在 2024 年估值达 67 亿美元,预计到 2034 年将以 26.1% 的年复合增长率增长,这充分证明了该架构对现代 AI 基础设施的关键重要性。
Transformer 架构的发展代表了深度学习历史上的一个关键时刻,它源于数十年来对序列数据处理神经网络的研究。在 transformer 出现之前,循环神经网络(RNN)及其变体,特别是长短期记忆(LSTM)网络,主导了自然语言处理任务。然而,这些架构存在根本性局限:它们顺序处理序列,一次处理一个元素,导致训练速度慢,且难以捕获长序列中远距离元素之间的依赖关系。梯度消失问题进一步限制了 RNN 从长距离关系中学习的能力,因为梯度在通过许多层反向传播时会呈指数级缩小。
2014 年 Bahdanau 及其同事引入的注意力机制提供了一个突破,使模型能够关注输入序列中的相关部分,无论距离远近。然而,注意力最初是作为 RNN 的增强功能而非替代品。2017 年的 Transformer 论文进一步推进了这一概念,提出了注意力就是你所需要的一切——即整个神经网络架构可以仅使用注意力机制和前馈层构建,完全消除递归。这一见解具有变革性。通过消除顺序处理,transformer 实现了大规模并行化,使研究人员能够利用 GPU 和 TPU 以前所未有的数据量进行训练。原始论文中最大的 transformer 模型在 8 块 GPU 上训练了 3.5 天,证明了规模和并行化可以带来显著提升的性能。
在原始 transformer 论文之后,该架构迅速发展。Google 于 2019 年发布的 BERT(来自 Transformer 的双向编码器表示) 证明了 transformer 编码器可以在大规模文本语料库上进行预训练,并针对多种下游任务进行微调。BERT 最大的模型包含 3.45 亿个参数,在 64 个专用 TPU 上训练了四天,预估成本为 7,000 美元,却在众多语言理解基准测试中取得了最先进的结果。与此同时,OpenAI 的 GPT 系列走了一条不同的道路,使用仅解码器的 transformer 架构进行语言建模任务训练。拥有 15 亿参数的 GPT-2 令研究社区感到惊讶,它证明了仅靠语言建模就能产生能力 remarkably 强大的系统。拥有 1750 亿参数的 GPT-3 展示了涌现能力——仅在大规模下才出现的能力,包括少样本学习和复杂推理——这从根本上改变了人们对 AI 系统能力的预期。
Transformer 架构由多个相互关联的技术组件组成,它们协同工作以实现高效的并行处理和复杂的上下文理解。输入嵌入层将离散标记(词或子词单元)转换为连续向量表示,通常维度为 512 或更高。这些嵌入随后通过位置编码进行增强,使用不同频率的正弦和余弦函数为每个标记在序列中的位置添加信息。这种位置信息至关重要,因为与通过循环结构固有地保留序列顺序的 RNN 不同,transformer 同时处理所有标记,需要显式的位置信号来理解词序和相对距离。
自注意力机制是使 transformer 区别于所有以往神经网络设计的架构创新。对于输入序列中的每个标记,模型计算三个向量:Query 向量(表示该标记正在寻找什么信息)、Key 向量(表示每个标记包含什么信息)和 Value 向量(表示要传递的实际信息)。注意力机制通过点积计算每个标记的 Query 与所有标记的 Key 之间的相似度得分,使用 softmax 将这些得分归一化为介于 0 和 1 之间的注意力权重,然后使用这些权重对 Value 向量进行加权求和。这一过程允许每个标记选择性地关注其他相关标记,使模型能够理解上下文和关系。
多头注意力通过同时运行多个并行注意力机制扩展了这一概念,通常为 8、12 或 16 个头。每个头在 Query、Key 和 Value 向量的不同线性投影上操作,允许模型在不同的表示子空间中关注不同类型的关系和模式。例如,一个注意力头可能关注词之间的句法关系,而另一个头关注语义关系或长程依赖关系。所有头的输出被拼接在一起并进行线性变换,为模型提供丰富的、多方面的上下文信息。这种方法已被证明非常有效,研究表明不同的头学会了专注于不同的语言现象。
编码器-解码器结构将这些注意力机制组织成一个分层处理流程。编码器由多个堆叠层(通常为 6 层或更多)组成,每层包含一个多头自注意力子层,后跟一个逐位置的前馈网络。每个子层周围的残差连接允许梯度在训练过程中直接流过网络,提高了稳定性,使更深的架构成为可能。每个子层后应用层归一化,对激活进行归一化以在整个网络中保持一致的尺度。解码器具有类似的结构,但增加了一个编码器-解码器注意力层,允许解码器关注编码器的输出,使模型在生成每个输出标记时能够关注输入的相关部分。在像 GPT 这样的仅解码器架构中,解码器自回归地生成输出标记,每个新标记以所有先前生成的标记为条件。
| 方面 | Transformer 架构 | RNN/LSTM | 卷积神经网络(CNN) |
|---|---|---|---|
| 处理方式 | 使用注意力并行处理整个序列 | 顺序处理,一次一个元素 | 固定大小窗口上的局部卷积操作 |
| 长程依赖 | 优秀;注意力可直接连接远距离标记 | 较差;受限于梯度消失和顺序瓶颈 | 有限;局部感受野需要多层堆叠 |
| 训练速度 | 非常快;GPU/TPU 大规模并行化 | 慢;顺序处理阻止并行化 | 固定大小输入时快;不太适合变长序列 |
| 内存需求 | 高;因注意力机制呈序列长度的二次方 | 较低;与序列长度成线性关系 | 中等;取决于核大小和深度 |
| 可扩展性 | 优秀;可扩展到数十亿参数 | 有限;难以训练非常大的模型 | 图像方面好;不太适合序列 |
| 典型应用 | 语言建模、机器翻译、文本生成 | 时间序列、顺序预测(现在较少见) | 图像分类、目标检测、计算机视觉 |
| 梯度流 | 稳定;残差连接支持深度网络 | 有问题;梯度消失/爆炸 | 通常稳定;局部连接有助于梯度流 |
| 位置信息 | 需要显式位置编码 | 通过顺序处理隐式获得 | 通过空间结构隐式获得 |
| 最先进的 LLM | GPT、Claude、Llama、Granite、Perplexity | 现代 LLM 中很少使用 | 不用于语言建模 |
Transformer 架构与现代大语言模型之间的关系是根本性的、不可分割的。过去五年中发布的每一个主要 LLM——包括 OpenAI 的 GPT-4、Anthropic 的 Claude、Meta 的 Llama、Google 的 Gemini、IBM 的 Granite 和 Perplexity 的 AI 模型——都建立在 transformer 架构之上。该架构能够随模型大小和训练数据高效扩展,这对实现定义现代 AI 系统的能力至关重要。当研究人员将模型大小从数百万增加到数十亿再到数千亿参数时,transformer 架构的并行化和注意力机制使这种扩展成为可能,而无需成比例地增加训练时间。
大多数现代 LLM 使用的自回归解码过程是 transformer 解码器架构的直接应用。在生成文本时,这些模型通过编码器(或者在仅解码器模型中,通过整个解码器)处理输入提示,然后逐个生成输出标记。每个新标记通过使用 softmax 计算整个词汇表上的概率分布来生成,模型选择概率最高的标记(或根据温度设置从分布中采样)。这个过程重复数百或数千次,产生连贯且与上下文相适应的文本。自注意力机制使模型能够在整个生成的序列中保持上下文,使其能够生成维持一致主题、人物和逻辑流程的长篇连贯段落。
在大型 transformer 模型中观察到的涌现能力——仅在足够规模下出现的能力,如少样本学习、思维链推理和上下文学习——是 transformer 架构设计的直接结果。多头注意力机制捕获多样关系的能力,加上模型庞大的参数量和多样化数据的训练,使这些系统能够执行它们从未被明确训练过的任务。例如,GPT-3 尽管仅受语言建模训练,却能进行算术运算、编写代码和回答常识问题。这些涌现特性使基于 transformer 的 LLM 成为现代 AI 革命的基础,应用范围从对话式 AI 和内容生成到代码合成和科研辅助。
自注意力机制是使 transformer 从根本上区别于以往方法并解释其优越性能的架构创新。要理解自注意力,请考虑解释语言中模糊代词的挑战。在句子"The trophy doesn’t fit in the suitcase because it is too large"中,代词"it"可能指代奖杯或手提箱,但上下文清楚地表明它指的是奖杯。在句子"The trophy doesn’t fit in the suitcase because it is too small"中,同一个代词现在指的是手提箱。Transformer 模型必须通过学习理解词之间的关系来解决此类歧义。
自注意力通过一个数学上优雅的过程实现这一点。对于输入序列中的每个标记,模型通过将标记的嵌入乘以学习到的权重矩阵WQ来计算 Query 向量。类似地,它为所有标记计算 Key 向量(使用WK)和 Value 向量(使用WV)。标记的 Query 与另一个标记的 Key 之间的注意力得分计算为这些向量的点积,除以键维度的平方根(通常为 √64 ≈ 8)。这些原始得分随后通过 softmax 函数,转换为和为 1 的归一化注意力权重。最后,每个标记的输出计算为所有 Value 向量的加权和,其中权重即为注意力得分。这一过程允许每个标记选择性地从所有其他标记聚合信息,权重在训练过程中学习以捕获有意义的联系。
自注意力的数学优雅性使其计算高效。整个过程可以表示为矩阵运算:Attention(Q, K, V) = softmax(QK^T / √d_k)V,其中 Q、K 和 V 分别包含所有 Query、Key 和 Value 向量的矩阵。这种矩阵形式实现了 GPU 加速,使 transformer 能够并行处理整个序列而非顺序处理。一个 512 个标记的序列可以在与 RNN 中处理单个标记大致相同的时间内完成处理,使 transformer 的训练速度提高数个数量级。这种计算效率,加上注意力机制捕获长程依赖关系的能力,解释了为什么 transformer 已成为语言建模的主导架构。
多头注意力通过运行多个并行注意力操作扩展了自注意力机制,每个操作学习标记关系的不同方面。在一个具有 8 个注意力头的典型 transformer 中,输入嵌入被线性投影到 8 个不同的表示子空间中,每个子空间有自己的 Query、Key 和 Value 权重矩阵。每个头独立计算注意力权重并产生输出向量。这些输出随后被拼接在一起,通过最终的权重矩阵进行线性变换,产生最终的多头注意力输出。这种架构允许模型同时关注来自不同表示子空间和不同位置的信息。
分析已训练 transformer 模型的研究揭示了不同的注意力头专门处理不同的语言现象。一些头关注句法关系,学习关注语法相关的词(如动词关注其主语和宾语)。其他头关注语义关系,学习关注具有相关含义的词。还有一些头捕获长程依赖关系,关注序列中相隔较远但在语义上相关的词。有些头甚至学会了主要关注当前标记本身,有效地充当恒等操作。这种专门化是在训练过程中无需显式监督自然出现的,证明了多头架构学习多样化、互补表示的能力。
注意力头的数量是一个关键的架构超参数。较大的模型通常使用更多的头(16、32 或甚至更多),使它们能够捕获更多样化的关系。然而,注意力计算的总维度通常是固定的,因此更多的头意味着每个头的维度更低。这种设计权衡了多个表示子空间的好处和计算效率。多头方法已被证明非常有效,以至于它已成为几乎所有现代 transformer 实现的标准配置,从 BERT 和 GPT 到视觉、音频和多模态任务的专用架构。
如《Attention is All You Need》论文所述,原始 transformer 架构使用针对机器翻译等序列到序列任务优化的编码器-解码器结构。编码器处理输入序列并生成一系列富含上下文的表示。每个编码器层包含两个主要组件:一个多头自注意力子层,允许标记关注输入中的其他标记;一个逐位置前馈网络,对每个位置独立应用相同的非线性变换。这些子层通过残差连接(也称为跳跃连接)相连,将输入添加到每个子层的输出中。这一设计选择受计算机视觉中残差网络的启发,通过允许梯度直接流过网络来支持非常深网络的训练。
解码器利用来自编码器和先前生成标记的信息,逐个标记生成输出序列。每个解码器层包含三个主要组件:一个掩码自注意力子层,允许每个标记仅关注之前的标记(防止模型在训练期间通过"偷看"未来标记来"作弊");一个编码器-解码器注意力子层,允许解码器标记关注编码器输出;以及一个逐位置前馈网络。自注意力子层中的掩码至关重要:它防止信息从未来位置流向过去位置,确保对位置 i 的预测仅依赖于小于 i 位置的已知输出。这种自回归结构对于逐个标记生成序列至关重要。
编码器-解码器架构在输入和输出具有不同结构或长度的任务中尤为有效,如机器翻译(将一种语言翻译为另一种语言)、摘要(压缩长文档)和问答(基于上下文生成答案)。然而,像 GPT 这样的现代 LLM 使用仅解码器架构,其中单堆解码器层同时处理输入提示和生成输出。这种简化降低了模型复杂度,并且在语言建模任务中被证明同样或更有效,可能是因为模型可以学会使用自注意力以统一的方式处理输入和生成输出。
Transformer 架构中的一个关键挑战是表示序列中标记的顺序。与通过循环结构固有地保留序列顺序的 RNN 不同,transformer 并行处理所有标记,没有内置的位置概念。如果没有显式的位置信息,transformer 会将句子"The cat sat on the mat"等同于"mat the on sat cat The",这对语言理解将是灾难性的。解决方案是位置编码,它在处理之前将位置相关的向量添加到标记嵌入中。
原始 transformer 论文使用正弦位置编码,其中位置 pos 和维度 i 的位置向量计算如下:
这些正弦函数为每个位置创建独特的模式,不同维度具有不同的频率。较低的频率(较小的 i)随位置变化缓慢,捕获长程位置信息,而较高的频率变化迅速,捕获细粒度的位置细节。这种设计有几个优点:它自然地泛化到比训练期间所见更长的序列;它提供平滑的位置过渡;它允许模型学习相对位置关系。位置编码向量在第一个注意力层之前简单地添加到标记嵌入中,模型在训练过程中学会使用这种位置信息。
已经提出并研究了替代的位置编码方案,包括相对位置表示(编码标记之间的距离而非绝对位置)和旋转位置嵌入(RoPE)(基于位置旋转嵌入向量)。这些替代方案在某些场景下表现出改进,特别是在处理非常长的序列或对比训练序列更长的序列进行微调时。位置编码的选择会显著影响模型性能,这仍然是 transformer 架构优化中的一个活跃研究领域。
理解 Transformer 架构对于理解现代 AI 系统如何在 ChatGPT、Claude、Perplexity 和 Google AI Overviews 等平台中生成回复至关重要。这些系统都建立在 transformer 技术之上,通过多层自注意力处理用户查询,使其能够理解上下文并生成连贯、相关的回复。当用户提出关于品牌、产品或域名的问题时,transformer 模型的注意力机制决定了其训练数据的哪些部分最相关,解码器生成可能提及或引用该品牌的回复。
对于使用 AmICited 等 AI 监测平台的组织来说,理解 transformer 架构为解读品牌如何以及在何种情况下出现在 AI 生成内容中提供了关键背景。自注意力机制捕获概念之间关系的能力意味着训练数据中提及的品牌可能与特定主题、行业或用例相关联。当用户向 AI 系统查询这些主题时,注意力机制可能激活与您品牌的联系,从而在生成的回复中产生提及。多头注意力结构意味着您品牌在训练数据中存在的不同方面可能被不同的注意力头捕获,影响模型对您品牌的理解和呈现的全面性。
Transformer 架构对训练数据的依赖也解释了为什么品牌在 AI 输出中的可见性在很大程度上取决于您在线存在的质量和数量。在互联网文本上训练的模型将为拥有广泛、高质量网络内容、在知名来源中被频繁提及以及与相关主题具有强烈语义关联的品牌提供更丰富的表示。寻求改善其在 AI 生成回复中可见性的组织应理解,他们本质上是在为未来 transformer 模型将学习的训练数据优化包含性。这种理解弥合了传统 SEO(搜索引擎优化)与可称为"GEO"(生成引擎优化)——针对 AI 系统可见性的优化——之间的差距。
对于试图理解为什么其内容被或不被 ChatGPT、Claude 和 Perplexity 等基于 transformer 的系统展示的团队,按顺序完成以下步骤有助于厘清什么是真正可控的。第一,确认您的内容是模型可访问的训练或检索数据的一部分——transformer 基于训练期间学到的模式或查询时检索到的内容(在基于 RAG 的系统中)生成回复,因此从未被爬取、被 robots.txt 阻止或发布于模型训练截止日期之后的内容,无论质量如何,都不可能被关注到。第二,审计您的品牌或域名概念与您希望被引用的主题共同出现的密度——因为自注意力从训练数据中的模式构建表示,一个仅在孤立上下文中被提及的品牌,与一个在众多来源中持续与其核心主题一起被讨论的品牌相比,建立的语义关联更弱。第三,检查您的内容是否存在于对训练数据构成有重大影响的高质量、频繁被引用的来源中——在互联网文本上训练的模型为具有广泛、有信誉报道的实体开发更丰富的表示,因此一个单一的自行发布的页面与跨多个可信来源出现的相同信息相比权重更低。第四,区分训练时知识和检索时引用——对于基于 RAG 的 AI 搜索工具,技术可爬取性和结构化内容与传统 SEO 同样重要,因为检索步骤依赖于搜索引擎使用的相同索引机制。第五,随时间监测引用模式而非期望即时结果,因为 transformer 模型对您品牌的了解仅在重新训练或检索系统重新索引您的内容时才会更新,这意味着可见性的改善需要经过一个训练周期或重新爬取才能实现,而不是在内容更改后立即出现。

了解 LLM 如何通过分词、Transformer 架构、注意力机制和概率预测生成响应。深入学习 AI 答案生成的技术流程。

注意力机制是一种机器学习技术,引导深度学习模型优先处理相关的输入数据部分。了解其如何为Transformer、大型语言模型(LLM)以及如ChatGPT和Claude等AI系统提供支持。...

生成式AI利用神经网络从训练数据中创建新内容。了解其工作原理、在ChatGPT和DALL-E中的应用,以及为何监控AI可见性对企业品牌至关重要。...
Cookie 同意
我们使用 cookie 来增强您的浏览体验并分析我们的流量。 See our privacy policy.