【LLM】从零开始学大语言模型 | 7 | Encoder-only架构和BERT

Encoder-only 架构与 BERT 家族:理解型大模型的构建方式 在 Transformer 的完整结构中,Encoder 与 Decoder 共同组成了一套既能理解文本、又能生成文本的模型框架。但在真实工业应用中,不同任务对模型能力的要求并不相同。有些任务需要模型不断生成新的词元,例如机器翻译、对话生成、文章续写;而另一些任务只需要模型读懂输入文本,然后给出判断、分类、标注或打分。 正是因为任务目标不同,Transformer 在后续发展中逐渐演化出了几类典型架构。其中第一类,就是专门面向文本理解任务的 Encoder-only 架构。这一方向最具代表性的模型,是 Google 在 2018 年提出的 BERT。 本文将系统梳理 Encoder-only 架构的设计动机、BERT 的核心训练任务、特殊 Token 的作用,以及“预训练 + 微调”这一改变 NLP 发展路径的技术范式。同时,我也会把一些常见疑问自然地融入解释中,例如:BERT 的伟大是否主要来自训练任务设计?微调时所谓“在顶层加一个分类器”到底是什么意思?Encoder-only 模型最后输出的矩阵又如何接到具体任务上? 一、从完整 Transformer 到 Encoder-only 1. Encoder 的特长:双向理解上下文 在原始 Transformer 中,Encoder 的职责是接收一段输入序列,并通过多层 Self-Attention 和前馈网络,为序列中的每个词元生成富含上下文信息的表示。 Encoder 的关键特点是:它的 Self-Attention 通常不限制词元之间的可见范围。对于输入序列中的任意一个词元,它既可以关注左侧上下文,也可以关注右侧上下文。也就是说,模型在表示一个词时,能够同时利用这个词前后的信息。 举例来说,对于句子: 我 今天 去 买 了 苹果 如果要理解“苹果”这个词的含义,模型不仅可以看到左侧的“我 今天 去 买 了”,也可以在条件允许时看到右侧可能出现的词。虽然这个例子右侧可能没有更多内容,但在更复杂的句子中,右侧上下文常常非常重要。例如: He deposited some money in the bank(他在银行存了钱) 与: ...

August 21, 2026 · 4 min · 846 words · c.w.