06-自监督学习¶
对应课程讲义第六章;公开仓库不包含原讲义。
前置知识:最大似然、熵与交叉熵,以及第五章的 Transformer 架构。
主线¶
本章解决的核心问题是:人工标注成本高昂,如何充分利用海量无标注数据。核心路径分三步:
- 动机与框架 — 自监督学习通过挖掘数据内在结构(遮蔽预测、上下文预测等)自动生成监督信号,无需人工标注;学到的表征再通过预训练 + 微调范式迁移到下游任务。
- 词表征 — word2vec(skip-gram)通过预测上下文词学习静态词向量;BERT 引入 Masked Language Modeling,以双向 Transformer 捕获深层上下文语义,解决了 word2vec 的多义词问题。
- 语言建模与大模型 — 自回归语言模型以"预测下一个词"为目标,用概率链式法则建模序列;大语言模型通过超大规模预训练涌现出零样本推理等能力,代表现代 AI 的核心范式。
关键思想:预训练(Pre-training)+ 微调(Fine-tuning / 上下文学习)极大降低了下游任务的标注需求,是现代 NLP 乃至多模态模型的基础。
关键概念¶
| 概念 | 一句话 |
|---|---|
| 自监督学习 | 用数据自身结构生成伪标签,无需人工标注的表征学习 |
| 前置任务 | 自监督学习任务本身;学到的表征迁移到下游任务 |
| word2vec | skip-gram 预测上下文词,训练静态词向量,捕获语义相似性 |
| BERT | 双向 Transformer + 掩码语言建模,动态上下文词表征 |
| 自回归语言模型 | 以概率链式法则逐词预测,GPT 系列的建模基础 |
| 大语言模型 | 超大规模预训练模型,涌现零样本推理、上下文学习等能力 |
| 掩码语言建模 | BERT 的核心前置任务:随机遮蔽词元并预测 |
关键方法¶
| 方法 | 意义 |
|---|---|
| 负采样 | 解决 Softmax函数 分母全词汇表求和的计算瓶颈(word2vec 训练) |
| 掩码语言建模 (MLM) | BERT 的核心前置任务:随机遮蔽词元并让模型预测 |
| 微调 / 上下文学习 | 预训练模型迁移到下游任务的两种范式 |