跳转至

06-自监督学习

对应课程讲义第六章;公开仓库不包含原讲义。

前置知识:最大似然、熵与交叉熵,以及第五章的 Transformer 架构。

主线

本章解决的核心问题是:人工标注成本高昂,如何充分利用海量无标注数据。核心路径分三步:

  1. 动机与框架 — 自监督学习通过挖掘数据内在结构(遮蔽预测、上下文预测等)自动生成监督信号,无需人工标注;学到的表征再通过预训练 + 微调范式迁移到下游任务。
  2. 词表征 — word2vec(skip-gram)通过预测上下文词学习静态词向量;BERT 引入 Masked Language Modeling,以双向 Transformer 捕获深层上下文语义,解决了 word2vec 的多义词问题。
  3. 语言建模与大模型 — 自回归语言模型以"预测下一个词"为目标,用概率链式法则建模序列;大语言模型通过超大规模预训练涌现出零样本推理等能力,代表现代 AI 的核心范式。

关键思想:预训练(Pre-training)+ 微调(Fine-tuning / 上下文学习)极大降低了下游任务的标注需求,是现代 NLP 乃至多模态模型的基础。


关键概念

概念 一句话
自监督学习 用数据自身结构生成伪标签,无需人工标注的表征学习
前置任务 自监督学习任务本身;学到的表征迁移到下游任务
word2vec skip-gram 预测上下文词,训练静态词向量,捕获语义相似性
BERT 双向 Transformer + 掩码语言建模,动态上下文词表征
自回归语言模型 以概率链式法则逐词预测,GPT 系列的建模基础
大语言模型 超大规模预训练模型,涌现零样本推理、上下文学习等能力
掩码语言建模 BERT 的核心前置任务:随机遮蔽词元并预测

关键方法

方法 意义
负采样 解决 Softmax函数 分母全词汇表求和的计算瓶颈(word2vec 训练)
掩码语言建模 (MLM) BERT 的核心前置任务:随机遮蔽词元并让模型预测
微调 / 上下文学习 预训练模型迁移到下游任务的两种范式