USC · CSCI 544 · 应用自然语言处理 · 2026 秋

从这里开始

先看看这门课在讲什么,再按顺序学习,或直接找到你想复习的知识点。

先找你想学的内容

这里整理了 CSCI 544 前七讲的笔记。你可以按下面的顺序学习,也可以直接跳到想复习的主题。同一个知识点即使在几节课里反复出现,也会放在一起讲,方便前后联系。

每页顶部的标签会告诉你,这个主题在哪几讲出现过。想按上课顺序查笔记,可以看课程时间线;只想查一个概念或公式,可以看术语表与公式。点击语言按钮,就能切换到同一页的英文版。

这门课目前讲到了哪里?

课程先从一个简单的问题开始:我们能不能猜出一句话接下来会出现什么词?接着,我们学习怎样让模型根据例子给文本分类,怎样用一组数字表示一个词的含义,最后再看怎样把分类器从一次加权求和扩展成多层网络。

第 1–3 讲
预测下一个词
统计词语搭配出现的次数,把次数变成概率,再检查模型对新文本预测得怎样。
第 3–6 讲
让模型从例子中学习
给模型一些带答案的文本,衡量它预测错了多少,再调整参数,让下一次预测更准确。
第 5–7 讲
用数字表示词义
观察一个词常和哪些词一起出现,用计数或预测的方式从这些语境中建立词向量,再比较不同词的联系。
第 7 讲
加上层
把逻辑回归看成一个单元,加上非线性函数,再把单元按层叠成前馈网络。

前两部分用到了同一个想法:选择一组参数,让我们已经看到的例子更有可能出现。这个方法叫最大似然估计(maximum likelihood estimation)。在简单的词频模型里,它就是数一数、再相除;在分类模型里,它会变成一种计算误差的方法:模型给正确答案的概率越低,误差就越大。

同一个想法在 word2vec 里第三次出现:它对词对训练一个逻辑回归分类器,再把权重留下来当词向量。这些模型也面临同一个难题:训练材料不可能包含以后会遇到的所有情况。平滑方法会给没见过的词语搭配留出概率;正则化则帮助分类模型避免只记住训练中的例子。

按主题开始学习

课程导览

了解课程在讲什么,以及作业、评分和答疑怎样安排。

第一部分 · 预测下一个词

从词频统计开始建立语言模型,检查预测效果,再处理训练材料里没出现过的情况。

第二部分 · 学习给文本分类

跟着完整的学习过程走一遍:准备数据、做出预测、计算误差,然后调整模型。

第三部分 · 用数字表示词义

用词周围的语境描述它的含义,再比较由此得到的词向量。

第四部分 · 神经网络

把单个分类器变成一层层的单元,学会一条直线画不出来的分界。

接下来会学什么?

第 1 讲给出的课程安排,大致沿着语言模型的发展顺序展开:

  • 早期神经网络语言模型,约 2013–2018 年:先学习怎样得到更紧凑的词向量,再学习前馈网络、循环神经网络、反向传播,以及编码器—解码器结构。第 7 讲已经讲到前两项;反向传播安排在 9 月 17 日。它们帮助我们理解神经网络怎样处理和生成一串文字。
  • 2018 年以后的模型:学习注意力机制和 Transformer,再看两类任务:补出被遮住的词,以及根据已有文本预测下一个词。
  • 大语言模型:学习预训练、微调、提示词、指令训练和人类反馈怎样影响模型行为,也会讨论文本生成、看似可信却不正确的回答、隐私等尚未解决的问题。

计划中的作业主题包括 n-gram 模型、词向量与循环语言模型、Transformer 中的注意力,以及大语言模型进阶内容。课程会从中安排两次作业,每次约 3–4 周;具体选题可能调整。