2026-8-31
新学期目标:
- 每天睡够 7 小时
- 少喝糖水
「会赢的.」
开学前的胜利宣言!
用于决定你要注意什么东西的一种东西, 例如你面前有十个杯子, 其中一个会发光, 你就会更容易注意到发光的杯子, 这就是一种注意力提示. 对模型来说, 在翻译 I ate an apple 中的 apple 时, 模型需要在整句英文中寻找哪些词和当前要生成的中文词最相关, 这也是一种注意力提示.
只使用非自主性提示时, 只用简单的全连接层, 汇聚层等即可实现将选择偏向于感官输入, 因此关键在于自主性提示.
在深度学习中, 自主性提示被抽象为 Query, Key, Value. 给定一个 query, 注意力机制通过注意力汇聚将选择引导至感官输入 (value).
到目前为止, 我们遇到过两种类型的数据: 表格数据和图像数据. 对于图像数据, 我们设计了专门的卷积神经网络架构来为这类特殊的数据结构建模. 换句话说, 如果我们拥有一张图像, 我们需要有效地利用其像素位置, 假若我们对图像中的像素位置进行重排, 就会对图像中内容的推断造成极大的困难.
最重要的是, 到目前为止我们默认数据都来自于某种分布, 并且所有样本都是独立同分布 (i.i.d.) 的. 然而, 大多数的数据并非如此. 例如, 文章中的单词是按顺序写的, 如果顺序被随机地重排, 就很难理解文章原始的意思. 同样, 视频中的图像帧, 对话中的音频信号以及网站上的浏览行为都是有顺序的. 因此, 针对此类数据而设计特定模型, 可能效果会更好.
另一个问题来自这样一个事实: 我们不仅仅可以接收一个序列作为输入, 而是还可能期望继续猜测这个序列的后续.
简言之, 如果说卷积神经网络可以有效地处理空间信息, 那么本章的循环神经网络 (recurrent neural network, RNN) 则可以更好地处理序列信息. 循环神经网络通过引入状态变量存储过去的信息和当前的输入, 从而可以确定当前的输出.
本章介绍的卷积神经网络 (convolutional neural network, CNN) 是一类强大的, 为处理图像数据而设计的神经网络. 基于卷积神经网络架构的模型在计算机视觉领域中已经占主导地位, 当今几乎所有的图像识别, 目标检测或语义分割相关的学术竞赛和商业应用都以这种方法为基础.
今天心血来潮下载了网易版的 MC, 找了个人比较多的起床战争服务器加进去玩了两把, 发现我还真就是从前那个少年没有一丝丝改变, 仍然是不敢进攻不会速搭 PVP 打不赢的超级大唐 b.
我不知道现在是该怀旧还是不该怀旧.
多层感知机 (MLP) 由多层神经元组成, 每一层与它的上一层相连, 从中接收输入; 同时每一层也与它的下一层相连, 影响当前层的神经元.
需要激活函数, 否则仍然是线性.
ReLU 线性整流函数:
ReLU(x)=max(0,x)
Sigmoid 函数:
σ(x)=1+e−x1
tanh 双曲正切函数:
tanh(x)=ex+e−xex−e−x
通用近似定理.
让 GPT 给我做了个学习计划, 猜猜我能坚持几天.
向量, 矩阵, 张量
dim=k 表示沿第 k 个维度做运算, 并通常把这个维度压缩掉.