{
  "paper": "Attention Is All You Need",
  "arxiv": "1706.03762v7",
  "note": "2017-context glosses for the reading surface. No invented BLEU or architecture numbers. Paper-specific claims cite section/table.",
  "terms": {
    "rnn": {
      "term": "RNN",
      "background": "循环神经网络按时间步更新隐状态：h_t 是 h_{t-1} 与当前输入的函数。2017 年前后，它仍是语言建模和序列转导的默认骨架。关键代价是符号位置被对齐到计算时间步，一个训练样本内部无法并行。",
      "paper_use": "Introduction 把 RNN 写成要离开的默认：sequential dependence precludes parallelization within training examples，并且在更长序列上变得 critical。Transformer 的主张是 dispenses with recurrence entirely。",
      "source": "Section 1；Hochreiter et al. 2001 路径长度动机 [12]"
    },
    "lstm": {
      "term": "LSTM",
      "background": "Long Short-Term Memory（Hochreiter & Schmidhuber, 1997）用输入/遗忘/输出门让梯度穿过许多时间步。到 2016 年，几乎所有有竞争力的神经机器翻译都建立在深层 LSTM 编码器–解码器上。",
      "paper_use": "与 GRU 并列，作为引言要离开的序列建模 SOTA 零件。GNMT 就是这条深层 LSTM 工业线；Table 2 里它既是基线，也是论文借用 beam / 长度惩罚配方的来源。",
      "source": "Section 1 citing [13]；GNMT Wu et al. 2016 [38]"
    },
    "gru": {
      "term": "GRU",
      "background": "Gated Recurrent Unit（Chung et al., 2014）是更轻的门控循环单元，用更新门和复位门代替 LSTM 的三门。2014–2017 年常与 LSTM 互换，作为“门控循环已经够用”的证据。",
      "paper_use": "引言把 LSTM 与 GRU 一起点名为 established recurrent SOTA。论文没有用 GRU 做消融，只是标明默认零件是什么。",
      "source": "Section 1 citing Chung et al. 2014 [7]"
    },
    "seq2seq": {
      "term": "Seq2Seq",
      "background": "Sutskever、Vinyals 与 Le（2014）把源句压进 RNN 编码器的隐状态，再用 RNN 解码器逐词生成目标句。Cho 等人同年的 RNN Encoder–Decoder 是同一模板。此后“序列到序列”几乎就等于这条循环姿势。",
      "paper_use": "Transformer 保留编码器–解码器的任务形状——x 映成 z，再自回归吐 y——但两边都不再是 RNN。跨栈注意力被说成模仿典型 seq2seq 注意力（GNMT / Bahdanau / ConvS2S）。",
      "source": "Section 1 citing [35],[5]；Section 3.2.3"
    },
    "attention": {
      "term": "注意力 / 加性注意力",
      "background": "Bahdanau、Cho 与 Bengio（2014）让解码器不必只盯一个固定向量，而用一个小前馈网给 [s; h] 打分（加性注意力），对源端任意位置加权。Luong、Pham 与 Manning（2015）把点积、concat 等变体又走深了一截。",
      "paper_use": "Section 1：in all but a few cases，注意力仍与 recurrent network 一起用。Section 3.2.1 比较加性与点积：加性也能用，但点积可整段变成矩阵乘；大 d_k 时加性反而更稳，所以他们除以 √d_k。",
      "source": "Section 1 citing [2],[24]；Section 3.2.1"
    },
    "self-attention": {
      "term": "自注意力",
      "background": "Query、Key、Value 来自同一条序列的注意力（也叫 intra-attention；Cheng、Dong 与 Lapata 2016 的 LSTMN 是先例之一）。一层之内任意两位置可以直接对齐，最长依赖路径变成常数。",
      "paper_use": "编码器自注意力：Q、K、V 来自上一层编码器。解码器自注意力相同，但未来位置在 softmax 前被设成 −∞。Table 1：每层 O(n²·d)、串行 O(1)、路径 O(1)。作者称其对所有位置加权平均会降低有效分辨率。",
      "source": "Section 3.2.3；Table 1；Section 2 / 4"
    },
    "bleu": {
      "term": "BLEU",
      "background": "Papineni 等人（2002）的 n-gram 重叠指标，是 WMT newstest 上自动评测机器翻译的标准分数。它奖励与参考译文重合的片段，并不直接等于“句子通不通”。",
      "paper_use": "主结果是 WMT 2014 newstest2014 的 tokenized BLEU。Abstract / Table 2 / §6.1：big EN–DE 28.4；EN–FR Abstract/Table 2 写 41.8，§6.1 写 41.0。Label smoothing ε_ls=0.1 被写明伤 perplexity、助 BLEU。开发集是 newstest2013。",
      "source": "Abstract；Table 2；Section 6.1；Section 5.4"
    },
    "gnmt": {
      "term": "GNMT",
      "background": "Google's Neural Machine Translation（Wu et al., 2016）：深层 LSTM 编码器–解码器加注意力，word-piece 词表，beam 搜索与长度惩罚。2016–2017 年工业神经翻译的代表系统。",
      "paper_use": "Table 2 基线：GNMT+RL EN–DE 24.6 / EN–FR 39.92；ensemble 26.30 / 41.16。Section 6.1 的 MT 解码配方（beam 4，长度惩罚 α=0.6）沿这条线。编码器–解码器注意力被说成模仿 GNMT 里典型的 seq2seq 注意力。",
      "source": "Table 2；Section 6.1；Wu et al. 2016 [38]"
    },
    "bytenet": {
      "term": "ByteNet",
      "background": "Kalchbrenner 等人的卷积转导模型，用膨胀卷积在位置之间并行计算。两个位置发生关系所需的运算次数随距离对数增长，而不是像普通卷积那样线性增长。",
      "paper_use": "Section 2 与 Table 1 的对照点：ByteNet 路径 O(log_k n)，Transformer 压到 O(1)。Table 2 EN–DE BLEU 23.75，是卷积线上被按下去的分数之一。",
      "source": "Section 2；Table 1；Table 2；Kalchbrenner et al. [18]"
    },
    "convs2s": {
      "term": "ConvS2S",
      "background": "Gehring 等人 2017 的卷积序列到序列。位置之间可并行，但两个位置要发生关系，中间隔着的运算次数随距离线性增长。也使用了可学习的位置嵌入。",
      "paper_use": "Table 1 / Section 2 的线性路径对照。Table 2：单模型 25.16 / 40.46，ensemble 26.36 / 41.29。Section 3.5 把可学习位置嵌入与正弦 PE 比较时引用 ConvS2S。跨栈注意力也点名模仿 ConvS2S。",
      "source": "Section 2；Table 2；Section 3.5 citing [9]；Section 3.2.3"
    },
    "layernorm": {
      "term": "LayerNorm",
      "background": "Layer Normalization（Ba、Kiros 与 Hinton, 2016）对单个样本的特征维做归一化，不像 BatchNorm 依赖 batch 统计。2017 年已是稳定深层残差栈的常用零件。",
      "paper_use": "每个子层外包残差和层归一化，写成 LayerNorm(x + Sublayer(x))（Section 3.1）。这要求子层输出与 x 同维，所以所有子层和嵌入都是 d_model。",
      "source": "Section 3.1；Ba et al. 2016 [1]"
    },
    "residual": {
      "term": "残差",
      "background": "ResNet（He et al., 2016）把子层输入加到输出上，给梯度一条短路。深度栈因此不必只靠一层层映射来传信号。",
      "paper_use": "编码器与解码器的每一个子层都是残差：输出为 LayerNorm(x + Sublayer(x))。为了能相加，base 里所有子层和嵌入都产生 d_model=512。Dropout 加在子层输出、残差相加之前（Section 5.4）。",
      "source": "Section 3.1；Section 5.4；He et al. 2016 [11]"
    },
    "d_model": {
      "term": "d_model",
      "background": "模型宽度，也是词嵌入维度。它决定残差能否直接相加，以及多头切开之后每头有多窄。",
      "paper_use": "base：d_model=512，d_ff=2048，h=8，故 d_k=d_v=64。big：d_model=1024，d_ff=4096，h=16（Table 3）。嵌入权重再乘 √d_model（Section 3.4）。学习率公式里也出现 d_model^{−0.5}（Section 5.3 式 3）。",
      "source": "Sections 3.1–3.4；Table 3；Section 5.3"
    },
    "multihead": {
      "term": "多头注意力",
      "background": "不是把一次注意力做宽，而是并行 h 组不同的 Q/K/V 投影，各自在自己的子空间里对齐，再拼接起来乘 W^O。用意是避免单次加权平均把多种关系挤扁。",
      "paper_use": "Section 3.2.2：base h=8，每头 d_k=d_v=d_model/h=64。作者说单头会抑制同时关注不同子空间；多头被写成对抗“平均掉分辨率”的对策。Table 3 行 (A)：单头比最佳头数设置在开发集上差 0.9 BLEU。",
      "source": "Section 3.2.2；Section 2；Section 6.2 / Table 3 row (A)"
    },
    "pe": {
      "term": "位置编码",
      "background": "自注意力对置换不敏感：打乱词序，点积还是那些点积。没有循环步进或卷积核在时间轴上滑动时，必须另想办法把“谁在谁前面”写进表示。",
      "paper_use": "Section 3.5 在嵌入上加上正弦 PE：偶数维 sin、奇数维 cos，波长从 2π 到 10000·2π。假设对固定偏移 k，PE_{pos+k} 可写成 PE_pos 的线性函数。Table 3 行 (E) 换可学习位置嵌入，开发集 BLEU 25.7 对 base 的 25.8；留下正弦是因为也许能外推到没见过的长度。",
      "source": "Section 3.5；Table 3 row (E)"
    },
    "softmax": {
      "term": "softmax",
      "background": "把一组实数 logits 压成和为 1 的非负权重。指数对大数值敏感：输入一大，分布就变成接近 one-hot，梯度变小（饱和）。",
      "paper_use": "注意力公式 (1)：softmax(QK^T / √d_k) 得到对 V 的权重。解码器顶端再来一次线性 + softmax，得到下一个 token 的分布（Section 3.4）。除以 √d_k 就是为了不让点积把 softmax 推进饱和区（footnote 4）。Mask 是在 softmax 前把非法位置设成 −∞。",
      "source": "Section 3.2.1 eq. 1, footnote 4；Section 3.2.3；Section 3.4"
    },
    "beam": {
      "term": "beam search",
      "background": "解码启发式：每一步保留 k 条最可能的部分假说，而不是只贪心走 1-best。常配合长度惩罚，避免短句占便宜。GNMT 把这套配方做成了工业默认。",
      "paper_use": "机器翻译：beam 4，长度惩罚 α=0.6；平均最后 5 个（base）或 20 个（big）checkpoint（Section 6.1）。成分句法：beam 21，α=0.3，输出上限为输入长度 +300（Section 6.3）。",
      "source": "Section 6.1；Section 6.3"
    },
    "bpe": {
      "term": "BPE",
      "background": "Byte-Pair Encoding（Sennrich、Haddow 与 Birch, 2015）迭代合并频繁符号对，得到子词词表。它让稀有词被拆开、常见词保持完整，是 2016–2017 年 NMT 处理开词汇的标准办法。GNMT 的 word-piece 是近亲。",
      "paper_use": "EN–DE：约 450 万句对、共享 BPE 词表约 37k。EN–FR：3600 万句、32k word-piece（Section 5.1）。正文把 BPE 标成 [3]，参考文献 [3] 是 Britz et al. 2017，BPE 论文其实是 [31]——论文自己的引用裂缝。Table 3 的 perplexity 是 per-wordpiece。",
      "source": "Section 5.1；Table 3 caption；Sennrich et al. 2015 [31]（正文误标 [3]）"
    },
    "perplexity": {
      "term": "perplexity",
      "background": "平均负对数似然的指数，衡量模型对语料的拟合：越低越好。它是语言模型指标，并不自动等于翻译质量。",
      "paper_use": "Table 3 开发集（newstest2013 EN–DE，未做 checkpoint 平均的变体表）：base PPL 4.92 / BLEU 25.8，big PPL 4.33 / BLEU 26.4。Caption 警告这些是 per-wordpiece，不要拿去跟 per-word PPL 比。Section 5.4：label smoothing ε_ls=0.1 伤 perplexity、助 BLEU。",
      "source": "Table 3 caption；Section 5.4"
    },
    "rnng": {
      "term": "RNNG",
      "background": "Recurrent Neural Network Grammar（Dyer et al., 2016）是成分句法树的生成式模型，把推导动作本身当成序列来建模。2016 年 WSJ 上的强基线。",
      "paper_use": "Section 6.3 / Table 4：四层 Transformer（d_model=1024）在 WSJ Section 23 得到 F1 91.3（仅约 4 万句）和 92.7（半监督约 1700 万句）。它超过 BerkeleyParser 的 90.4（WSJ-only），但没有超过 RNNG 生成式 93.3，也没有超过 Luong 等人 multi-task 的 93.0。句法不是这篇论文赢下的战场。",
      "source": "Section 6.3；Table 4；Dyer et al. 2016 [8]"
    },
    "transformer": {
      "term": "Transformer",
      "background": "这篇论文命名的架构：编码器–解码器各 N 层相同的块，块里是多头自注意力和逐位置前馈，外包残差与 LayerNorm，用正弦位置编码补顺序，全程没有循环、没有卷积。",
      "paper_use": "Abstract 的主张：based solely on attention mechanisms, dispensing with recurrence and convolutions entirely。base 65×10^6 参数，big 213×10^6（Table 3）。WMT 2014 newstest2014：base 27.3 / 38.1，big 28.4 / 41.8（Table 2；§6.1 对 EN–FR big 另写 41.0）。",
      "source": "Abstract；Section 3；Table 2；Table 3"
    }
  }
}
