NIPS 2017 · arXiv:1706.03762v7 · 五页阅读

Attention Is All You Need

Ashish Vaswani*, Noam Shazeer*, Niki Parmar*, Jakob Uszkoreit*, Llion Jones*, Aidan N. Gomez*, Łukasz Kaiser*, Illia Polosukhin* · Google Brain / Google Research / University of Toronto · * Equal contribution, listing order random · arXiv · 本地 PDF

这是一篇关于机器翻译的论文。机器翻译的任务,是把一句源语言自动写成一句意义相当的目标语言。作者提出一种不再依赖逐步循环、也不再依赖卷积的网络,并把它叫做

Abstract 中的主张表述直接:“We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.” 模型根据当前需要,为句子中各个位置分配不同权重,从而不必把整句压成一个固定向量;这一机制称为。本文主张:仅凭这一机制,即可完成把一种序列变成另一种序列的工作。

2014 年以来的默认做法,是用循环网络按词的先后逐步更新内部状态。因而同一句里后一个位置必须等前一个位置算完,训练难以在句内并行。其后加入的注意力缓解了远距离依赖,但仍附着于循环骨架;卷积换来了位置之间的并行,远距离却仍须叠多层才能接通。本文的选择是把循环与卷积一并去掉,只保留注意力,再用另行加入的位置信息补回词序。翻译质量用一种自动打分来报告;具体分数与那一处正文不一致,见证据页。

以下五页按因果顺序展开:默认做法及其代价,先前补救仍缺什么,本文如何安置被拆掉的部分,数字说明了什么,以及尚未收干净的限制。做法与比分各有专页;本页只把这条链摊开。

  1. 本页 · 故事

    先说结局:只靠注意力把一种序列变成另一种序列。下面四页是这条路何以走到这里。

  2. 背景

    机器翻译作为任务、编码器与解码器、顺序计算的代价、2014 年注意力仍附着于循环、卷积买到了什么、工业系统 ,以及本文上场前 WMT 2014 记分板上的先前分数。

  3. 做法

    去掉循环之后如何补回顺序、缩放点积、用多头对抗一次平均、以及解码器何以必须遮住尚未写出的词。

  4. 证据

    WMT 上的自动打分、训练成本、句法附带结果;以及 41.8 与 41.0 同页并存。

  5. 余韵

    平均所降低的分辨率、生成仍须逐步、句法未超过的系统、一处引用裂缝,然后把因果再述一遍。