NIPS 2017 · arXiv:1706.03762v7 · 五页阅读
这是一篇关于机器翻译的论文。机器翻译的任务,是把一句源语言自动写成一句意义相当的目标语言。作者提出一种不再依赖逐步循环、也不再依赖卷积的网络,并把它叫做 。
Abstract 中的主张表述直接:“We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.” 模型根据当前需要,为句子中各个位置分配不同权重,从而不必把整句压成一个固定向量;这一机制称为。本文主张:仅凭这一机制,即可完成把一种序列变成另一种序列的工作。
2014 年以来的默认做法,是用循环网络按词的先后逐步更新内部状态。因而同一句里后一个位置必须等前一个位置算完,训练难以在句内并行。其后加入的注意力缓解了远距离依赖,但仍附着于循环骨架;卷积换来了位置之间的并行,远距离却仍须叠多层才能接通。本文的选择是把循环与卷积一并去掉,只保留注意力,再用另行加入的位置信息补回词序。翻译质量用一种自动打分来报告;具体分数与那一处正文不一致,见证据页。
以下五页按因果顺序展开:默认做法及其代价,先前补救仍缺什么,本文如何安置被拆掉的部分,数字说明了什么,以及尚未收干净的限制。做法与比分各有专页;本页只把这条链摊开。