第五页 · 余韵

没有收干净的部分

作者写在纸上的限制、一处引用不一致,以及把因果再述一遍。

对所有位置做一次加权平均,会把多种关系挤进同一组权重。作者把这称为有效分辨率下降。八个头是针对这一平均的对策,并不是已经证毕的修复:切开之后,不同子空间可以同时被看见,但论文并未证明分辨率已经完全回来。Section 2 与 Section 4 把这场平均称为 reduced effective resolution。

序列一长,对所有位置两两计算的代价按长度平方增长。WMT 那种句子长度暂时扛得住 O(n²·d) 的账;对很长的序列,作者把只看邻域 r 的局部注意力明确留给后续工作,路径因而变成 O(n/r)(Section 4)。这不是实现上的疏忽,而是本文未做完的一项。

训练时编码器可以同时看整句,解码器也可以一次喂进目标序列再加遮罩。真正逐词写出时,已经生成的符号还要再送回去,下一步才出来。因而训练时的并行,并不等于生成时的并行。Conclusion 把 “making generation less sequential” 和其他模态、局部注意力并列成下一步。

句法那一栏,证据页已经报过 F1。这里只把没超过的名字再写一次:(Dyer et al., 2016)生成式 93.3,Luong 等人 multi-task 93.0。四层 Transformer 的 91.3 / 92.7 超过 BerkeleyParser 的 90.4,到此为止。句法搜索只覆盖了随机丢弃、学习率和集束宽度。句法不是这篇论文赢下的战场。

还有一处引用不一致,一并记下:Section 5.1 把 标成 [3],参考文献 [3] 是 Britz et al. 2017(加性与缩放点积在大 dk 时的比较),BPE 论文其实是 [31] Sennrich et al. 2015。同一份 v7 PDF 里,41.8 与 41.0 也互相并立。两处都不裁定,只标明裂缝所在。

再述一遍

循环网络按词的先后逐步更新,因而句内无法并行,远距离须穿过整段更新。注意力早已存在,却仍附着于循环,解决的是固定向量瓶颈,不是排队计算。卷积换来了位置之间的并行,远距离却仍须叠多层。作者赌只留下注意力:用正弦把顺序补回,用 √dk 避免点积把分配比例推入饱和,用八个头对抗一次平均;解码仍逐步写出。WMT 上英德到了 28.4,已超过先前含 ensemble 在内的最好分数;英法的 41.8 与 41.0 还在同一份 PDF 里并立。句法没有超过 RNNG。