IT 论文精读 · PAPER 8

Sequence to Sequence Learning(Seq2Seq)

Sutskever, Vinyals & Le · Google · NIPS 2014

EN →

这篇论文干了什么?

2014 年,Google 的三个人——其中的 Ilya Sutskever 后来当了 OpenAI 首席科学家——提出了 Seq2Seq(序列到序列):让两个神经网络接力,一个专门「读」、一个专门「说」,第一次让机器翻译整句话从头到尾由神经网络独立完成,成绩还超过了打磨多年的传统翻译系统。今天你跟 ChatGPT「你一句、我一句」的样子,最早的雏形就是它。

打个比方

想想同声传译员是怎么工作的:先听完一整句,在脑子里形成一个「意思」,再用另一种语言把这个意思重新说出来——绝不是听一个词翻一个词。而 Seq2Seq 之前的机器翻译恰恰更像后者:把句子剁成小块,逐块查对照表替换,再想办法把碎块拼通顺。Seq2Seq 让机器第一次学会了传译员的路子:先读懂,再重说。

新在哪

旧世界的翻译系统是一条流水线:切短语的、查表的、调语序的、打分挑最顺的……几十个零件各管一段,每个零件都要专家单独设计调教,哪里出错都难追查。Seq2Seq 把这一切换成一个整体:只要喂给它海量「原文–译文」句子对,它自己从头学会整个翻译过程,中间不需要任何人手工设计规则。

怎么做到的

「读」的网络逐词读入原句,一边读一边更新自己的「脑内状态」;读完最后一个词,这个状态就是整句话被浓缩成的一个「念头」。「说」的网络接过这个念头,一个词一个词往外说:每说一个词,都看着这个念头加上自己刚说过的话,决定下一个词说什么,直到说出一个特殊的「句号」记号才停笔——所以译文想多长就多长,不用提前规定。

论文里还有个出了名的妙招:把原句倒着喂进去。这样一来,原句的开头和译文的开头在时间上离得特别近,模型先轻松学会「开头对开头」,再顺藤摸瓜把后面对上——就像接力赛把交棒的两个人安排得更近,成绩立刻明显提高。

带来了什么

它第一次证明:不靠语言学规则、不靠手工零件,纯神经网络就能在正式比赛数据上打败传统翻译系统。两年后,Google 翻译把运行了十年的旧系统整个换成了这套架构的后代;「先读懂、再生成」也从翻译蔓延到摘要、对话、语音、看图说话,成了 AI 的通用套路。也得诚实说一句:把整句话压进一个固定大小的「念头」,句子越长越记不全——第二年为治这个毛病发明的「注意力」,后来长成了 Transformer。

一句话记住

两个网络接力:一个把整句话读成一个「念头」,另一个从这个念头出发一个词一个词地重说出来——翻译从「流水线拼积木」变成「先读懂、再重说」,今天大模型「你问我答」的形态就是从这里长出来的。

想看编码器–解码器的结构图、倒序技巧和真实比分? → 切到精读版