IT 论文精读 · PAPER 7

Long Short-Term Memory(LSTM)

Hochreiter & Schmidhuber · Neural Computation · 1997

EN →

这篇论文干了什么?

在 ChatGPT 出现之前,你手机里「能听会译」的那些东西——语音助手、谷歌翻译、手写识别——背后多半躺着同一个 1997 年的发明:LSTM(长短期记忆网络)。这篇论文给 AI 装上了一个能记住很久以前的事的记忆装置,此后统治「按顺序处理信息」的 AI 整整二十年。

先说个怪事

句子、语音都得按顺序一个字一个字读。当时的「记忆网络」像玩传话游戏:每读一个新字,就把之前记住的一切拿出来揉一遍、再把新字混进去。揉个十几轮,开头说了什么早就面目全非。更糟的是教也教不会:AI 学习靠「答错之后往回追责」,这股追责的声音往回传时同样一站站减弱,传不了几十步就没声了——所以它永远学不明白「结尾这个错,原因出在开头」这种远距离的账

那个点子

LSTM 的点子是:别让记忆跟着每一步被揉。给网络配一条受保护的记忆传送带:放上去的东西默认原样往前送,一步都不揉、一站都不改,走多远都还是原来那句话。

门卫怎么把关

光有传送带还不行——什么都往上堆,很快就成垃圾场。所以每个记忆格子配了两道,门卫由网络自己学出来:写门卫决定「眼前这条信息值不值得记」,读门卫决定「现在要不要把存货拿出来用」。平时两道门关着,存货安安静静原样前行;关键时刻门才打开,该记的记、该用的用。妙处还有一层:因为传送带不揉不搓,那股「往回追责」的纠错声音也能顺着它畅通地传回很久以前——远距离的账终于算得清了。

带来了什么

此后二十年,凡是「按顺序来」的活——听懂一句话、翻译一段文、认一行手写字——最好的系统里几乎都有 LSTM:谷歌语音搜索、谷歌翻译、Siri 都用过它。也说句诚实的:它必须一步一步按顺序算、快不起来,记性也远非无限——2017 年 Transformer 靠「所有词直接互相对视」接了它的班。

一句话记住

给神经网络一条不揉不搓、原样前送的「记忆传送带」,再配上自己学会开关的写门和读门——远处的信息存得住、纠错信号传得回,AI 第一次真正记住了很久以前的事,并统治序列任务二十年。

想看记忆单元的结构图、公式和「跨 1000 步」的实验? → 切到精读版