IT 论文精读 · PAPER 6

CLIP:用自然语言当老师教机器看图

Radford 等 · OpenAI · ICML 2021

EN →

这篇论文干了什么?

2021 年,OpenAI(后来做出 ChatGPT 的那家公司)发布了 CLIP:不再请人给图片打标签,而是从互联网上收来4 亿对「图片 + 它旁边的文字说明」,让机器自己学会「这张图和这句话说的是不是同一回事」。学成之后,它不用再训练就能认出成千上万种没专门教过的东西。今天你用文字生成图片(Stable Diffusion、DALL·E)、用一句话搜图,背后都有它。

先说旧世界的麻烦

在这之前,教机器认图像是办一所只考选择题的学校:先雇一大批人,给上百万张图一张张手工贴标签——「猫」「狗」「飞机」——机器再对着背。贵、慢不说,最要命的是学会一千种就只会这一千种:想让它多认一个「滑板」,就得重新收集图、重新标、重新训一轮。而且它认的只是编号,「猫」对它来说不过是第 281 号选项,跟「猫爱抓沙发」这些含义毫无关系。

那个点子

CLIP 的点子是:老师其实早就免费待在互联网上了。网上每张图片旁边几乎都有人写好的文字——图注、标题、配文。别再出选择题,直接玩一个连线配对游戏:一次发给机器一叠图片和一叠打乱的说明文字,让它把「哪张图配哪句话」连对。连错了就调整自己,连对为止。这个游戏不用人出题、题量近乎无限。

它是怎么「认得」没教过的东西的?

关键在于,机器为了玩好配对,练出了两个翻译官:一个把图片翻成一种内部的「意思坐标」,一个把句子也翻到同一套坐标里——说同一件事的图和话,会被翻到彼此挨得很近的位置,就像地图上两家紧邻的店。

要认新东西时,你只需用文字报上候选名字:比如把「一张滑板的照片」「一张猫的照片」都交给文字翻译官,再把要认的图交给图片翻译官,看图落在哪句话的旁边——离谁近就是谁。因为「滑板」这个词的意思它在配对游戏里早就见识过,所以不用任何新训练,写句话就等于当场造出一个新的识别器。类别不再是固定的选项表,而是你随口说出的语言。

带来了什么

视觉从此接上了语言的水管。想生成「一只骑滑板的柯基」,机器得先懂这句话和什么样的图「意思相近」——CLIP 练出的这套共同坐标,正是后来 Stable Diffusion、DALL·E 这类文生图模型的地基;今天的多模态助手(能看图聊天的 AI)大多也用它的「图片翻译官」当眼睛。也得诚实说一句:它擅长认「是什么」,但数数、分辨极相近的车型这类细活儿至今仍不灵

一句话记住

与其雇人给图片打标签,不如让机器拿互联网上现成的 4 亿对「图 + 配文」玩连线配对,练出把图像和语言放进同一套「意思坐标」的本事——从此认新东西不用重新训练,写一句话就是一个识别器。这套坐标成了文生图和多模态 AI 的地基。

想看配对游戏的结构图、真实数字和它输在哪? → 切到精读版