你好,我是Shrijith Venkatramana, 我正在建造LiveReview——一个为您的商业关键系统而建的具有爆炸意识的AI代码审查.
帮助Devs发现这个项目,尝试一下,分享你的反馈,帮助改进产品.
一个语言模型可以写作"活字",解释量子力学,并模仿莎士比亚.
然而,展示一个生产仪表板的截图, 突然的中心问题变成了: 接受过文字训练的变压器如何学习像素的含义?
答案是“给LLM一个形象。” 这个描述几乎隐藏了所有有趣的工程.
现代多模式系统通常是几个模型的构成:一个视觉编码器将像素转化为向量,一个连接器将这些向量转化为语言模型理解的东西,LLM然后对由此产生的与普通文本符号并列的表示提出理由.
这种建筑技巧把变压器从语言建筑变成了一个更接近于各种数据的通用界面。
进化是值得理解的,因为它揭示了一个有用的工程模式:你常常不需要再训练出一个巨大的模型来赋予它一种新的感官模式.
你需要一个很好的表述, 和充分的表达界面 在表述。
1.
基本心理模型:像素会变成符号 以普通的LLM开头.
它的输入在概念上看起来就像:万物最终被代表为向量.
多式联运变压器利用这一事实。
图像首先被转换成向量序列: 概念上的重要转变是: LLM不需要直接理解像素.
它只需要理解另一个模型所产生的一种表述.
这与软件接口非常相近。
视觉编码器是一个服务。
LLM是另一种服务.
连接器是API合同.
这个类比在你看实际建筑后, 变得令人惊讶的文字。
为什么不把像素标出?
你可以想象把每个RGB像素当作一个符号.
一个1024×1024的图像有: 即使在考虑RGB频道之前,也就是大约一百万个空间位置.
超过一百万个信使的自学是荒谬地昂贵的。
完全自学的计算成本约为: 如果增加100x,注意力工作大约增加: 因此多式系统需要压缩.
因此,第一个主要的工程问题是:我们如何把一个巨大的图像变成一个可管理的信息载体序列?
2.
第一个突破:视觉本身变得对变压器友好 最重要的前奏是认识到变压器根本不需要语言. 2020年,Alexey Dosovitskiy和Google Research的同事出版了"愿景变形器",即"ViT".
这个想法很简单。
取一幅图像: 将它分割成补丁, 比如: 你得到: 或者: 每个补丁成为向量 。
现在图像变成了一个序列:它看起来像是一个词的序列.
变压器并不在意这些向量来源于图像的小平方而不是文字片.
这是一个深刻的简化。
研究人员没有发明一种完全不同的视觉结构,而是可以越来越多地再利用那些使变压器在NLP中占据支配地位的机械。
假设每个补丁都用向量表示: 线性投影图 平整后补丁进入模型维度: 变压器然后处理:加上位置信息,使其知道一个补丁来自上左侧,另一个来自下右侧。
该架构现在几乎与序列处理级的语言变压器无法区分.
这为更大的事情打开了大门。
如果我们能把这些视觉向量和语言对齐呢?
这是下一步。
3.
CLIP:教授图像和语言以共享坐标系统 2021年,OpenAI研究员