跳到正文
技术吧
返回

多模态大型语言模型 (LLM) 的工作原理

更新于:

大型语言模型 (LLM) 已经展现出令人印象深刻的文本理解能力。但在很多情况下,我们希望 LLM 能够理解的不仅仅是文本。我们可能希望它们接收或生成多种模式的数据,如文本、图像和音频。具有此功能的 LLM 称为多模态 LLM,在本文中,我们将对视觉语言领域的三种多模态 LLM 进行概述。正如我们所见,这三种 LLM 都具有以下共同的组件:

让我们开始吧。

Flamingo 火烈鸟

Flamingo是一门多模态大型语言模型 (LLM),于 2022 年推出。视觉和语言组件的工作原理如下:

训练分为三个步骤:

经过训练,Flamingo 能够执行各种视觉语言任务,包括以对话形式回答有关图像的问题。

什么是 CLIP?

如上一节所述,Flamingo 在预训练阶段使用 CLIP。CLIP不是多模态 LLM。相反,它是一种训练方法,可以生成具有强大下游功能的独立视觉和文本模型。CLIP 代表对比语言图像预训练,其概念非常简单:

注意,有很多种方法可以测量两个嵌入之间的距离。一些常用的方法是欧几里得距离和余弦相似度。CLIP 使用后者。

此图中有 N 个图像-文本对。I N和 T N是第 N 个图像-文本对的图像和文本嵌入。突出显示的蓝色方块表示我们希望靠近的嵌入对。

从高层次来看,CLIP 学习的是联合图像-文本嵌入空间,这基本上意味着可以直接计算图像和文本之间的相似度。事实证明,以此为目标训练模型通常非常有用,包括在多模态 LLM 环境中。

BLIP-2

BLIP-2是一款多模态 LLM,于 2023 年初发布。与 Flamingo 一样,它包含预训练的图像编码器和 LLM。但与 Flamingo 不同的是,图像编码器和LLM 均未受影响(预训练后)。

为了将图像编码器连接到 LLM,BLIP-2 使用“Q-Former”,它由两个组件组成:

摘自 BLIP-2 论文,展示了 Q-Former 的内部结构及其训练目标。

BLIP-2 训练分为两个阶段:

图片摘自 BLIP-2 论文,展示了完整的模型架构。投影层标记为“完全连接”。

在论文的实验中,他们使用 CLIP 预训练的图像编码器和OPT或Flan-T5作为 LLM。实验表明,BLIP-2 在各种视觉问答任务上的表现都优于 Flamingo,但可训练参数却少得多。这使得训练过程更加轻松,且更具成本效益。

LLaVA

LLaVA是一门多模态 LLM,于 2023 年发布。其架构非常简单:

请注意,与 BLIP-2 中的 Q-Former 以及 Flamingo 中的感知器重采样器和交叉注意层相比,视觉编码器和 LLM 之间的组件非常简单。

训练分为两个阶段:

图片来自 LLaVA 论文,展示了完整的模型架构。 作者对 LLaVA 的评价如下:

LLaVA 说明,简单的架构在使用部分合成数据进行训练时可以取得优异的结果。

在这篇文章中,我们简要介绍了三个重要的多模态 LLM 以及 CLIP。


分享本文:

上一篇
探索多模态大型语言模型:人工智能的一大进步
下一篇
人工智能在招聘中的应用:机遇与挑战