用玩梗方式解释ViT模型:人脸当输入的搞笑示意图
文本内容
假、MLP Head、Transformer Encoder、Patch + Position Embedding、Linear Projection of Flattened Patches、(x) patch embedding
整体描述
这张图用玩梗的方式调侃视觉Transformer(ViT)模型的输入处理流程,将一张真人的脸作为输入,把人脸分割成多个类似ViT中Patch的区块,对应模型的Linear Projection of Flattened Patches模块,接着连接Patch+Position Embedding、Transformer Encoder,最后标注了一个“假”的MLP Head,用幽默的方式可视化了ViT模型的结构,让专业的AI模型知识变得通俗易懂,没有双关或谐音梗。
来源说明
这张图是网友对视觉Transformer(ViT)模型结构的趣味改编图,常见于AI技术相关的科普、调侃场景,在知乎等技术交流平台有流传,图右下角有知乎用户“Ey_奕辰”的水印,推测是该用户制作或发布的改编图,将AI模型结构和人脸图像结合,属于P图改编的创作。