基于自监督Transformer的小数据集识别网络
sciencepaper_online(2023)
摘要
Vision Transformer(ViT),一种与卷积神经网络截然不同的架构网络,具有多种优势,包括设计简单性,健壮性,并且已经在许多视觉任务上取得sota。然而与卷积神经网络比,ViT缺少归纳偏置,因此需要大量的数据集预训练从中学习归纳偏置,使得在小型数据集上从头开始训练效果并不好。本文目的是设计一个鲁棒的训练小规模数据集的方案。采用两阶段的方式。第一阶段,设计一种自监督学习方案,从小数据集上进行训练,从中学习归纳偏置,作为初始化权重。第二阶段,对ViT图片分割阶段进行优化,并使用初始化权重在优化的ViT模型上,使用小数据集进行微调。通过在多种公开小数据集上进行广泛的实验证明,与现有算法相比,本文提出的方法有更好的表现。
更多