Return to Article Details Image Captioning Using an InceptionV3 Encoder and a Vanilla Transformer Decoder on the Flickr30k Dataset Download Download PDF