Artificial Intelligence

Open-Source Datasets for Multimodal Generative AI

A curated, hand-verified collection of open-source datasets for training and benchmarking multimodal generative AI models — spanning video-text, image-caption, visual question answering, emotion, and RGB-D data.

7Datasets Listed
100%Verified Working
FreeTo Access

Multimodal Dataset Directory

1github.com

InternVid

A large-scale video-text dataset for multimodal understanding and generation, part of the InternVideo foundation model project.

Visit dataset
2kaggle.com

Flickr30k Image Dataset

A standard benchmark dataset for sentence-based image description, widely used for training and evaluating image-captioning models.

Visit dataset
3aclanthology.org

MuSE: Multimodal Stressed Emotion Dataset

Studies the multimodal interplay between the presence of stress and expressions of affect, with annotated recordings and baseline models.

Visit dataset
4kaggle.com

VQA Dataset

A Visual Question Answering dataset pairing images with natural-language questions and answers, for training multimodal reasoning models.

Visit dataset
5kaggle.com

Social-IQ

A question-answering benchmark for artificial social intelligence, testing a model's ability to reason about human social behavior.

Visit dataset
6cs.washington.edu

RGB-D Object Dataset

A large-scale, multi-view RGB-D object dataset from the University of Washington, widely cited for 3D object recognition research.

Visit dataset
7github.com

LLM Vision Datasets Collection

A curated collection of image and video datasets for generative AI and multimodal models, requiring at least images and corresponding captions.

Visit dataset