audio-datasets Flickr Audio Caption Corpus

Flickr Audio Caption Corpus

Open michizhou opened this issue 3 years ago • 0 comments

About Dataset: The Flickr 8k Audio Caption Corpus contains 40,000 spoken captions of 8,000 natural images. It was collected in 2015 to investigate multimodal learning schemes for unsupervised speech pattern discovery. This corpus only includes audio recordings, and not the original text captions or associated images.

Oct 27 '21 07:10 michizhou

audio-datasets audio-datasets copied to clipboard

Flickr Audio Caption Corpus

audio-datasets
audio-datasets copied to clipboard