{"url":"/dataset/vgg-sound","name":"VGG-Sound","full_name":null,"description_markdown":"Consists of more than 210k videos for 310 audio classes.\r\n\r\nSource: [VGGSound: A Large-scale Audio-Visual Dataset](/paper/vggsound-a-large-scale-audio-visual-dataset)","description_withheld":null,"homepage":"http://www.robots.ox.ac.uk/~vgg/data/vggsound/","introduced_date":null,"introduced_date_note":null,"introduced_by":{"paper":"/paper/vggsound-a-large-scale-audio-visual-dataset","title":"VGGSound: A Large-scale Audio-Visual Dataset","first_author":"Honglie Chen","url":null},"license":{"name":"CC-BY 4.0","url":"https://creativecommons.org/licenses/by/4.0/"},"modalities":[{"name":"Videos","url":"/datasets/modality/videos"},{"name":"Audio","url":"/datasets/modality/audio"}],"tasks":[{"name":"Image Classification","url":"/task/image-classification","datasets_with_task":"/datasets/task/image-classification"},{"name":"Audio Classification","url":"/task/audio-classification","datasets_with_task":"/datasets/task/audio-classification"},{"name":"Speaker Verification","url":"/task/speaker-verification","datasets_with_task":"/datasets/task/speaker-verification"},{"name":"Zero-shot Audio Classification","url":"/task/zero-shot-audio-classification","datasets_with_task":"/datasets/task/zero-shot-audio-classification"},{"name":"Multi-modal Classification","url":"/task/multi-modal-classification","datasets_with_task":"/datasets/task/multi-modal-classification"},{"name":"Speaker Recognition","url":"/task/speaker-recognition","datasets_with_task":"/datasets/task/speaker-recognition"},{"name":"Video-to-Sound Generation","url":"/task/video-to-sound-generation","datasets_with_task":"/datasets/task/video-to-sound-generation"}],"languages":[],"variants":["VGG-Sound","VGGSound"],"data_loaders":[],"num_papers_in_archive":211,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[{"leaderboard":"/sota/audio-classification-on-vggsound","task":"Audio Classification","dataset_variant":"VGGSound","rows":23,"metrics":["Top 1 Accuracy","Top 5 Accuracy","Mean AP","AUC","d-prime"],"first_row_in_archive_order":{"model":"Mirasol3B","paper":"/paper/mirasol3b-a-multimodal-autoregressive-model","metrics":{"Top 1 Accuracy":"69.8"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/video-to-sound-generation-on-vgg-sound","task":"Video-to-Sound Generation","dataset_variant":"VGG-Sound","rows":8,"metrics":["FAD","FD","KLD"],"first_row_in_archive_order":{"model":"MMAudio-S-16kHz","paper":"/paper/taming-multimodal-joint-training-for-high","metrics":{"FAD":"0.79","FD":"5.22"},"code_links":[{"title":"hkchengrex/MMAudio","url":"https://github.com/hkchengrex/MMAudio"}]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"},{"leaderboard":"/sota/multi-modal-classification-on-vgg-sound","task":"Multi-modal Classification","dataset_variant":"VGG-Sound","rows":4,"metrics":["Top-1 Accuracy","Top-5 Accuracy"],"first_row_in_archive_order":{"model":"MMT","paper":"/paper/multiscale-multimodal-transformer-for","metrics":{"Top-1 Accuracy":"66.2","Top-5 Accuracy":"85.7"},"code_links":[]},"note":"rows are the archive's own order at snapshot; nothing here re-ranks them"}],"papers_with_a_benchmark_row":[{"paper":"/paper/ca-2st-cross-attention-in-audio-space-and","title":"CA^2ST: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition","date":"2025-03-30","rows_on_this_dataset":2,"code_links":0,"syntology":null},{"paper":"/paper/taming-multimodal-joint-training-for-high","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","date":"2024-12-19","rows_on_this_dataset":2,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":4,"samples_ran":4,"samples_unverified":0,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/tell-what-you-hear-from-what-you-see-video-to","title":"Tell What You Hear From What You See -- Video to Audio Generation Through Text","date":"2024-11-08","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":6,"samples_ran":0,"samples_unverified":6,"pointer_only_for_licence":6,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/temporally-aligned-audio-for-video-with","title":"Temporally Aligned Audio for Video with Autoregression","date":"2024-09-20","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":13,"samples_ran":11,"samples_unverified":2,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/masked-generative-video-to-audio-transformers","title":"Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity","date":"2024-07-15","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/read-watch-and-scream-sound-generation-from","title":"Read, Watch and Scream! Sound Generation from Text and Video","date":"2024-07-08","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":22,"samples_ran":18,"samples_unverified":4,"pointer_only_for_licence":22,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/frieren-efficient-video-to-audio-generation","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","date":"2024-06-01","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":17,"samples_ran":14,"samples_unverified":3,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/equiav-leveraging-equivariance-for-audio","title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","date":"2024-03-14","rows_on_this_dataset":1,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":13,"samples_ran":6,"samples_unverified":7,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/mirasol3b-a-multimodal-autoregressive-model","title":"Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities","date":"2023-11-09","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/v2a-mapper-a-lightweight-solution-for-vision","title":"V2A-Mapper: A Lightweight Solution for Vision-to-Audio Generation by Connecting Foundation Models","date":"2023-08-18","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/one-peace-exploring-one-general","title":"ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities","date":"2023-05-18","rows_on_this_dataset":2,"code_links":2,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":7,"samples_ran":2,"samples_unverified":5,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multiscale-audio-spectrogram-transformer-for","title":"Multiscale Audio Spectrogram Transformer for Efficient Audio Classification","date":"2023-03-19","rows_on_this_dataset":1,"code_links":0,"syntology":null},{"paper":"/paper/audiovisual-masked-autoencoders","title":"Audiovisual Masked Autoencoders","date":"2022-12-09","rows_on_this_dataset":2,"code_links":2,"syntology":null},{"paper":"/paper/play-it-back-iterative-attention-for-audio","title":"Play It Back: Iterative Attention for Audio Recognition","date":"2022-10-20","rows_on_this_dataset":1,"code_links":1,"syntology":null},{"paper":"/paper/contrastive-audio-visual-masked-autoencoder","title":"Contrastive Audio-Visual Masked Autoencoder","date":"2022-10-02","rows_on_this_dataset":3,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":1,"samples_ran":0,"samples_unverified":1,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/multiscale-multimodal-transformer-for","title":"Multiscale Multimodal Transformer for Multimodal Action Recognition","date":"2022-09-22","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/avt-audio-video-transformer-for-multimodal","title":"AVT: Audio-Video Transformer for Multimodal Action Recognition","date":"2022-09-22","rows_on_this_dataset":3,"code_links":0,"syntology":null},{"paper":"/paper/uavm-a-unified-model-for-audio-visual","title":"UAVM: Towards Unifying Audio and Visual Models","date":"2022-07-29","rows_on_this_dataset":4,"code_links":1,"syntology":{"read_at":"2026-09-25T09:33:49+00:00","samples_harvested":14,"samples_ran":10,"samples_unverified":4,"pointer_only_for_licence":0,"claim":"Per-sample execution on synthesized fixtures; not a correctness claim."}},{"paper":"/paper/attention-bottlenecks-for-multimodal-fusion","title":"Attention Bottlenecks for Multimodal Fusion","date":"2021-06-30","rows_on_this_dataset":3,"code_links":1,"syntology":null}],"syntology_totals":{"read_at":"2026-09-25T09:33:49+00:00","papers_with_samples":9,"samples_harvested":97,"samples_ran":65,"samples_unverified":32,"pointer_only_for_licence":28,"papers_with_no_sample_that_ran":2,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}