{"url":"/method/avslowfast","slug":"avslowfast","name":"AVSlowFast","full_name":"Audiovisual SlowFast Network","full_name_withheld":false,"description_markdown":"**Audiovisual SlowFast Network**, or **AVSlowFast**, is an architecture for integrated audiovisual perception. AVSlowFast has Slow and Fast visual pathways that are integrated with a Faster Audio pathway to model vision and sound in a unified representation. Audio and visual features are fused at multiple layers, enabling audio to contribute to the formation of hierarchical audiovisual concepts. To overcome training difficulties that arise from different learning dynamics for audio and visual modalities, [DropPathway](https://paperswithcode.com/method/droppathway) is used, which randomly drops the Audio pathway during training as an effective regularization technique. Inspired by prior studies in neuroscience, hierarchical audiovisual synchronization is performed to learn joint audiovisual features.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Audiovisual SlowFast Networks for Video Recognition","paper":"/paper/audiovisual-slowfast-networks-for-video","first_author":"Fanyi Xiao","n_authors":5,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/audiovisual-slowfast-networks-for-video"},"source":{"url":"https://arxiv.org/abs/2001.08740v2","title":"Audiovisual SlowFast Networks for Video Recognition","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Multi-Modal Methods","url":"/methods/category/multi-modal-methods","pwc_aliases":[]},{"area":"Computer Vision","area_id":"computer-vision","collection":"Video Recognition Models","url":"/methods/category/video-recognition-models","pwc_aliases":[]}],"n_papers_tagged":1,"archive_num_papers":1,"papers_newest_first":[{"paper":"/paper/audiovisual-slowfast-networks-for-video","title":"Audiovisual SlowFast Networks for Video Recognition","date":"2020-01-23","arxiv_id":"2001.08740","n_code_links":3,"syntology":null}],"papers_shown":1,"tasks":[{"task":"/task/action-classification","name":"Action Classification","papers":1},{"task":"/task/video-recognition","name":"Video Recognition","papers":1}],"tasks_shown":2,"n_tasks":2,"usage_by_year":[{"year":"2020","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/avslowfast"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}