{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/a-better-baseline-for-ava","title":"A Better Baseline for AVA","arxiv_id":"1807.10066","date":"2018-07-26","proceeding":null,"authors":["Rohit Girdhar","João Carreira","Carl Doersch","Andrew Zisserman"],"abstract":"We introduce a simple baseline for action localization on the AVA dataset.\nThe model builds upon the Faster R-CNN bounding box detection framework,\nadapted to operate on pure spatiotemporal features - in our case produced\nexclusively by an I3D model pretrained on Kinetics. This model obtains 21.9%\naverage AP on the validation set of AVA v2.1, up from 14.5% for the best RGB\nspatiotemporal model used in the original AVA paper (which was pretrained on\nKinetics and ImageNet), and up from 11.3 of the publicly available baseline\nusing a ResNet101 image feature extractor, that was pretrained on ImageNet. Our\nfinal model obtains 22.8%/21.9% mAP on the val/test sets and outperforms all\nsubmissions to the AVA challenge at CVPR 2018.","url_abs":"http://arxiv.org/abs/1807.10066v1","url_pdf":"http://arxiv.org/pdf/1807.10066v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":"action-localization","task_name":"Action Localization"},{"task_slug":"action-recognition-in-videos","task_name":"Action Recognition"}],"methods":[{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"faster-r-cnn","method_name":"Faster R-CNN"},{"method_slug":"rpn","method_name":"RPN"},{"method_slug":"roipool","method_name":"RoIPool"},{"method_slug":"softmax","method_name":"Softmax"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/action-recognition-in-videos-on-ava-v21","task":"Action Recognition","dataset":"AVA v2.1","model":"I3D w/ RPN + JFT (Kinetics-400 pretraining(","rank_in_archive_order":12,"of":15,"metrics":{"mAP (Val)":"22.8"},"uses_additional_data":false},{"leaderboard":"/sota/action-recognition-in-videos-on-ava-v21","task":"Action Recognition","dataset":"AVA v2.1","model":"I3D w/ RPN (Kinetics-400 pretraining(","rank_in_archive_order":14,"of":15,"metrics":{"mAP (Val)":"21.9"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1807.10066","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}