{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/urvos-unified-referring-video-object","title":"URVOS: Unified Referring Video Object Segmentation Network with a Large-Scale Benchmark","arxiv_id":null,"date":"2020-08-01","proceeding":"ECCV 2020 8","authors":["Seonguk Seo","Joon-Young Lee","Bohyung Han"],"abstract":"We propose a unified referring video object segmentation network (URVOS). URVOS takes a video and a referring expression as inputs, and estimates the {object masks} referred by the given language expression in the whole video frames. Our algorithm addresses the challenging problem by performing language-based object segmentation and mask propagation jointly using a single deep neural network with a proper combination of two attention models. In addition, we construct the first large-scale referring video object segmentation dataset called Refer-Youtube-VOS. We evaluate our model on two benchmark datasets including ours and demonstrate the effectiveness of the proposed approach. The dataset is released at \\url{https://github.com/skynbe/Refer-Youtube-VOS}.","url_abs":"https://www.ecva.net/papers/eccv_2020/papers_ECCV/html/2327_ECCV_2020_paper.php","url_pdf":"https://www.ecva.net/papers/eccv_2020/papers_ECCV/papers/123600205.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"urvos-unified-referring-video-object","repo_url":"https://github.com/skynbe/Refer-Youtube-VOS","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"object","task_name":"Object"},{"task_slug":"one-shot-visual-object-segmentation","task_name":"One-shot visual object segmentation"},{"task_slug":"referring-expression","task_name":"Referring Expression"},{"task_slug":"referring-expression-segmentation","task_name":"Referring Expression Segmentation"},{"task_slug":"referring-video-object-segmentation","task_name":"Referring Video Object Segmentation"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"video-object-segmentation","task_name":"Video Object Segmentation"},{"task_slug":"video-semantic-segmentation","task_name":"Video Semantic Segmentation"}],"methods":[],"datasets_introduced":[{"slug":"refer-youtube-vos","name":"Refer-YouTube-VOS","full_name":""}],"methods_introduced":[],"results":[{"leaderboard":"/sota/referring-expression-segmentation-on-davis","task":"Referring Expression Segmentation","dataset":"DAVIS 2017 (val)","model":"URVOS + Refer-Youtube-VOS + ft. DAVIS","rank_in_archive_order":9,"of":18,"metrics":{"J&F 1st frame":"51.63"},"uses_additional_data":true},{"leaderboard":"/sota/referring-expression-segmentation-on-davis","task":"Referring Expression Segmentation","dataset":"DAVIS 2017 (val)","model":"URVOS + Refer-Youtube-VOS","rank_in_archive_order":11,"of":18,"metrics":{"J&F 1st frame":"46.85"},"uses_additional_data":true},{"leaderboard":"/sota/referring-expression-segmentation-on-davis","task":"Referring Expression Segmentation","dataset":"DAVIS 2017 (val)","model":"URVOS","rank_in_archive_order":15,"of":18,"metrics":{"J&F 1st frame":"44.1"},"uses_additional_data":false},{"leaderboard":"/sota/referring-expression-segmentation-on-refer-1","task":"Referring Expression Segmentation","dataset":"Refer-YouTube-VOS (2021 public validation)","model":"URVOS","rank_in_archive_order":32,"of":33,"metrics":{"F":"50.8","J":"47.0","J&F":"48.9"},"uses_additional_data":false},{"leaderboard":"/sota/referring-video-object-segmentation-on-mevis","task":"Referring Video Object Segmentation","dataset":"MeViS","model":"URVOS","rank_in_archive_order":16,"of":16,"metrics":{"F":"29.9","J":"25.7","J&F":"27.8"},"uses_additional_data":false},{"leaderboard":"/sota/referring-video-object-segmentation-on-ref","task":"Referring Video Object Segmentation","dataset":"Ref-DAVIS17","model":"URVOS","rank_in_archive_order":11,"of":11,"metrics":{"F":"56.0","J":"47.3","J&F":"51.6"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}