{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/lucid-data-dreaming-for-video-object","title":"Lucid Data Dreaming for Video Object Segmentation","arxiv_id":"1703.09554","date":"2017-03-28","proceeding":null,"authors":["Anna Khoreva","Rodrigo Benenson","Eddy Ilg","Thomas Brox","Bernt Schiele"],"abstract":"Convolutional networks reach top quality in pixel-level video object\nsegmentation but require a large amount of training data (1k~100k) to deliver\nsuch results. We propose a new training strategy which achieves\nstate-of-the-art results across three evaluation datasets while using 20x~1000x\nless annotated data than competing methods. Our approach is suitable for both\nsingle and multiple object segmentation. Instead of using large training sets\nhoping to generalize across domains, we generate in-domain training data using\nthe provided annotation on the first frame of each video to synthesize (\"lucid\ndream\") plausible future video frames. In-domain per-video training data allows\nus to train high quality appearance- and motion-based models, as well as tune\nthe post-processing stage. This approach allows to reach competitive results\neven when training from only a single annotated frame, without ImageNet\npre-training. Our results indicate that using a larger training set is not\nautomatically better, and that for the video object segmentation task a smaller\ntraining set that is closer to the target domain is more effective. This\nchanges the mindset regarding how many training samples and general\n\"objectness\" knowledge are required for the video object segmentation task.","url_abs":"http://arxiv.org/abs/1703.09554v5","url_pdf":"http://arxiv.org/pdf/1703.09554v5.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"lucid-data-dreaming-for-video-object","repo_url":"https://github.com/ankhoreva/LucidDataDreaming","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":null},{"paper_slug":"lucid-data-dreaming-for-video-object","repo_url":"https://github.com/birdman9390/MetaMaskTrack","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"lucid-data-dreaming-for-video-object","repo_url":"https://github.com/omkar13/MaskTrack","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"lucid-data-dreaming-for-video-object","repo_url":"https://github.com/yelantingfeng/pyLucid","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":null}],"tasks":[{"task_slug":"multiple-object-tracking","task_name":"Multiple Object Tracking"},{"task_slug":"object","task_name":"Object"},{"task_slug":"object-tracking","task_name":"Object Tracking"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"semi-supervised-video-object-segmentation","task_name":"Semi-Supervised Video Object Segmentation"},{"task_slug":"video-object-segmentation","task_name":"Video Object Segmentation"},{"task_slug":"video-semantic-segmentation","task_name":"Video Semantic Segmentation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/visual-object-tracking-on-davis-2016","task":"Semi-Supervised Video Object Segmentation","dataset":"DAVIS 2016","model":"Lucid","rank_in_archive_order":55,"of":78,"metrics":{"F-measure (Decay)":"9.7","F-measure (Mean)":"82.0","F-measure (Recall)":"88.1","J&F":"82.95","Jaccard (Decay)":"9.1","Jaccard (Mean)":"83.9","Jaccard (Recall)":"95.0"},"uses_additional_data":false},{"leaderboard":"/sota/semi-supervised-video-object-segmentation-on-1","task":"Semi-Supervised Video Object Segmentation","dataset":"DAVIS 2017 (test-dev)","model":"Lucid","rank_in_archive_order":44,"of":59,"metrics":{"F-measure (Decay)":"19.5","F-measure (Mean)":"69.9","F-measure (Recall)":"80.1","J&F":"66.6","Jaccard (Decay)":"19.5","Jaccard (Mean)":"63.4","Jaccard (Recall)":"74.0"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=1703.09554","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}