{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/pyramid-dilated-deeper-convlstm-for-video","title":"Pyramid Dilated Deeper ConvLSTM for Video Salient Object Detection","arxiv_id":null,"date":"2018-09-01","proceeding":"ECCV 2018 9","authors":["Hongmei Song","Wenguan Wang","Sanyuan Zhao","Jianbing Shen","Kin-Man Lam"],"abstract":"This paper proposes a fast video salient object detection model, based on a novel recurrent network architecture, named Pyramid Dilated Bidirectional ConvLSTM (PDB-ConvLSTM). A Pyramid Dilated Convolution (PDC) module is first designed for simultaneously extracting spatial features at multiple scales. These spatial features are then concatenated and fed into an extended Deeper Bidirectional ConvLSTM (DB-ConvLSTM) to learn spatiotemporal information. Forward and backward ConvLSTM units are placed in two layers and connected in a cascaded way, encouraging information flow between the bi-directional streams and leading to deeper feature extraction. We further augment DB-ConvLSTM with a PDC-like structure, by adopting several dilated DB-ConvLSTMs to extract multi-scale spatiotemporal information.  Extensive experimental results show that our method outperforms previous video saliency models in a large margin, with a real-time speed of 20 fps on a single GPU. With unsupervised video object segmentation as an example application, the proposed model (with a CRF-based post-process) achieves state-of-the-art results on two popular benchmarks, well demonstrating its superior performance and high applicability.","url_abs":"http://openaccess.thecvf.com/content_ECCV_2018/html/Hongmei_Song_Pseudo_Pyramid_Deeper_ECCV_2018_paper.html","url_pdf":"http://openaccess.thecvf.com/content_ECCV_2018/papers/Hongmei_Song_Pseudo_Pyramid_Deeper_ECCV_2018_paper.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[],"tasks":[{"task_slug":null,"task_name":"GPU"},{"task_slug":"object","task_name":"Object"},{"task_slug":"object-detection","task_name":"Object Detection"},{"task_slug":"salient-object-detection","task_name":"RGB Salient Object Detection"},{"task_slug":"salient-object-detection-1","task_name":"Salient Object Detection"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"},{"task_slug":"unsupervised-video-object-segmentation","task_name":"Unsupervised Video Object Segmentation"},{"task_slug":"video-object-segmentation","task_name":"Video Object Segmentation"},{"task_slug":"video-salient-object-detection","task_name":"Video Salient Object Detection"},{"task_slug":"video-semantic-segmentation","task_name":"Video Semantic Segmentation"},{"task_slug":"object-detection-1","task_name":"object-detection"}],"methods":[{"method_slug":"convlstm","method_name":"ConvLSTM"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"dilated-convolution","method_name":"Dilated Convolution"},{"method_slug":"speed","method_name":"SPEED"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"tanh-activation","method_name":"Tanh Activation"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/unsupervised-video-object-segmentation-on-10","task":"Unsupervised Video Object Segmentation","dataset":"DAVIS 2016 val","model":"PDB","rank_in_archive_order":25,"of":25,"metrics":{"F":"74.5","G":"75.9","J":"77.2"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-video-object-segmentation-on-5","task":"Unsupervised Video Object Segmentation","dataset":"DAVIS 2017 (test-dev)","model":"PDB","rank_in_archive_order":5,"of":6,"metrics":{"F-measure (Decay)":"3.7","F-measure (Mean)":"43.0","F-measure (Recall)":"44.6","J&F":"40.4","Jaccard (Decay)":"4.0","Jaccard (Mean)":"37.7","Jaccard (Recall)":"42.6"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-video-object-segmentation-on-4","task":"Unsupervised Video Object Segmentation","dataset":"DAVIS 2017 (val)","model":"PDB","rank_in_archive_order":9,"of":10,"metrics":{"F-measure (Mean)":"57.0","F-measure (Recall)":"60.2","J&F":"55.1","Jaccard (Mean)":"53.2","Jaccard (Recall)":"58.9"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-video-object-segmentation-on-11","task":"Unsupervised Video Object Segmentation","dataset":"FBMS test","model":"PDB","rank_in_archive_order":15,"of":15,"metrics":{"J":"74.0"},"uses_additional_data":false},{"leaderboard":"/sota/unsupervised-video-object-segmentation-on-12","task":"Unsupervised Video Object Segmentation","dataset":"YouTube-Objects","model":"PDB","rank_in_archive_order":16,"of":16,"metrics":{"J":"65.5"},"uses_additional_data":false},{"leaderboard":"/sota/video-salient-object-detection-on-davis-2016","task":"Video Salient Object Detection","dataset":"DAVIS-2016","model":"PDB","rank_in_archive_order":6,"of":11,"metrics":{"AVERAGE MAE":"0.028","MAX E-MEASURE":"0.951","S-Measure":"0.882"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-davsod-2","task":"Video Salient Object Detection","dataset":"DAVSOD-Difficult20","model":"PDB","rank_in_archive_order":3,"of":8,"metrics":{"Average MAE":"0.107","S-Measure":"0.608","max E-measure":"0.678"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-davsod-1","task":"Video Salient Object Detection","dataset":"DAVSOD-Normal25","model":"PDB","rank_in_archive_order":2,"of":8,"metrics":{"Average MAE":"0.132","S-Measure":"0.649","max E-measure":"0.698"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-davsod","task":"Video Salient Object Detection","dataset":"DAVSOD-easy35","model":"PDB","rank_in_archive_order":3,"of":9,"metrics":{"Average MAE":"0.114","S-Measure":"0.706","max E-Measure":"0.749","max F-Measure":"0.591"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-fbms-59","task":"Video Salient Object Detection","dataset":"FBMS-59","model":"PDB","rank_in_archive_order":6,"of":16,"metrics":{"AVERAGE MAE":"0.064","MAX F-MEASURE":"0.821","S-Measure":"0.851"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-mcl","task":"Video Salient Object Detection","dataset":"MCL","model":"PDB","rank_in_archive_order":1,"of":8,"metrics":{"AVERAGE MAE":"0.021","MAX E-MEASURE":"0.911","S-Measure":"0.856"},"uses_additional_data":false},{"leaderboard":"/sota/video-salient-object-detection-on-segtrack-v2","task":"Video Salient Object Detection","dataset":"SegTrack v2","model":"PDB","rank_in_archive_order":2,"of":8,"metrics":{"AVERAGE MAE":"0.024","S-Measure":"0.864","max E-measure":"0.935"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-uvsd","task":"Video Salient Object Detection","dataset":"UVSD","model":"PDB","rank_in_archive_order":1,"of":8,"metrics":{"Average MAE":"0.018","S-Measure":"0.901","max E-measure":"0.975"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-vos-t","task":"Video Salient Object Detection","dataset":"VOS-T","model":"PDB","rank_in_archive_order":3,"of":9,"metrics":{"Average MAE":"0.078","S-Measure":"0.818","max E-measure":"0.837"},"uses_additional_data":true},{"leaderboard":"/sota/video-salient-object-detection-on-visal","task":"Video Salient Object Detection","dataset":"ViSal","model":"PDB","rank_in_archive_order":4,"of":10,"metrics":{"Average MAE":"0.032","S-Measure":"0.907","max E-measure":"0.846"},"uses_additional_data":true}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}