{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/in-defense-of-pre-trained-imagenet","title":"In Defense of Pre-trained ImageNet Architectures for Real-time Semantic Segmentation of Road-driving Images","arxiv_id":"1903.08469","date":"2019-03-20","proceeding":null,"authors":["Marin Oršić","Ivan Krešo","Petra Bevandić","Siniša Šegvić"],"abstract":"Recent success of semantic segmentation approaches on demanding road driving\ndatasets has spurred interest in many related application fields. Many of these\napplications involve real-time prediction on mobile platforms such as cars,\ndrones and various kinds of robots. Real-time setup is challenging due to\nextraordinary computational complexity involved. Many previous works address\nthe challenge with custom lightweight architectures which decrease\ncomputational complexity by reducing depth, width and layer capacity with\nrespect to general purpose architectures. We propose an alternative approach\nwhich achieves a significantly better performance across a wide range of\ncomputing budgets. First, we rely on a light-weight general purpose\narchitecture as the main recognition engine. Then, we leverage light-weight\nupsampling with lateral connections as the most cost-effective solution to\nrestore the prediction resolution. Finally, we propose to enlarge the receptive\nfield by fusing shared features at multiple resolutions in a novel fashion.\nExperiments on several road driving datasets show a substantial advantage of\nthe proposed approach, either with ImageNet pre-trained parameters or when we\nlearn from scratch. Our Cityscapes test submission entitled SwiftNetRN-18\ndelivers 75.5% MIoU and achieves 39.9 Hz on 1024x2048 images on GTX1080Ti.","url_abs":"http://arxiv.org/abs/1903.08469v2","url_pdf":"http://arxiv.org/pdf/1903.08469v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"in-defense-of-pre-trained-imagenet","repo_url":"https://github.com/orsic/swiftnet","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"GPL-3.0"}},{"paper_slug":"in-defense-of-pre-trained-imagenet","repo_url":"https://github.com/Katexiang/swiftnet","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":{"status":"ok"}},{"paper_slug":"in-defense-of-pre-trained-imagenet","repo_url":"https://github.com/Maligetzus/Semantic-Segmentation-of-Aerial-Imagery","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}},{"paper_slug":"in-defense-of-pre-trained-imagenet","repo_url":"https://github.com/Maligetzus/Semantic-Segmentation-of-Aerial-Photographs","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":{"status":"ok"}},{"paper_slug":"in-defense-of-pre-trained-imagenet","repo_url":"https://github.com/XuJiacong/PIDNet","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}},{"paper_slug":"in-defense-of-pre-trained-imagenet","repo_url":"https://github.com/zh320/realtime-semantic-segmentation-pytorch","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"real-time-semantic-segmentation","task_name":"Real-Time Semantic Segmentation"},{"task_slug":"semantic-segmentation","task_name":"Semantic Segmentation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/real-time-semantic-segmentation-on-cityscapes","task":"Real-Time Semantic Segmentation","dataset":"Cityscapes test","model":"SwiftNetRN-18","rank_in_archive_order":12,"of":39,"metrics":{"Frame (fps)":"39.9","mIoU":"75.5%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-cityscapes","task":"Semantic Segmentation","dataset":"Cityscapes test","model":"SwiftNetRN-18","rank_in_archive_order":66,"of":105,"metrics":{"Mean IoU (class)":"75.5%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-dada-seg","task":"Semantic Segmentation","dataset":"DADA-seg","model":"SwiftNet (ResNet-18)","rank_in_archive_order":19,"of":28,"metrics":{"mIoU":"20.5"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-densepass","task":"Semantic Segmentation","dataset":"DensePASS","model":"SwiftNet (Cityscapes)","rank_in_archive_order":33,"of":36,"metrics":{"mIoU":"25.67%"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-eventscape","task":"Semantic Segmentation","dataset":"EventScape","model":"SwiftNet","rank_in_archive_order":12,"of":12,"metrics":{"mIoU":"36.67"},"uses_additional_data":false},{"leaderboard":"/sota/semantic-segmentation-on-zju-rgb-p","task":"Semantic Segmentation","dataset":"ZJU-RGB-P","model":"SwiftNet (RGB)","rank_in_archive_order":13,"of":13,"metrics":{"mIoU":"80.3"},"uses_additional_data":false}],"syntology":{"syntology_url":"https://syntology.ai/paper/1903.08469","atlas_url":"https://app.syntology.ai/?focus=1903.08469","mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}