{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/prototypical-cross-attention-networks-for","title":"Prototypical Cross-Attention Networks for Multiple Object Tracking and Segmentation","arxiv_id":"2106.11958","date":"2021-06-22","proceeding":"NeurIPS 2021 12","authors":["Lei Ke","Xia Li","Martin Danelljan","Yu-Wing Tai","Chi-Keung Tang","Fisher Yu"],"abstract":"Multiple object tracking and segmentation requires detecting, tracking, and segmenting objects belonging to a set of given classes. Most approaches only exploit the temporal dimension to address the association problem, while relying on single frame predictions for the segmentation mask itself. We propose Prototypical Cross-Attention Network (PCAN), capable of leveraging rich spatio-temporal information for online multiple object tracking and segmentation. PCAN first distills a space-time memory into a set of prototypes and then employs cross-attention to retrieve rich information from the past frames. To segment each object, PCAN adopts a prototypical appearance module to learn a set of contrastive foreground and background prototypes, which are then propagated over time. Extensive experiments demonstrate that PCAN outperforms current video instance tracking and segmentation competition winners on both Youtube-VIS and BDD100K datasets, and shows efficacy to both one-stage and two-stage segmentation frameworks. Code and video resources are available at http://vis.xyz/pub/pcan.","url_abs":"https://arxiv.org/abs/2106.11958v2","url_pdf":"https://arxiv.org/pdf/2106.11958v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"prototypical-cross-attention-networks-for","repo_url":"https://github.com/SysCV/pcan","is_official":1,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok","spdx":"Apache-2.0"}}],"tasks":[{"task_slug":"multi-object-tracking-and-segmentation","task_name":"Multi-Object Tracking and Segmentation"},{"task_slug":"multiple-object-track-and-segmentation","task_name":"Multiple Object Track and Segmentation"},{"task_slug":"multiple-object-tracking","task_name":"Multiple Object Tracking"},{"task_slug":"object","task_name":"Object"},{"task_slug":"object-tracking","task_name":"Object Tracking"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"video-instance-segmentation","task_name":"Video Instance Segmentation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/multi-object-tracking-and-segmentation-on-3","task":"Multi-Object Tracking and Segmentation","dataset":"BDD100K val","model":"PCAN","rank_in_archive_order":3,"of":8,"metrics":{"mMOTSA":"27.4"},"uses_additional_data":false},{"leaderboard":"/sota/multi-object-tracking-and-segmentation-on-3","task":"Multi-Object Tracking and Segmentation","dataset":"BDD100K val","model":"QDTrack-mots-fix","rank_in_archive_order":4,"of":8,"metrics":{"mMOTSA":"23.5"},"uses_additional_data":false},{"leaderboard":"/sota/multi-object-tracking-and-segmentation-on-3","task":"Multi-Object Tracking and Segmentation","dataset":"BDD100K val","model":"QDTrack-mots","rank_in_archive_order":5,"of":8,"metrics":{"mMOTSA":"22.5"},"uses_additional_data":false},{"leaderboard":"/sota/multi-object-tracking-and-segmentation-on-3","task":"Multi-Object Tracking and Segmentation","dataset":"BDD100K val","model":"MaskTrackRCNN","rank_in_archive_order":6,"of":8,"metrics":{"mMOTSA":"12.3"},"uses_additional_data":false},{"leaderboard":"/sota/multi-object-tracking-and-segmentation-on-3","task":"Multi-Object Tracking and Segmentation","dataset":"BDD100K val","model":"STEm-Seg","rank_in_archive_order":7,"of":8,"metrics":{"mMOTSA":"12.2"},"uses_additional_data":false},{"leaderboard":"/sota/multi-object-tracking-and-segmentation-on-3","task":"Multi-Object Tracking and Segmentation","dataset":"BDD100K val","model":"SortIoU","rank_in_archive_order":8,"of":8,"metrics":{"mMOTSA":"10.3"},"uses_additional_data":false},{"leaderboard":"/sota/multiple-object-track-and-segmentation-on-2","task":"Multiple Object Track and Segmentation","dataset":"BDD100K val","model":"PCAN","rank_in_archive_order":1,"of":1,"metrics":{"mMOTSA":"27.4"},"uses_additional_data":false},{"leaderboard":"/sota/video-instance-segmentation-on-bdd100k-val","task":"Video Instance Segmentation","dataset":"BDD100K val","model":"PCAN","rank_in_archive_order":1,"of":6,"metrics":{"mMOTSA":"27.4"},"uses_additional_data":false},{"leaderboard":"/sota/video-instance-segmentation-on-bdd100k-val","task":"Video Instance Segmentation","dataset":"BDD100K val","model":"QDTrack-mots-fix","rank_in_archive_order":2,"of":6,"metrics":{"mMOTSA":"23.5"},"uses_additional_data":false},{"leaderboard":"/sota/video-instance-segmentation-on-bdd100k-val","task":"Video Instance Segmentation","dataset":"BDD100K val","model":"QDTrack-mots","rank_in_archive_order":3,"of":6,"metrics":{"mMOTSA":"22.5"},"uses_additional_data":false},{"leaderboard":"/sota/video-instance-segmentation-on-bdd100k-val","task":"Video Instance Segmentation","dataset":"BDD100K val","model":"MaskTrackRCNN","rank_in_archive_order":4,"of":6,"metrics":{"mMOTSA":"12.3"},"uses_additional_data":false},{"leaderboard":"/sota/video-instance-segmentation-on-bdd100k-val","task":"Video Instance Segmentation","dataset":"BDD100K val","model":"STEm-Seg","rank_in_archive_order":5,"of":6,"metrics":{"mMOTSA":"12.2"},"uses_additional_data":false},{"leaderboard":"/sota/video-instance-segmentation-on-bdd100k-val","task":"Video Instance Segmentation","dataset":"BDD100K val","model":"SortIoU","rank_in_archive_order":6,"of":6,"metrics":{"mMOTSA":"10.3"},"uses_additional_data":false},{"leaderboard":"/sota/video-instance-segmentation-on-youtube-vis-1","task":"Video Instance Segmentation","dataset":"YouTube-VIS validation","model":"PCAN(ResNet-50)","rank_in_archive_order":31,"of":44,"metrics":{"AP50":"54.9","AP75":"39.4","AR1":"36.3","AR10":"41.6","mask AP":"36.1"},"uses_additional_data":false}],"syntology":{"atlas_url":"https://app.syntology.ai/?focus=2106.11958","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2106.11958"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-24T18:15:14+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/SysCV/pcan","reach":{"status":"ok","spdx":"Apache-2.0"}}],"summary":{"unverified":5},"by_repo_kind":{"official":{"samples":5,"ran":0,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":0,"samples":[{"code_sha256_prefix":"ecbbdf2760634c6f","entry":"cal_similarity","repo":"SysCV/pcan","repo_kind":"official","path":"pcan/core/track/similarity.py","file_url":"https://github.com/SysCV/pcan/blob/HEAD/pcan/core/track/similarity.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"mcp_get_code":{"code_sha256":"ecbbdf2760634c6f"}},{"code_sha256_prefix":"4cd14952230cdf84","entry":"intersection_over_area","repo":"SysCV/pcan","repo_kind":"official","path":"pcan/core/evaluation/mot.py","file_url":"https://github.com/SysCV/pcan/blob/HEAD/pcan/core/evaluation/mot.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"mcp_get_code":{"code_sha256":"4cd14952230cdf84"}},{"code_sha256_prefix":"d58e5f0465880838","entry":"segtrack2result","repo":"SysCV/pcan","repo_kind":"official","path":"pcan/core/track/transforms.py","file_url":"https://github.com/SysCV/pcan/blob/HEAD/pcan/core/track/transforms.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"mcp_get_code":{"code_sha256":"d58e5f0465880838"}},{"code_sha256_prefix":"8803773e1a105ac1","entry":"track2result","repo":"SysCV/pcan","repo_kind":"official","path":"pcan/core/track/transforms.py","file_url":"https://github.com/SysCV/pcan/blob/HEAD/pcan/core/track/transforms.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"mcp_get_code":{"code_sha256":"8803773e1a105ac1"}},{"code_sha256_prefix":"08df0b7800bb9cc2","entry":"xyxy2xywh","repo":"SysCV/pcan","repo_kind":"official","path":"pcan/core/evaluation/mot.py","file_url":"https://github.com/SysCV/pcan/blob/HEAD/pcan/core/evaluation/mot.py","link_basis":"first_harvest_node","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"Apache-2.0","inline_ok":true,"mcp_get_code":{"code_sha256":"08df0b7800bb9cc2"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}