{"url":"/task/panoptic-segmentation","name":"Panoptic Segmentation","slug":"panoptic-segmentation","description_markdown":"**Panoptic Segmentation** is a computer vision task that combines semantic segmentation and instance segmentation to provide a comprehensive understanding of the scene. The goal of panoptic segmentation is to segment the image into semantically meaningful parts or regions, while also detecting and distinguishing individual instances of objects within those regions. In a given image, every pixel is assigned a semantic label, and pixels belonging to \"things\" classes (countable objects with instances, like cars and people) are assigned unique instance IDs.\r\n<span style=\"color:grey; opacity: 0.6\">( Image credit: [Detectron2](https://github.com/facebookresearch/detectron2) )</span>","categories":[{"name":"Computer Vision","url":"/area/computer-vision"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":462,"papers_with_code":257,"benchmarks":27,"benchmark_tables_in_archive":27,"benchmark_tables_shown":27,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":37,"subtasks":2,"parent_tasks":1},"benchmarks":[{"leaderboard":"/sota/panoptic-segmentation-on-coco-test-dev","slug":"panoptic-segmentation-on-coco-test-dev","dataset":"COCO test-dev","dataset_url":"/dataset/coco","rows_in_archive":38,"metrics":["PQ","PQst","PQth"],"first_row_in_archive_order":{"model":"Mask DINO (single scale)","paper_title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","paper_url":"/paper/mask-dino-towards-a-unified-transformer-based-1","paper_date":"2022-06-06","arxiv_id":"2206.02777","code_links":[{"title":"PaddlePaddle/PaddleDetection","url":"https://github.com/PaddlePaddle/PaddleDetection"},{"title":"IDEACVR/DINO","url":"https://github.com/IDEACVR/DINO"},{"title":"idea-research/maskdino","url":"https://github.com/idea-research/maskdino"},{"title":"idea-research/dn-detr","url":"https://github.com/idea-research/dn-detr"},{"title":"IDEA-opensource/DN-DETR","url":"https://github.com/IDEA-opensource/DN-DETR"},{"title":"IDEA-opensource/DAB-DETR","url":"https://github.com/IDEA-opensource/DAB-DETR"},{"title":"idea-research/dab-detr","url":"https://github.com/idea-research/dab-detr"},{"title":"isbrycee/gem-glass-segmentor","url":"https://github.com/isbrycee/gem-glass-segmentor"},{"title":"isbrycee/gem","url":"https://github.com/isbrycee/gem"},{"title":"Expedit-LargeScale-Vision-Transformer/Expedit-DINO","url":"https://github.com/Expedit-LargeScale-Vision-Transformer/Expedit-DINO"}],"syntology":{"n":13,"n_ran":11,"n_unverified":2,"n_pointer_only":13}}},{"leaderboard":"/sota/panoptic-segmentation-on-cityscapes-val","slug":"panoptic-segmentation-on-cityscapes-val","dataset":"Cityscapes val","dataset_url":"/dataset/cityscapes","rows_in_archive":37,"metrics":["PQ","PQst","PQth","mIoU","AP","RQ","SQ"],"first_row_in_archive_order":{"model":"ViT-P (OneFormer, InternImage-H)","paper_title":"The Missing Point in Vision Transformers for Universal Image Segmentation","paper_url":"/paper/the-missing-point-in-vision-transformers-for","paper_date":"2025-05-26","arxiv_id":"2505.19795","code_links":[{"title":"sajjad-sh33/vit-p","url":"https://github.com/sajjad-sh33/vit-p"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-coco-minival","slug":"panoptic-segmentation-on-coco-minival","dataset":"COCO minival","dataset_url":"/dataset/coco","rows_in_archive":31,"metrics":["PQ","PQst","PQth","RQ","SQ","RQst","RQth","SQst","SQth","AP","mIoU","boxAP","maskAP"],"first_row_in_archive_order":{"model":"HyperSeg (Swin-B)","paper_title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","paper_url":"/paper/hyperseg-towards-universal-visual","paper_date":"2024-11-26","arxiv_id":"2411.17606","code_links":[{"title":"congvvc/HyperSeg","url":"https://github.com/congvvc/HyperSeg"}],"syntology":{"n":17,"n_ran":7,"n_unverified":10,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-ade20k-val","slug":"panoptic-segmentation-on-ade20k-val","dataset":"ADE20K val","dataset_url":"/dataset/ade20k","rows_in_archive":25,"metrics":["PQ","mIoU","AP"],"first_row_in_archive_order":{"model":"OneFormer (InternImage-H, emb_dim=256, single-scale, 896x896)","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","paper_url":"/paper/oneformer-one-transformer-to-rule-universal","paper_date":"2022-11-10","arxiv_id":"2211.06220","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"SHI-Labs/OneFormer","url":"https://github.com/SHI-Labs/OneFormer"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-1/oneformer"},{"title":"MindCode-4/code-2","url":"https://github.com/MindCode-4/code-2/tree/main/oneformer"}],"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-mapillary-val","slug":"panoptic-segmentation-on-mapillary-val","dataset":"Mapillary val","dataset_url":"/dataset/mapillary-vistas-dataset","rows_in_archive":13,"metrics":["PQ","mIoU","PQst","PQth"],"first_row_in_archive_order":{"model":"OneFormer (DiNAT-L, single-scale)","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","paper_url":"/paper/oneformer-one-transformer-to-rule-universal","paper_date":"2022-11-10","arxiv_id":"2211.06220","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"SHI-Labs/OneFormer","url":"https://github.com/SHI-Labs/OneFormer"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-1/oneformer"},{"title":"MindCode-4/code-2","url":"https://github.com/MindCode-4/code-2/tree/main/oneformer"}],"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-cityscapes-test","slug":"panoptic-segmentation-on-cityscapes-test","dataset":"Cityscapes test","dataset_url":"/dataset/cityscapes","rows_in_archive":10,"metrics":["PQ"],"first_row_in_archive_order":{"model":"OneFormer (ConvNeXt-L, single-scale, Mapillary Vistas-Pretrained)","paper_title":"OneFormer: One Transformer to Rule Universal Image Segmentation","paper_url":"/paper/oneformer-one-transformer-to-rule-universal","paper_date":"2022-11-10","arxiv_id":"2211.06220","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"SHI-Labs/OneFormer","url":"https://github.com/SHI-Labs/OneFormer"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-1/oneformer"},{"title":"MindCode-4/code-2","url":"https://github.com/MindCode-4/code-2/tree/main/oneformer"}],"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-lars","slug":"panoptic-segmentation-on-lars","dataset":"LaRS","dataset_url":"/dataset/lars","rows_in_archive":8,"metrics":["PQ"],"first_row_in_archive_order":{"model":"Mask2Former (Swin-B)","paper_title":"LaRS: A Diverse Panoptic Maritime Obstacle Detection Dataset and Benchmark","paper_url":"/paper/lars-a-diverse-panoptic-maritime-obstacle","paper_date":"2023-08-18","arxiv_id":"2308.09618","code_links":[{"title":"lojzezust/lars_evaluator","url":"https://github.com/lojzezust/lars_evaluator"},{"title":"lojzezust/mmsegmentation-macvi","url":"https://github.com/lojzezust/mmsegmentation-macvi"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-s3dis-area5","slug":"panoptic-segmentation-on-s3dis-area5","dataset":"S3DIS Area5","dataset_url":"/dataset/s3dis","rows_in_archive":5,"metrics":["PQ","RQ","SQ","PQ (with stuff)","RQ (with stuff)","SQ (with stuff)","Params (M)"],"first_row_in_archive_order":{"model":"SuperCluster","paper_title":"Scalable 3D Panoptic Segmentation As Superpoint Graph Clustering","paper_url":"/paper/scalable-3d-panoptic-segmentation-with","paper_date":"2024-01-12","arxiv_id":"2401.06704","code_links":[{"title":"drprojects/superpoint_transformer","url":"https://github.com/drprojects/superpoint_transformer"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-scannetv2","slug":"panoptic-segmentation-on-scannetv2","dataset":"ScanNetV2","dataset_url":"/dataset/scannet","rows_in_archive":5,"metrics":["PQ","RQ","SQ","Params (M)"],"first_row_in_archive_order":{"model":"OneFormer3D","paper_title":"OneFormer3D: One Transformer for Unified Point Cloud Segmentation","paper_url":"/paper/oneformer3d-one-transformer-for-unified-point","paper_date":"2023-11-24","arxiv_id":"2311.14405","code_links":[{"title":"oneformer3d/oneformer3d","url":"https://github.com/oneformer3d/oneformer3d"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-indian-driving-1","slug":"panoptic-segmentation-on-indian-driving-1","dataset":"Indian Driving Dataset","dataset_url":"/dataset/idd","rows_in_archive":4,"metrics":["PQ"],"first_row_in_archive_order":{"model":"EfficientPS","paper_title":"EfficientPS: Efficient Panoptic Segmentation","paper_url":"/paper/efficientps-efficient-panoptic-segmentation","paper_date":"2020-04-05","arxiv_id":"2004.02307","code_links":[{"title":"DeepSceneSeg/EfficientPS","url":"https://github.com/DeepSceneSeg/EfficientPS"},{"title":"vincrichard/EfficientPS","url":"https://github.com/vincrichard/EfficientPS"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-kitti-panoptic-1","slug":"panoptic-segmentation-on-kitti-panoptic-1","dataset":"KITTI Panoptic Segmentation","dataset_url":"/dataset/kitti","rows_in_archive":4,"metrics":["PQ"],"first_row_in_archive_order":{"model":"EfficientPS","paper_title":"EfficientPS: Efficient Panoptic Segmentation","paper_url":"/paper/efficientps-efficient-panoptic-segmentation","paper_date":"2020-04-05","arxiv_id":"2004.02307","code_links":[{"title":"DeepSceneSeg/EfficientPS","url":"https://github.com/DeepSceneSeg/EfficientPS"},{"title":"vincrichard/EfficientPS","url":"https://github.com/vincrichard/EfficientPS"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-pannuke","slug":"panoptic-segmentation-on-pannuke","dataset":"PanNuke","dataset_url":"/dataset/pannuke","rows_in_archive":4,"metrics":["PQ"],"first_row_in_archive_order":{"model":"LKCell","paper_title":"LKCell: Efficient Cell Nuclei Instance Segmentation with Large Convolution Kernels","paper_url":"/paper/lkcell-efficient-cell-nuclei-instance","paper_date":"2024-07-25","arxiv_id":"2407.18054","code_links":[{"title":"hustvl/lkcell","url":"https://github.com/hustvl/lkcell"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-scannet","slug":"panoptic-segmentation-on-scannet","dataset":"ScanNet","dataset_url":"/dataset/scannet","rows_in_archive":4,"metrics":["PQ","PQ_th","PQ_st"],"first_row_in_archive_order":{"model":"OneFormer3D","paper_title":"OneFormer3D: One Transformer for Unified Point Cloud Segmentation","paper_url":"/paper/oneformer3d-one-transformer-for-unified-point","paper_date":"2023-11-24","arxiv_id":"2311.14405","code_links":[{"title":"oneformer3d/oneformer3d","url":"https://github.com/oneformer3d/oneformer3d"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-pastis","slug":"panoptic-segmentation-on-pastis","dataset":"PASTIS","dataset_url":"/dataset/pastis","rows_in_archive":3,"metrics":["PQ","RQ","SQ"],"first_row_in_archive_order":{"model":"Exchanger+Mask2Former","paper_title":"Revisiting the Encoding of Satellite Image Time Series","paper_url":"/paper/rethinking-the-encoding-of-satellite-image","paper_date":"2023-05-03","arxiv_id":"2305.02086","code_links":[{"title":"TotalVariation/Exchanger4SITS","url":"https://github.com/TotalVariation/Exchanger4SITS"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-coco-panoptic","slug":"panoptic-segmentation-on-coco-panoptic","dataset":"COCO panoptic","dataset_url":"/dataset/coco","rows_in_archive":2,"metrics":["PQ","PQst","PQth"],"first_row_in_archive_order":{"model":"VAN-B6*","paper_title":"Visual Attention Network","paper_url":"/paper/visual-attention-network","paper_date":"2022-02-20","arxiv_id":"2202.09741","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"facebookresearch/xformers","url":"https://github.com/facebookresearch/xformers"},{"title":"PaddlePaddle/PaddleClas","url":"https://github.com/PaddlePaddle/PaddleClas"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"lucasjinreal/yolov7_d2","url":"https://github.com/lucasjinreal/yolov7_d2"},{"title":"MenghaoGuo/Awesome-Vision-Attentions","url":"https://github.com/MenghaoGuo/Awesome-Vision-Attentions"},{"title":"chengtan9907/simvpv2","url":"https://github.com/chengtan9907/simvpv2"},{"title":"sithu31296/semantic-segmentation","url":"https://github.com/sithu31296/semantic-segmentation"},{"title":"Visual-Attention-Network/VAN-Classification","url":"https://github.com/Visual-Attention-Network/VAN-Classification"},{"title":"Westlake-AI/openmixup","url":"https://github.com/Westlake-AI/openmixup"},{"title":"Visual-Attention-Network/VAN-Segmentation","url":"https://github.com/Visual-Attention-Network/VAN-Segmentation"},{"title":"DarshanDeshpande/jax-models","url":"https://github.com/DarshanDeshpande/jax-models"},{"title":"Jittor-Image-Models/Jittor-Image-Models","url":"https://github.com/Jittor-Image-Models/Jittor-Image-Models"},{"title":"Visual-Attention-Network/VAN-Jittor","url":"https://github.com/Visual-Attention-Network/VAN-Jittor"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"shkarupa-alex/tfvan","url":"https://github.com/shkarupa-alex/tfvan"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/5/van"},{"title":"Asthestarsfalll/VAN-MegEngine","url":"https://github.com/Asthestarsfalll/VAN-MegEngine"},{"title":"flytocc/PaddleClas","url":"https://github.com/flytocc/PaddleClas"},{"title":"EMalagoli92/VAN-Classification-TensorFlow","url":"https://github.com/EMalagoli92/VAN-Classification-TensorFlow"},{"title":"MindCode-4/code-1","url":"https://github.com/MindCode-4/code-1/tree/main/van"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-muses-multi-sensor-1","slug":"panoptic-segmentation-on-muses-multi-sensor-1","dataset":"MUSES: MUlti-SEnsor Semantic perception dataset","dataset_url":"/dataset/muses-multi-sensor-semantic-perception","rows_in_archive":2,"metrics":["PQ"],"first_row_in_archive_order":{"model":"CAFuser (Swin-T)","paper_title":"CAFuser: Condition-Aware Multimodal Fusion for Robust Semantic Perception of Driving Scenes","paper_url":"/paper/condition-aware-multimodal-fusion-for-robust","paper_date":"2024-10-14","arxiv_id":"2410.10791","code_links":[{"title":"timbroed/cafuser","url":"https://github.com/timbroed/cafuser"}],"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-nyu-depth-v2","slug":"panoptic-segmentation-on-nyu-depth-v2","dataset":"NYU Depth v2","dataset_url":"/dataset/nyuv2","rows_in_archive":2,"metrics":["PQ"],"first_row_in_archive_order":{"model":"EMSANet (2x ResNet-34 NBt1D, PanopticNDT version, finetuned)","paper_title":"PanopticNDT: Efficient and Robust Panoptic Mapping","paper_url":"/paper/panopticndt-efficient-and-robust-panoptic","paper_date":"2023-09-24","arxiv_id":"2309.13635","code_links":[{"title":"tui-nicr/emsanet","url":"https://github.com/tui-nicr/emsanet"},{"title":"tui-nicr/panoptic-mapping","url":"https://github.com/tui-nicr/panoptic-mapping"},{"title":"tui-nicr/nicr-scene-analysis-datasets","url":"https://github.com/tui-nicr/nicr-scene-analysis-datasets"},{"title":"tui-nicr/emsaformer","url":"https://github.com/tui-nicr/emsaformer"}],"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-semantickitti","slug":"panoptic-segmentation-on-semantickitti","dataset":"SemanticKITTI","dataset_url":"/dataset/semantickitti","rows_in_archive":2,"metrics":["PQ","PQ_dagger","PQst","PQth","RQ","RQst","RQth","SQ","SQst","SQth","mIoU"],"first_row_in_archive_order":{"model":"P3Former","paper_title":"Position-Guided Point Cloud Panoptic Segmentation Transformer","paper_url":"/paper/position-guided-point-cloud-panoptic","paper_date":"2023-03-23","arxiv_id":"2303.13509","code_links":[{"title":"smartbot-pjlab/p3former","url":"https://github.com/smartbot-pjlab/p3former"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-ade20k","slug":"panoptic-segmentation-on-ade20k","dataset":"ADE20K","dataset_url":"/dataset/ade20k","rows_in_archive":1,"metrics":["PQ"],"first_row_in_archive_order":{"model":"MasQCLIP","paper_title":"MasQCLIP for Open-Vocabulary Universal Image Segmentation","paper_url":"/paper/masqclip-for-open-vocabulary-universal-image","paper_date":"2023-01-01","arxiv_id":null,"code_links":[{"title":"mlpc-ucsd/MasQCLIP","url":"https://github.com/mlpc-ucsd/MasQCLIP"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-dales","slug":"panoptic-segmentation-on-dales","dataset":"DALES","dataset_url":"/dataset/dales","rows_in_archive":1,"metrics":["PQ","RQ","SQ","Params (M)"],"first_row_in_archive_order":{"model":"SuperCluster","paper_title":"Scalable 3D Panoptic Segmentation As Superpoint Graph Clustering","paper_url":"/paper/scalable-3d-panoptic-segmentation-with","paper_date":"2024-01-12","arxiv_id":"2401.06704","code_links":[{"title":"drprojects/superpoint_transformer","url":"https://github.com/drprojects/superpoint_transformer"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-hypersim","slug":"panoptic-segmentation-on-hypersim","dataset":"Hypersim","dataset_url":"/dataset/hypersim","rows_in_archive":1,"metrics":["PQ","PQ (test)","mIoU","mIoU (test)"],"first_row_in_archive_order":{"model":"EMSANet (2x ResNet-34 NBt1D)","paper_title":"PanopticNDT: Efficient and Robust Panoptic Mapping","paper_url":"/paper/panopticndt-efficient-and-robust-panoptic","paper_date":"2023-09-24","arxiv_id":"2309.13635","code_links":[{"title":"tui-nicr/emsanet","url":"https://github.com/tui-nicr/emsanet"},{"title":"tui-nicr/panoptic-mapping","url":"https://github.com/tui-nicr/panoptic-mapping"},{"title":"tui-nicr/nicr-scene-analysis-datasets","url":"https://github.com/tui-nicr/nicr-scene-analysis-datasets"},{"title":"tui-nicr/emsaformer","url":"https://github.com/tui-nicr/emsaformer"}],"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}}},{"leaderboard":"/sota/panoptic-segmentation-on-kitti-360","slug":"panoptic-segmentation-on-kitti-360","dataset":"KITTI-360","dataset_url":"/dataset/kitti-360","rows_in_archive":1,"metrics":["PQ","RQ","SQ","Params (M)"],"first_row_in_archive_order":{"model":"SuperCluster","paper_title":"Scalable 3D Panoptic Segmentation As Superpoint Graph Clustering","paper_url":"/paper/scalable-3d-panoptic-segmentation-with","paper_date":"2024-01-12","arxiv_id":"2401.06704","code_links":[{"title":"drprojects/superpoint_transformer","url":"https://github.com/drprojects/superpoint_transformer"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-panoptic-nuscenes","slug":"panoptic-segmentation-on-panoptic-nuscenes","dataset":"Panoptic nuScenes val","dataset_url":null,"rows_in_archive":1,"metrics":["PQ","RQ","SQ","mIoU"],"first_row_in_archive_order":{"model":"PolarSeg-Panoptic","paper_title":"Panoptic nuScenes: A Large-Scale Benchmark for LiDAR Panoptic Segmentation and Tracking","paper_url":"/paper/panoptic-nuscenes-a-large-scale-benchmark-for","paper_date":"2021-09-08","arxiv_id":"2109.03805","code_links":[{"title":"nutonomy/nuscenes-devkit","url":"https://github.com/nutonomy/nuscenes-devkit"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-panoptic-nuscenes-1","slug":"panoptic-segmentation-on-panoptic-nuscenes-1","dataset":"Panoptic nuScenes test","dataset_url":null,"rows_in_archive":1,"metrics":["PQ","RQ","SQ","mIoU"],"first_row_in_archive_order":{"model":"(AF)2-S3Net + CenterPoint","paper_title":"Panoptic nuScenes: A Large-Scale Benchmark for LiDAR Panoptic Segmentation and Tracking","paper_url":"/paper/panoptic-nuscenes-a-large-scale-benchmark-for","paper_date":"2021-09-08","arxiv_id":"2109.03805","code_links":[{"title":"nutonomy/nuscenes-devkit","url":"https://github.com/nutonomy/nuscenes-devkit"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-pastis-r","slug":"panoptic-segmentation-on-pastis-r","dataset":"PASTIS-R","dataset_url":"/dataset/pastis-r","rows_in_archive":1,"metrics":["PQ","RQ","SQ"],"first_row_in_archive_order":{"model":"Early Fusion","paper_title":"Multi-Modal Temporal Attention Models for Crop Mapping from Satellite Time Series","paper_url":"/paper/multi-modal-temporal-attention-models-for","paper_date":"2021-12-14","arxiv_id":"2112.07558","code_links":[{"title":"VSainteuf/pastis-benchmark","url":"https://github.com/VSainteuf/pastis-benchmark"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-s3dis","slug":"panoptic-segmentation-on-s3dis","dataset":"S3DIS","dataset_url":"/dataset/s3dis","rows_in_archive":1,"metrics":["PQ","RQ","SQ","PQ (with stuff)","RQ (with stuff)","SQ (with stuff)","Params (M)"],"first_row_in_archive_order":{"model":"SuperCluster","paper_title":"Scalable 3D Panoptic Segmentation As Superpoint Graph Clustering","paper_url":"/paper/scalable-3d-panoptic-segmentation-with","paper_date":"2024-01-12","arxiv_id":"2401.06704","code_links":[{"title":"drprojects/superpoint_transformer","url":"https://github.com/drprojects/superpoint_transformer"}],"syntology":null}},{"leaderboard":"/sota/panoptic-segmentation-on-sun-rgbd","slug":"panoptic-segmentation-on-sun-rgbd","dataset":"SUN-RGBD","dataset_url":"/dataset/sun-rgb-d","rows_in_archive":1,"metrics":["PQ"],"first_row_in_archive_order":{"model":"EMSANet","paper_title":"Efficient Multi-Task RGB-D Scene Analysis for Indoor Environments","paper_url":"/paper/efficient-multi-task-rgb-d-scene-analysis-for","paper_date":"2022-07-10","arxiv_id":"2207.04526","code_links":[{"title":"tui-nicr/emsanet","url":"https://github.com/tui-nicr/emsanet"},{"title":"tui-nicr/nicr-scene-analysis-datasets","url":"https://github.com/tui-nicr/nicr-scene-analysis-datasets"}],"syntology":null}}],"datasets":[{"url":"/dataset/coco","name":"COCO (Common Objects in Context)","full_name":"Common Objects in Context","num_papers_in_archive":11922},{"url":"/dataset/cityscapes","name":"Cityscapes","full_name":"","num_papers_in_archive":3702},{"url":"/dataset/kitti","name":"KITTI","full_name":"","num_papers_in_archive":3661},{"url":"/dataset/scannet","name":"ScanNet","full_name":"","num_papers_in_archive":1595},{"url":"/dataset/ade20k","name":"ADE20K","full_name":"","num_papers_in_archive":1213},{"url":"/dataset/nyuv2","name":"NYUv2","full_name":"NYU-Depth V2","num_papers_in_archive":986},{"url":"/dataset/semantickitti","name":"SemanticKITTI","full_name":"","num_papers_in_archive":669},{"url":"/dataset/s3dis","name":"S3DIS","full_name":"Stanford 3D Indoor Scene Dataset (S3DIS)","num_papers_in_archive":488},{"url":"/dataset/sun-rgb-d","name":"SUN RGB-D","full_name":"SUN RGB-D","num_papers_in_archive":477},{"url":"/dataset/bdd100k","name":"BDD100K","full_name":"","num_papers_in_archive":469},{"url":"/dataset/kitti-360","name":"KITTI-360","full_name":"","num_papers_in_archive":246},{"url":"/dataset/hypersim","name":"Hypersim","full_name":"","num_papers_in_archive":108},{"url":"/dataset/mapillary-vistas-dataset","name":"Mapillary Vistas Dataset","full_name":"","num_papers_in_archive":101},{"url":"/dataset/pannuke","name":"PanNuke","full_name":"","num_papers_in_archive":61},{"url":"/dataset/dales","name":"DALES","full_name":"DALES: A Large-scale Aerial LiDAR Data Set for Semantic Segmentation","num_papers_in_archive":26},{"url":"/dataset/hoi4d","name":"HOI4D","full_name":"","num_papers_in_archive":23},{"url":"/dataset/pastis","name":"PASTIS","full_name":"Panoptic Segmentation of satellite image TImes Series","num_papers_in_archive":18},{"url":"/dataset/waterscenes","name":"WaterScenes","full_name":"","num_papers_in_archive":13},{"url":"/dataset/4d-or","name":"4D-OR","full_name":"","num_papers_in_archive":11},{"url":"/dataset/cropandweed-dataset","name":"CropAndWeed","full_name":"","num_papers_in_archive":10},{"url":"/dataset/pascal-panoptic-parts","name":"Pascal Panoptic Parts","full_name":"","num_papers_in_archive":9},{"url":"/dataset/phenobench","name":"PhenoBench","full_name":"PhenoBench — A Large Dataset and Benchmarks for Semantic Image Interpretation in the Agricultural Domain","num_papers_in_archive":9},{"url":"/dataset/cityscapes-panoptic-parts","name":"Cityscapes Panoptic Parts","full_name":"","num_papers_in_archive":8},{"url":"/dataset/panoptic-nuscenes","name":"Panoptic nuScenes","full_name":"","num_papers_in_archive":7},{"url":"/dataset/bup20","name":"BUP20","full_name":"Sweet Pepper 2020 University of Bonn","num_papers_in_archive":5},{"url":"/dataset/lars","name":"LaRS","full_name":"Lakes, Rivers and Seas Dataset","num_papers_in_archive":5},{"url":"/dataset/muses-multi-sensor-semantic-perception","name":"MUSES: MUlti-SEnsor Semantic perception dataset","full_name":"The Multi-Sensor Semantic Perception Dataset for Driving under Uncertainty","num_papers_in_archive":4},{"url":"/dataset/pastis-r","name":"PASTIS-R","full_name":"Panoptic Segmentation of Radar and Optical Satellite image TIme Series","num_papers_in_archive":4},{"url":"/dataset/instaorder","name":"InstaOrder","full_name":"","num_papers_in_archive":2},{"url":"/dataset/sb20","name":"SB20","full_name":"Sugar Beet 2020 University of Bonn","num_papers_in_archive":2},{"url":"/dataset/panoramic-video-panoptic-segmentation-dataset","name":"Panoramic Video Panoptic Segmentation Dataset","full_name":"","num_papers_in_archive":1},{"url":"/dataset/semanticsugarbeets","name":"SemanticSugarBeets","full_name":"","num_papers_in_archive":1},{"url":"/dataset/sickle","name":"SICKLE","full_name":"Satellite Imagery for Cropping annotated with Keyparameter LabEls","num_papers_in_archive":1},{"url":"/dataset/timbervision-dataset","name":"TimberVision","full_name":"TimberVision","num_papers_in_archive":1},{"url":"/dataset/tyc-dataset","name":"TYC Dataset","full_name":"The TYC Dataset for Understanding Instance-Level Semantics and Motions of Cells in Microstructures","num_papers_in_archive":1},{"url":"/dataset/yim-dataset","name":"YIM Dataset","full_name":"Yeast Cells in Microstructures Dataset","num_papers_in_archive":1},{"url":"/dataset/lemons-quality-control-dataset","name":"Lemons quality control dataset","full_name":"","num_papers_in_archive":0}],"subtasks":[{"url":"/task/uncertainty-aware-panoptic-segmentation","name":"Uncertainty-Aware Panoptic Segmentation"},{"url":"/task/video-panoptic-segmentation","name":"Video Panoptic Segmentation"}],"parent_tasks":[{"url":"/task/semantic-segmentation","name":"Semantic Segmentation"}],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":257,"tagged_in_all":462,"items":[{"url":"/paper/mask-r-cnn","title":"Mask R-CNN","date":"2017-03-20","arxiv_id":"1703.06870","repositories_listed":179,"syntology":{"n":140,"n_ran":42,"n_unverified":98,"n_pointer_only":23}},{"url":"/paper/end-to-end-object-detection-with-transformers","title":"End-to-End Object Detection with Transformers","date":"2020-05-26","arxiv_id":"2005.12872","repositories_listed":37,"syntology":{"n":92,"n_ran":59,"n_unverified":33,"n_pointer_only":19}},{"url":"/paper/resnest-split-attention-networks","title":"ResNeSt: Split-Attention Networks","date":"2020-04-19","arxiv_id":"2004.08955","repositories_listed":36,"syntology":{"n":48,"n_ran":8,"n_unverified":40,"n_pointer_only":23}},{"url":"/paper/visual-attention-network","title":"Visual Attention Network","date":"2022-02-20","arxiv_id":"2202.09741","repositories_listed":21,"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/pvtv2-improved-baselines-with-pyramid-vision","title":"PVT v2: Improved Baselines with Pyramid Vision Transformer","date":"2021-06-25","arxiv_id":"2106.13797","repositories_listed":18,"syntology":null},{"url":"/paper/solov2-dynamic-faster-and-stronger","title":"SOLOv2: Dynamic and Fast Instance Segmentation","date":"2020-03-23","arxiv_id":"2003.10152","repositories_listed":18,"syntology":{"n":38,"n_ran":15,"n_unverified":23,"n_pointer_only":24}},{"url":"/paper/panoptic-feature-pyramid-networks","title":"Panoptic Feature Pyramid Networks","date":"2019-01-08","arxiv_id":"1901.02446","repositories_listed":12,"syntology":{"n":12,"n_ran":7,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/mask-dino-towards-a-unified-transformer-based-1","title":"Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation","date":"2022-06-06","arxiv_id":"2206.02777","repositories_listed":10,"syntology":{"n":13,"n_ran":11,"n_unverified":2,"n_pointer_only":13}},{"url":"/paper/focal-modulation-networks","title":"Focal Modulation Networks","date":"2022-03-22","arxiv_id":"2203.11926","repositories_listed":9,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/panoptic-deeplab-a-simple-strong-and-fast","title":"Panoptic-DeepLab: A Simple, Strong, and Fast Baseline for Bottom-Up Panoptic Segmentation","date":"2019-11-22","arxiv_id":"1911.10194","repositories_listed":9,"syntology":{"n":9,"n_ran":3,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/panoptic-segmentation","title":"Panoptic Segmentation","date":"2018-01-03","arxiv_id":"1801.00868","repositories_listed":9,"syntology":null},{"url":"/paper/hierarchical-multi-scale-attention-for","title":"Hierarchical Multi-Scale Attention for Semantic Segmentation","date":"2020-05-21","arxiv_id":"2005.10821","repositories_listed":8,"syntology":{"n":9,"n_ran":1,"n_unverified":8,"n_pointer_only":1}},{"url":"/paper/centermask-real-time-anchor-free-instance-1","title":"CenterMask : Real-Time Anchor-Free Instance Segmentation","date":"2019-11-15","arxiv_id":"1911.06667","repositories_listed":8,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":2}},{"url":"/paper/espnet-efficient-spatial-pyramid-of-dilated","title":"ESPNet: Efficient Spatial Pyramid of Dilated Convolutions for Semantic Segmentation","date":"2018-03-19","arxiv_id":"1803.06815","repositories_listed":8,"syntology":{"n":10,"n_ran":4,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/dilated-neighborhood-attention-transformer","title":"Dilated Neighborhood Attention Transformer","date":"2022-09-29","arxiv_id":"2209.15001","repositories_listed":7,"syntology":null},{"url":"/paper/masked-attention-mask-transformer-for","title":"Masked-attention Mask Transformer for Universal Image Segmentation","date":"2021-12-02","arxiv_id":"2112.01527","repositories_listed":7,"syntology":{"n":8,"n_ran":2,"n_unverified":6,"n_pointer_only":0}},{"url":"/paper/flexivit-one-model-for-all-patch-sizes","title":"FlexiViT: One Model for All Patch Sizes","date":"2022-12-15","arxiv_id":"2212.08013","repositories_listed":6,"syntology":{"n":4,"n_ran":1,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/mask2former-for-video-instance-segmentation","title":"Mask2Former for Video Instance Segmentation","date":"2021-12-20","arxiv_id":"2112.10764","repositories_listed":6,"syntology":{"n":7,"n_ran":2,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/fully-convolutional-networks-for-panoptic","title":"Fully Convolutional Networks for Panoptic Segmentation","date":"2020-12-01","arxiv_id":"2012.00720","repositories_listed":6,"syntology":null},{"url":"/paper/detectors-detecting-objects-with-recursive-1","title":"DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution","date":"2020-06-03","arxiv_id":"2006.02334","repositories_listed":6,"syntology":{"n":4,"n_ran":0,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/axial-deeplab-stand-alone-axial-attention-for","title":"Axial-DeepLab: Stand-Alone Axial-Attention for Panoptic Segmentation","date":"2020-03-17","arxiv_id":"2003.07853","repositories_listed":5,"syntology":{"n":11,"n_ran":3,"n_unverified":8,"n_pointer_only":1}},{"url":"/paper/seamless-scene-segmentation","title":"Seamless Scene Segmentation","date":"2019-05-03","arxiv_id":"1905.01220","repositories_listed":5,"syntology":{"n":2,"n_ran":1,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/panopticndt-efficient-and-robust-panoptic","title":"PanopticNDT: Efficient and Robust Panoptic Mapping","date":"2023-09-24","arxiv_id":"2309.13635","repositories_listed":4,"syntology":{"n":12,"n_ran":0,"n_unverified":12,"n_pointer_only":0}},{"url":"/paper/oneformer-one-transformer-to-rule-universal","title":"OneFormer: One Transformer to Rule Universal Image Segmentation","date":"2022-11-10","arxiv_id":"2211.06220","repositories_listed":4,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/expediting-large-scale-vision-transformer-for","title":"Expediting Large-Scale Vision Transformer for Dense Prediction without Fine-tuning","date":"2022-10-03","arxiv_id":"2210.01035","repositories_listed":4,"syntology":{"n":7,"n_ran":4,"n_unverified":3,"n_pointer_only":0}},{"url":"/paper/cityscapes-panoptic-parts-and-pascal-panoptic","title":"Cityscapes-Panoptic-Parts and PASCAL-Panoptic-Parts datasets for Scene Understanding","date":"2020-04-16","arxiv_id":"2004.07944","repositories_listed":4,"syntology":{"n":6,"n_ran":2,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/pointgroup-dual-set-point-grouping-for-3d","title":"PointGroup: Dual-Set Point Grouping for 3D Instance Segmentation","date":"2020-04-03","arxiv_id":"2004.01658","repositories_listed":4,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/bdd100k-a-diverse-driving-video-database-with","title":"BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask Learning","date":"2018-05-12","arxiv_id":"1805.04687","repositories_listed":4,"syntology":{"n":2,"n_ran":0,"n_unverified":2,"n_pointer_only":0}},{"url":"/paper/4d-panoptic-scene-graph-generation-1","title":"4D Panoptic Scene Graph Generation","date":"2024-05-16","arxiv_id":"2405.10305","repositories_listed":3,"syntology":{"n":14,"n_ran":13,"n_unverified":1,"n_pointer_only":10}},{"url":"/paper/panoptic-video-scene-graph-generation-1","title":"Panoptic Video Scene Graph Generation","date":"2023-11-28","arxiv_id":"2311.17058","repositories_listed":3,"syntology":{"n":11,"n_ran":11,"n_unverified":0,"n_pointer_only":3}}],"syntology_records":26,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}