{"url":"/method/pixelcnn","slug":"pixelcnn","name":"PixelCNN","full_name":"PixelCNN","full_name_withheld":false,"description_markdown":"A **PixelCNN** is a generative model that uses autoregressive connections to model images pixel by pixel, decomposing the joint image distribution as a product of conditionals. PixelCNNs are much faster to train than [PixelRNNs](https://paperswithcode.com/method/pixelrnn) because convolutions are inherently easier to parallelize; given the vast number of pixels present in large image datasets this is an important advantage.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Pixel Recurrent Neural Networks","paper":"/paper/pixel-recurrent-neural-networks","first_author":"Aaron van den Oord","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/pixel-recurrent-neural-networks"},"source":{"url":"http://arxiv.org/abs/1601.06759v3","title":"Pixel Recurrent Neural Networks","url_on_a_paper_host":true},"code_snippet_url":"https://github.com/openai/pixel-cnn","code_snippet_url_on_a_code_host":true,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Likelihood-Based Generative Models","url":"/methods/category/likelihood-based-generative-models","pwc_aliases":[]},{"area":"Computer Vision","area_id":"computer-vision","collection":"Generative Models","url":"/methods/category/generative-models","pwc_aliases":[]}],"n_papers_tagged":45,"archive_num_papers":45,"papers_newest_first":[{"paper":null,"title":"HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models","date":"2025-03-14","arxiv_id":"2503.11513","n_code_links":0,"syntology":null},{"paper":"/paper/pixelbytes-catching-unified-representation","title":"PixelBytes: Catching Unified Representation for Multimodal Generation","date":"2024-09-16","arxiv_id":"2410.01820","n_code_links":1,"syntology":null},{"paper":"/paper/pixelbytes-catching-unified-embedding-for","title":"PixelBytes: Catching Unified Embedding for Multimodal Generation","date":"2024-09-03","arxiv_id":"2409.15512","n_code_links":1,"syntology":null},{"paper":"/paper/sernet-former-semantic-segmentation-by","title":"SERNet-Former: Semantic Segmentation by Efficient Residual Network with Attention-Boosting Gates and Attention-Fusion Networks","date":"2024-01-28","arxiv_id":"2401.15741","n_code_links":2,"syntology":null},{"paper":"/paper/an-attempt-to-generate-new-bridge-types-from-2","title":"An attempt to generate new bridge types from latent space of PixelCNN","date":"2024-01-11","arxiv_id":"2401.05964","n_code_links":1,"syntology":null},{"paper":null,"title":"Deep autoregressive modeling for land use land cover","date":"2024-01-02","arxiv_id":"2401.01395","n_code_links":0,"syntology":null},{"paper":null,"title":"HQ-VAE: Hierarchical Discrete Representation Learning with Variational Bayes","date":"2023-12-31","arxiv_id":"2401.00365","n_code_links":0,"syntology":null},{"paper":null,"title":"SeaDSC: A video-based unsupervised method for dynamic scene change detection in unmanned surface vehicles","date":"2023-11-20","arxiv_id":"2311.11580","n_code_links":0,"syntology":null},{"paper":null,"title":"S-HR-VQVAE: Sequential Hierarchical Residual Learning Vector Quantized Variational Autoencoder for Video Prediction","date":"2023-07-13","arxiv_id":"2307.06701","n_code_links":0,"syntology":null},{"paper":null,"title":"Phased Data Augmentation for Training a Likelihood-Based Generative Model with Limited Data","date":"2023-05-22","arxiv_id":"2305.12681","n_code_links":0,"syntology":null},{"paper":"/paper/learning-with-miselbo-the-mixture-cookbook","title":"Cooperation in the Latent Space: The Benefits of Adding Mixture Components in Variational Autoencoders","date":"2022-09-30","arxiv_id":"2209.15514","n_code_links":1,"syntology":null},{"paper":"/paper/hierarchical-residual-learning-based-vector","title":"Hierarchical Residual Learning Based Vector Quantized Variational Autoencoder for Image Reconstruction and Generation","date":"2022-08-09","arxiv_id":"2208.04554","n_code_links":1,"syntology":null},{"paper":null,"title":"Information Entropy Initialized Concrete Autoencoder for Optimal Sensor Placement and Reconstruction of Geophysical Fields","date":"2022-06-28","arxiv_id":"2206.13968","n_code_links":0,"syntology":null},{"paper":null,"title":"Towards Measuring Domain Shift in Histopathological Stain Translation in an Unsupervised Manner","date":"2022-05-09","arxiv_id":"2205.04368","n_code_links":0,"syntology":null},{"paper":null,"title":"A model of semantic completion in generative episodic memory","date":"2021-11-26","arxiv_id":"2111.13537","n_code_links":0,"syntology":null},{"paper":"/paper/an-unsupervised-video-game-playstyle-metric","title":"An Unsupervised Video Game Playstyle Metric via State Discretization","date":"2021-10-03","arxiv_id":"2110.00950","n_code_links":1,"syntology":null},{"paper":null,"title":"Towards Generative Latent Variable Models for Speech","date":"2021-09-29","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/two-souls-in-an-adversarial-image-towards","title":"Two Souls in an Adversarial Image: Towards Universal Adversarial Example Detection using Multi-view Inconsistency","date":"2021-09-25","arxiv_id":"2109.12459","n_code_links":1,"syntology":null},{"paper":"/paper/cascaded-diffusion-models-for-high-fidelity","title":"Cascaded Diffusion Models for High Fidelity Image Generation","date":"2021-05-30","arxiv_id":"2106.15282","n_code_links":0,"syntology":null},{"paper":"/paper/unsupervised-representation-learning-from","title":"Unsupervised Representation Learning from Pathology Images with Multi-directional Contrastive Predictive Coding","date":"2021-05-11","arxiv_id":"2105.05345","n_code_links":1,"syntology":null},{"paper":"/paper/spectrogram-inpainting-for-interactive","title":"Spectrogram Inpainting for Interactive Generation of Instrument Sounds","date":"2021-04-15","arxiv_id":"2104.07519","n_code_links":1,"syntology":null},{"paper":null,"title":"Context-based Image Segment Labeling (CBISL)","date":"2020-11-02","arxiv_id":"2011.00784","n_code_links":0,"syntology":null},{"paper":"/paper/nonlinear-equation-solving-a-faster","title":"Accelerating Feedforward Computation via Parallel Nonlinear Equation Solving","date":"2020-02-10","arxiv_id":"2002.03629","n_code_links":1,"syntology":null},{"paper":"/paper/multimodal-controller-for-generative-models","title":"Multimodal Controller for Generative Models","date":"2020-02-07","arxiv_id":"2002.02572","n_code_links":1,"syntology":null},{"paper":"/paper/closing-the-dequantization-gap-pixelcnn-as-a","title":"Closing the Dequantization Gap: PixelCNN as a Single-Layer Flow","date":"2020-02-06","arxiv_id":"2002.02547","n_code_links":1,"syntology":null},{"paper":null,"title":"Hilbert-Based Generative Defense for Adversarial Examples","date":"2019-10-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"title":"PixelVAE++: Improved PixelVAE with Discrete Prior","date":"2019-08-26","arxiv_id":"1908.09948","n_code_links":0,"syntology":null},{"paper":"/paper/bayesian-volumetric-autoregressive-generative","title":"Bayesian Volumetric Autoregressive generative models for better semisupervised learning","date":"2019-07-26","arxiv_id":"1907.11559","n_code_links":1,"syntology":null},{"paper":"/paper/190600446","title":"Generating Diverse High-Fidelity Images with VQ-VAE-2","date":"2019-06-02","arxiv_id":"1906.00446","n_code_links":15,"syntology":{"ran":2,"of":9,"unverified":7,"pointer_only":4}},{"paper":null,"title":"ShieldNets: Defending Against Adversarial Attacks Using Probabilistic Adversarial Robustness","date":"2019-06-01","arxiv_id":null,"n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/image-generation","name":"Image Generation","papers":12},{"task":"/task/decoder","name":"Decoder","papers":6},{"task":"/task/representation-learning","name":"Representation Learning","papers":5},{"task":"/task/density-estimation","name":"Density Estimation","papers":3},{"task":"/task/classification","name":"General Classification","papers":3},{"task":"/task/video-generation","name":"Video Generation","papers":3},{"task":"/task/adversarial-robustness","name":"Adversarial Robustness","papers":2},{"task":"/task/atari-games","name":"Atari Games","papers":2},{"task":"/task/conditional-image-generation","name":"Conditional Image Generation","papers":2},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":2},{"task":"/task/image-compression","name":"Image Compression","papers":2},{"task":"/task/image-inpainting","name":"Image Inpainting","papers":2},{"task":"/task/mamba","name":"Mamba","papers":2},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":2},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":2},{"task":"/task/state-space-models","name":"State Space Models","papers":2},{"task":"/task/high","name":"Vocal Bursts Intensity Prediction","papers":2},{"task":"/task/multimodal-generation","name":"multimodal generation","papers":2},{"task":"/task/2d-semantic-segmentation","name":"2D Semantic Segmentation","papers":1},{"task":"/task/adversarial-attack","name":"Adversarial Attack","papers":1}],"tasks_shown":20,"n_tasks":52,"usage_by_year":[{"year":"2016","papers":4},{"year":"2017","papers":5},{"year":"2018","papers":5},{"year":"2019","papers":6},{"year":"2020","papers":4},{"year":"2021","papers":7},{"year":"2022","papers":4},{"year":"2023","papers":4},{"year":"2024","papers":5},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/pixelcnn"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}