{"url":"/method/cct","slug":"cct","name":"CCT","full_name":"Compact Convolutional Transformers","full_name_withheld":false,"description_markdown":"**Compact Convolutional Transformers** utilize sequence pooling and replace the patch embedding with a convolutional embedding, allowing for better inductive bias and making positional embeddings optional. CCT achieves better accuracy than ViT-Lite (smaller ViTs) and increases the flexibility of the input parameters.","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":"https://arxiv.org/abs/2104.05704v4","title":"Escaping the Big Data Paradigm with Compact Transformers","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision Transformers","url":"/methods/category/vision-transformers","pwc_aliases":["vision-transformer"]}],"n_papers_tagged":33,"archive_num_papers":null,"papers_newest_first":[{"paper":"/paper/steelblastqc-shot-blasted-steel-surface","title":"SteelBlastQC: Shot-blasted Steel Surface Dataset with Interpretable Detection of Surface Defects","date":"2025-04-29","arxiv_id":"2504.20510","n_code_links":1,"syntology":null},{"paper":null,"title":"Enhanced Filterless Multi-Color VLC via QCT","date":"2025-04-13","arxiv_id":"2504.09743","n_code_links":0,"syntology":null},{"paper":null,"title":"Fast Critical Clearing Time Calculation for Power Systems with Synchronous and Asynchronous Generation","date":"2025-03-15","arxiv_id":"2503.12132","n_code_links":0,"syntology":null},{"paper":null,"title":"A Comparative Performance Analysis of Classification and Segmentation Models on Bangladeshi Pothole Dataset","date":"2025-01-11","arxiv_id":"2501.06602","n_code_links":0,"syntology":null},{"paper":"/paper/dynamic-graph-representation-with-contrastive","title":"Dynamic Graph Representation with Contrastive Learning for Financial Market Prediction: Integrating Temporal Evolution and Static Relations","date":"2024-12-05","arxiv_id":"2412.04034","n_code_links":1,"syntology":null},{"paper":null,"title":"Aerial Flood Scene Classification Using Fine-Tuned Attention-based Architecture for Flood-Prone Countries in South Asia","date":"2024-10-31","arxiv_id":"2411.00169","n_code_links":0,"syntology":null},{"paper":"/paper/autoregressive-action-sequence-learning-for","title":"Autoregressive Action Sequence Learning for Robotic Manipulation","date":"2024-10-04","arxiv_id":"2410.03132","n_code_links":1,"syntology":{"ran":13,"of":14,"unverified":1,"pointer_only":14}},{"paper":null,"title":"Comparative Analysis of Learning-Based Methods for Transient Stability Assessment","date":"2024-09-03","arxiv_id":"2409.02336","n_code_links":0,"syntology":null},{"paper":null,"title":"Rate-Distortion-Perception Controllable Joint Source-Channel Coding for High-Fidelity Generative Communications","date":"2024-08-26","arxiv_id":"2408.14127","n_code_links":0,"syntology":null},{"paper":null,"title":"Code Comparison Tuning for Code Large Language Models","date":"2024-03-28","arxiv_id":"2403.19121","n_code_links":0,"syntology":null},{"paper":"/paper/textual-knowledge-matters-cross-modality-co","title":"Textual Knowledge Matters: Cross-Modality Co-Teaching for Generalized Visual Class Discovery","date":"2024-03-12","arxiv_id":"2403.07369","n_code_links":1,"syntology":{"ran":7,"of":11,"unverified":4,"pointer_only":11}},{"paper":null,"title":"Multi-modal Deep Learning","date":"2024-03-06","arxiv_id":"2403.03385","n_code_links":0,"syntology":null},{"paper":null,"title":"Harnessing Collective Intelligence Under a Lack of Cultural Consensus","date":"2023-09-18","arxiv_id":"2309.09787","n_code_links":0,"syntology":null},{"paper":null,"title":"More for Less: Compact Convolutional Transformers Enable Robust Medical Image Classification with Limited Data","date":"2023-07-01","arxiv_id":"2307.00213","n_code_links":0,"syntology":null},{"paper":"/paper/concept-centric-transformers-concept","title":"Concept-Centric Transformers: Enhancing Model Interpretability through Object-Centric Concept Learning within a Shared Global Workspace","date":"2023-05-25","arxiv_id":"2305.15775","n_code_links":2,"syntology":null},{"paper":null,"title":"CCT-Code: Cross-Consistency Training for Multilingual Clone Detection and Code Search","date":"2023-05-19","arxiv_id":"2305.11626","n_code_links":0,"syntology":null},{"paper":"/paper/recurrent-transformer-encoders-for-vision","title":"Vision-based Estimation of Fatigue and Engagement in Cognitive Training Sessions","date":"2023-04-24","arxiv_id":"2304.12470","n_code_links":1,"syntology":null},{"paper":null,"title":"Using SHAP Values and Machine Learning to Understand Trends in the Transient Stability Limit","date":"2023-02-13","arxiv_id":"2302.06274","n_code_links":0,"syntology":null},{"paper":"/paper/lape-layer-adaptive-position-embedding-for","title":"LaPE: Layer-adaptive Position Embedding for Vision Transformers with Independent Layer Normalization","date":"2023-01-01","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":null,"title":"Thermal Heating in ReRAM Crossbar Arrays: Challenges and Solutions","date":"2022-12-28","arxiv_id":"2212.13707","n_code_links":0,"syntology":null},{"paper":"/paper/position-embedding-needs-an-independent-layer","title":"Position Embedding Needs an Independent Layer Normalization","date":"2022-12-10","arxiv_id":"2212.05262","n_code_links":1,"syntology":null},{"paper":"/paper/speaker-vgg-cct-cross-corpus-speech-emotion","title":"SPEAKER VGG CCT: Cross-corpus Speech Emotion Recognition with Speaker Embedding and Vision Transformers","date":"2022-11-04","arxiv_id":"2211.02366","n_code_links":1,"syntology":null},{"paper":"/paper/jperceiver-joint-perception-network-for-depth","title":"JPerceiver: Joint Perception Network for Depth, Pose and Layout Estimation in Driving Scenes","date":"2022-07-16","arxiv_id":"2207.07895","n_code_links":1,"syntology":{"ran":1,"of":2,"unverified":1,"pointer_only":2}},{"paper":null,"title":"Classical and learned MR to pseudo-CT mappings for accurate transcranial ultrasound simulation","date":"2022-06-30","arxiv_id":"2206.15441","n_code_links":0,"syntology":null},{"paper":null,"title":"A Sparse Polynomial Chaos Expansion-Based Method for Probabilistic Transient Stability Assessment and Enhancement","date":"2022-06-09","arxiv_id":"2206.04244","n_code_links":0,"syntology":null},{"paper":null,"title":"Synthesized Speech Detection Using Convolutional Transformer-Based Spectrogram Analysis","date":"2022-05-03","arxiv_id":"2205.01800","n_code_links":0,"syntology":null},{"paper":"/paper/convolutional-xformers-for-vision","title":"Convolutional Xformers for Vision","date":"2022-01-25","arxiv_id":"2201.10271","n_code_links":1,"syntology":null},{"paper":null,"title":"GEOSCAN: Global Earth Observation using Swarm of Coordinated Autonomous Nanosats","date":"2021-11-27","arxiv_id":"2111.15627","n_code_links":0,"syntology":null},{"paper":null,"title":"Integrating Fréchet distance and AI reveals the evolutionary trajectory and origin of SARS-CoV-2","date":"2021-10-14","arxiv_id":"2110.07696","n_code_links":0,"syntology":null},{"paper":"/paper/uctransnet-rethinking-the-skip-connections-in","title":"UCTransNet: Rethinking the Skip Connections in U-Net from a Channel-wise Perspective with Transformer","date":"2021-09-09","arxiv_id":"2109.04335","n_code_links":3,"syntology":{"ran":1,"of":1,"unverified":0,"pointer_only":1}}],"papers_shown":30,"tasks":[{"task":"/task/image-classification","name":"Image Classification","papers":6},{"task":"/task/image-classification","name":"image-classification","papers":4},{"task":"/task/classification-1","name":"Classification","papers":2},{"task":"/task/decision-making","name":"Decision Making","papers":2},{"task":"/task/decoder","name":"Decoder","papers":2},{"task":"/task/facial-expression-recognition-1","name":"Facial Expression Recognition","papers":2},{"task":"/task/facial-expression-recognition","name":"Facial Expression Recognition (FER)","papers":2},{"task":"/task/memorization","name":"Memorization","papers":2},{"task":null,"name":"Position","papers":2},{"task":"/task/retrieval","name":"Retrieval","papers":2},{"task":"/task/segmentation","name":"Segmentation","papers":2},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":2},{"task":"/task/text-generation","name":"Text Generation","papers":2},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":2},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":1},{"task":"/task/binary-classification","name":"Binary Classification","papers":1},{"task":"/task/bug-fixing","name":"Bug fixing","papers":1},{"task":"/task/chunking","name":"Chunking","papers":1},{"task":"/task/clone-detection","name":"Clone Detection","papers":1},{"task":"/task/code-search","name":"Code Search","papers":1}],"tasks_shown":20,"n_tasks":56,"usage_by_year":[{"year":"2021","papers":6},{"year":"2022","papers":8},{"year":"2023","papers":7},{"year":"2024","papers":8},{"year":"2025","papers":4}],"row_source":"embedded","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/cct"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}