{"url":"/method/tabtransformer","slug":"tabtransformer","name":"TabTransformer","full_name":"TabTransformer","full_name_withheld":false,"description_markdown":"**TabTransformer** is a deep tabular data modeling architecture for supervised and semi-supervised learning. The TabTransformer is built upon self-attention based Transformers. The Transformer layers transform the embeddings of categorical features into robust contextual embeddings to achieve higher prediction accuracy. \r\n\r\nAs an overview, the architecture comprises a column embedding layer, a stack of $N$ [Transformer](/method/transformer) layers, and a multi-layer perceptron (MLP). The contextual embeddings (outputted by the Transformer layer) are concatenated along with continuous features which is inputted to an MLP. The loss function is then minimized  to learn all the parameters in an end-to-end learning.","description_state":"present","introduced_year":null,"introduced_by":{"title":"TabTransformer: Tabular Data Modeling Using Contextual Embeddings","paper":"/paper/tabtransformer-tabular-data-modeling-using","first_author":"Xin Huang","n_authors":4,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/tabtransformer-tabular-data-modeling-using"},"source":{"url":"https://arxiv.org/abs/2012.06678v1","title":"TabTransformer: Tabular Data Modeling Using Contextual Embeddings","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Deep Tabular Learning","url":"/methods/category/deep-tabular-learning","pwc_aliases":[]}],"n_papers_tagged":9,"archive_num_papers":9,"papers_newest_first":[{"paper":"/paper/a-robust-ppo-optimized-tabular-transformer","title":"A Robust PPO-optimized Tabular Transformer Framework for Intrusion Detection in Industrial IoT Systems","date":"2025-05-23","arxiv_id":"2505.18234","n_code_links":1,"syntology":null},{"paper":null,"title":"DeepOFormer: Deep Operator Learning with Domain-informed Features for Fatigue Life Prediction","date":"2025-03-28","arxiv_id":"2503.22475","n_code_links":0,"syntology":null},{"paper":"/paper/application-of-tabular-transformer","title":"Application of Tabular Transformer Architectures for Operating System Fingerprinting","date":"2025-02-13","arxiv_id":"2502.09084","n_code_links":1,"syntology":null},{"paper":null,"title":"A Survey on Deep Tabular Learning","date":"2024-10-15","arxiv_id":"2410.12034","n_code_links":0,"syntology":null},{"paper":"/paper/gradient-boosting-decision-trees-on-medical","title":"Gradient Boosting Decision Trees on Medical Diagnosis over Tabular Data","date":"2024-09-25","arxiv_id":"2410.03705","n_code_links":1,"syntology":null},{"paper":"/paper/towards-a-transformer-based-pre-trained-model","title":"Towards a Transformer-Based Pre-trained Model for IoT Traffic Classification","date":"2024-07-26","arxiv_id":"2407.19051","n_code_links":1,"syntology":null},{"paper":"/paper/deep-learning-with-tabular-data-a-self","title":"Deep Learning with Tabular Data: A Self-supervised Approach","date":"2024-01-26","arxiv_id":"2401.15238","n_code_links":1,"syntology":null},{"paper":"/paper/the-gatedtabtransformer-an-enhanced-deep","title":"The GatedTabTransformer. An enhanced deep learning architecture for tabular modeling","date":"2022-01-01","arxiv_id":"2201.00199","n_code_links":2,"syntology":null},{"paper":"/paper/tabtransformer-tabular-data-modeling-using","title":"TabTransformer: Tabular Data Modeling Using Contextual Embeddings","date":"2020-12-11","arxiv_id":"2012.06678","n_code_links":12,"syntology":{"ran":1,"of":4,"unverified":3,"pointer_only":4}}],"papers_shown":9,"tasks":[{"task":"/task/deep-learning","name":"Deep Learning","papers":2},{"task":"/task/tabular-classification","name":"tabular-classification","papers":2},{"task":"/task/binary-classification","name":"Binary Classification","papers":1},{"task":"/task/classification-1","name":"Classification","papers":1},{"task":"/task/denoising","name":"Denoising","papers":1},{"task":"/task/intrusion-detection","name":"Intrusion Detection","papers":1},{"task":"/task/management","name":"Management","papers":1},{"task":"/task/medical-diagnosis","name":"Medical Diagnosis","papers":1},{"task":"/task/network-intrusion-detection","name":"Network Intrusion Detection","papers":1},{"task":"/task/operator-learning","name":"Operator learning","papers":1},{"task":"/task/prediction","name":"Prediction","papers":1},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":1},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":1},{"task":"/task/survey","name":"Survey","papers":1},{"task":"/task/traffic-classification","name":"Traffic Classification","papers":1},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":1},{"task":"/task/unsupervised-pre-training","name":"Unsupervised Pre-training","papers":1},{"task":"/task/feature-selection","name":"feature selection","papers":1},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":1}],"tasks_shown":19,"n_tasks":19,"usage_by_year":[{"year":"2020","papers":1},{"year":"2022","papers":1},{"year":"2024","papers":4},{"year":"2025","papers":3}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/tabtransformer"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}