{"url":"/task/tabular-data-generation","name":"Tabular Data Generation","slug":"tabular-data-generation","description_markdown":"Generation of the tabular data using generative models","categories":[{"name":"Miscellaneous","url":"/area/miscellaneous"}],"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","slug_source":"archive_url"},"counts":{"papers_tagged":73,"papers_with_code":46,"benchmarks":6,"benchmark_tables_in_archive":6,"benchmark_tables_shown":6,"benchmark_tables_withheld_as_spam":0,"benchmark_definition":"a leaderboard table with at least one row; benchmark_tables_shown also counts the zero-row tables; benchmark_tables_in_archive adds the tables withheld as spam","datasets":7,"subtasks":0,"parent_tasks":0},"benchmarks":[{"leaderboard":"/sota/tabular-data-generation-on-adult-census","slug":"tabular-data-generation-on-adult-census","dataset":"Adult Census Income","dataset_url":"/dataset/adult-census-income","rows_in_archive":6,"metrics":["DT Accuracy","LR Accuracy","Parameters(M)","RF Accuracy"],"first_row_in_archive_order":{"model":"Binary Diffusion","paper_title":"Tabular Data Generation using Binary Diffusion","paper_url":"/paper/tabular-data-generation-using-binary","paper_date":"2024-09-20","arxiv_id":"2409.13882","code_links":[{"title":"vkinakh/binary-diffusion-tabular","url":"https://github.com/vkinakh/binary-diffusion-tabular"}],"syntology":{"n":10,"n_ran":10,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/tabular-data-generation-on-california-housing","slug":"tabular-data-generation-on-california-housing","dataset":"California Housing Prices","dataset_url":"/dataset/california-housing-prices","rows_in_archive":6,"metrics":["Parameters(M)","RF Mean Squared Error","DT Mean Squared Error","LR Mean Squared Error"],"first_row_in_archive_order":{"model":"TVAE","paper_title":"Modeling Tabular data using Conditional GAN","paper_url":"/paper/modeling-tabular-data-using-conditional-gan","paper_date":"2019-07-01","arxiv_id":"1907.00503","code_links":[{"title":"ydataai/ydata-synthetic","url":"https://github.com/ydataai/ydata-synthetic/tree/dev/src/ydata_synthetic/synthesizers/regular/ctgan"},{"title":"DAI-Lab/CTGAN","url":"https://github.com/DAI-Lab/CTGAN"},{"title":"sdv-dev/CTGAN","url":"https://github.com/sdv-dev/CTGAN"},{"title":"glederrey/datgan","url":"https://github.com/glederrey/datgan"},{"title":"oregonpillow/ctgan-server-cli","url":"https://github.com/oregonpillow/ctgan-server-cli"},{"title":"juliecious/ctgan","url":"https://github.com/juliecious/ctgan"},{"title":"lvyufeng/CTGAN-MindSpore","url":"https://github.com/lvyufeng/CTGAN-MindSpore"},{"title":"saha0073/GAN-VAE-to-generate-Synthetic-Tabular-Data","url":"https://github.com/saha0073/GAN-VAE-to-generate-Synthetic-Tabular-Data"},{"title":"Diyago/GAN-for-tabular-data","url":"https://github.com/Diyago/GAN-for-tabular-data"}],"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}}},{"leaderboard":"/sota/tabular-data-generation-on-diabetes","slug":"tabular-data-generation-on-diabetes","dataset":"Diabetes","dataset_url":"/dataset/diabetes","rows_in_archive":6,"metrics":["DT Accuracy","Parameters(M)","LR Accuracy","RF Accuracy"],"first_row_in_archive_order":{"model":"Binary Diffusion","paper_title":"Tabular Data Generation using Binary Diffusion","paper_url":"/paper/tabular-data-generation-using-binary","paper_date":"2024-09-20","arxiv_id":"2409.13882","code_links":[{"title":"vkinakh/binary-diffusion-tabular","url":"https://github.com/vkinakh/binary-diffusion-tabular"}],"syntology":{"n":10,"n_ran":10,"n_unverified":0,"n_pointer_only":0}}},{"leaderboard":"/sota/tabular-data-generation-on-heloc","slug":"tabular-data-generation-on-heloc","dataset":"HELOC","dataset_url":"/dataset/heloc","rows_in_archive":6,"metrics":["DT Accuracy","LR Accuracy","Parameters(M)","RF Accuracy"],"first_row_in_archive_order":{"model":"Distill-GReaT","paper_title":"Language Models are Realistic Tabular Data Generators","paper_url":"/paper/language-models-are-realistic-tabular-data","paper_date":"2022-10-12","arxiv_id":"2210.06280","code_links":[{"title":"kathrinse/be_great","url":"https://github.com/kathrinse/be_great"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/tabular-data-generation-on-sick","slug":"tabular-data-generation-on-sick","dataset":"SICK","dataset_url":"/dataset/sick","rows_in_archive":6,"metrics":["DT Accuracy","LR Accuracy","Parameters(M)","RF Accuracy"],"first_row_in_archive_order":{"model":"GReaT","paper_title":"Language Models are Realistic Tabular Data Generators","paper_url":"/paper/language-models-are-realistic-tabular-data","paper_date":"2022-10-12","arxiv_id":"2210.06280","code_links":[{"title":"kathrinse/be_great","url":"https://github.com/kathrinse/be_great"}],"syntology":{"n":6,"n_ran":0,"n_unverified":6,"n_pointer_only":0}}},{"leaderboard":"/sota/tabular-data-generation-on-travel","slug":"tabular-data-generation-on-travel","dataset":"Travel","dataset_url":"/dataset/travel","rows_in_archive":6,"metrics":["DT Accuracy","LR Accuracy","RF Accuracy","Parameters(M)"],"first_row_in_archive_order":{"model":"Binary Diffusion","paper_title":"Tabular Data Generation using Binary Diffusion","paper_url":"/paper/tabular-data-generation-using-binary","paper_date":"2024-09-20","arxiv_id":"2409.13882","code_links":[{"title":"vkinakh/binary-diffusion-tabular","url":"https://github.com/vkinakh/binary-diffusion-tabular"}],"syntology":{"n":10,"n_ran":10,"n_unverified":0,"n_pointer_only":0}}}],"datasets":[{"url":"/dataset/sick","name":"SICK","full_name":"Sentences Involving Compositional Knowledge","num_papers_in_archive":348},{"url":"/dataset/adult-census-income","name":"Adult Census Income","full_name":"adult_census_income","num_papers_in_archive":6},{"url":"/dataset/california-housing-prices","name":"California Housing Prices","full_name":"","num_papers_in_archive":6},{"url":"/dataset/diabetes","name":"Diabetes","full_name":"Diabetes 130-US Hospitals for Years 1999-2008","num_papers_in_archive":5},{"url":"/dataset/thyroid","name":"Thyroid","full_name":"Thyroid Disease","num_papers_in_archive":5},{"url":"/dataset/heloc","name":"HELOC","full_name":"Home Equity Line of Credit","num_papers_in_archive":3},{"url":"/dataset/travel","name":"Travel","full_name":"Tour & Travels Customer Churn Prediction","num_papers_in_archive":3}],"subtasks":[],"parent_tasks":[],"papers":{"order":"repositories listed in the archive (desc), then date (desc); the archive holds no stars","population":"papers tagged with this task that list at least one repository in the archive","shown":30,"of":46,"tagged_in_all":73,"items":[{"url":"/paper/modeling-tabular-data-using-conditional-gan","title":"Modeling Tabular data using Conditional GAN","date":"2019-07-01","arxiv_id":"1907.00503","repositories_listed":9,"syntology":{"n":3,"n_ran":2,"n_unverified":1,"n_pointer_only":0}},{"url":"/paper/generating-and-imputing-tabular-data-via","title":"Generating and Imputing Tabular Data via Diffusion and Flow-based Gradient-Boosted Trees","date":"2023-09-18","arxiv_id":"2309.09968","repositories_listed":5,"syntology":{"n":2,"n_ran":2,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/tabula-harnessing-language-models-for-tabular","title":"TabuLa: Harnessing Language Models for Tabular Data Synthesis","date":"2023-10-19","arxiv_id":"2310.12746","repositories_listed":3,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/tabularargn-a-flexible-and-efficient-auto-1","title":"TabularARGN: A Flexible and Efficient Auto-Regressive Framework for Generating High-Fidelity Synthetic Data","date":"2025-01-21","arxiv_id":"2501.12012","repositories_listed":2,"syntology":{"n":5,"n_ran":1,"n_unverified":4,"n_pointer_only":0}},{"url":"/paper/reimagining-synthetic-tabular-data-generation-1","title":"Reimagining Synthetic Tabular Data Generation through Data-Centric AI: A Comprehensive Benchmark","date":"2023-10-25","arxiv_id":"2310.16981","repositories_listed":2,"syntology":{"n":5,"n_ran":5,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/turning-the-tables-biased-imbalanced-dynamic","title":"Turning the Tables: Biased, Imbalanced, Dynamic Tabular Datasets for ML Evaluation","date":"2022-11-24","arxiv_id":"2211.13358","repositories_listed":2,"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/dpmm-differentially-private-marginal-models-a","title":"dpmm: Differentially Private Marginal Models, a Library for Synthetic Tabular Data Generation","date":"2025-05-31","arxiv_id":"2506.00322","repositories_listed":1,"syntology":null},{"url":"/paper/graph-conditional-flow-matching-for","title":"Graph Conditional Flow Matching for Relational Data Generation","date":"2025-05-21","arxiv_id":"2505.15668","repositories_listed":1,"syntology":null},{"url":"/paper/a-note-on-statistically-accurate-tabular-data","title":"A Note on Statistically Accurate Tabular Data Generation Using Large Language Models","date":"2025-05-05","arxiv_id":"2505.02659","repositories_listed":1,"syntology":null},{"url":"/paper/a-comprehensive-survey-of-synthetic-tabular","title":"A Comprehensive Survey of Synthetic Tabular Data Generation","date":"2025-04-23","arxiv_id":"2504.16506","repositories_listed":1,"syntology":null},{"url":"/paper/diffusion-transformers-for-tabular-data-time","title":"Diffusion Transformers for Tabular Data Time Series Generation","date":"2025-04-10","arxiv_id":"2504.07566","repositories_listed":1,"syntology":{"n":5,"n_ran":2,"n_unverified":3,"n_pointer_only":1}},{"url":"/paper/tabrep-a-simple-and-effective-continuous","title":"TabRep: a Simple and Effective Continuous Representation for Training Tabular Diffusion Models","date":"2025-04-07","arxiv_id":"2504.04798","repositories_listed":1,"syntology":{"n":19,"n_ran":9,"n_unverified":10,"n_pointer_only":0}},{"url":"/paper/llm-tabflow-synthetic-tabular-data-generation","title":"LLM-TabFlow: Synthetic Tabular Data Generation with Inter-column Logical Relationship Preservation","date":"2025-03-04","arxiv_id":"2503.02161","repositories_listed":1,"syntology":null},{"url":"/paper/beyond-the-convexity-assumption-realistic","title":"Beyond the convexity assumption: Realistic tabular data generation under quantifier-free real linear constraints","date":"2025-02-25","arxiv_id":"2502.18237","repositories_listed":1,"syntology":{"n":5,"n_ran":0,"n_unverified":5,"n_pointer_only":0}},{"url":"/paper/tabgen-icl-residual-aware-in-context-example","title":"TabGen-ICL: Residual-Aware In-Context Example Selection for Tabular Data Generation","date":"2025-02-23","arxiv_id":"2502.16414","repositories_listed":1,"syntology":null},{"url":"/paper/generative-adversarial-networks-vs-large","title":"Generative adversarial networks vs large language models: a comparative study on synthetic tabular data generation","date":"2025-02-20","arxiv_id":"2502.14523","repositories_listed":1,"syntology":null},{"url":"/paper/synthetic-tabular-data-generation-for","title":"Synthetic Tabular Data Generation for Imbalanced Classification: The Surprising Effectiveness of an Overlap Class","date":"2024-12-20","arxiv_id":"2412.15657","repositories_listed":1,"syntology":null},{"url":"/paper/tabular-data-generation-with-tensor","title":"Tabular data generation with tensor contraction layers and transformers","date":"2024-12-06","arxiv_id":"2412.05390","repositories_listed":1,"syntology":null},{"url":"/paper/dp-2stage-adapting-language-models-as","title":"DP-2Stage: Adapting Language Models as Differentially Private Tabular Data Generators","date":"2024-12-03","arxiv_id":"2412.02467","repositories_listed":1,"syntology":null},{"url":"/paper/tabdiff-a-multi-modal-diffusion-model-for","title":"TabDiff: a Multi-Modal Diffusion Model for Tabular Data Generation","date":"2024-10-27","arxiv_id":"2410.20626","repositories_listed":1,"syntology":{"n":9,"n_ran":0,"n_unverified":9,"n_pointer_only":0}},{"url":"/paper/generating-tabular-data-using-heterogeneous","title":"Generating Tabular Data Using Heterogeneous Sequential Feature Forest Flow Matching","date":"2024-10-20","arxiv_id":"2410.15516","repositories_listed":1,"syntology":null},{"url":"/paper/preserving-logical-and-functional","title":"Preserving logical and functional dependencies in synthetic tabular data","date":"2024-09-26","arxiv_id":"2409.17684","repositories_listed":1,"syntology":null},{"url":"/paper/tabular-data-generation-using-binary","title":"Tabular Data Generation using Binary Diffusion","date":"2024-09-20","arxiv_id":"2409.13882","repositories_listed":1,"syntology":{"n":10,"n_ran":10,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/synthetic-tabular-data-generation-for-class","title":"Synthetic Tabular Data Generation for Class Imbalance and Fairness: A Comparative Study","date":"2024-09-08","arxiv_id":"2409.05215","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":3}},{"url":"/paper/scaling-up-diffusion-and-flow-based-xgboost","title":"Scaling Up Diffusion and Flow-based XGBoost Models","date":"2024-08-28","arxiv_id":"2408.16046","repositories_listed":1,"syntology":{"n":1,"n_ran":1,"n_unverified":0,"n_pointer_only":0}},{"url":"/paper/unmasking-trees-for-tabular-data","title":"Unmasking Trees for Tabular Data","date":"2024-07-08","arxiv_id":"2407.05593","repositories_listed":1,"syntology":null},{"url":"/paper/artificial-inductive-bias-for-synthetic","title":"Artificial Inductive Bias for Synthetic Tabular Data Generation in Data-Scarce Scenarios","date":"2024-07-03","arxiv_id":"2407.03080","repositories_listed":1,"syntology":null},{"url":"/paper/are-llms-naturally-good-at-synthetic-tabular","title":"Are LLMs Naturally Good at Synthetic Tabular Data Generation?","date":"2024-06-20","arxiv_id":"2406.14541","repositories_listed":1,"syntology":null},{"url":"/paper/tabpfgen-tabular-data-generation-with-tabpfn","title":"TabPFGen -- Tabular Data Generation with TabPFN","date":"2024-06-07","arxiv_id":"2406.05216","repositories_listed":1,"syntology":null},{"url":"/paper/exploring-prompting-methods-for-mitigating","title":"EPIC: Effective Prompting for Imbalanced-Class Data Synthesis in Tabular Data Classification via Large Language Models","date":"2024-04-15","arxiv_id":"2404.12404","repositories_listed":1,"syntology":{"n":3,"n_ran":3,"n_unverified":0,"n_pointer_only":0}}],"syntology_records":14,"syntology_note":"a paper without a record is not a recorded non-run: it may lack an arXiv id or simply be absent from the graph layer"},"description_links":{"kept":0,"unwrapped_to_text":0,"bare_urls_linked":0,"relative_images_dropped":0,"rule":"internal links are kept only when the target slug exists in the catalog"},"syntology":{"read_at":"2026-09-24T18:15:14+00:00","claim":"Per-sample execution status on synthesized fixtures ('ran N of M samples'); not a correctness claim and not a ranking signal.","status_vocabulary":{"ran_honours":"ran, honoured the contract we drafted","ran_violates":"ran, violated the contract we drafted","ran_draft_wrong":"ran; our contract draft was wrong, not the code","ran_fixture":"ran; our fixture could not drive it","ran":"ran on a synthesized input","unverified":"unverified (harvested, no recorded run)"}},"not_shown":{"libraries":"the archive has no per-task library table","trend_sparklines":"the Trend column of the benchmarks table was a rendered image; it is not in the archive","social_and_latest_sorts":"stars and social signals are not in the archive"}}