{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/language-models-are-realistic-tabular-data","title":"Language Models are Realistic Tabular Data Generators","arxiv_id":"2210.06280","date":"2022-10-12","proceeding":null,"authors":["Vadim Borisov","Kathrin Seßler","Tobias Leemann","Martin Pawelczyk","Gjergji Kasneci"],"abstract":"Tabular data is among the oldest and most ubiquitous forms of data. However, the generation of synthetic samples with the original data's characteristics remains a significant challenge for tabular data. While many generative models from the computer vision domain, such as variational autoencoders or generative adversarial networks, have been adapted for tabular data generation, less research has been directed towards recent transformer-based large language models (LLMs), which are also generative in nature. To this end, we propose GReaT (Generation of Realistic Tabular data), which exploits an auto-regressive generative LLM to sample synthetic and yet highly realistic tabular data. Furthermore, GReaT can model tabular data distributions by conditioning on any subset of features; the remaining features are sampled without additional overhead. We demonstrate the effectiveness of the proposed approach in a series of experiments that quantify the validity and quality of the produced data samples from multiple angles. We find that GReaT maintains state-of-the-art performance across numerous real-world and synthetic data sets with heterogeneous feature types coming in various sizes.","url_abs":"https://arxiv.org/abs/2210.06280v2","url_pdf":"https://arxiv.org/pdf/2210.06280v2.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"language-models-are-realistic-tabular-data","repo_url":"https://github.com/kathrinse/be_great","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"pytorch","reach":{"status":"ok","spdx":"MIT"}}],"tasks":[{"task_slug":"tabular-data-generation","task_name":"Tabular Data Generation"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/tabular-data-generation-on-adult-census","task":"Tabular Data Generation","dataset":"Adult Census Income","model":"GReaT","rank_in_archive_order":2,"of":6,"metrics":{"DT Accuracy":"84.81","LR Accuracy":"84.77","Parameters(M)":"355","RF Accuracy":"85.42"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-adult-census","task":"Tabular Data Generation","dataset":"Adult Census Income","model":"Distill-GReaT","rank_in_archive_order":3,"of":6,"metrics":{"DT Accuracy":"84.49","LR Accuracy":"84.65","Parameters(M)":"82","RF Accuracy":"85.25"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-california-housing","task":"Tabular Data Generation","dataset":"California Housing Prices","model":"Distill-GReaT","rank_in_archive_order":5,"of":6,"metrics":{"DT Mean Squared Error":"0.43","LR Mean Squared Error":"0.57","Parameters(M)":"82","RF Mean Squared Error":"0.32"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-california-housing","task":"Tabular Data Generation","dataset":"California Housing Prices","model":"GReaT","rank_in_archive_order":6,"of":6,"metrics":{"DT Mean Squared Error":"0.39","LR Mean Squared Error":"0.34","Parameters(M)":"355","RF Mean Squared Error":"0.28"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-diabetes","task":"Tabular Data Generation","dataset":"Diabetes","model":"GReaT","rank_in_archive_order":2,"of":6,"metrics":{"DT Accuracy":"0.5523","LR Accuracy":"0.5734","Parameters(M)":"355","RF Accuracy":"0.5834"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-diabetes","task":"Tabular Data Generation","dataset":"Diabetes","model":"Distill-GReaT","rank_in_archive_order":3,"of":6,"metrics":{"DT Accuracy":"0.541","LR Accuracy":"0.5733","Parameters(M)":"82","RF Accuracy":"0.5803"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-heloc","task":"Tabular Data Generation","dataset":"HELOC","model":"Distill-GReaT","rank_in_archive_order":1,"of":6,"metrics":{"DT Accuracy":"81.4","LR Accuracy":"70.58","Parameters(M)":"82","RF Accuracy":"82.14"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-heloc","task":"Tabular Data Generation","dataset":"HELOC","model":"GReaT","rank_in_archive_order":2,"of":6,"metrics":{"DT Accuracy":"79.1","LR Accuracy":"71.9","Parameters(M)":"355","RF Accuracy":"80.93"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-sick","task":"Tabular Data Generation","dataset":"SICK","model":"GReaT","rank_in_archive_order":1,"of":6,"metrics":{"DT Accuracy":"97.72","LR Accuracy":"97.72","Parameters(M)":"355","RF Accuracy":"98.3"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-sick","task":"Tabular Data Generation","dataset":"SICK","model":"Distill-GReaT","rank_in_archive_order":3,"of":6,"metrics":{"DT Accuracy":"95.39","LR Accuracy":"96.56","Parameters(M)":"82","RF Accuracy":"97.72"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-travel","task":"Tabular Data Generation","dataset":"Travel","model":"GReaT","rank_in_archive_order":2,"of":6,"metrics":{"DT Accuracy":"83.56","LR Accuracy":"80.1","Parameters(M)":"355","RF Accuracy":"84.3"},"uses_additional_data":false},{"leaderboard":"/sota/tabular-data-generation-on-travel","task":"Tabular Data Generation","dataset":"Travel","model":"Distill-GReaT","rank_in_archive_order":4,"of":6,"metrics":{"DT Accuracy":"77.38","LR Accuracy":"78.53","Parameters(M)":"82","RF Accuracy":"79.5"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":"https://app.syntology.ai/?focus=2210.06280","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2210.06280"}},"developers":"https://syntology.ai/developers","read_at":"2026-09-24T18:15:14+00:00","read_at_is":"when the build read Syntology's graph, not when any sample ran","claim":"Per-sample execution status on synthesized fixtures; not a correctness claim about the paper. Samples come from repositories linked to the paper, official or community; repo_kind says which.","repos":[{"provenance":"external:paperswithcode_snapshot_2025-07-28","url":"https://github.com/kathrinse/be_great","reach":{"status":"ok","spdx":"MIT"}}],"summary":{"unverified":6},"by_repo_kind":{"official":{"samples":6,"ran":0,"repositories":1}},"repo_kind_vocabulary":{"official":"The archive marks this repository official for the paper","named_in_paper":"The archive records that the paper mentions this repository; it is not marked official","listed":"In the archive's code links for this paper, not marked official and not recorded as mentioned in the paper","found_in_text":"Syntology found this repository in the paper's own text; whether it is the authors' implementation is not asserted","community":"Not in the archive's code links for this paper; a community repository Syntology harvested"},"n_pointer_only_for_licence":0,"samples":[{"code_sha256_prefix":"83e59932f7b41b20","entry":"apply_null_probabilities","repo":"kathrinse/be_great","repo_kind":"official","path":"be_great/great_mock_datasets.py","file_url":"https://github.com/kathrinse/be_great/blob/HEAD/be_great/great_mock_datasets.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"83e59932f7b41b20"}},{"code_sha256_prefix":"d463c7b56fcd4ea6","entry":"build_effective_conditions","repo":"kathrinse/be_great","repo_kind":"official","path":"be_great/great_mock_datasets.py","file_url":"https://github.com/kathrinse/be_great/blob/HEAD/be_great/great_mock_datasets.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"d463c7b56fcd4ea6"}},{"code_sha256_prefix":"47258ece5fbeda33","entry":"build_few_shot_prefix","repo":"kathrinse/be_great","repo_kind":"official","path":"be_great/great_mock_datasets.py","file_url":"https://github.com/kathrinse/be_great/blob/HEAD/be_great/great_mock_datasets.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"47258ece5fbeda33"}},{"code_sha256_prefix":"7618dd48226e8d77","entry":"build_trie","repo":"kathrinse/be_great","repo_kind":"official","path":"be_great/great_constrained.py","file_url":"https://github.com/kathrinse/be_great/blob/HEAD/be_great/great_constrained.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"7618dd48226e8d77"}},{"code_sha256_prefix":"68f0043fac80bd8a","entry":"enumerate_valid_values","repo":"kathrinse/be_great","repo_kind":"official","path":"be_great/great_constrained.py","file_url":"https://github.com/kathrinse/be_great/blob/HEAD/be_great/great_constrained.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"68f0043fac80bd8a"}},{"code_sha256_prefix":"0781cc4ea48a2608","entry":"parse_condition","repo":"kathrinse/be_great","repo_kind":"official","path":"be_great/great_constrained.py","file_url":"https://github.com/kathrinse/be_great/blob/HEAD/be_great/great_constrained.py","link_basis":"harvester_set","language":"python","status":"unverified","verification_level":0,"contract_check":null,"metamorphic_tier":null,"behaviour_fingerprint":false,"licence":"MIT","inline_ok":true,"mcp_get_code":{"code_sha256":"0781cc4ea48a2608"}}]},"arxiv_metadata":null,"syntology_extracted_results":null}