{"url":"/dataset/vashantor-a-large-scale-multilingual","name":"Vashantor: A Large-scale Multilingual Benchmark Dataset for Automated Translation of Bangla Regional Dialects to Bangla Language","full_name":null,"description_markdown":"The Vashantor dataset consists of 32,500 sentences from different regions, including Chittagong, Noakhali, Sylhet, Barishal, and Mymensingh. It is categorized into two language formats: \"Bangla\" and \"Banglish.\" Each region and language combination has specified quantities for training, testing, and validation samples. The dataset details are as follows: \r\n\r\n\r\n## Specifics of the Core Data:\r\n\r\n|    Type    \t| Bangla \t| Banglish \t| English \t|\r\n|:----------:\t|:------:\t|:--------:\t|:-------:\t|\r\n| Train      \t|   1875 \t|     1875 \t|    1875 \t|  \r\n| Test       \t|    375 \t|      375 \t|     375 \t|  \r\n| Validation \t|    250 \t|      250 \t|     250 \t|  \r\n\r\n## Specifics of the Regional Data:\r\n\r\n<table class=\"tg\">\r\n<thead>\r\n  <tr>\r\n    <th class=\"tg-c3ow\">Region</th>\r\n    <th class=\"tg-c3ow\">Type</th>\r\n    <th class=\"tg-c3ow\">Train</th>\r\n    <th class=\"tg-c3ow\">Test</th>\r\n    <th class=\"tg-c3ow\">Validation</th>\r\n  </tr>\r\n</thead>\r\n<tbody>\r\n  <tr>\r\n    <td class=\"tg-c3ow\" rowspan=\"2\">Chittagong</td>\r\n    <td class=\"tg-0pky\">Bangla</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td> </td>\r\n    <td class=\"tg-0pky\">Banglish</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td class=\"tg-c3ow\" rowspan=\"2\">Noakhali</td>\r\n    <td class=\"tg-0pky\">Bangla</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td> </td>\r\n    <td class=\"tg-0pky\">Banglish</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td class=\"tg-c3ow\" rowspan=\"2\">Sylhet</td>\r\n    <td class=\"tg-0pky\">Bangla</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td> </td>\r\n    <td class=\"tg-0pky\">Banglish</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td class=\"tg-c3ow\" rowspan=\"2\">Barishal</td>\r\n    <td class=\"tg-0pky\">Bangla</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td> </td>\r\n    <td class=\"tg-0pky\">Banglish</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td class=\"tg-c3ow\" rowspan=\"2\">Mymensingh</td>\r\n    <td class=\"tg-0pky\">Bangla</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n  <tr>\r\n    <td> </td>\r\n    <td class=\"tg-0pky\">Banglish</td>\r\n    <td class=\"tg-dvpl\">1875</td>\r\n    <td class=\"tg-dvpl\">375</td>\r\n    <td class=\"tg-dvpl\">250</td>\r\n  </tr>\r\n</tbody>\r\n</table>","description_withheld":null,"homepage":"https://data.mendeley.com/datasets/bj5jgk878b","introduced_date":"2024-01-15","introduced_date_note":null,"introduced_by":{"paper":"/paper/vashantor-a-large-scale-multilingual","title":"Vashantor: A Large-scale Multilingual Benchmark Dataset for Automated Translation of Bangla Regional Dialects to Bangla Language","first_author":"Fatema Tuj Johora Faria","url":null},"license":{"name":"CC BY 4.0","url":"https://creativecommons.org/licenses/by/4.0/"},"modalities":[{"name":"Texts","url":"/datasets/modality/texts"}],"tasks":[{"name":"Machine Translation","url":"/task/machine-translation","datasets_with_task":"/datasets/task/machine-translation"}],"languages":[{"name":"English","url":"/datasets/language/english"},{"name":"Bengali","url":"/datasets/language/bengali"}],"variants":["Vashantor: A Large-scale Multilingual Benchmark Dataset for Automated Translation of Bangla Regional Dialects to Bangla Language"],"data_loaders":[],"num_papers_in_archive":1,"source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28"},"benchmarks":[],"papers_with_a_benchmark_row":[],"syntology_totals":{"read_at":"2026-09-24T18:15:14+00:00","papers_with_samples":0,"samples_harvested":0,"samples_ran":0,"samples_unverified":0,"pointer_only_for_licence":0,"papers_with_no_sample_that_ran":0,"note":"the per-paper counts above, summed; not a rate"},"papers_note":"The archive never published its papers-using-dataset list; these are papers with a leaderboard row on this dataset's benchmarks."}