{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/banglabook-a-large-scale-bangla-dataset-for","title":"BanglaBook: A Large-scale Bangla Dataset for Sentiment Analysis from Book Reviews","arxiv_id":"2305.06595","date":"2023-05-11","proceeding":null,"authors":["Mohsinul Kabir","Obayed Bin Mahfuz","Syed Rifat Raiyan","Hasan Mahmud","Md Kamrul Hasan"],"abstract":"The analysis of consumer sentiment, as expressed through reviews, can provide a wealth of insight regarding the quality of a product. While the study of sentiment analysis has been widely explored in many popular languages, relatively less attention has been given to the Bangla language, mostly due to a lack of relevant data and cross-domain adaptability. To address this limitation, we present BanglaBook, a large-scale dataset of Bangla book reviews consisting of 158,065 samples classified into three broad categories: positive, negative, and neutral. We provide a detailed statistical analysis of the dataset and employ a range of machine learning models to establish baselines including SVM, LSTM, and Bangla-BERT. Our findings demonstrate a substantial performance advantage of pre-trained models over models that rely on manually crafted features, emphasizing the necessity for additional training resources in this domain. Additionally, we conduct an in-depth error analysis by examining sentiment unigrams, which may provide insight into common classification errors in under-resourced languages like Bangla. Our codes and data are publicly available at https://github.com/mohsinulkabir14/BanglaBook.","url_abs":"https://arxiv.org/abs/2305.06595v3","url_pdf":"https://arxiv.org/pdf/2305.06595v3.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"banglabook-a-large-scale-bangla-dataset-for","repo_url":"https://github.com/mohsinulkabir14/banglabook","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":1,"framework":"none","reach":null}],"tasks":[{"task_slug":"sentiment-analysis","task_name":"Sentiment Analysis"}],"methods":[{"method_slug":"lstm","method_name":"LSTM"},{"method_slug":"svm","method_name":"SVM"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"tanh-activation","method_name":"Tanh Activation"}],"datasets_introduced":[{"slug":"banglabook","name":"BanglaBook","full_name":"Large-scale Bangla Dataset for Sentiment Analysis from Book Reviews"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Bangla-BERT (large)","rank_in_archive_order":1,"of":13,"metrics":{"Weighted Average F1-score":"0.9331"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Random Forest (word 2-gram + word 3-gram)","rank_in_archive_order":2,"of":13,"metrics":{"Weighted Average F1-score":"0.9106"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Bangla-BERT (base-uncased)","rank_in_archive_order":3,"of":13,"metrics":{"Weighted Average F1-score":"0.9064"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"SVM (word 2-gram + word 3-gram)","rank_in_archive_order":4,"of":13,"metrics":{"Weighted Average F1-score":"0.9053"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Random Forest (word 1-gram)","rank_in_archive_order":5,"of":13,"metrics":{"Weighted Average F1-score":"0.9043"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Logistic Regression (char 2-gram + char 3-gram)","rank_in_archive_order":6,"of":13,"metrics":{"Weighted Average F1-score":"0.8978"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Logistic Regression (word 2-gram + word 3-gram)","rank_in_archive_order":7,"of":13,"metrics":{"Weighted Average F1-score":"0.8964"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"XGBoost (char 2-gram + char 3-gram)","rank_in_archive_order":8,"of":13,"metrics":{"Weighted Average F1-score":"0.8723"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Multinomial NB (word 2-gram + word 3-gram)","rank_in_archive_order":9,"of":13,"metrics":{"Weighted Average F1-score":"0.8663"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"XGBoost (word 2-gram + word 3-gram)","rank_in_archive_order":10,"of":13,"metrics":{"Weighted Average F1-score":"0.8651"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"Multinomial NB (BoW)","rank_in_archive_order":11,"of":13,"metrics":{"Weighted Average F1-score":"0.8564"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"SVM (word 1-gram)","rank_in_archive_order":12,"of":13,"metrics":{"Weighted Average F1-score":"0.8519"},"uses_additional_data":false},{"leaderboard":"/sota/sentiment-analysis-on-banglabook","task":"Sentiment Analysis","dataset":"BanglaBook","model":"LSTM (GloVe)","rank_in_archive_order":13,"of":13,"metrics":{"Weighted Average F1-score":"0.0991"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}