{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/arabic-multi-dialect-segmentation-bi-lstm-crf","title":"Arabic Multi-Dialect Segmentation: bi-LSTM-CRF vs. SVM","arxiv_id":"1708.05891","date":"2017-08-19","proceeding":null,"authors":["Mohamed Eldesouki","Younes Samih","Ahmed Abdelali","Mohammed Attia","Hamdy Mubarak","Kareem Darwish","Kallmeyer Laura"],"abstract":"Arabic word segmentation is essential for a variety of NLP applications such\nas machine translation and information retrieval. Segmentation entails breaking\nwords into their constituent stems, affixes and clitics. In this paper, we\ncompare two approaches for segmenting four major Arabic dialects using only\nseveral thousand training examples for each dialect. The two approaches involve\nposing the problem as a ranking problem, where an SVM ranker picks the best\nsegmentation, and as a sequence labeling problem, where a bi-LSTM RNN coupled\nwith CRF determines where best to segment words. We are able to achieve solid\nsegmentation results for all dialects using rather limited training data. We\nalso show that employing Modern Standard Arabic data for domain adaptation and\nassuming context independence improve overall results.","url_abs":"http://arxiv.org/abs/1708.05891v1","url_pdf":"http://arxiv.org/pdf/1708.05891v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"arabic-multi-dialect-segmentation-bi-lstm-crf","repo_url":"https://github.com/qcri/dialectal_arabic_segmenter","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"tf","reach":null},{"paper_slug":"arabic-multi-dialect-segmentation-bi-lstm-crf","repo_url":"https://github.com/qcri/dialectal_arabic_tools","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":1,"framework":"none","reach":null}],"tasks":[{"task_slug":"domain-adaptation","task_name":"Domain Adaptation"},{"task_slug":"information-retrieval","task_name":"Information Retrieval"},{"task_slug":"machine-translation","task_name":"Machine Translation"},{"task_slug":"retrieval","task_name":"Retrieval"},{"task_slug":"segmentation","task_name":"Segmentation"},{"task_slug":"sentiment-analysis","task_name":"Sentiment Analysis"},{"task_slug":"translation","task_name":"Translation"}],"methods":[{"method_slug":"crf","method_name":"CRF"},{"method_slug":"svm","method_name":"SVM"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/sentiment-analysis-on-dynasent","task":"Sentiment Analysis","dataset":"DynaSent","model":"SVM","rank_in_archive_order":12,"of":12,"metrics":{"10 fold Cross validation":"1"},"uses_additional_data":true}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}