{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/inferring-the-source-of-official-texts-can","title":"Inferring the source of official texts: can SVM beat ULMFiT?","arxiv_id":null,"date":"2020-03-02","proceeding":"International Conference on Computational Processing of the Portuguese Language 2020 3","authors":["Pedro Henrique Luz de Araujo","Teófilo Emidio de Campos","Marcelo Magalhães Silva de Sousa"],"abstract":"Official Gazettes are a rich source of relevant information to the public. Their careful examination may lead to the detection of frauds and irregularities that may prevent mismanagement of public funds. This paper presents a dataset composed of documents from the Official Gazette of the Federal District, containing both samples with document source annotation and unlabeled ones. We train, evaluate and compare a transfer learning based model that uses ULMFiT with traditional bag-of-words models that use SVM and Naive Bayes as classifiers. We find the SVM to be competitive, its performance being marginally worse than the ULMFiT while having much faster train and inference time and being less computationally expensive. Finally, we conduct ablation analysis to assess the performance impact of the ULMFiT parts.","url_abs":"https://cic.unb.br/~teodecampos/KnEDLe/propor2020/luz_de_araujo_etal_propor2020.pdf","url_pdf":"https://cic.unb.br/~teodecampos/KnEDLe/propor2020/luz_de_araujo_etal_propor2020.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"inferring-the-source-of-official-texts-can","repo_url":"https://github.com/peluz/kneedle-exploration","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":null}],"tasks":[{"task_slug":"text-classification","task_name":"Text Classification"},{"task_slug":"transfer-learning","task_name":"Transfer Learning"}],"methods":[{"method_slug":"awd-lstm","method_name":"AWD-LSTM"},{"method_slug":"activation-regularization","method_name":"Activation Regularization"},{"method_slug":"discriminative-fine-tuning","method_name":"Discriminative Fine-Tuning"},{"method_slug":"dropconnect","method_name":"DropConnect"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"embedding-dropout","method_name":"Embedding Dropout"},{"method_slug":"lstm","method_name":"LSTM"},{"method_slug":"svm","method_name":"SVM"},{"method_slug":"sigmoid-activation","method_name":"Sigmoid Activation"},{"method_slug":"slanted-triangular-learning-rates","method_name":"Slanted Triangular Learning Rates"},{"method_slug":"tanh-activation","method_name":"Tanh Activation"},{"method_slug":"temporal-activation-regularization","method_name":"Temporal Activation Regularization"},{"method_slug":"ulmfit","method_name":"ULMFiT"},{"method_slug":"variational-dropout","method_name":"Variational Dropout"},{"method_slug":"weight-tying","method_name":"Weight Tying"}],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/text-classification-on-dodf-data","task":"Text Classification","dataset":"DODF Data","model":"ULMFiT (pre-trained vocab, no gradual unfreezing)","rank_in_archive_order":1,"of":5,"metrics":{"Average F1":"0.8918","Weighted F1":"0.9257"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-dodf-data","task":"Text Classification","dataset":"DODF Data","model":"SVM + word counts (pre-trained vocab)","rank_in_archive_order":2,"of":5,"metrics":{"Average F1":"0.8782","Weighted F1":"0.9049"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-dodf-data","task":"Text Classification","dataset":"DODF Data","model":"SVM + tf-idf (no pre-trained vocab)","rank_in_archive_order":3,"of":5,"metrics":{"Average F1":"0.8755","Weighted F1":"0.8917"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-dodf-data","task":"Text Classification","dataset":"DODF Data","model":"ULMFiT (no pre-trained vocab)","rank_in_archive_order":4,"of":5,"metrics":{"Average F1":"0.8469","Weighted F1":"0.8974"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-dodf-data","task":"Text Classification","dataset":"DODF Data","model":"ULMFiT (pre-trained vocab)","rank_in_archive_order":5,"of":5,"metrics":{"Average F1":"0.8374","Weighted F1":"0.9088"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}