{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/victor-a-dataset-for-brazilian-legal","title":"VICTOR: a Dataset for Brazilian Legal Documents Classification","arxiv_id":null,"date":"2020-05-01","proceeding":"LREC 2020 5","authors":["Pedro Henrique Luz de Araujo","Te{\\'o}filo Em{\\'\\i}dio de Campos","Fabricio Ataides Braz","Nilton Correia da Silva"],"abstract":"This paper describes VICTOR, a novel dataset built from Brazil{'}s Supreme Court digitalized legal documents, composed of more than 45 thousand appeals, which includes roughly 692 thousand documents{---}about 4.6 million pages. The dataset contains labeled text data and supports two types of tasks: document type classification; and theme assignment, a multilabel problem. We present baseline results using bag-of-words models, convolutional neural networks, recurrent neural networks and boosting algorithms. We also experiment using linear-chain Conditional Random Fields to leverage the sequential nature of the lawsuits, which we find to lead to improvements on document type classification. Finally we compare a theme classification approach where we use domain knowledge to filter out the less informative document pages to the default one where we use all pages. Contrary to the Court experts{'} expectations, we find that using all available data is the better method. We make the dataset available in three versions of different sizes and contents to encourage explorations of better models and techniques.","url_abs":"https://aclanthology.org/2020.lrec-1.181","url_pdf":"https://aclanthology.org/2020.lrec-1.181.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"victor-a-dataset-for-brazilian-legal","repo_url":"https://github.com/peluz/VICTOR-dataset","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"tf","reach":null}],"tasks":[{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"classification","task_name":"General Classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/multi-label-text-classification-on-bvictor","task":"Multi-Label Text Classification","dataset":"BVICTOR","model":"XGBoost","rank_in_archive_order":1,"of":3,"metrics":{"Average F1":"0.8843","Weighted F1":"0.8957"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-bvictor","task":"Multi-Label Text Classification","dataset":"BVICTOR","model":"SVM","rank_in_archive_order":2,"of":3,"metrics":{"Average F1":"0.7761","Weighted F1":"0.8235"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-bvictor","task":"Multi-Label Text Classification","dataset":"BVICTOR","model":"NB","rank_in_archive_order":3,"of":3,"metrics":{"Average F1":"0.6335","Weighted F1":"0.6955"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-mvictor","task":"Multi-Label Text Classification","dataset":"MVICTOR (theme)","model":"XGBoost","rank_in_archive_order":1,"of":3,"metrics":{"Average F1":"0.8882","Weighted F1":"0.9072"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-mvictor","task":"Multi-Label Text Classification","dataset":"MVICTOR (theme)","model":"SVM","rank_in_archive_order":2,"of":3,"metrics":{"Average F1":"0.6642","Weighted F1":"0.8137"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-mvictor","task":"Multi-Label Text Classification","dataset":"MVICTOR (theme)","model":"NB","rank_in_archive_order":3,"of":3,"metrics":{"Average F1":"0.3797","Weighted F1":"0.6062"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-svictor","task":"Multi-Label Text Classification","dataset":"SVICTOR (theme)","model":"XGBoost","rank_in_archive_order":1,"of":3,"metrics":{"Average F1":"0.8887","Weighted F1":"0.8634"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-svictor","task":"Multi-Label Text Classification","dataset":"SVICTOR (theme)","model":"SVM","rank_in_archive_order":2,"of":3,"metrics":{"Average F1":"0.8246","Weighted F1":"0.8231"},"uses_additional_data":false},{"leaderboard":"/sota/multi-label-text-classification-on-svictor","task":"Multi-Label Text Classification","dataset":"SVICTOR (theme)","model":"NB","rank_in_archive_order":3,"of":3,"metrics":{"Average F1":"0.5121","Weighted F1":"0.4875"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-mvictor-type","task":"Text Classification","dataset":"MVICTOR (type)","model":"CNN + CRF","rank_in_archive_order":1,"of":5,"metrics":{"Average F1":"0.7505","Weighted F1":"0.9537"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-mvictor-type","task":"Text Classification","dataset":"MVICTOR (type)","model":"BiLSTM","rank_in_archive_order":2,"of":5,"metrics":{"Average F1":"0.7092","Weighted F1":"0.9433"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-mvictor-type","task":"Text Classification","dataset":"MVICTOR (type)","model":"CNN","rank_in_archive_order":3,"of":5,"metrics":{"Average F1":"0.7061","Weighted F1":"0.9464"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-mvictor-type","task":"Text Classification","dataset":"MVICTOR (type)","model":"SVM","rank_in_archive_order":4,"of":5,"metrics":{"Average F1":"0.6792","Weighted F1":"0.9288"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-mvictor-type","task":"Text Classification","dataset":"MVICTOR (type)","model":"NB","rank_in_archive_order":5,"of":5,"metrics":{"Average F1":"0.4772","Weighted F1":"0.8477"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-svictor-type","task":"Text Classification","dataset":"SVICTOR (type)","model":"CNN + CRF","rank_in_archive_order":1,"of":5,"metrics":{"Average F1":"0.7740","Weighted F1":"0.9533"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-svictor-type","task":"Text Classification","dataset":"SVICTOR (type)","model":"SVM","rank_in_archive_order":2,"of":5,"metrics":{"Average F1":"0.7632","Weighted F1":"0.9425"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-svictor-type","task":"Text Classification","dataset":"SVICTOR (type)","model":"CNN","rank_in_archive_order":3,"of":5,"metrics":{"Average F1":"0.7584","Weighted F1":"0.9472"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-svictor-type","task":"Text Classification","dataset":"SVICTOR (type)","model":"BiLSTM","rank_in_archive_order":4,"of":5,"metrics":{"Average F1":"0.7281","Weighted F1":"0.9465"},"uses_additional_data":false},{"leaderboard":"/sota/text-classification-on-svictor-type","task":"Text Classification","dataset":"SVICTOR (type)","model":"NB","rank_in_archive_order":5,"of":5,"metrics":{"Average F1":"0.5979","Weighted F1":"0.8893"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}