{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/image-and-text-fusion-for-upmc-food-101-using","title":"Image and Text fusion for UPMC Food-101 \\\\using BERT and CNNs","arxiv_id":null,"date":"2020-12-17","proceeding":null,"authors":["Ignazio Gallo","Gianmarco Ria","Nicola Landro","and Riccardo La Grassa"],"abstract":"The modern digital world is becoming more and more multimodal. Looking on the internet, images are often associated with the text, so classification problems with these two modalities are very common.\r\nIn this paper, we examine multimodal classification using textual information and visual representations of the same concept.\r\nWe investigate two main basic methods to perform multimodal fusion and adapt them with stacking techniques to better handle this type of problem.\r\nHere, we use UPMC Food-101, which is a difficult and noisy multimodal dataset that well represents this category of multimodal problems.\r\nOur results show that the proposed early fusion technique combined with a stacking-based approach exceeds the state of the art on the dataset used.","url_abs":"https://ieeexplore.ieee.org/abstract/document/9290622","url_pdf":"http://artelab.dista.uninsubria.it/res/research/papers/2020/2020-IVCNZ-Gallo-Food101.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"image-and-text-fusion-for-upmc-food-101-using","repo_url":"https://github.com/artelab/Image-and-Text-fusion-for-UPMC-Food-101-using-BERT-and-CNNs","is_official":0,"mentioned_in_paper":0,"mentioned_in_github":0,"framework":"none","reach":null}],"tasks":[{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"document-text-classification","task_name":"Document Text Classification"},{"task_slug":"classification","task_name":"General Classification"},{"task_slug":"image-classification","task_name":"Image Classification"},{"task_slug":"multi-modal-document-classification","task_name":"Multi-Modal Document Classification"},{"task_slug":"multimodal-deep-learning","task_name":"Multimodal Deep Learning"},{"task_slug":"multimodal-text-and-image-classification","task_name":"Multimodal Text and Image Classification"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/document-text-classification-on-food-101","task":"Document Text Classification","dataset":"Food-101","model":"Bert","rank_in_archive_order":1,"of":1,"metrics":{"Accuracy (%)":"84.41"},"uses_additional_data":false},{"leaderboard":"/sota/image-classification-on-food-101-1","task":"Image Classification","dataset":"Food-101","model":"Inception V3","rank_in_archive_order":11,"of":11,"metrics":{"Accuracy (%)":"71.67"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-text-and-image-classification-on-1","task":"Multimodal Text and Image Classification","dataset":"Food-101","model":"Early Fusion (Bert + InceptionV3)","rank_in_archive_order":1,"of":2,"metrics":{"Accuracy (%)":"92.5"},"uses_additional_data":false},{"leaderboard":"/sota/multimodal-text-and-image-classification-on-1","task":"Multimodal Text and Image Classification","dataset":"Food-101","model":"Late Fusion (Bert + InceptionV3)","rank_in_archive_order":2,"of":2,"metrics":{"Accuracy (%)":"84.59"},"uses_additional_data":false}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}