{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/glami-1m-a-multilingual-image-text-fashion-1","title":"GLAMI-1M: A Multilingual Image-Text Fashion Dataset","arxiv_id":"2211.14451","date":"2022-11-17","proceeding":"BMVC 2022 11","authors":["Vaclav Kosar","Antonín Hoskovec","Milan Šulc","Radek Bartyzal"],"abstract":"We introduce GLAMI-1M: the largest multilingual image-text classification dataset and benchmark. The dataset contains images of fashion products with item descriptions, each in 1 of 13 languages. Categorization into 191 classes has high-quality annotations: all 100k images in the test set and 75% of the 1M training set were human-labeled. The paper presents baselines for image-text classification showing that the dataset presents a challenging fine-grained classification problem: The best scoring EmbraceNet model using both visual and textual features achieves 69.7% accuracy. Experiments with a modified Imagen model show the dataset is also suitable for image generation conditioned on text. The dataset, source code and model checkpoints are published at https://github.com/glami/glami-1m","url_abs":"https://arxiv.org/abs/2211.14451v1","url_pdf":"https://arxiv.org/pdf/2211.14451v1.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"glami-1m-a-multilingual-image-text-fashion-1","repo_url":"https://github.com/glami/glami-1m","is_official":1,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":null}],"tasks":[{"task_slug":"classification-1","task_name":"Classification"},{"task_slug":"image-generation","task_name":"Image Generation"},{"task_slug":"image-text-classification","task_name":"Image-text Classification"},{"task_slug":"multi-lingual-image-text-classification","task_name":"Multilingual Image-Text Classification"},{"task_slug":"text-classification","task_name":"Text Classification"},{"task_slug":"text-classification-1","task_name":"text-classification"}],"methods":[{"method_slug":"1x1-convolution","method_name":"1x1 Convolution"},{"method_slug":"adafactor","method_name":"Adafactor"},{"method_slug":"attention","method_name":"Attention"},{"method_slug":"attention-dropout","method_name":"Attention Dropout"},{"method_slug":"average-pooling","method_name":"Average Pooling"},{"method_slug":"bpe","method_name":"BPE"},{"method_slug":"batch-normalization","method_name":"Batch Normalization"},{"method_slug":"bottleneck-residual-block","method_name":"Bottleneck Residual Block"},{"method_slug":"clip","method_name":"CLIP"},{"method_slug":"convolution","method_name":"Convolution"},{"method_slug":"dense-connections","method_name":"Dense Connections"},{"method_slug":"diffusion","method_name":"Diffusion"},{"method_slug":"dropout","method_name":"Dropout"},{"method_slug":"embracenet","method_name":"EmbraceNet"},{"method_slug":"glu","method_name":"Gated Linear Unit"},{"method_slug":"global-average-pooling","method_name":"Global Average Pooling"},{"method_slug":"inverse-square-root-schedule","method_name":"Inverse Square Root Schedule"},{"method_slug":"kaiming-initialization","method_name":"Kaiming Initialization"},{"method_slug":"layer-normalization","method_name":"Layer Normalization"},{"method_slug":"linear-layer","method_name":"Linear Layer"},{"method_slug":"max-pooling","method_name":"Max Pooling"},{"method_slug":"multi-head-attention","method_name":"Multi-Head Attention"},{"method_slug":"relu","method_name":"ReLU"},{"method_slug":"residual-block","method_name":"Residual Block"},{"method_slug":"residual-connection","method_name":"Residual Connection"},{"method_slug":"sentencepiece","method_name":"SentencePiece"},{"method_slug":"softmax","method_name":"Softmax"},{"method_slug":"t5","method_name":"T5"},{"method_slug":"test","method_name":"Test"},{"method_slug":"mt5","method_name":"mT5"}],"datasets_introduced":[{"slug":"glami-1m","name":"GLAMI-1M","full_name":"A Multilingual Image-Text Fashion Dataset"}],"methods_introduced":[],"results":[{"leaderboard":"/sota/multi-lingual-image-text-classification-on","task":"Multilingual Image-Text Classification","dataset":"GLAMI-1M","model":"EmbraceNet (image+text)","rank_in_archive_order":1,"of":2,"metrics":{"Top 1 Accuracy %":"69.7","Top 5 Accuracy %":"94.0"},"uses_additional_data":true},{"leaderboard":"/sota/multi-lingual-image-text-classification-on","task":"Multilingual Image-Text Classification","dataset":"GLAMI-1M","model":"CLIP (zero-shot image+text)","rank_in_archive_order":2,"of":2,"metrics":{"Top 1 Accuracy %":"32.3","Top 5 Accuracy %":"74.5"},"uses_additional_data":true}],"syntology":{"syntology_url":null,"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}