{"about":{"site":"https://codewithpapers.app","non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page"},"url":"/paper/mmgcn-multi-modal-graph-convolution-network","title":"MMGCN: Multi-modal Graph Convolution Network for Personalized Recommendation of Micro-video","arxiv_id":null,"date":"2019-10-19","proceeding":"ACM International Conference on Multimedia 2019 10","authors":["Yinwei Wei","Xiang Wang","Liqiang Nie","Xiangnan He","Richang Hong","Tat-Seng Chua"],"abstract":"Personalized recommendation plays a central role in many online content sharing platforms. To provide quality micro-video recommendation service, it is of crucial importance to consider the interactions between users and items (i.e. micro-videos) as well as the item contents from various modalities (e.g. visual, acoustic, and textual). Existing works on multimedia recommendation largely exploit multi-modal contents to enrich item representations, while less effort is made to leverage information interchange between users and items to enhance user representations and further capture user's fine-grained preferences on different modalities. In this paper, we propose to exploit user-item interactions to guide the representation learning in each modality, and further personalized micro-video recommendation. We design a Multi-modal Graph Convolution Network (MMGCN) framework built upon the message-passing idea of graph neural networks, which can yield modal-specific representations of users and micro-videos to better capture user preferences. Specifically, we construct a user-item bipartite graph in each modality, and enrich the representation of each node with the topological structure and features of its neighbors. Through extensive experiments on three publicly available datasets, Tiktok, Kwai, and MovieLens, we demonstrate that our proposed model is able to significantly outperform state-of-the-art multi-modal recommendation methods.","url_abs":"https://dl.acm.org/doi/abs/10.1145/3343031.3351034","url_pdf":"http://staff.ustc.edu.cn/~hexn/papers/mm19-MMGCN.pdf","source":{"archive":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","row_kind":"abstracts"},"code_links":[{"paper_slug":"mmgcn-multi-modal-graph-convolution-network","repo_url":"https://github.com/weiyinwei/mmgcn","is_official":0,"mentioned_in_paper":1,"mentioned_in_github":0,"framework":"pytorch","reach":{"status":"ok"}}],"tasks":[{"task_slug":"micro-video-recommendations","task_name":"Micro-video recommendations"},{"task_slug":"microvideo-recommendation","task_name":"Microvideo Recommendation"},{"task_slug":"multi-media-recommendation","task_name":"Multi-Media Recommendation"},{"task_slug":"multi-modal-recommendation","task_name":"Multi-modal Recommendation"},{"task_slug":"multimedia-recommendation","task_name":"Multimedia recommendation"},{"task_slug":"multimodal-recommendation","task_name":"Multimodal Recommendation"},{"task_slug":"representation-learning","task_name":"Representation Learning"}],"methods":[],"datasets_introduced":[],"methods_introduced":[],"results":[{"leaderboard":"/sota/multi-media-recommendation-on-kwai","task":"Multi-Media Recommendation","dataset":"Kwai","model":"MMGCN","rank_in_archive_order":1,"of":2,"metrics":{"NDCG":"0.2298","Precision":"0.3057","Recall":"0.3996"},"uses_additional_data":false},{"leaderboard":"/sota/multi-media-recommendation-on-movielens-10m","task":"Multi-Media Recommendation","dataset":"MovieLens 10M","model":"MMGCN","rank_in_archive_order":1,"of":1,"metrics":{"NDCG":"0.3062","Precision":"0.1215","Recall":"0.5138"},"uses_additional_data":false},{"leaderboard":"/sota/multi-media-recommendation-on-tiktok","task":"Multi-Media Recommendation","dataset":"Tiktok","model":"MMGCN","rank_in_archive_order":1,"of":2,"metrics":{"NDCG":"0.3423","Precision":"0.1164","Recall":"0.5520"},"uses_additional_data":false},{"leaderboard":"/sota/multi-modal-recommendation-on-amazon-baby","task":"Multi-modal Recommendation","dataset":"Amazon Baby","model":"MMGCN","rank_in_archive_order":10,"of":10,"metrics":{"NDCG@20":"0.0282"},"uses_additional_data":false},{"leaderboard":"/sota/multi-modal-recommendation-on-amazon-clothing","task":"Multi-modal Recommendation","dataset":"Amazon Clothing","model":"MMGCN","rank_in_archive_order":10,"of":10,"metrics":{"NDCG@20":"0.0154"},"uses_additional_data":false},{"leaderboard":"/sota/multi-modal-recommendation-on-amazon-sports","task":"Multi-modal Recommendation","dataset":"Amazon Sports","model":"MMGCN","rank_in_archive_order":10,"of":10,"metrics":{"NGCG@20":"0.0270"},"uses_additional_data":false}],"syntology":{"atlas_url":null,"mcp":null,"developers":"https://syntology.ai/developers"},"arxiv_metadata":null,"syntology_extracted_results":null}