{"url":"/method/crosstransformers","slug":"crosstransformers","name":"CrossTransformers","full_name":"CrossTransformers","full_name_withheld":false,"description_markdown":"CrossTransformers is a Transformer-based neural network architecture which can take a small number of labeled images and an unlabeled query, find coarse spatial correspondence between the query and the labeled images, and then infer class membership by computing distances between spatially-corresponding features.","description_state":"present","introduced_year":null,"introduced_by":{"title":"CrossTransformers: spatially-aware few-shot transfer","paper":"/paper/crosstransformers-spatially-aware-few-shot","first_author":"Carl Doersch","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/crosstransformers-spatially-aware-few-shot"},"source":{"url":"https://arxiv.org/abs/2007.11498v5","title":"CrossTransformers: spatially-aware few-shot transfer","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Computer Vision","area_id":"computer-vision","collection":"Vision Transformers","url":"/methods/category/vision-transformers","pwc_aliases":["vision-transformer"]}],"n_papers_tagged":3,"archive_num_papers":3,"papers_newest_first":[{"paper":"/paper/fewsol-a-dataset-for-few-shot-object-learning","title":"FewSOL: A Dataset for Few-Shot Object Learning in Robotic Environments","date":"2022-07-06","arxiv_id":"2207.03333","n_code_links":3,"syntology":null},{"paper":"/paper/temporal-relational-crosstransformers-for-few","title":"Temporal-Relational CrossTransformers for Few-Shot Action Recognition","date":"2021-01-15","arxiv_id":"2101.06184","n_code_links":2,"syntology":{"ran":2,"of":5,"unverified":3,"pointer_only":1}},{"paper":"/paper/crosstransformers-spatially-aware-few-shot","title":"CrossTransformers: spatially-aware few-shot transfer","date":"2020-07-22","arxiv_id":"2007.11498","n_code_links":6,"syntology":{"ran":5,"of":6,"unverified":1,"pointer_only":2}}],"papers_shown":3,"tasks":[{"task":"/task/action-recognition-in-videos","name":"Action Recognition","papers":1},{"task":"/task/attribute","name":"Attribute","papers":1},{"task":"/task/classification-1","name":"Classification","papers":1},{"task":"/task/few-shot-action-recognition","name":"Few Shot Action Recognition","papers":1},{"task":"/task/few-shot-learning","name":"Few-Shot Learning","papers":1},{"task":"/task/few-shot-action-recognition","name":"Few-Shot action recognition","papers":1},{"task":"/task/meta-learning","name":"Meta-Learning","papers":1},{"task":"/task/object","name":"Object","papers":1},{"task":"/task/object-recognition","name":"Object Recognition","papers":1},{"task":"/task/pose-estimation","name":"Pose Estimation","papers":1},{"task":"/task/segmentation","name":"Segmentation","papers":1},{"task":"/task/self-supervised-learning","name":"Self-Supervised Learning","papers":1},{"task":"/task/semantic-segmentation","name":"Semantic Segmentation","papers":1}],"tasks_shown":13,"n_tasks":13,"usage_by_year":[{"year":"2020","papers":1},{"year":"2021","papers":1},{"year":"2022","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/crosstransformers"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}