{"url":"/method/policy-similarity-metric","slug":"policy-similarity-metric","name":"Policy Similarity Metric","full_name":"Policy Similarity Metric","full_name_withheld":false,"description_markdown":"**Policy Similarity Metric**, or **PSM**, is a similarity metric for measuring behavioral similarity between states in reinforcement learning. It assigns high similarity to states for which the optimal policies in those states as well as in future states are similar. PSM is reward-agnostic, making it more robust for generalization compared to approaches that rely on reward information.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Contrastive Behavioral Similarity Embeddings for Generalization in Reinforcement Learning","paper":"/paper/contrastive-behavioral-similarity-embeddings-1","first_author":"Rishabh Agarwal","n_authors":4,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/contrastive-behavioral-similarity-embeddings-1"},"source":{"url":"https://arxiv.org/abs/2101.05265v2","title":"Contrastive Behavioral Similarity Embeddings for Generalization in Reinforcement Learning","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"State Similarity Metrics","url":"/methods/category/state-similarity-metrics","pwc_aliases":[]}],"n_papers_tagged":2,"archive_num_papers":2,"papers_newest_first":[{"paper":"/paper/label-ranker-self-aware-preference-for","title":"Label Ranker: Self-Aware Preference for Classification Label Position in Visual Masked Self-Supervised Pre-Trained Model","date":"2025-03-03","arxiv_id":null,"n_code_links":1,"syntology":null},{"paper":"/paper/contrastive-behavioral-similarity-embeddings-1","title":"Contrastive Behavioral Similarity Embeddings for Generalization in Reinforcement Learning","date":"2021-01-13","arxiv_id":"2101.05265","n_code_links":1,"syntology":null}],"papers_shown":2,"tasks":[{"task":"/task/classification-1","name":"Classification","papers":1},{"task":"/task/dimensionality-reduction","name":"Dimensionality Reduction","papers":1},{"task":"/task/human-activity-recognition","name":"Human Activity Recognition","papers":1},{"task":"/task/image-classification","name":"Image Classification","papers":1},{"task":"/task/multi-label-learning","name":"Multi-Label Learning","papers":1},{"task":null,"name":"Position","papers":1},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":1},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":1},{"task":"/task/representation-learning","name":"Representation Learning","papers":1},{"task":"/task/semantic-similarity","name":"Semantic Similarity","papers":1},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":1}],"tasks_shown":11,"n_tasks":11,"usage_by_year":[{"year":"2021","papers":1},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/policy-similarity-metric"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}