{"url":"/method/iq-learn","slug":"iq-learn","name":"IQ-Learn","full_name":"Inverse Q-Learning","full_name_withheld":false,"description_markdown":"**Inverse Q-Learning (IQ-Learn)** is a a simple, stable & data-efficient framework for Imitation Learning (IL), that directly learns *soft Q-functions* from expert data. IQ-Learn enables **non-adverserial** imitation learning, working on both offline and online IL settings. It is performant even with very sparse expert data, and scales to complex image-based environments, surpassing prior methods by more than **3x**. \r\n\r\nIt is very simple to implement requiring ~15 lines of code on top of existing RL methods.\r\n\r\n<span class=\"description-source\">Source: [IQ-Learn: Inverse soft Q-Learning for Imitation](https://arxiv.org/abs/2106.12142)</span>","description_state":"present","introduced_year":null,"introduced_by":{"title":null,"paper":null,"first_author":null,"n_authors":0,"url_abs":null,"archive_paper_url":null},"source":{"url":null,"title":null,"url_on_a_paper_host":false},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Imitation Learning Methods","url":"/methods/category/imitation-learning-methods","pwc_aliases":[]}],"n_papers_tagged":4,"archive_num_papers":4,"papers_newest_first":[{"paper":"/paper/on-learning-informative-trajectory-embeddings","title":"On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression","date":"2025-01-16","arxiv_id":"2501.09327","n_code_links":1,"syntology":null},{"paper":null,"title":"Adversarial Imitation Learning via Boosting","date":"2024-04-12","arxiv_id":"2404.08513","n_code_links":0,"syntology":null},{"paper":null,"title":"Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time Guarantees","date":"2022-10-04","arxiv_id":"2210.01808","n_code_links":0,"syntology":null},{"paper":"/paper/iq-learn-inverse-soft-q-learning-for","title":"IQ-Learn: Inverse soft-Q Learning for Imitation","date":"2021-06-23","arxiv_id":"2106.12142","n_code_links":5,"syntology":{"ran":2,"of":3,"unverified":1,"pointer_only":3}}],"papers_shown":4,"tasks":[{"task":"/task/imitation-learning","name":"Imitation Learning","papers":3},{"task":"/task/decision-making","name":"Decision Making","papers":2},{"task":"/task/sequential-decision-making","name":"Sequential Decision Making","papers":2},{"task":"/task/atari-games","name":"Atari Games","papers":1},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":1},{"task":"/task/clustering","name":"Clustering","papers":1},{"task":"/task/continuous-control","name":"Continuous Control","papers":1},{"task":"/task/mujoco","name":"MuJoCo","papers":1},{"task":"/task/mujoco-games","name":"MuJoCo Games","papers":1},{"task":"/task/q-learning","name":"Q-Learning","papers":1},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":1},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":1},{"task":"/task/self-driving-cars","name":"Self-Driving Cars","papers":1},{"task":null,"name":"counterfactual","papers":1},{"task":"/task/regression-1","name":"regression","papers":1},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":1}],"tasks_shown":16,"n_tasks":16,"usage_by_year":[{"year":"2021","papers":1},{"year":"2022","papers":1},{"year":"2024","papers":1},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/iq-learn"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}