{"url":"/method/ail","slug":"ail","name":"GAIL","full_name":"Generative Adversarial Imitation Learning","full_name_withheld":false,"description_markdown":"**Generative Adversarial Imitation Learning** presents a new general framework for directly extracting a policy from data, as if it were obtained by reinforcement learning following inverse reinforcement learning.","description_state":"present","introduced_year":null,"introduced_by":{"title":"Generative Adversarial Imitation Learning","paper":"/paper/generative-adversarial-imitation-learning","first_author":"Jonathan Ho","n_authors":2,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/generative-adversarial-imitation-learning"},"source":{"url":"http://arxiv.org/abs/1606.03476v1","title":"Generative Adversarial Imitation Learning","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"General","area_id":"general","collection":"Adversarial Training","url":"/methods/category/adversarial-training","pwc_aliases":[]}],"n_papers_tagged":41,"archive_num_papers":41,"papers_newest_first":[{"paper":null,"title":"Imitation Learning of Correlated Policies in Stackelberg Games","date":"2025-03-11","arxiv_id":"2503.08883","n_code_links":0,"syntology":null},{"paper":null,"title":"Quality Diversity Imitation Learning","date":"2024-10-08","arxiv_id":"2410.06151","n_code_links":0,"syntology":null},{"paper":null,"title":"Enhancing Spectrum Efficiency in 6G Satellite Networks: A GAIL-Powered Policy Learning via Asynchronous Federated Inverse Reinforcement Learning","date":"2024-09-27","arxiv_id":"2409.18718","n_code_links":0,"syntology":null},{"paper":null,"title":"Adversarial Safety-Critical Scenario Generation using Naturalistic Human Driving Priors","date":"2024-08-06","arxiv_id":"2408.03200","n_code_links":0,"syntology":null},{"paper":null,"title":"RaCIL: Ray Tracing based Multi-UAV Obstacle Avoidance through Composite Imitation Learning","date":"2024-06-24","arxiv_id":"2407.02520","n_code_links":0,"syntology":null},{"paper":null,"title":"Diffusion-Reward Adversarial Imitation Learning","date":"2024-05-25","arxiv_id":"2405.16194","n_code_links":0,"syntology":null},{"paper":null,"title":"C-GAIL: Stabilizing Generative Adversarial Imitation Learning with Control Theory","date":"2024-02-26","arxiv_id":"2402.16349","n_code_links":0,"syntology":null},{"paper":null,"title":"Exploring Gradient Explosion in Generative Adversarial Imitation Learning: A Probabilistic Perspective","date":"2023-12-18","arxiv_id":"2312.11214","n_code_links":0,"syntology":null},{"paper":"/paper/hierarchical-generative-adversarial-imitation","title":"Hierarchical Generative Adversarial Imitation Learning with Mid-level Input Generation for Autonomous Driving on Urban Environments","date":"2023-02-09","arxiv_id":"2302.04823","n_code_links":1,"syntology":{"ran":2,"of":2,"unverified":0,"pointer_only":2}},{"paper":null,"title":"Latent Policies for Adversarial Imitation Learning","date":"2022-06-22","arxiv_id":"2206.11299","n_code_links":0,"syntology":null},{"paper":null,"title":"Diverse Imitation Learning via Self-Organizing Generative Models","date":"2022-05-06","arxiv_id":"2205.03484","n_code_links":0,"syntology":null},{"paper":"/paper/gail-pt-a-generic-intelligent-penetration","title":"GAIL-PT: A Generic Intelligent Penetration Testing Framework with Generative Adversarial Imitation Learning","date":"2022-04-05","arxiv_id":"2204.01975","n_code_links":1,"syntology":null},{"paper":null,"title":"Rethinking ValueDice: Does It Really Improve Performance?","date":"2022-02-05","arxiv_id":"2202.02468","n_code_links":0,"syntology":null},{"paper":null,"title":"Rethinking ValueDice: Does It Really Improve Performance?","date":"2022-01-17","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":"/paper/continuous-control-with-action-quantization-1","title":"Continuous Control with Action Quantization from Demonstrations","date":"2021-10-19","arxiv_id":"2110.10149","n_code_links":1,"syntology":null},{"paper":null,"title":"Generative Adversarial Imitation Learning for End-to-End Autonomous Driving on Urban Environments","date":"2021-10-16","arxiv_id":"2110.08586","n_code_links":0,"syntology":null},{"paper":null,"title":"Diverse Imitation Learning via Self-OrganizingGenerative Models","date":"2021-09-29","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"title":"Stabilized Likelihood-based Imitation Learning via Denoising Continuous Normalizing Flow","date":"2021-09-29","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"title":"Provably Efficient Generative Adversarial Imitation Learning for Online and Offline Setting with Linear Function Approximation","date":"2021-08-19","arxiv_id":"2108.08765","n_code_links":0,"syntology":null},{"paper":"/paper/a-pragmatic-look-at-deep-imitation-learning","title":"A Pragmatic Look at Deep Imitation Learning","date":"2021-08-04","arxiv_id":"2108.01867","n_code_links":1,"syntology":null},{"paper":null,"title":"Imitation by Predicting Observations","date":"2021-07-08","arxiv_id":"2107.03851","n_code_links":0,"syntology":null},{"paper":null,"title":"On the Benefits of Inducing Local Lipschitzness for Robust Generative Adversarial Imitation Learning","date":"2021-06-30","arxiv_id":"2107.00116","n_code_links":0,"syntology":null},{"paper":null,"title":"Generative Adversarial Imitation Learning for Empathy-based AI","date":"2021-05-27","arxiv_id":"2105.13328","n_code_links":0,"syntology":null},{"paper":null,"title":"GAN-Based Interactive Reinforcement Learning from Demonstration and Human Evaluative Feedback","date":"2021-04-14","arxiv_id":"2104.06600","n_code_links":0,"syntology":null},{"paper":null,"title":"Online Apprenticeship Learning","date":"2021-02-13","arxiv_id":"2102.06924","n_code_links":0,"syntology":null},{"paper":null,"title":"Visual Imitation with Reinforcement Learning using Recurrent Siamese Networks","date":"2021-01-01","arxiv_id":null,"n_code_links":0,"syntology":null},{"paper":null,"title":"What is the Reward for Handwriting? -- Handwriting Generation by Imitation Learning","date":"2020-09-23","arxiv_id":"2009.10962","n_code_links":0,"syntology":null},{"paper":"/paper/addressing-reward-bias-in-adversarial","title":"Addressing reward bias in Adversarial Imitation Learning with neutral reward functions","date":"2020-09-20","arxiv_id":"2009.09467","n_code_links":1,"syntology":null},{"paper":"/paper/non-adversarial-imitation-learning-and-its","title":"Non-Adversarial Imitation Learning and its Connections to Adversarial Methods","date":"2020-08-08","arxiv_id":"2008.03525","n_code_links":1,"syntology":{"ran":1,"of":4,"unverified":3,"pointer_only":0}},{"paper":null,"title":"Concurrent Training Improves the Performance of Behavioral Cloning from Observation","date":"2020-08-03","arxiv_id":"2008.01205","n_code_links":0,"syntology":null}],"papers_shown":30,"tasks":[{"task":"/task/imitation-learning","name":"Imitation Learning","papers":37},{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":13},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":8},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":8},{"task":"/task/mujoco","name":"MuJoCo","papers":6},{"task":"/task/continuous-control","name":"Continuous Control","papers":5},{"task":"/task/continuous-control","name":"continuous-control","papers":5},{"task":"/task/autonomous-driving","name":"Autonomous Driving","papers":2},{"task":"/task/autonomous-navigation","name":"Autonomous Navigation","papers":2},{"task":"/task/autonomous-vehicles","name":"Autonomous Vehicles","papers":2},{"task":"/task/transfer-learning","name":"Transfer Learning","papers":2},{"task":"/task/behavioural-cloning","name":"Behavioural cloning","papers":1},{"task":"/task/collision-avoidance","name":"Collision Avoidance","papers":1},{"task":"/task/d4rl","name":"D4RL","papers":1},{"task":"/task/data-augmentation","name":"Data Augmentation","papers":1},{"task":"/task/decision-making","name":"Decision Making","papers":1},{"task":"/task/decoder","name":"Decoder","papers":1},{"task":"/task/deep-reinforcement-learning","name":"Deep Reinforcement Learning","papers":1},{"task":"/task/denoising","name":"Denoising","papers":1},{"task":"/task/disentanglement","name":"Disentanglement","papers":1}],"tasks_shown":20,"n_tasks":34,"usage_by_year":[{"year":"2016","papers":1},{"year":"2020","papers":14},{"year":"2021","papers":12},{"year":"2022","papers":5},{"year":"2023","papers":2},{"year":"2024","papers":6},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/ail"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}