{"url":"/method/iql","slug":"iql","name":"IQL","full_name":"Implicit Q-Learning","full_name_withheld":false,"description_markdown":null,"description_state":"absent","introduced_year":null,"introduced_by":{"title":"Offline Reinforcement Learning with Implicit Q-Learning","paper":"/paper/offline-reinforcement-learning-with-implicit","first_author":"Ilya Kostrikov","n_authors":3,"url_abs":null,"archive_paper_url":"https://paperswithcode.com/paper/offline-reinforcement-learning-with-implicit"},"source":{"url":"https://arxiv.org/abs/2110.06169v1","title":"Offline Reinforcement Learning with Implicit Q-Learning","url_on_a_paper_host":true},"code_snippet_url":null,"code_snippet_url_on_a_code_host":false,"categories":[{"area":"Reinforcement Learning","area_id":"reinforcement-learning","collection":"Offline Reinforcement Learning Methods","url":"/methods/category/offline-reinforcement-learning-methods","pwc_aliases":[]}],"n_papers_tagged":16,"archive_num_papers":16,"papers_newest_first":[{"paper":null,"title":"Projection Implicit Q-Learning with Support Constraint for Offline Reinforcement Learning","date":"2025-01-15","arxiv_id":"2501.08907","n_code_links":0,"syntology":null},{"paper":null,"title":"Comparative Analysis of Multi-Agent Reinforcement Learning Policies for Crop Planning Decision Support","date":"2024-12-03","arxiv_id":"2412.02057","n_code_links":0,"syntology":null},{"paper":"/paper/hypercube-policy-regularization-framework-for","title":"Hypercube Policy Regularization Framework for Offline Reinforcement Learning","date":"2024-11-07","arxiv_id":"2411.04534","n_code_links":1,"syntology":null},{"paper":"/paper/energy-guided-diffusion-sampling-for-offline","title":"Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning","date":"2024-07-17","arxiv_id":"2407.12448","n_code_links":1,"syntology":{"ran":9,"of":11,"unverified":2,"pointer_only":11}},{"paper":"/paper/adr-bc-adversarial-density-weighted","title":"Imitating from auxiliary imperfect demonstrations via Adversarial Density Weighted Regression","date":"2024-05-28","arxiv_id":"2405.20351","n_code_links":1,"syntology":null},{"paper":"/paper/aligniql-policy-alignment-in-implicit-q","title":"AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization","date":"2024-05-28","arxiv_id":"2405.18187","n_code_links":1,"syntology":null},{"paper":null,"title":"Simple Ingredients for Offline Reinforcement Learning","date":"2024-03-19","arxiv_id":"2403.13097","n_code_links":0,"syntology":null},{"paper":null,"title":"Innate-Values-driven Reinforcement Learning based Cooperative Multi-Agent Cognitive Modeling","date":"2024-01-10","arxiv_id":"2401.05572","n_code_links":0,"syntology":null},{"paper":"/paper/towards-robust-offline-reinforcement-learning","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","date":"2023-10-19","arxiv_id":"2310.12955","n_code_links":2,"syntology":{"ran":5,"of":9,"unverified":4,"pointer_only":9}},{"paper":null,"title":"Action-Quantized Offline Reinforcement Learning for Robotic Skill Learning","date":"2023-10-18","arxiv_id":"2310.11731","n_code_links":0,"syntology":null},{"paper":"/paper/harnessing-mixed-offline-reinforcement","title":"Harnessing Mixed Offline Reinforcement Learning Datasets via Trajectory Weighting","date":"2023-06-22","arxiv_id":"2306.13085","n_code_links":1,"syntology":null},{"paper":"/paper/offline-prioritized-experience-replay","title":"Decoupled Prioritized Resampling for Offline RL","date":"2023-06-08","arxiv_id":"2306.05412","n_code_links":2,"syntology":{"ran":0,"of":1,"unverified":1,"pointer_only":0}},{"paper":"/paper/idql-implicit-q-learning-as-an-actor-critic","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","date":"2023-04-20","arxiv_id":"2304.10573","n_code_links":1,"syntology":{"ran":3,"of":3,"unverified":0,"pointer_only":3}},{"paper":"/paper/offline-rl-with-no-ood-actions-in-sample","title":"Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization","date":"2023-03-28","arxiv_id":"2303.15810","n_code_links":4,"syntology":{"ran":1,"of":3,"unverified":2,"pointer_only":0}},{"paper":null,"title":"MA2QL: A Minimalist Approach to Fully Decentralized Multi-Agent Reinforcement Learning","date":"2022-09-17","arxiv_id":"2209.08244","n_code_links":0,"syntology":null},{"paper":"/paper/offline-reinforcement-learning-with-implicit","title":"Offline Reinforcement Learning with Implicit Q-Learning","date":"2021-10-12","arxiv_id":"2110.06169","n_code_links":17,"syntology":{"ran":32,"of":58,"unverified":26,"pointer_only":22}}],"papers_shown":16,"tasks":[{"task":"/task/reinforcement-learning-1","name":"Reinforcement Learning (RL)","papers":11},{"task":"/task/q-learning","name":"Q-Learning","papers":9},{"task":"/task/reinforcement-learning-2","name":"reinforcement-learning","papers":9},{"task":"/task/offline-rl","name":"Offline RL","papers":8},{"task":"/task/reinforcement-learning","name":"Reinforcement Learning","papers":8},{"task":"/task/d4rl","name":"D4RL","papers":6},{"task":"/task/regression-1","name":"regression","papers":3},{"task":"/task/mujoco","name":"MuJoCo","papers":2},{"task":"/task/multi-agent-reinforcement-learning","name":"Multi-agent Reinforcement Learning","papers":2},{"task":"/task/quantile-regression","name":"quantile regression","papers":2},{"task":"/task/computational-efficiency","name":"Computational Efficiency","papers":1},{"task":"/task/fairness","name":"Fairness","papers":1},{"task":"/task/general-reinforcement-learning","name":"General Reinforcement Learning","papers":1},{"task":"/task/imitation-learning","name":"Imitation Learning","papers":1},{"task":"/task/quantization","name":"Quantization","papers":1},{"task":"/task/smac","name":"SMAC","papers":1},{"task":"/task/smac-1","name":"SMAC+","papers":1},{"task":"/task/starcraft","name":"Starcraft","papers":1}],"tasks_shown":18,"n_tasks":18,"usage_by_year":[{"year":"2021","papers":1},{"year":"2022","papers":1},{"year":"2023","papers":6},{"year":"2024","papers":7},{"year":"2025","papers":1}],"row_source":"methods_table","archive":{"source":"pwc-archive (Hugging Face), CC BY-SA 4.0","snapshot":"2025-07-28","archive_url":"https://paperswithcode.com/method/iql"},"syntology_read_at":"2026-09-24T18:15:14+00:00"}