{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/13","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":13,"pages_in_order":18,"rows_per_page":100,"rows":[1201,1300],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/12","next":"/task/multi-agent-reinforcement-learning/papers/14","papers":[{"url":null,"slug":"decentralized-scheduling-through-an-adaptive","title":"Decentralized scheduling through an adaptive, trading-based multi-agent system","date":"2022-07-05","arxiv_id":"2207.11172","repositories_listed":0,"syntology":null},{"url":null,"slug":"emvlight-a-multi-agent-reinforcement-learning","title":"EMVLight: a Multi-agent Reinforcement Learning Framework for an Emergency Vehicle Decentralized Routing and Traffic Signal Control System","date":"2022-06-27","arxiv_id":"2206.13441","repositories_listed":0,"syntology":null},{"url":null,"slug":"functional-optimization-reinforcement","title":"Functional Optimization Reinforcement Learning for Real-Time Bidding","date":"2022-06-25","arxiv_id":"2206.13939","repositories_listed":0,"syntology":null},{"url":null,"slug":"certifiably-robust-policy-learning-against","title":"Certifiably Robust Policy Learning against Adversarial Communication in Multi-agent Systems","date":"2022-06-21","arxiv_id":"2206.10158","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-multi-agent-to-multi-robot-a-scalable","title":"From Multi-agent to Multi-robot: A Scalable Training and Evaluation Platform for Multi-robot Reinforcement Learning","date":"2022-06-20","arxiv_id":"2206.09590","repositories_listed":0,"syntology":null},{"url":null,"slug":"s2rl-do-we-really-need-to-perceive-all-states","title":"S2RL: Do We Really Need to Perceive All States in Deep Multi-Agent Reinforcement Learning?","date":"2022-06-20","arxiv_id":"2206.11054","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-some-common-practices-in","title":"Revisiting Some Common Practices in Cooperative Multi-Agent Reinforcement Learning","date":"2022-06-15","arxiv_id":"2206.07505","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-neural-rewriter-for-vehicle","title":"Multi-Agent Neural Rewriter for Vehicle Routing with Limited Disclosure of Costs","date":"2022-06-13","arxiv_id":"2206.05990","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-fully-decentralized","title":"Finite-Time Analysis of Fully Decentralized Single-Timescale Actor-Critic","date":"2022-06-12","arxiv_id":"2206.05733","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-multi-agent-reinforcement-learning-with-2","title":"Deep Multi-Agent Reinforcement Learning with Hybrid Action Spaces based on Maximum Entropy","date":"2022-06-10","arxiv_id":"2206.05108","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-joint-learning-of-wireless-multiple","title":"Scalable Joint Learning of Wireless Multiple-Access Policies and their Signaling","date":"2022-06-08","arxiv_id":"2206.03844","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-learning-for-cooperative-multi","title":"Consensus Learning for Cooperative Multi-Agent Reinforcement Learning","date":"2022-06-06","arxiv_id":"2206.02583","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-for-markov-games-unified","title":"Policy Optimization for Markov Games: Unified Framework and Faster Convergence","date":"2022-06-06","arxiv_id":"2206.02640","repositories_listed":0,"syntology":null},{"url":null,"slug":"macc-cross-layer-multi-agent-congestion","title":"MACC: Cross-Layer Multi-Agent Congestion Control with Deep Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.01972","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-poisoning-attacks-on-offline-multi","title":"Reward Poisoning Attacks on Offline Multi-Agent Reinforcement Learning","date":"2022-06-04","arxiv_id":"2206.01888","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-of-1","title":"Sample-Efficient Reinforcement Learning of Partially Observable Markov Games","date":"2022-06-02","arxiv_id":"2206.01315","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-diagnosis-via-measuring-role-diversity","title":"Policy Diagnosis via Measuring Role Diversity in Cooperative Multi-agent RL","date":"2022-06-01","arxiv_id":"2207.05683","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-offline-multi-agent","title":"Provably Efficient Offline Multi-agent Reinforcement Learning via Strategy-wise Bonus","date":"2022-06-01","arxiv_id":"2206.00159","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-risk-averse-equilibria-in-multi","title":"A Game-Theoretic Framework for Managing Risk in Multi-Agent Systems","date":"2022-05-30","arxiv_id":"2205.15434","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-q-networks-for-value-function","title":"Residual Q-Networks for Value Function Factorizing in Multi-Agent Reinforcement Learning","date":"2022-05-30","arxiv_id":"2205.15245","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-and-decentralized-learning-in","title":"Independent and Decentralized Learning in Markov Potential Games","date":"2022-05-29","arxiv_id":"2205.14590","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-databases-via-independent","title":"Multi-agent Databases via Independent Learning","date":"2022-05-28","arxiv_id":"2205.14323","repositories_listed":0,"syntology":null},{"url":null,"slug":"feudal-multi-agent-reinforcement-learning","title":"Feudal Multi-Agent Reinforcement Learning with Adaptive Network Partition for Traffic Signal Control","date":"2022-05-27","arxiv_id":"2205.13836","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-beat-multi-agent-reinforcement-learning","title":"Off-Beat Multi-Agent Reinforcement Learning","date":"2022-05-27","arxiv_id":"2205.13718","repositories_listed":0,"syntology":null},{"url":null,"slug":"maviper-learning-decision-tree-policies-for","title":"MAVIPER: Learning Decision Tree Policies for Interpretable Multi-Agent Reinforcement Learning","date":"2022-05-25","arxiv_id":"2205.12449","repositories_listed":0,"syntology":null},{"url":null,"slug":"trust-based-consensus-in-multi-agent","title":"Trust-based Consensus in Multi-Agent Reinforcement Learning Systems","date":"2022-05-25","arxiv_id":"2205.12880","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-convolutional-reinforcement-learning-1","title":"Graph Convolutional Reinforcement Learning for Collaborative Queuing Agents","date":"2022-05-24","arxiv_id":"2205.12009","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-advise-and-learning-from-advice","title":"Learning to Advise and Learning from Advice in Cooperative Multi-Agent Reinforcement Learning","date":"2022-05-23","arxiv_id":"2205.11163","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinating-policies-among-multiple-agents","title":"Coordinating Policies Among Multiple Agents via an Intelligent Communication Channel","date":"2022-05-21","arxiv_id":"2205.10607","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-adversarial-attack-in-multi-agent","title":"Sparse Adversarial Attack in Multi-agent Reinforcement Learning","date":"2022-05-19","arxiv_id":"2205.09362","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-bartering-behaviour-in-multi-agent","title":"Emergent Bartering Behaviour in Multi-Agent Reinforcement Learning","date":"2022-05-13","arxiv_id":"2205.06760","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-distributed-framework-for","title":"Efficient Distributed Framework for Collaborative Multi-Agent Reinforcement Learning","date":"2022-05-11","arxiv_id":"2205.05248","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-target-active-object-tracking-with","title":"Multi-Target Active Object Tracking with Monte Carlo Tree Search and Target Motion Modeling","date":"2022-05-07","arxiv_id":"2205.03555","repositories_listed":0,"syntology":null},{"url":null,"slug":"general-sum-stochastic-games-with-networked","title":"General sum stochastic games with networked information flows","date":"2022-05-05","arxiv_id":"2205.02760","repositories_listed":0,"syntology":null},{"url":null,"slug":"ldsa-learning-dynamic-subtask-assignment-in","title":"LDSA: Learning Dynamic Subtask Assignment in Cooperative Multi-Agent Reinforcement Learning","date":"2022-05-05","arxiv_id":"2205.02561","repositories_listed":0,"syntology":null},{"url":null,"slug":"pp-marl-efficient-privacy-preserving-marl-for","title":"PP-MARL: Efficient Privacy-Preserving Multi-Agent Reinforcement Learning for Cooperative Intelligence in Communications","date":"2022-04-26","arxiv_id":"2204.12064","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-auto-curricula-multi-agent","title":"Collaborative Auto-Curricula Multi-Agent Reinforcement Learning with Graph Neural Network Communication Layer for Open-ended Wildfire-Management Resource Distribution","date":"2022-04-24","arxiv_id":"2204.11350","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-robot-teams-a-review-integrating","title":"Resilient robot teams: a review integrating decentralised control, change-detection, and learning","date":"2022-04-21","arxiv_id":"2204.10063","repositories_listed":0,"syntology":null},{"url":null,"slug":"exact-formulas-for-finite-time-estimation","title":"Exact Formulas for Finite-Time Estimation Errors of Decentralized Temporal Difference Learning with Linear Function Approximation","date":"2022-04-20","arxiv_id":"2204.09801","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-learning-for-distributed-energy","title":"Federated Learning for Distributed Energy-Efficient Resource Allocation","date":"2022-04-20","arxiv_id":"2204.09602","repositories_listed":0,"syntology":null},{"url":null,"slug":"mingling-foresight-with-imagination-model","title":"Mingling Foresight with Imagination: Model-Based Cooperative Multi-Agent Reinforcement Learning","date":"2022-04-20","arxiv_id":"2204.09418","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-transfer-role-assignment-across","title":"Learning to Transfer Role Assignment Across Team Sizes","date":"2022-04-17","arxiv_id":"2204.12937","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-comprehensive-testing-on-the","title":"Towards Comprehensive Testing on the Robustness of Cooperative Multi-agent Reinforcement Learning","date":"2022-04-17","arxiv_id":"2204.07932","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-discretization-methods-for","title":"An Analysis of Discretization Methods for Communication Learning with Multi-Agent Reinforcement Learning","date":"2022-04-12","arxiv_id":"2204.05669","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-actor-critic-with-time-dynamical","title":"Multi-agent Actor-Critic with Time Dynamical Opponent Model","date":"2022-04-12","arxiv_id":"2204.05576","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-complexity-of-markov-equilibrium-in","title":"The Complexity of Markov Equilibrium in Stochastic Games","date":"2022-04-08","arxiv_id":"2204.03991","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-for-robot","title":"Distributed Reinforcement Learning for Robot Teams: A Review","date":"2022-04-07","arxiv_id":"2204.03516","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl4real-reinforcement-learning-for-register","title":"RL4ReAl: Reinforcement Learning for Register Allocation","date":"2022-04-05","arxiv_id":"2204.02013","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimising-energy-efficiency-in-uav-assisted","title":"Optimising Energy Efficiency in UAV-Assisted Networks using Deep Reinforcement Learning","date":"2022-04-04","arxiv_id":"2204.01597","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-asynchronous-cooperation-with","title":"Asynchronous, Option-Based Multi-Agent Policy Gradient: A Conditional Reasoning Approach","date":"2022-03-29","arxiv_id":"2203.15925","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-intelligent-reflecting-surface","title":"Collaborative Intelligent Reflecting Surface Networks with Multi-Agent Reinforcement Learning","date":"2022-03-26","arxiv_id":"2203.14152","repositories_listed":0,"syntology":null},{"url":null,"slug":"remember-and-forget-experience-replay-for","title":"Remember and Forget Experience Replay for Multi-Agent Reinforcement Learning","date":"2022-03-24","arxiv_id":"2203.13319","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-reinforcement-2","title":"Model-based Multi-agent Reinforcement Learning: Recent Progress and Prospects","date":"2022-03-20","arxiv_id":"2203.10603","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-bayesian-games-for-multi-agent","title":"Risk-Sensitive Bayesian Games for Multi-Agent Reinforcement Learning under Policy Uncertainty","date":"2022-03-18","arxiv_id":"2203.10045","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-multi-agent-reinforcement","title":"A Survey of Multi-Agent Deep Reinforcement Learning with Communication","date":"2022-03-16","arxiv_id":"2203.08975","repositories_listed":0,"syntology":null},{"url":null,"slug":"backpropagation-through-time-and-space","title":"Backpropagation through Time and Space: Learning Numerical Methods with Multi-Agent Reinforcement Learning","date":"2022-03-16","arxiv_id":"2203.08937","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-introduction-to-multi-agent-reinforcement","title":"An Introduction to Multi-Agent Reinforcement Learning and Review of its Application to Autonomous Mobility","date":"2022-03-15","arxiv_id":"2203.07676","repositories_listed":0,"syntology":null},{"url":null,"slug":"calibration-of-derivative-pricing-models-a","title":"Calibration of Derivative Pricing Models: a Multi-Agent Reinforcement Learning Perspective","date":"2022-03-14","arxiv_id":"2203.06865","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-multi-agent","title":"Efficient Model-based Multi-agent Reinforcement Learning via Optimistic Equilibrium Computation","date":"2022-03-14","arxiv_id":"2203.07322","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-multi-agent-pickup-and-delivery-problem","title":"The Multi-Agent Pickup and Delivery Problem: MAPF, MARL and Its Warehouse Applications","date":"2022-03-14","arxiv_id":"2203.07092","repositories_listed":0,"syntology":null},{"url":null,"slug":"impression-allocation-and-policy-search-in","title":"Impression Allocation and Policy Search in Display Advertising","date":"2022-03-11","arxiv_id":"2203.07073","repositories_listed":0,"syntology":null},{"url":null,"slug":"api-boosting-multi-agent-reinforcement","title":"Breaking the Curse of Dimensionality in Multiagent State Space: A Unified Agent Permutation Framework","date":"2022-03-10","arxiv_id":"2203.05285","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-fly-strategy-adaptation-for-ad-hoc","title":"On-the-fly Strategy Adaptation for ad-hoc Agent Coordination","date":"2022-03-08","arxiv_id":"2203.08015","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-cooperation-strategy-generation-in","title":"Efficient Policy Generation in Multi-Agent Systems via Hypergraph Neural Network","date":"2022-03-07","arxiv_id":"2203.03265","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning-1","title":"Scalable multi-agent reinforcement learning for distributed control of residential energy flexibility","date":"2022-03-07","arxiv_id":"2203.03417","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-reasoning-graph-for-multi-agent","title":"Recursive Reasoning Graph for Multi-Agent Reinforcement Learning","date":"2022-03-06","arxiv_id":"2203.02844","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilateral-deep-reinforcement-learning","title":"Bilateral Deep Reinforcement Learning Approach for Better-than-human Car Following Model","date":"2022-03-03","arxiv_id":"2203.04749","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-graph-theoretic-distributed","title":"Distributed Multi-Agent Reinforcement Learning Based on Graph-Induced Local Value Functions","date":"2022-02-26","arxiv_id":"2202.13046","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-decentralized-communication-framework-based","title":"A Decentralized Communication Framework based on Dual-Level Recurrence for Multi-Agent Reinforcement Learning","date":"2022-02-22","arxiv_id":"2202.10612","repositories_listed":0,"syntology":null},{"url":null,"slug":"pool-pheromone-inspired-communication","title":"PooL: Pheromone-inspired Communication Framework forLarge Scale Multi-Agent Reinforcement Learning","date":"2022-02-20","arxiv_id":"2202.09722","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-efficient-actor-critic-methods-1","title":"Communication-Efficient Actor-Critic Methods for Homogeneous Markov Games","date":"2022-02-18","arxiv_id":"2202.09422","repositories_listed":0,"syntology":null},{"url":null,"slug":"motivating-physical-activity-via-competitive","title":"Motivating Physical Activity via Competitive Human-Robot Interaction","date":"2022-02-14","arxiv_id":"2202.07068","repositories_listed":0,"syntology":null},{"url":null,"slug":"dda3c-cooperative-distributed-deep","title":"Group-Agent Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.05135","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-value-decomposition-algorithms","title":"Understanding Value Decomposition Algorithms in Deep Cooperative Multi-Agent Reinforcement Learning","date":"2022-02-10","arxiv_id":"2202.04868","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-policy-gradient-for-large-scale","title":"Independent Policy Gradient for Large-Scale Markov Potential Games: Sharper Rates, Function Approximation, and Game-Agnostic Convergence","date":"2022-02-08","arxiv_id":"2202.04129","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-cooperative-marl-a","title":"Attacking c-MARL More Effectively: A Data Driven Approach","date":"2022-02-07","arxiv_id":"2202.03558","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-in-cooperative-multi-agent","title":"Generalization in Cooperative Multi-Agent Systems","date":"2022-01-31","arxiv_id":"2202.00104","repositories_listed":0,"syntology":null},{"url":null,"slug":"monotonic-improvement-guarantees-under-non-1","title":"Trust Region Bounds for Decentralized PPO Under Non-stationarity","date":"2022-01-31","arxiv_id":"2202.00082","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-cooperative-load-balancing-in-data","title":"Multi-Agent Reinforcement Learning for Network Load Balancing in Data Center","date":"2022-01-27","arxiv_id":"2201.11727","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-semantic-epsilon-greedy","title":"Exploiting Semantic Epsilon Greedy Exploration Strategy in Multi-Agent Reinforcement Learning","date":"2022-01-26","arxiv_id":"2201.10803","repositories_listed":0,"syntology":null},{"url":null,"slug":"probe-based-interventions-for-modifying-agent","title":"Probe-Based Interventions for Modifying Agent Behavior","date":"2022-01-26","arxiv_id":"2201.12938","repositories_listed":0,"syntology":null},{"url":null,"slug":"anytime-optimal-psro-for-two-player-zero-sum","title":"Anytime PSRO for Two-Player Zero-Sum Games","date":"2022-01-19","arxiv_id":"2201.07700","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-enforcers-consistent-sparse-discrete","title":"Interpretable Learned Emergent Communication for Human-Agent Teams","date":"2022-01-19","arxiv_id":"2201.07452","repositories_listed":0,"syntology":null},{"url":null,"slug":"implementations-that-matter-in-cooperative","title":"Implementations that Matter in Cooperative Multi-Agent Reinforcement Learning","date":"2022-01-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-cooperative-multi-agent","title":"Distributed Cooperative Multi-Agent Reinforcement Learning with Directed Coordination Graph","date":"2022-01-10","arxiv_id":"2201.04962","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-offline-two-player-zero-sum-markov","title":"When is Offline Two-Player Zero-Sum Markov Game Solvable?","date":"2022-01-10","arxiv_id":"2201.03522","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-agent-reinforcement-learning-approach-1","title":"A Multi-agent Reinforcement Learning Approach for Efficient Client Selection in Federated Learning","date":"2022-01-09","arxiv_id":"2201.02932","repositories_listed":0,"syntology":null},{"url":null,"slug":"offsetting-unequal-competition-through-rl","title":"Offsetting Unequal Competition through RL-assisted Incentive Schemes","date":"2022-01-05","arxiv_id":"2201.01450","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-1","title":"Deep Reinforcement Learning, a textbook","date":"2022-01-04","arxiv_id":"2201.02135","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deeper-understanding-of-state-based-critics","title":"A Deeper Understanding of State-Based Critics in Multi-Agent Reinforcement Learning","date":"2022-01-03","arxiv_id":"2201.01221","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-general-equilibria-in-many-agent-1","title":"Analyzing Micro-Founded General Equilibrium Models with Many Agents using Deep Reinforcement Learning","date":"2022-01-03","arxiv_id":"2201.01163","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-via","title":"Multi-Agent Reinforcement Learning via Adaptive Kalman Temporal Difference and Successor Representation","date":"2021-12-30","arxiv_id":"2112.15156","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-cooperative-multi-agent-policies","title":"Learning Cooperative Multi-Agent Policies with Partial Reward Decoupling","date":"2021-12-23","arxiv_id":"2112.12740","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-advantage-networks-for-cooperative","title":"Local Advantage Networks for Cooperative Multi-Agent Reinforcement Learning","date":"2021-12-23","arxiv_id":"2112.12458","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-communication-with-graph","title":"CGIBNet: Bandwidth-constrained Communication with Graph Information Bottleneck in Multi-Agent Reinforcement Learning","date":"2021-12-20","arxiv_id":"2112.10374","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-decentralized-q","title":"Finite-Sample Analysis of Decentralized Q-Learning for Stochastic Games","date":"2021-12-15","arxiv_id":"2112.07859","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-vulnerability-discovery-for","title":"Multi-Agent Vulnerability Discovery for Autonomous Driving with Hazard Arbitration Reward","date":"2021-12-12","arxiv_id":"2112.06185","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-attacks-in-multi-agent","title":"Reward-Free Attacks in Multi-Agent Reinforcement Learning","date":"2021-12-02","arxiv_id":"2112.00940","repositories_listed":0,"syntology":null},{"url":null,"slug":"rmix-learning-risk-sensitive-policies","title":"RMIX: Learning Risk-Sensitive Policies forCooperative Reinforcement Learning Agents","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-communication-and-sample-complexities","title":"Taming Communication and Sample Complexities in Decentralized Policy Evaluation for Cooperative Multi-Agent Reinforcement Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"5d9231edf04599df2dd3bf353a8382e770fe142827d9edb7d68741efc99ca077","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}