{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/14","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":14,"pages_in_order":18,"rows_per_page":100,"rows":[1301,1400],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/13","next":"/task/multi-agent-reinforcement-learning/papers/15","papers":[{"url":null,"slug":"the-power-of-communication-in-a-distributed","title":"The Power of Communication in a Distributed Multi-Agent System","date":"2021-11-30","arxiv_id":"2111.15611","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-uav-conflict-resolution-with-graph","title":"Multi-UAV Conflict Resolution with Graph Convolutional Reinforcement Learning","date":"2021-11-29","arxiv_id":"2111.14598","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-generalization-and-transfer","title":"Evaluating Generalization and Transfer Capacity of Multi-Agent Reinforcement Learning Across Variable Number of Agents","date":"2021-11-28","arxiv_id":"2111.14177","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-policy-gradient-with-variance","title":"Distributed Policy Gradient with Variance Reduction in Multi-Agent Reinforcement Learning","date":"2021-11-25","arxiv_id":"2111.12961","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-world-challenges-for-reinforcement","title":"Real-world challenges for multi-agent reinforcement learning in grid-interactive buildings","date":"2021-11-25","arxiv_id":"2112.06127","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-multi-agent-reinforcement","title":"Application of Multi-Agent Reinforcement Learning for Battery Management in Renewable Mini-Grids","date":"2021-11-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fixed-points-in-cyber-space-rethinking","title":"Fixed Points in Cyber Space: Rethinking Optimal Evasion Attacks in the Age of AI-NIDS","date":"2021-11-23","arxiv_id":"2111.12197","repositories_listed":0,"syntology":null},{"url":null,"slug":"renewable-energy-integration-and-microgrid","title":"Renewable energy integration and microgrid energy trading using multi-agent deep reinforcement learning","date":"2021-11-21","arxiv_id":"2111.10898","repositories_listed":0,"syntology":null},{"url":null,"slug":"calculus-of-consent-via-marl-legitimating-the","title":"Calculus of Consent via MARL: Legitimating the Collaborative Governance Supplying Public Goods","date":"2021-11-20","arxiv_id":"2111.10627","repositories_listed":0,"syntology":null},{"url":null,"slug":"polymatrix-competitive-gradient-descent","title":"Polymatrix Competitive Gradient Descent","date":"2021-11-16","arxiv_id":"2111.08565","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-medical-image-segmentation-with","title":"Interactive Medical Image Segmentation with Self-Adaptive Confidence Calibration","date":"2021-11-15","arxiv_id":"2111.07716","repositories_listed":0,"syntology":null},{"url":null,"slug":"relative-distributed-formation-and-obstacle","title":"Relative Distributed Formation and Obstacle Avoidance with Multi-agent Reinforcement Learning","date":"2021-11-14","arxiv_id":"2111.07334","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-multi-agent-reinforcement-learning","title":"Causal Multi-Agent Reinforcement Learning: Review and Open Problems","date":"2021-11-12","arxiv_id":"2111.06721","repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-resilience-in-multi-agent","title":"Collaboration Promotes Group Resilience in Multi-Agent AI","date":"2021-11-12","arxiv_id":"2111.06614","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-8","title":"Multi-agent Reinforcement Learning for Cooperative Lane Changing of Connected and Autonomous Vehicles in Mixed Traffic","date":"2021-11-11","arxiv_id":"2111.06318","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-based-radio-resource-management-and-1","title":"Multi Agent Reinforcement Learning Trajectory Design and Two-Stage Resource Management in CoMP UAV VLC Networks","date":"2021-11-06","arxiv_id":"2111.05116","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-to-speak-and-hear-through-1","title":"Towards Learning to Speak and Hear Through Multi-Agent Communication over a Continuous Acoustic Channel","date":"2021-11-04","arxiv_id":"2111.02827","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-supervised-learning-based-hour-ahead-demand","title":"A Supervised-Learning based Hour-Ahead Demand Response of a Behavior-based HEMS approximating MILP Optimization","date":"2021-11-03","arxiv_id":"2111.01978","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-dynamic-bus-control-a-distributional","title":"Robust Dynamic Bus Control: A Distributional Multi-agent Reinforcement Learning Approach","date":"2021-11-02","arxiv_id":"2111.01946","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-collaborative-multi-agent-reinforcement-1","title":"A Collaborative Multi-agent Reinforcement Learning Framework for Dialog Action Decomposition","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-reinforcement","title":"Decentralized Cooperative Reinforcement Learning with Hierarchical Information Structure","date":"2021-11-01","arxiv_id":"2111.00781","repositories_listed":0,"syntology":null},{"url":null,"slug":"feedback-attribution-for-counterfactual","title":"Feedback Attribution for Counterfactual Bandit Learning in Multi-Domain Spoken Language Understanding","date":"2021-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement-3","title":"Decentralized Multi-Agent Reinforcement Learning: An Off-Policy Method","date":"2021-10-31","arxiv_id":"2111.00438","repositories_listed":0,"syntology":null},{"url":null,"slug":"crowd-sensing-enhanced-parking-patrol-using","title":"Crowd-sensing Enhanced Parking Patrol using Trajectories of Sharing Bikes","date":"2021-10-29","arxiv_id":"2110.15557","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-with-reinforcement","title":"Learning to Communicate with Reinforcement Learning for an Adaptive Traffic Control System","date":"2021-10-29","arxiv_id":"2110.15779","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixed-cooperative-competitive-communication","title":"Mixed Cooperative-Competitive Communication Using Multi-Agent Reinforcement Learning","date":"2021-10-29","arxiv_id":"2110.15762","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-law-of-iterated-logarithm-for-multi-agent","title":"A Law of Iterated Logarithm for Multi-Agent Reinforcement Learning","date":"2021-10-27","arxiv_id":"2110.15092","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-reinforcement-1","title":"Model based Multi-agent Reinforcement Learning with Tensor Decompositions","date":"2021-10-27","arxiv_id":"2110.14524","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-factored-action","title":"Reinforcement Learning in Factored Action Spaces using Tensor Decompositions","date":"2021-10-27","arxiv_id":"2110.14538","repositories_listed":0,"syntology":null},{"url":null,"slug":"applications-of-multi-agent-reinforcement","title":"Applications of Multi-Agent Reinforcement Learning in Future Internet: A Comprehensive Survey","date":"2021-10-26","arxiv_id":"2110.13484","repositories_listed":0,"syntology":null},{"url":null,"slug":"common-information-based-approximate-state","title":"Common Information based Approximate State Representations in Multi-Agent Reinforcement Learning","date":"2021-10-25","arxiv_id":"2110.12603","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-rates-of-average-reward-multi","title":"Convergence Rates of Average-Reward Multi-agent Reinforcement Learning via Randomized Linear Programming","date":"2021-10-22","arxiv_id":"2110.12929","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-4","title":"Model-based Reinforcement Learning for Service Mesh Fault Resiliency in a Web Application-level","date":"2021-10-21","arxiv_id":"2110.13621","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-discrimination-in-learning-agents","title":"Statistical discrimination in learning agents","date":"2021-10-21","arxiv_id":"2110.11404","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-natural-policy-gradient-always","title":"Independent Natural Policy Gradient Always Converges in Markov Potential Games","date":"2021-10-20","arxiv_id":"2110.10614","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-cooperation-by-balancing-exploration","title":"Improved cooperation by balancing exploration and exploitation in intertemporal social dilemma tasks","date":"2021-10-19","arxiv_id":"2111.09152","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-based-episodic-memory-for-multi-agent","title":"State-based Episodic Memory for Multi-Agent Reinforcement Learning","date":"2021-10-19","arxiv_id":"2110.09817","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-advantage-actor-critic-for-robust-multi","title":"Local Advantage Actor-Critic for Robust Multi-Agent Deep Reinforcement Learning","date":"2021-10-16","arxiv_id":"2110.08642","repositories_listed":0,"syntology":null},{"url":null,"slug":"containerized-distributed-value-based-multi-1","title":"Containerized Distributed Value-Based Multi-Agent Reinforcement Learning","date":"2021-10-15","arxiv_id":"2110.08169","repositories_listed":0,"syntology":null},{"url":null,"slug":"edgeml-towards-network-accelerated-federated","title":"EdgeML: Towards Network-Accelerated Federated Learning over Wireless Edge","date":"2021-10-14","arxiv_id":"2111.09410","repositories_listed":0,"syntology":null},{"url":null,"slug":"haven-hierarchical-cooperative-multi-agent","title":"HAVEN: Hierarchical Cooperative Multi-Agent Reinforcement Learning with Dual Coordination Mechanism","date":"2021-10-14","arxiv_id":"2110.07246","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-multi-agent-reinforcement","title":"Provably Efficient Multi-Agent Reinforcement Learning with Fully Decentralized Communication","date":"2021-10-14","arxiv_id":"2110.07392","repositories_listed":0,"syntology":null},{"url":null,"slug":"calculus-of-consent-via-marl-legitimating-the-1","title":"Calculus of Consent via MARL: Legitimating the Collaborative Governance Supplying Public Goods","date":"2021-10-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-multi-agent-1","title":"On Improving Model-Free Algorithms for Decentralized Multi-Agent Reinforcement Learning","date":"2021-10-12","arxiv_id":"2110.05707","repositories_listed":0,"syntology":null},{"url":null,"slug":"gridlearn-multiagent-reinforcement-learning","title":"GridLearn: Multiagent Reinforcement Learning for Grid-Aware Building Energy Management","date":"2021-10-12","arxiv_id":"2110.06396","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reinforcement-learning-in","title":"Provably Efficient Reinforcement Learning in Decentralized General-Sum Markov Games","date":"2021-10-12","arxiv_id":"2110.05682","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-coordinate-in-multi-agent-systems-1","title":"Learning to Coordinate in Multi-Agent Systems: A Coordinated Actor-Critic Algorithm and Finite-Time Guarantees","date":"2021-10-11","arxiv_id":"2110.05597","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-independent-learning-algorithm-for-a-class","title":"Satisficing Paths and Independent Multi-Agent Reinforcement Learning in Stochastic Games","date":"2021-10-09","arxiv_id":"2110.04638","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-can-we-learn-general-sum-markov-games","title":"When Can We Learn General-Sum Markov Games with a Large Number of Players Sample-Efficiently?","date":"2021-10-08","arxiv_id":"2110.04184","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-actor-critic-for","title":"Scalable Multi-Agent Reinforcement Learning for Residential Load Scheduling under Data Governance","date":"2021-10-06","arxiv_id":"2110.02784","repositories_listed":0,"syntology":null},{"url":null,"slug":"divergence-regularized-multi-agent-actor","title":"Divergence-Regularized Multi-Agent Actor-Critic","date":"2021-10-01","arxiv_id":"2110.00304","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-reinforcement-learning-for","title":"Coordinated Reinforcement Learning for Optimizing Mobile Networks","date":"2021-09-30","arxiv_id":"2109.15175","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-graph-based-multi-agent","title":"Decentralized Graph-Based Multi-Agent Reinforcement Learning Using Reward Machines","date":"2021-09-30","arxiv_id":"2110.00096","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-interactions-of-autonomous-vehicles","title":"Modeling Interactions of Autonomous Vehicles and Pedestrians with Deep Multi-Agent Reinforcement Learning for Collision Avoidance","date":"2021-09-30","arxiv_id":"2109.15266","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-principled-permutation-invariant-approach","title":"A Principled Permutation Invariant Approach to Mean-Field Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-attacks-against-federated","title":"Coordinated Attacks Against Federated Learning: A Multi-Agent Reinforcement Learning Approach","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-multi-agent","title":"Decentralized Cooperative Multi-Agent Reinforcement Learning with Exploration","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":"/paper/disentangling-sources-of-risk-for","slug":"disentangling-sources-of-risk-for","title":"Disentangling Sources of Risk for Distributional Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dsdf-coordinated-look-ahead-strategy-in","title":"DSDF: Coordinated look-ahead strategy in stochastic multi-agent reinforcement learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-cooperative-marl","title":"Evaluating Robustness of Cooperative MARL","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-convergence-and-sample-complexity","title":"Finite-Time Convergence and Sample Complexity of Multi-Agent Actor-Critic Reinforcement Learning with Average Reward","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-based-value-representation-for","title":"Greedy-based Value Representation for Efficient Coordination in Multi-agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ia-marl-imputation-assisted-multi-agent","title":"IA-MARL: Imputation Assisted Multi-Agent Reinforcement Learning for Missing Training Data","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"information-bottleneck-based-behavior","title":"Information-Bottleneck-Based Behavior Representation Learning for Multi-agent Reinforcement learning","date":"2021-09-29","arxiv_id":"2109.14188","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-homophilic-incentives-in-sequential","title":"Learning Homophilic Incentives in Sequential Social Dilemmas","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"lpmarl-linear-programming-based-implicit-task","title":"LPMARL: Linear Programming based Implicit Task Assigment for Hiearchical Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"marnet-backdoor-attacks-against-value","title":"MARNET: Backdoor Attacks against Value-Decomposition Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-2","title":"Multi-Agent Reinforcement Learning with Shared Resource in Inventory Management","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-pre-trained-multi-agent-decision","title":"Offline Pre-trained Multi-Agent Decision Transformer","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"online-tuning-for-offline-decentralized-multi","title":"Online Tuning for Offline Decentralized Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-monotonicity-constraint-in","title":"Revisiting the Monotonicity Constraint in Cooperative Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"role-diversity-matters-a-study-of-cooperative","title":"Role Diversity Matters: A Study of Cooperative Training Strategies for Multi-Agent RL","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-communication-in-multi-agent","title":"Sequential Communication in Multi-Agent Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"surprise-minimizing-multi-agent-learning-with","title":"Surprise Minimizing Multi-Agent Learning with Energy-based Models","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"linda-multi-agent-local-information","title":"LINDA: Multi-Agent Local Information Decomposition for Awareness of Teammates","date":"2021-09-26","arxiv_id":"2109.12508","repositories_listed":0,"syntology":null},{"url":null,"slug":"dimension-free-rates-for-natural-policy","title":"Dimension-Free Rates for Natural Policy Gradient in Multi-Agent Reinforcement Learning","date":"2021-09-23","arxiv_id":"2109.11692","repositories_listed":0,"syntology":null},{"url":null,"slug":"locality-matters-a-scalable-value","title":"Locality Matters: A Scalable Value Decomposition Approach for Cooperative Multi-Agent Reinforcement Learning","date":"2021-09-22","arxiv_id":"2109.10632","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-multi-agent-reinforcement-learning-1","title":"Towards Multi-Agent Reinforcement Learning using Quantum Boltzmann Machines","date":"2021-09-22","arxiv_id":"2109.10900","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-unmixing-for-q-learning-in-multi-agent","title":"Greedy UnMixing for Q-Learning in Multi-Agent Reinforcement Learning","date":"2021-09-19","arxiv_id":"2109.09034","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularize-don-t-mix-multi-agent","title":"Regularize! Don't Mix: Multi-Agent Reinforcement Learning without Explicit Centralized Structures","date":"2021-09-19","arxiv_id":"2109.09038","repositories_listed":0,"syntology":null},{"url":null,"slug":"dsdf-an-approach-to-handle-stochastic-agents","title":"DSDF: An approach to handle stochastic agents in collaborative multi-agent reinforcement learning","date":"2021-09-14","arxiv_id":"2109.06609","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-deep-reinforcement-learning-a","title":"Exploration in Deep Reinforcement Learning: From Single-Agent to Multiagent Domain","date":"2021-09-14","arxiv_id":"2109.06668","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-approximation-of-cooperative","title":"On the Approximation of Cooperative Heterogeneous Multi-Agent Reinforcement Learning (MARL) using Mean Field Control (MFC)","date":"2021-09-09","arxiv_id":"2109.04024","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-complexity-of-computing-markov-perfect","title":"On the Complexity of Computing Markov Perfect Equilibrium in General-Sum Stochastic Games","date":"2021-09-04","arxiv_id":"2109.01795","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-natural-actor-critic","title":"Multi-agent Natural Actor-critic Reinforcement Learning Algorithms","date":"2021-09-03","arxiv_id":"2109.01654","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-meta-representations-for-agents-in","title":"Learning Meta Representations for Agents in Multi-Agent Reinforcement Learning","date":"2021-08-30","arxiv_id":"2108.12988","repositories_listed":0,"syntology":null},{"url":null,"slug":"influence-based-reinforcement-learning-for","title":"Influence-Based Reinforcement Learning for Intrinsically-Motivated Agents","date":"2021-08-28","arxiv_id":"2108.12581","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-emergence-of-wireless-mac-protocols-with","title":"The Emergence of Wireless MAC Protocols with Multi-Agent Reinforcement Learning","date":"2021-08-16","arxiv_id":"2108.07144","repositories_listed":0,"syntology":null},{"url":null,"slug":"mis-spoke-or-mis-lead-achieving-robustness-in","title":"Mis-spoke or mis-lead: Achieving Robustness in Multi-Agent Communicative Reinforcement Learning","date":"2021-08-09","arxiv_id":"2108.03803","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-tracklets-an-object-centric","title":"Semantic Tracklets: An Object-Centric Representation for Visual Multi-Agent Reinforcement Learning","date":"2021-08-06","arxiv_id":"2108.03319","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-multi-agent-reinforcement-learning-1","title":"Mean-Field Multi-Agent Reinforcement Learning: A Decentralized Network Approach","date":"2021-08-05","arxiv_id":"2108.02731","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-decentralized-multi-agent","title":"Offline Decentralized Multi-Agent Reinforcement Learning","date":"2021-08-04","arxiv_id":"2108.01832","repositories_listed":0,"syntology":null},{"url":null,"slug":"flip-learning-erase-to-segment","title":"Flip Learning: Erase to Segment","date":"2021-08-02","arxiv_id":"2108.00752","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-recent-multi-agent-reinforcement","title":"Survey of Recent Multi-Agent Reinforcement Learning Algorithms Utilizing Centralized Training","date":"2021-07-29","arxiv_id":"2107.14316","repositories_listed":0,"syntology":null},{"url":null,"slug":"packet-routing-with-graph-attention-multi","title":"Packet Routing with Graph Attention Multi-agent Reinforcement Learning","date":"2021-07-28","arxiv_id":"2107.13181","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-1","title":"Improved Reinforcement Learning in Cooperative Multi-agent Environments Using Knowledge Transfer","date":"2021-07-20","arxiv_id":"2107.09807","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement-2","title":"Decentralized Multi-Agent Reinforcement Learning for Task Offloading Under Uncertainty","date":"2021-07-16","arxiv_id":"2107.08114","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-evaluation-of-multi-agent","title":"Scalable Evaluation of Multi-Agent Reinforcement Learning with Melting Pot","date":"2021-07-14","arxiv_id":"2107.06857","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-smash-q-learning-based-self-adaptation-of","title":"Q-SMASH: Q-Learning-based Self-Adaptation of Human-Centered Internet of Things","date":"2021-07-13","arxiv_id":"2107.05949","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-in-multi-agent","title":"Transfer Learning in Multi-Agent Reinforcement Learning with Double Q-Networks for Distributed Resource Sharing in V2X Communication","date":"2021-07-13","arxiv_id":"2107.06195","repositories_listed":0,"syntology":null}],"record_sha256":"17dbed3b11eb16750ee0ff63522aa5104967cd362adb6df7da7ddc26de76f063","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}