{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/16","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":16,"pages_in_order":18,"rows_per_page":100,"rows":[1501,1600],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/15","next":"/task/multi-agent-reinforcement-learning/papers/17","papers":[{"url":null,"slug":"federated-lqr-learning-through-sharing","title":"LQR with Tracking: A Zeroth-order Approach and Its Global Convergence","date":"2020-11-03","arxiv_id":"2011.01815","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpreting-graph-drawing-with-multi-agent","title":"Interpreting Graph Drawing with Multi-Agent Reinforcement Learning","date":"2020-11-02","arxiv_id":"2011.00748","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-online-agnostic-learning","title":"Online Learning in Unknown Markov Games","date":"2020-10-28","arxiv_id":"2010.15020","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-information-asymmetry-in-competitive-multi","title":"On Information Asymmetry in Competitive Multi-Agent Reinforcement Learning: Convergence and Optimality","date":"2020-10-21","arxiv_id":"2010.10901","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-in-noma","title":"Multi-Agent Reinforcement Learning in NOMA-aided UAV Networks for Cellular Offloading","date":"2020-10-18","arxiv_id":"2010.09094","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-competitive-reinforcement","title":"Cooperative-Competitive Reinforcement Learning with History-Dependent Rewards","date":"2020-10-15","arxiv_id":"2010.08030","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-the-capabilities-of-connected-and","title":"Leveraging the Capabilities of Connected and Autonomous Vehicles and Multi-Agent Reinforcement Learning to Mitigate Highway Bottleneck Congestion","date":"2020-10-12","arxiv_id":"2010.05436","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-reinforcement","title":"Heterogeneous Multi-Agent Reinforcement Learning for Unknown Environment Mapping","date":"2020-10-06","arxiv_id":"2010.02663","repositories_listed":0,"syntology":null},{"url":null,"slug":"uneven-universal-value-exploration-for-multi-1","title":"UneVEn: Universal Value Exploration for Multi-Agent Reinforcement Learning","date":"2020-10-06","arxiv_id":"2010.02974","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-sharp-analysis-of-model-based-reinforcement-1","title":"A Sharp Analysis of Model-based Reinforcement Learning with Self-Play","date":"2020-10-04","arxiv_id":"2010.01604","repositories_listed":0,"syntology":null},{"url":null,"slug":"correcting-experience-replay-for-multi-agent-1","title":"Correcting Experience Replay for Multi-Agent Communication","date":"2020-10-02","arxiv_id":"2010.01192","repositories_listed":0,"syntology":null},{"url":"/paper/multi-agent-social-reinforcement-learning","slug":"multi-agent-social-reinforcement-learning","title":"Emergent Social Learning via Multi-agent Reinforcement Learning","date":"2020-10-01","arxiv_id":"2010.00581","repositories_listed":0,"syntology":{"n":3,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":1,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 1 unverified","sample_list":"/paper/multi-agent-social-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2010.00581","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2010.00581"}},"official":null}},{"url":null,"slug":"agent-environment-cycle-games","title":"Agent Environment Cycle Games","date":"2020-09-28","arxiv_id":"2009.13051","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-emergence-of-individuality-in-multi-agent-1","title":"The Emergence of Individuality in Multi-Agent Reinforcement Learning","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-heterogeneous-multi-agent","title":"Towards Heterogeneous Multi-Agent Reinforcement Learning with Graph Neural Networks","date":"2020-09-28","arxiv_id":"2009.13161","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-linear-value-1","title":"Towards Understanding Linear Value Decomposition in Cooperative Multi-Agent Q-Learning","date":"2020-09-28","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ultra-dense-low-data-rate-udld-communication","title":"Ultra-dense Low Data Rate (UDLD) Communication in the THz","date":"2020-09-22","arxiv_id":"2009.10674","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-based-reinforcement-learning-for","title":"Lyapunov-Based Reinforcement Learning for Decentralized Multi-Agent Control","date":"2020-09-20","arxiv_id":"2009.09361","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-algorithm","title":"Multi-agent reinforcement learning algorithm to solve a partially-observable multi-agent problem in disaster response","date":"2020-09-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-in-cournot","title":"Multi-Agent Reinforcement Learning in Cournot Games","date":"2020-09-14","arxiv_id":"2009.06224","repositories_listed":0,"syntology":null},{"url":null,"slug":"qr-mix-distributional-value-function","title":"QR-MIX: Distributional Value Function Factorisation for Cooperative Multi-Agent Reinforcement Learning","date":"2020-09-09","arxiv_id":"2009.04197","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-non-stationary-1","title":"Reinforcement Learning in Non-Stationary Discrete-Time Linear-Quadratic Mean-Field Games","date":"2020-09-09","arxiv_id":"2009.04350","repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-layer-band-selection-and-routing-design","title":"Cross-layer Band Selection and Routing Design for Diverse Band-aware DSA Networks","date":"2020-09-08","arxiv_id":"2009.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-reinforcement-learning-algorithm-for","title":"PAC Reinforcement Learning Algorithm for General-Sum Markov Games","date":"2020-09-05","arxiv_id":"2009.02605","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-nash-equilibria-in-zero-sum","title":"Learning Nash Equilibria in Zero-Sum Stochastic Games via Entropy-Regularized Policy Approximation","date":"2020-09-01","arxiv_id":"2009.00162","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-collaborate-in-multi-module","title":"Learning to Collaborate in Multi-Module Recommendation via Multi-Agent Reinforcement Learning without Communication","date":"2020-08-21","arxiv_id":"2008.09369","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-graph","title":"BGC: Multi-Agent Group Belief with Graph Clustering","date":"2020-08-20","arxiv_id":"2008.08808","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-consensus-algorithms","title":"On the Convergence of Consensus Algorithms with Markovian Noise and Gradient Bias","date":"2020-08-18","arxiv_id":"2008.07841","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-reinforcement-learning-based-multi-agent","title":"The reinforcement learning-based multi-agent cooperative approach for the adaptive speed regulation on a metallurgical pickling line","date":"2020-08-16","arxiv_id":"2008.06933","repositories_listed":0,"syntology":null},{"url":null,"slug":"remax-relational-representation-for-multi","title":"REMAX: Relational Representation for Multi-Agent Exploration","date":"2020-08-12","arxiv_id":"2008.05214","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-for-1","title":"Distributed Deep Reinforcement Learning for Functional Split Control in Energy Harvesting Virtualized Small Cells","date":"2020-08-07","arxiv_id":"2008.04105","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-network-based-multi-agent","title":"Deep Q-Network Based Multi-agent Reinforcement Learning with Binary Action Agents","date":"2020-08-06","arxiv_id":"2008.04109","repositories_listed":0,"syntology":null},{"url":null,"slug":"searching-collaborative-agents-for-multi","title":"Searching Collaborative Agents for Multi-plane Localization in 3D Ultrasound","date":"2020-07-30","arxiv_id":"2007.15273","repositories_listed":0,"syntology":null},{"url":null,"slug":"compare-and-select-video-summarization-with","title":"Compare and Select: Video Summarization with Multi-Agent Reinforcement Learning","date":"2020-07-29","arxiv_id":"2007.14552","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-in-1","title":"Multi-agent Reinforcement Learning in Bayesian Stackelberg Markov Games for Adaptive Moving Target Defense","date":"2020-07-20","arxiv_id":"2007.10457","repositories_listed":0,"syntology":null},{"url":null,"slug":"maps-multi-agent-reinforcement-learning-based","title":"MAPS: Multi-agent Reinforcement Learning-based Portfolio Management System","date":"2020-07-10","arxiv_id":"2007.05402","repositories_listed":0,"syntology":null},{"url":null,"slug":"consensus-multi-agent-reinforcement-learning","title":"Consensus Multi-Agent Reinforcement Learning for Volt-VAR Control in Power Distribution Networks","date":"2020-07-06","arxiv_id":"2007.02991","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-deep-reinforcement-learning-for-1","title":"Decentralized Deep Reinforcement Learning for Network Level Traffic Signal Control","date":"2020-07-02","arxiv_id":"2007.03433","repositories_listed":0,"syntology":null},{"url":null,"slug":"r2-b2-recursive-reasoning-based-bayesian","title":"R2-B2: Recursive Reasoning-Based Bayesian Optimization for No-Regret Learning in Games","date":"2020-06-30","arxiv_id":"2006.16679","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-multi-agent-reinforcement-learning-for","title":"Online Multi-agent Reinforcement Learning for Decentralized Inverter-based Volt-VAR Control","date":"2020-06-23","arxiv_id":"2006.12841","repositories_listed":0,"syntology":null},{"url":null,"slug":"qopt-optimistic-value-function","title":"QTRAN++: Improved Value Transformation for Cooperative Multi-Agent Reinforcement Learning","date":"2020-06-22","arxiv_id":"2006.12010","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-curse-of-many-agents-provable","title":"Breaking the Curse of Many Agents: Provable Mean Embedding Q-Iteration for Mean-Field Reinforcement Learning","date":"2020-06-21","arxiv_id":"2006.11917","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement-2","title":"Cooperative Multi-Agent Reinforcement Learning with Partial Observations","date":"2020-06-18","arxiv_id":"2006.10822","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-value-function-approximation-for","title":"Distributed Value Function Approximation for Collaborative Multi-Agent Reinforcement Learning","date":"2020-06-18","arxiv_id":"2006.10443","repositories_listed":0,"syntology":null},{"url":null,"slug":"eco-vehicular-edge-networks-for-connected","title":"Eco-Vehicular Edge Networks for Connected Transportation: A Distributed Multi-Agent Reinforcement Learning Approach","date":"2020-06-17","arxiv_id":"2003.01005","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-evaluation-and-seeking-for-multi-agent","title":"Policy Evaluation and Seeking for Multi-Agent Reinforcement Learning via Best Response","date":"2020-06-17","arxiv_id":"2006.09585","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-4","title":"Multi-Agent Reinforcement Learning for Adaptive User Association in Dynamic mmWave Networks","date":"2020-06-16","arxiv_id":"2006.09066","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-and-multi-agent-collaboration-in-a","title":"Human and Multi-Agent collaboration in a human-MARL teaming framework","date":"2020-06-12","arxiv_id":"2006.07301","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-using-counterfactual","title":"Learning to Communicate Using Counterfactual Reasoning","date":"2020-06-12","arxiv_id":"2006.07200","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-informational-learning-processes","title":"Multi-Agent Informational Learning Processes","date":"2020-06-11","arxiv_id":"2006.06870","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning","title":"Scalable Multi-Agent Reinforcement Learning for Networked Systems with Average Reward","date":"2020-06-11","arxiv_id":"2006.06626","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-in-a","title":"Multi-Agent Reinforcement Learning in a Realistic Limit Order Book Market Simulation","date":"2020-06-10","arxiv_id":"2006.05574","repositories_listed":0,"syntology":null},{"url":null,"slug":"incorporating-pragmatic-reasoning","title":"Incorporating Pragmatic Reasoning Communication into Emergent Language","date":"2020-06-07","arxiv_id":"2006.04109","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-discovery-of-coordination-in-multi","title":"Skill Discovery of Coordination in Multi-agent Reinforcement Learning","date":"2020-06-07","arxiv_id":"2006.04021","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-linear-value","title":"Towards Understanding Cooperative Multi-Agent Q-Learning with Value Factorization","date":"2020-05-31","arxiv_id":"2006.00587","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-augmented-multi-agent-reinforcement","title":"Batch-Augmented Multi-Agent Reinforcement Learning for Efficient Traffic Signal Optimization","date":"2020-05-19","arxiv_id":"2005.09624","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-augmentation-boosting-and","title":"Experience Augmentation: Boosting and Accelerating Off-Policy Multi-Agent Reinforcement Learning","date":"2020-05-19","arxiv_id":"2005.09453","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-turbulence-modeling-by-multi-agent","title":"Automating Turbulence Modeling by Multi-Agent Reinforcement Learning","date":"2020-05-18","arxiv_id":"2005.09023","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-autoregressive-image-captioning-with","title":"Non-Autoregressive Image Captioning with Counterfactuals-Critical Multi-Agent Learning","date":"2020-05-10","arxiv_id":"2005.04690","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-decentralized","title":"Multi-agent Reinforcement Learning for Decentralized Stable Matching","date":"2020-05-03","arxiv_id":"2005.01117","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-expensive-coordination-an-event","title":"Learning Expensive Coordination: An Event-Based Deep RL Approach","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-for-multi-agent","title":"Posterior sampling for multi-agent reinforcement learning: solving extensive games with imperfect information","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intention-propagation-for-multi-agent","title":"Variational Policy Propagation for Multi-agent Reinforcement Learning","date":"2020-04-19","arxiv_id":"2004.08883","repositories_listed":0,"syntology":null},{"url":null,"slug":"macro-action-based-deep-multi-agent","title":"Macro-Action-Based Deep Multi-Agent Reinforcement Learning","date":"2020-04-18","arxiv_id":"2004.08646","repositories_listed":0,"syntology":null},{"url":null,"slug":"f2a2-flexible-fully-decentralized-approximate","title":"F2A2: Flexible Fully-decentralized Approximate Actor-critic for Cooperative Multi-agent Reinforcement Learning","date":"2020-04-17","arxiv_id":"2004.11145","repositories_listed":0,"syntology":null},{"url":null,"slug":"re-conceptualising-the-language-game-paradigm","title":"Re-conceptualising the Language Game Paradigm in the Framework of Multi-Agent Reinforcement Learning","date":"2020-04-09","arxiv_id":"2004.04722","repositories_listed":0,"syntology":null},{"url":null,"slug":"networked-multi-agent-reinforcement-learning","title":"Networked Multi-Agent Reinforcement Learning with Emergent Communication","date":"2020-04-06","arxiv_id":"2004.02780","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-3","title":"Multi-agent Reinforcement Learning for Resource Allocation in IoT networks with Edge Computing","date":"2020-04-05","arxiv_id":"2004.02315","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-ensemble-multi-agent-reinforcement","title":"A Deep Ensemble Multi-Agent Reinforcement Learning Approach for Air Traffic Control","date":"2020-04-03","arxiv_id":"2004.01387","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactual-multi-agent-reinforcement","title":"Counterfactual Multi-Agent Reinforcement Learning with Graph Convolution Communication","date":"2020-04-01","arxiv_id":"2004.00470","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-knowledge-transfer-in-multi-agent","title":"Parallel Knowledge Transfer in Multi-Agent Reinforcement Learning","date":"2020-03-29","arxiv_id":"2003.13085","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-1","title":"Multi-Agent Reinforcement Learning for Problems with Combined Individual and Team Reward","date":"2020-03-24","arxiv_id":"2003.10598","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-variance-minimization-for-learning","title":"Value Variance Minimization for Learning Approximate Equilibrium in Aggregation Systems","date":"2020-03-16","arxiv_id":"2003.07088","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-framework-for-learning-mean-field","title":"A General Framework for Learning Mean-Field Games","date":"2020-03-13","arxiv_id":"2003.06069","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavior-planning-for-connected-autonomous","title":"A Multi-Agent Reinforcement Learning Approach For Safe and Efficient Behavior Planning Of Connected Autonomous Vehicles","date":"2020-03-09","arxiv_id":"2003.04371","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-design-in-cooperative-multi-agent-1","title":"Reward Design in Cooperative Multi-agent Reinforcement Learning for Packet Routing","date":"2020-03-05","arxiv_id":"2003.03433","repositories_listed":0,"syntology":null},{"url":null,"slug":"v2i-connectivity-based-dynamic-queue-jumper","title":"Dynamic Queue-Jump Lane for Emergency Vehicles under Partially Connected Settings: A Multi-Agent Deep Reinforcement Learning Approach","date":"2020-03-02","arxiv_id":"2003.01025","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-resolve-alliance-dilemmas-in-many","title":"Learning to Resolve Alliance Dilemmas in Many-Player Zero-Sum Games","date":"2020-02-27","arxiv_id":"2003.00799","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-as-a","title":"Multi-Agent Reinforcement Learning as a Computational Tool for Language Evolution Research: Historical Context and Future Challenges","date":"2020-02-20","arxiv_id":"2002.08878","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-design-for-driver-repositioning-using","title":"Reward Design for Driver Repositioning Using Multi-Agent Reinforcement Learning","date":"2020-02-17","arxiv_id":"2002.06723","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-vehicle-routing-problems-with-soft-time","title":"Multi-Vehicle Routing Problems with Soft Time Windows: A Multi-Agent Reinforcement Learning Approach","date":"2020-02-13","arxiv_id":"2002.05513","repositories_listed":0,"syntology":null},{"url":null,"slug":"connectivity-driven-communication-in-multi","title":"Learning Multi-Agent Coordination through Connectivity-driven Communication","date":"2020-02-12","arxiv_id":"2002.05233","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-structured-communication-for-multi-1","title":"Learning Structured Communication for Multi-agent Reinforcement Learning","date":"2020-02-11","arxiv_id":"2002.04235","repositories_listed":0,"syntology":null},{"url":null,"slug":"proficiency-aware-multi-agent-actor-critic","title":"Proficiency Constrained Multi-Agent Reinforcement Learning for Environment-Adaptive Multi UAV-UGV Teaming","date":"2020-02-10","arxiv_id":"2002.03910","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-for-mean-field-controls","title":"Mean-Field Controls with Q-learning for Cooperative MARL: Convergence and Complexity Analysis","date":"2020-02-10","arxiv_id":"2002.04131","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-decentralized-learning-in","title":"Regret Bounds for Decentralized Learning in Cooperative Multi-Agent Dynamical Systems","date":"2020-01-27","arxiv_id":"2001.10122","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-solving-cooperative-marl-problems-with-a","title":"On Solving Cooperative MARL Problems with a Few Good Experiences","date":"2020-01-22","arxiv_id":"2001.07993","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithms-in-multi-agent-systems-a-holistic","title":"Algorithms in Multi-Agent Systems: A Holistic Perspective from Reinforcement Learning and Game Theory","date":"2020-01-17","arxiv_id":"2001.06487","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-in-multi-agent-games","title":"Inducing Cooperative behaviour in Sequential-Social dilemmas through Multi-Agent Reinforcement Learning using Status-Quo Loss","date":"2020-01-15","arxiv_id":"2001.05458","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-multi-agent-reinforcement","title":"Model-based Multi-Agent Reinforcement Learning with Cooperative Prioritized Sweeping","date":"2020-01-15","arxiv_id":"2001.07527","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-formation-control-using","title":"Multi-Robot Formation Control Using Reinforcement Learning","date":"2020-01-13","arxiv_id":"2001.04527","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-curse-of-many-agents-provable-1","title":"Breaking the Curse of Many Agents: Provable Mean Embedding $Q$-Iteration for Mean-Field Reinforcement Learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"options-as-responses-grounding-behavioural-1","title":"OPtions as REsponses: Grounding behavioural hierarchies in multi-agent reinforcement learning","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"other-play-for-zero-shot-coordination-1","title":"“Other-Play” for Zero-Shot Coordination","date":"2020-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"individual-specialization-in-multi-task","title":"Individual specialization in multi-task environments with multiagent reinforcement learners","date":"2019-12-29","arxiv_id":"1912.12671","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-in-multi-agent-reinforcement","title":"Fairness in Multi-agent Reinforcement Learning for Stock Trading","date":"2019-12-14","arxiv_id":"2001.00918","repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-actor-critic-converges-globally-for","title":"Natural Actor-Critic Converges Globally for Hierarchical Linear Quadratic Regulator","date":"2019-12-14","arxiv_id":"1912.06875","repositories_listed":0,"syntology":null},{"url":null,"slug":"biases-for-emergent-communication-in-multi-1","title":"Biases for Emergent Communication in Multi-agent Reinforcement Learning","date":"2019-12-11","arxiv_id":"1912.05676","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement","title":"Decentralized Multi-Agent Reinforcement Learning with Networked Agents: Recent Advances","date":"2019-12-09","arxiv_id":"1912.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-coordination-among-multiple","title":"Intelligent Coordination among Multiple Traffic Intersections Using Multi-Agent Reinforcement Learning","date":"2019-12-09","arxiv_id":"1912.03851","repositories_listed":0,"syntology":null}],"record_sha256":"faf1ef331249ab058f2cc93793a25c81051a9ccf4ec23fad87247c45077f8ea2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}