{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/9","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":9,"pages_in_order":18,"rows_per_page":100,"rows":[801,900],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/8","next":"/task/multi-agent-reinforcement-learning/papers/10","papers":[{"url":null,"slug":"m-rag-reinforcing-large-language-model","title":"M-RAG: Reinforcing Large Language Model Performance through Retrieval-Augmented Generation with Multiple Partitions","date":"2024-05-26","arxiv_id":"2405.16420","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-offline-multi-agent-skill","title":"Variational Offline Multi-agent Skill Discovery","date":"2024-05-26","arxiv_id":"2405.16386","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-finite-time-analysis-of-distributed-q","title":"A finite time analysis of distributed Q-learning","date":"2024-05-23","arxiv_id":"2405.14078","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-8","title":"Multi-Agent Reinforcement Learning with Hierarchical Coordination for Emergency Responder Stationing","date":"2024-05-21","arxiv_id":"2405.13205","repositories_listed":0,"syntology":null},{"url":null,"slug":"llm-based-multi-agent-reinforcement-learning","title":"LLM-based Multi-Agent Reinforcement Learning: Current and Future Directions","date":"2024-05-17","arxiv_id":"2405.11106","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-distributed-fog-load-balancing-with","title":"Fully Distributed Fog Load Balancing with Multi-Agent Reinforcement Learning","date":"2024-05-15","arxiv_id":"2405.12236","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-constrained-multi-agent-reinforcement","title":"Safety Constrained Multi-Agent Reinforcement Learning for Active Voltage Control","date":"2024-05-14","arxiv_id":"2405.08443","repositories_listed":0,"syntology":null},{"url":null,"slug":"powqmix-weighted-value-factorization-with","title":"POWQMIX: Weighted Value Factorization with Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-13","arxiv_id":"2405.08036","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-adaptive-imfs-generalization-of","title":"Towards Adaptive IMFs -- Generalization of utility functions in Multi-Agent Frameworks","date":"2024-05-13","arxiv_id":"2405.07621","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptnet-rethinking-sensing-and-communication","title":"AdaptNet: Rethinking Sensing and Communication for a Seamless Internet of Drones Experience","date":"2024-05-12","arxiv_id":"2405.07318","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-partial-survey-of-decentralized-cooperative","title":"An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-10","arxiv_id":"2405.06161","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-overview-of-machine-learning-enabled-1","title":"An Overview of Machine Learning-Enabled Optimization for Reconfigurable Intelligent Surfaces-Aided 6G Networks: From Reinforcement Learning to Large Language Models","date":"2024-05-09","arxiv_id":"2405.17439","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-rl-based-industrial-aigc-service","title":"Multi-Agent RL-Based Industrial AIGC Service Offloading over Wireless Edge Networks","date":"2024-05-05","arxiv_id":"2405.02972","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-convergence-of-independent-natural","title":"Linear Convergence of Independent Natural Policy Gradient in Games with Entropy Regularization","date":"2024-05-04","arxiv_id":"2405.02769","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-equilibrium-bias-in-risk-sensitive","title":"Taming Equilibrium Bias in Risk-Sensitive Multi-Agent Reinforcement Learning","date":"2024-05-04","arxiv_id":"2405.02724","repositories_listed":0,"syntology":null},{"url":null,"slug":"socialgfs-learning-social-gradient-fields-for","title":"SocialGFs: Learning Social Gradient Fields for Multi-Agent Reinforcement Learning","date":"2024-05-03","arxiv_id":"2405.01839","repositories_listed":0,"syntology":null},{"url":null,"slug":"mesa-cooperative-meta-exploration-in-multi","title":"MESA: Cooperative Meta-Exploration in Multi-Agent Learning through Exploiting State-Action Space Structure","date":"2024-05-01","arxiv_id":"2405.00902","repositories_listed":0,"syntology":null},{"url":null,"slug":"mf-oml-online-mean-field-reinforcement","title":"MF-OML: Online Mean-Field Reinforcement Learning with Occupation Measures for Large Population Games","date":"2024-05-01","arxiv_id":"2405.00282","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-information-directed","title":"Provably Efficient Information-Directed Sampling Algorithms for Multi-Agent Reinforcement Learning","date":"2024-04-30","arxiv_id":"2404.19292","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-robust-multi-agent","title":"Sample-Efficient Robust Multi-Agent Reinforcement Learning in the Face of Environmental Uncertainty","date":"2024-04-29","arxiv_id":"2404.18909","repositories_listed":0,"syntology":null},{"url":null,"slug":"verco-learning-coordinated-verbal","title":"Verco: Learning Coordinated Verbal Communication for Multi-agent Reinforcement Learning","date":"2024-04-27","arxiv_id":"2404.17780","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-energy-1","title":"Multi-Agent Reinforcement Learning for Energy Networks: Computational Challenges, Progress and Open Problems","date":"2024-04-24","arxiv_id":"2404.15583","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-black-box-model-inversion","title":"Distributional Black-Box Model Inversion Attack with Multi-Agent Reinforcement Learning","date":"2024-04-22","arxiv_id":"2404.13860","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-hybrid-sac-for-joint-ss-dsa-in","title":"Multi-Agent Hybrid SAC for Joint SS-DSA in CRNs","date":"2024-04-22","arxiv_id":"2404.14319","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-redundant-computation-in-multi-agent","title":"Reducing Redundant Computation in Multi-Agent Coordination through Locally Centralized Execution","date":"2024-04-19","arxiv_id":"2404.13096","repositories_listed":0,"syntology":null},{"url":null,"slug":"centralized-vs-decentralized-multi-agent-1","title":"Centralized vs. Decentralized Multi-Agent Reinforcement Learning for Enhanced Control of Electric Vehicle Charging Networks","date":"2024-04-18","arxiv_id":"2404.12520","repositories_listed":0,"syntology":null},{"url":null,"slug":"function-approximation-for-reinforcement","title":"Function Approximation for Reinforcement Learning Controller for Energy from Spread Waves","date":"2024-04-17","arxiv_id":"2404.10991","repositories_listed":0,"syntology":null},{"url":"/paper/randomized-exploration-in-cooperative-multi","slug":"randomized-exploration-in-cooperative-multi","title":"Randomized Exploration in Cooperative Multi-Agent Reinforcement Learning","date":"2024-04-16","arxiv_id":"2404.10728","repositories_listed":0,"syntology":{"n":11,"n_ran":11,"n_constructed":0,"n_ran_checked":11,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":11,"n_pointer_only":0,"phrase":"11 ran (of which 0 constructed an object rather than computing a result; 11 with no instrument failure: 0 honoured, 0 violated, 11 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/randomized-exploration-in-cooperative-multi#ran","syntology_url":"https://syntology.ai/paper/2404.10728","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2404.10728"}},"official":null}},{"url":null,"slug":"higher-replay-ratio-empowers-sample-efficient","title":"Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning","date":"2024-04-15","arxiv_id":"2404.09715","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-reinforcement-learning-1","title":"Differentially Private Reinforcement Learning with Self-Play","date":"2024-04-11","arxiv_id":"2404.07559","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-driven-multi-agent-reinforcement","title":"Attention-Driven Multi-Agent Reinforcement Learning: Enhancing Decisions with Expertise-Informed Tasks","date":"2024-04-08","arxiv_id":"2404.05840","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-reinforcement-2","title":"Heterogeneous Multi-Agent Reinforcement Learning for Zero-Shot Scalable Collaboration","date":"2024-04-05","arxiv_id":"2404.03869","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-learning-strategies-for","title":"Decentralized Learning Strategies for Estimation Error Minimization with Graph Neural Networks","date":"2024-04-04","arxiv_id":"2404.03227","repositories_listed":0,"syntology":null},{"url":null,"slug":"marl-lns-cooperative-multi-agent","title":"MARL-LNS: Cooperative Multi-agent Reinforcement Learning via Large Neighborhoods Search","date":"2024-04-03","arxiv_id":"2404.03101","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-autonomous-swarm-formation-for","title":"Distributed Autonomous Swarm Formation for Dynamic Network Bridging","date":"2024-04-02","arxiv_id":"2404.01557","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergence-of-chemotactic-strategies-with","title":"Emergence of Chemotactic Strategies with Multi-Agent Reinforcement Learning","date":"2024-04-02","arxiv_id":"2404.01999","repositories_listed":0,"syntology":null},{"url":null,"slug":"energaize-multi-agent-deep-deterministic","title":"EnergAIze: Multi Agent Deep Deterministic Policy Gradient for Vehicle to Grid Energy Management","date":"2024-04-02","arxiv_id":"2404.02361","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-7","title":"Safety-Aware Multi-Agent Learning for Dynamic Network Bridging","date":"2024-04-02","arxiv_id":"2404.01551","repositories_listed":0,"syntology":null},{"url":null,"slug":"ma4div-multi-agent-reinforcement-learning-for","title":"MA4DIV: Multi-Agent Reinforcement Learning for Search Result Diversification","date":"2024-03-26","arxiv_id":"2403.17421","repositories_listed":0,"syntology":null},{"url":null,"slug":"paths-to-equilibrium-in-normal-form-games","title":"Paths to Equilibrium in Games","date":"2024-03-26","arxiv_id":"2403.18079","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-clustering-hierarchical-multi-agent","title":"Self-Clustering Hierarchical Multi-Agent Reinforcement Learning with Extensible Cooperation Graph","date":"2024-03-26","arxiv_id":"2403.18056","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-transformer-accelerated-rl-for","title":"Multi-agent transformer-accelerated RL for satisfaction of STL specifications","date":"2024-03-23","arxiv_id":"2403.15916","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-and-communication-efficient-fully","title":"Sample and Communication Efficient Fully Decentralized MARL Policy Evaluation via a New Approach: Local TD update","date":"2024-03-23","arxiv_id":"2403.15935","repositories_listed":0,"syntology":null},{"url":null,"slug":"carbon-footprint-reduction-for-sustainable","title":"Carbon Footprint Reduction for Sustainable Data Centers in Real-Time","date":"2024-03-21","arxiv_id":"2403.14092","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-communication-and-learning-pressures","title":"Learning and communication pressures in neural networks: Lessons from emergent communication","date":"2024-03-21","arxiv_id":"2403.14427","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scalable-and-parallelizable-digital-twin","title":"Mixed-Reality Digital Twins: Leveraging the Physical and Virtual Worlds for Hybrid Sim2Real Transition of Multi-Agent Reinforcement Learning Policies","date":"2024-03-16","arxiv_id":"2403.10996","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-joint-demonstrations-personalized","title":"Beyond Joint Demonstrations: Personalized Expert Guidance for Efficient Multi-Agent Reinforcement Learning","date":"2024-03-13","arxiv_id":"2403.08936","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-optimization-using-adaptive","title":"Multi-Objective Optimization Using Adaptive Distributed Reinforcement Learning","date":"2024-03-13","arxiv_id":"2403.08879","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategizing-against-q-learners-a-control","title":"Strategizing against Q-learners: A Control-theoretical Approach","date":"2024-03-13","arxiv_id":"2403.08906","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepsafempc-deep-learning-based-model","title":"DeepSafeMPC: Deep Learning-Based Model Predictive Control for Safe Multi-Agent Reinforcement Learning","date":"2024-03-11","arxiv_id":"2403.06397","repositories_listed":0,"syntology":null},{"url":null,"slug":"mathematics-of-multi-agent-learning-systems","title":"Mathematics of multi-agent learning systems at the interface of game theory and artificial intelligence","date":"2024-03-09","arxiv_id":"2403.07017","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-a","title":"Multi-Agent Reinforcement Learning with a Hierarchy of Reward Machines","date":"2024-03-08","arxiv_id":"2403.07005","repositories_listed":0,"syntology":null},{"url":null,"slug":"reaching-consensus-in-cooperative-multi-agent","title":"Reaching Consensus in Cooperative Multi-Agent Reinforcement Learning with Goal Imagination","date":"2024-03-05","arxiv_id":"2403.03172","repositories_listed":0,"syntology":null},{"url":null,"slug":"feint-in-multi-player-games","title":"Feint Behaviors and Strategies: Formalization, Implementation and Evaluation","date":"2024-03-04","arxiv_id":"2403.07932","repositories_listed":0,"syntology":null},{"url":null,"slug":"smaug-a-sliding-multidimensional-task-window","title":"SMAUG: A Sliding Multidimensional Task Window-Based MARL Framework for Adaptive Real-Time Subtask Recognition","date":"2024-03-04","arxiv_id":"2403.01816","repositories_listed":0,"syntology":null},{"url":null,"slug":"imagine-initialize-and-explore-an-effective","title":"Imagine, Initialize, and Explore: An Effective Exploration Method in Multi-Agent Reinforcement Learning","date":"2024-02-28","arxiv_id":"2402.17978","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-robust-volt-var","title":"Reinforcement Learning Based Robust Volt/Var Control in Active Distribution Networks With Imprecisely Known Delay","date":"2024-02-27","arxiv_id":"2402.17268","repositories_listed":0,"syntology":null},{"url":null,"slug":"shapley-value-based-multi-agent-reinforcement","title":"Shapley Value Based Multi-Agent Reinforcement Learning: Theory, Method and Its Application to Energy Network","date":"2024-02-23","arxiv_id":"2402.15324","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-neuro-symbolic-approach-to-multi-agent-rl","title":"A Neuro-Symbolic Approach to Multi-Agent RL for Interpretability and Probabilistic Decision Making","date":"2024-02-21","arxiv_id":"2402.13440","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-model-diverse-driving-behaviors","title":"Learning to Model Diverse Driving Behaviors in Highly Interactive Autonomous Driving Scenarios with Multi-Agent Reinforcement Learning","date":"2024-02-21","arxiv_id":"2402.13481","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-approximation-with-delayed-updates","title":"Stochastic Approximation with Delayed Updates: Finite-Time Rates under Markovian Sampling","date":"2024-02-19","arxiv_id":"2402.11800","repositories_listed":0,"syntology":null},{"url":null,"slug":"sinr-aware-deep-reinforcement-learning-for","title":"SINR-Aware Deep Reinforcement Learning for Distributed Dynamic Channel Allocation in Cognitive Interference Networks","date":"2024-02-17","arxiv_id":"2402.17773","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-multi-agent-transfer-reinforcement","title":"Enabling Multi-Agent Transfer Reinforcement Learning via Scenario Independent Representation","date":"2024-02-13","arxiv_id":"2402.08184","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-scaling-laws-for-learning-in","title":"Understanding Model Selection For Learning In Strategic Environments","date":"2024-02-12","arxiv_id":"2402.07588","repositories_listed":0,"syntology":null},{"url":null,"slug":"refined-sample-complexity-for-markov-games","title":"Refined Sample Complexity for Markov Games with Independent Linear Function Approximation","date":"2024-02-11","arxiv_id":"2402.07082","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-query-suggestion-with-multi-agent","title":"Multimodal Query Suggestion with Multi-Agent Reinforcement Learning from Human Feedback","date":"2024-02-07","arxiv_id":"2402.04867","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-21","title":"Multi-Agent Reinforcement Learning for Offloading Cellular Communications with Cooperating UAVs","date":"2024-02-05","arxiv_id":"2402.02957","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-energy","title":"Multi-agent Reinforcement Learning for Energy Saving in Multi-Cell Massive MIMO Systems","date":"2024-02-05","arxiv_id":"2402.03204","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-with-self-1","title":"Near-Optimal Reinforcement Learning with Self-Play under Adaptivity Constraints","date":"2024-02-02","arxiv_id":"2402.01111","repositories_listed":0,"syntology":null},{"url":null,"slug":"widetilde-o-t-1-convergence-to-coarse","title":"$\\widetilde{O}(T^{-1})$ Convergence to (Coarse) Correlated Equilibria in Full-Information General-Sum Markov Games","date":"2024-02-02","arxiv_id":"2403.07890","repositories_listed":0,"syntology":null},{"url":null,"slug":"closure-discovery-for-coarse-grained-partial","title":"Closure Discovery for Coarse-Grained Partial Differential Equations Using Grid-based Reinforcement Learning","date":"2024-02-01","arxiv_id":"2402.00972","repositories_listed":0,"syntology":null},{"url":null,"slug":"fm3q-factorized-multi-agent-minimax-q","title":"FM3Q: Factorized Multi-Agent MiniMax Q-Learning for Two-Team Zero-Sum Markov Game","date":"2024-02-01","arxiv_id":"2402.00738","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-calibrating-heterogeneous","title":"Learning and Calibrating Heterogeneous Bounded Rational Market Behaviour with Multi-Agent Reinforcement Learning","date":"2024-02-01","arxiv_id":"2402.00787","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-attention-based-reinforcement-learning","title":"Graph Attention-based Reinforcement Learning for Trajectory Design and Resource Assignment in Multi-UAV Assisted Communication","date":"2024-01-31","arxiv_id":"2401.17880","repositories_listed":0,"syntology":null},{"url":null,"slug":"nash-soft-actor-critic-leo-satellite-handover","title":"Nash Soft Actor-Critic LEO Satellite Handover Management Algorithm for Flying Vehicles","date":"2024-01-31","arxiv_id":"2402.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-vehicle-patrolling-through-deep","title":"Autonomous Vehicle Patrolling Through Deep Reinforcement Learning: Learning to Communicate and Cooperate","date":"2024-01-28","arxiv_id":"2402.10222","repositories_listed":0,"syntology":null},{"url":null,"slug":"networked-multiagent-reinforcement-learning","title":"Peer-to-Peer Energy Trading of Solar and Energy Storage: A Networked Multiagent Reinforcement Learning Approach","date":"2024-01-25","arxiv_id":"2401.13947","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-diagnostics-for-robustness-via","title":"Multi-Agent Diagnostics for Robustness via Illuminated Diversity","date":"2024-01-24","arxiv_id":"2401.13460","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-communication-protocol-learning-for","title":"Emergent Communication Protocol Learning for Task Offloading in Industrial Internet of Things","date":"2024-01-23","arxiv_id":"2401.12914","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-mean-field-games-on-sparse-graphs-a","title":"Learning Mean Field Games on Sparse Graphs: A Hybrid Graphex Approach","date":"2024-01-23","arxiv_id":"2401.12686","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-generative-adversarial","title":"Multi-Agent Generative Adversarial Interactive Self-Imitation Learning for AUV Formation Control and Obstacle Avoidance","date":"2024-01-21","arxiv_id":"2401.11378","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-20","title":"Multi-Agent Reinforcement Learning for Maritime Operational Technology Cyber Security","date":"2024-01-18","arxiv_id":"2401.10149","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-synergy-between-optimal-transport-theory","title":"The Synergy Between Optimal Transport Theory and Multi-Agent Reinforcement Learning","date":"2024-01-18","arxiv_id":"2401.10949","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentmixer-multi-agent-correlated-policy","title":"AgentMixer: Multi-Agent Correlated Policy Factorization","date":"2024-01-16","arxiv_id":"2401.08728","repositories_listed":0,"syntology":null},{"url":null,"slug":"revalued-regularised-ensemble-value","title":"REValueD: Regularised Ensemble Value-Decomposition for Factorisable Markov Decision Processes","date":"2024-01-16","arxiv_id":"2401.08850","repositories_listed":0,"syntology":null},{"url":null,"slug":"unex-rl-reinforcing-long-term-rewards-in","title":"UNEX-RL: Reinforcing Long-Term Rewards in Multi-Stage Recommender Systems with UNidirectional EXecution","date":"2024-01-12","arxiv_id":"2401.06470","repositories_listed":0,"syntology":null},{"url":null,"slug":"fully-decentralized-cooperative-multi-agent","title":"Fully Decentralized Cooperative Multi-Agent Reinforcement Learning: A Survey","date":"2024-01-10","arxiv_id":"2401.04934","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tensor-network-implementation-of-multi","title":"A Tensor Network Implementation of Multi Agent Reinforcement Learning","date":"2024-01-08","arxiv_id":"2401.03896","repositories_listed":0,"syntology":null},{"url":null,"slug":"clustercomm-discrete-communication-in","title":"ClusterComm: Discrete Communication in Decentralized MARL using Internal Representation Clustering","date":"2024-01-07","arxiv_id":"2401.03504","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-hidden-structures-in-non-convex-1","title":"Exploiting hidden structures in non-convex games for convergence to Nash equilibrium","date":"2023-12-27","arxiv_id":"2312.16609","repositories_listed":0,"syntology":null},{"url":null,"slug":"carss-cooperative-attention-guided","title":"CARSS: Cooperative Attention-guided Reinforcement Subpath Synthesis for Solving Traveling Salesman Problem","date":"2023-12-24","arxiv_id":"2312.15412","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-routing-for-integrated-satellite","title":"Dynamic Routing for Integrated Satellite-Terrestrial Networks: A Constrained Multi-Agent Reinforcement Learning Approach","date":"2023-12-23","arxiv_id":"2401.09455","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-multi-agent-reinforcement-1","title":"Multi-Agent Reinforcement Learning for Assessing False-Data Injection Attacks on Transportation Networks","date":"2023-12-22","arxiv_id":"2312.14625","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-mean-field-load-balancing-in-large","title":"Sparse Mean Field Load Balancing in Large Localized Queueing Systems","date":"2023-12-20","arxiv_id":"2312.12973","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-cooperation-in-multi","title":"Curriculum Learning for Cooperation in Multi-Agent Reinforcement Learning","date":"2023-12-19","arxiv_id":"2312.11768","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-communicative-multi-agent","title":"Robust Communicative Multi-Agent Reinforcement Learning with Active Defense","date":"2023-12-16","arxiv_id":"2312.11545","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-a-1","title":"Multi-agent Reinforcement Learning: A Comprehensive Survey","date":"2023-12-15","arxiv_id":"2312.10256","repositories_listed":0,"syntology":null},{"url":null,"slug":"situation-dependent-causal-influence-based","title":"Situation-Dependent Causal Influence-Based Cooperative Multi-agent Reinforcement Learning","date":"2023-12-15","arxiv_id":"2312.09539","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-parameter-sharing-for-multi-agent","title":"Adaptive parameter sharing for multi-agent reinforcement learning","date":"2023-12-14","arxiv_id":"2312.09009","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-quantifying-individual-agent","title":"Efficiently Quantifying Individual Agent Importance in Cooperative MARL","date":"2023-12-13","arxiv_id":"2312.08466","repositories_listed":0,"syntology":null}],"record_sha256":"5c172b48646e4b0c82a7c524ed9a77c6b869edf488c223dff47fe774cb5ee54f","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}