{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/11","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":11,"pages_in_order":18,"rows_per_page":100,"rows":[1001,1100],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/10","next":"/task/multi-agent-reinforcement-learning/papers/12","papers":[{"url":null,"slug":"hierarchical-task-network-planning-for","title":"Hierarchical Task Network Planning for Facilitating Cooperative Multi-Agent Reinforcement Learning","date":"2023-06-14","arxiv_id":"2306.08359","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-faking-a-nash-equilibrium","title":"Data Poisoning to Fake a Nash Equilibrium in Markov Games","date":"2023-06-13","arxiv_id":"2306.08041","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-learning-nash-policies-in","title":"Provably Learning Nash Policies in Constrained Markov Potential Games","date":"2023-06-13","arxiv_id":"2306.07749","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-black-box-approach-for-non-stationary-multi","title":"A Black-box Approach for Non-stationary Multi-agent Reinforcement Learning","date":"2023-06-12","arxiv_id":"2306.07465","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-guided-by","title":"Multi-Agent Reinforcement Learning Guided by Signal Temporal Logic Specifications","date":"2023-06-11","arxiv_id":"2306.06808","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-testing-for-multi-agent","title":"Robustness Testing for Multi-Agent Reinforcement Learning: State Perturbations on Critical Agents","date":"2023-06-09","arxiv_id":"2306.06136","repositories_listed":0,"syntology":null},{"url":null,"slug":"negotiated-reasoning-on-provably-addressing","title":"Negotiated Reasoning: On Provably Addressing Relative Over-Generalization","date":"2023-06-08","arxiv_id":"2306.05353","repositories_listed":0,"syntology":null},{"url":null,"slug":"inductive-bias-for-emergent-communication-in","title":"Inductive Bias for Emergent Communication in a Continuous Setting","date":"2023-06-06","arxiv_id":"2306.03830","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-generalizability-and-robustness","title":"Improving the generalizability and robustness of large-scale traffic signal control","date":"2023-06-02","arxiv_id":"2306.01925","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-path-planning-combining","title":"Multi-Robot Path Planning Combining Heuristics and Multi-Agent Reinforcement Learning","date":"2023-06-02","arxiv_id":"2306.01270","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-generalized-lagrangian","title":"Provably Efficient Generalized Lagrangian Policy Optimization for Safe Multi-Agent Reinforcement Learning","date":"2023-05-31","arxiv_id":"2306.00212","repositories_listed":0,"syntology":null},{"url":null,"slug":"centralised-rehearsal-of-decentralised","title":"Centralised rehearsal of decentralised cooperation: Multi-agent reinforcement learning for the scalable coordination of residential energy flexibility","date":"2023-05-30","arxiv_id":"2305.18875","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-schema-in-neural-agents","title":"Attention Schema in Neural Agents","date":"2023-05-27","arxiv_id":"2305.17375","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-reward-machines","title":"Reinforcement Learning With Reward Machines in Stochastic Games","date":"2023-05-27","arxiv_id":"2305.17372","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-primal-dual-actor-critic-method-for","title":"Scalable Primal-Dual Actor-Critic Method for Safe Multi-Agent RL with General Utilities","date":"2023-05-27","arxiv_id":"2305.17568","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-solution-to-the-offline-multi","title":"A Model-Based Solution to the Offline Multi-Agent Reinforcement Learning Coordination Problem","date":"2023-05-26","arxiv_id":"2305.17198","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-world-to-solve-social","title":"Understanding the World to Solve Social Dilemmas Using Multi-Agent Reinforcement Learning","date":"2023-05-19","arxiv_id":"2305.11358","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantically-aligned-task-decomposition-in","title":"Semantically Aligned Task Decomposition in Multi-Agent Reinforcement Learning","date":"2023-05-18","arxiv_id":"2305.10865","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-individual-rewards-in-collective","title":"Discovering Individual Rewards in Collective Behavior through Inverse Multi-Agent Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10548","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-methods","title":"Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges","date":"2023-05-17","arxiv_id":"2305.10091","repositories_listed":0,"syntology":null},{"url":null,"slug":"pragmatic-reasoning-in-structured-signaling","title":"Pragmatic Reasoning in Structured Signaling Games","date":"2023-05-17","arxiv_id":"2305.10167","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-multi-agent-reinforcement-learning-for","title":"Toward Multi-Agent Reinforcement Learning for Distributed Event-Triggered Control","date":"2023-05-15","arxiv_id":"2305.08723","repositories_listed":0,"syntology":null},{"url":null,"slug":"stackelberg-decision-transformer-for","title":"Stackelberg Decision Transformer for Asynchronous Action Coordination in Multi-Agent Systems","date":"2023-05-13","arxiv_id":"2305.07856","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-value-decomposition-via-unit-wise","title":"Boosting Value Decomposition via Unit-Wise Attentive State Representation for Cooperative Multi-Agent Reinforcement Learning","date":"2023-05-12","arxiv_id":"2305.07182","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-17","title":"Multi-Agent Reinforcement Learning for Network Routing in Integrated Access Backhaul Networks","date":"2023-05-12","arxiv_id":"2305.16170","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-interference","title":"Deep Reinforcement Learning for Interference Management in UAV-based 3D Networks: Potentials and Challenges","date":"2023-05-11","arxiv_id":"2305.07069","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-of-personality-improved-spiking-actor","title":"Mixture of personality improved Spiking actor network for efficient multi-agent cooperation","date":"2023-05-10","arxiv_id":"2305.05898","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-2","title":"Cooperative Multi-Agent Reinforcement Learning: Asynchronous Communication and Linear Function Approximation","date":"2023-05-10","arxiv_id":"2305.06446","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-algorithm-for-adversary-aware","title":"An Algorithm For Adversary Aware Decentralized Networked MARL","date":"2023-05-09","arxiv_id":"2305.05573","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-robust-multi-agent-learning-by","title":"Communication-Robust Multi-Agent Learning by Adaptable Auxiliary Multi-Agent Adversary Generation","date":"2023-05-09","arxiv_id":"2305.05116","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-continual-coordination-via","title":"Multi-agent Continual Coordination via Progressive Task Contextualization","date":"2023-05-07","arxiv_id":"2305.13937","repositories_listed":0,"syntology":null},{"url":null,"slug":"stackelberg-games-for-learning-emergent","title":"Stackelberg Games for Learning Emergent Behaviors During Competitive Autocurricula","date":"2023-05-04","arxiv_id":"2305.03735","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-machine-co-adaption-interface-via","title":"Human Machine Co-adaption Interface via Cooperation Markov Decision Process System","date":"2023-05-03","arxiv_id":"2305.02058","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-complexity-of-multi-agent-decision","title":"On the Complexity of Multi-Agent Decision Making: From Learning in Games to Partial Monitoring","date":"2023-05-01","arxiv_id":"2305.00684","repositories_listed":0,"syntology":null},{"url":null,"slug":"sea-a-spatially-explicit-architecture-for","title":"SEA: A Spatially Explicit Architecture for Multi-Agent Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12532","repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-stackelberg-equilibrium-through","title":"Inducing Stackelberg Equilibrium through Spatio-Temporal Sequential Decision-Making in Multi-Agent Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10351","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretability-for-conditional-coordinated","title":"Interpretability for Conditional Coordinated Behavior in Multi-Agent Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10375","repositories_listed":0,"syntology":null},{"url":null,"slug":"mastering-asymmetrical-multiplayer-game-with","title":"Mastering Asymmetrical Multiplayer Game with Multi-Agent Asymmetric-Evolution Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10124","repositories_listed":0,"syntology":null},{"url":null,"slug":"sociallight-distributed-cooperation-learning","title":"SocialLight: Distributed Cooperation Learning towards Network-Wide Traffic Signal Control","date":"2023-04-20","arxiv_id":"2305.16145","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-exploration-for-effective-multi-agent-q","title":"Graph Exploration for Effective Multi-agent Q-Learning","date":"2023-04-19","arxiv_id":"2304.09547","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement-6","title":"Cooperative Multi-Agent Reinforcement Learning for Inventory Management","date":"2023-04-18","arxiv_id":"2304.08769","repositories_listed":0,"syntology":null},{"url":null,"slug":"sustainable-aigc-workload-scheduling-of-geo","title":"Sustainable AIGC Workload Scheduling of Geo-Distributed Data Centers: A Multi-Agent Reinforcement Learning Approach","date":"2023-04-17","arxiv_id":"2304.07948","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-dynamic-shielding-for-safe-and","title":"Model-based Dynamic Shielding for Safe and Efficient Multi-Agent Reinforcement Learning","date":"2023-04-13","arxiv_id":"2304.06281","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-level-latent-variable-model-for-sample","title":"MABL: Bi-Level Latent-Variable World Model for Sample-Efficient Multi-Agent Reinforcement Learning","date":"2023-04-12","arxiv_id":"2304.06011","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-and-collaborate-in-a","title":"Learning to Communicate and Collaborate in a Competitive Multi-Agent Setup to Clean the Ocean from Macroplastics","date":"2023-04-12","arxiv_id":"2304.05872","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-policy-reciprocity-with","title":"Multi-agent Policy Reciprocity with Theoretical Guarantee","date":"2023-04-12","arxiv_id":"2304.05632","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-action-anticipation-in-multi-agent","title":"Off-Policy Action Anticipation in Multi-Agent Reinforcement Learning","date":"2023-04-04","arxiv_id":"2304.01447","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularization-of-the-policy-updates-for","title":"Regularization of the policy updates for stabilizing Mean Field Games","date":"2023-04-04","arxiv_id":"2304.01547","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-distributed-multi-agent","title":"Risk-Aware Distributed Multi-Agent Reinforcement Learning","date":"2023-04-04","arxiv_id":"2304.02005","repositories_listed":0,"syntology":null},{"url":null,"slug":"magnneto-a-graph-neural-network-based-multi","title":"MAGNNETO: A Graph Neural Network-based Multi-Agent system for Traffic Engineering","date":"2023-03-31","arxiv_id":"2303.18157","repositories_listed":0,"syntology":null},{"url":null,"slug":"reduce-reuse-recycle-selective-reincarnation","title":"Selective Reincarnation: Offline-to-Online Multi-Agent Reinforcement Learning","date":"2023-03-31","arxiv_id":"2304.00977","repositories_listed":0,"syntology":null},{"url":null,"slug":"deephive-a-multi-agent-reinforcement-learning","title":"DeepHive: A multi-agent reinforcement learning approach for automated discovery of swarm-based optimization policies","date":"2023-03-29","arxiv_id":"2304.04751","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-challenge-of-redundancy-on-multi-agent","title":"The challenge of redundancy on multi-agent value factorisation","date":"2023-03-28","arxiv_id":"2304.00009","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedding-contextual-information-through","title":"Embedding Contextual Information through Reward Shaping in Multi-Agent Learning: A Case Study from Google Football","date":"2023-03-25","arxiv_id":"2303.15471","repositories_listed":0,"syntology":null},{"url":null,"slug":"causality-detection-for-efficient-multi-agent","title":"Causality Detection for Efficient Multi-Agent Reinforcement Learning","date":"2023-03-24","arxiv_id":"2303.14227","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-reward-machines-in-cooperative-multi","title":"Learning Reward Machines in Cooperative Multi-Agent Tasks","date":"2023-03-24","arxiv_id":"2303.14061","repositories_listed":0,"syntology":null},{"url":null,"slug":"hardness-of-independent-learning-and-sparse","title":"Hardness of Independent Learning and Sparse Equilibrium Computation in Markov Games","date":"2023-03-22","arxiv_id":"2303.12287","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-16","title":"Large-Scale Traffic Signal Control Using Constrained Network Partition and Adaptive Deep Reinforcement Learning","date":"2023-03-21","arxiv_id":"2303.11899","repositories_listed":0,"syntology":null},{"url":null,"slug":"boundary-aware-supervoxel-level-iteratively","title":"Boundary-aware Supervoxel-level Iteratively Refined Interactive 3D Image Segmentation with Multi-agent Reinforcement Learning","date":"2023-03-19","arxiv_id":"2303.10692","repositories_listed":0,"syntology":null},{"url":null,"slug":"cheap-talk-discovery-and-utilization-in-multi","title":"Cheap Talk Discovery and Utilization in Multi-Agent Reinforcement Learning","date":"2023-03-19","arxiv_id":"2303.10733","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-via-mean","title":"Major-Minor Mean Field Multi-Agent Reinforcement Learning","date":"2023-03-19","arxiv_id":"2303.10665","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-policy-iteration-algorithm-for","title":"A New Policy Iteration Algorithm For Reinforcement Learning in Zero-Sum Markov Games","date":"2023-03-17","arxiv_id":"2303.09716","repositories_listed":0,"syntology":null},{"url":null,"slug":"svde-scalable-value-decomposition-exploration","title":"SVDE: Scalable Value-Decomposition Exploration for Cooperative Multi-Agent Reinforcement Learning","date":"2023-03-16","arxiv_id":"2303.09058","repositories_listed":0,"syntology":null},{"url":null,"slug":"muti-agent-proximal-policy-optimization-for","title":"Muti-Agent Proximal Policy Optimization For Data Freshness in UAV-assisted Networks","date":"2023-03-15","arxiv_id":"2303.08680","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategic-trading-in-quantitative-markets","title":"Optimizing Trading Strategies in Quantitative Markets using Multi-Agent Reinforcement Learning","date":"2023-03-15","arxiv_id":"2303.11959","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-reinforcement-learning-a-survey","title":"Evolutionary Reinforcement Learning: A Survey","date":"2023-03-07","arxiv_id":"2303.04150","repositories_listed":0,"syntology":null},{"url":null,"slug":"proactive-multi-camera-collaboration-for-3d","title":"Proactive Multi-Camera Collaboration For 3D Human Pose Estimation","date":"2023-03-07","arxiv_id":"2303.03767","repositories_listed":0,"syntology":null},{"url":null,"slug":"maestro-open-ended-environment-design-for","title":"MAESTRO: Open-Ended Environment Design for Multi-Agent Reinforcement Learning","date":"2023-03-06","arxiv_id":"2303.03376","repositories_listed":0,"syntology":null},{"url":null,"slug":"precision-decentralized-constrained-min-max","title":"PRECISION: Decentralized Constrained Min-Max Learning with Low Communication and Sample Complexities","date":"2023-03-05","arxiv_id":"2303.02532","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximating-energy-market-clearing-and","title":"Approximating Energy Market Clearing and Bidding With Model-Based Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01772","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-risk-based-optimistic-exploration-for","title":"Toward Risk-based Optimistic Exploration for Cooperative Multi-Agent Reinforcement Learning","date":"2023-03-03","arxiv_id":"2303.01768","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-learning-meets-6g-a-communication","title":"Distributed Learning Meets 6G: A Communication and Computing Perspective","date":"2023-03-02","arxiv_id":"2303.12802","repositories_listed":0,"syntology":null},{"url":null,"slug":"expert-free-online-transfer-learning-in-multi","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.01170","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-with-network-pruning-for","title":"Parameter Sharing with Network Pruning for Scalable Multi-Agent Deep Reinforcement Learning","date":"2023-03-02","arxiv_id":"2303.00912","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-variational-approach-to-mutual-information","title":"A Variational Approach to Mutual Information-Based Coordination for Multi-Agent Reinforcement Learning","date":"2023-03-01","arxiv_id":"2303.00451","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-guarantees-for-nash-q-learning","title":"Finite-sample Guarantees for Nash Q-learning with Linear Function Approximation","date":"2023-03-01","arxiv_id":"2303.00177","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-15","title":"Multi-Agent Reinforcement Learning for Pragmatic Communication and Control","date":"2023-02-28","arxiv_id":"2302.14399","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-role-of-emergent-communication-for","title":"On the Role of Emergent Communication for Social Learning in Multi-Agent Reinforcement Learning","date":"2023-02-28","arxiv_id":"2302.14276","repositories_listed":0,"syntology":null},{"url":null,"slug":"combating-uncertainties-in-wind-and","title":"Combating Uncertainties in Wind and Distributed PV Energy Sources Using Integrated Reinforcement Learning and Time-Series Forecasting","date":"2023-02-27","arxiv_id":"2302.14094","repositories_listed":0,"syntology":null},{"url":null,"slug":"ac2c-adaptively-controlled-two-hop","title":"AC2C: Adaptively Controlled Two-Hop Communication for Multi-Agent Reinforcement Learning","date":"2023-02-24","arxiv_id":"2302.12515","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-5","title":"Multi-Agent Reinforcement Learning with Common Policy for Antenna Tilt Optimization","date":"2023-02-24","arxiv_id":"2302.12899","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-learning-for-interpretable-multi","title":"Concept Learning for Interpretable Multi-Agent Reinforcement Learning","date":"2023-02-23","arxiv_id":"2302.12232","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-information-marketing-in-the","title":"Semantic Information Marketing in The Metaverse: A Learning-Based Contract Theory Framework","date":"2023-02-22","arxiv_id":"2302.11457","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-driven-exploration-in-sparse-reward","title":"Curiosity-driven Exploration in Sparse-reward Multi-agent Reinforcement Learning","date":"2023-02-21","arxiv_id":"2302.10825","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-arbitrating-in-zero-sum-markov","title":"Differentiable Arbitrating in Zero-sum Markov Games","date":"2023-02-20","arxiv_id":"2302.10058","repositories_listed":0,"syntology":null},{"url":null,"slug":"aiir-mix-multi-agent-reinforcement-learning","title":"AIIR-MIX: Multi-Agent Reinforcement Learning Meets Attention Individual Intrinsic Reward Mixing Network","date":"2023-02-19","arxiv_id":"2302.09531","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-communication-via-self-supervised","title":"Efficient Communication via Self-supervised Information Aggregation for Online and Offline Multi-agent Reinforcement Learning","date":"2023-02-19","arxiv_id":"2302.09605","repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-cooperation-in-multi-agent","title":"Promoting Cooperation in Multi-Agent Reinforcement Learning via Mutual Help","date":"2023-02-18","arxiv_id":"2302.09277","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-multi-agent-controller-for-shared","title":"Learning a Multi-Agent Controller for Shared Energy Storage System","date":"2023-02-16","arxiv_id":"2302.08328","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-incentive-for-cross-silo-federated","title":"Adaptive incentive for cross-silo federated learning: A multi-agent reinforcement learning approach","date":"2023-02-15","arxiv_id":"2302.07493","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning-4","title":"Scalable Multi-Agent Reinforcement Learning with General Utilities","date":"2023-02-15","arxiv_id":"2302.07938","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-attention-multi-agent-fleet-autonomy","title":"Graph Attention Multi-Agent Fleet Autonomy for Advanced Air Mobility","date":"2023-02-14","arxiv_id":"2302.07337","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-curse-of-multiagency-provably","title":"Breaking the Curse of Multiagency: Provably Efficient Decentralized Multi-Agent RL with Function Approximation","date":"2023-02-13","arxiv_id":"2302.06606","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-agent-mixtures-and-the-geometry-of","title":"Universal Agent Mixtures and the Geometry of Intelligence","date":"2023-02-13","arxiv_id":"2302.06083","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-entropy-communication-in-multi-agent","title":"Low Entropy Communication in Multi-Agent Reinforcement Learning","date":"2023-02-10","arxiv_id":"2302.05055","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-multi-agent-actor-critic-networks-for","title":"Quantum Multi-Agent Actor-Critic Networks for Cooperative Mobile Access in Multi-UAV Systems","date":"2023-02-09","arxiv_id":"2302.04445","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-planning-in-combinatorial-action","title":"Efficient Planning in Combinatorial Action Spaces with Applications to Cooperative Multi-Agent Reinforcement Learning","date":"2023-02-08","arxiv_id":"2302.04376","repositories_listed":0,"syntology":null},{"url":null,"slug":"order-book-regulatory-impact-on-stock-market","title":"Order book regulatory impact on stock market quality: a multi-agent reinforcement learning perspective","date":"2023-02-08","arxiv_id":"2302.04184","repositories_listed":0,"syntology":null},{"url":null,"slug":"shared-information-based-safe-and-efficient","title":"Shared Information-Based Safe And Efficient Behavior Planning For Connected Autonomous Vehicles","date":"2023-02-08","arxiv_id":"2302.04321","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-the-curse-of-multiagents-in-a-large","title":"Breaking the Curse of Multiagents in a Large State Space: RL in Markov Games with Independent Linear Function Approximation","date":"2023-02-07","arxiv_id":"2302.03673","repositories_listed":0,"syntology":null}],"record_sha256":"370d26c6370db543b8162db57bf5bbee2d62ce9d156442993f12d2ecd924c5ac","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}