{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/multi-agent-reinforcement-learning/papers/12","list_of":"/task/multi-agent-reinforcement-learning","task":"Multi-agent Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":12,"pages_in_order":18,"rows_per_page":100,"rows":[1101,1200],"of":1718,"counts":{"archive_papers_tagged":1718,"with_a_code_link":522,"where_syntology_ran_a_sample":135,"not_listed_spam_title":0,"listed":1718,"listed_where_code_ran":135,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":119,"every_run_a_failure_of_syntologys_instrument":16,"listed_with_a_run_with_no_instrument_failure":119,"listed_every_run_a_failure_of_syntologys_instrument":16,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/multi-agent-reinforcement-learning","prev":"/task/multi-agent-reinforcement-learning/papers/11","next":"/task/multi-agent-reinforcement-learning/papers/13","papers":[{"url":null,"slug":"ensemble-value-functions-for-efficient","title":"Ensemble Value Functions for Efficient Exploration in Multi-Agent Reinforcement Learning","date":"2023-02-07","arxiv_id":"2302.03439","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-skilled-population-curriculum-for","title":"Towards Skilled Population Curriculum for Multi-Agent Reinforcement Learning","date":"2023-02-07","arxiv_id":"2302.03429","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-learning-in-markov-games-with-general","title":"Offline Learning in Markov Games with General Function Approximation","date":"2023-02-06","arxiv_id":"2302.02571","repositories_listed":0,"syntology":null},{"url":null,"slug":"dual-self-awareness-value-decomposition","title":"Dual Self-Awareness Value Decomposition Framework without Individual Global Max for Cooperative Multi-Agent Reinforcement Learning","date":"2023-02-04","arxiv_id":"2302.02180","repositories_listed":0,"syntology":null},{"url":null,"slug":"best-possible-q-learning","title":"Best Possible Q-Learning","date":"2023-02-02","arxiv_id":"2302.01188","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-roles-with-emergent-social-value","title":"Learning Roles with Emergent Social Value Orientations","date":"2023-01-31","arxiv_id":"2301.13812","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-regret-minimization-in-multi","title":"Communication-Efficient Collaborative Regret Minimization in Multi-Armed Bandits","date":"2023-01-26","arxiv_id":"2301.11442","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-joint-edge-association-and","title":"Privacy-Preserving Joint Edge Association and Power Optimization for the Internet of Vehicles via Federated Multi-Agent Reinforcement Learning","date":"2023-01-26","arxiv_id":"2301.11014","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficient-task-offloading-for-semantic","title":"Resource Optimization for Semantic-Aware Networks with Task Offloading","date":"2023-01-20","arxiv_id":"2301.08376","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-graph-2","title":"Multi-agent Reinforcement Learning with Graph Q-Networks for Antenna Tuning","date":"2023-01-20","arxiv_id":"2302.01199","repositories_listed":0,"syntology":null},{"url":null,"slug":"sok-adversarial-machine-learning-attacks-and","title":"SoK: Adversarial Machine Learning Attacks and Defences in Multi-Agent Reinforcement Learning","date":"2023-01-11","arxiv_id":"2301.04299","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-fast","title":"Multi-Agent Reinforcement Learning for Fast-Timescale Demand Response of Residential Loads","date":"2023-01-06","arxiv_id":"2301.02593","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-communication-for-multi-agent","title":"Scalable Communication for Multi-Agent Reinforcement Learning via Transformer-Based Email Mechanism","date":"2023-01-05","arxiv_id":"2301.01919","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-machine-learning-for-uav-swarms","title":"Distributed Machine Learning for UAV Swarms: Computing, Sensing, and Semantics","date":"2023-01-03","arxiv_id":"2301.00912","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-difference-learning-with-compressed","title":"Temporal Difference Learning with Compressed Updates: Error-Feedback meets Reinforcement Learning","date":"2023-01-03","arxiv_id":"2301.00944","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-traffic-signal-control-by-a-nash","title":"Large-Scale Traffic Signal Control by a Nash Deep Q-network Approach","date":"2023-01-02","arxiv_id":"2301.00637","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-of-image-transmission-in-a","title":"Optimization of Image Transmission in a Cooperative Semantic Communication Networks","date":"2023-01-01","arxiv_id":"2301.00433","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-hybrid-reinforcement-learning","title":"Asynchronous Hybrid Reinforcement Learning for Latency and Reliability Optimization in the Metaverse over Wireless Communications","date":"2022-12-30","arxiv_id":"2212.14749","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-voltage-control-with-peer-to","title":"Decentralized Voltage Control with Peer-to-peer Energy Trading in a Distribution Network","date":"2022-12-29","arxiv_id":"2212.14156","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-individual-policies-in-large-multi","title":"Learning Individual Policies in Large Multi-agent Systems through Local Variance Minimization","date":"2022-12-27","arxiv_id":"2212.13379","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-multi-agent-reinforcement","title":"Coordinated Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Swarms in Autonomous Mobile Access Applications","date":"2022-12-23","arxiv_id":"2304.08493","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversar-adversarial-search-and-rescue-via","title":"AdverSAR: Adversarial Search and Rescue via Multi-Agent Reinforcement Learning","date":"2022-12-20","arxiv_id":"2212.10064","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-approach-to-conflict-free-multi-agent","title":"Bandit approach to conflict-free multi-agent Q-learning in view of photonic implementation","date":"2022-12-20","arxiv_id":"2212.09926","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-patrolling-with-battery","title":"An Energy-aware and Fault-tolerant Deep Reinforcement Learning based approach for Multi-agent Patrolling Problems","date":"2022-12-16","arxiv_id":"2212.08230","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-4","title":"Multi-Agent Reinforcement Learning with Shared Resources for Inventory Management","date":"2022-12-15","arxiv_id":"2212.07684","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-strategies-for-cooperative-multi","title":"Hierarchical Strategies for Cooperative Multi-Agent Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.07397","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-the-wireless-metaverse-via-semantic","title":"Enabling the Wireless Metaverse via Semantic Multiverse Communication","date":"2022-12-13","arxiv_id":"2212.06908","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-sample-efficient-distributed","title":"Scalable and Sample Efficient Distributed Policy Gradient Algorithms in Multi-Agent Networked Systems","date":"2022-12-13","arxiv_id":"2212.06357","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-relative","title":"CURO: Curriculum Learning for Relative Overgeneralization","date":"2022-12-06","arxiv_id":"2212.02733","repositories_listed":0,"syntology":null},{"url":null,"slug":"diamond-taming-sample-and-communication","title":"DIAMOND: Taming Sample and Communication Complexities in Decentralized Bilevel Optimization","date":"2022-12-05","arxiv_id":"2212.02376","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-mapp-efficient-multi-agent-reinforcement","title":"E-MAPP: Efficient Multi-Agent Reinforcement Learning with Parallel Program Guidance","date":"2022-12-05","arxiv_id":"2212.02064","repositories_listed":0,"syntology":null},{"url":null,"slug":"dacom-learning-delay-aware-communication-for","title":"DACOM: Learning Delay-Aware Communication for Multi-Agent Reinforcement Learning","date":"2022-12-03","arxiv_id":"2212.01619","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-framework-for-digital-twin-based","title":"A Bayesian Framework for Digital Twin-Based Control, Monitoring, and Data Collection in Wireless Systems","date":"2022-12-02","arxiv_id":"2212.01351","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-convergence-of-localized-policy","title":"Global Convergence of Localized Policy Iteration in Networked Multi-Agent Reinforcement Learning","date":"2022-11-30","arxiv_id":"2211.17116","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-14","title":"Multi-Agent Reinforcement Learning for Microprocessor Design Space Exploration","date":"2022-11-29","arxiv_id":"2211.16385","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-wall","title":"Multi-agent reinforcement learning for wall modeling in LES of flow over periodic hills","date":"2022-11-29","arxiv_id":"2211.16427","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-robot-social-aware-cooperative-planning","title":"Multi-robot Social-aware Cooperative Planning in Pedestrian Environments Using Multi-agent Reinforcement Learning","date":"2022-11-29","arxiv_id":"2211.15901","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-good-trajectories-in-offline","title":"Learning from Good Trajectories in Offline Multi-Agent Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15612","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-simulation-software-demonstration-for","title":"Software Simulation and Visualization of Quantum Multi-Drone Reinforcement Learning","date":"2022-11-24","arxiv_id":"2211.15375","repositories_listed":0,"syntology":null},{"url":null,"slug":"greedy-based-value-representation-for-optimal-1","title":"Greedy based Value Representation for Optimal Coordination in Multi-agent Reinforcement Learning","date":"2022-11-22","arxiv_id":"2211.12075","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-cooperative-oversubscription-for","title":"Learning Cooperative Oversubscription for Cloud by Chance-Constrained Multi-Agent Reinforcement Learning","date":"2022-11-21","arxiv_id":"2211.11759","repositories_listed":0,"syntology":null},{"url":null,"slug":"revealing-robust-oil-and-gas-company-macro","title":"Revealing Robust Oil and Gas Company Macro-Strategies using Deep Multi-Agent Reinforcement Learning","date":"2022-11-20","arxiv_id":"2211.11043","repositories_listed":0,"syntology":null},{"url":null,"slug":"credit-cognisant-reinforcement-learning-for","title":"Credit-cognisant reinforcement learning for multi-agent cooperation","date":"2022-11-18","arxiv_id":"2211.10100","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-collaborative-multi-agent","title":"Dynamic Collaborative Multi-Agent Reinforcement Learning Communication for Autonomous Drone Reforestation","date":"2022-11-14","arxiv_id":"2211.15414","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-domain-coverage-for-vehicles-with","title":"Efficient Domain Coverage for Vehicles with Second-Order Dynamics via Multi-Agent Reinforcement Learning","date":"2022-11-11","arxiv_id":"2211.05952","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-policy-optimization","title":"Decentralized Policy Optimization","date":"2022-11-06","arxiv_id":"2211.03032","repositories_listed":0,"syntology":null},{"url":null,"slug":"learninggroup-a-real-time-sparse-training-on","title":"LearningGroup: A Real-Time Sparse Training on FPGA via Learnable Weight Grouping for Multi-Agent Reinforcement Learning","date":"2022-10-29","arxiv_id":"2210.16624","repositories_listed":0,"syntology":null},{"url":null,"slug":"mapdp-cooperative-multi-agent-reinforcement","title":"MAPDP: Cooperative Multi-Agent Reinforcement Learning to Solve Pickup and Delivery Problems","date":"2022-10-26","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"non-linear-coordination-graphs","title":"Non-Linear Coordination Graphs","date":"2022-10-26","arxiv_id":"2211.08404","repositories_listed":0,"syntology":null},{"url":null,"slug":"entity-divider-with-language-grounding-in","title":"Entity Divider with Language Grounding in Multi-Agent Reinforcement Learning","date":"2022-10-25","arxiv_id":"2210.13942","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-bad-is-selfish-driving-bounding-the","title":"How Bad is Selfish Driving? Bounding the Inefficiency of Equilibria in Urban Driving Games","date":"2022-10-24","arxiv_id":"2210.13064","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaborative-reasoning-on-multi-modal","title":"Collaborative Reasoning on Multi-Modal Semantic Graphs for Video-Grounded Dialogue Generation","date":"2022-10-22","arxiv_id":"2210.12460","repositories_listed":0,"syntology":null},{"url":null,"slug":"oracles-followers-stackelberg-equilibria-in","title":"Oracles & Followers: Stackelberg Equilibria in Deep Multi-Agent Reinforcement Learning","date":"2022-10-19","arxiv_id":"2210.11942","repositories_listed":0,"syntology":null},{"url":null,"slug":"rpm-generalizable-behaviors-for-multi-agent","title":"RPM: Generalizable Behaviors for Multi-Agent Reinforcement Learning","date":"2022-10-18","arxiv_id":"2210.09646","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-automated-machine-learning","title":"Multi-Agent Automated Machine Learning","date":"2022-10-17","arxiv_id":"2210.09084","repositories_listed":0,"syntology":null},{"url":null,"slug":"ptde-personalized-training-with-distillated","title":"PTDE: Personalized Training with Distilled Execution for Multi-Agent Reinforcement Learning","date":"2022-10-17","arxiv_id":"2210.08872","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-federated-hypernetworks-for","title":"Personalized Federated Hypernetworks for Privacy Preservation in Multi-Task Reinforcement Learning","date":"2022-10-13","arxiv_id":"2210.06820","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-multi-agent-reinforcement-learning-2","title":"Towards Multi-Agent Reinforcement Learning driven Over-The-Counter Market Simulations","date":"2022-10-13","arxiv_id":"2210.07184","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-covering-option-discovery","title":"Multi-agent Deep Covering Skill Discovery","date":"2022-10-07","arxiv_id":"2210.03269","repositories_listed":0,"syntology":null},{"url":null,"slug":"spatial-temporal-aware-safe-multi-agent","title":"Spatial-Temporal-Aware Safe Multi-Agent Reinforcement Learning of Connected Autonomous Vehicles in Challenging Scenarios","date":"2022-10-05","arxiv_id":"2210.02300","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-last-iterate-convergence-of-policy","title":"Faster Last-iterate Convergence of Policy Optimization in Zero-Sum Markov Games","date":"2022-10-03","arxiv_id":"2210.01050","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-kernel-operator-learning-via","title":"Minimax Optimal Kernel Operator Learning via Multilevel Training","date":"2022-09-28","arxiv_id":"2209.14430","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-actor-critic-for-multi-agent","title":"Asynchronous Actor-Critic for Multi-Agent Reinforcement Learning","date":"2022-09-20","arxiv_id":"2209.10113","repositories_listed":0,"syntology":null},{"url":null,"slug":"irs-assisted-noma-aided-mobile-edge-computing","title":"IRS Assisted NOMA Aided Mobile Edge Computing with Queue Stability: Heterogeneous Multi-Agent Reinforcement Learning","date":"2022-09-20","arxiv_id":"2209.09776","repositories_listed":0,"syntology":null},{"url":null,"slug":"macro-action-based-multi-agent-robot-deep","title":"Macro-Action-Based Multi-Agent/Robot Deep Reinforcement Learning under Partial Observability","date":"2022-09-20","arxiv_id":"2209.10003","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-robust-and-constrained-multi-agent","title":"A Robust and Constrained Multi-Agent Reinforcement Learning Electric Vehicle Rebalancing Method in AMoD Systems","date":"2022-09-17","arxiv_id":"2209.08230","repositories_listed":0,"syntology":null},{"url":null,"slug":"ma2ql-a-minimalist-approach-to-fully","title":"MA2QL: A Minimalist Approach to Fully Decentralized Multi-Agent Reinforcement Learning","date":"2022-09-17","arxiv_id":"2209.08244","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-multi-agent-reinforcement","title":"Sample-Efficient Multi-Agent Reinforcement Learning with Demonstrations for Flocking Control","date":"2022-09-17","arxiv_id":"2209.08351","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-optimal-policy-aided-multi-agent","title":"Sub-optimal Policy Aided Multi-Agent Reinforcement Learning for Flocking Control","date":"2022-09-17","arxiv_id":"2209.08347","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-approximation-of-cooperative","title":"Mean-Field Approximation of Cooperative Constrained Multi-Agent Reinforcement Learning (CMARL)","date":"2022-09-15","arxiv_id":"2209.07437","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixrts-toward-interpretable-multi-agent","title":"MIXRTs: Toward Interpretable Multi-Agent Reinforcement Learning via Mixing Recurrent Soft Decision Trees","date":"2022-09-15","arxiv_id":"2209.07225","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-task-driven-robotic-swarm-control","title":"Scalable Task-Driven Robotic Swarm Control via Collision Avoidance and Learning Mean-Field Control","date":"2022-09-15","arxiv_id":"2209.07420","repositories_listed":0,"syntology":null},{"url":null,"slug":"skip-training-for-multi-agent-reinforcement","title":"Skip Training for Multi-Agent Reinforcement Learning Controller for Industrial Wave Energy Converters","date":"2022-09-13","arxiv_id":"2209.05656","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperation-and-competition-flocking-with","title":"Cooperation and Competition: Flocking with Evolutionary Multi-Agent Reinforcement Learning","date":"2022-09-10","arxiv_id":"2209.04696","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-large-population-systems-and","title":"A Survey on Large-Population Systems and Scalable Multi-Agent Reinforcement Learning","date":"2022-09-08","arxiv_id":"2209.03859","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-games-on-weighted-and-directed","title":"Mean Field Games on Weighted and Directed Graphs via Colored Digraphons","date":"2022-09-08","arxiv_id":"2209.03887","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-near-optimality-of-local-policies-in","title":"On the Near-Optimality of Local Policies in Large Cooperative Multi-Agent Reinforcement Learning","date":"2022-09-07","arxiv_id":"2209.03491","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-10","title":"Energy Management of Multi-mode Hybrid Electric Vehicles based on Hand-shaking Multi-agent Learning","date":"2022-09-06","arxiv_id":"2209.02633","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-practical-communication-strategies","title":"Learning Practical Communication Strategies in Cooperative Multi-Agent Reinforcement Learning","date":"2022-09-02","arxiv_id":"2209.01288","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-centralised-multi-agent-reinforcement","title":"Taming Multi-Agent Reinforcement Learning with Estimator Variance Reduction","date":"2022-09-02","arxiv_id":"2209.01054","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-further-exploration-of-deep-multi-agent","title":"A further exploration of deep Multi-Agent Reinforcement Learning with Hybrid Action Space","date":"2022-08-30","arxiv_id":"2208.14447","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approach-to-implement-reinforcement","title":"An approach to implement Reinforcement Learning for Heterogeneous Vehicular Networks","date":"2022-08-26","arxiv_id":"2208.12466","repositories_listed":0,"syntology":null},{"url":null,"slug":"ch-marl-a-multimodal-benchmark-for","title":"CH-MARL: A Multimodal Benchmark for Cooperative, Heterogeneous Multi-Agent Reinforcement Learning","date":"2022-08-26","arxiv_id":"2208.13626","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-multi","title":"Reinforcement Learning based Multi-connectivity Resource Allocation in Factory Automation Systems","date":"2022-08-26","arxiv_id":"2208.12662","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-multi-agent-rl-in-zero-sum","title":"Minimax-Optimal Multi-Agent RL in Markov Games With a Generative Model","date":"2022-08-22","arxiv_id":"2208.10458","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-multi-agent-meta-reinforcement","title":"Quantum Multi-Agent Meta Reinforcement Learning","date":"2022-08-22","arxiv_id":"2208.11510","repositories_listed":0,"syntology":null},{"url":null,"slug":"forecasting-evolution-of-clusters-in","title":"Forecasting Evolution of Clusters in Game Agents with Hebbian Learning","date":"2022-08-19","arxiv_id":"2209.06904","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-graph-1","title":"Multi-Agent Reinforcement Learning with Graph Convolutional Neural Networks for optimal Bidding Strategies of Generation Units in Electricity Markets","date":"2022-08-11","arxiv_id":"2208.06242","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-intent","title":"Multi-agent reinforcement learning for intent-based service assurance in cellular networks","date":"2022-08-07","arxiv_id":"2208.03740","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-coordinate-for-a-worker-station","title":"Learning to Coordinate for a Worker-Station Multi-robot System in Planar Coverage Tasks","date":"2022-08-05","arxiv_id":"2208.02993","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-multi-agent-reinforcement","title":"Transferable Multi-Agent Reinforcement Learning with Dynamic Participating Agents","date":"2022-08-04","arxiv_id":"2208.02424","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-computing-nash-equilibria-in","title":"Efficiently Computing Nash Equilibria in Adversarial Team Markov Games","date":"2022-08-03","arxiv_id":"2208.02204","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-agent-mirror-learning-a","title":"Heterogeneous-Agent Mirror Learning: A Continuum of Solutions to Cooperative MARL","date":"2022-08-02","arxiv_id":"2208.01682","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-long","title":"Multi-Agent Reinforcement Learning for Long-Term Network Resource Allocation through Auction: a V2X Application","date":"2022-07-29","arxiv_id":"2208.04237","repositories_listed":0,"syntology":null},{"url":null,"slug":"interact-achieving-low-sample-and","title":"INTERACT: Achieving Low Sample and Communication Complexities in Decentralized Bilevel Learning over Networks","date":"2022-07-27","arxiv_id":"2207.13283","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-actor-critic-via-td-error","title":"Cooperative Actor-Critic via TD Error Aggregation","date":"2022-07-25","arxiv_id":"2207.12533","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-teamwork","title":"Few-Shot Teamwork","date":"2022-07-19","arxiv_id":"2207.09300","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-sharing-relational-networks-in-multi","title":"Reward-Sharing Relational Networks in Multi-Agent Reinforcement Learning as a Framework for Emergent Behavior","date":"2022-07-12","arxiv_id":"2207.05886","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-global-optimality-in-cooperative-marl","title":"Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework","date":"2022-07-12","arxiv_id":"2207.11143","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-performance-simulation-for-scalable","title":"High Performance Simulation for Scalable Multi-Agent Reinforcement Learning","date":"2022-07-08","arxiv_id":"2207.03945","repositories_listed":0,"syntology":null}],"record_sha256":"b7e5c45c5ef689f4f743e161cb46155207ca8c783ea0b022419c82b66896fc1a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}