{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/64","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":64,"pages_in_order":132,"rows_per_page":100,"rows":[6301,6400],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/63","next":"/task/reinforcement-learning/papers/65","papers":[{"url":null,"slug":"skill-critic-refining-learned-skills-for","title":"Skill-Critic: Refining Learned Skills for Hierarchical Reinforcement Learning","date":"2023-06-14","arxiv_id":"2306.08388","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-primal-dual-critic-algorithm-for-offline","title":"A Primal-Dual-Critic Algorithm for Offline Constrained Reinforcement Learning","date":"2023-06-13","arxiv_id":"2306.07818","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-interval-restrictions-on-action","title":"Dynamic Interval Restrictions on Action Spaces in Deep Reinforcement Learning for Obstacle Avoidance","date":"2023-06-13","arxiv_id":"2306.08008","repositories_listed":0,"syntology":null},{"url":null,"slug":"kernelized-reinforcement-learning-with-order","title":"Kernelized Reinforcement Learning with Order Optimal Regret Bounds","date":"2023-06-13","arxiv_id":"2306.07745","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-market-energy-optimization-with","title":"Multi-market Energy Optimization with Renewables via Reinforcement Learning","date":"2023-06-13","arxiv_id":"2306.08147","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-faking-a-nash-equilibrium","title":"Data Poisoning to Fake a Nash Equilibrium in Markov Games","date":"2023-06-13","arxiv_id":"2306.08041","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-collision-momentum-in-deep","title":"Using Collision Momentum in Deep Reinforcement Learning Based Adversarial Pedestrian Modeling","date":"2023-06-13","arxiv_id":"2306.07525","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-projection-ensembles-for","title":"Diverse Projection Ensembles for Distributional Reinforcement Learning","date":"2023-06-12","arxiv_id":"2306.07124","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-based-offline-to-online","title":"ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles","date":"2023-06-12","arxiv_id":"2306.06871","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-through","title":"Robust Reinforcement Learning through Efficient Adversarial Herding","date":"2023-06-12","arxiv_id":"2306.07408","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-guided-by","title":"Multi-Agent Reinforcement Learning Guided by Signal Temporal Logic Specifications","date":"2023-06-11","arxiv_id":"2306.06808","repositories_listed":0,"syntology":null},{"url":null,"slug":"pacer-a-fully-push-forward-based","title":"PACER: A Fully Push-forward-based Distributional Reinforcement Learning Algorithm","date":"2023-06-11","arxiv_id":"2306.06637","repositories_listed":0,"syntology":null},{"url":null,"slug":"hipode-enhancing-offline-reinforcement","title":"HIPODE: Enhancing Offline Reinforcement Learning with High-Quality Synthetic Data from a Policy-Decoupled Approach","date":"2023-06-10","arxiv_id":"2306.06329","repositories_listed":0,"syntology":null},{"url":null,"slug":"pear-primitive-enabled-adaptive-relabeling","title":"PEAR: Primitive enabled Adaptive Relabeling for boosting Hierarchical Reinforcement Learning","date":"2023-06-10","arxiv_id":"2306.06394","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-sample-policy-iteration-for-offline","title":"Iteratively Refined Behavior Regularization for Offline Reinforcement Learning","date":"2023-06-09","arxiv_id":"2306.05726","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-paced-absolute-learning-progress-as-a","title":"Self-Paced Absolute Learning Progress as a Regularized Approach to Curriculum Learning","date":"2023-06-09","arxiv_id":"2306.05769","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-role-of-diverse-replay-for-generalisation","title":"The Role of Diverse Replay for Generalisation in Reinforcement Learning","date":"2023-06-09","arxiv_id":"2306.05727","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-framework-for-dynamically-training-and","title":"A framework for dynamically training and adapting deep reinforcement learning models to different, low-compute, and continuously changing radiology deployment environments","date":"2023-06-08","arxiv_id":"2306.05310","repositories_listed":0,"syntology":null},{"url":null,"slug":"instructed-diffuser-with-temporal-condition","title":"Instructed Diffuser with Temporal Condition Guidance for Offline Reinforcement Learning","date":"2023-06-08","arxiv_id":"2306.04875","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-of-competitive-two-player-game","title":"Balancing of competitive two-player Game Levels with Reinforcement Learning","date":"2023-06-07","arxiv_id":"2306.04429","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-across-observation-shifts-in","title":"Generalization Across Observation Shifts in Reinforcement Learning","date":"2023-06-07","arxiv_id":"2306.04595","repositories_listed":0,"syntology":null},{"url":null,"slug":"timing-process-interventions-with-causal","title":"Timing Process Interventions with Causal Inference and Reinforcement Learning","date":"2023-06-07","arxiv_id":"2306.04299","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-offline-reinforcement-learning-with-1","title":"Boosting Offline Reinforcement Learning with Action Preference Query","date":"2023-06-06","arxiv_id":"2306.03362","repositories_listed":0,"syntology":null},{"url":null,"slug":"inductive-bias-for-emergent-communication-in","title":"Inductive Bias for Emergent Communication in a Continuous Setting","date":"2023-06-06","arxiv_id":"2306.03830","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-control-of-4","title":"Reinforcement Learning-Based Control of CrazyFlie 2.X Quadrotor","date":"2023-06-06","arxiv_id":"2306.03951","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-perspective-on-objectives-of","title":"A General Perspective on Objectives of Reinforcement Learning","date":"2023-06-05","arxiv_id":"2306.03074","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-multi-agent-deep-rl-approach-for","title":"A Novel Multi-Agent Deep RL Approach for Traffic Signal Control","date":"2023-06-05","arxiv_id":"2306.02684","repositories_listed":0,"syntology":null},{"url":null,"slug":"survival-instinct-in-offline-reinforcement","title":"Survival Instinct in Offline Reinforcement Learning","date":"2023-06-05","arxiv_id":"2306.03286","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-modular-test-bed-for-reinforcement-learning","title":"A Modular Test Bed for Reinforcement Learning Incorporation into Industrial Applications","date":"2023-06-02","arxiv_id":"2306.01440","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-architecture-for-deploying-reinforcement","title":"An Architecture for Deploying Reinforcement Learning in Industrial Environments","date":"2023-06-02","arxiv_id":"2306.01420","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-multi-task-and-transfer","title":"Efficient Multi-Task and Transfer Reinforcement Learning with Parameter-Compositional Framework","date":"2023-06-02","arxiv_id":"2306.01839","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-generalizability-and-robustness","title":"Improving the generalizability and robustness of large-scale traffic signal control","date":"2023-06-02","arxiv_id":"2306.01925","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-modular-reinforcement-learning","title":"Heterogeneous Knowledge for Augmented Modular Reinforcement Learning","date":"2023-06-01","arxiv_id":"2306.01158","repositories_listed":0,"syntology":null},{"url":null,"slug":"delphic-offline-reinforcement-learning-under","title":"Delphic Offline Reinforcement Learning under Nonidentifiable Hidden Confounding","date":"2023-06-01","arxiv_id":"2306.01157","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-episodic-reinforcement","title":"Differentially Private Episodic Reinforcement Learning with Heavy-tailed Rewards","date":"2023-06-01","arxiv_id":"2306.01121","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-reinforcement-learning-under","title":"Non-stationary Reinforcement Learning under General Function Approximation","date":"2023-06-01","arxiv_id":"2306.00861","repositories_listed":0,"syntology":null},{"url":null,"slug":"what-model-does-muzero-learn","title":"What model does MuZero learn?","date":"2023-06-01","arxiv_id":"2306.00840","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-with-2","title":"Accelerating Reinforcement Learning with Value-Conditional State Entropy Exploration","date":"2023-05-31","arxiv_id":"2305.19476","repositories_listed":0,"syntology":null},{"url":null,"slug":"factually-consistent-summarization-via","title":"Factually Consistent Summarization via Reinforcement Learning with Textual Entailment Feedback","date":"2023-05-31","arxiv_id":"2306.00186","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-environment-lifelong-deep-reinforcement","title":"Multi-environment lifelong deep reinforcement learning for medical imaging","date":"2023-05-31","arxiv_id":"2306.00188","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-generalized-lagrangian","title":"Provably Efficient Generalized Lagrangian Policy Optimization for Safe Multi-Agent Reinforcement Learning","date":"2023-05-31","arxiv_id":"2306.00212","repositories_listed":0,"syntology":null},{"url":null,"slug":"replicability-in-reinforcement-learning","title":"Replicability in Reinforcement Learning","date":"2023-05-31","arxiv_id":"2305.19562","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-driven-reinforcement-learning","title":"Representation-Driven Reinforcement Learning","date":"2023-05-31","arxiv_id":"2305.19922","repositories_listed":0,"syntology":null},{"url":null,"slug":"centralised-rehearsal-of-decentralised","title":"Centralised rehearsal of decentralised cooperation: Multi-agent reinforcement learning for the scalable coordination of residential energy flexibility","date":"2023-05-30","arxiv_id":"2305.18875","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-for-continuous","title":"Policy Optimization for Continuous Reinforcement Learning","date":"2023-05-30","arxiv_id":"2305.18901","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-valuation-of-on-and-off-ball-soccer","title":"Action valuation of on- and off-ball soccer players based on multi-agent deep reinforcement learning","date":"2023-05-29","arxiv_id":"2305.17886","repositories_listed":0,"syntology":null},{"url":null,"slug":"doing-the-right-thing-for-the-right-reason","title":"Doing the right thing for the right reason: Evaluating artificial moral cognition by probing cost insensitivity","date":"2023-05-29","arxiv_id":"2305.18269","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-query-human-feedback-efficiently-in-rl","title":"Provable Reward-Agnostic Preference-Based Reinforcement Learning","date":"2023-05-29","arxiv_id":"2305.18505","repositories_listed":0,"syntology":null},{"url":null,"slug":"perimeter-control-using-deep-reinforcement","title":"Perimeter Control Using Deep Reinforcement Learning: A Model-free Approach towards Homogeneous Flow Rate Optimization","date":"2023-05-29","arxiv_id":"2305.19291","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-human-feedback","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism","date":"2023-05-29","arxiv_id":"2305.18438","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-reward-redistribution-in-1","title":"Interpretable Reward Redistribution in Reinforcement Learning: A Causal Approach","date":"2023-05-28","arxiv_id":"2305.18427","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-models-are-pragmatic-speakers","title":"Language Models are Bounded Pragmatic Speakers: Understanding RLHF from a Bayesian Cognitive Modeling Perspective","date":"2023-05-28","arxiv_id":"2305.17760","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-statistical-benefits-of-quantile-temporal","title":"The Statistical Benefits of Quantile Temporal-Difference Learning for Value Estimation","date":"2023-05-28","arxiv_id":"2305.18388","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-analysis-of-portfolio","title":"A Comparative Analysis of Portfolio Optimization Using Mean-Variance, Hierarchical Risk Parity, and Reinforcement Learning Approaches on the Indian Stock Market","date":"2023-05-27","arxiv_id":"2305.17523","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-online-reinforcement-learning-with","title":"No-Regret Online Reinforcement Learning with Adversarial Losses and Transitions","date":"2023-05-27","arxiv_id":"2305.17380","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-nonstochastic-model-free-reinforcement","title":"Online Nonstochastic Model-Free Reinforcement Learning","date":"2023-05-27","arxiv_id":"2305.17552","repositories_listed":0,"syntology":null},{"url":null,"slug":"probing-reaction-channels-via-reinforcement","title":"Probing reaction channels via reinforcement learning","date":"2023-05-27","arxiv_id":"2305.17531","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-reward-machines","title":"Reinforcement Learning With Reward Machines in Stochastic Games","date":"2023-05-27","arxiv_id":"2305.17372","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-with-6","title":"Distributional Reinforcement Learning with Dual Expectile-Quantile Regression","date":"2023-05-26","arxiv_id":"2305.16877","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-synthesis-and-reinforcement-learning","title":"Policy Synthesis and Reinforcement Learning for Discounted LTL","date":"2023-05-26","arxiv_id":"2305.17115","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-simple-sequence","title":"Reinforcement Learning with Simple Sequence Priors","date":"2023-05-26","arxiv_id":"2305.17109","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-reinforcement-learning-that","title":"Self-Supervised Reinforcement Learning that Transfers using Random Features","date":"2023-05-26","arxiv_id":"2305.17250","repositories_listed":0,"syntology":null},{"url":null,"slug":"tuning-models-of-code-with-compiler-generated","title":"Coarse-Tuning Models of Code with Reinforcement Learning Feedback","date":"2023-05-25","arxiv_id":"2305.18341","repositories_listed":0,"syntology":null},{"url":null,"slug":"2305-14608","title":"Inverse Reinforcement Learning with the Average Reward Criterion","date":"2023-05-24","arxiv_id":"2305.14608","repositories_listed":0,"syntology":null},{"url":null,"slug":"2305-14816","title":"Provable Offline Preference-Based Reinforcement Learning","date":"2023-05-24","arxiv_id":"2305.14816","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-plasticity","title":"Deep Reinforcement Learning with Plasticity Injection","date":"2023-05-24","arxiv_id":"2305.15555","repositories_listed":0,"syntology":null},{"url":null,"slug":"matrix-estimation-for-offline-reinforcement","title":"Matrix Estimation for Offline Reinforcement Learning with Low-Rank Structure","date":"2023-05-24","arxiv_id":"2305.15621","repositories_listed":0,"syntology":null},{"url":null,"slug":"replicable-reinforcement-learning","title":"Replicable Reinforcement Learning","date":"2023-05-24","arxiv_id":"2305.15284","repositories_listed":0,"syntology":null},{"url":null,"slug":"successor-predecessor-intrinsic-exploration","title":"Successor-Predecessor Intrinsic Exploration","date":"2023-05-24","arxiv_id":"2305.15277","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-random-search-for-multi-objective","title":"Combining Multi-Objective Bayesian Optimization with Reinforcement Learning for TinyML","date":"2023-05-23","arxiv_id":"2305.14109","repositories_listed":0,"syntology":null},{"url":null,"slug":"chemgymrl-an-interactive-framework-for","title":"ChemGymRL: An Interactive Framework for Reinforcement Learning for Digital Chemistry","date":"2023-05-23","arxiv_id":"2305.14177","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-proximal-policy-optimization","title":"Constrained Proximal Policy Optimization","date":"2023-05-23","arxiv_id":"2305.14216","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-of-a-simulated-mri-scanner-with-deep","title":"Control of a simulated MRI scanner with deep reinforcement learning","date":"2023-05-23","arxiv_id":"2305.13979","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-self-improvement-by","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","date":"2023-05-23","arxiv_id":"2305.14483","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-experience-replay-for-continual","title":"OER: Offline Experience Replay for Continual Offline Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13804","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-long-term-value-for-auction-based","title":"Optimizing Long-term Value for Auction-Based Recommender Systems via On-Policy Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13747","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-gradient-arborescence-for","title":"Proximal Policy Gradient Arborescence for Quality Diversity Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13795","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlboost-boosting-supervised-models-using-deep","title":"RLBoost: Boosting Supervised Models using Deep Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.14115","repositories_listed":0,"syntology":null},{"url":null,"slug":"hjb-based-online-safe-reinforcement-learning","title":"Lagrangian-based online safe reinforcement learning for state-constrained systems","date":"2023-05-22","arxiv_id":"2305.12967","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-primal-dual-reinforcement-learning","title":"Offline Primal-Dual Reinforcement Learning for Linear MDPs","date":"2023-05-22","arxiv_id":"2305.12944","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-6","title":"Offline Reinforcement Learning with Additional Covering Distributions","date":"2023-05-22","arxiv_id":"2305.12679","repositories_listed":0,"syntology":null},{"url":null,"slug":"tom-learning-policy-aware-models-for-model","title":"TOM: Learning Policy-Aware Models for Model-Based Reinforcement Learning via Transition Occupancy Matching","date":"2023-05-22","arxiv_id":"2305.12663","repositories_listed":0,"syntology":null},{"url":null,"slug":"game-theoretical-analysis-of-reviewer-rewards","title":"Game-Theoretical Analysis of Reviewer Rewards in Peer-Review Journal Systems: Analysis and Experimental Evaluation using Deep Reinforcement Learning","date":"2023-05-20","arxiv_id":"2305.12088","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-adaptation-for-sample-efficient","title":"Model-based adaptation for sample efficient transfer in reinforcement learning control of parameter-varying systems","date":"2023-05-20","arxiv_id":"2305.12158","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-first-order-meta-reinforcement-learning","title":"On First-Order Meta-Reinforcement Learning with Moreau Envelopes","date":"2023-05-20","arxiv_id":"2305.12216","repositories_listed":0,"syntology":null},{"url":null,"slug":"shattering-the-agent-environment-interface","title":"Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models","date":"2023-05-19","arxiv_id":"2305.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantically-aligned-task-decomposition-in","title":"Semantically Aligned Task Decomposition in Multi-Agent Reinforcement Learning","date":"2023-05-18","arxiv_id":"2305.10865","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proof-of-imitation-of-wasserstein-inverse","title":"A proof of imitation of Wasserstein inverse reinforcement learning for multi-objective optimization","date":"2023-05-17","arxiv_id":"2305.10089","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-in-job-shop-scheduling","title":"Curriculum Learning in Job Shop Scheduling using Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10192","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-individual-rewards-in-collective","title":"Discovering Individual Rewards in Collective Behavior through Inverse Multi-Agent Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10548","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-conflict-management-for-uam-with","title":"Integrated Conflict Management for UAM with Strategic Demand Capacity Balancing and Learning-based Tactical Deconfliction","date":"2023-05-17","arxiv_id":"2305.10556","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-robust-average-reward","title":"Model-Free Robust Average-Reward Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10504","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-methods","title":"Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges","date":"2023-05-17","arxiv_id":"2305.10091","repositories_listed":0,"syntology":null},{"url":null,"slug":"pragmatic-reasoning-in-structured-signaling","title":"Pragmatic Reasoning in Structured Signaling Games","date":"2023-05-17","arxiv_id":"2305.10167","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-to-maximize","title":"Deep Reinforcement Learning to Maximize Arterial Usage during Extreme Congestion","date":"2023-05-16","arxiv_id":"2305.09600","repositories_listed":0,"syntology":null},{"url":null,"slug":"horizon-free-reinforcement-learning-in-1","title":"Horizon-free Reinforcement Learning in Adversarial Linear Mixture MDPs","date":"2023-05-15","arxiv_id":"2305.08359","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-multi-agent-reinforcement-learning-for","title":"Toward Multi-Agent Reinforcement Learning for Distributed Event-Triggered Control","date":"2023-05-15","arxiv_id":"2305.08723","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-td-learning-over-finite-rate","title":"Federated TD Learning over Finite-Rate Erasure Channels: Linear Speedup under Markovian Sampling","date":"2023-05-14","arxiv_id":"2305.08104","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-with-2","title":"Inverse Reinforcement Learning With Constraint Recovery","date":"2023-05-14","arxiv_id":"2305.08130","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-prior-reinforcement-learning-for","title":"Gaussian Prior Reinforcement Learning for Nested Named Entity Recognition","date":"2023-05-12","arxiv_id":"2305.07266","repositories_listed":0,"syntology":null}],"record_sha256":"609e047870076bd76477fa2a0e8f14a6e7c916eb512736aec68273e8e0d4f623","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}