Browse State-of-the-Art › Reinforcement Learning (RL) › Papers, page 86
Reinforcement Learning (RL)
Papers archive 2025-07-28
archive papers tagged: 15,113 · with a code link: 4,749 · where Syntology ran a sample: 1,416 (1,186 with a run with no instrument failure, 230 where every run was a failure of Syntology's instrument) Syntology
Show: all tagged papersonly where code ran (1,416 of 15,113 tagged: 1,186 with a run with no instrument failure, 230 where every run was a failure of Syntology's instrument)
Page 86 of 152: papers 8,501 to 8,600 of 15,113, in archive order: by repositories listed in the archive (most first), then newest first, not by stars (the archive holds no stars, so PwC's “Social” and “Latest” sorts cannot be reproduced). Papers that list no repository come after every paper that lists one.
Papers without a page here are shown as plain text. A Syntology line reads “N ran (of which C constructed an object rather than computing a result; K with no instrument failure: H honoured, V violated, P with no contract checked; I where Syntology's instrument failed) · U unverified”; the figure “where Syntology's instrument failed” counts failures of Syntology's instrument, not of the code. When the archive marks a repository official for the paper, the line starts with that repository's state (the archive's flag, not a verdict on who wrote the code); hover it for the repositories the samples that ran came from. Abstracts are on each paper's page.
-
Learning Open Domain Multi-hop Search Using Reinforcement Learning30 May 2022 0 repositories listed
-
Quantum Multi-Armed Bandits and Stochastic Linear Bandits Enjoy Logarithmic Regrets30 May 2022 0 repositories listed
-
Residual Q-Networks for Value Function Factorizing in Multi-Agent Reinforcement Learning30 May 2022 0 repositories listed
-
SEREN: Knowing When to Explore and When to Exploit30 May 2022 0 repositories listed
-
Stock Trading Optimization through Model-based Reinforcement Learning with Resistance Support Relative Strength30 May 2022 0 repositories listed
-
Frustratingly Easy Regularization on Representation Can Boost Deep Reinforcement Learning29 May 2022 0 repositories listed
-
Multi-Source Transfer Learning for Deep Model-Based Reinforcement Learning28 May 2022 0 repositories listed
-
Survival Analysis on Structured Data using Deep Reinforcement Learning28 May 2022 0 repositories listed
-
Deep Reinforcement Learning for Distributed and Uncoordinated Cognitive Radios Resource Allocation27 May 2022 0 repositories listed
-
Double Deep Q Networks for Sensor Management in Space Situational Awareness27 May 2022 0 repositories listed
-
Feudal Multi-Agent Reinforcement Learning with Adaptive Network Partition for Traffic Signal Control27 May 2022 0 repositories listed
-
GALOIS: Boosting Deep Reinforcement Learning via Generalizable Logic Synthesis27 May 2022 0 repositories listed
-
KL-Entropy-Regularized RL with a Generative Model is Minimax Optimal27 May 2022 0 repositories listed
-
Non-Markovian policies occupancy measures27 May 2022 0 repositories listed
-
Off-Beat Multi-Agent Reinforcement Learning27 May 2022 0 repositories listed
-
Provably Sample-Efficient RL with Side Information about Latent Dynamics27 May 2022 0 repositories listed
-
Tutorial on Course-of-Action (COA) Attack Search Methods in Computer Networks27 May 2022 0 repositories listed
-
A Fair Federated Learning Framework With Reinforcement Learning26 May 2022 0 repositories listed
-
Does DQN Learn?26 May 2022 0 repositories listed
-
Constrained Reinforcement Learning for Short Video Recommendation26 May 2022 0 repositories listed
-
Embed to Control Partially Observed Systems: Representation Learning with Provable Sample Efficiency26 May 2022 0 repositories listed
-
Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes26 May 2022 0 repositories listed
-
Physics-Guided Hierarchical Reward Mechanism for Learning-Based Robotic Grasping26 May 2022 0 repositories listed
-
RACE: A Reinforcement Learning Framework for Improved Adaptive Control of NoC Channel Buffers26 May 2022 0 repositories listed
-
SFP: State-free Priors for Exploration in Off-Policy Reinforcement Learning26 May 2022 0 repositories listed
-
An Experimental Comparison Between Temporal Difference and Residual Gradient with Neural Network Approximation25 May 2022 0 repositories listed
-
Fast Inference and Transfer of Compositional Task Structures for Few-shot Task Generalization25 May 2022 0 repositories listed
-
Learning in Mean Field Games: A Survey25 May 2022 0 repositories listed
-
MAVIPER: Learning Decision Tree Policies for Interpretable Multi-Agent Reinforcement Learning25 May 2022 0 repositories listed
-
Near-Optimal Goal-Oriented Reinforcement Learning in Non-Stationary Environments25 May 2022 0 repositories listed
-
Robust Reinforcement Learning on Graphs for Logistics optimization25 May 2022 0 repositories listed
-
Stochastic Second-Order Methods Improve Best-Known Sample Complexity of SGD for Gradient-Dominated Function25 May 2022 0 repositories listed
-
Transportation-Inequalities, Lyapunov Stability and Sampling for Dynamical Systems on Continuous State Space25 May 2022 0 repositories listed
-
Trust-based Consensus in Multi-Agent Reinforcement Learning Systems25 May 2022 0 repositories listed
-
Distributional Hamilton-Jacobi-Bellman Equations for Continuous-Time Reinforcement Learning24 May 2022 0 repositories listed
-
Graph Convolutional Reinforcement Learning for Collaborative Queuing Agents24 May 2022 0 repositories listed
-
Learning to Drive Using Sparse Imitation Reinforcement Learning24 May 2022 0 repositories listed
-
Penalized Proximal Policy Optimization for Safe Reinforcement Learning24 May 2022 0 repositories listed
-
Computationally Efficient Horizon-Free Reinforcement Learning for Linear Mixture MDPs23 May 2022 0 repositories listed
-
Cooperative Reinforcement Learning on Traffic Signal Control23 May 2022 0 repositories listed
-
Efficient Reinforcement Learning from Demonstration Using Local Ensemble and Reparameterization with Split and Merge of Expert Policies23 May 2022 0 repositories listed
-
Human-in-the-loop: Provably Efficient Preference-based Reinforcement Learning with General Function Approximation23 May 2022 0 repositories listed
-
Learning to Advise and Learning from Advice in Cooperative Multi-Agent Reinforcement Learning23 May 2022 0 repositories listed
-
Logarithmic regret bounds for continuous-time average-reward Markov decision processes23 May 2022 0 repositories listed
-
Multiple Domain Cyberspace Attack and Defense Game Based on Reward Randomization Reinforcement Learning23 May 2022 0 repositories listed
-
POLTER: Policy Trajectory Ensemble Regularization for Unsupervised Reinforcement Learning23 May 2022 0 repositories listed
-
RL with KL penalties is better viewed as Bayesian inference23 May 2022 0 repositories listed
-
Spreading Factor assisted LoRa Localization with Deep Reinforcement Learning23 May 2022 0 repositories listed
-
A Dirichlet Process Mixture of Robust Task Models for Scalable Lifelong Reinforcement Learning22 May 2022 0 repositories listed
-
Contextual Information-Directed Sampling22 May 2022 0 repositories listed
-
Inverse-Inverse Reinforcement Learning. How to Hide Strategy from an Adversarial Inverse Reinforcement Learner22 May 2022 0 repositories listed
-
Power and accountability in reinforcement learning applications to environmental policy22 May 2022 0 repositories listed
-
Coordinating Policies Among Multiple Agents via an Intelligent Communication Channel21 May 2022 0 repositories listed
-
CORAL: Contextual Response Retrievability Loss Function for Training Dialog Generation Models21 May 2022 0 repositories listed
-
De novo design of protein target specific scaffold-based Inhibitors via Reinforcement Learning21 May 2022 0 repositories listed
-
Reinforced Pedestrian Attribute Recognition with Group Optimization Reward21 May 2022 0 repositories listed
-
A Fully Controllable Agent in the Path Planning using Goal-Conditioned Reinforcement Learning20 May 2022 0 repositories listed
-
Adversarial joint attacks on legged robots20 May 2022 0 repositories listed
-
Long Run Incremental Cost (LRIC) Distribution Network Pricing in UK, advising China's Distribution Network20 May 2022 0 repositories listed
-
On Jointly Optimizing Partial Offloading and SFC Mapping: A Cooperative Dual-agent Deep Reinforcement Learning Approach20 May 2022 0 repositories listed
-
Prototyping three key properties of specific curiosity in computational reinforcement learning20 May 2022 0 repositories listed
-
Survey on Fair Reinforcement Learning: Theory and Practice20 May 2022 0 repositories listed
-
AIGenC: An AI generalisation model via creativity19 May 2022 0 repositories listed
-
Data Valuation for Offline Reinforcement Learning19 May 2022 0 repositories listed
-
Distributed Multi-Agent Deep Reinforcement Learning for Robust Coordination against Noise19 May 2022 0 repositories listed
-
IL-flOw: Imitation Learning from Observation using Normalizing Flows19 May 2022 0 repositories listed
-
Parallel bandit architecture based on laser chaos for reinforcement learning19 May 2022 0 repositories listed
-
Routing and Placement of Macros using Deep Reinforcement Learning19 May 2022 0 repositories listed
-
Sparse Adversarial Attack in Multi-agent Reinforcement Learning19 May 2022 0 repositories listed
-
Towards Applicable Reinforcement Learning: Improving the Generalization and Sample Efficiency with Policy Ensemble19 May 2022 0 repositories listed
-
Deep Reinforcement Learning Based on Location-Aware Imitation Environment for RIS-Aided mmWave MIMO Systems18 May 2022 0 repositories listed
-
Generating Explanations from Deep Reinforcement Learning Using Episodic Memory18 May 2022 0 repositories listed
-
Market Making via Reinforcement Learning in China Commodity Market18 May 2022 0 repositories listed
-
No More Pesky Hyperparameters: Offline Hyperparameter Tuning for RL18 May 2022 0 repositories listed
-
Policy Distillation with Selective Input Gradient Regularization for Efficient Interpretability18 May 2022 0 repositories listed
-
Slowly Changing Adversarial Bandit Algorithms are Efficient for Discounted MDPs18 May 2022 0 repositories listed
-
World Value Functions: Knowledge Representation for Multitask Reinforcement Learning18 May 2022 0 repositories listed
-
Moral reinforcement learning using actual causation17 May 2022 0 repositories listed
-
Multibit Tries Packet Classification with Deep Reinforcement Learning17 May 2022 0 repositories listed
-
Planning to Practice: Efficient Online Fine-Tuning by Composing Goals in Latent Space17 May 2022 0 repositories listed
-
A Deep Reinforcement Learning Blind AI in DareFightingICE16 May 2022 0 repositories listed
-
Attacking and Defending Deep Reinforcement Learning Policies16 May 2022 0 repositories listed
-
Deep Apprenticeship Learning for Playing Games16 May 2022 0 repositories listed
-
Enforcing KL Regularization in General Tsallis Entropy Reinforcement Learning via Advantage Learning16 May 2022 0 repositories listed
-
KGRGRL: A User's Permission Reasoning Method Based on Knowledge Graph Reward Guidance Reinforcement Learning16 May 2022 0 repositories listed
-
Many Field Packet Classification with Decomposition and Reinforcement Learning16 May 2022 0 repositories listed
-
q-Munchausen Reinforcement Learning16 May 2022 0 repositories listed
-
Qualitative Differences Between Evolutionary Strategies and Reinforcement Learning Methods for Control of Autonomous Agents16 May 2022 0 repositories listed
-
Rethinking Reinforcement Learning based Logic Synthesis16 May 2022 0 repositories listed
-
Taming Continuous Posteriors for Latent Variational Dialogue Policies16 May 2022 0 repositories listed
-
Towards on-sky adaptive optics control using reinforcement learning16 May 2022 0 repositories listed
-
Policy Gradient Method For Robust Reinforcement Learning15 May 2022 0 repositories listed
-
RoMFAC: A robust mean-field actor-critic reinforcement learning against adversarial perturbations on states15 May 2022 0 repositories listed
-
14 May 2022 0 repositories listed Syntology 2 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 1 honoured, 0 violated, 0 with no contract checked; 1 where Syntology's instrument failed) · 2 unverified (of 4 harvested samples) · 1 pointer-only (licence)
-
Interpretable Stochastic Model Predictive Control using Distributional Reinforced Estimation for Quadrotor Tracking Systems14 May 2022 0 repositories listed
-
PrefixRL: Optimization of Parallel Prefix Circuits using Deep Reinforcement Learning14 May 2022 0 repositories listed
-
Efficient Off-Policy Reinforcement Learning via Brain-Inspired Computing14 May 2022 0 repositories listed
-
Deep Reinforcement Learning in mmW-NOMA: Joint Power Allocation and Hybrid Beamforming13 May 2022 0 repositories listed
-
Emergent Bartering Behaviour in Multi-Agent Reinforcement Learning13 May 2022 0 repositories listed
-
Joint Power Allocation and Beamformer for mmW-NOMA Downlink Systems by Deep Reinforcement Learning13 May 2022 0 repositories listed
Syntology lines on 1 of the papers shown; no Syntology record for the others (a paper without an arXiv id cannot be joined to the graph, and absence from the graph layer is not a recorded non-run). “Ran” means the sample executed on a synthesized fixture, not that the paper's result was reproduced; each line links to that paper's sample list. Syntology's record for this page has not changed since , the first build that kept a record date for it; when this build read Syntology's graph is in the build record. For agents: get_harvested_code_for_paper(arxiv_id) lists each paper's samples; how to connect.