{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/59","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":59,"pages_in_order":132,"rows_per_page":100,"rows":[5801,5900],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/58","next":"/task/reinforcement-learning/papers/60","papers":[{"url":null,"slug":"scaling-is-all-you-need-training-strong","title":"Scaling Is All You Need: Autonomous Driving with JAX-Accelerated Reinforcement Learning","date":"2023-12-23","arxiv_id":"2312.15122","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-note-on-stability-in-asynchronous","title":"A Note on Stability in Asynchronous Stochastic Approximation without Communication Delays","date":"2023-12-22","arxiv_id":"2312.15091","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-reinforcement-learning-from-human","title":"A Survey of Reinforcement Learning from Human Feedback","date":"2023-12-22","arxiv_id":"2312.14925","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-q-learning-linear-regret-speedup","title":"Federated Q-Learning: Linear Regret Speedup with Low Communication Cost","date":"2023-12-22","arxiv_id":"2312.15023","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-curriculum-learning-with-gradient","title":"Automatic Curriculum Learning with Gradient Reward Signals","date":"2023-12-21","arxiv_id":"2312.13565","repositories_listed":0,"syntology":null},{"url":null,"slug":"cva-hedging-by-risk-averse-stochastic-horizon","title":"CVA Hedging by Risk-Averse Stochastic-Horizon Reinforcement Learning","date":"2023-12-21","arxiv_id":"2312.14044","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-coordination-in-minority-game-a","title":"Optimal coordination of resources: A solution from reinforcement learning","date":"2023-12-20","arxiv_id":"2312.14970","repositories_listed":0,"syntology":null},{"url":null,"slug":"pgn-a-perturbation-generation-network-against","title":"PGN: A perturbation generation network against deep reinforcement learning","date":"2023-12-20","arxiv_id":"2312.12904","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparse-mean-field-load-balancing-in-large","title":"Sparse Mean Field Load Balancing in Large Localized Queueing Systems","date":"2023-12-20","arxiv_id":"2312.12973","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-cooperation-in-multi","title":"Curriculum Learning for Cooperation in Multi-Agent Reinforcement Learning","date":"2023-12-19","arxiv_id":"2312.11768","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-approximation-for-pessimistic","title":"Neural Network Approximation for Pessimistic Offline Reinforcement Learning","date":"2023-12-19","arxiv_id":"2312.11863","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-search-and-coverage-using-point-cloud","title":"Active search and coverage using point-cloud reinforcement learning","date":"2023-12-18","arxiv_id":"2312.11410","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-reinforcement-learning-for","title":"Contextual Reinforcement Learning for Offshore Wind Farm Bidding","date":"2023-12-18","arxiv_id":"2312.10884","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-ran-slicing-with-offline","title":"Advancing RAN Slicing with Offline Reinforcement Learning","date":"2023-12-16","arxiv_id":"2312.10547","repositories_listed":0,"syntology":null},{"url":null,"slug":"fractional-deep-reinforcement-learning-for","title":"Fractional Deep Reinforcement Learning for Age-Minimal Mobile Edge Computing","date":"2023-12-16","arxiv_id":"2312.10418","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-communicative-multi-agent","title":"Robust Communicative Multi-Agent Reinforcement Learning with Active Defense","date":"2023-12-16","arxiv_id":"2312.11545","repositories_listed":0,"syntology":null},{"url":null,"slug":"assume-guarantee-reinforcement-learning","title":"Assume-Guarantee Reinforcement Learning","date":"2023-12-15","arxiv_id":"2312.09938","repositories_listed":0,"syntology":null},{"url":"/paper/graphrare-reinforcement-learning-enhanced","slug":"graphrare-reinforcement-learning-enhanced","title":"GraphRARE: Reinforcement Learning Enhanced Graph Neural Network with Relative Entropy","date":"2023-12-15","arxiv_id":"2312.09708","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-a-1","title":"Multi-agent Reinforcement Learning: A Comprehensive Survey","date":"2023-12-15","arxiv_id":"2312.10256","repositories_listed":0,"syntology":null},{"url":null,"slug":"situation-dependent-causal-influence-based","title":"Situation-Dependent Causal Influence-Based Cooperative Multi-agent Reinforcement Learning","date":"2023-12-15","arxiv_id":"2312.09539","repositories_listed":0,"syntology":null},{"url":null,"slug":"small-dataset-big-gains-enhancing","title":"Small Dataset, Big Gains: Enhancing Reinforcement Learning by Offline Pre-Training with Model Based Augmentation","date":"2023-12-15","arxiv_id":"2312.09844","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-computationally-efficient-inverse","title":"Toward Computationally Efficient Inverse Reinforcement Learning via Reward Shaping","date":"2023-12-15","arxiv_id":"2312.09983","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-parameter-sharing-for-multi-agent","title":"Adaptive parameter sharing for multi-agent reinforcement learning","date":"2023-12-14","arxiv_id":"2312.09009","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-mc-reward-automated-dense-reward-design","title":"Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft","date":"2023-12-14","arxiv_id":"2312.09238","repositories_listed":0,"syntology":null},{"url":null,"slug":"improve-robustness-of-reinforcement-learning","title":"Improve Robustness of Reinforcement Learning against Observation Perturbations via $l_\\infty$ Lipschitz Policy Networks","date":"2023-12-14","arxiv_id":"2312.08751","repositories_listed":0,"syntology":null},{"url":null,"slug":"lift-unsupervised-reinforcement-learning-with","title":"LiFT: Unsupervised Reinforcement Learning with Foundation Models as Teachers","date":"2023-12-14","arxiv_id":"2312.08958","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-path-recourse","title":"Personalized Path Recourse for Reinforcement Learning Agents","date":"2023-12-14","arxiv_id":"2312.08724","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-language-models-as-a-source-of-rewards","title":"Vision-Language Models as a Source of Rewards","date":"2023-12-14","arxiv_id":"2312.09187","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-invitation-to-deep-reinforcement-learning","title":"An Invitation to Deep Reinforcement Learning","date":"2023-12-13","arxiv_id":"2312.08365","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-robotic-navigation-an-evaluation-of","title":"Enhancing Robotic Navigation: An Evaluation of Single and Multi-Objective Reinforcement Learning Strategies","date":"2023-12-13","arxiv_id":"2312.07953","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-user-simulation-to-develop-and","title":"Leveraging User Simulation to Develop and Evaluate Conversational Information Access Agents","date":"2023-12-13","arxiv_id":"2312.08041","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-exploration-in-reinforcement-learning","title":"Safe Exploration in Reinforcement Learning: Training Backup Control Barrier Functions with Zero Training Time Safety Violations","date":"2023-12-13","arxiv_id":"2312.07828","repositories_listed":0,"syntology":null},{"url":null,"slug":"noise-distribution-decomposition-based-multi","title":"Noise Distribution Decomposition based Multi-Agent Distributional Reinforcement Learning","date":"2023-12-12","arxiv_id":"2312.07025","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-network-intrusion-detection-via","title":"Real-time Network Intrusion Detection via Decision Transformers","date":"2023-12-12","arxiv_id":"2312.07696","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-decentralized-cooperative-platoon","title":"Scalable Decentralized Cooperative Platoon using Multi-Agent Deep Reinforcement Learning","date":"2023-12-11","arxiv_id":"2312.06858","repositories_listed":0,"syntology":null},{"url":null,"slug":"spreeze-high-throughput-parallel","title":"Spreeze: High-Throughput Parallel Reinforcement Learning Framework","date":"2023-12-11","arxiv_id":"2312.06126","repositories_listed":0,"syntology":null},{"url":null,"slug":"dcir-dynamic-consistency-intrinsic-reward-for","title":"DCIR: Dynamic Consistency Intrinsic Reward for Multi-Agent Reinforcement Learning","date":"2023-12-10","arxiv_id":"2312.05783","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-conditioned-semantic-search-based","title":"Language-Conditioned Semantic Search-Based Policy for Robotic Manipulation Tasks","date":"2023-12-10","arxiv_id":"2312.05925","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-reinforcement-learning-and-large","title":"PerfRL: A Small Language Model Framework for Efficient Code Optimization","date":"2023-12-09","arxiv_id":"2312.05657","repositories_listed":0,"syntology":null},{"url":null,"slug":"position-control-of-an-acoustic-cavitation","title":"Position control of an acoustic cavitation bubble by reinforcement learning","date":"2023-12-09","arxiv_id":"2312.05674","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserving-multi-agent-reinforcement","title":"Privacy Preserving Multi-Agent Reinforcement Learning in Supply Chains","date":"2023-12-09","arxiv_id":"2312.05686","repositories_listed":0,"syntology":null},{"url":null,"slug":"canaries-and-whistles-resilient-drone","title":"Canaries and Whistles: Resilient Drone Communication Networks with (or without) Deep Reinforcement Learning","date":"2023-12-08","arxiv_id":"2312.04940","repositories_listed":0,"syntology":null},{"url":null,"slug":"darlei-deep-accelerated-reinforcement","title":"DARLEI: Deep Accelerated Reinforcement Learning with Evolutionary Intelligence","date":"2023-12-08","arxiv_id":"2312.05171","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-risk-in-reinforcement-learning-a","title":"Modeling Risk in Reinforcement Learning: A Literature Mapping","date":"2023-12-08","arxiv_id":"2312.05231","repositories_listed":0,"syntology":null},{"url":null,"slug":"pruning-convolutional-filters-via","title":"Pruning Convolutional Filters via Reinforcement Learning with Entropy Minimization","date":"2023-12-08","arxiv_id":"2312.04918","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-active-feature-acquisition-1","title":"Evaluation of Active Feature Acquisition Methods for Static Feature Settings","date":"2023-12-06","arxiv_id":"2312.03619","repositories_listed":0,"syntology":null},{"url":null,"slug":"macca-offline-multi-agent-reinforcement","title":"MACCA: Offline Multi-agent Reinforcement Learning with Causal Credit Assignment","date":"2023-12-06","arxiv_id":"2312.03644","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-q-learning-approach-to-the-continuous","title":"A Q-learning approach to the continuous control problem of robot inverted pendulum balancing","date":"2023-12-05","arxiv_id":"2312.02649","repositories_listed":0,"syntology":null},{"url":null,"slug":"similarity-based-knowledge-transfer-for-cross","title":"Similarity-based Knowledge Transfer for Cross-Domain Reinforcement Learning","date":"2023-12-05","arxiv_id":"2312.03764","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-drill-boom-hole-seeking-control","title":"Integrated Drill Boom Hole-Seeking Control via Reinforcement Learning","date":"2023-12-04","arxiv_id":"2312.01836","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-reinforcement-learning-agents-and","title":"Training Reinforcement Learning Agents and Humans With Difficulty-Conditioned Generators","date":"2023-12-04","arxiv_id":"2312.02309","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-offline-policy-selection-sample","title":"When is Offline Policy Selection Sample Efficient for Reinforcement Learning?","date":"2023-12-04","arxiv_id":"2312.02355","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-for-4","title":"Distributed Reinforcement Learning for Molecular Design: Antioxidant case","date":"2023-12-03","arxiv_id":"2312.01267","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-active-feature-acquisition","title":"Evaluation of Active Feature Acquisition Methods for Time-varying Feature Settings","date":"2023-12-03","arxiv_id":"2312.01530","repositories_listed":0,"syntology":null},{"url":"/paper/regularity-as-intrinsic-reward-for-free-play-1","slug":"regularity-as-intrinsic-reward-for-free-play-1","title":"Regularity as Intrinsic Reward for Free Play","date":"2023-12-03","arxiv_id":"2312.01473","repositories_listed":0,"syntology":{"n":16,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":7,"n_honours":0,"n_violates":0,"n_no_contract":9,"n_pointer_only":16,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 0 where Syntology's instrument failed) · 7 unverified","sample_list":"/paper/regularity-as-intrinsic-reward-for-free-play-1#ran","syntology_url":"https://syntology.ai/paper/2312.01473","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2312.01473"}},"official":null}},{"url":null,"slug":"a-survey-of-temporal-credit-assignment-in","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","date":"2023-12-02","arxiv_id":"2312.01072","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlhf-and-iia-perverse-incentives","title":"RLHF and IIA: Perverse Incentives","date":"2023-12-02","arxiv_id":"2312.01057","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-in-tensor","title":"Safe Reinforcement Learning in Tensor Reproducing Kernel Hilbert Space","date":"2023-12-01","arxiv_id":"2312.00727","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-deep-reinforcement-learning-2","title":"Data-efficient Deep Reinforcement Learning for Vehicle Trajectory Control","date":"2023-11-30","arxiv_id":"2311.18393","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-concave-utility","title":"Efficient Model-Based Concave Utility Reinforcement Learning through Greedy Mirror Descent","date":"2023-11-30","arxiv_id":"2311.18346","repositories_listed":0,"syntology":null},{"url":null,"slug":"handling-cost-and-constraints-with-off-policy","title":"Handling Cost and Constraints with Off-Policy Deep Reinforcement Learning","date":"2023-11-30","arxiv_id":"2311.18684","repositories_listed":0,"syntology":null},{"url":null,"slug":"bias-resilient-multi-step-off-policy-goal","title":"Bias Resilient Multi-Step Off-Policy Goal-Conditioned Reinforcement Learning","date":"2023-11-29","arxiv_id":"2311.17565","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-graphs-feedback","title":"Deep Reinforcement Learning Graphs: Feedback Motion Planning via Neural Lyapunov Verification","date":"2023-11-29","arxiv_id":"2311.17587","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-inverse-reinforcement-learning-harder-than","title":"Is Inverse Reinforcement Learning Harder than Standard Reinforcement Learning? A Theoretical Perspective","date":"2023-11-29","arxiv_id":"2312.00054","repositories_listed":0,"syntology":null},{"url":null,"slug":"langwm-language-grounded-world-model","title":"LanGWM: Language Grounded World Model","date":"2023-11-29","arxiv_id":"2311.17593","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-model-correction-in","title":"Maximum Entropy Model Correction in Reinforcement Learning","date":"2023-11-29","arxiv_id":"2311.17855","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-online-and-offline-reinforcement","title":"Stable Online and Offline Reinforcement Learning for Antibody CDRH3 Design","date":"2023-11-29","arxiv_id":"2401.05341","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-step-reinforcement-learning-for","title":"Two-Step Reinforcement Learning for Multistage Strategy Card Game","date":"2023-11-29","arxiv_id":"2311.17305","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-enhanced-deep-reinforcement","title":"Digital Twin-Enhanced Deep Reinforcement Learning for Resource Management in Networks Slicing","date":"2023-11-28","arxiv_id":"2311.16876","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-offline-planning-from","title":"Goal-conditioned Offline Planning from Curious Exploration","date":"2023-11-28","arxiv_id":"2311.16996","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-in-a-simulated","title":"Safe Reinforcement Learning in a Simulated Robotic Arm","date":"2023-11-28","arxiv_id":"2312.09468","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-observer-design-using-reinforcement","title":"Optimal Observer Design Using Reinforcement Learning and Quadratic Neural Networks","date":"2023-11-27","arxiv_id":"2311.16272","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-diffusion","title":"Reinforcement Learning from Diffusion Feedback: Q* for Image Search","date":"2023-11-27","arxiv_id":"2311.15648","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-based-reinforcement-learning-for-1","title":"Value-Based Reinforcement Learning for Digital Twins in Cloud Computing","date":"2023-11-27","arxiv_id":"2311.15985","repositories_listed":0,"syntology":null},{"url":null,"slug":"frac-q-learning-a-reinforcement-learning-with","title":"FRAC-Q-Learning: A Reinforcement Learning with Boredom Avoidance Processes for Social Robots","date":"2023-11-26","arxiv_id":"2311.15327","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximation-of-convex-envelope-using","title":"Approximation of Convex Envelope Using Reinforcement Learning","date":"2023-11-24","arxiv_id":"2311.14421","repositories_listed":0,"syntology":null},{"url":null,"slug":"directly-attention-loss-adjusted-prioritized","title":"Directly Attention Loss Adjusted Prioritized Experience Replay","date":"2023-11-24","arxiv_id":"2311.14390","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-open-world-reinforcement-learning","title":"Efficient Open-world Reinforcement Learning via Knowledge Distillation and Autonomous Rule Discovery","date":"2023-11-24","arxiv_id":"2311.14270","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-ensure-a-safe-control-strategy-towards","title":"How to ensure a safe control strategy? Towards a SRL for urban transit autonomous operation","date":"2023-11-24","arxiv_id":"2311.14457","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-instance-refinement-for-cross","title":"Multi-modal Instance Refinement for Cross-domain Action Recognition","date":"2023-11-24","arxiv_id":"2311.14281","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-statistical","title":"Reinforcement Learning from Statistical Feedback: the Journey from AB Testing to ANT Testing","date":"2023-11-24","arxiv_id":"2311.14766","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-inference-in-reinforcement","title":"Probabilistic Inference in Reinforcement Learning Done Right","date":"2023-11-22","arxiv_id":"2311.13294","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlif-interactive-imitation-learning-as","title":"RLIF: Interactive Imitation Learning as Reinforcement Learning","date":"2023-11-21","arxiv_id":"2311.12996","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapter-rl-adaptation-of-any-agent-using","title":"ADAPTER-RL: Adaptation of Any Agent using Reinforcement Learning","date":"2023-11-20","arxiv_id":"2311.11537","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-representation-with-efficient","title":"Provable Representation with Efficient Planning for Partial Observable Reinforcement Learning","date":"2023-11-20","arxiv_id":"2311.12244","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-wireless","title":"Offline Reinforcement Learning for Wireless Network Optimization with Mixture Datasets","date":"2023-11-19","arxiv_id":"2311.11423","repositories_listed":0,"syntology":null},{"url":null,"slug":"tactile-active-inference-reinforcement","title":"Tactile Active Inference Reinforcement Learning for Efficient Robotic Manipulation Skill Acquisition","date":"2023-11-19","arxiv_id":"2311.11287","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-feature-extractors-for","title":"Benchmarking Feature Extractors for Reinforcement Learning-Based Semiconductor Defect Localization","date":"2023-11-18","arxiv_id":"2311.11145","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-port-navigation-with-ranging","title":"Autonomous Port Navigation With Ranging Sensors Using Model-Based Reinforcement Learning","date":"2023-11-17","arxiv_id":"2312.05257","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-standardized-reinforcement-learning","title":"Towards a Standardized Reinforcement Learning Framework for AAM Contingency Management","date":"2023-11-17","arxiv_id":"2311.10805","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-unsupervised-reinforcement","title":"Augmenting Unsupervised Reinforcement Learning with Self-Reference","date":"2023-11-16","arxiv_id":"2311.09692","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-lqr-using-reinforcement-learning","title":"Data-Driven LQR using Reinforcement Learning and Quadratic Neural Networks","date":"2023-11-16","arxiv_id":"2311.10235","repositories_listed":0,"syntology":null},{"url":null,"slug":"runtime-verification-of-learning-properties","title":"Runtime Verification of Learning Properties for Reinforcement Learning Algorithms","date":"2023-11-16","arxiv_id":"2311.09811","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-autonomous-path-planning-using","title":"Safety Aware Autonomous Path Planning Using Model Predictive Reinforcement Learning for Inland Waterways","date":"2023-11-16","arxiv_id":"2311.09878","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-to-reward-machine-based","title":"Adversarial Attacks to Reward Machine-based Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.09014","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-mrl-based-design-solution-for-ris-assisted","title":"An MRL-Based Design Solution for RIS-Assisted MU-MIMO Wireless System under Time-Varying Channels","date":"2023-11-15","arxiv_id":"2311.08840","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-the-robustness-of-intelligence","title":"Assessing the Robustness of Intelligence-Driven Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.09027","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-foundation-of-distributionally-robust","title":"On the Foundation of Distributionally Robust Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.09018","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-curriculum-generation-for","title":"Self-Supervised Curriculum Generation for Autonomous Reinforcement Learning without Task-Specific Knowledge","date":"2023-11-15","arxiv_id":"2311.09195","repositories_listed":0,"syntology":null},{"url":null,"slug":"supported-trust-region-optimization-for","title":"Supported Trust Region Optimization for Offline Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.08935","repositories_listed":0,"syntology":null}],"record_sha256":"ebd237a5d7fd257f0b21e5b97500e6ffa2ac747fc7852f026de2ea6dd61905ad","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}