{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/68","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":68,"pages_in_order":132,"rows_per_page":100,"rows":[6701,6800],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/67","next":"/task/reinforcement-learning/papers/69","papers":[{"url":null,"slug":"markov-chain-concentration-with-an","title":"Markov Chain Concentration with an Application in Reinforcement Learning","date":"2023-01-07","arxiv_id":"2301.02926","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-reset-free-reinforcement-learning-by","title":"Provable Reset-free Reinforcement Learning by No-Regret Reduction","date":"2023-01-06","arxiv_id":"2301.02389","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-air-traffic","title":"Reinforcement Learning-Based Air Traffic Deconfliction","date":"2023-01-05","arxiv_id":"2301.01861","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-enhancement-of-reinforcement-learning","title":"Value Enhancement of Reinforcement Learning via Efficient and Robust Trust Region Optimization","date":"2023-01-05","arxiv_id":"2301.02220","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-based-mpc-from-big-data-using","title":"Learning-based MPC from Big Data Using Reinforcement Learning","date":"2023-01-04","arxiv_id":"2301.01667","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-aided-metaverse-over-wireless","title":"UAV aided Metaverse over Wireless Communications: A Reinforcement Learning Approach","date":"2023-01-04","arxiv_id":"2301.01474","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-succinct-summary-of-reinforcement-learning","title":"A Succinct Summary of Reinforcement Learning","date":"2023-01-03","arxiv_id":"2301.01379","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-conservative-q-learning-for","title":"Contextual Conservative Q-Learning for Offline Reinforcement Learning","date":"2023-01-03","arxiv_id":"2301.01298","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-approximate-dynamic-programming-by","title":"Faster Reinforcement Learning by Freezing Slow States","date":"2023-01-03","arxiv_id":"2301.00922","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-evaluation-for-reinforcement-learning","title":"Offline Evaluation for Reinforcement Learning-based Recommendation: A Critical Issue and Some Alternatives","date":"2023-01-03","arxiv_id":"2301.00993","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-an-energy","title":"Safe Reinforcement Learning for an Energy-Efficient Driver Assistance System","date":"2023-01-03","arxiv_id":"2301.00904","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-deployable-rl-what-s-broken-with-rl","title":"Towards Deployable RL - What's Broken with RL Research and a Potential Fix","date":"2023-01-03","arxiv_id":"2301.01320","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-asset-1","title":"Deep Reinforcement Learning for Asset Allocation: Reward Clipping","date":"2023-01-02","arxiv_id":"2301.05300","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-filtering-for-reinforcement-learning","title":"Safety Filtering for Reinforcement Learning-based Adaptive Cruise Control","date":"2023-01-02","arxiv_id":"2301.00884","repositories_listed":0,"syntology":null},{"url":null,"slug":"gait-generating-aesthetic-indoor-tours-with","title":"GAIT: Generating Aesthetic Indoor Tours with Deep Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"local-guided-global-paired-similarity","title":"Local-Guided Global: Paired Similarity Representation for Visual Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policycleanse-backdoor-detection-and","title":"PolicyCleanse: Backdoor Detection and Mitigation for Competitive Reinforcement Learning","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"releaps-reinforcement-learning-based","title":"ReLeaPS : Reinforcement Learning-based Illumination Planning for Generalized Photometric Stereo","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-visual-reinforcement-learning-via","title":"Stabilizing Visual Reinforcement Learning via Asymmetric Interactive Cooperation","date":"2023-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"new-challenges-in-reinforcement-learning-a","title":"New Challenges in Reinforcement Learning: A Survey of Security and Privacy","date":"2022-12-31","arxiv_id":"2301.00188","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-experts-advice-aggregation-framework","title":"A Novel Experts Advice Aggregation Framework Using Deep Reinforcement Learning for Portfolio Management","date":"2022-12-29","arxiv_id":"2212.14477","repositories_listed":0,"syntology":null},{"url":null,"slug":"backward-curriculum-reinforcement-learning","title":"Backward Curriculum Reinforcement Learning","date":"2022-12-29","arxiv_id":"2212.14214","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-transforming-reinforcement-learning-by","title":"On Transforming Reinforcement Learning by Transformer: The Development Trajectory","date":"2022-12-29","arxiv_id":"2212.14164","repositories_listed":0,"syntology":null},{"url":null,"slug":"certifying-safety-in-reinforcement-learning","title":"Certifying Safety in Reinforcement Learning under Adversarial Perturbation Attacks","date":"2022-12-28","arxiv_id":"2212.14115","repositories_listed":0,"syntology":null},{"url":null,"slug":"don-t-do-it-safer-reinforcement-learning-with","title":"Don't do it: Safer Reinforcement Learning With Rule-based Guidance","date":"2022-12-28","arxiv_id":"2212.13819","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-a-sequence-to-sequence-nlp-model","title":"Improving a sequence-to-sequence nlp model using a reinforcement learning policy algorithm","date":"2022-12-28","arxiv_id":"2212.14117","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automating-codenames-spymasters-with","title":"Towards automating Codenames spymasters with deep reinforcement learning","date":"2022-12-28","arxiv_id":"2212.14104","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-abstractions-via","title":"Towards Learning Abstractions via Reinforcement Learning","date":"2022-12-28","arxiv_id":"2212.13980","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-with-2","title":"Model-Based Reinforcement Learning with Multinomial Logistic Function Approximation","date":"2022-12-27","arxiv_id":"2212.13540","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-scheduling-of-island-integrated","title":"Optimal scheduling of island integrated energy systems considering multi-uncertainties and hydrothermal simultaneous transmission: A deep reinforcement learning approach","date":"2022-12-27","arxiv_id":"2212.13472","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-heat-pump","title":"Deep Reinforcement Learning for Heat Pump Control","date":"2022-12-24","arxiv_id":"2212.12716","repositories_listed":0,"syntology":null},{"url":null,"slug":"shiro-soft-hierarchical-reinforcement","title":"SHIRO: Soft Hierarchical Reinforcement Learning","date":"2022-12-24","arxiv_id":"2212.12786","repositories_listed":0,"syntology":null},{"url":null,"slug":"streaming-traffic-flow-prediction-based-on","title":"Streaming Traffic Flow Prediction Based on Continuous Reinforcement Learning","date":"2022-12-24","arxiv_id":"2212.12767","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinated-multi-agent-reinforcement","title":"Coordinated Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Swarms in Autonomous Mobile Access Applications","date":"2022-12-23","arxiv_id":"2304.08493","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-memetic-algorithm-with-reinforcement","title":"A Memetic Algorithm with Reinforcement Learning for Sociotechnical Production Scheduling","date":"2022-12-21","arxiv_id":"2212.10936","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-is-not-enough-robustifying","title":"Imitation Is Not Enough: Robustifying Imitation with Reinforcement Learning for Challenging Driving Scenarios","date":"2022-12-21","arxiv_id":"2212.11419","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversar-adversarial-search-and-rescue-via","title":"AdverSAR: Adversarial Search and Rescue via Multi-Agent Reinforcement Learning","date":"2022-12-20","arxiv_id":"2212.10064","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-approach-to-conflict-free-multi-agent","title":"Bandit approach to conflict-free multi-agent Q-learning in view of photonic implementation","date":"2022-12-20","arxiv_id":"2212.09926","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-quantum-soft-actor-critic-for","title":"Variational Quantum Soft Actor-Critic for Robotic Arm Control","date":"2022-12-20","arxiv_id":"2212.11681","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexterous-manipulation-from-images-autonomous","title":"Dexterous Manipulation from Images: Autonomous Real-World RL via Substep Guidance","date":"2022-12-19","arxiv_id":"2212.09902","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-text","title":"Inverse Reinforcement Learning for Text Summarization","date":"2022-12-19","arxiv_id":"2212.09917","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-policy-identification-in-active","title":"Near-optimal Policy Identification in Active Reinforcement Learning","date":"2022-12-19","arxiv_id":"2212.09510","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-policy-gradient-algorithms","title":"Quantum policy gradient algorithms","date":"2022-12-19","arxiv_id":"2212.09328","repositories_listed":0,"syntology":null},{"url":null,"slug":"taming-lagrangian-chaos-with-multi-objective","title":"Taming Lagrangian Chaos with Multi-Objective Reinforcement Learning","date":"2022-12-19","arxiv_id":"2212.09612","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-coreference-resolution-based-on","title":"Neural Coreference Resolution based on Reinforcement Learning","date":"2022-12-18","arxiv_id":"2212.09028","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-reinforcement-learning-with","title":"Risk-Sensitive Reinforcement Learning with Exponential Criteria","date":"2022-12-18","arxiv_id":"2212.09010","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-cyber-resilience-of-networked","title":"Enhancing Cyber Resilience of Networked Microgrids using Vertical Federated Reinforcement Learning","date":"2022-12-17","arxiv_id":"2212.08973","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-variable-representation-for","title":"Latent Variable Representation for Reinforcement Learning","date":"2022-12-17","arxiv_id":"2212.08765","repositories_listed":0,"syntology":null},{"url":null,"slug":"level-k-meta-learning-for-pedestrian-aware","title":"Cognitive Level-$k$ Meta-Learning for Safe and Pedestrian-Aware Autonomous Driving","date":"2022-12-17","arxiv_id":"2212.08800","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-trained-image-encoder-for-generalizable","title":"Pre-Trained Image Encoder for Generalizable Visual Reinforcement Learning","date":"2022-12-17","arxiv_id":"2212.08860","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-robot-reinforcement-learning-with","title":"Offline Robot Reinforcement Learning with Uncertainty-Guided Human Expert Sampling","date":"2022-12-16","arxiv_id":"2212.08232","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-agile-active","title":"Reinforcement Learning for Agile Active Target Sensing with a UAV","date":"2022-12-16","arxiv_id":"2212.08214","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-4","title":"Multi-Agent Reinforcement Learning with Shared Resources for Inventory Management","date":"2022-12-15","arxiv_id":"2212.07684","repositories_listed":0,"syntology":null},{"url":null,"slug":"ungeneralizable-contextual-logistic-bandit-in","title":"Reinforcement Learning in Credit Scoring and Underwriting","date":"2022-12-15","arxiv_id":"2212.07632","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-resource-restricted","title":"Efficient Exploration in Resource-Restricted Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.06988","repositories_listed":0,"syntology":null},{"url":null,"slug":"explaining-agent-s-decision-making-in-a","title":"Explaining Agent's Decision-making in a Hierarchical Reinforcement Learning Scenario","date":"2022-12-14","arxiv_id":"2212.06967","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-strategies-for-cooperative-multi","title":"Hierarchical Strategies for Cooperative Multi-Agent Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.07397","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-control-based-on-deep-reinforcement","title":"Quantum Control based on Deep Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.07385","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-system","title":"Reinforcement Learning in System Identification","date":"2022-12-14","arxiv_id":"2212.07123","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-off-policy-evaluation-in","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","date":"2022-12-13","arxiv_id":"2212.06355","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-in-reinforcement-1","title":"Improving generalization in reinforcement learning through forked agents","date":"2022-12-13","arxiv_id":"2212.06451","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-approach-to-fair-solar-pv","title":"Model-Free Approach to Fair Solar PV Curtailment Using Reinforcement Learning","date":"2022-12-13","arxiv_id":"2212.06542","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-sample-efficient-distributed","title":"Scalable and Sample Efficient Distributed Policy Gradient Algorithms in Multi-Agent Networked Systems","date":"2022-12-13","arxiv_id":"2212.06357","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-reinforcement-learning-security","title":"A Survey on Reinforcement Learning Security with Application to Autonomous Driving","date":"2022-12-12","arxiv_id":"2212.06123","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-model-free-reinforcement-learning","title":"Evaluating Model-free Reinforcement Learning toward Safety-critical Tasks","date":"2022-12-12","arxiv_id":"2212.05727","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-reinforcement-learning-2","title":"Nearly Minimax Optimal Reinforcement Learning for Linear Markov Decision Processes","date":"2022-12-12","arxiv_id":"2212.06132","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-through-the-lens-of-learning","title":"Generalization Through the Lens of Learning Dynamics","date":"2022-12-11","arxiv_id":"2212.05377","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-deep-reinforcement-learning-for-1","title":"Hierarchical Deep Reinforcement Learning for VWAP Strategy Optimization","date":"2022-12-11","arxiv_id":"2212.14670","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-deep-reinforcement-learning-1","title":"Off-Policy Deep Reinforcement Learning Algorithms for Handling Various Robotic Manipulator Tasks","date":"2022-12-11","arxiv_id":"2212.05572","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-differentially-private","title":"Near-Optimal Differentially Private Reinforcement Learning","date":"2022-12-09","arxiv_id":"2212.04680","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-predicting-traffic","title":"Reinforcement Learning for Predicting Traffic Accidents","date":"2022-12-09","arxiv_id":"2212.04677","repositories_listed":0,"syntology":null},{"url":null,"slug":"confidence-conditioned-value-functions-for","title":"Confidence-Conditioned Value Functions for Offline Reinforcement Learning","date":"2022-12-08","arxiv_id":"2212.04607","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-resilient-power","title":"Reinforcement Learning for Resilient Power Grids","date":"2022-12-08","arxiv_id":"2212.04069","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-self-imitation-learning-from","title":"Accelerating Self-Imitation Learning from Demonstrations via Policy Constraints and Q-Ensemble","date":"2022-12-07","arxiv_id":"2212.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learned-simulation-environment-to-model","title":"A Learned Simulation Environment to Model Plant Growth in Indoor Farming","date":"2022-12-06","arxiv_id":"2212.03155","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-deep-reinforcement-learning-based-1","title":"A Novel Deep Reinforcement Learning Based Automated Stock Trading System Using Cascaded LSTM Networks","date":"2022-12-06","arxiv_id":"2212.02721","repositories_listed":0,"syntology":null},{"url":null,"slug":"misspecification-in-inverse-reinforcement","title":"Misspecification in Inverse Reinforcement Learning","date":"2022-12-06","arxiv_id":"2212.03201","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-uav-control-with","title":"Reinforcement Learning for UAV control with Policy and Reward Shaping","date":"2022-12-06","arxiv_id":"2212.03828","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-inverse-reinforcement-learning-via","title":"Safe Inverse Reinforcement Learning via Control Barrier Function","date":"2022-12-06","arxiv_id":"2212.02753","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-self-predictive-learning-for","title":"Understanding Self-Predictive Learning for Reinforcement Learning","date":"2022-12-06","arxiv_id":"2212.03319","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-look-at-risk","title":"Robust Reinforcement Learning for Risk-Sensitive Linear Quadratic Gaussian Control","date":"2022-12-05","arxiv_id":"2212.02072","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiated-federated-reinforcement","title":"Differentiated Federated Reinforcement Learning Based Traffic Offloading on Space-Air-Ground Integrated Networks","date":"2022-12-05","arxiv_id":"2212.02075","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-mapp-efficient-multi-agent-reinforcement","title":"E-MAPP: Efficient Multi-Agent Reinforcement Learning with Parallel Program Guidance","date":"2022-12-05","arxiv_id":"2212.02064","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-shielding-for-reinforcement-learning","title":"Online Shielding for Reinforcement Learning","date":"2022-12-04","arxiv_id":"2212.01861","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-reinforcement-learning-via","title":"Constrained Reinforcement Learning via Dissipative Saddle Flow Dynamics","date":"2022-12-03","arxiv_id":"2212.01505","repositories_listed":0,"syntology":null},{"url":null,"slug":"dacom-learning-delay-aware-communication-for","title":"DACOM: Learning Delay-Aware Communication for Multi-Agent Reinforcement Learning","date":"2022-12-03","arxiv_id":"2212.01619","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-demonstrations","title":"Reinforcement learning with Demonstrations from Mismatched Task under Sparse Reward","date":"2022-12-03","arxiv_id":"2212.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"ct-dqn-control-tutored-deep-reinforcement","title":"CT-DQN: Control-Tutored Deep Reinforcement Learning","date":"2022-12-02","arxiv_id":"2212.01343","repositories_listed":0,"syntology":null},{"url":null,"slug":"flow-to-control-offline-reinforcement","title":"Flow to Control: Offline Reinforcement Learning with Lossless Primitive Discovery","date":"2022-12-02","arxiv_id":"2212.01105","repositories_listed":0,"syntology":null},{"url":null,"slug":"selecting-mechanical-parameters-of-a-monopode","title":"Selecting Mechanical Parameters of a Monopode Jumping System with Reinforcement Learning","date":"2022-12-02","arxiv_id":"2212.01303","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-deep-reinforcement-learning-a","title":"Distributed Deep Reinforcement Learning: A Survey and A Multi-Player Multi-Agent Learning Toolbox","date":"2022-12-01","arxiv_id":"2212.00253","repositories_listed":0,"syntology":null},{"url":null,"slug":"launchpad-learning-to-schedule-using-offline","title":"Launchpad: Learning to Schedule Using Offline and Online RL Methods","date":"2022-12-01","arxiv_id":"2212.00639","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-mobile-health-users-as-reinforcement","title":"Modeling Mobile Health Users as Reinforcement Learning Agents","date":"2022-12-01","arxiv_id":"2212.00863","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with","title":"Safe Reinforcement Learning with Probabilistic Control Barrier Functions for Ramp Merging","date":"2022-12-01","arxiv_id":"2212.00618","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-discovery-of-multi-perspective","title":"Automatic Discovery of Multi-perspective Process Model using Reinforcement Learning","date":"2022-11-30","arxiv_id":"2211.16687","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-erl-targeted","title":"Computationally Efficient Reinforcement Learning: Targeted Exploration leveraging Simple Rules","date":"2022-11-30","arxiv_id":"2211.16691","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-copolymer-inverse-design-system","title":"Random Copolymer inverse design system orienting on Accurate discovering of Antimicrobial peptide-mimetic copolymers","date":"2022-11-30","arxiv_id":"2212.00023","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-multi-truck","title":"Reinforcement Learning for Multi-Truck Vehicle Routing Problems","date":"2022-11-30","arxiv_id":"2211.17078","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-signal-temporal","title":"Funnel-based Reward Shaping for Signal Temporal Logic Tasks in Reinforcement Learning","date":"2022-11-30","arxiv_id":"2212.03181","repositories_listed":0,"syntology":null},{"url":null,"slug":"targets-in-reinforcement-learning-to-solve","title":"Targets in Reinforcement Learning to solve Stackelberg Security Games","date":"2022-11-30","arxiv_id":"2211.17132","repositories_listed":0,"syntology":null}],"record_sha256":"d8dd554f6ccfe16c296687e73833a534b9516a97c38919fce2216791e2c9e668","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}