{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/68","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":68,"pages_in_order":135,"rows_per_page":100,"rows":[6701,6800],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/67","next":"/task/reinforcement-learning-2/papers/69","papers":[{"url":null,"slug":"federated-deep-reinforcement-learning-for-thz","title":"Federated Deep Reinforcement Learning for THz-Beam Search with Limited CSI","date":"2023-04-25","arxiv_id":"2304.13109","repositories_listed":0,"syntology":null},{"url":null,"slug":"fulfilling-formal-specifications-asap-by","title":"Fulfilling Formal Specifications ASAP by Model-free Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12508","repositories_listed":0,"syntology":null},{"url":null,"slug":"loss-and-reward-weighing-for-increased","title":"Loss- and Reward-Weighting for Efficient Distributed Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12778","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-extraction-attacks-against","title":"Model Extraction Attacks Against Reinforcement Learning Based Controllers","date":"2023-04-25","arxiv_id":"2304.13090","repositories_listed":0,"syntology":null},{"url":null,"slug":"sea-a-spatially-explicit-architecture-for","title":"SEA: A Spatially Explicit Architecture for Multi-Agent Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12532","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-theoretical-understanding-of-inverse","title":"Towards Theoretical Understanding of Inverse Reinforcement Learning","date":"2023-04-25","arxiv_id":"2304.12966","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-halftoning-via-deep-reinforcement","title":"Efficient Halftoning via Deep Reinforcement Learning","date":"2023-04-24","arxiv_id":"2304.12152","repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-optimality-in-interactive-decision","title":"Instance-Optimality in Interactive Decision Making: Toward a Non-Asymptotic Theory","date":"2023-04-24","arxiv_id":"2304.12466","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-bootstrap-based-on-policy-deep","title":"Parallel bootstrap-based on-policy deep reinforcement learning for continuous flow control applications","date":"2023-04-24","arxiv_id":"2304.12330","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-resilience-to-environment-poisoning","title":"Policy Resilience to Environment Poisoning Attacks on Reinforcement Learning","date":"2023-04-24","arxiv_id":"2304.12151","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-knowledge","title":"Reinforcement Learning with Knowledge Representation and Reasoning: A Brief Survey","date":"2023-04-24","arxiv_id":"2304.12090","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-declarative-procedural-and","title":"Bridging Declarative, Procedural, and Conditional Metacognitive Knowledge Gap Using Deep Reinforcement Learning","date":"2023-04-23","arxiv_id":"2304.11739","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-an-abrupt-model","title":"Reinforcement Learning with an Abrupt Model Change","date":"2023-04-22","arxiv_id":"2304.11460","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cubic-regularized-policy-newton-algorithm","title":"A Cubic-regularized Policy Newton Algorithm for Reinforcement Learning","date":"2023-04-21","arxiv_id":"2304.10951","repositories_listed":0,"syntology":null},{"url":null,"slug":"amp-in-the-wild-learning-robust-agile-natural","title":"Learning Robust, Agile, Natural Legged Locomotion Skills in the Wild","date":"2023-04-21","arxiv_id":"2304.10888","repositories_listed":0,"syntology":null},{"url":null,"slug":"aiding-reinforcement-learning-for-set-point","title":"Aiding reinforcement learning for set point control","date":"2023-04-20","arxiv_id":"2304.10289","repositories_listed":0,"syntology":null},{"url":"/paper/efficient-deep-reinforcement-learning","slug":"efficient-deep-reinforcement-learning","title":"Efficient Deep Reinforcement Learning Requires Regulating Overfitting","date":"2023-04-20","arxiv_id":"2304.10466","repositories_listed":0,"syntology":{"n":15,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":6,"n_honours":0,"n_violates":0,"n_no_contract":9,"n_pointer_only":0,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 0 where Syntology's instrument failed) · 6 unverified","sample_list":"/paper/efficient-deep-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2304.10466","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2304.10466"}},"official":null}},{"url":null,"slug":"interpretability-for-conditional-coordinated","title":"Interpretability for Conditional Coordinated Behavior in Multi-Agent Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10375","repositories_listed":0,"syntology":null},{"url":null,"slug":"mastering-asymmetrical-multiplayer-game-with","title":"Mastering Asymmetrical Multiplayer Game with Multi-Agent Asymmetric-Evolution Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10124","repositories_listed":0,"syntology":null},{"url":null,"slug":"observer-feedback-feedforward-controller","title":"Observer-Feedback-Feedforward Controller Structures in Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10276","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-picking-cluttered","title":"Reinforcement Learning for Picking Cluttered General Objects with Dense Object Descriptors","date":"2023-04-20","arxiv_id":"2304.10108","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-nonlinear-set-point-control-with","title":"Robust nonlinear set-point control with reinforcement learning","date":"2023-04-20","arxiv_id":"2304.10277","repositories_listed":0,"syntology":null},{"url":null,"slug":"topological-guided-actor-critic-modular","title":"Topological Guided Actor-Critic Modular Learning of Continuous Systems with Temporal Objectives","date":"2023-04-20","arxiv_id":"2304.10041","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-memory-reinforcement-learning","title":"Two-Memory Reinforcement Learning","date":"2023-04-20","arxiv_id":"2304.10098","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-agent-for-beyond-visual-range-air","title":"Autonomous Agent for Beyond Visual Range Air Combat: A Deep Reinforcement Learning Approach","date":"2023-04-19","arxiv_id":"2304.09669","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-policy-gradient-method-for-pomdps","title":"End-to-End Policy Gradient Method for POMDPs and Explainable Agents","date":"2023-04-19","arxiv_id":"2304.09769","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-fairness-with-unknown-dynamics","title":"Long-Term Fairness with Unknown Dynamics","date":"2023-04-19","arxiv_id":"2304.09362","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-6","title":"Model Based Reinforcement Learning for Personalized Heparin Dosing","date":"2023-04-19","arxiv_id":"2304.10000","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-deep-q-learning-with-distributed","title":"Quantum deep Q learning with distributed prioritized experience replay","date":"2023-04-19","arxiv_id":"2304.09648","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-multi-agent-reinforcement-6","title":"Cooperative Multi-Agent Reinforcement Learning for Inventory Management","date":"2023-04-18","arxiv_id":"2304.08769","repositories_listed":0,"syntology":null},{"url":null,"slug":"feasible-policy-iteration","title":"Feasible Policy Iteration for Safe Reinforcement Learning","date":"2023-04-18","arxiv_id":"2304.08845","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-bounds-for-adaptive-inverse","title":"Finite-Sample Bounds for Adaptive Inverse Reinforcement Learning using Passive Langevin Dynamics","date":"2023-04-18","arxiv_id":"2304.09123","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-feedback-efficient-reinforcement","title":"Provably Feedback-Efficient Reinforcement Learning via Active Reward Learning","date":"2023-04-18","arxiv_id":"2304.08944","repositories_listed":0,"syntology":null},{"url":null,"slug":"searching-for-ribbons-with-machine-learning","title":"Searching for ribbons with machine learning","date":"2023-04-18","arxiv_id":"2304.09304","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-on-a-q-learning-algorithm-application","title":"A study on a Q-Learning algorithm application to a manufacturing assembly problem","date":"2023-04-17","arxiv_id":"2304.08375","repositories_listed":0,"syntology":null},{"url":null,"slug":"alzheimers-disease-diagnosis-using-machine","title":"Alzheimers Disease Diagnosis using Machine Learning: A Review","date":"2023-04-17","arxiv_id":"2304.09178","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-decision-transformer-for-recommender","title":"Causal Decision Transformer for Recommender Systems via Offline Reinforcement Learning","date":"2023-04-17","arxiv_id":"2304.07920","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-explainable-relational-reinforcement","title":"Deep Explainable Relational Reinforcement Learning: A Neuro-Symbolic Approach","date":"2023-04-17","arxiv_id":"2304.08349","repositories_listed":0,"syntology":null},{"url":null,"slug":"integration-of-reinforcement-learning-based","title":"Integration of Reinforcement Learning Based Behavior Planning With Sampling Based Motion Planning for Automated Driving","date":"2023-04-17","arxiv_id":"2304.08280","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-deep-reinforcement-learning-for","title":"Leveraging Deep Reinforcement Learning for Metacognitive Interventions across Intelligent Tutoring Systems","date":"2023-04-17","arxiv_id":"2304.09821","repositories_listed":0,"syntology":null},{"url":null,"slug":"mddl-a-framework-for-reinforcement-learning","title":"MDDL: A Framework for Reinforcement Learning-based Position Allocation in Multi-Channel Feed","date":"2023-04-17","arxiv_id":"2304.09087","repositories_listed":0,"syntology":null},{"url":null,"slug":"reclaimer-a-reinforcement-learning-approach","title":"Reclaimer: A Reinforcement Learning Approach to Dynamic Resource Allocation for Cloud Microservices","date":"2023-04-17","arxiv_id":"2304.07941","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-automated-defense-strategies-using","title":"Training Automated Defense Strategies Using Graph-based Cyber Attack Simulations","date":"2023-04-17","arxiv_id":"2304.11084","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-on-longitudinal-car-following-model","title":"Car-Following Models: A Multidisciplinary Review","date":"2023-04-14","arxiv_id":"2304.07143","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandit-based-policy-invariant-explicit","title":"Bandit-Based Policy Invariant Explicit Shaping for Incorporating External Advice in Reinforcement Learning","date":"2023-04-14","arxiv_id":"2304.07163","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-reward-agnostic-exploration","title":"Minimax-Optimal Reward-Agnostic Exploration in Reinforcement Learning","date":"2023-04-14","arxiv_id":"2304.07278","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-applied-to-an","title":"Deep reinforcement learning applied to an assembly sequence planning problem with user preferences","date":"2023-04-13","arxiv_id":"2304.06567","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-dynamic-shielding-for-safe-and","title":"Model-based Dynamic Shielding for Safe and Efficient Multi-Agent Reinforcement Learning","date":"2023-04-13","arxiv_id":"2304.06281","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-level-latent-variable-model-for-sample","title":"MABL: Bi-Level Latent-Variable World Model for Sample-Efficient Multi-Agent Reinforcement Learning","date":"2023-04-12","arxiv_id":"2304.06011","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-symmetry-and-heuristic","title":"Exploiting Symmetry and Heuristic Demonstrations in Off-policy Reinforcement Learning for Robotic Manipulation","date":"2023-04-12","arxiv_id":"2304.06055","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tale-of-sampling-and-estimation-in","title":"A Tale of Sampling and Estimation in Discounted Reinforcement Learning","date":"2023-04-11","arxiv_id":"2304.05073","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-ris-aided-eh-noma-networks-a-deep","title":"Active RIS-aided EH-NOMA Networks: A Deep Reinforcement Learning Approach","date":"2023-04-11","arxiv_id":"2304.12184","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-interpretability-performance-trade","title":"Optimal Interpretability-Performance Trade-off of Classification Trees with Black-Box Reinforcement Learning","date":"2023-04-11","arxiv_id":"2304.05839","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-tutor-better-supported","title":"Reinforcement Learning Tutor Better Supported Lower Performers in a Math Task","date":"2023-04-11","arxiv_id":"2304.04933","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-assisted-genetic","title":"A Reinforcement Learning-assisted Genetic Programming Algorithm for Team Formation Problem Considering Person-Job Matching","date":"2023-04-08","arxiv_id":"2304.04022","repositories_listed":0,"syntology":null},{"url":null,"slug":"dream-adaptive-reinforcement-learning-based","title":"DREAM: Adaptive Reinforcement Learning based on Attention Mechanism for Temporal Knowledge Graph Reasoning","date":"2023-04-08","arxiv_id":"2304.03984","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-modular-framework-for-stabilizing-deep","title":"A modular framework for stabilizing deep reinforcement learning control","date":"2023-04-07","arxiv_id":"2304.03422","repositories_listed":0,"syntology":null},{"url":null,"slug":"crisp-curriculum-inducing-primitive-informed","title":"CRISP: Curriculum Inducing Primitive Informed Subgoal Prediction for Hierarchical Reinforcement Learning","date":"2023-04-07","arxiv_id":"2304.03535","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-optimal-1","title":"Deep Reinforcement Learning Based Optimal Infinite-Horizon Control of Probabilistic Boolean Control Networks","date":"2023-04-07","arxiv_id":"2304.03489","repositories_listed":0,"syntology":null},{"url":null,"slug":"full-gradient-deep-reinforcement-learning-for","title":"Full Gradient Deep Reinforcement Learning for Average-Reward Criterion","date":"2023-04-07","arxiv_id":"2304.03729","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-decision-focused-learning-for-reward","title":"Decision-Focused Model-based Reinforcement Learning for Reward Transfer","date":"2023-04-06","arxiv_id":"2304.03365","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-exploration-in-reinforcement","title":"Constrained Exploration in Reinforcement Learning with Optimality Preservation","date":"2023-04-05","arxiv_id":"2304.03104","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-action-anticipation-in-multi-agent","title":"Off-Policy Action Anticipation in Multi-Agent Reinforcement Learning","date":"2023-04-04","arxiv_id":"2304.01447","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-irrigation-efficiency-using-deep","title":"Optimizing Irrigation Efficiency using Deep Reinforcement Learning in the Field","date":"2023-04-04","arxiv_id":"2304.01435","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularization-of-the-policy-updates-for","title":"Regularization of the policy updates for stabilizing Mean Field Games","date":"2023-04-04","arxiv_id":"2304.01547","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-aware-distributed-multi-agent","title":"Risk-Aware Distributed Multi-Agent Reinforcement Learning","date":"2023-04-04","arxiv_id":"2304.02005","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-and-parameter-estimation-for-affine","title":"State and Parameter Estimation for Affine Nonlinear Systems","date":"2023-04-04","arxiv_id":"2304.01526","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tutorial-introduction-to-reinforcement","title":"A Tutorial Introduction to Reinforcement Learning","date":"2023-04-03","arxiv_id":"2304.00803","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-pick-up-in-dynamic-action-space","title":"Action Pick-up in Dynamic Action Space Reinforcement Learning","date":"2023-04-03","arxiv_id":"2304.00873","repositories_listed":0,"syntology":null},{"url":null,"slug":"dribblebot-dynamic-legged-manipulation-in-the","title":"DribbleBot: Dynamic Legged Manipulation in the Wild","date":"2023-04-03","arxiv_id":"2304.01159","repositories_listed":0,"syntology":null},{"url":null,"slug":"empirical-design-in-reinforcement-learning","title":"Empirical Design in Reinforcement Learning","date":"2023-04-03","arxiv_id":"2304.01315","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantitative-trading-using-deep-q-learning","title":"Quantitative Trading using Deep Q Learning","date":"2023-04-03","arxiv_id":"2304.06037","repositories_listed":0,"syntology":null},{"url":null,"slug":"experimentation-platforms-meet-reinforcement","title":"Experimentation Platforms Meet Reinforcement Learning: Bayesian Sequential Decision-Making for Continuous Monitoring","date":"2023-04-02","arxiv_id":"2304.00420","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-and-robust-model-based","title":"Risk-Sensitive and Robust Model-Based Reinforcement Learning and Planning","date":"2023-04-02","arxiv_id":"2304.00573","repositories_listed":0,"syntology":null},{"url":null,"slug":"mastering-pair-trading-with-risk-aware","title":"Mastering Pair Trading with Risk-Aware Recurrent Reinforcement Learning","date":"2023-04-01","arxiv_id":"2304.00364","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-microgrid-collaborative-optimization","title":"Multi-Microgrid Collaborative Optimization Scheduling Using an Improved Multi-Agent Soft Actor-Critic Algorithm","date":"2023-04-01","arxiv_id":"2304.01223","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-off-policy-reinforcement","title":"An Efficient Off-Policy Reinforcement Learning Algorithm for the Continuous-Time LQR Problem","date":"2023-03-31","arxiv_id":"2303.17819","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-in-markov","title":"Online Reinforcement Learning in Markov Decision Process Using Linear Programming","date":"2023-03-31","arxiv_id":"2304.00155","repositories_listed":0,"syntology":null},{"url":null,"slug":"reduce-reuse-recycle-selective-reincarnation","title":"Selective Reincarnation: Offline-to-Online Multi-Agent Reinforcement Learning","date":"2023-03-31","arxiv_id":"2304.00977","repositories_listed":0,"syntology":null},{"url":null,"slug":"textit-e-uber-a-crowdsourcing-platform-for","title":"$\\textit{e-Uber}$: A Crowdsourcing Platform for Electric Vehicle-based Ride- and Energy-sharing","date":"2023-03-31","arxiv_id":"2304.04753","repositories_listed":0,"syntology":null},{"url":null,"slug":"finetuning-from-offline-reinforcement","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","date":"2023-03-30","arxiv_id":"2303.17396","repositories_listed":0,"syntology":null},{"url":null,"slug":"does-sparsity-help-in-learning-misspecified","title":"Does Sparsity Help in Learning Misspecified Linear Bandits?","date":"2023-03-29","arxiv_id":"2303.16998","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-complicated-manipulation-skills-via","title":"Learning Complicated Manipulation Skills via Deterministic Policy with Limited Demonstrations","date":"2023-03-29","arxiv_id":"2303.16469","repositories_listed":0,"syntology":null},{"url":null,"slug":"physical-deep-reinforcement-learning-towards","title":"Physical Deep Reinforcement Learning Towards Safety Guarantee","date":"2023-03-29","arxiv_id":"2303.16860","repositories_listed":0,"syntology":null},{"url":null,"slug":"plan4mc-skill-reinforcement-learning-and","title":"Skill Reinforcement Learning and Planning for Open-World Long-Horizon Tasks","date":"2023-03-29","arxiv_id":"2303.16563","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-methods-for-discrete-time","title":"Policy Gradient Methods for Discrete Time Linear Quadratic Regulator With Random Parameters","date":"2023-03-29","arxiv_id":"2303.16548","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-deep-hedging","title":"Quantum Deep Hedging","date":"2023-03-29","arxiv_id":"2303.16585","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-background-music-for-a-fighting-game","title":"Adaptive Background Music for a Fighting Game: A Multi-Instrument Volume Modulation Approach","date":"2023-03-28","arxiv_id":"2303.15734","repositories_listed":0,"syntology":null},{"url":null,"slug":"bc-irl-learning-generalizable-reward","title":"BC-IRL: Learning Generalizable Reward Functions from Demonstrations","date":"2023-03-28","arxiv_id":"2303.16194","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-optimization-of-2","title":"On-line reinforcement learning for optimization of real-life energy trading strategy","date":"2023-03-28","arxiv_id":"2303.16266","repositories_listed":0,"syntology":null},{"url":null,"slug":"bi-manual-block-assembly-via-sim-to-real","title":"Bi-Manual Block Assembly via Sim-to-Real Reinforcement Learning","date":"2023-03-27","arxiv_id":"2303.14870","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-novel-quality-diversity-methods-for","title":"Exploring Novel Quality Diversity Methods For Generalization in Reinforcement Learning","date":"2023-03-26","arxiv_id":"2303.14592","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-generative-models-with-goal","title":"Learning Generative Models with Goal-conditioned Reinforcement Learning","date":"2023-03-26","arxiv_id":"2303.14811","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-packaging-optimization-with","title":"Robotic Packaging Optimization with Reinforcement Learning","date":"2023-03-26","arxiv_id":"2303.14693","repositories_listed":0,"syntology":null},{"url":null,"slug":"causality-detection-for-efficient-multi-agent","title":"Causality Detection for Efficient Multi-Agent Reinforcement Learning","date":"2023-03-24","arxiv_id":"2303.14227","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-path-following-on-rivers-using","title":"Robust Path Following on Rivers Using Bootstrapped Reinforcement Learning","date":"2023-03-24","arxiv_id":"2303.15178","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-knockoffs-for-variable-selection","title":"Sequential Knockoffs for Variable Selection in Reinforcement Learning","date":"2023-03-24","arxiv_id":"2303.14281","repositories_listed":0,"syntology":null},{"url":null,"slug":"boosting-reinforcement-learning-and-planning","title":"Boosting Reinforcement Learning and Planning with Demonstrations: A Survey","date":"2023-03-23","arxiv_id":"2303.13489","repositories_listed":0,"syntology":null},{"url":null,"slug":"connected-superlevel-set-in-deep","title":"Connected Superlevel Set in (Deep) Reinforcement Learning and its Application to Minimax Theorems","date":"2023-03-23","arxiv_id":"2303.12981","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-road-configurations-for-improved","title":"Adaptive Road Configurations for Improved Autonomous Vehicle-Pedestrian Interactions using Reinforcement Learning","date":"2023-03-22","arxiv_id":"2303.12289","repositories_listed":0,"syntology":null}],"record_sha256":"036298fe60de6f321b6549ae5dc84183892d4a2cc65a0ef2f3c571fcb56106c9","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}