{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/67","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":67,"pages_in_order":135,"rows_per_page":100,"rows":[6601,6700],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/66","next":"/task/reinforcement-learning-2/papers/68","papers":[{"url":null,"slug":"reinforcement-learning-finetuned-vision-code","title":"Learning UI-to-Code Reverse Generator Using Visual Critic Without Rendering","date":"2023-05-24","arxiv_id":"2305.14637","repositories_listed":0,"syntology":null},{"url":null,"slug":"replicable-reinforcement-learning","title":"Replicable Reinforcement Learning","date":"2023-05-24","arxiv_id":"2305.15284","repositories_listed":0,"syntology":null},{"url":null,"slug":"successor-predecessor-intrinsic-exploration","title":"Successor-Predecessor Intrinsic Exploration","date":"2023-05-24","arxiv_id":"2305.15277","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-random-search-for-multi-objective","title":"Combining Multi-Objective Bayesian Optimization with Reinforcement Learning for TinyML","date":"2023-05-23","arxiv_id":"2305.14109","repositories_listed":0,"syntology":null},{"url":null,"slug":"chemgymrl-an-interactive-framework-for","title":"ChemGymRL: An Interactive Framework for Reinforcement Learning for Digital Chemistry","date":"2023-05-23","arxiv_id":"2305.14177","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-proximal-policy-optimization","title":"Constrained Proximal Policy Optimization","date":"2023-05-23","arxiv_id":"2305.14216","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-of-a-simulated-mri-scanner-with-deep","title":"Control of a simulated MRI scanner with deep reinforcement learning","date":"2023-05-23","arxiv_id":"2305.13979","repositories_listed":0,"syntology":null},{"url":null,"slug":"l-sa-learning-under-explored-targets-in-multi","title":"L-SA: Learning Under-Explored Targets in Multi-Target Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13741","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-model-self-improvement-by","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","date":"2023-05-23","arxiv_id":"2305.14483","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-experience-replay-for-continual","title":"OER: Offline Experience Replay for Continual Offline Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13804","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-long-term-value-for-auction-based","title":"Optimizing Long-term Value for Auction-Based Recommender Systems via On-Policy Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13747","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-policy-gradient-arborescence-for","title":"Proximal Policy Gradient Arborescence for Quality Diversity Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.13795","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlboost-boosting-supervised-models-using-deep","title":"RLBoost: Boosting Supervised Models using Deep Reinforcement Learning","date":"2023-05-23","arxiv_id":"2305.14115","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aware-transmission-scheduling-a","title":"Semantic-aware Transmission Scheduling: a Monotonicity-driven Deep Reinforcement Learning Approach","date":"2023-05-23","arxiv_id":"2305.13706","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-action-supervision-in-reinforcement","title":"Adaptive action supervision in reinforcement learning from real-world multi-agent demonstrations","date":"2023-05-22","arxiv_id":"2305.13030","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributionally-robust-optimization","title":"Achieving the Asymptotically Optimal Sample Complexity of Offline Reinforcement Learning: A DRO-Based Approach","date":"2023-05-22","arxiv_id":"2305.13289","repositories_listed":0,"syntology":null},{"url":null,"slug":"hjb-based-online-safe-reinforcement-learning","title":"Lagrangian-based online safe reinforcement learning for state-constrained systems","date":"2023-05-22","arxiv_id":"2305.12967","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-primal-dual-reinforcement-learning","title":"Offline Primal-Dual Reinforcement Learning for Linear MDPs","date":"2023-05-22","arxiv_id":"2305.12944","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-6","title":"Offline Reinforcement Learning with Additional Covering Distributions","date":"2023-05-22","arxiv_id":"2305.12679","repositories_listed":0,"syntology":null},{"url":null,"slug":"tom-learning-policy-aware-models-for-model","title":"TOM: Learning Policy-Aware Models for Model-Based Reinforcement Learning via Transition Occupancy Matching","date":"2023-05-22","arxiv_id":"2305.12663","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-robust","title":"A Reinforcement Learning Approach for Robust Supervisory Control of UAVs Under Disturbances","date":"2023-05-21","arxiv_id":"2305.12543","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-optimal-energy-management-strategy","title":"Towards Optimal Energy Management Strategy for Hybrid Electric Vehicle with Reinforcement Learning","date":"2023-05-21","arxiv_id":"2305.12365","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-framework-for-provably-stable-and","title":"A Framework for Provably Stable and Consistent Training of Deep Feedforward Networks","date":"2023-05-20","arxiv_id":"2305.12125","repositories_listed":0,"syntology":null},{"url":null,"slug":"game-theoretical-analysis-of-reviewer-rewards","title":"Game-Theoretical Analysis of Reviewer Rewards in Peer-Review Journal Systems: Analysis and Experimental Evaluation using Deep Reinforcement Learning","date":"2023-05-20","arxiv_id":"2305.12088","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-adaptation-for-sample-efficient","title":"Model-based adaptation for sample efficient transfer in reinforcement learning control of parameter-varying systems","date":"2023-05-20","arxiv_id":"2305.12158","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-first-order-meta-reinforcement-learning","title":"On First-Order Meta-Reinforcement Learning with Moreau Envelopes","date":"2023-05-20","arxiv_id":"2305.12216","repositories_listed":0,"syntology":null},{"url":null,"slug":"shattering-the-agent-environment-interface","title":"Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models","date":"2023-05-19","arxiv_id":"2305.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-world-to-solve-social","title":"Understanding the World to Solve Social Dilemmas Using Multi-Agent Reinforcement Learning","date":"2023-05-19","arxiv_id":"2305.11358","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-design-method-of-building-pipeline","title":"Automatic Design Method of Building Pipeline Layout Based on Deep Reinforcement Learning","date":"2023-05-18","arxiv_id":"2305.10760","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-reparameterization-of-reward","title":"Bayesian Reparameterization of Reward-Conditioned Reinforcement Learning with Energy-based Models","date":"2023-05-18","arxiv_id":"2305.11340","repositories_listed":0,"syntology":null},{"url":null,"slug":"black-box-targeted-reward-poisoning-attack","title":"Black-Box Targeted Reward Poisoning Attack Against Online Deep Reinforcement Learning","date":"2023-05-18","arxiv_id":"2305.10681","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-metric-tensor-regularized-policy","title":"Deep Metric Tensor Regularized Policy Gradient","date":"2023-05-18","arxiv_id":"2305.11017","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-packgen-a-deep-reinforcement-learning","title":"Deep PackGen: A Deep Reinforcement Learning Framework for Adversarial Network Packet Generation","date":"2023-05-18","arxiv_id":"2305.11039","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-development-of-social-preferences-in","title":"Parallel development of social preferences in fish and machines","date":"2023-05-18","arxiv_id":"2305.11137","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantically-aligned-task-decomposition-in","title":"Semantically Aligned Task Decomposition in Multi-Agent Reinforcement Learning","date":"2023-05-18","arxiv_id":"2305.10865","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proof-of-imitation-of-wasserstein-inverse","title":"A proof of imitation of Wasserstein inverse reinforcement learning for multi-objective optimization","date":"2023-05-17","arxiv_id":"2305.10089","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-in-job-shop-scheduling","title":"Curriculum Learning in Job Shop Scheduling using Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10192","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-individual-rewards-in-collective","title":"Discovering Individual Rewards in Collective Behavior through Inverse Multi-Agent Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10548","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-conflict-management-for-uam-with","title":"Integrated Conflict Management for UAM with Strategic Demand Capacity Balancing and Learning-based Tactical Deconfliction","date":"2023-05-17","arxiv_id":"2305.10556","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-robust-average-reward","title":"Model-Free Robust Average-Reward Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10504","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-methods","title":"Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges","date":"2023-05-17","arxiv_id":"2305.10091","repositories_listed":0,"syntology":null},{"url":null,"slug":"pragmatic-reasoning-in-structured-signaling","title":"Pragmatic Reasoning in Structured Signaling Games","date":"2023-05-17","arxiv_id":"2305.10167","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-agnostic-fine-tuning-provable","title":"Reward-agnostic Fine-tuning: Provable Statistical Benefits of Hybrid Reinforcement Learning","date":"2023-05-17","arxiv_id":"2305.10282","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-to-maximize","title":"Deep Reinforcement Learning to Maximize Arterial Usage during Extreme Congestion","date":"2023-05-16","arxiv_id":"2305.09600","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-safe-robot-control","title":"Reinforcement Learning for Safe Robot Control using Control Lyapunov Barrier Functions","date":"2023-05-16","arxiv_id":"2305.09793","repositories_listed":0,"syntology":null},{"url":null,"slug":"horizon-free-reinforcement-learning-in-1","title":"Horizon-free Reinforcement Learning in Adversarial Linear Mixture MDPs","date":"2023-05-15","arxiv_id":"2305.08359","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-multi-agent-reinforcement-learning-for","title":"Toward Multi-Agent Reinforcement Learning for Distributed Event-Triggered Control","date":"2023-05-15","arxiv_id":"2305.08723","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-td-learning-over-finite-rate","title":"Federated TD Learning over Finite-Rate Erasure Channels: Linear Speedup under Markovian Sampling","date":"2023-05-14","arxiv_id":"2305.08104","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-with-2","title":"Inverse Reinforcement Learning With Constraint Recovery","date":"2023-05-14","arxiv_id":"2305.08130","repositories_listed":0,"syntology":null},{"url":null,"slug":"gaussian-prior-reinforcement-learning-for","title":"Gaussian Prior Reinforcement Learning for Nested Named Entity Recognition","date":"2023-05-12","arxiv_id":"2305.07266","repositories_listed":0,"syntology":null},{"url":null,"slug":"identify-estimate-and-bound-the-uncertainty","title":"Identify, Estimate and Bound the Uncertainty of Reinforcement Learning for Autonomous Driving","date":"2023-05-12","arxiv_id":"2305.07487","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-17","title":"Multi-Agent Reinforcement Learning for Network Routing in Integrated Access Backhaul Networks","date":"2023-05-12","arxiv_id":"2305.16170","repositories_listed":0,"syntology":null},{"url":null,"slug":"s-reinforce-a-neuro-symbolic-policy-gradient","title":"S-REINFORCE: A Neuro-Symbolic Policy Gradient Approach for Interpretable Reinforcement Learning","date":"2023-05-12","arxiv_id":"2305.07367","repositories_listed":0,"syntology":null},{"url":"/paper/towards-generalizable-reinforcement-learning","slug":"towards-generalizable-reinforcement-learning","title":"Towards Generalizable Reinforcement Learning for Trade Execution","date":"2023-05-12","arxiv_id":"2307.11685","repositories_listed":0,"syntology":{"n":1,"n_ran":1,"n_constructed":1,"n_ran_checked":1,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":1,"n_pointer_only":1,"phrase":"1 ran (of which 1 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified; the one sample that ran constructed an object rather than computing a result","sample_list":"/paper/towards-generalizable-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2307.11685","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2307.11685"}},"official":null}},{"url":null,"slug":"deep-reinforcement-learning-for-interference","title":"Deep Reinforcement Learning for Interference Management in UAV-based 3D Networks: Potentials and Challenges","date":"2023-05-11","arxiv_id":"2305.07069","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-practical-robust-reinforcement-learning","title":"On Practical Robust Reinforcement Learning: Practical Uncertainty Set and Double-Agent Algorithm","date":"2023-05-11","arxiv_id":"2305.06657","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-memory-mapping-using-deep","title":"Optimizing Memory Mapping Using Deep Reinforcement Learning","date":"2023-05-11","arxiv_id":"2305.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-theoretical-understanding-of-data","title":"Towards Theoretical Understanding of Data-Driven Policy Refinement","date":"2023-05-11","arxiv_id":"2305.06796","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-proof-of-convergence-of-inverse","title":"A proof of convergence of inverse reinforcement learning for multi-objective optimization","date":"2023-05-10","arxiv_id":"2305.06137","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-option-dependent-analysis-of-regret","title":"An Option-Dependent Analysis of Regret Minimization Algorithms in Finite-Horizon Semi-Markov Decision Processes","date":"2023-05-10","arxiv_id":"2305.06936","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-resource-1","title":"Deep Reinforcement Learning Based Resource Allocation for Cloud Native Wireless Network","date":"2023-05-10","arxiv_id":"2305.06249","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovery-of-optimal-quantum-error-correcting","title":"Discovery of Optimal Quantum Error Correcting Codes via Reinforcement Learning","date":"2023-05-10","arxiv_id":"2305.06378","repositories_listed":0,"syntology":null},{"url":null,"slug":"honeyiot-adaptive-high-interaction-honeypot","title":"HoneyIoT: Adaptive High-Interaction Honeypot for IoT Devices Through Reinforcement Learning","date":"2023-05-10","arxiv_id":"2305.06430","repositories_listed":0,"syntology":null},{"url":null,"slug":"mixture-of-personality-improved-spiking-actor","title":"Mixture of personality improved Spiking actor network for efficient multi-agent cooperation","date":"2023-05-10","arxiv_id":"2305.05898","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-2","title":"Cooperative Multi-Agent Reinforcement Learning: Asynchronous Communication and Linear Function Approximation","date":"2023-05-10","arxiv_id":"2305.06446","repositories_listed":0,"syntology":null},{"url":null,"slug":"supplementing-gradient-based-reinforcement","title":"Supplementing Gradient-Based Reinforcement Learning with Simple Evolutionary Ideas","date":"2023-05-10","arxiv_id":"2305.07571","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessment-of-reinforcement-learning","title":"Assessment of Reinforcement Learning Algorithms for Nuclear Power Plant Fuel Optimization","date":"2023-05-09","arxiv_id":"2305.05812","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperating-graph-neural-networks-with-deep","title":"Cooperating Graph Neural Networks with Deep Reinforcement Learning for Vaccine Prioritization","date":"2023-05-09","arxiv_id":"2305.05163","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-language-models-with-generative","title":"Fine-tuning Language Models with Generative Adversarial Reward Modelling","date":"2023-05-09","arxiv_id":"2305.06176","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlocator-reinforcement-learning-for-bug","title":"RLocator: Reinforcement Learning for Bug Localization","date":"2023-05-09","arxiv_id":"2305.05586","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-learning-path-navigation-based-on","title":"Adaptive Learning Path Navigation Based on Knowledge Tracing and Reinforcement Learning","date":"2023-05-08","arxiv_id":"2305.04475","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-oriented-inference-of-environment-from","title":"Goal-oriented inference of environment from redundant observations","date":"2023-05-08","arxiv_id":"2305.04432","repositories_listed":0,"syntology":null},{"url":null,"slug":"truncating-trajectories-in-monte-carlo","title":"Truncating Trajectories in Monte Carlo Reinforcement Learning","date":"2023-05-07","arxiv_id":"2305.04361","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-offline-model-based-reinforcement","title":"A Survey on Offline Model-Based Reinforcement Learning","date":"2023-05-05","arxiv_id":"2305.03360","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-reinforcement-learning-with-limited","title":"Bayesian Reinforcement Learning with Limited Cognitive Load","date":"2023-05-05","arxiv_id":"2305.03263","repositories_listed":0,"syntology":null},{"url":null,"slug":"biophysical-cybernetics-of-directed-evolution","title":"Reinforcement Learning for Control of Evolutionary and Ecological Processes","date":"2023-05-05","arxiv_id":"2305.03340","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-real-time-bidding-in-online","title":"Improving Real-Time Bidding in Online Advertising Using Markov Decision Processes and Machine Learning Techniques","date":"2023-05-05","arxiv_id":"2305.04889","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-from-teachers-to-learners","title":"Knowledge Transfer from Teachers to Learners in Growing-Batch Reinforcement Learning","date":"2023-05-05","arxiv_id":"2305.03870","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-causal-entropy-inverse-constrained","title":"Maximum Causal Entropy Inverse Constrained Reinforcement Learning","date":"2023-05-04","arxiv_id":"2305.02857","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-delayed-composite","title":"Reinforcement Learning with Delayed, Composite, and Partially Anonymous Reward","date":"2023-05-04","arxiv_id":"2305.02527","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-population-assisted-off-policy","title":"Rethinking Population-assisted Off-policy Reinforcement Learning","date":"2023-05-04","arxiv_id":"2305.02949","repositories_listed":0,"syntology":null},{"url":null,"slug":"gym-precice-reinforcement-learning","title":"Gym-preCICE: Reinforcement Learning Environments for Active Flow Control","date":"2023-05-03","arxiv_id":"2305.02033","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-machine-co-adaption-interface-via","title":"Human Machine Co-adaption Interface via Cooperation Markov Decision Process System","date":"2023-05-03","arxiv_id":"2305.02058","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-yaw-control-algorithm-for-wind","title":"An Improved Yaw Control Algorithm for Wind Turbines via Reinforcement Learning","date":"2023-05-02","arxiv_id":"2305.01299","repositories_listed":0,"syntology":null},{"url":null,"slug":"representations-and-exploration-for-deep","title":"Representations and Exploration for Deep Reinforcement Learning using Singular Value Decomposition","date":"2023-05-01","arxiv_id":"2305.00654","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-learning-of-policy-with-unknown","title":"Joint Learning of Policy with Unknown Temporal Constraints for Safe Reinforcement Learning","date":"2023-04-30","arxiv_id":"2305.00576","repositories_listed":0,"syntology":null},{"url":null,"slug":"relbot-a-transfer-learning-approach-to","title":"A Transfer Learning Approach to Minimize Reinforcement Learning Risks in Energy Optimization for Smart Buildings","date":"2023-04-30","arxiv_id":"2305.00365","repositories_listed":0,"syntology":null},{"url":null,"slug":"srl-assisted-afm-generating-planar","title":"SRL-Assisted AFM: Generating Planar Unstructured Quadrilateral Meshes with Supervised and Reinforcement Learning-Assisted Advancing Front Method","date":"2023-04-30","arxiv_id":"2305.00540","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-based-on-self","title":"Meta-Reinforcement Learning Based on Self-Supervised Task Representation Learning","date":"2023-04-29","arxiv_id":"2305.00286","repositories_listed":0,"syntology":null},{"url":null,"slug":"systematic-review-on-reinforcement-learning","title":"Systematic Review on Reinforcement Learning in the Field of Fintech","date":"2023-04-29","arxiv_id":"2305.07466","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-federated-reinforcement-learning-framework","title":"A Federated Reinforcement Learning Framework for Link Activation in Multi-link Wi-Fi Networks","date":"2023-04-28","arxiv_id":"2304.14720","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-for","title":"Active Reinforcement Learning for Personalized Stress Monitoring in Everyday Settings","date":"2023-04-28","arxiv_id":"2305.00111","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-policy-optimization-in-deep","title":"Adversarial Policy Optimization in Deep Reinforcement Learning","date":"2023-04-27","arxiv_id":"2304.14533","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-quantum-reinforcement-learning","title":"BCQQ: Batch-Constraint Quantum Q-Learning with Cyclic Data Re-uploading","date":"2023-04-27","arxiv_id":"2305.00905","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-flavor-structure-of-quarks-and","title":"Exploring the flavor structure of quarks and leptons with reinforcement learning","date":"2023-04-27","arxiv_id":"2304.14176","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-step-distributional-reinforcement","title":"One-Step Distributional Reinforcement Learning","date":"2023-04-27","arxiv_id":"2304.14421","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-agile-soccer-skills-for-a-bipedal","title":"Learning Agile Soccer Skills for a Bipedal Robot with Deep Reinforcement Learning","date":"2023-04-26","arxiv_id":"2304.13653","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-criteria-hardware-trojan-detection-a","title":"Multi-criteria Hardware Trojan Detection: A Reinforcement Learning Approach","date":"2023-04-26","arxiv_id":"2304.13232","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-partial","title":"Reinforcement Learning with Partial Parametric Model Knowledge","date":"2023-04-26","arxiv_id":"2304.13223","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-optimization-framework-for-herbal","title":"A optimization framework for herbal prescription planning based on deep reinforcement learning","date":"2023-04-25","arxiv_id":"2304.12828","repositories_listed":0,"syntology":null}],"record_sha256":"866c9e668721d82a3fd385920fd955abb15fee56e839efe5d6bdcf02023cdeb1","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}