{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/60","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":60,"pages_in_order":135,"rows_per_page":100,"rows":[5901,6000],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/59","next":"/task/reinforcement-learning-2/papers/61","papers":[{"url":null,"slug":"similarity-based-knowledge-transfer-for-cross","title":"Similarity-based Knowledge Transfer for Cross-Domain Reinforcement Learning","date":"2023-12-05","arxiv_id":"2312.03764","repositories_listed":0,"syntology":null},{"url":null,"slug":"foundations-for-transfer-in-reinforcement","title":"Foundations for Transfer in Reinforcement Learning: A Taxonomy of Knowledge Modalities","date":"2023-12-04","arxiv_id":"2312.01939","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-drill-boom-hole-seeking-control","title":"Integrated Drill Boom Hole-Seeking Control via Reinforcement Learning","date":"2023-12-04","arxiv_id":"2312.01836","repositories_listed":0,"syntology":null},{"url":null,"slug":"training-reinforcement-learning-agents-and","title":"Training Reinforcement Learning Agents and Humans With Difficulty-Conditioned Generators","date":"2023-12-04","arxiv_id":"2312.02309","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-offline-policy-selection-sample","title":"When is Offline Policy Selection Sample Efficient for Reinforcement Learning?","date":"2023-12-04","arxiv_id":"2312.02355","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-reinforcement-learning-for-4","title":"Distributed Reinforcement Learning for Molecular Design: Antioxidant case","date":"2023-12-03","arxiv_id":"2312.01267","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-active-feature-acquisition","title":"Evaluation of Active Feature Acquisition Methods for Time-varying Feature Settings","date":"2023-12-03","arxiv_id":"2312.01530","repositories_listed":0,"syntology":null},{"url":"/paper/regularity-as-intrinsic-reward-for-free-play-1","slug":"regularity-as-intrinsic-reward-for-free-play-1","title":"Regularity as Intrinsic Reward for Free Play","date":"2023-12-03","arxiv_id":"2312.01473","repositories_listed":0,"syntology":{"n":16,"n_ran":9,"n_constructed":0,"n_ran_checked":9,"n_instrument":0,"n_unverified":7,"n_honours":0,"n_violates":0,"n_no_contract":9,"n_pointer_only":16,"phrase":"9 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 0 where Syntology's instrument failed) · 7 unverified","sample_list":"/paper/regularity-as-intrinsic-reward-for-free-play-1#ran","syntology_url":"https://syntology.ai/paper/2312.01473","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2312.01473"}},"official":null}},{"url":null,"slug":"a-multifidelity-sim-to-real-pipeline-for","title":"A Multifidelity Sim-to-Real Pipeline for Verifiable and Compositional Reinforcement Learning","date":"2023-12-02","arxiv_id":"2312.01249","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-temporal-credit-assignment-in","title":"A Survey of Temporal Credit Assignment in Deep Reinforcement Learning","date":"2023-12-02","arxiv_id":"2312.01072","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlhf-and-iia-perverse-incentives","title":"RLHF and IIA: Perverse Incentives","date":"2023-12-02","arxiv_id":"2312.01057","repositories_listed":0,"syntology":null},{"url":null,"slug":"interior-point-constrained-reinforcement","title":"A safe exploration approach to constrained Markov decision processes","date":"2023-12-01","arxiv_id":"2312.00561","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-in-tensor","title":"Safe Reinforcement Learning in Tensor Reproducing Kernel Hilbert Space","date":"2023-12-01","arxiv_id":"2312.00727","repositories_listed":0,"syntology":null},{"url":null,"slug":"trc-trust-region-conditional-value-at-risk","title":"TRC: Trust Region Conditional Value at Risk for Safe Reinforcement Learning","date":"2023-12-01","arxiv_id":"2312.00344","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-deep-reinforcement-learning-2","title":"Data-efficient Deep Reinforcement Learning for Vehicle Trajectory Control","date":"2023-11-30","arxiv_id":"2311.18393","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-model-based-concave-utility","title":"Efficient Model-Based Concave Utility Reinforcement Learning through Greedy Mirror Descent","date":"2023-11-30","arxiv_id":"2311.18346","repositories_listed":0,"syntology":null},{"url":null,"slug":"handling-cost-and-constraints-with-off-policy","title":"Handling Cost and Constraints with Off-Policy Deep Reinforcement Learning","date":"2023-11-30","arxiv_id":"2311.18684","repositories_listed":0,"syntology":null},{"url":null,"slug":"bias-resilient-multi-step-off-policy-goal","title":"Bias Resilient Multi-Step Off-Policy Goal-Conditioned Reinforcement Learning","date":"2023-11-29","arxiv_id":"2311.17565","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-graphs-feedback","title":"Deep Reinforcement Learning Graphs: Feedback Motion Planning via Neural Lyapunov Verification","date":"2023-11-29","arxiv_id":"2311.17587","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-inverse-reinforcement-learning-harder-than","title":"Is Inverse Reinforcement Learning Harder than Standard Reinforcement Learning? A Theoretical Perspective","date":"2023-11-29","arxiv_id":"2312.00054","repositories_listed":0,"syntology":null},{"url":null,"slug":"langwm-language-grounded-world-model","title":"LanGWM: Language Grounded World Model","date":"2023-11-29","arxiv_id":"2311.17593","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-model-correction-in","title":"Maximum Entropy Model Correction in Reinforcement Learning","date":"2023-11-29","arxiv_id":"2311.17855","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-based-optimal-false-data-injection","title":"Q-learning Based Optimal False Data Injection Attack on Probabilistic Boolean Control Networks","date":"2023-11-29","arxiv_id":"2311.17631","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-online-and-offline-reinforcement","title":"Stable Online and Offline Reinforcement Learning for Antibody CDRH3 Design","date":"2023-11-29","arxiv_id":"2401.05341","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-step-reinforcement-learning-for","title":"Two-Step Reinforcement Learning for Multistage Strategy Card Game","date":"2023-11-29","arxiv_id":"2311.17305","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-enhanced-deep-reinforcement","title":"Digital Twin-Enhanced Deep Reinforcement Learning for Resource Management in Networks Slicing","date":"2023-11-28","arxiv_id":"2311.16876","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-offline-planning-from","title":"Goal-conditioned Offline Planning from Curious Exploration","date":"2023-11-28","arxiv_id":"2311.16996","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-in-a-simulated","title":"Safe Reinforcement Learning in a Simulated Robotic Arm","date":"2023-11-28","arxiv_id":"2312.09468","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-observer-design-using-reinforcement","title":"Optimal Observer Design Using Reinforcement Learning and Quadratic Neural Networks","date":"2023-11-27","arxiv_id":"2311.16272","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-diffusion","title":"Reinforcement Learning from Diffusion Feedback: Q* for Image Search","date":"2023-11-27","arxiv_id":"2311.15648","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-based-reinforcement-learning-for-1","title":"Value-Based Reinforcement Learning for Digital Twins in Cloud Computing","date":"2023-11-27","arxiv_id":"2311.15985","repositories_listed":0,"syntology":null},{"url":null,"slug":"frac-q-learning-a-reinforcement-learning-with","title":"FRAC-Q-Learning: A Reinforcement Learning with Boredom Avoidance Processes for Social Robots","date":"2023-11-26","arxiv_id":"2311.15327","repositories_listed":0,"syntology":null},{"url":null,"slug":"where2start-leveraging-initial-states-for","title":"Where2Start: Leveraging initial States for Robust and Sample-Efficient Reinforcement Learning","date":"2023-11-25","arxiv_id":"2311.15089","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximation-of-convex-envelope-using","title":"Approximation of Convex Envelope Using Reinforcement Learning","date":"2023-11-24","arxiv_id":"2311.14421","repositories_listed":0,"syntology":null},{"url":null,"slug":"directly-attention-loss-adjusted-prioritized","title":"Directly Attention Loss Adjusted Prioritized Experience Replay","date":"2023-11-24","arxiv_id":"2311.14390","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-open-world-reinforcement-learning","title":"Efficient Open-world Reinforcement Learning via Knowledge Distillation and Autonomous Rule Discovery","date":"2023-11-24","arxiv_id":"2311.14270","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-ensure-a-safe-control-strategy-towards","title":"How to ensure a safe control strategy? Towards a SRL for urban transit autonomous operation","date":"2023-11-24","arxiv_id":"2311.14457","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-instance-refinement-for-cross","title":"Multi-modal Instance Refinement for Cross-domain Action Recognition","date":"2023-11-24","arxiv_id":"2311.14281","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-statistical","title":"Reinforcement Learning from Statistical Feedback: the Journey from AB Testing to ANT Testing","date":"2023-11-24","arxiv_id":"2311.14766","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-flows-for-generative-modeling-and","title":"Guided Flows for Generative Modeling and Decision Making","date":"2023-11-22","arxiv_id":"2311.13443","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-inference-in-reinforcement","title":"Probabilistic Inference in Reinforcement Learning Done Right","date":"2023-11-22","arxiv_id":"2311.13294","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-behaviors-of-mixed-traffic-via","title":"Analyzing Behaviors of Mixed Traffic via Reinforcement Learning at Unsignalized Intersections","date":"2023-11-21","arxiv_id":"2312.05325","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlif-interactive-imitation-learning-as","title":"RLIF: Interactive Imitation Learning as Reinforcement Learning","date":"2023-11-21","arxiv_id":"2311.12996","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapter-rl-adaptation-of-any-agent-using","title":"ADAPTER-RL: Adaptation of Any Agent using Reinforcement Learning","date":"2023-11-20","arxiv_id":"2311.11537","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-representation-with-efficient","title":"Provable Representation with Efficient Planning for Partial Observable Reinforcement Learning","date":"2023-11-20","arxiv_id":"2311.12244","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-and-deep-stochastic","title":"Reinforcement Learning and Deep Stochastic Optimal Control for Final Quadratic Hedging","date":"2023-11-20","arxiv_id":"2401.08600","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-timescale-control-and-communications-1","title":"Multi-Timescale Control and Communications with Deep Reinforcement Learning -- Part II: Control-Aware Radio Resource Allocation","date":"2023-11-19","arxiv_id":"2311.11280","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-wireless","title":"Offline Reinforcement Learning for Wireless Network Optimization with Mixture Datasets","date":"2023-11-19","arxiv_id":"2311.11423","repositories_listed":0,"syntology":null},{"url":null,"slug":"tactile-active-inference-reinforcement","title":"Tactile Active Inference Reinforcement Learning for Efficient Robotic Manipulation Skill Acquisition","date":"2023-11-19","arxiv_id":"2311.11287","repositories_listed":0,"syntology":null},{"url":null,"slug":"benchmarking-feature-extractors-for","title":"Benchmarking Feature Extractors for Reinforcement Learning-Based Semiconductor Defect Localization","date":"2023-11-18","arxiv_id":"2311.11145","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-port-navigation-with-ranging","title":"Autonomous Port Navigation With Ranging Sensors Using Model-Based Reinforcement Learning","date":"2023-11-17","arxiv_id":"2312.05257","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-standardized-reinforcement-learning","title":"Towards a Standardized Reinforcement Learning Framework for AAM Contingency Management","date":"2023-11-17","arxiv_id":"2311.10805","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmenting-unsupervised-reinforcement","title":"Augmenting Unsupervised Reinforcement Learning with Self-Reference","date":"2023-11-16","arxiv_id":"2311.09692","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-lqr-using-reinforcement-learning","title":"Data-Driven LQR using Reinforcement Learning and Quadratic Neural Networks","date":"2023-11-16","arxiv_id":"2311.10235","repositories_listed":0,"syntology":null},{"url":null,"slug":"runtime-verification-of-learning-properties","title":"Runtime Verification of Learning Properties for Reinforcement Learning Algorithms","date":"2023-11-16","arxiv_id":"2311.09811","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-autonomous-path-planning-using","title":"Safety Aware Autonomous Path Planning Using Model Predictive Reinforcement Learning for Inland Waterways","date":"2023-11-16","arxiv_id":"2311.09878","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-attacks-to-reward-machine-based","title":"Adversarial Attacks to Reward Machine-based Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.09014","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-mrl-based-design-solution-for-ris-assisted","title":"An MRL-Based Design Solution for RIS-Assisted MU-MIMO Wireless System under Time-Varying Channels","date":"2023-11-15","arxiv_id":"2311.08840","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-the-robustness-of-intelligence","title":"Assessing the Robustness of Intelligence-Driven Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.09027","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-foundation-of-distributionally-robust","title":"On the Foundation of Distributionally Robust Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.09018","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-curriculum-generation-for","title":"Self-Supervised Curriculum Generation for Autonomous Reinforcement Learning without Task-Specific Knowledge","date":"2023-11-15","arxiv_id":"2311.09195","repositories_listed":0,"syntology":null},{"url":null,"slug":"supported-trust-region-optimization-for","title":"Supported Trust Region Optimization for Offline Reinforcement Learning","date":"2023-11-15","arxiv_id":"2311.08935","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-neuro-inspired-hierarchical-reinforcement","title":"A Central Motor System Inspired Pre-training Reinforcement Learning for Robotic Control","date":"2023-11-14","arxiv_id":"2311.07822","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-imitation-learning-on-aggregated","title":"Adversarial Imitation Learning On Aggregated Data","date":"2023-11-14","arxiv_id":"2311.08568","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-policy-gradient-reinforcement","title":"On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling","date":"2023-11-14","arxiv_id":"2311.08290","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-mining-electric-locomotives-meet","title":"When Mining Electric Locomotives Meet Reinforcement Learning","date":"2023-11-14","arxiv_id":"2311.08153","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-deviations-perspective-on-policy","title":"A Large Deviations Perspective on Policy Gradient Algorithms","date":"2023-11-13","arxiv_id":"2311.07411","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-introduction-to-reinforcement-learning-for","title":"An introduction to reinforcement learning for neuroscience","date":"2023-11-13","arxiv_id":"2311.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-task-generalization-via","title":"Data-Efficient Task Generalization via Probabilistic Model-based Meta Reinforcement Learning","date":"2023-11-13","arxiv_id":"2311.07558","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiago-rl-simulated-reinforcement-learning","title":"TIAGo RL: Simulated Reinforcement Learning Environments with Tactile Data for Mobile Robots","date":"2023-11-13","arxiv_id":"2311.07260","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-continual-reinforcement-learning-for","title":"Towards Continual Reinforcement Learning for Quadruped Robots","date":"2023-11-12","arxiv_id":"2311.06828","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-augmented-scheduling-for-solar","title":"Out-of-Distribution-Aware Electric Vehicle Charging","date":"2023-11-10","arxiv_id":"2311.05941","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-inference-on-investment-constraints","title":"Causal Inference on Investment Constraints and Non-stationarity in Dynamic Portfolio Optimization through Reinforcement Learning","date":"2023-11-08","arxiv_id":"2311.04946","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-recurrent-reinforcement-learning","title":"Real-Time Recurrent Reinforcement Learning","date":"2023-11-08","arxiv_id":"2311.04830","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-generalization-for","title":"Reinforcement Learning Generalization for Nonlinear Systems Through Dual-Scale Homogeneity Transformations","date":"2023-11-08","arxiv_id":"2311.05013","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-method-to-improve-the-performance-of","title":"A Method to Improve the Performance of Reinforcement Learning Based on the Y Operator for a Class of Stochastic Differential Equation-Based Child-Mother Systems","date":"2023-11-07","arxiv_id":"2311.04014","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-variational-lower-bound-for-inverse","title":"A Novel Variational Lower Bound for Inverse Reinforcement Learning","date":"2023-11-07","arxiv_id":"2311.03698","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-bayesian-reinforcement-learning-for","title":"Deep Bayesian Reinforcement Learning for Spacecraft Proximity Maneuvers and Docking","date":"2023-11-07","arxiv_id":"2311.03680","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimator-coupled-reinforcement-learning-for","title":"Estimator-Coupled Reinforcement Learning for Robust Purely Tactile In-Hand Manipulation","date":"2023-11-07","arxiv_id":"2311.04060","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypothesis-network-planned-exploration-for","title":"Hypothesis Network Planned Exploration for Rapid Meta-Reinforcement Learning Adaptation","date":"2023-11-07","arxiv_id":"2311.03701","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-decentralized-traffic-signal","title":"Learning Decentralized Traffic Signal Controllers with Multi-Agent Graph Reinforcement Learning","date":"2023-11-07","arxiv_id":"2311.03756","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-twinning-from-digital-twins-to","title":"Reinforcement Twinning: from digital twins to model-based reinforcement learning","date":"2023-11-07","arxiv_id":"2311.03628","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-modular-control-via-contraction-theory","title":"Stable Modular Control via Contraction Theory for Reinforcement Learning","date":"2023-11-07","arxiv_id":"2311.03669","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-efficient-reinforcement-learning-with","title":"Time-Efficient Reinforcement Learning with Stochastic Stateful Policies","date":"2023-11-07","arxiv_id":"2311.04082","repositories_listed":0,"syntology":null},{"url":null,"slug":"environmental-impact-based-multi-agent","title":"Environmental-Impact Based Multi-Agent Reinforcement Learning","date":"2023-11-06","arxiv_id":"2311.04240","repositories_listed":0,"syntology":null},{"url":null,"slug":"kindness-in-multi-agent-reinforcement","title":"Kindness in Multi-Agent Reinforcement Learning","date":"2023-11-06","arxiv_id":"2311.04239","repositories_listed":0,"syntology":null},{"url":null,"slug":"circle-multi-turn-query-clarifications-with","title":"CIRCLE: Multi-Turn Query Clarifications with Reinforcement Learning","date":"2023-11-05","arxiv_id":"2311.02737","repositories_listed":0,"syntology":null},{"url":null,"slug":"nonlinear-multi-objective-reinforcement","title":"Multi-objective Reinforcement Learning with Nonlinear Preferences: Provable Approximation for Maximizing Expected Scalarized Return","date":"2023-11-05","arxiv_id":"2311.02544","repositories_listed":0,"syntology":null},{"url":null,"slug":"staged-reinforcement-learning-for-complex","title":"Staged Reinforcement Learning for Complex Tasks through Decomposed Environments","date":"2023-11-05","arxiv_id":"2311.02746","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-of","title":"Accelerating Reinforcement Learning of Robotic Manipulations via Feedback from Large Language Models","date":"2023-11-04","arxiv_id":"2311.02379","repositories_listed":0,"syntology":null},{"url":null,"slug":"deliverai-reinforcement-learning-based","title":"DeliverAI: Reinforcement Learning Based Distributed Path-Sharing Network for Food Deliveries","date":"2023-11-03","arxiv_id":"2311.02017","repositories_listed":0,"syntology":null},{"url":null,"slug":"epidemic-decision-making-system-based","title":"Epidemic Decision-making System Based Federated Reinforcement Learning","date":"2023-11-03","arxiv_id":"2311.01749","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-bootstrapped-reinforcement-learning","title":"Imitation Bootstrapped Reinforcement Learning","date":"2023-11-03","arxiv_id":"2311.02198","repositories_listed":0,"syntology":null},{"url":null,"slug":"llms-augmented-contextual-bandit","title":"LLMs-augmented Contextual Bandit","date":"2023-11-03","arxiv_id":"2311.02268","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-adversarial-reinforcement-learning-via","title":"Robust Adversarial Reinforcement Learning via Bounded Rationality Curricula","date":"2023-11-03","arxiv_id":"2311.01642","repositories_listed":0,"syntology":null},{"url":null,"slug":"score-models-for-offline-goal-conditioned","title":"SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning","date":"2023-11-03","arxiv_id":"2311.02013","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-reinforcement-learning-based","title":"Toward Reinforcement Learning-based Rectilinear Macro Placement Under Human Constraints","date":"2023-11-03","arxiv_id":"2311.03383","repositories_listed":0,"syntology":null},{"url":null,"slug":"anytime-competitive-reinforcement-learning","title":"Anytime-Competitive Reinforcement Learning with Policy Prior","date":"2023-11-02","arxiv_id":"2311.01568","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamsmooth-improving-model-based","title":"DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing","date":"2023-11-02","arxiv_id":"2311.01450","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fair-federated-learning-based-on","title":"Dynamic Fair Federated Learning Based on Reinforcement Learning","date":"2023-11-02","arxiv_id":"2311.00959","repositories_listed":0,"syntology":null}],"record_sha256":"bffa2ff1ef17daab85eabe0b724a065038d321b3a150d43a731477d94f63e332","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}