{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/60","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":60,"pages_in_order":132,"rows_per_page":100,"rows":[5901,6000],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/59","next":"/task/reinforcement-learning/papers/61","papers":[{"url":null,"slug":"a-neuro-inspired-hierarchical-reinforcement","title":"A Central Motor System Inspired Pre-training Reinforcement Learning for Robotic Control","date":"2023-11-14","arxiv_id":"2311.07822","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-imitation-learning-on-aggregated","title":"Adversarial Imitation Learning On Aggregated Data","date":"2023-11-14","arxiv_id":"2311.08568","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-policy-gradient-reinforcement","title":"On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling","date":"2023-11-14","arxiv_id":"2311.08290","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-mining-electric-locomotives-meet","title":"When Mining Electric Locomotives Meet Reinforcement Learning","date":"2023-11-14","arxiv_id":"2311.08153","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-large-deviations-perspective-on-policy","title":"A Large Deviations Perspective on Policy Gradient Algorithms","date":"2023-11-13","arxiv_id":"2311.07411","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-introduction-to-reinforcement-learning-for","title":"An introduction to reinforcement learning for neuroscience","date":"2023-11-13","arxiv_id":"2311.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"tiago-rl-simulated-reinforcement-learning","title":"TIAGo RL: Simulated Reinforcement Learning Environments with Tactile Data for Mobile Robots","date":"2023-11-13","arxiv_id":"2311.07260","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-continual-reinforcement-learning-for","title":"Towards Continual Reinforcement Learning for Quadruped Robots","date":"2023-11-12","arxiv_id":"2311.06828","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-inference-on-investment-constraints","title":"Causal Inference on Investment Constraints and Non-stationarity in Dynamic Portfolio Optimization through Reinforcement Learning","date":"2023-11-08","arxiv_id":"2311.04946","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-recurrent-reinforcement-learning","title":"Real-Time Recurrent Reinforcement Learning","date":"2023-11-08","arxiv_id":"2311.04830","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-generalization-for","title":"Reinforcement Learning Generalization for Nonlinear Systems Through Dual-Scale Homogeneity Transformations","date":"2023-11-08","arxiv_id":"2311.05013","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-method-to-improve-the-performance-of","title":"A Method to Improve the Performance of Reinforcement Learning Based on the Y Operator for a Class of Stochastic Differential Equation-Based Child-Mother Systems","date":"2023-11-07","arxiv_id":"2311.04014","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-variational-lower-bound-for-inverse","title":"A Novel Variational Lower Bound for Inverse Reinforcement Learning","date":"2023-11-07","arxiv_id":"2311.03698","repositories_listed":0,"syntology":null},{"url":null,"slug":"hypothesis-network-planned-exploration-for","title":"Hypothesis Network Planned Exploration for Rapid Meta-Reinforcement Learning Adaptation","date":"2023-11-07","arxiv_id":"2311.03701","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-twinning-from-digital-twins-to","title":"Reinforcement Twinning: from digital twins to model-based reinforcement learning","date":"2023-11-07","arxiv_id":"2311.03628","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-modular-control-via-contraction-theory","title":"Stable Modular Control via Contraction Theory for Reinforcement Learning","date":"2023-11-07","arxiv_id":"2311.03669","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-efficient-reinforcement-learning-with","title":"Time-Efficient Reinforcement Learning with Stochastic Stateful Policies","date":"2023-11-07","arxiv_id":"2311.04082","repositories_listed":0,"syntology":null},{"url":null,"slug":"environmental-impact-based-multi-agent","title":"Environmental-Impact Based Multi-Agent Reinforcement Learning","date":"2023-11-06","arxiv_id":"2311.04240","repositories_listed":0,"syntology":null},{"url":null,"slug":"kindness-in-multi-agent-reinforcement","title":"Kindness in Multi-Agent Reinforcement Learning","date":"2023-11-06","arxiv_id":"2311.04239","repositories_listed":0,"syntology":null},{"url":null,"slug":"circle-multi-turn-query-clarifications-with","title":"CIRCLE: Multi-Turn Query Clarifications with Reinforcement Learning","date":"2023-11-05","arxiv_id":"2311.02737","repositories_listed":0,"syntology":null},{"url":null,"slug":"staged-reinforcement-learning-for-complex","title":"Staged Reinforcement Learning for Complex Tasks through Decomposed Environments","date":"2023-11-05","arxiv_id":"2311.02746","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-of","title":"Accelerating Reinforcement Learning of Robotic Manipulations via Feedback from Large Language Models","date":"2023-11-04","arxiv_id":"2311.02379","repositories_listed":0,"syntology":null},{"url":null,"slug":"deliverai-reinforcement-learning-based","title":"DeliverAI: Reinforcement Learning Based Distributed Path-Sharing Network for Food Deliveries","date":"2023-11-03","arxiv_id":"2311.02017","repositories_listed":0,"syntology":null},{"url":null,"slug":"epidemic-decision-making-system-based","title":"Epidemic Decision-making System Based Federated Reinforcement Learning","date":"2023-11-03","arxiv_id":"2311.01749","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-bootstrapped-reinforcement-learning","title":"Imitation Bootstrapped Reinforcement Learning","date":"2023-11-03","arxiv_id":"2311.02198","repositories_listed":0,"syntology":null},{"url":null,"slug":"llms-augmented-contextual-bandit","title":"LLMs-augmented Contextual Bandit","date":"2023-11-03","arxiv_id":"2311.02268","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-adversarial-reinforcement-learning-via","title":"Robust Adversarial Reinforcement Learning via Bounded Rationality Curricula","date":"2023-11-03","arxiv_id":"2311.01642","repositories_listed":0,"syntology":null},{"url":null,"slug":"score-models-for-offline-goal-conditioned","title":"SMORE: Score Models for Offline Goal-Conditioned Reinforcement Learning","date":"2023-11-03","arxiv_id":"2311.02013","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-reinforcement-learning-based","title":"Toward Reinforcement Learning-based Rectilinear Macro Placement Under Human Constraints","date":"2023-11-03","arxiv_id":"2311.03383","repositories_listed":0,"syntology":null},{"url":null,"slug":"anytime-competitive-reinforcement-learning","title":"Anytime-Competitive Reinforcement Learning with Policy Prior","date":"2023-11-02","arxiv_id":"2311.01568","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreamsmooth-improving-model-based","title":"DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing","date":"2023-11-02","arxiv_id":"2311.01450","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-fair-federated-learning-based-on","title":"Dynamic Fair Federated Learning Based on Reinforcement Learning","date":"2023-11-02","arxiv_id":"2311.00959","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-decision-transformer-via","title":"Rethinking Decision Transformer via Hierarchical Reinforcement Learning","date":"2023-11-01","arxiv_id":"2311.00267","repositories_listed":0,"syntology":null},{"url":null,"slug":"scpo-safe-reinforcement-learning-with-safety","title":"SCPO: Safe Reinforcement Learning with Safety Critic Policy Optimization","date":"2023-11-01","arxiv_id":"2311.00880","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-robotic-reinforcement-learning","title":"Autonomous Robotic Reinforcement Learning with Asynchronous Human Feedback","date":"2023-10-31","arxiv_id":"2310.20608","repositories_listed":0,"syntology":null},{"url":null,"slug":"dropout-strategy-in-reinforcement-learning","title":"Dropout Strategy in Reinforcement Learning: Limiting the Surrogate Objective Variance in Policy Optimization Methods","date":"2023-10-31","arxiv_id":"2310.20380","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-multi-agent-motion-planning-under","title":"Safe multi-agent motion planning under uncertainty for drones using filtered reinforcement learning","date":"2023-10-31","arxiv_id":"2311.00063","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-instance-optimality-in-online-pac","title":"Towards Instance-Optimality in Online PAC Reinforcement Learning","date":"2023-10-31","arxiv_id":"2311.05638","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-batch-inverse-reinforcement","title":"Adversarial Batch Inverse Reinforcement Learning: Learn to Reward from Imperfect Demonstration for Interactive Recommendation","date":"2023-10-30","arxiv_id":"2310.19536","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-continuous-time","title":"Efficient Exploration in Continuous-time Model-based Reinforcement Learning","date":"2023-10-30","arxiv_id":"2310.19848","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-bayesian-regret-bounds-for-thompson","title":"Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning","date":"2023-10-30","arxiv_id":"2310.20007","repositories_listed":0,"syntology":null},{"url":null,"slug":"remember-what-you-did-so-you-know-what-to-do","title":"Remember what you did so you know what to do next","date":"2023-10-30","arxiv_id":"2311.01468","repositories_listed":0,"syntology":null},{"url":null,"slug":"automaton-distillation-neuro-symbolic","title":"Automaton Distillation: Neuro-Symbolic Transfer Learning for Deep Reinforcement Learning","date":"2023-10-29","arxiv_id":"2310.19137","repositories_listed":0,"syntology":null},{"url":null,"slug":"mag-gnn-reinforcement-learning-boosted-graph","title":"MAG-GNN: Reinforcement Learning Boosted Graph Neural Network","date":"2023-10-29","arxiv_id":"2310.19142","repositories_listed":0,"syntology":null},{"url":null,"slug":"gen2sim-scaling-up-robot-learning-in","title":"Gen2Sim: Scaling up Robot Learning in Simulation with Generative Models","date":"2023-10-27","arxiv_id":"2310.18308","repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-data-augmentation-for-offline","title":"Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning","date":"2023-10-27","arxiv_id":"2310.18247","repositories_listed":0,"syntology":null},{"url":null,"slug":"cqm-curriculum-reinforcement-learning-with-a","title":"CQM: Curriculum Reinforcement Learning with a Quantized World Model","date":"2023-10-26","arxiv_id":"2310.17330","repositories_listed":0,"syntology":null},{"url":null,"slug":"demonstration-regularized-rl","title":"Demonstration-Regularized RL","date":"2023-10-26","arxiv_id":"2310.17303","repositories_listed":0,"syntology":null},{"url":null,"slug":"graphical-object-centric-actor-critic","title":"Relational Object-Centric Actor-Critic","date":"2023-10-26","arxiv_id":"2310.17178","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-language-models-as-generalizable","title":"Large Language Models as Generalizable Policies for Embodied Tasks","date":"2023-10-26","arxiv_id":"2310.17722","repositories_listed":0,"syntology":null},{"url":"/paper/reward-scale-robustness-for-proximal-policy","slug":"reward-scale-robustness-for-proximal-policy","title":"Reward Scale Robustness for Proximal Policy Optimization via DreamerV3 Tricks","date":"2023-10-26","arxiv_id":"2310.17805","repositories_listed":0,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":3,"n_instrument":1,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":3,"n_pointer_only":1,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 3 with no instrument failure: 0 honoured, 0 violated, 3 with no contract checked; 1 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/reward-scale-robustness-for-proximal-policy#ran","syntology_url":"https://syntology.ai/paper/2310.17805","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2310.17805"}},"official":null}},{"url":null,"slug":"ai-agent-as-urban-planner-steering","title":"AI Agent as Urban Planner: Steering Stakeholder Dynamics in Urban Planning via Consensus-based Multi-Agent Reinforcement Learning","date":"2023-10-25","arxiv_id":"2310.16772","repositories_listed":0,"syntology":null},{"url":null,"slug":"controlled-decoding-from-language-models","title":"Controlled Decoding from Language Models","date":"2023-10-25","arxiv_id":"2310.17022","repositories_listed":0,"syntology":null},{"url":null,"slug":"imperfect-digital-twin-assisted-low-cost","title":"Imperfect Digital Twin Assisted Low Cost Reinforcement Training for Multi-UAV Networks","date":"2023-10-25","arxiv_id":"2310.16302","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-enhanced-contrastive-reinforcement","title":"Model-enhanced Contrastive Reinforcement Learning for Sequential Recommendation","date":"2023-10-25","arxiv_id":"2310.16566","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiprompter-cooperative-prompt-optimization","title":"MultiPrompter: Cooperative Prompt Optimization with Multi-Agent Reinforcement Learning","date":"2023-10-25","arxiv_id":"2310.16730","repositories_listed":0,"syntology":null},{"url":null,"slug":"pitfall-of-optimism-distributional","title":"Pitfall of Optimism: Distributional Reinforcement Learning by Randomizing Risk Criterion","date":"2023-10-25","arxiv_id":"2310.16546","repositories_listed":0,"syntology":null},{"url":null,"slug":"privately-aligning-language-models-with","title":"Privately Aligning Language Models with Reinforcement Learning","date":"2023-10-25","arxiv_id":"2310.16960","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-sbm-graphon-games","title":"Reinforcement Learning for SBM Graphon Games with Re-Sampling","date":"2023-10-25","arxiv_id":"2310.16326","repositories_listed":0,"syntology":null},{"url":null,"slug":"symphony-of-experts-orchestration-with","title":"Policy Optimization via Adv2: Adversarial Learning on Advantage Functions","date":"2023-10-25","arxiv_id":"2310.16473","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-control-centric-representations-in","title":"Towards Control-Centric Representations in Reinforcement Learning from Images","date":"2023-10-25","arxiv_id":"2310.16655","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-contextualized-real-time-multimodal-emotion","title":"A Contextualized Real-Time Multimodal Emotion Recognition for Conversational Agents using Graph Convolutional Networks in Reinforcement Learning","date":"2023-10-24","arxiv_id":"2310.18363","repositories_listed":0,"syntology":null},{"url":null,"slug":"copf-continual-learning-human-preference","title":"COPR: Continual Learning Human Preference through Optimal Policy Regularization","date":"2023-10-24","arxiv_id":"2310.15694","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-local-path","title":"Reinforcement learning based local path planning for mobile robot","date":"2023-10-24","arxiv_id":"2403.12463","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-doubly-robust-approach-to-sparse","title":"A Doubly Robust Approach to Sparse Reinforcement Learning","date":"2023-10-23","arxiv_id":"2310.15286","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-teacher-selection-for-reinforcement","title":"Active teacher selection for reinforcement learning from human feedback","date":"2023-10-23","arxiv_id":"2310.15288","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-on-the-water-applying-drl-to-autonomous","title":"AI on the Water: Applying DRL to Autonomous Vessel Navigation","date":"2023-10-23","arxiv_id":"2310.14938","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparison-of-path-following-in-ships-using","title":"Comparison of path following in ships using modern and traditional controllers","date":"2023-10-23","arxiv_id":"2310.14940","repositories_listed":0,"syntology":null},{"url":null,"slug":"diverse-priors-for-deep-reinforcement","title":"Diverse Priors for Deep Reinforcement Learning","date":"2023-10-23","arxiv_id":"2310.14864","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-robotic-manipulation-harnessing-the","title":"Enhancing Robotic Manipulation: Harnessing the Power of Multi-Task Reinforcement Learning and Single Life Reinforcement Learning in Meta-World","date":"2023-10-23","arxiv_id":"2311.12854","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-fine-tuning-made-easy-pre-training","title":"Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for Autonomous Real-World Reinforcement Learning","date":"2023-10-23","arxiv_id":"2310.15145","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-primacy-bias-in-model-based-rl","title":"Mind the Model, Not the Agent: The Primacy Bias in Model-based RL","date":"2023-10-23","arxiv_id":"2310.15017","repositories_listed":0,"syntology":null},{"url":null,"slug":"one-is-more-diverse-perspectives-within-a","title":"One is More: Diverse Perspectives within a Single Network for Efficient DRL","date":"2023-10-21","arxiv_id":"2310.14009","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-deep-reinforcement-learning-for-1","title":"Interpretable Deep Reinforcement Learning for Optimizing Heterogeneous Energy Storage Systems","date":"2023-10-20","arxiv_id":"2310.14783","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-shaping-for-happier-autonomous-cyber","title":"Reward Shaping for Happier Autonomous Cyber Security Agents","date":"2023-10-20","arxiv_id":"2310.13565","repositories_listed":0,"syntology":null},{"url":null,"slug":"tree-search-in-dag-space-with-model-based","title":"Tree Search in DAG Space with Model-based Reinforcement Learning for Causal Discovery","date":"2023-10-20","arxiv_id":"2310.13576","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-gymnasium-a-unified-safe-reinforcement","title":"Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark","date":"2023-10-19","arxiv_id":"2310.12567","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerate-presolve-in-large-scale-linear","title":"Accelerate Presolve in Large-Scale Linear Programming via Reinforcement Learning","date":"2023-10-18","arxiv_id":"2310.11845","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-quantized-offline-reinforcement","title":"Action-Quantized Offline Reinforcement Learning for Robotic Skill Learning","date":"2023-10-18","arxiv_id":"2310.11731","repositories_listed":0,"syntology":null},{"url":null,"slug":"fact-based-agent-modeling-for-multi-agent","title":"Fact-based Agent modeling for Multi-Agent Reinforcement Learning","date":"2023-10-18","arxiv_id":"2310.12290","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-generalization-of-alignment-with","title":"Improving Generalization of Alignment with Human Preferences through Group Invariant Learning","date":"2023-10-18","arxiv_id":"2310.11971","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-expressivity-of-objective","title":"On The Expressivity of Objective-Specification Formalisms in Reinforcement Learning","date":"2023-10-18","arxiv_id":"2310.11840","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-acceleration-of-infinite-horizon","title":"Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes","date":"2023-10-18","arxiv_id":"2310.11684","repositories_listed":0,"syntology":null},{"url":null,"slug":"combat-urban-congestion-via-collaboration","title":"Combat Urban Congestion via Collaboration: Heterogeneous GNN-based MARL for Coordinated Platooning and Traffic Signal Control","date":"2023-10-17","arxiv_id":"2310.10948","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-packing-from-visual-sensing-to","title":"Neural Packing: from Visual Sensing to Reinforcement Learning","date":"2023-10-17","arxiv_id":"2311.09233","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-offline-reinforcement-learning-for","title":"End-to-end Offline Reinforcement Learning for Glycemia Control","date":"2023-10-16","arxiv_id":"2310.10312","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-topological-maps-in-deep","title":"Leveraging Topological Maps in Deep Reinforcement Learning for Multi-Object Navigation","date":"2023-10-16","arxiv_id":"2310.10250","repositories_listed":0,"syntology":null},{"url":null,"slug":"mimicking-the-maestro-exploring-the-efficacy","title":"Mimicking the Maestro: Exploring the Efficacy of a Virtual AI Teacher in Fine Motor Skill Acquisition","date":"2023-10-16","arxiv_id":"2310.10280","repositories_listed":0,"syntology":null},{"url":null,"slug":"verbosity-bias-in-preference-labeling-by","title":"Verbosity Bias in Preference Labeling by Large Language Models","date":"2023-10-16","arxiv_id":"2310.10076","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-explicit","title":"Deep Reinforcement Learning with Explicit Context Representation","date":"2023-10-15","arxiv_id":"2310.09924","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-learning-for-resource","title":"Federated Reinforcement Learning for Resource Allocation in V2X Networks","date":"2023-10-15","arxiv_id":"2310.09858","repositories_listed":0,"syntology":null},{"url":null,"slug":"mir2-towards-provably-robust-multi-agent","title":"Robust Multi-Agent Reinforcement Learning by Mutual Information Regularization","date":"2023-10-15","arxiv_id":"2310.09833","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-blockchain-empowered-multi-aggregator","title":"A Blockchain-empowered Multi-Aggregator Federated Learning Architecture in Edge Computing with Deep Reinforcement Learning Optimization","date":"2023-10-14","arxiv_id":"2310.09665","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-music-playlist-generation-via","title":"Automatic Music Playlist Generation via Simulation-based Reinforcement Learning","date":"2023-10-13","arxiv_id":"2310.09123","repositories_listed":0,"syntology":null},{"url":null,"slug":"goodhart-s-law-in-reinforcement-learning","title":"Goodhart's Law in Reinforcement Learning","date":"2023-10-13","arxiv_id":"2310.09144","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-for-optimizing","title":"Offline Reinforcement Learning for Optimizing Production Bidding Policies","date":"2023-10-13","arxiv_id":"2310.09426","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-way-to-incorporate-novelty-detection","title":"Novelty Detection in Reinforcement Learning with World Models","date":"2023-10-12","arxiv_id":"2310.08731","repositories_listed":0,"syntology":null},{"url":null,"slug":"meanap-guided-reinforced-active-learning-for","title":"Aligning Data Selection with Performance: Performance-driven Reinforcement Learning for Active Learning in Object Detection","date":"2023-10-12","arxiv_id":"2310.08387","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-display-transfer","title":"Reinforcement Learning of Display Transfer Robots in Glass Flow Control Systems: A Physical Simulation-Based Approach","date":"2023-10-12","arxiv_id":"2310.07981","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-autonomous-5","title":"Deep Reinforcement Learning for Autonomous Cyber Defence: A Survey","date":"2023-10-11","arxiv_id":"2310.07745","repositories_listed":0,"syntology":null}],"record_sha256":"2f176a7b0dcdc8e6560d1703fdaeba3ee8ef220dc4daf8df39f2573ec670d419","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}