{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/48","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":48,"pages_in_order":132,"rows_per_page":100,"rows":[4701,4800],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/47","next":"/task/reinforcement-learning/papers/49","papers":[{"url":null,"slug":"counterfactually-fair-reinforcement-learning","title":"Counterfactually Fair Reinforcement Learning via Sequential Data Preprocessing","date":"2025-01-10","arxiv_id":"2501.06366","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-safe-trusted-autonomy-for-responsible","title":"The Safe Trusted Autonomy for Responsible Space Program","date":"2025-01-10","arxiv_id":"2501.05984","repositories_listed":0,"syntology":null},{"url":null,"slug":"curla-curriculum-learning-based-deep","title":"CuRLA: Curriculum Learning Based Deep Reinforcement Learning for Autonomous Driving","date":"2025-01-09","arxiv_id":"2501.04982","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-in-model-based","title":"Knowledge Transfer in Model-Based Reinforcement Learning Agents for Efficient Multi-Task Learning","date":"2025-01-09","arxiv_id":"2501.05329","repositories_listed":0,"syntology":null},{"url":null,"slug":"timerl-efficient-deep-reinforcement-learning","title":"TimeRL: Efficient Deep Reinforcement Learning with Polyhedral Dependence Graphs","date":"2025-01-09","arxiv_id":"2501.05408","repositories_listed":0,"syntology":null},{"url":null,"slug":"constraints-as-rewards-reinforcement-learning","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","date":"2025-01-08","arxiv_id":"2501.04228","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-transfer-q-learning-for-offline-non","title":"Deep Transfer $Q$-Learning for Offline Non-Stationary Reinforcement Learning","date":"2025-01-08","arxiv_id":"2501.04870","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-artificial-intelligence-strategies-for","title":"Hybrid Artificial Intelligence Strategies for Drone Navigation","date":"2025-01-08","arxiv_id":"2501.04472","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperl-parameter-informed-reinforcement","title":"HypeRL: Parameter-Informed Reinforcement Learning for Parametric PDEs","date":"2025-01-08","arxiv_id":"2501.04538","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-minimal","title":"Safe Reinforcement Learning with Minimal Supervision","date":"2025-01-08","arxiv_id":"2501.04481","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-for-1","title":"Explainable Reinforcement Learning for Formula One Race Strategy","date":"2025-01-07","arxiv_id":"2501.04068","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-via","title":"Explainable Reinforcement Learning via Temporal Policy Decomposition","date":"2025-01-07","arxiv_id":"2501.03902","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-based-dynamic","title":"Online Reinforcement Learning-Based Dynamic Adaptive Evaluation Function for Real-Time Strategy Tasks","date":"2025-01-07","arxiv_id":"2501.03824","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-adversarial-attacks-in","title":"Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective","date":"2025-01-07","arxiv_id":"2501.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"run-and-tumble-chemotaxis-using-reinforcement","title":"Run-and-tumble chemotaxis using reinforcement learning","date":"2025-01-07","arxiv_id":"2501.03687","repositories_listed":0,"syntology":null},{"url":null,"slug":"sale-based-offline-reinforcement-learning","title":"SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks","date":"2025-01-07","arxiv_id":"2501.03676","repositories_listed":0,"syntology":null},{"url":null,"slug":"horizon-generalization-in-reinforcement","title":"Horizon Generalization in Reinforcement Learning","date":"2025-01-06","arxiv_id":"2501.02709","repositories_listed":0,"syntology":null},{"url":null,"slug":"turn-based-multi-agent-reinforcement-learning","title":"Turn-based Multi-Agent Reinforcement Learning Model Checking","date":"2025-01-06","arxiv_id":"2501.03187","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-calibration-with-model-based","title":"Digital Twin Calibration with Model-Based Reinforcement Learning","date":"2025-01-04","arxiv_id":"2501.02205","repositories_listed":0,"syntology":null},{"url":null,"slug":"sr-reward-taking-the-path-more-traveled","title":"SR-Reward: Taking The Path More Traveled","date":"2025-01-04","arxiv_id":"2501.02330","repositories_listed":0,"syntology":null},{"url":null,"slug":"pimaex-multi-agent-exploration-through-peer","title":"PIMAEX: Multi-Agent Exploration through Peer Incentivization","date":"2025-01-02","arxiv_id":"2501.01266","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetries-enhanced-multi-agent-reinforcement","title":"Symmetries-enhanced Multi-Agent Reinforcement Learning","date":"2025-01-02","arxiv_id":"2501.01136","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-motion-simulator-pushing-the-limit-of-1","title":"Neural Motion Simulator Pushing the Limit of World Models in Reinforcement Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vlms-guided-representation-distillation-for","title":"VLMs-Guided Representation Distillation for Efficient Vision-Based Reinforcement Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-recognition-using-actor-critic","title":"Goal Recognition using Actor-Critic Optimization","date":"2024-12-31","arxiv_id":"2501.01463","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-information-theoretic-active-inverse","title":"Toward Information Theoretic Active Inverse Reinforcement Learning","date":"2024-12-31","arxiv_id":"2501.00381","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-based-efficient-off-policy-stabilizing","title":"Data-Based Efficient Off-Policy Stabilizing Optimal Control Algorithms for Discrete-Time Linear Systems via Damping Coefficients","date":"2024-12-30","arxiv_id":"2412.20845","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-optimization-of-storage-systems-using","title":"Dynamic Optimization of Storage Systems Using Reinforcement Learning Techniques","date":"2024-12-29","arxiv_id":"2501.00068","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-code-llms-with-reinforcement","title":"Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey","date":"2024-12-29","arxiv_id":"2412.20367","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-data-augmentation-for","title":"Goal-Conditioned Data Augmentation for Offline Reinforcement Learning","date":"2024-12-29","arxiv_id":"2412.20519","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-multiagent-coordination-via-entropic","title":"Safe Multiagent Coordination via Entropic Exploration","date":"2024-12-29","arxiv_id":"2412.20361","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-context-aware-multi-path","title":"Adaptive Context-Aware Multi-Path Transmission Control for VR/AR Content: A Deep Reinforcement Learning Approach","date":"2024-12-27","arxiv_id":"2412.19737","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-rank-contextual-reinforcement-learning","title":"Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback","date":"2024-12-27","arxiv_id":"2412.19436","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-multi-agent-robust","title":"Minimax-Optimal Multi-Agent Robust Reinforcement Learning","date":"2024-12-27","arxiv_id":"2412.19873","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-hierarchical-reinforcement-learning","title":"Scalable Hierarchical Reinforcement Learning for Hyper Scale Multi-Robot Task Planning","date":"2024-12-27","arxiv_id":"2412.19538","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-multi-agent-meta-reinforcement","title":"Hierarchical Multi-agent Meta-Reinforcement Learning for Cross-channel Bidding","date":"2024-12-26","arxiv_id":"2412.19064","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-fantasy-sports-team-selection-with","title":"Optimizing Fantasy Sports Team Selection with Deep Reinforcement Learning","date":"2024-12-26","arxiv_id":"2412.19215","repositories_listed":0,"syntology":null},{"url":null,"slug":"medhallbench-a-new-benchmark-for-assessing","title":"MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models","date":"2024-12-25","arxiv_id":"2412.18947","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-evaluation-of-offline","title":"Robustness Evaluation of Offline Reinforcement Learning for Robot Control Against Action Perturbations","date":"2024-12-25","arxiv_id":"2412.18781","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-recognition-with-llms-adapted-to","title":"Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning","date":"2024-12-25","arxiv_id":"2501.00039","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-framework-for-reinforcement-learning","title":"Quantum framework for Reinforcement Learning: Integrating Markov decision process, quantum arithmetic, and trajectory search","date":"2024-12-24","arxiv_id":"2412.18208","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperq-opt-q-learning-for-hyperparameter","title":"HyperQ-Opt: Q-learning for Hyperparameter Optimization","date":"2024-12-23","arxiv_id":"2412.17765","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-deep-reinforcement-learning-for","title":"Multimodal Deep Reinforcement Learning for Portfolio Optimization","date":"2024-12-23","arxiv_id":"2412.17293","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-motor-control-a","title":"Reinforcement Learning for Motor Control: A Comprehensive Review","date":"2024-12-23","arxiv_id":"2412.17936","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-a-focus-on","title":"Reinforcement Learning with a Focus on Adjusting Policies to Reach Targets","date":"2024-12-23","arxiv_id":"2412.17344","repositories_listed":0,"syntology":null},{"url":null,"slug":"trading-devil-rl-backdoor-attack-via-stock","title":"Trading Devil RL: Backdoor attack via Stock market, Bayesian Optimization and Reinforcement Learning","date":"2024-12-23","arxiv_id":"2412.17908","repositories_listed":0,"syntology":null},{"url":null,"slug":"environment-descriptions-for-usability-and","title":"Environment Descriptions for Usability and Generalisation in Reinforcement Learning","date":"2024-12-22","arxiv_id":"2412.16970","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-in-reinforcement-learning-with","title":"Fairness in Reinforcement Learning with Bisimulation Metrics","date":"2024-12-22","arxiv_id":"2412.17123","repositories_listed":0,"syntology":null},{"url":null,"slug":"apirl-deep-reinforcement-learning-for-rest","title":"APIRL: Deep Reinforcement Learning for REST API Fuzzing","date":"2024-12-20","arxiv_id":"2412.15991","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexterous-manipulation-based-on-prior","title":"Dexterous Manipulation Based on Prior Dexterous Grasp Pose Knowledge","date":"2024-12-20","arxiv_id":"2412.15587","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-low-speed-autonomous-driving-a","title":"Optimizing Low-Speed Autonomous Driving: A Reinforcement Learning Approach to Route Stability and Maximum Speed","date":"2024-12-20","arxiv_id":"2412.16248","repositories_listed":0,"syntology":null},{"url":null,"slug":"sorrel-suboptimal-demonstration-guided","title":"SORREL: Suboptimal-Demonstration-Guided Reinforcement Learning for Learning to Branch","date":"2024-12-20","arxiv_id":"2412.15534","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacred-adaptive-causal-decision-transformers","title":"AdaCred: Adaptive Causal Decision Transformers with Feature Crediting","date":"2024-12-19","arxiv_id":"2412.15427","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-temporal-credit-assignment-for-optimal","title":"Agent-Temporal Credit Assignment for Optimal Policy Preservation in Sparse Multi-Agent Reinforcement Learning","date":"2024-12-19","arxiv_id":"2412.14779","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-subspaces-of-policies-for","title":"Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning","date":"2024-12-19","arxiv_id":"2412.14865","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-loop-federated-actor-critic-across","title":"Single-Loop Federated Actor-Critic across Heterogeneous Environments","date":"2024-12-19","arxiv_id":"2412.14555","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-critique-tune-based-reinforcement","title":"Bayesian Critique-Tune-Based Reinforcement Learning with Adaptive Pressure for Multi-Intersection Traffic Signal Control","date":"2024-12-18","arxiv_id":"2412.16225","repositories_listed":0,"syntology":null},{"url":null,"slug":"harvesting-energy-from-turbulent-winds-with","title":"Harvesting energy from turbulent winds with Reinforcement Learning","date":"2024-12-18","arxiv_id":"2412.13961","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-reinforcement-3","title":"Heterogeneous Multi-Agent Reinforcement Learning for Distributed Channel Access in WLANs","date":"2024-12-18","arxiv_id":"2412.14218","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-strategies-for","title":"Active Reinforcement Learning Strategies for Offline Policy Improvement","date":"2024-12-17","arxiv_id":"2412.13106","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-advantage-based-optimization-method-for","title":"An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space","date":"2024-12-17","arxiv_id":"2412.12605","repositories_listed":0,"syntology":null},{"url":null,"slug":"lagrangian-index-policy-for-restless-bandits","title":"Lagrangian Index Policy for Restless Bandits with Average Reward","date":"2024-12-17","arxiv_id":"2412.12641","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-reinforcement-learning-for","title":"Multi-Task Reinforcement Learning for Quadrotors","date":"2024-12-17","arxiv_id":"2412.12442","repositories_listed":0,"syntology":null},{"url":null,"slug":"physics-model-guided-worst-case-sampling-for","title":"Physics-model-guided Worst-case Sampling for Safe Reinforcement Learning","date":"2024-12-17","arxiv_id":"2412.13224","repositories_listed":0,"syntology":null},{"url":null,"slug":"reservoir-computing-for-fast-simplified","title":"Reservoir Computing for Fast, Simplified Reinforcement Learning on Memory Tasks","date":"2024-12-17","arxiv_id":"2412.13093","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-action-sampling-for-reinforcement","title":"Equivariant Action Sampling for Reinforcement Learning and Planning","date":"2024-12-16","arxiv_id":"2412.12237","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-bayesian-deep-reinforcement","title":"Generalized Bayesian deep reinforcement learning","date":"2024-12-16","arxiv_id":"2412.11743","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-meta-reinforcement-learning-via","title":"Hierarchical Meta-Reinforcement Learning via Automated Macro-Action Discovery","date":"2024-12-16","arxiv_id":"2412.11930","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-reinforcement-learning-in","title":"Stabilizing Reinforcement Learning in Differentiable Multiphysics Simulation","date":"2024-12-16","arxiv_id":"2412.12089","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-using-finite","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","date":"2024-12-15","arxiv_id":"2412.11138","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-driving-with-evolution-capability-a","title":"Automated Driving with Evolution Capability: A Reinforcement Learning Method with Monotonic Performance Enhancement","date":"2024-12-14","arxiv_id":"2412.10822","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyapunov-based-reinforcement-learning-for-1","title":"Lyapunov-based reinforcement learning for distributed control with stability guarantee","date":"2024-12-14","arxiv_id":"2412.10844","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scalable","title":"Deep Reinforcement Learning for Scalable Multiagent Spacecraft Inspection","date":"2024-12-13","arxiv_id":"2412.10530","repositories_listed":0,"syntology":null},{"url":null,"slug":"physics-instrument-design-with-reinforcement","title":"Physics Instrument Design with Reinforcement Learning","date":"2024-12-13","arxiv_id":"2412.10237","repositories_listed":0,"syntology":null},{"url":null,"slug":"rldg-robotic-generalist-policy-distillation","title":"RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning","date":"2024-12-13","arxiv_id":"2412.09858","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-for-optimal","title":"Efficient Reinforcement Learning for Optimal Control with Natural Images","date":"2024-12-12","arxiv_id":"2412.08893","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-train-based-distributed-multi-agent","title":"Quantum-Train-Based Distributed Multi-Agent Reinforcement Learning","date":"2024-12-12","arxiv_id":"2412.08845","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sketch-decompositions-in-planning","title":"Learning Sketch Decompositions in Planning via Deep Reinforcement Learning","date":"2024-12-11","arxiv_id":"2412.08574","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-reward-specification-in-deep","title":"Effective Reward Specification in Deep Reinforcement Learning","date":"2024-12-10","arxiv_id":"2412.07177","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-progressive-influence-maximization-in","title":"Non-Progressive Influence Maximization in Dynamic Social Networks","date":"2024-12-10","arxiv_id":"2412.07402","repositories_listed":0,"syntology":null},{"url":null,"slug":"parseval-regularization-for-continual","title":"Parseval Regularization for Continual Reinforcement Learning","date":"2024-12-10","arxiv_id":"2412.07224","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-delayed-deep-deterministic-policy","title":"Edge Delayed Deep Deterministic Policy Gradient: efficient continuous control for edge scenarios","date":"2024-12-09","arxiv_id":"2412.06390","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-enhanced-reinforcement-learning","title":"Skill-Enhanced Reinforcement Learning Acceleration from Demonstrations","date":"2024-12-09","arxiv_id":"2412.06207","repositories_listed":0,"syntology":null},{"url":null,"slug":"vision-based-deep-reinforcement-learning-of","title":"Vision-Based Deep Reinforcement Learning of UAV Autonomous Navigation Using Privileged Information","date":"2024-12-09","arxiv_id":"2412.06313","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-shaped-prediction-avoiding","title":"Policy-shaped prediction: avoiding distractions in model-based reinforcement learning","date":"2024-12-08","arxiv_id":"2412.05766","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategizing-equitable-transit-evacuations-a","title":"Strategizing Equitable Transit Evacuations: A Data-Driven Reinforcement Learning Approach","date":"2024-12-08","arxiv_id":"2412.05777","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-soft-driving-constraints-from","title":"Learning Soft Driving Constraints from Vectorized Scene Embeddings while Imitating Expert Trajectories","date":"2024-12-07","arxiv_id":"2412.05717","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-temporally-correlated-latent-exploration","title":"A Temporally Correlated Latent Exploration for Reinforcement Learning","date":"2024-12-06","arxiv_id":"2412.04775","repositories_listed":0,"syntology":null},{"url":null,"slug":"putting-the-iterative-training-of-decision","title":"Putting the Iterative Training of Decision Trees to the Test on a Real-World Robotic Task","date":"2024-12-06","arxiv_id":"2412.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"demonstration-selection-for-in-context","title":"Demonstration Selection for In-Context Learning via Reinforcement Learning","date":"2024-12-05","arxiv_id":"2412.03966","repositories_listed":0,"syntology":null},{"url":null,"slug":"element-episodic-and-lifelong-exploration-via","title":"ELEMENT: Episodic and Lifelong Exploration via Maximum Entropy","date":"2024-12-05","arxiv_id":"2412.03800","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-freeway-lane","title":"Reinforcement Learning for Freeway Lane-Change Regulation via Connected Vehicles","date":"2024-12-05","arxiv_id":"2412.04341","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-wild-animal","title":"Reinforcement Learning from Wild Animal Videos","date":"2024-12-05","arxiv_id":"2412.04273","repositories_listed":0,"syntology":null},{"url":null,"slug":"traffic-co-simulation-framework-empowered-by","title":"Traffic Co-Simulation Framework Empowered by Infrastructure Camera Sensing and Reinforcement Learning","date":"2024-12-05","arxiv_id":"2412.03925","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-acquisition-for-improving-model-fairness","title":"Data Acquisition for Improving Model Fairness using Reinforcement Learning","date":"2024-12-04","arxiv_id":"2412.03009","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-driven-discovery-of-planning","title":"Experience-driven discovery of planning strategies","date":"2024-12-04","arxiv_id":"2412.03111","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-hyperparameter-robust-efficient","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","date":"2024-12-04","arxiv_id":"2412.03767","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-delayed-reinforcement-learning","title":"Inverse Delayed Reinforcement Learning","date":"2024-12-04","arxiv_id":"2412.02931","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-driven-resource-allocation-framework-for","title":"AI-Driven Resource Allocation Framework for Microservices in Hybrid Cloud Platforms","date":"2024-12-03","arxiv_id":"2412.02610","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-problem-of-social-cost-in-multi-agent","title":"The Problem of Social Cost in Multi-Agent General Reinforcement Learning: Survey and Synthesis","date":"2024-12-03","arxiv_id":"2412.02091","repositories_listed":0,"syntology":null}],"record_sha256":"1e3ce9ccb2e1fa78f4e0b5f030ccadf5996845eaf3ba5ba8315f2e1e0d326761","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}