{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/47","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":47,"pages_in_order":135,"rows_per_page":100,"rows":[4601,4700],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/46","next":"/task/reinforcement-learning-2/papers/48","papers":[{"url":null,"slug":"rl-transformer-a-general-purpose-problem","title":"RL + Transformer = A General-Purpose Problem Solver","date":"2025-01-24","arxiv_id":"2501.14176","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-multi-objective","title":"Towards Efficient Multi-Objective Optimisation for Real-World Power Grid Topology Control","date":"2025-01-24","arxiv_id":"2502.00034","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-platform-for","title":"Reinforcement Learning Platform for Adversarial Black-box Attacks with Custom Distortion Filters","date":"2025-01-23","arxiv_id":"2501.14122","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-driven-hierarchical-reinforcement","title":"Attention-Driven Hierarchical Reinforcement Learning with Particle Filtering for Source Localization in Dynamic Fields","date":"2025-01-22","arxiv_id":"2501.13084","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-hybrid","title":"Deep Reinforcement Learning with Hybrid Intrinsic Reward Model","date":"2025-01-22","arxiv_id":"2501.12627","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-the-technology-landscape-through","title":"Exploring the Technology Landscape through Topic Modeling, Expert Involvement, and Reinforcement Learning","date":"2025-01-22","arxiv_id":"2501.13252","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-critic-guided-diffusion-policy-for","title":"Offline Critic-Guided Diffusion Policy for Multi-User Delay-Constrained Scheduling","date":"2025-01-22","arxiv_id":"2501.12942","repositories_listed":0,"syntology":null},{"url":null,"slug":"rag-reward-optimizing-rag-with-reward","title":"RAG-Reward: Optimizing RAG with Reward Modeling and RLHF","date":"2025-01-22","arxiv_id":"2501.13264","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-assisted-internet-of-vehicles-a-framework","title":"UAV-assisted Internet of Vehicles: A Framework Empowered by Reinforcement Learning and Blockchain","date":"2025-01-22","arxiv_id":"2502.15713","repositories_listed":0,"syntology":null},{"url":null,"slug":"arm-irl-adaptive-resilience-metric","title":"ARM-IRL: Adaptive Resilience Metric Quantification Using Inverse Reinforcement Learning","date":"2025-01-21","arxiv_id":"2501.12362","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-instruction-following-with","title":"Compositional Instruction Following with Language Models and Reinforcement Learning","date":"2025-01-21","arxiv_id":"2501.12539","repositories_listed":0,"syntology":null},{"url":null,"slug":"dnrselect-active-best-view-selection-for","title":"DNRSelect: Active Best View Selection for Deferred Neural Rendering","date":"2025-01-21","arxiv_id":"2501.12150","repositories_listed":0,"syntology":null},{"url":null,"slug":"group-agent-reinforcement-learning-with","title":"Group-Agent Reinforcement Learning with Heterogeneous Agents","date":"2025-01-21","arxiv_id":"2501.11818","repositories_listed":0,"syntology":null},{"url":null,"slug":"heuristic-deep-reinforcement-learning-for","title":"Heuristic Deep Reinforcement Learning for Phase Shift Optimization in RIS-assisted Secure Satellite Communication Systems with RSMA","date":"2025-01-21","arxiv_id":"2501.12311","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-constrained-beam","title":"Reinforcement Learning Constrained Beam Search for Parameter Optimization of Paper Drying Under Flexible Constraints","date":"2025-01-21","arxiv_id":"2501.12542","repositories_listed":0,"syntology":null},{"url":null,"slug":"secure-resource-allocation-via-constrained","title":"Secure Resource Allocation via Constrained Deep Reinforcement Learning","date":"2025-01-20","arxiv_id":"2501.11557","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-impact-of-intrinsic-rewards-on","title":"The impact of intrinsic rewards on exploration in Reinforcement Learning","date":"2025-01-20","arxiv_id":"2501.11533","repositories_listed":0,"syntology":null},{"url":null,"slug":"blockchain-assisted-demonstration-cloning-for","title":"Blockchain-assisted Demonstration Cloning for Multi-Agent Deep Reinforcement Learning","date":"2025-01-19","arxiv_id":"2501.10938","repositories_listed":0,"syntology":null},{"url":null,"slug":"forlaps-an-innovative-data-driven","title":"FORLAPS: An Innovative Data-Driven Reinforcement Learning Approach for Prescriptive Process Monitoring","date":"2025-01-17","arxiv_id":"2501.10543","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-adaptive-value-estimation-for","title":"Wasserstein Adaptive Value Estimation for Actor-Critic Reinforcement Learning","date":"2025-01-17","arxiv_id":"2501.10605","repositories_listed":0,"syntology":null},{"url":null,"slug":"evade-event-based-variational-thompson-1","title":"EVaDE : Event-Based Variational Thompson Sampling for Model-Based Reinforcement Learning","date":"2025-01-16","arxiv_id":"2501.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-searching-of-extreme-operating","title":"Fast Searching of Extreme Operating Conditions for Relay Protection Setting Calculation Based on Graph Neural Network and Reinforcement Learning","date":"2025-01-16","arxiv_id":"2501.09399","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-quiet","title":"A Reinforcement Learning Approach to Quiet and Safe UAM Traffic Management","date":"2025-01-15","arxiv_id":"2501.08941","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning-to-1","title":"Application of Deep Reinforcement Learning to UAV Swarming for Ground Surveillance","date":"2025-01-15","arxiv_id":"2501.08655","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-with-3","title":"Average-Reward Reinforcement Learning with Entropy Regularization","date":"2025-01-15","arxiv_id":"2501.09080","repositories_listed":0,"syntology":null},{"url":null,"slug":"inferring-transition-dynamics-from-value","title":"Inferring Transition Dynamics from Value Functions","date":"2025-01-15","arxiv_id":"2501.09081","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enhanced-procedural","title":"Reinforcement Learning-Enhanced Procedural Generation for Dynamic Narrative-Driven AR Experiences","date":"2025-01-15","arxiv_id":"2501.08552","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-pricing-in-high-speed-railways-using","title":"Dynamic Pricing in High-Speed Railways Using Multi-Agent Reinforcement Learning","date":"2025-01-14","arxiv_id":"2501.08234","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-of-link-configuration-for","title":"Optimization of Link Configuration for Satellite Communication Using Reinforcement Learning","date":"2025-01-14","arxiv_id":"2501.08220","repositories_listed":0,"syntology":null},{"url":null,"slug":"read-reinforcement-based-adversarial-learning","title":"READ: Reinforcement-based Adversarial Learning for Text Classification with Limited Labeled Data","date":"2025-01-14","arxiv_id":"2501.08035","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-inductive-learning-from-answer-sets","title":"Online inductive learning from answer sets for efficient reinforcement learning exploration","date":"2025-01-13","arxiv_id":"2501.07445","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-optimization-of-ratings-based","title":"Performance Optimization of Ratings-Based Reinforcement Learning","date":"2025-01-13","arxiv_id":"2501.07755","repositories_listed":0,"syntology":null},{"url":null,"slug":"timrl-a-novel-meta-reinforcement-learning","title":"TIMRL: A Novel Meta-Reinforcement Learning Framework for Non-Stationary and Multi-Task Environments","date":"2025-01-13","arxiv_id":"2501.07146","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-for","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","date":"2025-01-12","arxiv_id":"2501.06700","repositories_listed":0,"syntology":null},{"url":null,"slug":"pareto-set-learning-for-multi-objective","title":"Pareto Set Learning for Multi-Objective Reinforcement Learning","date":"2025-01-12","arxiv_id":"2501.06773","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-11","title":"Hierarchical Reinforcement Learning for Optimal Agent Grouping in Cooperative Systems","date":"2025-01-11","arxiv_id":"2501.06554","repositories_listed":0,"syntology":null},{"url":null,"slug":"counterfactually-fair-reinforcement-learning","title":"Counterfactually Fair Reinforcement Learning via Sequential Data Preprocessing","date":"2025-01-10","arxiv_id":"2501.06366","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-safe-trusted-autonomy-for-responsible","title":"The Safe Trusted Autonomy for Responsible Space Program","date":"2025-01-10","arxiv_id":"2501.05984","repositories_listed":0,"syntology":null},{"url":null,"slug":"curla-curriculum-learning-based-deep","title":"CuRLA: Curriculum Learning Based Deep Reinforcement Learning for Autonomous Driving","date":"2025-01-09","arxiv_id":"2501.04982","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-transfer-in-model-based","title":"Knowledge Transfer in Model-Based Reinforcement Learning Agents for Efficient Multi-Task Learning","date":"2025-01-09","arxiv_id":"2501.05329","repositories_listed":0,"syntology":null},{"url":null,"slug":"timerl-efficient-deep-reinforcement-learning","title":"TimeRL: Efficient Deep Reinforcement Learning with Polyhedral Dependence Graphs","date":"2025-01-09","arxiv_id":"2501.05408","repositories_listed":0,"syntology":null},{"url":null,"slug":"constraints-as-rewards-reinforcement-learning","title":"Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions","date":"2025-01-08","arxiv_id":"2501.04228","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-transfer-q-learning-for-offline-non","title":"Deep Transfer $Q$-Learning for Offline Non-Stationary Reinforcement Learning","date":"2025-01-08","arxiv_id":"2501.04870","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-artificial-intelligence-strategies-for","title":"Hybrid Artificial Intelligence Strategies for Drone Navigation","date":"2025-01-08","arxiv_id":"2501.04472","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperl-parameter-informed-reinforcement","title":"HypeRL: Parameter-Informed Reinforcement Learning for Parametric PDEs","date":"2025-01-08","arxiv_id":"2501.04538","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-minimal","title":"Safe Reinforcement Learning with Minimal Supervision","date":"2025-01-08","arxiv_id":"2501.04481","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-for-1","title":"Explainable Reinforcement Learning for Formula One Race Strategy","date":"2025-01-07","arxiv_id":"2501.04068","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-via","title":"Explainable Reinforcement Learning via Temporal Policy Decomposition","date":"2025-01-07","arxiv_id":"2501.03902","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-based-dynamic","title":"Online Reinforcement Learning-Based Dynamic Adaptive Evaluation Function for Real-Time Strategy Tasks","date":"2025-01-07","arxiv_id":"2501.03824","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-adversarial-attacks-in","title":"Rethinking Adversarial Attacks in Reinforcement Learning from Policy Distribution Perspective","date":"2025-01-07","arxiv_id":"2501.03562","repositories_listed":0,"syntology":null},{"url":null,"slug":"run-and-tumble-chemotaxis-using-reinforcement","title":"Run-and-tumble chemotaxis using reinforcement learning","date":"2025-01-07","arxiv_id":"2501.03687","repositories_listed":0,"syntology":null},{"url":null,"slug":"sale-based-offline-reinforcement-learning","title":"SALE-Based Offline Reinforcement Learning with Ensemble Q-Networks","date":"2025-01-07","arxiv_id":"2501.03676","repositories_listed":0,"syntology":null},{"url":null,"slug":"horizon-generalization-in-reinforcement","title":"Horizon Generalization in Reinforcement Learning","date":"2025-01-06","arxiv_id":"2501.02709","repositories_listed":0,"syntology":null},{"url":null,"slug":"turn-based-multi-agent-reinforcement-learning","title":"Turn-based Multi-Agent Reinforcement Learning Model Checking","date":"2025-01-06","arxiv_id":"2501.03187","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-calibration-with-model-based","title":"Digital Twin Calibration with Model-Based Reinforcement Learning","date":"2025-01-04","arxiv_id":"2501.02205","repositories_listed":0,"syntology":null},{"url":null,"slug":"sr-reward-taking-the-path-more-traveled","title":"SR-Reward: Taking The Path More Traveled","date":"2025-01-04","arxiv_id":"2501.02330","repositories_listed":0,"syntology":null},{"url":null,"slug":"pimaex-multi-agent-exploration-through-peer","title":"PIMAEX: Multi-Agent Exploration through Peer Incentivization","date":"2025-01-02","arxiv_id":"2501.01266","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetries-enhanced-multi-agent-reinforcement","title":"Symmetries-enhanced Multi-Agent Reinforcement Learning","date":"2025-01-02","arxiv_id":"2501.01136","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-motion-simulator-pushing-the-limit-of-1","title":"Neural Motion Simulator Pushing the Limit of World Models in Reinforcement Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"vlms-guided-representation-distillation-for","title":"VLMs-Guided Representation Distillation for Efficient Vision-Based Reinforcement Learning","date":"2025-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-recognition-using-actor-critic","title":"Goal Recognition using Actor-Critic Optimization","date":"2024-12-31","arxiv_id":"2501.01463","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-information-theoretic-active-inverse","title":"Toward Information Theoretic Active Inverse Reinforcement Learning","date":"2024-12-31","arxiv_id":"2501.00381","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-based-efficient-off-policy-stabilizing","title":"Data-Based Efficient Off-Policy Stabilizing Optimal Control Algorithms for Discrete-Time Linear Systems via Damping Coefficients","date":"2024-12-30","arxiv_id":"2412.20845","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-optimization-of-storage-systems-using","title":"Dynamic Optimization of Storage Systems Using Reinforcement Learning Techniques","date":"2024-12-29","arxiv_id":"2501.00068","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-code-llms-with-reinforcement","title":"Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey","date":"2024-12-29","arxiv_id":"2412.20367","repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-data-augmentation-for","title":"Goal-Conditioned Data Augmentation for Offline Reinforcement Learning","date":"2024-12-29","arxiv_id":"2412.20519","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-multiagent-coordination-via-entropic","title":"Safe Multiagent Coordination via Entropic Exploration","date":"2024-12-29","arxiv_id":"2412.20361","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-context-aware-multi-path","title":"Adaptive Context-Aware Multi-Path Transmission Control for VR/AR Content: A Deep Reinforcement Learning Approach","date":"2024-12-27","arxiv_id":"2412.19737","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-rank-contextual-reinforcement-learning","title":"Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback","date":"2024-12-27","arxiv_id":"2412.19436","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-multi-agent-robust","title":"Minimax-Optimal Multi-Agent Robust Reinforcement Learning","date":"2024-12-27","arxiv_id":"2412.19873","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-hierarchical-reinforcement-learning","title":"Scalable Hierarchical Reinforcement Learning for Hyper Scale Multi-Robot Task Planning","date":"2024-12-27","arxiv_id":"2412.19538","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-multi-agent-meta-reinforcement","title":"Hierarchical Multi-agent Meta-Reinforcement Learning for Cross-channel Bidding","date":"2024-12-26","arxiv_id":"2412.19064","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-fantasy-sports-team-selection-with","title":"Optimizing Fantasy Sports Team Selection with Deep Reinforcement Learning","date":"2024-12-26","arxiv_id":"2412.19215","repositories_listed":0,"syntology":null},{"url":null,"slug":"medhallbench-a-new-benchmark-for-assessing","title":"MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models","date":"2024-12-25","arxiv_id":"2412.18947","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustness-evaluation-of-offline","title":"Robustness Evaluation of Offline Reinforcement Learning for Robot Control Against Action Perturbations","date":"2024-12-25","arxiv_id":"2412.18781","repositories_listed":0,"syntology":null},{"url":null,"slug":"speech-recognition-with-llms-adapted-to","title":"Speech Recognition With LLMs Adapted to Disordered Speech Using Reinforcement Learning","date":"2024-12-25","arxiv_id":"2501.00039","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-framework-for-reinforcement-learning","title":"Quantum framework for Reinforcement Learning: Integrating Markov decision process, quantum arithmetic, and trajectory search","date":"2024-12-24","arxiv_id":"2412.18208","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperq-opt-q-learning-for-hyperparameter","title":"HyperQ-Opt: Q-learning for Hyperparameter Optimization","date":"2024-12-23","arxiv_id":"2412.17765","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-deep-reinforcement-learning-for","title":"Multimodal Deep Reinforcement Learning for Portfolio Optimization","date":"2024-12-23","arxiv_id":"2412.17293","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-motor-control-a","title":"Reinforcement Learning for Motor Control: A Comprehensive Review","date":"2024-12-23","arxiv_id":"2412.17936","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-a-focus-on","title":"Reinforcement Learning with a Focus on Adjusting Policies to Reach Targets","date":"2024-12-23","arxiv_id":"2412.17344","repositories_listed":0,"syntology":null},{"url":null,"slug":"trading-devil-rl-backdoor-attack-via-stock","title":"Trading Devil RL: Backdoor attack via Stock market, Bayesian Optimization and Reinforcement Learning","date":"2024-12-23","arxiv_id":"2412.17908","repositories_listed":0,"syntology":null},{"url":null,"slug":"environment-descriptions-for-usability-and","title":"Environment Descriptions for Usability and Generalisation in Reinforcement Learning","date":"2024-12-22","arxiv_id":"2412.16970","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-in-reinforcement-learning-with","title":"Fairness in Reinforcement Learning with Bisimulation Metrics","date":"2024-12-22","arxiv_id":"2412.17123","repositories_listed":0,"syntology":null},{"url":null,"slug":"apirl-deep-reinforcement-learning-for-rest","title":"APIRL: Deep Reinforcement Learning for REST API Fuzzing","date":"2024-12-20","arxiv_id":"2412.15991","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexterous-manipulation-based-on-prior","title":"Dexterous Manipulation Based on Prior Dexterous Grasp Pose Knowledge","date":"2024-12-20","arxiv_id":"2412.15587","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-low-speed-autonomous-driving-a","title":"Optimizing Low-Speed Autonomous Driving: A Reinforcement Learning Approach to Route Stability and Maximum Speed","date":"2024-12-20","arxiv_id":"2412.16248","repositories_listed":0,"syntology":null},{"url":null,"slug":"sorrel-suboptimal-demonstration-guided","title":"SORREL: Suboptimal-Demonstration-Guided Reinforcement Learning for Learning to Branch","date":"2024-12-20","arxiv_id":"2412.15534","repositories_listed":0,"syntology":null},{"url":null,"slug":"adacred-adaptive-causal-decision-transformers","title":"AdaCred: Adaptive Causal Decision Transformers with Feature Crediting","date":"2024-12-19","arxiv_id":"2412.15427","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-temporal-credit-assignment-for-optimal","title":"Agent-Temporal Credit Assignment for Optimal Policy Preservation in Sparse Multi-Agent Reinforcement Learning","date":"2024-12-19","arxiv_id":"2412.14779","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-subspaces-of-policies-for","title":"Hierarchical Subspaces of Policies for Continual Offline Reinforcement Learning","date":"2024-12-19","arxiv_id":"2412.14865","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-loop-federated-actor-critic-across","title":"Single-Loop Federated Actor-Critic across Heterogeneous Environments","date":"2024-12-19","arxiv_id":"2412.14555","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-critique-tune-based-reinforcement","title":"Bayesian Critique-Tune-Based Reinforcement Learning with Adaptive Pressure for Multi-Intersection Traffic Signal Control","date":"2024-12-18","arxiv_id":"2412.16225","repositories_listed":0,"syntology":null},{"url":null,"slug":"harvesting-energy-from-turbulent-winds-with","title":"Harvesting energy from turbulent winds with Reinforcement Learning","date":"2024-12-18","arxiv_id":"2412.13961","repositories_listed":0,"syntology":null},{"url":null,"slug":"heterogeneous-multi-agent-reinforcement-3","title":"Heterogeneous Multi-Agent Reinforcement Learning for Distributed Channel Access in WLANs","date":"2024-12-18","arxiv_id":"2412.14218","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-reinforcement-learning-strategies-for","title":"Active Reinforcement Learning Strategies for Offline Policy Improvement","date":"2024-12-17","arxiv_id":"2412.13106","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-advantage-based-optimization-method-for","title":"An Advantage-based Optimization Method for Reinforcement Learning in Large Action Space","date":"2024-12-17","arxiv_id":"2412.12605","repositories_listed":0,"syntology":null},{"url":null,"slug":"lagrangian-index-policy-for-restless-bandits","title":"Lagrangian Index Policy for Restless Bandits with Average Reward","date":"2024-12-17","arxiv_id":"2412.12641","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-reinforcement-learning-for","title":"Multi-Task Reinforcement Learning for Quadrotors","date":"2024-12-17","arxiv_id":"2412.12442","repositories_listed":0,"syntology":null},{"url":null,"slug":"physics-model-guided-worst-case-sampling-for","title":"Physics-model-guided Worst-case Sampling for Safe Reinforcement Learning","date":"2024-12-17","arxiv_id":"2412.13224","repositories_listed":0,"syntology":null}],"record_sha256":"0a098453a3b8b613b4d1bc8bd0a9f7d52edce3eff1511162662e7e6ae6bbb265","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}