{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/52","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":52,"pages_in_order":135,"rows_per_page":100,"rows":[5101,5200],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/51","next":"/task/reinforcement-learning-2/papers/53","papers":[{"url":null,"slug":"2408-03166","title":"CADRL: Category-aware Dual-agent Reinforcement Learning for Explainable Recommendations over Knowledge Graphs","date":"2024-08-06","arxiv_id":"2408.03166","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02349","title":"Active Sensing of Knee Osteoarthritis Progression with Reinforcement Learning","date":"2024-08-05","arxiv_id":"2408.02349","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02022","title":"Scenario-based Thermal Management Parametrization Through Deep Reinforcement Learning","date":"2024-08-04","arxiv_id":"2408.02022","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02165","title":"SelfBC: Self Behavior Cloning for Offline Reinforcement Learning","date":"2024-08-04","arxiv_id":"2408.02165","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01656","title":"Deep Reinforcement Learning for Dynamic Order Picking in Warehouse Operations","date":"2024-08-03","arxiv_id":"2408.01656","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01072","title":"A Survey on Self-play Methods in Reinforcement Learning","date":"2024-08-02","arxiv_id":"2408.01072","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01187","title":"Optimizing Variational Quantum Circuits Using Metaheuristic Strategies in Reinforcement Learning","date":"2024-08-02","arxiv_id":"2408.01187","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01188","title":"Multi-Objective Deep Reinforcement Learning for Optimisation in Autonomous Systems","date":"2024-08-02","arxiv_id":"2408.01188","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-00930","title":"Enabling High Data Throughput Reinforcement Learning on GPUs: A Domain Agnostic Framework for Data-Driven Scientific Research","date":"2024-08-01","arxiv_id":"2408.00930","repositories_listed":0,"syntology":null},{"url":null,"slug":"2407-21260","title":"Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation","date":"2024-07-31","arxiv_id":"2407.21260","repositories_listed":0,"syntology":null},{"url":null,"slug":"architectural-influence-on-variational","title":"Architectural Influence on Variational Quantum Circuits in Multi-Agent Reinforcement Learning: Evolutionary Strategies for Optimization","date":"2024-07-30","arxiv_id":"2407.20739","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-choose-a-reinforcement-learning","title":"How to Choose a Reinforcement-Learning Algorithm","date":"2024-07-30","arxiv_id":"2407.20917","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-generalizable-reinforcement-learning-1","title":"Towards Generalizable Reinforcement Learning via Causality-Guided Self-Adaptive Representations","date":"2024-07-30","arxiv_id":"2407.20651","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-method-for-fast-autonomy-transfer-in","title":"A Method for Fast Autonomy Transfer in Reinforcement Learning","date":"2024-07-29","arxiv_id":"2407.20466","repositories_listed":0,"syntology":null},{"url":null,"slug":"anomalous-state-sequence-modeling-to-enhance","title":"Anomalous State Sequence Modeling to Enhance Safety in Reinforcement Learning","date":"2024-07-29","arxiv_id":"2407.19860","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-dice-in-sample-diffusion-guidance","title":"Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning","date":"2024-07-29","arxiv_id":"2407.20109","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-machine-learning-architecture-search","title":"Quantum Machine Learning Architecture Search via Deep Reinforcement Learning","date":"2024-07-29","arxiv_id":"2407.20147","repositories_listed":0,"syntology":null},{"url":null,"slug":"empowering-clinicians-with-medical-decision","title":"Empowering Clinicians with Medical Decision Transformers: A Framework for Sepsis Treatment","date":"2024-07-28","arxiv_id":"2407.19380","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-interpretability-of-codebooks-in-model","title":"The Interpretability of Codebooks in Model-Based Reinforcement Learning is Limited","date":"2024-07-28","arxiv_id":"2407.19532","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-benefits-of-pixel-based-hierarchical","title":"On the benefits of pixel-based hierarchical policies for task generalization","date":"2024-07-27","arxiv_id":"2407.19142","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-sustainable-energy","title":"Reinforcement Learning for Sustainable Energy: A Survey","date":"2024-07-26","arxiv_id":"2407.18597","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-cross-environment-hyperparameter-setting","title":"The Cross-environment Hyperparameter Setting Benchmark for Reinforcement Learning","date":"2024-07-26","arxiv_id":"2407.18840","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentiable-quantum-architecture-search-in","title":"Differentiable Quantum Architecture Search in Asynchronous Quantum Reinforcement Learning","date":"2024-07-25","arxiv_id":"2407.18202","repositories_listed":0,"syntology":null},{"url":null,"slug":"principal-agent-reinforcement-learning","title":"Principal-Agent Reinforcement Learning: Orchestrating AI Agents with Contracts","date":"2024-07-25","arxiv_id":"2407.18074","repositories_listed":0,"syntology":null},{"url":null,"slug":"movelight-enhancing-traffic-signal-control","title":"MoveLight: Enhancing Traffic Signal Control through Movement-Centric Deep Reinforcement Learning","date":"2024-07-24","arxiv_id":"2407.17303","repositories_listed":0,"syntology":null},{"url":null,"slug":"pretrained-visual-representations-in","title":"Pretrained Visual Representations in Reinforcement Learning","date":"2024-07-24","arxiv_id":"2407.17238","repositories_listed":0,"syntology":null},{"url":null,"slug":"sonic-safe-social-navigation-with-adaptive","title":"SoNIC: Safe Social Navigation with Adaptive Conformal Inference and Constrained Reinforcement Learning","date":"2024-07-24","arxiv_id":"2407.17460","repositories_listed":0,"syntology":null},{"url":null,"slug":"traversing-pareto-optimal-policies-provably","title":"Traversing Pareto Optimal Policies: Provably Efficient Multi-Objective Reinforcement Learning","date":"2024-07-24","arxiv_id":"2407.17466","repositories_listed":0,"syntology":null},{"url":null,"slug":"odgr-online-dynamic-goal-recognition","title":"ODGR: Online Dynamic Goal Recognition","date":"2024-07-23","arxiv_id":"2407.16220","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-overview-of-reward-engineering","title":"Comprehensive Overview of Reward Engineering and Shaping in Advancing Reinforcement Learning Applications","date":"2024-07-22","arxiv_id":"2408.10215","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-replay-memory-architectures-in","title":"Efficient Replay Memory Architectures in Multi-Agent Reinforcement Learning for Traffic Congestion Control","date":"2024-07-22","arxiv_id":"2407.16034","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-and-addressing-reward-confusion-in","title":"Exploring and Addressing Reward Confusion in Offline Preference Learning","date":"2024-07-22","arxiv_id":"2407.16025","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-hardware-fault-tolerance-in","title":"Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms","date":"2024-07-21","arxiv_id":"2407.15283","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-deep-reinforcement-learning","title":"Mitigating Deep Reinforcement Learning Backdoors in the Neural Activation Space","date":"2024-07-21","arxiv_id":"2407.15168","repositories_listed":0,"syntology":null},{"url":null,"slug":"rocket-landing-control-with-random-annealing","title":"Rocket Landing Control with Random Annealing Jump Start Reinforcement Learning","date":"2024-07-21","arxiv_id":"2407.15083","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-abstraction-in-reinforcement-1","title":"Temporal Abstraction in Reinforcement Learning with Offline Data","date":"2024-07-21","arxiv_id":"2407.15241","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapt2reward-adapting-video-language-models","title":"Adapt2Reward: Adapting Video-Language Models to Generalizable Robotic Rewards via Failure Prompts","date":"2024-07-20","arxiv_id":"2407.14872","repositories_listed":0,"syntology":null},{"url":null,"slug":"phase-re-service-in-reinforcement-learning","title":"Phase Re-service in Reinforcement Learning Traffic Signal Control","date":"2024-07-20","arxiv_id":"2407.14775","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperparameter-optimization-for-driving","title":"Hyperparameter Optimization for Driving Strategies Based on Reinforcement Learning","date":"2024-07-19","arxiv_id":"2407.14262","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-evaluation-algorithms-in","title":"On Policy Evaluation Algorithms in Distributional Reinforcement Learning","date":"2024-07-19","arxiv_id":"2407.14175","repositories_listed":0,"syntology":null},{"url":null,"slug":"track-mdp-reinforcement-learning-for-target","title":"Track-MDP: Reinforcement Learning for Target Tracking with Controlled Sensing","date":"2024-07-19","arxiv_id":"2407.13995","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01429","title":"An Agile Adaptation Method for Multi-mode Vehicle Communication Networks","date":"2024-07-18","arxiv_id":"2408.01429","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-strategy-to-automate","title":"A reinforcement learning strategy to automate and accelerate h/p-multigrid solvers","date":"2024-07-18","arxiv_id":"2407.15872","repositories_listed":0,"syntology":null},{"url":null,"slug":"analyzing-and-bridging-the-gap-between","title":"Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning","date":"2024-07-18","arxiv_id":"2407.13279","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-2","title":"Deep Reinforcement Learning for Multi-Objective Optimization: Enhancing Wind Turbine Energy Generation while Mitigating Noise Emissions","date":"2024-07-18","arxiv_id":"2407.13320","repositories_listed":0,"syntology":null},{"url":null,"slug":"limt-language-informed-multi-task-visual","title":"LIMT: Language-Informed Multi-Task Visual World Models","date":"2024-07-18","arxiv_id":"2407.13466","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-policy-optimization-using","title":"Model-based Policy Optimization using Symbolic World Model","date":"2024-07-18","arxiv_id":"2407.13518","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-q-learning-for-average-reward-and","title":"Optimistic Q-learning for average reward and episodic reinforcement learning","date":"2024-07-18","arxiv_id":"2407.13743","repositories_listed":0,"syntology":null},{"url":null,"slug":"pg-rainbow-using-distributional-reinforcement","title":"PG-Rainbow: Using Distributional Reinforcement Learning in Policy Gradient Methods","date":"2024-07-18","arxiv_id":"2407.13146","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-latent-exploration-for-deep","title":"Random Latent Exploration for Deep Reinforcement Learning","date":"2024-07-18","arxiv_id":"2407.13755","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-tutorial-and-survey","title":"Reinforcement Learning: Tutorial and Survey","date":"2024-07-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-reaction-barriers-with-deep","title":"Estimating Reaction Barriers with Deep Reinforcement Learning","date":"2024-07-17","arxiv_id":"2407.12453","repositories_listed":0,"syntology":null},{"url":null,"slug":"maintenance-strategies-for-sewer-pipes-with","title":"Maintenance Strategies for Sewer Pipes with Multi-State Degradation and Deep Reinforcement Learning","date":"2024-07-17","arxiv_id":"2407.12894","repositories_listed":0,"syntology":null},{"url":null,"slug":"sparsity-based-safety-conservatism-for","title":"Sparsity-based Safety Conservatism for Constrained Offline Reinforcement Learning","date":"2024-07-17","arxiv_id":"2407.13006","repositories_listed":0,"syntology":null},{"url":null,"slug":"subequivariant-reinforcement-learning-in-3d","title":"Subequivariant Reinforcement Learning in 3D Multi-Entity Physical Environments","date":"2024-07-17","arxiv_id":"2407.12505","repositories_listed":0,"syntology":null},{"url":null,"slug":"bellman-diffusion-models","title":"Bellman Diffusion Models","date":"2024-07-16","arxiv_id":"2407.12163","repositories_listed":0,"syntology":null},{"url":null,"slug":"satisficing-exploration-for-deep","title":"Satisficing Exploration for Deep Reinforcement Learning","date":"2024-07-16","arxiv_id":"2407.12185","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-long-model-based-rollouts-are-no-reason","title":"Why long model-based rollouts are no reason for bad Q-value estimates","date":"2024-07-16","arxiv_id":"2407.11751","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-based-operators-for","title":"Deep Learning-Based Operators for Evolutionary Algorithms","date":"2024-07-15","arxiv_id":"2407.10477","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-knowledge-transfer-utilizing","title":"Exploration in Knowledge Transfer Utilizing Reinforcement Learning","date":"2024-07-15","arxiv_id":"2407.10835","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-imputed","title":"Offline Reinforcement Learning with Imputed Rewards","date":"2024-07-15","arxiv_id":"2407.10839","repositories_listed":0,"syntology":null},{"url":null,"slug":"three-dogmas-of-reinforcement-learning","title":"Three Dogmas of Reinforcement Learning","date":"2024-07-15","arxiv_id":"2407.10583","repositories_listed":0,"syntology":null},{"url":null,"slug":"walking-the-values-in-bayesian-inverse","title":"Walking the Values in Bayesian Inverse Reinforcement Learning","date":"2024-07-15","arxiv_id":"2407.10971","repositories_listed":0,"syntology":null},{"url":null,"slug":"affordance-guided-reinforcement-learning-via","title":"Affordance-Guided Reinforcement Learning via Visual Prompting","date":"2024-07-14","arxiv_id":"2407.10341","repositories_listed":0,"syntology":null},{"url":null,"slug":"ontology-driven-reinforcement-learning-for","title":"Ontology-driven Reinforcement Learning for Personalized Student Support","date":"2024-07-14","arxiv_id":"2407.10332","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-adapting-reinforcement-learning","title":"Towards Adapting Reinforcement Learning Agents to New Tasks: Insights from Q-Values","date":"2024-07-14","arxiv_id":"2407.10335","repositories_listed":0,"syntology":null},{"url":null,"slug":"communication-aware-reinforcement-learning","title":"Communication-Aware Reinforcement Learning for Cooperative Adaptive Cruise Control","date":"2024-07-12","arxiv_id":"2407.08964","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement-7","title":"Decentralized multi-agent reinforcement learning algorithm using a cluster-synchronized laser network","date":"2024-07-12","arxiv_id":"2407.09124","repositories_listed":0,"syntology":null},{"url":null,"slug":"hamilton-jacobi-reachability-in-reinforcement","title":"Hamilton-Jacobi Reachability in Reinforcement Learning: A Survey","date":"2024-07-12","arxiv_id":"2407.09645","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-cantor-kantorovich-metric-between-markov","title":"A Cantor-Kantorovich Metric Between Markov Decision Processes with Application to Transfer Learning","date":"2024-07-11","arxiv_id":"2407.08324","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-nine-physics-engines-for","title":"A Review of Nine Physics Engines for Reinforcement Learning Research","date":"2024-07-11","arxiv_id":"2407.08590","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-consensus-based-multi-agent","title":"Hierarchical Consensus-Based Multi-Agent Reinforcement Learning for Multi-Robot Cooperation Tasks","date":"2024-07-11","arxiv_id":"2407.08164","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-with-coarse-to-fine","title":"Continuous Control with Coarse-to-fine Reinforcement Learning","date":"2024-07-10","arxiv_id":"2407.07787","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-llms-to-explain-drl-decisions-for","title":"Leveraging LLMs to explain DRL decisions for transparent 6G network slicing","date":"2024-07-10","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimism-meets-risk-risk-sensitive-offline","title":"Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning","date":"2024-07-10","arxiv_id":"2407.07631","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-time-system-optimal-traffic-routing","title":"Real-time system optimal traffic routing under uncertainties -- Can physics models boost reinforcement learning?","date":"2024-07-10","arxiv_id":"2407.07364","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-adaptive","title":"Reinforcement Learning of Adaptive Acquisition Policies for Inverse Problems","date":"2024-07-10","arxiv_id":"2407.07794","repositories_listed":0,"syntology":null},{"url":null,"slug":"frequency-and-generalisation-of-periodic","title":"Frequency and Generalisation of Periodic Activation Functions in Reinforcement Learning","date":"2024-07-09","arxiv_id":"2407.06756","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-average-reward-linearly-solvable","title":"Hierarchical Average-Reward Linearly-solvable Markov Decision Processes","date":"2024-07-09","arxiv_id":"2407.06690","repositories_listed":0,"syntology":null},{"url":null,"slug":"intercepting-unauthorized-aerial-robots-in","title":"Intercepting Unauthorized Aerial Robots in Controlled Airspace Using Reinforcement Learning","date":"2024-07-09","arxiv_id":"2407.06909","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-open-source-multi-agent-deep-reinforcement","title":"An open source Multi-Agent Deep Reinforcement Learning Routing Simulator for satellite networks","date":"2024-07-08","arxiv_id":"2407.11047","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-anomaly-detection-with-noisy-labels-by","title":"Graph Anomaly Detection with Noisy Labels by Reinforcement Learning","date":"2024-07-08","arxiv_id":"2407.05934","repositories_listed":0,"syntology":null},{"url":null,"slug":"mathrm-e-2-cfd-towards-effective-and","title":"$\\mathrm{E^{2}CFD}$: Towards Effective and Efficient Cost Function Design for Safe Reinforcement Learning via Large Language Model","date":"2024-07-08","arxiv_id":"2407.05580","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-based-5","title":"Multi-agent Reinforcement Learning-based Network Intrusion Detection System","date":"2024-07-08","arxiv_id":"2407.05766","repositories_listed":0,"syntology":null},{"url":null,"slug":"system-stabilization-with-policy-optimization","title":"System stabilization with policy optimization on unstable latent manifolds","date":"2024-07-08","arxiv_id":"2407.06418","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-9","title":"A Reinforcement Learning Approach for Wildfire Tracking with UAV Swarms","date":"2024-07-07","arxiv_id":"2407.05473","repositories_listed":0,"syntology":null},{"url":null,"slug":"discounted-pseudocosts-in-milp","title":"Discounted Pseudocosts in MILP","date":"2024-07-07","arxiv_id":"2407.06237","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-off-policy-actor-critic","title":"Multi-agent Off-policy Actor-Critic Reinforcement Learning for Partially Observable Environments","date":"2024-07-06","arxiv_id":"2407.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-bayesian-policy-search","title":"Augmented Bayesian Policy Search","date":"2024-07-05","arxiv_id":"2407.04864","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-reinforcement-learning-in-power-grids-a","title":"Graph Reinforcement Learning for Power Grids: A Comprehensive Survey","date":"2024-07-05","arxiv_id":"2407.04522","repositories_listed":0,"syntology":null},{"url":null,"slug":"question-answering-with-texts-and-tables","title":"Question Answering with Texts and Tables through Deep Reinforcement Learning","date":"2024-07-05","arxiv_id":"2407.04858","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-video-summarization-via-1","title":"Unsupervised Video Summarization via Reinforcement Learning and a Trained Evaluator","date":"2024-07-05","arxiv_id":"2407.04258","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-pareto-reinforcement-learning-for-multi","title":"Deep Pareto Reinforcement Learning for Multi-Objective Recommender Systems","date":"2024-07-04","arxiv_id":"2407.03580","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-sequence-design","title":"Reinforcement Learning for Sequence Design Leveraging Protein Language Models","date":"2024-07-03","arxiv_id":"2407.03154","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-numeric-awards-in-context-dueling","title":"Beyond Numeric Awards: In-Context Dueling Bandits with LLM Agents","date":"2024-07-02","arxiv_id":"2407.01887","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-and-machine-ethics-a","title":"Reinforcement Learning and Machine ethics:a systematic review","date":"2024-07-02","arxiv_id":"2407.02425","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-human-feedback-2","title":"Reinforcement Learning from Human Feedback: Whose Culture, Whose Values, Whose Perspectives?","date":"2024-07-02","arxiv_id":"2407.17482","repositories_listed":0,"syntology":null},{"url":null,"slug":"research-on-autonomous-robots-navigation","title":"Research on Autonomous Robots Navigation based on Reinforcement Learning","date":"2024-07-02","arxiv_id":"2407.02539","repositories_listed":0,"syntology":null},{"url":null,"slug":"text-aware-diffusion-for-policy-learning","title":"Text-Aware Diffusion for Policy Learning","date":"2024-07-02","arxiv_id":"2407.01903","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-8","title":"A Deep Reinforcement Learning Approach to Battery Management in Dairy Farming via Proximal Policy Optimization","date":"2024-07-01","arxiv_id":"2407.01653","repositories_listed":0,"syntology":null}],"record_sha256":"a811d4536bf71cc52e60cbce9192ee30c1331bc1fa55ac164bea0e817042a2a2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}