{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/q-learning/papers/8","list_of":"/task/q-learning","task":"Q-Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":8,"pages_in_order":20,"rows_per_page":100,"rows":[701,800],"of":1918,"counts":{"archive_papers_tagged":1918,"with_a_code_link":463,"where_syntology_ran_a_sample":119,"not_listed_spam_title":0,"listed":1918,"listed_where_code_ran":119,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":102,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":102,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/q-learning","prev":"/task/q-learning/papers/7","next":"/task/q-learning/papers/9","papers":[{"url":null,"slug":"mutation-bias-learning-in-games","title":"Mutation-Bias Learning in Games","date":"2024-05-28","arxiv_id":"2405.18190","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-multiscale-reinforcement-q","title":"Analysis of Multiscale Reinforcement Q-Learning Algorithms for Mean Field Control Games","date":"2024-05-27","arxiv_id":"2405.17017","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-evolutionary-framework-for-connect-4-as","title":"An Evolutionary Framework for Connect-4 as Test-Bed for Comparison of Advanced Minimax, Q-Learning and MCTS","date":"2024-05-26","arxiv_id":"2405.16595","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-jump-diffusions","title":"Reinforcement Learning for Jump-Diffusions, with Financial Applications","date":"2024-05-26","arxiv_id":"2405.16449","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforcement-learning-via-large","title":"Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning","date":"2024-05-24","arxiv_id":"2405.15194","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-informed-auto-penetration-testing","title":"Knowledge-Informed Auto-Penetration Testing Based on Reinforcement Learning with Reward Machine","date":"2024-05-24","arxiv_id":"2405.15908","repositories_listed":0,"syntology":null},{"url":null,"slug":"sf-dqn-provable-knowledge-transfer-using","title":"SF-DQN: Provable Knowledge Transfer using Successor Feature for Deep Reinforcement Learning","date":"2024-05-24","arxiv_id":"2405.15920","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-finite-time-analysis-of-distributed-q","title":"A finite time analysis of distributed Q-learning","date":"2024-05-23","arxiv_id":"2405.14078","repositories_listed":0,"syntology":null},{"url":null,"slug":"exclusively-penalized-q-learning-for-offline","title":"Exclusively Penalized Q-learning for Offline Reinforcement Learning","date":"2024-05-23","arxiv_id":"2405.14082","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-q-learning-for-large-discrete","title":"Stochastic Q-learning for Large Discrete Action Spaces","date":"2024-05-16","arxiv_id":"2405.10310","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-real-time-2","title":"Deep Reinforcement Learning for Real-Time Ground Delay Program Revision and Corresponding Flight Delay Assignments","date":"2024-05-14","arxiv_id":"2405.08298","repositories_listed":0,"syntology":null},{"url":null,"slug":"smart-sampling-self-attention-and","title":"Smart Sampling: Self-Attention and Bootstrapping for Improved Ensembled Q-Learning","date":"2024-05-14","arxiv_id":"2405.08252","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-partial-survey-of-decentralized-cooperative","title":"An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-10","arxiv_id":"2405.06161","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-overview-of-machine-learning-enabled-1","title":"An Overview of Machine Learning-Enabled Optimization for Reconfigurable Intelligent Surfaces-Aided 6G Networks: From Reinforcement Learning to Large Language Models","date":"2024-05-09","arxiv_id":"2405.17439","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-q-learning-with-large-language","title":"Enhancing Q-Learning with Large Language Model Heuristics","date":"2024-05-06","arxiv_id":"2405.03341","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-network-simulation-of-otc-markets-with","title":"A Network Simulation of OTC Markets with Multiple Agents","date":"2024-05-03","arxiv_id":"2405.02480","repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-sum-positional-differential-games-as-a","title":"Zero-Sum Positional Differential Games as a Framework for Robust Reinforcement Learning: Deep Q-Learning Approach","date":"2024-05-03","arxiv_id":"2405.02044","repositories_listed":0,"syntology":null},{"url":null,"slug":"loqa-learning-with-opponent-q-learning","title":"LOQA: Learning with Opponent Q-Learning Awareness","date":"2024-05-02","arxiv_id":"2405.01035","repositories_listed":0,"syntology":null},{"url":null,"slug":"cell-switching-in-haps-aided-networking-how","title":"Cell Switching in HAPS-Aided Networking: How the Obscurity of Traffic Loads Affects the Decision","date":"2024-05-01","arxiv_id":"2405.00387","repositories_listed":0,"syntology":null},{"url":null,"slug":"numeric-reward-machines","title":"Numeric Reward Machines","date":"2024-04-30","arxiv_id":"2404.19370","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-problem-solving-with","title":"Reinforcement Learning Problem Solving with Large Language Models","date":"2024-04-29","arxiv_id":"2404.18638","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-q-learning-to-dynamically-toggle","title":"Using Deep Q-Learning to Dynamically Toggle between Push/Pull Actions in Computational Trust Mechanisms","date":"2024-04-28","arxiv_id":"2404.18296","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-to-navigate-turbulence-without-a","title":"Q-learning with temporal memory to navigate turbulence","date":"2024-04-26","arxiv_id":"2404.17495","repositories_listed":0,"syntology":null},{"url":null,"slug":"age-of-information-minimization-using-multi","title":"Age of Information Minimization using Multi-agent UAVs based on AI-Enhanced Mean Field Resource Allocation","date":"2024-04-24","arxiv_id":"2405.00056","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-backwards-q-learning-in","title":"Recursive Backwards Q-Learning in Deterministic Environments","date":"2024-04-24","arxiv_id":"2404.15822","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-ode-analysis-of-smooth-q-learning","title":"Unified ODE Analysis of Smooth Q-Learning Algorithms","date":"2024-04-20","arxiv_id":"2404.14442","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-time-risk-sensitive-reinforcement","title":"Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty","date":"2024-04-19","arxiv_id":"2404.12598","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-task-continual-offline-reinforcement","title":"Data-Incremental Continual Offline Reinforcement Learning","date":"2024-04-19","arxiv_id":"2404.12639","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-r-to-q-your-language-model-is-secretly-a","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","date":"2024-04-18","arxiv_id":"2404.12358","repositories_listed":0,"syntology":null},{"url":null,"slug":"empowering-embodied-visual-tracking-with","title":"Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL","date":"2024-04-15","arxiv_id":"2404.09857","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-forest-fire-prevention-deep","title":"Advancing Forest Fire Prevention: Deep Reinforcement Learning for Effective Firebreak Placement","date":"2024-04-12","arxiv_id":"2404.08523","repositories_listed":0,"syntology":null},{"url":null,"slug":"prelimit-coupling-and-steady-state","title":"Prelimit Coupling and Steady-State Convergence of Constant-stepsize Nonsmooth Contractive SA","date":"2024-04-09","arxiv_id":"2404.06023","repositories_listed":0,"syntology":null},{"url":null,"slug":"traffic-signal-control-and-speed-offset","title":"Traffic Signal Control and Speed Offset Coordination Using Q-Learning for Arterial Road Networks","date":"2024-04-09","arxiv_id":"2404.06382","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-control-for","title":"Deep Reinforcement Learning Control for Disturbance Rejection in a Nonlinear Dynamic System with Parametric Uncertainty","date":"2024-04-06","arxiv_id":"2404.04699","repositories_listed":0,"syntology":null},{"url":null,"slug":"growing-q-networks-solving-continuous-control","title":"Growing Q-Networks: Solving Continuous Control Tasks with Adaptive Control Resolution","date":"2024-04-05","arxiv_id":"2404.04253","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-knowledge-transfer-in-batch-q","title":"Data-Driven Knowledge Transfer in Batch $Q^*$ Learning","date":"2024-04-01","arxiv_id":"2404.15209","repositories_listed":0,"syntology":null},{"url":null,"slug":"utilizing-maximum-mean-discrepancy-barycenter","title":"Utilizing Maximum Mean Discrepancy Barycenter for Propagating the Uncertainty of Value Functions in Reinforcement Learning","date":"2024-03-31","arxiv_id":"2404.00686","repositories_listed":0,"syntology":null},{"url":null,"slug":"encomp-enhanced-covert-maneuver-planning","title":"EnCoMP: Enhanced Covert Maneuver Planning with Adaptive Threat-Aware Visibility Estimation using Offline Reinforcement Learning","date":"2024-03-29","arxiv_id":"2403.20016","repositories_listed":0,"syntology":null},{"url":null,"slug":"dasa-delay-adaptive-multi-agent-stochastic","title":"DASA: Delay-Adaptive Multi-Agent Stochastic Approximation","date":"2024-03-25","arxiv_id":"2403.17247","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aware-remote-estimation-of-multiple","title":"Semantic-Aware Remote Estimation of Multiple Markov Sources Under Constraints","date":"2024-03-25","arxiv_id":"2403.16855","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-online-testing-of","title":"Reinforcement Learning for Online Testing of Autonomous Driving Systems: a Replication and Extension Study","date":"2024-03-20","arxiv_id":"2403.13729","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-separated-sarsa-a-practical-sequential","title":"State-Separated SARSA: A Practical Sequential Decision-Making Algorithm with Recovering Rewards","date":"2024-03-18","arxiv_id":"2403.11520","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-kernel-conditional-mean-embeddings","title":"Neural-Kernel Conditional Mean Embeddings","date":"2024-03-16","arxiv_id":"2403.10859","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-dairy","title":"A Reinforcement Learning Approach to Dairy Farm Battery Management using Q Learning","date":"2024-03-14","arxiv_id":"2403.09499","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-resilient-controller-design-based","title":"Model-free Resilient Controller Design based on Incentive Feedback Stackelberg Game and Q-learning","date":"2024-03-13","arxiv_id":"2403.08948","repositories_listed":0,"syntology":null},{"url":null,"slug":"strategizing-against-q-learners-a-control","title":"Strategizing against Q-learners: A Control-theoretical Approach","date":"2024-03-13","arxiv_id":"2403.08906","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-design-and-implementation-of-an-open","title":"Optimal Design and Implementation of an Open-source Emulation Platform for User-Centric Shared E-mobility Services","date":"2024-03-12","arxiv_id":"2403.07964","repositories_listed":0,"syntology":null},{"url":null,"slug":"symmetric-q-learning-reducing-skewness-of","title":"Symmetric Q-learning: Reducing Skewness of Bellman Error in Online Reinforcement Learning","date":"2024-03-12","arxiv_id":"2403.07704","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-error-analysis-of-soft-q-learning","title":"Finite-Time Error Analysis of Soft Q-Learning: Switching System Approach","date":"2024-03-11","arxiv_id":"2403.06366","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithmic-collusion-and-price","title":"Algorithmic Collusion and Price Discrimination: The Over-Usage of Data","date":"2024-03-10","arxiv_id":"2403.06150","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-classification-performance-via","title":"Enhancing Classification Performance via Reinforcement Learning for Feature Selection","date":"2024-03-09","arxiv_id":"2403.05979","repositories_listed":0,"syntology":null},{"url":null,"slug":"smaug-a-sliding-multidimensional-task-window","title":"SMAUG: A Sliding Multidimensional Task Window-Based MARL Framework for Adaptive Real-Time Subtask Recognition","date":"2024-03-04","arxiv_id":"2403.01816","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-fox-learning-breaking-tradition-in","title":"QF-tuner: Breaking Tradition in Reinforcement Learning","date":"2024-02-26","arxiv_id":"2402.16562","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-index-policy-based-on-sarsa-and-q-learning","title":"An Index Policy Based on Sarsa and Q-learning for Heterogeneous Smart Target Tracking","date":"2024-02-19","arxiv_id":"2402.12015","repositories_listed":0,"syntology":null},{"url":null,"slug":"easy-as-abcs-unifying-boltzmann-q-learning","title":"Easy as ABCs: Unifying Boltzmann Q-Learning and Counterfactual Regret Minimization","date":"2024-02-19","arxiv_id":"2402.11835","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-error-analysis-of-online-model","title":"Finite-Time Error Analysis of Online Model-Based Q-Learning with a Relaxed Sampling Model","date":"2024-02-19","arxiv_id":"2402.11877","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-optimal-execution","title":"Reinforcement Learning for Optimal Execution when Liquidity is Time-Varying","date":"2024-02-19","arxiv_id":"2402.12049","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-approximation-with-delayed-updates","title":"Stochastic Approximation with Delayed Updates: Finite-Time Rates under Markovian Sampling","date":"2024-02-19","arxiv_id":"2402.11800","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-to-maximise-wind","title":"Reinforcement learning to maximise wind turbine energy generation","date":"2024-02-17","arxiv_id":"2402.11384","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-estimation-bias-in-deep-double-q","title":"Exploiting Estimation Bias in Clipped Double Q-Learning for Continous Control Reinforcement Learning Tasks","date":"2024-02-14","arxiv_id":"2402.09078","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-deep-q-learning-for-2d-self-driving","title":"Enhanced Deep Q-Learning for 2D Self-Driving Cars: Implementation and Evaluation on a Custom Track Environment","date":"2024-02-13","arxiv_id":"2402.08780","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-agricultural-management","title":"Intelligent Agricultural Management Considering N$_2$O Emission and Climate Variability with Uncertainties","date":"2024-02-13","arxiv_id":"2402.08832","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-deep-q-learning-and-5g-load","title":"Federated Deep Q-Learning and 5G load balancing","date":"2024-02-10","arxiv_id":"2403.08813","repositories_listed":0,"syntology":null},{"url":null,"slug":"orient-a-priority-aware-energy-efficient","title":"ORIENT: A Priority-Aware Energy-Efficient Approach for Latency-Sensitive Applications in 6G","date":"2024-02-10","arxiv_id":"2402.06931","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-function-interference-and-greedy-action","title":"Value function interference and greedy action selection in value-based multi-objective reinforcement learning","date":"2024-02-09","arxiv_id":"2402.06266","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-caching-based-on-deep-reinforcement","title":"Attention-Enhanced Prioritized Proximal Policy Optimization for Adaptive Edge Caching","date":"2024-02-08","arxiv_id":"2402.14576","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancement-of-high-definition-map-update","title":"Enhancement of High-definition Map Update Service Through Coverage-aware and Reinforcement Learning","date":"2024-02-08","arxiv_id":"2402.14582","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-offline-reinforcement-learning-1","title":"Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage Suffices","date":"2024-02-08","arxiv_id":"2402.05876","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-17","title":"A Deep Reinforcement Learning Approach for Adaptive Traffic Routing in Next-gen Networks","date":"2024-02-07","arxiv_id":"2402.04515","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-world-model","title":"Diffusion World Model: Future Modeling Beyond Step-by-Step Rollout for Offline Reinforcement Learning","date":"2024-02-05","arxiv_id":"2402.03570","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-for-21","title":"Multi-Agent Reinforcement Learning for Offloading Cellular Communications with Cooperating UAVs","date":"2024-02-05","arxiv_id":"2402.02957","repositories_listed":0,"syntology":null},{"url":null,"slug":"textit-minmaxmin-q-learning","title":"MinMaxMin $Q$-learning","date":"2024-02-03","arxiv_id":"2402.05951","repositories_listed":0,"syntology":null},{"url":null,"slug":"textit-sqt-textit-std-q-target","title":"SQT -- std $Q$-target","date":"2024-02-03","arxiv_id":"2402.05950","repositories_listed":0,"syntology":null},{"url":null,"slug":"drl-based-dynamic-channel-access-and-sclar","title":"DRL-Based Dynamic Channel Access and SCLAR Maximization for Networks Under Jamming","date":"2024-02-02","arxiv_id":"2402.01574","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-robot-sketching-an-application-of-deep-q","title":"Deep Robot Sketching: An application of Deep Q-Learning Networks for human-like sketching","date":"2024-02-01","arxiv_id":"2402.00676","repositories_listed":0,"syntology":null},{"url":null,"slug":"fm3q-factorized-multi-agent-minimax-q","title":"FM3Q: Factorized Multi-Agent MiniMax Q-Learning for Two-Team Zero-Sum Markov Game","date":"2024-02-01","arxiv_id":"2402.00738","repositories_listed":0,"syntology":null},{"url":null,"slug":"nash-soft-actor-critic-leo-satellite-handover","title":"Nash Soft Actor-Critic LEO Satellite Handover Management Algorithm for Flying Vehicles","date":"2024-01-31","arxiv_id":"2402.00091","repositories_listed":0,"syntology":null},{"url":null,"slug":"scheduled-curiosity-deep-dyna-q-efficient","title":"Scheduled Curiosity-Deep Dyna-Q: Efficient Exploration for Dialog Policy Learning","date":"2024-01-31","arxiv_id":"2402.00085","repositories_listed":0,"syntology":null},{"url":null,"slug":"extrinsicaly-rewarded-soft-q-imitation","title":"Extrinsicaly Rewarded Soft Q Imitation Learning with Discriminator","date":"2024-01-30","arxiv_id":"2401.16772","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergence-of-cooperation-under-punishment-a","title":"Emergence of cooperation under punishment: A reinforcement learning perspective","date":"2024-01-29","arxiv_id":"2401.16073","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-q-learning-with-linear-function","title":"Regularized Q-Learning with Linear Function Approximation","date":"2024-01-26","arxiv_id":"2401.15196","repositories_listed":0,"syntology":null},{"url":null,"slug":"constant-stepsize-q-learning-distributional","title":"Constant Stepsize Q-learning: Distributional Convergence, Bias and Extrapolation","date":"2024-01-25","arxiv_id":"2401.13884","repositories_listed":0,"syntology":null},{"url":null,"slug":"revalued-regularised-ensemble-value","title":"REValueD: Regularised Ensemble Value-Decomposition for Factorisable Markov Decision Processes","date":"2024-01-16","arxiv_id":"2401.08850","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-q-learning-for-combinatorial","title":"Graph Q-Learning for Combinatorial Optimization","date":"2024-01-11","arxiv_id":"2401.05610","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-4","title":"Model-Free Reinforcement Learning for Automated Fluid Administration in Critical Care","date":"2024-01-11","arxiv_id":"2401.06299","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-ecg-diagnosis-using-reinforcement","title":"Advancing ECG Diagnosis Using Reinforcement Learning on Global Waveform Variations Related to P Wave and PR Interval","date":"2024-01-10","arxiv_id":"2401.04938","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-multi-agent-learning","title":"Deep Reinforcement Multi-agent Learning framework for Information Gathering with Local Gaussian Processes for Water Monitoring","date":"2024-01-09","arxiv_id":"2401.04631","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-empirical-investigation-of-value-based","title":"An Empirical Investigation of Value-Based Multi-objective Reinforcement Learning for Stochastic Environments","date":"2024-01-06","arxiv_id":"2401.03163","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-q-learning-based-smart-scheduling-of","title":"A Deep Q-Learning based Smart Scheduling of EVs for Demand Response in Smart Grids","date":"2024-01-05","arxiv_id":"2401.02653","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-best-time-for-an-update-risk-sensitive","title":"The Best Time for an Update: Risk-Sensitive Minimization of Age-Based Metrics","date":"2024-01-03","arxiv_id":"2401.10265","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-dynamic-pricing-policy-for","title":"Personalized Dynamic Pricing Policy for Electric Vehicles: Reinforcement learning approach","date":"2024-01-01","arxiv_id":"2401.00661","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-decision-making-in-engineering-system","title":"Dynamic Decision Making in Engineering System Design: A Deep Q-Learning Approach","date":"2023-12-28","arxiv_id":"2312.17284","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-based","title":"Distributional Reinforcement Learning-based Energy Arbitrage Strategies in Imbalance Settlement Mechanism","date":"2023-12-23","arxiv_id":"2401.00015","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-safe-occupancy","title":"Reinforcement Learning for Safe Occupancy Strategies in Educational Spaces during an Epidemic","date":"2023-12-23","arxiv_id":"2312.15163","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-q-learning-linear-regret-speedup","title":"Federated Q-Learning: Linear Regret Speedup with Low Communication Cost","date":"2023-12-22","arxiv_id":"2312.15023","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-gflownets-with-soft-q","title":"Maximum entropy GFlowNets with soft Q-learning","date":"2023-12-21","arxiv_id":"2312.14331","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-coordination-in-minority-game-a","title":"Optimal coordination of resources: A solution from reinforcement learning","date":"2023-12-20","arxiv_id":"2312.14970","repositories_listed":0,"syntology":null},{"url":null,"slug":"stability-of-multi-agent-learning-in","title":"Stability of Multi-Agent Learning in Competitive Networks: Delaying the Onset of Chaos","date":"2023-12-19","arxiv_id":"2312.11943","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-dispatch-a-deep-reinforcement-learning","title":"Deep-Dispatch: A Deep Reinforcement Learning-Based Vehicle Dispatch Algorithm for Advanced Air Mobility","date":"2023-12-17","arxiv_id":"2312.10809","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-designing-multi-uav-aided-wireless-powered","title":"On Designing Multi-UAV aided Wireless Powered Dynamic Communication via Hierarchical Deep Reinforcement Learning","date":"2023-12-13","arxiv_id":"2312.07917","repositories_listed":0,"syntology":null}],"record_sha256":"10e188f3b2797170cde08d11c2a5c2141c1ffec412a9ad33dedf70715cfd58ea","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}