{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/q-learning/papers/7","list_of":"/task/q-learning","task":"Q-Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":7,"pages_in_order":20,"rows_per_page":100,"rows":[601,700],"of":1918,"counts":{"archive_papers_tagged":1918,"with_a_code_link":463,"where_syntology_ran_a_sample":119,"not_listed_spam_title":0,"listed":1918,"listed_where_code_ran":119,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":102,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":102,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/q-learning","prev":"/task/q-learning/papers/6","next":"/task/q-learning/papers/8","papers":[{"url":null,"slug":"multi-objective-optimization-multi-auv","title":"Multi-Objective-Optimization Multi-AUV Assisted Data Collection Framework for IoUT Based on Offline Reinforcement Learning","date":"2024-10-15","arxiv_id":"2410.11282","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-statistical-inference-for-time-varying","title":"Asymptotic Analysis of Sample-averaged Q-learning","date":"2024-10-14","arxiv_id":"2410.10737","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-waveform-selection-for-cognitive-radar","title":"Online waveform selection for cognitive radar","date":"2024-10-14","arxiv_id":"2410.10591","repositories_listed":0,"syntology":null},{"url":null,"slug":"hybrid-llm-ddqn-based-joint-optimization-of","title":"Hybrid LLM-DDQN based Joint Optimization of V2I Communication and Autonomous Driving","date":"2024-10-11","arxiv_id":"2410.08854","repositories_listed":0,"syntology":null},{"url":null,"slug":"gap-dependent-bounds-for-q-learning-using","title":"Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition","date":"2024-10-10","arxiv_id":"2410.07574","repositories_listed":0,"syntology":null},{"url":null,"slug":"uniq-offline-inverse-q-learning-for-avoiding","title":"UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations","date":"2024-10-10","arxiv_id":"2410.08307","repositories_listed":0,"syntology":null},{"url":null,"slug":"verifierq-enhancing-llm-test-time-compute","title":"VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers","date":"2024-10-10","arxiv_id":"2410.08048","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimized-resource-allocation-for-cloud","title":"Optimized Resource Allocation for Cloud-Native 6G Networks: Zero-Touch ML Models in Microservices-based VNF Deployments","date":"2024-10-09","arxiv_id":"2410.06938","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-wsl-leveraging-dynamic-programming-for","title":"Q-WSL: Optimizing Goal-Conditioned RL with Weighted Supervised Learning via Dynamic Programming","date":"2024-10-09","arxiv_id":"2410.06648","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-in-complex-action-spaces-without","title":"Learning in complex action spaces without policy gradients","date":"2024-10-08","arxiv_id":"2410.06317","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcenment-learning-aided-noma-random","title":"Reinforcenment Learning-Aided NOMA Random Access: An AoI-Based Timeliness Perspective","date":"2024-10-04","arxiv_id":"2410.03398","repositories_listed":0,"syntology":null},{"url":null,"slug":"mimicking-human-intuition-cognitive-belief","title":"Mimicking Human Intuition: Cognitive Belief-Driven Q-Learning","date":"2024-10-02","arxiv_id":"2410.01739","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-knowledge-based-multi-objective","title":"Adaptive Knowledge-based Multi-Objective Evolutionary Algorithm for Hybrid Flow Shop Scheduling Problems with Multiple Parallel Batch Processing Stages","date":"2024-09-27","arxiv_id":"2409.18524","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimized-monte-carlo-tree-search-for","title":"Optimized Monte Carlo Tree Search for Enhanced Decision Making in the FrozenLake Environment","date":"2024-09-25","arxiv_id":"2409.16620","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-finite-space-mean","title":"Reinforcement Learning for Finite Space Mean-Field Type Games","date":"2024-09-25","arxiv_id":"2409.18152","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-state-based-policies-in-pomdps-beyond","title":"Agent-state based policies in POMDPs: Beyond belief-state MDPs","date":"2024-09-24","arxiv_id":"2409.15703","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-play-video-games-with-intuitive","title":"Learning to Play Video Games with Intuitive Physics Priors","date":"2024-09-20","arxiv_id":"2409.13886","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-quadratic-q-learning-using","title":"Data-Efficient Quadratic Q-Learning Using LMIs","date":"2024-09-18","arxiv_id":"2409.11986","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-proton-pbs-treatment-planning-for","title":"Automating proton PBS treatment planning for head and neck cancers using policy gradient-based deep reinforcement learning","date":"2024-09-17","arxiv_id":"2409.11576","repositories_listed":0,"syntology":null},{"url":null,"slug":"shire-enhancing-sample-efficiency-using-human","title":"SHIRE: Enhancing Sample Efficiency using Human Intuition in REinforcement Learning","date":"2024-09-16","arxiv_id":"2409.09990","repositories_listed":0,"syntology":null},{"url":null,"slug":"kan-v-s-mlp-for-offline-reinforcement","title":"KAN v.s. MLP for Offline Reinforcement Learning","date":"2024-09-15","arxiv_id":"2409.09653","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-vehicle-decision-making-framework","title":"Autonomous Vehicle Decision-Making Framework for Considering Malicious Behavior at Unsignalized Intersections","date":"2024-09-11","arxiv_id":"2409.17162","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-rate-maximization","title":"Reinforcement Learning for Rate Maximization in IRS-aided OWC Networks","date":"2024-09-07","arxiv_id":"2409.04842","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-directed-score-based-diffusion-models","title":"Reward-Directed Score-Based Diffusion Models via q-Learning","date":"2024-09-07","arxiv_id":"2409.04832","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-q-learning-algorithms-for-restless","title":"Faster Q-Learning Algorithms for Restless Bandits","date":"2024-09-06","arxiv_id":"2409.05908","repositories_listed":0,"syntology":null},{"url":null,"slug":"whittle-index-learning-algorithms-for","title":"Whittle Index Learning Algorithms for Restless Bandits with Constant Stepsizes","date":"2024-09-06","arxiv_id":"2409.04605","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-stochastic-approximation-and","title":"Asynchronous Stochastic Approximation and Average-Reward Reinforcement Learning","date":"2024-09-05","arxiv_id":"2409.03915","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-rates-of-federated-q","title":"On the Convergence Rates of Federated Q-Learning across Heterogeneous Environments","date":"2024-09-05","arxiv_id":"2409.03897","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enabled-satellite","title":"Reinforcement Learning-enabled Satellite Constellation Reconfiguration and Retasking for Mission-Critical Applications","date":"2024-09-03","arxiv_id":"2409.02270","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-multi-objective-task-learning","title":"Accelerated Multi-objective Task Learning using Modified Q-learning Algorithm","date":"2024-09-02","arxiv_id":"2409.01046","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitating-language-via-scalable-inverse","title":"Imitating Language via Scalable Inverse Reinforcement Learning","date":"2024-09-02","arxiv_id":"2409.01369","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-sample-communication-complexity-trade-off","title":"The Sample-Communication Complexity Trade-off in Federated Q-Learning","date":"2024-08-30","arxiv_id":"2408.16981","repositories_listed":0,"syntology":null},{"url":null,"slug":"coverage-analysis-of-multi-environment-q","title":"Coverage Analysis of Multi-Environment Q-Learning Algorithms for Wireless Network Optimization","date":"2024-08-29","arxiv_id":"2408.16882","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-convergence-of-average-reward-q-learning","title":"On Convergence of Average-Reward Q-Learning in Weakly Communicating Markov Decision Processes","date":"2024-08-29","arxiv_id":"2408.16262","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-operator-management-in-meta","title":"Dynamic operator management in meta-heuristics using reinforcement learning: an application to permutation flowshop scheduling problems","date":"2024-08-27","arxiv_id":"2408.14864","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-td3-for-7-dof-robotic-arm-grasping","title":"Optimizing TD3 for 7-DOF Robotic Arm Grasping: Overcoming Suboptimality with Exploration-Enhanced Contrastive Learning","date":"2024-08-26","arxiv_id":"2408.14009","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-llm-be-a-good-path-planner-based-on","title":"Can LLM be a Good Path Planner based on Prompt Engineering? Mitigating the Hallucination for Path Planning","date":"2024-08-23","arxiv_id":"2408.13184","repositories_listed":0,"syntology":null},{"url":null,"slug":"deviations-from-the-nash-equilibrium-and","title":"Deviations from the Nash equilibrium and emergence of tacit collusion in a two-player optimal execution game with reinforcement learning","date":"2024-08-21","arxiv_id":"2408.11773","repositories_listed":0,"syntology":null},{"url":null,"slug":"gino-q-learning-an-asymptotically-optimal","title":"GINO-Q: Learning an Asymptotically Optimal Index Policy for Restless Multi-armed Bandits","date":"2024-08-19","arxiv_id":"2408.09882","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-q-learning-based-multi-hop-routing","title":"Improved Q-learning based Multi-hop Routing for UAV-Assisted Communication","date":"2024-08-17","arxiv_id":"2408.09109","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conflicts-free-speed-lossless-kan-based","title":"A Conflicts-free, Speed-lossless KAN-based Reinforcement Learning Decision System for Interactive Driving in Roundabouts","date":"2024-08-15","arxiv_id":"2408.08242","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduced-cascade-q-learning","title":"Variance-Reduced Cascade Q-learning: Algorithms and Sample Complexity","date":"2024-08-13","arxiv_id":"2408.06544","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-geometric-nash-approach-in-tuning-the","title":"A Geometric Nash Approach in Tuning the Learning Rate in Q-Learning Algorithm","date":"2024-08-09","arxiv_id":"2408.04911","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-03088","title":"QADQN: Quantum Attention Deep Q-Network for Financial Market Prediction","date":"2024-08-06","arxiv_id":"2408.03088","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-optimal-controller-for-discrete","title":"Model-free optimal controller for discrete-time Markovian jump linear systems: A Q-learning approach","date":"2024-08-06","arxiv_id":"2408.03077","repositories_listed":0,"syntology":null},{"url":null,"slug":"whittle-s-index-based-age-of-information","title":"Whittle's index-based age-of-information minimization in multi-energy harvesting source networks","date":"2024-08-05","arxiv_id":"2408.02570","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01999","title":"Reinforcement Learning for an Efficient and Effective Malware Investigation during Cyber Incident Response","date":"2024-08-04","arxiv_id":"2408.01999","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01188","title":"Multi-Objective Deep Reinforcement Learning for Optimisation in Autonomous Systems","date":"2024-08-02","arxiv_id":"2408.01188","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-assessment-with-qos-enhancement","title":"Multi-agent Assessment with QoS Enhancement for HD Map Updates in a Vehicular Network","date":"2024-07-31","arxiv_id":"2407.21460","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolution-of-cooperation-in-the-public-goods","title":"Evolution of cooperation in the public goods game with Q-learning","date":"2024-07-29","arxiv_id":"2407.19851","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-evolution-of-cooperation-with-q-learning","title":"Evolution of cooperation with Q-learning: the impact of information perception","date":"2024-07-29","arxiv_id":"2407.19634","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-deep-reinforcement-learning-for-18","title":"Multi-Agent Deep Reinforcement Learning for Energy Efficient Multi-Hop STAR-RIS-Assisted Transmissions","date":"2024-07-26","arxiv_id":"2407.18627","repositories_listed":0,"syntology":null},{"url":null,"slug":"qt-tdm-planning-with-transformer-dynamics","title":"QT-TDM: Planning With Transformer Dynamics Model and Autoregressive Q-Learning","date":"2024-07-26","arxiv_id":"2407.18841","repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-fairness-in-ride-hailing-platform","title":"Long-term Fairness in Ride-Hailing Platform","date":"2024-07-25","arxiv_id":"2407.17839","repositories_listed":0,"syntology":null},{"url":null,"slug":"principal-agent-reinforcement-learning","title":"Principal-Agent Reinforcement Learning: Orchestrating AI Agents with Contracts","date":"2024-07-25","arxiv_id":"2407.18074","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-search-for-architectures-and-loss","title":"In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning","date":"2024-07-23","arxiv_id":"2407.16807","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluation-of-reinforcement-learning-for","title":"Evaluation of Reinforcement Learning for Autonomous Penetration Testing using A3C, Q-learning and DQN","date":"2024-07-22","arxiv_id":"2407.15656","repositories_listed":0,"syntology":null},{"url":null,"slug":"modrl-ta-a-multi-objective-deep-reinforcement","title":"MODRL-TA:A Multi-Objective Deep Reinforcement Learning Framework for Traffic Allocation in E-Commerce Search","date":"2024-07-22","arxiv_id":"2407.15476","repositories_listed":0,"syntology":null},{"url":null,"slug":"coverage-aware-and-reinforcement-learning","title":"Coverage-aware and Reinforcement Learning Using Multi-agent Approach for HD Map QoS in a Realistic Environment","date":"2024-07-19","arxiv_id":"2408.03329","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-01429","title":"An Agile Adaptation Method for Multi-mode Vehicle Communication Networks","date":"2024-07-18","arxiv_id":"2408.01429","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-2","title":"Deep Reinforcement Learning for Multi-Objective Optimization: Enhancing Wind Turbine Energy Generation while Mitigating Noise Emissions","date":"2024-07-18","arxiv_id":"2407.13320","repositories_listed":0,"syntology":null},{"url":null,"slug":"misspecified-q-learning-with-sparse-linear","title":"Misspecified $Q$-Learning with Sparse Linear Function Approximation: Tight Bounds on Approximation Error","date":"2024-07-18","arxiv_id":"2407.13622","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-q-learning-for-average-reward-and","title":"Optimistic Q-learning for average reward and episodic reinforcement learning","date":"2024-07-18","arxiv_id":"2407.13743","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-tutorial-and-survey","title":"Reinforcement Learning: Tutorial and Survey","date":"2024-07-18","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-the-model-unavailable-mare-using-q","title":"Solving the Model Unavailable MARE using Q-Learning Algorithm","date":"2024-07-18","arxiv_id":"2407.13227","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-reward-shaping-for-multi-agent","title":"Cooperative Reward Shaping for Multi-Agent Pathfinding","date":"2024-07-15","arxiv_id":"2407.10403","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-knowledge-transfer-utilizing","title":"Exploration in Knowledge Transfer Utilizing Reinforcement Learning","date":"2024-07-15","arxiv_id":"2407.10835","repositories_listed":0,"syntology":null},{"url":null,"slug":"pail-performance-based-adversarial-imitation","title":"PAIL: Performance based Adversarial Imitation Learning Engine for Carbon Neutral Optimization","date":"2024-07-12","arxiv_id":"2407.08910","repositories_listed":0,"syntology":null},{"url":null,"slug":"pid-accelerated-temporal-difference","title":"PID Accelerated Temporal Difference Algorithms","date":"2024-07-11","arxiv_id":"2407.08803","repositories_listed":0,"syntology":null},{"url":null,"slug":"periodic-agent-state-based-q-learning-for","title":"Periodic agent-state based Q-learning for POMDPs","date":"2024-07-08","arxiv_id":"2407.06121","repositories_listed":0,"syntology":null},{"url":null,"slug":"unified-continuous-time-q-learning-for-mean","title":"Unified continuous-time q-learning for mean-field game and mean-field control problems","date":"2024-07-05","arxiv_id":"2407.04521","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-intelligence-and-algorithmic-price","title":"Artificial Intelligence and Algorithmic Price Collusion in Two-sided Markets","date":"2024-07-04","arxiv_id":"2407.04088","repositories_listed":0,"syntology":null},{"url":null,"slug":"configuring-transmission-thresholds-in-iiot","title":"Configuring Transmission Thresholds in IIoT Alarm Scenarios for Energy-Efficient Event Reporting","date":"2024-07-04","arxiv_id":"2407.03982","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-time-q-learning-for-jump-diffusion","title":"Continuous-time q-Learning for Jump-Diffusion Models under Tsallis Entropy","date":"2024-07-04","arxiv_id":"2407.03888","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-step-q-learning","title":"Two-Step Q-Learning","date":"2024-07-02","arxiv_id":"2407.02369","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-8","title":"A Deep Reinforcement Learning Approach to Battery Management in Dairy Farming via Proximal Policy Optimization","date":"2024-07-01","arxiv_id":"2407.01653","repositories_listed":0,"syntology":null},{"url":null,"slug":"tackling-long-horizon-tasks-with-model-based","title":"Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning","date":"2024-06-30","arxiv_id":"2407.00699","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-secure-and-efficient-data-scheduling","title":"Towards Secure and Efficient Data Scheduling for Vehicular Social Networks","date":"2024-06-28","arxiv_id":"2407.00141","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-semantic-traffic-control-in-avs","title":"Decentralized Semantic Traffic Control in AVs Using RL and DQN for Dynamic Roadblocks","date":"2024-06-26","arxiv_id":"2406.18741","repositories_listed":0,"syntology":null},{"url":null,"slug":"mereq-max-ent-residual-q-inverse-rl-for","title":"MEReQ: Max-Ent Residual-Q Inverse RL for Sample-Efficient Alignment from Intervention","date":"2024-06-24","arxiv_id":"2406.16258","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-general-control-theoretic-approach-for","title":"A General Control-Theoretic Approach for Reinforcement Learning: Theory and Algorithms","date":"2024-06-20","arxiv_id":"2406.14753","repositories_listed":0,"syntology":null},{"url":null,"slug":"eduqate-generating-adaptive-curricula-through","title":"EduQate: Generating Adaptive Curricula through RMABs in Education Settings","date":"2024-06-20","arxiv_id":"2406.14122","repositories_listed":0,"syntology":null},{"url":null,"slug":"equivariant-offline-reinforcement-learning","title":"Equivariant Offline Reinforcement Learning","date":"2024-06-20","arxiv_id":"2406.13961","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-select-goals-in-automated","title":"Learning to Select Goals in Automated Planning with Deep-Q Learning","date":"2024-06-20","arxiv_id":"2406.14779","repositories_listed":0,"syntology":null},{"url":null,"slug":"catalytic-evolution-of-cooperation-in-a","title":"Catalytic evolution of cooperation in a population with behavioural bimodality","date":"2024-06-17","arxiv_id":"2406.11121","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-transport-assisted-risk-sensitive-q","title":"Optimal Transport-Assisted Risk-Sensitive Q-Learning","date":"2024-06-17","arxiv_id":"2406.11774","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-simultaneous-double-q","title":"Finite-Time Analysis of Simultaneous Double Q-learning","date":"2024-06-14","arxiv_id":"2406.09946","repositories_listed":0,"syntology":null},{"url":null,"slug":"mix-q-learning-for-lane-changing-a","title":"Mix Q-learning for Lane Changing: A Collaborative Decision-Making Method in Multi-Agent Deep Reinforcement Learning","date":"2024-06-14","arxiv_id":"2406.09755","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-deep","title":"Multi-agent Reinforcement Learning with Deep Networks for Diverse Q-Vectors","date":"2024-06-12","arxiv_id":"2406.07848","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-fading-channel-and-power-optimization-of","title":"Fast-Fading Channel and Power Optimization of the Magnetic Inductive Cellular Network","date":"2024-06-07","arxiv_id":"2406.04737","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-frequency-scheduling-by-learning","title":"Online Frequency Scheduling by Learning Parallel Actions","date":"2024-06-07","arxiv_id":"2406.05041","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-expectiles-in-reinforcement","title":"Bootstrapping Expectiles in Reinforcement Learning","date":"2024-06-06","arxiv_id":"2406.04081","repositories_listed":0,"syntology":null},{"url":null,"slug":"age-of-trust-aot-a-continuous-verification","title":"Age of Trust (AoT): A Continuous Verification Framework for Wireless Networks","date":"2024-06-04","arxiv_id":"2406.02190","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithmic-collusion-in-dynamic-pricing-with","title":"Algorithmic Collusion in Dynamic Pricing with Deep Reinforcement Learning","date":"2024-06-04","arxiv_id":"2406.02437","repositories_listed":0,"syntology":null},{"url":null,"slug":"tabular-and-deep-learning-for-the-whittle","title":"Tabular and Deep Learning for the Whittle Index","date":"2024-06-04","arxiv_id":"2406.02057","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-to-discretize-continuous-state-action","title":"How to discretize continuous state-action spaces in Q-learning: A symbolic control approach","date":"2024-06-03","arxiv_id":"2406.01548","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-global-convergence-of-independent","title":"Approximate Global Convergence of Independent Learning in Multi-Agent Systems","date":"2024-05-30","arxiv_id":"2405.19811","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-as-a-monotone-scheme","title":"Q-learning as a monotone scheme","date":"2024-05-30","arxiv_id":"2405.20538","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-q-learning-with-reference-advantage","title":"Federated Q-Learning with Reference-Advantage Decomposition: Almost Optimal Regret and Logarithmic Communication Cost","date":"2024-05-29","arxiv_id":"2405.18795","repositories_listed":0,"syntology":null},{"url":null,"slug":"highway-reinforcement-learning","title":"Highway Reinforcement Learning","date":"2024-05-28","arxiv_id":"2405.18289","repositories_listed":0,"syntology":null}],"record_sha256":"3df41434c6760658e4b9634a478ce970bbc2667cfb76da5e4fd510706daea025","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}