{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/q-learning/papers/12","list_of":"/task/q-learning","task":"Q-Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":12,"pages_in_order":20,"rows_per_page":100,"rows":[1101,1200],"of":1918,"counts":{"archive_papers_tagged":1918,"with_a_code_link":463,"where_syntology_ran_a_sample":119,"not_listed_spam_title":0,"listed":1918,"listed_where_code_ran":119,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":102,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":102,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/q-learning","prev":"/task/q-learning/papers/11","next":"/task/q-learning/papers/13","papers":[{"url":null,"slug":"neuromimetic-linear-systems-resilience-and","title":"Neuromimetic Linear Systems -- Resilience and Learning","date":"2022-05-10","arxiv_id":"2205.05013","repositories_listed":0,"syntology":null},{"url":null,"slug":"vehicle-management-in-a-modular-production","title":"Vehicle management in a modular production context using Deep Q-Learning","date":"2022-05-06","arxiv_id":"2205.03294","repositories_listed":0,"syntology":null},{"url":null,"slug":"chemoreception-and-chemotaxis-of-a-three","title":"Chemoreception and chemotaxis of a three-sphere swimmer","date":"2022-05-05","arxiv_id":"2205.02678","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-scheduler-for-multi-task-learning-1","title":"Q-Learning Scheduler for Multi Task Learning Through the use of Histogram of Task Uncertainty","date":"2022-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-value-functions-from-undirected-1","title":"Learning Value Functions from Undirected State-only Experience","date":"2022-04-26","arxiv_id":"2204.12458","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-neural-network-based-agent-in-google","title":"Graph Neural Network based Agent in Google Research Football","date":"2022-04-23","arxiv_id":"2204.11142","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-kernelized-q-learning","title":"Provably Efficient Kernelized Q-Learning","date":"2022-04-21","arxiv_id":"2204.10349","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-learning-of-reward-machines-and","title":"Joint Learning of Reward Machines and Policies in Environments with Partially Known Semantics","date":"2022-04-20","arxiv_id":"2204.11833","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-and-practical-quantum-compiler","title":"Efficient and practical quantum compiler towards multi-qubit systems with deep reinforcement learning","date":"2022-04-14","arxiv_id":"2204.06904","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-the-long-term-behaviour-of-deep","title":"Optimizing the Long-Term Behaviour of Deep Reinforcement Learning for Pushing and Grasping","date":"2022-04-07","arxiv_id":"2204.03487","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-with-online-random-forests","title":"Q-learning with online random forests","date":"2022-04-07","arxiv_id":"2204.03771","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-of-global-optimizer-of","title":"Deep Q-learning of global optimizer of multiply model parameters for viscoelastic imaging","date":"2022-04-01","arxiv_id":"2204.01844","repositories_listed":0,"syntology":null},{"url":null,"slug":"functional-stability-of-discounted-markov","title":"Functional Stability of Discounted Markov Decision Processes Using Economic MPC Dissipativity Theory","date":"2022-03-31","arxiv_id":"2203.16989","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-q-learning-for-solving-elliptic-pdes","title":"Neural Q-learning for solving PDEs","date":"2022-03-31","arxiv_id":"2203.17128","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-the-properties-of-neural","title":"Investigating the Properties of Neural Network Representations in Reinforcement Learning","date":"2022-03-30","arxiv_id":"2203.15955","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-conservative-q-learning-approach-for","title":"A Conservative Q-Learning approach for handling distribution shift in sepsis treatment strategies","date":"2022-03-25","arxiv_id":"2203.13884","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-allocation-optimization-using","title":"The state-of-the-art review on resource allocation problem using artificial intelligence methods on various computing paradigms","date":"2022-03-23","arxiv_id":"2203.12315","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-note-on-target-q-learning-for-solving","title":"A Note on Target Q-learning For Solving Finite MDPs with A Generative Oracle","date":"2022-03-22","arxiv_id":"2203.11489","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-learning-for-vehicular-dynamic","title":"Distributed Learning for Vehicular Dynamic Spectrum Access in Autonomous Driving","date":"2022-03-22","arxiv_id":"2204.10179","repositories_listed":0,"syntology":null},{"url":null,"slug":"infinite-horizon-reach-avoid-zero-sum-games","title":"Infinite-Horizon Reach-Avoid Zero-Sum Games via Deep Reinforcement Learning","date":"2022-03-18","arxiv_id":"2203.10142","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-optimal-control-of","title":"Reinforcement Learning for Optimal Control of a District Cooling Energy Plant","date":"2022-03-14","arxiv_id":"2203.07500","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-efficacy-of-pessimism-in-asynchronous-q","title":"The Efficacy of Pessimism in Asynchronous Q-Learning","date":"2022-03-14","arxiv_id":"2203.07368","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-machine-learning-approach-for-prosumer","title":"A Machine Learning Approach for Prosumer Management in Intraday Electricity Markets","date":"2022-03-11","arxiv_id":"2203.06053","repositories_listed":0,"syntology":null},{"url":null,"slug":"graph-based-reinforcement-learning-meets","title":"Graph-based Reinforcement Learning meets Mixed Integer Programs: An application to 3D robot assembly discovery","date":"2022-03-08","arxiv_id":"2203.04120","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning-1","title":"Scalable multi-agent reinforcement learning for distributed control of residential energy flexibility","date":"2022-03-07","arxiv_id":"2203.03417","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-deep-reinforcement-learning-for","title":"Offline Deep Reinforcement Learning for Dynamic Pricing of Consumer Credit","date":"2022-03-06","arxiv_id":"2203.03003","repositories_listed":0,"syntology":null},{"url":null,"slug":"target-network-and-truncation-overcome-the","title":"Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning","date":"2022-03-05","arxiv_id":"2203.02628","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learning-based-framework-for-handling","title":"A Learning Based Framework for Handling Uncertain Lead Times in Multi-Product Inventory Management","date":"2022-03-02","arxiv_id":"2203.00885","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-diversity-of-bootstrapped-dqn","title":"Improving the Diversity of Bootstrapped DQN by Replacing Priors With Noise","date":"2022-03-02","arxiv_id":"2203.01004","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-q-learning-for-offline","title":"Pessimistic Q-Learning for Offline Reinforcement Learning: Towards Optimal Sample Complexity","date":"2022-02-28","arxiv_id":"2202.13890","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-content","title":"Whittle Index based Q-Learning for Wireless Edge Caching with Linear Function Approximation","date":"2022-02-26","arxiv_id":"2202.13187","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-warehouse-robot-using-deep-q","title":"Autonomous Warehouse Robot using Deep Q-Learning","date":"2022-02-21","arxiv_id":"2202.10019","repositories_listed":0,"syntology":null},{"url":null,"slug":"pool-pheromone-inspired-communication","title":"PooL: Pheromone-inspired Communication Framework forLarge Scale Multi-Agent Reinforcement Learning","date":"2022-02-20","arxiv_id":"2202.09722","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-base-station-trajectory-optimization","title":"UAV Base Station Trajectory Optimization Based on Reinforcement Learning in Post-disaster Search and Rescue Operations","date":"2022-02-17","arxiv_id":"2202.10338","repositories_listed":0,"syntology":null},{"url":null,"slug":"artificial-intelligence-and-auction-design","title":"Artificial Intelligence and Auction Design","date":"2022-02-12","arxiv_id":"2202.05947","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-q-learning","title":"Regularized Q-learning","date":"2022-02-11","arxiv_id":"2202.05404","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-autonomous-intersection","title":"Intelligent Autonomous Intersection Management","date":"2022-02-09","arxiv_id":"2202.04224","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferred-q-learning","title":"Transferred Q-learning","date":"2022-02-09","arxiv_id":"2202.04709","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-correlated-jammers-nullification","title":"Multiple Correlated Jammers Nullification using LSTM-based Deep Dueling Neural Network","date":"2022-02-08","arxiv_id":"2202.03600","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-gradient-descent-with-dependent","title":"Stochastic Gradient Descent with Dependent Data for Offline Reinforcement Learning","date":"2022-02-06","arxiv_id":"2202.02850","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-q-learning-method-for-optimizing","title":"A deep Q-learning method for optimizing visual search strategies in backgrounds of dynamic noise","date":"2022-01-28","arxiv_id":"2201.12385","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-spiking-q","title":"Deep Reinforcement Learning with Spiking Q-learning","date":"2022-01-21","arxiv_id":"2201.09754","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-variance-reduced-stochastic","title":"Optimal variance-reduced stochastic approximation in Banach spaces","date":"2022-01-21","arxiv_id":"2201.08518","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-family-of-cognitively-realistic-parsing","title":"A Family of Cognitively Realistic Parsing Environments for Deep Reinforcement Learning","date":"2022-01-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"criticality-based-varying-step-number","title":"Criticality-Based Varying Step-Number Algorithm for Reinforcement Learning","date":"2022-01-13","arxiv_id":"2201.05034","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-independent-capsule-based-agents-for","title":"Task Independent Capsule-Based Agents for Deep Q-Learning","date":"2022-01-11","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"age-of-information-minimization-via","title":"Age-of-information minimization via opportunistic sampling by an energy harvesting source","date":"2022-01-08","arxiv_id":"2201.02787","repositories_listed":0,"syntology":null},{"url":null,"slug":"sales-time-series-analytics-using-deep-q","title":"Sales Time Series Analytics Using Deep Q-Learning","date":"2022-01-06","arxiv_id":"2201.02058","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-task","title":"Reinforcement Learning for Task Specifications with Action-Constraints","date":"2022-01-02","arxiv_id":"2201.00286","repositories_listed":0,"syntology":null},{"url":null,"slug":"operator-deep-q-learning-zero-shot-reward","title":"Operator Deep Q-Learning: Zero-Shot Reward Transferring in Reinforcement Learning","date":"2022-01-01","arxiv_id":"2201.00236","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-graph-attention-learning-approach-to","title":"A Graph Attention Learning Approach to Antenna Tilt Optimization","date":"2021-12-27","arxiv_id":"2112.14843","repositories_listed":0,"syntology":null},{"url":null,"slug":"aerial-base-station-positioning-and-power","title":"Aerial Base Station Positioning and Power Control for Securing Communications: A Deep Q-Network Approach","date":"2021-12-21","arxiv_id":"2112.11090","repositories_listed":0,"syntology":null},{"url":null,"slug":"amortized-noisy-channel-neural-machine","title":"Amortized Noisy Channel Neural Machine Translation","date":"2021-12-16","arxiv_id":"2112.08670","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-decentralized-q","title":"Finite-Sample Analysis of Decentralized Q-Learning for Stochastic Games","date":"2021-12-15","arxiv_id":"2112.07859","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-a-robot-to-walk-using-reinforcement","title":"Teaching a Robot to Walk Using Reinforcement Learning","date":"2021-12-13","arxiv_id":"2112.07031","repositories_listed":0,"syntology":null},{"url":null,"slug":"control-tutored-reinforcement-learning-1","title":"Control-Tutored Reinforcement Learning: Towards the Integration of Data-Driven and Model-Based Control","date":"2021-12-11","arxiv_id":"2112.06018","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-architecture-search-via-continual","title":"Quantum Architecture Search via Continual Reinforcement Learning","date":"2021-12-10","arxiv_id":"2112.05779","repositories_listed":0,"syntology":null},{"url":null,"slug":"high-dimensional-stock-portfolio-trading-with","title":"High-Dimensional Stock Portfolio Trading with Deep Reinforcement Learning","date":"2021-12-09","arxiv_id":"2112.04755","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-reinforcement-learning-to","title":"Application of Deep Reinforcement Learning to Payment Fraud","date":"2021-12-08","arxiv_id":"2112.04236","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-results-for-q-learning-with","title":"Convergence Results For Q-Learning With Experience Replay","date":"2021-12-08","arxiv_id":"2112.04213","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-market-makers-in-a-multi","title":"Deep Q-Learning Market Makers in a Multi-Agent Simulated Stock Market","date":"2021-12-08","arxiv_id":"2112.04494","repositories_listed":0,"syntology":null},{"url":null,"slug":"replay-for-safety","title":"Replay For Safety","date":"2021-12-08","arxiv_id":"2112.04229","repositories_listed":0,"syntology":null},{"url":null,"slug":"pragmatic-implementation-of-reinforcement","title":"Pragmatic Implementation of Reinforcement Algorithms For Path Finding On Raspberry Pi","date":"2021-12-07","arxiv_id":"2112.03577","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-risk-averse-preview-based-q-learning","title":"A Risk-Averse Preview-based $Q$-Learning Algorithm: Application to Highway Driving of Autonomous Vehicles","date":"2021-12-06","arxiv_id":"2112.03232","repositories_listed":0,"syntology":null},{"url":null,"slug":"faster-non-asymptotic-convergence-for-double","title":"Faster Non-asymptotic Convergence for Double Q-learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-average-reward-td","title":"Finite Sample Analysis of Average-Reward TD Learning and $Q$-Learning","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deepcq-robust-and-scalable-routing-with-multi","title":"DeepCQ+: Robust and Scalable Routing with Multi-Agent Deep Reinforcement Learning for Highly Dynamic Networks","date":"2021-11-29","arxiv_id":"2111.15013","repositories_listed":0,"syntology":null},{"url":null,"slug":"final-adaptation-reinforcement-learning-for-n","title":"Final Adaptation Reinforcement Learning for N-Player Games","date":"2021-11-29","arxiv_id":"2111.14375","repositories_listed":0,"syntology":null},{"url":null,"slug":"count-based-temperature-scheduling-for","title":"Count-Based Temperature Scheduling for Maximum Entropy Reinforcement Learning","date":"2021-11-28","arxiv_id":"2111.14204","repositories_listed":0,"syntology":null},{"url":null,"slug":"multicrew-scheduling-and-routing-in-road","title":"Multicrew Scheduling and Routing in Road Network Restoration Based on Deep Q-learning","date":"2021-11-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reversible-action-design-for-combinatorial-1","title":"Reversible Action Design for Combinatorial Optimization with ReinforcementLearning","date":"2021-11-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-bayesian-deep-reinforcement","title":"Multi-agent Bayesian Deep Reinforcement Learning for Microgrid Energy Management under Communication Failures","date":"2021-11-22","arxiv_id":"2111.11868","repositories_listed":0,"syntology":null},{"url":null,"slug":"aggressive-q-learning-with-ensembles-1","title":"Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance","date":"2021-11-17","arxiv_id":"2111.09159","repositories_listed":0,"syntology":null},{"url":null,"slug":"compressive-features-in-offline-reinforcement","title":"Compressive Features in Offline Reinforcement Learning for Recommender Systems","date":"2021-11-16","arxiv_id":"2111.08817","repositories_listed":0,"syntology":null},{"url":null,"slug":"consecutive-task-oriented-dialog-policy","title":"Consecutive Task-oriented Dialog Policy Learning","date":"2021-11-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"where-to-look-a-unified-attention-model-for","title":"Where to Look: A Unified Attention Model for Visual Recognition with Reinforcement Learning","date":"2021-11-13","arxiv_id":"2111.07169","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-for-mdps-with-general-spaces","title":"Q-Learning for MDPs with General Spaces: Convergence and Near Optimality via Quantization under Weak Continuity","date":"2021-11-12","arxiv_id":"2111.06781","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-assessing-the-safety-of-reinforcement","title":"On Assessing The Safety of Reinforcement Learning algorithms Using Formal Methods","date":"2021-11-08","arxiv_id":"2111.04865","repositories_listed":0,"syntology":null},{"url":null,"slug":"supervised-advantage-actor-critic-for","title":"Supervised Advantage Actor-Critic for Recommender Systems","date":"2021-11-05","arxiv_id":"2111.03474","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-to-speak-and-hear-through-1","title":"Towards Learning to Speak and Hear Through Multi-Agent Communication over a Continuous Acoustic Channel","date":"2021-11-04","arxiv_id":"2111.02827","repositories_listed":0,"syntology":null},{"url":null,"slug":"balanced-q-learning-combining-the-influence","title":"Balanced Q-learning: Combining the Influence of Optimistic and Pessimistic Targets","date":"2021-11-03","arxiv_id":"2111.02787","repositories_listed":0,"syntology":null},{"url":"/paper/koopman-q-learning-offline-reinforcement-1","slug":"koopman-q-learning-offline-reinforcement-1","title":"Koopman Q-learning: Offline Reinforcement Learning via Symmetries of Dynamics","date":"2021-11-02","arxiv_id":"2111.01365","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-multi-agent-reinforcement-3","title":"Decentralized Multi-Agent Reinforcement Learning: An Off-Policy Method","date":"2021-10-31","arxiv_id":"2111.00438","repositories_listed":0,"syntology":null},{"url":null,"slug":"throughput-and-latency-in-the-distributed-q","title":"Throughput and Latency in the Distributed Q-Learning Random Access mMTC Networks","date":"2021-10-30","arxiv_id":"2111.00299","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-communicate-with-reinforcement","title":"Learning to Communicate with Reinforcement Learning for an Adaptive Traffic Control System","date":"2021-10-29","arxiv_id":"2110.15779","repositories_listed":0,"syntology":null},{"url":null,"slug":"location-routing-optimisation-for-urban","title":"Location-routing Optimisation for Urban Logistics Using Mobile Parcel Locker Based on Hybrid Q-Learning Algorithm","date":"2021-10-29","arxiv_id":"2110.15485","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-deep-q-learning-framework-for","title":"Cooperative Deep $Q$-learning Framework for Environments Providing Image Feedback","date":"2021-10-28","arxiv_id":"2110.15305","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-difference-value-estimation-via","title":"Temporal-Difference Value Estimation via Uncertainty-Guided Soft Updates","date":"2021-10-28","arxiv_id":"2110.14818","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-horizon-q-learning-stability","title":"Finite Horizon Q-learning: Stability, Convergence, Simulations and an application on Smart Grids","date":"2021-10-27","arxiv_id":"2110.15093","repositories_listed":0,"syntology":null},{"url":null,"slug":"v-learning-a-simple-efficient-decentralized","title":"V-Learning -- A Simple, Efficient, Decentralized Algorithm for Multiagent RL","date":"2021-10-27","arxiv_id":"2110.14555","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-control-of-overestimation-bias-for","title":"Automating Control of Overestimation Bias for Reinforcement Learning","date":"2021-10-26","arxiv_id":"2110.13523","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-q-learning-be-improved-with-advice","title":"Can Q-Learning be Improved with Advice?","date":"2021-10-25","arxiv_id":"2110.13052","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-simultaneous","title":"Deep Reinforcement Learning for Simultaneous Sensing and Channel Access in Cognitive Networks","date":"2021-10-24","arxiv_id":"2110.14541","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-to-2","title":"A Reinforcement Learning Approach to Parameter Selection for Distributed Optimal Power Flow","date":"2021-10-22","arxiv_id":"2110.11991","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-q-learning-solve-multi-armed-bantids","title":"Can Q-learning solve Multi Armed Bantids?","date":"2021-10-21","arxiv_id":"2110.10934","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-q-learning-based-approach-for-distributed","title":"A Q-Learning-based Approach for Distributed Beam Scheduling in mmWave Networks","date":"2021-10-17","arxiv_id":"2110.08704","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-target-q-learning-with-reverse-1","title":"Online Target Q-learning with Reverse Experience Replay: Efficiently finding the Optimal Policy for Linear MDPs","date":"2021-10-16","arxiv_id":"2110.08440","repositories_listed":0,"syntology":null},{"url":null,"slug":"value-penalized-q-learning-for-recommender","title":"Value Penalized Q-Learning for Recommender Systems","date":"2021-10-15","arxiv_id":"2110.07923","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-multi-agent-reinforcement","title":"Provably Efficient Multi-Agent Reinforcement Learning with Fully Decentralized Communication","date":"2021-10-14","arxiv_id":"2110.07392","repositories_listed":0,"syntology":null},{"url":null,"slug":"decentralized-cooperative-multi-agent-1","title":"On Improving Model-Free Algorithms for Decentralized Multi-Agent Reinforcement Learning","date":"2021-10-12","arxiv_id":"2110.05707","repositories_listed":0,"syntology":null}],"record_sha256":"5c7e28f69eb36a280cf1dcbcf4cfe49ccf3d26082f6cc6ae30b8ec6e6be1a36d","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}