{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/q-learning/papers/11","list_of":"/task/q-learning","task":"Q-Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":11,"pages_in_order":20,"rows_per_page":100,"rows":[1001,1100],"of":1918,"counts":{"archive_papers_tagged":1918,"with_a_code_link":463,"where_syntology_ran_a_sample":119,"not_listed_spam_title":0,"listed":1918,"listed_where_code_ran":119,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":102,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":102,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/q-learning","prev":"/task/q-learning/papers/10","next":"/task/q-learning/papers/12","papers":[{"url":null,"slug":"palmer-perception-action-loop-with-memory-for","title":"PALMER: Perception-Action Loop with Memory for Long-Horizon Planning","date":"2022-12-08","arxiv_id":"2212.04581","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-resilient-power","title":"Reinforcement Learning for Resilient Power Grids","date":"2022-12-08","arxiv_id":"2212.04069","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-discovery-of-multi-perspective","title":"Automatic Discovery of Multi-perspective Process Model using Reinforcement Learning","date":"2022-11-30","arxiv_id":"2211.16687","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-deep-reinforcement-learning-using","title":"Causal Deep Reinforcement Learning Using Observational Data","date":"2022-11-28","arxiv_id":"2211.15355","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-q-learning-on-diverse-multi-task-data","title":"Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes","date":"2022-11-28","arxiv_id":"2211.15144","repositories_listed":0,"syntology":null},{"url":null,"slug":"qlammp-a-q-learning-agent-for-optimizing-fees","title":"QLAMMP: A Q-Learning Agent for Optimizing Fees on Automated Market Making Protocols","date":"2022-11-28","arxiv_id":"2211.14977","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-aware-proximal-pessimistic-algorithms","title":"State-Aware Proximal Pessimistic Algorithms for Offline Reinforcement Learning","date":"2022-11-28","arxiv_id":"2211.15065","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-assisted-space-air-ground-integrated","title":"UAV-Assisted Space-Air-Ground Integrated Networks: A Technical Review of Recent Learning Algorithms","date":"2022-11-27","arxiv_id":"2211.14931","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-deep-q-learning-in-opponent-modeling","title":"Double Deep Q-Learning in Opponent Modeling","date":"2022-11-24","arxiv_id":"2211.15384","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-self-awareness-models-for-physical","title":"Learning Self-Awareness Models for Physical Layer Security in Cognitive and AI-enabled Radios","date":"2022-11-23","arxiv_id":"2211.12784","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-causal-structure-learning-on","title":"Reinforcement Causal Structure Learning on Order Graph","date":"2022-11-22","arxiv_id":"2211.12151","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneously-updating-all-persistence","title":"Simultaneously Updating All Persistence Values in Reinforcement Learning","date":"2022-11-21","arxiv_id":"2211.11620","repositories_listed":0,"syntology":null},{"url":null,"slug":"analysis-of-reinforcement-learning-schemes","title":"Analysis of Reinforcement Learning Schemes for Trajectory Optimization of an Aerial Radio Unit","date":"2022-11-18","arxiv_id":"2211.10524","repositories_listed":0,"syntology":null},{"url":null,"slug":"credit-cognisant-reinforcement-learning-for","title":"Credit-cognisant reinforcement learning for multi-agent cooperation","date":"2022-11-18","arxiv_id":"2211.10100","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-process","title":"A Reinforcement Learning Approach for Process Parameter Optimization in Additive Manufacturing","date":"2022-11-17","arxiv_id":"2211.09545","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-irregular-object-packing-via","title":"Planning Irregular Object Packing via Hierarchical Reinforcement Learning","date":"2022-11-17","arxiv_id":"2211.09382","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-the-issue-of-stochastic","title":"Addressing the issue of stochastic environments and local decision-making in multi-objective reinforcement learning","date":"2022-11-16","arxiv_id":"2211.08669","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploratory-control-with-tsallis-entropy-for","title":"Exploratory Control with Tsallis Entropy for Latent Factor Models","date":"2022-11-14","arxiv_id":"2211.07622","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-global-convergence-of-fitted-q","title":"On the Global Convergence of Fitted Q-Iteration with Two-layer Neural Network Parametrization","date":"2022-11-14","arxiv_id":"2211.07675","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-non-markovian","title":"Reinforcement Learning in Non-Markovian Environments","date":"2022-11-03","arxiv_id":"2211.01595","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-power-control","title":"Deep Reinforcement Learning for Power Control in Next-Generation WiFi Network Systems","date":"2022-11-02","arxiv_id":"2211.01107","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-rl-with-realistic-datasets","title":"Offline RL With Realistic Datasets: Heteroskedasticity and Support Constraints","date":"2022-11-02","arxiv_id":"2211.01052","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-deep-recurrent-reinforcement-learning","title":"Quantum deep recurrent reinforcement learning","date":"2022-10-26","arxiv_id":"2210.14876","repositories_listed":0,"syntology":null},{"url":null,"slug":"attitude-control-of-highly-maneuverable","title":"Attitude Control of Highly Maneuverable Aircraft Using an Improved Q-learning","date":"2022-10-22","arxiv_id":"2210.12317","repositories_listed":0,"syntology":null},{"url":null,"slug":"sufficient-exploration-for-convex-q-learning","title":"Sufficient Exploration for Convex Q-learning","date":"2022-10-17","arxiv_id":"2210.09409","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-characterizations-of-the-hamilton","title":"Model-Free Characterizations of the Hamilton-Jacobi-Bellman Equation and Convex Q-Learning in Continuous Time","date":"2022-10-14","arxiv_id":"2210.08131","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-automatic-run","title":"Deep reinforcement learning for automatic run-time adaptation of UWB PHY radio settings","date":"2022-10-13","arxiv_id":"2210.15498","repositories_listed":0,"syntology":null},{"url":null,"slug":"censored-deep-reinforcement-patrolling-with","title":"Censored Deep Reinforcement Patrolling with Information Criterion for Monitoring Large Water Resources using Autonomous Surface Vehicles","date":"2022-10-12","arxiv_id":"2210.08115","repositories_listed":0,"syntology":null},{"url":null,"slug":"dqlap-deep-q-learning-recommender-algorithm","title":"DQLAP: Deep Q-Learning Recommender Algorithm with Update Policy for a Real Steam Turbine System","date":"2022-10-12","arxiv_id":"2210.06399","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-approach-for-multi","title":"Reinforcement Learning Approach for Multi-Agent Flexible Scheduling Problems","date":"2022-10-07","arxiv_id":"2210.03674","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-option-discovery-using-deep-q","title":"Interpretable Option Discovery using Deep Q-Learning and Variational Autoencoders","date":"2022-10-03","arxiv_id":"2210.01231","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-with-5","title":"Offline Reinforcement Learning with Differentiable Function Approximation is Provably Efficient","date":"2022-10-03","arxiv_id":"2210.00750","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-q-learning-with-imperfect-expert","title":"Bayesian Q-learning With Imperfect Expert Demonstrations","date":"2022-10-01","arxiv_id":"2210.01800","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-recurrent-q-learning-for-energy","title":"Deep Recurrent Q-learning for Energy-constrained Coverage with a Mobile Robot","date":"2022-10-01","arxiv_id":"2210.00327","repositories_listed":0,"syntology":null},{"url":null,"slug":"application-of-deep-q-learning-with","title":"Application of Deep Q Learning with Simulation Results for Elevator Optimization","date":"2022-09-30","arxiv_id":"2210.00065","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-lstm-training-with-eligibility","title":"Efficient LSTM Training with Eligibility Traces","date":"2022-09-30","arxiv_id":"2209.15502","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-convergence-of-average-reward-off-policy","title":"On Convergence of Average-Reward Off-Policy Control Algorithms in Weakly Communicating MDPs","date":"2022-09-30","arxiv_id":"2209.15141","repositories_listed":0,"syntology":null},{"url":null,"slug":"fire-a-failure-adaptive-reinforcement","title":"FIRE: A Failure-Adaptive Reinforcement Learning Framework for Edge Computing Migrations","date":"2022-09-28","arxiv_id":"2209.14399","repositories_listed":0,"syntology":null},{"url":null,"slug":"predictive-crypto-asset-automated-market","title":"Predictive Crypto-Asset Automated Market Making Architecture for Decentralized Finance using Deep Reinforcement Learning","date":"2022-09-28","arxiv_id":"2211.01346","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-hindsight-goal-relabeling","title":"Understanding Hindsight Goal Relabeling from a Divergence Minimization Perspective","date":"2022-09-26","arxiv_id":"2209.13046","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-study-of-q-learning-and","title":"Comparative Study of Q-Learning and NeuroEvolution of Augmenting Topologies for Self Driving Agents","date":"2022-09-19","arxiv_id":"2209.09007","repositories_listed":0,"syntology":null},{"url":null,"slug":"ma2ql-a-minimalist-approach-to-fully","title":"MA2QL: A Minimalist Approach to Fully Decentralized Multi-Agent Reinforcement Learning","date":"2022-09-17","arxiv_id":"2209.08244","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-cooperative-p2p","title":"Reinforcement Learning-Based Cooperative P2P Power Trading between DC Nanogrid Clusters with Wind and PV Energy Resources","date":"2022-09-16","arxiv_id":"2209.07744","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-task-1","title":"Deep Reinforcement Learning for Task Offloading in UAV-Aided Smart Farm Networks","date":"2022-09-15","arxiv_id":"2209.07367","repositories_listed":0,"syntology":null},{"url":null,"slug":"iot-aerial-base-station-task-offloading-with","title":"IoT-Aerial Base Station Task Offloading with Risk-Sensitive Reinforcement Learning for Smart Agriculture","date":"2022-09-15","arxiv_id":"2209.07382","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-q-learning-for-antibody-design","title":"Structured Q-learning For Antibody Design","date":"2022-09-10","arxiv_id":"2209.04698","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-q-learning-for-citizen-relocation","title":"Double Q-Learning for Citizen Relocation During Natural Hazards","date":"2022-09-08","arxiv_id":"2209.03800","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-convergence-of-monte-carlo-ucb-for","title":"On the Convergence of Monte Carlo UCB for Random-Length Episodic MDPs","date":"2022-09-07","arxiv_id":"2209.02864","repositories_listed":0,"syntology":null},{"url":null,"slug":"slatefree-a-model-free-decomposition-for","title":"SlateFree: a Model-Free Decomposition for Reinforcement Learning with Slate Actions","date":"2022-09-05","arxiv_id":"2209.01876","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-technique-to-create-weaker-abstract-board","title":"A Technique to Create Weaker Abstract Board Game Agents via Reinforcement Learning","date":"2022-09-01","arxiv_id":"2209.00711","repositories_listed":0,"syntology":null},{"url":null,"slug":"partial-counterfactual-identification-for","title":"Partial Counterfactual Identification for Infinite Horizon Partially Observable Markov Decision Process","date":"2022-08-31","arxiv_id":"2209.00137","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-stabilizing-model-free-q-learning","title":"Direct Data-Driven Discrete-time Bilinear Biquadratic Regulator","date":"2022-08-29","arxiv_id":"2208.13843","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-goal-navigation-using-data-regularized","title":"Object Goal Navigation using Data Regularized Q-Learning","date":"2022-08-27","arxiv_id":"2208.13009","repositories_listed":0,"syntology":null},{"url":null,"slug":"prospect-theory-inspired-automated-p2p-energy","title":"Prospect Theory-inspired Automated P2P Energy Trading with Q-learning-based Dynamic Pricing","date":"2022-08-26","arxiv_id":"2208.12777","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-neural-network-based-anti-jamming","title":"Recurrent Neural Network-based Anti-jamming Framework for Defense Against Multiple Jamming Policies","date":"2022-08-19","arxiv_id":"2208.09518","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-resource-allocation-for-anti-jamming","title":"A Novel Resource Allocation for Anti-jamming in Cognitive-UAVs: an Active Inference Approach","date":"2022-08-10","arxiv_id":"2208.05269","repositories_listed":0,"syntology":null},{"url":null,"slug":"compositional-reinforcement-learning-for","title":"Compositional Reinforcement Learning for Discrete-Time Stochastic Control Systems","date":"2022-08-06","arxiv_id":"2208.03485","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-joint-v2i-network","title":"Reinforcement Learning for Joint V2I Network Selection and Autonomous Driving Policies","date":"2022-08-03","arxiv_id":"2208.02249","repositories_listed":0,"syntology":null},{"url":null,"slug":"digital-twin-assisted-efficient-reinforcement","title":"Digital Twin-Assisted Efficient Reinforcement Learning for Edge Task Scheduling","date":"2022-08-02","arxiv_id":"2208.01781","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-maintenance-planning-framework-using-online","title":"A Maintenance Planning Framework using Online and Offline Deep Reinforcement Learning","date":"2022-08-01","arxiv_id":"2208.00808","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-a-2d-game-indefinitely-using-neat-and","title":"Playing a 2D Game Indefinitely using NEAT and Reinforcement Learning","date":"2022-07-28","arxiv_id":"2207.14140","repositories_listed":0,"syntology":null},{"url":null,"slug":"structural-similarity-for-improved-transfer","title":"Structural Similarity for Improved Transfer in Reinforcement Learning","date":"2022-07-27","arxiv_id":"2207.13813","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-asynchronous-q-1","title":"Finite-Time Analysis of Asynchronous Q-learning under Diminishing Step-Size from Control-Theoretic View","date":"2022-07-25","arxiv_id":"2207.12217","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-source-aoi-constrained-resource","title":"Multi-Source AoI-Constrained Resource Minimization under HARQ: Heterogeneous Sampling Processes","date":"2022-07-19","arxiv_id":"2207.08996","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-decentralizing-federated-reinforcement","title":"On Decentralizing Federated Reinforcement Learning in Multi-Robot Scenarios","date":"2022-07-19","arxiv_id":"2207.09372","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-nash-equilibrium-learning-for-n","title":"Approximate Nash Equilibrium Learning for n-Player Markov Games in Dynamic Pricing","date":"2022-07-13","arxiv_id":"2207.06492","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddpg-learning-for-aerial-ris-assisted-mu-miso","title":"DDPG Learning for Aerial RIS-Assisted MU-MISO Communications","date":"2022-07-13","arxiv_id":"2207.06064","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-optimization-of-notifications","title":"Multi-objective Optimization of Notifications Using Offline Reinforcement Learning","date":"2022-07-07","arxiv_id":"2207.03029","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-with-rl-and-episodic-memory","title":"Planning with RL and episodic-memory behavioral priors","date":"2022-07-05","arxiv_id":"2207.01845","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-in-continuous-time","title":"q-Learning in Continuous Time","date":"2022-07-02","arxiv_id":"2207.00713","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-modulated-midbrain-dopamine-activity","title":"Action-modulated midbrain dopamine activity arises from distributed control policies","date":"2022-07-01","arxiv_id":"2207.00636","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-learning-from-natural-language","title":"Interactive Learning from Natural Language and Demonstrations using Signal Temporal Logic","date":"2022-07-01","arxiv_id":"2207.00627","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-the-need-for-blood-transfusion-in","title":"Predicting the Need for Blood Transfusion in Intensive Care Units with Reinforcement Learning","date":"2022-06-26","arxiv_id":"2206.14198","repositories_listed":0,"syntology":null},{"url":null,"slug":"recursive-reinforcement-learning","title":"Recursive Reinforcement Learning","date":"2022-06-23","arxiv_id":"2206.11430","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-under-partial","title":"Reinforcement Learning under Partial Observability Guided by Learned Environment Models","date":"2022-06-23","arxiv_id":"2206.11708","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-learning-linear","title":"Federated Stochastic Approximation under Markov Noise and Heterogeneity: Applications in Reinforcement Learning","date":"2022-06-21","arxiv_id":"2206.10185","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-integration-of-machine-learning-into","title":"The Integration of Machine Learning into Automated Test Generation: A Systematic Mapping Study","date":"2022-06-21","arxiv_id":"2206.10210","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-radial-basis-q-network","title":"Visual Radial Basis Q-Network","date":"2022-06-14","arxiv_id":"2206.06712","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-ea-a-reinforcement-learning-based","title":"RL-GA: A Reinforcement Learning-Based Genetic Algorithm for Electromagnetic Detection Satellite Scheduling Problem","date":"2022-06-12","arxiv_id":"2206.05694","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimization-method-assisted-ensemble-deep","title":"An Optimization Method-Assisted Ensemble Deep Reinforcement Learning Algorithm to Solve Unit Commitment Problems","date":"2022-06-09","arxiv_id":"2206.04249","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-continual-learning-methods-for-q","title":"A Study of Continual Learning Methods for Q-Learning","date":"2022-06-08","arxiv_id":"2206.03934","repositories_listed":0,"syntology":null},{"url":null,"slug":"concentration-bounds-for-ssp-q-learning-for","title":"Concentration bounds for SSP Q-learning for average cost MDPs","date":"2022-06-07","arxiv_id":"2206.03328","repositories_listed":0,"syntology":null},{"url":null,"slug":"balancing-profit-risk-and-sustainability-for","title":"Balancing Profit, Risk, and Sustainability for Portfolio Management","date":"2022-06-06","arxiv_id":"2207.02134","repositories_listed":0,"syntology":null},{"url":null,"slug":"ddpg-based-on-multi-scale-strokes-for","title":"DDPG based on multi-scale strokes for financial time series trading strategy","date":"2022-06-05","arxiv_id":"2207.10071","repositories_listed":0,"syntology":null},{"url":null,"slug":"console-convex-neural-symbolic-learning","title":"CoNSoLe: Convex Neural Symbolic Learning","date":"2022-06-01","arxiv_id":"2206.00257","repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-q-learning-with-linear","title":"Stabilizing Q-learning with Linear Architectures for Provably Efficient Learning","date":"2022-06-01","arxiv_id":"2206.00796","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-rewards-for-fast-learning","title":"Designing Rewards for Fast Learning","date":"2022-05-30","arxiv_id":"2205.15400","repositories_listed":0,"syntology":null},{"url":null,"slug":"gramer-graph-meta-reinforcement-learning-for","title":"GraMeR: Graph Meta Reinforcement Learning for Multi-Objective Influence Maximization","date":"2022-05-30","arxiv_id":"2205.14834","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-distributed-1","title":"Deep Reinforcement Learning for Distributed and Uncoordinated Cognitive Radios Resource Allocation","date":"2022-05-27","arxiv_id":"2205.13944","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-q-learning-and-sarsa-0-under-the","title":"Does DQN Learn?","date":"2022-05-26","arxiv_id":"2205.13617","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-exploitation-and-engagement-in","title":"Exploration, Exploitation, and Engagement in Multi-Armed Bandits with Abandonment","date":"2022-05-26","arxiv_id":"2205.13566","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-experimental-comparison-between-temporal","title":"An Experimental Comparison Between Temporal Difference and Residual Gradient with Neural Network Approximation","date":"2022-05-25","arxiv_id":"2205.12770","repositories_listed":0,"syntology":null},{"url":null,"slug":"analytics-of-business-time-series-using","title":"Analytics of Business Time Series Using Machine Learning and Bayesian Inference","date":"2022-05-25","arxiv_id":"2205.12905","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-returns-using-the-hurst-exponent","title":"Optimizing Returns Using the Hurst Exponent and Q Learning on Momentum and Mean Reversion Strategies","date":"2022-05-23","arxiv_id":"2205.11122","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-pedestrian-attribute-recognition","title":"Reinforced Pedestrian Attribute Recognition with Group Optimization Reward","date":"2022-05-21","arxiv_id":"2205.14042","repositories_listed":0,"syntology":null},{"url":null,"slug":"parallel-bandit-architecture-based-on-laser","title":"Parallel bandit architecture based on laser chaos for reinforcement learning","date":"2022-05-19","arxiv_id":"2205.09543","repositories_listed":0,"syntology":null},{"url":null,"slug":"qhd-a-brain-inspired-hyperdimensional","title":"Efficient Off-Policy Reinforcement Learning via Brain-Inspired Computing","date":"2022-05-14","arxiv_id":"2205.06978","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-learning-for-context-dependent","title":"Representation Learning for Context-Dependent Decision-Making","date":"2022-05-12","arxiv_id":"2205.05820","repositories_listed":0,"syntology":null},{"url":null,"slug":"characterizing-the-action-generalization-gap","title":"Characterizing the Action-Generalization Gap in Deep Q-Learning","date":"2022-05-11","arxiv_id":"2205.05588","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-constant-step-size-q","title":"Final Iteration Convergence Bound of Q-Learning: Switching System Approach","date":"2022-05-11","arxiv_id":"2205.05455","repositories_listed":0,"syntology":null}],"record_sha256":"5edafdef235c3cc8b8cb1c5c45c581b2565bd89eae4f969f4dcd3a41c5429ad1","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}