{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/method/q-learning/papers/3","list_of":"/method/q-learning","method":"Q-Learning","archive":{"snapshot":"2025-07-28"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"date (newest first), then slug","page":3,"pages_in_order":18,"rows_per_page":100,"rows":[201,300],"of":1734,"counts":{"archive_papers_tagged":1734,"with_a_code_link":464,"where_syntology_ran_a_sample":126,"not_listed_spam_title":0,"listed":1734,"listed_where_code_ran":126,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":105,"every_run_a_failure_of_syntologys_instrument":21,"listed_with_a_run_with_no_instrument_failure":105,"listed_every_run_a_failure_of_syntologys_instrument":21,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/method/q-learning","prev":"/method/q-learning/papers/2","next":"/method/q-learning/papers/4","papers":[{"paper":null,"slug":"variance-reduced-cascade-q-learning","title":"Variance-Reduced Cascade Q-learning: Algorithms and Sample Complexity","date":"2024-08-13","arxiv_id":"2408.06544","n_code_links":0,"syntology":null},{"paper":"/paper/crowd-intelligence-for-early-misinformation","slug":"crowd-intelligence-for-early-misinformation","title":"Crowd Intelligence for Early Misinformation Prediction on Social Media","date":"2024-08-08","arxiv_id":"2408.04463","n_code_links":1,"syntology":null},{"paper":null,"slug":"2408-03084","title":"Research on Autonomous Driving Decision-making Strategies based Deep Reinforcement Learning","date":"2024-08-06","arxiv_id":"2408.03084","n_code_links":0,"syntology":null},{"paper":null,"slug":"2408-03088","title":"QADQN: Quantum Attention Deep Q-Network for Financial Market Prediction","date":"2024-08-06","arxiv_id":"2408.03088","n_code_links":0,"syntology":null},{"paper":null,"slug":"model-free-optimal-controller-for-discrete","title":"Model-free optimal controller for discrete-time Markovian jump linear systems: A Q-learning approach","date":"2024-08-06","arxiv_id":"2408.03077","n_code_links":0,"syntology":null},{"paper":null,"slug":"whittle-s-index-based-age-of-information","title":"Whittle's index-based age-of-information minimization in multi-energy harvesting source networks","date":"2024-08-05","arxiv_id":"2408.02570","n_code_links":0,"syntology":null},{"paper":null,"slug":"2408-01188","title":"Multi-Objective Deep Reinforcement Learning for Optimisation in Autonomous Systems","date":"2024-08-02","arxiv_id":"2408.01188","n_code_links":0,"syntology":null},{"paper":null,"slug":"multi-agent-assessment-with-qos-enhancement","title":"Multi-agent Assessment with QoS Enhancement for HD Map Updates in a Vehicular Network","date":"2024-07-31","arxiv_id":"2407.21460","n_code_links":0,"syntology":null},{"paper":null,"slug":"evolution-of-cooperation-in-the-public-goods","title":"Evolution of cooperation in the public goods game with Q-learning","date":"2024-07-29","arxiv_id":"2407.19851","n_code_links":0,"syntology":null},{"paper":null,"slug":"the-evolution-of-cooperation-with-q-learning","title":"Evolution of cooperation with Q-learning: the impact of information perception","date":"2024-07-29","arxiv_id":"2407.19634","n_code_links":0,"syntology":null},{"paper":null,"slug":"multi-agent-deep-reinforcement-learning-for-18","title":"Multi-Agent Deep Reinforcement Learning for Energy Efficient Multi-Hop STAR-RIS-Assisted Transmissions","date":"2024-07-26","arxiv_id":"2407.18627","n_code_links":0,"syntology":null},{"paper":null,"slug":"principal-agent-reinforcement-learning","title":"Principal-Agent Reinforcement Learning: Orchestrating AI Agents with Contracts","date":"2024-07-25","arxiv_id":"2407.18074","n_code_links":0,"syntology":null},{"paper":null,"slug":"in-search-for-architectures-and-loss","title":"In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning","date":"2024-07-23","arxiv_id":"2407.16807","n_code_links":0,"syntology":null},{"paper":null,"slug":"evaluation-of-reinforcement-learning-for","title":"Evaluation of Reinforcement Learning for Autonomous Penetration Testing using A3C, Q-learning and DQN","date":"2024-07-22","arxiv_id":"2407.15656","n_code_links":0,"syntology":null},{"paper":null,"slug":"modrl-ta-a-multi-objective-deep-reinforcement","title":"MODRL-TA:A Multi-Objective Deep Reinforcement Learning Framework for Traffic Allocation in E-Commerce Search","date":"2024-07-22","arxiv_id":"2407.15476","n_code_links":0,"syntology":null},{"paper":null,"slug":"coverage-aware-and-reinforcement-learning","title":"Coverage-aware and Reinforcement Learning Using Multi-agent Approach for HD Map QoS in a Realistic Environment","date":"2024-07-19","arxiv_id":"2408.03329","n_code_links":0,"syntology":null},{"paper":null,"slug":"2408-01429","title":"An Agile Adaptation Method for Multi-mode Vehicle Communication Networks","date":"2024-07-18","arxiv_id":"2408.01429","n_code_links":0,"syntology":null},{"paper":null,"slug":"optimistic-q-learning-for-average-reward-and","title":"Optimistic Q-learning for average reward and episodic reinforcement learning","date":"2024-07-18","arxiv_id":"2407.13743","n_code_links":0,"syntology":null},{"paper":null,"slug":"solving-the-model-unavailable-mare-using-q","title":"Solving the Model Unavailable MARE using Q-Learning Algorithm","date":"2024-07-18","arxiv_id":"2407.13227","n_code_links":0,"syntology":null},{"paper":null,"slug":"cooperative-reward-shaping-for-multi-agent","title":"Cooperative Reward Shaping for Multi-Agent Pathfinding","date":"2024-07-15","arxiv_id":"2407.10403","n_code_links":0,"syntology":null},{"paper":"/paper/2407-21025","slug":"2407-21025","title":"Reinforcement Learning in High-frequency Market Making","date":"2024-07-14","arxiv_id":"2407.21025","n_code_links":1,"syntology":null},{"paper":"/paper/alphadou-high-performance-end-to-end-doudizhu","slug":"alphadou-high-performance-end-to-end-doudizhu","title":"AlphaDou: High-Performance End-to-End Doudizhu AI Integrating Bidding","date":"2024-07-14","arxiv_id":"2407.10279","n_code_links":1,"syntology":null},{"paper":null,"slug":"pail-performance-based-adversarial-imitation","title":"PAIL: Performance based Adversarial Imitation Learning Engine for Carbon Neutral Optimization","date":"2024-07-12","arxiv_id":"2407.08910","n_code_links":0,"syntology":null},{"paper":null,"slug":"pid-accelerated-temporal-difference","title":"PID Accelerated Temporal Difference Algorithms","date":"2024-07-11","arxiv_id":"2407.08803","n_code_links":0,"syntology":null},{"paper":null,"slug":"multi-agent-reinforcement-learning-based-5","title":"Multi-agent Reinforcement Learning-based Network Intrusion Detection System","date":"2024-07-08","arxiv_id":"2407.05766","n_code_links":0,"syntology":null},{"paper":null,"slug":"periodic-agent-state-based-q-learning-for","title":"Periodic agent-state based Q-learning for POMDPs","date":"2024-07-08","arxiv_id":"2407.06121","n_code_links":0,"syntology":null},{"paper":"/paper/a-two-step-minimax-q-learning-algorithm-for","slug":"a-two-step-minimax-q-learning-algorithm-for","title":"A Multi-Step Minimax Q-learning Algorithm for Two-Player Zero-Sum Markov Games","date":"2024-07-05","arxiv_id":"2407.04240","n_code_links":1,"syntology":{"ran":1,"of":1,"n_ran_checked":1,"n_instrument":0,"unverified":0,"pointer_only":1,"phrase":"1 ran (of which 0 constructed an object rather than computing a result; 1 with no instrument failure: 0 honoured, 0 violated, 1 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","official":{"repos":["shreyassr123/multi-step-markov-games"],"state":"official (archive's flag): 1 ran","n_ran":1,"n_constructed":0,"n_ran_no_instrument_failure":1,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":"/paper/simplifying-deep-temporal-difference-learning","slug":"simplifying-deep-temporal-difference-learning","title":"Simplifying Deep Temporal Difference Learning","date":"2024-07-05","arxiv_id":"2407.04811","n_code_links":1,"syntology":{"ran":3,"of":3,"n_ran_checked":0,"n_instrument":3,"unverified":0,"pointer_only":0,"phrase":"3 ran (of which 0 constructed an object rather than computing a result; 0 with no instrument failure: 0 honoured, 0 violated, 0 with no contract checked; 3 where Syntology's instrument failed) · 0 unverified","official":{"repos":["mttga/purejaxql"],"state":"official (archive's flag): 3 ran","n_ran":3,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"unified-continuous-time-q-learning-for-mean","title":"Unified continuous-time q-learning for mean-field game and mean-field control problems","date":"2024-07-05","arxiv_id":"2407.04521","n_code_links":0,"syntology":null},{"paper":null,"slug":"artificial-intelligence-and-algorithmic-price","title":"Artificial Intelligence and Algorithmic Price Collusion in Two-sided Markets","date":"2024-07-04","arxiv_id":"2407.04088","n_code_links":0,"syntology":null},{"paper":null,"slug":"configuring-transmission-thresholds-in-iiot","title":"Configuring Transmission Thresholds in IIoT Alarm Scenarios for Energy-Efficient Event Reporting","date":"2024-07-04","arxiv_id":"2407.03982","n_code_links":0,"syntology":null},{"paper":null,"slug":"continuous-time-q-learning-for-jump-diffusion","title":"Continuous-time q-Learning for Jump-Diffusion Models under Tsallis Entropy","date":"2024-07-04","arxiv_id":"2407.03888","n_code_links":0,"syntology":null},{"paper":"/paper/q-adapter-training-your-llm-adapter-as-a","slug":"q-adapter-training-your-llm-adapter-as-a","title":"Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation","date":"2024-07-04","arxiv_id":"2407.03856","n_code_links":1,"syntology":{"ran":13,"of":14,"n_ran_checked":9,"n_instrument":4,"unverified":1,"pointer_only":1,"phrase":"13 ran (of which 0 constructed an object rather than computing a result; 9 with no instrument failure: 0 honoured, 0 violated, 9 with no contract checked; 4 where Syntology's instrument failed) · 1 unverified","official":{"repos":["mansicer/Q-Adapter"],"state":"official (archive's flag): 2 ran","n_ran":2,"n_constructed":0,"n_ran_no_instrument_failure":0,"n_unverified":0,"ran_from_kinds":["found_in_text","official"]}}},{"paper":"/paper/rethinking-data-augmentation-for-robust-lidar","slug":"rethinking-data-augmentation-for-robust-lidar","title":"Rethinking Data Augmentation for Robust LiDAR Semantic Segmentation in Adverse Weather","date":"2024-07-02","arxiv_id":"2407.02286","n_code_links":2,"syntology":null},{"paper":null,"slug":"two-step-q-learning","title":"Two-Step Q-Learning","date":"2024-07-02","arxiv_id":"2407.02369","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-deep-reinforcement-learning-approach-to-8","title":"A Deep Reinforcement Learning Approach to Battery Management in Dairy Farming via Proximal Policy Optimization","date":"2024-07-01","arxiv_id":"2407.01653","n_code_links":0,"syntology":null},{"paper":null,"slug":"tackling-long-horizon-tasks-with-model-based","title":"Model-based Offline Reinforcement Learning with Lower Expectile Q-Learning","date":"2024-06-30","arxiv_id":"2407.00699","n_code_links":0,"syntology":null},{"paper":"/paper/contextualized-hybrid-ensemble-q-learning","slug":"contextualized-hybrid-ensemble-q-learning","title":"Contextualized Hybrid Ensemble Q-learning: Learning Fast with Control Priors","date":"2024-06-28","arxiv_id":"2406.19768","n_code_links":1,"syntology":null},{"paper":null,"slug":"towards-secure-and-efficient-data-scheduling","title":"Towards Secure and Efficient Data Scheduling for Vehicular Social Networks","date":"2024-06-28","arxiv_id":"2407.00141","n_code_links":0,"syntology":null},{"paper":null,"slug":"mereq-max-ent-residual-q-inverse-rl-for","title":"MEReQ: Max-Ent Residual-Q Inverse RL for Sample-Efficient Alignment from Intervention","date":"2024-06-24","arxiv_id":"2406.16258","n_code_links":0,"syntology":null},{"paper":null,"slug":"eduqate-generating-adaptive-curricula-through","title":"EduQate: Generating Adaptive Curricula through RMABs in Education Settings","date":"2024-06-20","arxiv_id":"2406.14122","n_code_links":0,"syntology":null},{"paper":null,"slug":"equivariant-offline-reinforcement-learning","title":"Equivariant Offline Reinforcement Learning","date":"2024-06-20","arxiv_id":"2406.13961","n_code_links":0,"syntology":null},{"paper":null,"slug":"learning-to-select-goals-in-automated","title":"Learning to Select Goals in Automated Planning with Deep-Q Learning","date":"2024-06-20","arxiv_id":"2406.14779","n_code_links":0,"syntology":null},{"paper":"/paper/reinforcement-learning-based-routing-for","slug":"reinforcement-learning-based-routing-for","title":"Reinforcement-Learning based routing for packet-optical networks with hybrid telemetry","date":"2024-06-18","arxiv_id":"2406.12602","n_code_links":1,"syntology":null},{"paper":null,"slug":"catalytic-evolution-of-cooperation-in-a","title":"Catalytic evolution of cooperation in a population with behavioural bimodality","date":"2024-06-17","arxiv_id":"2406.11121","n_code_links":0,"syntology":null},{"paper":null,"slug":"optimal-transport-assisted-risk-sensitive-q","title":"Optimal Transport-Assisted Risk-Sensitive Q-Learning","date":"2024-06-17","arxiv_id":"2406.11774","n_code_links":0,"syntology":null},{"paper":"/paper/post-hoc-utterance-refining-method-by-entity","slug":"post-hoc-utterance-refining-method-by-entity","title":"Post-hoc Utterance Refining Method by Entity Mining for Faithful Knowledge Grounded Conversations","date":"2024-06-16","arxiv_id":"2406.10809","n_code_links":1,"syntology":null},{"paper":null,"slug":"mix-q-learning-for-lane-changing-a","title":"Mix Q-learning for Lane Changing: A Collaborative Decision-Making Method in Multi-Agent Deep Reinforcement Learning","date":"2024-06-14","arxiv_id":"2406.09755","n_code_links":0,"syntology":null},{"paper":null,"slug":"latent-assistance-networks-rediscovering","title":"Hadamard Representations: Augmenting Hyperbolic Tangents in RL","date":"2024-06-13","arxiv_id":"2406.09079","n_code_links":0,"syntology":null},{"paper":null,"slug":"multi-agent-reinforcement-learning-with-deep","title":"Multi-agent Reinforcement Learning with Deep Networks for Diverse Q-Vectors","date":"2024-06-12","arxiv_id":"2406.07848","n_code_links":0,"syntology":null},{"paper":"/paper/probing-implicit-bias-in-semi-gradient-q","slug":"probing-implicit-bias-in-semi-gradient-q","title":"Probing Implicit Bias in Semi-gradient Q-learning: Visualizing the Effective Loss Landscapes via the Fokker--Planck Equation","date":"2024-06-12","arxiv_id":"2406.08148","n_code_links":1,"syntology":null},{"paper":"/paper/plandq-hierarchical-plan-orchestration-via-d","slug":"plandq-hierarchical-plan-orchestration-via-d","title":"PlanDQ: Hierarchical Plan Orchestration via D-Conductor and Q-Performer","date":"2024-06-10","arxiv_id":"2406.06793","n_code_links":1,"syntology":null},{"paper":null,"slug":"online-policy-distillation-with-decision","title":"Online Policy Distillation with Decision-Attention","date":"2024-06-08","arxiv_id":"2406.05488","n_code_links":0,"syntology":null},{"paper":null,"slug":"fast-fading-channel-and-power-optimization-of","title":"Fast-Fading Channel and Power Optimization of the Magnetic Inductive Cellular Network","date":"2024-06-07","arxiv_id":"2406.04737","n_code_links":0,"syntology":null},{"paper":null,"slug":"online-frequency-scheduling-by-learning","title":"Online Frequency Scheduling by Learning Parallel Actions","date":"2024-06-07","arxiv_id":"2406.05041","n_code_links":0,"syntology":null},{"paper":"/paper/stabilizing-extreme-q-learning-by-maclaurin","slug":"stabilizing-extreme-q-learning-by-maclaurin","title":"Stabilizing Extreme Q-learning by Maclaurin Expansion","date":"2024-06-07","arxiv_id":"2406.04896","n_code_links":1,"syntology":null},{"paper":null,"slug":"bootstrapping-expectiles-in-reinforcement","title":"Bootstrapping Expectiles in Reinforcement Learning","date":"2024-06-06","arxiv_id":"2406.04081","n_code_links":0,"syntology":null},{"paper":null,"slug":"evaluating-the-influence-of-temporal-context","title":"Evaluating the Influence of Temporal Context on Automatic Mouse Sleep Staging through the Application of Human Models","date":"2024-06-06","arxiv_id":"2406.16911","n_code_links":0,"syntology":null},{"paper":"/paper/strategically-conservative-q-learning","slug":"strategically-conservative-q-learning","title":"Strategically Conservative Q-Learning","date":"2024-06-06","arxiv_id":"2406.04534","n_code_links":1,"syntology":null},{"paper":null,"slug":"nonlinear-transformations-against-unlearnable","title":"Nonlinear Transformations Against Unlearnable Datasets","date":"2024-06-05","arxiv_id":"2406.02883","n_code_links":0,"syntology":null},{"paper":null,"slug":"algorithmic-collusion-in-dynamic-pricing-with","title":"Algorithmic Collusion in Dynamic Pricing with Deep Reinforcement Learning","date":"2024-06-04","arxiv_id":"2406.02437","n_code_links":0,"syntology":null},{"paper":"/paper/qroa-a-black-box-query-response-optimization","slug":"qroa-a-black-box-query-response-optimization","title":"Towards Universal and Black-Box Query-Response Only Attack on LLMs with QROA","date":"2024-06-04","arxiv_id":"2406.02044","n_code_links":1,"syntology":null},{"paper":null,"slug":"tabular-and-deep-learning-for-the-whittle","title":"Tabular and Deep Learning for the Whittle Index","date":"2024-06-04","arxiv_id":"2406.02057","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-new-view-on-planning-in-online","title":"A New View on Planning in Online Reinforcement Learning","date":"2024-06-03","arxiv_id":"2406.01562","n_code_links":0,"syntology":null},{"paper":null,"slug":"how-to-discretize-continuous-state-action","title":"How to discretize continuous state-action spaces in Q-learning: A symbolic control approach","date":"2024-06-03","arxiv_id":"2406.01548","n_code_links":0,"syntology":null},{"paper":"/paper/diffusion-policies-creating-a-trust-region","slug":"diffusion-policies-creating-a-trust-region","title":"Diffusion Policies creating a Trust Region for Offline Reinforcement Learning","date":"2024-05-30","arxiv_id":"2405.19690","n_code_links":1,"syntology":{"ran":17,"of":20,"n_ran_checked":11,"n_instrument":6,"unverified":3,"pointer_only":20,"phrase":"17 ran (of which 0 constructed an object rather than computing a result; 11 with no instrument failure: 0 honoured, 0 violated, 11 with no contract checked; 6 where Syntology's instrument failed) · 3 unverified","official":{"repos":["tianyucodings/diffusion_trusted_q_learning"],"state":"official (archive's flag): 17 ran","n_ran":17,"n_constructed":0,"n_ran_no_instrument_failure":11,"n_unverified":3,"ran_from_kinds":["official"]}}},{"paper":null,"slug":"q-learning-as-a-monotone-scheme","title":"Q-learning as a monotone scheme","date":"2024-05-30","arxiv_id":"2405.20538","n_code_links":0,"syntology":null},{"paper":null,"slug":"federated-q-learning-with-reference-advantage","title":"Federated Q-Learning with Reference-Advantage Decomposition: Almost Optimal Regret and Logarithmic Communication Cost","date":"2024-05-29","arxiv_id":"2405.18795","n_code_links":0,"syntology":null},{"paper":"/paper/aligniql-policy-alignment-in-implicit-q","slug":"aligniql-policy-alignment-in-implicit-q","title":"AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization","date":"2024-05-28","arxiv_id":"2405.18187","n_code_links":1,"syntology":null},{"paper":null,"slug":"mutation-bias-learning-in-games","title":"Mutation-Bias Learning in Games","date":"2024-05-28","arxiv_id":"2405.18190","n_code_links":0,"syntology":null},{"paper":"/paper/safe-multi-agent-reinforcement-learning-with","slug":"safe-multi-agent-reinforcement-learning-with","title":"Safe Multi-Agent Reinforcement Learning with Bilevel Optimization in Autonomous Driving","date":"2024-05-28","arxiv_id":"2405.18209","n_code_links":1,"syntology":null},{"paper":null,"slug":"spatial-temporal-analysis-of-neural","title":"Spatial-temporal analysis of neural desynchronization in sleep-like states reveals critical dynamics","date":"2024-05-28","arxiv_id":"2405.18329","n_code_links":0,"syntology":null},{"paper":null,"slug":"analysis-of-multiscale-reinforcement-q","title":"Analysis of Multiscale Reinforcement Q-Learning Algorithms for Mean Field Control Games","date":"2024-05-27","arxiv_id":"2405.17017","n_code_links":0,"syntology":null},{"paper":null,"slug":"biological-neurons-compete-with-deep","title":"Biological Neurons Compete with Deep Reinforcement Learning in Sample Efficiency in a Simulated Gameworld","date":"2024-05-27","arxiv_id":"2405.16946","n_code_links":0,"syntology":null},{"paper":null,"slug":"an-evolutionary-framework-for-connect-4-as","title":"An Evolutionary Framework for Connect-4 as Test-Bed for Comparison of Advanced Minimax, Q-Learning and MCTS","date":"2024-05-26","arxiv_id":"2405.16595","n_code_links":0,"syntology":null},{"paper":null,"slug":"reinforcement-learning-for-jump-diffusions","title":"Reinforcement Learning for Jump-Diffusions, with Financial Applications","date":"2024-05-26","arxiv_id":"2405.16449","n_code_links":0,"syntology":null},{"paper":null,"slug":"efficient-reinforcement-learning-via-large","title":"Extracting Heuristics from Large Language Models for Reward Shaping in Reinforcement Learning","date":"2024-05-24","arxiv_id":"2405.15194","n_code_links":0,"syntology":null},{"paper":null,"slug":"knowledge-informed-auto-penetration-testing","title":"Knowledge-Informed Auto-Penetration Testing Based on Reinforcement Learning with Reward Machine","date":"2024-05-24","arxiv_id":"2405.15908","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-finite-time-analysis-of-distributed-q","title":"A finite time analysis of distributed Q-learning","date":"2024-05-23","arxiv_id":"2405.14078","n_code_links":0,"syntology":null},{"paper":null,"slug":"exclusively-penalized-q-learning-for-offline","title":"Exclusively Penalized Q-learning for Offline Reinforcement Learning","date":"2024-05-23","arxiv_id":"2405.14082","n_code_links":0,"syntology":null},{"paper":null,"slug":"traffic-control-using-intelligent-timing-of","title":"Traffic control using intelligent timing of traffic lights with reinforcement learning technique and real-time processing of surveillance camera images","date":"2024-05-22","arxiv_id":"2405.13256","n_code_links":0,"syntology":null},{"paper":null,"slug":"stochastic-q-learning-for-large-discrete","title":"Stochastic Q-learning for Large Discrete Action Spaces","date":"2024-05-16","arxiv_id":"2405.10310","n_code_links":0,"syntology":null},{"paper":null,"slug":"deep-reinforcement-learning-for-real-time-2","title":"Deep Reinforcement Learning for Real-Time Ground Delay Program Revision and Corresponding Flight Delay Assignments","date":"2024-05-14","arxiv_id":"2405.08298","n_code_links":0,"syntology":null},{"paper":null,"slug":"a-partial-survey-of-decentralized-cooperative","title":"An Initial Introduction to Cooperative Multi-Agent Reinforcement Learning","date":"2024-05-10","arxiv_id":"2405.06161","n_code_links":0,"syntology":null},{"paper":"/paper/swiftrl-towards-efficient-reinforcement","slug":"swiftrl-towards-efficient-reinforcement","title":"SwiftRL: Towards Efficient Reinforcement Learning on Real Processing-In-Memory Systems","date":"2024-05-07","arxiv_id":"2405.03967","n_code_links":1,"syntology":null},{"paper":null,"slug":"a-network-simulation-of-otc-markets-with","title":"A Network Simulation of OTC Markets with Multiple Agents","date":"2024-05-03","arxiv_id":"2405.02480","n_code_links":0,"syntology":null},{"paper":"/paper/regularized-q-learning-through-robust","slug":"regularized-q-learning-through-robust","title":"Regularized Q-learning through Robust Averaging","date":"2024-05-03","arxiv_id":"2405.02201","n_code_links":1,"syntology":null},{"paper":null,"slug":"zero-sum-positional-differential-games-as-a","title":"Zero-Sum Positional Differential Games as a Framework for Robust Reinforcement Learning: Deep Q-Learning Approach","date":"2024-05-03","arxiv_id":"2405.02044","n_code_links":0,"syntology":null},{"paper":null,"slug":"loqa-learning-with-opponent-q-learning","title":"LOQA: Learning with Opponent Q-Learning Awareness","date":"2024-05-02","arxiv_id":"2405.01035","n_code_links":0,"syntology":null},{"paper":null,"slug":"cell-switching-in-haps-aided-networking-how","title":"Cell Switching in HAPS-Aided Networking: How the Obscurity of Traffic Loads Affects the Decision","date":"2024-05-01","arxiv_id":"2405.00387","n_code_links":0,"syntology":null},{"paper":null,"slug":"portfolio-management-using-deep-reinforcement","title":"Portfolio Management using Deep Reinforcement Learning","date":"2024-05-01","arxiv_id":"2405.01604","n_code_links":0,"syntology":null},{"paper":null,"slug":"numeric-reward-machines","title":"Numeric Reward Machines","date":"2024-04-30","arxiv_id":"2404.19370","n_code_links":0,"syntology":null},{"paper":null,"slug":"reinforcement-learning-problem-solving-with","title":"Reinforcement Learning Problem Solving with Large Language Models","date":"2024-04-29","arxiv_id":"2404.18638","n_code_links":0,"syntology":null},{"paper":"/paper/afu-actor-free-critic-updates-in-off-policy","slug":"afu-actor-free-critic-updates-in-off-policy","title":"AFU: Actor-Free critic Updates in off-policy RL for continuous control","date":"2024-04-24","arxiv_id":"2404.16159","n_code_links":1,"syntology":null},{"paper":null,"slug":"age-of-information-minimization-using-multi","title":"Age of Information Minimization using Multi-agent UAVs based on AI-Enhanced Mean Field Resource Allocation","date":"2024-04-24","arxiv_id":"2405.00056","n_code_links":0,"syntology":null},{"paper":null,"slug":"recursive-backwards-q-learning-in","title":"Recursive Backwards Q-Learning in Deterministic Environments","date":"2024-04-24","arxiv_id":"2404.15822","n_code_links":0,"syntology":null},{"paper":"/paper/research-on-robot-path-planning-based-on","slug":"research-on-robot-path-planning-based-on","title":"Research on Robot Path Planning Based on Reinforcement Learning","date":"2024-04-22","arxiv_id":"2404.14077","n_code_links":1,"syntology":null},{"paper":null,"slug":"unified-ode-analysis-of-smooth-q-learning","title":"Unified ODE Analysis of Smooth Q-Learning Algorithms","date":"2024-04-20","arxiv_id":"2404.14442","n_code_links":0,"syntology":null},{"paper":null,"slug":"continuous-time-risk-sensitive-reinforcement","title":"Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty","date":"2024-04-19","arxiv_id":"2404.12598","n_code_links":0,"syntology":null},{"paper":null,"slug":"reinforcement-learning-approach-for-1","title":"Reinforcement Learning Approach for Integrating Compressed Contexts into Knowledge Graphs","date":"2024-04-19","arxiv_id":"2404.12587","n_code_links":0,"syntology":null}],"record_sha256":"a0eafa58d14e6d3c3cd6c96a19f4d1894d8e294ecaded4667faae96b6987c075","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}