{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/q-learning/papers/6","list_of":"/task/q-learning","task":"Q-Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":6,"pages_in_order":20,"rows_per_page":100,"rows":[501,600],"of":1918,"counts":{"archive_papers_tagged":1918,"with_a_code_link":463,"where_syntology_ran_a_sample":119,"not_listed_spam_title":0,"listed":1918,"listed_where_code_ran":119,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":102,"every_run_a_failure_of_syntologys_instrument":17,"listed_with_a_run_with_no_instrument_failure":102,"listed_every_run_a_failure_of_syntologys_instrument":17,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/q-learning","prev":"/task/q-learning/papers/5","next":"/task/q-learning/papers/7","papers":[{"url":null,"slug":"mixed-precision-conjugate-gradient-solvers","title":"Mixed-Precision Conjugate Gradient Solvers with RL-Driven Precision Tuning","date":"2025-04-19","arxiv_id":"2504.14268","repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-the-theoretical-properties-of","title":"Understanding the theoretical properties of projected Bellman equation, linear Q-learning, and approximate value iteration","date":"2025-04-15","arxiv_id":"2504.10865","repositories_listed":0,"syntology":null},{"url":null,"slug":"nash-equilibrium-between-consumer-electronic","title":"Nash Equilibrium Between Consumer Electronic Devices and DoS Attacker for Distributed IoT-enabled RSE Systems","date":"2025-04-13","arxiv_id":"2504.09415","repositories_listed":0,"syntology":null},{"url":null,"slug":"relaxing-the-markov-requirements-on","title":"A Framework of decision-relevant observability: Reinforcement Learning converges under relative ignorability","date":"2025-04-10","arxiv_id":"2504.07722","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-estimation-using-particle-filtering-in","title":"State Estimation Using Particle Filtering in Adaptive Machine Learning Methods: Integrating Q-Learning and NEAT Algorithms with Noisy Radar Measurements","date":"2025-04-10","arxiv_id":"2504.07393","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-rl-scene-dynamics-learning-for","title":"Inverse RL Scene Dynamics Learning for Nonlinear Predictive Control in Autonomous Vehicles","date":"2025-04-02","arxiv_id":"2504.01336","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-curriculum-learning-for-goal","title":"Probabilistic Curriculum Learning for Goal-Based Reinforcement Learning","date":"2025-04-02","arxiv_id":"2504.01459","repositories_listed":0,"syntology":null},{"url":null,"slug":"late-breaking-results-breaking-symmetry","title":"Late Breaking Results: Breaking Symmetry- Unconventional Placement of Analog Circuits using Multi-Level Multi-Agent Reinforcement Learning","date":"2025-03-29","arxiv_id":"2503.22958","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-path-planning-and-cost-minimization","title":"Optimal Path Planning and Cost Minimization for a Drone Delivery System Via Model Predictive Control","date":"2025-03-25","arxiv_id":"2503.19699","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-bounds-for-two-time-scale","title":"Finite-Time Bounds for Two-Time-Scale Stochastic Approximation with Arbitrary Norm Contractions and Markovian Noise","date":"2025-03-24","arxiv_id":"2503.18391","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-switching-non","title":"Reinforcement Learning in Switching Non-Stationary Markov Decision Processes: Algorithms and Convergence Analysis","date":"2025-03-24","arxiv_id":"2503.18607","repositories_listed":0,"syntology":null},{"url":null,"slug":"bandwidth-reservation-for-time-critical","title":"Bandwidth Reservation for Time-Critical Vehicular Applications: A Multi-Operator Environment","date":"2025-03-22","arxiv_id":"2503.17756","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-and-learning-in-average-risk-aware","title":"Planning and Learning in Average Risk-aware MDPs","date":"2025-03-22","arxiv_id":"2503.17629","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-with-gradient-target-tracking","title":"Deep Q-Learning with Gradient Target Tracking","date":"2025-03-20","arxiv_id":"2503.16700","repositories_listed":0,"syntology":null},{"url":null,"slug":"apf-boosting-adaptive-potential-function","title":"APF+: Boosting adaptive-potential function reinforcement learning methods with a W-shaped network for high-dimensional games","date":"2025-03-17","arxiv_id":"2503.13557","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-competitive-and-collusive-behaviors","title":"Exploring Competitive and Collusive Behaviors in Algorithmic Pricing with Deep Reinforcement Learning","date":"2025-03-14","arxiv_id":"2503.11270","repositories_listed":0,"syntology":null},{"url":null,"slug":"residual-policy-gradient-a-reward-view-of-kl","title":"Residual Policy Gradient: A Reward View of KL-regularized Objective","date":"2025-03-14","arxiv_id":"2503.11019","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-q-learning-dynamics-in-random","title":"Multi-Agent Q-Learning Dynamics in Random Networks: Convergence due to Exploration and Sparsity","date":"2025-03-13","arxiv_id":"2503.10186","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-multi-objective-reinforcement","title":"A Novel Multi-Objective Reinforcement Learning Algorithm for Pursuit-Evasion Game","date":"2025-03-09","arxiv_id":"2503.06741","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-multi-agent-q-learning-for-policy","title":"Generative Multi-Agent Q-Learning for Policy Optimization: Decentralized Wireless Networks","date":"2025-03-07","arxiv_id":"2503.05970","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-inverse-q-learning-from","title":"Multi-Agent Inverse Q-Learning from Demonstrations","date":"2025-03-06","arxiv_id":"2503.04679","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-inspired-reinforcement-learning-in","title":"Quantum-Inspired Reinforcement Learning in the Presence of Epistemic Ambivalence","date":"2025-03-06","arxiv_id":"2503.04219","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-iqs-dynamics-aware-offline-inverse-q","title":"DO-IQS: Dynamics-Aware Offline Inverse Q-Learning for Optimal Stopping with Unknown Gain Functions","date":"2025-03-05","arxiv_id":"2503.03515","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigating-intelligence-a-survey-of-google-or","title":"Navigating Intelligence: A Survey of Google OR-Tools and Machine Learning for Global Path Planning in Autonomous Vehicles","date":"2025-03-05","arxiv_id":"2503.03338","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-efficient-and-uncertainty-aware","title":"An Efficient and Uncertainty-aware Reinforcement Learning Framework for Quality Assurance in Extrusion Additive Manufacturing","date":"2025-03-02","arxiv_id":"2503.00971","repositories_listed":0,"syntology":null},{"url":null,"slug":"2503-00372","title":"Nucleolus Credit Assignment for Effective Coalitions in Multi-agent Reinforcement Learning","date":"2025-03-01","arxiv_id":"2503.00372","repositories_listed":0,"syntology":null},{"url":null,"slug":"cycles-and-collusion-in-congestion-games","title":"Cycles and collusion in congestion games under Q-learning","date":"2025-02-26","arxiv_id":"2502.18984","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-learning-with-a-natural-language","title":"Policy Learning with a Natural Language Action Space: A Causal Approach","date":"2025-02-24","arxiv_id":"2502.17538","repositories_listed":0,"syntology":null},{"url":null,"slug":"yes-q-learning-helps-offline-in-context-rl","title":"Yes, Q-learning Helps Offline In-Context RL","date":"2025-02-24","arxiv_id":"2502.17666","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-non-asymptotic-theory-of-seminorm-lyapunov","title":"A Non-Asymptotic Theory of Seminorm Lyapunov Stability: From Deterministic to Stochastic Iterative Algorithms","date":"2025-02-20","arxiv_id":"2502.14208","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithmic-collusion-under-observed-demand","title":"Algorithmic Collusion under Observed Demand Shocks","date":"2025-02-20","arxiv_id":"2502.15084","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-mean-field-multi-agent-reinforcement","title":"Causal Mean Field Multi-Agent Reinforcement Learning","date":"2025-02-20","arxiv_id":"2502.14200","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-q-learning-an-ill-posed-problem","title":"Is Q-learning an Ill-posed Problem?","date":"2025-02-20","arxiv_id":"2502.14365","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-reinforcement-learning-for-3","title":"Multi-Objective Reinforcement Learning for Critical Scenario Generation of Autonomous Vehicles","date":"2025-02-18","arxiv_id":"2502.15792","repositories_listed":0,"syntology":null},{"url":null,"slug":"few-is-more-task-efficient-skill-discovery","title":"Few is More: Task-Efficient Skill-Discovery for Multi-Task Offline Multi-Agent Reinforcement Learning","date":"2025-02-13","arxiv_id":"2502.08985","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-adaptive-anti-jamming-channel-access-via","title":"Fast Adaptive Anti-Jamming Channel Access via Deep Q Learning and Coarse-Grained Spectrum Prediction","date":"2025-02-07","arxiv_id":"2502.04963","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-wireless-resource-management-and","title":"Optimizing Wireless Resource Management and Synchronization in Digital Twin Networks","date":"2025-02-07","arxiv_id":"2502.05116","repositories_listed":0,"syntology":null},{"url":null,"slug":"seasonal-station-keeping-of-short-duration","title":"Seasonal Station-Keeping of Short Duration High Altitude Balloons using Deep Reinforcement Learning","date":"2025-02-07","arxiv_id":"2502.05014","repositories_listed":0,"syntology":null},{"url":null,"slug":"cleansurvival-automated-data-preprocessing","title":"CleanSurvival: Automated data preprocessing for time-to-event models using reinforcement learning","date":"2025-02-06","arxiv_id":"2502.03946","repositories_listed":0,"syntology":null},{"url":null,"slug":"decaf-learning-to-be-fair-in-multi-agent","title":"DECAF: Learning to be Fair in Multi-agent Resource Allocation","date":"2025-02-06","arxiv_id":"2502.04281","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-triangular-arbitrage-detection-via","title":"Efficient Triangular Arbitrage Detection via Graph Neural Networks","date":"2025-02-05","arxiv_id":"2502.03194","repositories_listed":0,"syntology":null},{"url":null,"slug":"gap-dependent-bounds-for-federated-q-learning","title":"Gap-Dependent Bounds for Federated $Q$-learning","date":"2025-02-05","arxiv_id":"2502.02859","repositories_listed":0,"syntology":null},{"url":null,"slug":"vistaflow-photorealistic-volumetric","title":"VistaFlow: Photorealistic Volumetric Reconstruction with Dynamic Resolution Management via Q-Learning","date":"2025-02-05","arxiv_id":"2502.05222","repositories_listed":0,"syntology":null},{"url":null,"slug":"resilient-uav-trajectory-planning-via-few","title":"Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning","date":"2025-02-03","arxiv_id":"2502.01268","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-mdp-model-for-censoring-in-harvesting","title":"An MDP Model for Censoring in Harvesting Sensors: Optimal and Approximated Solutions","date":"2025-02-02","arxiv_id":"2502.00940","repositories_listed":0,"syntology":null},{"url":null,"slug":"computing-and-learning-mean-field-equilibria","title":"Computing and Learning Stationary Mean Field Equilibria with Scalar Interactions: Algorithms and Applications","date":"2025-02-02","arxiv_id":"2502.12024","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-suboptimal-data-in-continuous","title":"Learning from Suboptimal Data in Continuous Control via Auto-Regressive Soft Q-Network","date":"2025-02-01","arxiv_id":"2502.00288","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-q-learning-does-not-diverge","title":"Linear $Q$-Learning Does Not Diverge: Convergence Rates to a Bounded Set","date":"2025-01-31","arxiv_id":"2501.19254","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-quantum-circuit","title":"Reinforcement Learning for Quantum Circuit Design: Using Matrix Representations","date":"2025-01-27","arxiv_id":"2501.16509","repositories_listed":0,"syntology":null},{"url":null,"slug":"music-generation-using-human-in-the-loop","title":"Music Generation using Human-In-The-Loop Reinforcement Learning","date":"2025-01-25","arxiv_id":"2501.15304","repositories_listed":0,"syntology":null},{"url":null,"slug":"coordinating-ride-pooling-with-public-transit","title":"Coordinating Ride-Pooling with Public Transit using Reward-Guided Conservative Q-Learning: An Offline Training and Online Fine-Tuning Reinforcement Learning Framework","date":"2025-01-24","arxiv_id":"2501.14199","repositories_listed":0,"syntology":null},{"url":null,"slug":"bmg-q-localized-bipartite-match-graph","title":"BMG-Q: Localized Bipartite Match Graph Attention Q-Learning for Ride-Pooling Order Dispatch","date":"2025-01-23","arxiv_id":"2501.13448","repositories_listed":0,"syntology":null},{"url":null,"slug":"random-key-algorithms-for-optimizing","title":"Random-Key Algorithms for Optimizing Integrated Operating Room Scheduling","date":"2025-01-17","arxiv_id":"2501.10243","repositories_listed":0,"syntology":null},{"url":null,"slug":"projection-implicit-q-learning-with-support","title":"Projection Implicit Q-Learning with Support Constraint for Offline Reinforcement Learning","date":"2025-01-15","arxiv_id":"2501.08907","repositories_listed":0,"syntology":null},{"url":null,"slug":"speq-stabilization-phases-for-efficient-q","title":"SPEQ: Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","date":"2025-01-15","arxiv_id":"2501.08669","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-inventory-management-for-new","title":"Data-driven inventory management for new products: An adjusted Dyna-$Q$ approach with transfer learning","date":"2025-01-14","arxiv_id":"2501.08109","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-inductive-learning-from-answer-sets","title":"Online inductive learning from answer sets for efficient reinforcement learning exploration","date":"2025-01-13","arxiv_id":"2501.07445","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-optimal-output-tracking-for","title":"Cooperative Optimal Output Tracking for Discrete-Time Multiagent Systems: Stabilizing Policy Iteration Frameworks and Analysis","date":"2025-01-11","arxiv_id":"2501.06510","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-transfer-q-learning-for-offline-non","title":"Deep Transfer $Q$-Learning for Offline Non-Stationary Reinforcement Learning","date":"2025-01-08","arxiv_id":"2501.04870","repositories_listed":0,"syntology":null},{"url":null,"slug":"b-dqn-improving-deep-q-learning-by-evolving","title":"$β$-DQN: Improving Deep Q-Learning By Evolving the Behavior","date":"2025-01-01","arxiv_id":"2501.00913","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-based-efficient-off-policy-stabilizing","title":"Data-Based Efficient Off-Policy Stabilizing Optimal Control Algorithms for Discrete-Time Linear Systems via Damping Coefficients","date":"2024-12-30","arxiv_id":"2412.20845","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-optimization-of-storage-systems-using","title":"Dynamic Optimization of Storage Systems Using Reinforcement Learning Techniques","date":"2024-12-29","arxiv_id":"2501.00068","repositories_listed":0,"syntology":null},{"url":null,"slug":"protein-structure-prediction-in-the-3d-hp","title":"Protein Structure Prediction in the 3D HP Model Using Deep Reinforcement Learning","date":"2024-12-29","arxiv_id":"2412.20329","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-task-mapping","title":"A Reinforcement Learning-Based Task Mapping Method to Improve the Reliability of Clustered Manycores","date":"2024-12-26","arxiv_id":"2412.19340","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperq-opt-q-learning-for-hyperparameter","title":"HyperQ-Opt: Q-learning for Hyperparameter Optimization","date":"2024-12-23","arxiv_id":"2412.17765","repositories_listed":0,"syntology":null},{"url":null,"slug":"acl-ql-adaptive-conservative-level-in-q","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","date":"2024-12-22","arxiv_id":"2412.16848","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-q-learning-for-real-time-load","title":"Multi-Agent Q-Learning for Real-Time Load Balancing User Association and Handover in Mobile Networks","date":"2024-12-22","arxiv_id":"2412.19835","repositories_listed":0,"syntology":null},{"url":null,"slug":"distribution-free-uncertainty-quantification-2","title":"Distribution-Free Uncertainty Quantification in Mechanical Ventilation Treatment: A Conformal Deep Q-Learning Framework","date":"2024-12-17","arxiv_id":"2412.12597","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-network-driven-reward-prediction-as-a","title":"Neural-Network-Driven Reward Prediction as a Heuristic: Advancing Q-Learning for Mobile Robot Path Planning","date":"2024-12-17","arxiv_id":"2412.12650","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrated-trucks-assignment-and-scheduling","title":"Integrated trucks assignment and scheduling problem with mixed service mode docks: A Q-learning based adaptive large neighborhood search algorithm","date":"2024-12-12","arxiv_id":"2412.09090","repositories_listed":0,"syntology":null},{"url":null,"slug":"pickllm-context-aware-rl-assisted-large","title":"PickLLM: Context-Aware RL-Assisted Large Language Model Routing","date":"2024-12-12","arxiv_id":"2412.12170","repositories_listed":0,"syntology":null},{"url":null,"slug":"edge-delayed-deep-deterministic-policy","title":"Edge Delayed Deep Deterministic Policy Gradient: efficient continuous control for edge scenarios","date":"2024-12-09","arxiv_id":"2412.06390","repositories_listed":0,"syntology":null},{"url":null,"slug":"demonstration-selection-for-in-context","title":"Demonstration Selection for In-Context Learning via Reinforcement Learning","date":"2024-12-05","arxiv_id":"2412.03966","repositories_listed":0,"syntology":null},{"url":null,"slug":"comparative-analysis-of-multi-agent","title":"Comparative Analysis of Multi-Agent Reinforcement Learning Policies for Crop Planning Decision Support","date":"2024-12-03","arxiv_id":"2412.02057","repositories_listed":0,"syntology":null},{"url":null,"slug":"mean-field-sampling-for-cooperative-multi","title":"Mean-Field Sampling for Cooperative Multi-Agent Reinforcement Learning","date":"2024-12-01","arxiv_id":"2412.00661","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-based-model-free-safety-filter","title":"Q-learning-based Model-free Safety Filter","date":"2024-11-29","arxiv_id":"2411.19809","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-retail-pricing-via-q-learning-a","title":"Dynamic Retail Pricing via Q-Learning -- A Reinforcement Learning Framework for Enhanced Revenue Management","date":"2024-11-27","arxiv_id":"2411.18261","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-scale-separation-in-q-learning-extending","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","date":"2024-11-21","arxiv_id":"2411.14019","repositories_listed":0,"syntology":null},{"url":null,"slug":"almost-sure-convergence-rates-and","title":"Almost Sure Convergence Rates and Concentration of Stochastic Approximation and Reinforcement Learning with Markovian Noise","date":"2024-11-20","arxiv_id":"2411.13711","repositories_listed":0,"syntology":null},{"url":null,"slug":"structure-learning-with-temporal-gaussian","title":"Structure learning with Temporal Gaussian Mixture for model-based Reinforcement Learning","date":"2024-11-18","arxiv_id":"2411.11511","repositories_listed":0,"syntology":null},{"url":null,"slug":"mitigating-relative-over-generalization-in","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","date":"2024-11-17","arxiv_id":"2411.11099","repositories_listed":0,"syntology":null},{"url":null,"slug":"coverage-analysis-for-digital-cousin","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","date":"2024-11-13","arxiv_id":"2411.08360","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigation-with-qphil-quantizing-planner-for","title":"Navigation with QPHIL: Quantizing Planner for Hierarchical Implicit Q-Learning","date":"2024-11-12","arxiv_id":"2411.07760","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-the-curse-of-dimensionality-in-1","title":"Overcoming the Curse of Dimensionality in Reinforcement Learning Through Approximate Factorization","date":"2024-11-12","arxiv_id":"2411.07591","repositories_listed":0,"syntology":null},{"url":null,"slug":"real-world-offline-reinforcement-learning-1","title":"Real-World Offline Reinforcement Learning from Vision Language Model Feedback","date":"2024-11-08","arxiv_id":"2411.05273","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-adaptive-resource","title":"Reinforcement Learning for Adaptive Resource Scheduling in Complex System Environments","date":"2024-11-08","arxiv_id":"2411.05346","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotic-regularity-of-a-generalised","title":"Asymptotic regularity of a generalised stochastic Halpern scheme with applications","date":"2024-11-07","arxiv_id":"2411.04845","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-user-connectivity-in-ai-enabled","title":"Maximizing User Connectivity in AI-Enabled Multi-UAV Networks: A Distributed Strategy Generalized to Arbitrary User Distributions","date":"2024-11-07","arxiv_id":"2411.05205","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-sft-q-learning-for-language-models-via","title":"Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning","date":"2024-11-07","arxiv_id":"2411.05193","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-of-exploratory-policy-improvement-and","title":"Regret of exploratory policy improvement and $q$-learning","date":"2024-11-02","arxiv_id":"2411.01302","repositories_listed":0,"syntology":null},{"url":null,"slug":"haver-instance-dependent-error-bounds-for","title":"HAVER: Instance-Dependent Error Bounds for Maximum Mean Estimation and Applications to Q-Learning and Monte Carlo Tree Search","date":"2024-11-01","arxiv_id":"2411.00405","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-and-sequence","title":"Offline Reinforcement Learning and Sequence Modeling for Downlink Link Adaptation","date":"2024-10-30","arxiv_id":"2410.23031","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-approximation-with-unbounded","title":"Stochastic Approximation with Unbounded Markovian Noise: A General-Purpose Theorem","date":"2024-10-29","arxiv_id":"2410.21704","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-load-scheduling-in-power-grids","title":"Optimizing Load Scheduling in Power Grids Using Reinforcement Learning and Markov Decision Processes","date":"2024-10-23","arxiv_id":"2410.17696","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-novel-reinforcement-learning-model-for-post","title":"A Novel Reinforcement Learning Model for Post-Incident Malware Investigations","date":"2024-10-19","arxiv_id":"2410.15028","repositories_listed":0,"syntology":null},{"url":null,"slug":"diar-diffusion-model-guided-implicit-q","title":"DIAR: Diffusion-model-guided Implicit Q-learning with Adaptive Revaluation","date":"2024-10-15","arxiv_id":"2410.11338","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-based-offline-rl-for-improved","title":"Diffusion-Based Offline RL for Improved Decision-Making in Augmented ARC Task","date":"2024-10-15","arxiv_id":"2410.11324","repositories_listed":0,"syntology":null},{"url":null,"slug":"improve-value-estimation-of-q-function-and","title":"Improve Value Estimation of Q Function and Reshape Reward with Monte Carlo Tree Search","date":"2024-10-15","arxiv_id":"2410.11642","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-agents-with-prioritization-and-1","title":"Learning Agents With Prioritization and Parameter Noise in Continuous State and Action Space","date":"2024-10-15","arxiv_id":"2410.11250","repositories_listed":0,"syntology":null},{"url":null,"slug":"mfc-eq-mean-field-control-with-envelope-q","title":"MFC-EQ: Mean-Field Control with Envelope Q-Learning for Moving Decentralized Agents in Formation","date":"2024-10-15","arxiv_id":"2410.12062","repositories_listed":0,"syntology":null}],"record_sha256":"19ae6fde4810551c4e124c6d01dd83d575c5ad4e7ba25d88743a4d546611278e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}