{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/64","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":64,"pages_in_order":152,"rows_per_page":100,"rows":[6301,6400],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/63","next":"/task/reinforcement-learning-1/papers/65","papers":[{"url":null,"slug":"uncertainty-aware-distributional-offline","title":"Uncertainty-aware Distributional Offline Reinforcement Learning","date":"2024-03-26","arxiv_id":"2403.17646","repositories_listed":0,"syntology":null},{"url":null,"slug":"outcome-constrained-large-language-models-for","title":"Outcome-Constrained Large Language Models for Countering Hate Speech","date":"2024-03-25","arxiv_id":"2403.17146","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-finds-nash-equilibrium-in","title":"Policy Optimization finds Nash Equilibrium in Regularized General-Sum LQ Games","date":"2024-03-25","arxiv_id":"2404.00045","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-recommender-2","title":"Reinforcement Learning-based Recommender Systems with Large Language Models for State Reward and Action Modeling","date":"2024-03-25","arxiv_id":"2403.16948","repositories_listed":0,"syntology":null},{"url":null,"slug":"semantic-aware-remote-estimation-of-multiple","title":"Semantic-Aware Remote Estimation of Multiple Markov Sources Under Constraints","date":"2024-03-25","arxiv_id":"2403.16855","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-with-a-learned-policy-basis-to","title":"Planning with a Learned Policy Basis to Optimally Solve Complex Tasks","date":"2024-03-22","arxiv_id":"2403.15301","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-reinforcement-learning-with-1","title":"Constrained Reinforcement Learning with Smoothed Log Barrier Function","date":"2024-03-21","arxiv_id":"2403.14508","repositories_listed":0,"syntology":null},{"url":null,"slug":"distilling-reinforcement-learning-policies","title":"Distilling Reinforcement Learning Policies for Interpretable Robot Locomotion: Gradient Boosting Machines and Symbolic Regression","date":"2024-03-21","arxiv_id":"2403.14328","repositories_listed":0,"syntology":null},{"url":null,"slug":"heuristic-algorithm-based-action-masking","title":"Heuristic Algorithm-based Action Masking Reinforcement Learning (HAAM-RL) with Ensemble Inference Method","date":"2024-03-21","arxiv_id":"2403.14110","repositories_listed":0,"syntology":null},{"url":null,"slug":"task-optimal-data-driven-surrogate-models-for","title":"Task-optimal data-driven surrogate models for eNMPC via differentiable simulation and optimization","date":"2024-03-21","arxiv_id":"2403.14425","repositories_listed":0,"syntology":null},{"url":null,"slug":"isometric-neural-machine-translation-using","title":"Isometric Neural Machine Translation using Phoneme Count Ratio Reward-based Reinforcement Learning","date":"2024-03-20","arxiv_id":"2403.15469","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-online-testing-of","title":"Reinforcement Learning for Online Testing of Autonomous Driving Systems: a Replication and Extension Study","date":"2024-03-20","arxiv_id":"2403.13729","repositories_listed":0,"syntology":null},{"url":null,"slug":"safety-aware-reinforcement-learning-for","title":"Safety-Aware Reinforcement Learning for Electric Vehicle Charging Station Management in Distribution Network","date":"2024-03-20","arxiv_id":"2403.13236","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-value-tracking-for-deep-reinforcement","title":"Fast Value Tracking for Deep Reinforcement Learning","date":"2024-03-19","arxiv_id":"2403.13178","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-offline-distributionally","title":"Sample Complexity of Offline Distributionally Robust Linear Markov Decision Processes","date":"2024-03-19","arxiv_id":"2403.12946","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-reinforcement-learning-with","title":"Bootstrapping Reinforcement Learning with Imitation for Vision-Based Agile Flight","date":"2024-03-18","arxiv_id":"2403.12203","repositories_listed":0,"syntology":null},{"url":null,"slug":"distill2explain-differentiable-decision-trees","title":"Distill2Explain: Differentiable decision trees for explainable reinforcement learning in energy application controllers","date":"2024-03-18","arxiv_id":"2403.11907","repositories_listed":0,"syntology":null},{"url":null,"slug":"envgen-generating-and-adapting-environments","title":"EnvGen: Generating and Adapting Environments via LLMs for Training Embodied Agents","date":"2024-03-18","arxiv_id":"2403.12014","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-multitask-representation-learning-for","title":"Offline Multitask Representation Learning for Reinforcement Learning","date":"2024-03-18","arxiv_id":"2403.11574","repositories_listed":0,"syntology":null},{"url":null,"slug":"pessimistic-causal-reinforcement-learning","title":"Pessimistic Causal Reinforcement Learning with Mediators for Confounded Offline Data","date":"2024-03-18","arxiv_id":"2403.11841","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-generalizable","title":"Reinforcement Learning with Generalizable Gaussian Splatting","date":"2024-03-18","arxiv_id":"2404.07950","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-separated-sarsa-a-practical-sequential","title":"State-Separated SARSA: A Practical Sequential Decision-Making Algorithm with Recovering Rewards","date":"2024-03-18","arxiv_id":"2403.11520","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-value-of-reward-lookahead-in","title":"The Value of Reward Lookahead in Reinforcement Learning","date":"2024-03-18","arxiv_id":"2403.11637","repositories_listed":0,"syntology":null},{"url":null,"slug":"causality-from-bottom-to-top-a-survey","title":"Causality from Bottom to Top: A Survey","date":"2024-03-17","arxiv_id":"2403.11219","repositories_listed":0,"syntology":null},{"url":null,"slug":"independent-rl-for-cooperative-competitive","title":"Independent RL for Cooperative-Competitive Agents: A Mean-Field Perspective","date":"2024-03-17","arxiv_id":"2403.11345","repositories_listed":0,"syntology":null},{"url":null,"slug":"prior-dependent-analysis-of-posterior","title":"Prior-dependent analysis of posterior sampling reinforcement learning with function approximation","date":"2024-03-17","arxiv_id":"2403.11175","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributed-multi-objective-dynamic","title":"Distributed Multi-Objective Dynamic Offloading Scheduling for Air-Ground Cooperative MEC","date":"2024-03-16","arxiv_id":"2403.10927","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-kernel-conditional-mean-embeddings","title":"Neural-Kernel Conditional Mean Embeddings","date":"2024-03-16","arxiv_id":"2403.10859","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-fallacy-of-minimizing-local-regret-in-the","title":"The Fallacy of Minimizing Cumulative Regret in the Sequential Task Setting","date":"2024-03-16","arxiv_id":"2403.10946","repositories_listed":0,"syntology":null},{"url":null,"slug":"visarl-visual-reinforcement-learning-guided","title":"ViSaRL: Visual Reinforcement Learning Guided by Human Saliency","date":"2024-03-16","arxiv_id":"2403.10940","repositories_listed":0,"syntology":null},{"url":null,"slug":"horizon-free-regret-for-linear-markov","title":"Horizon-Free Regret for Linear Markov Decision Processes","date":"2024-03-15","arxiv_id":"2403.10738","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-optimal-and-computationally-efficient","title":"Minimax Optimal and Computationally Efficient Algorithms for Distributionally Robust Offline Reinforcement Learning","date":"2024-03-14","arxiv_id":"2403.09621","repositories_listed":0,"syntology":null},{"url":null,"slug":"hrlaif-improvements-in-helpfulness-and","title":"HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback","date":"2024-03-13","arxiv_id":"2403.08309","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-operators-for-enabling-parallel-planning","title":"Meta-operators for Enabling Parallel Planning Using Deep Reinforcement Learning","date":"2024-03-13","arxiv_id":"2403.08910","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-optimization-using-adaptive","title":"Multi-Objective Optimization Using Adaptive Distributed Reinforcement Learning","date":"2024-03-13","arxiv_id":"2403.08879","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-efficient-risk-sensitive-policy","title":"Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis","date":"2024-03-13","arxiv_id":"2403.08955","repositories_listed":0,"syntology":null},{"url":null,"slug":"acquiring-diverse-skills-using-curriculum","title":"Acquiring Diverse Skills using Curriculum Reinforcement Learning with Mixture of Experts","date":"2024-03-11","arxiv_id":"2403.06966","repositories_listed":0,"syntology":null},{"url":null,"slug":"advancing-text-driven-chest-x-ray-generation","title":"Advancing Text-Driven Chest X-Ray Generation with Policy-Based Reinforcement Learning","date":"2024-03-11","arxiv_id":"2403.06516","repositories_listed":0,"syntology":null},{"url":null,"slug":"coral-collaborative-retrieval-augmented-large","title":"CoRAL: Collaborative Retrieval-Augmented Large Language Models Improve Long-tail Recommendation","date":"2024-03-11","arxiv_id":"2403.06447","repositories_listed":0,"syntology":null},{"url":null,"slug":"e-neural-thompson-sampling-of-deep-brain","title":"ε-Neural Thompson Sampling of Deep Brain Stimulation for Parkinson Disease Treatment","date":"2024-03-11","arxiv_id":"2403.06814","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-context-exploration-exploitation-for","title":"In-context Exploration-Exploitation for Reinforcement Learning","date":"2024-03-11","arxiv_id":"2403.06826","repositories_listed":0,"syntology":null},{"url":null,"slug":"mathbf-n-k-puzzle-a-cost-efficient-testbed","title":"$\\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model","date":"2024-03-11","arxiv_id":"2403.07191","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlingua-improving-reinforcement-learning","title":"RLingua: Improving Reinforcement Learning Sample Efficiency in Robotic Manipulations With Large Language Models","date":"2024-03-11","arxiv_id":"2403.06420","repositories_listed":0,"syntology":null},{"url":null,"slug":"unveiling-the-significance-of-toddler","title":"Unveiling the Significance of Toddler-Inspired Reward Transition in Goal-Oriented Reinforcement Learning","date":"2024-03-11","arxiv_id":"2403.06880","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferable-reinforcement-learning-via","title":"Distributional Successor Features Enable Zero-Shot Policy Optimization","date":"2024-03-10","arxiv_id":"2403.06328","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-classification-performance-via","title":"Enhancing Classification Performance via Reinforcement Learning for Feature Selection","date":"2024-03-09","arxiv_id":"2403.05979","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-multi-hop-knowledge-graph-reasoning","title":"Enhancing Multi-Hop Knowledge Graph Reasoning through Reward Shaping Techniques","date":"2024-03-09","arxiv_id":"2403.05801","repositories_listed":0,"syntology":null},{"url":null,"slug":"paper-hilt-personalized-and-adaptive-privacy","title":"PEaRL: Personalized Privacy of Human-Centric Systems using Early-Exit Reinforcement Learning","date":"2024-03-09","arxiv_id":"2403.05864","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-optimizing-human-centric-objectives","title":"Towards Optimizing Human-Centric Objectives in AI-Assisted Decision-Making With Offline Reinforcement Learning","date":"2024-03-09","arxiv_id":"2403.05911","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-design-of-photonic-crystal-surface","title":"Inverse Design of Photonic Crystal Surface Emitting Lasers is a Sequence Modeling Problem","date":"2024-03-08","arxiv_id":"2403.05149","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulating-battery-powered-tinyml-systems","title":"Simulating Battery-Powered TinyML Systems Optimised using Reinforcement Learning in Image-Based Anomaly Detection","date":"2024-03-08","arxiv_id":"2403.05106","repositories_listed":0,"syntology":null},{"url":null,"slug":"switching-the-loss-reduces-the-cost-in-batch","title":"Switching the Loss Reduces the Cost in Batch Reinforcement Learning","date":"2024-03-08","arxiv_id":"2403.05385","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-natural-extension-to-online-algorithms-for","title":"A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage","date":"2024-03-07","arxiv_id":"2403.09701","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-human-to-humanoid-real-time-whole","title":"Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation","date":"2024-03-07","arxiv_id":"2403.04436","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisy-spiking-actor-network-for-exploration","title":"Noisy Spiking Actor Network for Exploration","date":"2024-03-07","arxiv_id":"2403.04162","repositories_listed":0,"syntology":null},{"url":null,"slug":"proxy-rlhf-decoupling-generation-and","title":"Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy","date":"2024-03-07","arxiv_id":"2403.04283","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-cfr-improving-action-abstraction-for","title":"RL-CFR: Improving Action Abstraction for Imperfect Information Extensive-Form Games with Reinforcement Learning","date":"2024-03-07","arxiv_id":"2403.04344","repositories_listed":0,"syntology":null},{"url":null,"slug":"why-online-reinforcement-learning-is-causal","title":"Why Online Reinforcement Learning is Causal","date":"2024-03-07","arxiv_id":"2403.04221","repositories_listed":0,"syntology":null},{"url":null,"slug":"dexterous-legged-locomotion-in-confined-3d","title":"Dexterous Legged Locomotion in Confined 3D Spaces with Reinforcement Learning","date":"2024-03-06","arxiv_id":"2403.03848","repositories_listed":0,"syntology":null},{"url":null,"slug":"stop-regressing-training-value-functions-via","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","date":"2024-03-06","arxiv_id":"2403.03950","repositories_listed":0,"syntology":null},{"url":null,"slug":"language-guided-exploration-for-rl-agents-in","title":"Language Guided Exploration for RL Agents in Text Environments","date":"2024-03-05","arxiv_id":"2403.03141","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterated-q-network-beyond-the-one-step","title":"Iterated $Q$-Network: Beyond One-Step Bellman Updates in Deep Reinforcement Learning","date":"2024-03-04","arxiv_id":"2403.02107","repositories_listed":0,"syntology":null},{"url":null,"slug":"koopman-assisted-reinforcement-learning","title":"Koopman-Assisted Reinforcement Learning","date":"2024-03-04","arxiv_id":"2403.02290","repositories_listed":0,"syntology":null},{"url":null,"slug":"twisting-lids-off-with-two-hands","title":"Twisting Lids Off with Two Hands","date":"2024-03-04","arxiv_id":"2403.02338","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-myopic-exploration-through","title":"Sample Efficient Myopic Exploration Through Multitask Reinforcement Learning with Diverse Tasks","date":"2024-03-03","arxiv_id":"2403.01636","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-speech-recognition-using-advanced","title":"Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey","date":"2024-03-02","arxiv_id":"2403.01255","repositories_listed":0,"syntology":null},{"url":null,"slug":"overestimation-overfitting-and-plasticity-in","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","date":"2024-03-01","arxiv_id":"2403.00514","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-policy-learning-via-offline-skill","title":"Robust Policy Learning via Offline Skill Diffusion","date":"2024-03-01","arxiv_id":"2403.00225","repositories_listed":0,"syntology":null},{"url":null,"slug":"robustifying-a-policy-in-multi-agent-rl-with","title":"Robustifying a Policy in Multi-Agent RL with Diverse Cooperative Behaviors and Adversarial Style Sampling for Assistive Tasks","date":"2024-03-01","arxiv_id":"2403.00344","repositories_listed":0,"syntology":null},{"url":null,"slug":"scale-invariant-gradient-aggregation-for","title":"Conflict-Averse Gradient Aggregation for Constrained Multi-Objective Reinforcement Learning","date":"2024-03-01","arxiv_id":"2403.00282","repositories_listed":0,"syntology":null},{"url":null,"slug":"investigating-gender-fairness-in-machine","title":"Investigating Gender Fairness in Machine Learning-driven Personalized Care for Chronic Pain","date":"2024-02-29","arxiv_id":"2402.19226","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-fictitious-self-play-for-competitive","title":"Offline Fictitious Self-Play for Competitive Games","date":"2024-02-29","arxiv_id":"2403.00841","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-gpt-integrating-reinforcement-learning-and","title":"RL-GPT: Integrating Reinforcement Learning and Code-as-policy","date":"2024-02-29","arxiv_id":"2402.19299","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-risk-sensitive-distributional","title":"Provable Risk-Sensitive Distributional Reinforcement Learning with General Function Approximation","date":"2024-02-28","arxiv_id":"2402.18159","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-and-graph-neural","title":"Reinforcement Learning and Graph Neural Networks for Probabilistic Risk Assessment","date":"2024-02-28","arxiv_id":"2402.18246","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-program-variational-quantum","title":"Learning to Program Variational Quantum Circuits with Fast Weights","date":"2024-02-27","arxiv_id":"2402.17760","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-logic-specification-conditioned","title":"Temporal Logic Specification-Conditioned Decision Transformer for Offline Safe Reinforcement Learning","date":"2024-02-27","arxiv_id":"2402.17217","repositories_listed":0,"syntology":null},{"url":null,"slug":"c-gail-stabilizing-generative-adversarial","title":"C-GAIL: Stabilizing Generative Adversarial Imitation Learning with Control Theory","date":"2024-02-26","arxiv_id":"2402.16349","repositories_listed":0,"syntology":null},{"url":null,"slug":"monitoring-fidelity-of-online-reinforcement","title":"Monitoring Fidelity of Online Reinforcement Learning Algorithms in Clinical Trials","date":"2024-02-26","arxiv_id":"2402.17003","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-fox-learning-breaking-tradition-in","title":"QF-tuner: Breaking Tradition in Reinforcement Learning","date":"2024-02-26","arxiv_id":"2402.16562","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-oscillation","title":"Reinforcement Learning Based Oscillation Dampening: Scaling up Single-Agent RL algorithms to a 100 AV highway field operational test","date":"2024-02-26","arxiv_id":"2402.17050","repositories_listed":0,"syntology":null},{"url":null,"slug":"concurrent-learning-of-policy-and-unknown","title":"Concurrent Learning of Policy and Unknown Safety Constraints in Reinforcement Learning","date":"2024-02-24","arxiv_id":"2402.15893","repositories_listed":0,"syntology":null},{"url":null,"slug":"altgraph-redesigning-quantum-circuits-using","title":"AltGraph: Redesigning Quantum Circuits Using Generative Graph Models for Efficient Optimization","date":"2024-02-23","arxiv_id":"2403.12979","repositories_listed":0,"syntology":null},{"url":null,"slug":"predilect-preferences-delineated-with-zero","title":"PREDILECT: Preferences Delineated with Zero-Shot Language-based Reasoning in Reinforcement Learning","date":"2024-02-23","arxiv_id":"2402.15420","repositories_listed":0,"syntology":null},{"url":null,"slug":"trajectory-wise-iterative-reinforcement","title":"Trajectory-wise Iterative Reinforcement Learning Framework for Auto-bidding","date":"2024-02-23","arxiv_id":"2402.15102","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-design-and-optimization-of","title":"Automated Design and Optimization of Distributed Filtering Circuits via Reinforcement Learning","date":"2024-02-22","arxiv_id":"2402.14236","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-elastic-time","title":"Reinforcement Learning with Elastic Time Steps","date":"2024-02-22","arxiv_id":"2402.14961","repositories_listed":0,"syntology":null},{"url":null,"slug":"attackgnn-red-teaming-gnns-in-hardware","title":"AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning","date":"2024-02-21","arxiv_id":"2402.13946","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-a-proportional-integral-controller","title":"Improving a Proportional Integral Controller with Reinforcement Learning on a Throttle Valve Benchmark","date":"2024-02-21","arxiv_id":"2402.13654","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dual-arm-object-rearrangement-for","title":"Learning Dual-arm Object Rearrangement for Cartesian Robots","date":"2024-02-21","arxiv_id":"2402.13634","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-assisted-quantum-1","title":"Reinforcement learning-assisted quantum architecture search for variational quantum algorithms","date":"2024-02-21","arxiv_id":"2402.13754","repositories_listed":0,"syntology":null},{"url":null,"slug":"achieving-near-optimal-regret-for-bandit","title":"Uniform Last-Iterate Guarantee for Bandits and Reinforcement Learning","date":"2024-02-20","arxiv_id":"2402.12711","repositories_listed":0,"syntology":null},{"url":null,"slug":"align-your-intents-offline-imitation-learning","title":"Align Your Intents: Offline Imitation Learning via Optimal Transport","date":"2024-02-20","arxiv_id":"2402.13037","repositories_listed":0,"syntology":null},{"url":null,"slug":"antifragile-perimeter-control-anticipating","title":"Antifragile Perimeter Control: Anticipating and Gaining from Disruptions with Reinforcement Learning","date":"2024-02-20","arxiv_id":"2402.12665","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-hedging-with-market-impact","title":"Deep Hedging with Market Impact","date":"2024-02-20","arxiv_id":"2402.13326","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-multi-task-transfer-rl-with","title":"Offline Multi-task Transfer RL with Representational Penalization","date":"2024-02-19","arxiv_id":"2402.12570","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-evolving-autoencoder-embedded-q-network","title":"Self-evolving Autoencoder Embedded Q-Network","date":"2024-02-18","arxiv_id":"2402.11604","repositories_listed":0,"syntology":null},{"url":null,"slug":"theoretical-foundations-for-programmatic","title":"Programmatic Reinforcement Learning: Navigating Gridworlds","date":"2024-02-18","arxiv_id":"2402.11650","repositories_listed":0,"syntology":null},{"url":null,"slug":"sinr-aware-deep-reinforcement-learning-for","title":"SINR-Aware Deep Reinforcement Learning for Distributed Dynamic Channel Allocation in Cognitive Interference Networks","date":"2024-02-17","arxiv_id":"2402.17773","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-play-fine-tuning-of-diffusion-models-for","title":"Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation","date":"2024-02-15","arxiv_id":"2402.10210","repositories_listed":0,"syntology":null}],"record_sha256":"5cd6a9c9411163cf39fa73fd83033523284289f05e9bef3edba934aba33cdd58","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}