{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/57","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":57,"pages_in_order":152,"rows_per_page":100,"rows":[5601,5700],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/56","next":"/task/reinforcement-learning-1/papers/58","papers":[{"url":null,"slug":"probing-for-consciousness-in-machines","title":"Probing for Consciousness in Machines","date":"2024-11-25","arxiv_id":"2411.16262","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-event-outlier-detection-in","title":"Unsupervised Event Outlier Detection in Continuous Time","date":"2024-11-25","arxiv_id":"2411.16427","repositories_listed":0,"syntology":null},{"url":null,"slug":"broad-critic-deep-actor-reinforcement","title":"Broad Critic Deep Actor Reinforcement Learning for Continuous Control","date":"2024-11-24","arxiv_id":"2411.15806","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-laws-to-motivation-guiding-exploration","title":"From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards","date":"2024-11-24","arxiv_id":"2411.15891","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enhanced-genetic","title":"Reinforcement learning-enhanced genetic algorithm for wind farm layout optimization","date":"2024-11-24","arxiv_id":"2412.06803","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-local-trading-strategy-deep","title":"Learning a local trading strategy: deep reinforcement learning for grid-scale renewable energy integration","date":"2024-11-23","arxiv_id":"2411.15422","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-molecular-design-through-graph","title":"Enhancing Molecular Design through Graph-based Topological Reinforcement Learning","date":"2024-11-22","arxiv_id":"2411.14726","repositories_listed":0,"syntology":null},{"url":null,"slug":"free-energy-projective-simulation-feps-active","title":"Free Energy Projective Simulation (FEPS): Active inference with interpretability","date":"2024-11-22","arxiv_id":"2411.14991","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-fine-tuning-two-step-diffusion-models","title":"Reward Fine-Tuning Two-Step Diffusion Models via Learning Differentiable Latent-Space Surrogate Reward","date":"2024-11-22","arxiv_id":"2411.15247","repositories_listed":0,"syntology":null},{"url":null,"slug":"segmenting-action-value-functions-over-time","title":"Segmenting Action-Value Functions Over Time-Scales in SARSA via TD($Δ$)","date":"2024-11-22","arxiv_id":"2411.14783","repositories_listed":0,"syntology":null},{"url":null,"slug":"graco-a-graph-composer-for-integrated","title":"GraCo -- A Graph Composer for Integrated Circuits","date":"2024-11-21","arxiv_id":"2411.13890","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-checking-for-reinforcement-learning-in","title":"Model Checking for Reinforcement Learning in Autonomous Driving: One Can Do More Than You Think!","date":"2024-11-21","arxiv_id":"2411.14375","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-scale-separation-in-q-learning-extending","title":"Time-Scale Separation in Q-Learning: Extending TD($\\triangle$) for Action-Value Function Decomposition","date":"2024-11-21","arxiv_id":"2411.14019","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-enhancing-reinforcement-learning","title":"A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback","date":"2024-11-20","arxiv_id":"2411.13410","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-action-manipulation-attack","title":"Provably Efficient Action-Manipulation Attack Against Continuous Reinforcement Learning","date":"2024-11-20","arxiv_id":"2411.13116","repositories_listed":0,"syntology":null},{"url":null,"slug":"grl-prompt-towards-knowledge-graph-based","title":"GRL-Prompt: Towards Knowledge Graph based Prompt Optimization via Reinforcement Learning","date":"2024-11-19","arxiv_id":"2411.14479","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-action-sequence","title":"Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Robot Learning","date":"2024-11-19","arxiv_id":"2411.12155","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-decision-transformer-with-diffusion","title":"Enhancing Decision Transformer with Diffusion-Based Trajectory Branch Generation","date":"2024-11-18","arxiv_id":"2411.11327","repositories_listed":0,"syntology":null},{"url":null,"slug":"no-regret-exploration-in-shuffle-private","title":"No-regret Exploration in Shuffle Private Reinforcement Learning","date":"2024-11-18","arxiv_id":"2411.11647","repositories_listed":0,"syntology":null},{"url":null,"slug":"preserving-expert-level-privacy-in-offline","title":"Preserving Expert-Level Privacy in Offline Reinforcement Learning","date":"2024-11-18","arxiv_id":"2411.13598","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-free-reinforcement-learning-for-ltl","title":"Regret-Free Reinforcement Learning for LTL Specifications","date":"2024-11-18","arxiv_id":"2411.12019","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-under-diffusion","title":"Robust Reinforcement Learning under Diffusion Models for Data with Jumps","date":"2024-11-18","arxiv_id":"2411.11697","repositories_listed":0,"syntology":null},{"url":null,"slug":"upside-down-reinforcement-learning-for-more","title":"Upside-Down Reinforcement Learning for More Interpretable Optimal Control","date":"2024-11-18","arxiv_id":"2411.11457","repositories_listed":0,"syntology":null},{"url":null,"slug":"financial-news-driven-llm-reinforcement","title":"Financial News-Driven LLM Reinforcement Learning for Portfolio Management","date":"2024-11-17","arxiv_id":"2411.11059","repositories_listed":0,"syntology":null},{"url":null,"slug":"modulating-reservoir-dynamics-via","title":"Modulating Reservoir Dynamics via Reinforcement Learning for Efficient Robot Skill Synthesis","date":"2024-11-17","arxiv_id":"2411.10991","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-defense-against-extreme-grid-events","title":"Robust Defense Against Extreme Grid Events Using Dual-Policy Reinforcement Learning Agents","date":"2024-11-17","arxiv_id":"2411.11180","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-learning-of-design-strategies-over","title":"Adaptive Learning of Design Strategies over Non-Hierarchical Multi-Fidelity Models via Policy Alignment","date":"2024-11-16","arxiv_id":"2411.10841","repositories_listed":0,"syntology":null},{"url":null,"slug":"stable-continual-reinforcement-learning-via","title":"Stable Continual Reinforcement Learning via Diffusion-based Trajectory Replay","date":"2024-11-16","arxiv_id":"2411.10809","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-adversarial-reinforcement-learning","title":"Continual Adversarial Reinforcement Learning (CARL) of False Data Injection detection: forgetting and explainability","date":"2024-11-15","arxiv_id":"2411.10367","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-path-finding-for-timed-tasks","title":"Multi-agent Path Finding for Timed Tasks using Evolutionary Games","date":"2024-11-15","arxiv_id":"2411.10558","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-surprising-ineffectiveness-of-pre-trained","title":"The Surprising Ineffectiveness of Pre-Trained Visual Representations for Model-Based Reinforcement Learning","date":"2024-11-15","arxiv_id":"2411.10175","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-sample-efficiency-and-generalization","title":"Towards Sample-Efficiency and Generalization of Transfer and Inverse Reinforcement Learning: A Comprehensive Literature Review","date":"2024-11-15","arxiv_id":"2411.10268","repositories_listed":0,"syntology":null},{"url":null,"slug":"rationality-based-innate-values-driven","title":"Innate-Values-driven Reinforcement Learning based Cognitive Modeling","date":"2024-11-14","arxiv_id":"2411.09160","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-bootstrap-or-to-rollout-an-optimal-and","title":"To bootstrap or to rollout? An optimal and adaptive interpolation","date":"2024-11-14","arxiv_id":"2411.09731","repositories_listed":0,"syntology":null},{"url":null,"slug":"llmstinger-jailbreaking-llms-using-rl-fine","title":"LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs","date":"2024-11-13","arxiv_id":"2411.08862","repositories_listed":0,"syntology":null},{"url":null,"slug":"rlinspect-an-interactive-visual-approach-to","title":"RLInspect: An Interactive Visual Approach to Assess Reinforcement Learning Algorithm","date":"2024-11-13","arxiv_id":"2411.08392","repositories_listed":0,"syntology":null},{"url":null,"slug":"robot-see-robot-do-imitation-reward-for-noisy","title":"Robot See, Robot Do: Imitation Reward for Noisy Financial Environments","date":"2024-11-13","arxiv_id":"2411.08637","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-practical-deep-schedulers-for","title":"Towards Practical Deep Schedulers for Allocating Cellular Radio Resources","date":"2024-11-13","arxiv_id":"2411.08529","repositories_listed":0,"syntology":null},{"url":null,"slug":"navigation-with-qphil-quantizing-planner-for","title":"Navigation with QPHIL: Quantizing Planner for Hierarchical Implicit Q-Learning","date":"2024-11-12","arxiv_id":"2411.07760","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-the-curse-of-dimensionality-in-1","title":"Overcoming the Curse of Dimensionality in Reinforcement Learning Through Approximate Factorization","date":"2024-11-12","arxiv_id":"2411.07591","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-framework-for-1","title":"Reinforcement Learning Framework for Quantitative Trading","date":"2024-11-12","arxiv_id":"2411.07585","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-offline-reinforcement-learning-for-non","title":"Robust Offline Reinforcement Learning for Non-Markovian Decision Processes","date":"2024-11-12","arxiv_id":"2411.07514","repositories_listed":0,"syntology":null},{"url":null,"slug":"test-where-decisions-matter-importance-driven","title":"Test Where Decisions Matter: Importance-driven Testing for Deep Reinforcement Learning","date":"2024-11-12","arxiv_id":"2411.07700","repositories_listed":0,"syntology":null},{"url":null,"slug":"quadwbg-generalizable-quadrupedal-whole-body","title":"QuadWBG: Generalizable Quadrupedal Whole-Body Grasping","date":"2024-11-11","arxiv_id":"2411.06782","repositories_listed":0,"syntology":null},{"url":null,"slug":"crops-a-deployable-crop-management-system","title":"CROPS: A Deployable Crop Management System Over All Possible State Availabilities","date":"2024-11-09","arxiv_id":"2411.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-cooperative-strategies-for-multi","title":"Emergent Cooperative Strategies for Multi-Agent Shepherding via Reinforcement Learning","date":"2024-11-08","arxiv_id":"2411.05454","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-grained-reward-optimization-for-machine","title":"Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings","date":"2024-11-08","arxiv_id":"2411.05986","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-multi-domain-task-oriented-dialogue","title":"Improving Multi-Domain Task-Oriented Dialogue System with Offline Reinforcement Learning","date":"2024-11-08","arxiv_id":"2411.05340","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-automatic","title":"A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model","date":"2024-11-07","arxiv_id":"2411.04942","repositories_listed":0,"syntology":null},{"url":null,"slug":"evaluating-robustness-of-reinforcement","title":"Evaluating Robustness of Reinforcement Learning Algorithms for Autonomous Shipping","date":"2024-11-07","arxiv_id":"2411.04915","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-dialogue-agents-via-reinforcement","title":"Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations","date":"2024-11-07","arxiv_id":"2411.05194","repositories_listed":0,"syntology":null},{"url":null,"slug":"plasticity-loss-in-deep-reinforcement","title":"Plasticity Loss in Deep Reinforcement Learning: A Survey","date":"2024-11-07","arxiv_id":"2411.04832","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-sft-q-learning-for-language-models-via","title":"Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning","date":"2024-11-07","arxiv_id":"2411.05193","repositories_listed":0,"syntology":null},{"url":null,"slug":"sharp-analysis-for-kl-regularized-contextual","title":"Sharp Analysis for KL-Regularized Contextual Bandits and RLHF","date":"2024-11-07","arxiv_id":"2411.04625","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-study-of-deep-reinforcement-2","title":"A Comparative Study of Deep Reinforcement Learning for Crop Production Management","date":"2024-11-06","arxiv_id":"2411.04106","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-equivariance-in-reinforcement","title":"Approximate Equivariance in Reinforcement Learning","date":"2024-11-06","arxiv_id":"2411.04225","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-and-efficient-data-driven","title":"Interpretable and Efficient Data-driven Discovery and Control of Distributed Systems","date":"2024-11-06","arxiv_id":"2411.04098","repositories_listed":0,"syntology":null},{"url":null,"slug":"opportunities-of-reinforcement-learning-in","title":"Opportunities of Reinforcement Learning in South Africa's Just Transition","date":"2024-11-06","arxiv_id":"2411.15145","repositories_listed":0,"syntology":null},{"url":null,"slug":"embedding-safety-into-rl-a-new-take-on-trust","title":"Embedding Safety into RL: A New Take on Trust Region Methods","date":"2024-11-05","arxiv_id":"2411.02957","repositories_listed":0,"syntology":null},{"url":null,"slug":"pre-trained-visual-dynamics-representations","title":"Pre-trained Visual Dynamics Representations for Efficient Policy Learning","date":"2024-11-05","arxiv_id":"2411.03169","repositories_listed":0,"syntology":null},{"url":null,"slug":"transformer-based-fault-tolerant-control-for","title":"Transformer-Based Fault-Tolerant Control for Fixed-Wing UAVs Using Knowledge Distillation and In-Context Adaptation","date":"2024-11-05","arxiv_id":"2411.02975","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-to-localize-a-risk-constrained","title":"When to Localize? A Risk-Constrained Reinforcement Learning Approach","date":"2024-11-05","arxiv_id":"2411.02788","repositories_listed":0,"syntology":null},{"url":null,"slug":"n-gram-induction-heads-for-in-context-rl","title":"N-Gram Induction Heads for In-Context RL: Improving Stability and Reducing Data Needs","date":"2024-11-04","arxiv_id":"2411.01958","repositories_listed":0,"syntology":null},{"url":null,"slug":"show-don-t-tell-learning-reward-machines-from","title":"Show, Don't Tell: Learning Reward Machines from Demonstrations for Reinforcement Learning-Based Cardiac Pacemaker Synthesis","date":"2024-11-04","arxiv_id":"2411.01750","repositories_listed":0,"syntology":null},{"url":null,"slug":"so-you-think-you-can-scale-up-autonomous","title":"So You Think You Can Scale Up Autonomous Robot Data Collection?","date":"2024-11-04","arxiv_id":"2411.01813","repositories_listed":0,"syntology":null},{"url":null,"slug":"diversity-progress-for-goal-selection-in","title":"Diversity Progress for Goal Selection in Discriminability-Motivated RL","date":"2024-11-03","arxiv_id":"2411.01521","repositories_listed":0,"syntology":null},{"url":null,"slug":"gitsr-graph-interaction-transformer-based","title":"GITSR: Graph Interaction Transformer-based Scene Representation for Multi Vehicle Collaborative Decision-making","date":"2024-11-03","arxiv_id":"2411.01608","repositories_listed":0,"syntology":null},{"url":null,"slug":"hedging-and-pricing-structured-products","title":"Hedging and Pricing Structured Products Featuring Multiple Underlying Assets","date":"2024-11-02","arxiv_id":"2411.01121","repositories_listed":0,"syntology":null},{"url":null,"slug":"prompt-tuning-with-diffusion-for-few-shot-pre","title":"Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization","date":"2024-11-02","arxiv_id":"2411.01168","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-reinforcement-learning-in","title":"A Review of Reinforcement Learning in Financial Applications","date":"2024-11-01","arxiv_id":"2411.12746","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-based-traffic-analysis-in-digital-twin","title":"AI-based traffic analysis in digital twin networks","date":"2024-11-01","arxiv_id":"2411.00681","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-ml-model-versioning-in-edge","title":"Effective ML Model Versioning in Edge Networks","date":"2024-11-01","arxiv_id":"2411.01078","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistical-guarantees-for-lifelong","title":"Statistical Guarantees for Lifelong Reinforcement Learning using PAC-Bayes Theory","date":"2024-11-01","arxiv_id":"2411.00401","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-building-secure-uav-navigation-with","title":"Towards Building Secure UAV Navigation with FHE-aware Knowledge Distillation","date":"2024-11-01","arxiv_id":"2411.00403","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-exploration-via-stationary","title":"Deterministic Exploration via Stationary Bellman Error Maximization","date":"2024-10-31","arxiv_id":"2410.23840","repositories_listed":0,"syntology":null},{"url":null,"slug":"earl-bo-reinforcement-learning-for-multi-step","title":"EARL-BO: Reinforcement Learning for Multi-Step Lookahead, High-Dimensional Bayesian Optimization","date":"2024-10-31","arxiv_id":"2411.00171","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-alignment-via-asymmetric-self-play","title":"Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play","date":"2024-10-31","arxiv_id":"2411.00062","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-linearity-the-key-for-no-regret","title":"Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs","date":"2024-10-31","arxiv_id":"2410.24071","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-entropy-hindsight-experience-replay","title":"Maximum Entropy Hindsight Experience Replay","date":"2024-10-31","arxiv_id":"2410.24016","repositories_listed":0,"syntology":null},{"url":null,"slug":"noise-as-a-double-edged-sword-reinforcement","title":"Noise as a Double-Edged Sword: Reinforcement Learning Exploits Randomized Defenses in Neural Networks","date":"2024-10-31","arxiv_id":"2410.23870","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-reinforcement-learning-and-sequence","title":"Offline Reinforcement Learning and Sequence Modeling for Downlink Link Adaptation","date":"2024-10-30","arxiv_id":"2410.23031","repositories_listed":0,"syntology":null},{"url":null,"slug":"resource-governance-in-networked-systems-via","title":"Resource Governance in Networked Systems via Integrated Variational Autoencoders and Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.23393","repositories_listed":0,"syntology":null},{"url":null,"slug":"return-augmented-decision-transformer-for-off","title":"Return Augmented Decision Transformer for Off-Dynamics Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.23450","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-driving-car-racing-application-of-deep","title":"Self-Driving Car Racing: Application of Deep Reinforcement Learning","date":"2024-10-30","arxiv_id":"2410.22766","repositories_listed":0,"syntology":null},{"url":null,"slug":"softctrl-soft-conservative-kl-control-of","title":"SoftCTRL: Soft conservative KL-control of Transformer Reinforcement Learning for Autonomous Driving","date":"2024-10-30","arxiv_id":"2410.22752","repositories_listed":0,"syntology":null},{"url":null,"slug":"stepping-out-of-the-shadows-reinforcement","title":"Stepping Out of the Shadows: Reinforcement Learning in Shadow Mode","date":"2024-10-30","arxiv_id":"2410.23419","repositories_listed":0,"syntology":null},{"url":null,"slug":"precise-and-dexterous-robotic-manipulation","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning","date":"2024-10-29","arxiv_id":"2410.21845","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multi-agent-reinforcement-learning-testbed","title":"A Multi-Agent Reinforcement Learning Testbed for Cognitive Radio Applications","date":"2024-10-28","arxiv_id":"2410.21521","repositories_listed":0,"syntology":null},{"url":null,"slug":"bilevel-model-for-electricity-market","title":"Bilevel Model for Electricity Market Mechanism Optimisation via Quantum Computing Enhanced Reinforcement Learning","date":"2024-10-28","arxiv_id":"2410.20968","repositories_listed":0,"syntology":null},{"url":null,"slug":"getting-by-goal-misgeneralization-with-a","title":"Getting By Goal Misgeneralization With a Little Help From a Mentor","date":"2024-10-28","arxiv_id":"2410.21052","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-limits-of-transfer-reinforcement-learning","title":"The Limits of Transfer Reinforcement Learning with Latent Low-rank Structure","date":"2024-10-28","arxiv_id":"2410.21601","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-simple-sum-of-delayed-rewards-non","title":"Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning","date":"2024-10-26","arxiv_id":"2410.20176","repositories_listed":0,"syntology":null},{"url":null,"slug":"gflownet-fine-tuning-for-diverse-correct","title":"GFlowNet Fine-tuning for Diverse Correct Solutions in Mathematical Reasoning Tasks","date":"2024-10-26","arxiv_id":"2410.20147","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-selection-for-initiating-human","title":"Off-Policy Selection for Initiating Human-Centric Experimental Design","date":"2024-10-26","arxiv_id":"2410.20017","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-environment-design-via-regret","title":"Adversarial Environment Design via Regret-Guided Diffusion Models","date":"2024-10-25","arxiv_id":"2410.19715","repositories_listed":0,"syntology":null},{"url":null,"slug":"humanizing-the-machine-proxy-attacks-to","title":"Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors","date":"2024-10-25","arxiv_id":"2410.19230","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-robot-reinforcement-learning-with-goal","title":"On-Robot Reinforcement Learning with Goal-Contrastive Rewards","date":"2024-10-25","arxiv_id":"2410.19989","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-adaptive-average-reward","title":"Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces","date":"2024-10-25","arxiv_id":"2410.19919","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-aligning-large","title":"Reinforcement Learning for Aligning Large Language Models Agents with Interactive Environments: Quantifying and Mitigating Prompt Overfitting","date":"2024-10-25","arxiv_id":"2410.19920","repositories_listed":0,"syntology":null},{"url":null,"slug":"sad-state-action-distillation-for-in-context","title":"Random Policy Enables In-Context Reinforcement Learning within Trust Horizons","date":"2024-10-25","arxiv_id":"2410.19982","repositories_listed":0,"syntology":null}],"record_sha256":"f42ff0ea136cc08fc5c83743f0c43a300d477eb24baa4080d6cc8b54bf236d4e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}