{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/67","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":67,"pages_in_order":132,"rows_per_page":100,"rows":[6601,6700],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/66","next":"/task/reinforcement-learning/papers/68","papers":[{"url":null,"slug":"robot-path-planning-using-deep-reinforcement","title":"Robot path planning using deep reinforcement learning","date":"2023-02-17","arxiv_id":"2302.09120","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-computing-provides-exponential-regret","title":"Quantum Computing Provides Exponential Regret Improvement in Episodic Reinforcement Learning","date":"2023-02-16","arxiv_id":"2302.08617","repositories_listed":0,"syntology":null},{"url":null,"slug":"ceril-continuous-event-based-reinforcement","title":"CERiL: Continuous Event-based Reinforcement Learning","date":"2023-02-15","arxiv_id":"2302.07667","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-offline-reinforcement-learning-for-real","title":"Deep Offline Reinforcement Learning for Real-world Treatment Optimization Applications","date":"2023-02-15","arxiv_id":"2302.07549","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-via-exploratory","title":"Meta-Reinforcement Learning via Exploratory Task Clustering","date":"2023-02-15","arxiv_id":"2302.07958","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-multi-agent-reinforcement-learning-4","title":"Scalable Multi-Agent Reinforcement Learning with General Utilities","date":"2023-02-15","arxiv_id":"2302.07938","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-risk-or-not-to-risk-learning-with-risk","title":"To Risk or Not to Risk: Learning with Risk Quantification for IoT Task Offloading in UAVs","date":"2023-02-14","arxiv_id":"2302.07399","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-lifetime-extended-energy-management","title":"A Lifetime Extended Energy Management Strategy for Fuel Cell Hybrid Electric Vehicles via Self-Learning Fuzzy Reinforcement Learning","date":"2023-02-13","arxiv_id":"2302.06236","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-safe-reinforcement-learning-with","title":"Provably Safe Reinforcement Learning with Step-wise Violation Constraints","date":"2023-02-13","arxiv_id":"2302.06064","repositories_listed":0,"syntology":null},{"url":null,"slug":"maneuver-decision-making-for-autonomous-air","title":"Maneuver Decision-Making For Autonomous Air Combat Through Curriculum Learning And Reinforcement Learning With Sparse Rewards","date":"2023-02-12","arxiv_id":"2302.05838","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-causal-reinforcement-learning","title":"A Survey on Causal Reinforcement Learning","date":"2023-02-10","arxiv_id":"2302.05209","repositories_listed":0,"syntology":null},{"url":null,"slug":"low-entropy-communication-in-multi-agent","title":"Low Entropy Communication in Multi-Agent Reinforcement Learning","date":"2023-02-10","arxiv_id":"2302.05055","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-minimax-optimality-of-model-based","title":"Towards Minimax Optimality of Model-based Robust Reinforcement Learning","date":"2023-02-10","arxiv_id":"2302.05372","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-investigation-into-pre-training-object","title":"An Investigation into Pre-Training Object-Centric Representations for Reinforcement Learning","date":"2023-02-09","arxiv_id":"2302.04419","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-quality-aware-mixed-precision","title":"Data Quality-aware Mixed-precision Quantization via Hybrid Reinforcement Learning","date":"2023-02-09","arxiv_id":"2302.04453","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-scale-independent-multi-objective","title":"A Scale-Independent Multi-Objective Reinforcement Learning with Convergence Analysis","date":"2023-02-08","arxiv_id":"2302.04179","repositories_listed":0,"syntology":null},{"url":null,"slug":"aisyn-ai-driven-reinforcement-learning-based","title":"AISYN: AI-driven Reinforcement Learning-Based Logic Synthesis Framework","date":"2023-02-08","arxiv_id":"2302.06415","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-planning-in-combinatorial-action","title":"Efficient Planning in Combinatorial Action Spaces with Applications to Cooperative Multi-Agent Reinforcement Learning","date":"2023-02-08","arxiv_id":"2302.04376","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-adversarial-reinforcement","title":"Near-Optimal Adversarial Reinforcement Learning with Switching Costs","date":"2023-02-08","arxiv_id":"2302.04374","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-aggregation-for-safety-critical","title":"Adaptive Aggregation for Safety-Critical Control","date":"2023-02-07","arxiv_id":"2302.03586","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-minimax-optimal-risk-sensitive","title":"Near-Minimax-Optimal Risk-Sensitive Reinforcement Learning with CVaR","date":"2023-02-07","arxiv_id":"2302.03201","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-with-uncertain","title":"Online Reinforcement Learning with Uncertain Episode Lengths","date":"2023-02-07","arxiv_id":"2302.03608","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-skilled-population-curriculum-for","title":"Towards Skilled Population Curriculum for Multi-Agent Reinforcement Learning","date":"2023-02-07","arxiv_id":"2302.03429","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-for-process-design-with","title":"Transfer learning for process design with reinforcement learning","date":"2023-02-07","arxiv_id":"2302.03375","repositories_listed":0,"syntology":null},{"url":null,"slug":"arena-web-a-web-based-development-and","title":"Arena-Web -- A Web-based Development and Benchmarking Platform for Autonomous Navigation Approaches","date":"2023-02-06","arxiv_id":"2302.02898","repositories_listed":0,"syntology":null},{"url":null,"slug":"ditto-offline-imitation-learning-with-world","title":"DITTO: Offline Imitation Learning with World Models","date":"2023-02-06","arxiv_id":"2302.03086","repositories_listed":0,"syntology":null},{"url":null,"slug":"holistic-deep-reinforcement-learning-based","title":"Holistic Deep-Reinforcement-Learning-based Training of Autonomous Navigation Systems","date":"2023-02-06","arxiv_id":"2302.02921","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-wise-safe-reinforcement-learning-a","title":"State-wise Safe Reinforcement Learning: A Survey","date":"2023-02-06","arxiv_id":"2302.03122","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-online-model-following-projection","title":"An Online Model-Following Projection Mechanism Using Reinforcement Learning","date":"2023-02-05","arxiv_id":"2302.02493","repositories_listed":0,"syntology":null},{"url":null,"slug":"open-problems-and-modern-solutions-for-deep","title":"Open Problems and Modern Solutions for Deep Reinforcement Learning","date":"2023-02-05","arxiv_id":"2302.02298","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-of-deep-reinforcement-learning","title":"Generalization of Deep Reinforcement Learning for Jammer-Resilient Frequency and Power Allocation","date":"2023-02-04","arxiv_id":"2302.02250","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-learning-with-unsupervised-skill","title":"Developing Driving Strategies Efficiently: A Skill-Based Hierarchical Reinforcement Learning Approach","date":"2023-02-04","arxiv_id":"2302.02179","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-low-rank-mdps-with","title":"Reinforcement Learning in Low-Rank MDPs with Density Features","date":"2023-02-04","arxiv_id":"2302.02252","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-history-dependent","title":"Reinforcement Learning with History-Dependent Dynamic Contexts","date":"2023-02-04","arxiv_id":"2302.02061","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-user-retention-in-a-billion-scale","title":"Reinforcing User Retention in a Billion Scale Short Video Recommender System","date":"2023-02-03","arxiv_id":"2302.01724","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-bounds-for-policy-based-average","title":"Performance Bounds for Policy-Based Average Reward Reinforcement Learning Algorithms","date":"2023-02-02","arxiv_id":"2302.01450","repositories_listed":0,"syntology":null},{"url":null,"slug":"reload-reinforcement-learning-with-optimistic","title":"ReLOAD: Reinforcement Learning with Optimistic Ascent-Descent for Last-Iterate Convergence in Constrained MDPs","date":"2023-02-02","arxiv_id":"2302.01275","repositories_listed":0,"syntology":null},{"url":null,"slug":"bridging-physics-informed-neural-networks","title":"Bridging Physics-Informed Neural Networks with Reinforcement Learning: Hamilton-Jacobi-Bellman Proximal Policy Optimization (HJBPPO)","date":"2023-02-01","arxiv_id":"2302.00237","repositories_listed":0,"syntology":null},{"url":"/paper/collaborating-with-language-models-for","slug":"collaborating-with-language-models-for","title":"Collaborating with language models for embodied reasoning","date":"2023-02-01","arxiv_id":"2302.00763","repositories_listed":0,"syntology":{"n":2,"n_ran":2,"n_constructed":0,"n_ran_checked":2,"n_instrument":0,"n_unverified":0,"n_honours":0,"n_violates":0,"n_no_contract":2,"n_pointer_only":0,"phrase":"2 ran (of which 0 constructed an object rather than computing a result; 2 with no instrument failure: 0 honoured, 0 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/collaborating-with-language-models-for#ran","syntology_url":"https://syntology.ai/paper/2302.00763","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2302.00763"}},"official":null}},{"url":null,"slug":"combining-tree-search-generative-models-and","title":"Combining Deep Reinforcement Learning and Search with Generative Models for Game-Theoretic Opponent Modeling","date":"2023-02-01","arxiv_id":"2302.00797","repositories_listed":0,"syntology":null},{"url":"/paper/efficient-multi-task-reinforcement-learning","slug":"efficient-multi-task-reinforcement-learning","title":"QMP: Q-switch Mixture of Policies for Multi-Task Behavior Sharing","date":"2023-02-01","arxiv_id":"2302.00671","repositories_listed":0,"syntology":{"n":4,"n_ran":4,"n_constructed":0,"n_ran_checked":4,"n_instrument":0,"n_unverified":0,"n_honours":1,"n_violates":1,"n_no_contract":2,"n_pointer_only":0,"phrase":"4 ran (of which 0 constructed an object rather than computing a result; 4 with no instrument failure: 1 honoured, 1 violated, 2 with no contract checked; 0 where Syntology's instrument failed) · 0 unverified","sample_list":"/paper/efficient-multi-task-reinforcement-learning#ran","syntology_url":"https://syntology.ai/paper/2302.00671","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2302.00671"}},"official":null}},{"url":null,"slug":"multi-zone-hvac-control-with-model-based-deep","title":"Multi-zone HVAC Control with Model-Based Deep Reinforcement Learning","date":"2023-02-01","arxiv_id":"2302.00725","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-fitted-q-evaluation-and-iteration","title":"Robust Fitted-Q-Evaluation and Iteration under Sequentially Exogenous Unobserved Confounders","date":"2023-02-01","arxiv_id":"2302.00662","repositories_listed":0,"syntology":null},{"url":null,"slug":"enabling-surrogate-assisted-evolutionary","title":"Enabling surrogate-assisted evolutionary reinforcement learning via policy embedding","date":"2023-01-31","arxiv_id":"2301.13374","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-grid-aware-dynamic-matching-using","title":"Scalable Grid-Aware Dynamic Matching using Deep Reinforcement Learning","date":"2023-01-31","arxiv_id":"2301.13796","repositories_listed":0,"syntology":null},{"url":null,"slug":"scaling-laws-for-single-agent-reinforcement","title":"Scaling laws for single-agent reinforcement learning","date":"2023-01-31","arxiv_id":"2301.13442","repositories_listed":0,"syntology":null},{"url":null,"slug":"scheduling-inference-workloads-on-distributed","title":"Scheduling Inference Workloads on Distributed Edge Clusters with Reinforcement Learning","date":"2023-01-31","arxiv_id":"2301.13618","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-programmatic-reinforcement","title":"Hierarchical Programmatic Reinforcement Learning via Learning to Compose Programs","date":"2023-01-30","arxiv_id":"2301.12950","repositories_listed":0,"syntology":null},{"url":null,"slug":"singularity-aware-reinforcement-learning","title":"STEEL: Singularity-aware Reinforcement Learning","date":"2023-01-30","arxiv_id":"2301.13152","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-multiple-policies-to-hotstart","title":"Transferring Multiple Policies to Hotstart Reinforcement Learning in an Air Compressor Management Problem","date":"2023-01-30","arxiv_id":"2301.12820","repositories_listed":0,"syntology":null},{"url":null,"slug":"v2n-service-scaling-with-deep-reinforcement","title":"V2N Service Scaling with Deep Reinforcement Learning","date":"2023-01-30","arxiv_id":"2301.13324","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-framework-for-7","title":"A Deep Reinforcement Learning Framework for Optimizing Congestion Control in Data Centers","date":"2023-01-29","arxiv_id":"2301.12558","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-deep-reinforcement-learning-3","title":"Sample Efficient Deep Reinforcement Learning via Local Planning","date":"2023-01-29","arxiv_id":"2301.12579","repositories_listed":0,"syntology":null},{"url":null,"slug":"steering-stein-information-directed","title":"STEERING: Stein Information Directed Exploration for Model-Based Reinforcement Learning","date":"2023-01-28","arxiv_id":"2301.12038","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-rubik-s-cube-with-n-tuple","title":"Towards Learning Rubik's Cube with N-tuple-based Reinforcement Learning","date":"2023-01-28","arxiv_id":"2301.12167","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-deep-reinforcement-learning-for","title":"Exploring Deep Reinforcement Learning for Holistic Smart Building Control","date":"2023-01-27","arxiv_id":"2301.11510","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-munchausen-reinforcement-learning","title":"Generalized Munchausen Reinforcement Learning using Tsallis KL Divergence","date":"2023-01-27","arxiv_id":"2301.11476","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-from-diverse-human","title":"Reinforcement Learning from Diverse Human Preferences","date":"2023-01-27","arxiv_id":"2301.11774","repositories_listed":0,"syntology":null},{"url":null,"slug":"single-trajectory-distributionally-robust","title":"Single-Trajectory Distributionally Robust Reinforcement Learning","date":"2023-01-27","arxiv_id":"2301.11721","repositories_listed":0,"syntology":null},{"url":null,"slug":"snerl-semantic-aware-neural-radiance-fields","title":"SNeRL: Semantic-aware Neural Radiance Fields for Reinforcement Learning","date":"2023-01-27","arxiv_id":"2301.11520","repositories_listed":0,"syntology":null},{"url":null,"slug":"fedhql-federated-heterogeneous-q-learning","title":"FedHQL: Federated Heterogeneous Q-Learning","date":"2023-01-26","arxiv_id":"2301.11135","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-offline-reinforcement-learning-1","title":"Model-based Offline Reinforcement Learning with Local Misspecification","date":"2023-01-26","arxiv_id":"2301.11426","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-robustness","title":"Certifiably Robust Reinforcement Learning through Model-Based Abstract Interpretation","date":"2023-01-26","arxiv_id":"2301.11374","repositories_listed":0,"syntology":null},{"url":null,"slug":"principled-reinforcement-learning-with-human","title":"Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons","date":"2023-01-26","arxiv_id":"2301.11270","repositories_listed":0,"syntology":null},{"url":null,"slug":"asq-it-interactive-explanations-for","title":"ASQ-IT: Interactive Explanations for Reinforcement-Learning Agents","date":"2023-01-24","arxiv_id":"2301.09941","repositories_listed":0,"syntology":null},{"url":null,"slug":"autocost-evolving-intrinsic-cost-for-zero","title":"AutoCost: Evolving Intrinsic Cost for Zero-violation Reinforcement Learning","date":"2023-01-24","arxiv_id":"2301.10339","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-deep-reinforcement-learning-state","title":"Explainable Deep Reinforcement Learning: State of the Art and Challenges","date":"2023-01-24","arxiv_id":"2301.09937","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-motivation-in-model-based","title":"Intrinsic Motivation in Model-based Reinforcement Learning: A Brief Review","date":"2023-01-24","arxiv_id":"2301.10067","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimal-value-equivalent-partial-models-for","title":"Minimal Value-Equivalent Partial Models for Scalable and Robust Planning in Lifelong Reinforcement Learning","date":"2023-01-24","arxiv_id":"2301.10119","repositories_listed":0,"syntology":null},{"url":null,"slug":"story-shaping-teaching-agents-human-like","title":"Story Shaping: Teaching Agents Human-like Behavior with Stories","date":"2023-01-24","arxiv_id":"2301.10107","repositories_listed":0,"syntology":null},{"url":null,"slug":"quasi-optimal-learning-with-continuous","title":"Quasi-optimal Reinforcement Learning with Continuous Actions","date":"2023-01-21","arxiv_id":"2301.08940","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-deep-double-duelling-q-learning","title":"Asynchronous Deep Double Duelling Q-Learning for Trading-Signal Execution in Limit Order Book Markets","date":"2023-01-20","arxiv_id":"2301.08688","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-efficient-task-offloading-for-semantic","title":"Resource Optimization for Semantic-Aware Networks with Task Offloading","date":"2023-01-20","arxiv_id":"2301.08376","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-slate-recommendation-with","title":"Generative Slate Recommendation with Reinforcement Learning","date":"2023-01-20","arxiv_id":"2301.08632","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-reinforcement-learning-with-graph-2","title":"Multi-agent Reinforcement Learning with Graph Q-Networks for Antenna Tuning","date":"2023-01-20","arxiv_id":"2302.01199","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-estimation-for","title":"Reinforcement learning-based estimation for partial differential equations","date":"2023-01-20","arxiv_id":"2302.01189","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-estimation-bias-in-policy","title":"Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning","date":"2023-01-20","arxiv_id":"2301.08442","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-meta-reinforcement-learning","title":"A Survey of Meta-Reinforcement Learning","date":"2023-01-19","arxiv_id":"2301.08028","repositories_listed":0,"syntology":null},{"url":null,"slug":"advanced-scaling-methods-for-vnf-deployment","title":"Advanced Scaling Methods for VNF deployment with Reinforcement Learning","date":"2023-01-19","arxiv_id":"2301.08325","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-timescale-adaptation-in-an-open-ended","title":"Human-Timescale Adaptation in an Open-Ended Task Space","date":"2023-01-18","arxiv_id":"2301.07608","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-compartment-neuron-and-population","title":"Multi-compartment Neuron and Population Encoding Powered Spiking Neural Network for Deep Distributional Reinforcement Learning","date":"2023-01-18","arxiv_id":"2301.07275","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-robust-deep-reinforcement","title":"Adversarial Robust Deep Reinforcement Learning Requires Redefining Robustness","date":"2023-01-17","arxiv_id":"2301.07487","repositories_listed":0,"syntology":null},{"url":null,"slug":"dqnas-neural-architecture-search-using","title":"DQNAS: Neural Architecture Search using Reinforcement Learning","date":"2023-01-17","arxiv_id":"2301.06687","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-world-models-for-adapting-to","title":"Neuro-Symbolic World Models for Adapting to Open World Novelty","date":"2023-01-16","arxiv_id":"2301.06294","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-symbolic-meta-reinforcement-learning","title":"Neuro-symbolic Meta Reinforcement Learning for Trading","date":"2023-01-15","arxiv_id":"2302.08996","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-averse-reinforcement-learning-via","title":"Risk-Averse Reinforcement Learning via Dynamic Time-Consistent Risk Measures","date":"2023-01-14","arxiv_id":"2301.05981","repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-training-of-quantum","title":"Asynchronous training of quantum reinforcement learning","date":"2023-01-12","arxiv_id":"2301.05096","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-analysis-of-quantile-temporal-difference","title":"An Analysis of Quantile Temporal-Difference Learning","date":"2023-01-11","arxiv_id":"2301.04462","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-preference-based-reinforcement","title":"Efficient Preference-Based Reinforcement Learning Using Learned Dynamics Models","date":"2023-01-11","arxiv_id":"2301.04741","repositories_listed":0,"syntology":null},{"url":null,"slug":"sok-adversarial-machine-learning-attacks-and","title":"SoK: Adversarial Machine Learning Attacks and Defences in Multi-Agent Reinforcement Learning","date":"2023-01-11","arxiv_id":"2301.04299","repositories_listed":0,"syntology":null},{"url":null,"slug":"switchable-lightweight-anti-symmetric","title":"Switchable Lightweight Anti-symmetric Processing (SLAP) with CNN Outspeeds Data Augmentation by Smaller Sample -- Application in Gomoku Reinforcement Learning","date":"2023-01-11","arxiv_id":"2301.04746","repositories_listed":0,"syntology":null},{"url":null,"slug":"actor-director-critic-a-novel-deep","title":"Actor-Director-Critic: A Novel Deep Reinforcement Learning Framework","date":"2023-01-10","arxiv_id":"2301.03887","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-model-based-reinforcement-1","title":"Exploration in Model-based Reinforcement Learning with Randomized Reward","date":"2023-01-09","arxiv_id":"2301.03142","repositories_listed":0,"syntology":null},{"url":null,"slug":"network-slicing-via-transfer-learning-aided","title":"Network Slicing via Transfer Learning aided Distributed Deep Reinforcement Learning","date":"2023-01-09","arxiv_id":"2301.03262","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-enhanced-pichunter-for","title":"Reinforcement Learning Enhanced PicHunter for Interactive Search","date":"2023-01-09","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"tuning-path-tracking-controllers-for","title":"Tuning Path Tracking Controllers for Autonomous Cars Using Reinforcement Learning","date":"2023-01-09","arxiv_id":"2301.03363","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-transformers-in-reinforcement","title":"A Survey on Transformers in Reinforcement Learning","date":"2023-01-08","arxiv_id":"2301.03044","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-symbolic-representations-for","title":"Learning Symbolic Representations for Reinforcement Learning of Non-Markovian Behavior","date":"2023-01-08","arxiv_id":"2301.02952","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for-ris","title":"Hierarchical Reinforcement Learning for RIS-Assisted Energy-Efficient RAN","date":"2023-01-07","arxiv_id":"2301.02771","repositories_listed":0,"syntology":null},{"url":null,"slug":"laga-a-learning-adaptive-genetic-algorithm","title":"Mathematical Models and Reinforcement Learning based Evolutionary Algorithm Framework for Satellite Scheduling Problem","date":"2023-01-07","arxiv_id":"2301.02764","repositories_listed":0,"syntology":null}],"record_sha256":"b7dc58526d4be6dc7d590e6e5c146f7e77a4d88567c58bcec52a840e398ef7dd","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}