{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/111","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":111,"pages_in_order":152,"rows_per_page":100,"rows":[11001,11100],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/110","next":"/task/reinforcement-learning-1/papers/112","papers":[{"url":null,"slug":"learning-to-dynamically-select-between-reward","title":"Learning to Dynamically Select Between Reward Shaping Signals","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-explore-with-pleasure","title":"Learning to Explore with Pleasure","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-observe-with-reinforcement","title":"Learning to Observe with Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-with-informed","title":"Meta-Reinforcement Learning With Informed Policy Regularization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"monte-carlo-planning-and-learning-with","title":"Monte-Carlo Planning and Learning with Language Action Value Estimates","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mqes-max-q-entropy-search-for-efficient","title":"MQES: Max-Q Entropy Search for Efficient Exploration in Continuous Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-policy-optimization-with-variance","title":"Offline Policy Optimization with Variance Regularization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-trade-offs-of-image-prediction-in-visual","title":"On Trade-offs of Image Prediction in Visual Model-Based Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-exploration-with-backward","title":"Optimistic Exploration with Backward Bootstrapped Bonus for Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-policy-optimization-with-general","title":"Optimistic Policy Optimization with General Function Approximations","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-information-bottleneck-in","title":"Optimizing Information Bottleneck in Reinforcement Learning: A Stein Variational Approach","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-bayesian-randomized-value-function-with","title":"PAC-Bayesian Randomized Value Function with Informative Prior","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"partial-off-policy-learning-balance-accuracy","title":"Partial Off-Policy Learning: Balance Accuracy and Diversity for Human-Oriented Image Captioning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"peril-probabilistic-embeddings-for-hybrid","title":"PERIL: Probabilistic Embeddings for hybrid Meta-Reinforcement and Imitation Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"plan-based-asymptotically-equivalent-reward","title":"Plan-Based Asymptotically Equivalent Reward Shaping","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-atari-with-capsule-networks-a","title":"Playing Atari with Capsule Networks: A systematic comparison of CNN and CapsNets-based agents.","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"pods-policy-optimization-via-differentiable","title":"PODS: Policy Optimization via Differentiable Simulation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"practical-marginalized-importance-sampling","title":"Practical Marginalized Importance Sampling with the Successor Representation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"prior-preference-learning-from-experts","title":"Prior Preference Learning From Experts: Designing A Reward with Active Inference","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-rich-observation-reinforcement","title":"Provable Rich Observation Reinforcement Learning with Combinatorial Latent States","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"r-latte-attention-module-for-visual-control","title":"R-LAtte: Attention Module for Visual Control via Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"re-examining-routing-networks-for-multi-task","title":"Re-examining Routing Networks for Multi-task Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reconnaissance-for-reinforcement-learning","title":"RECONNAISSANCE FOR REINFORCEMENT LEARNING WITH SAFETY CONSTRAINTS","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"regioned-episodic-reinforcement-learning","title":"Regioned Episodic Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-asymmetrical-dnn","title":"Reinforcement Learning Based Asymmetrical DNN Modularization for Optimal Loading","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-control-with","title":"Reinforcement Learning for Control with Probabilistic Stability Guarantee","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-bayesian","title":"Reinforcement Learning with Bayesian Classifiers: Efficient Skill Learning from Outcome Examples","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-balancing-offline-model-based","title":"Representation Balancing Offline Model-based Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rmix-risk-sensitive-multi-agent-reinforcement","title":"RMIX: Risk-Sensitive Multi-Agent Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-imitation-via-decision-time-planning","title":"Robust Imitation via Decision-Time Planning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multi-agent-reinforcement-learning","title":"Robust Multi-Agent Reinforcement Learning Driven by Correlated Equilibrium","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-offline-reinforcement-learning-from","title":"Robust Offline Reinforcement Learning from Low-Quality Data","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-quality-diversity-for-neural","title":"Sample efficient Quality Diversity for neural continuous control","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-bayesian-inverse-reinforcement","title":"Scalable Bayesian Inverse Reinforcement Learning by Auto-Encoding Reward","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"schedulenet-learn-to-solve-minmax-mtsp-using","title":"ScheduleNet: Learn to Solve MinMax mTSP Using Reinforcement Learning with Delayed Reward","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-continuous-control-without","title":"Self-Supervised Continuous Control without Policy Gradient","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simple-augmentation-goes-a-long-way-adrl-for","title":"Simple Augmentation Goes a Long Way: ADRL for DNN Quantization","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"success-rate-targeted-reinforcement-learning","title":"Success-Rate Targeted Reinforcement Learning by Disorientation Penalty","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-skill-action-architecture-learning","title":"The Skill-Action Architecture: Learning Abstract Action Embeddings for Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiased-learning-with-state-conditioned","title":"Unbiased learning with State-Conditioned Rewards in Adversarial Imitation Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncertainty-weighted-offline-reinforcement","title":"Uncertainty Weighted Offline Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-and-leveraging-causal-relations","title":"Understanding and Leveraging Causal Relations in Deep Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-active-pre-training-for","title":"Unsupervised Active Pre-Training for Reinforcement Learning","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"updet-universal-multi-agent-rl-via-policy","title":"UPDeT: Universal Multi-agent RL via Policy Decoupling with Transformers","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-imitation-with-reinforcement-learning","title":"Visual Imitation with Reinforcement Learning using Recurrent Siamese Networks","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"weighted-bellman-backups-for-improved-signal","title":"Weighted Bellman Backups for Improved Signal-to-Noise in Q-Updates","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"what-are-the-statistical-limits-of-batch-rl","title":"What are the Statistical Limits of Batch RL with Linear Function Approximation?","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"what-matters-for-on-policy-deep-actor-critic","title":"What Matters for On-Policy Deep Actor-Critic Methods? A Large-Scale Study","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-generalizable-reinforcement-learning","title":"When Is Generalizable Reinforcement Learning Tractable?","date":"2021-01-01","arxiv_id":"2101.00300","repositories_listed":0,"syntology":null},{"url":null,"slug":"winning-the-l2rpn-challenge-power-grid","title":"Winning the L2RPN Challenge: Power Grid Management via Semi-Markov Afterstate Actor-Critic","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"asynchronous-advantage-actor-critic-non-1","title":"Towards Understanding Asynchronous Advantage Actor-critic: Convergence and Linear Speedup","date":"2020-12-31","arxiv_id":"2012.15511","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-maintenance-in-iot-networks-via","title":"Autonomous Maintenance in IoT Networks via AoI-driven Deep Reinforcement Learning","date":"2020-12-31","arxiv_id":"2012.15548","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-based-deep-reinforcement-learning","title":"Curriculum-based Deep Reinforcement Learning for Quantum Control","date":"2020-12-31","arxiv_id":"2012.15427","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-algorithm","title":"Model Free Reinforcement Learning Algorithm for Stationary Mean field Equilibrium for Multiple Types of Agents","date":"2020-12-31","arxiv_id":"2012.15377","repositories_listed":0,"syntology":null},{"url":null,"slug":"refine-and-imitate-reducing-repetition-and-1","title":"Refine and Imitate: Reducing Repetition and Inconsistency in Persuasion Dialogues via Reinforcement Learning and Human Demonstration","date":"2020-12-31","arxiv_id":"2012.15375","repositories_listed":0,"syntology":null},{"url":null,"slug":"relational-deep-reinforcement-learning-for","title":"Relational Deep Reinforcement Learning for Routing in Wireless Networks","date":"2020-12-31","arxiv_id":"2012.15700","repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-reliable-designs-of-data-driven","title":"Toward Reliable Designs of Data-Driven Reinforcement Learning Tracking Control for Euler-Lagrange Systems","date":"2020-12-31","arxiv_id":"2101.00068","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-pessimism-provably-efficient-for-offline","title":"Is Pessimism Provably Efficient for Offline RL?","date":"2020-12-30","arxiv_id":"2012.15085","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-user-scheduling-for-6g-a-fairness","title":"Fairness-Oriented User Scheduling for Bursty Downlink Transmission Using Multi-Agent Reinforcement Learning","date":"2020-12-30","arxiv_id":"2012.15081","repositories_listed":0,"syntology":null},{"url":null,"slug":"lispr-an-options-framework-for-policy-reuse","title":"LISPR: An Options Framework for Policy Reuse with Reinforcement Learning","date":"2020-12-29","arxiv_id":"2012.14942","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-multi-agent-actor-critic-learning","title":"Federated Multi-Agent Actor-Critic Learning for Age Sensitive Mobile Edge Computing","date":"2020-12-28","arxiv_id":"2012.14137","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-deep-rl-variance-constrained","title":"Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds Globally Optimal Policy","date":"2020-12-28","arxiv_id":"2012.14098","repositories_listed":0,"syntology":null},{"url":null,"slug":"portfolio-optimization-with-2d-relative","title":"Portfolio Optimization with 2D Relative-Attentional Gated Transformer","date":"2020-12-27","arxiv_id":"2101.03138","repositories_listed":0,"syntology":null},{"url":null,"slug":"achieving-real-time-lidar-3d-object-detection","title":"Achieving Real-Time LiDAR 3D Object Detection on a Mobile Device","date":"2020-12-26","arxiv_id":"2012.13801","repositories_listed":0,"syntology":null},{"url":null,"slug":"stability-certified-reinforcement-learning","title":"Stability-Certified Reinforcement Learning via Spectral Normalization","date":"2020-12-26","arxiv_id":"2012.13744","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-sample-efficient-episodic-control","title":"Towards sample-efficient episodic control with DAC-ML","date":"2020-12-26","arxiv_id":"2012.13779","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-continual-reinforcement-learning-a","title":"Towards Continual Reinforcement Learning: A Review and Perspectives","date":"2020-12-25","arxiv_id":"2012.13490","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-state-representation-dueling-network-for","title":"A State Representation Dueling Network for Deep Reinforcement Learning","date":"2020-12-24","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"assured-rl-reinforcement-learning-with-almost","title":"Assured RL: Reinforcement Learning with Almost Sure Constraints","date":"2020-12-24","arxiv_id":"2012.13036","repositories_listed":0,"syntology":null},{"url":null,"slug":"auto-agent-distiller-towards-efficient-deep","title":"Auto-Agent-Distiller: Towards Efficient Deep Reinforcement Learning Agents via Neural Architecture Search","date":"2020-12-24","arxiv_id":"2012.13091","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-vehicle-routing-problems-using","title":"Learning Vehicle Routing Problems using Policy Optimisation","date":"2020-12-24","arxiv_id":"2012.13269","repositories_listed":0,"syntology":null},{"url":null,"slug":"scc-an-efficient-deep-reinforcement-learning","title":"SCC: an efficient deep reinforcement learning agent mastering the game of StarCraft II","date":"2020-12-24","arxiv_id":"2012.13169","repositories_listed":0,"syntology":null},{"url":null,"slug":"spotter-extending-symbolic-planning-operators","title":"SPOTTER: Extending Symbolic Planning Operators through Targeted Reinforcement Learning","date":"2020-12-24","arxiv_id":"2012.13037","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervised-deep-clustering-and","title":"Unsupervised deep clustering and reinforcement learning can accurately segment MRI brain tumors with very small training sets","date":"2020-12-24","arxiv_id":"2012.13321","repositories_listed":0,"syntology":null},{"url":null,"slug":"commission-fee-is-not-enough-a-hierarchical","title":"Deep Stock Trading: A Hierarchical Reinforcement Learning Framework for Portfolio Optimization and Order Execution","date":"2020-12-23","arxiv_id":"2012.12620","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-reflecting-surface-assisted-anti-1","title":"Intelligent Reflecting Surface Assisted Anti-Jamming Communications Based on Reinforcement Learning","date":"2020-12-23","arxiv_id":"2012.12761","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethink-ai-based-power-grid-control-diving","title":"Rethink AI-based Power Grid Control: Diving Into Algorithm Design","date":"2020-12-23","arxiv_id":"2012.13026","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-penalty-function-approach-for","title":"A Dynamic Penalty Function Approach for Constraints-Handling in Reinforcement Learning","date":"2020-12-22","arxiv_id":"2012.11790","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-resource-allocation-in-dense-lora","title":"Intelligent Resource Allocation in Dense LoRa Networks using Deep Reinforcement Learning","date":"2020-12-22","arxiv_id":"2012.11867","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-deep-reinforcement-learning-for","title":"Scalable Deep Reinforcement Learning for Routing and Spectrum Access in Physical Layer","date":"2020-12-22","arxiv_id":"2012.11783","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-imitation-advantage-learning","title":"Self-Imitation Advantage Learning","date":"2020-12-22","arxiv_id":"2012.11989","repositories_listed":0,"syntology":null},{"url":null,"slug":"2012-11643","title":"myGym: Modular Toolkit for Visuomotor Robotic Tasks","date":"2020-12-21","arxiv_id":"2012.11643","repositories_listed":0,"syntology":null},{"url":null,"slug":"difference-rewards-policy-gradients","title":"Difference Rewards Policy Gradients","date":"2020-12-21","arxiv_id":"2012.11258","repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-robot-planner-with-low-cost-cameras","title":"Mobile Robot Planner with Low-cost Cameras Using Deep Reinforcement Learning","date":"2020-12-21","arxiv_id":"2012.11160","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-product-delivery","title":"Reinforcement Learning-based Product Delivery Frequency Control","date":"2020-12-20","arxiv_id":"2012.10858","repositories_listed":0,"syntology":null},{"url":null,"slug":"minimax-strikes-back","title":"Minimax Strikes Back","date":"2020-12-19","arxiv_id":"2012.10700","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-actor-critic-with-chance","title":"Model-Based Actor-Critic with Chance Constraint for Stochastic System","date":"2020-12-19","arxiv_id":"2012.10716","repositories_listed":0,"syntology":null},{"url":null,"slug":"quantum-reinforcement-learning-in-continuous","title":"Quantum reinforcement learning in continuous action space","date":"2020-12-19","arxiv_id":"2012.10711","repositories_listed":0,"syntology":null},{"url":null,"slug":"exact-reduction-of-huge-action-spaces-in","title":"Exact Reduction of Huge Action Spaces in General Reinforcement Learning","date":"2020-12-18","arxiv_id":"2012.10200","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-fluent-query-reformulations-with","title":"Exploring Fluent Query Reformulations with Text-to-Text Transformers and Reinforcement Learning","date":"2020-12-18","arxiv_id":"2012.10033","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-principles-of-embodied","title":"Hierarchical principles of embodied reinforcement learning: A review","date":"2020-12-18","arxiv_id":"2012.10147","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-test-case","title":"Reinforcement Learning for Test Case Prioritization","date":"2020-12-18","arxiv_id":"2012.11364","repositories_listed":0,"syntology":null},{"url":null,"slug":"curiosity-in-exploring-chemical-space","title":"Curiosity in exploring chemical space: Intrinsic rewards for deep molecular reinforcement learning","date":"2020-12-17","arxiv_id":"2012.11293","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-question-clarification-in","title":"Interactive Question Clarification in Dialogue via Reinforcement Learning","date":"2020-12-17","arxiv_id":"2012.09411","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsically-motivated-goal-conditioned","title":"Autotelic Agents with Intrinsically Motivated Goal-Conditioned Reinforcement Learning: a Short Survey","date":"2020-12-17","arxiv_id":"2012.09830","repositories_listed":0,"syntology":null},{"url":null,"slug":"magnet-multi-agent-graph-network-for-deep","title":"MAGNet: Multi-agent Graph Network for Deep Multi-agent Reinforcement Learning","date":"2020-12-17","arxiv_id":"2012.09762","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-optimal-district-heating-temperature","title":"Towards Optimal District Heating Temperature Control in China with Deep Reinforcement Learning","date":"2020-12-17","arxiv_id":"2012.09508","repositories_listed":0,"syntology":null},{"url":null,"slug":"ving-learning-open-world-navigation-with","title":"ViNG: Learning Open-World Navigation with Visual Goals","date":"2020-12-17","arxiv_id":"2012.09812","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-comparative-evaluation-of-machine-learning","title":"A comparative evaluation of machine learning methods for robot navigation through human crowds","date":"2020-12-16","arxiv_id":"2012.08822","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-constrained-distributional","title":"Batch-Constrained Distributional Reinforcement Learning for Session-based Recommendation","date":"2020-12-16","arxiv_id":"2012.08984","repositories_listed":0,"syntology":null}],"record_sha256":"b1192df7f3deb53abc70f8164eb3cc2e059348b7ddeb41f49971dab17b2d5eab","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}