{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/112","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":112,"pages_in_order":152,"rows_per_page":100,"rows":[11101,11200],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/111","next":"/task/reinforcement-learning-1/papers/113","papers":[{"url":null,"slug":"carla-real-traffic-scenarios-novel-training","title":"CARLA Real Traffic Scenarios -- novel training ground and benchmark for autonomous driving","date":"2020-12-16","arxiv_id":"2012.11329","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-run-with-potential-based-reward","title":"Learning to Run with Potential-Based Reward Shaping and Demonstrations from Video Data","date":"2020-12-16","arxiv_id":"2012.08824","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-reinforcement-learning-via-1","title":"Sample-Efficient Reinforcement Learning via Counterfactual-Based Data Augmentation","date":"2020-12-16","arxiv_id":"2012.09092","repositories_listed":0,"syntology":null},{"url":null,"slug":"gegelati-lightweight-artificial-intelligence","title":"Gegelati: Lightweight Artificial Intelligence through Generic and Evolvable Tangled Program Graphs","date":"2020-12-15","arxiv_id":"2012.08296","repositories_listed":0,"syntology":null},{"url":null,"slug":"grounding-artificial-intelligence-in-the","title":"Grounding Artificial Intelligence in the Origins of Human Behavior","date":"2020-12-15","arxiv_id":"2012.08564","repositories_listed":0,"syntology":null},{"url":null,"slug":"nearly-minimax-optimal-reinforcement-learning","title":"Nearly Minimax Optimal Reinforcement Learning for Linear Mixture Markov Decision Processes","date":"2020-12-15","arxiv_id":"2012.08507","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-case-for-new-neural-network-smoothness","title":"A case for new neural network smoothness constraints","date":"2020-12-14","arxiv_id":"2012.07969","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-framework-for-efficient-robotic","title":"Learning Visual Robotic Control Efficiently with Contrastive Pre-training and Data Augmentation","date":"2020-12-14","arxiv_id":"2012.07975","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-formulation-of-the","title":"A Reinforcement Learning Formulation of the Lyapunov Optimization: Application to Edge Computing Systems with Queue Stability","date":"2020-12-14","arxiv_id":"2012.07279","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-hierarchical-imitation-and","title":"Active Hierarchical Imitation and Reinforcement Learning","date":"2020-12-14","arxiv_id":"2012.07330","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-source-code-summarization-via","title":"Automatic Source Code Summarization via Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"demystify-painting-with-rl","title":"Demystify Painting with RL","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deploying-reinforcement-learning-in-water","title":"Deploying Reinforcement Learning in Water Transport","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"evading-web-application-firewalls-with","title":"Evading Web Application Firewalls with Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exponential-lower-bounds-for-batch","title":"Exponential Lower Bounds for Batch Reinforcement Learning: Batch RL can be Exponentially Harder than Online RL","date":"2020-12-14","arxiv_id":"2012.08005","repositories_listed":0,"syntology":null},{"url":null,"slug":"ipm-move-planner-an-efficient-exploiting-deep","title":"IPM Move Planner: AN EFFICIENT EXPLOITING DEEP REINFORCEMENT LEARNING WITH MONTE CARLO TREE SEARCH","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-to-manage-portfolio-with-reinforcement","title":"Learn To Manage Portfolio With Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-to-play-tetris-with-deep-reinforcement","title":"Learn to Play Tetris with Deep Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-mobile-robot-navigation-in-the-dense","title":"Learning Mobile Robot Navigation in the Dense Crowd with Deep Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-robots-autonomous-exploration-with","title":"Mobile Robots Autonomous Exploration with Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mobile-robots-exploration-via-deep","title":"Mobile Robots Exploration via Deep Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-portfolio-liquidation","title":"Optimal Portfolio Liquidation","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimization-of-multi-factor-model-in","title":"Optimization of Multi-Factor Model in Quantitative Trading Based On Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"portfolio-management-with-reinforcement","title":"Portfolio Management with Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ranking-items-in-large-scale-item-search","title":"Ranking Items in Large-Scale Item Search Engines with Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-adaptive","title":"Reinforcement Learning Based Adaptive WalkingAssistance Control of a Lower Limb Exoskeleton","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-character","title":"Reinforcement Learning Based Character Controlling","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-predict-optimize","title":"Reinforcement Learning for Predict+Optimize","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-the-beginning-of","title":"Reinforcement Learning for the Beginning of Starcraft II Game","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-20q-game-with","title":"Reinforcement Learning in 20Q Game with Generic Knowledge Bases","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-with-stability","title":"Learning for MPC with Stability & Safety Guarantees","date":"2020-12-14","arxiv_id":"2012.07369","repositories_listed":0,"syntology":null},{"url":null,"slug":"sat-marl-specification-aware-training-in","title":"SAT-MARL: Specification Aware Training in Multi-Agent Reinforcement Learning","date":"2020-12-14","arxiv_id":"2012.07949","repositories_listed":0,"syntology":null},{"url":null,"slug":"smoothing-deep-reinforcement-learning-for","title":"Smoothing Deep Reinforcement Learning for Power Control for Spectrum Sharing in Cognitive Radios","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"specializing-inter-agent-communication-in","title":"Specializing Inter-Agent Communication in Heterogeneous Multi-Agent Reinforcement Learning using Agent Class Information","date":"2020-12-14","arxiv_id":"2012.07617","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-understanding-deep-policy-gradients-a","title":"Towards Understanding Deep Policy Gradients: A Case Study on PPO","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"train-a-snake-with-reinforcement-learning","title":"Train a snake with reinforcement learning algorithms","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-enhanced-gaussian-cross-entropy-in","title":"Using Enhanced Gaussian Cross-Entropy in Imitation Learning to Digging the First Diamond in Minecraft","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"virtual-autonomous-driving-with-reinforcement","title":"Virtual Autonomous Driving with Reinforcement Learning","date":"2020-12-14","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-subspaces-using","title":"Reinforcement Learning with Subspaces using Free Energy Paradigm","date":"2020-12-13","arxiv_id":"2012.07091","repositories_listed":0,"syntology":null},{"url":null,"slug":"noise-robust-end-to-end-quantum-control-using","title":"Noise-Robust End-to-End Quantum Control using Deep Autoregressive Policy Networks","date":"2020-12-12","arxiv_id":"2012.06701","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-reward-learning-for-offline","title":"Semi-supervised reward learning for offline reinforcement learning","date":"2020-12-12","arxiv_id":"2012.06899","repositories_listed":0,"syntology":null},{"url":null,"slug":"tutoring-reinforcement-learning-via-feedback","title":"Tutoring Reinforcement Learning via Feedback Control","date":"2020-12-12","arxiv_id":"2012.06863","repositories_listed":0,"syntology":null},{"url":null,"slug":"opac-opportunistic-actor-critic","title":"OPAC: Opportunistic Actor-Critic","date":"2020-12-11","arxiv_id":"2012.06555","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularizing-action-policies-for-smooth","title":"Regularizing Action Policies for Smooth Control with Reinforcement Learning","date":"2020-12-11","arxiv_id":"2012.06644","repositories_listed":0,"syntology":null},{"url":null,"slug":"blending-mpc-value-function-approximation-for-1","title":"Blending MPC & Value Function Approximation for Efficient Reinforcement Learning","date":"2020-12-10","arxiv_id":"2012.05909","repositories_listed":0,"syntology":null},{"url":null,"slug":"flatland-rl-multi-agent-reinforcement","title":"Flatland-RL : Multi-Agent Reinforcement Learning on Trains","date":"2020-12-10","arxiv_id":"2012.05893","repositories_listed":0,"syntology":null},{"url":null,"slug":"performance-weighed-policy-sampling-for-meta","title":"Performance-Weighed Policy Sampling for Meta-Reinforcement Learning","date":"2020-12-10","arxiv_id":"2012.06016","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-agents-for-ubisoft-s","title":"Reinforcement Learning Agents for Ubisoft's Roller Champions","date":"2020-12-10","arxiv_id":"2012.06031","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-for-4","title":"A Deep Reinforcement Learning Approach for Ramp Metering Based on Traffic Video Data","date":"2020-12-09","arxiv_id":"2012.12104","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-long-term","title":"Deep Reinforcement Learning for Long Term Hydropower Production Scheduling","date":"2020-12-09","arxiv_id":"2012.06312","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-stock","title":"Deep Reinforcement Learning for Stock Portfolio Optimization","date":"2020-12-09","arxiv_id":"2012.06325","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-search-based-on-deep","title":"Interactive Search Based on Deep Reinforcement Learning","date":"2020-12-09","arxiv_id":"2012.06052","repositories_listed":0,"syntology":null},{"url":null,"slug":"mlcomp-a-methodology-for-machine-learning","title":"MLComp: A Methodology for Machine Learning-based Performance Estimation and Adaptive Selection of Pareto-Optimal Compiler Optimization Sequences","date":"2020-12-09","arxiv_id":"2012.05270","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-domain-randomised-reinforcement","title":"Robust Domain Randomised Reinforcement Learning through Peer-to-Peer Distillation","date":"2020-12-09","arxiv_id":"2012.04839","repositories_listed":0,"syntology":null},{"url":null,"slug":"semi-supervised-off-policy-reinforcement","title":"Semi-Supervised Off Policy Reinforcement Learning","date":"2020-12-09","arxiv_id":"2012.04809","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-for-efficient-iterative","title":"Transfer Learning for Efficient Iterative Safety Validation","date":"2020-12-09","arxiv_id":"2012.05336","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergence-of-different-modes-of-tool-use-in-a","title":"Emergence of Different Modes of Tool Use in a Reaching and Dragging Task","date":"2020-12-08","arxiv_id":"2012.04700","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-architectural-implications-of-distributed","title":"The Architectural Implications of Distributed Reinforcement Learning on CPU-GPU Systems","date":"2020-12-08","arxiv_id":"2012.04210","repositories_listed":0,"syntology":null},{"url":null,"slug":"battery-model-calibration-with-deep","title":"Battery Model Calibration with Deep Reinforcement Learning","date":"2020-12-07","arxiv_id":"2012.04010","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reservoir-management-through-deep","title":"Efficient Reservoir Management through Deep Reinforcement Learning","date":"2020-12-07","arxiv_id":"2012.03822","repositories_listed":0,"syntology":null},{"url":null,"slug":"selective-pseudo-labeling-with-reinforcement","title":"Selective Pseudo-Labeling with Reinforcement Learning for Semi-Supervised Domain Adaptation","date":"2020-12-07","arxiv_id":"2012.03438","repositories_listed":0,"syntology":null},{"url":null,"slug":"vehicular-cooperative-perception-through","title":"Vehicular Cooperative Perception Through Action Branching and Federated Reinforcement Learning","date":"2020-12-07","arxiv_id":"2012.03414","repositories_listed":0,"syntology":null},{"url":null,"slug":"fever-basketball-a-complex-flexible-and","title":"Fever Basketball: A Complex, Flexible, and Asynchronized Sports Game Environment for Multi-agent Reinforcement Learning","date":"2020-12-06","arxiv_id":"2012.03204","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-boost-text-data-augmentation-through-1","title":"Data Boost: Text Data Augmentation Through Reinforcement Learning Guided Conditional Generation","date":"2020-12-05","arxiv_id":"2012.02952","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-navigation-based-on-deep","title":"Multi-agent navigation based on deep reinforcement learning and traditional pathfinding algorithm","date":"2020-12-05","arxiv_id":"2012.09134","repositories_listed":0,"syntology":null},{"url":null,"slug":"demonstration-efficient-inverse-reinforcement","title":"Demonstration-efficient Inverse Reinforcement Learning in Procedurally Generated Environments","date":"2020-12-04","arxiv_id":"2012.02527","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-agnostic-learning-to-meta-learn","title":"Model-Agnostic Learning to Meta-Learn","date":"2020-12-04","arxiv_id":"2012.02684","repositories_listed":0,"syntology":null},{"url":"/paper/neural-dynamic-policies-for-end-to-end-1","slug":"neural-dynamic-policies-for-end-to-end-1","title":"Neural Dynamic Policies for End-to-End Sensorimotor Learning","date":"2020-12-04","arxiv_id":"2012.02788","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-meta-level-model-based-reinforcement","title":"Offline Meta-level Model-based Reinforcement Learning Approach for Cold-Start Recommendation","date":"2020-12-04","arxiv_id":"2012.02476","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepcrawl-deep-reinforcement-learning-for","title":"DeepCrawl: Deep Reinforcement Learning for Turn-based Strategy Games","date":"2020-12-03","arxiv_id":"2012.01914","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-a-prospective-covid-19-therapeutic","title":"Designing a Prospective COVID-19 Therapeutic with Reinforcement Learning","date":"2020-12-03","arxiv_id":"2012.01736","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-ran-slicing-for-service-oriented","title":"Dynamic RAN Slicing for Service-Oriented Vehicular Networks via Constrained Learning","date":"2020-12-03","arxiv_id":"2012.01991","repositories_listed":0,"syntology":null},{"url":null,"slug":"partially-connected-automated-vehicle","title":"Partially Connected Automated Vehicle Cooperative Control Strategy with a Deep Reinforcement Learning Approach","date":"2020-12-03","arxiv_id":"2012.01841","repositories_listed":0,"syntology":null},{"url":null,"slug":"are-gradient-based-saliency-maps-useful-in","title":"Are Gradient-based Saliency Maps Useful in Deep Reinforcement Learning?","date":"2020-12-02","arxiv_id":"2012.01281","repositories_listed":0,"syntology":null},{"url":null,"slug":"coinbot-intelligent-robotic-coin-bag","title":"Coinbot: Intelligent Robotic Coin Bag Manipulation Using Deep Reinforcement Learning And Machine Teaching","date":"2020-12-02","arxiv_id":"2012.01356","repositories_listed":0,"syntology":null},{"url":null,"slug":"convergence-proof-for-actor-critic-methods-1","title":"Convergence Proof for Actor-Critic Methods Applied to PPO and RUDDER","date":"2020-12-02","arxiv_id":"2012.01399","repositories_listed":0,"syntology":null},{"url":null,"slug":"driving-policy-adaptive-safeguard-for","title":"Driving-Policy Adaptive Safeguard for Autonomous Vehicles Using Reinforcement Learning","date":"2020-12-02","arxiv_id":"2012.01010","repositories_listed":0,"syntology":null},{"url":null,"slug":"fit-a-fast-and-accurate-framework-for-solving","title":"BSODA: A Bipartite Scalable Framework for Online Disease Diagnosis","date":"2020-12-02","arxiv_id":"2012.01065","repositories_listed":0,"syntology":null},{"url":null,"slug":"pareto-deterministic-policy-gradients-and-its","title":"Pareto Deterministic Policy Gradients and Its Application in 5G Massive MIMO Networks","date":"2020-12-02","arxiv_id":"2012.01279","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-antenna-tilt","title":"A Safe Reinforcement Learning Architecture for Antenna Tilt Optimisation","date":"2020-12-02","arxiv_id":"2012.01296","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-policy-gradient-finding","title":"Sample Complexity of Policy Gradient Finding Second-Order Stationary Points","date":"2020-12-02","arxiv_id":"2012.01491","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learning-exploring-method-to-generate","title":"A Learning-Exploring Method to Generate Diverse Paraphrases with Multi-Objective Deep Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-local-temporal-difference-code-for","title":"A Local Temporal Difference Code for Distributional Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-convergent-variant-of-q-learning-with","title":"A new convergent variant of Q-learning with linear function approximation","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"almost-optimal-model-free-reinforcement-1","title":"Almost Optimal Model-Free Reinforcement Learningvia Reference-Advantage Decomposition","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"answer-driven-deep-question-generation-based","title":"Answer-driven Deep Question Generation based on Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-and-accelerating-coverage-in-deep","title":"Assessing and Accelerating Coverage in Deep Reinforcement Learning","date":"2020-12-01","arxiv_id":"2012.00724","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-temporal-difference-and-q-learning-learn-1","title":"Can Temporal-Diﬀerence and Q-Learning Learn Representation? A Mean-Field Theory","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-cognitive-modeling-and","title":"Combining Cognitive Modeling and Reinforcement Learning for Clarification in Dialogue","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ecolight-intersection-control-in-developing","title":"EcoLight: Intersection Control in Developing Regions Under Extreme Budget and Network Constraints","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"expanrl-hierarchical-reinforcement-learning","title":"ExpanRL: Hierarchical Reinforcement Learning for Course Concept Expansion in MOOCs","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-neural-machine-translation-for","title":"Improving Neural Machine Translation for Sanskrit-English","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-the-naturalness-and-diversity-of","title":"Improving the Naturalness and Diversity of Referring Expression Generation models using Minimum Risk Training","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"instance-based-generalization-in-1","title":"Instance-based Generalization in Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"is-long-horizon-rl-more-difficult-than-short","title":"Is Long Horizon RL More Difficult Than Short Horizon RL?","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"leverage-the-average-an-analysis-of-kl","title":"Leverage the Average: an Analysis of KL Regularization in Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"morel-model-based-offline-reinforcement-1","title":"MOReL: Model-Based Offline Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"non-crossing-quantile-regression-for","title":"Non-Crossing Quantile Regression for Distributional Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"obtain-employee-turnover-rate-and-optimal","title":"Obtain Employee Turnover Rate and Optimal Reduction Strategy Based On Neural Network and Reinforcement Learning","date":"2020-12-01","arxiv_id":"2012.00583","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-efficiency-in-hierarchical-reinforcement","title":"On Efficiency in Hierarchical Reinforcement Learning","date":"2020-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"bf05a6b5b61e4beae2e669bcbac7568af313f0d3ba064c092fbe4de7e139b149","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}