{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/109","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":109,"pages_in_order":135,"rows_per_page":100,"rows":[10801,10900],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/108","next":"/task/reinforcement-learning-2/papers/110","papers":[{"url":null,"slug":"reinforcement-learning-and-bayesian-data","title":"Reinforcement learning and Bayesian data assimilation for model-informed precision dosing in oncology","date":"2020-06-01","arxiv_id":"2006.01061","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-with-1","title":"Robust Reinforcement Learning with Wasserstein Constraint","date":"2020-06-01","arxiv_id":"2006.00945","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-differential-learning-in-continuous","title":"Temporal-Differential Learning in Continuous Environments","date":"2020-06-01","arxiv_id":"2006.00997","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-reward-estimator-bottleneck","title":"Variational Reward Estimator Bottleneck: Learning Robust Reward Estimator for Multi-Domain Task-Oriented Dialog","date":"2020-05-31","arxiv_id":"2006.00417","repositories_listed":0,"syntology":null},{"url":null,"slug":"ai-based-resource-allocation-reinforcement","title":"AI-based Resource Allocation: Reinforcement Learning for Adaptive Auto-scaling in Serverless Environments","date":"2020-05-29","arxiv_id":"2005.14410","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-knowledge-integration-by-gradient","title":"Domain Knowledge Integration By Gradient Matching For Sample-Efficient Reinforcement Learning","date":"2020-05-28","arxiv_id":"2005.13778","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-residential-energy-management","title":"Intelligent Residential Energy Management System using Deep Reinforcement Learning","date":"2020-05-28","arxiv_id":"2005.14259","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-measure-reinforcement-learning-for","title":"Active Measure Reinforcement Learning for Observation Cost Minimization","date":"2020-05-26","arxiv_id":"2005.12697","repositories_listed":0,"syntology":null},{"url":null,"slug":"anomaly-detection-under-controlled-sensing","title":"Anomaly Detection Under Controlled Sensing Using Actor-Critic Reinforcement Learning","date":"2020-05-26","arxiv_id":"2006.01044","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-leo-satellite-and-uav-relaying","title":"Integrating LEO Satellite and UAV Relaying via Reinforcement Learning for Non-Terrestrial Networks","date":"2020-05-26","arxiv_id":"2005.12521","repositories_listed":0,"syntology":null},{"url":null,"slug":"time-variant-variational-transfer-for-value","title":"Time-Variant Variational Transfer for Value Functions","date":"2020-05-26","arxiv_id":"2005.12864","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-intervention-centric-causal-reasoning","title":"Towards intervention-centric causal reasoning in learning agents","date":"2020-05-26","arxiv_id":"2005.12968","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-models-for-automatic","title":"Deep Learning Models for Automatic Summarization","date":"2020-05-25","arxiv_id":"2005.11988","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-power-1","title":"Deep Reinforcement Learning Based Power Allocation for D2D Network","date":"2020-05-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-value-estimation-for-single-task","title":"Dynamic Value Estimation for Single-Task Multi-Scene Reinforcement Learning","date":"2020-05-25","arxiv_id":"2005.12254","repositories_listed":0,"syntology":null},{"url":null,"slug":"generator-and-critic-a-deep-reinforcement","title":"Generator and Critic: A Deep Reinforcement Learning Approach for Slate Re-ranking in E-commerce","date":"2020-05-25","arxiv_id":"2005.12206","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-monitored-reinforcement-learning","title":"Gradient Monitored Reinforcement Learning","date":"2020-05-25","arxiv_id":"2005.12108","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-trajectory","title":"Meta-Reinforcement Learning for Trajectory Design in Wireless UAV Networks","date":"2020-05-25","arxiv_id":"2005.12394","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-entropy-for-out-of-distribution","title":"Policy Entropy for Out-of-Distribution Classification","date":"2020-05-25","arxiv_id":"2005.12069","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-iterative","title":"Reinforcement Learning with Iterative Reasoning for Merging in Dense Traffic","date":"2020-05-25","arxiv_id":"2005.11895","repositories_listed":0,"syntology":null},{"url":null,"slug":"gochat-goal-oriented-chatbots-with","title":"GoChat: Goal-oriented Chatbots with Hierarchical Reinforcement Learning","date":"2020-05-24","arxiv_id":"2005.11729","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for-1","title":"Model-free Reinforcement Learning for Stochastic Stackelberg Security Games","date":"2020-05-24","arxiv_id":"2005.11853","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-reinforcement-learning-through","title":"Adaptive Reinforcement Learning through Evolving Self-Modifying Neural Networks","date":"2020-05-22","arxiv_id":"2006.05832","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-human-advice-a","title":"Reinforcement learning with human advice: a survey","date":"2020-05-22","arxiv_id":"2005.11016","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-automated-safety-coverage-and-testing","title":"Towards Automated Safety Coverage and Testing for Autonomous Vehicles with Reinforcement Learning","date":"2020-05-22","arxiv_id":"2005.13976","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-nav-nav-setting-method-based-on","title":"Q-NAV: NAV Setting Method based on Reinforcement Learning in Underwater Wireless Networks","date":"2020-05-21","arxiv_id":"2005.13521","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-decision","title":"A reinforcement learning based decision support system in textile manufacturing process","date":"2020-05-20","arxiv_id":"2005.09867","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-high-level","title":"Deep Reinforcement Learning for High Level Character Control","date":"2020-05-20","arxiv_id":"2005.10391","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-greedy-gq-with","title":"Finite-sample Analysis of Greedy-GQ with Linear Function Approximation under Markovian Noise","date":"2020-05-20","arxiv_id":"2005.10175","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-reasoning-for-robot-dialog-and","title":"Learning and Reasoning for Robot Dialog and Navigation Tasks","date":"2020-05-20","arxiv_id":"2005.09833","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-variable-selection","title":"Reinforcement Learning for Variable Selection in a Branch and Bound Algorithm","date":"2020-05-20","arxiv_id":"2005.10026","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-stage-deep-reinforcement-learning-for","title":"Two-stage Deep Reinforcement Learning for Inverter-based Volt-VAR Control in Active Distribution Networks","date":"2020-05-20","arxiv_id":"2005.11142","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-reinforcement-learning-algorithms","title":"A Survey of Reinforcement Learning Algorithms for Dynamically Varying Environments","date":"2020-05-19","arxiv_id":"2005.10619","repositories_listed":0,"syntology":null},{"url":null,"slug":"batch-augmented-multi-agent-reinforcement","title":"Batch-Augmented Multi-Agent Reinforcement Learning for Efficient Traffic Signal Optimization","date":"2020-05-19","arxiv_id":"2005.09624","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-augmentation-boosting-and","title":"Experience Augmentation: Boosting and Accelerating Off-Policy Multi-Agent Reinforcement Learning","date":"2020-05-19","arxiv_id":"2005.09453","repositories_listed":0,"syntology":null},{"url":null,"slug":"human-instruction-following-with-deep","title":"Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text","date":"2020-05-19","arxiv_id":"2005.09382","repositories_listed":0,"syntology":null},{"url":null,"slug":"privileged-information-dropout-in","title":"Privileged Information Dropout in Reinforcement Learning","date":"2020-05-19","arxiv_id":"2005.09220","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-caching-with-space","title":"Reinforcement Learning for Caching with Space-Time Popularity Dynamics","date":"2020-05-19","arxiv_id":"2005.09155","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-turbulence-modeling-by-multi-agent","title":"Automating Turbulence Modeling by Multi-Agent Reinforcement Learning","date":"2020-05-18","arxiv_id":"2005.09023","repositories_listed":0,"syntology":null},{"url":null,"slug":"basal-glucose-control-in-type-1-diabetes","title":"Basal Glucose Control in Type 1 Diabetes using Deep Reinforcement Learning: An In Silico Validation","date":"2020-05-18","arxiv_id":"2005.09059","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-charging-method-for-effective-li-ion","title":"Optimal Charging Method for Effective Li-ion Battery Life Extension Based on Reinforcement Learning","date":"2020-05-18","arxiv_id":"2005.08770","repositories_listed":0,"syntology":null},{"url":null,"slug":"concept-learning-in-deep-reinforcement","title":"Learning Transferable Concepts in Deep Reinforcement Learning","date":"2020-05-16","arxiv_id":"2005.07870","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-guarantees-for-safe-deep","title":"Probabilistic Guarantees for Safe Deep Reinforcement Learning","date":"2020-05-14","arxiv_id":"2005.07073","repositories_listed":0,"syntology":null},{"url":null,"slug":"solve-traveling-salesman-problem-by-monte","title":"Solve Traveling Salesman Problem by Monte Carlo Tree Search and Deep Neural Network","date":"2020-05-14","arxiv_id":"2005.06879","repositories_listed":0,"syntology":null},{"url":null,"slug":"stealthy-and-efficient-adversarial-attacks","title":"Stealthy and Efficient Adversarial Attacks against Deep Reinforcement Learning","date":"2020-05-14","arxiv_id":"2005.07099","repositories_listed":0,"syntology":null},{"url":null,"slug":"dream-architecture-a-developmental-approach","title":"DREAM Architecture: a Developmental Approach to Open-Ended Learning in Robotics","date":"2020-05-13","arxiv_id":"2005.06223","repositories_listed":0,"syntology":null},{"url":null,"slug":"explainable-reinforcement-learning-a-survey","title":"Explainable Reinforcement Learning: A Survey","date":"2020-05-13","arxiv_id":"2005.06247","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-simulation-to-real-world-maneuver","title":"From Simulation to Real World Maneuver Execution using Deep Reinforcement Learning","date":"2020-05-13","arxiv_id":"2005.07023","repositories_listed":0,"syntology":null},{"url":null,"slug":"proxy-experience-replay-federated","title":"Proxy Experience Replay: Federated Distillation for Distributed Reinforcement Learning","date":"2020-05-13","arxiv_id":"2005.06105","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-deep-neural-architecture-search","title":"A New Deep Neural Architecture Search Pipeline for Face Recognition","date":"2020-05-12","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"unbiased-deep-reinforcement-learning-a","title":"Unbiased Deep Reinforcement Learning: A General Training Framework for Existing and Future Algorithms","date":"2020-05-12","arxiv_id":"2005.07782","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-2","title":"A Deep Reinforcement Learning Approach to Efficient Drone Mobility Support","date":"2020-05-11","arxiv_id":"2005.05229","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-organ","title":"Deep Reinforcement Learning for Organ Localization in CT","date":"2020-05-11","arxiv_id":"2005.04974","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-on-real-time","title":"Reinforcement Learning Based on Real-Time Iteration NMPC","date":"2020-05-11","arxiv_id":"2005.05225","repositories_listed":0,"syntology":null},{"url":null,"slug":"toma-topological-map-abstraction-for","title":"TOMA: Topological Map Abstraction for Reinforcement Learning","date":"2020-05-11","arxiv_id":"2005.06061","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-deep-neuroevolution-on","title":"Accelerating Deep Neuroevolution on Distributed FPGAs for Reinforcement Learning Problems","date":"2020-05-10","arxiv_id":"2005.04536","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-fpga-based-on-device-reinforcement","title":"An FPGA-Based On-Device Reinforcement Learning Approach using Online Sequential Learning","date":"2020-05-10","arxiv_id":"2005.04646","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-pid-and-antiwindup-control-design-as","title":"Optimal PID and Antiwindup Control Design as a Reinforcement Learning Problem","date":"2020-05-10","arxiv_id":"2005.04539","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-beamforming-for","title":"A Reinforcement Learning based approach for Multi-target Detection in Massive MIMO radar","date":"2020-05-10","arxiv_id":"2005.04708","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-design-of-linear","title":"Reinforcement Learning based Design of Linear Fixed Structure Controllers","date":"2020-05-10","arxiv_id":"2005.04537","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-thermostatically","title":"Reinforcement Learning for Thermostatically Controlled Loads Control using Modelica and Python","date":"2020-05-09","arxiv_id":"2005.04444","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesizing-safe-policies-under","title":"Synthesizing Safe Policies under Probabilistic Constraints with Reinforcement Learning and Bayesian Model Checking","date":"2020-05-08","arxiv_id":"2005.03898","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-feedback-graphs","title":"Reinforcement Learning with Feedback Graphs","date":"2020-05-07","arxiv_id":"2005.03789","repositories_listed":0,"syntology":null},{"url":null,"slug":"robotic-arm-control-and-task-training-through","title":"Robotic Arm Control and Task Training through Deep Reinforcement Learning","date":"2020-05-06","arxiv_id":"2005.02632","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-through-meta","title":"Safe Reinforcement Learning through Meta-learned Instincts","date":"2020-05-06","arxiv_id":"2005.03233","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalized-planning-with-deep-reinforcement","title":"Generalized Planning With Deep Reinforcement Learning","date":"2020-05-05","arxiv_id":"2005.02305","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-uav-autonomous","title":"Reinforcement Learning for UAV Autonomous Navigation, Mapping and Target Detection","date":"2020-05-05","arxiv_id":"2005.05057","repositories_listed":0,"syntology":null},{"url":null,"slug":"formal-policy-synthesis-for-continuous-space","title":"Formal Policy Synthesis for Continuous-Space Systems via Reinforcement Learning","date":"2020-05-04","arxiv_id":"2005.01319","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiagent-value-iteration-algorithms-in","title":"Multiagent Value Iteration Algorithms in Dynamic Programming and Reinforcement Learning","date":"2020-05-04","arxiv_id":"2005.01627","repositories_listed":0,"syntology":null},{"url":null,"slug":"noise-pollution-in-hospital-readmission","title":"Noise Pollution in Hospital Readmission Prediction: Long Document Classification with Reinforcement Learning","date":"2020-05-04","arxiv_id":"2005.01259","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-constrained-interactive-recommendation","title":"Reward Constrained Interactive Recommendation with Natural Language Feedback","date":"2020-05-04","arxiv_id":"2005.01618","repositories_listed":0,"syntology":null},{"url":null,"slug":"setting-up-experimental-bell-test-with","title":"Setting up experimental Bell test with reinforcement learning","date":"2020-05-04","arxiv_id":"2005.01697","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-decentralized","title":"Multi-agent Reinforcement Learning for Decentralized Stable Matching","date":"2020-05-03","arxiv_id":"2005.01117","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-intelligent-1","title":"Deep Reinforcement Learning for Intelligent Transportation Systems: A Survey","date":"2020-05-02","arxiv_id":"2005.00935","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-text-based-reinforcement-learning","title":"Enhancing Text-based Reinforcement Learning Agents with Commonsense Knowledge","date":"2020-05-02","arxiv_id":"2005.00811","repositories_listed":0,"syntology":null},{"url":null,"slug":"amrl-aggregated-memory-for-reinforcement","title":"AMRL: Aggregated Memory For Reinforcement Learning","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"episodic-reinforcement-learning-with","title":"Episodic Reinforcement Learning with Associative Memory","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-reinforcement-learning-with","title":"Exploration in Reinforcement Learning with Deep Covering Options","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-robustness-via-risk-averse","title":"Improving Robustness via Risk Averse Distributional Reinforcement Learning","date":"2020-05-01","arxiv_id":"2005.00585","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-long-horizon-reinforcement-learning-more","title":"Is Long Horizon Reinforcement Learning More Difficult Than Short Horizon Reinforcement Learning?","date":"2020-05-01","arxiv_id":"2005.00527","repositories_listed":0,"syntology":null},{"url":null,"slug":"keep-doing-what-worked-behavior-modelling","title":"Keep Doing What Worked: Behavior Modelling Priors for Offline Reinforcement Learning","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-heuristics-for-quantified-boolean","title":"Learning Heuristics for Quantified Boolean Formulas through Reinforcement Learning","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-the-arrow-of-time-for-problems-in","title":"Learning the Arrow of Time for Problems in Reinforcement Learning","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for","title":"Model-based reinforcement learning for biological sequence design","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-reinforcement-learning-for-atari-1","title":"Model Based Reinforcement Learning for Atari","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-for-multi-agent","title":"Posterior sampling for multi-agent reinforcement learning: solving extensive games with imperfect information","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"the-ingredients-of-real-world-robotic","title":"The Ingredients of Real World Robotic Reinforcement Learning","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"toward-evaluating-robustness-of-deep","title":"Toward Evaluating Robustness of Deep Reinforcement Learning with Continuous Control","date":"2020-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrap-latent-predictive-representations","title":"Bootstrap Latent-Predictive Representations for Multitask Reinforcement Learning","date":"2020-04-30","arxiv_id":"2004.14646","repositories_listed":0,"syntology":null},{"url":null,"slug":"breaking-global-barriers-in-parallel","title":"Breaking (Global) Barriers in Parallel Stochastic Optimization with Wait-Avoiding Group Averaging","date":"2020-04-30","arxiv_id":"2005.00124","repositories_listed":0,"syntology":null},{"url":null,"slug":"delay-aware-resource-allocation-in-fog","title":"Delay-aware Resource Allocation in Fog-assisted IoT Networks Through Reinforcement Learning","date":"2020-04-30","arxiv_id":"2005.04097","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-soft-actor-critic-for-risk","title":"DSAC: Distributional Soft Actor Critic for Risk-Sensitive Reinforcement Learning","date":"2020-04-30","arxiv_id":"2004.14547","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-persona-consistent-dialogue","title":"Improving Factual Consistency Between a Response and Persona Facts","date":"2020-04-30","arxiv_id":"2005.00036","repositories_listed":0,"syntology":null},{"url":null,"slug":"plan-space-state-embeddings-for-improved","title":"Plan-Space State Embeddings for Improved Reinforcement Learning","date":"2020-04-30","arxiv_id":"2004.14567","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-minimalist-grammars","title":"Reinforcement learning of minimalist grammars","date":"2020-04-30","arxiv_id":"2005.00359","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-embodied-scene-description","title":"Towards Embodied Scene Description","date":"2020-04-30","arxiv_id":"2004.14638","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-robotic","title":"Meta-Reinforcement Learning for Robotic Industrial Insertion Tasks","date":"2020-04-29","arxiv_id":"2004.14404","repositories_listed":0,"syntology":null},{"url":null,"slug":"molecular-design-in-synthetically-accessible","title":"Molecular Design in Synthetically Accessible Chemical Space via Deep Reinforcement Learning","date":"2020-04-29","arxiv_id":"2004.14308","repositories_listed":0,"syntology":null},{"url":null,"slug":"reduced-dimensional-reinforcement-learning","title":"Reduced-Dimensional Reinforcement Learning Control using Singular Perturbation Approximations","date":"2020-04-29","arxiv_id":"2004.14501","repositories_listed":0,"syntology":null},{"url":null,"slug":"whittle-index-based-q-learning-for-restless","title":"Whittle index based Q-learning for restless bandits with average reward","date":"2020-04-29","arxiv_id":"2004.14427","repositories_listed":0,"syntology":null}],"record_sha256":"51d269636faf895d257f59c84b36ba667d953f181471350cfe4365970c47134c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}