{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/110","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":110,"pages_in_order":132,"rows_per_page":100,"rows":[10901,11000],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/109","next":"/task/reinforcement-learning/papers/111","papers":[{"url":null,"slug":"from-semantics-to-execution-integrating","title":"From semantics to execution: Integrating action planning with reinforcement learning for robotic causal problem-solving","date":"2019-05-23","arxiv_id":"1905.09683","repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-guarantees-for-concurrent-reinforcement","title":"PAC Guarantees for Cooperative Multi-Agent Reinforcement Learning with Restricted Communication","date":"2019-05-23","arxiv_id":"1905.09951","repositories_listed":0,"syntology":null},{"url":null,"slug":"population-based-global-optimisation-methods","title":"Population-based Global Optimisation Methods for Learning Long-term Dependencies with RNNs","date":"2019-05-23","arxiv_id":"1905.09691","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-value-functions","title":"Recurrent Value Functions","date":"2019-05-23","arxiv_id":"1905.09562","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-guarantees-for-learning-an","title":"Robust guarantees for learning an autoregressive filter","date":"2019-05-23","arxiv_id":"1905.09897","repositories_listed":0,"syntology":null},{"url":null,"slug":"where-to-find-next-passengers-on-e-hailing","title":"Optimal Passenger-Seeking Policies on E-hailing Platforms Using Markov Decision Process and Imitation Learning","date":"2019-05-23","arxiv_id":"1905.09906","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-detecting","title":"Deep Reinforcement Learning for Detecting Malicious Websites","date":"2019-05-22","arxiv_id":"1905.09207","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for","title":"Hierarchical Reinforcement Learning for Quadruped Locomotion","date":"2019-05-22","arxiv_id":"1905.08926","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-inverse-reinforcement-learning","title":"Stochastic Inverse Reinforcement Learning","date":"2019-05-21","arxiv_id":"1905.08513","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-approach-to-robust-reinforcement","title":"A Bayesian Approach to Robust Reinforcement Learning","date":"2019-05-20","arxiv_id":"1905.08188","repositories_listed":0,"syntology":null},{"url":null,"slug":"issues-concerning-realizability-of-blackwell","title":"Issues concerning realizability of Blackwell optimal policies in reinforcement learning","date":"2019-05-20","arxiv_id":"1905.08293","repositories_listed":0,"syntology":null},{"url":null,"slug":"perceptual-values-from-observation","title":"Perceptual Values from Observation","date":"2019-05-20","arxiv_id":"1905.07861","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-without-ground-truth","title":"Reinforcement Learning without Ground-Truth State","date":"2019-05-20","arxiv_id":"1905.07866","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-deep-q","title":"Stochastic Variance Reduction for Deep Q-learning","date":"2019-05-20","arxiv_id":"1905.08152","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-learning-of","title":"Reinforcement Learning for Learning of Dynamical Systems in Uncertain Environment: a Tutorial","date":"2019-05-19","arxiv_id":"1905.07727","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-rewards-to-automate-reinforcement","title":"Evolving Rewards to Automate Reinforcement Learning","date":"2019-05-18","arxiv_id":"1905.07628","repositories_listed":0,"syntology":null},{"url":null,"slug":"alpha-maml-adaptive-model-agnostic-meta","title":"Alpha MAML: Adaptive Model-Agnostic Meta-Learning","date":"2019-05-17","arxiv_id":"1905.07435","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-channel","title":"Deep Reinforcement Learning-Based Channel Allocation for Wireless LANs with Graph Convolutional Networks","date":"2019-05-17","arxiv_id":"1905.07144","repositories_listed":0,"syntology":null},{"url":null,"slug":"enforcing-constraints-for-time-series","title":"Enforcing constraints for time series prediction in supervised, unsupervised and reinforcement learning","date":"2019-05-17","arxiv_id":"1905.07501","repositories_listed":0,"syntology":null},{"url":null,"slug":"mamic-macro-and-micro-curriculum-for-robotic","title":"MaMiC: Macro and Micro Curriculum for Robotic Reinforcement Learning","date":"2019-05-17","arxiv_id":"1905.07193","repositories_listed":0,"syntology":null},{"url":null,"slug":"replab-a-reproducible-low-cost-arm-benchmark","title":"REPLAB: A Reproducible Low-Cost Arm Benchmark Platform for Robotic Learning","date":"2019-05-17","arxiv_id":"1905.07447","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastically-dominant-distributional","title":"Stochastically Dominant Distributional Reinforcement Learning","date":"2019-05-17","arxiv_id":"1905.07318","repositories_listed":0,"syntology":null},{"url":null,"slug":"stratospheric-aerosol-injection-as-a-deep","title":"Stratospheric Aerosol Injection as a Deep Reinforcement Learning Problem","date":"2019-05-17","arxiv_id":"1905.07366","repositories_listed":0,"syntology":null},{"url":null,"slug":"tbq-improving-efficiency-of-trace-utilization","title":"TBQ($σ$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning","date":"2019-05-17","arxiv_id":"1905.07237","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-sequential-decision-making","title":"Knowledge-Based Sequential Decision-Making Under Uncertainty","date":"2019-05-16","arxiv_id":"1905.07030","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-exploration-policies-for-model","title":"Learning Exploration Policies for Model-Agnostic Meta-Reinforcement Learning","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-adaptive-1","title":"Meta-Reinforcement Learning for Adaptive Autonomous Driving","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-policy-adaptation-for-hierarchical-1","title":"Sub-policy Adaptation for Hierarchical Reinforcement Learning","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learning-based-branch-and-bound-for-maximum","title":"A Learning based Branch and Bound for Maximum Common Subgraph Problems","date":"2019-05-15","arxiv_id":"1905.05840","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-the-loss-metric-mismatch-with","title":"Addressing the Loss-Metric Mismatch with Adaptive Loss Alignment","date":"2019-05-15","arxiv_id":"1905.05895","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-penetration-testing-using","title":"Autonomous Penetration Testing using Reinforcement Learning","date":"2019-05-15","arxiv_id":"1905.05965","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scheduling-in","title":"Deep reinforcement learning for scheduling in large-scale networked control systems","date":"2019-05-15","arxiv_id":"1905.05992","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scheduling-in-1","title":"Deep Reinforcement Learning for Scheduling in Cellular Networks","date":"2019-05-15","arxiv_id":"1905.05914","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-exploitation-trade-off-in","title":"Exploration-Exploitation Trade-off in Reinforcement Learning on Online Markov Decision Processes with Global Concave Rewards","date":"2019-05-15","arxiv_id":"1905.06466","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-active-spine-behaviors-for-dynamic","title":"Learning Active Spine Behaviors for Dynamic and Efficient Locomotion in Quadruped Robots","date":"2019-05-15","arxiv_id":"1905.06077","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-robotics-and","title":"Reinforcement Learning for Robotics and Control with Active Uncertainty Reduction","date":"2019-05-15","arxiv_id":"1905.06274","repositories_listed":0,"syntology":null},{"url":null,"slug":"synthesis-of-provably-correct-autonomy","title":"Synthesis of Provably Correct Autonomy Protocols for Shared Control","date":"2019-05-15","arxiv_id":"1905.06471","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-parametric-and-nonparametric-models","title":"Combining Parametric and Nonparametric Models for Off-Policy Evaluation","date":"2019-05-14","arxiv_id":"1905.05787","repositories_listed":0,"syntology":null},{"url":null,"slug":"tauriel-targeting-traveling-salesman-problem","title":"TauRieL: Targeting Traveling Salesman Problem with a deep reinforcement learning inspired architecture","date":"2019-05-14","arxiv_id":"1905.05567","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-regret-bounds-for-reinforcement","title":"Variational Regret Bounds for Reinforcement Learning","date":"2019-05-14","arxiv_id":"1905.05857","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-multi-agent-reinforcement-learning-based","title":"Deep Multi-Agent Reinforcement Learning Based Cooperative Edge Caching in Wireless Networks","date":"2019-05-13","arxiv_id":"1905.05256","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-for","title":"Distributional Reinforcement Learning for Efficient Exploration","date":"2019-05-13","arxiv_id":"1905.06125","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-exploiting-multiple-subgoals-for","title":"Learning and Exploiting Multiple Subgoals for Fast Exploration in Hierarchical Reinforcement Learning","date":"2019-05-13","arxiv_id":"1905.05180","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-novel-policies-for-tasks","title":"Learning Novel Policies For Tasks","date":"2019-05-13","arxiv_id":"1905.05252","repositories_listed":0,"syntology":null},{"url":null,"slug":"diagnosing-reinforcement-learning-for-traffic","title":"Diagnosing Reinforcement Learning for Traffic Signal Control","date":"2019-05-12","arxiv_id":"1905.04716","repositories_listed":0,"syntology":null},{"url":null,"slug":"metareasoning-in-modular-software-systems-on","title":"Metareasoning in Modular Software Systems: On-the-Fly Configuration using Reinforcement Learning with Rich Contextual Representations","date":"2019-05-12","arxiv_id":"1905.05179","repositories_listed":0,"syntology":null},{"url":null,"slug":"190513315","title":"Graph Attention Memory for Visual Navigation","date":"2019-05-11","arxiv_id":"1905.13315","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-routerless-network-on-chip-designs","title":"Optimizing Routerless Network-on-Chip Designs: An Innovative Learning-Based Framework","date":"2019-05-11","arxiv_id":"1905.04423","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-deep-reinforcement-learning","title":"Attention-based Deep Reinforcement Learning for Multi-view Environments","date":"2019-05-10","arxiv_id":"1905.03985","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-artificial-intelligence-agents-for","title":"Design of Artificial Intelligence Agents for Games using Deep Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04127","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-autonomous-agents-benefit-from-hearing","title":"Do Autonomous Agents Benefit from Hearing?","date":"2019-05-10","arxiv_id":"1905.04192","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adversarial-reinforcement-learning-for","title":"Domain Adversarial Reinforcement Learning for Partial Domain Adaptation","date":"2019-05-10","arxiv_id":"1905.04094","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-escape-based-flocking-behavior-using","title":"Emergent Escape-based Flocking Behavior using Multi-Agent Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04077","repositories_listed":0,"syntology":null},{"url":null,"slug":"gan-based-deep-distributional-reinforcement","title":"GAN-powered Deep Distributional Reinforcement Learning for Resource Management in Network Slicing","date":"2019-05-10","arxiv_id":"1905.03929","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-detection-of-mutual-influences-and","title":"On the Detection of Mutual Influences and Their Consideration in Reinforcement Learning Processes","date":"2019-05-10","arxiv_id":"1905.04205","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-non-stationary","title":"Reinforcement Learning in Non-Stationary Environments","date":"2019-05-10","arxiv_id":"1905.03970","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503428","title":"Testing Scenario Library Generation for Connected and Automated Vehicles, Part II: Case Studies","date":"2019-05-09","arxiv_id":"1905.03428","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503440","title":"Path Design for Cellular-Connected UAV with Reinforcement Learning","date":"2019-05-09","arxiv_id":"1905.03440","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503494","title":"Toward Packet Routing with Fully-distributed Multi-agent Deep Reinforcement Learning","date":"2019-05-09","arxiv_id":"1905.03494","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503501","title":"Pretrain Soft Q-Learning with Imperfect Demonstrations","date":"2019-05-09","arxiv_id":"1905.03501","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503517","title":"Mitigating Deep Learning Vulnerabilities from Adversarial Examples Attack in the Cybersecurity Domain","date":"2019-05-09","arxiv_id":"1905.03517","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503726","title":"A Reinforcement Learning Perspective on the Optimal Control of Mutation Probabilities for the (1+1) Evolutionary Algorithm: First Results on the OneMax Problem","date":"2019-05-09","arxiv_id":"1905.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"smoothing-policies-and-safe-policy-gradients","title":"Smoothing Policies and Safe Policy Gradients","date":"2019-05-08","arxiv_id":"1905.03231","repositories_listed":0,"syntology":null},{"url":null,"slug":"190508314","title":"Longitudinal Dynamic versus Kinematic Models for Car-Following Control Using Deep Reinforcement Learning","date":"2019-05-07","arxiv_id":"1905.08314","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-complementary-learning-systems-approach-to","title":"A Complementary Learning Systems Approach to Temporal Difference Learning","date":"2019-05-07","arxiv_id":"1905.02636","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-target-updates-for-q-learning","title":"Accelerated Target Updates for Q-learning","date":"2019-05-07","arxiv_id":"1905.02841","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-and-multi-task-reinforcement","title":"Continual and Multi-task Reinforcement Learning With Shared Episodic Memory","date":"2019-05-07","arxiv_id":"1905.02662","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-refinement-a-practical","title":"Neural Architecture Refinement: A Practical Way for Avoiding Overfitting in NAS","date":"2019-05-07","arxiv_id":"1905.02341","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-exchangeability-in-reinforcement","title":"Object Exchangeability in Reinforcement Learning: Extended Abstract","date":"2019-05-07","arxiv_id":"1905.02698","repositories_listed":0,"syntology":null},{"url":null,"slug":"regal-transfer-learning-for-fast-optimization","title":"Reinforced Genetic Algorithm Learning for Optimizing Computation Graphs","date":"2019-05-07","arxiv_id":"1905.02494","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-planning-and-deep-reinforcement","title":"Combining Planning and Deep Reinforcement Learning in Tactical Decision Making for Autonomous Driving","date":"2019-05-06","arxiv_id":"1905.02680","repositories_listed":0,"syntology":null},{"url":null,"slug":"deeprmsa-a-deep-reinforcement-learning","title":"DeepRMSA: A Deep Reinforcement Learning Framework for Routing, Modulation and Spectrum Assignment in Elastic Optical Networks","date":"2019-05-06","arxiv_id":"1905.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-meta-controller-adaptive-alternation","title":"Curious Meta-Controller: Adaptive Alternation between Model-Based and Model-Free Control in Deep Reinforcement Learning","date":"2019-05-05","arxiv_id":"1905.01718","repositories_listed":0,"syntology":null},{"url":null,"slug":"190511437","title":"A Survey of Adaptive Resonance Theory Neural Network Models for Engineering Applications","date":"2019-05-04","arxiv_id":"1905.11437","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-neural-architecture-search","title":"A Survey on Neural Architecture Search","date":"2019-05-04","arxiv_id":"1905.01392","repositories_listed":0,"syntology":null},{"url":null,"slug":"face-hallucination-by-attentive-sequence","title":"Face Hallucination by Attentive Sequence Optimization with Reinforcement Learning","date":"2019-05-04","arxiv_id":"1905.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-policy-learning-is-sensitive-to","title":"Hierarchical Policy Learning is Sensitive to Goal Space Design","date":"2019-05-04","arxiv_id":"1905.01537","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learners-learning-dynamics-are-unlike","title":"Meta-learners' learning dynamics are unlike learners'","date":"2019-05-03","arxiv_id":"1905.01320","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tutorial-on-recursive-models-for-analyzing","title":"A tutorial on recursive models for analyzing and predicting path choice behavior","date":"2019-05-02","arxiv_id":"1905.00883","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-intelligent-secondary-control-of","title":"Adaptive Intelligent Secondary Control of Microgrids Using a Biologically-Inspired Reinforcement Learning","date":"2019-05-02","arxiv_id":"1905.00557","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-air-traffic-controller-a-deep","title":"Autonomous Air Traffic Controller: A Deep Multi-Agent Reinforcement Learning Approach","date":"2019-05-02","arxiv_id":"1905.01303","repositories_listed":0,"syntology":null},{"url":null,"slug":"behavior-planning-of-autonomous-cars-with","title":"Behavior Planning of Autonomous Cars with Social Perception","date":"2019-05-02","arxiv_id":"1905.00988","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-guider-network-for-multi-dual-learning","title":"A Guider Network for Multi-Dual Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-dog-learns-old-tricks-rl-finds-classic","title":"A new dog learns old tricks: RL finds classic optimization algorithms","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"actrce-augmenting-experience-via-teachers-1","title":"ACTRCE: Augmenting Experience via Teacher’s Advice","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ad-vat-an-asymmetric-dueling-mechanism-for","title":"AD-VAT: An Asymmetric Dueling mechanism for learning Visual Active Tracking","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-exploration-strategy-for-self-1","title":"Adversarial Exploration Strategy for Self-Supervised Imitation Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-skill-composition","title":"Automata Guided Skill Composition","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"backplay-man-muss-immer-umkehren-1","title":"Backplay: 'Man muss immer umkehren'","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-games-bringing-exploration-to-robots","title":"Beyond Games: Bringing Exploration to Robots in Real-world","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cem-rl-combining-evolutionary-and-gradient","title":"CEM-RL: Combining evolutionary and gradient-based methods for policy search","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-task-knowledge-transfer-for-visually","title":"Cross-Task Knowledge Transfer for Visually-Grounded Navigation","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-relational","title":"Deep reinforcement learning with relational inductive biases","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"driving-with-style-inverse-reinforcement","title":"Driving with Style: Inverse Reinforcement Learning in General-Purpose Planning for Automated Driving","date":"2019-05-01","arxiv_id":"1905.00229","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-recall-for-efficient-exploration","title":"Explicit Recall for Efficient Exploration","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-intent-inference-via-meta-inverse","title":"Few-Shot Intent Inference via Meta-Inverse Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"guided-evolutionary-strategies-escaping-the-1","title":"Guided Evolutionary Strategies: Escaping the curse of dimensionality in random search","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-via-learning-to-reshape","title":"Inducing Cooperation via Learning to reshape rewards in semi-cooperative multi-agent reinforcement learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inferring-reward-functions-from-demonstrators","title":"Inferring Reward Functions from Demonstrators with Unknown Biases","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"information-theoretic-considerations-in-batch","title":"Information-Theoretic Considerations in Batch Reinforcement Learning","date":"2019-05-01","arxiv_id":"1905.00360","repositories_listed":0,"syntology":null}],"record_sha256":"f8058d9567a7fc971a7217e5631d09a666740a39a191a2460ae3bb14bf192946","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}