{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/53","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":53,"pages_in_order":59,"rows_per_page":100,"rows":[5201,5300],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/52","next":"/task/deep-reinforcement-learning/papers/54","papers":[{"url":null,"slug":"rl-rrt-kinodynamic-motion-planning-via","title":"RL-RRT: Kinodynamic Motion Planning via Learning Reachability Estimators from RL Policies","date":"2019-07-10","arxiv_id":"1907.04799","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-financial","title":"Capturing Financial markets to apply Deep Reinforcement Learning","date":"2019-07-09","arxiv_id":"1907.04373","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-based-wireless-resource","title":"Deep Learning based Wireless Resource Allocation with Application to Vehicular Networks","date":"2019-07-07","arxiv_id":"1907.03289","repositories_listed":0,"syntology":null},{"url":null,"slug":"autoslim-an-automatic-dnn-structured-pruning","title":"AutoCompress: An Automatic DNN Structured Pruning Framework for Ultra-High Compression Rates","date":"2019-07-06","arxiv_id":"1907.03141","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-motivation-driven-intuitive-physics","title":"Intrinsic Motivation Driven Intuitive Physics Learning using Deep Reinforcement Learning with Intrinsic Reward Normalization","date":"2019-07-06","arxiv_id":"1907.03116","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-modeling-chit","title":"Deep Reinforcement Learning For Modeling Chit-Chat Dialog With Discrete Attributes","date":"2019-07-05","arxiv_id":"1907.02848","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-inductive-biases-in-deep-reinforcement","title":"On Inductive Biases in Deep Reinforcement Learning","date":"2019-07-05","arxiv_id":"1907.02908","repositories_listed":0,"syntology":null},{"url":null,"slug":"perspective-taking-in-deep-reinforcement","title":"Perspective Taking in Deep Reinforcement Learning Agents","date":"2019-07-03","arxiv_id":"1907.01851","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-face-video-segmentation-via","title":"Dynamic Face Video Segmentation via Reinforcement Learning","date":"2019-07-02","arxiv_id":"1907.01296","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-from-a-few-environments-in","title":"Generalizing from a few environments in safety-critical reinforcement learning","date":"2019-07-02","arxiv_id":"1907.01475","repositories_listed":0,"syntology":null},{"url":null,"slug":"modified-actor-critics","title":"Modified Actor-Critics","date":"2019-07-02","arxiv_id":"1907.01298","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-deep-reinforcement-learning-for","title":"Designing Deep Reinforcement Learning for Human Parameter Exploration","date":"2019-07-01","arxiv_id":"1907.00824","repositories_listed":0,"syntology":null},{"url":"/paper/end-to-end-deep-reinforcement-learning-based","slug":"end-to-end-deep-reinforcement-learning-based","title":"End-to-end Deep Reinforcement Learning Based Coreference Resolution","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fidi-rl-incorporating-deep-reinforcement","title":"FiDi-RL: Incorporating Deep Reinforcement Learning with Finite-Difference Policy Search for Efficient Learning of Continuous Control","date":"2019-07-01","arxiv_id":"1907.00526","repositories_listed":0,"syntology":null},{"url":null,"slug":"collaboration-of-ai-agents-via-cooperative","title":"Collaboration of AI Agents via Cooperative Multi-Agent Deep Reinforcement Learning","date":"2019-06-30","arxiv_id":"1907.00327","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-training-flexible-robots-using-deep","title":"On Training Flexible Robots using Deep Reinforcement Learning","date":"2019-06-29","arxiv_id":"1907.00269","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-cope-with-adversarial-attacks","title":"Learning to Cope with Adversarial Attacks","date":"2019-06-28","arxiv_id":"1906.12061","repositories_listed":0,"syntology":null},{"url":null,"slug":"demonstration-guided-deep-reinforcement","title":"Demonstration-Guided Deep Reinforcement Learning of Control Policies for Dexterous Human-Robot Interaction","date":"2019-06-27","arxiv_id":"1906.11695","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-navigation-of-active-particles-in","title":"Efficient Navigation of Colloidal Robots in an Unknown Environment via Deep Reinforcement Learning","date":"2019-06-26","arxiv_id":"1906.10844","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-proximaltrust-region-policy","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","date":"2019-06-25","arxiv_id":"1906.10306","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-conservative-policy-iteration","title":"Deep Conservative Policy Iteration","date":"2019-06-24","arxiv_id":"1906.09784","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-with","title":"Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction","date":"2019-06-21","arxiv_id":"1906.09205","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-lane-changing-via-deep","title":"Cooperative Lane Changing via Deep Reinforcement Learning","date":"2019-06-20","arxiv_id":"1906.08662","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-multiple-agents-learn-to-schedule-a","title":"When Multiple Agents Learn to Schedule: A Distributed Radio Resource Management Framework","date":"2019-06-20","arxiv_id":"1906.08792","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-user-resource-control-with-deep","title":"Multi-user Resource Control with Deep Reinforcement Learning in IoT Edge Computing","date":"2019-06-19","arxiv_id":"1906.07860","repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing","title":"Reward Prediction Error as an Exploration Objective in Deep RL","date":"2019-06-19","arxiv_id":"1906.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"disco-influence-maximization-meets-network","title":"DISCO: Influence Maximization Meets Network Embedding and Deep Learning","date":"2019-06-18","arxiv_id":"1906.07378","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-gray-box-approach-for-curriculum-learning","title":"A gray-box approach for curriculum learning","date":"2019-06-17","arxiv_id":"1906.06812","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-successor-features-based-deep","title":"Universal Successor Features Based Deep Reinforcement Learning for Navigation","date":"2019-06-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"self-tuning-sectorization-deep-reinforcement","title":"Self-Tuning Sectorization: Deep Reinforcement Learning Meets Broadcast Beam Optimization","date":"2019-06-14","arxiv_id":"1906.06021","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-cyber","title":"Deep Reinforcement Learning for Cyber Security","date":"2019-06-13","arxiv_id":"1906.05799","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-unmanned","title":"Deep Reinforcement Learning for Unmanned Aerial Vehicle-Assisted Vehicular Networks","date":"2019-06-12","arxiv_id":"1906.05015","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-non-stationarity-in-multi-agent","title":"Dealing with Non-Stationarity in Multi-Agent Deep Reinforcement Learning","date":"2019-06-11","arxiv_id":"1906.04737","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-control-of-artificial-avatars","title":"Deep learning control of artificial avatars in group coordination tasks","date":"2019-06-11","arxiv_id":"1906.04656","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-discrete","title":"Deep Reinforcement Learning with Discrete Normalized Advantage Functions for Resource Management in Network Slicing","date":"2019-06-10","arxiv_id":"1906.04594","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-heterogeneous-scheduler","title":"Neural Heterogeneous Scheduler","date":"2019-06-09","arxiv_id":"1906.03724","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-by-modeling-a-distribution","title":"Transfer Learning by Modeling a Distribution over Policies","date":"2019-06-09","arxiv_id":"1906.03574","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-active-learning-from-human-data-a","title":"Multi-modal Active Learning From Human Data: A Deep Reinforcement Learning Approach","date":"2019-06-07","arxiv_id":"1906.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-extensible-interactive-interface-for-agent","title":"An Extensible Interactive Interface for Agent Design","date":"2019-06-06","arxiv_id":"1906.02641","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-1","title":"Deep Reinforcement Learning for Multi-objective Optimization","date":"2019-06-06","arxiv_id":"1906.02386","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-for-directed-acyclic-graph","title":"Deep Q-Learning for Directed Acyclic Graph Generation","date":"2019-06-05","arxiv_id":"1906.02280","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-polynomial-proofs","title":"Learning dynamic polynomial proofs","date":"2019-06-04","arxiv_id":"1906.01681","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-via-off-policy","title":"Off-Policy Evaluation via Off-Policy Classification","date":"2019-06-04","arxiv_id":"1906.01624","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-board-deep-q-network-for-uav-assisted","title":"On-board Deep Q-Network for UAV-assisted Online Power Transfer and Data Collection","date":"2019-06-04","arxiv_id":"1906.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"options-as-responses-grounding-behavioural","title":"Options as responses: Grounding behavioural hierarchies in multi-agent RL","date":"2019-06-04","arxiv_id":"1906.01470","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600571","title":"Deep Reinforcement Learning Architecture for Continuous Power Allocation in High Throughput Satellites","date":"2019-06-03","arxiv_id":"1906.00571","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600625","title":"Decentralized Deep Reinforcement Learning for Delay-Power Tradeoff in Vehicular Communications","date":"2019-06-03","arxiv_id":"1906.00625","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600767","title":"Load Balancing for Ultra-Dense Networks: A Deep Reinforcement Learning Based Approach","date":"2019-06-03","arxiv_id":"1906.00767","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-exploitation-of-policy-imitation","title":"Adversarial Exploitation of Policy Imitation","date":"2019-06-03","arxiv_id":"1906.01121","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-based-method-for-benchmarking-the","title":"RL-Based Method for Benchmarking the Adversarial Resilience and Robustness of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01110","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-triggers-for-watermarking-of-deep","title":"Sequential Triggers for Watermarking of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01126","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600131","title":"Decision-Making in Reinforcement Learning","date":"2019-06-01","arxiv_id":"1906.00131","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-bayesian-compression-via-deep","title":"Enhanced Bayesian Compression via Deep Reinforcement Learning","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-medical-test-suggestions-using-deep","title":"Effective Medical Test Suggestions Using Deep Reinforcement Learning","date":"2019-05-30","arxiv_id":"1905.12916","repositories_listed":0,"syntology":null},{"url":null,"slug":"targeted-attacks-on-deep-reinforcement","title":"CopyCAT: Taking Control of Neural Policies with Constant Attacks","date":"2019-05-29","arxiv_id":"1905.12282","repositories_listed":0,"syntology":null},{"url":null,"slug":"190601408","title":"Hypothesis-Driven Skill Discovery for Hierarchical Deep Reinforcement Learning","date":"2019-05-27","arxiv_id":"1906.01408","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentgraph-towards-universal-dialogue","title":"AgentGraph: Towards Universal Dialogue Management with Structured Deep Reinforcement Learning","date":"2019-05-27","arxiv_id":"1905.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"190512726","title":"Prioritized Sequence Experience Replay","date":"2019-05-25","arxiv_id":"1905.12726","repositories_listed":0,"syntology":null},{"url":null,"slug":"aspire-automated-security-policy","title":"Transferable Cost-Aware Security Policy Implementation for Malware Detection Using Deep Reinforcement Learning","date":"2019-05-25","arxiv_id":"1905.10517","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-ensembles-of-policies-with-deep","title":"Composing Task-Agnostic Policies with Deep Reinforcement Learning","date":"2019-05-25","arxiv_id":"1905.10681","repositories_listed":0,"syntology":null},{"url":"/paper/learning-to-reason-in-large-theories-without","slug":"learning-to-reason-in-large-theories-without","title":"Learning to Reason in Large Theories without Imitation","date":"2019-05-25","arxiv_id":"1905.10501","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-detecting","title":"Deep Reinforcement Learning for Detecting Malicious Websites","date":"2019-05-22","arxiv_id":"1905.09207","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-deep-q","title":"Stochastic Variance Reduction for Deep Q-learning","date":"2019-05-20","arxiv_id":"1905.08152","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-channel","title":"Deep Reinforcement Learning-Based Channel Allocation for Wireless LANs with Graph Convolutional Networks","date":"2019-05-17","arxiv_id":"1905.07144","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-support-of-over-parametrization-in-deep","title":"In Support of Over-Parametrization in Deep Reinforcement Learning: an Empirical Study","date":"2019-05-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"replab-a-reproducible-low-cost-arm-benchmark","title":"REPLAB: A Reproducible Low-Cost Arm Benchmark Platform for Robotic Learning","date":"2019-05-17","arxiv_id":"1905.07447","repositories_listed":0,"syntology":null},{"url":null,"slug":"stratospheric-aerosol-injection-as-a-deep","title":"Stratospheric Aerosol Injection as a Deep Reinforcement Learning Problem","date":"2019-05-17","arxiv_id":"1905.07366","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-sequential-decision-making","title":"Knowledge-Based Sequential Decision-Making Under Uncertainty","date":"2019-05-16","arxiv_id":"1905.07030","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-learn-to-communicate","title":"Learning to learn to communicate","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scheduling-in","title":"Deep reinforcement learning for scheduling in large-scale networked control systems","date":"2019-05-15","arxiv_id":"1905.05992","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scheduling-in-1","title":"Deep Reinforcement Learning for Scheduling in Cellular Networks","date":"2019-05-15","arxiv_id":"1905.05914","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-active-spine-behaviors-for-dynamic","title":"Learning Active Spine Behaviors for Dynamic and Efficient Locomotion in Quadruped Robots","date":"2019-05-15","arxiv_id":"1905.06077","repositories_listed":0,"syntology":null},{"url":null,"slug":"tauriel-targeting-traveling-salesman-problem","title":"TauRieL: Targeting Traveling Salesman Problem with a deep reinforcement learning inspired architecture","date":"2019-05-14","arxiv_id":"1905.05567","repositories_listed":0,"syntology":null},{"url":null,"slug":"diagnosing-reinforcement-learning-for-traffic","title":"Diagnosing Reinforcement Learning for Traffic Signal Control","date":"2019-05-12","arxiv_id":"1905.04716","repositories_listed":0,"syntology":null},{"url":null,"slug":"190513315","title":"Graph Attention Memory for Visual Navigation","date":"2019-05-11","arxiv_id":"1905.13315","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-routerless-network-on-chip-designs","title":"Optimizing Routerless Network-on-Chip Designs: An Innovative Learning-Based Framework","date":"2019-05-11","arxiv_id":"1905.04423","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-deep-reinforcement-learning","title":"Attention-based Deep Reinforcement Learning for Multi-view Environments","date":"2019-05-10","arxiv_id":"1905.03985","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-artificial-intelligence-agents-for","title":"Design of Artificial Intelligence Agents for Games using Deep Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04127","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-autonomous-agents-benefit-from-hearing","title":"Do Autonomous Agents Benefit from Hearing?","date":"2019-05-10","arxiv_id":"1905.04192","repositories_listed":0,"syntology":null},{"url":null,"slug":"gan-based-deep-distributional-reinforcement","title":"GAN-powered Deep Distributional Reinforcement Learning for Resource Management in Network Slicing","date":"2019-05-10","arxiv_id":"1905.03929","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-user-association-for-symbiotic","title":"Intelligent User Association for Symbiotic Radio Networks using Deep Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04041","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503494","title":"Toward Packet Routing with Fully-distributed Multi-agent Deep Reinforcement Learning","date":"2019-05-09","arxiv_id":"1905.03494","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503517","title":"Mitigating Deep Learning Vulnerabilities from Adversarial Examples Attack in the Cybersecurity Domain","date":"2019-05-09","arxiv_id":"1905.03517","repositories_listed":0,"syntology":null},{"url":null,"slug":"190508314","title":"Longitudinal Dynamic versus Kinematic Models for Car-Following Control Using Deep Reinforcement Learning","date":"2019-05-07","arxiv_id":"1905.08314","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-exchangeability-in-reinforcement","title":"Object Exchangeability in Reinforcement Learning: Extended Abstract","date":"2019-05-07","arxiv_id":"1905.02698","repositories_listed":0,"syntology":null},{"url":null,"slug":"regal-transfer-learning-for-fast-optimization","title":"Reinforced Genetic Algorithm Learning for Optimizing Computation Graphs","date":"2019-05-07","arxiv_id":"1905.02494","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-planning-and-deep-reinforcement","title":"Combining Planning and Deep Reinforcement Learning in Tactical Decision Making for Autonomous Driving","date":"2019-05-06","arxiv_id":"1905.02680","repositories_listed":0,"syntology":null},{"url":null,"slug":"deeprmsa-a-deep-reinforcement-learning","title":"DeepRMSA: A Deep Reinforcement Learning Framework for Routing, Modulation and Spectrum Assignment in Elastic Optical Networks","date":"2019-05-06","arxiv_id":"1905.02248","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-meta-controller-adaptive-alternation","title":"Curious Meta-Controller: Adaptive Alternation between Model-Based and Model-Free Control in Deep Reinforcement Learning","date":"2019-05-05","arxiv_id":"1905.01718","repositories_listed":0,"syntology":null},{"url":null,"slug":"face-hallucination-by-attentive-sequence","title":"Face Hallucination by Attentive Sequence Optimization with Reinforcement Learning","date":"2019-05-04","arxiv_id":"1905.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-exploration-strategy-for-self-1","title":"Adversarial Exploration Strategy for Self-Supervised Imitation Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-skill-composition","title":"Automata Guided Skill Composition","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cem-rl-combining-evolutionary-and-gradient","title":"CEM-RL: Combining evolutionary and gradient-based methods for policy search","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cross-task-knowledge-transfer-for-visually","title":"Cross-Task Knowledge Transfer for Visually-Grounded Navigation","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-relational","title":"Deep reinforcement learning with relational inductive biases","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-recall-for-efficient-exploration","title":"Explicit Recall for Efficient Exploration","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-via-learning-to-reshape","title":"Inducing Cooperation via Learning to reshape rewards in semi-cooperative multi-agent reinforcement learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-heuristics-for-automated-reasoning-1","title":"Learning Heuristics for Automated Reasoning through Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-control-visual-abstractions-for","title":"Learning to Control Visual Abstractions for Structured Exploration in Deep Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-malware-control-with-deep","title":"NEURAL MALWARE CONTROL WITH DEEP REINFORCEMENT LEARNING","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"3a69cfc8ded265bf2d53b0f82ec8066c06f7422803d9dd61185ba9c0ae683810","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}