{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/135","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":135,"pages_in_order":152,"rows_per_page":100,"rows":[13401,13500],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/134","next":"/task/reinforcement-learning-1/papers/136","papers":[{"url":null,"slug":"tauriel-targeting-traveling-salesman-problem","title":"TauRieL: Targeting Traveling Salesman Problem with a deep reinforcement learning inspired architecture","date":"2019-05-14","arxiv_id":"1905.05567","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-regret-bounds-for-reinforcement","title":"Variational Regret Bounds for Reinforcement Learning","date":"2019-05-14","arxiv_id":"1905.05857","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-multi-agent-reinforcement-learning-based","title":"Deep Multi-Agent Reinforcement Learning Based Cooperative Edge Caching in Wireless Networks","date":"2019-05-13","arxiv_id":"1905.05256","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-reinforcement-learning-for","title":"Distributional Reinforcement Learning for Efficient Exploration","date":"2019-05-13","arxiv_id":"1905.06125","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-and-exploiting-multiple-subgoals-for","title":"Learning and Exploiting Multiple Subgoals for Fast Exploration in Hierarchical Reinforcement Learning","date":"2019-05-13","arxiv_id":"1905.05180","repositories_listed":0,"syntology":null},{"url":null,"slug":"diagnosing-reinforcement-learning-for-traffic","title":"Diagnosing Reinforcement Learning for Traffic Signal Control","date":"2019-05-12","arxiv_id":"1905.04716","repositories_listed":0,"syntology":null},{"url":null,"slug":"metareasoning-in-modular-software-systems-on","title":"Metareasoning in Modular Software Systems: On-the-Fly Configuration using Reinforcement Learning with Rich Contextual Representations","date":"2019-05-12","arxiv_id":"1905.05179","repositories_listed":0,"syntology":null},{"url":null,"slug":"190513315","title":"Graph Attention Memory for Visual Navigation","date":"2019-05-11","arxiv_id":"1905.13315","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimizing-routerless-network-on-chip-designs","title":"Optimizing Routerless Network-on-Chip Designs: An Innovative Learning-Based Framework","date":"2019-05-11","arxiv_id":"1905.04423","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-based-deep-reinforcement-learning","title":"Attention-based Deep Reinforcement Learning for Multi-view Environments","date":"2019-05-10","arxiv_id":"1905.03985","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-artificial-intelligence-agents-for","title":"Design of Artificial Intelligence Agents for Games using Deep Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04127","repositories_listed":0,"syntology":null},{"url":null,"slug":"do-autonomous-agents-benefit-from-hearing","title":"Do Autonomous Agents Benefit from Hearing?","date":"2019-05-10","arxiv_id":"1905.04192","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-adversarial-reinforcement-learning-for","title":"Domain Adversarial Reinforcement Learning for Partial Domain Adaptation","date":"2019-05-10","arxiv_id":"1905.04094","repositories_listed":0,"syntology":null},{"url":null,"slug":"emergent-escape-based-flocking-behavior-using","title":"Emergent Escape-based Flocking Behavior using Multi-Agent Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04077","repositories_listed":0,"syntology":null},{"url":null,"slug":"gan-based-deep-distributional-reinforcement","title":"GAN-powered Deep Distributional Reinforcement Learning for Resource Management in Network Slicing","date":"2019-05-10","arxiv_id":"1905.03929","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-user-association-for-symbiotic","title":"Intelligent User Association for Symbiotic Radio Networks using Deep Reinforcement Learning","date":"2019-05-10","arxiv_id":"1905.04041","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-detection-of-mutual-influences-and","title":"On the Detection of Mutual Influences and Their Consideration in Reinforcement Learning Processes","date":"2019-05-10","arxiv_id":"1905.04205","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-non-stationary","title":"Reinforcement Learning in Non-Stationary Environments","date":"2019-05-10","arxiv_id":"1905.03970","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503440","title":"Path Design for Cellular-Connected UAV with Reinforcement Learning","date":"2019-05-09","arxiv_id":"1905.03440","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503494","title":"Toward Packet Routing with Fully-distributed Multi-agent Deep Reinforcement Learning","date":"2019-05-09","arxiv_id":"1905.03494","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503501","title":"Pretrain Soft Q-Learning with Imperfect Demonstrations","date":"2019-05-09","arxiv_id":"1905.03501","repositories_listed":0,"syntology":null},{"url":null,"slug":"190503726","title":"A Reinforcement Learning Perspective on the Optimal Control of Mutation Probabilities for the (1+1) Evolutionary Algorithm: First Results on the OneMax Problem","date":"2019-05-09","arxiv_id":"1905.03726","repositories_listed":0,"syntology":null},{"url":null,"slug":"190508314","title":"Longitudinal Dynamic versus Kinematic Models for Car-Following Control Using Deep Reinforcement Learning","date":"2019-05-07","arxiv_id":"1905.08314","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-complementary-learning-systems-approach-to","title":"A Complementary Learning Systems Approach to Temporal Difference Learning","date":"2019-05-07","arxiv_id":"1905.02636","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-target-updates-for-q-learning","title":"Accelerated Target Updates for Q-learning","date":"2019-05-07","arxiv_id":"1905.02841","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-and-multi-task-reinforcement","title":"Continual and Multi-task Reinforcement Learning With Shared Episodic Memory","date":"2019-05-07","arxiv_id":"1905.02662","repositories_listed":0,"syntology":null},{"url":null,"slug":"object-exchangeability-in-reinforcement","title":"Object Exchangeability in Reinforcement Learning: Extended Abstract","date":"2019-05-07","arxiv_id":"1905.02698","repositories_listed":0,"syntology":null},{"url":null,"slug":"regal-transfer-learning-for-fast-optimization","title":"Reinforced Genetic Algorithm Learning for Optimizing Computation Graphs","date":"2019-05-07","arxiv_id":"1905.02494","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-planning-and-deep-reinforcement","title":"Combining Planning and Deep Reinforcement Learning in Tactical Decision Making for Autonomous Driving","date":"2019-05-06","arxiv_id":"1905.02680","repositories_listed":0,"syntology":null},{"url":null,"slug":"190511437","title":"A Survey of Adaptive Resonance Theory Neural Network Models for Engineering Applications","date":"2019-05-04","arxiv_id":"1905.11437","repositories_listed":0,"syntology":null},{"url":null,"slug":"face-hallucination-by-attentive-sequence","title":"Face Hallucination by Attentive Sequence Optimization with Reinforcement Learning","date":"2019-05-04","arxiv_id":"1905.01509","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-policy-learning-is-sensitive-to","title":"Hierarchical Policy Learning is Sensitive to Goal Space Design","date":"2019-05-04","arxiv_id":"1905.01537","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-learners-learning-dynamics-are-unlike","title":"Meta-learners' learning dynamics are unlike learners'","date":"2019-05-03","arxiv_id":"1905.01320","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-intelligent-secondary-control-of","title":"Adaptive Intelligent Secondary Control of Microgrids Using a Biologically-Inspired Reinforcement Learning","date":"2019-05-02","arxiv_id":"1905.00557","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-air-traffic-controller-a-deep","title":"Autonomous Air Traffic Controller: A Deep Multi-Agent Reinforcement Learning Approach","date":"2019-05-02","arxiv_id":"1905.01303","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-guider-network-for-multi-dual-learning","title":"A Guider Network for Multi-Dual Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-new-dog-learns-old-tricks-rl-finds-classic","title":"A new dog learns old tricks: RL finds classic optimization algorithms","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"actrce-augmenting-experience-via-teachers-1","title":"ACTRCE: Augmenting Experience via Teacher’s Advice","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-skill-composition","title":"Automata Guided Skill Composition","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"backplay-man-muss-immer-umkehren-1","title":"Backplay: 'Man muss immer umkehren'","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-relational","title":"Deep reinforcement learning with relational inductive biases","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"driving-with-style-inverse-reinforcement","title":"Driving with Style: Inverse Reinforcement Learning in General-Purpose Planning for Automated Driving","date":"2019-05-01","arxiv_id":"1905.00229","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-recall-for-efficient-exploration","title":"Explicit Recall for Efficient Exploration","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"few-shot-intent-inference-via-meta-inverse","title":"Few-Shot Intent Inference via Meta-Inverse Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inducing-cooperation-via-learning-to-reshape","title":"Inducing Cooperation via Learning to reshape rewards in semi-cooperative multi-agent reinforcement learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"information-theoretic-considerations-in-batch","title":"Information-Theoretic Considerations in Batch Reinforcement Learning","date":"2019-05-01","arxiv_id":"1905.00360","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-actionable-representations-with-goal-1","title":"Learning Actionable Representations with Goal Conditioned Policies","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-agents-with-prioritization-and","title":"Learning agents with prioritization and parameter noise in continuous state and action space","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-goal-conditioned-value-functions","title":"Learning Goal-Conditioned Value Functions with one-step Path rewards rather than Goal-Rewards","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-heuristics-for-automated-reasoning-1","title":"Learning Heuristics for Automated Reasoning through Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-control-visual-abstractions-for","title":"Learning to Control Visual Abstractions for Structured Exploration in Deep Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-decompose-compound-questions-with","title":"Learning to Decompose Compound Questions with Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-progressively-plan","title":"Learning to Progressively Plan","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-reinforcement-learn-by-imitation","title":"Learning to Reinforcement Learn by Imitation","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-solve-circuit-sat-an-unsupervised","title":"Learning To Solve Circuit-SAT: An Unsupervised Differentiable Approach","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"m3rl-mind-aware-multi-agent-management","title":"M^3RL: Mind-aware Multi-agent Management Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-the-long-term-future-in-model-based","title":"Modeling the Long Term Future in Model-Based Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-malware-control-with-deep","title":"NEURAL MALWARE CONTROL WITH DEEP REINFORCEMENT LEARNING","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicted-variables-in-programming","title":"Predicted Variables in Programming","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rating-continuous-actions-in-spatial-multi","title":"Rating Continuous Actions in Spatial Multi-Agent Problems","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-policy-learning-in-multi","title":"Sample-efficient policy learning in multi-agent Reinforcement Learning via meta-learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simile-introducing-sequential-information","title":"SIMILE: Introducing Sequential Information towards More Effective Imitation Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-q-learning-with-mutual-information","title":"Soft Q-Learning with Mutual-Information Regularization","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-consistent-performance-on-atari-using","title":"Towards Consistent Performance on Atari using Expert Demonstrations","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncovering-surprising-behaviors-in","title":"Uncovering Surprising Behaviors in Reinforcement Learning via Worst-case Analysis","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-generalizing-alphago-zero","title":"Understanding & Generalizing AlphaGo Zero","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visceral-machines-reinforcement-learning-with-1","title":"Visceral Machines: Reinforcement Learning with Intrinsic Physiological Rewards","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-imagination-for-sample","title":"Generative Adversarial Imagination for Sample Efficient Deep Reinforcement Learning","date":"2019-04-30","arxiv_id":"1904.13255","repositories_listed":0,"syntology":null},{"url":null,"slug":"argus-smartphone-enabled-human-cooperation","title":"Argus: Smartphone-enabled Human Cooperation via Multi-Agent Reinforcement Learning for Disaster Situational Awareness","date":"2019-04-29","arxiv_id":"1906.03037","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-scheduler-for-vehicle","title":"Reinforcement Learning Scheduler for Vehicle-to-Vehicle Communications Outside Coverage","date":"2019-04-29","arxiv_id":"1904.12653","repositories_listed":0,"syntology":null},{"url":null,"slug":"arbitrage-of-energy-storage-in-electricity","title":"Arbitrage of Energy Storage in Electricity Markets with Deep Reinforcement Learning","date":"2019-04-28","arxiv_id":"1904.12232","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-training-autonomous-driving-agent","title":"Self Training Autonomous Driving Agent","date":"2019-04-26","arxiv_id":"1904.12738","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-optimal-1","title":"Deep Reinforcement Learning for Optimal Critical Care Pain Management with Morphine using Dueling Double-Deep Q Networks","date":"2019-04-25","arxiv_id":"1904.11115","repositories_listed":0,"syntology":null},{"url":null,"slug":"ray-interference-a-source-of-plateaus-in-deep","title":"Ray Interference: a Source of Plateaus in Deep Reinforcement Learning","date":"2019-04-25","arxiv_id":"1904.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"190602671","title":"Grounding Natural Language Commands to StarCraft II Game States for Narration-Guided Reinforcement Learning","date":"2019-04-24","arxiv_id":"1906.02671","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-voltage-control-for-grid-operation","title":"Autonomous Voltage Control for Grid Operation Using Deep Reinforcement Learning","date":"2019-04-24","arxiv_id":"1904.10597","repositories_listed":0,"syntology":null},{"url":null,"slug":"cognitive-radar-using-reinforcement-learning","title":"Cognitive Radar Using Reinforcement Learning in Automotive Applications","date":"2019-04-24","arxiv_id":"1904.10739","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-neural-networks-in-reinforcement","title":"Evolving Neural Networks in Reinforcement Learning by means of UMDAc","date":"2019-04-24","arxiv_id":"1904.10932","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-you-act-tells-a-lot-privacy-leakage","title":"How You Act Tells a Lot: Privacy-Leakage Attack on Deep Reinforcement Learning","date":"2019-04-24","arxiv_id":"1904.11082","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-lipschitz-q-learning","title":"Stochastic Lipschitz Q-Learning","date":"2019-04-24","arxiv_id":"1904.10653","repositories_listed":0,"syntology":null},{"url":null,"slug":"driving-decision-and-control-for-autonomous","title":"Driving Decision and Control for Autonomous Lane Change based on Deep Reinforcement Learning","date":"2019-04-23","arxiv_id":"1904.10171","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-exploration-and-exploitation","title":"Generative Exploration and Exploitation","date":"2019-04-21","arxiv_id":"1904.09605","repositories_listed":0,"syntology":null},{"url":null,"slug":"compression-and-localization-in-reinforcement","title":"Compression and Localization in Reinforcement Learning for ATARI Games","date":"2019-04-20","arxiv_id":"1904.09489","repositories_listed":0,"syntology":null},{"url":null,"slug":"190501357","title":"Teaching on a Budget in Multi-Agent Deep Reinforcement Learning","date":"2019-04-19","arxiv_id":"1905.01357","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-molecular-graph-embeddings-with","title":"Decoding Molecular Graph Embeddings with Reinforcement Learning","date":"2019-04-18","arxiv_id":"1904.08915","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-interactive-reinforcement-agent","title":"Improving Interactive Reinforcement Agent Planning with Human Demonstration","date":"2019-04-18","arxiv_id":"1904.08621","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-meaning-semiotics-within-predictive","title":"Making Meaning: Semiotics Within Predictive Knowledge Architectures","date":"2019-04-18","arxiv_id":"1904.09023","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-a-prediction-knowledge","title":"When is a Prediction Knowledge?","date":"2019-04-18","arxiv_id":"1904.09024","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-game-theoretical-framework-for-the","title":"A Game Theoretical Framework for the Evaluation of Unmanned Aircraft Systems Airspace Integration Concepts","date":"2019-04-17","arxiv_id":"1904.08477","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-traffic-signal-control-methods","title":"A Survey on Traffic Signal Control Methods","date":"2019-04-17","arxiv_id":"1904.08117","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-policy-selection-using-active","title":"Bayesian policy selection using active inference","date":"2019-04-17","arxiv_id":"1904.08149","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-emotional","title":"Reinforcement Learning Based Emotional Editing Constraint Conversation Generation","date":"2019-04-17","arxiv_id":"1904.08061","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-3d-navigation-protocols-on-touch","title":"Learning 3D Navigation Protocols on Touch Interfaces with Cooperative Multi-Agent Reinforcement Learning","date":"2019-04-16","arxiv_id":"1904.07802","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-nested-polar-code","title":"Reinforcement Learning for Nested Polar Code Construction","date":"2019-04-16","arxiv_id":"1904.07511","repositories_listed":0,"syntology":null},{"url":null,"slug":"simion-zoo-a-workbench-for-distributed","title":"Simion Zoo: A Workbench for Distributed Experimentation with Reinforcement Learning for Continuous Control Tasks","date":"2019-04-16","arxiv_id":"1904.07817","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-ilqr-resolving-uncertainty-in-model","title":"Curious iLQR: Resolving Uncertainty in Model-based RL","date":"2019-04-15","arxiv_id":"1904.06786","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-options-with-hellinger-distance","title":"Disentangling Options with Hellinger Distance Regularizer","date":"2019-04-15","arxiv_id":"1904.06887","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-interactive-reinforcement-learning","title":"Improving interactive reinforcement learning: What makes a good teacher?","date":"2019-04-15","arxiv_id":"1904.06879","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-autonomous-braking-system","title":"Multi-Objective Autonomous Braking System using Naturalistic Dataset","date":"2019-04-15","arxiv_id":"1904.07705","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-probabilistic","title":"Reinforcement Learning with Probabilistic Guarantees for Autonomous Driving","date":"2019-04-15","arxiv_id":"1904.07189","repositories_listed":0,"syntology":null}],"record_sha256":"cb0b5af47a24b6104a6850c68fad657d68f14a132c8b8f5e4e83729395117ec2","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}