{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/111","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":111,"pages_in_order":132,"rows_per_page":100,"rows":[11001,11100],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/110","next":"/task/reinforcement-learning/papers/112","papers":[{"url":null,"slug":"intrinsic-social-motivation-via-causal","title":"Intrinsic Social Motivation via Causal Influence in Multi-Agent RL","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-meta-solver-for-syntax-guided","title":"Learning a Meta-Solver for Syntax-Guided Program Synthesis","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-abstract-models-for-long-horizon","title":"Learning Abstract Models for Long-Horizon Exploration","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-actionable-representations-with-goal-1","title":"Learning Actionable Representations with Goal Conditioned Policies","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-agents-with-prioritization-and","title":"Learning agents with prioritization and parameter noise in continuous state and action space","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-goal-conditioned-value-functions","title":"Learning Goal-Conditioned Value Functions with one-step Path rewards rather than Goal-Rewards","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-heuristics-for-automated-reasoning-1","title":"Learning Heuristics for Automated Reasoning through Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-control-visual-abstractions-for","title":"Learning to Control Visual Abstractions for Structured Exploration in Deep Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-decompose-compound-questions-with","title":"Learning to Decompose Compound Questions with Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-progressively-plan","title":"Learning to Progressively Plan","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-reinforcement-learn-by-imitation","title":"Learning to Reinforcement Learn by Imitation","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-search-efficient-densenet-with","title":"Learning to Search Efficient DenseNet with Layer-wise Pruning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-solve-circuit-sat-an-unsupervised","title":"Learning To Solve Circuit-SAT: An Unsupervised Differentiable Approach","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"m3rl-mind-aware-multi-agent-management","title":"M^3RL: Mind-aware Multi-agent Management Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-the-long-term-future-in-model-based","title":"Modeling the Long Term Future in Model-Based Reinforcement Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-malware-control-with-deep","title":"NEURAL MALWARE CONTROL WITH DEEP REINFORCEMENT LEARNING","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicted-variables-in-programming","title":"Predicted Variables in Programming","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"rating-continuous-actions-in-spatial-multi","title":"Rating Continuous Actions in Spatial Multi-Agent Problems","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-imitation-learning-from","title":"Reinforced Imitation Learning from Observations","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-policy-learning-in-multi","title":"Sample-efficient policy learning in multi-agent Reinforcement Learning via meta-learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"simile-introducing-sequential-information","title":"SIMILE: Introducing Sequential Information towards More Effective Imitation Learning","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"single-shot-neural-architecture-search-via","title":"Single Shot Neural Architecture Search Via Direct Sparse Optimization","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-q-learning-with-mutual-information","title":"Soft Q-Learning with Mutual-Information Regularization","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ssoc-learning-spontaneous-and-self-organizing","title":"SSoC: Learning Spontaneous and Self-Organizing Communication for Multi-Agent Collaboration","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"strokenet-a-neural-painting-environment","title":"StrokeNet: A Neural Painting Environment","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-consistent-performance-on-atari-using","title":"Towards Consistent Performance on Atari using Expert Demonstrations","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-and-exploration-via-the-information","title":"Transfer and Exploration via the Information Bottleneck","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"two-timescale-networks-for-nonlinear-value","title":"Two-Timescale Networks for Nonlinear Value Function Approximation","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"uncovering-surprising-behaviors-in","title":"Uncovering Surprising Behaviors in Reinforcement Learning via Worst-case Analysis","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"understanding-generalizing-alphago-zero","title":"Understanding & Generalizing AlphaGo Zero","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visceral-machines-reinforcement-learning-with-1","title":"Visceral Machines: Reinforcement Learning with Intrinsic Physiological Rewards","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-imitation-with-a-minimal-adversary","title":"Visual Imitation with a Minimal Adversary","date":"2019-05-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-q-learning-method-for-downlink-power","title":"A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks","date":"2019-04-30","arxiv_id":"1904.13032","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-adversarial-imagination-for-sample","title":"Generative Adversarial Imagination for Sample Efficient Deep Reinforcement Learning","date":"2019-04-30","arxiv_id":"1904.13255","repositories_listed":0,"syntology":null},{"url":null,"slug":"argus-smartphone-enabled-human-cooperation","title":"Argus: Smartphone-enabled Human Cooperation via Multi-Agent Reinforcement Learning for Disaster Situational Awareness","date":"2019-04-29","arxiv_id":"1906.03037","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-scheduler-for-vehicle","title":"Reinforcement Learning Scheduler for Vehicle-to-Vehicle Communications Outside Coverage","date":"2019-04-29","arxiv_id":"1904.12653","repositories_listed":0,"syntology":null},{"url":null,"slug":"arbitrage-of-energy-storage-in-electricity","title":"Arbitrage of Energy Storage in Electricity Markets with Deep Reinforcement Learning","date":"2019-04-28","arxiv_id":"1904.12232","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-training-autonomous-driving-agent","title":"Self Training Autonomous Driving Agent","date":"2019-04-26","arxiv_id":"1904.12738","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-optimal-1","title":"Deep Reinforcement Learning for Optimal Critical Care Pain Management with Morphine using Dueling Double-Deep Q Networks","date":"2019-04-25","arxiv_id":"1904.11115","repositories_listed":0,"syntology":null},{"url":null,"slug":"ray-interference-a-source-of-plateaus-in-deep","title":"Ray Interference: a Source of Plateaus in Deep Reinforcement Learning","date":"2019-04-25","arxiv_id":"1904.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"zapq-learning-for-optimal-stopping-time","title":"Zap Q-Learning for Optimal Stopping Time Problems","date":"2019-04-25","arxiv_id":"1904.11538","repositories_listed":0,"syntology":null},{"url":null,"slug":"190602671","title":"Grounding Natural Language Commands to StarCraft II Game States for Narration-Guided Reinforcement Learning","date":"2019-04-24","arxiv_id":"1906.02671","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-voltage-control-for-grid-operation","title":"Autonomous Voltage Control for Grid Operation Using Deep Reinforcement Learning","date":"2019-04-24","arxiv_id":"1904.10597","repositories_listed":0,"syntology":null},{"url":null,"slug":"cognitive-radar-using-reinforcement-learning","title":"Cognitive Radar Using Reinforcement Learning in Automotive Applications","date":"2019-04-24","arxiv_id":"1904.10739","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-neural-networks-in-reinforcement","title":"Evolving Neural Networks in Reinforcement Learning by means of UMDAc","date":"2019-04-24","arxiv_id":"1904.10932","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-you-act-tells-a-lot-privacy-leakage","title":"How You Act Tells a Lot: Privacy-Leakage Attack on Deep Reinforcement Learning","date":"2019-04-24","arxiv_id":"1904.11082","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-lipschitz-q-learning","title":"Stochastic Lipschitz Q-Learning","date":"2019-04-24","arxiv_id":"1904.10653","repositories_listed":0,"syntology":null},{"url":null,"slug":"target-based-temporal-difference-learning","title":"Target-Based Temporal Difference Learning","date":"2019-04-24","arxiv_id":"1904.10945","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-combining-on-off-policy-methods-for","title":"Towards Combining On-Off-Policy Methods for Real-World Applications","date":"2019-04-24","arxiv_id":"1904.10642","repositories_listed":0,"syntology":null},{"url":null,"slug":"driving-decision-and-control-for-autonomous","title":"Driving Decision and Control for Autonomous Lane Change based on Deep Reinforcement Learning","date":"2019-04-23","arxiv_id":"1904.10171","repositories_listed":0,"syntology":null},{"url":null,"slug":"algorithm-portfolio-for-individual-based","title":"Algorithm Portfolio for Individual-based Surrogate-Assisted Evolutionary Algorithms","date":"2019-04-22","arxiv_id":"1904.09813","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-stationary-markov-decision-processes-a","title":"Non-Stationary Markov Decision Processes, a Worst-Case Approach using Model-Based Reinforcement Learning, Extended version","date":"2019-04-22","arxiv_id":"1904.10090","repositories_listed":0,"syntology":null},{"url":null,"slug":"tripping-through-time-efficient-localization","title":"Tripping through time: Efficient Localization of Activities in Videos","date":"2019-04-22","arxiv_id":"1904.09936","repositories_listed":0,"syntology":null},{"url":null,"slug":"generative-exploration-and-exploitation","title":"Generative Exploration and Exploitation","date":"2019-04-21","arxiv_id":"1904.09605","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-search-for-deep-face","title":"Neural Architecture Search for Deep Face Recognition","date":"2019-04-21","arxiv_id":"1904.09523","repositories_listed":0,"syntology":null},{"url":null,"slug":"compression-and-localization-in-reinforcement","title":"Compression and Localization in Reinforcement Learning for ATARI Games","date":"2019-04-20","arxiv_id":"1904.09489","repositories_listed":0,"syntology":null},{"url":null,"slug":"190501357","title":"Teaching on a Budget in Multi-Agent Deep Reinforcement Learning","date":"2019-04-19","arxiv_id":"1905.01357","repositories_listed":0,"syntology":null},{"url":null,"slug":"decoding-molecular-graph-embeddings-with","title":"Decoding Molecular Graph Embeddings with Reinforcement Learning","date":"2019-04-18","arxiv_id":"1904.08915","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-interactive-reinforcement-agent","title":"Improving Interactive Reinforcement Agent Planning with Human Demonstration","date":"2019-04-18","arxiv_id":"1904.08621","repositories_listed":0,"syntology":null},{"url":null,"slug":"making-meaning-semiotics-within-predictive","title":"Making Meaning: Semiotics Within Predictive Knowledge Architectures","date":"2019-04-18","arxiv_id":"1904.09023","repositories_listed":0,"syntology":null},{"url":null,"slug":"when-is-a-prediction-knowledge","title":"When is a Prediction Knowledge?","date":"2019-04-18","arxiv_id":"1904.09024","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-game-theoretical-framework-for-the","title":"A Game Theoretical Framework for the Evaluation of Unmanned Aircraft Systems Airspace Integration Concepts","date":"2019-04-17","arxiv_id":"1904.08477","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-on-traffic-signal-control-methods","title":"A Survey on Traffic Signal Control Methods","date":"2019-04-17","arxiv_id":"1904.08117","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-policy-selection-using-active","title":"Bayesian policy selection using active inference","date":"2019-04-17","arxiv_id":"1904.08149","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-emotional","title":"Reinforcement Learning Based Emotional Editing Constraint Conversation Generation","date":"2019-04-17","arxiv_id":"1904.08061","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-exploration-with-tight-bayesian","title":"Robust Exploration with Tight Bayesian Plausibility Sets","date":"2019-04-17","arxiv_id":"1904.08528","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-3d-navigation-protocols-on-touch","title":"Learning 3D Navigation Protocols on Touch Interfaces with Cooperative Multi-Agent Reinforcement Learning","date":"2019-04-16","arxiv_id":"1904.07802","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-nested-polar-code","title":"Reinforcement Learning for Nested Polar Code Construction","date":"2019-04-16","arxiv_id":"1904.07511","repositories_listed":0,"syntology":null},{"url":null,"slug":"simion-zoo-a-workbench-for-distributed","title":"Simion Zoo: A Workbench for Distributed Experimentation with Reinforcement Learning for Continuous Control Tasks","date":"2019-04-16","arxiv_id":"1904.07817","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-ilqr-resolving-uncertainty-in-model","title":"Curious iLQR: Resolving Uncertainty in Model-based RL","date":"2019-04-15","arxiv_id":"1904.06786","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-options-with-hellinger-distance","title":"Disentangling Options with Hellinger Distance Regularizer","date":"2019-04-15","arxiv_id":"1904.06887","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-interactive-reinforcement-learning","title":"Improving interactive reinforcement learning: What makes a good teacher?","date":"2019-04-15","arxiv_id":"1904.06879","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-autonomous-braking-system","title":"Multi-Objective Autonomous Braking System using Naturalistic Dataset","date":"2019-04-15","arxiv_id":"1904.07705","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-probabilistic","title":"Reinforcement Learning with Probabilistic Guarantees for Autonomous Driving","date":"2019-04-15","arxiv_id":"1904.07189","repositories_listed":0,"syntology":null},{"url":null,"slug":"saliency-prediction-on-omnidirectional-images","title":"Saliency Prediction on Omnidirectional Images with Generative Adversarial Imitation Learning","date":"2019-04-15","arxiv_id":"1904.07080","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-critical-n-step-training-for-image","title":"Self-critical n-step Training for Image Captioning","date":"2019-04-15","arxiv_id":"1904.06861","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-short-survey-on-memory-based-reinforcement","title":"A Short Survey On Memory Based Reinforcement Learning","date":"2019-04-14","arxiv_id":"1904.06736","repositories_listed":0,"syntology":null},{"url":null,"slug":"dot-to-dot-achieving-structured-robotic","title":"Dot-to-Dot: Explainable Hierarchical Reinforcement Learning for Robotic Manipulation","date":"2019-04-14","arxiv_id":"1904.06703","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-scheduling-function-design-in-sdn","title":"Effective Scheduling Function Design in SDN through Deep Reinforcement Learning","date":"2019-04-12","arxiv_id":"1904.06039","repositories_listed":0,"syntology":null},{"url":null,"slug":"interaction-aware-decision-making-with","title":"Interaction-aware Decision Making with Adaptive Strategies under Merging Scenarios","date":"2019-04-12","arxiv_id":"1904.06025","repositories_listed":0,"syntology":null},{"url":null,"slug":"similarities-between-policy-gradient-methods","title":"Similarities between policy gradient methods (PGM) in Reinforcement learning (RL) and supervised learning (SL)","date":"2019-04-12","arxiv_id":"1904.06260","repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-flow-improve-upon-your-teachers-1","title":"Knowledge Flow: Improve Upon Your Teachers","date":"2019-04-11","arxiv_id":"1904.05878","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-reinforcement-learning-for","title":"Model-Free Reinforcement Learning for Financial Portfolios: A Brief Survey","date":"2019-04-10","arxiv_id":"1904.04973","repositories_listed":0,"syntology":null},{"url":null,"slug":"safer-deep-rl-with-shallow-mcts-a-case-study","title":"Safer Deep RL with Shallow MCTS: A Case Study in Pommerman","date":"2019-04-10","arxiv_id":"1904.05759","repositories_listed":0,"syntology":null},{"url":null,"slug":"embryo-staging-with-weakly-supervised-region","title":"Embryo staging with weakly-supervised region selection and dynamically-decoded predictions","date":"2019-04-09","arxiv_id":"1904.04419","repositories_listed":0,"syntology":null},{"url":null,"slug":"190407961","title":"RL-Based User Association and Resource Allocation for Multi-UAV enabled MEC","date":"2019-04-08","arxiv_id":"1904.07961","repositories_listed":0,"syntology":null},{"url":null,"slug":"creating-pro-level-ai-for-real-time-fighting","title":"Creating Pro-Level AI for a Real-Time Fighting Game Using Deep Reinforcement Learning","date":"2019-04-08","arxiv_id":"1904.03821","repositories_listed":0,"syntology":null},{"url":null,"slug":"jam-me-if-you-can-defeating-jammer-with-deep","title":"\"Jam Me If You Can'': Defeating Jammer with Deep Dueling Neural Network Architecture and Ambient Backscattering Augmented Communications","date":"2019-04-08","arxiv_id":"1904.03897","repositories_listed":0,"syntology":null},{"url":null,"slug":"samples-are-not-all-useful-denoising-policy","title":"Only Relevant Information Matters: Filtering Out Noisy Samples to Boost RL","date":"2019-04-08","arxiv_id":"1904.04025","repositories_listed":0,"syntology":null},{"url":null,"slug":"teaching-gans-to-sketch-in-vector-format","title":"Teaching GANs to Sketch in Vector Format","date":"2019-04-07","arxiv_id":"1904.03620","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-imitation-in-heterogeneous-action","title":"Reinforced Imitation in Heterogeneous Action Space","date":"2019-04-06","arxiv_id":"1904.03438","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-attention-that","title":"Reinforcement Learning with Attention that Works: A Self-Supervised Approach","date":"2019-04-06","arxiv_id":"1904.03367","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-preference-actor-critic","title":"Multi-Preference Actor Critic","date":"2019-04-05","arxiv_id":"1904.03295","repositories_listed":0,"syntology":null},{"url":null,"slug":"reducing-catastrophic-forgetting-when","title":"Reducing catastrophic forgetting when evolving neural networks","date":"2019-04-05","arxiv_id":"1904.03178","repositories_listed":0,"syntology":null},{"url":null,"slug":"structured-agents-for-physical-construction","title":"Structured agents for physical construction","date":"2019-04-05","arxiv_id":"1904.03177","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-a-robot-become-a-movie-director-learning","title":"Can a Robot Become a Movie Director? Learning Artistic Principles for Aerial Cinematography","date":"2019-04-04","arxiv_id":"1904.02579","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-adapting-goals-allow-transfer-of","title":"Self-Adapting Goals Allow Transfer of Predictive Models to New Tasks","date":"2019-04-04","arxiv_id":"1904.02435","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-generative-adversarial-network","title":"Multi-Modal Generative Adversarial Network for Short Product Title Generation in Mobile E-Commerce","date":"2019-04-03","arxiv_id":"1904.01735","repositories_listed":0,"syntology":null},{"url":null,"slug":"paintbot-a-reinforcement-learning-approach","title":"PaintBot: A Reinforcement Learning Approach for Natural Media Painting","date":"2019-04-03","arxiv_id":"1904.02201","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multi-agent-counterfactual-prediction","title":"Robust Multi-agent Counterfactual Prediction","date":"2019-04-03","arxiv_id":"1904.02235","repositories_listed":0,"syntology":null}],"record_sha256":"6acb6b03e6a029485f927582770e9fff672fcab69f1d3612ee797a6d0437a6b7","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}