{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/deep-reinforcement-learning/papers/52","list_of":"/task/deep-reinforcement-learning","task":"Deep Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":52,"pages_in_order":59,"rows_per_page":100,"rows":[5101,5200],"of":5822,"counts":{"archive_papers_tagged":5822,"with_a_code_link":1739,"where_syntology_ran_a_sample":398,"not_listed_spam_title":0,"listed":5822,"listed_where_code_ran":398,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":340,"every_run_a_failure_of_syntologys_instrument":58,"listed_with_a_run_with_no_instrument_failure":340,"listed_every_run_a_failure_of_syntologys_instrument":58,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/deep-reinforcement-learning","prev":"/task/deep-reinforcement-learning/papers/51","next":"/task/deep-reinforcement-learning/papers/53","papers":[{"url":null,"slug":"hippocampal-neuronal-representations-in","title":"HIPPOCAMPAL NEURONAL REPRESENTATIONS IN CONTINUAL LEARNING","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"how-many-weights-are-enough-can-tensor","title":"How many weights are enough : can tensor factorization learn efficient policies ?","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-exploration-of-deep-reinforcement","title":"Improving Exploration of Deep Reinforcement Learning using Planning for Policy Search","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-key-steps-to-attack-deep","title":"Learning Key Steps to Attack Deep Reinforcement Learning Agents","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-latent-representations-for-inverse","title":"Learning Latent Representations for Inverse Dynamics using Generalized Experiences","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-semantically-meaningful","title":"Learning Semantically Meaningful Representations Through Embodiment","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"long-term-planning-short-term-adjustments","title":"Long-term planning, short-term adjustments","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"moet-interpretable-and-verifiable-1","title":"MoET: Interpretable and Verifiable Reinforcement Learning via Mixture of Expert Trees","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-step-greedy-policies-in-model-free-deep","title":"Multi-step Greedy Policies in Model-Free Deep Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing-1","title":"QXplore: Q-Learning Exploration by Maximizing Temporal Difference Error","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"ros-hpl-robotic-object-search-with","title":"ROS-HPL: Robotic Object Search with Hierarchical Policy Learning and Intrinsic-Extrinsic Modeling","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"stabilizing-off-policy-reinforcement-learning-1","title":"Stabilizing Off-Policy Reinforcement Learning with Conservative Policy Gradients","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"striving-for-simplicity-in-off-policy-deep-1","title":"Striving for Simplicity in Off-Policy Deep Reinforcement Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-simplicity-in-deep-reinforcement","title":"Towards Simplicity in Deep Reinforcement Learning: Streamlined Off-Policy Learning","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"zero-shot-policy-transfer-with-disentangled","title":"Zero-Shot Policy Transfer with Disentangled Attention","date":"2019-09-25","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"controlling-an-autonomous-vehicle-with-deep","title":"Controlling an Autonomous Vehicle with Deep Reinforcement Learning","date":"2019-09-24","arxiv_id":"1909.12153","repositories_listed":0,"syntology":null},{"url":null,"slug":"power-allocation-in-cache-aided-noma-systems","title":"Power Allocation in Cache-Aided NOMA Systems: Optimization and Deep Reinforcement Learning Approaches","date":"2019-09-24","arxiv_id":"1909.11074","repositories_listed":0,"syntology":null},{"url":null,"slug":"190910157","title":"Active collaboration in relative observation for Multi-agent visual SLAM based on Deep Q Network","date":"2019-09-23","arxiv_id":"1909.10157","repositories_listed":0,"syntology":null},{"url":null,"slug":"190910304","title":"Where to Look Next: Unsupervised Active Visual Exploration on 360° Input","date":"2019-09-23","arxiv_id":"1909.10304","repositories_listed":0,"syntology":null},{"url":null,"slug":"190910400","title":"Robot Navigation in Crowds by Graph Convolutional Networks with Attention Learned from Human Gaze","date":"2019-09-23","arxiv_id":"1909.10400","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-attractor-selection-using-deep","title":"Constrained Attractor Selection Using Deep Reinforcement Learning","date":"2019-09-23","arxiv_id":"1909.10500","repositories_listed":0,"syntology":null},{"url":null,"slug":"integrating-independent-and-centralized-multi","title":"Integrating independent and centralized multi-agent reinforcement learning for traffic signal network optimization","date":"2019-09-23","arxiv_id":"1909.10651","repositories_listed":0,"syntology":null},{"url":null,"slug":"sensor-augmented-neural-adaptive-bitrate","title":"Sensor-Augmented Neural Adaptive Bitrate Video Streaming on UAVs","date":"2019-09-23","arxiv_id":"1909.10914","repositories_listed":0,"syntology":null},{"url":null,"slug":"190909906","title":"Leveraging Human Guidance for Deep Reinforcement Learning Tasks","date":"2019-09-21","arxiv_id":"1909.09906","repositories_listed":0,"syntology":null},{"url":null,"slug":"190909705","title":"A Layered Architecture for Active Perception: Image Classification using Deep Reinforcement Learning","date":"2019-09-20","arxiv_id":"1909.09705","repositories_listed":0,"syntology":null},{"url":null,"slug":"how-much-do-unstated-problem-constraints","title":"How Much Do Unstated Problem Constraints Limit Deep Robotic Reinforcement Learning?","date":"2019-09-20","arxiv_id":"1909.09282","repositories_listed":0,"syntology":null},{"url":null,"slug":"macs-deep-reinforcement-learning-based-sdn","title":"MACS: Deep Reinforcement Learning based SDN Controller Synchronization Policy Design","date":"2019-09-19","arxiv_id":"1909.09063","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-lane-change-decision-making-using","title":"Automated Lane Change Decision Making using Deep Reinforcement Learning in Dynamic and Uncertain Highway Environment","date":"2019-09-18","arxiv_id":"1909.11538","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepgait-planning-and-control-of-quadrupedal","title":"DeepGait: Planning and Control of Quadrupedal Gaits using Deep Reinforcement Learning","date":"2019-09-18","arxiv_id":"1909.08399","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-tracking-by-means-of-deep","title":"Visual Tracking by means of Deep Reinforcement Learning and an Expert Demonstrator","date":"2019-09-18","arxiv_id":"1909.08487","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-tracking-prediction-and-decision","title":"A Review of Tracking, Prediction and Decision Making Methods for Autonomous Driving","date":"2019-09-17","arxiv_id":"1909.07707","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-feature-training-for","title":"Adversarial Feature Training for Generalizable Robotic Visuomotor Control","date":"2019-09-17","arxiv_id":"1909.07745","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-task-driven","title":"Selective Network Discovery via Deep Reinforcement Learning on Embedded Spaces","date":"2019-09-16","arxiv_id":"1909.07294","repositories_listed":0,"syntology":null},{"url":null,"slug":"job-scheduling-on-data-centers-with-deep","title":"Data Centers Job Scheduling with Deep Reinforcement Learning","date":"2019-09-16","arxiv_id":"1909.07820","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-prediction-network-model-free-behavior","title":"Policy Prediction Network: Model-Free Behavior Policy with Model-Based Learning in Continuous Action Space","date":"2019-09-15","arxiv_id":"1909.07373","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-collaboration-for-robot-assisted","title":"Learning to Collaborate from Simulation for Robot-Assisted Dressing","date":"2019-09-14","arxiv_id":"1909.06682","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuromodulated-patience-for-robot-and-self","title":"Neuromodulated Patience for Robot and Self-Driving Vehicle Navigation","date":"2019-09-14","arxiv_id":"1909.06533","repositories_listed":0,"syntology":null},{"url":null,"slug":"aituning-machine-learning-based-tuning-tool","title":"AITuning: Machine Learning-based Tuning Tool for Run-Time Communication Libraries","date":"2019-09-13","arxiv_id":"1909.06301","repositories_listed":0,"syntology":null},{"url":null,"slug":"petri-net-machines-for-human-agent","title":"Petri Net Machines for Human-Agent Interaction","date":"2019-09-13","arxiv_id":"1909.06174","repositories_listed":0,"syntology":null},{"url":null,"slug":"mat-multi-fingered-adaptive-tactile-grasping","title":"MAT: Multi-Fingered Adaptive Tactile Grasping via Deep Reinforcement Learning","date":"2019-09-10","arxiv_id":"1909.04787","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-online-1","title":"DEAR: Deep Reinforcement Learning for Online Advertising Impression in Recommender Systems","date":"2019-09-09","arxiv_id":"1909.03602","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-value-policy-gradients","title":"Deterministic Value-Policy Gradients","date":"2019-09-09","arxiv_id":"1909.03939","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-continual-combinatorial-selection-via","title":"Solving Continual Combinatorial Selection via Deep Reinforcement Learning","date":"2019-09-09","arxiv_id":"1909.03638","repositories_listed":0,"syntology":null},{"url":"/paper/imitation-learning-for-human-pose-prediction","slug":"imitation-learning-for-human-pose-prediction","title":"Imitation Learning for Human Pose Prediction","date":"2019-09-08","arxiv_id":"1909.03449","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-driving-scale-car-trained-by-deep","title":"Self-driving scale car trained by Deep reinforcement learning","date":"2019-09-08","arxiv_id":"1909.03467","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-financial-trading-agent-for-low","title":"Automatic Financial Trading Agent for Low-risk Portfolio Management using Deep Reinforcement Learning","date":"2019-09-07","arxiv_id":"1909.03278","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-policy-gradient-method-for-maximum","title":"Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning","date":"2019-09-07","arxiv_id":"1909.03198","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-few-to-more-large-scale-dynamic","title":"From Few to More: Large-scale Dynamic Multiagent Curriculum Learning","date":"2019-09-06","arxiv_id":"1909.02790","repositories_listed":0,"syntology":null},{"url":null,"slug":"ledeepchef-deep-reinforcement-learning-agent","title":"LeDeepChef: Deep Reinforcement Learning Agent for Families of Text-Based Games","date":"2019-09-04","arxiv_id":"1909.01646","repositories_listed":0,"syntology":null},{"url":null,"slug":"quasi-newton-optimization-methods-for-deep","title":"Quasi-Newton Optimization Methods For Deep Learning Applications","date":"2019-09-04","arxiv_id":"1909.01994","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-smart-sliding-chinese-pinyin-input-method","title":"A Smart Sliding Chinese Pinyin Input Method Editor on Touchscreen","date":"2019-09-03","arxiv_id":"1909.01063","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-in-transfer-learning","title":"Generalization in Transfer Learning","date":"2019-09-03","arxiv_id":"1909.01331","repositories_listed":0,"syntology":null},{"url":null,"slug":"logic-and-the-2-simplicial-transformer","title":"Logic and the $2$-Simplicial Transformer","date":"2019-09-02","arxiv_id":"1909.00668","repositories_listed":0,"syntology":null},{"url":null,"slug":"to-combine-or-not-to-combine-a-rainbow-deep","title":"To Combine or Not To Combine? A Rainbow Deep Reinforcement Learning Agent for Dialog Policies","date":"2019-09-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-with-1","title":"Deep Reinforcement Learning with Distributional Semantic Rewards for Abstractive Summarization","date":"2019-08-31","arxiv_id":"1909.00141","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-actor-critic-reinforcement-learning-for","title":"Deep Actor-Critic Reinforcement Learning for Anomaly Detection","date":"2019-08-28","arxiv_id":"1908.10755","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-chatbots","title":"Deep Reinforcement Learning for Chatbots Using Clustered Actions and Human-Likeness Rewards","date":"2019-08-27","arxiv_id":"1908.10331","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-based-deep-reinforcement-learning","title":"Ensemble-Based Deep Reinforcement Learning for Chatbots","date":"2019-08-27","arxiv_id":"1908.10422","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to","title":"A Deep Reinforcement Learning Approach to Multi-component Job Scheduling in Edge Computing","date":"2019-08-26","arxiv_id":"1908.10290","repositories_listed":0,"syntology":null},{"url":null,"slug":"tutorial-and-survey-on-probabilistic","title":"Tutorial and Survey on Probabilistic Graphical Model and Variational Inference in Deep Reinforcement Learning","date":"2019-08-25","arxiv_id":"1908.09381","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-foreign","title":"Deep Reinforcement Learning for Foreign Exchange Trading","date":"2019-08-21","arxiv_id":"1908.08036","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-actor-critic-reinforcement-learning","title":"A Deep Actor-Critic Reinforcement Learning Framework for Dynamic Multichannel Access","date":"2019-08-20","arxiv_id":"1908.08401","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-sit-synthesizing-human-chair","title":"Learning to Sit: Synthesizing Human-Chair Interactions via Hierarchical Control","date":"2019-08-20","arxiv_id":"1908.07423","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-flight-control-a-domain","title":"A Domain-Knowledge-Aided Deep Reinforcement Learning Approach for Flight Control Design","date":"2019-08-19","arxiv_id":"1908.06884","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-in-deep-reinforcement-learning-using-2","title":"Transfer in Deep Reinforcement Learning using Knowledge Graphs","date":"2019-08-19","arxiv_id":"1908.06556","repositories_listed":0,"syntology":null},{"url":null,"slug":"privacy-preserved-task-offloading-in-mobile","title":"Privacy-Preserved Task Offloading in Mobile Blockchain with Deep Reinforcement Learning","date":"2019-08-15","arxiv_id":"1908.07467","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-deep-reinforcement-learning-4","title":"Sample-efficient Deep Reinforcement Learning with Imaginary Rollouts for Human-Robot Interaction","date":"2019-08-15","arxiv_id":"1908.05546","repositories_listed":0,"syntology":null},{"url":null,"slug":"secure-computation-offloading-in-blockchain","title":"Secure Computation Offloading in Blockchain based IoT Networks with Deep Reinforcement Learning","date":"2019-08-15","arxiv_id":"1908.07466","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-for-high-dimensional-state","title":"Continuous Control for High-Dimensional State Spaces: An Interactive Learning Approach","date":"2019-08-14","arxiv_id":"1908.05256","repositories_listed":0,"syntology":null},{"url":null,"slug":"skill-transfer-in-deep-reinforcement-learning","title":"Skill Transfer in Deep Reinforcement Learning under Morphological Heterogeneity","date":"2019-08-14","arxiv_id":"1908.05265","repositories_listed":0,"syntology":null},{"url":null,"slug":"competitive-multi-agent-deep-reinforcement","title":"Competitive Multi-Agent Deep Reinforcement Learning with Counterfactual Thinking","date":"2019-08-13","arxiv_id":"1908.04573","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-crystallized-adaptivity-to-fluid","title":"From Crystallized Adaptivity to Fluid Adaptivity in Deep Reinforcement Learning -- Insights from Biological Systems on Adaptive Flexibility","date":"2019-08-13","arxiv_id":"1908.05348","repositories_listed":0,"syntology":null},{"url":null,"slug":"superstition-in-the-network-deep","title":"Superstition in the Network: Deep Reinforcement Learning Plays Deceptive Games","date":"2019-08-12","arxiv_id":"1908.04436","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-cooperative-multi-agent-deep","title":"A Review of Cooperative Multi-Agent Deep Reinforcement Learning","date":"2019-08-11","arxiv_id":"1908.03963","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-grasp-from-25d-images-a-deep","title":"Learning to Grasp from 2.5D images: a Deep Reinforcement Learning Approach","date":"2019-08-08","arxiv_id":"1908.03440","repositories_listed":0,"syntology":null},{"url":null,"slug":"progressive-relation-learning-for-group","title":"Progressive Relation Learning for Group Activity Recognition","date":"2019-08-08","arxiv_id":"1908.02948","repositories_listed":0,"syntology":null},{"url":null,"slug":"large-scale-traffic-signal-control-using","title":"Large-scale traffic signal control using machine learning: some traffic flow considerations","date":"2019-08-07","arxiv_id":"1908.02673","repositories_listed":0,"syntology":null},{"url":null,"slug":"age-of-information-aware-radio-resource","title":"Age of Information-Aware Radio Resource Management in Vehicular Networks: A Proactive Deep Reinforcement Learning Perspective","date":"2019-08-06","arxiv_id":"1908.02047","repositories_listed":0,"syntology":null},{"url":null,"slug":"promoting-coordination-through-policy","title":"Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning","date":"2019-08-06","arxiv_id":"1908.02269","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-system","title":"A View on Deep Reinforcement Learning in System Optimization","date":"2019-08-04","arxiv_id":"1908.01275","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-deep-reinforcement-learning-in","title":"Improving Deep Reinforcement Learning in Minecraft with Action Advice","date":"2019-08-02","arxiv_id":"1908.01007","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-attacks-on-reinforcement-learning","title":"Optimal Attacks on Reinforcement Learning Policies","date":"2019-07-31","arxiv_id":"1907.13548","repositories_listed":0,"syntology":null},{"url":null,"slug":"precodernet-hybrid-beamforming-for-millimeter","title":"PrecoderNet: Hybrid Beamforming for Millimeter Wave Systems with Deep Reinforcement Learning","date":"2019-07-31","arxiv_id":"1907.13266","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepplace-learning-to-place-applications-in","title":"DeepPlace: Learning to Place Applications in Multi-Tenant Clusters","date":"2019-07-30","arxiv_id":"1907.12916","repositories_listed":0,"syntology":null},{"url":null,"slug":"taxable-stock-trading-with-deep-reinforcement","title":"Taxable Stock Trading with Deep Reinforcement Learning","date":"2019-07-28","arxiv_id":"1907.12093","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-personalized","title":"Deep Reinforcement Learning for Personalized Search Story Recommendation","date":"2019-07-26","arxiv_id":"1907.11754","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-guidance-with-mcts-for-deep","title":"Action Guidance with MCTS for Deep Reinforcement Learning","date":"2019-07-25","arxiv_id":"1907.11703","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-input-for-deep-reinforcement-learning","title":"Dynamic Input for Deep Reinforcement Learning in Autonomous Driving","date":"2019-07-25","arxiv_id":"1907.10994","repositories_listed":0,"syntology":null},{"url":null,"slug":"alphastock-a-buying-winners-and-selling","title":"AlphaStock: A Buying-Winners-and-Selling-Losers Investment Strategy using Interpretable Deep Reinforcement Attention Networks","date":"2019-07-24","arxiv_id":"1908.02646","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-in-reinforcement-learning-2","title":"Fairness in Reinforcement Learning","date":"2019-07-24","arxiv_id":"1907.10323","repositories_listed":0,"syntology":null},{"url":null,"slug":"terminal-prediction-as-an-auxiliary-task-for","title":"Terminal Prediction as an Auxiliary Task for Deep Reinforcement Learning","date":"2019-07-24","arxiv_id":"1907.10827","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-modeling-as-auxiliary-task-for-deep","title":"Agent Modeling as Auxiliary Task for Deep Reinforcement Learning","date":"2019-07-22","arxiv_id":"1907.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-autonomous-1","title":"Deep Reinforcement Learning for Autonomous Internet of Things: Model, Applications and Challenges","date":"2019-07-22","arxiv_id":"1907.09059","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-clinical","title":"Deep Reinforcement Learning for Clinical Decision Support: A Brief Survey","date":"2019-07-22","arxiv_id":"1907.09475","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-actor-critic-attention-mechanism-for-deep","title":"An Actor-Critic-Attention Mechanism for Deep Reinforcement Learning in Multi-view Environments","date":"2019-07-19","arxiv_id":"1907.09466","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-keyword-recommendations-for","title":"Combinatorial Keyword Recommendations for Sponsored Search with Deep Reinforcement Learning","date":"2019-07-18","arxiv_id":"1907.08686","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-autonomy-validation-in-simulation","title":"Efficient Autonomy Validation in Simulation with Adaptive Stress Testing","date":"2019-07-16","arxiv_id":"1907.06795","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-memory-structure-for-efficient-use-of","title":"A Dual Memory Structure for Efficient Use of Replay Memory in Deep Reinforcement Learning","date":"2019-07-15","arxiv_id":"1907.06396","repositories_listed":0,"syntology":null},{"url":null,"slug":"uav-access-point-placement-for-connectivity","title":"UAV Access Point Placement for Connectivity to a User with Unknown Location Using Deep RL","date":"2019-07-13","arxiv_id":"1907.03912","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-driving","title":"Deep Reinforcement-Learning-based Driving Policy for Autonomous Road Vehicles","date":"2019-07-10","arxiv_id":"1907.05246","repositories_listed":0,"syntology":null}],"record_sha256":"f55262455082c9c182ea666579b45525bcfaa2b00c86d5273024941d0208c682","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}