{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/107","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":107,"pages_in_order":132,"rows_per_page":100,"rows":[10601,10700],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/106","next":"/task/reinforcement-learning/papers/108","papers":[{"url":null,"slug":"learning-task-specifications-from-2","title":"Maximum Causal Entropy Specification Inference from Demonstrations","date":"2019-07-26","arxiv_id":"1907.11792","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-hard-exploration-for-reinforcement","title":"On Hard Exploration for Reinforcement Learning: a Case Study in Pommerman","date":"2019-07-26","arxiv_id":"1907.11788","repositories_listed":0,"syntology":null},{"url":null,"slug":"action-guidance-with-mcts-for-deep","title":"Action Guidance with MCTS for Deep Reinforcement Learning","date":"2019-07-25","arxiv_id":"1907.11703","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-input-for-deep-reinforcement-learning","title":"Dynamic Input for Deep Reinforcement Learning in Autonomous Driving","date":"2019-07-25","arxiv_id":"1907.10994","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-performance-of-distributed","title":"Finite-Time Performance of Distributed Temporal Difference Learning with Linear Function Approximation","date":"2019-07-25","arxiv_id":"1907.12530","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-lungs-auscultation-with","title":"Interactive Lungs Auscultation with Reinforcement Learning Agent","date":"2019-07-25","arxiv_id":"1907.11238","repositories_listed":0,"syntology":null},{"url":null,"slug":"alphastock-a-buying-winners-and-selling","title":"AlphaStock: A Buying-Winners-and-Selling-Losers Investment Strategy using Interpretable Deep Reinforcement Attention Networks","date":"2019-07-24","arxiv_id":"1908.02646","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-with-self-imitation","title":"Memory Based Trajectory-conditioned Policies for Learning from Sparse Rewards","date":"2019-07-24","arxiv_id":"1907.10247","repositories_listed":0,"syntology":null},{"url":null,"slug":"fairness-in-reinforcement-learning-2","title":"Fairness in Reinforcement Learning","date":"2019-07-24","arxiv_id":"1907.10323","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-goal-oriented-visual-dialog-agents","title":"Learning Goal-Oriented Visual Dialog Agents: Imitating and Surpassing Analytic Experts","date":"2019-07-24","arxiv_id":"1907.10500","repositories_listed":0,"syntology":null},{"url":null,"slug":"terminal-prediction-as-an-auxiliary-task-for","title":"Terminal Prediction as an Auxiliary Task for Deep Reinforcement Learning","date":"2019-07-24","arxiv_id":"1907.10827","repositories_listed":0,"syntology":null},{"url":null,"slug":"agent-modeling-as-auxiliary-task-for-deep","title":"Agent Modeling as Auxiliary Task for Deep Reinforcement Learning","date":"2019-07-22","arxiv_id":"1907.09597","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-calibration-of-artificial-neural","title":"Automatic Calibration of Artificial Neural Networks for Zebrafish Collective Behaviours using a Quality Diversity Algorithm","date":"2019-07-22","arxiv_id":"1907.09209","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-autonomous-1","title":"Deep Reinforcement Learning for Autonomous Internet of Things: Model, Applications and Challenges","date":"2019-07-22","arxiv_id":"1907.09059","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-clinical","title":"Deep Reinforcement Learning for Clinical Decision Support: A Brief Survey","date":"2019-07-22","arxiv_id":"1907.09475","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-policy-learning-for-non-stationary","title":"Efficient Policy Learning for Non-Stationary MDPs under Adversarial Manipulation","date":"2019-07-22","arxiv_id":"1907.09350","repositories_listed":0,"syntology":null},{"url":null,"slug":"surrogate-models-for-enhancing-the-efficiency","title":"Surrogate Models for Enhancing the Efficiency of Neuroevolution in Reinforcement Learning","date":"2019-07-22","arxiv_id":"1907.09300","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-tools-challenge-rapid-trial-and-error","title":"Rapid trial-and-error learning with simulation supports flexible tool use and physical reasoning","date":"2019-07-22","arxiv_id":"1907.09620","repositories_listed":0,"syntology":null},{"url":null,"slug":"vrls-a-unified-reinforcement-learning","title":"VRLS: A Unified Reinforcement Learning Scheduler for Vehicle-to-Vehicle Communications","date":"2019-07-22","arxiv_id":"1907.09319","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learning-based-two-stage-spectrum-sharing","title":"A Learning-Based Two-Stage Spectrum Sharing Strategy with Multiple Primary Transmit Power Levels","date":"2019-07-21","arxiv_id":"1907.09949","repositories_listed":0,"syntology":null},{"url":null,"slug":"techniques-for-automated-machine-learning","title":"Techniques for Automated Machine Learning","date":"2019-07-21","arxiv_id":"1907.08908","repositories_listed":0,"syntology":null},{"url":null,"slug":"potential-based-advice-for-stochastic-policy","title":"Potential-Based Advice for Stochastic Policy Learning","date":"2019-07-20","arxiv_id":"1907.08823","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-actor-critic-attention-mechanism-for-deep","title":"An Actor-Critic-Attention Mechanism for Deep Reinforcement Learning in Multi-view Environments","date":"2019-07-19","arxiv_id":"1907.09466","repositories_listed":0,"syntology":null},{"url":null,"slug":"delegative-reinforcement-learning-learning-to","title":"Delegative Reinforcement Learning: learning to avoid traps with a little help","date":"2019-07-19","arxiv_id":"1907.08461","repositories_listed":0,"syntology":null},{"url":null,"slug":"combinatorial-keyword-recommendations-for","title":"Combinatorial Keyword Recommendations for Sponsored Search with Deep Reinforcement Learning","date":"2019-07-18","arxiv_id":"1907.08686","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamical-distance-learning-for-unsupervised","title":"Dynamical Distance Learning for Semi-Supervised and Unsupervised Skill Discovery","date":"2019-07-18","arxiv_id":"1907.08225","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-high-level-planning-symbols-from","title":"Learning High-Level Planning Symbols from Intrinsically Motivated Experience","date":"2019-07-18","arxiv_id":"1907.08313","repositories_listed":0,"syntology":null},{"url":null,"slug":"prioritized-guidance-for-efficient-multi","title":"Prioritized Guidance for Efficient Multi-Agent Reinforcement Learning Exploration","date":"2019-07-18","arxiv_id":"1907.07847","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-across-simulated-robots","title":"Transfer Learning Across Simulated Robots With Different Sensors","date":"2019-07-18","arxiv_id":"1907.07958","repositories_listed":0,"syntology":null},{"url":null,"slug":"cads-core-aware-dynamic-scheduler-for","title":"CADS: Core-Aware Dynamic Scheduler for Multicore Memory Controllers","date":"2019-07-17","arxiv_id":"1907.07776","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-variable-impedance-control-for","title":"Learning Variable Impedance Control for Contact Sensitive Tasks","date":"2019-07-17","arxiv_id":"1907.07500","repositories_listed":0,"syntology":null},{"url":null,"slug":"photonic-architecture-for-reinforcement","title":"Photonic architecture for reinforcement learning","date":"2019-07-17","arxiv_id":"1907.07503","repositories_listed":0,"syntology":null},{"url":null,"slug":"zermelos-problem-optimal-point-to-point","title":"Zermelo's problem: Optimal point-to-point navigation in 2D turbulent flows using Reinforcement Learning","date":"2019-07-17","arxiv_id":"1907.08591","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-inductive-synthesis-framework-for","title":"An Inductive Synthesis Framework for Verifiable Reinforcement Learning","date":"2019-07-16","arxiv_id":"1907.07273","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-autonomy-validation-in-simulation","title":"Efficient Autonomy Validation in Simulation with Adaptive Stress Testing","date":"2019-07-16","arxiv_id":"1907.06795","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-reinforcement-learning-through","title":"Improved Reinforcement Learning through Imitation Learning Pretraining Towards Image-based Autonomous Driving","date":"2019-07-16","arxiv_id":"1907.06838","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-free-control-of-chaos-with-continuous","title":"Model-free Control of Chaos with Continuous Deep Q-learning","date":"2019-07-16","arxiv_id":"1907.07775","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-dual-memory-structure-for-efficient-use-of","title":"A Dual Memory Structure for Efficient Use of Replay Memory in Deep Reinforcement Learning","date":"2019-07-15","arxiv_id":"1907.06396","repositories_listed":0,"syntology":null},{"url":null,"slug":"federated-reinforcement-distillation-with","title":"Federated Reinforcement Distillation with Proxy Experience Memory","date":"2019-07-15","arxiv_id":"1907.06536","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-reinforcement-learning","title":"Mutual Reinforcement Learning","date":"2019-07-15","arxiv_id":"1907.06725","repositories_listed":0,"syntology":null},{"url":null,"slug":"ranking-sentences-from-product-description","title":"Ranking sentences from product description & bullets for better search","date":"2019-07-15","arxiv_id":"1907.06330","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-global-convergence-of-actor-critic-a","title":"On the Global Convergence of Actor-Critic: A Case for Linear Quadratic Regulator with Ergodic Cost","date":"2019-07-14","arxiv_id":"1907.06246","repositories_listed":0,"syntology":null},{"url":null,"slug":"environment-reconstruction-with-hidden","title":"Environment Reconstruction with Hidden Confounders for Reinforcement Learning based Recommendation","date":"2019-07-12","arxiv_id":"1907.06584","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-model-based-approach-for-sample-efficient","title":"A Model-based Approach for Sample-efficient Multi-task Reinforcement Learning","date":"2019-07-11","arxiv_id":"1907.04964","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-systematic-mapping-study-on-testing-of","title":"A Systematic Mapping Study on Testing of Machine Learning Programs","date":"2019-07-11","arxiv_id":"1907.09427","repositories_listed":0,"syntology":null},{"url":null,"slug":"discorl-continual-reinforcement-learning-via","title":"DisCoRL: Continual Reinforcement Learning via Policy Distillation","date":"2019-07-11","arxiv_id":"1907.05855","repositories_listed":0,"syntology":null},{"url":null,"slug":"imitation-projected-policy-gradient-for","title":"Imitation-Projected Programmatic Reinforcement Learning","date":"2019-07-11","arxiv_id":"1907.05431","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-based-driving","title":"Deep Reinforcement-Learning-based Driving Policy for Autonomous Road Vehicles","date":"2019-07-10","arxiv_id":"1907.05246","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-intrinsically-motivated-approach-for","title":"An Intrinsically-Motivated Approach for Learning Highly Exploring and Fast Mixing Policies","date":"2019-07-10","arxiv_id":"1907.04662","repositories_listed":0,"syntology":null},{"url":null,"slug":"assessing-transferability-from-simulation-to","title":"Assessing Transferability from Simulation to Reality for Reinforcement Learning","date":"2019-07-10","arxiv_id":"1907.04685","repositories_listed":0,"syntology":null},{"url":null,"slug":"dob-net-actively-rejecting-unknown-excessive","title":"DOB-Net: Actively Rejecting Unknown Excessive Time-Varying Disturbances","date":"2019-07-10","arxiv_id":"1907.04514","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-dynamics-models-for-data","title":"Interpretable Dynamics Models for Data-Efficient Reinforcement Learning","date":"2019-07-10","arxiv_id":"1907.04902","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-input-search-for-large-scale","title":"Neural Input Search for Large Scale Recommendation Models","date":"2019-07-10","arxiv_id":"1907.04471","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-chromatic","title":"Reinforcement Learning with Chromatic Networks for Compact Architecture Search","date":"2019-07-10","arxiv_id":"1907.06511","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-rrt-kinodynamic-motion-planning-via","title":"RL-RRT: Kinodynamic Motion Planning via Learning Reachability Estimators from RL Policies","date":"2019-07-10","arxiv_id":"1907.04799","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-in-financial","title":"Capturing Financial markets to apply Deep Reinforcement Learning","date":"2019-07-09","arxiv_id":"1907.04373","repositories_listed":0,"syntology":null},{"url":null,"slug":"dreaming-machine-learning-lipschitz","title":"Dreaming machine learning: Lipschitz extensions for reinforcement learning on financial markets","date":"2019-07-09","arxiv_id":"1907.05697","repositories_listed":0,"syntology":null},{"url":null,"slug":"estimating-mass-distribution-of-articulated","title":"Estimating Mass Distribution of Articulated Objects using Non-prehensile Manipulation","date":"2019-07-09","arxiv_id":"1907.03964","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-based-risk-estimations-in-markov","title":"Variance-Based Risk Estimations in Markov Processes via Transformation with State Lumping","date":"2019-07-09","arxiv_id":"1907.05231","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-reinforcement-learning-for","title":"Data Efficient Reinforcement Learning for Legged Robots","date":"2019-07-08","arxiv_id":"1907.03613","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-policy-robot-imitation-learning-from-a","title":"On-Policy Robot Imitation Learning from a Converging Supervisor","date":"2019-07-08","arxiv_id":"1907.03423","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-algorithms-have-no-guarantees","title":"Policy-Gradient Algorithms Have No Guarantees of Convergence in Linear Quadratic Games","date":"2019-07-08","arxiv_id":"1907.03712","repositories_listed":0,"syntology":null},{"url":null,"slug":"shrinkml-end-to-end-asr-model-compression","title":"ShrinkML: End-to-End ASR Model Compression Using Reinforcement Learning","date":"2019-07-08","arxiv_id":"1907.03540","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-inference-mpc-for-bayesian-model","title":"Variational Inference MPC for Bayesian Model-based Reinforcement Learning","date":"2019-07-08","arxiv_id":"1907.04202","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-based-wireless-resource","title":"Deep Learning based Wireless Resource Allocation with Application to Vehicular Networks","date":"2019-07-07","arxiv_id":"1907.03289","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-communication-efficient-multi-agent-actor","title":"A Communication-Efficient Multi-Agent Actor-Critic Algorithm for Distributed Reinforcement Learning","date":"2019-07-06","arxiv_id":"1907.03053","repositories_listed":0,"syntology":null},{"url":null,"slug":"autoslim-an-automatic-dnn-structured-pruning","title":"AutoCompress: An Automatic DNN Structured Pruning Framework for Ultra-High Compression Rates","date":"2019-07-06","arxiv_id":"1907.03141","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropic-regularization-of-markov-decision","title":"Entropic Regularization of Markov Decision Processes","date":"2019-07-06","arxiv_id":"1907.04214","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-motivation-driven-intuitive-physics","title":"Intrinsic Motivation Driven Intuitive Physics Learning using Deep Reinforcement Learning with Intrinsic Reward Normalization","date":"2019-07-06","arxiv_id":"1907.03116","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-flappy-bird-via-asynchronous","title":"Playing Flappy Bird via Asynchronous Advantage Actor Critic Algorithm","date":"2019-07-06","arxiv_id":"1907.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-approximate-bayesian-approach-to-surprise","title":"Learning in Volatile Environments with the Bayes Factor Surprise","date":"2019-07-05","arxiv_id":"1907.02936","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-modeling-chit","title":"Deep Reinforcement Learning For Modeling Chit-Chat Dialog With Discrete Attributes","date":"2019-07-05","arxiv_id":"1907.02848","repositories_listed":0,"syntology":null},{"url":null,"slug":"dependency-aware-attention-control-for-1","title":"Dependency-aware Attention Control for Unconstrained Face Recognition with Image Sets","date":"2019-07-05","arxiv_id":"1907.03030","repositories_listed":0,"syntology":null},{"url":null,"slug":"incrementally-learning-functions-of-the","title":"Incrementally Learning Functions of the Return","date":"2019-07-05","arxiv_id":"1907.04651","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-a-behavioral-repertoire-from","title":"Learning a Behavioral Repertoire from Demonstrations","date":"2019-07-05","arxiv_id":"1907.03046","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-inductive-biases-in-deep-reinforcement","title":"On Inductive Biases in Deep Reinforcement Learning","date":"2019-07-05","arxiv_id":"1907.02908","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-learning-of-distance","title":"Self-supervised Learning of Distance Functions for Goal-Conditioned Reinforcement Learning","date":"2019-07-05","arxiv_id":"1907.02998","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-fictitious-play-for-mean-field","title":"On the Convergence of Model Free Learning in Mean Field Games","date":"2019-07-04","arxiv_id":"1907.02633","repositories_listed":0,"syntology":null},{"url":null,"slug":"integration-of-imitation-learning-using-gail","title":"Integration of Imitation Learning using GAIL and Reinforcement Learning using Task-achievement Rewards via Probabilistic Graphical Model","date":"2019-07-03","arxiv_id":"1907.02140","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-weaknesses-of-reinforcement-learning","title":"On the Weaknesses of Reinforcement Learning for Neural Machine Translation","date":"2019-07-03","arxiv_id":"1907.01752","repositories_listed":0,"syntology":null},{"url":null,"slug":"perspective-taking-in-deep-reinforcement","title":"Perspective Taking in Deep Reinforcement Learning Agents","date":"2019-07-03","arxiv_id":"1907.01851","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-approximate-dynamic-programming-via","title":"Safe Approximate Dynamic Programming Via Kernelized Lipschitz Estimation","date":"2019-07-03","arxiv_id":"1907.02151","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-approach-for-the","title":"A Reinforcement Learning Approach for the Multichannel Rendezvous Problem","date":"2019-07-02","arxiv_id":"1907.01919","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-face-video-segmentation-via","title":"Dynamic Face Video Segmentation via Reinforcement Learning","date":"2019-07-02","arxiv_id":"1907.01296","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalizing-from-a-few-environments-in","title":"Generalizing from a few environments in safety-critical reinforcement learning","date":"2019-07-02","arxiv_id":"1907.01475","repositories_listed":0,"syntology":null},{"url":null,"slug":"modified-actor-critics","title":"Modified Actor-Critics","date":"2019-07-02","arxiv_id":"1907.01298","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-go-without-game-tree-search-using","title":"Playing Go without Game Tree Search Using Convolutional Neural Networks","date":"2019-07-02","arxiv_id":"1907.04658","repositories_listed":0,"syntology":null},{"url":null,"slug":"voting-based-multi-agent-reinforcement","title":"Voting-Based Multi-Agent Reinforcement Learning for Intelligent IoT","date":"2019-07-02","arxiv_id":"1907.01385","repositories_listed":0,"syntology":null},{"url":null,"slug":"designing-deep-reinforcement-learning-for","title":"Designing Deep Reinforcement Learning for Human Parameter Exploration","date":"2019-07-01","arxiv_id":"1907.00824","repositories_listed":0,"syntology":null},{"url":"/paper/end-to-end-deep-reinforcement-learning-based","slug":"end-to-end-deep-reinforcement-learning-based","title":"End-to-end Deep Reinforcement Learning Based Coreference Resolution","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"fidi-rl-incorporating-deep-reinforcement","title":"FiDi-RL: Incorporating Deep Reinforcement Learning with Finite-Difference Policy Search for Efficient Learning of Continuous Control","date":"2019-07-01","arxiv_id":"1907.00526","repositories_listed":0,"syntology":null},{"url":null,"slug":"historical-text-normalization-with-delayed","title":"Historical Text Normalization with Delayed Rewards","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"inferential-machine-comprehension-answering","title":"Inferential Machine Comprehension: Answering Questions by Recursively Deducing the Evidence Chain from Text","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-structure-models-for-natural-language","title":"Latent Structure Models for Natural Language Processing","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-world-graphs-to-accelerate","title":"Learning World Graphs to Accelerate Hierarchical Reinforcement Learning","date":"2019-07-01","arxiv_id":"1907.00664","repositories_listed":0,"syntology":null},{"url":null,"slug":"look-harder-a-neural-machine-translation","title":"Look Harder: A Neural Machine Translation Model with Hard Attention","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"on-mechanisms-for-transfer-using-landmark","title":"On mechanisms for transfer using landmark value functions in multi-task lifelong reinforcement learning","date":"2019-07-01","arxiv_id":"1907.00884","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentence-movers-similarity-automatic","title":"Sentence Mover's Similarity: Automatic Evaluation for Multi-Sentence Texts","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-comprehensive-description-generation","title":"Towards Comprehensive Description Generation from Factual Attribute-value Tables","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-semantic-similarity-as-reward-for","title":"Using Semantic Similarity as Reward for Reinforcement Learning in Sentence Generation","date":"2019-07-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"70d04a8ecafc8a362415f2e57e28ea19605989556cba5c6ec6e1dec14cc3a32e","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}