{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/105","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":105,"pages_in_order":132,"rows_per_page":100,"rows":[10401,10500],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/104","next":"/task/reinforcement-learning/papers/106","papers":[{"url":null,"slug":"a-human-centered-data-driven-planner-actor","title":"A Human-Centered Data-Driven Planner-Actor-Critic Architecture via Logic Programming","date":"2019-09-18","arxiv_id":"1909.09209","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-lane-change-decision-making-using","title":"Automated Lane Change Decision Making using Deep Reinforcement Learning in Dynamic and Uncertain Highway Environment","date":"2019-09-18","arxiv_id":"1909.11538","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepgait-planning-and-control-of-quadrupedal","title":"DeepGait: Planning and Control of Quadrupedal Gaits using Deep Reinforcement Learning","date":"2019-09-18","arxiv_id":"1909.08399","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-opponent-modeling-via-adversarial","title":"Robust Opponent Modeling via Adversarial Ensemble Reinforcement Learning in Asymmetric Imperfect-Information Games","date":"2019-09-18","arxiv_id":"1909.08735","repositories_listed":0,"syntology":null},{"url":null,"slug":"segregation-dynamics-with-reinforcement","title":"Segregation Dynamics with Reinforcement Learning and Agent Based Modeling","date":"2019-09-18","arxiv_id":"1909.08711","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-tracking-by-means-of-deep","title":"Visual Tracking by means of Deep Reinforcement Learning and an Expert Demonstrator","date":"2019-09-18","arxiv_id":"1909.08487","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-of-tracking-prediction-and-decision","title":"A Review of Tracking, Prediction and Decision Making Methods for Autonomous Driving","date":"2019-09-17","arxiv_id":"1909.07707","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-feature-training-for","title":"Adversarial Feature Training for Generalizable Robotic Visuomotor Control","date":"2019-09-17","arxiv_id":"1909.07745","repositories_listed":0,"syntology":null},{"url":null,"slug":"attraction-repulsion-actor-critic-for","title":"Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning","date":"2019-09-17","arxiv_id":"1909.07543","repositories_listed":0,"syntology":null},{"url":null,"slug":"controllable-length-control-neural-encoder","title":"Controllable Length Control Neural Encoder-Decoder via Reinforcement Learning","date":"2019-09-17","arxiv_id":"1909.09492","repositories_listed":0,"syntology":null},{"url":null,"slug":"generating-black-box-adversarial-examples-for","title":"Generating Black-Box Adversarial Examples for Text Classifiers Using a Deep Reinforced Model","date":"2019-09-17","arxiv_id":"1909.07873","repositories_listed":0,"syntology":null},{"url":null,"slug":"split-deep-q-learning-for-robust-object","title":"Split Deep Q-Learning for Robust Object Singulation","date":"2019-09-17","arxiv_id":"1909.08105","repositories_listed":0,"syntology":null},{"url":null,"slug":"stock-market-microstructure-inference-via","title":"Stock market microstructure inference via multi-agent reinforcement learning","date":"2019-09-17","arxiv_id":"1909.07748","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-task-driven","title":"Selective Network Discovery via Deep Reinforcement Learning on Embedded Spaces","date":"2019-09-16","arxiv_id":"1909.07294","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovering-differential-features-adversarial","title":"Discovering Differential Features: Adversarial Learning for Information Credibility Evaluation","date":"2019-09-16","arxiv_id":"1909.07523","repositories_listed":0,"syntology":null},{"url":null,"slug":"job-scheduling-on-data-centers-with-deep","title":"Data Centers Job Scheduling with Deep Reinforcement Learning","date":"2019-09-16","arxiv_id":"1909.07820","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-human-domain-knowledge-to-model-an","title":"Leveraging human Domain Knowledge to model an empirical Reward function for a Reinforcement Learning problem","date":"2019-09-16","arxiv_id":"1909.07116","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-sim-to-real","title":"Meta Reinforcement Learning for Sim-to-real Domain Adaptation","date":"2019-09-16","arxiv_id":"1909.12906","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-road-autonomous-vehicles-traversability","title":"Off-road Autonomous Vehicles Traversability Analysis and Trajectory Planning Based on Deep Inverse Reinforcement Learning","date":"2019-09-16","arxiv_id":"1909.06953","repositories_listed":0,"syntology":null},{"url":null,"slug":"biased-estimates-of-advantages-over-path","title":"Biased Estimates of Advantages over Path Ensembles","date":"2019-09-15","arxiv_id":"1909.06851","repositories_listed":0,"syntology":null},{"url":null,"slug":"model-based-planning-with-energy-based-models","title":"Model Based Planning with Energy Based Models","date":"2019-09-15","arxiv_id":"1909.06878","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-prediction-network-model-free-behavior","title":"Policy Prediction Network: Model-Free Behavior Policy with Model-Based Learning in Continuous Action Space","date":"2019-09-15","arxiv_id":"1909.07373","repositories_listed":0,"syntology":null},{"url":null,"slug":"state-representation-learning-from","title":"State Representation Learning from Demonstration","date":"2019-09-15","arxiv_id":"1910.01738","repositories_listed":0,"syntology":null},{"url":null,"slug":"vild-variational-imitation-learning-with","title":"VILD: Variational Imitation Learning with Diverse-quality Demonstrations","date":"2019-09-15","arxiv_id":"1909.06769","repositories_listed":0,"syntology":null},{"url":null,"slug":"wield-systematic-reinforcement-learning-with","title":"Wield: Systematic Reinforcement Learning With Progressive Randomization","date":"2019-09-15","arxiv_id":"1909.06844","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-learning-for-risk-sensitive-inverse","title":"Active Learning for Risk-Sensitive Inverse Reinforcement Learning","date":"2019-09-14","arxiv_id":"1909.07843","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-collaboration-for-robot-assisted","title":"Learning to Collaborate from Simulation for Robot-Assisted Dressing","date":"2019-09-14","arxiv_id":"1909.06682","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-search-for-class","title":"Neural Architecture Search for Class-incremental Learning","date":"2019-09-14","arxiv_id":"1909.06686","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuromodulated-patience-for-robot-and-self","title":"Neuromodulated Patience for Robot and Self-Driving Vehicle Navigation","date":"2019-09-14","arxiv_id":"1909.06533","repositories_listed":0,"syntology":null},{"url":null,"slug":"node-injection-attacks-on-graphs-via","title":"Node Injection Attacks on Graphs via Reinforcement Learning","date":"2019-09-14","arxiv_id":"1909.06543","repositories_listed":0,"syntology":null},{"url":null,"slug":"aituning-machine-learning-based-tuning-tool","title":"AITuning: Machine Learning-based Tuning Tool for Run-Time Communication Libraries","date":"2019-09-13","arxiv_id":"1909.06301","repositories_listed":0,"syntology":null},{"url":null,"slug":"hjb-optimal-feedback-control-with-deep","title":"HJB Optimal Feedback Control with Deep Differential Value Functions and Action Constraints","date":"2019-09-13","arxiv_id":"1909.06153","repositories_listed":0,"syntology":null},{"url":null,"slug":"petri-net-machines-for-human-agent","title":"Petri Net Machines for Human-Agent Interaction","date":"2019-09-13","arxiv_id":"1909.06174","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-a-comparison-of-ucb","title":"Reinforcement Learning: a Comparison of UCB Versus Alternative Adaptive Policies","date":"2019-09-13","arxiv_id":"1909.06019","repositories_listed":0,"syntology":null},{"url":null,"slug":"say-what-i-want-towards-the-dark-side-of","title":"Say What I Want: Towards the Dark Side of Neural Dialogue Models","date":"2019-09-13","arxiv_id":"1909.06044","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-an-adaptive-robot-for-sports-and","title":"Towards an Adaptive Robot for Sports and Rehabilitation Coaching","date":"2019-09-13","arxiv_id":"1909.08052","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-private-meta-learning","title":"Differentially Private Meta-Learning","date":"2019-09-12","arxiv_id":"1909.05830","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficiently-breaking-the-curse-of-horizon","title":"Efficiently Breaking the Curse of Horizon in Off-Policy Evaluation with Double Reinforcement Learning","date":"2019-09-12","arxiv_id":"1909.05850","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-inference-of-reward-machines-and","title":"Joint Inference of Reward Machines and Policies for Reinforcement Learning","date":"2019-09-12","arxiv_id":"1909.05912","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-infor-blockchain-future-and","title":"Machine Learning in/for Blockchain: Future and Challenges","date":"2019-09-12","arxiv_id":"1909.06189","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-likelihood-constraint-inference-for","title":"Maximum Likelihood Constraint Inference for Inverse Reinforcement Learning","date":"2019-09-12","arxiv_id":"1909.05477","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-sensorimotor-coordination-as-multi","title":"Modeling Sensorimotor Coordination as Multi-Agent Reinforcement Learning with Differentiable Communication","date":"2019-09-12","arxiv_id":"1909.05815","repositories_listed":0,"syntology":null},{"url":null,"slug":"sqlr-short-term-memory-q-learning-for-elastic","title":"SQLR: Short-Term Memory Q-Learning for Elastic Provisioning","date":"2019-09-12","arxiv_id":"1909.05772","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-online-reinforcement-learning-approach-to","title":"An Online Reinforcement Learning Approach to Quality-Cost-Aware Task Allocation for Multi-Attribute Social Sensing","date":"2019-09-11","arxiv_id":"1909.05388","repositories_listed":0,"syntology":null},{"url":null,"slug":"correlation-priors-for-reinforcement-learning","title":"Correlation Priors for Reinforcement Learning","date":"2019-09-11","arxiv_id":"1909.05106","repositories_listed":0,"syntology":null},{"url":null,"slug":"modelling-working-memory-using-deep-recurrent","title":"Modelling Working Memory using Deep Recurrent Reinforcement Learning","date":"2019-09-11","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-information-regularization-in-markov","title":"Mutual-Information Regularization in Markov Decision Processes and Actor-Critic Learning","date":"2019-09-11","arxiv_id":"1909.05950","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-memory-mechanism-in-multi-agent","title":"On Memory Mechanism in Multi-Agent Reinforcement Learning","date":"2019-09-11","arxiv_id":"1909.05232","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-policy-improvement-with-an-estimated","title":"Safe Policy Improvement with an Estimated Baseline Policy","date":"2019-09-11","arxiv_id":"1909.05236","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-multistep-lyapunov-approach-for-finite-time","title":"A Multistep Lyapunov Approach for Finite-Time Analysis of Biased Stochastic Approximation","date":"2019-09-10","arxiv_id":"1909.04299","repositories_listed":0,"syntology":null},{"url":null,"slug":"discovery-of-useful-questions-as-auxiliary","title":"Discovery of Useful Questions as Auxiliary Tasks","date":"2019-09-10","arxiv_id":"1909.04607","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-transferable-domain-priors-for-safe","title":"Learning Transferable Domain Priors for Safe Exploration in Reinforcement Learning","date":"2019-09-10","arxiv_id":"1909.04307","repositories_listed":0,"syntology":null},{"url":null,"slug":"mat-multi-fingered-adaptive-tactile-grasping","title":"MAT: Multi-Fingered Adaptive Tactile Grasping via Deep Reinforcement Learning","date":"2019-09-10","arxiv_id":"1909.04787","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-based-aerial-base-station","title":"Q-Learning Based Aerial Base Station Placement for Fairness Enhancement in Mobile Networks","date":"2019-09-10","arxiv_id":"1909.08093","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-and-video-games","title":"Reinforcement Learning and Video Games","date":"2019-09-10","arxiv_id":"1909.04751","repositories_listed":0,"syntology":null},{"url":null,"slug":"sampling-strategies-for-gan-synthetic-data","title":"Sampling Strategies for GAN Synthetic Data","date":"2019-09-10","arxiv_id":"1909.04689","repositories_listed":0,"syntology":null},{"url":null,"slug":"signal-instructed-coordination-in-team","title":"Signal Instructed Coordination in Cooperative Multi-agent Reinforcement Learning","date":"2019-09-10","arxiv_id":"1909.04224","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-of-temporal-logic-formulas-in","title":"Transfer of Temporal Logic Formulas in Reinforcement Learning","date":"2019-09-10","arxiv_id":"1909.04256","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-online-1","title":"DEAR: Deep Reinforcement Learning for Online Advertising Impression in Recommender Systems","date":"2019-09-09","arxiv_id":"1909.03602","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-value-policy-gradients","title":"Deterministic Value-Policy Gradients","date":"2019-09-09","arxiv_id":"1909.03939","repositories_listed":0,"syntology":null},{"url":null,"slug":"fixed-horizon-temporal-difference-methods-for","title":"Fixed-Horizon Temporal Difference Methods for Stable Reinforcement Learning","date":"2019-09-09","arxiv_id":"1909.03906","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-aware-model-based-policy-search","title":"Gradient-Aware Model-based Policy Search","date":"2019-09-09","arxiv_id":"1909.04115","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-architecture-search-in-embedding-space","title":"Neural Architecture Search in Embedding Space","date":"2019-09-09","arxiv_id":"1909.03615","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-in-partially-observable","title":"Off-Policy Evaluation in Partially Observable Environments","date":"2019-09-09","arxiv_id":"1909.03739","repositories_listed":0,"syntology":null},{"url":null,"slug":"option-encoder-a-framework-for-discovering-a","title":"Option Encoder: A Framework for Discovering a Policy Basis in Reinforcement Learning","date":"2019-09-09","arxiv_id":"1909.04134","repositories_listed":0,"syntology":null},{"url":null,"slug":"partner-approximating-learners-pal-simulation","title":"Partner Approximating Learners (PAL): Simulation-Accelerated Learning with Explicit Partner Modeling in Multi-Agent Domains","date":"2019-09-09","arxiv_id":"1909.03868","repositories_listed":0,"syntology":null},{"url":null,"slug":"recommendation-system-based-upper-confidence","title":"Recommendation System-based Upper Confidence Bound for Online Advertising","date":"2019-09-09","arxiv_id":"1909.04190","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-continual-combinatorial-selection-via","title":"Solving Continual Combinatorial Selection via Deep Reinforcement Learning","date":"2019-09-09","arxiv_id":"1909.03638","repositories_listed":0,"syntology":null},{"url":null,"slug":"compound-domain-adaptation-in-an-open-world","title":"Open Compound Domain Adaptation","date":"2019-09-08","arxiv_id":"1909.03403","repositories_listed":0,"syntology":null},{"url":null,"slug":"countering-the-effects-of-lead-bias-in-news","title":"Countering the Effects of Lead Bias in News Summarization via Multi-Stage Training and Auxiliary Losses","date":"2019-09-08","arxiv_id":"1909.04028","repositories_listed":0,"syntology":null},{"url":"/paper/imitation-learning-for-human-pose-prediction","slug":"imitation-learning-for-human-pose-prediction","title":"Imitation Learning for Human Pose Prediction","date":"2019-09-08","arxiv_id":"1909.03449","repositories_listed":0,"syntology":null},{"url":null,"slug":"personalized-heartsteps-a-reinforcement","title":"Personalized HeartSteps: A Reinforcement Learning Algorithm for Optimizing Physical Activity","date":"2019-09-08","arxiv_id":"1909.03539","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-driving-scale-car-trained-by-deep","title":"Self-driving scale car trained by Deep reinforcement learning","date":"2019-09-08","arxiv_id":"1909.03467","repositories_listed":0,"syntology":null},{"url":"/paper/auto-gnn-neural-architecture-search-of-graph","slug":"auto-gnn-neural-architecture-search-of-graph","title":"Auto-GNN: Neural Architecture Search of Graph Neural Networks","date":"2019-09-07","arxiv_id":"1909.03184","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-financial-trading-agent-for-low","title":"Automatic Financial Trading Agent for Low-risk Portfolio Management using Deep Reinforcement Learning","date":"2019-09-07","arxiv_id":"1909.03278","repositories_listed":0,"syntology":null},{"url":null,"slug":"soft-policy-gradient-method-for-maximum","title":"Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning","date":"2019-09-07","arxiv_id":"1909.03198","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-approach-for","title":"Reinforcement Learning for Joint Optimization of Multiple Rewards","date":"2019-09-06","arxiv_id":"1909.02940","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-trust-region-policy-optimization","title":"Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs","date":"2019-09-06","arxiv_id":"1909.02769","repositories_listed":0,"syntology":null},{"url":null,"slug":"blackbox-attacks-on-reinforcement-learning","title":"Blackbox Attacks on Reinforcement Learning Agents Using Approximated Temporal Information","date":"2019-09-06","arxiv_id":"1909.02918","repositories_listed":0,"syntology":null},{"url":null,"slug":"building-task-oriented-visual-dialog-systems","title":"Building Task-Oriented Visual Dialog Systems Through Alternative Optimization Between Dialog Policy and Language Generation","date":"2019-09-06","arxiv_id":"1909.05365","repositories_listed":0,"syntology":null},{"url":null,"slug":"encoders-and-decoders-for-quantum-expander","title":"Encoders and Decoders for Quantum Expander Codes Using Machine Learning","date":"2019-09-06","arxiv_id":"1909.02945","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-few-to-more-large-scale-dynamic","title":"From Few to More: Large-scale Dynamic Multiagent Curriculum Learning","date":"2019-09-06","arxiv_id":"1909.02790","repositories_listed":0,"syntology":null},{"url":null,"slug":"gradient-q-a-unified-algorithm-with-function","title":"Gradient Q$(σ, λ)$: A Unified Algorithm with Function Approximation for Reinforcement Learning","date":"2019-09-06","arxiv_id":"1909.02877","repositories_listed":0,"syntology":null},{"url":null,"slug":"sqrtn-regret-for-learning-in-markov-decision","title":"$\\sqrt{n}$-Regret for Learning in Markov Decision Processes with Function Approximation and Low Bellman Rank","date":"2019-09-05","arxiv_id":"1909.02506","repositories_listed":0,"syntology":null},{"url":null,"slug":"aces-automatic-configuration-of-energy","title":"ACES -- Automatic Configuration of Energy Harvesting Sensors with Reinforcement Learning","date":"2019-09-04","arxiv_id":"1909.01968","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-entity-driven-framework-for-abstractive","title":"An Entity-Driven Framework for Abstractive Summarization","date":"2019-09-04","arxiv_id":"1909.02059","repositories_listed":0,"syntology":null},{"url":null,"slug":"augmented-memory-networks-for-streaming-based","title":"Augmented Memory Networks for Streaming-Based Active One-Shot Learning","date":"2019-09-04","arxiv_id":"1909.01757","repositories_listed":0,"syntology":null},{"url":null,"slug":"inductive-bias-driven-reinforcement-learning","title":"Inductive-bias-driven Reinforcement Learning For Efficient Schedules in Heterogeneous Clusters","date":"2019-09-04","arxiv_id":"1909.02119","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-sparse-representations-in-1","title":"Learning sparse representations in reinforcement learning","date":"2019-09-04","arxiv_id":"1909.01575","repositories_listed":0,"syntology":null},{"url":null,"slug":"ledeepchef-deep-reinforcement-learning-agent","title":"LeDeepChef: Deep Reinforcement Learning Agent for Families of Text-Based Games","date":"2019-09-04","arxiv_id":"1909.01646","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-data-enhanced-traffic-flow-monitoring-in","title":"Q-DATA: Enhanced Traffic Flow Monitoring in Software-Defined Networks applying Q-learning","date":"2019-09-04","arxiv_id":"1909.01544","repositories_listed":0,"syntology":null},{"url":null,"slug":"quasi-newton-optimization-methods-for-deep","title":"Quasi-Newton Optimization Methods For Deep Learning Applications","date":"2019-09-04","arxiv_id":"1909.01994","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-based-framework-for","title":"A Reinforcement Learning-Based Framework for Solving Physical Design Routing Problem in the Absence of Large Test Sets","date":"2019-09-03","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-smart-sliding-chinese-pinyin-input-method","title":"A Smart Sliding Chinese Pinyin Input Method Editor on Touchscreen","date":"2019-09-03","arxiv_id":"1909.01063","repositories_listed":0,"syntology":null},{"url":null,"slug":"generalization-in-transfer-learning","title":"Generalization in Transfer Learning","date":"2019-09-03","arxiv_id":"1909.01331","repositories_listed":0,"syntology":null},{"url":null,"slug":"classification-betters-regression-in-query","title":"Classification Betters Regression in Query-based Multi-document Summarisation Techniques for Question Answering: Macquarie University at BioASQ7b","date":"2019-09-02","arxiv_id":"1909.00542","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-reinforcement-learning-of","title":"Evolutionary reinforcement learning of dynamical large deviations","date":"2019-09-02","arxiv_id":"1909.00835","repositories_listed":0,"syntology":null},{"url":null,"slug":"logic-and-the-2-simplicial-transformer","title":"Logic and the $2$-Simplicial Transformer","date":"2019-09-02","arxiv_id":"1909.00668","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-automatic","title":"Reinforcement Learning-based Automatic Diagnosis of Acute Appendicitis in Abdominal CT","date":"2019-09-02","arxiv_id":"1909.00617","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcing-medical-image-classifier-to","title":"Reinforcing Medical Image Classifier to Improve Generalization on Small Datasets","date":"2019-09-02","arxiv_id":"1909.05630","repositories_listed":0,"syntology":null}],"record_sha256":"ea6e7ffb7ea1a3a49c38f1454ed5bc65cbf3732af8b441a0ae299e302741a021","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}