{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/98","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":98,"pages_in_order":132,"rows_per_page":100,"rows":[9701,9800],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/97","next":"/task/reinforcement-learning/papers/99","papers":[{"url":null,"slug":"on-the-convergence-of-the-monte-carlo","title":"On the Convergence of the Monte Carlo Exploring Starts Algorithm for Reinforcement Learning","date":"2020-02-10","arxiv_id":"2002.03585","repositories_listed":0,"syntology":null},{"url":null,"slug":"proficiency-aware-multi-agent-actor-critic","title":"Proficiency Constrained Multi-Agent Reinforcement Learning for Environment-Adaptive Multi UAV-UGV Teaming","date":"2020-02-10","arxiv_id":"2002.03910","repositories_listed":0,"syntology":null},{"url":null,"slug":"provable-self-play-algorithms-for-competitive","title":"Provable Self-Play Algorithms for Competitive Reinforcement Learning","date":"2020-02-10","arxiv_id":"2002.04017","repositories_listed":0,"syntology":null},{"url":null,"slug":"q-learning-for-mean-field-controls","title":"Mean-Field Controls with Q-learning for Cooperative MARL: Convergence and Complexity Analysis","date":"2020-02-10","arxiv_id":"2002.04131","repositories_listed":0,"syntology":null},{"url":null,"slug":"statistically-efficient-off-policy-policy","title":"Statistically Efficient Off-Policy Policy Gradients","date":"2020-02-10","arxiv_id":"2002.04014","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximizing-the-total-reward-via-reward","title":"Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons","date":"2020-02-09","arxiv_id":"2002.03327","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-data-driven-choice-of-misfit-function-for","title":"A data-driven choice of misfit function for FWI using reinforcement learning","date":"2020-02-08","arxiv_id":"2002.03154","repositories_listed":0,"syntology":null},{"url":null,"slug":"brpo-batch-residual-policy-optimization","title":"BRPO: Batch Residual Policy Optimization","date":"2020-02-08","arxiv_id":"2002.05522","repositories_listed":0,"syntology":null},{"url":null,"slug":"capsule-network-performance-with-autonomous","title":"Capsule Network Performance with Autonomous Navigation","date":"2020-02-08","arxiv_id":"2002.03181","repositories_listed":0,"syntology":null},{"url":null,"slug":"comprehensive-and-efficient-data-labeling-via","title":"Comprehensive and Efficient Data Labeling via Adaptive Model Scheduling","date":"2020-02-08","arxiv_id":"2002.05520","repositories_listed":0,"syntology":null},{"url":null,"slug":"conservative-exploration-in-reinforcement","title":"Conservative Exploration in Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03218","repositories_listed":0,"syntology":null},{"url":null,"slug":"description-based-text-classification-with","title":"Description Based Text Classification with Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03067","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-detection-of-maximum-common-subgraph-via","title":"GLSearch: Maximum Common Subgraph Detection via Learning to Search","date":"2020-02-08","arxiv_id":"2002.03129","repositories_listed":0,"syntology":null},{"url":null,"slug":"inferential-induction-joint-bayesian","title":"Inferential Induction: A Novel Framework for Bayesian Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-task-reinforcement-learning-with-a","title":"Multi-task Reinforcement Learning with a Planning Quasi-Metric","date":"2020-02-08","arxiv_id":"2002.03240","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-duet-online-music-accompaniment-generation","title":"RL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement Learning","date":"2020-02-08","arxiv_id":"2002.03082","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-reinforcement-learning-for","title":"Accelerating Reinforcement Learning for Reaching using Continuous Curriculum Learning","date":"2020-02-07","arxiv_id":"2002.02697","repositories_listed":0,"syntology":null},{"url":null,"slug":"automated-lane-change-strategy-using-proximal","title":"Automated Lane Change Strategy using Proximal Policy Optimization-based Deep Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02667","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-residual-policy-optimization-1","title":"Bayesian Residual Policy Optimization: Scalable Bayesian Reinforcement Learning with Clairvoyant Experts","date":"2020-02-07","arxiv_id":"2002.03042","repositories_listed":0,"syntology":null},{"url":null,"slug":"causally-correct-partial-models-for-1","title":"Causally Correct Partial Models for Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02836","repositories_listed":0,"syntology":null},{"url":null,"slug":"dynamic-energy-dispatch-in-isolated","title":"Dynamic Energy Dispatch Based on Deep Reinforcement Learning in IoT-Driven Smart Isolated Microgrids","date":"2020-02-07","arxiv_id":"2002.02581","repositories_listed":0,"syntology":null},{"url":null,"slug":"explicit-mean-square-error-bounds-for-monte","title":"Explicit Mean-Square Error Bounds for Monte-Carlo and Linear Stochastic Approximation","date":"2020-02-07","arxiv_id":"2002.02584","repositories_listed":0,"syntology":null},{"url":null,"slug":"i-love-your-chain-mail-making-knights-smile-1","title":"I love your chain mail! Making knights smile in a fantasy game world: Open-domain goal-oriented dialogue agents","date":"2020-02-07","arxiv_id":"2002.02878","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-whole-body-motor-skills-for","title":"Learning Whole-body Motor Skills for Humanoids","date":"2020-02-07","arxiv_id":"2002.02991","repositories_listed":0,"syntology":null},{"url":null,"slug":"manipulating-reinforcement-learning-poisoning","title":"Manipulating Reinforcement Learning: Poisoning Attacks on Cost Signals","date":"2020-02-07","arxiv_id":"2002.03827","repositories_listed":0,"syntology":null},{"url":null,"slug":"mdldroid-a-chainsgd-reduce-approach-to-mobile","title":"MDLdroid: a ChainSGD-reduce Approach to Mobile Deep Learning for Personal Mobile Sensing","date":"2020-02-07","arxiv_id":"2002.02897","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-maximum-entropy-reinforcement","title":"Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)","date":"2020-02-07","arxiv_id":"2002.02829","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-reconstruction-of-policy","title":"Representation of Reinforcement Learning Policies in Reproducing Kernel Hilbert Spaces","date":"2020-02-07","arxiv_id":"2002.02863","repositories_listed":0,"syntology":null},{"url":null,"slug":"ready-policy-one-world-building-through","title":"Ready Policy One: World Building Through Active Learning","date":"2020-02-07","arxiv_id":"2002.02693","repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-free-exploration-for-reinforcement","title":"Reward-Free Exploration for Reinforcement Learning","date":"2020-02-07","arxiv_id":"2002.02794","repositories_listed":0,"syntology":null},{"url":null,"slug":"studentteacher-advising-through-reward","title":"Student/Teacher Advising through Reward Augmentation","date":"2020-02-07","arxiv_id":"2002.02938","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-reinforcement-learning-in-3","title":"Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms and Tighter Regret Bounds for the Non-Episodic Setting","date":"2020-02-06","arxiv_id":"2002.02302","repositories_listed":0,"syntology":null},{"url":null,"slug":"social-diversity-and-social-preferences-in","title":"Social diversity and social preferences in mixed-motive reinforcement learning","date":"2020-02-06","arxiv_id":"2002.02325","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporal-adaptive-hierarchical-reinforcement","title":"Temporal-adaptive Hierarchical Reinforcement Learning","date":"2020-02-06","arxiv_id":"2002.02080","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-heterogeneous-knowledge-among-peer","title":"Transfer Heterogeneous Knowledge Among Peer-to-Peer Teammates: A Model Distillation Approach","date":"2020-02-06","arxiv_id":"2002.02202","repositories_listed":0,"syntology":null},{"url":null,"slug":"unboxing-mac-protocol-design-optimization","title":"Unboxing MAC Protocol Design Optimization Using Deep Learning","date":"2020-02-06","arxiv_id":"2002.03795","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-learning-tubes-for-tube-mpc","title":"Deep Learning Tubes for Tube MPC","date":"2020-02-05","arxiv_id":"2002.01587","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-rbf-value-functions-for-continuous","title":"Deep Radial-Basis Value Functions for Continuous Control","date":"2020-02-05","arxiv_id":"2002.01883","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhancing-feature-invariance-with-learned","title":"Learning Test-time Augmentation for Content-based Image Retrieval","date":"2020-02-05","arxiv_id":"2002.01642","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-information-based-state-control-for","title":"Mutual Information-based State-Control for Intrinsically Motivated Reinforcement Learning","date":"2020-02-05","arxiv_id":"2002.01963","repositories_listed":0,"syntology":null},{"url":null,"slug":"bootstrapping-a-dqn-replay-memory-with","title":"Bootstrapping a DQN Replay Memory with Synthetic Experiences","date":"2020-02-04","arxiv_id":"2002.01370","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-linear-two-timescale","title":"Finite Time Analysis of Linear Two-timescale Stochastic Approximation with Markovian Noise","date":"2020-02-04","arxiv_id":"2002.01268","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-robotic-ultrasound-scanning-using","title":"Learning rewards for robotic ultrasound scanning using probabilistic temporal ranking","date":"2020-02-04","arxiv_id":"2002.01240","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-task-driven-control-policies-via","title":"Learning Task-Driven Control Policies via Information Bottlenecks","date":"2020-02-04","arxiv_id":"2002.01428","repositories_listed":0,"syntology":null},{"url":null,"slug":"neuro-evolutionary-frameworks-for-generalized","title":"Neuro-evolutionary Frameworks for Generalized Learning Agents","date":"2020-02-04","arxiv_id":"2002.01088","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-based-quantum-approximate","title":"Policy Gradient based Quantum Approximate Optimization Algorithm","date":"2020-02-04","arxiv_id":"2002.01068","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-algorithms-for-constructing-an","title":"Evolutionary algorithms for constructing an ensemble of decision trees","date":"2020-02-03","arxiv_id":"2002.00721","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-sample-analysis-of-stochastic","title":"Finite-Sample Analysis of Stochastic Approximation Using Smooth Convex Envelopes","date":"2020-02-03","arxiv_id":"2002.00874","repositories_listed":0,"syntology":null},{"url":null,"slug":"prophet-proactive-candidate-selection-for","title":"Prophet: Proactive Candidate-Selection for Federated Learning by Predicting the Qualities of Training and Reporting Phases","date":"2020-02-03","arxiv_id":"2002.00577","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-autonomous-2","title":"Deep Reinforcement Learning for Autonomous Driving: A Survey","date":"2020-02-02","arxiv_id":"2002.00444","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-deep-reinforcement-learning-approach-to-1","title":"A Deep Reinforcement Learning Approach to Concurrent Bilateral Negotiation","date":"2020-01-31","arxiv_id":"2001.11785","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-deep-reinforcement-learning-for","title":"Constrained Deep Reinforcement Learning for Energy Sustainable Multi-UAV based Random Access IoT Networks with NOMA","date":"2020-01-31","arxiv_id":"2002.00073","repositories_listed":0,"syntology":null},{"url":null,"slug":"locally-private-distributed-reinforcement","title":"Locally Private Distributed Reinforcement Learning","date":"2020-01-31","arxiv_id":"2001.11718","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-mmo-v13-a-massively-multiagent-game","title":"Neural MMO v1.3: A Massively Multiagent Game Environment for Training and Evaluating Neural Networks","date":"2020-01-31","arxiv_id":"2001.12004","repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-goal-directed-attention-control","title":"Predicting Goal-directed Attention Control Using Inverse-Reinforcement Learning","date":"2020-01-31","arxiv_id":"2001.11921","repositories_listed":0,"syntology":null},{"url":null,"slug":"preventing-imitation-learning-with-1","title":"Preventing Imitation Learning with Adversarial Policy Ensembles","date":"2020-01-31","arxiv_id":"2002.01059","repositories_listed":0,"syntology":null},{"url":null,"slug":"survey-of-deep-reinforcement-learning-for","title":"Survey of Deep Reinforcement Learning for Motion Planning of Autonomous Vehicles","date":"2020-01-30","arxiv_id":"2001.11231","repositories_listed":0,"syntology":null},{"url":null,"slug":"asymptotically-efficient-off-policy","title":"Asymptotically Efficient Off-Policy Evaluation for Tabular Reinforcement Learning","date":"2020-01-29","arxiv_id":"2001.10742","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiple-access-in-dynamic-cell-free-networks","title":"Multiple Access in Dynamic Cell-Free Networks: Outage Performance and Deep Reinforcement Learning-Based Design","date":"2020-01-29","arxiv_id":"2002.02801","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-multimodal-image-registration-using","title":"Robust Multimodal Image Registration Using Deep Recurrent Reinforcement Learning","date":"2020-01-29","arxiv_id":"2002.03733","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-fractal-neural-networks-to-play-simcity","title":"Using Fractal Neural Networks to Play SimCity 1 and Conway's Game of Life at Variable Scales","date":"2020-01-29","arxiv_id":"2002.03896","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-autoencoders-for-opponent-1","title":"Variational Autoencoders for Opponent Modeling in Multi-Agent Systems","date":"2020-01-29","arxiv_id":"2001.10829","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-driven-control-of-micro-climate-in","title":"Data-driven control of micro-climate in buildings: an event-triggered reinforcement learning approach","date":"2020-01-28","arxiv_id":"2001.10505","repositories_listed":0,"syntology":null},{"url":null,"slug":"distal-explanations-for-explainable","title":"Distal Explanations for Model-free Explainable Reinforcement Learning","date":"2020-01-28","arxiv_id":"2001.10284","repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-in-coagent-networks","title":"Coagent Networks Revisited","date":"2020-01-28","arxiv_id":"2001.10474","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-learning-multi-agent-negotiations-via","title":"Towards Learning Multi-agent Negotiations via Self-Play","date":"2020-01-28","arxiv_id":"2001.10208","repositories_listed":0,"syntology":null},{"url":null,"slug":"developing-multi-task-recommendations-with","title":"Developing Multi-Task Recommendations with Long-Term Rewards via Policy Distilled Reinforcement Learning","date":"2020-01-27","arxiv_id":"2001.09595","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-bounds-for-decentralized-learning-in","title":"Regret Bounds for Decentralized Learning in Cooperative Multi-Agent Dynamical Systems","date":"2020-01-27","arxiv_id":"2001.10122","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-autoscaling-of","title":"Reinforcement Learning-based Application Autoscaling in the Cloud: A Survey","date":"2020-01-27","arxiv_id":"2001.09957","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-upper-confidence-reinforcement","title":"Constrained Upper Confidence Reinforcement Learning","date":"2020-01-26","arxiv_id":"2001.09377","repositories_listed":0,"syntology":null},{"url":null,"slug":"regime-switching-bandits","title":"Regime Switching Bandits","date":"2020-01-26","arxiv_id":"2001.09390","repositories_listed":0,"syntology":null},{"url":null,"slug":"sentiment-and-knowledge-based-algorithmic","title":"Sentiment and Knowledge Based Algorithmic Trading with Deep Reinforcement Learning","date":"2020-01-26","arxiv_id":"2001.09403","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-blind","title":"Deep Reinforcement Learning based Blind mmWave MIMO Beam Alignment","date":"2020-01-25","arxiv_id":"2001.09251","repositories_listed":0,"syntology":null},{"url":null,"slug":"following-instructions-by-imagining-and","title":"Following Instructions by Imagining and Reaching Visual Goals","date":"2020-01-25","arxiv_id":"2001.09373","repositories_listed":0,"syntology":null},{"url":null,"slug":"egomap-projective-mapping-and-structured-1","title":"EgoMap: Projective mapping and structured egocentric memory for Deep RL","date":"2020-01-24","arxiv_id":"2002.02286","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-vision-based-adaptive-cruise","title":"End-to-End Vision-Based Adaptive Cruise Control (ACC) Using Deep Reinforcement Learning","date":"2020-01-24","arxiv_id":"2001.09181","repositories_listed":0,"syntology":null},{"url":null,"slug":"stacked-auto-encoder-based-deep-reinforcement","title":"Stacked Auto Encoder Based Deep Reinforcement Learning for Online Resource Scheduling in Large-Scale MEC Networks","date":"2020-01-24","arxiv_id":"2001.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"chameleon-adaptive-code-optimization-for-1","title":"Chameleon: Adaptive Code Optimization for Expedited Deep Neural Network Compilation","date":"2020-01-23","arxiv_id":"2001.08743","repositories_listed":0,"syntology":null},{"url":null,"slug":"facial-feedback-for-reinforcement-learning-a","title":"Facial Feedback for Reinforcement Learning: A Case Study and Offline Analysis Using the TAMER Framework","date":"2020-01-23","arxiv_id":"2001.08703","repositories_listed":0,"syntology":null},{"url":null,"slug":"fine-tuning-a-transformer-based-language","title":"Reducing Non-Normative Text Generation from Language Models","date":"2020-01-23","arxiv_id":"2001.08764","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-objective-neural-architecture-search-2","title":"Multi-objective Neural Architecture Search via Non-stationary Policy Gradient","date":"2020-01-23","arxiv_id":"2001.08437","repositories_listed":0,"syntology":null},{"url":null,"slug":"local-policy-optimization-for-trajectory","title":"Local Policy Optimization for Trajectory-Centric Reinforcement Learning","date":"2020-01-22","arxiv_id":"2001.08092","repositories_listed":0,"syntology":null},{"url":null,"slug":"machine-learning-assisted-handover-and","title":"Machine Learning assisted Handover and Resource Management for Cellular Connected Drones","date":"2020-01-22","arxiv_id":"2001.07937","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-solving-cooperative-marl-problems-with-a","title":"On Solving Cooperative MARL Problems with a Few Good Experiences","date":"2020-01-22","arxiv_id":"2001.07993","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-vehicle-cell","title":"Reinforcement Learning Based Vehicle-cell Association Algorithm for Highly Mobile Millimeter Wave Communication","date":"2020-01-22","arxiv_id":"2001.07915","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-highway-work-zone-merge-control","title":"Cooperative Highway Work Zone Merge Control based on Reinforcement Learning in A Connected and Automated Environment","date":"2020-01-21","arxiv_id":"2001.08581","repositories_listed":0,"syntology":null},{"url":null,"slug":"improving-interaction-quality-estimation-with-1","title":"Improving Interaction Quality Estimation with BiLSTMs and the Impact on Dialogue Policy Learning","date":"2020-01-21","arxiv_id":"2001.07615","repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-bandwidth-allocation-for-latency","title":"Intelligent Bandwidth Allocation for Latency Management in NG-EPON using Reinforcement Learning Methods","date":"2020-01-21","arxiv_id":"2001.07698","repositories_listed":0,"syntology":null},{"url":null,"slug":"lyceum-an-efficient-and-scalable-ecosystem-1","title":"Lyceum: An efficient and scalable ecosystem for robot learning","date":"2020-01-21","arxiv_id":"2001.07343","repositories_listed":0,"syntology":null},{"url":null,"slug":"unsupervisedly-learned-representations-should","title":"Unsupervisedly Learned Representations: Should the Quest be Over?","date":"2020-01-21","arxiv_id":"2001.07495","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-review-on-generative-adversarial-networks","title":"A Review on Generative Adversarial Networks: Algorithms, Theory, and Applications","date":"2020-01-20","arxiv_id":"2001.06937","repositories_listed":0,"syntology":null},{"url":null,"slug":"memristor-hardware-friendly-reinforcement","title":"Memristor Hardware-Friendly Reinforcement Learning","date":"2020-01-20","arxiv_id":"2001.06930","repositories_listed":0,"syntology":null},{"url":null,"slug":"nested-wasserstein-self-imitation-learning","title":"Nested-Wasserstein Self-Imitation Learning for Sequence Generation","date":"2020-01-20","arxiv_id":"2001.06944","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-probabilistically-1","title":"Reinforcement Learning with Probabilistically Complete Exploration","date":"2020-01-20","arxiv_id":"2001.06940","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-reinforcement-learning-techniques","title":"A Survey of Reinforcement Learning Techniques: Strategies, Recent Development, and Future Directions","date":"2020-01-19","arxiv_id":"2001.06921","repositories_listed":0,"syntology":null},{"url":null,"slug":"fresh-interactive-reward-shaping-in-high","title":"FRESH: Interactive Reward Shaping in High-Dimensional State Spaces using Human Feedback","date":"2020-01-19","arxiv_id":"2001.06781","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-options-from-demonstration-using","title":"Learning Options from Demonstration using Skill Segmentation","date":"2020-01-19","arxiv_id":"2001.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"cube2net-efficient-query-specific-network","title":"cube2net: Efficient Query-Specific Network Construction with Data Cube Organization","date":"2020-01-18","arxiv_id":"2002.00841","repositories_listed":0,"syntology":null},{"url":null,"slug":"effects-of-sparse-rewards-of-different","title":"Effects of sparse rewards of different magnitudes in the speed of learning of model-based actor critic methods","date":"2020-01-18","arxiv_id":"2001.06725","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-neural-architecture-search-a-broad","title":"BNAS:An Efficient Neural Architecture Search Approach Using Broad Scalable Architecture","date":"2020-01-18","arxiv_id":"2001.06679","repositories_listed":0,"syntology":null}],"record_sha256":"cc51470e2898ce765d7fc43752412867c1b7356e574912d627089df0bd2baaa8","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}