{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-1/papers/134","list_of":"/task/reinforcement-learning-1","task":"Reinforcement Learning (RL)","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":134,"pages_in_order":152,"rows_per_page":100,"rows":[13301,13400],"of":15113,"counts":{"archive_papers_tagged":15113,"with_a_code_link":4749,"where_syntology_ran_a_sample":1416,"not_listed_spam_title":0,"listed":15113,"listed_where_code_ran":1416,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":1186,"every_run_a_failure_of_syntologys_instrument":230,"listed_with_a_run_with_no_instrument_failure":1186,"listed_every_run_a_failure_of_syntologys_instrument":230,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-1","prev":"/task/reinforcement-learning-1/papers/133","next":"/task/reinforcement-learning-1/papers/135","papers":[{"url":null,"slug":"risk-sensitive-compact-decision-trees-for","title":"Risk-Sensitive Compact Decision Trees for Autonomous Execution in Presence of Simulated Market Response","date":"2019-06-05","arxiv_id":"1906.02312","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-reinforcement-learning-of-multiple","title":"Autonomous Reinforcement Learning of Multiple Interrelated Tasks","date":"2019-06-04","arxiv_id":"1906.01374","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-via-off-policy","title":"Off-Policy Evaluation via Off-Policy Classification","date":"2019-06-04","arxiv_id":"1906.01624","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-board-deep-q-network-for-uav-assisted","title":"On-board Deep Q-Network for UAV-assisted Online Power Transfer and Data Collection","date":"2019-06-04","arxiv_id":"1906.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"options-as-responses-grounding-behavioural","title":"Options as responses: Grounding behavioural hierarchies in multi-agent RL","date":"2019-06-04","arxiv_id":"1906.01470","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-variance-analysis-of-gaussian","title":"Posterior Variance Analysis of Gaussian Processes with Application to Average Learning Curves","date":"2019-06-04","arxiv_id":"1906.01404","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-translation-with-flexible-policy","title":"Simultaneous Translation with Flexible Policy via Restricted Imitation Learning","date":"2019-06-04","arxiv_id":"1906.01135","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600571","title":"Deep Reinforcement Learning Architecture for Continuous Power Allocation in High Throughput Satellites","date":"2019-06-03","arxiv_id":"1906.00571","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600625","title":"Decentralized Deep Reinforcement Learning for Delay-Power Tradeoff in Vehicular Communications","date":"2019-06-03","arxiv_id":"1906.00625","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600767","title":"Load Balancing for Ultra-Dense Networks: A Deep Reinforcement Learning Based Approach","date":"2019-06-03","arxiv_id":"1906.00767","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-exploitation-of-policy-imitation","title":"Adversarial Exploitation of Policy Imitation","date":"2019-06-03","arxiv_id":"1906.01121","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-reliability-optimization-for","title":"Proximal Reliability Optimization for Reinforcement Learning","date":"2019-06-03","arxiv_id":"1906.01127","repositories_listed":0,"syntology":null},{"url":null,"slug":"reconstruct-and-represent-video-contents-for","title":"Reconstruct and Represent Video Contents for Captioning via Reinforcement Learning","date":"2019-06-03","arxiv_id":"1906.01452","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-based-method-for-benchmarking-the","title":"RL-Based Method for Benchmarking the Adversarial Resilience and Robustness of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01110","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-triggers-for-watermarking-of-deep","title":"Sequential Triggers for Watermarking of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01126","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600317","title":"Automated Video Game Testing Using Synthetic and Human-Like Agents","date":"2019-06-02","arxiv_id":"1906.00317","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600336","title":"The Principle of Unchanged Optimality in Reinforcement Learning Generalization","date":"2019-06-02","arxiv_id":"1906.00336","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600429","title":"Learner-aware Teaching: Inverse Reinforcement Learning with Preferences and Constraints","date":"2019-06-02","arxiv_id":"1906.00429","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600431","title":"An Empirical Study on Hyperparameters and their Interdependence for RL Generalization","date":"2019-06-02","arxiv_id":"1906.00431","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600131","title":"Decision-Making in Reinforcement Learning","date":"2019-06-01","arxiv_id":"1906.00131","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-bayesian-compression-via-deep","title":"Enhanced Bayesian Compression via Deep Reinforcement Learning","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-noisy-data-in-distant-supervision","title":"Exploiting Noisy Data in Distant Supervision Relation Classification","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-driven-temporal-activity","title":"Language-Driven Temporal Activity Localization: A Semantic Matching Reinforcement Learning Model","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"attentional-policies-for-cross-context-multi","title":"Attentional Policies for Cross-Context Multi-Agent Reinforcement Learning","date":"2019-05-31","arxiv_id":"1905.13428","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-experience-reuse-with","title":"Reinforcement Learning Experience Reuse with Policy Residual Representation","date":"2019-05-31","arxiv_id":"1905.13719","repositories_listed":0,"syntology":null},{"url":"/paper/rewarding-smatch-transition-based-amr-parsing","slug":"rewarding-smatch-transition-based-amr-parsing","title":"Rewarding Smatch: Transition-Based AMR Parsing with Reinforcement Learning","date":"2019-05-31","arxiv_id":"1905.13370","repositories_listed":0,"syntology":null},{"url":null,"slug":"combating-the-compounding-error-problem-with","title":"Combating the Compounding-Error Problem with a Multi-step Model","date":"2019-05-30","arxiv_id":"1905.13320","repositories_listed":0,"syntology":null},{"url":null,"slug":"defining-admissible-rewards-for-high","title":"Defining Admissible Rewards for High Confidence Policy Evaluation","date":"2019-05-30","arxiv_id":"1905.13167","repositories_listed":0,"syntology":null},{"url":null,"slug":"dont-forget-your-teacher-a-corrective","title":"Don't Forget Your Teacher: A Corrective Reinforcement Learning Framework","date":"2019-05-30","arxiv_id":"1905.13562","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-medical-test-suggestions-using-deep","title":"Effective Medical Test Suggestions Using Deep Reinforcement Learning","date":"2019-05-30","arxiv_id":"1905.12916","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-approximate-policy","title":"Finite-time Analysis of Approximate Policy Iteration for the Linear Quadratic Regulator","date":"2019-05-30","arxiv_id":"1905.12842","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-value-functions-and-the-agent-environment","title":"On Value Functions and the Agent-Environment Boundary","date":"2019-05-30","arxiv_id":"1905.13341","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-mean-field-game","title":"Reinforcement Learning for Mean Field Game","date":"2019-05-30","arxiv_id":"1905.13357","repositories_listed":0,"syntology":null},{"url":null,"slug":"advantage-amplification-in-slowly-evolving","title":"Advantage Amplification in Slowly Evolving Latent-State Environments","date":"2019-05-29","arxiv_id":"1905.13559","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-convergence-analysis-of","title":"An Improved Convergence Analysis of Stochastic Variance-Reduced Policy Gradient","date":"2019-05-29","arxiv_id":"1905.12615","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-interpolation-gives-better-gradients","title":"Linear interpolation gives better gradients than Gaussian smoothing in derivative-free optimization","date":"2019-05-29","arxiv_id":"1905.13043","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-generalization-gap-in","title":"On the Generalization Gap in Reparameterizable Reinforcement Learning","date":"2019-05-29","arxiv_id":"1905.12654","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-policy-mixture","title":"Reinforcement Learning with Policy Mixture Model for Temporal Point Processes Clustering","date":"2019-05-29","arxiv_id":"1905.12345","repositories_listed":0,"syntology":null},{"url":null,"slug":"switching-linear-dynamics-for-variational","title":"Switching Linear Dynamics for Variational Bayes Filtering","date":"2019-05-29","arxiv_id":"1905.12434","repositories_listed":0,"syntology":null},{"url":null,"slug":"targeted-attacks-on-deep-reinforcement","title":"CopyCAT: Taking Control of Neural Policies with Constant Attacks","date":"2019-05-29","arxiv_id":"1905.12282","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-evolution-strategies","title":"Variance Reduction for Evolution Strategies via Structured Control Variates","date":"2019-05-29","arxiv_id":"1906.08868","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-control-model-based-approach-for","title":"A General Markov Decision Process Framework for Directly Learning Optimal Control Policies","date":"2019-05-28","arxiv_id":"1905.12009","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-exponentially-discounted-sum-automatic","title":"Beyond Exponentially Discounted Sum: Automatic Learning of Return Function","date":"2019-05-28","arxiv_id":"1905.11591","repositories_listed":0,"syntology":null},{"url":null,"slug":"conditions-on-features-for-temporal","title":"Conditions on Features for Temporal Difference-Like Methods to Converge","date":"2019-05-28","arxiv_id":"1905.11702","repositories_listed":0,"syntology":null},{"url":null,"slug":"generation-of-policy-level-explanations-for","title":"Generation of Policy-Level Explanations for Reinforcement Learning","date":"2019-05-28","arxiv_id":"1905.12044","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-teaching-algorithms-for-inverse","title":"Interactive Teaching Algorithms for Inverse Reinforcement Learning","date":"2019-05-28","arxiv_id":"1905.11867","repositories_listed":0,"syntology":null},{"url":null,"slug":"190601408","title":"Hypothesis-Driven Skill Discovery for Hierarchical Deep Reinforcement Learning","date":"2019-05-27","arxiv_id":"1906.01408","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentgraph-towards-universal-dialogue","title":"AgentGraph: Towards Universal Dialogue Management with Structured Deep Reinforcement Learning","date":"2019-05-27","arxiv_id":"1905.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-dynamics-and-returns-value","title":"Disentangling Dynamics and Returns: Value Function Decomposition with Future Prediction","date":"2019-05-27","arxiv_id":"1905.11100","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-optimistic-reinforcement","title":"Near-optimal Optimistic Reinforcement Learning using Empirical Bernstein Inequalities","date":"2019-05-27","arxiv_id":"1905.12425","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-by-target-distribution-learning","title":"Policy Search by Target Distribution Learning for Continuous Control","date":"2019-05-27","arxiv_id":"1905.11041","repositories_listed":0,"syntology":null},{"url":"/paper/selective-transfer-with-reinforced-transfer","slug":"selective-transfer-with-reinforced-transfer","title":"Selective Transfer with Reinforced Transfer Network for Partial Domain Adaptation","date":"2019-05-26","arxiv_id":"1905.10756","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-bayes-a-report-on-approaches-and","title":"Variational Bayes: A report on approaches and applications","date":"2019-05-26","arxiv_id":"1905.10744","repositories_listed":0,"syntology":null},{"url":null,"slug":"190512726","title":"Prioritized Sequence Experience Replay","date":"2019-05-25","arxiv_id":"1905.12726","repositories_listed":0,"syntology":null},{"url":null,"slug":"aspire-automated-security-policy","title":"Transferable Cost-Aware Security Policy Implementation for Malware Detection Using Deep Reinforcement Learning","date":"2019-05-25","arxiv_id":"1905.10517","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-ensembles-of-policies-with-deep","title":"Composing Task-Agnostic Policies with Deep Reinforcement Learning","date":"2019-05-25","arxiv_id":"1905.10681","repositories_listed":0,"syntology":null},{"url":"/paper/learning-to-reason-in-large-theories-without","slug":"learning-to-reason-in-large-theories-without","title":"Learning to Reason in Large Theories without Imitation","date":"2019-05-25","arxiv_id":"1905.10501","repositories_listed":0,"syntology":null},{"url":null,"slug":"190512567","title":"MQLV: Optimal Policy of Money Management in Retail Banking with Q-Learning","date":"2019-05-24","arxiv_id":"1905.12567","repositories_listed":0,"syntology":null},{"url":null,"slug":"190601407","title":"RL4health: Crowdsourcing Reinforcement Learning for Knee Replacement Pathway Optimization","date":"2019-05-24","arxiv_id":"1906.01407","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-machine-learning-by-pipeline","title":"Automatic Machine Learning by Pipeline Synthesis using Model-Based Reinforcement Learning and a Grammar","date":"2019-05-24","arxiv_id":"1905.10345","repositories_listed":0,"syntology":null},{"url":null,"slug":"inforl-interpretable-reinforcement-learning","title":"InfoRL: Interpretable Reinforcement Learning using Information Maximization","date":"2019-05-24","arxiv_id":"1905.10404","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-leaning-in-feature-space-matrix","title":"Reinforcement Learning in Feature Space: Matrix Bandit, Kernels, and Regret Bound","date":"2019-05-24","arxiv_id":"1905.10389","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-expected-cumulative-reward","title":"A Micro-Objective Perspective of Reinforcement Learning","date":"2019-05-24","arxiv_id":"1905.10016","repositories_listed":0,"syntology":null},{"url":null,"slug":"190509949","title":"Scene Induced Multi-Modal Trajectory Forecasting via Planning","date":"2019-05-23","arxiv_id":"1905.09949","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-with","title":"Unknown mixing times in apprenticeship and reinforcement learning","date":"2019-05-23","arxiv_id":"1905.09704","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-with-q-matrix-transfer","title":"Deep Q-Learning with Q-Matrix Transfer Learning for Novel Fire Evacuation Environment","date":"2019-05-23","arxiv_id":"1905.09673","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-semantics-to-execution-integrating","title":"From semantics to execution: Integrating action planning with reinforcement learning for robotic causal problem-solving","date":"2019-05-23","arxiv_id":"1905.09683","repositories_listed":0,"syntology":null},{"url":null,"slug":"pac-guarantees-for-concurrent-reinforcement","title":"PAC Guarantees for Cooperative Multi-Agent Reinforcement Learning with Restricted Communication","date":"2019-05-23","arxiv_id":"1905.09951","repositories_listed":0,"syntology":null},{"url":null,"slug":"population-based-global-optimisation-methods","title":"Population-based Global Optimisation Methods for Learning Long-term Dependencies with RNNs","date":"2019-05-23","arxiv_id":"1905.09691","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-value-functions","title":"Recurrent Value Functions","date":"2019-05-23","arxiv_id":"1905.09562","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-detecting","title":"Deep Reinforcement Learning for Detecting Malicious Websites","date":"2019-05-22","arxiv_id":"1905.09207","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-reinforcement-learning-for","title":"Hierarchical Reinforcement Learning for Quadruped Locomotion","date":"2019-05-22","arxiv_id":"1905.08926","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-inverse-reinforcement-learning","title":"Stochastic Inverse Reinforcement Learning","date":"2019-05-21","arxiv_id":"1905.08513","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-approach-to-robust-reinforcement","title":"A Bayesian Approach to Robust Reinforcement Learning","date":"2019-05-20","arxiv_id":"1905.08188","repositories_listed":0,"syntology":null},{"url":null,"slug":"issues-concerning-realizability-of-blackwell","title":"Issues concerning realizability of Blackwell optimal policies in reinforcement learning","date":"2019-05-20","arxiv_id":"1905.08293","repositories_listed":0,"syntology":null},{"url":null,"slug":"perceptual-values-from-observation","title":"Perceptual Values from Observation","date":"2019-05-20","arxiv_id":"1905.07861","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-without-ground-truth","title":"Reinforcement Learning without Ground-Truth State","date":"2019-05-20","arxiv_id":"1905.07866","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-deep-q","title":"Stochastic Variance Reduction for Deep Q-learning","date":"2019-05-20","arxiv_id":"1905.08152","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-learning-of","title":"Reinforcement Learning for Learning of Dynamical Systems in Uncertain Environment: a Tutorial","date":"2019-05-19","arxiv_id":"1905.07727","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolving-rewards-to-automate-reinforcement","title":"Evolving Rewards to Automate Reinforcement Learning","date":"2019-05-18","arxiv_id":"1905.07628","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-based-channel","title":"Deep Reinforcement Learning-Based Channel Allocation for Wireless LANs with Graph Convolutional Networks","date":"2019-05-17","arxiv_id":"1905.07144","repositories_listed":0,"syntology":null},{"url":null,"slug":"enforcing-constraints-for-time-series","title":"Enforcing constraints for time series prediction in supervised, unsupervised and reinforcement learning","date":"2019-05-17","arxiv_id":"1905.07501","repositories_listed":0,"syntology":null},{"url":null,"slug":"in-support-of-over-parametrization-in-deep","title":"In Support of Over-Parametrization in Deep Reinforcement Learning: an Empirical Study","date":"2019-05-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"mamic-macro-and-micro-curriculum-for-robotic","title":"MaMiC: Macro and Micro Curriculum for Robotic Reinforcement Learning","date":"2019-05-17","arxiv_id":"1905.07193","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastically-dominant-distributional","title":"Stochastically Dominant Distributional Reinforcement Learning","date":"2019-05-17","arxiv_id":"1905.07318","repositories_listed":0,"syntology":null},{"url":null,"slug":"stratospheric-aerosol-injection-as-a-deep","title":"Stratospheric Aerosol Injection as a Deep Reinforcement Learning Problem","date":"2019-05-17","arxiv_id":"1905.07366","repositories_listed":0,"syntology":null},{"url":null,"slug":"tbq-improving-efficiency-of-trace-utilization","title":"TBQ($σ$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning","date":"2019-05-17","arxiv_id":"1905.07237","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-knowledge-based-agent-learning-to-do","title":"Deep Knowledge Based Agent: Learning to do tasks by self-thinking about imaginary worlds","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"goal-conditioned-imitation-learning-1","title":"Goal-conditioned Imitation Learning","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"knowledge-based-sequential-decision-making","title":"Knowledge-Based Sequential Decision-Making Under Uncertainty","date":"2019-05-16","arxiv_id":"1905.07030","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-exploration-policies-for-model","title":"Learning Exploration Policies for Model-Agnostic Meta-Reinforcement Learning","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-reinforcement-learning-for-adaptive-1","title":"Meta-Reinforcement Learning for Adaptive Autonomous Driving","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-policy-adaptation-for-hierarchical-1","title":"Sub-policy Adaptation for Hierarchical Reinforcement Learning","date":"2019-05-16","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-learning-based-branch-and-bound-for-maximum","title":"A Learning based Branch and Bound for Maximum Common Subgraph Problems","date":"2019-05-15","arxiv_id":"1905.05840","repositories_listed":0,"syntology":null},{"url":null,"slug":"addressing-the-loss-metric-mismatch-with","title":"Addressing the Loss-Metric Mismatch with Adaptive Loss Alignment","date":"2019-05-15","arxiv_id":"1905.05895","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-penetration-testing-using","title":"Autonomous Penetration Testing using Reinforcement Learning","date":"2019-05-15","arxiv_id":"1905.05965","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scheduling-in","title":"Deep reinforcement learning for scheduling in large-scale networked control systems","date":"2019-05-15","arxiv_id":"1905.05992","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-scheduling-in-1","title":"Deep Reinforcement Learning for Scheduling in Cellular Networks","date":"2019-05-15","arxiv_id":"1905.05914","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-robotics-and","title":"Reinforcement Learning for Robotics and Control with Active Uncertainty Reduction","date":"2019-05-15","arxiv_id":"1905.06274","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-parametric-and-nonparametric-models","title":"Combining Parametric and Nonparametric Models for Off-Policy Evaluation","date":"2019-05-14","arxiv_id":"1905.05787","repositories_listed":0,"syntology":null}],"record_sha256":"04e9a83f061ccc39d5a59e27422d10ca4ea2a3192cc446685377b808f16c841a","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}