{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning/papers/109","list_of":"/task/reinforcement-learning","task":"Reinforcement Learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":109,"pages_in_order":132,"rows_per_page":100,"rows":[10801,10900],"of":13178,"counts":{"archive_papers_tagged":13178,"with_a_code_link":4183,"where_syntology_ran_a_sample":1175,"not_listed_spam_title":0,"listed":13178,"listed_where_code_ran":1175,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":988,"every_run_a_failure_of_syntologys_instrument":187,"listed_with_a_run_with_no_instrument_failure":988,"listed_every_run_a_failure_of_syntologys_instrument":187,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning","prev":"/task/reinforcement-learning/papers/108","next":"/task/reinforcement-learning/papers/110","papers":[{"url":null,"slug":"multi-modal-active-learning-from-human-data-a","title":"Multi-modal Active Learning From Human Data: A Deep Reinforcement Learning Approach","date":"2019-06-07","arxiv_id":"1906.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-under-drift","title":"Non-Stationary Reinforcement Learning: The Blessing of (More) Optimism","date":"2019-06-07","arxiv_id":"1906.02922","repositories_listed":0,"syntology":null},{"url":null,"slug":"watch-try-learn-meta-learning-from","title":"Watch, Try, Learn: Meta-Learning from Demonstrations and Reward","date":"2019-06-07","arxiv_id":"1906.03352","repositories_listed":0,"syntology":null},{"url":null,"slug":"worst-case-regret-bounds-for-exploration-via","title":"Worst-Case Regret Bounds for Exploration via Randomized Value Functions","date":"2019-06-07","arxiv_id":"1906.02870","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-extensible-interactive-interface-for-agent","title":"An Extensible Interactive Interface for Agent Design","date":"2019-06-06","arxiv_id":"1906.02641","repositories_listed":0,"syntology":null},{"url":null,"slug":"clustered-reinforcement-learning","title":"Clustered Reinforcement Learning","date":"2019-06-06","arxiv_id":"1906.02457","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-reinforcement-learning-and","title":"Combining Reinforcement Learning and Configuration Checking for Maximum k-plex Problem","date":"2019-06-06","arxiv_id":"1906.02578","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-1","title":"Deep Reinforcement Learning for Multi-objective Optimization","date":"2019-06-06","arxiv_id":"1906.02386","repositories_listed":0,"syntology":null},{"url":null,"slug":"deepmdp-learning-continuous-latent-space","title":"DeepMDP: Learning Continuous Latent Space Models for Representation Learning","date":"2019-06-06","arxiv_id":"1906.02736","repositories_listed":0,"syntology":null},{"url":null,"slug":"playing-the-lottery-with-rewards-and-multiple","title":"Playing the lottery with rewards and multiple languages: lottery tickets in RL and NLP","date":"2019-06-06","arxiv_id":"1906.02768","repositories_listed":0,"syntology":null},{"url":null,"slug":"continuous-control-for-automated-lane-change","title":"Continuous Control for Automated Lane Change Behavior Based on Deep Deterministic Policy Gradient Algorithm","date":"2019-06-05","arxiv_id":"1906.02275","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-for-directed-acyclic-graph","title":"Deep Q-Learning for Directed Acyclic Graph Generation","date":"2019-06-05","arxiv_id":"1906.02280","repositories_listed":0,"syntology":null},{"url":null,"slug":"escaping-the-state-of-nature-a-hobbesian","title":"Escaping the State of Nature: A Hobbesian Approach to Cooperation in Multi-agent Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.09874","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-with-unreliable-intrinsic-reward","title":"Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.02138","repositories_listed":0,"syntology":null},{"url":null,"slug":"global-optimality-guarantees-for-policy","title":"Global Optimality Guarantees For Policy Gradient Methods","date":"2019-06-05","arxiv_id":"1906.01786","repositories_listed":0,"syntology":null},{"url":null,"slug":"measurement-based-online-available-bandwidth","title":"Measurement-based Online Available Bandwidth Estimation employing Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.07095","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-hypergraph-grammars-for","title":"Probabilistic hypergraph grammars for efficient molecular optimization","date":"2019-06-05","arxiv_id":"1906.01845","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-compact-decision-trees-for","title":"Risk-Sensitive Compact Decision Trees for Autonomous Execution in Presence of Simulated Market Response","date":"2019-06-05","arxiv_id":"1906.02312","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-reinforcement-learning-of-multiple","title":"Autonomous Reinforcement Learning of Multiple Interrelated Tasks","date":"2019-06-04","arxiv_id":"1906.01374","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-dynamic-polynomial-proofs","title":"Learning dynamic polynomial proofs","date":"2019-06-04","arxiv_id":"1906.01681","repositories_listed":0,"syntology":null},{"url":null,"slug":"off-policy-evaluation-via-off-policy","title":"Off-Policy Evaluation via Off-Policy Classification","date":"2019-06-04","arxiv_id":"1906.01624","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-board-deep-q-network-for-uav-assisted","title":"On-board Deep Q-Network for UAV-assisted Online Power Transfer and Data Collection","date":"2019-06-04","arxiv_id":"1906.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"options-as-responses-grounding-behavioural","title":"Options as responses: Grounding behavioural hierarchies in multi-agent RL","date":"2019-06-04","arxiv_id":"1906.01470","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-variance-analysis-of-gaussian","title":"Posterior Variance Analysis of Gaussian Processes with Application to Average Learning Curves","date":"2019-06-04","arxiv_id":"1906.01404","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-translation-with-flexible-policy","title":"Simultaneous Translation with Flexible Policy via Restricted Imitation Learning","date":"2019-06-04","arxiv_id":"1906.01135","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600571","title":"Deep Reinforcement Learning Architecture for Continuous Power Allocation in High Throughput Satellites","date":"2019-06-03","arxiv_id":"1906.00571","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600625","title":"Decentralized Deep Reinforcement Learning for Delay-Power Tradeoff in Vehicular Communications","date":"2019-06-03","arxiv_id":"1906.00625","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600767","title":"Load Balancing for Ultra-Dense Networks: A Deep Reinforcement Learning Based Approach","date":"2019-06-03","arxiv_id":"1906.00767","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-exploitation-of-policy-imitation","title":"Adversarial Exploitation of Policy Imitation","date":"2019-06-03","arxiv_id":"1906.01121","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-reliability-optimization-for","title":"Proximal Reliability Optimization for Reinforcement Learning","date":"2019-06-03","arxiv_id":"1906.01127","repositories_listed":0,"syntology":null},{"url":null,"slug":"reconstruct-and-represent-video-contents-for","title":"Reconstruct and Represent Video Contents for Captioning via Reinforcement Learning","date":"2019-06-03","arxiv_id":"1906.01452","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-based-method-for-benchmarking-the","title":"RL-Based Method for Benchmarking the Adversarial Resilience and Robustness of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01110","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-triggers-for-watermarking-of-deep","title":"Sequential Triggers for Watermarking of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01126","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600317","title":"Automated Video Game Testing Using Synthetic and Human-Like Agents","date":"2019-06-02","arxiv_id":"1906.00317","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600336","title":"The Principle of Unchanged Optimality in Reinforcement Learning Generalization","date":"2019-06-02","arxiv_id":"1906.00336","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600429","title":"Learner-aware Teaching: Inverse Reinforcement Learning with Preferences and Constraints","date":"2019-06-02","arxiv_id":"1906.00429","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600431","title":"An Empirical Study on Hyperparameters and their Interdependence for RL Generalization","date":"2019-06-02","arxiv_id":"1906.00431","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600131","title":"Decision-Making in Reinforcement Learning","date":"2019-06-01","arxiv_id":"1906.00131","repositories_listed":0,"syntology":null},{"url":null,"slug":"context-reinforced-semantic-segmentation","title":"Context-Reinforced Semantic Segmentation","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"early-rumour-detection","title":"Early Rumour Detection","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-bayesian-compression-via-deep","title":"Enhanced Bayesian Compression via Deep Reinforcement Learning","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-noisy-data-in-distant-supervision","title":"Exploiting Noisy Data in Distant Supervision Relation Classification","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-driven-temporal-activity","title":"Language-Driven Temporal Activity Localization: A Semantic Matching Reinforcement Learning Model","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-channel-wise-interactions-for-binary","title":"Learning Channel-Wise Interactions for Binary Convolutional Neural Networks","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-interpretable-negation-rules-via","title":"Learning Interpretable Negation Rules via Weak Supervision at Document Level: A Reinforcement Learning Approach","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-personalized-modular-network-guided","title":"Learning Personalized Modular Network Guided by Structured Knowledge","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"spot-and-learn-a-maximum-entropy-patch","title":"Spot and Learn: A Maximum-Entropy Patch Sampler for Few-Shot Image Classification","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"task-agnostic-meta-learning-for-few-shot-1","title":"Task Agnostic Meta-Learning for Few-Shot Learning","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"190600088","title":"Diversity-Inducing Policy Gradient: Using Maximum Mean Discrepancy to Find a Set of Diverse Policies","date":"2019-05-31","arxiv_id":"1906.00088","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600729","title":"Policy Optimization Provably Converges to Nash Equilibria in Zero-Sum Linear Quadratic Games","date":"2019-05-31","arxiv_id":"1906.00729","repositories_listed":0,"syntology":null},{"url":null,"slug":"attentional-policies-for-cross-context-multi","title":"Attentional Policies for Cross-Context Multi-Agent Reinforcement Learning","date":"2019-05-31","arxiv_id":"1905.13428","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-experience-reuse-with","title":"Reinforcement Learning Experience Reuse with Policy Residual Representation","date":"2019-05-31","arxiv_id":"1905.13719","repositories_listed":0,"syntology":null},{"url":"/paper/rewarding-smatch-transition-based-amr-parsing","slug":"rewarding-smatch-transition-based-amr-parsing","title":"Rewarding Smatch: Transition-Based AMR Parsing with Reinforcement Learning","date":"2019-05-31","arxiv_id":"1905.13370","repositories_listed":0,"syntology":null},{"url":null,"slug":"combating-the-compounding-error-problem-with","title":"Combating the Compounding-Error Problem with a Multi-step Model","date":"2019-05-30","arxiv_id":"1905.13320","repositories_listed":0,"syntology":null},{"url":null,"slug":"defining-admissible-rewards-for-high","title":"Defining Admissible Rewards for High Confidence Policy Evaluation","date":"2019-05-30","arxiv_id":"1905.13167","repositories_listed":0,"syntology":null},{"url":null,"slug":"dont-forget-your-teacher-a-corrective","title":"Don't Forget Your Teacher: A Corrective Reinforcement Learning Framework","date":"2019-05-30","arxiv_id":"1905.13562","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-medical-test-suggestions-using-deep","title":"Effective Medical Test Suggestions Using Deep Reinforcement Learning","date":"2019-05-30","arxiv_id":"1905.12916","repositories_listed":0,"syntology":null},{"url":null,"slug":"finite-time-analysis-of-approximate-policy","title":"Finite-time Analysis of Approximate Policy Iteration for the Linear Quadratic Regulator","date":"2019-05-30","arxiv_id":"1905.12842","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-value-functions-and-the-agent-environment","title":"On Value Functions and the Agent-Environment Boundary","date":"2019-05-30","arxiv_id":"1905.13341","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-mean-field-game","title":"Reinforcement Learning for Mean Field Game","date":"2019-05-30","arxiv_id":"1905.13357","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-heuristic-for-unsupervised-model-selection","title":"Unsupervised Model Selection for Variational Disentangled Representation Learning","date":"2019-05-29","arxiv_id":"1905.12614","repositories_listed":0,"syntology":null},{"url":null,"slug":"advantage-amplification-in-slowly-evolving","title":"Advantage Amplification in Slowly Evolving Latent-State Environments","date":"2019-05-29","arxiv_id":"1905.13559","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-convergence-analysis-of","title":"An Improved Convergence Analysis of Stochastic Variance-Reduced Policy Gradient","date":"2019-05-29","arxiv_id":"1905.12615","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-navigation-subroutines-by-watching","title":"Learning Navigation Subroutines from Egocentric Videos","date":"2019-05-29","arxiv_id":"1905.12612","repositories_listed":0,"syntology":null},{"url":null,"slug":"linear-interpolation-gives-better-gradients","title":"Linear interpolation gives better gradients than Gaussian smoothing in derivative-free optimization","date":"2019-05-29","arxiv_id":"1905.13043","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-generalization-gap-in","title":"On the Generalization Gap in Reparameterizable Reinforcement Learning","date":"2019-05-29","arxiv_id":"1905.12654","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-policy-mixture","title":"Reinforcement Learning with Policy Mixture Model for Temporal Point Processes Clustering","date":"2019-05-29","arxiv_id":"1905.12345","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-and-transferable-learning-of","title":"Learning NP-Hard Multi-Agent Assignment Planning using GNN: Inference on a Random Graph and Provable Auction-Fitted Q-learning","date":"2019-05-29","arxiv_id":"1905.12204","repositories_listed":0,"syntology":null},{"url":null,"slug":"switching-linear-dynamics-for-variational","title":"Switching Linear Dynamics for Variational Bayes Filtering","date":"2019-05-29","arxiv_id":"1905.12434","repositories_listed":0,"syntology":null},{"url":null,"slug":"targeted-attacks-on-deep-reinforcement","title":"CopyCAT: Taking Control of Neural Policies with Constant Attacks","date":"2019-05-29","arxiv_id":"1905.12282","repositories_listed":0,"syntology":null},{"url":null,"slug":"variance-reduction-for-evolution-strategies","title":"Variance Reduction for Evolution Strategies via Structured Control Variates","date":"2019-05-29","arxiv_id":"1906.08868","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-control-model-based-approach-for","title":"A General Markov Decision Process Framework for Directly Learning Optimal Control Policies","date":"2019-05-28","arxiv_id":"1905.12009","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-exponentially-discounted-sum-automatic","title":"Beyond Exponentially Discounted Sum: Automatic Learning of Return Function","date":"2019-05-28","arxiv_id":"1905.11591","repositories_listed":0,"syntology":null},{"url":null,"slug":"conditions-on-features-for-temporal","title":"Conditions on Features for Temporal Difference-Like Methods to Converge","date":"2019-05-28","arxiv_id":"1905.11702","repositories_listed":0,"syntology":null},{"url":null,"slug":"generation-of-policy-level-explanations-for","title":"Generation of Policy-Level Explanations for Reinforcement Learning","date":"2019-05-28","arxiv_id":"1905.12044","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-teaching-algorithms-for-inverse","title":"Interactive Teaching Algorithms for Inverse Reinforcement Learning","date":"2019-05-28","arxiv_id":"1905.11867","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-and-effective-exploration","title":"Learning Efficient and Effective Exploration Policies with Counterfactual Meta Policy","date":"2019-05-28","arxiv_id":"1905.11583","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-complexity-of-sample-average","title":"Sample Complexity of Sample Average Approximation for Conditional Stochastic Optimization","date":"2019-05-28","arxiv_id":"1905.11957","repositories_listed":0,"syntology":null},{"url":null,"slug":"190601408","title":"Hypothesis-Driven Skill Discovery for Hierarchical Deep Reinforcement Learning","date":"2019-05-27","arxiv_id":"1906.01408","repositories_listed":0,"syntology":null},{"url":null,"slug":"agentgraph-towards-universal-dialogue","title":"AgentGraph: Towards Universal Dialogue Management with Structured Deep Reinforcement Learning","date":"2019-05-27","arxiv_id":"1905.11259","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangling-dynamics-and-returns-value","title":"Disentangling Dynamics and Returns: Value Function Decomposition with Future Prediction","date":"2019-05-27","arxiv_id":"1905.11100","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-latent-state-representation-for","title":"Learning latent state representation for speeding up exploration","date":"2019-05-27","arxiv_id":"1905.12621","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-policies-from-human-data-for-skat","title":"Learning Policies from Human Data for Skat","date":"2019-05-27","arxiv_id":"1905.10907","repositories_listed":0,"syntology":null},{"url":null,"slug":"near-optimal-optimistic-reinforcement","title":"Near-optimal Optimistic Reinforcement Learning using Empirical Bernstein Inequalities","date":"2019-05-27","arxiv_id":"1905.12425","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-search-by-target-distribution-learning","title":"Policy Search by Target Distribution Learning for Continuous Control","date":"2019-05-27","arxiv_id":"1905.11041","repositories_listed":0,"syntology":null},{"url":"/paper/selective-transfer-with-reinforced-transfer","slug":"selective-transfer-with-reinforced-transfer","title":"Selective Transfer with Reinforced Transfer Network for Partial Domain Adaptation","date":"2019-05-26","arxiv_id":"1905.10756","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-bayes-a-report-on-approaches-and","title":"Variational Bayes: A report on approaches and applications","date":"2019-05-26","arxiv_id":"1905.10744","repositories_listed":0,"syntology":null},{"url":null,"slug":"190512726","title":"Prioritized Sequence Experience Replay","date":"2019-05-25","arxiv_id":"1905.12726","repositories_listed":0,"syntology":null},{"url":null,"slug":"aspire-automated-security-policy","title":"Transferable Cost-Aware Security Policy Implementation for Malware Detection Using Deep Reinforcement Learning","date":"2019-05-25","arxiv_id":"1905.10517","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-ensembles-of-policies-with-deep","title":"Composing Task-Agnostic Policies with Deep Reinforcement Learning","date":"2019-05-25","arxiv_id":"1905.10681","repositories_listed":0,"syntology":null},{"url":"/paper/learning-to-reason-in-large-theories-without","slug":"learning-to-reason-in-large-theories-without","title":"Learning to Reason in Large Theories without Imitation","date":"2019-05-25","arxiv_id":"1905.10501","repositories_listed":0,"syntology":null},{"url":null,"slug":"190512567","title":"MQLV: Optimal Policy of Money Management in Retail Banking with Q-Learning","date":"2019-05-24","arxiv_id":"1905.12567","repositories_listed":0,"syntology":null},{"url":null,"slug":"190601407","title":"RL4health: Crowdsourcing Reinforcement Learning for Knee Replacement Pathway Optimization","date":"2019-05-24","arxiv_id":"1906.01407","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-machine-learning-by-pipeline","title":"Automatic Machine Learning by Pipeline Synthesis using Model-Based Reinforcement Learning and a Grammar","date":"2019-05-24","arxiv_id":"1905.10345","repositories_listed":0,"syntology":null},{"url":null,"slug":"inforl-interpretable-reinforcement-learning","title":"InfoRL: Interpretable Reinforcement Learning using Information Maximization","date":"2019-05-24","arxiv_id":"1905.10404","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-leaning-in-feature-space-matrix","title":"Reinforcement Learning in Feature Space: Matrix Bandit, Kernels, and Regret Bound","date":"2019-05-24","arxiv_id":"1905.10389","repositories_listed":0,"syntology":null},{"url":null,"slug":"rethinking-expected-cumulative-reward","title":"A Micro-Objective Perspective of Reinforcement Learning","date":"2019-05-24","arxiv_id":"1905.10016","repositories_listed":0,"syntology":null},{"url":null,"slug":"190509949","title":"Scene Induced Multi-Modal Trajectory Forecasting via Planning","date":"2019-05-23","arxiv_id":"1905.09949","repositories_listed":0,"syntology":null},{"url":null,"slug":"average-reward-reinforcement-learning-with","title":"Unknown mixing times in apprenticeship and reinforcement learning","date":"2019-05-23","arxiv_id":"1905.09704","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-with-q-matrix-transfer","title":"Deep Q-Learning with Q-Matrix Transfer Learning for Novel Fire Evacuation Environment","date":"2019-05-23","arxiv_id":"1905.09673","repositories_listed":0,"syntology":null}],"record_sha256":"96ffa9b329aae1dbb3d36cf192335e02ad6de5b8ad5f8d2b7dcf217a8c94294c","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}