{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/119","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":119,"pages_in_order":135,"rows_per_page":100,"rows":[11801,11900],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/118","next":"/task/reinforcement-learning-2/papers/120","papers":[{"url":null,"slug":"toward-simulating-environments-in","title":"Toward Simulating Environments in Reinforcement Learning Based Recommendations","date":"2019-06-27","arxiv_id":"1906.11462","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-tractable-algorithm-for-finite-horizon","title":"A Tractable Algorithm For Finite-Horizon Continuous Reinforcement Learning","date":"2019-06-26","arxiv_id":"1906.11245","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-dynamic-programming-for-linear","title":"Approximate Dynamic Programming For Linear Systems with State and Input Constraints","date":"2019-06-26","arxiv_id":"1906.11369","repositories_listed":0,"syntology":null},{"url":null,"slug":"regularized-hierarchical-policies-for","title":"Compositional Transfer in Hierarchical Reinforcement Learning","date":"2019-06-26","arxiv_id":"1906.11228","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-proximaltrust-region-policy","title":"Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy","date":"2019-06-25","arxiv_id":"1906.10306","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-multi-agent-learning-in-team-sports-games","title":"On Multi-Agent Learning in Team Sports Games","date":"2019-06-25","arxiv_id":"1906.10124","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-proximal-policy-optimization","title":"Optimistic Proximal Policy Optimization","date":"2019-06-25","arxiv_id":"1906.11075","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-with-stochastic-mirror","title":"Policy Optimization with Stochastic Mirror Descent","date":"2019-06-25","arxiv_id":"1906.10462","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-competitive","title":"Reinforcement Learning with Competitive Ensembles of Information-Constrained Primitives","date":"2019-06-25","arxiv_id":"1906.10667","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-theoretical-connection-between-statistical","title":"A Theoretical Connection Between Statistical Physics and Reinforcement Learning","date":"2019-06-24","arxiv_id":"1906.10228","repositories_listed":0,"syntology":null},{"url":null,"slug":"deceptive-reinforcement-learning-under","title":"Deceptive Reinforcement Learning Under Adversarial Manipulations on Cost Signals","date":"2019-06-24","arxiv_id":"1906.10571","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-conditioned-on","title":"Inverse reinforcement learning conditioned on brain scan","date":"2019-06-24","arxiv_id":"1906.09770","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-networks-with-motivation","title":"Neural networks with motivation","date":"2019-06-23","arxiv_id":"1906.09528","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-trajectory","title":"Reinforcement Learning-Based Trajectory Design for the Aerial Base Stations","date":"2019-06-23","arxiv_id":"1906.09550","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-study-of-state-aliasing-in-structured","title":"A Study of State Aliasing in Structured Prediction with RNNs","date":"2019-06-21","arxiv_id":"1906.09310","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-with","title":"Continual Reinforcement Learning with Diversity Exploration and Adversarial Self-Correction","date":"2019-06-21","arxiv_id":"1906.09205","repositories_listed":0,"syntology":null},{"url":null,"slug":"disentangled-skill-embeddings-for","title":"Disentangled Skill Embeddings for Reinforcement Learning","date":"2019-06-21","arxiv_id":"1906.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"leveraging-reinforcement-learning-techniques","title":"Leveraging Reinforcement Learning Techniques for Effective Policy Adoption and Validation","date":"2019-06-21","arxiv_id":"1906.09340","repositories_listed":0,"syntology":null},{"url":null,"slug":"cache-aided-noma-mobile-edge-computing-a","title":"Cache-Aided NOMA Mobile Edge Computing: A Reinforcement Learning Approach","date":"2019-06-20","arxiv_id":"1906.08812","repositories_listed":0,"syntology":null},{"url":null,"slug":"cooperative-lane-changing-via-deep","title":"Cooperative Lane Changing via Deep Reinforcement Learning","date":"2019-06-20","arxiv_id":"1906.08662","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-needles-in-a-moving-haystack","title":"Finding Needles in a Moving Haystack: Prioritizing Alerts with Adversarial Reinforcement Learning","date":"2019-06-20","arxiv_id":"1906.08805","repositories_listed":0,"syntology":null},{"url":null,"slug":"adapting-behaviour-via-intrinsic-reward-a","title":"Adapting Behaviour via Intrinsic Reward: A Survey and Empirical Study","date":"2019-06-19","arxiv_id":"1906.07865","repositories_listed":0,"syntology":null},{"url":null,"slug":"experience-replay-optimization","title":"Experience Replay Optimization","date":"2019-06-19","arxiv_id":"1906.08387","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-user-resource-control-with-deep","title":"Multi-user Resource Control with Deep Reinforcement Learning in IoT Edge Computing","date":"2019-06-19","arxiv_id":"1906.07860","repositories_listed":0,"syntology":null},{"url":null,"slug":"qxplore-q-learning-exploration-by-maximizing","title":"Reward Prediction Error as an Exploration Objective in Deep RL","date":"2019-06-19","arxiv_id":"1906.08189","repositories_listed":0,"syntology":null},{"url":null,"slug":"wasserstein-adversarial-imitation-learning","title":"Wasserstein Adversarial Imitation Learning","date":"2019-06-19","arxiv_id":"1906.08113","repositories_listed":0,"syntology":null},{"url":null,"slug":"directed-exploration-for-reinforcement","title":"Directed Exploration for Reinforcement Learning","date":"2019-06-18","arxiv_id":"1906.07805","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-reinforcement-learning-for","title":"Evolutionary Reinforcement Learning for Sample-Efficient Multiagent Coordination","date":"2019-06-18","arxiv_id":"1906.07315","repositories_listed":0,"syntology":null},{"url":null,"slug":"gap-increasing-policy-evaluation-for","title":"Gap-Increasing Policy Evaluation for Efficient and Noise-Tolerant Reinforcement Learning","date":"2019-06-18","arxiv_id":"1906.07586","repositories_listed":0,"syntology":null},{"url":null,"slug":"ridm-reinforced-inverse-dynamics-modeling-for","title":"RIDM: Reinforced Inverse Dynamics Modeling for Learning from a Single Observed Demonstration","date":"2019-06-18","arxiv_id":"1906.07372","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-reinforcement-learning-for-continuous","title":"Robust Reinforcement Learning for Continuous Control with Model Misspecification","date":"2019-06-18","arxiv_id":"1906.07516","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-gray-box-approach-for-curriculum-learning","title":"A gray-box approach for curriculum learning","date":"2019-06-17","arxiv_id":"1906.06812","repositories_listed":0,"syntology":null},{"url":null,"slug":"iterative-model-based-reinforcement-learning","title":"Iterative Model-Based Reinforcement Learning Using Simulations in the Differentiable Neural Computer","date":"2019-06-17","arxiv_id":"1906.07248","repositories_listed":0,"syntology":null},{"url":null,"slug":"lpaintb-learning-to-paint-from-self","title":"LPaintB: Learning to Paint from Self-Supervision","date":"2019-06-17","arxiv_id":"1906.06841","repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-successor-features-based-deep","title":"Universal Successor Features Based Deep Reinforcement Learning for Navigation","date":"2019-06-17","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-driven-heuristic","title":"Reinforcement Learning Driven Heuristic Optimization","date":"2019-06-16","arxiv_id":"1906.06639","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-non-uniform-state","title":"Reinforcement Learning with Non-uniform State Representations for Adaptive Search","date":"2019-06-15","arxiv_id":"1906.06588","repositories_listed":0,"syntology":null},{"url":null,"slug":"epistemic-risk-sensitive-reinforcement","title":"Epistemic Risk-Sensitive Reinforcement Learning","date":"2019-06-14","arxiv_id":"1906.06273","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-q-learning-with-function","title":"Provably Efficient $Q$-learning with Function Approximation via Distribution Shift Error Checking Oracle","date":"2019-06-14","arxiv_id":"1906.06321","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-tuning-sectorization-deep-reinforcement","title":"Self-Tuning Sectorization: Deep Reinforcement Learning Meets Broadcast Beam Optimization","date":"2019-06-14","arxiv_id":"1906.06021","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-cyber","title":"Deep Reinforcement Learning for Cyber Security","date":"2019-06-13","arxiv_id":"1906.05799","repositories_listed":0,"syntology":null},{"url":null,"slug":"jacobian-policy-optimizations","title":"Conditioning of Reinforcement Learning Agents and its Policy Regularization Application","date":"2019-06-13","arxiv_id":"1906.05437","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-and-interpreting-real-world-human","title":"Modeling and Interpreting Real-world Human Risk Decision Making with Inverse Reinforcement Learning","date":"2019-06-13","arxiv_id":"1906.05803","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-policy-adaptation-for-hierarchical","title":"Sub-policy Adaptation for Hierarchical Reinforcement Learning","date":"2019-06-13","arxiv_id":"1906.05862","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-unmanned","title":"Deep Reinforcement Learning for Unmanned Aerial Vehicle-Assisted Vehicular Networks","date":"2019-06-12","arxiv_id":"1906.05015","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-minimization-for-reinforcement","title":"Regret Minimization for Reinforcement Learning by Evaluating the Optimal Bias Function","date":"2019-06-12","arxiv_id":"1906.05110","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-based-adaptive-optimal","title":"Adaptive Optimal Control for Reference Tracking Independent of Exo-System Dynamics","date":"2019-06-12","arxiv_id":"1906.05085","repositories_listed":0,"syntology":null},{"url":null,"slug":"sub-goal-trees-a-framework-for-goal-directed","title":"Sub-Goal Trees -- a Framework for Goal-Directed Trajectory Prediction and Optimization","date":"2019-06-12","arxiv_id":"1906.05329","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-hybrid-approach-between-adversarial","title":"A Hybrid Approach Between Adversarial Generative Networks and Actor-Critic Policy Gradient for Low Rate High-Resolution Image Compression","date":"2019-06-11","arxiv_id":"1906.04681","repositories_listed":0,"syntology":null},{"url":null,"slug":"continual-reinforcement-learning-deployed-in","title":"Continual Reinforcement Learning deployed in Real-life using Policy Distillation and Sim2Real Transfer","date":"2019-06-11","arxiv_id":"1906.04452","repositories_listed":0,"syntology":null},{"url":null,"slug":"dealing-with-non-stationarity-in-multi-agent","title":"Dealing with Non-Stationarity in Multi-Agent Deep Reinforcement Learning","date":"2019-06-11","arxiv_id":"1906.04737","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-integer","title":"Reinforcement Learning for Integer Programming: Learning to Cut","date":"2019-06-11","arxiv_id":"1906.04859","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-minimalist-numeral","title":"Reinforcement Learning of Minimalist Numeral Grammars","date":"2019-06-11","arxiv_id":"1906.04447","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-inverse-reinforcement-learning-for","title":"Towards Inverse Reinforcement Learning for Limit Order Book Dynamics","date":"2019-06-11","arxiv_id":"1906.04813","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-survey-of-reinforcement-learning-informed","title":"A Survey of Reinforcement Learning Informed by Natural Language","date":"2019-06-10","arxiv_id":"1906.03926","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-the-optimality-of-sparse-model-based","title":"Model-Based Reinforcement Learning with a Generative Model is Minimax Optimal","date":"2019-06-10","arxiv_id":"1906.03804","repositories_listed":0,"syntology":null},{"url":null,"slug":"neural-heterogeneous-scheduler","title":"Neural Heterogeneous Scheduler","date":"2019-06-09","arxiv_id":"1906.03724","repositories_listed":0,"syntology":null},{"url":null,"slug":"transfer-learning-by-modeling-a-distribution","title":"Transfer Learning by Modeling a Distribution over Policies","date":"2019-06-09","arxiv_id":"1906.03574","repositories_listed":0,"syntology":null},{"url":null,"slug":"optimal-off-policy-evaluation-for","title":"Towards Optimal Off-Policy Evaluation for Reinforcement Learning with Marginalized Importance Sampling","date":"2019-06-08","arxiv_id":"1906.03393","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-modal-active-learning-from-human-data-a","title":"Multi-modal Active Learning From Human Data: A Deep Reinforcement Learning Approach","date":"2019-06-07","arxiv_id":"1906.03098","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-under-drift","title":"Non-Stationary Reinforcement Learning: The Blessing of (More) Optimism","date":"2019-06-07","arxiv_id":"1906.02922","repositories_listed":0,"syntology":null},{"url":null,"slug":"worst-case-regret-bounds-for-exploration-via","title":"Worst-Case Regret Bounds for Exploration via Randomized Value Functions","date":"2019-06-07","arxiv_id":"1906.02870","repositories_listed":0,"syntology":null},{"url":null,"slug":"clustered-reinforcement-learning","title":"Clustered Reinforcement Learning","date":"2019-06-06","arxiv_id":"1906.02457","repositories_listed":0,"syntology":null},{"url":null,"slug":"combining-reinforcement-learning-and","title":"Combining Reinforcement Learning and Configuration Checking for Maximum k-plex Problem","date":"2019-06-06","arxiv_id":"1906.02578","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi-1","title":"Deep Reinforcement Learning for Multi-objective Optimization","date":"2019-06-06","arxiv_id":"1906.02386","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-q-learning-for-directed-acyclic-graph","title":"Deep Q-Learning for Directed Acyclic Graph Generation","date":"2019-06-05","arxiv_id":"1906.02280","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-with-unreliable-intrinsic-reward","title":"Exploration with Unreliable Intrinsic Reward in Multi-Agent Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.02138","repositories_listed":0,"syntology":null},{"url":null,"slug":"measurement-based-online-available-bandwidth","title":"Measurement-based Online Available Bandwidth Estimation employing Reinforcement Learning","date":"2019-06-05","arxiv_id":"1906.07095","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-hypergraph-grammars-for","title":"Probabilistic hypergraph grammars for efficient molecular optimization","date":"2019-06-05","arxiv_id":"1906.01845","repositories_listed":0,"syntology":null},{"url":null,"slug":"risk-sensitive-compact-decision-trees-for","title":"Risk-Sensitive Compact Decision Trees for Autonomous Execution in Presence of Simulated Market Response","date":"2019-06-05","arxiv_id":"1906.02312","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-reinforcement-learning-of-multiple","title":"Autonomous Reinforcement Learning of Multiple Interrelated Tasks","date":"2019-06-04","arxiv_id":"1906.01374","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-board-deep-q-network-for-uav-assisted","title":"On-board Deep Q-Network for UAV-assisted Online Power Transfer and Data Collection","date":"2019-06-04","arxiv_id":"1906.07064","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-variance-analysis-of-gaussian","title":"Posterior Variance Analysis of Gaussian Processes with Application to Average Learning Curves","date":"2019-06-04","arxiv_id":"1906.01404","repositories_listed":0,"syntology":null},{"url":null,"slug":"simultaneous-translation-with-flexible-policy","title":"Simultaneous Translation with Flexible Policy via Restricted Imitation Learning","date":"2019-06-04","arxiv_id":"1906.01135","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600571","title":"Deep Reinforcement Learning Architecture for Continuous Power Allocation in High Throughput Satellites","date":"2019-06-03","arxiv_id":"1906.00571","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600625","title":"Decentralized Deep Reinforcement Learning for Delay-Power Tradeoff in Vehicular Communications","date":"2019-06-03","arxiv_id":"1906.00625","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600767","title":"Load Balancing for Ultra-Dense Networks: A Deep Reinforcement Learning Based Approach","date":"2019-06-03","arxiv_id":"1906.00767","repositories_listed":0,"syntology":null},{"url":null,"slug":"adversarial-exploitation-of-policy-imitation","title":"Adversarial Exploitation of Policy Imitation","date":"2019-06-03","arxiv_id":"1906.01121","repositories_listed":0,"syntology":null},{"url":null,"slug":"proximal-reliability-optimization-for","title":"Proximal Reliability Optimization for Reinforcement Learning","date":"2019-06-03","arxiv_id":"1906.01127","repositories_listed":0,"syntology":null},{"url":null,"slug":"reconstruct-and-represent-video-contents-for","title":"Reconstruct and Represent Video Contents for Captioning via Reinforcement Learning","date":"2019-06-03","arxiv_id":"1906.01452","repositories_listed":0,"syntology":null},{"url":null,"slug":"rl-based-method-for-benchmarking-the","title":"RL-Based Method for Benchmarking the Adversarial Resilience and Robustness of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01110","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequential-triggers-for-watermarking-of-deep","title":"Sequential Triggers for Watermarking of Deep Reinforcement Learning Policies","date":"2019-06-03","arxiv_id":"1906.01126","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600317","title":"Automated Video Game Testing Using Synthetic and Human-Like Agents","date":"2019-06-02","arxiv_id":"1906.00317","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600336","title":"The Principle of Unchanged Optimality in Reinforcement Learning Generalization","date":"2019-06-02","arxiv_id":"1906.00336","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600429","title":"Learner-aware Teaching: Inverse Reinforcement Learning with Preferences and Constraints","date":"2019-06-02","arxiv_id":"1906.00429","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600431","title":"An Empirical Study on Hyperparameters and their Interdependence for RL Generalization","date":"2019-06-02","arxiv_id":"1906.00431","repositories_listed":0,"syntology":null},{"url":null,"slug":"190600131","title":"Decision-Making in Reinforcement Learning","date":"2019-06-01","arxiv_id":"1906.00131","repositories_listed":0,"syntology":null},{"url":null,"slug":"enhanced-bayesian-compression-via-deep","title":"Enhanced Bayesian Compression via Deep Reinforcement Learning","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploiting-noisy-data-in-distant-supervision","title":"Exploiting Noisy Data in Distant Supervision Relation Classification","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"language-driven-temporal-activity","title":"Language-Driven Temporal Activity Localization: A Semantic Matching Reinforcement Learning Model","date":"2019-06-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"attentional-policies-for-cross-context-multi","title":"Attentional Policies for Cross-Context Multi-Agent Reinforcement Learning","date":"2019-05-31","arxiv_id":"1905.13428","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-experience-reuse-with","title":"Reinforcement Learning Experience Reuse with Policy Residual Representation","date":"2019-05-31","arxiv_id":"1905.13719","repositories_listed":0,"syntology":null},{"url":"/paper/rewarding-smatch-transition-based-amr-parsing","slug":"rewarding-smatch-transition-based-amr-parsing","title":"Rewarding Smatch: Transition-Based AMR Parsing with Reinforcement Learning","date":"2019-05-31","arxiv_id":"1905.13370","repositories_listed":0,"syntology":null},{"url":null,"slug":"combating-the-compounding-error-problem-with","title":"Combating the Compounding-Error Problem with a Multi-step Model","date":"2019-05-30","arxiv_id":"1905.13320","repositories_listed":0,"syntology":null},{"url":null,"slug":"dont-forget-your-teacher-a-corrective","title":"Don't Forget Your Teacher: A Corrective Reinforcement Learning Framework","date":"2019-05-30","arxiv_id":"1905.13562","repositories_listed":0,"syntology":null},{"url":null,"slug":"effective-medical-test-suggestions-using-deep","title":"Effective Medical Test Suggestions Using Deep Reinforcement Learning","date":"2019-05-30","arxiv_id":"1905.12916","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-value-functions-and-the-agent-environment","title":"On Value Functions and the Agent-Environment Boundary","date":"2019-05-30","arxiv_id":"1905.13341","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-for-mean-field-game","title":"Reinforcement Learning for Mean Field Game","date":"2019-05-30","arxiv_id":"1905.13357","repositories_listed":0,"syntology":null},{"url":null,"slug":"advantage-amplification-in-slowly-evolving","title":"Advantage Amplification in Slowly Evolving Latent-State Environments","date":"2019-05-29","arxiv_id":"1905.13559","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-improved-convergence-analysis-of","title":"An Improved Convergence Analysis of Stochastic Variance-Reduced Policy Gradient","date":"2019-05-29","arxiv_id":"1905.12615","repositories_listed":0,"syntology":null}],"record_sha256":"643385d68e7fdb66556686e13eff1fb6ce0ba063b77ae89cfd4a79ae458d1c48","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}