{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/reinforcement-learning-2/papers/129","list_of":"/task/reinforcement-learning-2","task":"reinforcement-learning","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":129,"pages_in_order":135,"rows_per_page":100,"rows":[12801,12900],"of":13427,"counts":{"archive_papers_tagged":13427,"with_a_code_link":4119,"where_syntology_ran_a_sample":1165,"not_listed_spam_title":0,"listed":13427,"listed_where_code_ran":1165,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":973,"every_run_a_failure_of_syntologys_instrument":192,"listed_with_a_run_with_no_instrument_failure":973,"listed_every_run_a_failure_of_syntologys_instrument":192,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/reinforcement-learning-2","prev":"/task/reinforcement-learning-2/papers/128","next":"/task/reinforcement-learning-2/papers/130","papers":[{"url":null,"slug":"model-based-imitation-learning-from-state","title":"Model-based imitation learning from state trajectories","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"neuron-as-an-agent","title":"Neuron as an Agent","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"now-i-remember-episodic-memory-for","title":"Now I Remember! Episodic Memory For Reinforcement Learning","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-gradient-for-multidimensional-action","title":"Policy Gradient For Multidimensional Action Spaces: Action Sampling and Entropy Bonus","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"predicting-multiple-actions-for-stochastic","title":"Predicting Multiple Actions for Stochastic Continuous Control","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-via-replica-stacking","title":"Reinforcement Learning via Replica Stacking of Quantum Measurements for the Training of Quantum Boltzmann Machines","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"representing-entropy-a-short-proof-of-the","title":"Representing Entropy : A short proof of the equivalence between soft Q-learning and policy gradients","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"reward-estimation-via-state-prediction","title":"Reward Estimation via State Prediction","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"universal-agent-for-disentangling","title":"Universal Agent for Disentangling Environments and Tasks","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"using-deep-reinforcement-learning-to-generate","title":"Using Deep Reinforcement Learning to Generate Rationales for Molecules","date":"2018-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"sbeed-convergent-reinforcement-learning-with","title":"SBEED: Convergent Reinforcement Learning with Nonlinear Function Approximation","date":"2017-12-29","arxiv_id":"1712.10285","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-with-analogical","title":"Reinforcement Learning with Analogical Similarity to Guide Schema Induction and Attention","date":"2017-12-28","arxiv_id":"1712.10070","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-short-variational-proof-of-equivalence","title":"A short variational proof of equivalence between policy gradients and soft Q learning","date":"2017-12-22","arxiv_id":"1712.08650","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiagent-based-participatory-urban","title":"Multiagent-based Participatory Urban Simulation through Inverse Reinforcement Learning","date":"2017-12-21","arxiv_id":"1712.07887","repositories_listed":0,"syntology":null},{"url":null,"slug":"hierarchical-and-interpretable-skill","title":"Hierarchical and Interpretable Skill Acquisition in Multi-task Reinforcement Learning","date":"2017-12-20","arxiv_id":"1712.07294","repositories_listed":0,"syntology":null},{"url":null,"slug":"pseudorehearsal-in-actor-critic-agents-with","title":"Pseudorehearsal in actor-critic agents with neural network function approximation","date":"2017-12-20","arxiv_id":"1712.07686","repositories_listed":0,"syntology":null},{"url":null,"slug":"recurrent-attentional-reinforcement-learning","title":"Recurrent Attentional Reinforcement Learning for Multi-label Image Recognition","date":"2017-12-20","arxiv_id":"1712.07465","repositories_listed":0,"syntology":null},{"url":null,"slug":"revisiting-the-master-slave-architecture-in","title":"Revisiting the Master-Slave Architecture in Multi-Agent Deep Reinforcement Learning","date":"2017-12-20","arxiv_id":"1712.07305","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-wasserstein-reinforcement-learning-and-the","title":"On Wasserstein Reinforcement Learning and the Fokker-Planck equation","date":"2017-12-19","arxiv_id":"1712.07185","repositories_listed":0,"syntology":null},{"url":null,"slug":"two-dimensional-anti-jamming-mobile","title":"Two-dimensional Anti-jamming Mobile Communication Based on Reinforcement Learning","date":"2017-12-19","arxiv_id":"1712.06793","repositories_listed":0,"syntology":null},{"url":null,"slug":"es-is-more-than-just-a-traditional-finite","title":"ES Is More Than Just a Traditional Finite-Difference Approximator","date":"2017-12-18","arxiv_id":"1712.06568","repositories_listed":0,"syntology":null},{"url":null,"slug":"integral-equations-and-machine-learning","title":"Integral Equations and Machine Learning","date":"2017-12-17","arxiv_id":"1712.06115","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-deep-reinforcement-learning","title":"Towards a Deep Reinforcement Learning Approach for Tower Line Wars","date":"2017-12-17","arxiv_id":"1712.06180","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-for-marketing","title":"Inverse Reinforcement Learning for Marketing","date":"2017-12-13","arxiv_id":"1712.04612","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-focus-attention-network-for-efficient","title":"Multi-focus Attention Network for Efficient Deep Reinforcement Learning","date":"2017-12-13","arxiv_id":"1712.04603","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-boosted-by","title":"Deep Reinforcement Learning Boosted by External Knowledge","date":"2017-12-12","arxiv_id":"1712.04101","repositories_listed":0,"syntology":null},{"url":null,"slug":"interpretable-policies-for-reinforcement","title":"Interpretable Policies for Reinforcement Learning by Genetic Programming","date":"2017-12-12","arxiv_id":"1712.04170","repositories_listed":0,"syntology":null},{"url":null,"slug":"simulated-autonomous-driving-on-realistic","title":"Simulated Autonomous Driving on Realistic Road Networks using Deep Reinforcement Learning","date":"2017-12-12","arxiv_id":"1712.04363","repositories_listed":0,"syntology":null},{"url":null,"slug":"robust-deep-reinforcement-learning-with","title":"Robust Deep Reinforcement Learning with Adversarial Attacks","date":"2017-12-11","arxiv_id":"1712.03632","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforced-dynamics-for-enhanced-sampling-in","title":"Reinforced dynamics for enhanced sampling in large atomic and molecular systems","date":"2017-12-10","arxiv_id":"1712.03461","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-primal-dual-reinforcement-learning","title":"Deep Primal-Dual Reinforcement Learning: Accelerating Actor-Critic using Bellman Duality","date":"2017-12-07","arxiv_id":"1712.02467","repositories_listed":0,"syntology":null},{"url":null,"slug":"interactive-reinforcement-learning-for-object","title":"Interactive Reinforcement Learning for Object Grounding via Self-Talking","date":"2017-12-02","arxiv_id":"1712.00576","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-reinforcement-learning-in-stochastic","title":"Online Reinforcement Learning in Stochastic Games","date":"2017-12-02","arxiv_id":"1712.00579","repositories_listed":0,"syntology":null},{"url":null,"slug":"representation-and-reinforcement-learning-for","title":"Representation and Reinforcement Learning for Personalized Glycemic Control in Septic Patients","date":"2017-12-02","arxiv_id":"1712.00654","repositories_listed":0,"syntology":null},{"url":null,"slug":"compatible-reward-inverse-reinforcement","title":"Compatible Reward Inverse Reinforcement Learning","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-reinforcement-learning-in","title":"Data-Efficient Reinforcement Learning in Continuous State-Action Gaussian-POMDPs","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"log-normality-and-skewness-of-estimated","title":"Log-normality and Skewness of Estimated State/Action Values in Reinforcement Learning","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"natural-value-approximators-learning-when-to","title":"Natural Value Approximators: Learning when to Trust Past Estimates","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"optimistic-posterior-sampling-for","title":"Optimistic posterior sampling for reinforcement learning: worst-case regret bounds","date":"2017-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"comparing-deep-reinforcement-learning-and","title":"Comparing Deep Reinforcement Learning and Evolutionary Methods in Continuous Control","date":"2017-11-30","arxiv_id":"1712.00006","repositories_listed":0,"syntology":null},{"url":null,"slug":"improved-learning-in-evolution-strategies-via","title":"Improved Learning in Evolution Strategies via Sparser Inter-Agent Network Topologies","date":"2017-11-30","arxiv_id":"1711.11180","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-autonomous-driving-knowledge-on","title":"Transferring Autonomous Driving Knowledge on Simulated and Real Intersections","date":"2017-11-30","arxiv_id":"1712.01106","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-benchmarking-environment-for-reinforcement","title":"A Benchmarking Environment for Reinforcement Learning Based Task Oriented Dialogue Management","date":"2017-11-29","arxiv_id":"1711.11023","repositories_listed":0,"syntology":null},{"url":null,"slug":"automating-vehicles-by-deep-reinforcement","title":"Automating Vehicles by Deep Reinforcement Learning using Task Separation with Hill Climbing","date":"2017-11-29","arxiv_id":"1711.10785","repositories_listed":0,"syntology":null},{"url":null,"slug":"can-complex-collective-behaviour-be-generated","title":"Can Complex Collective Behaviour Be Generated Through Randomness, Memory and a Pinch of Luck?","date":"2017-11-29","arxiv_id":"1711.11161","repositories_listed":0,"syntology":null},{"url":null,"slug":"end-to-end-optimization-of-task-oriented","title":"End-to-End Optimization of Task-Oriented Dialogue Model with Deep Reinforcement Learning","date":"2017-11-29","arxiv_id":"1711.10712","repositories_listed":0,"syntology":null},{"url":"/paper/home-a-household-multimodal-environment","slug":"home-a-household-multimodal-environment","title":"HoME: a Household Multimodal Environment","date":"2017-11-29","arxiv_id":"1711.11017","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-to-adapt-speech","title":"Reinforcement Learning To Adapt Speech Enhancement to Instantaneous Input Signal Quality","date":"2017-11-29","arxiv_id":"1711.10791","repositories_listed":0,"syntology":null},{"url":null,"slug":"video-captioning-via-hierarchical","title":"Video Captioning via Hierarchical Reinforcement Learning","date":"2017-11-29","arxiv_id":"1711.11135","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-reinforcement-learning-algorithm-for","title":"A reinforcement learning algorithm for building collaboration in multi-agent systems","date":"2017-11-28","arxiv_id":"1711.10574","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-from-longitudinal-face-demonstration","title":"Learning from Longitudinal Face Demonstration - Where Tractable Deep Modeling Meets Inverse Reinforcement Learning","date":"2017-11-28","arxiv_id":"1711.10520","repositories_listed":0,"syntology":null},{"url":null,"slug":"malaria-likelihood-prediction-by-effectively","title":"Malaria Likelihood Prediction By Effectively Surveying Households Using Deep Reinforcement Learning","date":"2017-11-25","arxiv_id":"1711.09223","repositories_listed":0,"syntology":null},{"url":null,"slug":"posterior-sampling-for-large-scale","title":"Posterior Sampling for Large Scale Reinforcement Learning","date":"2017-11-21","arxiv_id":"1711.07979","repositories_listed":0,"syntology":null},{"url":null,"slug":"transferring-agent-behaviors-from-videos-via","title":"Transferring Agent Behaviors from Videos via Motion GANs","date":"2017-11-21","arxiv_id":"1711.07676","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-for-multi","title":"Deep Reinforcement Learning for Multi-Resource Multi-Machine Job Scheduling","date":"2017-11-20","arxiv_id":"1711.07440","repositories_listed":0,"syntology":null},{"url":null,"slug":"bbq-networks-efficient-exploration-in-deep","title":"BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems","date":"2017-11-15","arxiv_id":"1711.05715","repositories_listed":0,"syntology":null},{"url":null,"slug":"costate-focused-models-for-reinforcement","title":"Costate-focused models for reinforcement learning","date":"2017-11-15","arxiv_id":"1711.05817","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-efficient-swimming-strategies-in-a","title":"Finding Efficient Swimming Strategies in a Three Dimensional Chaotic Flow by Reinforcement Learning","date":"2017-11-15","arxiv_id":"1711.05826","repositories_listed":0,"syntology":null},{"url":null,"slug":"variational-adaptive-newton-method-for","title":"Variational Adaptive-Newton Method for Explorative Learning","date":"2017-11-15","arxiv_id":"1711.05560","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-a-large-scale","title":"Reinforcement Learning in a large scale photonic Recurrent Neural Network","date":"2017-11-14","arxiv_id":"1711.05133","repositories_listed":0,"syntology":null},{"url":null,"slug":"saliency-based-sequential-image-attention","title":"Saliency-based Sequential Image Attention with Multiset Prediction","date":"2017-11-14","arxiv_id":"1711.05165","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-method-for-stochastic-composition","title":"Accelerated Method for Stochastic Composition Optimization with Nonsmooth Regularization","date":"2017-11-10","arxiv_id":"1711.03937","repositories_listed":0,"syntology":null},{"url":null,"slug":"applications-of-deep-learning-and","title":"Applications of Deep Learning and Reinforcement Learning to Biological Data","date":"2017-11-10","arxiv_id":"1711.03985","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-of-speech-recognition","title":"Reinforcement Learning of Speech Recognition System Based on Policy Gradient and Hypothesis Selection","date":"2017-11-10","arxiv_id":"1711.03689","repositories_listed":0,"syntology":null},{"url":null,"slug":"worm-level-control-through-search-based","title":"Worm-level Control through Search-based Reinforcement Learning","date":"2017-11-09","arxiv_id":"1711.03467","repositories_listed":0,"syntology":null},{"url":null,"slug":"energy-storage-arbitrage-in-real-time-markets","title":"Energy Storage Arbitrage in Real-Time Markets via Reinforcement Learning","date":"2017-11-08","arxiv_id":"1711.03127","repositories_listed":0,"syntology":null},{"url":null,"slug":"double-q-and-q-unifying-reinforcement","title":"Double Q($σ$) and Q($σ, λ$): Unifying Reinforcement Learning Control Algorithms","date":"2017-11-05","arxiv_id":"1711.01569","repositories_listed":0,"syntology":null},{"url":null,"slug":"composing-meta-policies-for-autonomous","title":"Composing Meta-Policies for Autonomous Driving Using Hierarchical Deep Reinforcement Learning","date":"2017-11-04","arxiv_id":"1711.01503","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-optimization-by-genetic-distillation","title":"Policy Optimization by Genetic Distillation","date":"2017-11-03","arxiv_id":"1711.01012","repositories_listed":0,"syntology":null},{"url":null,"slug":"acquiring-target-stacking-skills-by-goal","title":"Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00267","repositories_listed":0,"syntology":null},{"url":null,"slug":"automatic-text-summarization-using","title":"Automatic Text Summarization Using Reinforcement Learning with Embedding Features","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"intelligent-parameter-tuning-in-optimization","title":"Intelligent Parameter Tuning in Optimization-based Iterative CT Reconstruction via Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00414","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-diagnose-assimilating-clinical","title":"Learning to Diagnose: Assimilating Clinical Narratives using Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"paraphrase-generation-with-deep-reinforcement","title":"Paraphrase Generation with Deep Reinforcement Learning","date":"2017-11-01","arxiv_id":"1711.00279","repositories_listed":0,"syntology":null},{"url":null,"slug":"automata-guided-hierarchical-reinforcement","title":"Automata-Guided Hierarchical Reinforcement Learning for Skill Composition","date":"2017-10-31","arxiv_id":"1711.00129","repositories_listed":0,"syntology":null},{"url":null,"slug":"exponential-improvements-for-quantum","title":"Exponential improvements for quantum-accessible reinforcement learning","date":"2017-10-30","arxiv_id":"1710.11160","repositories_listed":0,"syntology":null},{"url":null,"slug":"sequence-to-sequence-asr-optimization-via","title":"Sequence-to-Sequence ASR Optimization via Reinforcement Learning","date":"2017-10-30","arxiv_id":"1710.10774","repositories_listed":0,"syntology":null},{"url":null,"slug":"unifying-value-iteration-advantage-learning","title":"Unifying Value Iteration, Advantage Learning, and Dynamic Policy Programming","date":"2017-10-30","arxiv_id":"1710.10866","repositories_listed":0,"syntology":null},{"url":null,"slug":"diff-dac-distributed-actor-critic-for-average","title":"Diff-DAC: Distributed Actor-Critic for Average Multitask Deep Reinforcement Learning","date":"2017-10-28","arxiv_id":"1710.10363","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-under-noisy","title":"Inverse Reinforcement Learning Under Noisy Observations","date":"2017-10-27","arxiv_id":"1710.10116","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerated-reinforcement-learning","title":"Accelerated Reinforcement Learning","date":"2017-10-23","arxiv_id":"1710.08070","repositories_listed":0,"syntology":null},{"url":null,"slug":"map-based-multi-policy-reinforcement-learning","title":"Map-based Multi-Policy Reinforcement Learning: Enhancing Adaptability of Robots by Deep Reinforcement Learning","date":"2017-10-17","arxiv_id":"1710.06117","repositories_listed":0,"syntology":null},{"url":null,"slug":"stochastic-variance-reduction-for-policy","title":"Stochastic Variance Reduction for Policy Gradient Estimation","date":"2017-10-17","arxiv_id":"1710.06034","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-epicurus-the-father-of-reinforcement","title":"Is Epicurus the father of Reinforcement Learning?","date":"2017-10-12","arxiv_id":"1710.04582","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-reinforcement-learning-framework","title":"Deep Reinforcement Learning: Framework, Applications, and Embedded Implementations","date":"2017-10-10","arxiv_id":"1710.03792","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-and-off-policy-monotonic-policy","title":"On- and Off-Policy Monotonic Policy Improvement","date":"2017-10-10","arxiv_id":"1710.03442","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-inverse-reinforcement-learning-via","title":"Meta Inverse Reinforcement Learning via Maximum Reward Sharing for Human Motion Analysis","date":"2017-10-07","arxiv_id":"1710.03592","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-feature-space-for","title":"Exploration in Feature Space for Reinforcement Learning","date":"2017-10-05","arxiv_id":"1710.02210","repositories_listed":0,"syntology":null},{"url":null,"slug":"event-identification-as-a-decision-process","title":"Event Identification as a Decision Process with Non-linear Representation of Text","date":"2017-10-03","arxiv_id":"1710.00969","repositories_listed":0,"syntology":null},{"url":null,"slug":"attention-aware-deep-reinforcement-learning","title":"Attention-Aware Deep Reinforcement Learning for Video Face Recognition","date":"2017-10-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"parameter-sharing-deep-deterministic-policy","title":"Parameter Sharing Deep Deterministic Policy Gradient for Cooperative Multi-agent Reinforcement Learning","date":"2017-10-01","arxiv_id":"1710.00336","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-policy-search-method-for-temporal-logic","title":"A Policy Search Method For Temporal Logic Specified Reinforcement Learning Tasks","date":"2017-09-27","arxiv_id":"1709.09611","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-reinforcement-learning-mechanism-for","title":"A Simple Reinforcement Learning Mechanism for Resource Allocation in LTE-A Networks with Markov Decision Process and Q-Learning","date":"2017-09-27","arxiv_id":"1709.09312","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-optimal-online-method-of-selecting-source","title":"An Optimal Online Method of Selecting Source Policies for Reinforcement Learning","date":"2017-09-24","arxiv_id":"1709.08201","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-unmanned-aerial-vehicle-control-for","title":"Learning Unmanned Aerial Vehicle Control for Autonomous Target Following","date":"2017-09-24","arxiv_id":"1709.08233","repositories_listed":0,"syntology":null},{"url":null,"slug":"inverse-reinforcement-learning-with","title":"Inverse Reinforcement Learning with Conditional Choice Probabilities","date":"2017-09-22","arxiv_id":"1709.07597","repositories_listed":0,"syntology":null},{"url":null,"slug":"multiqubit-and-multilevel-quantum","title":"Multiqubit and multilevel quantum reinforcement learning with quantum technologies","date":"2017-09-22","arxiv_id":"1709.07848","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-overfitting-and-asymptotic-bias-in-batch","title":"On overfitting and asymptotic bias in batch reinforcement learning with partial observability","date":"2017-09-22","arxiv_id":"1709.07796","repositories_listed":0,"syntology":null},{"url":null,"slug":"optlayer-practical-constrained-optimization","title":"OptLayer - Practical Constrained Optimization for Deep Reinforcement Learning in the Real World","date":"2017-09-22","arxiv_id":"1709.07643","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-engineering-for-predictive-modeling","title":"Feature Engineering for Predictive Modeling using Reinforcement Learning","date":"2017-09-21","arxiv_id":"1709.07150","repositories_listed":0,"syntology":null}],"record_sha256":"2dc1e8e6fa458a78b717c86aea3a1524784dddfb6db540f1db3868855d27ac83","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}