{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/efficient-exploration/papers/4","list_of":"/task/efficient-exploration","task":"Efficient Exploration","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":4,"pages_in_order":6,"rows_per_page":100,"rows":[301,400],"of":514,"counts":{"archive_papers_tagged":514,"with_a_code_link":189,"where_syntology_ran_a_sample":57,"not_listed_spam_title":0,"listed":514,"listed_where_code_ran":57,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":48,"every_run_a_failure_of_syntologys_instrument":9,"listed_with_a_run_with_no_instrument_failure":48,"listed_every_run_a_failure_of_syntologys_instrument":9,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/efficient-exploration","prev":"/task/efficient-exploration/papers/3","next":"/task/efficient-exploration/papers/5","papers":[{"url":null,"slug":"grow-your-limits-continuous-improvement-with","title":"Grow Your Limits: Continuous Improvement with Real-World RL for Robotic Locomotion","date":"2023-10-26","arxiv_id":"2310.17634","repositories_listed":0,"syntology":null},{"url":null,"slug":"co-navgpt-multi-robot-cooperative-visual","title":"Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models","date":"2023-10-11","arxiv_id":"2310.07937","repositories_listed":0,"syntology":null},{"url":null,"slug":"f-policy-gradients-a-general-framework-for","title":"$f$-Policy Gradients: A General Framework for Goal Conditioned RL using $f$-Divergences","date":"2023-10-10","arxiv_id":"2310.06794","repositories_listed":0,"syntology":null},{"url":null,"slug":"information-content-exploration","title":"Information Content Exploration","date":"2023-10-10","arxiv_id":"2310.06777","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-optimal-power-flow-value-functions","title":"Learning Optimal Power Flow Value Functions with Input-Convex Neural Networks","date":"2023-10-06","arxiv_id":"2310.04605","repositories_listed":0,"syntology":null},{"url":null,"slug":"dream-decentralized-reinforcement-learning","title":"DREAM: Decentralized Reinforcement Learning for Exploration and Efficient Energy Management in Multi-Robot Systems","date":"2023-09-29","arxiv_id":"2309.17433","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-exploration-in-constrained","title":"Provably Efficient Exploration in Constrained Reinforcement Learning:Posterior Sampling Is All You Need","date":"2023-09-27","arxiv_id":"2309.15737","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-spatial-and-temporal-hierarchies","title":"Learning Spatial and Temporal Hierarchies: Hierarchical Active Inference for navigation in Multi-Room Maze Environments","date":"2023-09-18","arxiv_id":"2309.09864","repositories_listed":0,"syntology":null},{"url":null,"slug":"where2explore-few-shot-affordance-learning","title":"Where2Explore: Few-shot Affordance Learning for Unseen Novel Categories of Articulated Objects","date":"2023-09-14","arxiv_id":"2309.07473","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-informed-evolutionary","title":"Reinforcement learning informed evolutionary search for autonomous systems testing","date":"2023-08-24","arxiv_id":"2308.12762","repositories_listed":0,"syntology":null},{"url":null,"slug":"bag-of-policies-for-distributional-deep","title":"Bag of Policies for Distributional Deep Exploration","date":"2023-08-03","arxiv_id":"2308.01759","repositories_listed":0,"syntology":null},{"url":null,"slug":"towards-a-unified-agent-with-foundation","title":"Towards A Unified Agent with Foundation Models","date":"2023-07-18","arxiv_id":"2307.09668","repositories_listed":0,"syntology":null},{"url":null,"slug":"lissnas-locality-based-iterative-search-space","title":"LISSNAS: Locality-based Iterative Search Space Shrinkage for Neural Architecture Search","date":"2023-07-06","arxiv_id":"2307.03110","repositories_listed":0,"syntology":null},{"url":null,"slug":"approximate-information-for-efficient","title":"Approximate information for efficient exploration-exploitation strategies","date":"2023-07-04","arxiv_id":"2307.01563","repositories_listed":0,"syntology":null},{"url":null,"slug":"maximum-state-entropy-exploration-using","title":"Maximum State Entropy Exploration using Predecessor and Successor Representations","date":"2023-06-26","arxiv_id":"2306.14808","repositories_listed":0,"syntology":null},{"url":null,"slug":"disco-10m-a-large-scale-music-dataset","title":"DISCO-10M: A Large-Scale Music Dataset","date":"2023-06-23","arxiv_id":"2306.13512","repositories_listed":0,"syntology":null},{"url":null,"slug":"inferring-hierarchical-structure-in-multi","title":"Inferring Hierarchical Structure in Multi-Room Maze Environments","date":"2023-06-23","arxiv_id":"2306.13546","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-representation-learning","title":"Provably Efficient Representation Learning with Tractable Planning in Low-Rank POMDP","date":"2023-06-21","arxiv_id":"2306.12356","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-simple-unified-uncertainty-guided-framework","title":"A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning","date":"2023-06-13","arxiv_id":"2306.07541","repositories_listed":0,"syntology":null},{"url":null,"slug":"pacer-a-fully-push-forward-based","title":"PACER: A Fully Push-forward-based Distributional Reinforcement Learning Algorithm","date":"2023-06-11","arxiv_id":"2306.06637","repositories_listed":0,"syntology":null},{"url":null,"slug":"magnitude-attention-based-dynamic-pruning","title":"Magnitude Attention-based Dynamic Pruning","date":"2023-06-08","arxiv_id":"2306.05056","repositories_listed":0,"syntology":null},{"url":null,"slug":"intriguing-properties-of-text-guided","title":"Discovering Failure Modes of Text-guided Diffusion Models via Adversarial Search","date":"2023-06-01","arxiv_id":"2306.00974","repositories_listed":0,"syntology":null},{"url":null,"slug":"solving-diffusion-odes-with-optimal-boundary","title":"Solving Diffusion ODEs with Optimal Boundary Conditions for Better Image Super-Resolution","date":"2023-05-24","arxiv_id":"2305.15357","repositories_listed":0,"syntology":null},{"url":null,"slug":"successor-predecessor-intrinsic-exploration","title":"Successor-Predecessor Intrinsic Exploration","date":"2023-05-24","arxiv_id":"2305.15277","repositories_listed":0,"syntology":null},{"url":null,"slug":"shattering-the-agent-environment-interface","title":"Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models","date":"2023-05-19","arxiv_id":"2305.11455","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-falsification-and-fidelity-settings","title":"Joint Falsification and Fidelity Settings Optimization for Validation of Safety-Critical Systems: A Theoretical Analysis","date":"2023-05-10","arxiv_id":"2305.06111","repositories_listed":0,"syntology":null},{"url":null,"slug":"rescue-conversations-from-dead-ends-efficient","title":"Rescue Conversations from Dead-ends: Efficient Exploration for Task-oriented Dialogue Policy Optimization","date":"2023-05-05","arxiv_id":"2305.03262","repositories_listed":0,"syntology":null},{"url":null,"slug":"fast-exploration-and-learning-of-latent","title":"Fast exploration and learning of latent graphs with aliased observations","date":"2023-03-13","arxiv_id":"2303.07397","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-of-the-search-space-of-gaussian","title":"Exploration of the search space of Gaussian graphical models for paired data","date":"2023-03-09","arxiv_id":"2303.05561","repositories_listed":0,"syntology":null},{"url":null,"slug":"policy-mirror-descent-inherently-explores","title":"Policy Mirror Descent Inherently Explores Action Space","date":"2023-03-08","arxiv_id":"2303.04386","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-via-epistemic-value-estimation","title":"Exploration via Epistemic Value Estimation","date":"2023-03-07","arxiv_id":"2303.04012","repositories_listed":0,"syntology":null},{"url":null,"slug":"guarded-policy-optimization-with-imperfect","title":"Guarded Policy Optimization with Imperfect Online Demonstrations","date":"2023-03-03","arxiv_id":"2303.01728","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-using-extra-safety","title":"Efficient Exploration Using Extra Safety Budget in Constrained Policy Optimization","date":"2023-02-28","arxiv_id":"2302.14339","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-informed-proposals-for-discrete","title":"Efficient Informed Proposals for Discrete Distributions via Newton's Series Approximation","date":"2023-02-27","arxiv_id":"2302.13929","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-exploration-in-quantum","title":"Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case Regret","date":"2023-02-21","arxiv_id":"2302.10796","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-via-epistemic-risk","title":"Efficient Exploration via Epistemic-Risk-Seeking Policy Optimization","date":"2023-02-18","arxiv_id":"2302.09339","repositories_listed":0,"syntology":null},{"url":null,"slug":"ensemble-value-functions-for-efficient","title":"Ensemble Value Functions for Efficient Exploration in Multi-Agent Reinforcement Learning","date":"2023-02-07","arxiv_id":"2302.03439","repositories_listed":0,"syntology":null},{"url":null,"slug":"computational-discovery-of-microstructured","title":"Computational Discovery of Microstructured Composites with Optimal Stiffness-Toughness Trade-Offs","date":"2023-02-01","arxiv_id":"2302.01078","repositories_listed":0,"syntology":null},{"url":null,"slug":"gflownets-for-ai-driven-scientific-discovery","title":"GFlowNets for AI-Driven Scientific Discovery","date":"2023-02-01","arxiv_id":"2302.00615","repositories_listed":0,"syntology":null},{"url":null,"slug":"esc-exploration-with-soft-commonsense","title":"ESC: Exploration with Soft Commonsense Constraints for Zero-shot Object Navigation","date":"2023-01-30","arxiv_id":"2301.13166","repositories_listed":0,"syntology":null},{"url":null,"slug":"embodied-agents-for-efficient-exploration-and","title":"Embodied Agents for Efficient Exploration and Smart Scene Description","date":"2023-01-17","arxiv_id":"2301.07150","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-model-based-reinforcement-1","title":"Exploration in Model-based Reinforcement Learning with Randomized Reward","date":"2023-01-09","arxiv_id":"2301.03142","repositories_listed":0,"syntology":null},{"url":null,"slug":"shiro-soft-hierarchical-reinforcement","title":"SHIRO: Soft Hierarchical Reinforcement Learning","date":"2022-12-24","arxiv_id":"2212.12786","repositories_listed":0,"syntology":null},{"url":null,"slug":"ungeneralizable-contextual-logistic-bandit-in","title":"Reinforcement Learning in Credit Scoring and Underwriting","date":"2022-12-15","arxiv_id":"2212.07632","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-resource-restricted","title":"Efficient Exploration in Resource-Restricted Reinforcement Learning","date":"2022-12-14","arxiv_id":"2212.06988","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn-to-explore-on-bootstrapping-interactive","title":"Learn to Explore: on Bootstrapping Interactive Data Exploration with Meta-learning","date":"2022-12-07","arxiv_id":"2212.03423","repositories_listed":0,"syntology":null},{"url":null,"slug":"curriculum-learning-for-relative","title":"CURO: Curriculum Learning for Relative Overgeneralization","date":"2022-12-06","arxiv_id":"2212.02733","repositories_listed":0,"syntology":null},{"url":null,"slug":"heat-hardware-efficient-automatic-tensor","title":"HEAT: Hardware-Efficient Automatic Tensor Decomposition for Transformer Compression","date":"2022-11-30","arxiv_id":"2211.16749","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-model-free-reinforcement-learning-using","title":"Safe and Efficient Reinforcement Learning Using Disturbance-Observer-Based Control Barrier Functions","date":"2022-11-30","arxiv_id":"2211.17250","repositories_listed":0,"syntology":null},{"url":null,"slug":"cim-constrained-intrinsic-motivation-for","title":"CIM: Constrained Intrinsic Motivation for Sparse-Reward Continuous Control","date":"2022-11-28","arxiv_id":"2211.15205","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-using-model-based","title":"Efficient Exploration using Model-Based Quality-Diversity with Gradients","date":"2022-11-22","arxiv_id":"2211.12610","repositories_listed":0,"syntology":null},{"url":null,"slug":"active-exploration-based-on-information-gain","title":"Active Exploration based on Information Gain by Particle Filter for Efficient Spatial Concept Formation","date":"2022-11-20","arxiv_id":"2211.10934","repositories_listed":0,"syntology":null},{"url":null,"slug":"planning-to-the-information-horizon-of-bamdps","title":"Planning to the Information Horizon of BAMDPs via Epistemic State Abstraction","date":"2022-10-30","arxiv_id":"2210.16872","repositories_listed":0,"syntology":null},{"url":null,"slug":"design-of-convolutional-extreme-learning","title":"Design of Convolutional Extreme Learning Machines for Vision-Based Navigation Around Small Bodies","date":"2022-10-28","arxiv_id":"2210.16244","repositories_listed":0,"syntology":null},{"url":null,"slug":"deep-active-ensemble-sampling-for-image","title":"Deep Active Ensemble Sampling For Image Classification","date":"2022-10-11","arxiv_id":"2210.05770","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-role-of-coverage-in-online-reinforcement","title":"The Role of Coverage in Online Reinforcement Learning","date":"2022-10-09","arxiv_id":"2210.04157","repositories_listed":0,"syntology":null},{"url":null,"slug":"deterministic-sequencing-of-exploration-and","title":"Deterministic Sequencing of Exploration and Exploitation for Reinforcement Learning","date":"2022-09-12","arxiv_id":"2209.05408","repositories_listed":0,"syntology":null},{"url":null,"slug":"self-supervised-sequential-information","title":"Self-supervised Sequential Information Bottleneck for Robust Exploration in Deep Reinforcement Learning","date":"2022-09-12","arxiv_id":"2209.05333","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-action-translator-for-meta","title":"Learning Action Translator for Meta Reinforcement Learning on Sparse-Reward Tasks","date":"2022-07-19","arxiv_id":"2207.09071","repositories_listed":0,"syntology":null},{"url":null,"slug":"skexgen-autoregressive-generation-of-cad","title":"SkexGen: Autoregressive Generation of CAD Construction Sequences with Disentangled Codebooks","date":"2022-07-11","arxiv_id":"2207.04632","repositories_listed":0,"syntology":null},{"url":null,"slug":"gan-based-intrinsic-exploration-for-sample","title":"GAN-based Intrinsic Exploration For Sample Efficient Reinforcement Learning","date":"2022-06-28","arxiv_id":"2206.14256","repositories_listed":0,"syntology":null},{"url":null,"slug":"curious-exploration-via-structured-world","title":"Curious Exploration via Structured World Models Yields Zero-Shot Object Manipulation","date":"2022-06-22","arxiv_id":"2206.11403","repositories_listed":0,"syntology":null},{"url":null,"slug":"scalable-exploration-for-neural-online","title":"Scalable Exploration for Neural Online Learning to Rank with Perturbed Feedback","date":"2022-06-13","arxiv_id":"2206.05954","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-exploration-based-policy","title":"Sample-Efficient, Exploration-Based Policy Optimisation for Routing Problems","date":"2022-05-31","arxiv_id":"2205.15656","repositories_listed":0,"syntology":null},{"url":null,"slug":"temporl-temporal-priors-for-exploration-in-1","title":"SFP: State-free Priors for Exploration in Off-Policy Reinforcement Learning","date":"2022-05-26","arxiv_id":"2205.13528","repositories_listed":0,"syntology":null},{"url":null,"slug":"feature-and-instance-joint-selection-a","title":"Feature and Instance Joint Selection: A Reinforcement Learning Perspective","date":"2022-05-12","arxiv_id":"2205.07867","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-efficient-exploration-through-human","title":"Efficient Exploration via First-Person Behavior Cloning Assisted Rapidly-Exploring Random Trees","date":"2022-03-23","arxiv_id":"2203.12774","repositories_listed":0,"syntology":null},{"url":null,"slug":"tandem-learning-joint-exploration-and","title":"TANDEM: Learning Joint Exploration and Decision Making with Tactile Sensors","date":"2022-03-01","arxiv_id":"2203.00798","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-causal-overhypotheses-through","title":"Learning Causal Overhypotheses through Exploration in Children and Computational Models","date":"2022-02-21","arxiv_id":"2202.10430","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-unified-perspective-on-value-backup-and","title":"A Unified Perspective on Value Backup and Exploration in Monte-Carlo Tree Search","date":"2022-02-11","arxiv_id":"2202.07071","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-policy-space-response-oracles","title":"Efficient Policy Space Response Oracles","date":"2022-01-28","arxiv_id":"2202.00633","repositories_listed":0,"syntology":null},{"url":null,"slug":"using-non-stationary-bandits-for-learning-in","title":"Using Non-Stationary Bandits for Learning in Repeated Cournot Games with Non-Stationary Demand","date":"2022-01-03","arxiv_id":"2201.00486","repositories_listed":0,"syntology":null},{"url":null,"slug":"juewu-mc-playing-minecraft-with-sample","title":"JueWu-MC: Playing Minecraft with Sample-efficient Hierarchical Reinforcement Learning","date":"2021-12-07","arxiv_id":"2112.04907","repositories_listed":0,"syntology":null},{"url":null,"slug":"boovi-provably-efficient-bootstrapped-value","title":"BooVI: Provably Efficient Bootstrapped Value Iteration","date":"2021-12-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"cells-cost-effective-evolution-in-latent","title":"HelixMO: Sample-Efficient Molecular Optimization in Scene-Sensitive Latent Space","date":"2021-11-30","arxiv_id":"2112.00905","repositories_listed":0,"syntology":null},{"url":"/paper/ib-mvs-an-iterative-algorithm-for-deep-multi","slug":"ib-mvs-an-iterative-algorithm-for-deep-multi","title":"IB-MVS: An Iterative Algorithm for Deep Multi-View Stereo based on Binary Decisions","date":"2021-11-29","arxiv_id":"2111.14420","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayesian-optimization-of-distributed","title":"Bayesian optimization of distributed neurodynamical controller models for spatial navigation","date":"2021-10-31","arxiv_id":"2111.00599","repositories_listed":0,"syntology":null},{"url":null,"slug":"accelerating-robotic-reinforcement-learning","title":"Accelerating Robotic Reinforcement Learning via Parameterized Action Primitives","date":"2021-10-28","arxiv_id":"2110.15360","repositories_listed":0,"syntology":null},{"url":null,"slug":"more-efficient-exploration-with-symbolic","title":"More Efficient Exploration with Symbolic Priors on Action Sequence Equivalences","date":"2021-10-20","arxiv_id":"2110.10632","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-binary-and","title":"Efficient Exploration in Binary and Preferential Bayesian Optimization","date":"2021-10-18","arxiv_id":"2110.09361","repositories_listed":0,"syntology":null},{"url":null,"slug":"braxlines-fast-and-interactive-toolkit-for-rl","title":"Braxlines: Fast and Interactive Toolkit for RL-driven Behavior Engineering beyond Reward Maximization","date":"2021-10-10","arxiv_id":"2110.04686","repositories_listed":0,"syntology":null},{"url":null,"slug":"reinforcement-learning-in-reward-mixing-mdps","title":"Reinforcement Learning in Reward-Mixing MDPs","date":"2021-10-07","arxiv_id":"2110.03743","repositories_listed":0,"syntology":null},{"url":null,"slug":"distributional-perturbation-for-efficient","title":"Distributional Perturbation for Efficient Exploration in Distributional Reinforcement Learning","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"divide-and-explore-multi-agent-separate","title":"Divide and Explore: Multi-Agent Separate Exploration with Shared Intrinsic Motivations","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-to-solve-combinatorial-problems-via","title":"Learning to Solve Combinatorial Problems via Efficient Exploration","date":"2021-09-29","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-more-when-it-needs-in-deep","title":"Exploring More When It Needs in Deep Reinforcement Learning","date":"2021-09-28","arxiv_id":"2109.13477","repositories_listed":0,"syntology":null},{"url":null,"slug":"differentially-evolving-memory-ensembles","title":"Differentially Evolving Memory Ensembles: Pareto Optimization based on Computational Intelligence for Embedded Memories on a System Level","date":"2021-09-20","arxiv_id":"2109.09502","repositories_listed":0,"syntology":null},{"url":null,"slug":"multi-agent-embodied-visual-semantic","title":"Multi-Agent Embodied Visual Semantic Navigation with Scene Prior Knowledge","date":"2021-09-20","arxiv_id":"2109.09531","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-in-deep-reinforcement-learning-a","title":"Exploration in Deep Reinforcement Learning: From Single-Agent to Multiagent Domain","date":"2021-09-14","arxiv_id":"2109.06668","repositories_listed":0,"syntology":null},{"url":null,"slug":"learn2hop-learned-optimization-on-rough","title":"Learn2Hop: Learned Optimization on Rough Landscapes","date":"2021-07-20","arxiv_id":"2107.09661","repositories_listed":0,"syntology":null},{"url":null,"slug":"multimodal-reward-shaping-for-efficient","title":"Multimodal Reward Shaping for Efficient Exploration in Reinforcement Learning","date":"2021-07-19","arxiv_id":"2107.08888","repositories_listed":0,"syntology":null},{"url":null,"slug":"data-efficient-exploration-with-self-play-for","title":"Data-Efficient Exploration with Self Play for Atari","date":"2021-06-13","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"impact-of-detecting-clinical-trial-elements","title":"Impact of detecting clinical trial elements in exploration of COVID-19 literature","date":"2021-05-25","arxiv_id":"2105.12261","repositories_listed":0,"syntology":null},{"url":null,"slug":"non-decreasing-quantile-function-network-with-1","title":"Non-decreasing Quantile Function Network with Efficient Exploration for Distributional Reinforcement Learning","date":"2021-05-14","arxiv_id":"2105.06696","repositories_listed":0,"syntology":null},{"url":null,"slug":"domain-specific-genetic-algorithm-for-multi","title":"MAGMA: An Optimization Framework for Mapping Multiple DNNs on Multiple Accelerator Cores","date":"2021-04-28","arxiv_id":"2104.13997","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-memory-dependent-continuous-control","title":"Learning Memory-Dependent Continuous Control from Demonstrations","date":"2021-02-18","arxiv_id":"2102.09208","repositories_listed":0,"syntology":null},{"url":null,"slug":"meta-thompson-sampling","title":"Meta-Thompson Sampling","date":"2021-02-11","arxiv_id":"2102.06129","repositories_listed":0,"syntology":null},{"url":null,"slug":"the-minerl-2020-competition-on-sample","title":"The MineRL 2020 Competition on Sample Efficient Reinforcement Learning using Human Priors","date":"2021-01-26","arxiv_id":"2101.11071","repositories_listed":0,"syntology":null},{"url":null,"slug":"autonomous-synthesis-of-metastable-materials","title":"Autonomous synthesis of metastable materials","date":"2021-01-19","arxiv_id":"2101.07385","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropic-risk-sensitive-reinforcement","title":"Entropic Risk-Sensitive Reinforcement Learning: A Meta Regret Framework with Function Approximation","date":"2021-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null}],"record_sha256":"cfda8c7c306427ed447f68858858425333e7bc5f0b686de62b0eb81471ce33c6","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}