{"about":{"non_affiliation":"Code with Papers and Syntology are not affiliated with, endorsed by, or sponsored by Papers with Code, Meta, or the pwc-archive mirror.","site":"https://codewithpapers.app","licence":"CC BY-SA 4.0","licence_url":"https://creativecommons.org/licenses/by-sa/4.0/legalcode","attribution":"https://codewithpapers.app/attribution","modified":"archive material modified by Syntology; see the attribution page","syntology":{"site":"https://syntology.ai","developers":"https://syntology.ai/developers","mcp":{"server":"https://syntology.ai/mcp","transport":"streamable-http","server_card":"https://syntology.ai/.well-known/mcp/server-card.json","auth":{"type":"trial token, no account","trial_token":"https://syntology.ai/api/oauth/trial/token","method":"POST","docs":"https://syntology.ai/developers"}},"have":"https://syntology.ai/api/graph/have?x=<method, arXiv id or title> (free, answers coverage only)","paper_base":"https://syntology.ai/paper/","atlas_base":"https://app.syntology.ai/?focus="},"machine_readable":[{"url":"https://codewithpapers.app/llms.txt","what":"the machine catalog: every machine-readable file, counted"},{"url":"https://codewithpapers.app/index/manifest.json","what":"paper-to-code index by arXiv id, with Syntology's counts"},{"url":"https://codewithpapers.app/search/manifest.json","what":"site search index (titles, authors) and its files"},{"url":"https://codewithpapers.app/download","what":"bulk files: Syntology's layer, described there"},{"url":"https://codewithpapers.app/build_manifest.json","what":"the build record: inputs, counts, exclusions, probes"}]},"url":"/task/efficient-exploration/papers/3","list_of":"/task/efficient-exploration","task":"Efficient Exploration","archive":{"snapshot":"2025-07-28"},"key_notes":{"n_ran_checked":"legacy name, kept unchanged so existing readers do not break: it counts the samples that ran with no instrument failure (honoured, violated, and ran with no contract checked); it does not mean a contract was checked, and the pages print it as 'K with no instrument failure', not 'K checked'","n_constructed":"a sub-count of the samples that ran, never subtracted from them and never a failure: an executed sample whose run returned an instance of its own class (fixture_out_type equals the entry name): the run built an object and did not compute a result (Syntology's RAN record, counts.constructed)"},"syntology_read_at":"2026-09-28T10:30:06+00:00","order":"archive","order_definition":"repositories listed in the archive (most first), then date (newest first), then slug","page":3,"pages_in_order":6,"rows_per_page":100,"rows":[201,300],"of":514,"counts":{"archive_papers_tagged":514,"with_a_code_link":189,"where_syntology_ran_a_sample":57,"not_listed_spam_title":0,"listed":514,"listed_where_code_ran":57,"where_syntology_ran_a_sample_split":{"with_a_run_with_no_instrument_failure":48,"every_run_a_failure_of_syntologys_instrument":9,"listed_with_a_run_with_no_instrument_failure":48,"listed_every_run_a_failure_of_syntologys_instrument":9,"filter":{"states":["a run with no instrument failure","any run, instrument failures included"],"default":"a run with no instrument failure","note":"on the 'only where code ran' pages the default hides, in the browser, the rows where every run was a failure of Syntology's instrument; the second state shows them again. Rows are hidden, never re-ordered; these twins list every row"}},"definition":"distinct papers the archive tags; 'where Syntology ran a sample' counts papers with at least one harvested sample that ran, which is not a correctness claim"},"first_page":"/task/efficient-exploration","prev":"/task/efficient-exploration/papers/2","next":"/task/efficient-exploration/papers/4","papers":[{"url":null,"slug":"interpretable-shap-bounded-bayesian","title":"Interpretable SHAP-bounded Bayesian Optimization for Underwater Acoustic Metamaterial Coating Design","date":"2025-05-10","arxiv_id":"2505.06519","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-explainable-nature-inspired-framework-for","title":"An Explainable Nature-Inspired Framework for Monkeypox Diagnosis: Xception Features Combined with NGBoost and African Vultures Optimization Algorithm","date":"2025-04-24","arxiv_id":"2504.17540","repositories_listed":0,"syntology":null},{"url":null,"slug":"aerial-active-star-ris-assisted-satellite","title":"Aerial Active STAR-RIS-assisted Satellite-Terrestrial Covert Communications","date":"2025-04-22","arxiv_id":"2504.16146","repositories_listed":0,"syntology":null},{"url":null,"slug":"lumos-efficient-performance-modeling-and","title":"Lumos: Efficient Performance Modeling and Estimation for Large-scale LLM Training","date":"2025-04-12","arxiv_id":"2504.09307","repositories_listed":0,"syntology":null},{"url":null,"slug":"memetic-search-for-green-vehicle-routing","title":"Memetic Search for Green Vehicle Routing Problem with Private Capacitated Refueling Stations","date":"2025-04-06","arxiv_id":"2504.04527","repositories_listed":0,"syntology":null},{"url":null,"slug":"from-automation-to-autonomy-in-smart","title":"From Automation to Autonomy in Smart Manufacturing: A Bayesian Optimization Framework for Modeling Multi-Objective Experimentation and Sequential Decision Making","date":"2025-04-05","arxiv_id":"2504.04244","repositories_listed":0,"syntology":null},{"url":null,"slug":"entropy-guided-sequence-weighting-for","title":"Entropy-guided sequence weighting for efficient exploration in RL-based LLM fine-tuning","date":"2025-03-28","arxiv_id":"2503.22456","repositories_listed":0,"syntology":null},{"url":null,"slug":"maya-optimizing-deep-learning-training","title":"Maya: Optimizing Deep Learning Training Workloads using Emulated Virtual Accelerators","date":"2025-03-26","arxiv_id":"2503.20191","repositories_listed":0,"syntology":null},{"url":null,"slug":"falconeye-finding-answers-and-localizing","title":"FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs","date":"2025-03-25","arxiv_id":"2503.19850","repositories_listed":0,"syntology":null},{"url":null,"slug":"cae-repurposing-the-critic-as-an-explorer-in","title":"CAE: Repurposing the Critic as an Explorer in Deep Reinforcement Learning","date":"2025-03-23","arxiv_id":"2503.18980","repositories_listed":0,"syntology":null},{"url":null,"slug":"kea-keeping-exploration-alive-by-proactively","title":"KEA: Keeping Exploration Alive by Proactively Coordinating Exploration Strategies","date":"2025-03-23","arxiv_id":"2503.18234","repositories_listed":0,"syntology":null},{"url":null,"slug":"contextual-similarity-distillation-ensemble","title":"Contextual Similarity Distillation: Ensemble Uncertainties with a Single Model","date":"2025-03-14","arxiv_id":"2503.11339","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyperarm-bandit-optimization-a-novel-approach","title":"HyperArm Bandit Optimization: A Novel approach to Hyperparameter Optimization and an Analysis of Bandit Algorithms in Stochastic and Adversarial Settings","date":"2025-03-13","arxiv_id":"2503.10282","repositories_listed":0,"syntology":null},{"url":null,"slug":"is-a-good-foundation-necessary-for-efficient","title":"Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration","date":"2025-03-10","arxiv_id":"2503.07453","repositories_listed":0,"syntology":null},{"url":null,"slug":"probabilistic-insights-for-efficient","title":"Probabilistic Insights for Efficient Exploration Strategies in Reinforcement Learning","date":"2025-03-05","arxiv_id":"2503.03565","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-transformer-model-for-predicting-chemical","title":"A Transformer Model for Predicting Chemical Reaction Products from Generic Templates","date":"2025-03-04","arxiv_id":"2503.05810","repositories_listed":0,"syntology":null},{"url":null,"slug":"on-space-filling-input-design-for-nonlinear","title":"On Space-Filling Input Design for Nonlinear Dynamic Model Learning: A Gaussian Process Approach","date":"2025-02-24","arxiv_id":"2502.17042","repositories_listed":0,"syntology":null},{"url":null,"slug":"mem2ego-empowering-vision-language-models","title":"Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation","date":"2025-02-20","arxiv_id":"2502.14254","repositories_listed":0,"syntology":null},{"url":null,"slug":"synergistic-fusion-of-multi-source-knowledge","title":"Synergistic Fusion of Multi-Source Knowledge via Evidence Theory for High-Entropy Alloy Discovery","date":"2025-02-20","arxiv_id":"2502.14631","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffexp-efficient-exploration-in-reward-fine","title":"DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models","date":"2025-02-19","arxiv_id":"2502.14070","repositories_listed":0,"syntology":null},{"url":"/paper/fragfm-efficient-fragment-based-molecular","slug":"fragfm-efficient-fragment-based-molecular","title":"FragFM: Hierarchical Framework for Efficient Molecule Generation via Fragment-Level Discrete Flow Matching","date":"2025-02-19","arxiv_id":"2502.15805","repositories_listed":0,"syntology":{"n":14,"n_ran":8,"n_constructed":0,"n_ran_checked":8,"n_instrument":0,"n_unverified":6,"n_honours":0,"n_violates":0,"n_no_contract":8,"n_pointer_only":2,"phrase":"8 ran (of which 0 constructed an object rather than computing a result; 8 with no instrument failure: 0 honoured, 0 violated, 8 with no contract checked; 0 where Syntology's instrument failed) · 6 unverified","sample_list":"/paper/fragfm-efficient-fragment-based-molecular#ran","syntology_url":"https://syntology.ai/paper/2502.15805","mcp":{"get_harvested_code_for_paper":{"arxiv_id":"2502.15805"}},"official":null}},{"url":null,"slug":"finedeep-mitigating-sparse-activation-in","title":"Finedeep: Mitigating Sparse Activation in Dense LLMs via Multi-Layer Fine-Grained Experts","date":"2025-02-18","arxiv_id":"2502.12928","repositories_listed":0,"syntology":null},{"url":null,"slug":"massively-scaling-explicit-policy-conditioned","title":"Massively Scaling Explicit Policy-conditioned Value Functions","date":"2025-02-17","arxiv_id":"2502.11949","repositories_listed":0,"syntology":null},{"url":null,"slug":"causal-information-prioritization-for","title":"Causal Information Prioritization for Efficient Reinforcement Learning","date":"2025-02-14","arxiv_id":"2502.10097","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploratory-diffusion-policy-for-unsupervised","title":"Exploratory Diffusion Model for Unsupervised Reinforcement Learning","date":"2025-02-11","arxiv_id":"2502.07279","repositories_listed":0,"syntology":null},{"url":"/paper/guided-exploration-for-efficient-relational","slug":"guided-exploration-for-efficient-relational","title":"Guided Exploration for Efficient Relational Model Learning","date":"2025-02-10","arxiv_id":"2502.06146","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptive-exploration-for-multi-reward-multi","title":"Adaptive Exploration for Multi-Reward Multi-Policy Evaluation","date":"2025-02-04","arxiv_id":"2502.02516","repositories_listed":0,"syntology":null},{"url":null,"slug":"constrained-hybrid-metaheuristic-algorithm","title":"Constrained Hybrid Metaheuristic Algorithm for Probabilistic Neural Networks Learning","date":"2025-01-26","arxiv_id":"2501.15661","repositories_listed":0,"syntology":null},{"url":null,"slug":"contrastive-language-structure-pre-training","title":"Bridging Text and Crystal Structures: Literature-driven Contrastive Learning for Materials Science","date":"2025-01-22","arxiv_id":"2501.12919","repositories_listed":0,"syntology":null},{"url":null,"slug":"activegamer-active-gaussian-mapping-through","title":"ActiveGAMER: Active GAussian Mapping through Efficient Rendering","date":"2025-01-12","arxiv_id":"2501.06897","repositories_listed":0,"syntology":null},{"url":null,"slug":"b-dqn-improving-deep-q-learning-by-evolving","title":"$β$-DQN: Improving Deep Q-Learning By Evolving the Behavior","date":"2025-01-01","arxiv_id":"2501.00913","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-exploration-in-reward","title":"Provably Efficient Exploration in Reward Machines with Low Regret","date":"2024-12-26","arxiv_id":"2412.19194","repositories_listed":0,"syntology":null},{"url":null,"slug":"grapheqa-using-3d-semantic-scene-graphs-for","title":"GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering","date":"2024-12-19","arxiv_id":"2412.14480","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-temporally-correlated-latent-exploration","title":"A Temporally Correlated Latent Exploration for Reinforcement Learning","date":"2024-12-06","arxiv_id":"2412.04775","repositories_listed":0,"syntology":null},{"url":null,"slug":"hyper-hyperparameter-robust-efficient","title":"Hyper: Hyperparameter Robust Efficient Exploration in Reinforcement Learning","date":"2024-12-04","arxiv_id":"2412.03767","repositories_listed":0,"syntology":null},{"url":null,"slug":"sample-efficient-robot-learning-in-supervised","title":"Sample Efficient Robot Learning in Supervised Effect Prediction Tasks","date":"2024-12-03","arxiv_id":"2412.02331","repositories_listed":0,"syntology":null},{"url":null,"slug":"cbol-tuner-classifier-pruned-bayesian","title":"CBOL-Tuner: Classifier-pruned Bayesian optimization to explore temporally structured latent spaces for particle accelerator tuning","date":"2024-12-02","arxiv_id":"2412.01748","repositories_listed":0,"syntology":null},{"url":null,"slug":"adaptformer-sequence-models-as-adaptive","title":"Adaptformer: Sequence models as adaptive iterative planners","date":"2024-11-30","arxiv_id":"2412.00293","repositories_listed":0,"syntology":null},{"url":null,"slug":"randomized-grid-search-for-hyperparameter","title":"Randomized-Grid Search for Hyperparameter Tuning in Decision Tree Model to Improve Performance of Cardiovascular Disease Classification","date":"2024-11-27","arxiv_id":"2411.18234","repositories_listed":0,"syntology":null},{"url":null,"slug":"bpp-search-enhancing-tree-of-thought","title":"BPP-Search: Enhancing Tree of Thought Reasoning for Mathematical Modeling Problem Solving","date":"2024-11-26","arxiv_id":"2411.17404","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficienteqa-an-efficient-approach-for-open","title":"EfficientEQA: An Efficient Approach for Open Vocabulary Embodied Question Answering","date":"2024-10-26","arxiv_id":"2410.20263","repositories_listed":0,"syntology":null},{"url":null,"slug":"overcoming-the-sim-to-real-gap-leveraging","title":"Overcoming the Sim-to-Real Gap: Leveraging Simulation to Learn to Explore for Real-World RL","date":"2024-10-26","arxiv_id":"2410.20254","repositories_listed":0,"syntology":null},{"url":null,"slug":"offline-to-online-multi-agent-reinforcement","title":"Offline-to-Online Multi-Agent Reinforcement Learning with Offline Value Function Memory and Sequential Exploration","date":"2024-10-25","arxiv_id":"2410.19450","repositories_listed":0,"syntology":null},{"url":null,"slug":"scattered-forest-search-smarter-code-space","title":"Scattered Forest Search: Smarter Code Space Exploration with LLMs","date":"2024-10-22","arxiv_id":"2411.05010","repositories_listed":0,"syntology":null},{"url":null,"slug":"actsafe-active-exploration-with-safety","title":"ActSafe: Active Exploration with Safety Constraints for Reinforcement Learning","date":"2024-10-12","arxiv_id":"2410.09486","repositories_listed":0,"syntology":null},{"url":null,"slug":"latent-action-priors-from-a-single-gait-cycle","title":"Latent Action Priors for Locomotion with Deep Reinforcement Learning","date":"2024-10-04","arxiv_id":"2410.03246","repositories_listed":0,"syntology":null},{"url":null,"slug":"bayescns-a-unified-bayesian-approach-to","title":"BayesCNS: A Unified Bayesian Approach to Address Cold Start and Non-Stationarity in Search Systems at Scale","date":"2024-10-03","arxiv_id":"2410.02126","repositories_listed":0,"syntology":null},{"url":null,"slug":"provably-efficient-exploration-in-inverse","title":"Provably Efficient Exploration in Inverse Constrained Reinforcement Learning","date":"2024-09-24","arxiv_id":"2409.15963","repositories_listed":0,"syntology":null},{"url":null,"slug":"querybuilder-human-in-the-loop-query","title":"QueryBuilder: Human-in-the-Loop Query Development for Information Retrieval","date":"2024-09-07","arxiv_id":"2409.04667","repositories_listed":0,"syntology":null},{"url":null,"slug":"targetin-the-partition-function-of-chemically","title":"Targeting the partition function of chemically disordered materials with a generative approach based on inverse variational autoencoders","date":"2024-08-27","arxiv_id":"2408.14928","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-reinforced-dag-learning-without","title":"Reinforcement Learning for Causal Discovery without Acyclicity Constraints","date":"2024-08-24","arxiv_id":"2408.13448","repositories_listed":0,"syntology":null},{"url":null,"slug":"emotion-agent-unsupervised-deep-reinforcement","title":"Emotion-Agent: Unsupervised Deep Reinforcement Learning with Distribution-Prototype Reward for Continuous Emotional EEG Analysis","date":"2024-08-22","arxiv_id":"2408.12121","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-and-discriminative","title":"Efficient Exploration and Discriminative World Model Learning with an Object-Centric Abstraction","date":"2024-08-21","arxiv_id":"2408.11816","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-deep-reinforcement","title":"Efficient Exploration in Deep Reinforcement Learning: A Novel Bayesian Actor-Critic Algorithm","date":"2024-08-19","arxiv_id":"2408.10055","repositories_listed":0,"syntology":null},{"url":null,"slug":"modeling-multi-step-scientific-processes-with","title":"Modeling Multi-Step Scientific Processes with Graph Transformer Networks","date":"2024-08-10","arxiv_id":"2408.05425","repositories_listed":0,"syntology":null},{"url":null,"slug":"2408-02912","title":"KOI: Accelerating Online Imitation Learning via Hybrid Key-state Guidance","date":"2024-08-06","arxiv_id":"2408.02912","repositories_listed":0,"syntology":null},{"url":null,"slug":"image-based-deep-reinforcement-learning-with","title":"Image-Based Deep Reinforcement Learning with Intrinsically Motivated Stimuli: On the Execution of Complex Robotic Tasks","date":"2024-07-31","arxiv_id":"2407.21338","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-augmented-agents-a-framework-for","title":"Diffusion Augmented Agents: A Framework for Efficient Exploration and Transfer Learning","date":"2024-07-30","arxiv_id":"2407.20798","repositories_listed":0,"syntology":null},{"url":null,"slug":"online-learning-for-autonomous-management-of","title":"Online Learning for Autonomous Management of Intent-based 6G Networks","date":"2024-07-25","arxiv_id":"2407.17767","repositories_listed":0,"syntology":null},{"url":null,"slug":"paramsdrag-interactive-parameter-space","title":"ParamsDrag: Interactive Parameter Space Exploration via Image-Space Dragging","date":"2024-07-19","arxiv_id":"2407.14100","repositories_listed":0,"syntology":null},{"url":null,"slug":"autorag-hp-automatic-online-hyper-parameter","title":"AutoRAG-HP: Automatic Online Hyper-Parameter Tuning for Retrieval-Augmented Generation","date":"2024-06-27","arxiv_id":"2406.19251","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-gpc-based-quantification-of","title":"Efficient gPC-based quantification of probabilistic robustness for systems in neuroscience","date":"2024-06-19","arxiv_id":"2406.13489","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploration-by-learning-diverse-skills","title":"Exploration by Learning Diverse Skills through Successor State Measures","date":"2024-06-14","arxiv_id":"2406.10127","repositories_listed":0,"syntology":null},{"url":null,"slug":"world-models-with-hints-of-large-language","title":"World Models with Hints of Large Language Models for Goal Achieving","date":"2024-06-11","arxiv_id":"2406.07381","repositories_listed":0,"syntology":null},{"url":null,"slug":"neorl-efficient-exploration-for-nonepisodic","title":"NeoRL: Efficient Exploration for Nonepisodic RL","date":"2024-06-03","arxiv_id":"2406.01175","repositories_listed":0,"syntology":null},{"url":null,"slug":"computing-low-thrust-transfers-in-the","title":"Computing low-thrust transfers in the asteroid belt, a comparison between astrodynamical manipulations and a machine learning approach","date":"2024-05-29","arxiv_id":"2405.18918","repositories_listed":0,"syntology":null},{"url":null,"slug":"opinion-guided-reinforcement-learning","title":"Opinion-Guided Reinforcement Learning","date":"2024-05-27","arxiv_id":"2405.17287","repositories_listed":0,"syntology":null},{"url":null,"slug":"glad-synergizing-molecular-graphs-and","title":"GLaD: Synergizing Molecular Graphs and Language Descriptors for Enhanced Power Conversion Efficiency Prediction in Organic Photovoltaic Devices","date":"2024-05-23","arxiv_id":"2405.14203","repositories_listed":0,"syntology":null},{"url":null,"slug":"intrinsic-rewards-for-exploration-without","title":"Intrinsic Rewards for Exploration without Harm from Observational Noise: A Simulation Study Based on the Free Energy Principle","date":"2024-05-13","arxiv_id":"2405.07473","repositories_listed":0,"syntology":null},{"url":null,"slug":"mesa-cooperative-meta-exploration-in-multi","title":"MESA: Cooperative Meta-Exploration in Multi-Agent Learning through Exploiting State-Action Space Structure","date":"2024-05-01","arxiv_id":"2405.00902","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-of-image-classifier","title":"Efficient Exploration of Image Classifier Failures with Bayesian Optimization and Text-to-Image Models","date":"2024-04-26","arxiv_id":"2405.02332","repositories_listed":0,"syntology":null},{"url":null,"slug":"evolutionary-reinforcement-learning-via-1","title":"Evolutionary Reinforcement Learning via Cooperative Coevolution","date":"2024-04-23","arxiv_id":"2404.14763","repositories_listed":0,"syntology":null},{"url":null,"slug":"an-off-policy-reinforcement-learning","title":"An Offline Reinforcement Learning Algorithm Customized for Multi-Task Fusion in Large-Scale Recommender Systems","date":"2024-04-19","arxiv_id":"2404.17589","repositories_listed":0,"syntology":null},{"url":null,"slug":"sampling-for-model-predictive-trajectory","title":"Sampling for Model Predictive Trajectory Planning in Autonomous Driving using Normalizing Flows","date":"2024-04-15","arxiv_id":"2404.09657","repositories_listed":0,"syntology":null},{"url":null,"slug":"learning-off-policy-with-model-based","title":"Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration","date":"2024-03-31","arxiv_id":"2404.00651","repositories_listed":0,"syntology":null},{"url":null,"slug":"exploring-unseen-environments-with-robots","title":"Cognitive Planning for Object Goal Navigation using Generative AI Models","date":"2024-03-30","arxiv_id":"2404.00318","repositories_listed":0,"syntology":null},{"url":null,"slug":"vdsc-enhancing-exploration-timing-with-value","title":"VDSC: Enhancing Exploration Timing with Value Discrepancy and State Counts","date":"2024-03-26","arxiv_id":"2403.17542","repositories_listed":0,"syntology":null},{"url":null,"slug":"explore-until-confident-efficient-exploration","title":"Explore until Confident: Efficient Exploration for Embodied Question Answering","date":"2024-03-23","arxiv_id":"2403.15941","repositories_listed":0,"syntology":null},{"url":null,"slug":"safe-reinforcement-learning-for-constrained","title":"Safe Reinforcement Learning for Constrained Markov Decision Processes with Stochastic Stopping Time","date":"2024-03-23","arxiv_id":"2403.15928","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-of-high-tc","title":"A Straightforward Gradient-Based Approach for High-Tc Superconductor Design: Leveraging Domain Knowledge via Adaptive Constraints","date":"2024-03-20","arxiv_id":"2403.13627","repositories_listed":0,"syntology":null},{"url":null,"slug":"beyond-joint-demonstrations-personalized","title":"Beyond Joint Demonstrations: Personalized Expert Guidance for Efficient Multi-Agent Reinforcement Learning","date":"2024-03-13","arxiv_id":"2403.08936","repositories_listed":0,"syntology":null},{"url":null,"slug":"a-natural-extension-to-online-algorithms-for","title":"A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage","date":"2024-03-07","arxiv_id":"2403.09701","repositories_listed":0,"syntology":null},{"url":null,"slug":"finding-waldo-towards-efficient-exploration","title":"Finding Waldo: Towards Efficient Exploration of NeRF Scene Spaces","date":"2024-03-07","arxiv_id":"2403.04508","repositories_listed":0,"syntology":null},{"url":null,"slug":"noisy-spiking-actor-network-for-exploration","title":"Noisy Spiking Actor Network for Exploration","date":"2024-03-07","arxiv_id":"2403.04162","repositories_listed":0,"syntology":null},{"url":null,"slug":"vlearn-off-policy-learning-with-efficient","title":"Vlearn: Off-Policy Learning with Efficient State-Value Function Estimation","date":"2024-03-07","arxiv_id":"2403.04453","repositories_listed":0,"syntology":null},{"url":null,"slug":"ace-off-policy-actor-critic-with-causality","title":"ACE : Off-Policy Actor-Critic with Causality-Aware Entropy Regularization","date":"2024-02-22","arxiv_id":"2402.14528","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-models-meet-contextual-bandits-with","title":"Diffusion Models Meet Contextual Bandits with Large Action Spaces","date":"2024-02-15","arxiv_id":"2402.10028","repositories_listed":0,"syntology":null},{"url":null,"slug":"toponav-topological-navigation-for-efficient","title":"TopoNav: Topological Navigation for Efficient Exploration in Sparse Reward Environments","date":"2024-02-06","arxiv_id":"2402.04061","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-for-llms","title":"Efficient Exploration for LLMs","date":"2024-02-01","arxiv_id":"2402.00396","repositories_listed":0,"syntology":null},{"url":null,"slug":"scheduled-curiosity-deep-dyna-q-efficient","title":"Scheduled Curiosity-Deep Dyna-Q: Efficient Exploration for Dialog Policy Learning","date":"2024-01-31","arxiv_id":"2402.00085","repositories_listed":0,"syntology":null},{"url":null,"slug":"fit-slam-fisher-information-and","title":"FIT-SLAM -- Fisher Information and Traversability estimation-based Active SLAM for exploration in 3D environments","date":"2024-01-17","arxiv_id":"2401.09322","repositories_listed":0,"syntology":null},{"url":null,"slug":"go-explore-for-residential-energy-management","title":"Go-Explore for Residential Energy Management","date":"2024-01-15","arxiv_id":"2401.07710","repositories_listed":0,"syntology":null},{"url":null,"slug":"mutual-enhancement-of-large-language-and","title":"Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Case Study","date":"2024-01-12","arxiv_id":"2401.06603","repositories_listed":0,"syntology":null},{"url":null,"slug":"diffusion-es-gradient-free-planning-with-1","title":"Diffusion-ES: Gradient-free Planning with Diffusion for Autonomous and Instruction-guided Driving","date":"2024-01-01","arxiv_id":null,"repositories_listed":0,"syntology":null},{"url":null,"slug":"a-bayesian-framework-of-deep-reinforcement","title":"A Bayesian Framework of Deep Reinforcement Learning for Joint O-RAN/MEC Orchestration","date":"2023-12-26","arxiv_id":"2312.16142","repositories_listed":0,"syntology":null},{"url":null,"slug":"joint-channel-estimation-and-data-detection-2","title":"Joint channel estimation and data detection in massive MIMO systems based on diffusion models","date":"2023-11-17","arxiv_id":"2311.10311","repositories_listed":0,"syntology":null},{"url":null,"slug":"virtual-action-actor-critic-framework-for","title":"Virtual Action Actor-Critic Framework for Exploration (Student Abstract)","date":"2023-11-06","arxiv_id":"2311.02916","repositories_listed":0,"syntology":null},{"url":null,"slug":"regret-analysis-of-learning-based-linear","title":"Regret Analysis of Learning-Based Linear Quadratic Gaussian Control with Additive Exploration","date":"2023-11-05","arxiv_id":"2311.02679","repositories_listed":0,"syntology":null},{"url":null,"slug":"visual-analytics-for-efficient-image","title":"Visual Analytics for Efficient Image Exploration and User-Guided Image Captioning","date":"2023-11-02","arxiv_id":"2311.01016","repositories_listed":0,"syntology":null},{"url":null,"slug":"efficient-exploration-in-continuous-time","title":"Efficient Exploration in Continuous-time Model-based Reinforcement Learning","date":"2023-10-30","arxiv_id":"2310.19848","repositories_listed":0,"syntology":null}],"record_sha256":"b53b784615ab96dfdc04116acdc91d3f3d1b76b5c423189b6ac9d5951d6153b4","record_changed_at":"2026-09-28","record_changed_at_basis":"first_hashed"}