| Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs added by Syntology |
2026-09 (from id) |
hexixiang/MT-SDPO/training/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents added by Syntology |
2026-09 (from id) |
AlibabaResearch/SignalCoverageRL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| On-policy Distillation with Verifiable Reward added by Syntology |
2026-08 (from id) |
LeapLabTHU/OPDVR/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision added by Syntology |
2026-08 (from id) |
verl-project/verl/verl/model_merger/base_model_merger.py 45205d24c28c95d4 |
ran
|
Apache-2.0 (permissive) |
| Best Practice Critic Optimization BEST PRACTICE CRITIC OPTIMIZATION added by Syntology |
2026-08 (from id) |
QPHutu/golden_critic/verl/model_merger/base_model_merger.py 45205d24c28c95d4 |
ran
|
Apache-2.0 (permissive) |
| Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning added by Syntology |
2026-08 (from id) |
SolereZhang/GC-OPD/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| TAIL-AWARE TOP-k ON-POLICY DISTILLATION added by Syntology |
2026-08 (from id) |
HuipengHuang/TA-OPD/verl/verl/model_merger/base_model_merger.py 45205d24c28c95d4 |
ran
|
no licence file found · pointer only |
| Self-Improving Large Language Models via Progressive Experience Evolution added by Syntology |
2026-08 (from id) |
rrrsj/SPEE/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning added by Syntology |
2026-08 (from id) |
Lumina04/CoKL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation added by Syntology |
2026-07 (from id) |
HappynessI/Prefix_GRPO/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation added by Syntology |
2026-07 (from id) |
VisionOPD/Vision-OPD/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples added by Syntology |
2026-07 (from id) |
Hesse73/ARMOR/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning added by Syntology |
2026-07 (from id) |
xiuyilou/TACO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| DENSER ̸ = BETTER: LIMITS OF ON-POLICY SELF-DISTILLATION FOR CONTINUAL POST-TRAINING added by Syntology |
2026-07 (from id) |
Moenupa/SDPO-CL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning added by Syntology |
2026-06 (from id) |
pangpang-xuan/OPERA/verl/verl/model_merger/base_model_merger.py 9c496dae615ba2a8 |
ran
|
no licence file found · pointer only |
| ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning added by Syntology |
2026-06 (from id) |
allen4747/extra/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| VIMPO: Value-Implicit Policy Optimization for LLMs added by Syntology |
2026-06 (from id) |
backprop07/VIMPO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts added by Syntology |
2026-06 (from id) |
furiosa-ai/EfficientRollout/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization added by Syntology |
2026-06 (from id) |
OPPO-Mente-Lab/GNDPO/verl/model_merger/base_model_merger.py 9c496dae615ba2a8 |
ran
|
Apache-2.0 (permissive) |
| INFUSER: Influence-Guided Self-Evolution Improves Reasoning added by Syntology |
2026-06 (from id) |
FFishy-git/INFUSER/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
MIT (permissive) |
| OPRD: On-Policy Representation Distillation added by Syntology |
2026-06 (from id) |
ShenzhiYang2000/OPRD/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Self-Distilled Policy Gradient added by Syntology |
2026-06 (from id) |
lauyikfung/SDPG/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation added by Syntology |
2026-06 (from id) |
YuYingLi0/FiRe-OPD/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering added by Syntology |
2026-06 (from id) |
KhanCold/spader/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains added by Syntology |
2026-05 (from id) |
ZiqiZhao1/ROSD/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| MERIT: Matching Expertise via Rubric-Informed Training for Reviewer Assignment added by Syntology |
2026-05 (from id) |
Luli3220/MERIT/MERIT-Assessor/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning added by Syntology |
2026-05 (from id) |
AlexFanw/LegalSearch-R1/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards added by Syntology |
2026-05 (from id) |
Lumina04/CARE/verl/model_merger/base_model_merger.py 9c496dae615ba2a8 |
ran
|
Apache-2.0 (permissive) |
| Hide to Guide: Learning via Semantic Masking added by Syntology |
2026-05 (from id) |
mit-han-lab/SMEPO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning added by Syntology |
2026-05 (from id) |
Stellaris167/RAC/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation added by Syntology |
2026-05 (from id) |
caiyuchen-ustc/EffOPD/EffOPD/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective added by Syntology |
2026-05 (from id) |
horizon-llm/CTPO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| When Less is Enough: Efficient Inference via Collaborative Reasoning added by Syntology |
2026-05 (from id) |
fairytale9/llm_bottleneck/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement added by Syntology |
2026-04 (from id) |
newera-xiao/ReQueR/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning added by Syntology |
2026-04 (from id) |
yuyongcan/DDRL/verl/verl/model_merger/base_model_merger.py 9c496dae615ba2a8 |
ran
|
MIT (permissive) |
| HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment added by Syntology |
2026-04 (from id) |
XMUDeepLIT/HEAL/verl/model_merger/base_model_merger.py 9c496dae615ba2a8 |
ran
|
Apache-2.0 (permissive) |
| WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering added by Syntology |
2026-04 (from id) |
zhuyjan/WikiSeeker/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Learning to Hint for Reinforcement Learning added by Syntology |
2026-04 (from id) |
Andree-9/HiLL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs? added by Syntology |
2026-03 (from id) |
lasgroup/SDPO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs added by Syntology |
2026-03 (from id) |
ucsd-wang-lab-lm/tips/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs added by Syntology |
2026-03 (from id) |
sikelifei/HeRL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time added by Syntology |
2026-03 (from id) |
Jasper-Yan/SCRL/verl/verl/model_merger/base_model_merger.py 9c496dae615ba2a8 |
ran
|
MIT (permissive) |
| Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models added by Syntology |
2026-03 (from id) |
XiaojieGu/Omanic/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents added by Syntology |
2026-03 (from id) |
unimpor/T3/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR added by Syntology |
2026-03 (from id) |
Qwen-Applications/CLIPO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Entropy-Aware On-Policy Distillation of Language Models added by Syntology |
2026-03 (from id) |
WLS04/EOPD/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning added by Syntology |
2026-02 (from id) |
FlyTune/MASPO-RL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| VESPO: Variational Sequence-level Soft Policy Optimization for Off-Policy LLM Training added by Syntology |
2026-02 (from id) |
FloyedShen/VESPO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Online Causal Kalman Filtering for Stable and Effective Policy Optimization added by Syntology |
2026-02 (from id) |
shuohe1995/verl-kpo/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Uncovering Cross-Objective Interference in Multi-Objective Alignment added by Syntology |
2026-02 (from id) |
yining610/ctwa/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models added by Syntology |
2026-02 (from id) |
Easy195/FaithRL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Rethinking the Trust Region in LLM Reinforcement Learning added by Syntology |
2026-02 (from id) |
sail-sg/Stable-RL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning added by Syntology |
2026-02 (from id) |
wenquanlu/PrAg-PO/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Self-Hinting Language Models Enhance Reinforcement Learning added by Syntology |
2026-02 (from id) |
BaohaoLiao/SAGE/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs added by Syntology |
2026-02 (from id) |
Within-yao/CoBA-RL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| GRAPHDANCER: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training added by Syntology |
2026-02 (from id) |
leopoldwhite/GraphDancer/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| UCPO: Uncertainty-Aware Policy Optimization added by Syntology |
2026-01 (from id) |
xzhouzeng/ucpo/train/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis added by Syntology |
2026-01 (from id) |
HowardLi1984/ChemCraft/chemcraft_rl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
no licence file found · pointer only |
| Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors added by Syntology |
2026-01 (from id) |
THUNLP-MT/HieroSA/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
MIT (permissive) |
| Linear Dynamics in the RLVR Training of Large Language Models added by Syntology |
2026-01 (from id) |
Miaow-Lab/RLVR-Linearity/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
MIT (permissive) |
| Prioritized Replay for RL Post-training added by Syntology |
2026-01 (from id) |
fatemi/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection added by Syntology |
2025-10 (from id) |
JingbiaoMei/ExPO-HM/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking added by Syntology |
2025-09 (from id) |
bytedance/EvoQuality/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| TTRL: Test-Time Reinforcement Learning |
22 Apr 2025 |
prime-rl/ttrl/verl/verl/model_merger/base_model_merger.py 9c496dae615ba2a8 |
ran
|
MIT (permissive) |
| Guided Stream of Search: Learning to Better Search with Language Models via Optimal Path Guidance |
3 Oct 2024 |
snu-mllab/guided-rest/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| arXiv:openreview_v70fTOqer2 |
|
liziniu/KnapsackRL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| arXiv:openreview_lbaBsu0CaY |
|
Tunanzzz/Meerkat-VL/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |
| arXiv:openreview_VZDlkXuIQc |
|
ShadeCloak/IP-GRM/verl/verl/model_merger/base_model_merger.py 8896f4e2bafe8abc |
ran
|
Apache-2.0 (permissive) |