| Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs added by Syntology |
2026-09 (from id) |
hexixiang/MT-SDPO/training/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents added by Syntology |
2026-09 (from id) |
AlibabaResearch/SignalCoverageRL/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision added by Syntology |
2026-08 (from id) |
verl-project/verl/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Best Practice Critic Optimization BEST PRACTICE CRITIC OPTIMIZATION added by Syntology |
2026-08 (from id) |
QPHutu/golden_critic/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Self-Improving Large Language Models via Progressive Experience Evolution added by Syntology |
2026-08 (from id) |
rrrsj/SPEE/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning added by Syntology |
2026-07 (from id) |
xiuyilou/TACO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| DENSER ̸ = BETTER: LIMITS OF ON-POLICY SELF-DISTILLATION FOR CONTINUAL POST-TRAINING added by Syntology |
2026-07 (from id) |
Moenupa/SDPO-CL/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization added by Syntology |
2026-06 (from id) |
OPPO-Mente-Lab/GNDPO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| INFUSER: Influence-Guided Self-Evolution Improves Reasoning added by Syntology |
2026-06 (from id) |
FFishy-git/INFUSER/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
MIT (permissive) |
| CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement added by Syntology |
2026-06 (from id) |
langfengQ/verl-agent/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Self-Distilled Policy Gradient added by Syntology |
2026-06 (from id) |
lauyikfung/SDPG/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains added by Syntology |
2026-05 (from id) |
ZiqiZhao1/ROSD/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| MERIT: Matching Expertise via Rubric-Informed Training for Reviewer Assignment added by Syntology |
2026-05 (from id) |
Luli3220/MERIT/MERIT-Assessor/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning added by Syntology |
2026-05 (from id) |
AlexFanw/LegalSearch-R1/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards added by Syntology |
2026-05 (from id) |
Lumina04/CARE/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Hide to Guide: Learning via Semantic Masking added by Syntology |
2026-05 (from id) |
mit-han-lab/SMEPO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning added by Syntology |
2026-05 (from id) |
Stellaris167/RAC/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective added by Syntology |
2026-05 (from id) |
horizon-llm/CTPO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning added by Syntology |
2026-04 (from id) |
yuyongcan/DDRL/verl/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
MIT (permissive) |
| Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs? added by Syntology |
2026-03 (from id) |
lasgroup/SDPO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs added by Syntology |
2026-03 (from id) |
ucsd-wang-lab-lm/tips/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Reinforcement Learning with Conditional Expectation Reward added by Syntology |
2026-03 (from id) |
changyi7231/CER/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR added by Syntology |
2026-03 (from id) |
Qwen-Applications/CLIPO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Adaptive Reflection and Length Coordinated Penalty (ARLCP) STOP UNNECESSARY REFLECTION: TRAINING LRMS FOR EFFICIENT REASONING WITH ADAPTIVE REFLEC-TION AND LENGTH COORDINATED PENALTY added by Syntology |
2026-02 (from id) |
ZeweiYu1/ARLCP/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
MIT (permissive) |
| Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning added by Syntology |
2026-02 (from id) |
wdqqdw/Echo/verl/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Online Causal Kalman Filtering for Stable and Effective Policy Optimization added by Syntology |
2026-02 (from id) |
shuohe1995/verl-kpo/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Uncovering Cross-Objective Interference in Multi-Objective Alignment added by Syntology |
2026-02 (from id) |
yining610/ctwa/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models added by Syntology |
2026-02 (from id) |
Easy195/FaithRL/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Rethinking the Trust Region in LLM Reinforcement Learning added by Syntology |
2026-02 (from id) |
sail-sg/Stable-RL/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs added by Syntology |
2026-02 (from id) |
Within-yao/CoBA-RL/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| AgentOCR: Reimagining Agent History via Optical Self-Compression added by Syntology |
2026-01 (from id) |
langfengQ/AgentOCR/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| AT 2 PO: Agentic Turn-based Policy Optimization via Tree Search added by Syntology |
2026-01 (from id) |
zzfoutofspace/ATPO/ATPO/verl_atpo/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Prioritized Replay for RL Post-training added by Syntology |
2026-01 (from id) |
fatemi/verl/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Meta-RL Induces Exploration in Language Agents added by Syntology |
2025-12 (from id) |
mlbio-epfl/LaMer/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
no licence file found · pointer only |
| Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning added by Syntology |
2025-12 (from id) |
SII-zyj/Ophiuchus/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents added by Syntology |
2025-10 (from id) |
GuoqingWang1/IGPO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| Multi-Agent Tool-Integrated Policy Optimization added by Syntology |
2025-10 (from id) |
mzf666/MATPO/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models |
15 Jun 2025 |
xid32/SoundMind/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
MIT (permissive) |
| RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling |
10 Jun 2025 |
bigai-nlco/rulereasoner/verl/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
MIT (permissive) |
| HybridFlow: A Flexible and Efficient RLHF Framework |
28 Sep 2024 |
du-nlp-lab/lengthreward/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| arXiv:openreview_dzcDbh8ewp |
|
Xiao-Youth/LECTOR/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |
| arXiv:openreview_VZDlkXuIQc |
|
ShadeCloak/IP-GRM/verl/verl/utils/net_utils.py 705afe175ad8e404 |
unverified |
Apache-2.0 (permissive) |