| Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs added by Syntology |
2026-09 (from id) |
hexixiang/MT-SDPO/training/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents added by Syntology |
2026-09 (from id) |
AlibabaResearch/SignalCoverageRL/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| FARCA: Fact-Aligned Reliability-Aware Credit Assignment for Reinforcement Learning with Factual Supervision added by Syntology |
2026-08 (from id) |
verl-project/verl/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Best Practice Critic Optimization BEST PRACTICE CRITIC OPTIMIZATION added by Syntology |
2026-08 (from id) |
QPHutu/golden_critic/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Self-Improving Large Language Models via Progressive Experience Evolution added by Syntology |
2026-08 (from id) |
rrrsj/SPEE/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples added by Syntology |
2026-07 (from id) |
Hesse73/ARMOR/verl/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning added by Syntology |
2026-07 (from id) |
xiuyilou/TACO/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| DENSER ̸ = BETTER: LIMITS OF ON-POLICY SELF-DISTILLATION FOR CONTINUAL POST-TRAINING added by Syntology |
2026-07 (from id) |
Moenupa/SDPO-CL/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning added by Syntology |
2026-06 (from id) |
jinyangwu/OPID/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| How Does Reasoning Flow? Tracing Attention-Induced Information Flow for Targeted RL in LLMs added by Syntology |
2026-06 (from id) |
Jiayi-Pan/TinyZero/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization added by Syntology |
2026-06 (from id) |
OPPO-Mente-Lab/GNDPO/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| INFUSER: Influence-Guided Self-Evolution Improves Reasoning added by Syntology |
2026-06 (from id) |
FFishy-git/INFUSER/verl/protocol.py 83b1686d7ac03c21 |
ran
|
MIT (permissive) |
| SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models added by Syntology |
2026-06 (from id) |
Zhaolutuan/SAW/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement added by Syntology |
2026-06 (from id) |
langfengQ/verl-agent/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Self-Distilled Policy Gradient added by Syntology |
2026-06 (from id) |
lauyikfung/SDPG/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification added by Syntology |
2026-06 (from id) |
shanjf666/CoCoV/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
no licence file found · pointer only |
| ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains added by Syntology |
2026-05 (from id) |
ZiqiZhao1/ROSD/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| MERIT: Matching Expertise via Rubric-Informed Training for Reviewer Assignment added by Syntology |
2026-05 (from id) |
Luli3220/MERIT/MERIT-Assessor/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning added by Syntology |
2026-05 (from id) |
AlexFanw/LegalSearch-R1/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards added by Syntology |
2026-05 (from id) |
Lumina04/CARE/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Hide to Guide: Learning via Semantic Masking added by Syntology |
2026-05 (from id) |
mit-han-lab/SMEPO/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning added by Syntology |
2026-05 (from id) |
Stellaris167/RAC/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| SEIF: Self-Evolving Reinforcement Learning for Instruction Following added by Syntology |
2026-05 (from id) |
Rainier-rq1/SEIF/verl/protocol.py a91c18341292d50e |
ran
|
Apache-2.0 (permissive) |
| Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective added by Syntology |
2026-05 (from id) |
horizon-llm/CTPO/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| When Less is Enough: Efficient Inference via Collaborative Reasoning added by Syntology |
2026-05 (from id) |
fairytale9/llm_bottleneck/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks added by Syntology |
2026-04 (from id) |
Rainier-rq1/From_Coarse_to_Fine/WRL/verl/verl/protocol.py a91c18341292d50e |
ran
|
no licence file found · pointer only |
| One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement added by Syntology |
2026-04 (from id) |
newera-xiao/ReQueR/verl/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning added by Syntology |
2026-04 (from id) |
yuyongcan/DDRL/verl/verl/protocol.py 83b1686d7ac03c21 |
ran
|
MIT (permissive) |
| Bounded Ratio Reinforcement Learning added by Syntology |
2026-04 (from id) |
bounded-ratio-rl/bounded_ratio_rl/src/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment added by Syntology |
2026-04 (from id) |
XMUDeepLIT/HEAL/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents added by Syntology |
2026-04 (from id) |
WangHanLinHenry/EVU/verl-agent/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
no licence file found · pointer only |
| GIANTS: Generative Insight Anticipation from Scientific Literature added by Syntology |
2026-04 (from id) |
joyheyueya/giants/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs? added by Syntology |
2026-03 (from id) |
lasgroup/SDPO/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs added by Syntology |
2026-03 (from id) |
ucsd-wang-lab-lm/tips/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time added by Syntology |
2026-03 (from id) |
Jasper-Yan/SCRL/verl/verl/protocol.py 83b1686d7ac03c21 |
ran
|
MIT (permissive) |
| Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL added by Syntology |
2026-03 (from id) |
amazon-science/adaptive-layerwise-perturbation/multi-turn/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Reinforcement Learning with Conditional Expectation Reward added by Syntology |
2026-03 (from id) |
changyi7231/CER/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR added by Syntology |
2026-03 (from id) |
Qwen-Applications/CLIPO/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution added by Syntology |
2026-03 (from id) |
ncbi-nlp/Med-V1/training/grpo/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
no licence file found · pointer only |
| SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety added by Syntology |
2026-03 (from id) |
hiyouga/EasyR1/verl/protocol.py a91c18341292d50e |
ran
|
Apache-2.0 (permissive) |
| Beyond Static Pipelines: Learning Dynamic Workflows for Text-to-SQL added by Syntology |
2026-02 (from id) |
Satissss/SquRL/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph added by Syntology |
2026-02 (from id) |
Alibaba-NLP/VRAG/VRAG-RL/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
no licence file found · pointer only |
| Adaptive Reflection and Length Coordinated Penalty (ARLCP) STOP UNNECESSARY REFLECTION: TRAINING LRMS FOR EFFICIENT REASONING WITH ADAPTIVE REFLEC-TION AND LENGTH COORDINATED PENALTY added by Syntology |
2026-02 (from id) |
ZeweiYu1/ARLCP/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning added by Syntology |
2026-02 (from id) |
wdqqdw/Echo/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
no licence file found · pointer only |
| Online Causal Kalman Filtering for Stable and Effective Policy Optimization added by Syntology |
2026-02 (from id) |
shuohe1995/verl-kpo/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Uncovering Cross-Objective Interference in Multi-Objective Alignment added by Syntology |
2026-02 (from id) |
yining610/ctwa/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models added by Syntology |
2026-02 (from id) |
Easy195/FaithRL/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| Rethinking the Trust Region in LLM Reinforcement Learning added by Syntology |
2026-02 (from id) |
sail-sg/Stable-RL/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL added by Syntology |
2026-02 (from id) |
LunjunZhang/ema-pg/search/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue added by Syntology |
2026-02 (from id) |
Da1yuqin/SEAD/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning added by Syntology |
2026-02 (from id) |
wenquanlu/PrAg-PO/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs added by Syntology |
2026-02 (from id) |
Within-yao/CoBA-RL/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| CPMöbius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning added by Syntology |
2026-02 (from id) |
thunlp/CPMobius/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| GRAPHDANCER: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training added by Syntology |
2026-02 (from id) |
leopoldwhite/GraphDancer/verl/protocol.py 83b1686d7ac03c21 |
ran
|
no licence file found · pointer only |
| Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation added by Syntology |
2026-01 (from id) |
Cherry-qwq/LcRL-Open/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| RelayLLM: Efficient Reasoning via Collaborative Decoding added by Syntology |
2026-01 (from id) |
Chengsong-Huang/RelayLLM/RL_stage/verl/protocol.py a91c18341292d50e |
ran
|
no licence file found · pointer only |
| AT 2 PO: Agentic Turn-based Policy Optimization via Tree Search added by Syntology |
2026-01 (from id) |
zzfoutofspace/ATPO/ATPO/verl_atpo/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
no licence file found · pointer only |
| Prioritized Replay for RL Post-training added by Syntology |
2026-01 (from id) |
fatemi/verl/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Meta-RL Induces Exploration in Language Agents added by Syntology |
2025-12 (from id) |
mlbio-epfl/LaMer/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
no licence file found · pointer only |
| Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning added by Syntology |
2025-12 (from id) |
SII-zyj/Ophiuchus/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning added by Syntology |
2025-11 (from id) |
aiming-lab/Agent0/Agent0-VL/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents added by Syntology |
2025-10 (from id) |
GuoqingWang1/IGPO/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Multi-Agent Tool-Integrated Policy Optimization added by Syntology |
2025-10 (from id) |
mzf666/MATPO/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking added by Syntology |
2025-09 (from id) |
bytedance/EvoQuality/verl/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| Scaling RL to Long Videos |
10 Jul 2025 |
NVlabs/Long-RL/verl/protocol.py a91c18341292d50e |
ran
|
Apache-2.0 (permissive) |
| Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training |
7 Jul 2025 |
zhhvvv/rft_vs_sft/EasyR1/verl/protocol.py a91c18341292d50e |
ran
|
no licence file found · pointer only |
| SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models |
15 Jun 2025 |
xid32/SoundMind/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling |
10 Jun 2025 |
bigai-nlco/rulereasoner/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency |
2 Jun 2025 |
appletea233/temporal-r1/verl/protocol.py a91c18341292d50e |
ran
|
Apache-2.0 (permissive) |
| ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL |
30 May 2025 |
Franklin-Zhang0/ReasonGen-R1/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| ToMAP: Training Opponent-Aware LLM Persuaders with Theory of Mind |
29 May 2025 |
ulab-uiuc/ToMAP/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| REARANK: Reasoning Re-ranking Agent via Reinforcement Learning |
26 May 2025 |
lezhang7/rearank/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Behavior Injection: Preparing Language Models for Reinforcement Learning |
25 May 2025 |
czp16/bridge-llm-reasoning/simple_verl/sverl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting |
24 May 2025 |
joeying1019/adactrl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Synthetic Data RL: Task Definition Is All You Need |
18 May 2025 |
gydpku/data_synthesis_rl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| UFT: Unifying Supervised and Reinforcement Fine-Tuning |
22 May 2025 |
liumy2010/uft/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay |
22 May 2025 |
dvlab-research/arpo/verl/protocol.py a91c18341292d50e |
ran
|
Apache-2.0 (permissive) |
| DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning |
20 May 2025 |
visual-agent/deepeyes/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Thinkless: LLM Learns When to Think |
19 May 2025 |
vainf/thinkless/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs |
19 May 2025 |
zhyang2226/ar-lopti/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning |
16 May 2025 |
yueliu1999/guardreasoner-vl/train/EasyR1/verl/protocol.py a91c18341292d50e |
ran
|
MIT (permissive) |
| Scalable Chain of Thoughts via Elastic Reasoning |
8 May 2025 |
salesforceairesearch/elastic-reasoning/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 recorded; this copy not marked cleared · pointer only |
| ZeroSearch: Incentivize the Search Capability of LLMs without Searching |
7 May 2025 |
alibaba-nlp/zerosearch/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Reinforcement Learning for Reasoning in Large Language Models with One Training Example |
29 Apr 2025 |
ypwang61/one-shot-rlvr/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| SQL-R1: Training Natural Language to SQL Reasoning Model By Reinforcement Learning |
2025-04 (from id) |
IDEA-FinAI/SQL-R1/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Efficient Reinforcement Finetuning via Adaptive Curriculum Learning |
7 Apr 2025 |
uscnlp-lime/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Do Theory of Mind Benchmarks Need Explicit Human-like Reasoning in Language Models? |
2 Apr 2025 |
bigai-ai/ToM-RL/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning |
2 Apr 2025 |
UCSB-NLP-Chang/ThinkPrune/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models |
28 Mar 2025 |
lzhxmu/cppo/cppo_verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| OpenVLThinker: An Early Exploration to Complex Vision-Language Reasoning via Iterative Self-Improvement |
21 Mar 2025 |
yihedeng9/openvlthinker/EasyR1/verl/protocol.py a91c18341292d50e |
ran
|
Apache-2.0 (permissive) |
| Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond |
13 Mar 2025 |
Qihoo360/Light-R1/deepscaler-release/verl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Agent models: Internalizing Chain-of-Action Generation into Reasoning models |
9 Mar 2025 |
adam-bjtu/autocoa/RL_training/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
MIT (permissive) |
| Self-rewarding correction for mathematical reasoning |
26 Feb 2025 |
agentica-project/verl-pipeline/verl/protocol.py 80bcfef75cb84b53 |
unverified |
Apache-2.0 (permissive) |
| Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning |
20 Feb 2025 |
Unakar/Logic-RL/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| S*: Test Time Scaling for Code Generation |
20 Feb 2025 |
novasky-ai/skythought/skythought/skythought-rl/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| Flaming-hot Initiation with Regular Execution Sampling for Large Language Models |
28 Oct 2024 |
yaof20/real/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| HybridFlow: A Flexible and Efficient RLHF Framework |
28 Sep 2024 |
du-nlp-lab/lengthreward/verl/protocol.py 83b1686d7ac03c21 |
ran
|
Apache-2.0 (permissive) |
| arXiv:openreview_dzcDbh8ewp |
|
Xiao-Youth/LECTOR/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| arXiv:openreview_Y1rHxA58If |
|
qiancheng0/ToolRL/verl/protocol.py 25f0ea3f460f6ce1 |
ran · our draft was wrong
|
Apache-2.0 (permissive) |
| arXiv:openreview_Y1PXB8HBV7 |
|
youwyouw/mirl-main/verl/protocol.py a91c18341292d50e |
ran
|
Apache-2.0 (permissive) |