FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
arXiv:2603.19835v2 Announce Type: replace Abstract: We present Future-KL Influenced Policy Optimization (FIPO), a reinforcement learning algorithm designed to overcome reasoning bottlenecks in large language models. While GRPO style training scales effectively, it typically relies on outcome-based rewards (ORM) that distribute…
