Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
Paper • 2609.18708 • Published • 79
None defined yet.
RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution
Self-Adversarial One Step Generation via Condition Shifting