Signal2026-08-06
arXiv

Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

Part of

Advanced Inverse Reward And Prompt Engineering