Sovenyr
Get early access
Signal
2026-07-24
arXiv
X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
Part of
Advanced Inverse Reward And Prompt Engineering
Open primary source
See the whole picture