Signal2026-08-11
arXiv

Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

Part of

Self-Driving Car Security Evaluation