Signal2026-07-20
arXiv

Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization

Part of

Prompt-Based Fairness Debiasing