Signal2026-07-02
arXiv

Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity

Part of

Adaptive Interfaces And AI Benchmarking