Signal2026-08-10
Papers With Code

Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss

Part of

Advanced Machine Translation And NLP