Quentin Gallouédec
@QGallouedec
TRL v1.15 is out. Our biggest optimization ever.
Fused LM head, on by default:
→ up to 82% less peak VRAM
→ 7x longer sequences
→ DPO 10k → 59k tokens, GRPO 29k → 115k
And more... github.com/huggingface/tr…
Fused LM head, on by default:
→ up to 82% less peak VRAM
→ 7x longer sequences
→ DPO 10k → 59k tokens, GRPO 29k → 115k
And more... github.com/huggingface/tr…
9 81