Tag: optimisation GPU

Entraînement en Précision Mixte pour les LLM : Guide FP16, BF16 et au-delà

Entraînement en Précision Mixte pour les LLM : Guide FP16, BF16 et au-delà

Découvrez comment l'entraînement en précision mixte (FP16, BF16) accélère les LLM et réduit les coûts. Guide pratique sur le choix des formats, l'implémentation PyTorch et les gains matériels.

Voir plus
Gains de latence par la compression : Servir des LLM plus petits en production

Gains de latence par la compression : Servir des LLM plus petits en production

Découvrez comment réduire la latence des LLM en production grâce à la compression. Guide pratique sur la quantisation INT8/FP8, la sparsité et les outils comme Red Hat LLM Compressor pour servir des modèles plus petits et plus rapides.

Voir plus