Tag: optimisation GPU
Entraînement en Précision Mixte pour les LLM : Guide FP16, BF16 et au-delà
- King Willie
- |
- |
- 0
Découvrez comment l'entraînement en précision mixte (FP16, BF16) accélère les LLM et réduit les coûts. Guide pratique sur le choix des formats, l'implémentation PyTorch et les gains matériels.
Voir plusGains de latence par la compression : Servir des LLM plus petits en production
- King Willie
- |
- |
- 0
Découvrez comment réduire la latence des LLM en production grâce à la compression. Guide pratique sur la quantisation INT8/FP8, la sparsité et les outils comme Red Hat LLM Compressor pour servir des modèles plus petits et plus rapides.
Voir plus