Tag: optimisation GPU

Réduire l'empreinte mémoire pour héberger plusieurs LLMs

Réduire l'empreinte mémoire pour héberger plusieurs LLMs

Découvrez comment réduire l'empreinte mémoire des LLMs pour héberger plusieurs modèles sur un seul GPU. Techniques clés : QLoRA, distillation et innovations architecturales.

Voir plus
Entraînement en Précision Mixte pour les LLM : Guide FP16, BF16 et au-delà

Entraînement en Précision Mixte pour les LLM : Guide FP16, BF16 et au-delà

Découvrez comment l'entraînement en précision mixte (FP16, BF16) accélère les LLM et réduit les coûts. Guide pratique sur le choix des formats, l'implémentation PyTorch et les gains matériels.

Voir plus
Gains de latence par la compression : Servir des LLM plus petits en production

Gains de latence par la compression : Servir des LLM plus petits en production

Découvrez comment réduire la latence des LLM en production grâce à la compression. Guide pratique sur la quantisation INT8/FP8, la sparsité et les outils comme Red Hat LLM Compressor pour servir des modèles plus petits et plus rapides.

Voir plus