Empreinte estimée = poids quantifiés + cache KV (contexte, FP16) + socle runtime. Pour un dimensionnement exact du cache KV (GQA, FP8, concurrence), voir le calculateur de VRAM.
Tous les formats disponibles
| Format | Bits | Poids | Empreinte | VRAM | Qualité |
|---|
Comment lire cette recommandation
Qu'est-ce que la quantification ? Un modèle est un ensemble de poids stockés par défaut sur 16 bits. La quantification réduit cette précision (8, 5, 4 bits…) pour diviser d'autant la mémoire des poids. Un modèle de N milliards de paramètres pèse environ N × 2 Go en 16 bits, N Go en 8 bits, et N ÷ 2 Go en 4 bits. C'est le levier le plus efficace pour faire tenir un modèle plus capable sur le même GPU.
Production ou local ? En production, un serveur vLLM privilégie FP8 (sur GPU Hopper/Ada) ou des poids AWQ/GPTQ 4 bits, calibrés pour préserver la qualité sous forte concurrence. En local (llama.cpp, Ollama, LM Studio), le format GGUF propose une échelle fine, de Q8_0 (quasi sans perte) à Q4_K_M, le standard de l'IA locale.
Où s'arrête la quantification utile ? Jusqu'à 4 bits (Q4_K_M, AWQ), la perte de qualité est légère et souvent imperceptible sur des tâches documentaires. En dessous de 4 bits, la dégradation devient nettement plus marquée : à réserver aux cas très contraints en mémoire. Au-dessus, 5 à 6 bits (Q5_K_M, Q6_K) offrent un excellent compromis quand la VRAM le permet.
La quantification du cache KV est un autre levier. Indépendamment des poids, le cache qui stocke le contexte peut lui aussi passer en 8 bits (FP8) sous vLLM, divisant par deux la mémoire du contexte. C'est déterminant quand vous servez beaucoup d'utilisateurs simultanés : le calculateur de VRAM le prend en compte précisément.
Une estimation, pas une garantie. La qualité réelle d'une quantification dépend du modèle, de la méthode de calibration et de votre cas d'usage. La seule mesure qui tranche est une évaluation sur vos propres données. C'est ce que nous faisons pour chaque déploiement souverain : voir notre page Modèles LLM et l'article quel modèle open weight auto-héberger.
Le bon modèle, la bonne quantification, le bon GPU
Nous validons la quantification sur vos propres documents et opérons l'infrastructure pour vous, sans compromis sur la souveraineté.
Parler à un ingénieur