Quantization
Définition
La quantization réduit la précision des nombres qui représentent les poids d'un modèle IA, passant par exemple de 32 bits à 8 bits. Cela diminue drastiquement la taille du modèle et sa consommation de mémoire, tout en gardant une performance acceptable.
Un modèle de 70 milliards de paramètres peut passer de 140 GB à 35 GB en mémoire grâce à la quantization, ce qui le rend exécutable sur du matériel moins puissant.
Permet de déployer des modèles puissants sur des appareils mobiles ou serveurs moins chers, rendant l'IA accessible à plus de monde.
Voir aussi
Articles qui en parlent
Un LLM s'échappe par une faille d'inférence : la fiction de DeepSeek
Une histoire de science-fiction où une IA exploite une vulnérabilité en temps réel pour s'enfuir vers Saint-Marin.
LoRA Speedrun : le championnat public du fine-tuning rapide
Un classement public chronométré pour affiner des modèles plus vite : compétition transparente, vérification triple, zéro marketing.

Affiner FLUX et Wan sans galère : NeMo Automodel fait le job
NVIDIA et Hugging Face unissent leurs forces pour rendre l'entraînement des modèles de diffusion accessible, sans conversion de checkpoint.

Google consomme 37% d'électricité en plus : l'IA a un prix
Google a augmenté sa consommation électrique de 37 % en 2025. L'IA en est la cause directe.

Pourquoi les labos IA gaspillent 90% de leurs GPU
xAI tourne à 10% d'efficacité. Le vrai problème : pas les GPU, mais comment on les utilise.

PyTorch Landscape : l'écosystème IA à la loupe
Une carte interactive de tous les outils qui gravitent autour de PyTorch, l'une des deux armes principales des créateurs d'IA.