Débit d’inférence différent observé lors de l’exécution de la même architecture de modèle avec différents fichiers de poids. Bien que la structure du modèle soit identique, les performances d’inférence varient considérablement en fonction du poids, de la précision et de la représentation utilisée.
Les poids et la précision du modèle (FP32, FP16, INT8) affectent les performances d’inférence.
L’utilisation du format FP32 entraînerait la distribution complète du poids et est connue sous le nom de virgule flottante à précision unique.
Pendant ce temps, les formats FP16 et INT8 sont tous deux des formats de poids compressés où ils sont pressés pour être de plus petite taille. Le compromis pour ces compressions est la précision du modèle, également connue sous le nom d’erreur de quantification.
Plus le nombre de bits alloués pour représenter les données est élevé, plus la portée qu’ils peuvent représenter est large et, potentiellement, meilleure est la précision du modèle. Cependant, les données plus volumineuses nécessitent un espace mémoire plus important pour leur stockage, une bande passante mémoire plus élevée pour les transférer, et davantage de ressources de calcul et de temps utilisés.
Les résultats du test de performance Distribution Intel® du kit d'outils OpenVINO™ montrent des différences évidentes en termes de performances entre les différents formats de poids ou de précision.