01 / Définir les entrées de test
Pour l’inférence, précisez la révision du modèle, la précision, la longueur des entrées et sorties et les requêtes simultanées. Mesurez débit et latence ensemble à cette charge.
Pour l’entraînement, consignez taille des lots, longueur des séquences, optimiseur et intervalle des points de contrôle. Ces entrées déterminent la mémoire de travail et les communications ; le choix du GPU en découle.
02 / Calculer la mémoire des poids
Un modèle de 70 milliards de paramètres à deux octets par paramètre exige 140 Go pour les poids. À un octet : 70 Go ; à quatre bits : 35 Go. Ces estimations décimales précèdent métadonnées de quantification, cache KV, activations et tampons d’exécution.
Mesurez le pic mémoire au contexte et à la concurrence prévus. L’entraînement ajoute gradients et états de l’optimiseur selon la méthode.
Poids seuls, en Go décimaux. Ajoutez cache KV, activations, buffers et marge de fonctionnement avant de choisir une configuration.
03 / Distinguer GB300 et HGX B300
ILION exploite des clusters GB300 au Canada. La référence GB300 NVL72 de NVIDIA est une plateforme à l’échelle du rack comprenant 72 GPU et 36 CPU Grace Arm. Il s’agit de chiffres d’architecture du fabricant, pas de l’inventaire ILION.
Le Supermicro SYS-822GS-NB3RT utilise une plateforme HGX B300 à huit GPU. Qualifiez architecture hôte, logiciels et topologie GPU-NIC pour le système choisi.
04 / Vérifier mémoire et édition
H200 fournit une référence de 141 Go de HBM3e ; RTX PRO 6000 Blackwell Server Edition, 96 Go de GDDR7 ECC. Bande passante, interconnexion, graphisme et licences diffèrent. Le cahier des charges de Tokyo identifie la configuration exacte des cartes RTX PRO 6000.
Plusieurs GPU exigent une stratégie compatible de partitionnement ou de parallélisme ; la somme des capacités mémoire ne suffit pas à établir la compatibilité applicative.
05 / Conserver des résultats comparables
Conservez les mêmes révision de modèle, précision, longueurs d’entrée, concurrence et versions logicielles entre plateformes. Enregistrez délai du premier token, latence entre tokens, débit total et pic mémoire d’un même essai.
Pour l’entraînement, retenez durée des étapes et résultats de sauvegarde/reprise. Le choix final documente configuration, résultats observés et limites de recette convenues.
Exemple / poids d’un modèle 70B
| Précision | Calcul | Poids seuls |
|---|---|---|
| BF16 / FP16 | 70B × 2 bytes | 140 GB |
| INT8 | 70B × 1 byte | 70 GB |
| 4-bit | 70B × 0.5 byte | 35 GB |
Go décimaux. Hors métadonnées de quantification, cache KV, activations, états optimiseur et mémoire d’exécution. Le multi-GPU exige une stratégie de partition compatible.
- Modèle + précision + contexte + concurrence
- Édition GPU + topologie + versions logicielles
- Test représentatif + critères + preuves