01 / Définir les entrées de test

Pour l’inférence, précisez la révision du modèle, la précision, la longueur des entrées et sorties et les requêtes simultanées. Mesurez débit et latence ensemble à cette charge.

Pour l’entraînement, consignez taille des lots, longueur des séquences, optimiseur et intervalle des points de contrôle. Ces entrées déterminent la mémoire de travail et les communications ; le choix du GPU en découle.

02 / Calculer la mémoire des poids

Un modèle de 70 milliards de paramètres à deux octets par paramètre exige 140 Go pour les poids. À un octet : 70 Go ; à quatre bits : 35 Go. Ces estimations décimales précèdent métadonnées de quantification, cache KV, activations et tampons d’exécution.

Mesurez le pic mémoire au contexte et à la concurrence prévus. L’entraînement ajoute gradients et états de l’optimiseur selon la méthode.

MÉMOIRE DES POIDS / ESTIMATION
140 GB

Poids seuls, en Go décimaux. Ajoutez cache KV, activations, buffers et marge de fonctionnement avant de choisir une configuration.

03 / Distinguer GB300 et HGX B300

ILION exploite des clusters GB300 au Canada. La référence GB300 NVL72 de NVIDIA est une plateforme à l’échelle du rack comprenant 72 GPU et 36 CPU Grace Arm. Il s’agit de chiffres d’architecture du fabricant, pas de l’inventaire ILION.

Le Supermicro SYS-822GS-NB3RT utilise une plateforme HGX B300 à huit GPU. Qualifiez architecture hôte, logiciels et topologie GPU-NIC pour le système choisi.

04 / Vérifier mémoire et édition

H200 fournit une référence de 141 Go de HBM3e ; RTX PRO 6000 Blackwell Server Edition, 96 Go de GDDR7 ECC. Bande passante, interconnexion, graphisme et licences diffèrent. Le cahier des charges de Tokyo identifie la configuration exacte des cartes RTX PRO 6000.

Plusieurs GPU exigent une stratégie compatible de partitionnement ou de parallélisme ; la somme des capacités mémoire ne suffit pas à établir la compatibilité applicative.

05 / Conserver des résultats comparables

Conservez les mêmes révision de modèle, précision, longueurs d’entrée, concurrence et versions logicielles entre plateformes. Enregistrez délai du premier token, latence entre tokens, débit total et pic mémoire d’un même essai.

Pour l’entraînement, retenez durée des étapes et résultats de sauvegarde/reprise. Le choix final documente configuration, résultats observés et limites de recette convenues.

Exemple / poids d’un modèle 70B

PrécisionCalculPoids seuls
BF16 / FP1670B × 2 bytes140 GB
INT870B × 1 byte70 GB
4-bit70B × 0.5 byte35 GB

Go décimaux. Hors métadonnées de quantification, cache KV, activations, états optimiseur et mémoire d’exécution. Le multi-GPU exige une stratégie de partition compatible.

Liste de contrôle
  • Modèle + précision + contexte + concurrence
  • Édition GPU + topologie + versions logicielles
  • Test représentatif + critères + preuves
Références primaires