01 / Definir las entradas de prueba
Para inferencia, especifique revisión del modelo, precisión, longitud de entrada y salida y solicitudes simultáneas. Mida rendimiento y latencia juntos con esa carga.
Para entrenamiento, registre tamaño de lote, longitud de secuencia, optimizador e intervalo de puntos de control. Estas entradas determinan la memoria de trabajo y las comunicaciones; después se elige la GPU.
02 / Calcular la memoria de los pesos
Un modelo de 70 mil millones de parámetros a dos bytes por parámetro requiere 140 GB de pesos. A un byte requiere 70 GB; a cuatro bits, 35 GB. Son estimaciones decimales previas a metadatos de cuantización, caché KV, activaciones y búferes de ejecución.
Mida la memoria máxima con el contexto y la concurrencia previstos. El entrenamiento añade gradientes y estados del optimizador según el método.
Solo pesos, en GB decimales. Añada caché KV, activaciones, buffers y margen operativo antes de elegir una configuración.
03 / Distinguir GB300 de HGX B300
ILION opera clústeres GB300 en Canadá. La referencia GB300 NVL72 de NVIDIA es una plataforma de rack con 72 GPU y 36 CPU Grace Arm. Son cifras de arquitectura del fabricante, no totales del inventario de ILION.
El Supermicro SYS-822GS-NB3RT utiliza HGX B300 de ocho GPU. Valide arquitectura del host, paquetes de software y topología GPU-NIC del sistema elegido.
04 / Revisar memoria y edición
H200 ofrece una referencia de 141 GB HBM3e; RTX PRO 6000 Blackwell Server Edition, 96 GB GDDR7 ECC. Difieren el ancho de banda, la interconexión, los gráficos y las licencias. La especificación del proyecto en Tokio identifica la configuración exacta de las tarjetas RTX PRO 6000.
Varias GPU requieren una estrategia compatible de partición o paralelismo; sumar sus capacidades no demuestra que la aplicación encaje.
05 / Conservar resultados comparables
Mantenga idénticos revisión del modelo, precisión, longitudes de entrada, concurrencia y versiones de software al comparar plataformas. Guarde tiempo al primer token, latencia entre tokens, rendimiento total y memoria máxima de la misma ejecución.
Para entrenamiento, conserve tiempo por paso y resultados de guardado/reinicio. La selección final registra configuración, resultados observados y límites de aceptación acordados.
Ejemplo / pesos de un modelo 70B
| Precisión | Cálculo | Solo pesos |
|---|---|---|
| BF16 / FP16 | 70B × 2 bytes | 140 GB |
| INT8 | 70B × 1 byte | 70 GB |
| 4-bit | 70B × 0.5 byte | 35 GB |
GB decimales. Excluye metadatos de cuantización, caché KV, activaciones, estados del optimizador y memoria de ejecución. Varios GPU requieren partición compatible.
- Modelo + precisión + contexto + concurrencia
- Edición GPU + topología + versiones
- Prueba representativa + criterios + evidencias