01 / Definir las entradas de prueba

Para inferencia, especifique revisión del modelo, precisión, longitud de entrada y salida y solicitudes simultáneas. Mida rendimiento y latencia juntos con esa carga.

Para entrenamiento, registre tamaño de lote, longitud de secuencia, optimizador e intervalo de puntos de control. Estas entradas determinan la memoria de trabajo y las comunicaciones; después se elige la GPU.

02 / Calcular la memoria de los pesos

Un modelo de 70 mil millones de parámetros a dos bytes por parámetro requiere 140 GB de pesos. A un byte requiere 70 GB; a cuatro bits, 35 GB. Son estimaciones decimales previas a metadatos de cuantización, caché KV, activaciones y búferes de ejecución.

Mida la memoria máxima con el contexto y la concurrencia previstos. El entrenamiento añade gradientes y estados del optimizador según el método.

MEMORIA DE PESOS / ESTIMACIÓN
140 GB

Solo pesos, en GB decimales. Añada caché KV, activaciones, buffers y margen operativo antes de elegir una configuración.

03 / Distinguir GB300 de HGX B300

ILION opera clústeres GB300 en Canadá. La referencia GB300 NVL72 de NVIDIA es una plataforma de rack con 72 GPU y 36 CPU Grace Arm. Son cifras de arquitectura del fabricante, no totales del inventario de ILION.

El Supermicro SYS-822GS-NB3RT utiliza HGX B300 de ocho GPU. Valide arquitectura del host, paquetes de software y topología GPU-NIC del sistema elegido.

04 / Revisar memoria y edición

H200 ofrece una referencia de 141 GB HBM3e; RTX PRO 6000 Blackwell Server Edition, 96 GB GDDR7 ECC. Difieren el ancho de banda, la interconexión, los gráficos y las licencias. La especificación del proyecto en Tokio identifica la configuración exacta de las tarjetas RTX PRO 6000.

Varias GPU requieren una estrategia compatible de partición o paralelismo; sumar sus capacidades no demuestra que la aplicación encaje.

05 / Conservar resultados comparables

Mantenga idénticos revisión del modelo, precisión, longitudes de entrada, concurrencia y versiones de software al comparar plataformas. Guarde tiempo al primer token, latencia entre tokens, rendimiento total y memoria máxima de la misma ejecución.

Para entrenamiento, conserve tiempo por paso y resultados de guardado/reinicio. La selección final registra configuración, resultados observados y límites de aceptación acordados.

Ejemplo / pesos de un modelo 70B

PrecisiónCálculoSolo pesos
BF16 / FP1670B × 2 bytes140 GB
INT870B × 1 byte70 GB
4-bit70B × 0.5 byte35 GB

GB decimales. Excluye metadatos de cuantización, caché KV, activaciones, estados del optimizador y memoria de ejecución. Varios GPU requieren partición compatible.

Lista del proyecto
  • Modelo + precisión + contexto + concurrencia
  • Edición GPU + topología + versiones
  • Prueba representativa + criterios + evidencias
Referencias primarias