01 / Conciliar la configuración entregada

Compare cada sistema con la lista de materiales aceptada: chasis, edición y cantidad de GPU, CPU, DIMM, discos, NIC y firmware. Adjunte números de serie y resuelva sustituciones antes de probar.

Para cómputo alquilado, documente recursos asignados, aislamiento y límites de acceso. Este inventario es la referencia de todos los resultados posteriores.

02 / Fijar la base de software

Registre imagen del sistema, controlador, CUDA, framework, resumen del contenedor y configuración de aplicación. Incluya política de potencia GPU, ajustes de red y trabajos que compartían el sistema.

Conserve comandos y archivos de entrada. Un resultado solo es reproducible si se pueden reconstruir entorno y entradas.

03 / Probar red y aplicación por separado

Una prueba de comunicación colectiva registra nodos, rangos GPU, tamaños de mensajes, asignación NIC y versión exacta de prueba. Separe medidas dentro y entre nodos. Después ejecute la aplicación con modelo, entradas y concurrencia acordados.

Conserve ambos registros originales. La velocidad de puerto, el ancho de banda colectivo y el rendimiento de aplicación describen partes distintas del sistema.

04 / Ejecutar reinicio y recuperación

Acuerde la duración y registre temperaturas, limitaciones térmicas, errores de hardware y fallos de tareas. Guarde un punto de control en el almacenamiento previsto, detenga la carga de prueba y restáurela. Verifique estado recuperado e integridad de datos.

Toda prueba disruptiva requiere alcance, procedimiento de reversión y ventana de mantenimiento aprobada.

05 / Cerrar el registro de aceptación

Para cada prueba, conserve criterio, resultado observado, ubicación de evidencias, excepción y responsable. Cierre fallos con una nueva prueba o una excepción aceptada expresamente.

La entrega identifica configuración aceptada, responsable operativo y vía de escalado. Los objetivos de disponibilidad y respuesta del soporte figuran en el acuerdo de servicio.

Aceptación / evidencias mínimas

PruebaRegistroDecisión
InventarioSeries, componentes, mapa GPU/NICResolver sustituciones
GPU / fabricRegistros, versión NCCL, tamaños y rangosComparar topología acordada
AplicaciónModelo, precisión, entrada, concurrencia, latencia p95Aplicar criterios de carga
RecuperaciónCheckpoint, interrupción, restauración, integridadCerrar incidencias antes de aprobar

Acordar umbrales y duración antes de probar. Conservar fallos y repeticiones junto al resultado final.

Lista del proyecto
  • Inventario y versiones base
  • Evidencia de red + aplicación + recuperación
  • Excepciones, responsable y soporte
Referencias primarias