01 / Conciliar la configuración entregada
Compare cada sistema con la lista de materiales aceptada: chasis, edición y cantidad de GPU, CPU, DIMM, discos, NIC y firmware. Adjunte números de serie y resuelva sustituciones antes de probar.
Para cómputo alquilado, documente recursos asignados, aislamiento y límites de acceso. Este inventario es la referencia de todos los resultados posteriores.
02 / Fijar la base de software
Registre imagen del sistema, controlador, CUDA, framework, resumen del contenedor y configuración de aplicación. Incluya política de potencia GPU, ajustes de red y trabajos que compartían el sistema.
Conserve comandos y archivos de entrada. Un resultado solo es reproducible si se pueden reconstruir entorno y entradas.
03 / Probar red y aplicación por separado
Una prueba de comunicación colectiva registra nodos, rangos GPU, tamaños de mensajes, asignación NIC y versión exacta de prueba. Separe medidas dentro y entre nodos. Después ejecute la aplicación con modelo, entradas y concurrencia acordados.
Conserve ambos registros originales. La velocidad de puerto, el ancho de banda colectivo y el rendimiento de aplicación describen partes distintas del sistema.
04 / Ejecutar reinicio y recuperación
Acuerde la duración y registre temperaturas, limitaciones térmicas, errores de hardware y fallos de tareas. Guarde un punto de control en el almacenamiento previsto, detenga la carga de prueba y restáurela. Verifique estado recuperado e integridad de datos.
Toda prueba disruptiva requiere alcance, procedimiento de reversión y ventana de mantenimiento aprobada.
05 / Cerrar el registro de aceptación
Para cada prueba, conserve criterio, resultado observado, ubicación de evidencias, excepción y responsable. Cierre fallos con una nueva prueba o una excepción aceptada expresamente.
La entrega identifica configuración aceptada, responsable operativo y vía de escalado. Los objetivos de disponibilidad y respuesta del soporte figuran en el acuerdo de servicio.
Aceptación / evidencias mínimas
| Prueba | Registro | Decisión |
|---|---|---|
| Inventario | Series, componentes, mapa GPU/NIC | Resolver sustituciones |
| GPU / fabric | Registros, versión NCCL, tamaños y rangos | Comparar topología acordada |
| Aplicación | Modelo, precisión, entrada, concurrencia, latencia p95 | Aplicar criterios de carga |
| Recuperación | Checkpoint, interrupción, restauración, integridad | Cerrar incidencias antes de aprobar |
Acordar umbrales y duración antes de probar. Conservar fallos y repeticiones junto al resultado final.
- Inventario y versiones base
- Evidencia de red + aplicación + recuperación
- Excepciones, responsable y soporte