Un entorno de inferencia dedicado
Definir modelo, precisión, contexto y concurrencia. Dimensionar pesos y caché KV y alinear las conexiones GPU y de red con la arquitectura.
Entrega: manifiesto de software, topología, accesos, registros de rendimiento y latencia p95, checkpoints y reinicio.