Grille virtuelle de processus ´etendue

4.2 Mod`ele de distribution

4.2.3 Grille virtuelle de processus ´etendue

Un tableau ou un nid de boucles avec un nombre de dimensions supérieur ou égal à deux peut avoir une dimension distribuée avec une distribution diagonalisée en utilisant le mot clé diag. La distribution ainsi obtenue est dite multi-partitionnée, pour reprendre le vocabulaire utilisé dans l’implémentation de référence des benchmarks NAS BT et SP [11] pour ce type de distribution. Nous rappelons sur un exemple ce qu’est une distribution multi-partitionnée ainsi que son intérêt. Nous explicitons

ensuite la construction d’une grille virtuelle, que l’on qualifiera d’étendue, associée à un tableau ou un nid de boucle avec une distribution multi-partitionnée.

Contrainte du modèle. Une seule dimension d’un nid de boucles ou d’un tableau peut être diagonalisée.

Intérêt. Une distribution multi-partitionnée permet d’obtenir un meilleur équilibrage de charge pour des schémas d’accès à balayage. Il s’agit de tableaux multi-dimensionnels qui sont accédés par des nids de boucles avec au moins une dimension comportant une dépendance, imposant ainsi un ordre séquentiel sur cette dimension. Dans ce type de programmes, la dimension ordonnée change entre les différents nids de boucles successifs du programme.

Exemple. La figure 4.2 montre un exemple d’exécution d’un code effectuant un balayage par lignes d’un tableau 2-dimensionnel sur quatre processus. Si le tableau parcouru est distribué par lignes, alors il faudrait quatre étapes successives pour effectuer le calcul. Les différents niveaux de gris indiqués sur la figure montre ces différentes étapes, rappelant une vague avan¸cant par blocs de lignes. Dans ce cas, à chaque étape, un seul processus est actif et les trois autres sont inactifs, en attente des résultats des étapes précédentes. Il est ainsi clair que cette configuration résulte en une dégradation des performance de l’exécution parallèle.

Si en revanche on distribuait le tableau par blocs de colonnes alors le problème de la dépendance sur la première dimension ne se poserait plus et les calculs seraient effectués en une seule étape où tous les processus sont actifs. Mais si un nid de boucle suivant accède au même tableau avec une dépendance sur la deuxième dimension, alors le problème symétrique se poserait.

Une distribution 2-dimensionnelle ne résoudrait pas non plus le problème de l’équilibrage de charge car il y aurait deux étapes de calcul et pour chaque étape, la moitié des processus seraient inactifs.

Maintenant que nous avons rappelé le problème posé par ce type de schéma d’accès, nous verrons comment une distribution multi-partitionnée permet de régler le problème de l’équilibrage de charge. Dans notre exemple, si la deuxième dimension du tableau est distribuée avec un type diag, on obtient une distribution multi-partitionnée comme indiqué sur la figure 4.2. Les blocs du tableau A sont affectés aux différents processus suivant une diagonale (nous donnerons les détails de la construction d’une telle distribution dans les sections suivantes). Dans ce cas, on a toujours quatre étapes de calcul, mais la différence majeure avec les distributions précédentes est qu’à chaque étape de calcul, tous les processus sont actifs.

Remarque importante. La distribution multi-partitionnée, illustrée par l’exemple précédent, permet d’obtenir un meilleur équilibrage de charge, mais introduit des communications supplémentaires entre les différents blocs de données, qui sont plus nombreux que dans les autres exemples de distribution. Le gain effectif d’une telle distribution découle directement de la différence entre le gain en équilibrage de charge

et les surcoûts des communications induites, décrits dans le chapitre 7 sur le modèle de coût de dSTEP.

Figure _{4.2 – Illustration de la distribution multi-partitionn´ee sur un tableau 2-} dimensionnel

Une distribution multi-partitionnée est effectuée sur une grille de processus étendue, dont nous donnons la définition dans la section suivante.

Définition. Une grille virtuelle étendue de processus est définie par l’ensemble Pgrid

(´equation 4.5). Le vecteur ~˜pgrid est un identifiant de processus virtuel dans cette grille.

La matrice P , de dimension d, est une matrice diagonale contenant le nombre de processus selon chaque dimension. La matrice P est obtenue `a partir de la matrice P′

(équation 4.4) en l’étendant d’une dimension correspondant à la dimension diagona- lisée et en donnant comme valeur à cette dimension un nombre de processus virtuels correspondant au minimum du nombre de processus affectés aux autres dimensions, autres les dimensions répliquées.

Pk,k=

_P_′

k,k si k est non diagonalis´ee

M IN {P′

j,j, 0 ≤ j < d, j 6= k, j n’est pas r´epliqu´ee} sinon

(4.4)

Exemple. Le listing 4.3 montre l’utilisation de la directive dstep distribute pour indiquer que la deuxième dimension du tableau A est diagonalisée. Les différentes étapes permettant de construire la grille virtuelle de processus étendue pour cette distribution sont illustrées par la figure 4.3. Sur la grille virtuelle étendue, il y a seize identifiants de processus alors que l’on ne dispose réellement que de quatre processus. En effet, les processus affectés à la deuxième dimension de la grille, correspondant à la dimension diagonalisée, n’existent pas. Ils sont obtenus en associant vprocs processus virtuels à chaque processus réel. Dans l’exemple précédent, vprocs = 4.

Définition. Pour une grille virtuelle de processus, on définit : vprocs = Pk,k si une dimension k est diagonalisée,

1 sinon (4.6)

La matrice P a donc la propri´et´e suivante :

det(P ) = nb procs × vprocs 6= 0 (4.7)

1 # pragma dstep d i s t r i b u t e A (1: block :1 , 1: diag :1) 2 double A [ m ][ n ];

Listing 4.3 – Exemple d’un tableau distribué sur ses deux dimensions, avec une distribution diagonalisée sur la deuxième dimension

Définition. La fonction extend id (équation 4.8) associe vprocs identifiants de processus dans une grille virtuelle étendue à chaque identifiant de processus dans une grille virtuelle simple. L’ensemble V est défini par V = [0, vprocs[.

extend id : P′

grid× V → Pgrid

(~p′

grid, v) → (~p′grid+ v~1)modvP~1

(4.8) Exemple. La figure 4.4 montre les quatre processus virtuels associ´es au processus p = 1.

Th´eor`eme. 1. La fonction extend id est bijective.

La bijectivité de la fonction extend id permet de garantir que tous les processus virtuels peuvent être énumérés : chaque processus obtient son identifiant en interro- geant l’environnement d’exécution, et énumère les vprocs qui lui sont affectés grâce à la fonction extend id. Les grilles virtuelles étant les supports sur lesquels les nids de boucles et les tableaux sont distribués, cette propriété garantit que toutes les itérations et les éléments de tableaux distribués peuvent être visités (voir le chapitre compilation 5).

Figure _{4.3 – Construction d’une grille virtuelle ´etendue}

Démonstration. Si aucune dimension n’est diagonalisée, la fonction extend id est la fonction identité, qui est trivialement bijective. Sinon, soit k la dimension diagonalisée de la grille :

a) Soit (~p′

grid, v), (~q′grid, w) ∈ Pgrid′ × V avec (~p′grid, v) 6= (~q′grid, w)

On suppose que extend id(~p′

grid, v) = extend id(~q′grid, w)

=⇒ (~p′

grid+ v~1)modvP~1 = (~q′grid+ w~1)modvP~1

L’équation précédente exprime que les vecteurs (~p′

grid+ v~1) et (~q′grid+ w~1) ont le

mˆeme modulo, composante par composante, par le vecteur (P~1). Leur difference est donc forc´ement un multiple du vecteur (P~1), ce qui s’ecrit :

((~p′

grid+ v~1) − (~q′grid+ w~1))modvP~1 = ~0

=⇒ ((~p′

grid− ~q′grid) + (v − w)~1)modvP~1 = ~0

=⇒ ((~p′

grid(k) − ~q′grid(k)) + (v − w)) mod Pk,k = 0

Or, on a par d´efinition ~p′

grid(k) = ~q′grid(k) = 0,

ce qui implique que (v − w) mod Pk,k = 0, c’est-`a-dire que (v − w) = nPk,k, n ∈ Z

On a par ailleurs 0 ≤ v < Pk,k et 0 ≤ w < Pk,k, ce qui implique que −Pk,k <

v − w < Pk,k.

On en déduit que n ne peut être que nul, donc que v = w. On peut maintenant réécrire (~p′

grid− ~q′grid+ (v − w)~1)modvP~1 = ~0 en

(~p′

Figure _{4.4 – Illustration de la fonction extend id}

Soit une dimension k′_{, k}′ _{6= k,}

(~p′

grid− ~q′grid)modvP~1 = ~0 =⇒ (~p′grid(k′) − ~q′grid(k′)) mod Pk′,k′ = 0

=⇒ ~p′

grid(k′) − ~q′grid(k′) = nPk′,k′, n ∈ Z

On a par ailleurs 0 ≤ ~p′

grid(k′) < Pk′_,k′ et 0 ≤ ~q′_grid(k′) < P_k′_,k′, ce qui implique

que −Pk′_,k′ < ~p′_grid(k′) − ~q′_grid(k′) < P_k′_,k′,

On en d´eduit que n ne peut ˆetre que nul, donc que ~p′

grid(k′) = ~q′grid(k′) pour tout

k′_{, c’est `a dire que ~}_p′

grid = ~q′grid.

Le r´esultat v = w et ~p′

grid = ~q′grid est en contradiction avec notre hypoth`ese,

extend id est donc une injection.

b) On montre que extend id est une surjection, c’est-à-dire qu’il existe un antécédent (~p′

grid, v) ∈ Pgrid′ × V pour tout ´el´ement ~˜p ∈ Pgrid.

On vérifie facilement que l’élément (~p′

grid = (~˜pgrid+P~1− ˜p(k)~1)modvP~1, v = ~˜p(k))

est un antécédent de l’élément ~˜p ∈ Pgrid.

La fonction extend id est donc bien une bijection.

Remarque. Une grille virtuelle simple n’est qu’un cas particulier d’une grille virtuelle ´etendue dans laquelle vprocs = 1 et la fonction extend id est la fonction iden-

tit´e. Dans toute la suite, nous parlerons de grilles virtuelles de processus au sens large.

Dans le document Programmation haute performance pour architectures hybrides (Page 70-76)