-
Saatavilla olevat erätyöjonot
Käytettävissä olevat eräajopartiot
CSC:n supertietokoneilla ohjelmia ajetaan lähettämällä ne partitioihin, jotka ovat Slurm-kuormanhallinnan hallinnoimia loogisia joukkioita laskentasolmuja. Tällä sivulla luetellaan käytettävissä olevat Slurm-partitiot Roihu-, Puhti- ja Mahti-supertietokoneilla ja selitetään niiden käyttötarkoitukset. Alla ovat yleiset ohjeet Slurm-partitioiden käyttöön järjestelmissämme:
- Käytä
test- jagputest-partitioita koodisi testaamiseen, älä tuotantoon. Nämä partitiot tarjoavat vähemmän resursseja kuin muut partitiot, mutta niihin lähetetyillä töillä on korkeampi prioriteetti, joten ne saavat resursseja ennen muita töitä. - Pyydä useita CPU-ytimiä vain, jos tiedät ohjelmasi tukevan rinnakkaisajoa. Useiden ytimien varaaminen ei automaattisesti nopeuta työtäsi. Ohjelmasi on oltava kirjoitettu siten, että laskenta voidaan suorittaa useissa säikeissä tai prosesseissa. Useampien ytimien varaaminen ei itsessään tee mitään, jos koodiasi ei ole rinnakkaistettu, paitsi että joudut jonottamaan pidempään.
- Käytä GPU-partitioita vain, jos tiedät ohjelmasi osaavan hyödyntää GPU:ita. Laskennan suorittaminen yhdellä tai useammalla GPU:lla on erittäin tehokas rinnakkaistamismenetelmä tietyissä sovelluksissa, mutta ohjelmasi on oltava määritetty käyttämään CUDA-alustaa. Jos et ole varma, onko näin, on parempi lähettää työsi CPU-partitioon, koska silloin sinulle osoitetaan resursseja nopeammin. Jos olet epävarma, ota yhteyttä CSC:n Service Deskiin.
Seuraavia komentoja voidaan käyttää näyttämään tietoja käytettävissä olevista partitioista:
LUMI-partitiot
Käytettävissä olevat LUMIn eräajopartiot löytyvät [LUMI-dokumentaatiosta].
Roihun partitiot
Roihun partitioissa käytetään erilaisia allokaatiotyyppejä, jotka soveltuvat erilaisiin käyttötapauksiin ja resurssivaatimuksiin. Ne on selitetty alla olevassa taulukossa.
| Allokaatiotyyppi | Resurssipyyntö |
|---|---|
| R | Muisti- ja CPU-resursseja voidaan muuttaa toisistaan riippumatta |
| N | Vain kokonaisia solmuja koskevat pyynnöt |
| C | Muistiallokaatio on kiinteä pyydettyjen CPU-ytimien määrän perusteella |
| G | CPU- ja muistiallokaatio on kiinteä pyydettyjen GPU:iden määrän perusteella |
Roihun CPU-partitiot
Roihu tarjoaa seuraavat partitiot töiden lähettämiseen CPU-solmuille:
| Partition | Allocation type | Time limit | Nodes | Max CPUs | Node types | Max memory | Requirements |
|---|---|---|---|---|---|---|---|
test |
R | 15 minutes | 1 - 2 | 384 per node | M | 744 GiB per node | |
small |
R | 72 hours | 1 | 384 per job | M, L | 1500 GiB per job | |
medium |
N | 36 hours | 1 - 6 | 384 per node | M | 744 GiB per node | |
large |
N | 36 hours | 6 - 60 | 384 per node | M | 744 GiB per node | scalability test |
longrun |
R | 10 days | 1 | 192 per job | M, L | 1500 GiB per job | |
hugemem |
C | 36 hours | 1 | 128 per job | XL | 6037 GiB per job | |
hugemem_longrun |
C | 10 days | 1 | 128 per job | XL | 6037 GiB per job |
Roihun GPU-partitiot
Roihu tarjoaa seuraavat partitiot töiden lähettämiseen GPU-solmuille:
| Partition | Allocation type | Time limit | Nodes | Min GPUs | Max GPUs | Node types | Max memory | Requirements |
|---|---|---|---|---|---|---|---|---|
gputest |
G | 15 minutes | 1 - 2 | 1 | 4 per node | GPU | 217 GiB per reserved GPU | |
gpumedium |
G | 36 hours | 1 - 4 | 1 | 4 per job | GPU | 217 GiB per reserved GPU | |
gpularge |
G | 36 hours | 1 - 10 | 4 | 4 per node | GPU | 217 GiB per reserved GPU | scalability test |
Jokaisessa täydellisessä GPU-solmussa on 4 GH200-GPU:ta. Jokainen varattu GPU antaa käyttöön enintään 72 CPU-ydintä sekä 95 GiB HBM3-muistia + 122 GiB LPDDR5-muistia, yhteensä 217 G käytettävissä olevaa muistia varattua GPU:ta kohden.
Tässä luetellut muistimäärät ovat töille allokoitavissa olevia määriä; osa muistista on varattu järjestelmän käyttöön.
Roihun interaktiiviset partitiot
Roihussa on useita interaktiiviseen käyttöön ja datan visualisointiin varattuja partitioita.
Roihu-CPU:n interaktiivinen käyttö
Roihun interactive-partitio mahdollistaa
interaktiivisten töiden ajamisen CPU-solmuilla sinteractive-komennolla.
sinteractive-komento valitsee oikean partition resurssipyyntösi perusteella
ja tarjoaa automaattisesti Roihu-CPU-resursseja, kun sitä ajetaan Roihu-CPU-kirjautumissolmulta.
| Partition | Allocation type | Time limit | Nodes | Max CPUs | Node types | Max memory |
|---|---|---|---|---|---|---|
interactive |
R | 36 hours | 1 | 32 per job | M | 64 GiB per job |
Roihu-GPU:n interaktiivinen käyttö
Roihun gpuinteractive-partitio mahdollistaa
interaktiivisten töiden ajamisen GPU-solmuilla sinteractive-komennolla.
sinteractive-komento valitsee oikean partition resurssipyyntösi perusteella
ja tarjoaa automaattisesti GPU-siivun, kun sitä ajetaan Roihu-GPU-kirjautumissolmulta.
| Partition | Allocation type | Time limit | Nodes | Max CPUs | Max GPU slices | Node types |
|---|---|---|---|---|---|---|
gpuinteractive |
G | 12 hours | 1 | TBA | TBA | GPU (slice) |
Mikä on GPU-siivu?
Roihun gpuinteractive-partitio koostuu kahdesta solmusta, joista kummassakin on neljä GH200-GPU:ta. Jokainen GPU voidaan jakaa enintään seitsemään 1g.12gb MIG-siivuun, jolloin partitiossa on yhteensä enintään 56 GPU-siivua. Kukin siivu tarjoaa yhden seitsemäsosan GPU:n laskentakapasiteetista ja yhden kahdeksasosan täyden GH200-GPU:n muistista (12 GiB).
GPU-siivuja ei ole vielä täysin konfiguroitu
GPU-siivuja ei ole vielä konfiguroitu järjestelmään, ja GPU:iden varaaminen sinteractive-komennolla tai Slurmin kautta tässä partitiossa
antaa sen sijaan käyttöön täydet GPU:t.
Vizinteractive
Roihussa on myös seuraava interaktiiviseen käyttöön ja datan visualisointiin erikoistuneella laitteistolla tarkoitettu partitio:
| Partition | Allocation type | Time limit | Nodes | Max GPUs | Node types |
|---|---|---|---|---|---|
vizinteractive |
G | 12 hours | 1 | 2 per job | V |
Jokaisessa partition solmussa on 2 Nvidia L40 -GPU:ta, joissa on 48 GB muistia, sekä kaksi 32-ytimistä AMD Turin 9335 -CPU:ta. Jokainen varattu GPU antaa käyttöön enintään 32 CPU-ydintä ja 183 GiB CPU-muistia.
Paikallinen tallennustila Roihun solmuilla
Paikallinen tallennustila Roihun M-, L- ja GPU-solmuilla on tarkoitettu vain väliaikaisten tiedostojen tallentamiseen, ei korkean suorituskyvyn I/O:hon.
Korkean suorituskyvyn paikallista tallennustilaa on saatavilla Roihun XL- ja V-solmuilla, mikä on ihanteellista I/O-intensiivisille töille.
Solmukohtaista paikallista tallennustilaa on kahdenlaista: automaattinen väliaikaistallennus
($TMPDIR), joka on käytettävissä jokaisessa työssä ilman varausta ja maksutta,
sekä varattava paikallinen scratch-tila ($LOCAL_SCRATCH), joka on käytettävissä vain
XL- ja V-solmuilla, varataan Slurmin kautta --gres=nvme-valinnalla
ja kuluttaa laskutusyksiköitä (BUs).
Yhden käyttäjän käytettävissä olevan paikallisen tallennustilan määrä riippuu käytetystä partitiosta:
| Allocation type | Available per user | Read / Write speeds |
|---|---|---|
| R (shared nodes) | 20 GiB | 5000 / 1400 MB/s |
| N (full nodes) | 600 GiB | 5000 / 1400 MB/s |
| G (GPU nodes) | 150 GiB | 5000 / 1400 MB/s |
| Hugemem (XL) nodes | 578 GiB | 6700 / 4000 MB/s |
| V (visualization nodes) | 14 TiB | 6700 / 4000 MB/s |
Varattavaa paikallista scratch-tilaa ei ole vielä toteutettu visualisointisolmuilla (V).
Kunnes se on saatavilla, näillä solmuilla ajettavat työt voivat käyttää yllä esitettyä koko $TMPDIR-allokaatiota.
Kun varattava paikallinen scratch-tila on toteutettu, käyttäjäkohtaisen $TMPDIR-tilan määrää visualisointisolmuilla pienennetään.
| Node type | Maximum reservable | Read / Write speeds |
|---|---|---|
| Hugemem (XL) nodes | 13 TiB | 6700 / 4000 MB/s |
| V (visualization nodes) | 6.5 TiB per user | 6700 / 4000 MB/s |
Paikallisen scratch-tilan varaamista visualisointisolmuilla ei ole vielä
toteutettu; käytä näillä solmuilla $TMPDIR-hakemistoa, kunnes tämä ominaisuus lisätään.
Lue lisää: Paikallinen tallennustila Roihun solmuilla