-
Mahti
Mahtin tekniset tiedot
Mahtin käytöstäpoisto syksyllä 2026
Mahti poistetaan käytöstä vaiheittain, ja sen korvaa Roihu, CSC:n seuraavan sukupolven supertietokone, joka tarjoaa paremman suorituskyvyn ja laajemmat ominaisuudet.
Mahtin laskentapalvelut suljettiin 31. elokuuta 2026. Tallennuspalveluiden ja kirjautumissolmujen on suunniteltu olevan käytettävissä 15. lokakuuta 2026 puoleenpäivään asti, mutta käyttäjiä kehotetaan vahvasti siirtämään kaikki tarvitsemansa data järjestelmästä viipymättä.
Laskentasolmut
Mahtissa oli yhteensä 1404 CPU-solmua ja 24 GPU-solmua. Teoreettinen huippusuorituskyky on CPU-solmuille 7,5 petaflopsia ja GPU-solmuille 2,0 petaflopsia, yhteensä 9,5 petaflopsia.
Sekä CPU- että GPU-solmuissa oli kaksi AMD Rome 7H12 -suoritinta, joissa kummassakin oli 64 ydintä, joten ytimien kokonaismäärä oli noin 180 000. Suorittimet perustuivat AMD Zen 2 -arkkitehtuuriin, tukivat AVX2-vektorikäskykantaa ja toimivat 2,6 GHz:n perustaajuudella (maksimiboosti enintään 3,3 GHz). Suorittimet tukivat samanaikaista monisäikeistystä (SMT), jossa kukin ydin voi ajaa kahta laitesäiettä. Kun SMT on käytössä, säikeiden kokonaismäärä solmua kohden on 256 säiettä.
CPU-solmut oli varustettu 256 Gt:n muistilla, eikä valtaosassa ollut paikallisia levyjä. Yhteensä 60 solmua oli varustettu paikallisella 3,8 Tt:n NVMe-asemalla.
GPU-solmut oli varustettu 512 Gt:n muistilla ja paikallisella 3,8 Tt:n NVMe-asemalla. Niissä oli myös neljä Nvidia Ampere A100 -GPU:ta.
NUMA-kokoonpano
Mahti-solmussa oli hyvin hierarkkinen rakenne. Solmussa oli kaksi kantaa, joista kumpikin sisälsi yhden suorittimen ja muistin DIMM-moduulit. Kaikki solmun sisäinen muisti oli jaettua, mutta muistin suorituskyky riippui ytimen etäisyydestä muistiin. Hieman paremman muistisuorituskyvyn tarjoamiseksi ajoimme kumpaakin suoritinta NPS4-tilassa (NUMA per socket 4), joka jakoi edelleen kummankin suorittimen 4 NUMA-alueeseen. Kussakin NUMA-alueessa oli 16 ydintä ja kaksi muistiohjainta sekä yhteensä 32 GiB muistia. Ydin 0 ajoi säikeitä 0 ja 128, ydin 1 säikeitä 1 ja 129 ja niin edelleen. Alla oleva kuva näyttää, miten säikeet jakautuivat ytimille ja NUMA-solmuille.

Ytimet, ydinryhmät ja laskentapiirit
Suorittimen perusrakenneosa on ydin, jotka ryhmitellään ydinryhmiksi (CCX) ja edelleen laskentapiireiksi (CCD).
Kussakin ytimessä on 32 KiB L1-datavälimuistia ja 32 KiB L1-käskyvälimuistia. Myös L2-välimuisti on yksityinen kullekin ytimelle, ja jokaisessa ytimessä on 512 KiB L2-välimuistia. Jokaisessa ytimessä on kaksi FMA-yksikköä (fused multiply add), jotka toimivat täysillä 256-bittisillä vektoreilla. Tämä tarkoittaa, että kumpikin yksikkö voi suorittaa jokaisella kellosyklillä operaatioita 8 yksittäistarkkuuden liukuluvulla tai 4 kaksinkertaisen tarkkuuden liukuluvulla. Näin ollen parhaimmillaan 2 (kertolasku+yhteenlasku) x 2 (kaksi yksikköä) x 4 (vektorin leveys) = 16 kaksinkertaisen tarkkuuden liukulukutoimitusta sykliä kohden.
Ydintä ylemmällä tasolla 4 ydintä ryhmitellään yhdeksi ydinryhmäksi (CCX), ja CCX:n sisällä ytimet jakavat saman 16 MiB:n L3-välimuistin. Kaksi tällaista CCX-osaa yhdistetään sitten muodostamaan laskentapiiri (CCD).

Kukin suoritin koostuu 8 laskentapiiristä sekä erillisestä I/O-piiristä, jossa sijaitsevat muistiohjaimet ja PCI-e-ohjain. Kukin solmu koostuu sitten kahdesta tällaisesta suorittimesta ja yhdestä 200 gbit HDR -verkkosovittimesta.

Jos haluat syvällisemmän kuvauksen Zen 2 -ytimestä, voit lukea lisää siitä WikiChipissä
Verkko
Yhdysverkko perustuu Mellanox HDR InfiniBandiin, ja kukin solmu on kytketty verkkoon yhdellä 200 Gbps HDR -linkillä. Verkon topologia on dragonfly+-topologia. Topologia koostuu useista solmuryhmistä, joista kukin on sisäisesti yhdistetty fat tree -topologialla, ja nämä fat tree -rakenteet on sitten yhdistetty toisiinsa all-to-all-linkeillä.

Mahtissa kussakin dragonfly-ryhmässä oli 234 solmua, ja sisäisen fat tree -rakenteen ylivarauskerroin oli 1,7:1. Kullekin lehtikytkimelle oli kytketty 20 tai 18 solmua, ja jokaisella lehtikytkimellä oli 12 linkkiä ryhmän runkokytkimeen. Kaikki linkit olivat 200 Gbps:n linkkejä. Ryhmiä oli yhteensä 6, ja ryhmien välillä oli täysin estoton all-to-all-yhteys siten, että kustakin runkokytkimestä meni 5 kappaletta 200 Gbps:n linkkejä yhteen runkokytkimeen jokaisessa muussa ryhmässä.

Tallennus
Mahtissa on 8,7 PB:n Lustre-rinnakkaistallennusjärjestelmä, joka tarjoaa tilaa home-, project- ja scratch-tallennusalueille.
Mahtin nykyinen Lustre-kokoonpano on:
| Storage area | # OSTs | # MDTs |
|---|---|---|
| home | 8 | 1 |
| projappl | 8 | 1 |
| scratch | 24 | 2 |
Katso terminologia kohdasta Lustre-dokumentaatio.
Mahtin scratch voi tarjota paremman suorituskyvyn kuin muut tallennusalueet,
jos sovelluksesi ja datan koko ovat riittävän suuria, koska siinä on enemmän
OST- ja MDT-kohteita.
Mahtin I/O:n huippusuorituskyky on noin 100 GB/s kirjoituksessa ja 115 GB/s lukemisessa. Tämä suorituskyky saavutettiin kuitenkin erillisessä järjestelmässä, jossa oli 64 laskentasolmua, mikä tarkoittaa noin 1,5 GB/s laskentasolmua kohden. Jos käytetään enemmän solmuja tai monet työt tekevät merkittävästi I/O:ta, ei 1,5 GB/s:n suorituskykyyn päästä. Näin on myös silloin, jos sovelluksen I/O-malli ei ole tehokas.