Hyppää sisältöön

Puhdin ja Mahdin laskentapalvelut ovat poistuneet käytöstä. Puhdin ja Mahdin kirjautumisnoodit sekä tallennustila ovat saatavilla 15. lokakuuta 2026 asti, mutta ne eivät enää ole palvelusopimusten piirissä. Ryhdythän toimiin datan siirtämiseksi Roihuun välittömästi. Ohjeita löydät sivulta Roihun datan siirto-opas.

GTDB-Tk

GTDB-Tk on ohjelmistotyökalupakki objektiivisten taksonomisten luokitusten määrittämiseen bakteeri- ja arkeonigenomeille, mukaan lukien metagenomikootut genomit (MAG:t) ja yksittäisvahvistetut genomit (SAG:t). Luokitukset perustuvat Genome Taxonomy Databaseen (GTDB). classify_wf-työvuo tunnistaa markkerigeenit (Prodigal-geenikutsu, HMMER-markkerihaku), kohdistaa ne, seuloo kyselygenomit GTDB:n referenssigenomeja vastaan keskimääräisen nukleotidi-identtisyyden perusteella (skani) ja sijoittaa ne GTDB:n referenssipuuhun pplacerilla.

Lisenssi

Vapaasti käytettävissä ja avointa lähdekoodia GNU GPLv3 -lisenssillä.

Saatavuus

  • Roihu-CPU: 2.7.2, bio-apps-moduulin kautta.

Käyttö

GTDB-Tk on osa Roihun bio-apps -kokoelmaa. Lataa ensin bio-apps-moduulipuu ja sitten GTDB-Tk-moduuli:

module load bio-apps/v202603
module load py-gtdbtk/2.7.2

Luokittelukomennot suoritetaan gtdbtk-komennolla, esimerkiksi gtdbtk classify_wf.

Referenssidata

GTDB-Tk tarvitsee GTDB:n referenssidatapaketin (~100 GiB), joka vastaa työkalun versiota. Roihussa CSC tarjoaa tämän datan valmiiksi, ja moduuli asettaa GTDBTK_DATA_PATH-ympäristömuuttujan puolestasi — sinun ei tarvitse ladata tai määrittää mitään. GTDB-Tk 2.7.2 käyttää GTDB-julkaisua R232.

Voit tarkistaa polun moduulin lataamisen jälkeen komennolla:

echo $GTDBTK_DATA_PATH

Esimerkkieräajokomentosarja

classify_wf ottaa syötteeksi hakemiston, joka sisältää genomi-FASTA-tiedostoja. Oletusluokittelu (joka jakaa referenssipuun) tarvitsee noin 140 GiB muistia ja hyötyy monista ytimistä (katso GTDB-Tk:n laitteistovaatimukset).

#!/bin/bash
#SBATCH --job-name=gtdbtk
#SBATCH --account=<project>
#SBATCH --output=output_%j.txt
#SBATCH --error=errors_%j.txt
#SBATCH --partition=small
#SBATCH --time=12:00:00
#SBATCH --nodes=1
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=32
#SBATCH --mem=160G

module load bio-apps/v202603
module load py-gtdbtk/2.7.2

gtdbtk classify_wf \
    --genome_dir genomes/ \
    --extension fa \
    --out_dir gtdbtk_out \
    --cpus $SLURM_CPUS_PER_TASK

Korvaa <project> omalla CSC-projektillasi (esimerkiksi project_2001234).

  • --extension on syötegenomiesi tiedostopääte (fa, fasta, fna, …).
  • GTDB-Tk 2.7 seuloo kyselygenomit automaattisesti GTDB-edustajia vastaan skanilla; tätä vaihetta varten ei ole erillistä referenssitietokantaa ladattavaksi tai määritettäväksi.
  • pplacer-vaihe kuluttaa eniten muistia. Jos ajo loppuu muistin puutteeseen, lisää ensin --pplacer_cpus 1 (pienempi muistihuippu, hitaampi), ja kokeile sitten kasvattaa --mem-pyyntöäsi — small-osio voi tarjota enintään 1500 GiB. GTDB-Tk:n --scratch_dir-valitsinta, joka siirtää pplacerin varausta levylle, kannattaa Roihussa välttää: sen taustatiedosto on suunnilleen yhtä suuri kuin säästetty muisti (mikä tekee siitä todennäköisesti liian suuren $TMPDIR:lle), ja sen satunnainen, muistikartoitettu käyttömalli toimii heikosti Lustren /scratch-tiedostojärjestelmässä.

--full_tree-ajo (sijoittaminen täydelliseen, koristelemattomaan referenssipuuhun) vaatii noin 950 GiB muistia. Tämä mahtuu edelleen small-osion 1500 GiB:n ylärajaan; hugemem-osio on vaihtoehto. Oletusarvoista jaettua puuta käyttävää lähestymistapaa suositellaan lähes kaikkeen käyttöön.

Katso lisätietoja eräajojen suorittamisesta kohdasta eräajokomentosarjan luominen Roihulle.

Tuki

CSC:n Service Desk

Lisätietoja

Suomenkielinen tekoälykäännös

Sisällössä voi esiintyä virheellistä tietoa tekoälykäännöksestä johtuen.

Klikkaa tästä antaaksesi palautetta