Hyppää sisältöön

Docs CSC now features an automatic Finnish translation. Click here for more information.

Warning!

Puhti and Mahti computing services have been decommissioned and no new jobs are accepted or executed on its compute nodes. Puhti and Mahti login nodes and storage services are planned to remain available until 15 October 2026. Clean up unnecessary files and move any data you need to keep by 31 August 2026. See the Roihu data migration guide for instructions on transferring your data to Roihu.

GTDB-Tk

GTDB-Tk on ohjelmistotyökalupakki objektiivisten taksonomisten luokitusten määrittämiseen bakteeri- ja arkeonigenomeille, mukaan lukien metagenomikootut genomit (MAG:t) ja yksittäisvahvistetut genomit (SAG:t). Luokitukset perustuvat Genome Taxonomy Databaseen (GTDB). classify_wf-työvuo tunnistaa markkerigeenit (Prodigal-geenikutsu, HMMER-markkerihaku), kohdistaa ne, seuloo kyselygenomit GTDB:n referenssigenomeja vastaan keskimääräisen nukleotidi-identtisyyden perusteella (skani) ja sijoittaa ne GTDB:n referenssipuuhun pplacerilla.

Lisenssi

Vapaasti käytettävissä ja avointa lähdekoodia GNU GPLv3 -lisenssillä.

Saatavuus

  • Roihu-CPU: 2.7.2, bio-apps-moduulin kautta.

Käyttö

GTDB-Tk on osa Roihun bio-apps -kokoelmaa. Lataa ensin bio-apps-moduulipuu ja sitten GTDB-Tk-moduuli:

module load bio-apps/v202603
module load py-gtdbtk/2.7.2

Luokittelukomennot suoritetaan gtdbtk-komennolla, esimerkiksi gtdbtk classify_wf.

Referenssidata

GTDB-Tk tarvitsee GTDB:n referenssidatapaketin (~100 GiB), joka vastaa työkalun versiota. Roihussa CSC tarjoaa tämän datan valmiiksi, ja moduuli asettaa GTDBTK_DATA_PATH-ympäristömuuttujan puolestasi — sinun ei tarvitse ladata tai määrittää mitään. GTDB-Tk 2.7.2 käyttää GTDB-julkaisua R232.

Voit tarkistaa polun moduulin lataamisen jälkeen komennolla:

echo $GTDBTK_DATA_PATH

Esimerkkieräajokomentosarja

classify_wf ottaa syötteeksi hakemiston, joka sisältää genomi-FASTA-tiedostoja. Oletusluokittelu (joka jakaa referenssipuun) tarvitsee noin 140 GiB muistia ja hyötyy monista ytimistä (katso GTDB-Tk:n laitteistovaatimukset).

#!/bin/bash
#SBATCH --job-name=gtdbtk
#SBATCH --account=<project>
#SBATCH --output=output_%j.txt
#SBATCH --error=errors_%j.txt
#SBATCH --partition=small
#SBATCH --time=12:00:00
#SBATCH --nodes=1
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=32
#SBATCH --mem=160G

module load bio-apps/v202603
module load py-gtdbtk/2.7.2

gtdbtk classify_wf \
    --genome_dir genomes/ \
    --extension fa \
    --out_dir gtdbtk_out \
    --cpus $SLURM_CPUS_PER_TASK

Korvaa <project> omalla CSC-projektillasi (esimerkiksi project_2001234).

  • --extension on syötegenomiesi tiedostopääte (fa, fasta, fna, …).
  • GTDB-Tk 2.7 seuloo kyselygenomit automaattisesti GTDB-edustajia vastaan skanilla; tätä vaihetta varten ei ole erillistä referenssitietokantaa ladattavaksi tai määritettäväksi.
  • pplacer-vaihe kuluttaa eniten muistia. Jos ajo loppuu muistin puutteeseen, lisää ensin --pplacer_cpus 1 (pienempi muistihuippu, hitaampi), ja kokeile sitten kasvattaa --mem-pyyntöäsi — small-osio voi tarjota enintään 1500 GiB. GTDB-Tk:n --scratch_dir-valitsinta, joka siirtää pplacerin varausta levylle, kannattaa Roihussa välttää: sen taustatiedosto on suunnilleen yhtä suuri kuin säästetty muisti (mikä tekee siitä todennäköisesti liian suuren $TMPDIR:lle), ja sen satunnainen, muistikartoitettu käyttömalli toimii heikosti Lustren /scratch-tiedostojärjestelmässä.

--full_tree-ajo (sijoittaminen täydelliseen, koristelemattomaan referenssipuuhun) vaatii noin 950 GiB muistia. Tämä mahtuu edelleen small-osion 1500 GiB:n ylärajaan; hugemem-osio on vaihtoehto. Oletusarvoista jaettua puuta käyttävää lähestymistapaa suositellaan lähes kaikkeen käyttöön.

Katso lisätietoja eräajojen suorittamisesta kohdasta eräajokomentosarjan luominen Roihulle.

Tuki

CSC:n Service Desk

Lisätietoja

Suomenkielinen tekoälykäännös

Sisällössä voi esiintyä virheellistä tietoa tekoälykäännöksestä johtuen.

Klikkaa tästä antaaksesi palautetta