-
GTDB-Tk
GTDB-Tk
GTDB-Tk on ohjelmistotyökalupakki objektiivisten taksonomisten luokitusten määrittämiseen
bakteeri- ja arkeonigenomeille, mukaan lukien metagenomikootut genomit (MAG:t) ja
yksittäisvahvistetut genomit (SAG:t). Luokitukset perustuvat
Genome Taxonomy Databaseen (GTDB). classify_wf-työvuo
tunnistaa markkerigeenit (Prodigal-geenikutsu, HMMER-markkerihaku),
kohdistaa ne, seuloo kyselygenomit GTDB:n referenssigenomeja vastaan keskimääräisen
nukleotidi-identtisyyden perusteella (skani) ja sijoittaa ne GTDB:n referenssipuuhun
pplacerilla.
Lisenssi
Vapaasti käytettävissä ja avointa lähdekoodia GNU GPLv3 -lisenssillä.
Saatavuus
- Roihu-CPU: 2.7.2,
bio-apps-moduulin kautta.
Käyttö
GTDB-Tk on osa Roihun bio-apps -kokoelmaa. Lataa ensin bio-apps-moduulipuu ja sitten GTDB-Tk-moduuli:
Luokittelukomennot suoritetaan gtdbtk-komennolla, esimerkiksi
gtdbtk classify_wf.
Referenssidata
GTDB-Tk tarvitsee GTDB:n referenssidatapaketin (~100 GiB), joka vastaa työkalun
versiota. Roihussa CSC tarjoaa tämän datan valmiiksi, ja moduuli asettaa
GTDBTK_DATA_PATH-ympäristömuuttujan puolestasi — sinun ei tarvitse ladata
tai määrittää mitään. GTDB-Tk 2.7.2 käyttää GTDB-julkaisua R232.
Voit tarkistaa polun moduulin lataamisen jälkeen komennolla:
Esimerkkieräajokomentosarja
classify_wf ottaa syötteeksi hakemiston, joka sisältää genomi-FASTA-tiedostoja. Oletusluokittelu
(joka jakaa referenssipuun) tarvitsee noin 140 GiB muistia ja hyötyy
monista ytimistä (katso GTDB-Tk:n
laitteistovaatimukset).
#!/bin/bash
#SBATCH --job-name=gtdbtk
#SBATCH --account=<project>
#SBATCH --output=output_%j.txt
#SBATCH --error=errors_%j.txt
#SBATCH --partition=small
#SBATCH --time=12:00:00
#SBATCH --nodes=1
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=32
#SBATCH --mem=160G
module load bio-apps/v202603
module load py-gtdbtk/2.7.2
gtdbtk classify_wf \
--genome_dir genomes/ \
--extension fa \
--out_dir gtdbtk_out \
--cpus $SLURM_CPUS_PER_TASK
Korvaa <project> omalla CSC-projektillasi (esimerkiksi project_2001234).
--extensionon syötegenomiesi tiedostopääte (fa,fasta,fna, …).- GTDB-Tk 2.7 seuloo kyselygenomit automaattisesti GTDB-edustajia vastaan skanilla; tätä vaihetta varten ei ole erillistä referenssitietokantaa ladattavaksi tai määritettäväksi.
pplacer-vaihe kuluttaa eniten muistia. Jos ajo loppuu muistin puutteeseen, lisää ensin--pplacer_cpus 1(pienempi muistihuippu, hitaampi), ja kokeile sitten kasvattaa--mem-pyyntöäsi —small-osio voi tarjota enintään 1500 GiB. GTDB-Tk:n--scratch_dir-valitsinta, joka siirtää pplacerin varausta levylle, kannattaa Roihussa välttää: sen taustatiedosto on suunnilleen yhtä suuri kuin säästetty muisti (mikä tekee siitä todennäköisesti liian suuren$TMPDIR:lle), ja sen satunnainen, muistikartoitettu käyttömalli toimii heikosti Lustren/scratch-tiedostojärjestelmässä.
--full_tree-ajo (sijoittaminen täydelliseen, koristelemattomaan referenssipuuhun)
vaatii noin 950 GiB muistia. Tämä mahtuu edelleen small-osion 1500 GiB:n
ylärajaan; hugemem-osio on
vaihtoehto. Oletusarvoista jaettua puuta käyttävää lähestymistapaa suositellaan lähes kaikkeen käyttöön.
Katso lisätietoja eräajojen suorittamisesta kohdasta eräajokomentosarjan luominen Roihulle.