-
Kraken
Kraken
Kraken on sekvenssiluokitin, joka antaa DNA-sekvensseille taksonomisia luokituksia. Kraken tutkii kyselysekvenssin k-meerejä ja käyttää niiden sisältämää tietoa tietokannan kyselyyn. Tämä tietokanta yhdistää k-meerit alimpaan yhteiseen esi-isään kaikista genomeista, joiden tiedetään sisältävän kyseisen k-meerin.
Roihussa Kraken on tarjolla nimellä Kraken 2 (moduuli kraken2, komento kraken2).
Lisenssi
Vapaasti käytettävissä ja avointa lähdekoodia MIT-lisenssillä.
Saatavuus
- Roihu-CPU: 2.17.1, 2.17.2 (moduuli
kraken2),bio-apps-moduulin kautta.
Käyttö
Kraken 2 on osa Roihun bio-apps -kokoelmaa. Lataa bio-apps-moduulipuu ja sen jälkeen Kraken 2 -moduuli:
Tämä lataa Kraken 2 -paketin, jonka voi käynnistää komennolla kraken2. Esimerkiksi:
Tietokannat
Kraken 2 tarvitsee viitetietokannan (--db). CSC tarjoaa seuraavat valmiiksi rakennetut
tietokannat Kraken 2 -indeksikokoelmasta
hakemistossa /dataset/project_2020345/kraken2:
| Tietokanta | Sisältö | Indeksin koko |
|---|---|---|
k2_pluspf_20260226 |
PlusPF (helmikuu 2026): RefSeq-arkit, bakteerit, virukset, plasmidit, alkueläimet ja sienet sekä ihminen ja UniVec_Core | 104 GiB |
k2_NCBI_reference_20251007 |
Yksi viitekooste per laji NCBI:n bakteereille, arkeille, protisteille ja sienille (lokakuu 2025) sekä ihminen, RefSeq-virukset ja UniVec_Core | 466 GiB |
kraken2-moduuli asettaa muuttujan KRAKEN2_DB_PATH tähän hakemistoon, joten voit antaa
tietokannan nimellä:
Kraken 2 lataa koko indeksin muistiin, joten varaa työllesi muistia vähintään indeksin koon verran.
Esimerkiksi työ, joka käyttää tietokantaa k2_NCBI_reference_20251007, tarvitsee noin --mem=500G. Tämän kokoiset työt
mahtuvat small-osioon, joka sallii enintään 1500 GB muistia sen suuren muistin solmuilla.
Jos haluat käyttää muuta tietokantaa, rakenna oma tietokantasi komennolla kraken2-build kirjoitettavaan sijaintiin (esimerkiksi projektisi /scratch-hakemistoon). Tämä lataa viitedataa ja vaatii huomattavasti levytilaa, muistia ja aikaa:
Vaihtoehtoisesti voit ladata valmiiksi rakennetun Kraken 2 -indeksin ja antaa sen hakemiston täyden polun, johon purit sen, parametrissa --db.
Esimerkkieräajokomentosarja
Molemmat valmiiksi rakennetut tietokannat tarvitsevat enemmän muistia kuin interaktiivinen istunto sallii, joten aja Kraken 2 niiden kanssa eräajotyönä. Alla on esimerkkityö, joka luokittelee sekvenssejä PlusPF-tietokantaa vasten käyttäen 8 ydintä, 120 GB muistia ja 6 tunnin ajoaikaa:
#!/bin/bash
#SBATCH --job-name=kraken2
#SBATCH --account=<project>
#SBATCH --output=output_%j.txt
#SBATCH --error=errors_%j.txt
#SBATCH --partition=small
#SBATCH --time=06:00:00
#SBATCH --nodes=1
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=8
#SBATCH --mem-per-cpu=15G
module load bio-apps/v202603
module load kraken2/2.17.2
kraken2 --db k2_pluspf_20260226 --threads $SLURM_CPUS_PER_TASK --report sample.kreport --output results.txt input.fasta
Korvaa <project> CSC-projektillasi (esimerkiksi project_2001234). Jos käytät omaa tietokantaasi, anna sen täysi polku parametrissa --db.
Voit lähettää eräajotiedoston eräajo järjestelmään komennolla:
Katso lisätietoja eräajojen suorittamisesta kohdasta eräajokomentosarjan luominen Roihulle.