Hyppää sisältöön

Puhdin ja Mahdin laskentapalvelut ovat poistuneet käytöstä. Puhdin ja Mahdin kirjautumisnoodit sekä tallennustila ovat saatavilla 15. lokakuuta 2026 asti, mutta ne eivät enää ole palvelusopimusten piirissä. Ryhdythän toimiin datan siirtämiseksi Roihuun välittömästi. Ohjeita löydät sivulta Roihun datan siirto-opas.

Kraken

Kraken on sekvenssiluokitin, joka antaa DNA-sekvensseille taksonomisia luokituksia. Kraken tutkii kyselysekvenssin k-meerejä ja käyttää niiden sisältämää tietoa tietokannan kyselyyn. Tämä tietokanta yhdistää k-meerit alimpaan yhteiseen esi-isään kaikista genomeista, joiden tiedetään sisältävän kyseisen k-meerin.

Roihussa Kraken on tarjolla nimellä Kraken 2 (moduuli kraken2, komento kraken2).

Lisenssi

Vapaasti käytettävissä ja avointa lähdekoodia MIT-lisenssillä.

Saatavuus

  • Roihu-CPU: 2.17.1, 2.17.2 (moduuli kraken2), bio-apps-moduulin kautta.

Käyttö

Kraken 2 on osa Roihun bio-apps -kokoelmaa. Lataa bio-apps-moduulipuu ja sen jälkeen Kraken 2 -moduuli:

module load bio-apps/v202603
module load kraken2/2.17.2

Tämä lataa Kraken 2 -paketin, jonka voi käynnistää komennolla kraken2. Esimerkiksi:

kraken2 --help

Tietokannat

Kraken 2 tarvitsee viitetietokannan (--db). CSC tarjoaa seuraavat valmiiksi rakennetut tietokannat Kraken 2 -indeksikokoelmasta hakemistossa /dataset/project_2020345/kraken2:

Tietokanta Sisältö Indeksin koko
k2_pluspf_20260226 PlusPF (helmikuu 2026): RefSeq-arkit, bakteerit, virukset, plasmidit, alkueläimet ja sienet sekä ihminen ja UniVec_Core 104 GiB
k2_NCBI_reference_20251007 Yksi viitekooste per laji NCBI:n bakteereille, arkeille, protisteille ja sienille (lokakuu 2025) sekä ihminen, RefSeq-virukset ja UniVec_Core 466 GiB

kraken2-moduuli asettaa muuttujan KRAKEN2_DB_PATH tähän hakemistoon, joten voit antaa tietokannan nimellä:

kraken2 --db k2_pluspf_20260226 --threads $SLURM_CPUS_PER_TASK input.fasta --output results.txt

Kraken 2 lataa koko indeksin muistiin, joten varaa työllesi muistia vähintään indeksin koon verran. Esimerkiksi työ, joka käyttää tietokantaa k2_NCBI_reference_20251007, tarvitsee noin --mem=500G. Tämän kokoiset työt mahtuvat small-osioon, joka sallii enintään 1500 GB muistia sen suuren muistin solmuilla.

Jos haluat käyttää muuta tietokantaa, rakenna oma tietokantasi komennolla kraken2-build kirjoitettavaan sijaintiin (esimerkiksi projektisi /scratch-hakemistoon). Tämä lataa viitedataa ja vaatii huomattavasti levytilaa, muistia ja aikaa:

kraken2-build --standard --db /scratch/<project>/kraken_db

Vaihtoehtoisesti voit ladata valmiiksi rakennetun Kraken 2 -indeksin ja antaa sen hakemiston täyden polun, johon purit sen, parametrissa --db.

Esimerkkieräajokomentosarja

Molemmat valmiiksi rakennetut tietokannat tarvitsevat enemmän muistia kuin interaktiivinen istunto sallii, joten aja Kraken 2 niiden kanssa eräajotyönä. Alla on esimerkkityö, joka luokittelee sekvenssejä PlusPF-tietokantaa vasten käyttäen 8 ydintä, 120 GB muistia ja 6 tunnin ajoaikaa:

#!/bin/bash
#SBATCH --job-name=kraken2
#SBATCH --account=<project>
#SBATCH --output=output_%j.txt
#SBATCH --error=errors_%j.txt
#SBATCH --partition=small
#SBATCH --time=06:00:00
#SBATCH --nodes=1
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=8
#SBATCH --mem-per-cpu=15G

module load bio-apps/v202603
module load kraken2/2.17.2

kraken2 --db k2_pluspf_20260226 --threads $SLURM_CPUS_PER_TASK --report sample.kreport --output results.txt input.fasta

Korvaa <project> CSC-projektillasi (esimerkiksi project_2001234). Jos käytät omaa tietokantaasi, anna sen täysi polku parametrissa --db.

Voit lähettää eräajotiedoston eräajo järjestelmään komennolla:

sbatch batch_job_file.sh

Katso lisätietoja eräajojen suorittamisesta kohdasta eräajokomentosarjan luominen Roihulle.

Tuki

CSC:n asiakastuki

Lisätietoja

Suomenkielinen tekoälykäännös

Sisällössä voi esiintyä virheellistä tietoa tekoälykäännöksestä johtuen.

Klikkaa tästä antaaksesi palautetta