Hyppää sisältöön

Puhdin ja Mahdin laskentapalvelut ovat poistuneet käytöstä. Puhdin ja Mahdin kirjautumisnoodit sekä tallennustila ovat saatavilla 15. lokakuuta 2026 asti, mutta ne eivät enää ole palvelusopimusten piirissä. Ryhdythän toimiin datan siirtämiseksi Roihuun välittömästi. Ohjeita löydät sivulta Roihun datan siirto-opas.

HMMER

Piilotetut Markovin mallit (HMM) ovat matemaattisia työkaluja, joita voidaan käyttää toisiinsa liittyvien tai samankaltaisten sekvenssialueiden kuvaamiseen ja analysointiin. HMM-mallit voidaan johtaa monisekvenssikohdistuksista siten, että ne sisältävät paikkakohtaista tietoa todennäköisyyksistä, joilla tietyt nukleotidit tai aminohapot esiintyvät kohdistuksen kussakin kohdassa.

HMMER-paketti sisältää työkaluja sekvenssikohdistuksiin perustuvien HMM-mallien luomiseen ja muokkaamiseen, niiden käyttämiseen tietokantahauissa sekä sekvenssikohdistusten laajentamiseen.

Tietokantahaut HMM-profiileilla voivat vaatia tavallisilla tietokoneilla erittäin pitkiä laskenta-aikoja.

Lisenssi

Vapaasti käytettävissä ja avointa lähdekoodia BSD 3-Clause -lisenssillä.

Saatavuus

  • Roihu-CPU: 3.4, bio-apps-moduulin kautta.

Käyttö

HMMER on osa Roihun bio-apps -kokoelmaa. Lataa ensin bio-apps-moduulipuu ja sitten HMMER-moduuli:

module load bio-apps/v202603
module load hmmer/3.4

Tarkista saatavilla olevat versiot komennolla:

module spider hmmer

Tämän jälkeen kunkin hmmer-komennon komentorivivalinnat voi tarkistaa valinnalla -h. Esimerkiksi:

hmmsearch -h

Pfam-tietokanta

Jaetut viitetietokannat

CSC suunnittelee tarjoavansa jaettuja viitetietokantoja (kuten Pfam-A) keskitetystä sijainnista Roihussa. Tätä ollaan vielä ottamassa käyttöön. Siihen asti lataa ja käytä omaa kopiota tietokannasta.

Voit hakea proteiinisekvenssiä Pfam-A HMM -tietokantaa vasten tai omia HMM-tietokantojasi vasten. Kun olet ladannut Pfam-A HMM -tiedoston, valmistele se hakua varten komennolla hmmpress:

hmmpress Pfam-A.hmm

Natiivilla HMMERillä voit nopeuttaa hmmscan- ja hmmsearch-komentoja käyttämällä useita prosessoreita. Käytettävien prosessorien määrä, esimerkiksi 4, ilmoitetaan valinnalla --cpu 4, mutta luku kannattaa korvata ympäristömuuttujalla, jossa arvo on jo valmiina, eli $SLURM_CPUS_PER_TASK, jotta se pysyy aina synkronoituna eräajokomentosarjan pyynnön kanssa.

Voit suorittaa haun interaktiivisessa istunnossa. Roihun interactive-osiolla jokainen varattu ydin tarjoaa 1,875 Gt muistia (enintään 32 ydintä / 60 Gt / 36 tuntia), joten pyydä tarpeeksi ytimiä tarvitsemaasi muistimäärää varten, esimerkiksi:

sinteractive --account <project> --cores 4
module load bio-apps/v202603
module load hmmer/3.4
hmmscan --cpu $SLURM_CPUS_PER_TASK Pfam-A.hmm protein.fasta > result.txt

HMMER-työt kannattaa ajaa interaktiivisina eräajoina tai tavallisina eräajoina. Tässä on esimerkkieräajokomentosarja, joka käyttää 4 prosessoriydintä:

#!/bin/bash 
#SBATCH --job-name=hmmer_job
#SBATCH --account=<project>
#SBATCH --output=output_%j.txt
#SBATCH --error=errors_%j.txt
#SBATCH --time=04:00:00
#SBATCH --partition=small
#SBATCH --nodes=1
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=4
#SBATCH --mem-per-cpu=2000M

module load bio-apps/v202603
module load hmmer/3.4

hmmscan --cpu $SLURM_CPUS_PER_TASK Pfam-A.hmm protein.fasta > result.txt

Korvaa <project> CSC-projektillasi (esimerkiksi project_2001234).

Työ lähetetään komennolla (missä batch_job_file.sh on eräajotiedostosi nimi):

sbatch batch_job_file.sh

Lisätietoja eräajojen suorittamisesta on sivulla eräajokomentosarjan luominen Roihulle.

Tuki

CSC:n asiakastuki

Lisätietoja

Suomenkielinen tekoälykäännös

Sisällössä voi esiintyä virheellistä tietoa tekoälykäännöksestä johtuen.

Klikkaa tästä antaaksesi palautetta