-
HMMER
HMMER
Piilotetut Markovin mallit (HMM) ovat matemaattisia työkaluja, joita voidaan käyttää toisiinsa liittyvien tai samankaltaisten sekvenssialueiden kuvaamiseen ja analysointiin. HMM-mallit voidaan johtaa monisekvenssikohdistuksista siten, että ne sisältävät paikkakohtaista tietoa todennäköisyyksistä, joilla tietyt nukleotidit tai aminohapot esiintyvät kohdistuksen kussakin kohdassa.
HMMER-paketti sisältää työkaluja sekvenssikohdistuksiin perustuvien HMM-mallien luomiseen ja muokkaamiseen, niiden käyttämiseen tietokantahauissa sekä sekvenssikohdistusten laajentamiseen.
Tietokantahaut HMM-profiileilla voivat vaatia tavallisilla tietokoneilla erittäin pitkiä laskenta-aikoja.
Lisenssi
Vapaasti käytettävä ja avointa lähdekoodia BSD 3-Clause -lisenssillä.
Saatavuus
- Roihu: 3.4,
bio-apps-moduulin kautta.
Käyttö
HMMER on osa Roihun bio-apps -kokoelmaa. Lataa ensin bio-apps-moduulipuu ja sitten HMMER-moduuli:
Tarkista saatavilla olevat versiot komennolla:
Tämän jälkeen kunkin hmmer-komennon komentorivivalinnat voidaan tarkistaa valinnalla -h. Esimerkiksi:
Pfam-tietokanta
Jaetut viitetietokannat
CSC suunnittelee tarjoavansa jaettuja viitetietokantoja (kuten Pfam-A) keskitetystä sijainnista Roihussa. Tätä ollaan vielä ottamassa käyttöön. Kunnes se on saatavilla, lataa ja käytä omaa kopiota tietokannasta.
Voit hakea proteiinisekvenssiä Pfam-A HMM -tietokantaa vasten tai omia HMM-tietokantojasi vasten.
Pfam-A HMM -tiedoston lataamisen jälkeen valmistele se hakua varten komennolla hmmpress:
Natiivilla HMMERillä voit nopeuttaa hmmscan- ja hmmsearch-komentoja käyttämällä useita
prosessoreita. Käytettävien prosessorien määrä, esimerkiksi 4, ilmoitetaan valinnalla --cpu 4,
mutta luku kannattaa korvata ympäristömuuttujalla, jossa arvo on jo valmiina, eli
$SLURM_CPUS_PER_TASK, jotta se pysyy aina synkronoituna eräajokomentosarjan pyynnön kanssa.
Voit suorittaa haun interaktiivisessa istunnossa. Roihun interactive-osiolla jokainen varattu ydin tarjoaa 1,875 Gt muistia (enintään 32 ydintä / 60 Gt / 36 tuntia), joten pyydä riittävästi ytimiä tarvitsemaasi muistimäärää varten, esimerkiksi:
sinteractive --account <project> --cores 4
module load bio-apps/v202603
module load hmmer/3.4
hmmscan --cpu $SLURM_CPUS_PER_TASK Pfam-A.hmm protein.fasta > result.txt
HMMER-ajot tulisi suorittaa interaktiivisina eräajoina tai tavallisina eräajoina. Tässä on esimerkkieräajokomentosarja, joka käyttää 4 prosessoriydintä:
#!/bin/bash
#SBATCH --job-name=hmmer_job
#SBATCH --account=<project>
#SBATCH --output=output_%j.txt
#SBATCH --error=errors_%j.txt
#SBATCH --time=04:00:00
#SBATCH --partition=small
#SBATCH --nodes=1
#SBATCH --ntasks=1
#SBATCH --cpus-per-task=4
#SBATCH --mem-per-cpu=2000M
module load bio-apps/v202603
module load hmmer/3.4
hmmscan --cpu $SLURM_CPUS_PER_TASK Pfam-A.hmm protein.fasta > result.txt
Korvaa <project> CSC-projektillasi (esimerkiksi project_2001234).
Työ lähetetään komennolla (jossa batch_job_file.sh on eräajotiedostosi nimi):
Lisätietoja eräajojen suorittamisesta on sivulla eräajokomentosarjan luominen Roihulle.