-
Metatiedot ja datan dokumentointi
Metadata ja datan dokumentointi
Yleiskatsaus
Metadata ja datan dokumentointi ovat dataa ja sen alkuperää koskevaa kontekstuaalista tietoa, jota tarvitaan datan tulkintaan. Kattavan metadatan tuottaminen ja datan elinkaaren dokumentointi oman tieteenalasi käytäntöjen mukaisesti tekee datastasi ymmärrettävää, löydettävää ja uudelleenkäytettävää.
Metadata, eli data datasta, voi tarkoittaa useita asioita, ja myös yllä kuvattuja dokumentteja, jotka selittävät, miten dataa tulee tulkita, voidaan kutsua metadataksi. Näillä sivuilla käytämme kuitenkin termiä metadata viittaamaan löydettävyysmetadataan, datasi ”etikettiin”, jota tarvitaan, kun data julkaistaan ja jaetaan.
Datan dokumentointi tarkoittaa tiedon tuottamista, joka mahdollistaa datan oikean ja itsenäisen tulkinnan. Se koostuu tiedostoista, jotka selittävät, miten data on tuotettu tai digitoitu, miten dataa tulee tulkita, mikä sen rakenne on ja miten dataa on muokattu. Tätä tietoa voidaan kutsua myös data-tason dokumentaatioksi tai jopa metadataksi, koska se on dataa koskevaa tietoa. Datan dokumentointia tulisi pitää parhaana käytäntönä dataa hallittaessa, ja se on myös olennaista datan säilyttämisen kannalta. Aina kun dataa käytetään, tarvitaan riittävästi kontekstuaalista tietoa, jotta data voidaan tulkita oikein ja itsenäisesti.
Metadatan tyypit
Metadata on dataa koskevaa tietoa, esimerkiksi missä, milloin, miksi ja miten data on kerätty, käsitelty ja tulkittu. Metadata voi sisältää myös tietoja kokeista, analyysimenetelmistä ja tutkimuskontekstista.

License: CC BY 4.0
Löydettävyysmetadata
Löydettävyysmetadata voi olla kolmea tyyppiä: kuvailevaa, hallinnollista ja rakenteellista metadataa.
Kuvaileva metadata
Aineiston kuvaileva metadata voidaan jakaa kahteen alaluokkaan:
1) ydinmetadata tai tutkimustason metadata (löytämistä ja tunnistamista varten – hakua ja viittaamista varten), johon kuuluu:
- pysyvä tunniste, jota käytetään aineistoon viitattaessa tai uudelleenkäytöstä raportoidessa
- yleiset tiedot aineistosta (nimi, tieteenala, avainsanat, sisällön kattavuus, muuttujat)
- tiedot toimijoista (tekijät, muut osallistujat, julkaisija, jakelija)
- tiedot saatavuudesta (latauslinkki tai pääsytiedot ja käyttöoikeuslausumat)
- tiedot elinkaaren tapahtumista ja niihin liittyvistä entiteeteistä (alkuperä)
- tekniset tiedot, kuten tarkistussumma, koko, tiedostomuoto, mediatyyppi
2) datan dokumentointi (kutsutaan myös yksityiskohtaiseksi kuvailevaksi metadataksi tai data-tason metadataksi) (muuttujien määritykset, työnkulut, käsittelykoodi jne. – arvioinnin ja uudelleenkäytön mahdollistamiseksi). Lisää yksityiskohtaisesta kuvailevasta metadatasta kohdassa Datan dokumentointi.
Hallinnollinen metadata
Hallinnollinen metadata sisältää tietoa aineiston oikeuksista. Tämä tarkoittaa tietoa lisenssistä, rajoituksen tyypistä ja sen syystä (eettinen, oikeudellinen jne.), embargoajasta, oikeuksien omistajasta, uudelleenkäytön yhteyshenkilöstä sekä siitä, miten käyttölupaa ja pääsyä haetaan.
Muita hallinnollisen metadatan luokkia ovat tekninen metadata (esim. tiedostotyyppejä koskevat tiedot, joita tarvitaan tiedostojen esittämiseen) ja säilytysmetadata.
Rakenteellinen metadata
Rakenteellinen metadata kuvaa, miten aineisto on sisäisesti järjestetty ja miten se liittyy muihin aineistoihin (esim. versioiden hallinta). Joillakin tieteenaloilla data julkaistaan ja jaetaan yhteisön hyväksymien standardien ja skeemojen mukaisesti, jotka ovat muodollinen ja koneellisesti hyödynnettävä tapa ilmaista rakenteellista metadataa. Skeemoja käytetään ilmaisemaan tieteenalaa, rakennetta, suhteita, kenttien nimiä ja parametrikohtaisia standardeja koko aineistolle. Skeema mahdollistaa datan jakamisen, yhdistämisen tai siirtämisen tietojärjestelmien välillä menettämättä datan merkitystä tai rakennetta (eli data on yhteentoimivaa). Teknisten standardien ja skeemojen käyttöönoton lisäksi eri datojen välisen semanttisen yhteentoimivuuden varmistaminen edellyttää julkaistujen semanttisten artefaktien käyttöä ja niihin viittaamista.
Huom.
Voit käyttää Qvain - tutkimusaineistojen metatietotyökalua aineistosi ydin-, hallinnollisen ja rakenteellisen metadatan luomiseen.
Se julkaistaan palvelussa Etsin - tutkimusaineistojen hakupalvelu.
Datan dokumentointi (kutsutaan myös yksityiskohtaiseksi kuvailevaksi metadataksi tai data-tason metadataksi)
Jos sinulla on lisämetadataa, joka ei sovi datakatalogiin, lisämetadataa ja dokumentaatiota, kuten koodikirjoja tai asetustiedostoja, voidaan lisätä aineistoon erillisinä tiedostoina. Tämä metadata voi olla myös sisäänrakennettuna datatiedostoihin. Muista, että tämä voi vaikeuttaa datan löytämistä. Jos lisäät ylimääräistä metadataa:
- Käytä metadatastandardeja, jos mahdollista: Repositoriot edellyttävät usein tietyn metadatastandardin käyttöä; jäsenneltyjä muotoja, jotka käyttävät tiettyjä sanastoja tai ontologioita datan kuvaamiseen. Tarkista, onko olemassa tieteenala-/yhteisö- tai repositoriopohjainen metadataskeema tai standardi (eli suositellut metadataelementtien joukot), joka voidaan ottaa käyttöön. Tieteenalakohtaisia standardeja löytyy Digital Curation Centre -verkkosivustolta.
- Jotkin tutkimuslaitteet tuottavat standardoituja metadataformaatteja automaattisesti. Valitse mahdollisuuksien mukaan standardi, joka on yhteensopiva muiden ohjelmistojen kanssa.
- Käytä erillisiä metadatatiedostoja tai datatiedostoihin sisältyvää metadataa, asetustiedostoja, lisenssiasiakirjoja, koodikirjoja ja muuta dataa tai tietoa, joka on tärkeää datan toistettavuuden ja uudelleenkäytön kannalta.
- Readme-tiedosto(t), jotka tarjoavat tietoa datatiedostoista oikean tulkinnan varmistamiseksi
- Datasanakirja / koodikirja, joka selittää datan muuttujat ja kokoaa aineistossa käytetyt koodit.
Mieti myös tiedostojen nimeämiskäytäntöjä, hakemistorakennetta ja versionhallintaa. Lisää tästä kohdassa Datan organisointi.
Datan dokumentointia voidaan tehdä käyttämällä:
- (alakohtaisia) metadata- ja datastandardeja
- sähköisiä laboratoriopäiväkirjoja
- sanakirjoja ja sanastoja
- readme-tiedostoja
ja ne kaikki osallistuvat siihen, mitä projektin data on ja mitä se tarkoittaa, selittämiseen.
Semanttinen yhteentoimivuus ja koneellisesti luettavuus
Kontrolloidut sanastot, tesaurukset ja ontologiat ovat kaikki niin sanottuja semanttisia artefakteja, jotka ovat koneellisesti luettavia tiedon malleja. Kun datastandardi ja skeema ilmaisevat datan rakenteen (datan eri elementtien väliset suhteet), semanttiset artefaktit tekevät sisällön merkityksestä yksiselitteisen ja koneelle ”ymmärrettävän” (machine actionable). Esimerkiksi kun keräät dataa kasveista, muille ihmisille voi olla ilmeistä, että data koskee eläviä organismeja eikä voimalaitoksia tai muita tehtaita, mutta tietokone ei pysty erottamaan tätä tulkitsemalla merkitystä kontekstista samalla tavoin kuin ihminen. Tätä varten datan mukana tulisi olla tai siihen tulisi viitata julkisesti saatavilla olevaan sanastoon, joka kertoo koneelle, miten dataa tulkitaan kontekstissaan ja mitä muuttujien arvot tarkoittavat (esimerkiksi ovatko "Degrees"-sarakkeen luvut Fahrenheit- vai Celsius-asteita). On myös tärkeää kertoa koneelle, tarkoittaako tyhjä kenttä, NULL tai nolla nolla-arvoa vai sitä, että data yksinkertaisesti puuttuu. Tämä voi olla ratkaisevaa analyyseille ja tuloksille, jos dataa tulkitaan väärin eri tavoin aineistoja uudelleenkäytettäessä tai yhdistettäessä.
Linkkejä kontrolloituihin sanastoihin, tesauruksiin ja ontologioihin
- Finnish Thesaurus and Ontology Service (Finto.fi)
- National checklist of Finnish species (Laji.fi)
- Basic Register of Thesauri, Ontologies & Classifications (BARTOC)
- CESSDA Vocabulary Service
- Linked Open Vocabularies (LOV)
- The Open Biological and Biomedical Ontology (OBO) Foundry
- Repository of biomedical ontologies (BioPortal)
- NERC Vocabulary Server (NVS)
- Research Vocabulary Australia
- Marine Metadata Interoperability Ontology Registry and Repository (MMI ORR)
- Industrial Ontologies Foundry (IOF)
Datan organisointi
Tärkeä osa hyvää datanhallintaa on myös huolehtia datan organisoinnista. Tähän kuuluu esimerkiksi harkittu tiedostojen nimeäminen, selkeä kansiorakenne, saavutettavat tiedostomuodot ja yksiselitteinen versionhallinta.
On hyvä käytäntö luoda selkeä tiedostojen nimeämisjärjestelmä projektin alusta alkaen ja käyttää esimerkiksi samaa järjestelmää yhdessä tutkimusryhmäsi kanssa. Tämä auttaa sekä sinua että kollegoitasi ymmärtämään tiedostonimen perusteella, mitä tiedostot sisältävät. Lue vinkkejä datasi organisointiin sekä tiedostojen ja kansioiden nimeämiseen alta tai RDMKitin Data Organisation -sivulta.
Tutkimusalallasi voi myös olla ohjeita ja suosituksia datan organisointiin. Esimerkiksi Brain Imaging Data Structure (BIDS) on aivotutkijoiden tiedeyhteisön luoma, ja se määrittelee tiedostomuodot, tiedostojen nimeämissäännöt ja säännöt datan järjestämiseksi hakemistoihin.
Versiointi
Jotta data pysyy hyvin järjestettynä, sinulla tulisi olla käytössä versionhallintajärjestelmä. Tämä voidaan tehdä joko manuaalisesti, jolloin lisäät juoksevan numeron tiedostonimen loppuun (_v03), tai automaattisesti, mikä on suositeltava tapa. Automaattinen versionhallinta voidaan toteuttaa ohjelmistoilla kuten Git, GitHub tai GitLab (organisaatiosi saattaa tarjota integroidun ratkaisun) tai käyttämällä pilvitallennusratkaisuja, jotka yleensä tarjoavat automaattisen tiedostoversioinnin. Lisää vinkkejä datan organisointiin löytyy ELIXIR Research Data Management Kitistä (RDMkit).
Kun teet uusia versioita datatiedostoista, on tärkeää säilyttää kopio alkuperäisestä raakadatasta. Data tulisi säilyttää raakamuodossaan aina kun mahdollista läpinäkyvyyden mahdollistamiseksi ja uudelleenanalyysin helpottamiseksi. Tämä auttaa myös yhdistämään useita datalähteitä ja käyttämään dataa uudelleen uusiin tarkoituksiin. Lisäksi dataa jaettaessa voi olla hyödyllistä tarjota sekä käsittelemättömät että käsitellyt versiot datasta sekä joko koodi tai selitykset jälkimmäisen tuottamiseksi. Joissakin tapauksissa on jopa mahdollista julkaista data yhdessä käsittely- ja analyysikoodin kanssa suoritettavana artikkelina, jotta voidaan osoittaa tieteellisen prosessin olevan toistettavissa. Toisin sanoen suoritettavat artikkelit ovat dynaamisia ohjelmistokokonaisuuksia, jotka yhdistävät tekstin, raakadatan ja analyysissä käytetyn koodin ja joiden kanssa lukija voi olla vuorovaikutuksessa.
Lue lisää toistettavuudesta ja suoritettavista tutkimusartikkeleista:
Tiedostot ja tiedostomuodot
Kaikki digitaalinen informaatio on jäsenneltyä dataa. Tiedostomuoto on standardoitu tapa, jolla tieto koodataan tallennettavaksi tietokonetiedostoon. Avoin muoto on tiedostomuoto digitaalisen datan tallentamiseen, joka on määritelty julkaistussa spesifikaatiossa, jota yleensä ylläpitää standardointiorganisaatio, ja jota kuka tahansa voi käyttää ja toteuttaa. Toisin kuin avoimet muodot, suljettuja muotoja pidetään liikesalaisuuksina. Esimerkiksi monet kaupalliset laitteet tai ohjelmistot tuottavat dataa, jota ei voida lukea tai tulkita ilman saman toimittajan muita työkaluja. Tutkimusdataa organisoitaessa, tallennettaessa ja julkaistaessa on tärkeää luoda yhtenäisiä, ymmärrettäviä ja läpinäkyviä kokonaisuuksia, joihin on helppo päästä käsiksi ja joita on helppo käyttää uudelleen. Tämä on mahdollista avoimilla muodoilla, jotka voidaan avata ja joita voidaan käyttää myös yleisesti käytetyillä avoimilla työkaluilla.
Datan organisointi
- Lajittele ja luokittele tietosi
- Älä esimerkiksi sekoita eri tyyppisiä tietoja Excel-sarakkeissa: yleensä aineistojen yhdistäminen on helpompaa kuin huonosti jäsennellyn datan selvittäminen myöhemmin
- Mieti rakeisuutta (tiedostokokoa) ja metadataa
- Päätä muodot, yksiköt, koodit jne. ja ole johdonmukainen
- Käytä yleisiä tiedostomuotoja, mieluiten avoimia
- Löydät suositeltujen tiedostomuotojen listan digitaalista säilyttämistä käsittelevältä verkkosivustolta. Jos käytät muita muotoja, sinun on harkittava tiedostomuodon teknisen dokumentaation lisäämistä.
- Kirjoita koodikirja, dokumentoi. Readme-tiedostot ovat usein tarpeen.
- Mieti ymmärrettävyyttä
- Ole varovainen järjestellessäsi uudelleen, muotoillessasi uudelleen, lajitellessasi tai kopioidessasi ja liittäessäsi dataa
- Vältä väliaikaisten tai piilotettujen järjestelmätiedostojen sisällyttämistä varsinaisten datatiedostojen joukkoon
- Ota käyttöön prosessit datan laadun ja täydellisyyden tarkistamiseksi
- Tee selväksi, mitkä ovat pääkopiot ja mitkä muut kopiot
- Ole huolellinen ja suunnittele hyvin sensitiivinen data ja anonymisointi
- Mieti turvallisuutta ja käyttöoikeuksia
- Suunnittele ja sopikaa, mitkä aineiston versiot arkistoidaan ja/tai julkaistaan
- Mieti toistettavuutta ja dataan viittaamista
Tiedostot ja kansiot: jäsentäminen ja nimeäminen
On tärkeää käyttää hieman aikaa tiedosto- ja kansiorakenteiden sekä nimeämisen suunnitteluun.
- Luo ja sopikaa tiedostojen ja kansioiden nimeämisjärjestelmästä ja noudata sitä johdonmukaisesti
- Pyri organisoimaan tiedostot loogisesti kansioiden ja alikansioiden avulla sen sijaan, että kaikki tiedostot olisivat yhdessä kansiossa
- Vältä hyvin syviä kansiorakenteita, sillä niitä voi olla vaikea hallita
- Jos datasi on aikasidonnaista ja loogisesti järjestettävissä ajanjaksojen mukaan, voi olla hyödyllistä järjestää tiedostot aikaan sidottuihin kansioihin, kuten YYYY-MM-DD
- Käytä merkityksellisiä, yksilöllisiä tiedosto- ja kansionimiä
- Pidä tiedosto- ja kansionimet mahdollisimman lyhyinä mutta olennaisina. Enimmäispituudeksi katsotaan yleensä 25 merkkiä.
- Päivämäärät muodossa YYYY-MM-DD mahdollistavat tiedostojen lajittelun ja haun
- Vältä erikoismerkkejä kuten % & / \ : ; * . ? < > ^! " () ja skandinaavisia kirjaimia
- Käytä kolmea numeroa (tai 4:ää, jos tiedostoja on paljon), eli 001, 002…….201, 202 (ei 1, 2, 21).
- Käytä alaviivoja (_) välilyöntien sijasta
- Jos käytät nimessä henkilönnimeä, kirjoita ensin sukunimi ja sitten etunimi
- Ole kuitenkin erittäin varovainen henkilötietojen kanssa tiedostoja ja kansioita nimetessäsi
- Ilmaise versionumero käyttämällä merkintää 'V' tai 'version' ja numeroa (sekä alaversioissa useampia numeroita, jos muutokset ovat pieniä)