Hopp til hovudinnhald
Nasjonalbiblioteket

N-grammer fra Nasjonalbiblioteket 2026

Distribusjonar 
1
API-ar 
0
  • Namnlaus distribusjon
    • application/zstd , application/json
    Last ned
Ingen registrerte API-ar tilbyr dette datasettet.
  • Datasett
  • Allmenn tilgang 

    Tilgjengeleg for alle. Tilgang kan likevel krevje registrering og førespurnad om API-nøklar, så lenge kven som helst kan be om slik registrering og/eller API-nøklar.

    Les meir om tilgangsnivå her

  • Opne data 

    Datasettet er klassifisert som allmenn tilgang og har minst éi distribuering med godkjend open lisens.

OversiktDistribusjonar og API-ar 
1
DetaljarDiskusjonar 
0
RDF

Skildring

Dette datasettet inneholder n-grammer – uni-, bi- og trigrammer – fra alle bøker og aviser som var blitt digitalisert ved Nasjonalbiblioteket per mars 2026. N-grammene er laget på basis av et materiale bestående av om lag 685.000 bøker og 4.720.000 avishefter, til sammen ca. 160 milliarder «tokens» (ord og tegnsetting). Filformatet er UTF-8-kodert JSONL, komprimert med den effektive Zstandard-algoritmen.

Innhold Nøklene i JSONL-filene med n-grammer er som følger: – first – det første ordet i n-grammet (i uni-, bi- og trigram) – second – det andre ordet i n-grammet (i bi- og trigram) – third – det tredje ordet i n-grammet (i trigram) – lang – språkkode for n-grammet (gjelder kun bøker, avisene har ingen språkklassifikasjon per nå) – freq – den totale frekvensen for n-grammet i samlingen av bøker eller aviser – counts – et dictionary med råfrekvens per år

totals.json inneholder totalfrekvenser innenfor årganger i hhv. bok- og avismaterialet. Med disse kan man lett regne ut relativfrekvenser for sammenligning på tvers av år som i NB N-gram. ngram-2026-digibok-metadata.jsonl og ngram-2026-digavis-metadata.jsonl inneholder enkle metadata for alle bøkene og avisene som inngår i bok- og aviskorpuset. Hvis du er interessert i mer utførlige metadata, henviser vi til Oria eller NBs APIer under https://api.nb.no/.

Tilrettelegging N-grammene ble ekstrahert fra fulltekstbasene til DH-labben ved Nasjonalbiblioteket (https://www.nb.no/dh-lab/). Følgende frekvenskutt ble gjennomført:

  • unigram (bøker): totalfrekvens på mindre enn fem i delkorpuset for norsk bokmål, mindre enn to i alle andre språk. I tillegg må n-grammet være brukt i mer enn ett år.
  • unigram (aviser): totalfrekvens på mindre enn fem. I tillegg må n-grammet være brukt i mer enn ett år.
  • bigram (bøker og aviser): tilsvarende kuttregler som for unigram. I tillegg ble alle hapax-bigrammer innenfor ett år fjernet.
  • trigram (bøker og aviser): tilsvarende kuttregler som for bigram. Alle hapax-trigrammer innenfor ett år ble fjernet.

Lisens Dataene stilles til disposisjon som CC-0 (fritt tilgjengelig).


Liknande datasett

Omsetjingsminne frå Semantix ASNasjonalbiblioteket
Allmenn tilgang
Grafem-til-fonem-modeller for norsk bokmålNasjonalbiblioteket
Allmenn tilgang
NB N-gramNasjonalbiblioteket
Allmenn tilgang
NST uttaleleksikon for svenskNasjonalbiblioteket
Allmenn tilgang
Grafem-til-fonem-modeller for norskNasjonalbiblioteket
Allmenn tilgang

Kontaktinformasjon

Kontaktpunkt:
Ikkje oppgitt
Nettside:
https://www.nb.no/sprakbanken/
E-post:
sprakbanken@nb.no
Telefon:
Ikkje oppgitt

Om dataane

Språk:
Ikkje oppgitt
Innhaldsleverandørar:
Ikkje oppgitt
Opphav:
Ikkje oppgitt
Oppdateringsfrekvens:
Ikkje oppgitt
Først utgjeve:

Denne datoen seier når dataa i dette datasettet først blei utgitt. Det kan ha skjedd før datasettet blei publisert på data.norge.no.

15. mars 2026
Sist oppdatert:
15. juni 2026
Nøyaktigheit:
Ikkje oppgitt
Tilgjenge:
Ikkje oppgitt
Fullstendigheit:
Ikkje oppgitt
Aktualitet:
Ikkje oppgitt
Relevans:
Ikkje oppgitt
Geografisk område:
Ikkje oppgitt
Tidsrom:
Ikkje oppgitt
I samsvar med:

Referanse til ei implementeringsregel eller anna spesifikasjon som ligg til grunn for datasettet.

Ikkje oppgitt

Lovheimler

Ikkje oppgitt

Omgrep brukte i datasettet

Ikkje oppgitt

Referansar

Ikkje oppgitt

Gebyr

Ikkje oppgitt

Om datasettet

Utgjevar:
Nasjonalbiblioteket
Publisert:

Denne datoen viser når datasettet vart henta inn av data.norge.no. Det kan ha vore tilgjengeleg tidlegare andre stader.

Les meir om innhenting her

1. juli 2026
Sist oppdatert:
1. juli 2026
Landingsside:
Ikkje oppgitt
Dokumentasjon:
Ikkje oppgitt
Datasettype:
Ikkje oppgitt
Metadatakvalitet:

Metadatakvalitet er ein indikator på kor godt datasettene er beskrive ved hjelp av metadata.

Les meir om metadatakvalitet her

URI:

Tema

Nøkkelord

Ikkje oppgitt

Diskusjonar på Datalandsbyen
0

Ingen diskusjonar funne

Kva er Datalandsbyen?

Datalandsbyen er vårt nettforum der du kan be om data, dele erfaringar og spørje om råd som gjeld deling av data og informasjonsforvalting.