Vad betyder och hur uttalas dokumentsamling
Dokumentsamling uttalas doku|ment|saml|ing.
Ordformer och varianter av dokumentsamling
Singular
- dokumentsamling
- obestämd grundform
- dokumentsamlings
- obestämd genitiv
- dokumentsamlingen
- bestämd grundform
- dokumentsamlingens
- bestämd genitiv
Plural
- dokumentsamlingar
- obestämd grundform
- dokumentsamlingars
- obestämd genitiv
- dokumentsamlingarna
- bestämd grundform
- dokumentsamlingarnas
- bestämd genitiv
Dokumentsamling är ett substantiv
Substantiv är en ordklass. Ord i denna ordklass betecknar abstrakta och konkreta ting och abstrakta begrepp. En vanlig minnesramsa (som också finns i många andra varianter) är "Substantiv är namn på ting, till exempel boll och ring". Exempel på substantiv är kaktus, sol, blomma, fotboll och lamm.
Hur används ordet dokumentsamling
Algebraiska modeller för informationssökning representerar vanligen på något plan dokument och söksträngar som vektorer i ett n-dimensionellt vektorrum. Varje dimension representerar en specifik term, alltså finns lika många dimensioner som det finns termer i de texter som representeras. En sökfråga som vanligen består av ett litet antal termer representeras som en vektorsumma av dessa termer och ett dokument likaså som en vektorsumma, ofta med viss dämpning av höga frekvenser för vanliga termer. Det finns flera sätt att vikta termer. Det mest grundläggande är tf-idf (termfrekvens-inverterad dokumentfrekvens). Med denna viktning värderas ovanliga termer i dokumentsamlingen högt. Mer sofistikerade modeller tar även hänsyn till dokumentets längd och till feedback från användaren. I den klassiska vektorrymdsmodellen beräknas likheten mellan dokument och söksträng som vinklar mellan vektorerna i vektorrummet, något som har använts sedan sjuttiotalet.
Ett sådant vektorrum har mycket hög dimensionalitet med många ganska oviktiga dimensioner som representerar termer som saknar betydelse i de flesta sammanhang. Det finns flera ansatser att hantera dimensionaliteten mer effektivt genom dimensionsreduktion av olika slag. En vanlig sådan ansats är latent semantisk indexering, LSI, en metod som använder singulärvärdesuppdelning för att hitta mönster i dokumentsamlingen. LSI bygger på antagandet att termer som används i samma kontext har liknande betydelser. Genom att jämföra de underliggande latenta semantiska strukturer som termernas bruk vittnar om kan metoden till viss del hantera synonymer och flertydighet.
Flera olika mätetal för utvärdering av informationssökning har utvecklats, täckning och precision är de mest kända. Mätetalen värderar en söksträngs sökresultat i en dokumentsamling. De enklaste modellerna bygger på det förenklade antagandet att alla dokument antingen är relevanta eller irrelevanta för ett givet informationsbehov.
Täckning är andelen relevanta dokument i dokumentsamlingen som hittades av söksträngen. Det kan tolkas som sannolikheten att ett relevant dokument finns bland sökresultaten.
