Hur du använder tjänsten och vad som händer i bakgrunden.
Dokumentet delas upp i segment — i huvudsak en mening eller tabellrad per segment. Varje segment skickas genom tre lager i tur och ordning. Om något lager flaggar segmentet markeras det som en träff.
Söker efter väldefinierade mönster: personnummer, samordningsnummer, e-postadresser, telefonnummer, gatuadresser, IBAN, bankkontonummer och mer. Hög precision — vet exakt vilket ord som är träffen.
Använder en svensk språkmodell (spaCy sv_core_news_sm) för att identifiera personnamn. Kompletteras av mönsterregler för namn som föregås av fraser som "sökanden heter" eller "handläggare". Vet exakt vilka ord som är ett namn.
En logistisk regressionsmodell tränad på svenska meningar bedömer om segmentets helhet innehåller personuppgifter — t.ex. kön + ålder i kombination. ML ger inget exakt ord utan flaggar hela meningen. Kan fånga indirekta personuppgifter som de andra lagren missar.
Varje träff får ett konfidenspoäng (0–100 %). Regex- och NER-regler ger höga poäng (85–100 %) eftersom mönstren är väldefinierade. ML-modellen returnerar en sannolikhet — träffar under 45 % filtreras bort.
När ML är det enda lagret som flaggar ett segment saknas information om vilket specifikt ord som är problemet — modellen bedömer meningen som helhet. Sådana träffar visas med en gul vänsterkant och texten "ML-modellen flaggade hela segmentet" för att tydliggöra skillnaden.
Varje träff visas i ett kort med följande information:
Din feedback hjälper till att förbättra systemet. Det finns tre alternativ:
Varje analys sparas som en JSON-fil på servern med dokumenttexten, alla träffar och din feedback. Filerna kan sedan användas för att:
| Format | Tillägg | Kommentar |
|---|---|---|
| Oformaterad text | .txt | UTF-8, UTF-8 BOM eller Latin-1 |
| Textbaserade PDF:er; skannade dokument (bilder) stöds inte | ||
| Word | .docx | Microsoft Word 2007 och senare |
| Excel (nytt format) | .xlsx | Microsoft Excel 2007 och senare; alla blad analyseras |
| Excel (gammalt format) | .xls | Excel 97–2003 |
Maximal filstorlek: 10 MB.
Uppladdade dokument lagras inte på disk — de läses in i minnet, analyseras och kastas. Det som sparas är:
feedback.db).training_data/ på servern, innehållande dokumenttexten och feedback. Dessa används enbart för att förbättra systemet.Tjänsten är en prototyp och inte juridiskt granskad. Den kan missa personuppgifter och kräver alltid manuell granskning innan dokumentet bedöms vara anonymiserat.