← Tillbaka till PII-detektorn

Guide – PII-detektor

Hur du använder tjänsten och vad som händer i bakgrunden.

Kom igång

  1. Ladda upp ett dokument Klicka på uppladdningsfältet eller dra ett dokument dit. Tjänsten stöder .txt, .pdf, .docx, .xlsx och .xls upp till 10 MB.
  2. Starta analysen Klicka på Analysera dokument. Dokumentet delas upp i meningar eller rader som sedan analyseras var för sig. Beroende på dokumentstorlek tar det några sekunder.
  3. Granska resultaten Varje mening som bedöms innehålla personuppgifter visas som ett kort. Den specifika uppgiften är markerad med gul bakgrund och fetstil. Om hela meningen är flaggad (ML-fall, se nedan) visas ett streck längs vänsterkanten.
  4. Lämna feedback Bedöm varje träff med 👍, 👎 eller ❓. Feedbacken sparas och används för att förbättra systemet.

Hur analyseras texten?

Dokumentet delas upp i segment — i huvudsak en mening eller tabellrad per segment. Varje segment skickas genom tre lager i tur och ordning. Om något lager flaggar segmentet markeras det som en träff.

regex

Regelbaserat lager

Söker efter väldefinierade mönster: personnummer, samordningsnummer, e-postadresser, telefonnummer, gatuadresser, IBAN, bankkontonummer och mer. Hög precision — vet exakt vilket ord som är träffen.

ner

Namnigenkänning (NER)

Använder en svensk språkmodell (spaCy sv_core_news_sm) för att identifiera personnamn. Kompletteras av mönsterregler för namn som föregås av fraser som "sökanden heter" eller "handläggare". Vet exakt vilka ord som är ett namn.

ml

Maskininlärning (ML)

En logistisk regressionsmodell tränad på svenska meningar bedömer om segmentets helhet innehåller personuppgifter — t.ex. kön + ålder i kombination. ML ger inget exakt ord utan flaggar hela meningen. Kan fånga indirekta personuppgifter som de andra lagren missar.

Konfidenspoäng

Varje träff får ett konfidenspoäng (0–100 %). Regex- och NER-regler ger höga poäng (85–100 %) eftersom mönstren är väldefinierade. ML-modellen returnerar en sannolikhet — träffar under 45 % filtreras bort.

Varför visas hela meningen ibland?

När ML är det enda lagret som flaggar ett segment saknas information om vilket specifikt ord som är problemet — modellen bedömer meningen som helhet. Sådana träffar visas med en gul vänsterkant och texten "ML-modellen flaggade hela segmentet" för att tydliggöra skillnaden.

Förstå träffkorten

Varje träff visas i ett kort med följande information:

Ge feedback

Din feedback hjälper till att förbättra systemet. Det finns tre alternativ:

👍 Korrekt 👎 Fel ❓ Osäker

Vad händer med feedbacken?

Varje analys sparas som en JSON-fil på servern med dokumenttexten, alla träffar och din feedback. Filerna kan sedan användas för att:

Stödda filformat

FormatTilläggKommentar
Oformaterad text.txtUTF-8, UTF-8 BOM eller Latin-1
PDF.pdfTextbaserade PDF:er; skannade dokument (bilder) stöds inte
Word.docxMicrosoft Word 2007 och senare
Excel (nytt format).xlsxMicrosoft Excel 2007 och senare; alla blad analyseras
Excel (gammalt format).xlsExcel 97–2003

Maximal filstorlek: 10 MB.

Integritet och datasäkerhet

All bearbetning sker lokalt på servern Ditt dokument skickas aldrig vidare till externa molntjänster, AI-APIer eller tredje part. Analysen utförs helt med lokala modeller.

Uppladdade dokument lagras inte på disk — de läses in i minnet, analyseras och kastas. Det som sparas är:

Tjänsten är en prototyp och inte juridiskt granskad. Den kan missa personuppgifter och kräver alltid manuell granskning innan dokumentet bedöms vara anonymiserat.