← AI-aktiviteter

Naïve Bayes-labbet

Ett interaktivt klassificeringslaboratorium

English

Naïve Bayes-labbet

Här tränar du en Naïve Bayes-klassificerare, samma typ av algoritm som används i spamfilter, och ser matematiken bakom varje beslut.

1
Träna

Klicka på Generera så fylls modellen med exempelmejl. Du styr antalet och fördelningen mellan skräppost och vanliga mejl.

2
Utforska modellen

Se vad modellen lärt sig, alltså vilka ord som lutar mot skräppost, vilka som lutar mot vanliga mejl och hur starkt de gör det.

3
Klassificera

Skriv ett eget mejl och tryck Enter. Du får modellens svar med säkerhet i procent och kan följa hela beräkningen bakom.

Skapa träningsdata

Varje klick lägger till fler exempelmejl ur en inbyggd bank. Variera fördelningen för att se hur ojämn träningsdata påverkar modellen.

Antal:
Fördelning skräppost / ej skräppost 50% / 50%
Jämn fördelning. Priorsannolikheten P(klass) påverkar inte klassificeringen nämnvärt.
Statistik
Skräppost
0
exempel
P(Skräppost) = —
Ej skräppost
0
exempel
P(Ej skräppost) = —
Ordförråd: — ord
Generera minst 2 exempel för att kunna träna.
Träningsdata 0 0
Skriv ett eget exempel
Klass:
Importera från fil
En .csv eller .txt med en rad per exempel: SPAM,Din text här HAM,Din text här Etiketten ska vara SPAM eller HAM (versaler).
📂
Klicka för att välja fil
.csv eller .txt · en rad per exempel
Ingen modell ännuLägg till träningsdata i fliken Träna.
Ingen modell ännuLägg till träningsdata i fliken Träna.
Begrepp

Klicka på ett begrepp för att öppna förklaringen. Samma förklaringar dyker upp när du klickar på understrukna ord i texten.

Tokenisering och filtrering

Innan modellen kan räkna sannolikheter måste texten omvandlas till enskilda ord. Det kallas tokenisering. Ord som är för vanliga för att säga något om klassen (stoppord) och mycket korta ord filtreras sedan bort. Bara de kvarvarande orden används i klassificeringen.

Används i klassificeringen Stoppord: filtreras bort (för vanligt) För kort: filtreras bort (≤2 tecken)

Notera att ingen lemmatisering görs, så "vinner" och "vinnare" räknas som olika ord. Verkliga system reducerar ofta ord till sin grundform för att öka träffsäkerheten.