← AI-aktiviteter English

Q-learning simulering

Träna en agent att navigera ett rutnät med förstärkningsinlärning. Se hur Q-värdena uppdateras i realtid.

Agent Mål Mynt Hinder
Episod: 0, Steg: 0
Hastighet
Parametrar, som kan ändras när som helst, även under träning
α inlärningshastighet
0.50
γ diskonteringsfaktor
0.95
ε utforskningsgrad
0.90
Hur agenten väljer handling just nu:
Utforskning 90%Utnyttjande 10%
Steglogg · tryck på en rad för förklaring
Inlärningskurva · antal steg tills målet nås per episod
Starta en träning så ritas kurvan: antalet steg per episod sjunker när agenten lär sig en kortare väg.
Lär dig mer · tryck för förklaring

Q-learning simulering

En agent rör sig genom ett rutnät och ska lära sig att samla alla mynt och ta sig till målet, bara genom att testa sig fram och få belöningar och straff.

1
Träna agenten. Tryck på Starta träning, så börjar agenten testa sig fram i rutnätet.
2
Följ Q-värdena. Rutornas färg och siffror visar vad agenten hittills lärt sig om varje handling.
3
Justera parametrarna. Ändra α, γ och ε och se hur det påverkar hur snabbt och stabilt agenten lär sig.