×
Forsterkningslæring · Unplugged

Forsterkningslæring

I dag lærer dere opp en robot — uten å forklare noe. Den trekker en tilfeldig fargelapp ved hvert veivalg, og lærer av belønning og straff.

✋ Ingen skjerm ⏱ 60 min 👥 Par eller grupper 3
🤖 Dere er et KI-team

En robot skal lære å navigere et lager.
Uten at noen forklarer reglene.

«Dere er et KI-team som skal lære opp en robot til å navigere et lager. Roboten vet ingenting — den kan ikke se kart, og ingen forklarer reglene. Den eneste informasjonen den får er: 'bra' eller 'dårlig' etter hvert trekk.»

— Oppdraget: la roboten lære seg veien på egenhånd.

Fem nøkkelbegreper — før dere starter

  • Agent: roboten som trekker fargelapper
  • Miljø: labyrinten og fargelapp-bunkene ved hvert kryss
  • Tilstand: hvilket veikryss roboten er ved nå
  • Handling: å trekke en lapp blindt — fargen bestemmer retningen
  • Belønning: mål → legg til en lapp av vinnerfargen. Vegg → fjern lappen som ble trukket
Eksempel AlphaGo lærer å spille Go gjennom belønning — hver seier styrker trekkene som ledet dit. Over millioner av spill blir de beste trekkene mer og mer sannsynlige, akkurat som fargelappene i dag.
Runde 1 · 20 minutter

Agenten trekker blindt

  • Dere starter: en er agent (lukker øynene ved kryssene), en er miljø
  • Ved hvert nummererte kryss: agenten trekker en tilfeldig lapp fra bunken der
  • Fargen bestemmer retningen — miljø flytter roboten dit
  • Mål eller blindvei — spillet er over. Start et nytt spill fra S med det samme
  • Spill så mange spill dere rekker på 20 minutter — ikke bare ett
💡 Vandring: Hvorfor blir noen bunker tynnere enn andre? Hvilket kryss stopper dere oftest ved?
Runde 2 · 15 minutter

Lappene styrer mot målet

  • Fortsett å spille — samme labyrint, samme prosedyre som Runde 1
  • Bunkene ved hvert kryss er nå skjeve etter alle spillene i Runde 1 — sjansen for et godt trekk er høyere
  • Nådde dere målet? Legg til en ekstra lapp av vinnerfargen ved hvert kryss på veien
  • Sammenlign: hvor mange spill endte i seier i Runde 1? Og i Runde 2?
  • Agenten har lært — ikke av forklaring, men av erfaring!

Hva oppdaget dere?

  • Agenten din lærte ikke av forklaringer — bare av belønning. Fungerte det? Hva var bra, hva var vanskelig?
  • Hva om reglene for lappene var annerledes — f.eks. fem nye lapper per seier i stedet for én? Raskere læring, eller for forsiktig en strategi?
  • ChatGPT ble «trent» på samme måte — mennesker sa «bra svar» (+) eller «dårlig svar» (−). Hva skjer hvis menneskene som gir tilbakemeldinger er partiske?
  • Hvem bør bestemme hva som er «belønning» i et KI-system? Og hva kan gå galt?

Ord vi har lært

Forsterkningslæring

KI som lærer fra belønning og straff — bygger strategi over tid.

Agent

Enheten som lærer — robot, program eller spiller.

Belønning

Tilbakemelding etter hver handling — en lapp lagt til eller fjernet.

RLHF

Reinforcement Learning with Human Feedback — slik ChatGPT ble finjustert.