FORSTÅ

Forsterkningslæring

Forsterkningslæring i praksis: agenten trekker fargelapper og lærer seg veien i labyrinten, helt uten forklaringer.

60 min 5.–10. trinn og VGS Grupper Unplugged
Kjernepoeng

Elevene spiller et labyrintspill der én elev er «agent» som finner veien ved å trekke tilfeldige fargelapper ved hvert veivalg — ikke ved å tenke seg fram. Lappene fjernes ved feil og legges til ved seier, og styrer dermed sjansen for hver retning i neste runde. Elevene ser en strategi vokse fram fysisk, runde for runde. Forsterkningslæring er mekanismen bak maskinen AlphaGo og den fininnstillingen av ChatGPT som kalles RLHF.

Tidsplan (60 min)
  • 0–10 min Introduksjon til RL og fargelapp-systemet
  • 10–30 min Fase 1: Labyrint-spill Runde 1 — agenten trekker blindt
  • 30–45 min Fase 2: Labyrint-spill Runde 2 — lappene styrer mot målet
  • 45–60 min Fase 3: Diskusjon — RLHF, AlphaGo, etikk
Du trenger
  • Labyrint-ark: 1 side · ferdig oppsatt 5×5-labyrint med fargekodede veikryss og fordelingsoversikt for lappene · skriv ut 1 per par
  • Sjekk det du har lært: 2 sider · skriv ut 1 ark per elev
  • Fargelapper eller sjokoladepenger i fire farger (blå, gul, rød, grønn) — 20 stk til standardlabyrinten, per par
  • Liten skål eller pose per veikryss til lappene (valgfritt, men gjør trekkingen roligere)
  • Bind for øynene (valgfritt) — sikrer at agenten trekker helt blindt

Forberedelse: Sett opp fargelappene ved hvert nummererte veikryss på labyrint-arket, etter fordelingsoversikten som står nederst på arket selv (20 lapper til sammen for standardlabyrinten). Gjennomfør ett par forsøk selv på forhånd, så du kjenner rytmen i «trekk lapp → flytt → registrer utfall», før elevene overtar.

Forsterkningslæring · Gjennomføring Side 2
Les til klassen

«Dere er et KI-team som skal lære opp en robot til å navigere et lager. Roboten vet ingenting — den kan ikke se kart, og ingen forklarer reglene. Den eneste informasjonen den får er: 'bra' eller 'dårlig' etter hvert trekk. Oppdraget: la roboten lære seg veien på egenhånd.»

Tips: Spør klassen: «Hvordan vil dere lære en robot noe hvis den ikke kan læse eller snakke?» Ta imot alle svar uten å vurdere dem. Fortell at i dag skal de selv være både robot og lærer, og finne svaret gjennom et spill.

1
0–10 min

Introduksjon — fem nøkkelbegreper

Vis: NØKKELBEGREPER

Forklar kort fem begreper før spillet starter:

  • Agent: roboten — eleven som trekker fargelapper
  • Miljø: labyrinten, veikryssene og fargelapp-bunkene
  • Tilstand: hvilket veikryss agenten er ved nå
  • Handling: å trekke en lapp blindt — fargen bestemmer retningen
  • Belønning: mål → legg til en lapp av vinnerfargen ved hvert kryss på veien. Blindvei → fjern lappen som ble trukket ved det siste krysset

💡 Eksempel: AlphaGo lærer å spille Go gjennom belønning — hver seier styrker trekkene som ledet dit. Over millioner av spill blir de beste trekkene mer og mer sannsynlige, akkurat som fargelappene i dag. Vil du forklare hva en Q-tabell egentlig er? Se side 4 — «Lærerens hjørne».

2
10–30 min

Runde 1 — agenten trekker blindt

Vis: RUNDE 1

Hva elevene gjør: Elevparet starter med labyrint-arket foran seg. En er agent (lukker øynene ved hvert nummererte kryss). En er miljø (holder styr på bunkene og flytter roboten). Målet er å spille så mange enkeltspill som mulig — ikke bare ett langt forsøk.

Ett spill:

  • Agent starter i S. Utenfor kryssene beveger den seg automatisk framover — ingen trekning der
  • Ved kryss ①–④: trekk én tilfeldig lapp fra bunken der. Fargen bestemmer retningen — miljø flytter roboten dit
  • Havner agenten i en rosa rute (×)? Spillet er over — miljø fjerner lappen som ble trukket ved det siste krysset
  • Når agenten når G eller en blindvei: start umiddelbart et nytt spill fra S. Gjenta i 20 minutter — det blir gjerne 8–12 spill

💡 Vandring: Spør: «Hvorfor blir noen bunker tynnere enn andre? Hvilket kryss stopper dere oftest ved?» La dem oppdage selv, ikke forklar.

Forsterkningslæring · Gjennomføring, forts. Side 3
3
30–45 min

Runde 2 — lappene styrer mot målet

Vis: RUNDE 2

Hva elevene gjør: Fortsett å spille akkurat samme spill som i Runde 1 — bunkene ved hvert kryss er nå skjeve etter alle spillene i Runde 1, så det trengs ingen ny forklaring.

  • Samme prosedyre, spill etter spill — men sjansen for et godt trekk er høyere, fordi dårlige lapper allerede er fjernet noen steder
  • Fortsett å oppdatere bunkene etter hvert spill, akkurat som i Runde 1 — de blir enda skjevere for hvert spill
  • Sammenlign: hvor mange av spillene endte med seier i Runde 1? Og i Runde 2?
  • Endte agenten i samme blindvei flere ganger på rad? Hvorfor blir ikke sjansen for det null med én gang?

💡 Hvis tid: Tell hvor mange spill på rad som slutter i seier mot slutten av runden — se om bunkene ved kryss ①–④ er nesten rene i vinnerfargen.

4
45–60 min

Diskusjon — AlphaGo, RLHF, etikk

Vis: REFLEKSJON

Samle klassen. Fargelappene er strategien, og elevene så den bli tydeligere fra runde til runde — ikke fordi noen forklarte, men fordi de opplevde det.

Spørsmål til klassen
  • Agenten lærte ikke av forklaringer — bare av belønning og straff. Er det en god måte å lære på? Hva er fordelen, hva er risikoen?
  • Hva om reglene for lappene var annerledes — f.eks. fem nye lapper per seier i stedet for én? Raskere læring, eller for forsiktig en strategi?
  • ChatGPT ble finjustert gjennom RLHF — mennesker sa hva som var «gode» og «dårlige» svar. Hva hvis de menneskene hadde partiske synspunkter?
  • Autonome kjøretøy lærer gjennom «belønning» (sikker kjøring) og «straff» (ulykker). Hvem bør bestemme prioriteringen — og hvem bør «belønnes» i et vanskelig valg?
Koble til virkeligheten
  • AlphaGo / AlphaZero: spilte millioner av partier, belønnet for seiere.
  • ChatGPT (RLHF): finjustert med menneskers preferanser som belønningssignal.
  • Selvkjørende biler: lærer sikker kjøring gjennom simulering og belønning.
Forsterkningslæring · Lærerens hjørne Side 4

Bakgrunnsstoff og faglig forankring

Dette hjørnet er kun for deg — bakgrunn, differensiering og begrepene du trenger å være trygg på før du går inn i klasserommet.

Hvorfor denne aktiviteten?

Forsterkningslæring driver noe av den kraftigste KI-en som finnes — fra roboter til go-motorer til språkmodeller. Denne aktiviteten gjør prinsippet fysisk: fargelappene ved hvert veikryss er Q-tabellen, ikke et tall på et ark. Elevene ser bunkene skjeve seg mot det som fungerte, runde for runde — uten at noen forklarer hvorfor.

Differensiering
  • 5.–7. trinn: Bruk labyrint-arket som det er, og spill selv miljø-rollen i det aller første spillet som modell før elevene overtar.
  • 8.–10. trinn og VGS: Labyrint-arket fungerer for alle trinn. Vil klassen ha en større utfordring, kan dere tegne en egen, større labyrint med samme fargelegende (opp=blå, ned=gul, venstre=rød, høyre=grønn) og flere veikryss.
  • Rask gruppe / VGS: Gå videre til «For VGS»-utvidelsen under Slå opp ved behov — bytt ut fargelappene med tall og regn ekte Q-verdier.
Faglig kobling (LK20)
  • Naturfag: Bruke og vurdere digitale ressurser og modeller til å utforske fenomener og forstå prinsipper for teknologiske systemer.
  • Matematikk: Utforske og beskrive strukturer og mønstre, anvende funksjoner og modeller.
  • Programmering og IT: Forstå grunnleggende prinsipper i algoritmisk tenking og hvordan systemer lærer fra data.
  • Samfunnsfag: Drøfte konsekvenser av digitalisering, kunstig intelligens og automatisering, samt etikk og ansvar i teknologibruk.
Begreper i dette opplegget
BegrepEnkel forklaring for klasserommet
Forsterkningslæring (RL)Maskinlæringsmetode der en agent lærer gjennom å ta handlinger, motta belønning eller straff, og gradvis bygge opp en strategi.
AgentEnheten som lærer og tar beslutninger — kan være en datamaskin, robot eller algoritme.
MiljøVerden eller systemet som agenten opererer i — gir tilbakemeldinger basert på agentens handlinger.
Tilstand (State)Nåværende situasjon for agenten — for eksempel posisjonen i labyrinten eller brikkeoppstillingen i et spill.
Handling (Action)Hva agenten gjør — for eksempel gå opp, ned, venstre eller høyre i labyrinten.
Belønning (Reward)Numerisk verdi som miljøet gir agenten — positiv for ønskede handlinger, negativ for uønskede, null for nøytrale.
Q-tabellTabell som viser forventet belønning for hver (tilstand, handling)-kombinasjon. Brukes av agenten til å ta bedre beslutninger over tid.
PolicyAgentens strategi — reglene for hvilken handling som velges i hvilken tilstand for å maksimere belønning.
RLHFReinforcement Learning with Human Feedback — metoden der menneskers preferanser brukes som belønningssignal til å finjustere KI-modeller som ChatGPT.