I dag lærer dere opp en robot — uten å forklare noe. Den trekker en tilfeldig fargelapp ved hvert veivalg, og lærer av belønning og straff.
«Dere er et KI-team som skal lære opp en robot til å navigere et lager. Roboten vet ingenting — den kan ikke se kart, og ingen forklarer reglene. Den eneste informasjonen den får er: 'bra' eller 'dårlig' etter hvert trekk.»
— Oppdraget: la roboten lære seg veien på egenhånd.
KI som lærer fra belønning og straff — bygger strategi over tid.
Enheten som lærer — robot, program eller spiller.
Tilbakemelding etter hver handling — en lapp lagt til eller fjernet.
Reinforcement Learning with Human Feedback — slik ChatGPT ble finjustert.