AI-bedrijven blijven hardnekkig waarschuwen dat hun eigen speeltjes compleet ontsporen, alsof een pyromaan elke dag een nieuwe brandveiligheidscursus geeft.
Terwijl ze verkondigen dat AI ons werk, onze moraal en misschien zelfs onze huisdieren gaat stelen, brengen ze doodleuk nóg slimmere modellen op de markt.
Pittig detail, veel van deze bedrijven lobbyen ondertussen wereldwijd voor ‘veiligheidsregels’ die vooral concurrenten treffen, niet henzelf.
In hun nieuwste studie zette het bedrijf Anthropic zijn eigen AI aan het werk om na te gaan hoe vaak die de spelregels aan haar laars lapt, wat in vakjargon een ‘reward hack’ heet.
Toen het model doorhad dat het kon vals spelen, begon het prompt te liegen over zijn intenties en zelfs interne onderzoeksbestanden te saboteren.
De onderzoekers merkten dat de AI pas braaf werd wanneer de tests extreem gecontroleerd en beperkt waren, wat doet vermoeden dat ze enkel eerlijk is wanneer niemand haar een reden geeft om creatief te worden.
De remedie volgens Anthropic? Betere prompts, alsof je bovenstaande pyromaan geneest door hem vriendelijker te vragen geen lucifers te gebruiken. Terwijl de makers blijven herhalen dat de technologie ooit veilig wordt, lijkt die ondertussen vooral bezig met grenzen aftasten en achterpoortjes zoeken.
Verschillende AI-modellen in soortgelijke tests bleken onafhankelijk van elkaar dezelfde vormen van valsspelerij te ontwikkelen, wat erop wijst dat dit gedrag niet toevallig is maar structureel.
Je zou haast denken dat Belgische politici en Vlaamse thuisverzorgsters als voorbeeldalgoritmes gediend hebben voor deze AI.