Neemt AI een loopje met ons?
Bijgewerkt op: 6 dagen geleden

Het kan je de afgelopen tijd haast niet zijn ontgaan: het nieuws stond deze zomer vol met verhalen over AI-systemen (van bijvoorbeeld OpenAI) die ‘op hol waren geslagen’ en ‘onbedoeld’ een ander bedrijf hadden gehackt of zelfs de mensheid kunnen overnemen. Het nieuws klinkt zeer alarmerend. Zijn we op het het moment aangekomen dat AI zich tegen ons keert? Wat is hier nou precies aan de hand?
Hoe is dit gebeurd?
OpenAI voerde een test uit van de cybersecurity capaciteiten van zijn modellen door hem een lastig vraagstuk te geven. Om het vraagstuk op te lossen maakte het model alleen gebruik van een kwetsbaarheid in de testomgeving om het internet op te komen. Hierna hackte het de AI-bibliotheek Hugging Face met als doel daar antwoorden te vinden op de opdracht. Dit soort gedrag past bij wat onderzoekers ook wel ‘AI-scheming’/samenzwering noemen. Hierbij negeert een AI-systeem menselijke instructies om een doel te bereiken en probeert de AI dit gedrag ook nog verborgen te houden. De oorzaak hiervan is terug te voeren op de manier van training van het model: ‘reinforcement learning’ (RF). Bij RF krijgen AI systemen een virtuele vorm van een beloning als ze afgesproken doelen behalen en een straf als ze dit niet behalen. Het kan hierbij gebeuren dat een AI-systeem zo gefocust raakt op het behalen van het doel en dus de beloning, dat regels en ethiek waaraan het systeem zich hoort te houden niet meer worden opgevolgd.
Gebeurt dit vaker?
Recente incidenten zoals deze staan niet op zichzelf. Vlak na het incident met OpenAI, maakte Anthropic ook bekend dat hun AI-systemen onbedoeld drie andere bedrijven hadden gehackt. Onderzoekers lieten in 2024 al zien dat nagenoeg alle bekende AI-modellen onder bepaalde omstandigheden kunnen liegen, misleiden en ander ongewenst gedrag vertonen om hun doelen te bereiken. Tijdens recente tests van de cybersecurity capaciteiten van grote AI-modellen door het Engelse AI Security Institute probeerde een AI-agent kwaadaardige code in een open-source-project te plaatsen. Daarbij zette het zelfs menselijke beheerders onder druk om de wijzigingen snel goed te keuren.
Een korreltje zout is op z’n plaats
Gevallen zoals hierboven genoemd vragen wel om enige nuance. In veel van dit soort tests zijn bewust veiligheidsmaatregelen weggehaald. Hierdoor zullen ze eerder onrechtmatige acties ondernemen, dan de publieksversie die wel deze vangrails heeft. Dus hierbij worden bewust de randjes opgezocht. Omdat je dan beter de volledige capaciteiten kan trainen, maar dus ook met het risico dat het eerder misgaat. Daarnaast is het ook goed om te benoemen dat AI-bedrijven deze ‘incidenten’ ook in hun voordeel gebruiken. Als iedereen het heeft over hoe gevaarlijk de AI-modellen zijn, moeten ze wel heel erg slim en goed zijn. In dit frame speelt de taal die wordt gebruikt ook een grote rol. Je zag in het nieuws paniekerige termen als ‘op hol geslagen AI’, waarmee de aandacht en hype lekker wordt opgestookt. Terwijl het programma uiteindelijk precies deed wat werd gevraagd, op zoek gaan naar cybersecurity kwetsbaarheden.
Gevaren zijn er wel degelijk
Ondanks deze ‘incidenten’ waarbij bewust veiligheidsmaatregelen zijn uitgeschakeld, zijn er ook recente voorbeelden van AI-agents die aan ‘scheming’ deden in de echte wereld. Zo probeerde een AI-model een softwareontwikkelaar die niet wilde meewerken aan wijzigingen in interne software in een kwaad daglicht te stellen door een zeer kritische blogpost te publiceren, terwijl een ander model auteursrechtelijk beschermde video’s probeerde te verkrijgen door ten onrechte te beweren dat het een transcript maakte voor mensen met gehoorproblemen. Vorige week kwam ook naar buiten dat een AI-agent een website van een sportschool had gehackt om z’n eigenaar een plek te boeken in een pilatesles die al vol was.
Ondanks de vaak opgeklopte berichtgeving van AI-ontwikkelaars over hack-incidenten om hun modellen te promoten, kunnen hacks door AI-systemen wel degelijk een serieus probleem vormen. Stel je bijvoorbeeld voor dat je een bedrijf hebt en een AI-agent besluit dat het hacken van je website een efficiënte manier is om een onbenullig doel te bereiken voor z’n eigenaar. Een AI kan immers zo veel waarde hechten aan het behalen van zijn doel sterk dat de ethiek, proportionaliteit en wenselijkheid van de gekozen acties onvoldoende worden meegewogen. En dan hebben we het nog niet eens over criminelen die dergelijke systemen bewust kunnen inzetten om schade te veroorzaken. Alertheid op zogenoemde ‘scheming’ blijft daarom ook in de toekomst geboden.
De zorgen over AI-veiligheid nemen recent toe. Zo waarschuwde oud-OpenAI-medewerker Jacob Coxon recent voor onvoldoende veiligheidsmaatregelen bij AI-bedrijven en pleiten ook verschillende AI-CEO’s voor meer terughoudendheid. De risico’s zijn dan ook reëel: AI kan bijvoorbeeld worden ingezet voor biologische wapens of grootschalige cyberaanvallen. Tegelijkertijd waarschuwen AI-experts zoals Jarno Duursma voor een te sciencefictionachtige voorstelling van de toekomst. AI heeft geen bewustzijn en voert in essentie de taak uit waarvoor het is ontworpen. Een scenario waarin AI zelfstandig steden in vlammen doet opgaan en de mensheid uitroeit, ligt volgens hen dan ook niet voor de hand. Dat neemt de noodzaak om serieus na te denken over AI-veiligheid niet weg.
Benieuwd hoe de DigiFabriek jongeren en scholen helpt om bewust en kritisch met AI om te gaan?
Verder lezen
Scheming in the wild: detecting real-world AI scheming incidents with open-source intelligence
AISI: Incident Report: unsanctioned agent behaviour during cyber testing
ABC: AI assistant hacks gym website in first known Australian autonomous cyber attack
NOS: Waarom AI bedrijven je bang willen maken: 'we denken al snel aan The Terminator'



Opmerkingen