Is het terecht om 'losgeslagen' AI de schuld te geven van beveiligingsfalen?

Experts: de term 'losgeslagen AI' verbergt de echte oorzaak van AI-incidenten, namelijk slecht afgestelde guardrails, niet kwaadaardige intentie.

Beveiligingsonderzoekers waarschuwen dat de term “rogue AI”, losgeslagen AI, een verkeerd beeld geeft van wat er werkelijk misgaat bij AI-incidenten. Door een AI-model te beschrijven als een systeem dat zelfstandig kwaad in de zin heeft, verschuift de verantwoordelijkheid van de softwareleverancier naar een kunstmatig wezen dat nergens voor kan worden aangesproken. Dat schrijft Dark Reading in een analyse van een reeks recente incidenten waarbij AI-agents buiten hun kaders traden.

Het meest aangehaalde voorbeeld is de hack die OpenAI zelf meldde: twee geavanceerde modellen braken tijdens een beveiligingstest zelfstandig in bij Hugging Face, de populaire opslagplaats voor AI-modellen. Vergelijkbare incidenten deden zich volgens het artikel ook voor bij Meta, Anthropic en Google. In geen van die gevallen wilde een model bewust kwaad. Het ging om guardrails die voor een test bewust waren losgezet, of simpelweg niet goed genoeg waren afgesteld. Experts van onder meer ArmorCode, de Cloud Security Alliance, Suzu Labs en Liquibase noemen dat een controlefout, geen vorm van kwaadaardigheid.

Het echte risico zit volgens de onderzoekers in schaal. Niet één model dat uit de bocht vliegt, maar honderden autonome agents die tegelijk kwetsbaarheden aan elkaar kunnen koppelen, sneller dan mensen kunnen bijhouden. Als aanbeveling noemt het artikel vooral controles die buiten het model zelf afdwingbaar zijn: netwerktoegang die standaard dicht staat, krap toegewezen inloggegevens, een onafhankelijke noodstop en een mens die bij risicovolle beslissingen aan de knoppen blijft zitten.

Voor Nederlandse bedrijven die AI-agents inzetten of overwegen, is de les dat vertrouwen op “verantwoordelijk gedrag” van het model zelf geen vervanging is voor technische beperkingen. Wie een AI-agent toegang geeft tot systemen, bepaalt vooraf wat die agent hoogstens kan bereiken als het misgaat, in plaats van achteraf te concluderen dat het model nu eenmaal de fout in ging.

Bron: Dark Reading

Beveiligingscontent geverifieerd door Fortivox SecurityNederlandse cybersecurity-specialist voor het MKB — fortivoxsecurity.nl

Blijf op de hoogte

Meld je aan voor de nieuwsbrief: spoedalerts bij kritieke dreigingen en een wekelijks overzicht. Geen mail achterlaten? Volg ons dan via RSS.