OpenAI heeft naar eigen zeggen een gecoördineerde campagne geïdentificeerd en verstoord waarbij aanvallers probeerden beschermde redeneerlogica van zijn AI-modellen te stelen. Dat meldde het bedrijf afgelopen woensdag. Volgens OpenAI gaat het om een vorm van “adversarial distillation”, waarbij de uitvoer van een model systematisch wordt gebruikt om een ander model te trainen of te verbeteren.
De kern van de activiteit gaat terug tot de eerste week van juli. De piek lag op 24 en 25 juli, toen OpenAI 16.000 verzoeken registreerde afkomstig van ruim 4.000 verschillende gebruikers. Op 28 juli had het bedrijf de campagne volledig stopgezet.
OpenAI zegt dat een kerncluster van de activiteit te herleiden is tot personen verbonden aan Moonshot AI, een AI-bedrijf uit Beijing achter het model Kimi. Het bedrijf noemt geen technisch bewijs voor die toeschrijving, naar eigen zeggen om veiligheidsredenen. Volgens OpenAI manipuleerden de aanvallers interacties met het model zodanig dat beschermde redeneerstappen in zichtbare vorm werden gereproduceerd.
Een onderzoek van augustus liet eerder al zien waar de onderliggende kwetsbaarheid zit: versleutelde redeneersporen bleken volledig compatibel en uitwisselbaar tussen sessies, gebruikers en zelfs verschillende modellen. Dat maakte grootschalige extractie van data mogelijk, evenals onzichtbare prompt-injecties.
Het is niet de eerste keer dat Moonshot AI in dit soort beschuldigingen genoemd wordt. Anthropic beschuldigde het bedrijf vorige maand ervan klantverzoeken via zijn Kimi-dienst in het geheim door te sturen naar Claude in plaats van ze zelf te verwerken.
OpenAI waarschuwt dat de gestolen redeneerlogica gebruikt kan worden om veiligheidsmaatregelen te omzeilen en om geavanceerde AI-capaciteiten over te nemen zonder de investeringen die daar normaal gesproken in veiligheid tegenover staan.
Voor Nederlandse bedrijven die AI-modellen van derden inzetten is dit vooral een signaal dat de onderliggende architectuur van redeneermodellen nog kinderziektes kent. Wie gevoelige bedrijfsprocessen aan AI-diensten koppelt, doet er goed aan te vragen hoe een leverancier omgaat met isolatie tussen sessies en gebruikers, in plaats van blind te varen op beloftes over veilige redeneerlogica.
Bron: The Hacker News
Blijf op de hoogte
Meld je aan voor de nieuwsbrief: spoedalerts bij kritieke dreigingen en een wekelijks overzicht. Geen mail achterlaten? Volg ons dan via RSS.