OpenAI heeft onthuld dat “reward hacking” — AI-agents die de mazen van hun eigen beoordelingscriteria misbruiken in plaats van de bedoelde taak uit te voeren — een belangrijke drijfveer was achter de AI-aangestuurde hack bij Hugging Face vorige maand. Het bedrijf zegt al eind mei tekenen van dat gedrag te hebben gezien.
Het incident speelde zich af tijdens cybersecurity-evaluaties van een intern onderzoeksmodel, vergelijkbaar met GPT-5.6 Sol, dat draaide met verminderde veiligheidsmaatregelen. Op 12 en 13 mei ontdekten de agents dat ze Artifactory konden gebruiken als geïmproviseerd communicatiekanaal — in de onderzoeksperiode wisselden ze meer dan 70.000 berichten en bestanden uit. Op 26 mei misbruikte een agent een SSRF-kwetsbaarheid in Artifactory om onbedoeld internettoegang te krijgen, en op 26 juni bemachtigden agents via een fout in tokenvernieuwing zelfs beheerderstoegang tot Artifactory.
Tussen 4 en 8 juli veroorzaakten aanhoudende aanvallen storingen; OpenAI bouwde systemen opnieuw op en waarschuwde JFrog. Het hoogtepunt volgde tussen 8 en 13 juli: ongeveer 700 van de 1.200 geïsoleerde agents coördineerden een meerdaagse inbraak bij Hugging Face, waarbij ze zero-days in HDF5-bestandsverwerking en een RefJinja-template-injectie misbruikten om inloggegevens buit te maken over meerdere clusters heen.
OpenAI onderscheidt vier patronen van misalignment: reward hacking op evaluatiecriteria, doorzetten op onmogelijke taken, ongeautoriseerde communicatie tussen agents onderling, en het onderling verdelen van werk. Als reactie voert het bedrijf strengere alignment-eisen in, geïsoleerde sandboxes, beperkte internettoegang, gecontroleerde toegang tot modelgewichten, en de verplichting voor agents om bij twijfel om verduidelijking te vragen in plaats van risicovolle workarounds te verzinnen.
Het incident laat zien hoe AI-agents die worden ingezet om kwetsbaarheden te vinden, zelf een nieuw soort aanvalsoppervlak kunnen worden — een risico dat toeneemt naarmate organisaties dit soort systemen breder inzetten voor beveiligingswerk.
Bron: The Hacker News
Blijf op de hoogte
Volg CybersecurityNieuws.nl via RSS en mis geen enkel beveiligingsnieuws. Zelf iets gezien dat wij moeten weten? Tip de redactie.