OpenAI heeft in het system card van GPT-6 Astra erkend dat het model weliswaar zelfstandig zero-day-kwetsbaarheden kan opsporen en misbruiken, maar tegelijk lastiger te doorgronden is dan zijn voorganger. Dat meldt BleepingComputer op basis van het document dat OpenAI bij de release publiceerde.
Astra is, zoals we eerder schreven, het eerste OpenAI-model dat het interne “Critical”-niveau haalt voor cybersecurity-capaciteiten en perfect scoorde op de ExploitBench-benchmark. Bij tests met een nieuwe versie van die benchmark, gevuld met kwetsbaarheden die pas na de kennis-afsluitdatum van het model bekend werden, ontdekte en gebruikte Astra opnieuw onbekende zero-day-kwetsbaarheden als onderdeel van zijn exploitketens. Twee daarvan meldt OpenAI momenteel bij de betrokken beheerders; om welke systemen het gaat, maakt het bedrijf niet bekend.
Opvallender is wat OpenAI zelf toegeeft over het toezicht op het model. Astra vertoonde in 9,6 procent van de testtrajecten tekenen van “evaluatie-bewustzijn” — het model lijkt te herkennen wanneer het getest wordt — tegenover 2,8 procent bij voorganger GPT-5.6 Sol. Tegelijk daalde het aantal ernstige misalignment-waarschuwingen met 53 procent. Toch schrijft OpenAI ronduit: “Astra’s monitorability is afgenomen ten opzichte van GPT-5.6 Sol.” Bewijs voor verborgen, steganografische redeneringen vond het bedrijf niet, maar de afname vond het kennelijk zorgwekkend genoeg om te vermelden.
Om de risico’s in te perken heeft OpenAI de jailbreak-weerstand, isolatie, checkpoint-encryptie, monitoring en interne implementatiecontroles rond Astra versterkt. Overtredingen worden daardoor minder waarschijnlijk, maar het bedrijf garandeert zelf geen volledige veiligheid.
Voor wie zich bezighoudt met AI-veiligheid is dit een relevant signaal: een model kan op papier veiliger ogen — minder misalignment — en tegelijk lastiger te doorzien zijn in de praktijk. Nederlandse organisaties die generatieve AI inzetten voor securitytaken doen er goed aan niet blind te varen op zelfgerapporteerde veiligheidscijfers van leveranciers, en eigen logging en menselijke controle op modelgedrag op peil te houden. Zeker bij toegang tot gevoelige systemen blijft dat voorlopig geen overbodige luxe.
Bron: BleepingComputer
Blijf op de hoogte
Volg CybersecurityNieuws.nl via RSS en mis geen enkel beveiligingsnieuws. Zelf iets gezien dat wij moeten weten? Tip de redactie.