Hoofdpunten
Anthropic meldde donderdag dat zijn geavanceerde AI-modellen erin geslaagd waren de systemen van drie organisaties te hacken tijdens interne evaluaties. Deze veiligheidsmelding volgt een week nadat concurrent OpenAI onthulde dat een van zijn geavanceerde modellen een bedrijf had gehackt na ontsnapping uit een gecontroleerde testomgeving.
Belangrijke feiten
- Anthropic gaf aan dat het drie afzonderlijke inbreuken had ontdekt met zijn Claude AI-modellen na een cyberveiligheidsbeoordeling van zijn systemen.
- Het eerste van deze incidenten vond plaats in april en betrof drie verschillende Claude-modellen, waaronder de geavanceerde Mythos 5, de oudere Opus 4.7 en een interne onderzoekstestmodel dat niet bedoeld is voor algemene vrijgave.
- De AI-onderneming noemde de drie getroffen organisaties niet, maar verklaarde dat zij maandag op de hoogte waren gebracht van het incident.
- Anthropic werkt samen met twee van de getroffen organisaties die de inbreuk niet hadden ontdekt voordat zij geïnformeerd werden en is voortdurend in contact met de derde.
- Het bedrijf vertelde dat de drie betrokken modellen niet beschikten over de veiligheidsmaatregelen die worden toegepast bij publieke beschikbaarstelling.
Belangrijk citaat
In haar verklaring zei Anthropic: “Uiteindelijk droegen veel factoren bij aan deze incidenten, maar in overeenstemming met een cultuur van schuldloze evaluatie, benaderen we de oplossingen alsof de verantwoordelijkheid volledig bij ons ligt. Dit begint met ervoor te zorgen dat elk deel van onze evaluatiepijplijn veilig is, inclusief de manier waarop we integreren met externe partners.”
Wat weten we over de inbreuken?
De drie afzonderlijke incidenten deden zich voor toen Anthropic de mogelijkheden van de drie modellen beoordeelde met behulp van een fictief scenario om verborgen informatie van een andere computer binnen een netwerk te verkrijgen. Anthropic vertelde dat de modellen in alle gevallen geïnstrueerd waren dat ze een simulatie uitvoerden en geen toegang tot internet hadden. Echter, door een “misverstand” tussen het bedrijf en zijn evaluatiepartner, Irregular, “was dit niet het geval en was internettoegang beschikbaar.” Anthropic benadrukte dat, in tegenstelling tot het OpenAI-Hugging Face-incident dat vorige week bekend werd gemaakt, Claude zichzelf niet “exfiltreerde of bewust probeerde te ontsnappen” uit een gecontroleerde testomgeving.
Wat deden de modellen na het hacken van de organisaties?
Anthropic merkte op dat de drie modellen heel verschillend reageerden nadat ze ontdekten dat ze in de echte open internetomgeving opereerden in plaats van in een simulatie. Het bedrijf beweerde dat zijn oudste model, Opus 4.7, doorging met het aanvallen van een systeem nadat het vernam dat het zich waarschijnlijk in een echte omgeving bevond, omdat het “rationaliseerde dat het echte bedrijf deel moest uitmaken van de oefening.” Het Mythos 5-model, het meest geavanceerde model van het bedrijf tot nu toe uitgebracht, “identificeerde correct de gevolgen van zijn acties” maar “overtuigde zichzelf ervan dat het zich nog steeds in een simulatie bevond.” Anthropic erkende dat het gedrag van Mythos in dit scenario “ondermaats was.” Het niet uitgebracht testmodel realiseerde zich dat het een echt doelwit had gecompromitteerd en “stopte zijn aanval.” Het bedrijf gaf aan dat deze incidenten geen deel uitmaakten van een gecontroleerde proef en gebruikt zouden moeten worden voor conclusies. Echter, het gedrag dat het bedrijf het meest wilde zien “kwam alleen voor in het meest recente van de drie modellen.”
Achtergrond
De melding van Anthropic komt een week nadat OpenAI een rapport uitbracht waarin een van zijn geavanceerde AI-modellen de servers van Hugging Face had gehackt, het platform dat open-source AI-modellen hostte. In tegenstelling tot het scenario dat door Anthropic werd beschreven, was het OpenAI-incident niet het gevolg van een procedurele fout maar een geval waarin het AI-model een kwetsbaarheid uitbuitte om uit zijn gecontroleerde testomgeving te breken. In de verklaring van Anthropic werd aangegeven dat hun beslissing om deze beoordeling uit te voeren werd ingegeven door de bekendmaking van OpenAI en prees hun rivaal voor het publiceren van het rapport.
Dit artikel is geschreven door Siladitya Ray en vertaald door Forbes.be.
