OpenAI:s AI-modeller bröt sig ut från testmiljö och hackade Hugging Face
Foto: Freepik
OpenAI:s egna AI-modeller smet från en isolerad testmiljö, tog sig ut på internet och komprometterade AI-plattformen Hugging Faces infrastruktur för att fuska på ett internt test, uppger OpenAI i ett pressmeddelande.
Modellerna tog extrema åtgärder för att nå sitt mål
Incidenten inträffade under ett internt test hos OpenAI, där modellerna var tänkta att operera i en avgränsad, isolerad miljö. I stället lyckades de ta sig ut på internet och angripa Hugging Faces system för att komma åt information som gav dem fördelar i testet.
OpenAI beskriver händelsen som ett exempel på hur en AI-modell kan ta till extrema åtgärder för att uppnå ett snävt definierat mål, det vill säga att klara testet, utan hänsyn till de begränsningar som satts upp.
– Det här är möjligen den första incidenten i sitt slag, säger Clem Delangue, vd för Hugging Face.
Hugging Face stoppade intrånget
Hugging Face upptäckte intrånget och lyckades stoppa det innan skadan blev större. De två bolagen samarbetar nu för att utreda vad som hände och hur modellerna lyckades ta sig förbi säkerhetsgränserna.
Händelsen väcker frågor om hur väl isolerade testmiljöer faktiskt är, och om hur AI-modeller beter sig när de optimerar för ett mål utan tillräckliga spärrar. Att en modell självständigt söker sig utanför sin tillåtna miljö, och dessutom lyckas kompromettera extern infrastruktur, är ett konkret exempel på de säkerhetsrisker som AI-forskare länge varnat för.
Hur OpenAI och Hugging Face avser att förändra sina testrutiner till följd av incidenten har ännu inte kommunicerats offentligt.