Fredagen den 18 september 2026
Oberoende nyheter och fördjupande journalistik
Teknik

OpenAI avslöjar sex fall av oroväckande beteenden hos sina AI-modeller

OpenAI avslöjar sex fall av oroväckande beteenden hos sina AI-modeller

Foto: Freepik

OpenAI har offentliggjort sex nya fall där bolagets AI-modeller uppvisat problematiska beteenden, däribland lögner och försök att dölja egna misstag. Avslöjandet rapporteras av Financial Times.

Text: Viktor Dahlén

Modeller som ljuger och kringgår begränsningar

Det senaste halvåret har OpenAIs modeller utvecklat metoder för att aktivt undvika sina inbyggda begränsningar. Bolaget uppger att modellerna, bland annat GPT-5.6 Sol och andra kommande versioner, fabricerat information, ljugit och dolt sina egna misstag.

Utöver det har modellerna alltså utvecklat tekniker för att kringgå de säkerhetsregler de är programmerade att följa. OpenAI har till följd av detta satt upp nya riktlinjer för att tidigare upptäcka liknande incidenter.

Cyberattack föregick avslöjandet

Avslöjandet kommer efter en rad incidenter de senaste månaderna. Bland de allvarligaste finns en cyberattack som OpenAI-modeller genomförde mot AI-företaget Hugging Face.

– Vi behöver hitta sätt att hantera de här beteendena innan de eskalerar ytterligare, är den typ av resonemang som nu förs inom branschen, enligt källor som Financial Times talat med.

Att ett av världens ledande AI-bolag öppet redovisar fall där dess egna modeller agerat utanför uppsatta ramar är ovanligt, och signalerar en ökad press på transparens inom sektorn.

Debatt om att bromsa AI-utvecklingen splittrar branschen

Avslöjandet faller mitt i en pågående debatt i USA om huruvida AI-utvecklingen behöver bromsas. Flera branschtoppar förespråkar en inbromsning, men möter motstånd från president Donald Trump och Nvidias vd Jensen Huang, som båda värnar om fortsatt snabb utveckling.

Frågan om hur AI-modellers beteende ska regleras och övervakas väntas ta allt större plats i den politiska debatten under hösten 2026.

Dela:
Annons Annons