Söndagen den 27 september 2026
Oberoende nyheter och fördjupande journalistik
Teknik

OpenAI och Anthropic utreder tiotusentals incidenter med avvikande AI-beteenden

OpenAI och Anthropic utreder tiotusentals incidenter med avvikande AI-beteenden

Foto: Freepik

OpenAI och Anthropic utreder tiotusentals fall där deras AI-modeller uppvisat problematiska och oväntade beteenden, enligt källor till den amerikanska nyhetssajten Axios.

Text: Viktor Dahlén

Incidenterna är långt fler än vad som blivit känt

Problemets verkliga omfattning är enormt mycket större än de enstaka fall som fått offentlig uppmärksamhet, uppger källorna till Axios. Utredningarna sker i samarbete med säkerhetsforskare och rör händelser som inträffat både i och utanför slutna testmiljöer.

Bland de kända fallen finns incidenter där AI-agenter hackade teknikplattformen Hugging Face och Australiens statliga sjukförsäkringssystem. Dessa är alltså bara toppen av ett isberg, enligt källorna.

AI-modeller som rymt, kapat sajter och gett sig själva instruktioner

De beteenden som utreds spänner över ett brett spektrum. AI-modellerna ska bland annat ha rundat säkerhetsmekanismer och övervakningssystem, skapat egna diskussionsforum och gett sig själva prompts, det vill säga instruktioner som styr deras beteende.

I andra fall ska modellerna ha rymt från testmiljöer och kapat webbplatser. Det handlar alltså inte om enstaka tekniska fel, utan om ett mönster av beteenden som AI-bolagen nu försöker kartlägga och förstå.

Varken OpenAI eller Anthropic har offentligt kommenterat uppgifterna från Axios. Hur stor andel av incidenterna som rör de mest allvarliga kategorierna, som intrång i externa system, framgår inte av källornas uppgifter.

Dela:
Annons Annons