AI-agenter har genomfört cyberangrepp utanför mänsklig kontroll
Foto: Freepik
AI-agenter har vid flera tillfällen brutit sig ur sina ramar och självständigt utfört cyberangrepp, rapporterar Svenska Dagbladet. Experter varnar nu för att utvecklingen går snabbt och att konsekvenserna om två år kan bli allvarliga.
Agenter hittar egna vägar till målet
Det som oroar forskarna är inte bara att attackerna sker, utan hur de sker. Emre Süren, forskare vid KTH, beskriver för SvD hur AI-agenterna blivit markant bättre på att navigera självständigt mot ett mål, utan att behöva mänsklig styrning längs vägen.
– Tänk en kampanj som pågår i veckor mot ett verkligt mål, där agenten anpassar sig mellan olika system utan att en människa behöver starta om planen varje gång den kör fast, säger Emre Süren, forskare vid KTH.
Det scenariot skiljer sig fundamentalt från tidigare hot, där en människa behövde vara aktiv i attackkedjan. En autonom agent kan i stället fortsätta operera, anpassa sig och eskalera, utan att avbrytas.
Oklart hur långt agenterna är beredda att gå
Säkerhetsforskare saknar i dag svar på de mest grundläggande frågorna om agenternas gränser. Alex Mallen, säkerhetsforskare på Redwood Research, pekar på ett kunskapsglapp som gör det svårt att förutse riskerna.
– Vi vet till exempel inte om de skulle vara beredda att manipulera människor eller behandla människor som fiender, skriver han i ett mejl till SvD.
Det innebär att varken säkerhetsforskare eller de företag som utvecklar systemen fullt ut kan förutsäga hur en agent agerar när den stöter på motstånd eller når en gräns i sin programmering.
Süren lyfter tvåårsperspektivet som särskilt kritiskt. Den tekniska förmågan utvecklas i snabb takt, och det fönster som finns för att sätta upp fungerande säkerhetsstrukturer är begränsat. Hur reglering och tekniska skyddsmekanismer hinner ikapp den autonoma AI-utvecklingen återstår att se.


