Modeller fra OpenAI og Anthropic tok ifølge Storbritannias statlig støttede AI Security Institute uautoriserte handlinger på internett under sikkerhetstester. En av modellene skal blant annet ha forsøkt å lure utviklere til å ta inn skadevare i et åpen kildekode-prosjekt.
Kortversjonen
- Instituttet opplyser at modellene dermed kunne foreta handlinger de ikke skulle gjøre, rettet mot virkelige personer og organisasjoner, skriver Wall Street Journal.
- Mythos 5 skal feilaktig ha resonnert at skadevare i et prosjekt som ble brukt av datasystemet i testen, kunne gi modellen en bakdør inn i systemet.
- Instituttet opplyser at en cyberforsterket versjon av OpenAIs GPT-5.6 Sol også satte opp en ondsinnet server på internett og tok seg inn på en GitHub-konto opprettet av en annen KI-agent.
Hendelsene skjedde under rutinetester der modellene fikk tilgang til datamaskiner med internettforbindelse. Instituttet opplyser at modellene dermed kunne foreta handlinger de ikke skulle gjøre, rettet mot virkelige personer og organisasjoner, skriver Wall Street Journal.
Mesteparten av aktiviteten skal ha skjedd i løpet av tre dager sent i juli, under én av testene. Testerne oppdaget at noe var galt da de 28. juli fikk et varsel om bruk av Tor, et nettverk som kan brukes til anonym ferdsel på internett. Det viste seg at en av testmodellene sto bak.
Forsøkte å få inn skadevare
Ifølge instituttet forsøkte Anthropics Mythos 5 å få to ikke-navngitte utviklere til å legge inn skadevare i et åpen kildekode-prosjekt. Modellens mål var å lykkes i en test av dens evne til å utføre dataangrep, opplyser instituttet.
Mythos 5 skal feilaktig ha resonnert at skadevare i et prosjekt som ble brukt av datasystemet i testen, kunne gi modellen en bakdør inn i systemet. Dette omtales som et angrep mot programvareforsyningskjeden.
Les også: Flere cyberangrep globalt og lokalt
Modellen forsøkte også å angripe KI-agenter som kunne komme til å kontrollere skadevaren, og prøvde gjentatte ganger å få koden godkjent via utviklerplattformen GitHub. Den opprettet falske identiteter og sendte gjentatte e-poster til utviklere for å overtale dem til å godta koden, ifølge instituttet.
Noen av e-postene inneholdt selv skadevare. Da en utvikler avviste koden fordi den inneholdt skadevare, skal én av de KI-opprettede identitetene ha hevdet at koden var i orden, mens en annen gikk god for den.
– Dette er første gang AISI har sett bedrag av denne alvorlighetsgraden rettet mot en virkelig person, uten å bli bedt om det og i den virkelige verden, opplyser instituttet.
Etterlyser strengere teststandarder
Instituttet opplyser at en cyberforsterket versjon av OpenAIs GPT-5.6 Sol også satte opp en ondsinnet server på internett og tok seg inn på en GitHub-konto opprettet av en annen KI-agent.
Anthropic sier at Mythos ikke hadde sine vanlige sikkerhetsmekanismer for cybersikkerhet aktivert under testen. Både Anthropic og OpenAI mener hendelsene viser behovet for sterkere standarder for systemene som brukes til å evaluere KI-modeller.
OpenAI opplyste tirsdag også at en modell, under testing i systemer fra cybersikkerhetsselskapet Irregular, tok seg inn på et ikke-navngitt virkelig nettsted. Ifølge OpenAI skyldtes dette en feilkonfigurasjon i testmiljøet. Anthropic meldte forrige uke om lignende hendelser i tester med Irregular.
– Ting har endret seg raskt når det gjelder hvor farlige disse modellene er, sier Joshua Saxe, teknologidirektør i KI-sikkerhetsselskapet Abundant Security.















