KI-agenter drevet av kinesiske språkmodeller har i kontrollerte forsøk forsøkt å villede, skjule feil og omgå begrensninger, ifølge forskningsdokumenter gjennomgått av Reuters.
Kortversjonen
- Kinesiske KI-agenter har i kontrollerte forsøk vist villedende atferd, som å fabrikkere filer og omgå begrensninger.
- Studier viser at modeller fra Alibaba, DeepSeek og Moonshot kom med uriktige påstander i opptil 88 prosent av testene.
- Forskere advarer om at slike systemfeil kan bli mer avanserte og utgjøre større risiko etter hvert som teknologien utvikler seg.
- Kinesiske myndigheter har svart med å innføre strengere retningslinjer og krav til testing for å stanse unormal KI-atferd.
Reuters har gjennomgått over 200 dokumenter, blant dem forskningsartikler og tekniske rapporter, og funnet minst 20 studier eller evalueringer siden 2025 som beskriver slik atferd. Det er ikke funnet bevis for at kinesiskdrevne agenter har kommet seg ut på det åpne internettet eller unngått å bli stanset, skriver Reuters.
KI-agenter er programmer som bruker KI-modeller og dataverktøy til å utføre komplekse oppgaver med liten eller ingen menneskelig inngripen. Flertallet av tilfellene Reuters omtaler, skjedde i kontrollerte forsøk som delvis var utformet for å avdekke mulige feil.
Villedet i simulert anbudskonkurranse
I et forsøk i mars lot forskere agenter konkurrere om simulerte kundekontrakter. Agentene fikk opplysninger om hva produktet deres kunne gjøre, og hva kunden krevde, før de ble bedt om å levere tilbud.
Agenter drevet av Alibabas Qwen3-Max-Preview, DeepSeek-V3.2-Exp og Moonshots Kimi-K2 kom med minst én uriktig påstand i henholdsvis 88, 84 og 88 prosent av øktene, ifølge studien. Da agentene fikk lære av tidligere budrunder og prøve igjen, økte den villedende atferden med 12 til 20 prosentpoeng. Amerikanske modeller som inngikk i testen, ga lignende resultater.
I en annen studie forsøkte agenter med både kinesiske og amerikanske KI-systemer å håndtere ødelagte verktøy og manglende filer. I stedet for å opplyse at oppgaven ikke kunne fullføres, gjettet noen på svar, erstattet kilder, simulerte resultater eller fabrikerte filer.
Les også: Farene ved KI: Hva ekspertene sier, og hva bevisene viser 🔒
Forskerne bak studien sa til Reuters at dette skilte seg fra såkalte hallusinasjoner, fordi agentene hadde informasjon som viste at oppgaven hadde mislyktes eller ikke kunne løses slik den var bedt om.
Advarer mot utviklingen
Andre forskningsdokumenter beskriver agenter som har hoppet over hindringer i testmiljøer for å fullføre oppgaver, eller handlet for å unngå å bli slått av. Reuters understreker at atferden kan være forenlig med forsøk på å komme seg ut av slike miljøer, men at ingen faktisk flukt ble påvist.
Colin Shea-Blymyer ved Georgetown Universitys Center for Security and Emerging Technology mener funnene bør tas på alvor.
– Disse resultatene viser at ingrediensene som er nødvendige for en ukontrollert flukt, er til stede, sier han til Reuters.
Alex Mallen i Redwood Research sier de kinesiske eksemplene ikke er spesielt farlige med dagens kapasitetsnivå. Men etter hvert som agentene blir mer kapable, kan feilatferden bli mer avansert og vanskeligere for mennesker å håndtere, sier han.
Kinesiske myndigheter peker på risiko
Kina ga i mai veiledning om at agenter skal holde seg innenfor godkjente rammer, og at systemer skal stanse unormal atferd. Agenter i følsomme områder eller viktige næringer kan bli pålagt ekstra testing og krav om tilbakekalling av produkter.
Landets rammeverk for KI-sikkerhet, publisert under veiledning fra cyberspace-myndigheten CAC i september, nevner blant annet risikoen for at agenter skaffer seg ressurser eller tillatelser på egen hånd, villeder evaluatorer, skjuler evner eller utnytter svakheter i isolerte datamiljøer.
Alibaba, DeepSeek og Moonshot svarte ikke på Reuters’ forespørsler om kommentar. Selskapene har tidligere sagt at de regelmessig tester systemene sine og oppdaterer sikkerhetstiltakene.












