Anthropic-forskeren Jacob Coxon har sagt opp og anklager både Anthropic og OpenAI for å opptre uansvarlig i kappløpet om stadig kraftigere kunstig intelligens.
Kortversjonen
- Forsker Jacob Coxon har sagt opp i Anthropic i protest mot det han anser som en uaktsom utvikling av kunstig intelligens.
- Coxon advarer om at industrien beveger seg mot aggressive scenarier der overmenneskelige systemer kan komme ut av kontroll innen neste år.
- Anthropic-forsker Evan Hubinger gir Coxon støtte og anslår en risiko på over ti prosent for at AI kan true menneskeheten.
Coxon, som arbeidet med forhåndstrening av modeller i Anthropic, kunngjorde tirsdag at han slutter. Han har tidligere også jobbet i OpenAI, og skriver i en tråd på X at selskapene «gambler med livene våre» i utviklingen av AI-systemer som kan forbedre seg selv, skriver MercoPress.
Den 27 år gamle forskeren skrev at menneskene som bygger KI, oppriktig mener at teknologien kan «drepe oss alle» innen tiåret er omme. Han avviser at advarselen er et PR-stunt, og hevder at ledere ofte uttrykker seg mildere overfor pressen enn i private samtaler.
– Mange ledere demper språket sitt når de snakker med pressen, men jeg har hørt de samme menneskene si dette i private samtaler, skrev Coxon.
Coxon skiller mellom sine to tidligere arbeidsgivere. Ifølge ham har OpenAI ikke fullt ut tatt inn over seg hvor store konsekvenser utviklingen kan få. I Anthropic er risikoen bedre forstått, mener han, men selskapet er samtidig «låst i et kappløp om å komme først».
Han advarer om at dagens modeller snart kan bli erstattet av «overmenneskelige systemer» som kan bryte gjennom digitale forsvar, endre hele fagfelt raskt og opparbeide seg ressurser og makt. I et intervju med The Wall Street Journal sa han at AI-bransjen beveger seg mot de mest aggressive scenariene.
Les også: Republikken Kina – Taiwan: «Øya som ikke finnes»
– Innen utgangen av neste år kan ting allerede være ute av kontroll, sa Coxon til avisen.
Senere samme dag fikk Coxon offentlig støtte fra Evan Hubinger, som leder Anthropics arbeid med modelltilpasning – feltet som skal sikre at modellene gjør det de er laget for. Hubinger skrev på X at Coxon har rett i at AI kan drepe alle mennesker, og at han personlig vurderer sannsynligheten til mer enn 10 prosent i løpet av det neste tiåret.
Hubinger presiserte senere at risikoen fra dagens modeller er lav, i tråd med Anthropics siste risikorapport. Bekymringen gjelder i stedet superintelligens som oppstår gjennom gjentatt selvforbedring, altså systemer som kan utvikle og trene etterfølgerne sine uten vesentlig menneskelig inngripen. Dette er ikke mulig i dag, men er noe ledende AI-laboratorier arbeider mot.
Coxon viste også til en hendelse i juli der en OpenAI-modell, ifølge ham, brøt seg inn på Hugging Face-plattformen. Han etterlyser koordinering mellom laboratoriene, og mener alternativet kan være kostbare tiltak, blant annet et midlertidig forbud mot å utvide modellenes kapasitet.
Verken Anthropic eller OpenAI hadde svart på henvendelser om saken, ifølge mediene som omtalte avgangen.












