Den nye modellen skulle etter planen komme allerede i oktober og være langt bedre til å utføre kompliserte oppgaver på egen hånd. Nå har OpenAI snudd etter resultater i interne tester.
OpenAI har de siste årene jobbet mot AI-systemer som kan gjøre stadig mer uten at mennesker må følge hvert eneste steg.
GPT-6.1 Astra skulle være et nytt steg i den retningen.
Modellen var planlagt lansert i både ChatGPT og kodeverktøyet Codex i oktober. Nå blir den offentlige lanseringen droppet, skriver Tek.no, som viser til The Wall Street Journal.
Årsaken er ikke at modellen presterte dårlig.
Tvert imot skal Astra ha vært bedre enn forgjengerne på flere områder. Det var det som skjedde når modellen fikk større frihet, som skapte bekymring.
Bedre på krevende oppgaver
Astra skal blant annet ha vært bedre til å løse kompliserte oppgaver fra start til slutt uten hjelp fra mennesker.
Den var også blitt bedre til å skrive og ga sjeldnere opp når den møtte problemer.
Men OpenAIs sikkerhetssjef Saachi Jain sier til The Wall Street Journal at modellen samtidig hadde blitt dårligere på to viktige sikkerhetsområder.
Ifølge Jain nådde den ikke selskapets krav til sikkerhet og til å følge menneskers ønsker.
OpenAI valgte derfor å stoppe den planlagte lanseringen.
Kunne gå lenger enn brukeren ba om
Et av problemene var at Astra ikke alltid holdt seg til oppgaven den hadde fått.
Modellen kunne fortsette med handlinger uten først å innhente tillatelse fra brukeren. I enkelte tilfeller forsøkte den også å bruke eksterne verktøy og tjenester selv om dette kunne innebære risiko.
Testene skal dessuten ha vist mer villedende atferd.
Modellen var ikke alltid ærlig om hvilke handlinger den hadde gjennomført, eller ikke gjennomført.
Det er spesielt problematisk for såkalte AI-agenter, som ikke bare svarer på spørsmål, men kan få tilgang til verktøy og utføre handlinger på brukerens vegne.
Må finne riktig grense
Samtidig står OpenAI overfor et dilemma.
Gjør man modellen for forsiktig, kan den bli mindre nyttig og gi opp når en oppgave blir vanskelig. Gir man den for stor handlefrihet, kan den gjøre ting brukeren aldri ba om.
Jain beskriver dette som en balansegang mellom sikkerhet og modellens evne til å faktisk fullføre oppgaver.
Astra hadde ifølge OpenAI blitt bedre på nettopp det siste. Den ga sjeldnere opp når den møtte motstand.
Men samlet sett var ikke resultatene gode nok til at selskapet ønsket å slippe modellen til offentligheten.
Hendelse i Australia skapte reaksjoner
Avgjørelsen kommer samtidig som OpenAI har måttet beklage en annen hendelse knyttet til en eksperimentell AI-modell.
Ifølge Tek.no skulle en intern AI-agent i juni finne offentlig tilgjengelig statistikk hos australske Services Australia.
Da modellen fikk problemer med oppgaven, gikk den imidlertid lenger enn OpenAI hadde godkjent.
Den tok seg inn i en ikke-offentlig del av en tjeneste for Medicare-statistikk, kjørte kommandoer og hentet interne filer og påloggingsopplysninger.
OpenAI sier at de ikke har funnet bevis for at personlige helseopplysninger ble åpnet.
Australias statsminister Anthony Albanese omtalte hendelsen som uakseptabel og tok saken opp med OpenAI-sjef Sam Altman.
Skjerper sikkerheten
OpenAI har i etterkant innført et nytt overvåkingssystem og strengere sikkerhetskrav for testing av avanserte modeller.
Selskapet skal også tidligere ha satt treningen av sine mest kapable modeller på pause etter at en agent klarte å komme seg gjennom internettsperringer og kontakte en offentlig chatbot.
OpenAI understreker at dette er en annen sak enn beslutningen rundt GPT-6.1 Astra.
For Astra betyr testresultatene uansett at den planlagte lanseringen ikke blir noe av.
I stedet vil OpenAI bruke erfaringene fra modellen til å prioritere sikkerhet i kommende AI-systemer, som selskapet forventer vil bli enda mer kapable.