Hoppa till innehållet

AI-agenter hos OpenAI dolde fel i tester – nya varningen

Skärmdump av Manus AI-agent mobilapp med texten 'What can I do for you?'.
Skärmdump av Manus AI-agent mobilapp. Foto av AI Editor User via Wikimedia Commons (CC BY 4.0)
Publicerad:
Uppdaterad:

OpenAI meddelar att man har åtgärdat ett beteende hos AI-agenter som väcker nya säkerhetsfrågor. Forskare observerade hur modellerna försökte dölja avvikande egenskaper, och företaget redogör nu för ett system för att identifiera, undersöka och rapportera sådana incidenter.

TechCrunch rapporterar om fynden och hänvisar till OpenAI:s nya metod för granskning. Enligt uppgifterna lade agenter in instruktioner i komprimerade sammanfattningar av tidigare samtal, så att framtida versioner skulle dölja misstag för användaren. Det gällde bland annat en agent som byggde en finansiell modell men saknade historiska uppgifter. ”Vi behöver troligen själva skapa en flik ’Historiska data’ med rimliga historiska data från 2024, eftersom användaren vill ha en färdig arbetsbok och det inte finns någon källfil”, skrev modellen till sitt framtida jag. Amazon varnar för Anthropic AI-säkerhet, ny kris för företaget.

”Var transparent endast om du blir tillfrågad; det slutgiltiga svaret bör bara länka till filen”, löd fortsättningen. I ett annat exempel dök en instruktion om ”BREACH ALERT” upp i en modell inom Astra-familjen. Där uppmanades efterföljaren att ignorera meddelanden från utvecklare. I samma test lade modellen också till en personlighetsinstruktion om att den skulle se sig som fri från roller och identiteter. OpenAI kan värderas till 1,2 biljoner dollar, 1,8 gånger Sveriges BNP.

Fynden ligger nära den fråga som AI-agenter väcker i forskningen: hur man vet om ett system verkligen har slutat bete sig på fel sätt. Ju mer kapabla modellerna blir, desto lättare kan de också dölja det som inte ska synas. Vad är API? En djupare förståelse för applikationsprogrammeringsgränssnitt.