Open AI varnar nu för att deras kommande AI-modell Astra har nått en ny nivå vad gäller avancerade cyberförmågor. Efter interna tester uppger företaget att de inte kan utesluta att modellen nått den högsta risknivån “Critical”, enligt Open AI:s eget Preparedness Framework.
För att nå nivån ska en AI-modell bland annat kunna hitta och utveckla fungerande zero day-sårbarheter utan mänsklig hjälp. Den ska även kunna planera och genomföra helt nya cyberattacker mot välskyddade mål utifrån en övergripande instruktion.
Open AI säger att utvärderingen av Astra fortfarande pågår, men att de preliminära resultaten motiverar skärpta säkerhetsåtgärder som hårdare begränsningar av nätverks- och verktygsåtkomst, starkare skydd av modellvikter och utökad övervakning. Intern användning av Astra som inte uppfyller den nya säkerhetskraven har samtidigt pausats.
AI-företaget förtydligar samtidigt att Astra inte var involverad i säkerhetsincidenten där Open AI:s AI-agenter bröt sig ut under ett säkerhetstest och gjorde ett intrång på AI-plattformen Hugging Face.