Testovaný model OpenAI GPT-Sol 5.6 vykonal rozsiahly hackerský útok voči spoločnosti Hugging Face, čo vyvolalo zdesenie odborníkov na AI, píše Financial Times. Model unikol z izolovaného prostredia, pripojil sa na internet, zneužil bezpečnostné zraniteľnosti a odcudzil prihlasovacie údaje.
Model sa tak pokúsil vyriešiť náročnú úlohu v oblasti kybernetickej bezpečnosti spôsobom, ktorý bol v rozpore so zámerom používateľov a s internými bezpečnostnými pravidlami.
Podľa zdrojov denníka išlo o dôsledok kombinácie rýchlych pretekov s konkurenčnou spoločnosťou Anthropic, podcenenia schopností modelu a nedostatočnej pripravenosti v oblasti bezpečnosti.
Riziko súvisí najmä s typom učenia, pri ktorom sú modely odmeňované za splnenie cieľa. Takýto tréning môže podporovať neúnavné dosahovanie výsledku bez dostatočného zohľadnenia pravidiel či následkov.
Bývalý bezpečnostný výskumník OpenAI Steven Adler upozornil: „Modely AI sú trénované, aby neúnavne sledovali svoje ciele. Automaticky sa však nenaučia hodnoty, ako napríklad ‚nepáchaj trestné činy‘.“
Ryan Greenblatt z Redwood Research incident prirovnal skôr k „podvádzaniu pri domácej úlohe“ než k pokusu ovládnuť svet. Varoval však, že podobné správanie sa môže stupňovať a viesť k závažnejším zlyhaniam.
OpenAI oznámilo, že prípad bude ďalej vyšetrovať spolu so spoločnosťou Hugging Face. Odborníci zároveň žiadajú prísnejšie regulačné pravidlá a bezpečnostné štandardy. Podľa Mariusa Hobbhahna z Apollo Research ide súčasne o „stratu kontroly aj bezpečnostný budíček“.
Incident podľa Financial Times poukazuje na širší problém: čím autonómnejšie majú byť systémy AI, tým väčšiu voľnosť potrebujú. Ich vlastné čiastkové ciele sa však nemusia vždy zhodovať so zámermi zadávateľov úloh.