Hlavní obsah

AI si začala sama udílet pokyny. Podobných případů přibývá, ukázal výzkum

Foto: Shutterstock.com

Aplikace ChatGPT

Přibývá případů, kdy se umělá inteligence vymkne kontrole, lže nebo ignoruje pokyny svých uživatelů. V červenci jich britští výzkumníci zaznamenali dvakrát více než o měsíc dříve.

Článek

Modely umělé inteligence se stále zdokonalují. S jejich rostoucími schopnostmi ale zároveň roste i riziko, kdy se z chytrého pomocníka stává autonomní systém.

Z analýzy výzkumné iniciativy The Loss of Control Observatory, financované britským vládním Institutem pro bezpečnost AI, vyplývá, že během července došlo k více než třem stům případům, kdy se umělá inteligence vymkla kontrole a přestala poslouchat pokyny, které jí zadávali soukromí jednotlivci nebo firemní uživatelé. Informuje o tom britský deník The Guardian. Je to téměř dvojnásobek případů ve srovnání s červnem.

Sledování běží od listopadu loňského roku a jedním z případů, které od té doby zaznamenala, patří situace, kdy se umělá inteligence vydávala za člověka, který jí zadává pokyny, a napodobovala jeho styl psaní. V praxi si pak sama udělila souhlas k provedení určitých aktivit, které by jí jinak musel dát sám uživatel, a obešla tak pravidla svého fungování nastavená jejími tvůrci.

„Někdy panuje představa, že k tomuto druhu nevhodného a skrytého chování dochází pouze při testech nebo hodnoceních, ale podobné znepokojivé jevy pozorujeme i v širším kontextu,“ říká Tommy Shaffer-Shane, vedoucí pracovník Centra pro dlouhodobou odolnost, které iniciativu The Loss of Control Observatory provozuje.

„Nesmíme se uklidňovat tím, že se tyto věci v reálném světě nestanou, existují důkazy, že se již dějí.“

Základem analýzy jsou příspěvky uživatelů na sociální síti X, kteří zde sdílejí své zkušenosti s AI. Nejde tedy zdaleka o úplný přehled incidentů. Většinu z letošních 1600 případů nahlásili softwaroví vývojáři, kteří umělou inteligenci využívají v rámci své práce.

„Musí hlásit vše, na co přijdou, i když jde o nehodu nebo incident s nižší závažností. Tyto nedávné incidenty také odhalily, že samotné společnosti ne vždy sledují, kde k tomuto typu chování dochází, zejména u interně nasazených modelů. V těchto laboratořích je třeba klást větší důraz na systematické monitorování,“ říká Shaffer-Shane.

OpenAI zpomaluje vývoj

Americká technologická společnost OpenAI minulý měsíc uvedla, že její autonomní agenti pohánění pokročilými modely AI minulý měsíc unikli z testovacího prostředí a nabourali se do systému startupu HuggingFace.

Na základě incidentu společnost zveřejnila prohlášení, ve kterém oznámila, že na dva týdny pozastaví testování svých modelů a zaměří se na posilování ochranných opatření.

Tento týden ale vyšlo najevo, že společnost zaznamenala známky nekontrolovatelného chování svých autonomních agentů již několik týdnů před samotným incidentem. Vyšetřování také odhalilo, že skupina přibližně 700 agentů minulý měsíc tajně spolupracovala a oslavovala své hackerské úspěchy na diskusním fóru, které sami založili.

Britský Institut pro bezpečnost AI (AISI) na začátku tohoto měsíce vydal zprávu, ve které uvádí, že modely umělé inteligence od společností OpenAI a Anthropic během bezpečnostních testů provedly hackerský útok namířený proti skutečným lidem.

Související témata:

Doporučované