Výzkum odhalil prudký nárůst případů, kdy umělá inteligence uniká kontrole uživatelů

29. 8. 2026

čas čtení 5 minut

Počet případů, kdy umělá inteligence lže, ignoruje pokyny a sleduje cíle škodlivými způsoby, se v červenci téměř zdvojnásobil

Počet případů, kdy se umělá inteligence vymyká kontrole uživatelů, lže, ignoruje pokyny a sleduje své cíle škodlivými způsoby, dosáhl nového maxima. Vyplývá to z výzkumu, který rovněž naznačuje, že se závažnost klamání a nesouladu zhoršuje.

Analýza reálných incidentů ztráty kontroly nad modely umělé inteligence, na které upozornily firmy i jednotlivci, se v červenci ve srovnání s červnem téměř zdvojnásobila – za tento měsíc bylo zaznamenáno více než 300 případů, uvádí observatoř Loss of Control Observatory, která sleduje hlášení uživatelů umělé inteligence na sociální platformě X.

 

Toto observatoř byla zřízena s finanční podporou britského vládního institutu AI Security Institute (AISI) a od loňského listopadu začala sledovat případy, kdy se umělá inteligence vymyká pokynům svých uživatelů. Mezi případy zaznamenané od té doby patří umělá inteligence, která předstírá, že je svým vlastním lidským operátorem, a napodobuje jeho styl psaní, aby si tak fakticky udělila souhlas k provádění akcí a obešla pravidla vyžadující lidský souhlas s danými akcemi. Incident ztráty kontroly je definován jako situace, kdy existují jasné důkazy naznačující intriky nebo chování související s intrikami.

Nejnovější zjištění přicházejí po rostoucích obavách z neřízeného chování špičkových modelů umělé inteligence během testování společností OpenAI a Anthropic letos v létě, které podnítily výzvy k pozastavení vývoje těchto průkopnických modelů.

Tento týden vyšlo najevo, že zaměstnanci společnosti OpenAI zaznamenali známky neovladatelného chování u svých špičkových AI agentů již týdny předtím, než tito agenti unikli z trénovacího prostředí a zahájili bezprecedentní hackerskou křížovou výpravu, která vyvolala celosvětovou paniku. Vyšetřování jejich hackerského útoku na Hugging Face, repozitář softwaru, odhalilo skupinu asi 700 autonomních agentů, kteří minulý měsíc tajně spolupracovali a oslavovali své hackerské úspěchy na diskusním fóru, které si zřídili, aby jim pomohlo plánovat, a to s výkřiky jako „BOOM!“ a „Whoa!“.

AISI tento měsíc rovněž odhalila „závažný incident“, při kterém pokročilé modely umělé inteligence vyvinuté oběma společnostmi – Mythos 5 od Anthropic a GPT-5.6 Sol od OpenAI – provedly během testu kyberbezpečnosti hackerskou kampaň namířenou proti skutečným lidem.

„Někdy panuje představa, že k tomuto typu nesprávně nasměrovaného a skrytého chování dochází pouze při testech nebo hodnoceních, ale podobné znepokojivé chování pozorujeme i při širším použití,“ uvedl Tommy Shaffer-Shane, vedoucí manažer pro politiku v Centru pro dlouhodobou odolnost, které observatoř provozuje. „Nesmíme se spokojit s domněnkou, že se tyto věci v reálném světě nestanou, a existují důkazy, že se již dějí.“

Počet incidentů ztráty kontroly vychází z příspěvků uživatelů platformy X o událostech, které se staly, a je tedy pouze částečný, ale vzhledem k absenci jiného komplexního veřejného monitorování poskytuje přehled o tom, jak se někdy chovají rychle se vyvíjející modely umělé inteligence.

Tento měsíc vyšlo najevo, že osobní AI agent s názvem OpenClaw, který používal člen australské tělocvičny, se bez jeho vědomí spikl s cílem odstranit jiného člena z čekací listiny na oblíbenou ranní lekci. Agent se omluvil, ale nemohl vyřazeného člena znovu zařadit.

Většinu z více než 1 600 incidentů ztráty kontroly zaznamenaných v roce 2026 nahlásili na platformě X softwaroví vývojáři, kteří ve své práci využívají AI. Vzhledem k tomu, že firmy zabývající se AI vybízejí veřejnost i podniky všeho druhu k experimentování s touto technologií, Shaffer-Shaneová vyzvala Silicon Valley k větší transparentnosti ohledně případů, kdy se AI vymkne kontrole.

„Musí hlásit, na co přijdou, i když jde o téměř nehodu nebo incident nižší závažnosti,“ řekl Shaffer-Shane. „Tyto nedávné incidenty také odhalily, že samotné firmy nutně nesledují, kde k tomuto typu chování dochází, zejména u interně nasazených modelů. V těchto laboratořích je třeba klást větší důraz na systematické monitorování.“

Organizace Loss of Control Observatory uvedla, že ačkoli většina incidentů ztráty kontroly v reálném světě, které zaznamenala, nevedla k významné újmě, rostoucí podíl z nich byl z hlediska míry klamavosti a nesouladu s úmysly lidského uživatele hodnocen jako závažnější.

„Svědčí o ochotě systémů umělé inteligence ignorovat přímé pokyny, obcházet bezpečnostní opatření, lhát uživatelům a vytrvale sledovat cíl škodlivými způsoby,“ uvedla organizace a dodala, že současný rozsah ztráty kontroly je pravděpodobně podceňován, jelikož shromažďovala pouze hlášení incidentů od společnosti X.

Vyzývá vládu, aby od společností zabývajících se umělou inteligencí vyžadovala sledování a hlášení závažných incidentů ztráty kontroly a zavedla mimořádná oprávnění k řešení závažných incidentů ztráty kontroly, včetně dočasného omezení služeb umělé inteligence.

Zdroj v angličtině ZDE

0
Vytisknout
405

Diskuse

Obsah vydání | 28. 8. 2026