Je chytřejší AI bezpečnější?
2026-09-21
Úvod
V posledních týdnech se začínají objevovat zprávy o AI modelech které utekly z testovacího prostředí a prováděly reálné kybernetické útoky. Tyto zprávy vyvolávají otázku, zda je lepší a chytřejší model bezpečnější, nebo zda je lepší mít omezenější model nebo aplikaci, která je bezpečnější. V tomto článku se podíváme na výhody a nevýhody obou přístupů a pokusíme se na otázku odpovědět.
Incidenty
Asi největším incidentem roku 2026 byl incident OpenAI-Hugging Face, kdy přibližně 1200 agentů mělo za úkol splnit určitou sadu úkolů. Místo tvorby a hledání odpovědi využili agenti zranitelnosti v interní infrastruktuře OpenAI a přes několik dalších zero-day exploitů se dostali do interního prostředí Hugging Face, kde získali přístup k odpovědím na zadané úkoly. 95% agentů běželo na modelu označeném jako Internal Model 1 a zbylých 5% na GPT-5.6 Sol. Nedošlo k úniku dat, ale incident ukázal, že chytřejší modely mohou být zneužity a mohou představovat bezpečnostní riziko.
Společnost Anthropic, která vyvíjí modely Claude na základě incidentu OpenAI prošetřila své starší testy a objevila celkem tři incidenty, kdy modely získaly přístup k internetu. Problém byl v tom že v příkazu (promptu) bylo uvedeno že přístup k internetu je zakázáný, ale nebylo specifikováno, že model nesmí opustit lokální prostředí. Pouze v jednom z těchto případů agent rozpoznal že udělal chybu a útoky zastavil. V ostatních dvou si agenti své chování odůvodnili tím, že se jednalo o testovací prostředí a že je to v pořádku. Incidenty byly vyřešeny aktualizací modelů a přidáním dalších bezpečnostních opatření.
V květnu 2026 testovala společnost Google nové modely Gemini u izraelského startupu Irregular. Každý z modelů měl za úkol napadnout fiktivní společnost. Problém byl v tom, že názvy společností se kryly s názvy reálných společností. Lidskou chybou byl zpřístupněn internet a modely se úspěšně nabouraly do tří reálných společností. Po získání přístupů modely identifikovaly, že se jedná o reálné společnosti a přestaly s útoky. Incident byl vyřešen úpravou procesů.
Copilot
AI, která je často označována za špatnou a zastaralou je Microsoft Copilot. Copilot je ale založený na modelech GPT, které jsou velmi chytré a dokáží provádět složité úkoly. Copilot je ale omezený striktními bezpečnostními opatřeními a omezení, které mohou mít vliv na jeho výkon. Koncovým zákazníkem Copilotu totiž není jednotlivec, ale velké firmy, které mají vlastní bezpečnostní politiky a procesy. Copilot je tedy omezený a bezpečný, aby mohl být používán v bezpečném prostředí s citlivými daty.
Copilot vlastně funguje jako velice striktní obal pro modely GPT a tedy aplikace, která je schopna provádět složité úkoly, ale je omezená bezpečnostními opatřeními. Copilot je tedy příkladem toho, že omezenější model může být bezpečnější než chytřejší model.
Tím samozřejmě nepopírám, že Copilot měl bezpečnostní incidenty. Pravděpodobně největší bezpečnostní incident Copilotu byl CVE-2025-32711, kdy se mohl útočník dostat k soukromým datům bez jakékoliv uživatelské aktivity. Z toho vyplývá, že i omezenější modely mohou mít bezpečnostní incidenty, ale je pravděpodobnější, že budou bezpečnější než chytřejší modely.
Odpovědnost
Důležité je říct, že ve všech incidentech nebyly AI modely vyloženě zlé. U incidentu OpenAI-Hugging Face měli agenti zadaný úkol a svou chytrostí vyhodnotili, že nejlepší způsob, jak dosáhnout cíle je nabourat se do interní infrastruktury. U incidentu Anthropic modely vyhodnotily, že je v pořádku opustit lokální prostředí a získat přístup k internetu. U incidentu Google modely vyhodnotily, že je v pořádku napadnout fiktivní společnost, ale po zjištění, že se jedná o reálnou společnost útoky zastavily. Ve všech případech tedy modely jednaly podle svého nejlepšího vědomí a svědomí. U Google se jednalo primárně o lidské pochybení v konfiguraci
Závěr – Hledání rovnováhy
Incidenty z roku 2026 jasně ukazují, že chytřejší AI automaticky neznamená bezpečnější AI. Naopak, s rostoucí inteligencí roste i schopnost modelů nacházet kreativní – a potenciálně nebezpečné – cesty k dosažení cíle. Microsoft Copilot nám ale ukazuje, že i chytré modely lze efektivně „zkrotit“ striktními architektonickými omezeními, guardrails a bezpečnostními pravidly, pokud je prioritou stabilita a ochrana dat.
Budoucnost AI bezpečnosti tak nebude jen o vylepšování modelů, ale především o vylepšování prostředí, ve kterém tyto modely fungují. Tím se ale otvírá otázka, zda je možné najít rovnováhu mezi inteligencí a bezpečností. Je zřejmé, že budoucí vývoj AI bude vyžadovat nejen technické inovace, ale i etické a právní rámce, které zajistí, že chytřejší AI bude zároveň i bezpečnější. Společnost Anthropic se snaží vyvíjet modely řízené "Ústavními principy" (Constitutional AI), které mají za cíl zajistit, aby se modely řídily jasně definovanými pravidly a principy, které minimalizují riziko nechtěného chování.