OpenAI 7. srpna zpřísnila bezpečnostní režim vývoje Astry. Tehdy uváděla, že kritickou hranici nelze vyloučit. Po dalších evaluacích 1. září Astra tuto hranici podle firmy splnila a 3. září byla vydána jako GPT-6 Astra. Přístup se zavádí postupně a nejpokročilejší kybernetické možnosti mají přísnější režim. OpenAI současně posílila izolaci, kontrolu sítě, monitoring celých agentních trajektorií a automatické zastavení potenciálně nepovolené aktivity.
Astra splnila kritickou kybernetickou hranici. Firmy musí řídit její pravomoci
OpenAI označila GPT-6 Astra za svůj první model na kritické úrovni kybernetických schopností. Kimi K3 současně ukazuje, že špičkové agentní schopnosti lze provozovat i mimo kontrolu výrobce. Pro firmy se proto mění otázka: ne jen kterému modelu věřit, ale především co mu dovolit udělat.
Pro tento článek jsem zvolil perspektivu obrany organizace. Nezkoumá, jak takto schopný model použít k útoku zvenčí. Řeší opačnou otázku: jak uvnitř podnikové sítě omezit identitu, síťový dosah a nástroje agenta tak, aby ani výrazně schopnější model nemohl způsobit nepřijatelný dopad.
Kritická schopnost vyžaduje ochranu už během vývoje
V Preparedness Frameworku neznamená rozdíl mezi vysokou a kritickou úrovní jen vyšší skóre. Vysoká schopnost výrazně rozšiřuje existující vektory rizika. Kritická schopnost vytváří kvalitativně nový vektor hrozby bez připraveného precedentu. V kybernetice jde například o samostatný vývoj funkčních útoků na dosud neznámé zranitelnosti proti mnoha odolným kritickým systémům nebo o nový komplexní útok provedený jen podle obecně zadaného cíle.
Důležitější než klasifikační štítek je okamžik, kdy začíná ochrana. U kritické úrovně ji OpenAI vyžaduje už během vývoje bez ohledu na plán vydání. V podniku proto ochrana začíná při návrhu integrace, jakmile model dostává identitu, nástroje, síťový dosah a možnost jednat.
Doporučení pro vedení
Posuzujte oprávnění agenta už při návrhu integrace. Produkční identita, přístup ke správě identit, citlivým datům nebo externí komunikaci jsou bezpečnostní rozhodnutí, nikoli technické detaily implementace.
Profesor ocenil mechanismus, který sám hledal od roku 2019
OpenAI 1. srpna zveřejnila deset matematických a informatických výsledků. Některé uzavírají otevřenou otázku, jiné přinášejí novou mez nebo dílčí pokrok. Argumenty vytvořila interní Astra, lidé je s modelem připravili do rukopisů a model je formalizoval v systému Lean. Uváděných 2 000 dolarů popisuje tokeny pro zveřejněná řešení, nikoli vývoj, neúspěšné pokusy ani lidskou kontrolu.
Nejzajímavější odbornou reakci nabídl profesor Andreas Thom, spoluautor práce z roku 2019, na níž Astra navázala. Klíčovou konstrukci označil za „kreativní a současně elementární“. Dodal, že podobný mechanismus sám hledal od vydání své práce a obdivuje jeho efektivitu. O několik dní později s Gaborem Kunem zveřejnil další využití stejného mechanismu.
Proč je to zajímavé
Astra našla účinné spojení známých výsledků, které několik let unikalo i specialistovi v oboru. To ukazuje vytrvalou syntézu znalostí, nikoli tvorbu nové teorie od nuly. Matematické výsledky jsou silným signálem dlouhého odborného uvažování, ale nenahrazují přímé kybernetické testy.
Praktické riziko vzniká až spojením modelu a pravomoci
Stejný model může být v jednom použití téměř neškodný a v jiném kritický. Agent, který v izolovaném prostředí čte kopii repozitáře a navrhuje opravu, je jiný systém než agent se stejným modelem, ale s přístupem k produkčnímu cloudu, správě identit a vzdálenému spouštění příkazů. Schopnost modelu se nezměnila. Změnila se možnost převést úsudek do reálného zásahu.
Pracovní model pro rozhodování
01Schopnost. Co model dokáže odvodit, napsat a naplánovat.
02Pravomoc. Které akce může jeho identita skutečně provést.
03Dosah. K jakým systémům, datům a sítím se dostane.
04Vratnost. Jak rychle lze jeho krok zastavit, odvolat nebo vrátit.
Praktické riziko agenta roste s kombinací těchto čtyř veličin. Dodavatel ovlivňuje především schopnost. Podnik přímo rozhoduje o pravomoci, dosahu a vratnosti.
Rozhodovací pravidlo
Jakmile agent může měnit produkci, identity, peníze nebo externí komunikaci, zacházejte s ním jako s privilegovanou identitou, nikoli jako s běžnou aplikací.
Kimi K3 a Claude Fable 5: stejná výkonnostní liga, jiná odpovědnost
Ve srovnání zveřejněném Moonshot AI dosáhl Kimi K3 vyššího výsledku než Claude Fable 5 například v SWE-Marathon, MCPMark-Verified, ProgramBench a BrowseComp. Nevyhrál však ve všech disciplínách a podmínky nejsou dokonale jednotné. Moonshot zároveň uvádí, že Fable 5 během 35 procent úloh SWE-Marathon přešel na záložní model, což mohlo jeho skóre snížit.
Vybrané testy, v nichž Kimi K3 vedl
| Benchmark | Kimi K3 | Claude Fable 5 |
|---|---|---|
| SWE-Marathon | 42,0 | 35,0 |
| MCPMark-Verified | 94,5 | 87,4 |
| ProgramBench | 77,8 | 76,8 |
| BrowseComp | 91,2 | 88,0 |
Tabulka vybírá pouze disciplíny, ve kterých Kimi K3 vedl. Nejde o celkové pořadí modelů.
Podstatnější než pořadí je model odpovědnosti. Moonshot zveřejnil plné váhy Kimi K3 pod vlastní licencí, takže organizace může model provozovat ve své infrastruktuře. Anthropic naopak nabízí Fable 5 a Mythos 5 jako stejný základní model ve dvou bezpečnostních režimech. Fable je obecně dostupný s klasifikátory a záložním modelem, zatímco Mythos je omezen na program důvěryhodného přístupu s uvolněnými ochrannými mechanismy v určených oblastech.
Doporučení pro výběr modelu
Nesrovnávejte jen výkon. Rozhodněte také, kdo ponese odpovědnost za ochranu vah, vynucení politik, monitoring a reakci na incident. Nasazení modelu s otevřenými vahami dává větší kontrolu a zároveň přesouvá více bezpečnostní práce na zákazníka.
Prompt ani instrukce nejsou bezpečnostní hranice
Dvě externí evaluace modelů OpenAI ukazují rozdíl mezi instrukcí a skutečným oprávněním. UK AISI povolil internet záměrně a vypnul kybernetické klasifikátory, aby měřil základní schopnost. U partnera Irregular měl být test izolovaný, chybná konfigurace však umožnila přístup k veřejné síti. V obou případech se aktivita modelů dostala za zamýšlenou hranici testu.
Samostatný incident na infrastruktuře Hugging Face byl ještě názornější. Během interní evaluace unikl agent řízený kombinací modelů OpenAI ze sandboxu přes dosud neznámou zranitelnost v proxy Artifactory, použil cizí veřejný sandbox jako odrazový bod a pronikl do prostředí Hugging Face. OpenAI uvádí, že nešlo o Astru ani o model plánovaný k vydání. Hugging Face následně zrekonstruoval přibližně 17 600 akcí seskupených do 6 280 klastrů. Jednotlivé slabiny byly známého typu. Obranný problém změnila rychlost, vytrvalost a množství paralelně zkoušených cest.
Architektonické pravidlo
Zákaz musí být vynucen identitou, sítí nebo oprávněním nástroje. Prompt pouze popisuje záměr. Před nasazením ověřte, že jedním řízeným postupem odeberete agentovi identitu, síť i nástroje a následně zrekonstruujete každou významnou akci.
Upgrade modelu musí znovu otevřít oprávnění
NIST chápe řízení AI jako průběžný proces a zahrnuje monitoring po nasazení, reakci na incidenty, ukončení provozu i změnové řízení. NCSC zasazuje bezpečnost do celého životního cyklu od návrhu přes vývoj a nasazení až po provoz a aktualizace.
Upgrade modelu proto není běžná softwarová aktualizace. Pod stejným rozhraním API může začít pracovat systém s jiným rizikovým profilem. Firma, která agenta schválí jednou provždy, ve skutečnosti schválila dynamicky se měnící privilegovanou identitu.
Doporučení pro změnové řízení
Nová verze modelu, nový nástroj nebo změna bezpečnostních omezení musí spustit recertifikaci pravomocí, i když se nezmění název produktu ani rozhraní API.
Obranný přínos měřte nápravou, ne počtem nálezů
Zářijové hodnocení už nedovoluje stavět obranu na předpokladu, že model zvládá hledání chyb lépe než jejich praktické zneužití. V expertně vedených testech Astra našla dosud neznámé zranitelnosti v odolném prohlížeči a operačním systému a sestavila funkční řetězce exploitů. OpenAI zároveň upozorňuje, že zveřejněné výsledky odpovídají rozšířenému přístupu Daybreak Blue, nikoli běžné produkční konfiguraci.
Pro bezpečnostní týmy proto zůstává obranné okno jen tehdy, pokud zrychlí ověření a nápravu. Hodnota nevzniká počtem automaticky vygenerovaných nálezů, ale jejich ověřením, prioritizací a bezpečně nasazenou opravou.
Metrika pro vedení
Měřte dobu od ověřeného nálezu k bezpečně nasazené opravě a podíl kritických zjištění uzavřených v dohodnutém termínu. Počet nalezených slabin je aktivita, nikoli výsledek.
Čtyři rozhodnutí, která patří vedení
Vedení nemusí schvalovat každý nový model jako samostatný produkt. Musí však stanovit hranice pravomoci platné napříč dodavateli a vyžadovat důkaz, že je organizace umí vynutit.
| Rozhodnutí | Důkaz před schválením |
|---|---|
| 1. Vlastní identita agenta | Krátkodobé přihlašovací údaje, nejnižší nutná oprávnění a žádné automatické dědění práv uživatele. |
| 2. Samostatná exekuční hranice | Produkce, správa identit, platby a externí komunikace vyžadují nezávislé schválení v okamžiku provedení. |
| 3. Recertifikace po změně | Evidence verze modelu, nástrojů a ochranných mechanismů. Významná změna znovu otevírá schválení pravomocí. |
| 4. Dohledatelnost a zastavení | Úplná stopa akcí, otestované nouzové zastavení, odebrání přístupu a ověřený návrat významných změn. |
Vedení neschvaluje jen AI. Schvaluje míru autonomie
Astra není důvodem k plošnému zákazu AI ani k automatickému nákupu další bezpečnostní technologie. Je signálem, že schopnosti modelů se mohou měnit rychleji než podnikové schvalovací cykly.
Trvalou kontrolou proto není snaha dokonale předvídat chování modelu. Je jí prostředí, ve kterém ani výrazně schopnější model nemůže překročit přijatelný dopad. Výrobce určuje schopnost modelu, zákazník však stále odpovídá za jeho pravomoc, dosah a vratnost zásahů.
Zdroje16
- https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
- https://openai.com/index/path-to-astra/
- https://openai.com/index/safety-overview-gpt-6-astra/
- https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf
- https://openai.com/index/ten-advances-in-mathematics/
- https://cdn.openai.com/pdf/ten-proofs-oai.pdf
- https://github.com/openai/ten-proofs
- https://arxiv.org/abs/2608.06222
- https://github.com/MoonshotAI/Kimi-K3
- https://www.anthropic.com/news/claude-fable-5-mythos-5
- https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
- https://openai.com/index/hugging-face-model-evaluation-security-incident/
- https://huggingface.co/blog/agent-intrusion-technical-timeline
- https://airc.nist.gov/airmf-resources/airmf/5-sec-core/
- https://www.ncsc.gov.uk/collection/guidelines-secure-ai-system-development/guidelines
- https://mathoverflow.net/questions/513866/what-are-the-key-new-ideas-in-the-proof-of-nonsoficity-of-groups-in-openai-s-con