Reklama

6. 9. 2026 · Miharu Edge

Astra splnila kritickou kybernetickou hranici. Firmy musí řídit její pravomoci

OpenAI označila GPT-6 Astra za svůj první model na kritické úrovni kybernetických schopností. Kimi K3 současně ukazuje, že špičkové agentní schopnosti lze provozovat i mimo kontrolu výrobce. Pro firmy se proto mění otázka: ne jen kterému modelu věřit, ale především co mu dovolit udělat.

Astra splnila kritickou kybernetickou hranici
GPT-6 Astra a řízení kritických kybernetických schopností

OpenAI 7. srpna zpřísnila bezpečnostní režim vývoje Astry. Tehdy uváděla, že kritickou hranici nelze vyloučit. Po dalších evaluacích 1. září Astra tuto hranici podle firmy splnila a 3. září byla vydána jako GPT-6 Astra. Přístup se zavádí postupně a nejpokročilejší kybernetické možnosti mají přísnější režim. OpenAI současně posílila izolaci, kontrolu sítě, monitoring celých agentních trajektorií a automatické zastavení potenciálně nepovolené aktivity.

Pro tento článek jsem zvolil perspektivu obrany organizace. Nezkoumá, jak takto schopný model použít k útoku zvenčí. Řeší opačnou otázku: jak uvnitř podnikové sítě omezit identitu, síťový dosah a nástroje agenta tak, aby ani výrazně schopnější model nemohl způsobit nepřijatelný dopad.

Kritická schopnost vyžaduje ochranu už během vývoje

V Preparedness Frameworku neznamená rozdíl mezi vysokou a kritickou úrovní jen vyšší skóre. Vysoká schopnost výrazně rozšiřuje existující vektory rizika. Kritická schopnost vytváří kvalitativně nový vektor hrozby bez připraveného precedentu. V kybernetice jde například o samostatný vývoj funkčních útoků na dosud neznámé zranitelnosti proti mnoha odolným kritickým systémům nebo o nový komplexní útok provedený jen podle obecně zadaného cíle.

Důležitější než klasifikační štítek je okamžik, kdy začíná ochrana. U kritické úrovně ji OpenAI vyžaduje už během vývoje bez ohledu na plán vydání. V podniku proto ochrana začíná při návrhu integrace, jakmile model dostává identitu, nástroje, síťový dosah a možnost jednat.

Doporučení pro vedení

Posuzujte oprávnění agenta už při návrhu integrace. Produkční identita, přístup ke správě identit, citlivým datům nebo externí komunikaci jsou bezpečnostní rozhodnutí, nikoli technické detaily implementace.

Profesor ocenil mechanismus, který sám hledal od roku 2019

OpenAI 1. srpna zveřejnila deset matematických a informatických výsledků. Některé uzavírají otevřenou otázku, jiné přinášejí novou mez nebo dílčí pokrok. Argumenty vytvořila interní Astra, lidé je s modelem připravili do rukopisů a model je formalizoval v systému Lean. Uváděných 2 000 dolarů popisuje tokeny pro zveřejněná řešení, nikoli vývoj, neúspěšné pokusy ani lidskou kontrolu.

Nejzajímavější odbornou reakci nabídl profesor Andreas Thom, spoluautor práce z roku 2019, na níž Astra navázala. Klíčovou konstrukci označil za „kreativní a současně elementární“. Dodal, že podobný mechanismus sám hledal od vydání své práce a obdivuje jeho efektivitu. O několik dní později s Gaborem Kunem zveřejnil další využití stejného mechanismu.

Proč je to zajímavé

Astra našla účinné spojení známých výsledků, které několik let unikalo i specialistovi v oboru. To ukazuje vytrvalou syntézu znalostí, nikoli tvorbu nové teorie od nuly. Matematické výsledky jsou silným signálem dlouhého odborného uvažování, ale nenahrazují přímé kybernetické testy.

Praktické riziko vzniká až spojením modelu a pravomoci

Stejný model může být v jednom použití téměř neškodný a v jiném kritický. Agent, který v izolovaném prostředí čte kopii repozitáře a navrhuje opravu, je jiný systém než agent se stejným modelem, ale s přístupem k produkčnímu cloudu, správě identit a vzdálenému spouštění příkazů. Schopnost modelu se nezměnila. Změnila se možnost převést úsudek do reálného zásahu.

Pracovní model pro rozhodování

01Schopnost. Co model dokáže odvodit, napsat a naplánovat.

02Pravomoc. Které akce může jeho identita skutečně provést.

03Dosah. K jakým systémům, datům a sítím se dostane.

04Vratnost. Jak rychle lze jeho krok zastavit, odvolat nebo vrátit.

Praktické riziko agenta roste s kombinací těchto čtyř veličin. Dodavatel ovlivňuje především schopnost. Podnik přímo rozhoduje o pravomoci, dosahu a vratnosti.

Rozhodovací pravidlo

Jakmile agent může měnit produkci, identity, peníze nebo externí komunikaci, zacházejte s ním jako s privilegovanou identitou, nikoli jako s běžnou aplikací.

Kimi K3 a Claude Fable 5: stejná výkonnostní liga, jiná odpovědnost

Ve srovnání zveřejněném Moonshot AI dosáhl Kimi K3 vyššího výsledku než Claude Fable 5 například v SWE-Marathon, MCPMark-Verified, ProgramBench a BrowseComp. Nevyhrál však ve všech disciplínách a podmínky nejsou dokonale jednotné. Moonshot zároveň uvádí, že Fable 5 během 35 procent úloh SWE-Marathon přešel na záložní model, což mohlo jeho skóre snížit.

Vybrané testy, v nichž Kimi K3 vedl

Benchmark Kimi K3 Claude Fable 5
SWE-Marathon 42,0 35,0
MCPMark-Verified 94,5 87,4
ProgramBench 77,8 76,8
BrowseComp 91,2 88,0

Tabulka vybírá pouze disciplíny, ve kterých Kimi K3 vedl. Nejde o celkové pořadí modelů.

Podstatnější než pořadí je model odpovědnosti. Moonshot zveřejnil plné váhy Kimi K3 pod vlastní licencí, takže organizace může model provozovat ve své infrastruktuře. Anthropic naopak nabízí Fable 5 a Mythos 5 jako stejný základní model ve dvou bezpečnostních režimech. Fable je obecně dostupný s klasifikátory a záložním modelem, zatímco Mythos je omezen na program důvěryhodného přístupu s uvolněnými ochrannými mechanismy v určených oblastech.

Doporučení pro výběr modelu

Nesrovnávejte jen výkon. Rozhodněte také, kdo ponese odpovědnost za ochranu vah, vynucení politik, monitoring a reakci na incident. Nasazení modelu s otevřenými vahami dává větší kontrolu a zároveň přesouvá více bezpečnostní práce na zákazníka.

Prompt ani instrukce nejsou bezpečnostní hranice

Dvě externí evaluace modelů OpenAI ukazují rozdíl mezi instrukcí a skutečným oprávněním. UK AISI povolil internet záměrně a vypnul kybernetické klasifikátory, aby měřil základní schopnost. U partnera Irregular měl být test izolovaný, chybná konfigurace však umožnila přístup k veřejné síti. V obou případech se aktivita modelů dostala za zamýšlenou hranici testu.

Samostatný incident na infrastruktuře Hugging Face byl ještě názornější. Během interní evaluace unikl agent řízený kombinací modelů OpenAI ze sandboxu přes dosud neznámou zranitelnost v proxy Artifactory, použil cizí veřejný sandbox jako odrazový bod a pronikl do prostředí Hugging Face. OpenAI uvádí, že nešlo o Astru ani o model plánovaný k vydání. Hugging Face následně zrekonstruoval přibližně 17 600 akcí seskupených do 6 280 klastrů. Jednotlivé slabiny byly známého typu. Obranný problém změnila rychlost, vytrvalost a množství paralelně zkoušených cest.

Architektonické pravidlo

Zákaz musí být vynucen identitou, sítí nebo oprávněním nástroje. Prompt pouze popisuje záměr. Před nasazením ověřte, že jedním řízeným postupem odeberete agentovi identitu, síť i nástroje a následně zrekonstruujete každou významnou akci.

Upgrade modelu musí znovu otevřít oprávnění

NIST chápe řízení AI jako průběžný proces a zahrnuje monitoring po nasazení, reakci na incidenty, ukončení provozu i změnové řízení. NCSC zasazuje bezpečnost do celého životního cyklu od návrhu přes vývoj a nasazení až po provoz a aktualizace.

Upgrade modelu proto není běžná softwarová aktualizace. Pod stejným rozhraním API může začít pracovat systém s jiným rizikovým profilem. Firma, která agenta schválí jednou provždy, ve skutečnosti schválila dynamicky se měnící privilegovanou identitu.

Doporučení pro změnové řízení

Nová verze modelu, nový nástroj nebo změna bezpečnostních omezení musí spustit recertifikaci pravomocí, i když se nezmění název produktu ani rozhraní API.

Obranný přínos měřte nápravou, ne počtem nálezů

Zářijové hodnocení už nedovoluje stavět obranu na předpokladu, že model zvládá hledání chyb lépe než jejich praktické zneužití. V expertně vedených testech Astra našla dosud neznámé zranitelnosti v odolném prohlížeči a operačním systému a sestavila funkční řetězce exploitů. OpenAI zároveň upozorňuje, že zveřejněné výsledky odpovídají rozšířenému přístupu Daybreak Blue, nikoli běžné produkční konfiguraci.

Pro bezpečnostní týmy proto zůstává obranné okno jen tehdy, pokud zrychlí ověření a nápravu. Hodnota nevzniká počtem automaticky vygenerovaných nálezů, ale jejich ověřením, prioritizací a bezpečně nasazenou opravou.

Metrika pro vedení

Měřte dobu od ověřeného nálezu k bezpečně nasazené opravě a podíl kritických zjištění uzavřených v dohodnutém termínu. Počet nalezených slabin je aktivita, nikoli výsledek.

Čtyři rozhodnutí, která patří vedení

Vedení nemusí schvalovat každý nový model jako samostatný produkt. Musí však stanovit hranice pravomoci platné napříč dodavateli a vyžadovat důkaz, že je organizace umí vynutit.

Rozhodnutí Důkaz před schválením
1. Vlastní identita agenta Krátkodobé přihlašovací údaje, nejnižší nutná oprávnění a žádné automatické dědění práv uživatele.
2. Samostatná exekuční hranice Produkce, správa identit, platby a externí komunikace vyžadují nezávislé schválení v okamžiku provedení.
3. Recertifikace po změně Evidence verze modelu, nástrojů a ochranných mechanismů. Významná změna znovu otevírá schválení pravomocí.
4. Dohledatelnost a zastavení Úplná stopa akcí, otestované nouzové zastavení, odebrání přístupu a ověřený návrat významných změn.

Vedení neschvaluje jen AI. Schvaluje míru autonomie

Astra není důvodem k plošnému zákazu AI ani k automatickému nákupu další bezpečnostní technologie. Je signálem, že schopnosti modelů se mohou měnit rychleji než podnikové schvalovací cykly.

Trvalou kontrolou proto není snaha dokonale předvídat chování modelu. Je jí prostředí, ve kterém ani výrazně schopnější model nemůže překročit přijatelný dopad. Výrobce určuje schopnost modelu, zákazník však stále odpovídá za jeho pravomoc, dosah a vratnost zásahů.

Zdroje16
  1. https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
  2. https://openai.com/index/path-to-astra/
  3. https://openai.com/index/safety-overview-gpt-6-astra/
  4. https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf
  5. https://openai.com/index/ten-advances-in-mathematics/
  6. https://cdn.openai.com/pdf/ten-proofs-oai.pdf
  7. https://github.com/openai/ten-proofs
  8. https://arxiv.org/abs/2608.06222
  9. https://github.com/MoonshotAI/Kimi-K3
  10. https://www.anthropic.com/news/claude-fable-5-mythos-5
  11. https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/
  12. https://openai.com/index/hugging-face-model-evaluation-security-incident/
  13. https://huggingface.co/blog/agent-intrusion-technical-timeline
  14. https://airc.nist.gov/airmf-resources/airmf/5-sec-core/
  15. https://www.ncsc.gov.uk/collection/guidelines-secure-ai-system-development/guidelines
  16. https://mathoverflow.net/questions/513866/what-are-the-key-new-ideas-in-the-proof-of-nonsoficity-of-groups-in-openai-s-con