Nová čísla o AI laboratořích: měřit dohled je lepší než věřit slibům
Anthropic v září 2026 zveřejnila návrh, jak měřit podíl AI na vlastním výzkumu, pokrytí agentních akcí kontrolou a rozdělení výpočetní kapacity. Čísla sama o sobě neříkají, zda je laboratoř bezpečná. Ukazují však užitečný posun: u rychle rostoucí autonomie se ptejme, kolik práce skutečně sledujeme, za jak dlouho reagujeme a kdo kontroluje definici metrik.
Dohled nad agenty musí mít měřitelnou kapacitu
Zveřejněný údaj má smysl jen se jmenovatelem
Anthropic uvádí, že v srpnu 2026 Claude „vedl“ podle její metodiky 26 procent výzkumné a vývojové práce související s modely a na úrovni spolupráce nebo výš se podílel na více než 90 procentech. Zároveň výslovně nehlásí plně autonomní práci v měřených kategoriích. Údaj o míře zapojení vzniká ze vzorkování práce, klasifikace úloh a vážení podle času lidí. Není to univerzální procento „AI vyvinula sama sebe“ a bez stejné metodiky jej nelze přenést do jiné firmy.
U interní agentní platformy firma zveřejnila také pokrytí online i následným monitoringem, rychlost přezkumu a četnost zablokovaných akcí. Hodnota tohoto příkladu není v tom, že by každá organizace měla mít stejné počty agentů nebo stejné procento blokací. Hodnota je v přiznání, že provoz agentů vyžaduje měřit nejen jejich výkon, ale i schopnost kontroly. Nízká míra záchytů může znamenat dobré chování, slabý detektor nebo úzký výběr sledovaných akcí.
Tři metriky vytvářejí užitečný rozhovor
Pokrytí říká, jaká část agentních akcí prochází kontrolou. Latence říká, kdy se o problému někdo dozví. Míra blokací a eskalací ukazuje, jak často systém zasáhne. Žádná sama o sobě nestačí. Stoprocentní pokrytí slabým pravidlem nezachytí nový typ chyby; rychlá kontrola po nevratném zápisu přijde pozdě; nízká míra blokací může ukazovat dobrý design oprávnění, ale také slepý monitoring. Dohromady však tyto metriky nutí firmu ukázat mechanismus místo obecného prohlášení o bezpečnosti.
Jmenovatel musí být transparentní. Pokud se z metriky vynechají akce prováděné externími nástroji, lokálními skripty nebo ručně vytvořenými podřízenými agenty, bude číslo vypadat výborně a popisovat jen část reality. U každého kanálu agentní práce je vhodné evidovat identitu, povolený rozsah, možnost zápisu a způsob zastavení. Teprve pak lze srovnávat, zda kontrolní kapacita roste stejně rychle jako počet delegovaných úloh.
Procento bez jmenovatele zkresluje dohled
Ukazatel
Jmenovatel
Co číslo samo neříká
Pokrytí kontrolou
Všechny akce s daným oprávněním včetně externích nástrojů
Zda kontrolní pravidlo zachytí skutečnou chybu
Čas zásahu
Akce, u nichž kontrola musela zasáhnout
Zda zásah přišel ještě před nevratným účinkem
Blokace a eskalace
Všechny posuzované akce stejné rizikové třídy
Zda nízká míra znamená bezpečný provoz nebo slepé místo
Náprava
Všechny potvrzené nežádoucí akce
Zda oprava zabránila opakování stejné chyby
Co lze přenést do podnikového provozu
Představme si firmu, která nechá agenty spravovat podpůrné tikety, konfiguraci a interní dokumentaci. Běžný přehled ukáže počet zpracovaných úloh a úsporu času. Chybí však jmenovatel pro kontrolu: kolik akcí mělo právo zapisovat, které prošly kontrolou před provedením, jak dlouho čekaly na lidské posouzení a kolik výjimek nebylo uzavřeno. Pokud vedení tyto údaje nezná, rychlost nasazení nemá protiváhu v pozorovatelném riziku.
Začal bych třemi prostými metrikami: pokrytí rizikových akcí technickou kontrolou, doba od neobvyklé akce k přezkumu a podíl eskalací, které skončily konkrétní opravou pravidla nebo nástroje. Každou metriku je nutné vyhodnotit podle typu oprávnění a dopadu. Zápis do veřejného ceníku a návrh interního souhrnu nesmějí být v jedné průměrné hodnotě. U kritických akcí musí kontrola proběhnout před účinkem; zpětné čtení logu je pro nevratnou změnu pozdě.
METRIKA PRO VEDENÍ
U každé nevratné třídy akcí požadujte počet pokusů, počet kontrol před účinkem, zablokované pokusy a doložené omyly kontroly. Zpětný monitoring po zápisu je jiný druh ochrany.
Z externího reportu nevzniká interní politika kopírováním
Laboratoř provozuje výzkumné agenty na vlastních systémech a má jiný profil hrozeb než banka, nemocnice nebo malý výrobce. Její četnost blokací se proto nedá použít jako cílová hodnota pro jiné prostředí. Podnik by měl nejprve klasifikovat akce podle dopadu: čtení veřejného dokumentu, čtení interních dat, změna konfigurace, externí komunikace a nevratný zápis. Pro každou třídu potřebuje jinou kombinaci automatické kontroly, lidského schválení a následného auditu.
Pak lze měřit nejen bezpečnost, ale i provozní cenu ochrany. Kolik legitimních akcí bylo zbytečně blokováno? Jak dlouho čeká urgentní oprava na schválení? Je možné zastavit jeden špatný run bez vypnutí celého programu? Kontrola, kterou týmy hromadně obcházejí, zhorší přehled. Přiměřené hranice mají být technicky vynucené a zároveň dostatečně čitelné pro lidi, kteří za výsledek ručí.
Jak má vypadat ověřitelný report
Přehled pro vedení by měl uvádět období, přesnou populaci agentů, definici akce, použité kontrolní body a počet případů, v nichž kontrola selhala nebo byla obcházena. Vhodné je připojit anonymizovaný vzorek zásahů s vysvětlením, proč byl běh zastaven a jaké opatření se změnilo. Bez takového příkladu procenta často neřeknou, zda systém rozpoznává skutečně významné problémy. Nezávislý auditor musí mít možnost ověřit zdrojové záznamy, nikoli jen převzít dashboard dodavatele.
Pro interní program bych stejný formát používal čtvrtletně. V jedné části by byly schopnosti a přínosy, v druhé mandát agentů a výsledky kontrol. Když se počet samostatných běhů zdvojnásobí, musí být vidět, zda se změnila kontrolní kapacita a doba přezkumu. Pokud ne, tempo rozšíření oprávnění má být předmětem rozhodnutí, nikoli vedlejším efektem úspěšné demonstrace.
HRANICE DŮKAZU
Míra zapojení AI do výzkumu není podílem autonomně vyvinutého modelu. Pokrytí monitoringu není jeho účinnost a podíl výpočetního výkonu věnovaného bezpečnosti není kvalita bezpečnostní práce. Srovnání firem vyžaduje stejnou definici a nezávisle ověřitelný vzorek.
Transparentnost potřebuje nezávislé ověření
V metodice Anthropicu stojí důležitá slabina: část práce klasifikuje vlastní AI, tedy systém, jehož použití se současně měří. Firma sama navrhuje nezávislé posouzení a upozorňuje na obtížnost srovnání mezi laboratořemi. Podobně podíl výpočetní kapacity věnované bezpečnosti nevypovídá přímo o kvalitě bezpečnostního výzkumu; některá důležitá práce spotřebuje málo výpočetního výkonu. Metrika bez definice a možnosti auditovat vzorek může vytvořit jen nové číslo pro prezentaci.
Můj názor je, že tato novinka je důležitější jako návrh otázky než jako žebříček firem. Podniky by od dodavatelů AI měly chtít popis kontroly agentních akcí, hranice oprávnění, záznam zásahů a způsob nezávislého ověření. A stejně přísně by měly měřit vlastní agentní provoz. Slib o odpovědné AI získává váhu teprve tehdy, když lze ukázat konkrétní jmenovatel, čas reakce a případ, v němž kontrola skutečně zastavila nevhodnou akci.