Reklama

20. 9. 2026 · Miharu Edge

Blíží se ternární modely. Slibují levnější AI, ale rozhodne celý systém

Srpnové studie ScaleQ-1.58 a QTEA ukázaly, že ternární váhy mohou dávat lepší výsledky také při převodu již vytrénovaných jazykových modelů. V září přibyl veřejně dostupný 27miliardový model Ternary Bonsai 2 a nová metoda úsporného uložení vah BITCOS. Pokrok je konkrétní, ale jednotlivá čísla měří odlišné věci: přesnost vybraných úloh, velikost vah nebo rychlost určitého jádra. O podnikové hodnotě rozhodne kvalita na vlastních datech a cena celé služby.

Výzkumník porovnává kompaktní čipy a provozní nároky ternárního jazykového modelu
Tři hodnoty vah mění ekonomiku inference

Od BitNetu k srpnovým výsledkům

Microsoft Research představil BitNet b1.58 s ternárními vahami. Číslo 1,58 vychází přibližně z logaritmu tří možných hodnot; neznamená, že každý skutečně uložený parametr zabere přesně tolik bitů. Software bitnet.cpp tým zveřejnil v roce 2024 a nativně trénovaný model 2B4T v roce 2025. Březnový Sparse-BitNet zkoumal spojení nízké přesnosti a strukturované řídkosti. Srpnové práce ScaleQ-1.58 a QTEA naopak řeší, jak na ternární váhy převést už natrénované modely bez tak výrazné ztráty schopností. Zářijová práce BITCOS zkoumá účinnější uložení nul a znamének. Tyto výsledky nelze sečíst do jednoho násobku úspory, protože zasahují různé části systému.

Srpnové studie posunuly dodatečnou kvantizaci

ScaleQ-1.58 používá při kalibraci i postup uvažování, který si vytvořil původní model. Autoři uvádějí, že takto převedený Qwen3-1.7B dosáhl s využitím čtyř milionů kalibračních tokenů více než 90,52 procenta skóre modelu BitNet b1.58 2B4T v průměru čtyř matematických a programovacích úloh. Srovnávají tedy dva různé modely na vybraných testech, nikoli zachování 90,52 procenta všech schopností původního modelu Qwen3-1.7B. Sami upozorňují, že u složitého uvažování zbývá odstup od modelu s plnou přesností a že podpora účinných jader pro různé ternární architektury je omezená.

QTEA, zveřejněná 31. srpna, přidává k ternárním vahám řídké opravné hodnoty pro důležité části modelu. U Qwen3-14B autoři uvádějí efektivních 1,7 bitu na váhu a zlepšení průměrné přesnosti ve svých testech ze 45,11 na 52,65 bodu proti nejsilnější srovnávané ternární metodě. Původní model s plnou přesností však ve stejné tabulce získal 68,23 bodu. Výsledek je výrazný pokrok v rámci velmi nízkého počtu bitů, nikoli důkaz, že dodatečný převod už běžně zachová výkon původního modelu.

Veřejný 27miliardový model dává výzkumu provozní podobu

PrismML vydala 17. září Ternary Bonsai 2 27B odvozený od Qwen3.8-27B. Kompaktní balení jazykových vah má podle zveřejněné karty modelu 5,95 GB; plná přesnost má přibližně 54 GB. Dodavatel uvádí zachování 98,2 procenta souhrnného skóre na své sadě benchmarků. Váhy jsou veřejně dostupné, takže výsledky lze zkusit na konkrétních úlohách. Číslo 98,2 procenta ale není zárukou stejné kvality každé odpovědi ani nezávislým provozním měřením.

Praktická výjimka je v běhovém prostředí: podle karty modelu potřebují úsporné formáty PTQ1_0 a PQ2_0 upravenou větev llama.cpp. Běžná verze je nerozpozná a variantu Q2_0 může načíst s chybným výstupem bez varování. Navíc menší balení není na každém hardwaru nejrychlejší. Při pilotu proto vedle kvality a paměti ověřte přesný formát vah, verzi inference serveru a rychlost na zařízení, na kterém má služba skutečně běžet.

Pro rozhodování je důležitý rozdíl mezi modelem trénovaným pro ternární váhy od začátku a hotovým modelem převedeným až po trénování. BitNet 2B4T ukazuje první cestu; ScaleQ-1.58, QTEA a Bonsai 2 druhou. Novější převodní postupy mohou ušetřit náklady na nový trénink, ale míra zachování schopností závisí na úloze a na použitém výchozím modelu. Nelze proto vzít libovolný současný model a předpokládat, že se po ternárním převodu bude chovat stejně.

PRACOVNÍ TEZE

Ternární reprezentace otevírá možnost levnější inference, zejména u omezené paměti. Její podniková hodnota se určí až při stejné kvalitě úlohy a započtení celého provozního řetězce.

Paměť vah je jen jedna položka provozního účtu

Představme si interní asistenta, který zpracovává krátké dotazy z dokumentace. Menší váhy mohou dovolit provoz na levnějším zařízení a zlepšit latenci při nízkém počtu souběžných uživatelů. U dlouhých konverzací ale rostou nároky na KV cache, u vyhledávání přibude index a síť, u hromadného provozu rozhodne scheduler a dávkování požadavků. Specializovaný kernel také nemusí být stejně dobrý na všech CPU a GPU. Číslo z papíru o úspoře paměti proto nepřenášejte přímo do rozpočtu celé služby.

Praktický pilot potřebuje vedle sebe kvalitu odpovědi na vlastních úlohách, paměť při reálné délce kontextu, latenci p50 a p95, spotřebu energie na dokončený úkol a celkové náklady včetně provozu. Srovnávejte při stejné úspěšnosti úloh, ne jen při stejném počtu parametrů. Pokud menší model potřebuje opakované pokusy nebo častější eskalaci k dražšímu modelu, část úspory zmizí.

Úsporu je třeba měřit po vrstvách

Vrstva Co může ternární model zlepšit Co pilot musí změřit
Uložení vah Méně bajtů pro samotné váhy Celkovou obsazenou paměť včetně runtime
Výpočet tokenu Výhodu specializovaného jádra na podporovaném hardwaru Latenci p95 a propustnost při skutečné zátěži
Dlouhý kontext Bez přímé úspory celé KV cache Paměť při reálné délce dotazu
Dokončená úloha Potenciálně nižší provozní cenu Kvalitu, opakování odpovědi, energii a eskalace

Výkonové číslo je nutné rozebrat na fáze

U jazykového modelu uživatel vnímá čas k prvnímu tokenu a potom rychlost dokončení odpovědi. Tyto části zatěžují hardware jinak. Menší váhy mohou pomoci při přesunu modelu z paměti a při některých operacích, ale delší vstup zvyšuje nároky na zpracování kontextu. Pokud benchmark měří jen generování dalšího tokenu na jednom zařízení, nemusí predikovat čekání v podnikové frontě s různými délkami dotazů. Zdrojem mohou být i optimalizace konkrétní knihovny, které chybějí v běžném produkčním systému.

Při čtení výsledku studie si proto všímejte měřené úlohy, modelové velikosti, tréninkového rozpočtu, typu hardwaru, přesnosti aktivací a toho, zda benchmark zahrnuje celý proces od dotazu po odpověď. Ternární váhy nezaručují ternární celý výpočet. Aktivace, normalizace, mechanismus pozornosti a cache mají vlastní paměť i energetickou cenu. Číslo „1,58 bitu“ je důležitý architektonický údaj, ale není celkové TCO.

Model s nízkým počtem bitů potřebuje vlastní provozní plán

Veřejně dostupné váhy usnadňují pilot, ale neodstraňují závislost na konkrétním formátu a inference serveru. Před rozhodnutím ověřte licenci, podporu požadovaného jazyka, délku kontextu, kompatibilitu s bezpečnostními filtry a postup aktualizace. U převodu po trénování se přidává otázka, kdo bude kalibrovat další verze výchozího modelu. Úspora na uložených vahách má cenu jen tehdy, pokud provozní tým zvládne tuto cestu opakovat a kontrolovat.

Smysluplný experiment může na jedné opakovatelné úloze postavit proti sobě současný model, menší běžný model, nativně ternární variantu a některou veřejně dostupnou dodatečně převedenou variantu. Měřte úspěšnost dokončené úlohy při stejné zátěži, ne pouze skóre obecného benchmarku. Když nová varianta ušetří paměť, ale vyžádá si častější opravy odpovědí nebo zvláštní runtime, musí se to projevit v celkové ceně.

Slibná inovace bez univerzálního vítěze

Práce BITCOS ukazuje, že ani samotné ukládání tří hodnot nemá jen jednu správnou podobu. Pokud model obsahuje více nul, rozložení vah se dá využít pro úsporu prostoru; výsledek ale závisí na rozložení hodnot a na efektivitě rozbalování pro daný procesor. Sparse-BitNet zase zkoumá, jak spojit ternární reprezentaci se strukturovanou řídkostí. Oba směry ilustrují, že pokrok vzniká ve vazbě matematické reprezentace a hardwarových kernelů, nikoli v jediné zázračné volbě datového typu.

Z tohoto důvodu bych zprávu „blíží se ternární modely“ nečetl jako datum, kdy staré modely zastarají. Četl bych ji jako signál, že jednotkové náklady na vybrané AI úlohy se mohou výrazně měnit. Architektura by měla umožnit model pro jednu úlohu vyměnit, měřit kvalitu a cenu a bezpečně vrátit předchozí variantu. Tato flexibilita bude mít hodnotu, i kdyby nakonec zvítězila jiná technologie s nízkým počtem bitů.

HRANICE DŮKAZU

ScaleQ-1.58 srovnává vybrané matematické a programovací úlohy, QTEA má i po zlepšení odstup od původního modelu s plnou přesností a skóre Bonsai 2 pochází od jeho výrobce. BITCOS řeší hlavně ukládání a rozbalování vah. Žádný z těchto výsledků sám nedokládá nižší cenu celé podnikové služby při stejné kvalitě odpovědí.

Kde čekám první smysluplné nasazení

Nejpravděpodobnější jsou opakovatelné úlohy s jasným zadáním: lokální klasifikace, extrakce, jednoduchý asistent pro servisní dokumentaci nebo běh na zařízení s omezenou pamětí. Tam lze hodnotit výsledek po jednotlivých úlohách a případnou chybu zachytit. U náročného právního posouzení, neznámého výzkumného problému nebo autonomního zásahu do produkce bych nejdřív požadoval důkaz kvality, nikoli jen elegantní bitovou reprezentaci.

Můj názor je optimistický, ale technicky podmíněný. Ternární modely mohou změnit cenu lokální inference a rozšířit okruh zařízení, na kterých se AI vyplatí. Vítězem však nemusí být první model s nejnižším počtem bitů. Vítězem bude kombinace trénování, knihoven, hardwaru, kvality na konkrétních úlohách a jednoduchého provozu. Dnes je vhodná doba na cílené benchmarky, ne na plošnou migraci všech aplikací.

Zdroje13
  1. https://www.microsoft.com/en-us/research/publication/the-era-of-1-bit-llms-all-large-language-models-are-in-1-58-bits/
  2. https://arxiv.org/abs/2504.12285
  3. https://www.microsoft.com/en-us/research/publication/sparse-bitnet-1-58-bit-llms-are-naturally-friendly-to-semi-structured-sparsity/
  4. https://arxiv.org/abs/2609.16338
  5. https://arxiv.org/abs/2402.17764
  6. https://github.com/microsoft/BitNet
  7. https://arxiv.org/abs/2410.16144
  8. https://jmlr.org/papers/volume26/24-2050/24-2050.pdf
  9. https://arxiv.org/abs/2608.01078
  10. https://arxiv.org/abs/2609.00224
  11. https://prismml.com/news/bonsai-2-27b
  12. https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf
  13. https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-2-27b-whitepaper.pdf