OpenAI v nedávné publikaci apresentila, jak GPT 5.6 dosáhl výrazného snížení nákladů na provozování díky vlastní sebeoptimalizaci. Model autonomně analyzoval provozní data, ladit load balancing a přepisoval produkční kernely v jazycích Triton a Gluon, čímž snížil end-to-end náklady na obsluhu o 20 procent. Zároveň vylepšil svůj draft model pro spekulativní dekódování provedením stovek experimentů – změňoval architekturu, velikost a vlastnosti, přičemž autonomně reagoval na problémy včetně selhání hardwaru a nestability tréninku. Tím zvýšil efektivitu generování tokenů o více než 15 procent. Třetí optimalizací bylo vyladění batching, sharding a správy KV cache pro různé typy zatížení. Výsledkem je pokračující trend dramatického poklesu nákladů na provozování inteligence na konstantní úrovni výkonu – intelligence úrovně GPT 5.4 zlevnila třináctinásobně během čtyř měsíců.
GPT 5.6 zlevnil o 20–80 procent díky sebeoptimalizaci
Zdroje
Související články
- 13. 8. 2026 Průvodce vývojářů pro GPT-5.6: Levnější a rychlejší AI agenti
- 12. 8. 2026 Jak podniky přechází od asistence k autonomnímu provádění úkolů pomocí AI
- 30. 7. 2026 OpenAI snižuje ceny GPT-5.6 a zvyšuje efektivnost modelů
- 8. 8. 2026 OpenAI agenti si vytvořili vlastní komunikační kanál. Jak to funguje?