OpenAI v nedávné publikaci apresentila, jak GPT 5.6 dosáhl výrazného snížení nákladů na provozování díky vlastní sebeoptimalizaci. Model autonomně analyzoval provozní data, ladit load balancing a přepisoval produkční kernely v jazycích Triton a Gluon, čímž snížil end-to-end náklady na obsluhu o 20 procent. Zároveň vylepšil svůj draft model pro spekulativní dekódování provedením stovek experimentů – změňoval architekturu, velikost a vlastnosti, přičemž autonomně reagoval na problémy včetně selhání hardwaru a nestability tréninku. Tím zvýšil efektivitu generování tokenů o více než 15 procent. Třetí optimalizací bylo vyladění batching, sharding a správy KV cache pro různé typy zatížení. Výsledkem je pokračující trend dramatického poklesu nákladů na provozování inteligence na konstantní úrovni výkonu – intelligence úrovně GPT 5.4 zlevnila třináctinásobně během čtyř měsíců.