DeepSeek V4 Pro nyní běží prostřednictvím platformy RunInfra s výrazným výkonem: model dosahuje 207 tokenů za sekundu (tok/s) při zachování plné kontextové délky 1 milion tokenů bez jakékoliv quantizace. Absence quantizace znamená, že model běží v původní přesnosti, což zajišťuje kvalitu výstupu bez kompromisů na přesnosti. Taková kombinace vysoké rychlosti s maximální kontextovou délkou bez redukce modelu představuje výrazný pokrok v dostupnosti vyspělých jazykových modelů. RunInfra tímto krokem demonstruje, že je možné poskytovat enterprise-grade inference služby s výkonem srovnatelným s nejrychlejšími dostupnými řešeními na trhu.
DeepSeek V4 Pro dosahuje 207 tokenů za sekundu s plnou 1M kontextem
Zdroje
- Hacker News (AI stories): DeepSeek V4 Pro at 207 tok/s with the full 1M context, no quantization
Související články
- 14. 5. 2026 Hugging Face zrychluje kontinuální batch processing pomocí asynchronity
- 15. 8. 2026 Tvůrce webového prohlížeče postaveného na AI čelí kritice komunity
- 14. 8. 2026 Vícemodální chatboti: jak zvolit správný backend, routing a záložní řešení
- 13. 8. 2026 llm-gemini 0.33: Podpora pro Gemini 3.7 Flash a nové embedding modely