DeepSeek V4 Pro nyní běží prostřednictvím platformy RunInfra s výrazným výkonem: model dosahuje 207 tokenů za sekundu (tok/s) při zachování plné kontextové délky 1 milion tokenů bez jakékoliv quantizace. Absence quantizace znamená, že model běží v původní přesnosti, což zajišťuje kvalitu výstupu bez kompromisů na přesnosti. Taková kombinace vysoké rychlosti s maximální kontextovou délkou bez redukce modelu představuje výrazný pokrok v dostupnosti vyspělých jazykových modelů. RunInfra tímto krokem demonstruje, že je možné poskytovat enterprise-grade inference služby s výkonem srovnatelným s nejrychlejšími dostupnými řešeními na trhu.