Francouzská startup Kog zpochybňuje rozšířený názor, že grafické procesory nejsou vhodné pro agentní pracovní postupy. Společnost se zaměřuje na optimalizaci inference na GPU pro tyto náročné úlohy.
Hugging Face porovnává nečinné GPU s uzemnými letadly a poukazuje na problém neefektivního využití výpočetních zdrojů. Článek se zabývá tím, jak mohou firmy lépe spravovat své GPU infrastrukturu.
Hugging Face a IBM Research analyzují výzvy při nasazování systémů, které dynamicky volí mezi více AI modely. Zdánlivě jednoduchá úloha se ukázala být složitější, než by se na první pohled zdálo.
Hugging Face vydal třetí díl série o profilování výkonu v PyTorchu, zaměřený na optimalizaci attention mechanismů. Článek ukazuje, jak měřit a zlepšovat výkon klíčové komponenty transformerových modelů.
Hugging Face a vLLM spouštějí nový transformers modeling backend, který nabízí native-speed výkon. Integrace má zjednodušit práci vývojářů a urychlit běh modelů bez komplikací.
Hugging Face zveřejnila druhou část série o profilování výkonu v PyTorch. Zaměřuje se na optimalizaci neuronových sítí prostřednictvím fúze operací, konkrétně jak transformovat standardní lineární vrstvy do efektivnějších fúzovaných MLP implementací.
Google DeepMind představil DiffusionGemma, novou metodu, která urychluje generování textu čtyřikrát oproti standardním přístupům. Jde o kombinaci difúzního modelování s jazykovými modely, která slibuje efektivnější zpracování textů.
Hugging Face vydala první část průvodce zaměřeného na profilování výkonu v PyTorchi. Článek vysvětluje, jak používat torch.profiler k analýze a optimalizaci trénovacích modelů.
Hugging Face představil novou funkci Delta Weight Sync v knihovně TRL, která zlepšuje distribuci modelů se biliony parametrů. Technologie umožňuje efektivnější synchronizaci vah modelů přes Hub Bucket.