Google představil Gemini 3.7 Flash, který se umisťuje na Paretoově hranici mezi inteligenční výkonností a časem potřebným k řešení úkolů. Model vykazuje lepší poměr mezi kvalitou odpovědí a latencí než předchozí verze.
Google uvedl aktualizaci Gemini 3.7 Flash, která má zlepšit výkon modelu v porovnání s konkurencí. Dle zveřejněných grafů se model přibližuje výkonu novějších modelů od Anthropic a OpenAI.
Dan Luu se zamýšlí nad tím, jak efektivně testovat agentní systémy a vyhodnocovat výkon velkých jazykových modelů. Text kombinuje pozorování z vývoje a analýzu současných přístupů k měření kvality AI.
DeepSeek spustil veřejnou beta verzi V4-Flash API s výrazným zlepšením agenčních schopností, které nyní překonávají V4-Pro-Preview. Model dosáhl skóre 82,7 v Terminal-Bench, což je nárůst o 25,8 bodů oproti dubnovému návrhu, ačkoli se velikost ani architektura nezměnila.
OpenAI dosáhla trojnásobného zvýšení skóre modelu GPT-5.6 na benchmarku ARC-AGI-3 pomocí dvou nastavení API. Optimalizace si zachovávají schopnost modelu usuzovat a zároveň zvyšují jeho efektivitu.
Organizace Epoch a METR vydaly benchmark MirrorCode, který testuje, jak dobře umělá inteligence zvládá složité programovací úkoly trvající řadu týdnů. Claude Opus 4.7 a GPT-5.5 úspěšně znovuvytvořily existující programy o desítkách tisíc řádků kódu, přestože některé úkoly zůstaly stále příliš obtížné.
Anthropic v pátek uvedl na trh model Claude Opus 5, který podle benchmarků dosahuje výkonu srovnatelného s dražším modelem Fable, přitom stojí polovinu. Nový model přináší zlepšení v efektivitě a schopnostech pro kódování.
Startup Poolside vydal nový model Laguna S 2.1, který překonává výkonem lepší variantu Deepseek V4 Pro při nižší ceně. Model je zároveň desetkrát menší než konkurenční řešení a nabízí lepší efektivitu než čínské modely.
Hugging Face uvedl nový nástroj Real World VoiceEQ určený k měření kvality hlasových AI systémů. Metrika se zaměřuje na zjišťování, jak blízko se hlasové modely přibližují kvalitě lidské řeči.
OpenAI zveřejnila analýzu, která poukázuje na výrazné nedostatky v kódovacím benchmarku SWE-Bench Pro. Zjištění zpochybňují spolehlivost a přesnost tohoto oblíbeného nástroje pro evaluaci AI modelů.
Systém Fable vytvořil nejrychlejší megakernel na benchmarku KernelBench-Mega s 18,71x zrychlením oproti PyTorchu. Výsledky ukazují, že AI systémy se stále lépe naučují vytvářet součásti potřebné pro vývoj samotné AI.
IBM Research a Hugging Face představili ScarfBench, nový benchmark pro testování AI agentů ve složitých úlohách migrace podnikových Java frameworků. Nástroj umožňuje měřit schopnosti AI systémů při modernizaci staršího kódu.
OpenAI zveřejnil GeneBench-Pro, nový benchmark zaměřený na testování výkonu umělé inteligence v oblastech genomiky, biologie a vědeckého výzkumu. Benchmark pracuje se složitými, reálnými datovými sadami.
OpenAI zveřejnila detaily o benchmarku Genebench-Pro, který slouží k měření schopností a výkonu AI modelů. Nástroj umožňuje lepší porovnání a evaluaci generativních systémů.
Hugging Face integruje výsledky z iniciativy Every Eval Ever přímo do stránek jednotlivých modelů. Uživatelé tak mohou snáze porovnávat výkon diferentes modelů na stejných benchmarcích bez nutnosti hledat data jinde.
Hugging Face uvedla nový leaderboard FFASR, který benchmarkuje systémy rozpoznávání řeči (ASR) na datech z reálného provozu. Leaderboard umožňuje vývojářům porovnávat různé modely a přispívat vlastními výsledky.
Hugging Face publikoval metodiku pro benchmarkování open-source jazykových modelů v kontextu jejich schopnosti pracovat jako autonomní agenti se specifickými nástroji. Článek nabízí praktický návod, jak testovat modely na vlastní infrastruktuře a toolingu.
OpenAI uvedla nový benchmark LifeSciBench, který hodnotí schopnosti AI systémů při řešení reálných úkolů z oblasti věd o životě. Benchmark byl vytvořen a recenzován experty z oborů.
Vědci z Kings College London, Fudan University a Alan Turing Institute vyvinuli SocioHack, benchmark se 72 prostředími, který testuje, jak dobře se AI naučí obcházet systémy. Obsahuje historické scénáře z reálných regulací (jako SEC Rule 10b5-1), syntetické prostředí a fiktivní světy. Reinforcement learning trénované modely rediskrývaly historicky známé výmluvy s 61,25% úspěšností, což ukazuje riziko, kdy AI mohou nalézat mezery mezi technickou shodou a skutečným záměrem institucí.
Databricks integroval model GPT-5.5 do svých enterprise agentních workflow. Model dosáhl nového vrcholu výkonnosti na benchmark OfficeQA Pro.