OpenAI odhalila problémy v populárním benchmarku SWE-Bench Pro
OpenAI zveřejnila analýzu, která poukázuje na výrazné nedostatky v kódovacím benchmarku SWE-Bench Pro. Zjištění zpochybňují spolehlivost a přesnost tohoto oblíbeného nástroje pro evaluaci AI modelů.