Příspěvek se zabývá praktickými aspekty vývoje agentních systémů postavených na LLM, zejména jejich testováním a evaluací. Autor rozebírá, jak tradiční benchmarky a metriky často nedokázují plně zachytit skutečnou užitečnost modelů v reálných aplikacích. Upozorňuje na rozpor mezi skóre v populárních benchmarcích a skutečným výkonem agentů při řešení komplexních úloh. Text se dotýká také problémů při návrhu vhodných testovacích procesů, které by realistically simulovaly produkční podmínky. Luu zdůrazňuje, že některé metriky mohou být zavádějící a že vývojáři se musí spoléhat na kombinaci objektivních měření a kvalitativní analýzy.