Mnoho webů má příliš mnoho tagů na to, aby je bylo možné předat jazykovému modelu s požadavkem na klasifikaci. Simon Willison si všímá, že jeho blog obsahuje 1 856 tagů, což by bylo příliš na jeden dotaz. Doug Turnbull přichází s elegantním řešením: místo klasického výběru z předdefinované sady instruuje model, aby vygeneroval nové, imaginární tagy odpovídající obsahu. Poté se použijí vektorové vnoření k nalezení konkrétních existujících tagů, které jsou sémanticky nejbližší těm, které si model „vymyslel". Turnbull doporučuje v promptu zahrnout příklady struktury tagů, aby model generoval užitečnější odhady. Takový přístup redukuje počet tokenů ve promptu a zároveň umožňuje modelu myslet kreativněji.
Nechte model hádat tagy. Pak je namapujte na existující slovník
Zdroje
- Simon Willison: Don't classify. Hallucinate!
Související články
- 17. 8. 2026 DeepSeek V4 Pro dosahuje 207 tokenů za sekundu s plnou 1M kontextem
- 15. 8. 2026 Tvůrce webového prohlížeče postaveného na AI čelí kritice komunity
- 14. 8. 2026 Vícemodální chatboti: jak zvolit správný backend, routing a záložní řešení
- 13. 8. 2026 llm-gemini 0.33: Podpora pro Gemini 3.7 Flash a nové embedding modely