Zkoumal jsem, jak můžeme využít vizuálně-jazykové modely (VLM) k optimalizaci úloh klasifikace objektů. Inspiraci jsem čerpal z postupů, jako jsou ukázky Rohita Singha, které kombinují obrazový a textový kontext pro spolehlivé prostorové uvažování.
Než začnu testovat, chtěl bych položit jednu otázku:
Dopad na využití a kvótu: Vkládání obrázků ve vysokém rozlišení do modelu OpenAI rychle spotřebovává tokeny. Zajímalo by mě, jak moc to zasáhne naše limity. Testoval někdo, jak rychle takový pracovní postup vyčerpá standardní pětihodinový testovací limit?