Ik heb onderzocht hoe we vision-language-modellen (VLM's) kunnen inzetten om objectclassificatietaken te optimaliseren. Daarbij liet ik me inspireren door workflows zoals de demonstraties van Rohit Singh, waarin beeld- en tekstcontext worden gecombineerd voor betrouwbare ruimtelijke redenering.
Voordat ik begin met testen, wilde ik één vraag stellen:
Impact op gebruik en quota: afbeeldingen met een hoge resolutie invoeren in een OpenAI-model kost snel veel tokens. Ik vraag me af hoeveel dit onze limieten zal belasten. Heeft iemand getest hoe snel een workflow als deze een standaard testbudget van vijf uur verbruikt?