J’explore comment utiliser les modèles vision-langage (VLM) pour optimiser les tâches de classification d’objets, en m’inspirant de flux de travail comme les démonstrations de Rohit Singh, qui combinent le contexte des images et du texte pour un raisonnement spatial robuste.
Avant de commencer les tests, j’avais une question :
Impact sur l’utilisation et le quota : transmettre des images haute résolution à un modèle OpenAI consomme rapidement des jetons. Je me demande dans quelle mesure cela affectera nos limites. Quelqu’un a-t-il testé à quelle vitesse un flux de travail de ce type consomme une allocation standard de cinq heures de test ?