Tenho explorado como podemos usar modelos de linguagem visual (VLMs) para otimizar tarefas de classificação de objetos, inspirando-me em fluxos de trabalho como as demonstrações de Rohit Singh, que combinam contexto de imagem e texto para um raciocínio espacial robusto.
Antes de começar os testes, queria fazer uma pergunta:
Impacto no uso e na cota: enviar imagens em alta resolução para o modelo da OpenAI consome tokens rapidamente. Quero saber o quanto isso afetará nossos limites. Alguém já testou com que rapidez um fluxo de trabalho como esse consome uma cota padrão de cinco horas de testes?