He estado explorando cómo podemos usar modelos de lenguaje y visión (VLM) para optimizar tareas de clasificación de objetos, inspirándome en flujos de trabajo como las demostraciones de Rohit Singh, que combinan el contexto de imágenes y texto para lograr un razonamiento espacial sólido.
Antes de empezar las pruebas, quería hacer una pregunta:
Impacto en el uso y la cuota: introducir imágenes de alta resolución en un modelo de OpenAI consume tokens rápidamente. Me pregunto cuánto afectará esto a nuestros límites. ¿Alguien ha probado qué tan rápido consume un flujo de trabajo como este una asignación estándar de cinco horas de pruebas?