Ich habe mich damit beschäftigt, wie wir Vision-Language-Modelle (VLMs) zur Optimierung von Objektklassifizierungsaufgaben einsetzen können. Dabei habe ich mich von Arbeitsabläufen wie den Demonstrationen von Rohit Singh inspirieren lassen, bei denen Bild- und Textkontext für zuverlässiges räumliches Schlussfolgern kombiniert werden.
Bevor ich mit dem Testen beginne, wollte ich eine Frage stellen:
Auswirkungen auf Nutzung und Kontingent: Das Einspeisen hochauflösender Bilder in ein OpenAI-Modell verbraucht schnell Tokens. Mich interessiert, wie stark sich das auf unsere Limits auswirken wird. Hat schon jemand getestet, wie schnell ein solcher Arbeitsablauf ein reguläres fünfstündiges Testkontingent aufbraucht?