物体分類タスクを最適化するために、視覚言語モデル(VLM)をどのように活用できるか調べています。Rohit Singh氏が実演している、画像とテキストのコンテキストを組み合わせて堅牢な空間推論を行うワークフローなどを参考にしています。
テストを始める前に、1つ質問させてください。
利用量とクォータへの影響:高解像度の画像をOpenAIのモデルに入力すると、トークンをすぐに消費します。利用上限にどれほど影響するのか気になります。このようなワークフローで、標準の5時間分のテスト枠がどれくらいの速さで消費されるか、試した方はいらっしゃいますか?