تخمین توکن مصرفی عکس و فایل صوتی در مدلهای مختلف، بههمراه هزینه تقریبی و آموزش کامل فرایند.
ورودی تصویر
نتیجه تصویر
دکمه «محاسبه کن» را بزنید.
ورودی صوت
نتیجه صوت
دکمه «محاسبه کن» را بزنید.
ورودی ویدئو
نتیجه ویدئو
دکمه «محاسبه کن» را بزنید.
شرح فرایند توکنسازی تصویر
OpenAI (GPT-4o)
حالت low: کوچکنمایی به ۵۱۲ پیکسل و هزینه ثابت ۸۵ توکن.
حالت high: جا کردن تصویر در قاب ۲۰۴۸×۲۰۴۸ با حفظ نسبت.
کوچک کردن تا ضلع کوچک برابر ۷۶۸ پیکسل شود.
شمارش کاشیهای ۵۱۲ پیکسلی و فرمول ۸۵ + ۱۷۰ × تعداد کاشی.
Anthropic Claude
بدون کاشیبندی پیچیده: کل تصویر یکجا سنجیده میشود.
مساحت تصویر (عرض × ارتفاع) محاسبه میشود.
فرمول ساده: سقف (مساحت ÷ ۷۵۰).
مثال: عکس ۱۰۲۴×۱۰۲۴ حدود ۱۳۹۹ توکن میشود.
Google Gemini
اگر هر دو ضلع حداکثر ۳۸۴ پیکسل باشند: فقط ۲۵۸ توکن.
تصاویر بزرگتر به کاشیهای ۷۶۸ پیکسلی برش میخورند.
هر کاشی ۲۵۸ توکن؛ جمع کل، توکن تصویر است.
صوت هم جدا حساب میشود: حدود ۳۲ توکن در هر ثانیه.
🎬 ویدئو
Gemini ویدئو را با نرخ پیشفرض ۱ فریم در ثانیه نمونهبرداری میکند.
هر فریم مثل یک تصویر ۲۵۸ توکن حساب میشود.
ترک صوتی جداگانه با نرخ ۳۲ توکن در ثانیه اضافه میشود.
در OpenAI فریمها استخراج و هر فریم مثل تصویر high محاسبه میشود.
✨ تولید ویدئو
مدلهایی مثل Seedance و Kling ویدئو میسازند، نه تحلیل میکنند.
قیمتگذاری توکنی نیست؛ بر اساس ثانیه ویدئوی تولیدشده است.
هر مدل نرخ خودش را دارد؛ رزولوشن و حالت حرفهای گرانتر است.
فرمول: مدت (ثانیه) × قیمت هر ثانیه مدل.
تفاوت مدلها در یک نگاه
ارائهدهنده
فرمول تصویر
هزینه پایه
اندازه کاشی
صوت
ویدئو
OpenAI
85 + 170 × tiles
۸۵ توکن
512px
دقیقهای (Whisper)
هر فریم مثل تصویر high
Claude
ceil(w × h / 750)
—
—
پشتیبانی محدود
—
Gemini
258 × tiles
۲۵۸ توکن
768px
۳۲ توکن در ثانیه
۲۵۸ توکن در هر فریم
تولید ویدئو (Seedance، Kling، Sora…)
—
—
—
—
دلار بر ثانیه؛ هر مدل نرخ خودش
توجه: توکنهای تصویر در هر سه ارائهدهنده با نرخ توکن متنی ورودی همان مدل صورتحساب میشوند. اعداد این ابزار تخمینیاند و ممکن است با نسخههای جدید مدلها کمی تغییر کنند.
سؤالهای پرتکرار
توکن تصویر چیست و چرا از توکن متنی پرهزینهتر است؟
مدلهای بینایی تصویر را به قطعات کوچک (تایل) تقسیم میکنند و هر قطعه را جداگانه کدگذاری میکنند؛ به همین دلیل یک عکس معمولی صدها تا چند هزار توکن مصرف میکند، در حالی که همان مفهوم در قالب متن فقط چند توکن لازم دارد.
تفاوت حالت low و high در OpenAI چیست؟
در حالت low تصویر کوچکنمایی میشود و همیشه ۸۵ توکن حساب میشود، اما جزئیات از دست میرود. در حالت high تصویر به کاشیهای ۵۱۲ پیکسلی تقسیم میشود و هزینه برابر ۸۵ + ۱۷۰ × تعداد کاشیهاست؛ مثلاً یک عکس مربعی ۱۰۲۴ پیکسلی ۷۶۵ توکن میشود.
چرا فرمول Claude و Gemini با OpenAI فرق دارد؟
هر ارائهدهنده معماری کدگذار تصویر متفاوتی دارد: Claude مساحت تصویر را بر ۷۵۰ تقسیم میکند، Gemini تصویر را به کاشیهای ۷۶۸ پیکسلی با هزینه ثابت ۲۵۸ توکن میبرد، و OpenAI از ترکیب هزینه پایه و کاشی ۵۱۲ پیکسلی استفاده میکند. نتیجه: یک تصویر یکسان در سه مدل، سه عدد متفاوت میدهد.
هزینه صوت چگونه محاسبه میشود؟
دو مدل قیمتگذاری وجود دارد: مدلهای رونویسی مثل Whisper بر اساس دقیقه (مثلاً ۰٫۰۰۶ دلار در دقیقه) و مدلهای چندوجهی مثل Gemini بر اساس توکن (حدود ۳۲ توکن در هر ثانیه) هزینه میگیرند. این ابزار هر دو حالت را پشتیبانی میکند.
توکن ویدئو چطور حساب میشود؟
Gemini ویدئو را با نرخ پیشفرض یک فریم در ثانیه نمونهبرداری میکند و هر فریم ۲۵۸ توکن است؛ مثلاً یک دقیقه ویدئو حدود ۱۵٬۴۸۰ توکن تصویری بهعلاوه ترک صوتی میشود. در OpenAI باید فریمها را استخراج کرد و هر فریم مثل یک تصویر با جزئیات بالا محاسبه میشود.
هزینه تولید ویدئو با Seedance و Kling چطور حساب میشود؟
مدلهای تولید ویدئو مثل Seedance، Kling، Sora و Runway قیمتگذاری توکنی ندارند؛ هزینه بر اساس ثانیه ویدئوی تولیدشده است و هر مدل نرخ خودش را دارد (رزولوشن بالاتر و حالت حرفهای گرانتر است). کافی است مدت را در قیمت هر ثانیه مدل ضرب کنید؛ این ابزار نرخهای پیشفرض تقریبی دارد که میتوانید با نرخ دقیق ارائهدهنده جایگزین کنید.