محاسبه توکن تصویر و صوت

تخمین توکن مصرفی عکس و فایل صوتی در مدل‌های مختلف، به‌همراه هزینه تقریبی و آموزش کامل فرایند.

ورودی تصویر

نتیجه تصویر

دکمه «محاسبه کن» را بزنید.

ورودی صوت

نتیجه صوت

دکمه «محاسبه کن» را بزنید.

ورودی ویدئو

نتیجه ویدئو

دکمه «محاسبه کن» را بزنید.

شرح فرایند توکن‌سازی تصویر

OpenAI (GPT-4o)

  1. حالت low: کوچک‌نمایی به ۵۱۲ پیکسل و هزینه ثابت ۸۵ توکن.
  2. حالت high: جا کردن تصویر در قاب ۲۰۴۸×۲۰۴۸ با حفظ نسبت.
  3. کوچک کردن تا ضلع کوچک برابر ۷۶۸ پیکسل شود.
  4. شمارش کاشی‌های ۵۱۲ پیکسلی و فرمول ۸۵ + ۱۷۰ × تعداد کاشی.

Anthropic Claude

  1. بدون کاشی‌بندی پیچیده: کل تصویر یکجا سنجیده می‌شود.
  2. مساحت تصویر (عرض × ارتفاع) محاسبه می‌شود.
  3. فرمول ساده: سقف (مساحت ÷ ۷۵۰).
  4. مثال: عکس ۱۰۲۴×۱۰۲۴ حدود ۱۳۹۹ توکن می‌شود.

Google Gemini

  1. اگر هر دو ضلع حداکثر ۳۸۴ پیکسل باشند: فقط ۲۵۸ توکن.
  2. تصاویر بزرگ‌تر به کاشی‌های ۷۶۸ پیکسلی برش می‌خورند.
  3. هر کاشی ۲۵۸ توکن؛ جمع کل، توکن تصویر است.
  4. صوت هم جدا حساب می‌شود: حدود ۳۲ توکن در هر ثانیه.

🎬 ویدئو

  1. Gemini ویدئو را با نرخ پیش‌فرض ۱ فریم در ثانیه نمونه‌برداری می‌کند.
  2. هر فریم مثل یک تصویر ۲۵۸ توکن حساب می‌شود.
  3. ترک صوتی جداگانه با نرخ ۳۲ توکن در ثانیه اضافه می‌شود.
  4. در OpenAI فریم‌ها استخراج و هر فریم مثل تصویر high محاسبه می‌شود.

✨ تولید ویدئو

  1. مدل‌هایی مثل Seedance و Kling ویدئو می‌سازند، نه تحلیل می‌کنند.
  2. قیمت‌گذاری توکنی نیست؛ بر اساس ثانیه ویدئوی تولیدشده است.
  3. هر مدل نرخ خودش را دارد؛ رزولوشن و حالت حرفه‌ای گران‌تر است.
  4. فرمول: مدت (ثانیه) × قیمت هر ثانیه مدل.

تفاوت مدل‌ها در یک نگاه

ارائه‌دهنده فرمول تصویر هزینه پایه اندازه کاشی صوت ویدئو
OpenAI85 + 170 × tiles۸۵ توکن512pxدقیقه‌ای (Whisper)هر فریم مثل تصویر high
Claudeceil(w × h / 750)پشتیبانی محدود
Gemini258 × tiles۲۵۸ توکن768px۳۲ توکن در ثانیه۲۵۸ توکن در هر فریم
تولید ویدئو (Seedance، Kling، Sora…)دلار بر ثانیه؛ هر مدل نرخ خودش

توجه: توکن‌های تصویر در هر سه ارائه‌دهنده با نرخ توکن متنی ورودی همان مدل صورتحساب می‌شوند. اعداد این ابزار تخمینی‌اند و ممکن است با نسخه‌های جدید مدل‌ها کمی تغییر کنند.

سؤال‌های پرتکرار

توکن تصویر چیست و چرا از توکن متنی پرهزینه‌تر است؟

مدل‌های بینایی تصویر را به قطعات کوچک (تایل) تقسیم می‌کنند و هر قطعه را جداگانه کدگذاری می‌کنند؛ به همین دلیل یک عکس معمولی صدها تا چند هزار توکن مصرف می‌کند، در حالی که همان مفهوم در قالب متن فقط چند توکن لازم دارد.

تفاوت حالت low و high در OpenAI چیست؟

در حالت low تصویر کوچک‌نمایی می‌شود و همیشه ۸۵ توکن حساب می‌شود، اما جزئیات از دست می‌رود. در حالت high تصویر به کاشی‌های ۵۱۲ پیکسلی تقسیم می‌شود و هزینه برابر ۸۵ + ۱۷۰ × تعداد کاشی‌هاست؛ مثلاً یک عکس مربعی ۱۰۲۴ پیکسلی ۷۶۵ توکن می‌شود.

چرا فرمول Claude و Gemini با OpenAI فرق دارد؟

هر ارائه‌دهنده معماری کدگذار تصویر متفاوتی دارد: Claude مساحت تصویر را بر ۷۵۰ تقسیم می‌کند، Gemini تصویر را به کاشی‌های ۷۶۸ پیکسلی با هزینه ثابت ۲۵۸ توکن می‌برد، و OpenAI از ترکیب هزینه پایه و کاشی ۵۱۲ پیکسلی استفاده می‌کند. نتیجه: یک تصویر یکسان در سه مدل، سه عدد متفاوت می‌دهد.

هزینه صوت چگونه محاسبه می‌شود؟

دو مدل قیمت‌گذاری وجود دارد: مدل‌های رونویسی مثل Whisper بر اساس دقیقه (مثلاً ۰٫۰۰۶ دلار در دقیقه) و مدل‌های چندوجهی مثل Gemini بر اساس توکن (حدود ۳۲ توکن در هر ثانیه) هزینه می‌گیرند. این ابزار هر دو حالت را پشتیبانی می‌کند.

توکن ویدئو چطور حساب می‌شود؟

Gemini ویدئو را با نرخ پیش‌فرض یک فریم در ثانیه نمونه‌برداری می‌کند و هر فریم ۲۵۸ توکن است؛ مثلاً یک دقیقه ویدئو حدود ۱۵٬۴۸۰ توکن تصویری به‌علاوه ترک صوتی می‌شود. در OpenAI باید فریم‌ها را استخراج کرد و هر فریم مثل یک تصویر با جزئیات بالا محاسبه می‌شود.

هزینه تولید ویدئو با Seedance و Kling چطور حساب می‌شود؟

مدل‌های تولید ویدئو مثل Seedance، Kling، Sora و Runway قیمت‌گذاری توکنی ندارند؛ هزینه بر اساس ثانیه ویدئوی تولیدشده است و هر مدل نرخ خودش را دارد (رزولوشن بالاتر و حالت حرفه‌ای گران‌تر است). کافی است مدت را در قیمت هر ثانیه مدل ضرب کنید؛ این ابزار نرخ‌های پیش‌فرض تقریبی دارد که می‌توانید با نرخ دقیق ارائه‌دهنده جایگزین کنید.