هوش مصنوعی ۷ دقیقه مطالعه

Claude Sonnet 5 چیست و چرا با وجود عملکرد قوی، هزینه هر وظیفه آن از Opus 4.8 بیشتر است؟

آیدا استاد شریف آیدا استاد شریف

Claude Sonnet 5 چیست و چرا با وجود عملکرد قوی، هزینه هر وظیفه آن از Opus 4.8 بیشتر است؟

Anthropic با معرفی Claude Sonnet 5 نشان داده که در نسل جدید مدل‌های هوش مصنوعی، صرفا امتیاز بالاتر در بنچمارک‌ها کافی نیست؛ بلکه نسبت عملکرد به هزینه نیز به همان اندازه اهمیت دارد. طبق ارزیابی Artificial Analysis، این مدل توانسته امتیاز 53 را در Artificial Analysis Intelligence Index ثبت کند و به جایگاه پنجم جدول برسد، اما در عین حال، به‌دلیل افزایش مصرف توکن در اجرای وظایف عامل‌محور، هزینه هر وظیفه آن از Claude Opus 4.8 هم بیشتر شده است.

این نکته برای شرکت‌ها و تیم‌هایی که از مدل‌های زبانی در گردش‌کارهای واقعی استفاده می‌کنند اهمیت زیادی دارد. زیرا در دنیای تولید، فقط این مهم نیست که مدل چقدر خوب پاسخ می‌دهد؛ مهم‌تر این است که با چه هزینه‌ای، در چند مرحله، و با چه میزان مصرف منابع به نتیجه می‌رسد.

Claude Sonnet 5 در Artificial Analysis چه عملکردی دارد؟

بر اساس گزارش منتشرشده از Artificial Analysis در 30 ژوئن 2026، Claude Sonnet 5 با امتیاز 53 در Intelligence Index در رتبه پنجم قرار گرفته است. این مدل فقط 2 تا 3 امتیاز با مدل‌هایی مانند GPT-5.5 (xhigh) و Claude Opus 4.8 (max) فاصله دارد؛ فاصله‌ای که از نظر رقابتی بسیار مهم است، چون نشان می‌دهد Sonnet 5 به سطح مدل‌های مرزی نزدیک شده است.

با این حال، ارزیابی‌ها نشان می‌دهند که این مدل هنوز در برخی حوزه‌ها پشت سر برادران بزرگ‌تر خود، یعنی Claude Opus 4.7 و Claude Opus 4.8 قرار می‌گیرد. بنابراین Sonnet 5 را باید مدلی دانست که از نظر توانایی عامل‌محور بسیار قوی است، اما هنوز در همه سناریوهای سنگین reasoning و knowledge در صدر نیست.

چرا هزینه Claude Sonnet 5 از Opus 4.8 بیشتر می‌شود؟

نکته کلیدی اینجاست که هزینه نهایی یک مدل فقط به قیمت هر توکن وابسته نیست؛ مصرف واقعی توکن هم نقش تعیین‌کننده‌ای دارد.

طبق ارزیابی Artificial Analysis:

  • Claude Sonnet 5 با قیمت استاندارد 3 دلار به ازای هر 1 میلیون توکن ورودی و 15 دلار به ازای هر 1 میلیون توکن خروجی عرضه می‌شود.
  • این قیمت از نظر اسمی پایین‌تر از Claude Opus 4.8 است که قیمت 5/25 دلار دارد.
  • اما Sonnet 5 در زمان اجرای وظایف، توکن بیشتری مصرف می‌کند؛ بنابراین هزینه واقعی هر وظیفه بالا می‌رود.

در نتیجه، با وجود اینکه قیمت واحد توکن در Sonnet 5 کمتر است، رفتار پرکارتر مدل باعث می‌شود هزینه نهایی از Opus 4.8 نیز بالاتر برود. Artificial Analysis هزینه هر وظیفه Sonnet 5 را در شاخص Intelligence حدود 2.29 دلار اعلام کرده؛ یعنی تقریباً دو برابر Sonnet 4.6 و حدود 15 درصد بیشتر از Opus 4.8.

نقش تنظیم effort در عملکرد Claude Sonnet 5

یکی از مهم‌ترین ویژگی‌های Sonnet 5، سازگاری آن با سطح‌های مختلف effort است. در این مدل، افزایش effort باعث می‌شود مدل:

  • بیشتر فکر کند،
  • مراحل بیشتری را طی کند،
  • فراخوانی ابزار بیشتری انجام دهد،
  • و خروجی دقیق‌تری در وظایف پیچیده تولید کند.

طبق گزارش، Sonnet 5 در حالت max effort نسبت به Sonnet 4.6 حدود 40 درصد توکن خروجی بیشتری مصرف کرده است. همچنین در ارزیابی‌های عامل‌محور مانند AA-Briefcase و GDPval-AA، تعداد turnهای عامل‌محور آن حدود سه برابر بیشتر شده است.

جالب‌تر اینکه این رفتار به‌خوبی با سطح effort مقیاس می‌شود. برای نمونه، در GDPval-AA، تنظیم max حدود 6 برابر بیشتر از low turn ایجاد می‌کند. این یعنی Sonnet 5 برای کاربرانی که کیفیت و دقت را به کم‌هزینه بودن ترجیح می‌دهند، گزینه‌ای بسیار قدرتمند است؛ اما برای سناریوهای انبوه و حساس به هزینه، استفاده از آن نیازمند دقت بیشتری است.

Claude Sonnet 5 در وظایف عامل‌محور چقدر خوب است؟

اگر معیار را از reasoning محض به کارهای واقعی اداری و حرفه‌ای تغییر دهیم، Sonnet 5 عملکرد بسیار درخشانی دارد.

در بنچمارک‌های:

  • AA-Briefcase
  • GDPval-AA

این مدل کمی بهتر از Claude Opus 4.8 عمل کرده و فقط پشت سر Claude Fable 5 قرار گرفته است؛ مدلی که در زمان گزارش هنوز به‌طور عمومی در دسترس نیست.

این دسته از بنچمارک‌ها توانایی مدل را در تولید خروجی‌های دقیق، ساختاریافته و حرفه‌ای می‌سنجند؛ خروجی‌هایی که برای کارهای اداری، تحلیل اسناد، نگارش گزارش و سناریوهای knowledge work اهمیت دارند. Artificial Analysis برای اجرای این ارزیابی‌ها از چارچوب متن‌باز Stirrup استفاده کرده است.

به بیان ساده، اگر هدف شما انجام کارهای حرفه‌ای با کیفیت بالا باشد، Claude Sonnet 5 یکی از قوی‌ترین گزینه‌هاست؛ حتی اگر از نظر cost-efficiency همیشه بهترین انتخاب نباشد.

Sonnet 5 در بنچمارک‌های reasoning و دانش‌محور چه وضعی دارد؟

با وجود پیشرفت‌های قابل‌توجه، Sonnet 5 هنوز در برخی benchmarkهای سنگین‌تر از مدل‌های بزرگ‌تر عقب‌تر است.

یکی از مهم‌ترین نمونه‌ها CritPt است؛ بنچمارک reasoning فیزیک که توسط پژوهشگران Argonne و UIUC توسعه یافته است. طبق گزارش:

  • Claude Sonnet 5 در این بنچمارک 17 درصد امتیاز گرفته است.
  • این نتیجه 14 امتیاز بالاتر از نسل قبلی آن است.
  • اما هنوز از مدل‌هایی مانند GLM-5.2، Claude Opus، Claude Fable و GPT-5.5 (xhigh / Pro) عقب‌تر است.

این الگو نشان می‌دهد که Sonnet 5 در بسیاری از وظایف پیشرفت جدی داشته، اما در reasoning عمیق و دانش سنگین، هنوز مدل‌های بزرگ‌تر برتری دارند.

بهبودهای Sonnet 5 در سایر بنچمارک‌ها

Claude Sonnet 5 فقط در agentic tasks پیشرفت نکرده، بلکه در چند بنچمارک مهم دیگر هم جهش قابل‌توجهی داشته است:

  • Terminal-Bench v2.1 با 9 امتیاز افزایش
  • Humanity's Last Exam با 10 امتیاز افزایش
  • SciCode با 7 امتیاز افزایش

در مقابل، برخی بنچمارک‌ها تغییر چشمگیری نشان نداده‌اند و عملکرد مدل تقریبا ثابت مانده است. این الگو معمولا نشان می‌دهد که بهبود مدل در همه حوزه‌ها یکنواخت نیست و به‌ویژه در taskهایی که به reasoning مرحله‌ای، ابزارمحوری یا تولید خروجی حرفه‌ای نیاز دارند، تأثیر بیشتری دیده می‌شود.

مشخصات فنی مهم Claude Sonnet 5

Artificial Analysis چند مشخصه مهم دیگر را هم برای این مدل اعلام کرده است:

  • پنجره متن: 1 میلیون توکن
  • قیمت استاندارد: 3/15 دلار برای هر 1 میلیون توکن ورودی/خروجی
  • قیمت تخفیفی موقت: 2/10 دلار تا 1 سپتامبر
  • قیمت کش:
    • 3.75 دلار برای نوشتن کش
    • با TTL پنج‌دقیقه‌ای
    • و 0.3 دلار برای cache hit
  • تنظیم effort:
    • low
    • medium
    • high
    • xhigh
    • max

وجود xhigh در Sonnet 5 یک تغییر مهم است، چون آن را از نظر سطح‌های کنترلی به Opus 4.8 نزدیک می‌کند و به کاربران اجازه می‌دهد بین سرعت، هزینه و کیفیت، انتخاب دقیق‌تری داشته باشند.

آیا Claude Sonnet 5 انتخاب بهتری از Opus 4.8 است؟

پاسخ کوتاه این است: بستگی دارد به کاربرد شما.

اگر اولویت شما:

  • اجرای وظایف عامل‌محور،
  • کیفیت خوب در knowledge work،
  • و انعطاف در effort settings

باشد، Claude Sonnet 5 انتخاب بسیار جذابی است.

اما اگر:

  • reasoning سنگین،
  • عملکرد مرزی در benchmarkهای پیچیده،
  • یا دقت بیشتر در سناریوهای high-stakes

برای شما اولویت دارد، مدل‌های بزرگ‌تر Anthropic همچنان برتری خود را حفظ کرده‌اند.

از طرف دیگر، چون Sonnet 5 با وجود قیمت توکنی کمتر، توکن بیشتری مصرف می‌کند، در عمل ممکن است هزینه نهایی آن از مدل‌های گران‌تر هم بیشتر شود. این همان جایی است که تحلیل cost-per-task از قیمت اسمی مهم‌تر می‌شود.

جمع‌بندی

Claude Sonnet 5 یکی از مهم‌ترین مدل‌های جدید Anthropic در میانه سال 2026 است؛ مدلی که توانسته در Artificial Analysis Intelligence Index به امتیاز 53 برسد و در کارهای عامل‌محور عملکردی بسیار رقابتی ارائه دهد. با این حال، مصرف بالای توکن در حالت‌های effort بالا باعث شده که هزینه هر وظیفه آن از Claude Opus 4.8 هم فراتر برود.

به همین دلیل، Sonnet 5 را باید مدلی دانست که از نظر فنی بسیار قدرتمند است، اما از نظر اقتصادی فقط در برخی سناریوها انتخاب بهینه محسوب می‌شود. برای تیم‌هایی که روی اتوماسیون، دستیارهای حرفه‌ای و workflowهای مبتنی بر agent کار می‌کنند، این مدل می‌تواند گزینه‌ای جدی باشد؛ به‌شرط آنکه هزینه واقعی اجرای آن به‌دقت محاسبه شود.

نوشته‌شده توسط

آیدا استاد شریف

کار من رصد کردن سریع‌ترین تغییرات دنیای تکنولوژیه. عاشق اینم که وسط ترندهای جدید و گجت‌های معرفی‌نشده شیرجه بزنم و زودتر از بقیه سر دربیارم که آینده قراره چه شکلی باشه.

دیدگاه خود را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *