Claude Sonnet 5 چیست و چرا با وجود عملکرد قوی، هزینه هر وظیفه آن از Opus 4.8 بیشتر است؟
Anthropic با معرفی Claude Sonnet 5 نشان داده که در نسل جدید مدلهای هوش مصنوعی، صرفا امتیاز بالاتر در بنچمارکها کافی نیست؛ بلکه نسبت عملکرد به هزینه نیز به همان اندازه اهمیت دارد. طبق ارزیابی Artificial Analysis، این مدل توانسته امتیاز 53 را در Artificial Analysis Intelligence Index ثبت کند و به جایگاه پنجم جدول برسد، اما در عین حال، بهدلیل افزایش مصرف توکن در اجرای وظایف عاملمحور، هزینه هر وظیفه آن از Claude Opus 4.8 هم بیشتر شده است.
این نکته برای شرکتها و تیمهایی که از مدلهای زبانی در گردشکارهای واقعی استفاده میکنند اهمیت زیادی دارد. زیرا در دنیای تولید، فقط این مهم نیست که مدل چقدر خوب پاسخ میدهد؛ مهمتر این است که با چه هزینهای، در چند مرحله، و با چه میزان مصرف منابع به نتیجه میرسد.
Claude Sonnet 5 در Artificial Analysis چه عملکردی دارد؟
بر اساس گزارش منتشرشده از Artificial Analysis در 30 ژوئن 2026، Claude Sonnet 5 با امتیاز 53 در Intelligence Index در رتبه پنجم قرار گرفته است. این مدل فقط 2 تا 3 امتیاز با مدلهایی مانند GPT-5.5 (xhigh) و Claude Opus 4.8 (max) فاصله دارد؛ فاصلهای که از نظر رقابتی بسیار مهم است، چون نشان میدهد Sonnet 5 به سطح مدلهای مرزی نزدیک شده است.
با این حال، ارزیابیها نشان میدهند که این مدل هنوز در برخی حوزهها پشت سر برادران بزرگتر خود، یعنی Claude Opus 4.7 و Claude Opus 4.8 قرار میگیرد. بنابراین Sonnet 5 را باید مدلی دانست که از نظر توانایی عاملمحور بسیار قوی است، اما هنوز در همه سناریوهای سنگین reasoning و knowledge در صدر نیست.
چرا هزینه Claude Sonnet 5 از Opus 4.8 بیشتر میشود؟
نکته کلیدی اینجاست که هزینه نهایی یک مدل فقط به قیمت هر توکن وابسته نیست؛ مصرف واقعی توکن هم نقش تعیینکنندهای دارد.
طبق ارزیابی Artificial Analysis:
Claude Sonnet 5با قیمت استاندارد3 دلاربه ازای هر 1 میلیون توکن ورودی و15 دلاربه ازای هر 1 میلیون توکن خروجی عرضه میشود.- این قیمت از نظر اسمی پایینتر از
Claude Opus 4.8است که قیمت5/25 دلاردارد. - اما Sonnet 5 در زمان اجرای وظایف، توکن بیشتری مصرف میکند؛ بنابراین هزینه واقعی هر وظیفه بالا میرود.
در نتیجه، با وجود اینکه قیمت واحد توکن در Sonnet 5 کمتر است، رفتار پرکارتر مدل باعث میشود هزینه نهایی از Opus 4.8 نیز بالاتر برود. Artificial Analysis هزینه هر وظیفه Sonnet 5 را در شاخص Intelligence حدود 2.29 دلار اعلام کرده؛ یعنی تقریباً دو برابر Sonnet 4.6 و حدود 15 درصد بیشتر از Opus 4.8.
نقش تنظیم effort در عملکرد Claude Sonnet 5
یکی از مهمترین ویژگیهای Sonnet 5، سازگاری آن با سطحهای مختلف effort است. در این مدل، افزایش effort باعث میشود مدل:
- بیشتر فکر کند،
- مراحل بیشتری را طی کند،
- فراخوانی ابزار بیشتری انجام دهد،
- و خروجی دقیقتری در وظایف پیچیده تولید کند.
طبق گزارش، Sonnet 5 در حالت max effort نسبت به Sonnet 4.6 حدود 40 درصد توکن خروجی بیشتری مصرف کرده است. همچنین در ارزیابیهای عاملمحور مانند AA-Briefcase و GDPval-AA، تعداد turnهای عاملمحور آن حدود سه برابر بیشتر شده است.
جالبتر اینکه این رفتار بهخوبی با سطح effort مقیاس میشود. برای نمونه، در GDPval-AA، تنظیم max حدود 6 برابر بیشتر از low turn ایجاد میکند. این یعنی Sonnet 5 برای کاربرانی که کیفیت و دقت را به کمهزینه بودن ترجیح میدهند، گزینهای بسیار قدرتمند است؛ اما برای سناریوهای انبوه و حساس به هزینه، استفاده از آن نیازمند دقت بیشتری است.
Claude Sonnet 5 در وظایف عاملمحور چقدر خوب است؟
اگر معیار را از reasoning محض به کارهای واقعی اداری و حرفهای تغییر دهیم، Sonnet 5 عملکرد بسیار درخشانی دارد.
در بنچمارکهای:
AA-BriefcaseGDPval-AA
این مدل کمی بهتر از Claude Opus 4.8 عمل کرده و فقط پشت سر Claude Fable 5 قرار گرفته است؛ مدلی که در زمان گزارش هنوز بهطور عمومی در دسترس نیست.
این دسته از بنچمارکها توانایی مدل را در تولید خروجیهای دقیق، ساختاریافته و حرفهای میسنجند؛ خروجیهایی که برای کارهای اداری، تحلیل اسناد، نگارش گزارش و سناریوهای knowledge work اهمیت دارند. Artificial Analysis برای اجرای این ارزیابیها از چارچوب متنباز Stirrup استفاده کرده است.
به بیان ساده، اگر هدف شما انجام کارهای حرفهای با کیفیت بالا باشد، Claude Sonnet 5 یکی از قویترین گزینههاست؛ حتی اگر از نظر cost-efficiency همیشه بهترین انتخاب نباشد.
Sonnet 5 در بنچمارکهای reasoning و دانشمحور چه وضعی دارد؟
با وجود پیشرفتهای قابلتوجه، Sonnet 5 هنوز در برخی benchmarkهای سنگینتر از مدلهای بزرگتر عقبتر است.
یکی از مهمترین نمونهها CritPt است؛ بنچمارک reasoning فیزیک که توسط پژوهشگران Argonne و UIUC توسعه یافته است. طبق گزارش:
Claude Sonnet 5در این بنچمارک 17 درصد امتیاز گرفته است.- این نتیجه 14 امتیاز بالاتر از نسل قبلی آن است.
- اما هنوز از مدلهایی مانند
GLM-5.2،Claude Opus،Claude FableوGPT-5.5 (xhigh / Pro)عقبتر است.
این الگو نشان میدهد که Sonnet 5 در بسیاری از وظایف پیشرفت جدی داشته، اما در reasoning عمیق و دانش سنگین، هنوز مدلهای بزرگتر برتری دارند.
بهبودهای Sonnet 5 در سایر بنچمارکها
Claude Sonnet 5 فقط در agentic tasks پیشرفت نکرده، بلکه در چند بنچمارک مهم دیگر هم جهش قابلتوجهی داشته است:
Terminal-Bench v2.1با 9 امتیاز افزایشHumanity's Last Examبا 10 امتیاز افزایشSciCodeبا 7 امتیاز افزایش
در مقابل، برخی بنچمارکها تغییر چشمگیری نشان ندادهاند و عملکرد مدل تقریبا ثابت مانده است. این الگو معمولا نشان میدهد که بهبود مدل در همه حوزهها یکنواخت نیست و بهویژه در taskهایی که به reasoning مرحلهای، ابزارمحوری یا تولید خروجی حرفهای نیاز دارند، تأثیر بیشتری دیده میشود.
مشخصات فنی مهم Claude Sonnet 5
Artificial Analysis چند مشخصه مهم دیگر را هم برای این مدل اعلام کرده است:
- پنجره متن: 1 میلیون توکن
- قیمت استاندارد:
3/15 دلاربرای هر 1 میلیون توکن ورودی/خروجی - قیمت تخفیفی موقت:
2/10 دلارتا 1 سپتامبر - قیمت کش:
3.75 دلاربرای نوشتن کش- با TTL پنجدقیقهای
- و
0.3 دلاربرای cache hit
- تنظیم effort:
lowmediumhighxhighmax
وجود xhigh در Sonnet 5 یک تغییر مهم است، چون آن را از نظر سطحهای کنترلی به Opus 4.8 نزدیک میکند و به کاربران اجازه میدهد بین سرعت، هزینه و کیفیت، انتخاب دقیقتری داشته باشند.
آیا Claude Sonnet 5 انتخاب بهتری از Opus 4.8 است؟
پاسخ کوتاه این است: بستگی دارد به کاربرد شما.
اگر اولویت شما:
- اجرای وظایف عاملمحور،
- کیفیت خوب در knowledge work،
- و انعطاف در effort settings
باشد، Claude Sonnet 5 انتخاب بسیار جذابی است.
اما اگر:
- reasoning سنگین،
- عملکرد مرزی در benchmarkهای پیچیده،
- یا دقت بیشتر در سناریوهای high-stakes
برای شما اولویت دارد، مدلهای بزرگتر Anthropic همچنان برتری خود را حفظ کردهاند.
از طرف دیگر، چون Sonnet 5 با وجود قیمت توکنی کمتر، توکن بیشتری مصرف میکند، در عمل ممکن است هزینه نهایی آن از مدلهای گرانتر هم بیشتر شود. این همان جایی است که تحلیل cost-per-task از قیمت اسمی مهمتر میشود.
جمعبندی
Claude Sonnet 5 یکی از مهمترین مدلهای جدید Anthropic در میانه سال 2026 است؛ مدلی که توانسته در Artificial Analysis Intelligence Index به امتیاز 53 برسد و در کارهای عاملمحور عملکردی بسیار رقابتی ارائه دهد. با این حال، مصرف بالای توکن در حالتهای effort بالا باعث شده که هزینه هر وظیفه آن از Claude Opus 4.8 هم فراتر برود.
به همین دلیل، Sonnet 5 را باید مدلی دانست که از نظر فنی بسیار قدرتمند است، اما از نظر اقتصادی فقط در برخی سناریوها انتخاب بهینه محسوب میشود. برای تیمهایی که روی اتوماسیون، دستیارهای حرفهای و workflowهای مبتنی بر agent کار میکنند، این مدل میتواند گزینهای جدی باشد؛ بهشرط آنکه هزینه واقعی اجرای آن بهدقت محاسبه شود.