خانه/Claude/Claude Sonnet 5.5 معرفی شد؛ مقایسه با Sonnet 5
Claude 07 مهر 1405
Claude Sonnet 5.5 معرفی شد؛ مقایسه با Sonnet 5
نوشته: امیرعلی قربانی
مقایسه Claude Sonnet 5.5 با Sonnet 5 ؛ قابلیتها، بنچمارکها و نکتههای مهاجرت
Anthropic در ۲۸ سپتامبر ۲۰۲۶ نسخه تازهای از خانواده کلود رو معرفی کرد که خیلی زود توجه توسعهدهندهها و تیمهای محصول رو جلب کرد. Claude Sonnet 5.5 بهعنوان جانشین مستقیم Sonnet 5 اومده و طبق ادعای رسمی، هم سریعتره هم در خیلی از کارها ارزونتر تموم میشه. اما این پیشرفتها دقیقاً کجا خودشون رو نشون میدن؟ آیا واقعاً وقتشه از Sonnet 5 مهاجرت کنی؟ و مقایسهش با Sol 6 چقدر قابل اتکاست؟ تو این مقاله همه این سؤالها رو با تکیه بر منابع رسمی بررسی میکنیم، بدون بزرگنمایی و بدون ادعای بیپایه.
Claude Sonnet 5.5 کجای خانواده کلود قرار میگیره؟
Claude Sonnet 5.5 دومین مدل خانواده Claude 5.5 هست که بعد از Opus 5.5 منتشر شده و قراره Haiku 5.5 هم بهزودی بهش اضافه بشه. Anthropic این مدل رو یک مکمل سریعتر و کمهزینهتر برای Opus 5.5 توصیف کرده، نه رقیب مستقیمش.
در سلسلهمراتب فعلی خانواده کلود، Opus 5.5 قویترین مدل محسوب میشه، Sonnet 5.5 نقش میانی رو داره و روی سرعت و تعادل بین کیفیت و هزینه تمرکز کرده، و Haiku برای کارهای سبک و سریع طراحی شده. مشخصات رسمی هم همین جایگاه رو تأیید میکنن: قیمت Sonnet 5.5 برای هر میلیون توکن ورودی ۲ دلار و خروجی ۱۰ دلاره، در حالی که Opus 5.5 با قیمت ۴ دلار ورودی و ۲۰ دلار خروجی جایگاه بالاتری داره.
نزدیک شدن Sonnet 5.5 به سطح Opus 5.5 در بعضی بنچمارکها به این معنی نیست که این دو مدل در همه کارها برابرن. تفاوت اصلی هنوز هم در عمق استدلال و کیفیت نهایی کارهای پیچیدهتره، جایی که Opus 5.5 معمولاً برتری خودش رو حفظ میکنه. سرعت پاسخدهی Sonnet 5.5 رسماً «Fast» توصیف شده، در حالی که Opus 5.5 با سرعت «Moderate» کار میکنه؛ یعنی انتخاب بین این دو بیشتر به نوع کار و اولویت بین سرعت و عمق تحلیل بستگی داره.
مقایسه Claude Sonnet 5.5 با Sonnet 5 در سرعت و کیفیت
در مقایسه Sonnet 5.5 و Sonnet 5، Claude Sonnet 5.5 بیش از ۳۰ درصد سریعتر معرفی شده و برای بیشتر کارها تا ۳۰ درصد هزینه کمتری داره. این ارتقا شامل بهبود در کدنویسی، کارهای دانشی، فهم نمودار و استفاده از رایانه میشه. Anthropic این مدل رو «ارتقای روشن» نسبت به نسل قبل توصیف کرده، اما میزان دقیق این بهبود بین کارهای مختلف فرق میکنه.
عدد ۳۰ درصد سرعت و صرفهجویی هزینه رو نباید معادل کاهش ۳۰ درصدی زمان کل یک پروژه گرفت. این اعداد از آزمونهای مشخص روی بنچمارکهای خاص بهدست اومدن و بسته به نوع کار، سطح تلاش انتخابی، ابزارهایی که مدل بهشون دسترسی داره و طول خروجی مورد انتظار میتونن بالاتر یا پایینتر باشن.
نکته جالب اینه که قیمت اسمی Sonnet 5.5 نسبت به Sonnet 5 ثابت مونده؛ یعنی صرفهجویی هزینه از مسیر افزایش کارایی مدل میاد، نه کاهش نرخ پایه. طبق دادههای رسمی، در Terminal-Bench 4.0 با سطح تلاش متوسط (که پیشفرض اپلیکیشنهای Claude هست)، Sonnet 5.5 با کمتر از یکدهم هزینه هر کار، از بهترین امتیاز Sonnet 5 فراتر رفته.
در زیر سه تسک مختلف رو میبینید که هم با sonnet 5.5 هم با sonnet 5 انجام شدن و کامل نشون میده در شرایط یکسان چه عملکرد خارق العادهای رو داره.
Prompt: A murmuration of 400 starlings in one HTML file
Claude Sonnet 5
Claude Sonnet 5.5
Prompt: Wind shaping sand dunes in one HTML file
Claude Sonnet 5
Claude Sonnet 5.5
Prompt: A clock made of 24 small clocks in one HTML file
Claude Sonnet 5
Claude Sonnet 5.5
جدول زیر عملکرد این دو مدل رو در چند بنچمارک کلیدی کنار هم میذاره:
معیار
Claude Sonnet 5.5
Claude Sonnet 5
Terminal-Bench 4.0 (کدنویسی عاملی)
۷۰.۶٪
۱۰.۳٪
FrontierCode 1.1 (Main)
۴۶.۲٪ (حالت Max)
۴۲.۴٪
CursorBench 4.0
۵۵.۵٪
۳۴.۱٪
GDPval-AA v2.1 (کار دانشی)
۱۸۴۴
۱۴۴۹
AA-Briefcase v1.1
۱۸۱۱
۱۳۵۹
Humanity’s Last Exam (با ابزار)
۶۴.۵٪
۵۴.۹٪
OSWorld 2.1 (استفاده از رایانه)
۸۰.۱٪
۵۷.۰٪
Chartography (فهم نمودار، بدون ابزار)
۶۱.۶٪
۱۵.۶٪
این فاصلههای زیاد بین دو نسل، مخصوصاً در Terminal-Bench و Chartography، نشون میده تمرکز اصلی توسعه روی کارهای عاملی و بصری بوده. برای تیمهایی که کارشون شامل رفع باگ، خودکارسازی وظایف چندمرحلهای یا تحلیل نمودار میشه، این تفاوت میتونه در عمل قابللمس باشه.
Terminal-Bench 4.0Accuracy vs. cost
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-5.6 Sol
Terminal-Bench 4.0 measures how well a model can complete complex, multi-step professional tasks within a command-line interface. At Medium effort, the default in the Claude apps, Sonnet 5.5 far exceeds Sonnet 5’s best score for less than a tenth of the cost per task.
Terminal-Bench and OpenAI did not report GPT-6 Sol performance publicly, so we report GPT-5.6 Sol here.
FrontierCode v1.1, main setAccuracy vs. cost
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-6 Sol
FrontierCode measures whether an agent’s code changes would be merged. At High effort, the default on the Claude Platform, Sonnet 5.5 matches GPT-6 Sol’s best score for about a fifth of the cost per task.²
CursorBench 4.0Accuracy vs. cost
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-5.6 Sol
CursorBench evaluates coding agents on ambiguous, multi-file tasks taken from real Cursor sessions. Sonnet 5.5 at Low effort exceeds Sonnet 5’s best score for less than a tenth of the cost per task.
CursorBench 4.0 does not report GPT-6 Sol performance publicly, so we report GPT-5.6 Sol here.
AA-Briefcase v1.1Accuracy vs. cost
Sonnet 5.5
Opus 5.5
Sonnet 5
GPT-6 Sol
On AA-Briefcase, a new benchmark of long-horizon knowledge work, Sonnet 5.5 at Medium effort bests Sonnet 5’s best score for about one ninth of the cost per task.³
Claude Sonnet 5.5 در کدنویسی و کارهای دانشی
Claude Sonnet 5.5 در سناریوهایی مثل رفع باگ چندمرحلهای عملکرد بهتری نشون میده؛ یعنی پیدا کردن مسیر دقیق درخواست در کد، اعمال تغییر محدود به همون بخش، و اجرای آزمون برای تأیید درستبودن تغییر. این نوع کار دقیقاً همون چیزیه که بنچمارکهای عاملی مثل Terminal-Bench و FrontierCode اندازه میگیرن.برای اطلاعات بیشتر در این مورد میتونی قابلیتهای عاملی و استفاده از ابزار در Claude Sonnet 5: راهنمای کامل قابلیتهای agentic و مقایسه با Opus رو ببینی.
در حوزه کارهای دانشی، این مدل میتونه از منابع مختلف مثل اسناد مالی، رونوشت تماسها و قالبهای اسلاید، یک مرور عملیاتی و قابل استفاده بسازه. امتیاز بالا در GDPval-AA و AA-Briefcase نشوندهنده همین توانایی در کارهای طولانی و چندمرحلهایه که نیاز به ترکیب اطلاعات از منابع مختلف داره.
برای کارهای بصری هم Sonnet 5.5 میتونه از ابزارهایی مثل برش تصویر، بزرگنمایی روی بخش خاصی از نمودار، و ابزارهای محاسباتی برای استخراج دقیقتر داده استفاده کنه. این ترکیب توضیح میده چرا نمره Chartography این مدل بهطرز محسوسی از Sonnet 5 فاصله گرفته.
نکته آموزشی: کیفیت نهایی خروجی هر مدلی، چه Sonnet 5.5 باشه چه هر مدل دیگه، به چهار چیز وابستهست: تعریف دقیق مسئله، کیفیت منبع دادهٔ ورودی، وجود آزمون برای سنجش نتیجه، و بازبینی انسانی روی خروجی نهایی. بنچمارک بالا تضمین نمیکنه هر پروژهای بدون این چهار مؤلفه به همون کیفیت برسه.
پیشنهاد ویژه کادینر
خرید اشتراک قانونی و اختصاصی برای استفاده پایدارتر
اشتراکهای اختصاصی کادینر روی ایمیل شخصی خود کاربر، همراه با گارانتی و پشتیبانی کامل ارائه میشوند.
قابلیتهای پیشرفته Sonnet 5.5 عمدتاً حول محور تفکر تطبیقی، استفاده گستردهتر از ابزارها، جستوجو و طراحی عاملی شکل گرفته. طبق دادههای منتشرشده، این مدل در Terminal-Bench 4.0 امتیاز ۷۰.۶ درصد گرفته، در Toolathlon-Verified نرخ موفقیت ۷۷.۸ درصد داشته و در GMMLU برای ۴۲ زبان به میانگین دقت ۹۲.۱ درصد رسیده.
از نظر ظرفیت پردازش، Sonnet 5.5 پنجره زمینه یکمیلیون توکنی داره و سقف خروجی عادیش ۱۲۸ هزار توکنه. در Message Batches API هم با فعالسازی یک هدر بتا مخصوص، امکان خروجی تا ۳۰۰ هزار توکن هم وجود داره. این ظرفیت بزرگ برای کارهایی که نیاز به پردازش اسناد طولانی یا مجموعهای از فایلها دارن مفیده، اما باید در نظر داشت که داشتن پنجره زمینه بزرگ بهمعنای حفظ یا بازیابی بیخطای همه جزئیات در طول یک گفتوگوی طولانی نیست.
تفکر تطبیقی (Adaptive Thinking) یکی از ویژگیهای کلیدی این مدله که بهصورت پیشفرض فعاله و سطح تلاش پیشفرضش «high» تنظیم شده. این یعنی مدل خودش تصمیم میگیره چقدر روی یک مسئله «فکر کنه» پیش از پاسخ دادن، که مستقیماً روی نتیجه بنچمارکهای عاملی و کیفیت پاسخ تأثیر میذاره.برای اطلاعات بیشتر در این مورد میتونی تنظیم سطح تلاش و تفاوت مدلهای Claude رو در پرامپت نویسی Claude؛ 5 قانون طلایی برای Opus 5 یاد بگیری.
نکته مهمی که در طراحی معیارهای پایان کار وجود داره اینه که نتیجه یک بنچمارک، بهشدت به محیط اجرا، ابزارهای در دسترس مدل، و سیاستهای داوری همون آزمون وابستهست. به همین دلیل، عددهای بالا رو باید در چارچوب همون آزمون خاص دید، نه بهعنوان تضمینی برای عملکرد یکسان در هر پروژه.
Anthropic بهبودهایی هم در زمینه ایمنی، توانایی کلی و پشتیبانی چندزبانه برای این نسل از مدلها گزارش کرده. با این حال، این بهبودها بهمعنای حذف کامل ریسک خطا یا احتمال حمله نیست؛ همچنان لازمه خروجیهای حساس با دقت بیشتری بازبینی بشن، مخصوصاً در کاربردهای امنیتی یا تصمیمگیریهای مهم سازمانی.
محدودیت های Claude Sonnet 5.5 و نکتههای مهاجرت
راهنمای مهاجرت به Claude Sonnet 5.5 با چند تغییر مهم نسبت به Sonnet 5 شروع میشه که مستقیماً روی کد و کارهای در حال اجرا اثر میذاره. طبق مستندات رسمی، پنج تغییر شکننده (breaking changes) بین این دو نسخه وجود داره که پیش از مهاجرت باید بهشون توجه کنی.
اولین نکته اینه که بخشهای تفکر (thinking blocks) به مدل خاص و همون گفتوگو وابستهن. یعنی اگه مدل یا حساب کاربری رو عوض کنی، این بخشهای ذخیرهشده ممکنه از بین برن یا قابل انتقال نباشن. برای پروژههایی که به تاریخچه استدلال مدل وابستهن، این نکته میتونه اهمیت زیادی داشته باشه.
دومین نکته مربوط به تنظیمات API هست: در Sonnet 5.5، تفکر تطبیقی بهصورت پیشفرض فعاله. برخی تنظیمات قدیمی که در نسخههای قبلی رایج بود، مثل غیرفعالکردن کامل thinking یا اجبار مستقیم به استفاده از یک ابزار خاص، دیگه به همون شکل قبلی پشتیبانی نمیشن.
نکته سوم درباره ابزار استفاده از رایانهست. ابزار قدیمی با شناسه computer_20251124 در Claude API و Google Cloud دیگه پذیرفته نمیشه و باید از نسخه جدید یعنی computer_toolset_20260801 استفاده کنی. اگر workflow تو به این ابزار وابسته بود، این بخش رو حتماً پیش از انتقال به محیط عملیاتی تست کن.
# نمونه فراخوانی شناسه مدل در Claude API
model: "claude-sonnet-5-5"
# نکته: ابزار قدیمی زیر دیگر پذیرفته نمیشود
# tool_id: "computer_20251124" ❌ منسوخشده
# جایگزین رسمی برای استفاده از رایانه
tool_id: "computer_toolset_20260801" ✅
نکته چهارم به ابزار مشاور (advisor tool) مربوطه که دیگه مدلهای Claude Opus 4.8، Opus 4.7 و Sonnet 5 رو بهعنوان مشاور نمیپذیره. اگر سیستم تو از این ابزار برای هماهنگی بین چند مدل استفاده میکنه، باید فهرست مدلهای مجاز رو بهروزرسانی کنی.
مهمترین درسی که از این تغییرات میشه گرفت اینه که مهاجرت به Sonnet 5.5 فقط با عوضکردن شناسه مدل در کد کامل نمیشه. هزینه واقعی، کیفیت خروجی، رفتار ابزارها و حتی ساختار پاسخها باید دوباره سنجیده بشن، چون این تغییرات میتونن رفتار سیستم رو بهطور محسوسی عوض کنن.
چطور مدل مناسب رو با آزمون واقعی انتخاب کنیم؟
تصمیمگیری بین Claude Sonnet 5.5، Sonnet 5 یا هر مدل دیگهای نباید فقط بر اساس عدد بنچمارک باشه. مراحل زیر یک مسیر عملی برای رسیدن به تصمیم قابلاتکا ارائه میده:
1کارهای واقعی سازمان یا پروژهت رو دستهبندی کن (مثلاً رفع باگ، خلاصهسازی سند، تولید کد جدید) و برای هر دسته چند نمونه نماینده واقعی انتخاب کن.
2همون نمونهها رو با سطحهای تلاش مختلف مدل (پایین، متوسط، بالا) آزمایش کن تا ببینی تعادل سرعت و کیفیت در کجا برات منطقیتره.
3برای هر آزمون، زمان اجرا، هزینه واقعی، کیفیت خروجی و میزان اصلاحی که باید دستی انجام بدی رو ثبت و اندازهگیری کن.
4برای خروجیهای مهم، منبع اعداد، فرضهای اولیه، نوع آزمون و هر تغییری که در تنظیمات دادی رو مستند نگه دار تا بعداً قابل بررسی باشه.
5نتیجه هر بنچمارک رسمی رو فقط وقتی به پروژه خودت تعمیم بده که شرایط اجرا (نوع کار، ابزارها، سطح تلاش) به شرایط همون بنچمارک نزدیک باشه.
اگه بعد از این آزمونها به این نتیجه رسیدی که Claude برای کار تو گزینه مناسبیه، برای دسترسی قانونی و اختصاصی بهش میتونی از کادینر استفاده کنی. کادینر اشتراک Claude Pro رو بهصورت اختصاصی روی ایمیل شخصی خودت فعال میکنه؛ یعنی تاریخچه گفتگوها و تنظیماتت حفظ میمونه و نیازی نیست نگران اشتراکگذاری حساب با کاربر دیگهای باشی. این پلن به مدل پیشفرض فعلی خانواده Claude دسترسی میده و امکاناتی مثل Claude Code، Projects و حافظه گفتگو رو هم شامل میشه. قیمت بهروز رو در صفحه محصول Claude در کادینر میتونی ببینی، و اگه سؤالی درباره فعالسازی یا نوع پلن داشتی، پشتیبانی کادینر از طریق تلگرام در دسترسه.
پیشنهاد ویژه کادینر
خرید اشتراک قانونی و اختصاصی برای استفاده پایدارتر
اشتراکهای اختصاصی کادینر روی ایمیل شخصی خود کاربر، همراه با گارانتی و پشتیبانی کامل ارائه میشوند.
Claude Sonnet 5.5 نسبت به Sonnet 5 پیشرفت قابلتوجهی در سرعت، هزینه هر کار، کدنویسی عاملی و کارهای دانشی نشون داده، با فاصلههای زیادی در بنچمارکهایی مثل Terminal-Bench و Chartography. اما این ارتقا بهمعنای برتری مطلق در همه شرایط نیست؛ Opus 5.5 هنوز در کارهای پیچیدهتر جلوتره، و کیفیت واقعی هر پروژه به نوع کار، سطح تلاش و بازبینی انسانی وابسته میمونه.
سؤالات متداول
Claude Sonnet 5.5 برای چه نوع کارهایی مناسبتره؟
Claude Sonnet 5.5 برای کدنویسی، کارهای دانشی، تحلیل اسناد، فهم نمودار و همکاری سریع با کاربر طراحی شده. این مدل پنجره زمینه یکمیلیونتوکنی و سقف خروجی عادی ۱۲۸ هزار توکنی داره و تفکر تطبیقی هم بهصورت پیشفرض فعاله.
مهمترین بنچمارکهای Claude Sonnet 5.5 کدومها هستن؟
طبق مواد منبع، Claude Sonnet 5.5 در Terminal-Bench 4.0 امتیاز ۷۰٫۶ درصد و در Toolathlon-Verified نرخ موفقیت ۷۷٫۸ درصد داره. میانگین دقت این مدل در GMMLU برای ۴۲ زبان هم ۹۲٫۱ درصد گزارش شده.
برای مهاجرت از Sonnet 5 به Sonnet 5.5 چه چیزهایی باید تغییر کنه؟
مهاجرت فقط با عوض کردن شناسه مدل کامل نمیشه. باید پیشوند گفتوگو، تاریخچه، حساب سازنده، بخشهای تفکر ذخیرهشده و ابزارها دوباره بررسی بشن. ابزار قدیمی computer_20251124 پذیرفته نیست و باید از computer_toolset_20260801 استفاده کنی؛ هزینه و کیفیت خروجی هم باید دوباره سنجیده بشن.
منابع و مراجع
برای بررسی و بهروزرسانی اطلاعات این مقاله از منابع زیر استفاده شده است:
هنوز دیدگاهی برای این محصول ثبت نشده است.