فهرست

سبد خرید 0

سبد خرید خالی

سبد خرید شما خالیه!

هنوز هیچ محصولی در سبد خرید شما نیست.

مشاهده محصولات
جستجوی محصولات
خانه / Chatgpt / GPT 6 Sol چیه و چه فرقی با GPT 6 Luna داره؟
Chatgpt 01 مهر 1405

GPT 6 Sol چیه و چه فرقی با GPT 6 Luna داره؟

نوشته: امیرعلی قربانی
GPT 6 Sol

GPT 6 Sol چیه و چه فرقی با GPT 6 Luna داره؟

اگه این روزها اخبار هوش مصنوعی رو دنبال می‌کنی، احتمالاً به اسم GPT 6 Sol و GPT 6 Luna برخورده‌ای و از خودت پرسیدی کدوم‌شون به کار تو میاد. این دو مدل قرار نیست جایگزین هم باشن؛ هر کدوم برای یک نوع کار طراحی شدن. GPT 6 Sol سمت کارهای پیچیده و چندمرحله‌ای می‌ایسته و GPT 6 Luna برای حجم بالا و سرعت ساخته شده. توی این مقاله می‌خوایم دقیق ببینیم فرق این دو مدل چیه، کدوم برای برنامه‌نویسی و تولید محتوا مناسب‌تره، هزینه و محدودیت‌هاشون چطوره، و در نهایت از کجا می‌شه بهشون دسترسی پیدا کرد.برای مقایسهٔ بهتر مدل‌های سول و لونا می‌تونی مدل GPT 5.6: مقایسه سول، ترا و لونا و چالش‌های رقابتی رو هم بخونی.

OpenAI مشخصات فنی، قیمت API و نتایج چند بنچمارک GPT 6 Sol و GPT 6 Luna رو رسماً منتشر کرده. پایین‌تر هم عددهای مهم رو با منبع و توضیح روش خواندن‌شون می‌بینی. این نتایج به شرایط همان آزمون‌ها مربوط‌اند و قیمت و دسترسی ممکنه بعداً تغییر کنن؛ برای تصمیم نهایی، صفحه رسمی مدل‌ها رو هم بررسی کن.

Sol و Luna برای چه کارهایی بهترن؟

GPT 6 Sol مدل حرفه‌ای خانواده GPT 6 هست که برای موارد استفاده GPT 6 Sol مثل برنامه‌نویسی، عامل‌های چندمرحله‌ای و تحلیل پیچیده ساخته شده؛ GPT 6 Luna هم مدل اقتصادی‌تریه که برای کارهای سریع، پرتعداد، طبقه‌بندی، استخراج داده و پشتیبانی طراحی شده. این تفکیک یعنی وقتی کار سنگین و چندمرحله‌ای داری، سمت Sol بری بهتره؛ وقتی حجم بالا و ساده داری، Luna جواب می‌ده.

فرض کن قراره یک کدبیس بزرگ رو تحلیل کنی، دنبال منشأ یک باگ پیچیده بگردی یا چند فایل به‌هم‌وابسته رو هم‌زمان تغییر بدی. این دقیقاً همون نوع کاریه که Sol براش ساخته شده؛ چون نیاز به استدلال عمیق و دنبال‌کردن زنجیره‌ای از منطق داره.

GPT 6 Sol

از طرف دیگه، اگه قراره صدها تیکت پشتیبانی رو دسته‌بندی کنی، از یک انبوه سند داده استخراج کنی یا پاسخ‌های کوتاه و تکراری تولید کنی، Luna گزینه منطقی‌تریه. این کارها معمولاً پیچیدگی استدلالی بالایی نمی‌خوان، ولی حجم‌شون زیاده و سرعت پاسخ اهمیت داره.

  • Sol: تحلیل کدبیس، دیباگ چندمرحله‌ای، طراحی معماری، تحقیق عمیق
  • Luna: دسته‌بندی تیکت، استخراج داده از سند، پاسخ سریع به سؤالات ساده، پردازش حجم بالا

تفاوت GPT-6 Sol و GPT-6 Luna چیه؟

تفاوت Sol و Luna در جایگاه کاری، سطح پیچیدگی، سرعت و هزینه استفاده‌ست. Sol برای کیفیت و استدلال در کارهای پیچیده‌تر طراحی شده و Luna برای حجم بالا، پاسخ سریع و هزینه کمتر. این یعنی وقتی می‌خوای بین این دو انتخاب کنی، باید اول ببینی کارت به عمق فکری بیشتری نیاز داره یا به سرعت و تعداد بیشتر.

معیار GPT-6 Sol GPT-6 Luna
نوع کار مناسب پیچیده، چندمرحله‌ای، حرفه‌ای ساده، تکراری، پرتعداد
سرعت پاسخ معمولاً کندتر معمولاً سریع‌تر
هزینه هر درخواست بیشتر کمتر
نیاز به استدلال عمیق بالا پایین تا متوسط
مناسب برای حجم بالا نه لزوماً بله

نکته‌ای که این وسط باید حواست بهش باشه اینه که «گرون‌تر بودن» به‌معنای «همیشه بهتر بودن» نیست. اگه کارت ساده و تکراریه، استفاده از Sol فقط هزینه رو بالا می‌بره بدون این‌که فایده محسوسی اضافه کنه. برعکسش هم صادقه؛ اگه کار پیچیده رو به Luna بسپاری، ممکنه نتیجه دقیق و قابل‌اعتماد نباشه.

برای برنامه‌نویسی و تولید محتوا کدوم مدل مناسب‌تره؟

GPT 6 Sol

برای برنامه‌نویسی، Sol برای پیدا کردن منشأ باگ، تغییر فایل‌های لازم، نوشتن تست و بررسی اثر تغییر مناسب‌تره؛ Luna بیشتر برای کدهای تکراری و تحلیل اولیه خطاها به کار میاد. برای تولید محتوا هم انتخاب مدل به پیچیدگی و حساسیت متن بستگی داره.برای اطلاعات بیشتر در این مورد می‌تونی ChatGPT Work چیست؟ راهنمای کامل مدل‌های Sol و Terra و Luna ؛ تیر 1405 رو ببینی.

اگه به‌عنوان برنامه‌نویس داری روی یک ویژگی جدید کار می‌کنی که چند بخش از سیستم رو تحت تأثیر قرار می‌ده، Sol بهتر می‌تونه رابطه بین این بخش‌ها رو دنبال کنه و راه‌حلی بده که واقعاً کار کنه. اما اگه فقط می‌خوای یک تابع ساده بنویسی یا خطای واضحی رو پیدا کنی، Luna معمولاً سریع‌تر و کم‌هزینه‌تر همون نتیجه رو می‌ده.

برای تولید کننده‌های محتوا هم داستان مشابهه. اگه قراره یک مقاله تحلیلی عمیق بنویسی که نیاز به ساختاردهی پیچیده و ارجاع منطقی بین بخش‌ها داره، Sol گزینه معقول‌تریه. اما برای تولید عناوین، خلاصه‌سازی متن‌های کوتاه یا تولید حجم بالای محتوای ساده، Luna می‌تونه سریع‌تر جواب بده.

نکته مهم اینجاست که برای تولید محتوا، قبل از انتخاب مدل باید زمینه، معیار پذیرش و قالب خروجی رو دقیق مشخص کنی. اگه این‌ها روشن نباشن، حتی قوی‌ترین مدل هم ممکنه خروجی نامناسب بده. یعنی کیفیت درخواست تو، گاهی از انتخاب مدل هم مهم‌تره.

نتایج بنچمارک‌ها و پیشرفت‌های Sol و Luna چی می‌گن؟

OpenAI در معرفی رسمی GPT 6 Sol و Luna چند نتیجه از کار حرفه‌ای، کدنویسی و کار با رایانه منتشر کرده. این عددها به سؤال «مدل در آزمون مشخص چقدر خوب عمل کرده؟» جواب می‌دن، ولی به‌تنهایی نمی‌گن روی فایل‌ها، ابزارها و درخواست‌های تو هم همان امتیاز رو می‌گیره. سطح تلاش استدلالی یا effort و هزینهٔ هر وظیفه رو هم باید کنار امتیاز ببینی.

AutomationBench
$0.005$0.01$0.02$0.05$0.10$0.20$0.50$1.00$2.00$5.00Cost per task0%10%20%30%40%50%ScoreModel: Claude Opus 5 · Effort: low · Cost per task: $1.64 · Score: 20.4%Model: Claude Opus 5 · Effort: low · Cost per task: $1.64 · Score: 20.4%Model: Claude Opus 5 · Effort: medium · Cost per task: $2.22 · Score: 23.9%Model: Claude Opus 5 · Effort: high · Cost per task: $2.27 · Score: 20.5%Model: Claude Opus 5 · Effort: xhigh · Cost per task: $2.71 · Score: 25.3%Model: Claude Opus 5 · Effort: max · Cost per task: $3.05 · Score: 26.9%Model: Claude Fable 5.1 w/ Opus 5 Fallback · Effort: max · Cost per task: $2.45 · Score: 31.4%Model: Claude Fable 5.1 w/ Opus 5 Fallback · Effort: max · Cost per task: $2.45 · Score: 31.4%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.010 · Score: 1.8%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.010 · Score: 1.8%Model: GPT-5.6 Luna · Effort: medium · Cost per task: $0.020 · Score: 4.3%Model: GPT-5.6 Luna · Effort: high · Cost per task: $0.050 · Score: 9.1%Model: GPT-5.6 Luna · Effort: xhigh · Cost per task: $0.060 · Score: 12.9%Model: GPT-5.6 Luna · Effort: max · Cost per task: $0.070 · Score: 17.0%Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.31 · Score: 11.7%Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.31 · Score: 11.7%Model: GPT-5.6 Sol · Effort: medium · Cost per task: $0.42 · Score: 19.6%Model: GPT-5.6 Sol · Effort: high · Cost per task: $0.47 · Score: 24.8%Model: GPT-5.6 Sol · Effort: xhigh · Cost per task: $0.54 · Score: 26.3%Model: GPT-5.6 Sol · Effort: max · Cost per task: $0.67 · Score: 28.8%Model: GPT-6 Astra · Effort: low · Cost per task: $1.08 · Score: 30.3%Model: GPT-6 Astra · Effort: low · Cost per task: $1.08 · Score: 30.3%Model: GPT-6 Astra · Effort: medium · Cost per task: $1.27 · Score: 34.1%Model: GPT-6 Astra · Effort: high · Cost per task: $1.44 · Score: 37.1%Model: GPT-6 Astra · Effort: xhigh · Cost per task: $1.50 · Score: 39.0%Model: GPT-6 Astra · Effort: max · Cost per task: $1.73 · Score: 41.4%Model: GPT-6 Luna · Effort: low · Cost per task: $0.0060 · Score: 1.2%Model: GPT-6 Luna · Effort: low · Cost per task: $0.0060 · Score: 1.2%Model: GPT-6 Luna · Effort: medium · Cost per task: $0.016 · Score: 9.4%Model: GPT-6 Luna · Effort: high · Cost per task: $0.021 · Score: 14.5%Model: GPT-6 Luna · Effort: xhigh · Cost per task: $0.025 · Score: 12.6%Model: GPT-6 Luna · Effort: max · Cost per task: $0.037 · Score: 20.7%Model: GPT-6 Sol · Effort: low · Cost per task: $0.19 · Score: 21.2%Model: GPT-6 Sol · Effort: low · Cost per task: $0.19 · Score: 21.2%Model: GPT-6 Sol · Effort: medium · Cost per task: $0.21 · Score: 26.9%Model: GPT-6 Sol · Effort: high · Cost per task: $0.24 · Score: 31.2%Model: GPT-6 Sol · Effort: xhigh · Cost per task: $0.27 · Score: 33.2%Model: GPT-6 Sol · Effort: max · Cost per task: $0.34 · Score: 32.0%
In AutomationBench 1.0.6 , AI agents are tested on end-to-end workflows using 47 tools across sales, marketing, operations, support, finance, and HR. The datapoint for Claude Fable 5.1 understates its actual cost, as it omits the cost of the Opus 5 fallbacks, which occurred on ~40% of tasks.
Agents’ Last Exam
$0.02$0.05$0.10$0.20$0.50$1.00$2.00$5.00$10.00$20.00Cost per task30%35%40%45%50%55%61%ScoreModel: Claude Opus 5 · Effort: low · Cost per task: $4.06 · Score: 51.9%Model: Claude Opus 5 · Effort: low · Cost per task: $4.06 · Score: 51.9%Model: Claude Opus 5 · Effort: medium · Cost per task: $5.29 · Score: 53.0%Model: Claude Opus 5 · Effort: high · Cost per task: $7.29 · Score: 55.9%Model: Claude Opus 5 · Effort: xhigh · Cost per task: $10.02 · Score: 55.5%Model: Claude Opus 5 · Effort: max · Cost per task: $9.76 · Score: 52.7%Model: Claude Fable 5 w/ Opus 4.8 fallback · Effort: adaptive · Cost per task: $15.23 · Score: 41.3%Model: Claude Fable 5 w/ Opus 4.8 fallback · Effort: adaptive · Cost per task: $15.23 · Score: 41.3%Model: Claude Fable 5 w/ Opus 4.8 fallback · Effort: xhigh · Cost per task: $28.55 · Score: 48.7%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.18 · Score: 31.0%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.18 · Score: 31.0%Model: GPT-5.6 Luna · Effort: medium · Cost per task: $0.38 · Score: 38.5%Model: GPT-5.6 Luna · Effort: high · Cost per task: $0.84 · Score: 46.1%Model: GPT-5.6 Luna · Effort: xhigh · Cost per task: $1.55 · Score: 49.4%Model: GPT-5.6 Luna · Effort: max · Cost per task: $2.57 · Score: 50.4%Model: GPT-5.6 Sol · Effort: low · Cost per task: $1.63 · Score: 45.1%Model: GPT-5.6 Sol · Effort: low · Cost per task: $1.63 · Score: 45.1%Model: GPT-5.6 Sol · Effort: medium · Cost per task: $3.41 · Score: 52.1%Model: GPT-5.6 Sol · Effort: high · Cost per task: $3.79 · Score: 52.4%Model: GPT-5.6 Sol · Effort: xhigh · Cost per task: $5.08 · Score: 53.6%Model: GPT-5.6 Sol · Effort: max · Cost per task: $7.13 · Score: 52.8%Model: GPT-6 Astra · Effort: low · Cost per task: $3.07 · Score: 53.4%Model: GPT-6 Astra · Effort: low · Cost per task: $3.07 · Score: 53.4%Model: GPT-6 Astra · Effort: medium · Cost per task: $4.10 · Score: 57.6%Model: GPT-6 Astra · Effort: high · Cost per task: $4.64 · Score: 57.8%Model: GPT-6 Astra · Effort: xhigh · Cost per task: $5.40 · Score: 58.3%Model: GPT-6 Astra · Effort: max · Cost per task: $6.23 · Score: 59.3%Model: GPT-6 Luna · Effort: low · Cost per task: $0.025 · Score: 36.3%Model: GPT-6 Luna · Effort: low · Cost per task: $0.025 · Score: 36.3%Model: GPT-6 Luna · Effort: medium · Cost per task: $0.11 · Score: 46.8%Model: GPT-6 Luna · Effort: high · Cost per task: $0.11 · Score: 43.6%Model: GPT-6 Luna · Effort: xhigh · Cost per task: $0.11 · Score: 47.9%Model: GPT-6 Luna · Effort: max · Cost per task: $0.15 · Score: 50.9%Model: GPT-6 Sol · Effort: low · Cost per task: $0.86 · Score: 48.7%Model: GPT-6 Sol · Effort: low · Cost per task: $0.86 · Score: 48.7%Model: GPT-6 Sol · Effort: medium · Cost per task: $1.27 · Score: 53.1%Model: GPT-6 Sol · Effort: high · Cost per task: $1.53 · Score: 52.6%Model: GPT-6 Sol · Effort: xhigh · Cost per task: $1.67 · Score: 55.4%Model: GPT-6 Sol · Effort: max · Cost per task: $2.93 · Score: 56.4%
In Agents’ Last Exam V1 , AI agents are evaluated on long-horizon, economically valuable tasks spanning 55 sub-industries, covering most major fields of professional work performed on a computer.
Factual error rate on difficult prompts
$0.002$0.005$0.01$0.02$0.05$0.10$0.20$0.50$1.00Cost per task0%10%20%30%40%Answers with any factual errorModel: GPT-5.6 Luna · Effort: low · Cost per task: $0.0045Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.0045Model: GPT-5.6 Luna · Effort: medium · Cost per task: $0.0062Model: GPT-5.6 Luna · Effort: high · Cost per task: $0.011Model: GPT-5.6 Luna · Effort: xhigh · Cost per task: $0.015Model: GPT-5.6 Luna · Effort: max · Cost per task: $0.022Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.10Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.10Model: GPT-5.6 Sol · Effort: medium · Cost per task: $0.15Model: GPT-5.6 Sol · Effort: high · Cost per task: $0.23Model: GPT-5.6 Sol · Effort: xhigh · Cost per task: $0.39Model: GPT-5.6 Sol · Effort: max · Cost per task: $0.87Model: GPT-6 Astra · Effort: low · Cost per task: $0.24Model: GPT-6 Astra · Effort: low · Cost per task: $0.24Model: GPT-6 Astra · Effort: medium · Cost per task: $0.31Model: GPT-6 Astra · Effort: high · Cost per task: $0.48Model: GPT-6 Astra · Effort: xhigh · Cost per task: $0.60Model: GPT-6 Astra · Effort: max · Cost per task: $0.79Model: GPT-6 Luna · Effort: low · Cost per task: $0.0024Model: GPT-6 Luna · Effort: low · Cost per task: $0.0024Model: GPT-6 Luna · Effort: medium · Cost per task: $0.0033Model: GPT-6 Luna · Effort: high · Cost per task: $0.0045Model: GPT-6 Luna · Effort: xhigh · Cost per task: $0.0062Model: GPT-6 Luna · Effort: max · Cost per task: $0.012Model: GPT-6 Sol · Effort: low · Cost per task: $0.050Model: GPT-6 Sol · Effort: low · Cost per task: $0.050Model: GPT-6 Sol · Effort: medium · Cost per task: $0.069Model: GPT-6 Sol · Effort: high · Cost per task: $0.099Model: GPT-6 Sol · Effort: xhigh · Cost per task: $0.13Model: GPT-6 Sol · Effort: max · Cost per task: $0.18
Here we evaluate factuality on de-identified ChatGPT conversations where users had flagged a factual error from a prior model. These error-inducing conversations are not representative of typical usage, where factual errors are more rare. Scores are not controlled for length; however, our verbosity sweeps showed almost no dependence on answer length.
FrontierCode
$0.02$0.05$0.10$0.20$0.50$1.00$2.00$5.00$10.00Cost per task10%20%30%40%50%55%ScoreModel: Claude Opus 5 · Effort: low · Cost per task: $2.68 · Score: 41.9%Model: Claude Opus 5 · Effort: low · Cost per task: $2.68 · Score: 41.9%Model: Claude Opus 5 · Effort: medium · Cost per task: $4.31 · Score: 53.4%Model: Claude Opus 5 · Effort: high · Cost per task: $7.24 · Score: 48.0%Model: Claude Opus 5 · Effort: xhigh · Cost per task: $9.14 · Score: 43.6%Model: Claude Opus 5 · Effort: max · Cost per task: $11.42 · Score: 48.0%Model: Claude Fable 5.1 · Effort: low · Cost per task: $2.38 · Score: 49.8%Model: Claude Fable 5.1 · Effort: low · Cost per task: $2.38 · Score: 49.8%Model: Claude Fable 5.1 · Effort: medium · Cost per task: $3.28 · Score: 50.9%Model: Claude Fable 5.1 · Effort: high · Cost per task: $5.27 · Score: 50.3%Model: Claude Fable 5.1 · Effort: xhigh · Cost per task: $9.27 · Score: 48.7%Model: Claude Fable 5.1 · Effort: max · Cost per task: $12.83 · Score: 50.3%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.060 · Score: 15.4%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.060 · Score: 15.4%Model: GPT-5.6 Luna · Effort: medium · Cost per task: $0.13 · Score: 25.7%Model: GPT-5.6 Luna · Effort: high · Cost per task: $0.23 · Score: 35.9%Model: GPT-5.6 Luna · Effort: xhigh · Cost per task: $0.31 · Score: 38.9%Model: GPT-5.6 Luna · Effort: max · Cost per task: $0.37 · Score: 39.8%Model: GPT-5.6 Sol · Effort: low · Cost per task: $1.89 · Score: 35.4%Model: GPT-5.6 Sol · Effort: low · Cost per task: $1.89 · Score: 35.4%Model: GPT-5.6 Sol · Effort: medium · Cost per task: $2.69 · Score: 39.9%Model: GPT-5.6 Sol · Effort: high · Cost per task: $3.48 · Score: 45.1%Model: GPT-5.6 Sol · Effort: xhigh · Cost per task: $4.15 · Score: 46.8%Model: GPT-5.6 Sol · Effort: max · Cost per task: $5.19 · Score: 47.5%Model: GPT-6 Astra · Effort: low · Cost per task: $1.70 · Score: 45.3%Model: GPT-6 Astra · Effort: low · Cost per task: $1.70 · Score: 45.3%Model: GPT-6 Astra · Effort: medium · Cost per task: $2.43 · Score: 48.8%Model: GPT-6 Astra · Effort: high · Cost per task: $3.01 · Score: 50.9%Model: GPT-6 Astra · Effort: xhigh · Cost per task: $3.28 · Score: 50.6%Model: GPT-6 Astra · Effort: max · Cost per task: $4.59 · Score: 53.3%Model: GPT-6 Luna · Effort: low · Cost per task: $0.021 · Score: 25.7%Model: GPT-6 Luna · Effort: low · Cost per task: $0.021 · Score: 25.7%Model: GPT-6 Luna · Effort: medium · Cost per task: $0.053 · Score: 35.5%Model: GPT-6 Luna · Effort: high · Cost per task: $0.067 · Score: 37.3%Model: GPT-6 Luna · Effort: xhigh · Cost per task: $0.073 · Score: 37.1%Model: GPT-6 Luna · Effort: max · Cost per task: $0.11 · Score: 42.4%Model: GPT-6 Sol · Effort: low · Cost per task: $0.45 · Score: 37.3%Model: GPT-6 Sol · Effort: low · Cost per task: $0.45 · Score: 37.3%Model: GPT-6 Sol · Effort: medium · Cost per task: $0.80 · Score: 45.9%Model: GPT-6 Sol · Effort: high · Cost per task: $1.08 · Score: 47.7%Model: GPT-6 Sol · Effort: xhigh · Cost per task: $1.37 · Score: 48.4%Model: GPT-6 Sol · Effort: max · Cost per task: $2.14 · Score: 49.3%
In FrontierCode 1.1 Main , AI agents write code that’s graded not only on correctness but also “mergeability”: e.g., test quality, scope discipline, code style, and adherence to codebase standards.
DeepSWE
$0.005$0.01$0.02$0.05$0.10$0.20$0.50$1.00$2.00$5.00$10.00$20.00Cost per task0%20%40%60%80%ScoreModel: Claude Opus 5 · Effort: low · Cost per task: $1.66 · Score: 58.1%Model: Claude Opus 5 · Effort: low · Cost per task: $1.66 · Score: 58.1%Model: Claude Opus 5 · Effort: medium · Cost per task: $3.29 · Score: 68.9%Model: Claude Opus 5 · Effort: high · Cost per task: $6.08 · Score: 72.8%Model: Claude Opus 5 · Effort: xhigh · Cost per task: $9.07 · Score: 73.2%Model: Claude Opus 5 · Effort: max · Cost per task: $11.84 · Score: 73.7%Model: Claude Fable 5 · Effort: low · Cost per task: $3.76 · Score: 59.6%Model: Claude Fable 5 · Effort: low · Cost per task: $3.76 · Score: 59.6%Model: Claude Fable 5 · Effort: medium · Cost per task: $6.09 · Score: 65.4%Model: Claude Fable 5 · Effort: high · Cost per task: $9.18 · Score: 68.6%Model: Claude Fable 5 · Effort: xhigh · Cost per task: $13.41 · Score: 69.9%Model: Claude Fable 5 · Effort: max · Cost per task: $21.63 · Score: 69.7%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.011 · Score: 1.2%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.011 · Score: 1.2%Model: GPT-5.6 Luna · Effort: medium · Cost per task: $0.031 · Score: 9.3%Model: GPT-5.6 Luna · Effort: high · Cost per task: $0.13 · Score: 42.4%Model: GPT-5.6 Luna · Effort: xhigh · Cost per task: $0.27 · Score: 56.2%Model: GPT-5.6 Luna · Effort: max · Cost per task: $0.53 · Score: 62.2%Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.82 · Score: 45.4%Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.82 · Score: 45.4%Model: GPT-5.6 Sol · Effort: medium · Cost per task: $1.42 · Score: 61.1%Model: GPT-5.6 Sol · Effort: high · Cost per task: $2.66 · Score: 69.4%Model: GPT-5.6 Sol · Effort: xhigh · Cost per task: $3.60 · Score: 70.7%Model: GPT-5.6 Sol · Effort: max · Cost per task: $6.46 · Score: 72.7%Model: GPT-6 Astra · Effort: low · Cost per task: $1.60 · Score: 67.0%Model: GPT-6 Astra · Effort: low · Cost per task: $1.60 · Score: 67.0%Model: GPT-6 Astra · Effort: medium · Cost per task: $3.08 · Score: 72.8%Model: GPT-6 Astra · Effort: high · Cost per task: $3.92 · Score: 73.2%Model: GPT-6 Astra · Effort: xhigh · Cost per task: $4.43 · Score: 74.1%Model: GPT-6 Astra · Effort: max · Cost per task: $7.50 · Score: 73.2%Model: GPT-6 Luna · Effort: low · Cost per task: $0.0057 · Score: 2.4%Model: GPT-6 Luna · Effort: low · Cost per task: $0.0057 · Score: 2.4%Model: GPT-6 Luna · Effort: medium · Cost per task: $0.052 · Score: 44.5%Model: GPT-6 Luna · Effort: high · Cost per task: $0.084 · Score: 59.3%Model: GPT-6 Luna · Effort: xhigh · Cost per task: $0.11 · Score: 61.3%Model: GPT-6 Luna · Effort: max · Cost per task: $0.22 · Score: 66.6%Model: GPT-6 Sol · Effort: low · Cost per task: $0.16 · Score: 37.2%Model: GPT-6 Sol · Effort: low · Cost per task: $0.16 · Score: 37.2%Model: GPT-6 Sol · Effort: medium · Cost per task: $0.38 · Score: 56.6%Model: GPT-6 Sol · Effort: high · Cost per task: $0.64 · Score: 65.3%Model: GPT-6 Sol · Effort: xhigh · Cost per task: $1.00 · Score: 66.6%Model: GPT-6 Sol · Effort: max · Cost per task: $2.74 · Score: 68.8%
In DeepSWE 1.1 , AI agents solve original, long-horizon software engineering tasks.
OSWorld 2.0, offline set
$0.02$0.05$0.10$0.20$0.50$1.00$2.00$5.00$10.00$20.00Cost per task0%20%40%60%80%ScoreModel: Claude Opus 5 · Effort: low · Cost per task: $9.88 · Score: 55.2%Model: Claude Opus 5 · Effort: low · Cost per task: $9.88 · Score: 55.2%Model: Claude Opus 5 · Effort: medium · Cost per task: $12.67 · Score: 60.3%Model: Claude Opus 5 · Effort: high · Cost per task: $15.95 · Score: 65.9%Model: Claude Opus 5 · Effort: xhigh · Cost per task: $23.91 · Score: 70.1%Model: Claude Opus 5 · Effort: max · Cost per task: $24.11 · Score: 70.2%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.019 · Score: 12.0%Model: GPT-5.6 Luna · Effort: low · Cost per task: $0.019 · Score: 12.0%Model: GPT-5.6 Luna · Effort: medium · Cost per task: $0.052 · Score: 22.7%Model: GPT-5.6 Luna · Effort: high · Cost per task: $0.16 · Score: 35.9%Model: GPT-5.6 Luna · Effort: xhigh · Cost per task: $0.36 · Score: 48.0%Model: GPT-5.6 Luna · Effort: max · Cost per task: $0.49 · Score: 52.7%Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.91 · Score: 29.8%Model: GPT-5.6 Sol · Effort: low · Cost per task: $0.91 · Score: 29.8%Model: GPT-5.6 Sol · Effort: medium · Cost per task: $2.73 · Score: 49.7%Model: GPT-5.6 Sol · Effort: high · Cost per task: $4.46 · Score: 56.5%Model: GPT-5.6 Sol · Effort: xhigh · Cost per task: $5.93 · Score: 60.9%Model: GPT-5.6 Sol · Effort: max · Cost per task: $7.71 · Score: 66.2%Model: GPT-6 Astra · Effort: low · Cost per task: $2.55 · Score: 62.2%Model: GPT-6 Astra · Effort: low · Cost per task: $2.55 · Score: 62.2%Model: GPT-6 Astra · Effort: medium · Cost per task: $5.10 · Score: 69.3%Model: GPT-6 Astra · Effort: high · Cost per task: $6.60 · Score: 70.0%Model: GPT-6 Astra · Effort: xhigh · Cost per task: $7.17 · Score: 71.3%Model: GPT-6 Astra · Effort: max · Cost per task: $9.07 · Score: 73.5%Model: GPT-6 Luna · Effort: low · Cost per task: $0.030 · Score: 8.3%Model: GPT-6 Luna · Effort: low · Cost per task: $0.030 · Score: 8.3%Model: GPT-6 Luna · Effort: medium · Cost per task: $0.062 · Score: 31.5%Model: GPT-6 Luna · Effort: high · Cost per task: $0.12 · Score: 41.4%Model: GPT-6 Luna · Effort: xhigh · Cost per task: $0.16 · Score: 46.7%Model: GPT-6 Luna · Effort: max · Cost per task: $0.27 · Score: 52.7%Model: GPT-6 Sol · Effort: low · Cost per task: $0.97 · Score: 43.9%Model: GPT-6 Sol · Effort: low · Cost per task: $0.97 · Score: 43.9%Model: GPT-6 Sol · Effort: medium · Cost per task: $1.32 · Score: 54.0%Model: GPT-6 Sol · Effort: high · Cost per task: $1.64 · Score: 58.3%Model: GPT-6 Sol · Effort: xhigh · Cost per task: $2.21 · Score: 60.5%Model: GPT-6 Sol · Effort: max · Cost per task: $3.25 · Score: 64.4%
In OSWorld 2.0 , AI agents attempt long-horizon computer-use workflows spanning everyday and professional tasks. We report the partial reward on the offline set from the v2026.08.08 release.
Coding deception (lower is better)
GPT-6 AstraGPT-6 SolGPT-5.6 SolGPT-6 LunaGPT-5.6 Luna0%20%40%60%80%100%Deception rateModel: GPT-5.6 Luna · Effort: max · Score: 9.5%Model: GPT-5.6 Sol · Effort: max · Score: 10.4%Model: GPT-6 Astra · Effort: max · Score: 0.5%Model: GPT-6 Luna · Effort: max · Score: 2.8%Model: GPT-6 Sol · Effort: max · Score: 1.3%9.5%Model: GPT-5.6 Luna · Effort: max · Score: 9.5%10.4%Model: GPT-5.6 Sol · Effort: max · Score: 10.4%0.5%Model: GPT-6 Astra · Effort: max · Score: 0.5%2.8%Model: GPT-6 Luna · Effort: max · Score: 2.8%1.3%Model: GPT-6 Sol · Effort: max · Score: 1.3%
In our internal coding deception evaluation, AI agents are given tasks deliberately selected to elicit dishonesty. In typical usage, deception is much rarer. Deception rate measures the fraction of answers with any detected deception. Effort was set to maximum.

کار حرفه‌ای و استفاده از ابزارها چقدر بهتر شده؟

در AutomationBench 1.0.6، عامل‌های هوش مصنوعی باید جریان‌های کاری چندمرحله‌ای رو با ۴۷ ابزار در حوزه‌هایی مثل فروش، پشتیبانی و عملیات انجام بدن. GPT 6 Sol با effort سطح xhigh امتیاز ۳۳٫۲ درصد و هزینهٔ ۰٫۲۷ دلار برای هر وظیفه ثبت کرده. OpenAI می‌گه GPT 6 Luna با effort سطح high نسبت به GPT 5.6 Luna، ۵٫۴ واحد درصد امتیاز بالاتر و ۵۸ درصد هزینهٔ کمتر برای هر وظیفه داشته. «واحد درصد» با «درصد رشد نسبی» فرق داره؛ این عدد اختلاف مستقیم دو امتیازه.

در Agents’ Last Exam، که وظایف حرفه‌ای طولانی‌تر رو در رشته‌ها و صنایع مختلف می‌سنجه، Sol با effort سطح max به امتیاز ۵۶٫۴ درصد رسیده. این نتیجه برای کسی مهمه که می‌خواد مدل فقط یک جواب کوتاه نده و چند مرحله کار رو با ابزارها جلو ببره. البته امتیاز ۵۶٫۴ درصد خودش نشان می‌ده حتی در همین آزمون هم بخش قابل‌توجهی از وظایف کامل حل نشده‌اند؛ پس برای کار حساس، خروجی عامل همچنان به بررسی نیاز داره.

برای کدنویسی و کار با رایانه چه نتیجه‌ای منتشر شده؟

در FrontierCode، فقط اجرای درست کد مهم نیست؛ کیفیت تست، محدودهٔ تغییر و آماده‌بودن آن برای ادغام در پروژه هم بررسی می‌شه. OpenAI می‌گه Sol در این آزمون نسبت به GPT 5.6 Sol پیشرفت قابل‌توجهی داشته. در DeepSWE v1.1، که روی وظایف طولانی مهندسی نرم‌افزار در کدبیس‌های واقعی تمرکز داره، Sol با effort سطح max امتیاز ۶۸٫۸ درصد و Luna با همان سطح effort امتیاز ۶۶٫۶ درصد گرفته‌اند. این نتیجه نشان می‌ده Luna هم در یک آزمون کدنویسی پیچیده توان رقابتی داشته؛ با این حال، برای انتخاب مدل پروژه‌ات باید کیفیت تست و هزینهٔ اجرای خودت رو بسنجی.

در OSWorld 2.0 offline، که عامل‌ها باید با محیط رایانه کار کنن، Sol با effort سطح xhigh امتیاز ۶۰٫۵ درصد گرفته. OpenAI همچنین گزارش کرده Luna با effort سطح max از GPT 5.6 Sol با effort سطح medium و حدود یک‌دهم هزینهٔ هر وظیفه جلو زده. معیار منتشرشده برای OSWorld امتیاز جزئی روی مجموعهٔ آفلاین است؛ بنابراین نباید آن رو معادل نرخ موفقیت کامل در کار روزانه با مرورگر یا فایل‌سیستم بدونی.

دقت پاسخ و رفتار مدل‌ها هم تغییر کرده؟

OpenAI در یک ارزیابی داخلی از گفت‌وگوهای ناشناس‌شده‌ای که کاربران قبلاً در آن‌ها خطای واقعی گزارش کرده بودند، می‌گه Sol حدود نصف GPT 5.6 Sol اشتباه کرده. Luna هم در سطح‌های بالاتر effort پیشرفت داشته. خود OpenAI توضیح می‌ده این گفت‌وگوهای خطاخیز نمایندهٔ استفادهٔ معمول نیستن؛ بنابراین این نتیجه به معنی «نصف‌شدن خطا در هر کار» یا بی‌نیازی از منبع و بازبینی نیست.

پیشرفت فقط به امتیاز آزمون‌ها محدود نیست. OpenAI می‌گه در Sol و Luna، گزارش کار فنی شفاف‌تر شده و نرخ ادعاهای گمراه‌کننده دربارهٔ کار کدنویسی نسبت به مدل‌های GPT 5.6 پایین‌تر اومده. کشِ بهتر زمینه هم می‌تونه بخش‌های تکراری درخواست‌های طولانی رو سریع‌تر و با هزینهٔ کمتر پردازش کنه؛ تخفیف خواندن ورودی کش‌شده ۹۰ درصده. برای یک عامل کدنویسی یا پشتیبانی، این یعنی باید هم کیفیت نتیجه، هم صداقت گزارش انجام کار و هم هزینهٔ کل گردش کار رو اندازه بگیری.

برای تفسیر درست این آمار، به سه چیز دقت کن: امتیاز آزمون، سطح effort و هزینهٔ هر وظیفه. نتایج OpenAI در محیط پژوهشی یا از طریق API به دست اومده‌اند و ممکنه با خروجی محصول نهایی به‌خاطر تفاوت ابزارها و دستورالعمل‌ها کمی فرق داشته باشن. پس یک مجموعهٔ کوچک از کارهای واقعی خودت بساز و Sol و Luna رو با همان ورودی‌ها و معیار پذیرش مقایسه کن؛ این کار از تکیهٔ صرف به یک عدد بنچمارک دقیق‌تره.

پیشنهاد ویژه کادینر

خرید اشتراک قانونی و اختصاصی برای استفاده پایدارتر

اشتراک‌های اختصاصی کادینر روی ایمیل شخصی خود کاربر، همراه با گارانتی و پشتیبانی کامل ارائه می‌شوند.

تحویل سریعپشتیبانی فارسیگارانتی تا پایان دوره
مشاهده و خرید از کادینر

چطور مدل مناسب رو برای هر درخواست انتخاب کنیم؟

برای انتخاب مدل مناسب، اول باید مسئله، هدف، محدودیت‌ها و داده قابل‌اعتماد رو مشخص کنی. بعد درخواست رو ابتدا با Luna بررسی کن و اگه پاسخش کافی نبود یا کار پیچیده‌تر از حد معمول بود، به Sol منتقلش کن.

این رویکرد، یک الگوی عملی برای صرفه‌جویی در هزینه و زمانه:

  1. 1کار رو تعریف کن: چه نوع خروجی می‌خوای، چقدر پیچیدگی داره و چند مرحله لازمه؟
  2. 2اول با Luna امتحان کن، مخصوصاً اگه حجم درخواست‌ها بالاست.
  3. 3اگه خروجی Luna دقت کافی نداشت یا نیاز به استدلال چندمرحله‌ای بود، به Sol برو.
  4. 4برای تصمیم‌های حساس یا غیرقابل‌برگشت، یک لایه بازبینی انسانی یا مدل‌های دقیق‌تر مثل Astra رو هم وارد کن.
  5. 5نتیجه رو با نمونه‌های واقعی مقایسه کن؛ دقت، زمان پاسخ، effort و هزینه کل رو کنار هم بذار.

نکته آموزشی: تصمیم بین Sol و Luna نباید فقط بر اساس «کدوم مدل جدیدتره» گرفته بشه. معیار واقعی، تطابق پیچیدگی کار با توان مدله؛ یک مدل قوی‌تر لزوماً برای هر کاری بهترین انتخاب نیست.

برای تصمیم‌های حساس ( مثل کارهایی که روی داده مالی، تصمیم‌های حقوقی یا هر چیزی که برگشت‌ناپذیره تأثیر می‌ذارن ) بهتره یک لایه بازبینی انسانی همیشه وجود داشته باشه، فارغ از این‌که از Sol استفاده کردی یا Luna.

هزینه، ابزارها و محدودیت‌های Sol و Luna

طبق مشخصات رسمی مدل‌ها و صفحهٔ قیمت API، هزینهٔ GPT 6 Sol برای هر یک میلیون توکن ورودی ۲ دلار و خروجی ۱۰ دلاره؛ برای GPT 6 Luna این عددها به‌ترتیب ۰٫۱۰ و ۰٫۵۰ دلارن. هر دو پنجرهٔ زمینهٔ ۱٫۰۵ میلیون توکن و سقف خروجی ۱۲۸ هزار توکن دارن و از ورودی تصویری، متن چندزبانه و ابزارهایی مثل جست‌وجو و فراخوانی تابع پشتیبانی می‌کنن. این‌ها قیمت API هستن، نه قیمت اشتراک کادینر یا سهمیهٔ پیام در یک پلن ChatGPT؛ برای تغییرات بعدی، صفحهٔ رسمی رو بررسی کن.

چیزی که مهم‌تر از عدد دقیقه، این‌جاست که پنجره زمینه بزرگ به‌تنهایی فهم بی‌نقص یا نتیجه بهتر رو تضمین نمی‌کنه. یک مدل ممکنه پنجره زمینه بزرگی داشته باشه ولی هنوز توی دنبال‌کردن رابطه بین بخش‌های دور از هم متن دچار خطا بشه. برای همین توصیه می‌شه به‌جای تکیه صرف روی مشخصات فنی، روی نتیجه واقعی تست تمرکز کنی.

نکته دیگه‌ای که باید حواست بهش باشه، استفاده از ابزارها و رایانه (مثل اجرای کد یا دسترسی به فایل‌سیستم) هست. این نوع قابلیت‌ها به ثبت رویداد، محدودیت دسترسی و امکان توقف نیاز دارن. یعنی اگه داری از این مدل‌ها برای کارهایی استفاده می‌کنی که به سیستم واقعی دسترسی دارن، باید مطمئن بشی که یک مکانیزم برای توقف یا محدودکردن دامنه دسترسی وجود داره.

قبل از انتخاب نهایی، این چک‌لیست می‌تونه کمکت کنه:

  • آیا قیمت هر درخواست با حجم کاری که داری، منطقی درمیاد؟
  • آیا سقف پنجره زمینه و خروجی برای پروژه تو کافیه؟
  • آیا ابزارهایی که نیاز داری (مثل ورودی تصویری یا اجرای کد) در دسترسن؟
  • آیا برای کارهای حساس، یک لایه بازبینی انسانی در نظر گرفتی؟

چطور درخواست مؤثر و کنترل‌شده بنویسیم؟

نوشتن یک درخواست خوب، گاهی تأثیرش روی نتیجه بیشتر از انتخاب مدله. هدف، زمینه، محدودیت‌ها و داده معتبر رو واضح بنویس؛ هرچی این بخش مبهم‌تر باشه، احتمال خطا در خروجی بیشتر می‌شه.

در کنارش باید ابزارهای مجاز و شکل خروجی رو هم مشخص کنی. مثلاً اگه می‌خوای خروجی به فرمت JSON باشه یا فقط از یک ابزار خاص استفاده بشه، این رو صریح بنویس. مدل نمی‌تونه چیزی رو حدس بزنه که تو مشخص نکردی.

معیار موفقیت و شرایط توقف هم باید از قبل روشن باشن. یعنی باید بدونی که خروجی چه شکلی باید باشه تا بگی «کار انجام شده»، و اگه مدل به بن‌بست خورد یا داده کافی نداشت، چه اتفاقی باید بیفته.

  • هدف کار رو در یک جمله واضح بنویس
  • زمینه لازم (داده، فایل، پیش‌زمینه) رو کامل ضمیمه کن
  • ابزارهای مجاز و قالب خروجی مورد انتظار رو مشخص کن
  • معیار پذیرش نهایی رو تعریف کن
  • شرایط توقف یا نیاز به بازبینی انسانی رو مشخص کن

بعد از اجرای درخواست، نتیجه تست‌ها و فرض‌های باقی‌مانده رو گزارش کن. اگه بخشی از کار روی فرض‌هایی بنا شده که مطمئن نیستی درستن، این‌ها رو جداگانه علامت‌گذاری کن تا بعداً بتونی راحت‌تر پیگیری‌شون کنی.

GPT 6 Sol

مسیر دسترسی به Sol و Luna از کادینر

برای دسترسی به این خانواده از مدل‌ها، معمولاً از طریق اکانت‌های ChatGPT وارد می‌شی. کادینر عرضه‌کننده اکانت‌های ChatGPT Plus، ChatGPT Go و ChatGPT Pro هست و می‌تونه مسیر عملی برای دسترسی به این پلن‌ها باشه. انتخاب بین این پلن‌ها به نوع استفاده، حجم کار و سطح دسترسی مورد نیازت بستگی داره؛ کسی که کار سبک و گاه‌به‌گاه داره با کسی که هر روز روی پروژه‌های سنگین کار می‌کنه، نیاز متفاوتی داره. برای سؤالات مربوط به پلن‌ها و فرایند تحویل هم می‌تونی از طریق تلگرام با پشتیبانی کادینر در تماس باشی.

پیشنهاد ویژه کادینر

خرید اشتراک قانونی و اختصاصی برای استفاده پایدارتر

اشتراک‌های اختصاصی کادینر روی ایمیل شخصی خود کاربر، همراه با گارانتی و پشتیبانی کامل ارائه می‌شوند.

تحویل سریعپشتیبانی فارسیگارانتی تا پایان دوره
مشاهده و خرید از کادینر

جمع‌بندی

انتخاب بین GPT-6 Sol و GPT-6 Luna به این برمی‌گرده که کارت چقدر پیچیده‌ست و چقدر حجم داری. برای تحلیل عمیق، برنامه‌نویسی چندمرحله‌ای و کارهای حرفه‌ای، Sol گزینه منطقی‌تریه؛ برای طبقه‌بندی، استخراج داده و کارهای پرتکرار، Luna هزینه و زمان کمتری می‌بره. بهترین روش اینه که کار رو با نمونه واقعی تست کنی، هزینه کل رو در نظر بگیری و برای تصمیم‌های حساس همیشه یک لایه بازبینی انسانی داشته باشی. جزئیات فنی و قیمتی این مدل‌ها هم مدام در حال تغییرن، پس قبل از هر تصمیم نهایی حتماً سراغ منبع رسمی و تازه برو.

سؤالات متداول

برای کار پیچیده، gpt 6 sol رو انتخاب کنم یا Luna؟
اگه مسئله چندمرحله‌ای باشه و به تحلیل عمیق، کدنویسی یا بررسی اثر تغییرات نیاز داشته باشه، gpt 6 sol معمولاً انتخاب مناسب‌تریه. Luna وقتی کاربردی‌تره که سرعت، حجم پردازش و پاسخ استاندارد از استدلال پیچیده مهم‌تر باشه و خروجی تکرارپذیر بخوای.
تفاوت Sol و Luna بیشتر توی چه چیزی دیده می‌شه؟
تفاوت Sol و Luna بیشتر به نوع کار برمی‌گرده: Sol برای مسئله‌های پیچیده و چندمرحله‌ای ساخته شده، اما Luna برای پاسخ سریع، دسته‌بندی، استخراج داده و پردازش پرتعداد مناسبه. بنابراین انتخاب بین این دو به سطح استدلال، حجم درخواست و هزینه قابل‌قبول بستگی داره.
برای برنامه‌نویسی و تولید محتوا کدوم مدل کاربردی‌تره؟
برای برنامه‌نویسی، gpt 6 sol معمولاً وقتی می‌ارزه که دنبال پیدا کردن منشأ باگ، تغییر فایل‌های لازم، نوشتن تست و سنجش اثر تغییر باشی. Luna برای تحلیل اولیه خطاها، کدهای تکراری و پردازش حجیم مناسبه. در تولید محتوا هم قالب، زمینه و معیار پذیرش باید از قبل روشن باشن.
چطور مدل مناسب رو برای هر درخواست انتخاب کنیم؟
برای انتخاب مدل مناسب، اول هدف، داده‌های قابل‌اعتماد، محدودیت زمانی و شکل خروجی رو مشخص کن. درخواست‌های پرتعداد و استاندارد رو می‌تونی با Luna شروع کنی و موارد مبهم یا پیچیده رو به Sol بسپری. تصمیم‌های حساس هم به بازبینی انسانی نیاز دارن.

نظرات کاربران

هنوز دیدگاهی برای این محصول ثبت نشده است.

خانه
مجله
به سبد اضافه شد! مشاهده سبد خرید ←