أصدرت شركة أنثروبيك نموذج كلود سونيت 5,5 في 28 سبتمبر بنفس سعر قائمة سونيت 5. ذكرت الشركة أن النموذج يعمل بسرعة تزيد عن 30% ويكلف أقل بنسبة تصل إلى 30% لكل مهمة.
وصلت شركة مستقلة متخصصة في قياس الأداء إلى نتيجة مختلفة حول التكلفة عندما دفعت النموذج إلى أقصى طاقته.
تابعنا على منصة X للحصول على آخر الأخبار فور حدوثها
وصول نموذج 5,5 الثاني من أنثروبيك بعد أيام من إصدار أوبوس
يعتبر سونيت 5,5 النموذج الثاني في عائلة كلود 5,5. أطلقت أنثروبيك أوبوس 5,5 في 22 سبتمبر. في نفس اليوم، أصدرت أوبن إيه آي أيضاً جي بي تي-6 سول ولونا.
يحافظ النموذج الجديد على أسعار سونيت 5 والبالغة $2 لكل مليون رمز إدخال و$10 لكل مليون رمز إخراج. أفادت أنثروبيك بتحقيق نسبة 70,6% في اختبار Terminal-Bench 4,0، وهو اختبار برمجي ذاتي. واستطاع سونيت 5 الوصول إلى 10,3% فقط، بينما بلغ أوبوس 5,5 نسبة 66,4%.
ذكرت شركة أنثروبيك أن سونيت 5,5 لا يوسع حدود قدراته، لذا ركزت مراجعة التوافق على المخاطر مثل تضليل المستخدمين أو المساهمة في سوء الاستخدام في المواقف الحساسة.
يأتي سونيت 5,5 أيضاً مع تدابير حماية إلكترونية ومصنفات مضادة للتقطير. تمنع هذه التدخلات أي محاولات لاستخراج منطق النموذج بغرض تدريب أنظمة منافسة. سيتبع كلود هايكو 5,5 خلال الأسابيع القادمة.
في المقابل، أقدمت أوبن إيه آي على تجميد نموذج قادم هو جي بي تي-6,1 أسترا، لأسباب تتعلق بالسلامة. أكدت قناة CNBC يوم الاثنين أن النموذج لم يستوفِ معايير الشركة.
تحليل شركة آرتيفيشال يكشف فاتورة رموز أعلى عند أقصى جهد
منحت شركة آرتيفيشال أناليسِس، وهي الشركة المسؤولة عن قياس الأداء التي صنفت جروك 4,7 في المركز الرابع، سونيت 5,5 درجة 56 على مؤشر الذكاء الخاص بها. يضعه ذلك في المرتبة الثانية بشكل عام، بفارق نقطتين عن أوبوس 5,5 عند أقصى جهد.
سجلت الشركة 64% لسونيت 5,5 على تيرمينال-بينش 4,0 مقابل 60% لأوبوس 5,5 وGPT-6 أسترا. عند اختبارات الأعمال المعرفية مثل GDPval-AA, وجدت أن سونيت 5,5 على مستوى تقريبا مع أوبوس 5,5.
ذكرت الشركة أن سونيت 5,5 استخدم عددا أكبر بكثير من التوكنات لتحقيق تلك النتائج.
يقع هذا الحجم عند حوالي 60% فوق أوبوس 5,5 وسونيت 5 عند أقصى جهد. كما أنه يعادل تقريباً 7 أضعاف عدد التوكنات القصوى لGPT-6 أسترا.
ذكر عملاء الوصول المبكر الذين اقتبستهم أنثروبيك اتجاهًا معاكسًا ضد سونيت 5, لكن في مهام عمل مختلفة. لاحظت شركة بالياسني لإدارة الأصول انخفاضًا كبيرًا في استخدام التوكنات في مهامها المالية.
قال جو بويريه، كبير مهندسي الذكاء الاصطناعي في بالياسني لإدارة الأصول إنه على مجموعتنا الخاصة المكونة من 2 441 مهمة مالية تشمل الأسئلة والأجوبة والاستخراج والتحليل والتنبؤ, حقق كلود سونيت 5,5 نتيجة أفضل من سونيت 5 واستخدم حوالي 121k توكن لكل إجابة حيث استخدم سونيت 5 عدد 497k توكن.
قامت شركة ارتيفيشال أناليسيس باختبار نسخة ما قبل الإصدار التي كانت تحتوي على خلل بخصوص المخرجات المنظمة والذي قامت أنثروبيك بإصلاحه منذ ذلك الحين. وتخطط الشركة لإعادة إجراء التقييمات ذات الصلة قريبًا.
اشترك في قناة يوتيوب الخاصة بنا لمتابعة القادة والصحفيين يقدمون رؤى خبراء









