أعلنت شركة جوجل عن إطلاق Gemini 3,8 Live وGemini 3,8 Live Extended Thinking في 15 سبتمبر، ووصفتهم بأنهم أكثر نماذجها الصوتية تطورًا حتى الآن.
يستطيع النموذجان التحدث والتفكير وأداء المهام. ولكن، كيف يقيمهم المحللون المستقلون؟ تصدرت نسخة Extended Thinking مؤشر الكلام إلى الكلام الصادر عن شركة Artificial Analysis بنسبة 82,6%، متقدمة على GPT-Live-1 وGrok Voice.
تابعونا على X للحصول على آخر الأخبار مباشرة عند حدوثها
كيف تقيم المعايير نموذج الذكاء الاصطناعي للمحادثة الأحدث من جوجل
يعتمد مؤشر Artificial Analysis على متوسط قدرة النموذج في التفكير الصوتي، الأداء المعتمد على الوكلاء، تفضيلات المستخدمين في المقارنات، ونسبة النجاح في المهام.
تصدرت Gemini 3,8 Live Extended Thinking، التي تم اختبارها بجهد تفكير عالٍ، المركز الأول. تلته GPT-Live-1 Astra بنسبة 81,5% وGrok Voice Think Fast 2,0 High بنسبة 81,3%.
حقق نموذج Gemini 3,8 Live القياسي المركز الخامس بنتيجة بلغت 76,0%. وتفوق كلا النموذجين على Gemini 3,1 Flash Live High الذي حصل على 71,5%.
لاحظ أن الفجوة بينهما في الأداء القائم على الوكلاء أوسع. وصلت نسخة Extended Thinking إلى 68,6% على اختبار Tau Voice، مقارنة بـ37,7% للجيل السابق.
في اختبار التفكير الصوتي، حققت نسخة Extended Thinking نسبة 97,7% متقدمة بشكل طفيف على Grok Voice بنسبة 97,2%. ومع ذلك، تخلفت عن Qwen Audio 3,0 Realtime Plus الذي سجل 99,2%.
يواصل المختبرون البشريون الاعتماد على نموذج Gemini الأقدم
يبرز التفاوت الأكبر في السعر. يعمل النموذج القياسي بتكلفة ٠,٨٤ دولار لكل ساعة من الصوت المدخل. يمثل ذلك تقريبًا نصف تكلفة سابقه البالغة ١,٧٥ دولار وهي أيضًا أقل تكلفة في المؤشر.
اعرض أن Extended Thinking يعمل بسعر ٣,٥٠ دولار لكل ساعة. هذا السعر أقل من GPT-Live-1 Sol الذي يبلغ ٤,٤٧ دولار وGrok Voice Think Fast 2,0 High الذي يبلغ ٤,٨٠ دولار.
انخفضت فترة التأخير أيضاً. انخفض متوسط الوقت حتى أول صوت إلى ١,١٨ ثانية، مقارنةً بـ ٢,٩٩ ثانية لنموذج جيميني الأقدم.
لاحظ أن المستمعين مع ذلك، غير مقتنعين بالكامل. ما زال Gemini 3.1 Flash Live يتصدر الأفضلية في محادثات Speech Agent Arena العمياء، برصيد Elo بلغ ١٠٩٦.
يحتل Gemini 3.8 Live المركز الثاني عند ١٠٨٣. يأتي نوع Extended Thinking في المؤخرة عند ٩٩٠، رغم إكماله ٨٩,١ % من مهامه.
لاحظ أن الذكاء الاصطناعي الصوتي يُقيَّم حالياً على مقياسين يشيران في اتجاهين مختلفين. تكافئ المقاييس النموذج الذي يحلل بشكل أقوى. وتكافئ الأفضلية من يتحدث بأفضل طريقة. تتصدر جوجل في الوقت الحالي كلا المجالين، بنماذج مختلفة.
اشترك في قناتنا على يوتيوب لمشاهدة القادة والصحفيين يقدمون تحليلات متخصصة









