وحدة 4 / 10

لاعبين أقوياء آخرين: Meta، Mistral، xAI، DeepSeek، Cohere

المكاسب:

  • التعرف على مواقع Meta (Llama)، وMistral، وxAI (Grok)، وDeepSeek، وCohere
  • تحديد الأعمال الأكثر ملاءمةً لمقدمي الخدمات ذوي الوزن المفتوح والإقليميين والذين يركزون على التكلفة
  • القدرة على تقييم بلد المنشأ والترخيص كمعيار للاختيار

لقد تعرفنا على المزودين الثلاثة الكبار في الولايات المتحدة. ومع ذلك، فإن التفكير في أن السوق يدور حول هذه الخيارات سيكون بمثابة تجاهل لبعض الخيارات الأكثر قيمة المتاحة لك. Meta، الشركة الرائدة الواضحة، Mistral، فخر أوروبا، xAI، التي تعمل مع البيانات في الوقت الفعلي، DeepSeek، التي تتميز بتوازنها بين التكلفة والأداء، وCohere، المتخصصة في الاستعلام عن مستندات الشركات؛ قد تكون جميعها أكثر ملاءمة لوظائف معينة من الوظائف الثلاثة الكبرى. في هذه الوحدة، ستتعرف بشكل موضوعي على هؤلاء اللاعبين الخمسة ومراكزهم والوظيفة المناسبة لهم؛ سترى لماذا يعتبر بلد المنشأ والترخيص معيارًا للاختيار.

ميتا — عائلة اللاما (زعيم الوزن المفتوح)

عائلة Meta's Llama هي الاسم الأكثر شهرة في عالم الوزن المفتوح. وبما أن الأوزان قابلة للتنزيل، فيمكنك تشغيلها على الخادم الخاص بك ومعالجة البيانات دون إخراجها على الإطلاق. هناك إصدارات بأحجام مختلفة: تعمل النماذج الصغيرة حتى على خادم عادي، بينما تتطلب النماذج الكبيرة أجهزة قوية.

المجالات التي تبرز فيها: المؤسسات التي تريد التحكم الكامل في البيانات؛ أولئك الذين يريدون جعل التكلفة قابلة للتنبؤ بها بكميات كبيرة جدًا؛ وأولئك الذين يرغبون في تخصيص (ضبط) النموذج ببياناتهم الخاصة. الضبط الدقيق هو تخصيص نموذج جاهز لعملك من خلال إعادة تدريبه باستخدام الأمثلة الخاصة بك.

المستخدم النموذجي: المؤسسات الكبيرة التي لديها مراكز بيانات خاصة بها، وصناعات حساسة للخصوصية، وشركات لديها فرق فنية قوية.

تنبيه: على الرغم من أن ترخيص اللاما "مفتوح"، إلا أنه ليس غير مشروط؛ قد تتضمن متطلبات إضافية للشركات الكبيرة جدًا التي تتجاوز حدًا معينًا للمستخدم النشط. اقرأ الترخيص مع فريقك القانوني قبل وضعه في العمل.

ميسترال - مزود أوروبا

تتميز شركة ميسترال، ومقرها فرنسا، بأصلها الأوروبي. إنه مزود "مختلط" لأنه يقدم نماذج الوزن المفتوح (مثل Mixtral) والنماذج المغلقة الأكثر قوة. وهو مرشح طبيعي للمؤسسات التي لديها مخاوف تتعلق بسيادة البيانات في أوروبا؛ لأن المزود نفسه موجود داخل الاتحاد الأوروبي.

المجالات البارزة: المؤسسات المعنية بالامتثال للإطار القانوني الأوروبي؛ أولئك الذين يريدون مرونة الوزن المفتوح وراحة الطراز المغلق تحت نفس السقف؛ ودعم اللغة الأوروبية متعدد اللغات.

المستخدم النموذجي: المؤسسات المتوسطة والكبيرة الحجم العاملة في الاتحاد الأوروبي والتي تريد أن تظل بياناتها داخل حدود الاتحاد الأوروبي.

xAI — Grok (بيانات الوقت الفعلي)

يتم وضع نموذج Grok الخاص بـ xAI من خلال تكامله مع منصة X (Twitter سابقًا) والوصول إلى البيانات الحالية في الوقت الفعلي. على الرغم من أنه نموذج للأغراض العامة، إلا أنه يجذب الانتباه بادعائه أنه يعكس الأحداث الجارية ونبض وسائل التواصل الاجتماعي.

المجالات التي تبرز فيها: تتبع الأحداث الجارية، وتحليل وسائل التواصل الاجتماعي، والمحتوى المرتبط بجدول الأعمال. يعد الاتصال في الوقت الفعلي ذا قيمة عندما يحتاج النموذج إلى معرفة شيء "حدث للتو".

المستخدم النموذجي: فرق وسائل التواصل الاجتماعي، والمسوقون الذين يراقبون العلامات التجارية، ومنتجي المحتوى الذين يعد تتبع جدول أعمالهم أمرًا بالغ الأهمية.

DeepSeek - التكلفة/الأداء (أصل الصين)

وتتميز شركة DeepSeek، ومقرها الصين، بتقديم أداء قوي بتكلفة منخفضة، وبعض نماذجها ذات وزن مفتوح. فهو يقدم نتائج تنافسية، خاصة في المهام التي تتطلب تفكيرًا مكثفًا، مع تقديم ميزة سعرية.

المجالات التي تبرز فيها: الوظائف الاستدلالية كبيرة الحجم ذات الحساسية العالية للميزانية؛ الفرق التي تريد مرونة واضحة في الوزن ولكن يتعين عليها إبقاء التكاليف منخفضة.

المستخدم النموذجي: المبادرات التي تركز على التكلفة، والفرق التي تقوم بتحليلات كبيرة الحجم.

تنبيه: DeepSeek ينشأ من الصين. إذا كنت ستقوم بمعالجة البيانات الشخصية أو الأسرار التجارية، فتأكد من توضيح مكان معالجة البيانات وتخزينها. يؤدي تشغيل الإصدار المفتوح على الخادم الخاص بك إلى تخفيف هذا القلق؛ يجب تقييم استخدام الخدمة السحابية بعناية من حيث سيادة البيانات. سنتناول هذا الموضوع بالتفصيل في الوحدة الثامنة.

Cohere - بحث المؤسسات وRAG

تم تصميم شركة Cohere التي يقع مقرها في كندا لأعباء عمل المؤسسات بدلاً من تطبيقات الدردشة للعملاء. إنها قوية بشكل خاص في سيناريوهات RAG (توليد المعرفة التي تم جلبها)؛ أي في الأنظمة التي يعثر فيها النموذج على الأجزاء ذات الصلة من أرشيف المستندات ويقرأها قبل الاستجابة. ويفضل أيضًا إنشاء البنية التحتية للبحث في الشركات باستخدام نماذج "التضمين" التي تحول النصوص إلى متجهات رقمية. (التضمين هو تحويل معنى النص إلى أرقام بحيث يمكن وضع النصوص المتشابهة جنبًا إلى جنب.)

المجالات التي تبرز فيها: الاستعلام عن المستندات الداخلية، والبحث الذكي، وأنظمة الأسئلة والأجوبة على قاعدة المعرفة.

المستخدم النموذجي: المؤسسات التي لديها أرشيفات مستندات كبيرة، والفرق التي ترغب في جعل قاعدة معارفها الداخلية قابلة للبحث باستخدام الذكاء الاصطناعي.

خمسة لاعبين جنبًا إلى جنب

مزود

القيمة المميزة

الوزن

الأصل

وظيفة نموذجية

ميتا (اللاما)

تحكم كامل، ضبط دقيق

مفتوح

الولايات المتحدة الأمريكية

الأعمال السرية على الخادم الخاص

ميسترال

أصل الاتحاد الأوروبي، المرونة

مختلط

فرنسا

سيادة البيانات في الاتحاد الأوروبي

اكس آي (جروك)

بيانات في الوقت الحقيقي

مغلق

الولايات المتحدة الأمريكية

جدول الأعمال / وسائل التواصل الاجتماعي

ديب سيك

التكلفة/الأداء

مفتوح

الصين

حجم كبير، موجه نحو الميزانية

cohere

بحث المؤسسة/RAG

مختلط

كندا

الاستعلام عن الوثيقة

ثلاث حالات واقعية

الحالة 1 - شركة تصنيع تعمل في الاتحاد الأوروبي. تريد شركة لها مصانع في ألمانيا البحث في الوثائق الفنية باستخدام الذكاء الاصطناعي، لكنها لا تريد أن تخرج بياناتها خارج الاتحاد الأوروبي. لقد اختاروا نموذج ميسترال المغلق القائم على الاتحاد الأوروبي؛ إنه قوي ومتوافق مع الإطار القانوني. تتحول الوظيفة الشهرية التي تبلغ حوالي 800000 رمز إلى فاتورة يمكن التنبؤ بها ويشعر الفريق القانوني بالارتياح.

الحالة 2 - مبادرة التحليلات المقيدة بالميزانية. يجب على شركة تحليل البيانات الناشئة المكونة من ثمانية أشخاص أن تقوم بتصنيف وتلخيص عشرات الآلاف من النصوص القصيرة يوميًا، لكن ميزانيتها محدودة. يقومون بتشغيل نموذج الوزن المفتوح الخاص بـ DeepSeek على خادم يستأجرونه؛ وبالتالي، فإنهم لا يدفعون مقابل كل رمز مميز، ويقومون بحل المشكلة المتعلقة بنشأة البيانات من خلال عدم سحب البيانات مطلقًا.

الحالة 3 - قاعدة معرفية كبيرة لشركة التأمين. سألت شركة تأمين لديها عشرات الآلاف من وثائق التأمين والوثائق الإجرائية موظفيها "ماذا يفعلون في هذه الحالة؟" يريد أن يكون قادرًا على طرح أسئلته على الأرشيف. إنهم يقومون ببناء نظام بحث داخلي باستخدام RAG من Cohere ونماذج التضمين. عندما يطرح أحد الموظفين سؤالاً، يقوم النظام أولاً بالعثور على المستندات ذات الصلة، ثم يجيب النموذج عليها بناءً عليها؛ وبالتالي فإن الإجابات ليست مختلقة، بل مبنية على وثائق حقيقية.

موجه ضعيف / موجه قوي

حث ضعيف:

اقترح نموذجًا رخيصًا للذكاء الاصطناعي.

مطالبة قوية:

دورك: مستشار مشتريات الذكاء الاصطناعي. الحاجة: قم بفرز ما يقرب من 30000 تعليق قصير من العملاء الأتراك يوميًا إلى إيجابية/سلبية/محايدة. الميزانية محدودة جداً. لا تحتوي البيانات على بيانات شخصية (مجهولة). المهمة: التوصية بـ 3 خيارات (بما في ذلك الوزن المفتوح) مع توازن جيد بين التكلفة والأداء. اكتب نطاق التكلفة الشهرية المقدرة ومذكرة الأصل/البيانات والمخاطر الرئيسية لكل منها. وأخيرا، قدم توصية واحدة للطيار.

توفر المطالبة القوية توصية قابلة للتنفيذ حقًا لأنها توفر الحجم وقيد الميزانية ونوع البيانات واللغة.

قوالب قابلة للنسخ

1. فحص المزود البديل:

قم بإدراج موفري الخدمات خارج الشركات الثلاثة الكبرى (Anthropic/OpenAI/Google) الذين قد يكونون مناسبين للمهمة التالية [TASK]: Meta وMistral وxAI وDeepSeek وCohere. اكتب سطرًا واحدًا "لماذا هو مناسب / لماذا هو غير مناسب" لكل منها.

2. مذكرة المنشأ والترخيص:

أفكر في استخدام الموفر التالي [PROVIDER]. ما هي المخاطر التي يشكلها بلد المنشأ ونوع الوزن وشروط الترخيص بالنسبة لي فيما يتعلق بسيادة البيانات؟ اقترح الاحتياط لكل خطر.

3. فحص الامتثال لـ RAG:

لدي ~[NUMBER] من المستندات وأريد أن يطرح الموظفون أسئلة عنها. هل هذا هو سيناريو RAG؟ إذا كان الأمر كذلك، ما هو نوع الموفر/النموذج (التضمين + الإنتاج) الذي توصي به وما هي الخطوات الثلاث الأولى للتثبيت؟

4. الخطة التجريبية للوزن المفتوح:

نريد تجربة نموذج الوزن المفتوح هذا [MODEL] على الخادم الخاص بنا. قم بإنشاء خطة تقريبية تتضمن متطلبات الأجهزة وخطوات التثبيت والوقت المقدر و3 مقاييس نجاح يجب اتباعها في الأسبوع الأول.

الأخطاء الشائعة

  • التعثر مع الثلاثة الكبار: قد لا يكون المزود الأكثر شهرة هو الأنسب لعملك الخاص؛ لا تتخذ قراراً دون تقييم البدائل.
  • الخلط بين بلد المنشأ وسبب تقني: الأصل هو معيار استراتيجي من حيث سيادة البيانات والمخاطر القانونية، وليس تسمية عادية.
  • الخلط بين RAG وقوة النموذج: غالبًا ما يأتي النجاح في الاستعلام عن المستندات من إعداد RAG جيد، وليس من النموذج الأقوى.
  • بافتراض أن الوزن المفتوح خالي من التثبيت: اختر DeepSeek أو Llama لأنهما "مجانيان" ولا يأخذان في الاعتبار أعباء الأجهزة والصيانة.
  • المبالغة في تقدير الحاجة إلى الوقت الفعلي: لا ترغب كل الشركات في الحصول على بيانات في الوقت الفعلي؛ إن ميزة Grok تكون منطقية فقط عندما يكون التوقيت المناسب أمرًا بالغ الأهمية.

باختصار

  • ميتا (اللاما) وزن مفتوح وتحكم كامل؛ ميسترال الاتحاد الأوروبي الأصل والمرونة. بيانات xAI في الوقت الحقيقي؛ تكلفة/أداء DeepSeek؛ يبرز Cohere مع بحث المؤسسات/RAG.
  • يعتبر بلد المنشأ والترخيص من معايير الاختيار الإستراتيجية، خاصة بالنسبة لأولئك الذين يقومون بمعالجة البيانات الشخصية أو السرية.
  • في سيناريوهات RAG، يأتي النجاح من إعداد جيد لجلب المستندات بدلاً من النموذج الأقوى.
  • قد يأتي المزود المناسب من خارج الشركات الثلاث الكبرى، اعتمادًا على نوع العمل والميزانية والإطار القانوني.

مهمة التطبيق

ضع في اعتبارك ما إذا كانت هناك حاجة للاستعلام عن المستندات في عملك (مثل قيام الموظفين بطرح أسئلة تتعلق بالأرشيف). اطلب من نموذج الذكاء الاصطناعي تقييم موقفك باستخدام القالب 3 في هذه الوحدة (فحص ملاءمة RAG). وأيضًا، إذا كنت تقوم بمعالجة بيانات شخصية أو سرية، فقم بإزالة مخاطر سيادة البيانات الخاصة بالمزود الذي تفكر في اختياره باستخدام القالب الثاني (ملاحظة الأصل والترخيص). سوف نستخدم هذا الناتج في دراسة KVKK في الوحدة الثامنة.

قائمة مرجعية

  • [ ] يمكنني مطابقة القيمة البارزة والعمل النموذجي لخمسة لاعبين بديلين.
  • [ ] يمكنني الفصل بين مقدمي الخدمة ذوي الوزن المفتوح والمقدمين الإقليميين ومقدمي الخدمات الذين يركزون على التكلفة بناءً على الوظيفة المناسبة لهم.
  • [ ] أستطيع أن أشرح لماذا يعتبر بلد المنشأ والترخيص من معايير الاختيار.
  • [ ] يمكنني التعرف على سيناريو RAG والتوصية بنوع الموفر المناسب.
  • [ ] أستطيع أن أرى الخطوات الصعبة لطيار الوزن المفتوح.