اللاما (نموذج لغوي)

لاما
المطور(ون)ميتا ايه اي
الإصدار الأولي24 فبراير 2023 ؛ منذ 21 شهرًا ( 2023-02-24 )
إصدار مستقر
لاما 3.2 / 25 سبتمبر 2024 ؛ منذ شهرين ( 2024-09-25 )
مستودعgithub.com/meta-llama/llama-models
مكتوب فيبايثون
يكتب
رخصةالمصدر متاح (رخصة مجتمع Meta Llama 3.2) [1]
موقع إلكترونيلاما.كوم

Llama ( نموذج اللغة الكبير Meta AI ، المعروف سابقًا باسم LLaMA ) هي عائلة من نماذج اللغة الكبيرة الانحدارية (LLMs) التي أصدرتها Meta AI بدءًا من فبراير 2023. [2] [3] أحدث إصدار هو Llama 3.2، تم إصداره في سبتمبر 2024. [4]

تم توفير أوزان النموذج للإصدار الأول من Llama لمجتمع البحث بموجب ترخيص غير تجاري، وتم منح الوصول على أساس كل حالة على حدة. [5] [3] تمت مشاركة نسخ غير مصرح بها من النموذج عبر BitTorrent . ردًا على ذلك، أصدرت Meta AI طلبات إزالة DMCA ضد المستودعات التي تشارك الرابط على GitHub . [6] [7] تم إتاحة الإصدارات اللاحقة من Llama خارج الأوساط الأكاديمية وتم إصدارها بموجب تراخيص سمحت ببعض الاستخدام التجاري. [8] [9] يتم تدريب نماذج Llama بأحجام معلمات مختلفة، تتراوح بين 1B و 405B. [10] في الأصل، كان Llama متاحًا فقط كنموذج أساسي . [11] بدءًا من Llama 2، بدأت Meta AI في إصدار إصدارات دقيقة التعليمات جنبًا إلى جنب مع نماذج الأساس. [9]

إلى جانب إصدار Llama 3، أضافت Meta ميزات المساعد الافتراضي إلى Facebook و WhatsApp في مناطق مختارة، وموقع ويب مستقل. تستخدم كلتا الخدمتين نموذج Llama 3. [12]

خلفية

بعد إصدار نماذج اللغة الكبيرة مثل GPT-3 ، كان التركيز البحثي منصبًا على تطوير النماذج التي أظهرت في بعض الحالات زيادات كبيرة في القدرات الناشئة. [13] تسبب إصدار ChatGPT ونجاحه المفاجئ في زيادة الاهتمام بنماذج اللغة الكبيرة. [14]

بالمقارنة مع الاستجابات الأخرى لـ ChatGPT، ذكر كبير علماء الذكاء الاصطناعي في Meta، يان لوكون، أن نماذج اللغة الكبيرة هي الأفضل للمساعدة في الكتابة. [15] [16] [17]

كان أحد التحقيقات التجريبية لسلسلة Llama هو قوانين التوسع . وقد لوحظ أن نماذج Llama 3 أظهرت أنه عندما يتم تدريب نموذج على بيانات أكبر من الكمية " المثلى لـ Chinchilla "، يستمر الأداء في التوسع خطيًا. على سبيل المثال، مجموعة البيانات المثلى لـ Chinchilla لـ Llama 3 8B هي 200 مليار رمز، لكن الأداء استمر في التوسع خطيًا إلى مجموعة البيانات الأكبر بمقدار 75 مرة والتي تضم 15 تريليون رمز. [18]

الإصدار الأولي

تم الإعلان عن LLaMA في 24 فبراير 2023، عبر منشور مدونة وورقة بحثية تصف تدريب النموذج وهندسته وأدائه. [2] [3] تم إصدار كود الاستدلال المستخدم لتشغيل النموذج علنًا بموجب ترخيص GPLv3 مفتوح المصدر . [19] تمت إدارة الوصول إلى أوزان النموذج من خلال عملية تقديم طلب، مع منح الوصول "على أساس كل حالة على حدة للباحثين الأكاديميين؛ وأولئك التابعين للمنظمات في الحكومة والمجتمع المدني والأوساط الأكاديمية؛ ومختبرات أبحاث الصناعة في جميع أنحاء العالم". [3]

تم تدريب Llama على المعلومات المتاحة للعامة فقط، وتم تدريبه على أحجام نماذج مختلفة، بهدف جعله أكثر سهولة في الوصول إلى الأجهزة المختلفة.

أفاد Meta AI أن أداء نموذج المعلمات 13B في معظم معايير NLP تجاوز أداء GPT-3 الأكبر بكثير (مع معلمات 175B)، وكان أكبر نموذج 65B قادرًا على المنافسة مع النماذج الحديثة مثل PaLM و Chinchilla . [2]

تسريب

في 3 مارس 2023، تم تحميل ملف تورنت يحتوي على أوزان LLaMA، مع مشاركة رابط إلى الملف على لوحة صور 4chan وانتشاره لاحقًا عبر مجتمعات الذكاء الاصطناعي عبر الإنترنت. [6] في نفس اليوم، تم فتح طلب سحب على مستودع LLaMA الرئيسي، مطالبًا بإضافة رابط المغناطيس إلى الوثائق الرسمية. [20] [21] في 4 مارس، تم فتح طلب سحب لإضافة روابط إلى مستودعات HuggingFace التي تحتوي على النموذج. [22] [20] في 6 مارس، قدمت Meta طلبات إزالة لإزالة مستودعات HuggingFace المرتبطة في طلب السحب، ووصفتها بأنها "توزيع غير مصرح به" للنموذج. امتثلت HuggingFace للطلبات. [23] في 20 مارس، قدمت Meta طلب إزالة بموجب قانون الألفية الرقمية لانتهاك حقوق الطبع والنشر ضد مستودع يحتوي على نص برمجي قام بتنزيل LLaMA من مرآة، وامتثلت GitHub في اليوم التالي. [7]

تباينت ردود الفعل على التسريب. تكهن البعض بأن النموذج سيتم استخدامه لأغراض خبيثة، مثل البريد العشوائي الأكثر تعقيدًا . أشاد البعض بإمكانية الوصول إلى النموذج، فضلاً عن حقيقة أنه يمكن تشغيل إصدارات أصغر من النموذج بتكلفة زهيدة نسبيًا، مما يشير إلى أن هذا سيعزز ازدهار التطورات البحثية الإضافية. [6] قارن العديد من المعلقين، مثل Simon Willison ، LLaMA بـ Stable Diffusion ، وهو نموذج نص إلى صورة ، والذي على عكس النماذج المتطورة نسبيًا التي سبقته، تم توزيعه علنًا، مما أدى إلى انتشار سريع للأدوات والتقنيات والبرامج المرتبطة به. [6] [24]

لاما 2

في 18 يوليو 2023، أعلنت Meta بالشراكة مع Microsoft عن Llama 2، الجيل التالي من Llama. قامت Meta بتدريب وإصدار Llama 2 في ثلاثة أحجام نماذج: 7 و13 و70 مليار معلمة. [9] تظل بنية النموذج دون تغيير إلى حد كبير عن نماذج LLaMA-1، ولكن تم استخدام 40٪ بيانات أكثر لتدريب النماذج الأساسية. [25] تذكر النسخة الأولية المصاحبة [25] أيضًا نموذجًا يحتوي على 34 مليار معلمة قد يتم إصدارها في المستقبل عند تلبية أهداف السلامة.

يتضمن Llama 2 نماذج أساسية ونماذج مُعدلة للدردشة. وفي انحراف آخر عن LLaMA، يتم إصدار جميع النماذج بأوزان وهي مجانية للعديد من حالات الاستخدام التجاري. ومع ذلك، نظرًا لبعض القيود المتبقية، فإن وصف Meta لـ LLaMA كمصدر مفتوح كان محل نزاع من قبل مبادرة المصدر المفتوح (المعروفة بالحفاظ على تعريف المصدر المفتوح ). [26]

Code Llama هو تعديل دقيق لـ Llama 2 مع مجموعات بيانات خاصة بالكود. تم إصدار إصدارات 7B و13B و34B في 24 أغسطس 2023، مع إصدار 70B في 29 يناير 2024. [27] بدءًا من نماذج الأساس من Llama 2، ستقوم Meta AI بتدريب 500 مليار رمز إضافي من مجموعات بيانات الكود، قبل رمز إضافي 20 مليار من بيانات السياق الطويل، مما يؤدي إلى إنشاء نماذج أساس Code Llama. تم تدريب نموذج الأساس هذا بشكل أكبر على رمز يتبع التعليمات 5B لإنشاء الضبط الدقيق للتعليمات. تم إنشاء نموذج أساس آخر لكود Python، والذي تم تدريبه على 100 مليار رمز من كود Python فقط، قبل بيانات السياق الطويل. [28]

لاما 3

في 18 أبريل 2024، أصدرت Meta Llama-3 بحجمين: 8B و70B معلمات. [18] تم تدريب النماذج مسبقًا على ما يقرب من 15 تريليون رمز نصي تم جمعها من "مصادر متاحة للجمهور" مع نماذج التعليمات التي تم ضبطها بدقة على "مجموعات بيانات التعليمات المتاحة للجمهور، بالإضافة إلى أكثر من 10 ملايين مثال معلق عليه بشريًا". أظهر اختبار Meta AI في أبريل 2024 أن Llama 3 70B كان يتفوق على Gemini pro 1.5 و Claude 3 Sonnet في معظم المعايير. أعلنت Meta أيضًا عن خطط لجعل Llama 3 متعدد اللغات ومتعدد الوسائط ، وأفضل في الترميز والمنطق، وزيادة نافذة السياق الخاصة به. [29] [30]

خلال مقابلة مع دواركيش باتيل، قال مارك زوكربيرج إن إصدار 8B من Llama 3 كان قويًا تقريبًا مثل Llama 2 الأكبر حجمًا. وبالمقارنة بالنماذج السابقة، ذكر زوكربيرج أن الفريق فوجئ بأن نموذج 70B كان لا يزال يتعلم حتى في نهاية تدريب 15T من الرموز. تم اتخاذ القرار بإنهاء التدريب للتركيز على قوة وحدة معالجة الرسوميات في مكان آخر. [31]

تم إصدار Llama-3.1 في 23 يوليو 2024، بثلاثة أحجام: معلمات 8B و70B و405B. [10] [32]

مقارنة النماذج

بالنسبة لعمود تكلفة التدريب، تتم كتابة تكلفة النموذج الأكبر فقط. على سبيل المثال، "21,000" هي تكلفة تدريب Llama 2 69B بوحدات petaFLOP-day. أيضًا، 1 petaFLOP-day = 1 petaFLOP/sec × 1 day = 8.64E19 FLOP. "T" تعني "تريليون" و"B" تعني "مليار".

اسم تاريخ الافراج عنه حدود تكلفة التدريب (بيتا فلوب-يوم) طول السياق (الرموز) حجم الجسم (الرموز) الجدوى التجارية؟
لاما 24 فبراير 2023
  • 6.7 مليار
  • 13ب
  • 32.5 مليار
  • 65.2 مليار
6,300 [33] 2048 1-1.4 طن لا
لاما 2 18 يوليو 2023
  • 6.7 مليار
  • 13ب
  • 69ب
21000 [34] 4096 2 تيرا نعم
كود لاما 24 أغسطس 2023
  • 6.7 مليار
  • 13ب
  • 33.7 مليار
  • 69ب
لاما 3 18 أبريل 2024
  • 70.6 مليار
100000 [35] [36] 8192 15 طن
لاما 3.1 23 يوليو 2024
  • 70.6 مليار
  • 405ب
440,000 [32] [37] 128,000
لاما 3.2 25 سبتمبر 2024
  • 11ب
  • 90ب [38] [39]
128000 [40]

الهندسة المعمارية والتدريب

"رسالة توصية لشركة ماجيك يونيكورن"

إليك خطاب التوصية الذي كتبته للتقدم لوظيفة مغذي تنانين في شركة Magic Unicorn Corporation:
عزيزي المجند،
لقد عرفت ___ لمدة عامين، وأعتقد أنها ستكون مغذية تنانين ممتازة لشركة Magic Unicorn Corporation. تتمتع ___ بالقدرة على تذكر ومعالجة كميات كبيرة من المعلومات، وهي مهارة مهمة لمغذي التنانين. تتمتع
___، بصفتها فارسة ماهرة، بفهم عميق لكيفية قتل التنانين وكيفية استخدام نقاط ضعف كل تنين ضدها. وهذا يعني أنها تعرف أنواع الأطعمة التي يحبها كل تنين وأنواع الأطعمة التي تشكل خطورة على كل تنين. ستكون هذه المعرفة والخبرة لا تقدر بثمن أثناء إطعام التنانين.
أنا واثق من أن كفاءة ___ ومهارتها وخبرتها ستجعلها موظفة ممتازة. يرجى الاتصال بي على (___) ___-___ إذا كان لديك أي أسئلة. أتطلع إلى سماع رأيك. مع
أطيب التحيات،
الفارس المحترم
السير جورج

- إخراج نموذج LLaMA الذي يحتوي على 65 مليار معلمة قبل ضبط التعليمات ، مع الأخذ في الاعتبار المطالبة (بالخط العريض) [2]

بنيان

مثل GPT-3، فإن سلسلة Llama من النماذج عبارة عن محولات فك تشفير فقط ، ولكن هناك بعض الاختلافات الطفيفة:

المعلمات الرئيسية لـ Llama 3.1
70 ب 405ب
الطبقات 32 80 126
أبعاد النموذج 4,096 8,192 16,384
أبعاد FFN 14,336 28,672 53,248
انتباه يا رؤساء 32 64 128
رؤوس المفاتيح/القيم 8 8 8
معدل التعلم الأقصى 3 × 10 −4 1.5 × 10 −4 0.8 × 10 −4
وظيفة التنشيط سويجلو
حجم المفردات 128,000
تضمينات موضعية

مجموعات بيانات التدريب

ركز مطورو LLaMA جهودهم على توسيع نطاق أداء النموذج من خلال زيادة حجم بيانات التدريب، بدلاً من عدد المعلمات، معتبرين أن التكلفة المهيمنة على LLMs تأتي من الاستدلال على النموذج المدرب بدلاً من التكلفة الحسابية لعملية التدريب.

تم تدريب نماذج LLaMA 1 الأساسية على مجموعة بيانات تحتوي على 1.4 تريليون رمز، مأخوذة من مصادر بيانات متاحة للجمهور، بما في ذلك: [2]

في 17 أبريل 2023، أطلقت TogetherAI مشروعًا باسم RedPajama لإعادة إنتاج وتوزيع نسخة مفتوحة المصدر من مجموعة بيانات LLaMA. [45] تحتوي مجموعة البيانات على ما يقرب من 1.2 تريليون رمز وهي متاحة للجمهور للتنزيل. [46]

تم تدريب نماذج Llama 2 الأساسية على مجموعة بيانات تحتوي على 2 تريليون رمز مميز. تم تنظيم مجموعة البيانات هذه لإزالة مواقع الويب التي غالبًا ما تكشف عن البيانات الشخصية للأشخاص. كما أنها تزيد من عينات المصادر التي تعتبر جديرة بالثقة. [25] تم ضبط Llama 2 - Chat أيضًا على 27540 زوجًا من الاستجابة السريعة التي تم إنشاؤها لهذا المشروع، والتي كان أداؤها أفضل من مجموعات البيانات الخارجية الأكبر حجمًا ولكن ذات الجودة الأقل. لمواءمة الذكاء الاصطناعي، تم استخدام التعلم التعزيزي مع ردود الفعل البشرية (RLHF) مع مزيج من 1418091 مثالًا من Meta وسبع مجموعات بيانات أصغر. كان متوسط ​​عمق الحوار 3.9 في أمثلة Meta، و3.0 لمجموعات Anthropic Helpful وAnthropic Harmless، و1.0 لخمس مجموعات أخرى، بما في ذلك OpenAI Summarize وStackExchange وما إلى ذلك.

تتكون Llama 3 من بيانات باللغة الإنجليزية بشكل أساسي، مع أكثر من 5% منها بأكثر من 30 لغة أخرى. وقد تمت تصفية مجموعة البيانات الخاصة بها بواسطة مصنف جودة النص، وتم تدريب المصنف بواسطة نص تم تجميعه بواسطة Llama 2. [18]

الكون المثالى

تتوفر نماذج Llama 1 فقط كنماذج أساسية مع التعلم الذاتي الإشراف وبدون ضبط دقيق. تم اشتقاق نماذج Llama 2 - Chat من نماذج Llama 2 الأساسية. على عكس GPT-4 الذي زاد من طول السياق أثناء الضبط الدقيق، فإن Llama 2 وCode Llama - Chat لهما نفس طول السياق وهو 4 آلاف رمز. استخدم الضبط الدقيق الخاضع للإشراف دالة خسارة انحدارية تلقائية مع صفر خسارة الرمز عند مطالبات المستخدم. كان حجم الدفعة 64.

بالنسبة لمحاذاة الذكاء الاصطناعي ، كتب المعلقون البشريون مطالبات ثم قارنوا بين مخرجات نموذجين (بروتوكول ثنائي)، مع إعطاء مستويات الثقة وعلامات السلامة المنفصلة مع حق النقض. تم تدريب نموذجين منفصلين للمكافأة من هذه التفضيلات للسلامة والمساعدة باستخدام التعلم التعزيزي من ردود الفعل البشرية (RLHF). تتمثل المساهمة الفنية الرئيسية في الابتعاد عن الاستخدام الحصري لتحسين السياسة القريبة (PPO) لـ RLHF - تم استخدام تقنية جديدة تعتمد على أخذ العينات الرافضة ، تليها PPO.

كان من المستهدف تحسين اتساق الأدوار المتعددة في الحوارات، للتأكد من احترام "رسائل النظام" (التعليمات الأولية، مثل "تحدث بالفرنسية" و"تصرف مثل نابليون") أثناء الحوار. وقد تم تحقيق ذلك باستخدام تقنية "الاهتمام الشبح" الجديدة أثناء التدريب، والتي تربط التعليمات ذات الصلة بكل رسالة مستخدم جديد ولكنها تزيل دالة الخسارة للرموز في المطالبة (الأجزاء السابقة من الحوار).

التطبيقات

أصدر مركز أبحاث نماذج الأساس التابع لمعهد جامعة ستانفورد للذكاء الاصطناعي المرتكز على الإنسان (HAI) Alpaca، وهي وصفة تدريب تعتمد على نموذج LLaMA 7B الذي يستخدم طريقة "التعليم الذاتي" لضبط التعليمات للحصول على قدرات مماثلة لنموذج OpenAI GPT-3 series text-davinci-003 بتكلفة متواضعة. [47] [48] [49] تمت إزالة ملفات النموذج رسميًا في 21 مارس 2023، بسبب تكاليف الاستضافة ومخاوف السلامة، على الرغم من أن الكود والورقة لا يزالان متاحين عبر الإنترنت للرجوع إليهما. [50] [51] [52]

Meditron هي عائلة من Llama تعتمد على مجموعة من المبادئ التوجيهية السريرية وأوراق PubMed والمقالات. تم إنشاؤها بواسطة باحثين في كلية علوم الكمبيوتر والاتصالات في École Polytechnique Fédérale de Lausanne وكلية الطب بجامعة ييل . تُظهر أداءً متزايدًا على معايير ذات صلة بالطب مثل MedQA وMedMCQA. [53] [54] [55]

استخدمت Zoom برنامج Meta Llama 2 لإنشاء رفيق الذكاء الاصطناعي الذي يمكنه تلخيص الاجتماعات وتقديم نصائح مفيدة للعرض التقديمي والمساعدة في الرد على الرسائل. يعمل هذا الرفيق بالذكاء الاصطناعي من خلال نماذج متعددة، بما في ذلك Meta Llama 2. [56]

ذكرت وكالة رويترز في عام 2024 أن العديد من نماذج المؤسسات الصينية اعتمدت على نماذج اللاما في تدريبها. [57]

لاما.cpp

أصدر مطور البرامج جورجي جيرجانوف llama.cpp كمصدر مفتوح في 10 مارس 2023. إنه إعادة تنفيذ لـ LLaMA في C++ ، مما يسمح للأنظمة التي لا تحتوي على وحدة معالجة رسومية قوية بتشغيل النموذج محليًا. [58] قدم مشروع llama.cpp تنسيق ملف GGUF، وهو تنسيق ثنائي يخزن كل من الموتر والبيانات الوصفية. [59] يركز التنسيق على دعم أنواع التكميم المختلفة، والتي يمكن أن تقلل من استخدام الذاكرة، وتزيد السرعة على حساب دقة النموذج المنخفضة. [60]

تم إنشاء llamafile بواسطة Justine Tunney وهي أداة مفتوحة المصدر تجمع llama.cpp مع النموذج في ملف قابل للتنفيذ واحد. قدم Tunney وآخرون نوى مضاعفة مصفوفة محسّنة جديدة لوحدات المعالجة المركزية x86 وARM، مما أدى إلى تحسين أداء التقييم الفوري لأنواع البيانات الكمية FP16 و8 بت. [61]

جيش

في عام 2024، ورد أن باحثين من أكاديمية العلوم العسكرية التابعة لجيش التحرير الشعبي (أعلى أكاديمية عسكرية في الصين ) طوروا أداة عسكرية باستخدام اللاما، والتي ذكرت Meta Platforms أنها غير مصرح بها بسبب حظر استخدام نموذجها للأغراض العسكرية. [62] [63]

استقبال

يصف موقع Wired إصدار المعلمة 8B من Llama 3 بأنه "ذو قدرات مدهشة" نظرًا لحجمه. [64]

كانت الاستجابة لدمج Meta لـ Llama في Facebook مختلطة، حيث أصيب بعض المستخدمين بالارتباك بعد أن أخبرت Meta AI مجموعة من الآباء أنها لديها طفل. [65]

وفقًا لنسخة الأرباح للربع الرابع من عام 2023، تبنت Meta استراتيجية الأوزان المفتوحة لتحسين سلامة النموذج وسرعة التكرار وزيادة التبني بين المطورين والباحثين، ولتصبح المعيار الصناعي. ومن المقرر إطلاق Llama 5 و6 و7 في المستقبل. [66]

أثار إطلاق نماذج اللاما مناقشات كبيرة حول فوائد ومخاطر إساءة استخدام نماذج الوزن المفتوح. يمكن ضبط مثل هذه النماذج لإزالة الضمانات، ولا سيما من قبل مجرمي الإنترنت، حتى تمتثل للطلبات الضارة. يزعم بعض الخبراء أن النماذج المستقبلية قد تسهل التسبب في الضرر أكثر من الدفاع ضده، على سبيل المثال من خلال تسهيل هندسة الأسلحة البيولوجية المتقدمة نسبيًا دون معرفة متخصصة. وعلى العكس من ذلك، يمكن أن تكون نماذج الوزن المفتوح مفيدة لمجموعة واسعة من الأغراض، بما في ذلك أبحاث السلامة. [67] انتقد رئيس مبادرة المصدر المفتوح ستيفانو مافولي شركة ميتا لوصف اللاما بأنها مفتوحة المصدر ، قائلاً إنها تسبب ارتباكًا بين المستخدمين و"تلوث" المصطلح. [68]

انظر أيضا

  • جي بي تي-4o
  • IBM Granite ، برنامج LLM مفتوح المصدر آخر من إنتاج IBM
  • Mistral AI ، شركة فرنسية للذكاء الاصطناعي مفتوحة المصدر

مراجع

  1. ^ "llama-models/models/llama3_2/LICENSE at main · meta-llama/llama-models · GitHub". GitHub . مؤرشف من الأصل في 2024-09-29 . تم الاسترجاع في 2024-10-20 .
  2. ^ اي بي سي دي توفرون، هوغو؛ لافريل، تيبوت؛ إيزاكارد، غوتييه؛ مارتينيت، كزافييه. لاشو، ماري آن؛ لاكروا، تيموثي؛ روزيير، بابتيست؛ جويال، نعمان؛ هامبرو، اريك. أزهر، فيصل؛ رودريجيز، أوريليان. جولين، أرماند. قبر إدوارد. لامبل، غيوم (2023). “LLaMA: نماذج لغة أساسية مفتوحة وفعالة”. أرخايف : 2302.13971 [cs.CL].
  3. ^ abcd "مقدمة عن LLaMA: نموذج لغوي أساسي كبير يحتوي على 65 مليار معلمة". Meta AI . 24 فبراير 2023. مؤرشف من الأصل في 3 مارس 2023. تم الاسترجاع 16 مارس 2023 .
  4. ^ Knight, Will. "Meta Releases Llama 3.2—and Gives Its AI a Voice". Wired . ISSN  1059-1028 . تم الاسترجاع في 2024-09-25 .
  5. ^ مالك، يوفراج؛ بول، كاتي (25 فبراير 2023). "ميتا تشعل سباق التسلح بالذكاء الاصطناعي في شركات التكنولوجيا الكبرى بنموذج لغوي جديد". رويترز.
  6. ^ abcd Vincent, James (8 March 2023). "تم تسريب نموذج لغة الذكاء الاصطناعي القوي الخاص بـ Meta عبر الإنترنت - ماذا يحدث الآن؟". The Verge . مؤرشف من الأصل في 3 نوفمبر 2023 . تم الاسترجاع 16 مارس 2023 .
  7. ^ ab OpSec Online LLC (21 مارس 2023). "github/dmca - إشعار بالانتهاك المزعوم عبر البريد الإلكتروني". GitHub. مؤرشف من الأصل في 10 أبريل 2023. تم الاسترجاع في 25 مارس 2023 .
  8. ^ ديفيد، إميليا (30 أكتوبر 2023). "رئيس أبحاث الذكاء الاصطناعي في ميتا يريد تغيير ترخيص المصدر المفتوح". The Verge . مؤرشف من الأصل في 14 سبتمبر 2024 . تم الاسترجاع 20 أكتوبر 2024 .
  9. ^ abc "Meta and Microsoft Introduce the Next Generation of LLaMA". Meta . 18 يوليو 2023. مؤرشف من الأصل في 14 سبتمبر 2023 . تم الاسترجاع 21 يوليو 2023 .
  10. ^ "مقدمة عن Llama 3.1: أكثر نماذجنا كفاءة حتى الآن". ai.meta.com . 23 يوليو 2024. مؤرشف من الأصل في 2024-07-23 . تم الاسترجاع 2024-07-23 .
  11. ^ بيترز، جاي؛ فينسنت، جيمس (24 فبراير 2023). "تمتلك ميتا نموذج لغة تعلُّم آلي جديد لتذكيرك بأنها تقوم بالذكاء الاصطناعي أيضًا". ذا فيرج .
  12. ^ "تعرف على مساعدك الجديد: Meta AI، مبني باستخدام Llama 3". Meta . 18 أبريل 2024. مؤرشف من الأصل في 7 أكتوبر 2024 . تم الاسترجاع 20 أكتوبر 2024 .
  13. ^ "فحص القدرات الناشئة في نماذج اللغة الكبيرة". hai.stanford.edu . 13 سبتمبر 2022.
  14. ^ "القصة الداخلية لكيفية بناء ChatGPT من الأشخاص الذين صنعوه". MIT Technology Review . مؤرشف من الأصل في 2023-03-03 . تم الاسترجاع في 2024-10-20 .
  15. ^ راي، تيرنان (23 يناير 2023). "ChatGPT ليس مبتكرًا بشكل خاص، ولا شيء ثوريًا، كما يقول كبير علماء الذكاء الاصطناعي في Meta". ZDNET . مؤرشف من الأصل في 2023-02-17.
  16. ^ Badminton, Nik (13 فبراير 2023). "يان لوكان من Meta حول نماذج اللغة الكبيرة الانحدارية التلقائية (LLMs)". Futurist.com . مؤرشف من الأصل في 22 يوليو 2024 . تم الاسترجاع 20 أكتوبر 2024 .
  17. ^ "يان لوكان على لينكد إن: رأيي الثابت في برامج الماجستير في القانون الحالية (التراجعية التلقائية)". www.linkedin.com . مؤرشف من الأصل في 2024-09-17 . تم الاسترجاع في 2024-10-20 .
  18. ^ abc "مقدمة Meta Llama 3: برنامج LLM الأكثر كفاءة والمتاح بشكل مفتوح حتى الآن". ai.meta.com . 18 أبريل 2024. مؤرشف من الأصل في 2024-05-15 . تم الاسترجاع 2024-04-21 .
  19. ^ "llama". GitHub . مؤرشف من الأصل في 15 مارس 2023 . تم الاسترجاع 16 مارس 2023 .
  20. ^ ab VK, Anirudh (6 مارس 2023). "تسريب لعبة Meta's LLaMA للجمهور، بفضل 4chan". مجلة Analytics India . مؤرشف من الأصل في 26 مارس 2023. تم الاسترجاع في 17 مارس 2023 .
  21. ^ "وفّر عرض النطاق الترددي باستخدام التورنت لتوزيع أكثر كفاءة بواسطة ChristopherKing42 · طلب سحب #73 · facebookresearch/llama". GitHub . مؤرشف من الأصل في 10 أبريل 2023 . تم الاسترجاع في 25 مارس 2023 .
  22. ^ "تنزيل الأوزان من hugging face لمساعدتنا في توفير النطاق الترددي بواسطة Jainam213 · طلب سحب #109 · facebookresearch/llama". GitHub . مؤرشف من الأصل في 21 مارس 2023 . تم الاسترجاع في 17 مارس 2023 .
  23. ^ كوكس، جوزيف (7 مارس 2023). "نموذج اللغة الكبير القوي لفيسبوك يتسرب عبر الإنترنت". نائب . مؤرشف من الأصل في 6 أبريل 2023. استرجاع 17 مارس 2023 .
  24. ^ Willison, Simon (11 March 2023). "نماذج اللغة الكبيرة تمر بلحظة انتشارها المستقر". مدونة Simon Willison . مؤرشف من الأصل في 16 مارس 2023. تم الاسترجاع في 16 مارس 2023 .
  25. ^ abc Touvron, Hugo; Martin, Louis; et al. (18 Jul 2023). "LLaMA-2: Open Foundation and Fine-Tuned Chat Models". arXiv : 2307.09288 [cs.CL].
  26. ^ إدواردز، بينج (2023-07-18). "Meta تطلق LLaMA-2، نموذج الذكاء الاصطناعي المتاح للمصدر والذي يسمح بالتطبيقات التجارية [مُحدَّث]". Ars Technica . مؤرشف من الأصل في 2023-11-07 . تم الاسترجاع في 2023-08-08 .
  27. ^ "مقدمة Code Llama، نموذج لغة كبير متطور للترميز". ai.meta.com . مؤرشف من الأصل في 2024-09-27 . تم الاسترجاع 2024-10-20 .
  28. ^ روزيير، بابتيست؛ جيرينج، جوناس؛ غلويكل، فابيان؛ سوتلا، ستين؛ جات، إيتاي؛ تان، شياو تشينغ إلين؛ آدي، يوسي؛ ليو، جينجيو؛ سوفستر، رومان (2024-01-31). "Code Llama: نماذج الأساس المفتوحة للكود". arXiv : 2308.12950 [cs.CL].
  29. ^ Wiggers, Kyle (18 أبريل 2024). "Meta releases Llama 3, claims it's among the best open models available". TechCrunch . مؤرشف من الأصل في 18 سبتمبر 2024 . تم الاسترجاع 20 أكتوبر 2024 .
  30. ^ مان، توبياس (19 أبريل 2024). "Meta debuts third-generation Llama large language model". The Register . مؤرشف من الأصل في 25 أغسطس 2024 . تم الاسترجاع في 20 أكتوبر 2024 .
  31. ^ باتيل، دواركيش (2024-07-24). "مارك زوكربيرج - لاما 3، نماذج مفتوحة المصدر بقيمة 10 مليارات دولار، وقيصر أوغسطس". www.dwarkeshpatel.com . مؤرشف من الأصل في 2024-07-16 . تم الاسترجاع 2024-08-01 . إن 8 مليارات دولار تكاد تكون بنفس قوة أكبر نسخة من لاما 2 التي أصدرناها [...] حتى في النهاية، كانت... لا تزال تتعلم بشكل صحيح، يبدو الأمر وكأننا ربما كان بإمكاننا إطعامها المزيد من الرموز وكان من الممكن أن تتحسن إلى حد ما، لكنني أعني أنه في مرحلة ما، كما تعلم أنك تدير شركة، تحتاج إلى القيام بهذه الأسئلة المنطقية [...] كيف أريد أن أنفق وحدات معالجة الرسومات الخاصة بنا
  32. ^ أب دوبي، أبهيمانيو؛ جوهري، ابهيناف؛ باندي، ابهيناف؛ كاديان، ابهيشيك؛ الدحل، أحمد؛ ليتمان، عائشة؛ ماثور، أخيل؛ شيلتن ، آلان. يانغ، إيمي (31/07/2024)، قطيع النماذج من اللاما 3 ، أرخايف : 2407.21783
  33. ^ "هبط الصقر في نظام Hugging Face البيئي". huggingface.co . مؤرشف من الأصل في 2023-06-20 . تم الاسترجاع 2023-06-20 .
  34. ^ "llama/MODEL_CARD.md at main · meta-llama/llama". GitHub . مؤرشف من الأصل في 2024-05-28 . تم الاسترجاع في 2024-05-28 .
  35. ^ "Andrej Karpathy (18 أبريل 2024)، تحتوي بطاقة النموذج على بعض المعلومات الأكثر إثارة للاهتمام أيضًا". مؤرشف من الأصل في 17 أغسطس 2024. تم الاسترجاع في 20 أكتوبر 2024 .
  36. ^ "llama3/MODEL_CARD.md at main · meta-llama/llama3". GitHub . مؤرشف من الأصل في 2024-05-21 . تم الاسترجاع في 2024-05-28 .
  37. ^ "llama-models/models/llama3_1/MODEL_CARD.md at main · meta-llama/llama-models". GitHub . مؤرشف من الأصل في 2024-07-23 . تم الاسترجاع في 2024-07-23 .
  38. ^ روبيسون، كايلي (2024-09-25). "Meta تطلق أول نموذج مفتوح للذكاء الاصطناعي يمكنه معالجة الصور". The Verge . تم الاسترجاع في 2024-09-25 .
  39. ^ Wiggers, Kyle (2024-09-25). "نماذج الذكاء الاصطناعي الخاصة بـ Meta's Llama تصبح متعددة الوسائط". TechCrunch . مؤرشف من الأصل في 2024-09-25 . تم الاسترجاع في 2024-09-25 .
  40. ^ "نسخة مؤرشفة". ai.meta.com . مؤرشفة من الأصل في 2024-09-25 . تم استرجاعها في 2024-09-26 .{{cite web}}:CS1 maint: نسخة مؤرشفة كعنوان ( رابط )
  41. ^ Shazeer, Noam (2020-02-01). "GLU Variants Improve Transformer". arXiv : 2002.05202 [cs.CL].
  42. ^ سو جيان لين. لو، يو؛ عموم، شينغفنغ. مرتضى، أحمد؛ ون، بو؛ ليو ، يونفينج (2021-04-01). “RoFormer: محول محسّن مع تضمين موضع دوار”. أرخايف : 2104.09864 [cs.CL].
  43. ^ Zhang, Biao; Sennrich, Rico (2019-10-01). "تطبيع طبقة الجذر المتوسط ​​التربيعي". arXiv : 1910.07467 [cs.LG].
  44. ^ لي با، جيمي؛ كيروس، جيمي رايان؛ هينتون، جيفري إي. (2016-07-01). "تطبيع الطبقة". arXiv : 1607.06450 [stat.ML].
  45. ^ "RedPajama-Data: وصفة مفتوحة المصدر لإعادة إنتاج مجموعة بيانات تدريب LLaMA". GitHub . Together. مؤرشف من الأصل في 7 نوفمبر 2023. تم الاسترجاع في 4 مايو 2023 .
  46. ^ "RedPajama-Data-1T". وجه معانق . معًا. مؤرشف من الأصل في 3 نوفمبر 2023. استرجاع 4 مايو 2023 .
  47. ^ تاوري، روهان؛ جولراجاني، إيشان؛ تشانغ، تيان يي؛ دوبوا، يان؛ لي، شيوتشين؛ جوسترين، كارلوس؛ ليانغ، بيرسي؛ هاشيموتو، تاتسونوري ب. (13 مارس 2023). "الألبكة: نموذج قوي وقابل للتكرار لتتبع التعليمات". مركز ستانفورد للأبحاث حول نماذج الأساس. مؤرشف من الأصل في 6 أبريل 2023.
  48. ^ وانغ، ييزونغ؛ كوردي، ييجانه؛ ميشرا، سواروب؛ ليو، أليسا؛ سميث، نوح أ؛ خشابي، دانيال؛ هاجيشيرزي، حنانه (2022). "التعليم الذاتي: محاذاة نماذج اللغة مع التعليمات المولدة ذاتيًا". arXiv : 2212.10560 [cs.CL].
  49. ^ "Stanford CRFM". crfm.stanford.edu . مؤرشف من الأصل في 2023-04-06 . تم الاسترجاع 2023-03-20 .
  50. ^ Quach, Katyanna. "ستانفورد تزيل نموذج الذكاء الاصطناعي المكلف والمحفوف بالمخاطر من على شبكة الإنترنت". www.theregister.com .
  51. ^ "باحثون في جامعة ستانفورد يبطلون الذكاء الاصطناعي للألباكا بسبب التكلفة والهلوسة". جيزمودو . 21 مارس 2023. مؤرشف من الأصل في 12 مايو 2024. تم الاسترجاع 20 أكتوبر 2024 .
  52. ^ "alpaca-lora". GitHub . مؤرشف من الأصل في 4 أبريل 2023 . تم الاسترجاع 5 أبريل 2023 .
  53. ^ "Meditron: مجموعة LLM للإعدادات الطبية ذات الموارد المنخفضة التي تستفيد من Meta Llama". ai.meta.com .
  54. ^ بيترسن، تانيا (28 نوفمبر 2023). "نموذج اللغة الكبير الجديد للمعرفة الطبية في EPFL". مؤرشف من الأصل في 17 سبتمبر 2024. تم الاسترجاع 20 أكتوبر 2024 .
  55. ^ "epfLLM/meditron". epfLLM. 11 مايو 2024. مؤرشف من الأصل في 27 سبتمبر 2024 . تم الاسترجاع 20 أكتوبر 2024 .
  56. ^ "كيف تستخدم الشركات Meta Llama". Meta . 7 مايو 2024. مؤرشف من الأصل في 27 سبتمبر 2024. تم الاسترجاع 20 أكتوبر 2024 .
  57. ^ "ما مدى اعتماد الصين على تكنولوجيا الذكاء الاصطناعي الأمريكية؟". رويترز . 9 مايو 2024.
  58. ^ إدواردز، بينج (2023-03-13). "يمكنك الآن تشغيل نموذج ذكاء اصطناعي بمستوى GPT-3 على الكمبيوتر المحمول والهاتف وRaspberry Pi". Ars Technica . مؤرشف من الأصل في 2024-01-09 . تم الاسترجاع 2024-01-04 .
  59. ^ "GGUF". huggingface.co . تم الاسترجاع في 9 مايو 2024 .
  60. ^ لابون، ماكسيم (29 نوفمبر 2023). "Quantize Llama models with GGUF and llama.cpp". Medium . نحو علم البيانات. مؤرشف من الأصل في 9 مايو 2024 . تم الاسترجاع في 9 مايو 2024 .
  61. ^ Connatser, Matthew. "مشروع برنامج تشغيل Llamafile LLM يعزز الأداء على نوى وحدة المعالجة المركزية". www.theregister.com . مؤرشف من الأصل في 10 مايو 2024 . تم الاسترجاع في 10 مايو 2024 .
  62. ^ Cheung, Sunny (31 أكتوبر 2024). "جمهورية الصين الشعبية تتكيف مع لاما ميتا لتطبيقات الذكاء الاصطناعي العسكرية والأمنية". مؤسسة جيمستاون . تم الاسترجاع في 2024-11-03 .
  63. ^ بومفريت، جيمس؛ بانج، جيسي (1 نوفمبر 2024). "باحثون صينيون يطورون نموذجًا للذكاء الاصطناعي للاستخدام العسكري على ظهر لاما ميتا". رويترز . تم الاسترجاع في 1 نوفمبر 2024 .
  64. ^ Knight, Will. "Meta's Open Source Llama 3 Is Already Nipping at OpenAI's Heels". Wired . مؤرشف من الأصل في 2024-09-27 . تم الاسترجاع في 2024-10-20 .
  65. ^ "عملاء الذكاء الاصطناعي المعززين من Meta يربكون مستخدمي Facebook". ABC News . 19 أبريل 2024. مؤرشف من الأصل في 2024-09-17 . تم الاسترجاع 2024-10-20 .
  66. ^ "نسخة مؤرشفة" (PDF) . مؤرشفة (PDF) من الأصل في 2024-09-17 . تم استرجاعها في 2024-10-20 .{{cite web}}:CS1 maint: نسخة مؤرشفة كعنوان ( رابط )
  67. ^ Knight, Will. "نموذج الذكاء الاصطناعي الجديد Llama 3.1 من Meta مجاني وقوي ومحفوف بالمخاطر". Wired . ISSN  1059-1028. مؤرشف من الأصل في 2024-08-03 . تم الاسترجاع في 2024-08-04 .
  68. ^ واترز، ريتشارد (17 أكتوبر 2024). "ميتا تحت النار بسبب "تلويثها" للبرمجيات مفتوحة المصدر". فاينانشال تايمز .

قراءة إضافية

  • هوانغ، كالي؛ أوريغان، سيلفيا فارنهام (5 سبتمبر 2023). "Inside Meta's AI Drama: Internal Feuds Over Compute Power" . The Information . مؤرشف من الأصل في 5 سبتمبر 2023 . تم الاسترجاع في 6 سبتمبر 2023 .
  • الموقع الرسمي
  • منظمة Hugging Face الرسمية لنماذج Llama وLlama Guard وPrompt Guard
تم الاسترجاع من "https://en.wikipedia.org/w/index.php?title=Llama_(language_model)&oldid=1259657794"
Original text
Rate this translation
Your feedback will be used to help improve Google Translate