Word2vec

Word2vec هي تقنية في معالجة اللغة الطبيعية تُستخدم للحصول على تمثيلات متجهة للكلمات. تُجسّد هذه المتجهات معلومات حول معنى الكلمة بناءً على الكلمات المحيطة بها. تُقدّر خوارزمية Word2vec هذه التمثيلات من خلال نمذجة نص في مجموعة كبيرة من النصوص . بعد التدريب، يُمكن لهذا النموذج اكتشاف الكلمات المترادفة أو اقتراح كلمات إضافية لجزء من الجملة. طُوّرت Word2vec بواسطة توماش ميكولوف ، وكاي تشين، وجريج كورادو، وإيليا سوتسكيفر ، وجيف دين في جوجل، ونُشرت عام 2013. [ 1 ] [ 2 ]

يمثل Word2vec الكلمة كمتجه رقمي عالي الأبعاد، يجسد العلاقات بين الكلمات. على وجه الخصوص، تُربط الكلمات التي تظهر في سياقات متشابهة بمتجهات متقاربة، وفقًا لمقياس تشابه جيب التمام . يشير هذا إلى مستوى التشابه الدلالي بين الكلمات، فعلى سبيل المثال، متجهات كلمتي walk و ran متقاربة، وكذلك متجهات كلمتي but و however، ومتجهات كلمتي Berlin و Germany.

يقترب

Word2vec عبارة عن مجموعة من النماذج المترابطة التي تُستخدم لإنتاج تمثيلات الكلمات . هذه النماذج عبارة عن شبكات عصبية سطحية ثنائية الطبقات، مُدرَّبة على إعادة بناء السياقات اللغوية للكلمات. يستقبل Word2vec كمدخلات مجموعة كبيرة من النصوص ، ويُنتج خريطة لمجموعة الكلمات إلى فضاء متجهي ، عادةً ما يكون ذا مئات الأبعاد ، حيث تُخصَّص لكل كلمة فريدة في المجموعة متجه في هذا الفضاء.

يستطيع Word2vec استخدام أحد نموذجين معماريين لإنتاج هذه التمثيلات الموزعة للكلمات: نموذج الحقيبة المتصلة للكلمات (CBOW) أو نموذج Skip-gram المنزلق باستمرار. في كلا النموذجين، يأخذ Word2vec في الاعتبار الكلمات الفردية ونافذة السياق المنزلقة أثناء معالجته لمجموعة النصوص.

يمكن اعتبار اختبار CBOW بمثابة مهمة "ملء الفراغات"، حيث يمثل تمثيل الكلمة كيفية تأثيرها على الاحتمالات النسبية للكلمات الأخرى في نافذة السياق. ينبغي أن تؤثر الكلمات المتشابهة دلاليًا على هذه الاحتمالات بطرق متشابهة، لأن الكلمات المتشابهة دلاليًا تُستخدم في سياقات متشابهة. لا يؤثر ترتيب كلمات السياق على التنبؤ (افتراض نموذج حقيبة الكلمات).

في بنية Skip-gram المستمرة، يستخدم النموذج الكلمة الحالية للتنبؤ بنافذة الكلمات السياقية المحيطة بها. [ 1 ] [ 2 ] تُعطي بنية Skip-gram وزنًا أكبر للكلمات السياقية القريبة مقارنةً بالكلمات السياقية البعيدة. ووفقًا لملاحظة المؤلفين، [ 3 ] فإن CBOW أسرع، بينما تُؤدي Skip-gram أداءً أفضل مع الكلمات غير المتكررة.

بعد تدريب النموذج، تُوضع تمثيلات الكلمات المُستخلصة في فضاء المتجهات بحيث تتقارب الكلمات التي تشترك في سياقات مشتركة في المدونة - أي الكلمات المتشابهة دلاليًا ونحويًا - في هذا الفضاء. [ 1 ] أما الكلمات الأقل تشابهًا فتتباعد في هذا الفضاء. [ 1 ]

التفاصيل الرياضية

يعتمد هذا القسم على الشروحات. [ 4 ] [ 5 ]

المدونة هي سلسلة من الكلمات. كل من CBOW و skip-gram هما طريقتان لتعلم متجه واحد لكل كلمة تظهر في المدونة.

يتركV{\displaystyle V}(المفردات) هي مجموعة جميع الكلمات التي تظهر في المدونةج{\displaystyle C}هدفنا هو تعلم متجه واحدvwRد{\displaystyle v_{w}\in \mathbb {R} ^{d}}لكل كلمةwV{\displaystyle w\in V}.

تعتمد فكرة نموذج Skip-gram على أن يكون متجه الكلمة قريبًا من متجه كل كلمة مجاورة لها. أما فكرة نموذج CBOW فتعتمد على أن يكون مجموع متجهات الكلمات المجاورة للكلمة قريبًا من متجه الكلمة نفسها.

نموذج الكلمات المتصلة (CBOW)

نموذج حقيبة الكلمات المتصلة (CBOW)
رسم توضيحي لنموذج CBOW كشبكة عصبية

تعتمد فكرة CBOW على تمثيل كل كلمة بمتجه، بحيث يكون من الممكن التنبؤ بالكلمة باستخدام مجموع متجهات جيرانها. تحديدًا، لكل كلمةwأنا{\displaystyle w_{i}}في مجموعة النصوص، يُستخدم ترميز الكلمة أحادي الترميز كمدخل للشبكة العصبية. أما مخرج الشبكة العصبية فهو توزيع احتمالي على القاموس، يمثل تنبؤًا بالكلمات الفردية في جوارها.wأنا{\displaystyle w_{i}}الهدف من التدريب هو تحقيق أقصى قدر من الكفاءةأناlnبرو(wأنا|wأنا+ج:جشمال){\displaystyle \sum _{i}\ln \Pr(w_{i}\mid w_{i+j}\colon j\in N)}أينشمال{\displaystyle N}هي مجموعة من المؤشرات (غير الصفرية) التي تمثل المواقع النسبية للكلمات القريبة التي تعتبر فيwأنا{\displaystyle w_{i}}حيّها.

على سبيل المثال، إذا أردنا أن يتم التنبؤ بكل كلمة في المدونة من خلال كل كلمة أخرى ضمن نطاق صغير من 4 كلمات، فإن مجموعة المؤشرات النسبية للكلمات المجاورة ستكون كالتالي:شمال={-2،-1،+1،+2}{\displaystyle N=\{-2,-1,+1,+2\}}والهدف هو تحقيق أقصى قدر منأناlnبرو(wأنا|wأنا-2،wأنا-1،wأنا+1،wأنا+2){\displaystyle \sum _{i}\ln \Pr(w_{i}\mid w_{i-2},w_{i-1},w_{i+1},w_{i+2})}.

في نموذج "حقيبة الكلمات" القياسي، يُعبَّر عن سياق الكلمة بعدد الكلمات المجاورة لها (أو ما يُعرف بمخطط الكلمات ). على سبيل المثال، تُمثَّل كلمة "sat" في جملة "the cat sat on the mat" بالصيغة {"the": 2, "cat": 1, "on": 1}. لاحظ أن الكلمة الأخيرة "mat" لا تُستخدم لتمثيل "sat"، لأنها خارج نطاق الكلمات المجاورة.شمال={-2،-1،+1،+2}{\displaystyle N=\{-2,-1,+1,+2\}}.

في نموذج "حقيبة الكلمات" المتصلة، يتم ضرب المدرج التكراري بمصفوفة.V{\displaystyle V}للحصول على تمثيل متصل لسياق الكلمة. المصفوفةV{\displaystyle V}يُطلق عليه أيضًا اسم قاموس . أعمدته هي متجهات الكلمات.د{\displaystyle D}الأعمدة، حيثد{\displaystyle D}حجم القاموس. ليكند{\displaystyle d}ليكن طول كل متجه كلمة. لديناVRد×د{\displaystyle V\in \mathbb {R} ^{d\times D}}.

على سبيل المثال، ضرب الرسم البياني للكلمات {"the": 2, "cat": 1, "on": 1} بـV{\displaystyle V}، نحصل2vال+vقطة+vعلى{\displaystyle 2v_{\text{the}}+v_{\text{cat}}+v_{\text{on}}}.

ثم يتم ضرب هذا بمصفوفة أخرىV{\displaystyle V'}شكلRد×د{\displaystyle \mathbb {R} ^{D\times d}}كل صف منها عبارة عن متجه كلمةv{\displaystyle v'}ينتج عن ذلك متجه بطولد{\displaystyle D}، مدخل واحد لكل مدخل في القاموس. ثم، يتم تطبيق دالة softmax للحصول على توزيع احتمالي على القاموس.

يمكن تصور هذا النظام كشبكة عصبية، تشبه في جوهرها المشفر التلقائي ، ذات بنية خطية-خطية- سوفتماكس ، كما هو موضح في الرسم التخطيطي. يتم تدريب النظام باستخدام خوارزمية التدرج الهبوطي لتقليل خسارة الإنتروبيا المتقاطعة .

في الصيغة الكاملة، تكون خسارة الإنتروبيا المتقاطعة كما يلي:-أناlnهـvwأنا(جشمالvwج+أنا)wهـvw(جشمالvwج+أنا){\displaystyle -\sum _{i}\ln {\frac {e^{v_{w_{i}}'\cdot (\sum _{j\in N}v_{w_{j+i}})}}{\sum _{w'}e^{v_{w'}'\cdot (\sum _{j\in N}v_{{w'}_{j+i}})}}}}حيث المجموع الخارجيأنا{\displaystyle \sum _{i}}يتعلق الأمر بالكلمات في مجموعة النصوص، الكميةجشمالvwج+أنا{\displaystyle \sum _{j\in N}v_{w_{j+i}}}هو مجموع متجهات جيران الكلمة، إلخ.

بمجرد تدريب هذا النظام، نحصل على مصفوفتين مدربتين.V،V{\displaystyle V,V'}إما متجهات الأعمدة لـV{\displaystyle V}أو متجهات الصفوف لـV{\displaystyle V'}يمكن أن تُستخدم كقاموس. على سبيل المثال، يمكن تمثيل كلمة "sat" إما بالعمود رقم "sat" منV{\displaystyle V}أو الصف "السبت" منV{\displaystyle V'}من الممكن أيضًا تعريفها ببساطةV=V{\displaystyle V'=V^{\top }}وفي هذه الحالة لن يكون هناك خيار بعد الآن.

سكيب غرام

سكيب غرام

تتمثل فكرة skip-gram في تمثيل كل كلمة بمتجه، بحيث يكون من الممكن التنبؤ بمتجهات جيرانها باستخدام متجه الكلمة.

لا تزال البنية خطية-خطية-سوفتماكس، كما هو الحال في CBOW، ولكن تم تبديل المدخلات والمخرجات. تحديدًا، لكل كلمةwأنا{\displaystyle w_{i}}في مجموعة النصوص، يُستخدم ترميز الكلمة أحادي الترميز كمدخل للشبكة العصبية. أما مخرج الشبكة العصبية فهو توزيع احتمالي على القاموس، يمثل تنبؤًا بالكلمات الفردية في جوارها.wأنا{\displaystyle w_{i}}الهدف من التدريب هو تحقيق أقصى قدر من الكفاءةأناجشمالlnبرو(wج+أنا|wأنا){\displaystyle \sum _{i}\sum _{j\in N}\ln \Pr(w_{j+i}\mid w_{i})}.

الصيغة الكاملة لدالة الخسارة هي-أناجشمالlnهـvwج+أناvwأناwهـvwvwأنا{\displaystyle -\sum _{i}\sum _{j\in N}\ln {\frac {e^{v_{w_{j+i}}'\cdot v_{w_{i}}}}{\sum _{w'}e^{v_{w'}'\cdot v_{w_{i}}}}}}كما هو الحال مع CBOW، بمجرد تدريب هذا النظام، نحصل على مصفوفتين مدربتين.V،V{\displaystyle V,V'}إما متجهات الأعمدة لـV{\displaystyle V}أو متجهات الصفوف لـV{\displaystyle V'}يمكن استخدامه كقاموس. ومن الممكن أيضًا تعريفه ببساطةV=V{\displaystyle V'=V^{\top }}وفي هذه الحالة لن يكون هناك خيار بعد الآن.

في الأساس، تتشابه خوارزمية skip-gram وخوارزمية CBOW تمامًا في بنيتها. ويكمن الاختلاف الوحيد بينهما في دالة الهدف أثناء التدريب.

تاريخ

خلال ثمانينيات القرن العشرين، كانت هناك بعض المحاولات المبكرة لاستخدام الشبكات العصبية لتمثيل الكلمات والمفاهيم كمتجهات. [ 6 ] [ 7 ] [ 8 ]

في عام 2010، قام توماش ميكولوف (الذي كان يعمل آنذاك في جامعة برنو للتكنولوجيا ) مع مؤلفين مشاركين بتطبيق شبكة عصبية متكررة بسيطة ذات طبقة مخفية واحدة على نمذجة اللغة. [ 9 ]

تم ابتكار Word2vec، وحصل على براءة اختراع، [ 10 ] ونُشر في عام 2013 بواسطة فريق من الباحثين بقيادة ميكولوف في جوجل ، وذلك من خلال ورقتين بحثيتين. [ 1 ] [ 2 ] رُفضت الورقة البحثية الأصلية من قبل المحكمين في مؤتمر ICLR لعام 2013. كما استغرق الأمر شهورًا للموافقة على نشر الكود كمصدر مفتوح. [ 11 ] ساهم باحثون آخرون في تحليل الخوارزمية وشرحها. [ 4 ]

تتمتع متجهات التضمين المُنشأة باستخدام خوارزمية Word2vec ببعض المزايا مقارنةً بالخوارزميات السابقة [ 1 ] ، مثل تلك التي تستخدم نماذج n-gram والتحليل الدلالي الكامن . طُوِّرت خوارزمية GloVe من قِبَل فريق في جامعة ستانفورد خصيصًا كمنافس لها، وقد أشارت الورقة البحثية الأصلية إلى تحسينات عديدة لـ GloVe مقارنةً بـ Word2vec. [ 12 ] جادل ميكولوف بأن المقارنة غير عادلة لأن GloVe دُرِّبت على بيانات أكثر، وأن مشروع fastText أظهر تفوق Word2vec عند تدريبها على نفس البيانات. [ 13 ] [ 11 ]

في عام 2022، وُصفت طريقة Word2vec المباشرة بأنها "قديمة". أما النماذج القائمة على Transformer ، مثل ELMo و BERT ، والتي تضيف طبقات انتباه متعددة للشبكات العصبية فوق نموذج تضمين الكلمات المشابه لـ Word2vec، فقد أصبحت تُعتبر أحدث ما توصلت إليه تقنيات معالجة اللغة الطبيعية. [ 14 ]

تحديد المعلمات

قد تتأثر نتائج تدريب نموذج word2vec بالمعلمات المستخدمة . فيما يلي بعض المعلمات المهمة في تدريب نموذج word2vec.

خوارزمية التدريب

يمكن تدريب نموذج word2vec باستخدام دالة softmax الهرمية و/أو أخذ العينات السلبية. لتقريب دالة الاحتمال الشرطي التي يسعى النموذج إلى تعظيمها، تستخدم دالة softmax الهرمية شجرة هوفمان لتقليل العمليات الحسابية. أما دالة أخذ العينات السلبية، فتتعامل مع مشكلة التعظيم عن طريق تقليل دالة الاحتمال للحالات السلبية المأخوذة كعينة. ووفقًا للمؤلفين، فإن دالة softmax الهرمية تعمل بشكل أفضل مع الكلمات غير المتكررة، بينما تعمل دالة أخذ العينات السلبية بشكل أفضل مع الكلمات المتكررة ومع المتجهات منخفضة الأبعاد. [ 3 ] ومع ازدياد عدد دورات التدريب، تفقد دالة softmax الهرمية جدواها. [ 15 ]

أخذ عينات فرعية

غالباً ما لا توفر الكلمات عالية التردد والكلمات منخفضة التردد معلومات كافية. ويمكن تقليل عدد الكلمات التي يزيد ترددها عن عتبة معينة، أو يقل عن عتبة معينة، أو إزالتها لتسريع عملية التدريب. [ 16 ]

الأبعاد

تتحسن جودة تمثيل الكلمات مع زيادة الأبعاد، ولكن بعد الوصول إلى حد معين، يتضاءل التحسن الطفيف. [ 1 ] عادةً، يتم ضبط أبعاد المتجهات بين 100 و1000.

نافذة السياق

يُحدد حجم نافذة السياق عدد الكلمات التي تسبق كلمة معينة وتليها، والتي تُعتبر كلمات سياقية لها. ووفقًا لملاحظة المؤلفين، فإن القيمة الموصى بها هي 10 لنموذج skip-gram و5 لنموذج CBOW. [ 3 ]

الإضافات

توجد مجموعة متنوعة من الإضافات لـ word2vec.

doc2vec

تُنشئ مكتبة doc2vec تمثيلات موزعة لأجزاء نصية متغيرة الطول ، مثل الجمل أو الفقرات أو المستندات الكاملة. [ 17 ] [ 18 ] وقد تم تطبيق doc2vec في أدوات C و Python و Java / Scala (انظر أدناه)، كما تدعم إصدارات Java وPython استنتاج تضمينات المستندات على مستندات جديدة غير مرئية.

يُقدّر نموذج doc2vec التمثيلات الموزعة للمستندات بطريقة مشابهة لكيفية تقدير نموذج word2vec لتمثيلات الكلمات: يستخدم doc2vec أحد نموذجين معماريين، وكلاهما يُشابه النموذج المستخدم في word2vec. النموذج الأول، وهو نموذج الذاكرة الموزعة لمتجهات الفقرات (PV-DM)، مطابق لنموذج CBOW باستثناء أنه يُضيف مُعرّفًا فريدًا للمستند كجزء من السياق الإضافي. أما النموذج الثاني، وهو نموذج حقيبة الكلمات الموزعة لمتجه الفقرات (PV-DBOW)، فهو مطابق لنموذج skip-gram باستثناء أنه يُحاول التنبؤ بنافذة كلمات السياق المحيطة من مُعرّف الفقرة بدلاً من الكلمة الحالية. [ 17 ]

يتمتع برنامج doc2vec أيضًا بالقدرة على استخلاص المعاني الدلالية لسياقات إضافية تحيط بالكلمات؛ إذ يمكنه تقدير التمثيلات الدلالية للمتحدثين أو سماتهم، والمجموعات، والفترات الزمنية. على سبيل المثال، استُخدم doc2vec لتقدير المواقف السياسية للأحزاب في مختلف مجالس الكونغرس والبرلمانات في الولايات المتحدة والمملكة المتحدة، [ 19 ] على التوالي، وفي مؤسسات حكومية مختلفة. [ 20 ]

top2vec

يُعدّ top2vec امتدادًا آخر لـ word2vec، حيث يستفيد من تضمينات كلٍّ من المستندات والكلمات لتقدير تمثيلات موزعة للمواضيع. [ 21 ] [ 22 ] يأخذ top2vec تضمينات المستندات المُستخلصة من نموذج doc2vec ويُقلّلها إلى بُعد أقل (عادةً باستخدام UMAP ). ثمّ يتمّ مسح فضاء المستندات باستخدام HDBSCAN ، [ 23 ] ويتمّ العثور على مجموعات من المستندات المتشابهة. بعد ذلك، يُعتبر مركز المستندات المُحدّدة في مجموعة ما هو متجه موضوع تلك المجموعة. أخيرًا، يبحث top2vec في الفضاء الدلالي عن تضمينات الكلمات القريبة من متجه الموضوع لتحديد "معنى" الموضوع. [ 21 ] قد يتمّ تعيين الكلمة ذات التضمينات الأكثر تشابهًا مع متجه الموضوع كعنوان للموضوع، بينما قد تُعتبر تضمينات الكلمات البعيدة غير ذات صلة.

على عكس نماذج المواضيع الأخرى مثل LDA ، يوفر top2vec مقاييس "المسافة" المعيارية بين موضوعين، أو بين موضوع وتمثيلات أخرى (كلمات، مستندات، أو غير ذلك). وبالاستعانة بنتائج HDBSCAN، يمكن للمستخدمين إنشاء تسلسلات هرمية للمواضيع، أو مجموعات من المواضيع والمواضيع الفرعية ذات الصلة.

علاوة على ذلك، يمكن للمستخدم استخدام نتائج دالة top2vec لاستنتاج مواضيع المستندات غير النموذجية. بعد استنتاج تمثيل التضمين لمستند جديد، يكفي البحث في فضاء المواضيع عن أقرب متجه موضوعي.

بيوفيكتورز

اقترح أسغاري ومفرد امتدادًا لمتجهات الكلمات لـ n-grams في التسلسلات البيولوجية (مثل الحمض النووي DNA ، والحمض النووي الريبي RNA ، والبروتينات ) لتطبيقات المعلوماتية الحيوية . [ 24 ] يُطلق على هذا الامتداد اسم المتجهات الحيوية ( BioVec ) للإشارة إلى التسلسلات البيولوجية بشكل عام، مع استخدام متجهات البروتين (ProtVec) للبروتينات (تسلسلات الأحماض الأمينية) ومتجهات الجينات (GeneVec) لتسلسلات الجينات. يمكن استخدام هذا التمثيل على نطاق واسع في تطبيقات التعلم الآلي في علم البروتينات وعلم الجينوم. تشير النتائج إلى أن المتجهات الحيوية قادرة على توصيف التسلسلات البيولوجية من حيث التفسيرات البيوكيميائية والبيوفيزيائية للأنماط الكامنة. [ 24 ] وقد أظهر متغير مشابه، dna2vec، وجود ارتباط بين درجة تشابه نييدلمان-وونش وتشابه جيب التمام لمتجهات كلمات dna2vec. [ 25 ]

علم الأشعة وتضمين الكلمات الذكي (IWE)

اقترح بانيرجي وآخرون [ 26 ] امتدادًا لمتجهات الكلمات لإنشاء تمثيل متجهي كثيف لتقارير الأشعة غير المنظمة. يتمثل أحد أكبر التحديات التي تواجه Word2vec في كيفية التعامل مع الكلمات غير المعروفة أو الخارجة عن نطاق المفردات (OOV) والكلمات المتشابهة صرفيًا. إذا لم يصادف نموذج Word2vec كلمة معينة من قبل، فسيُضطر إلى استخدام متجه عشوائي، وهو عادةً ما يكون بعيدًا عن التمثيل الأمثل. قد يُمثل هذا مشكلة خاصة في مجالات مثل الطب، حيث يمكن استخدام المرادفات والكلمات ذات الصلة اعتمادًا على الأسلوب المُفضل لأخصائي الأشعة، وقد تكون الكلمات نادرة الاستخدام في مجموعة كبيرة من النصوص.

يجمع نموذج IWE بين تقنية Word2vec وتقنية رسم خرائط القاموس الدلالي لمعالجة التحديات الرئيسية لاستخلاص المعلومات من النصوص السريرية، والتي تشمل غموض أسلوب السرد الحر، والاختلافات المعجمية، واستخدام عبارات غير نحوية ومختصرة، والترتيب العشوائي للكلمات، وكثرة استخدام الاختصارات والمختصرات. ومن الجدير بالذكر أن نموذج IWE (الذي تم تدريبه على مجموعة بيانات مؤسسية واحدة) نجح في الانتقال إلى مجموعة بيانات مؤسسية أخرى، مما يدل على قابلية تعميم جيدة لهذا النهج عبر المؤسسات.

تحليل

The reasons for successful word embedding learning in the word2vec framework are poorly understood. Goldberg and Levy point out that the word2vec objective function causes words that occur in similar contexts to have similar embeddings (as measured by cosine similarity) and note that this is in line with J. R. Firth's distributional hypothesis. However, they note that this explanation is "very hand-wavy" and argue that a more formal explanation would be preferable.[4]

Levy et al. (2015)[27] show that much of the superior performance of word2vec or similar embeddings in downstream tasks is not a result of the models per se, but of the choice of specific hyperparameters. Transferring these hyperparameters to more 'traditional' approaches yields similar performances in downstream tasks. Arora et al. (2016)[28] explain word2vec and related algorithms as performing inference for a simple generative model for text, which involves a random walk generation process based upon loglinear topic model. They use this to explain some properties of word embeddings, including their use to solve analogies.

Preservation of semantic and syntactic relationships

توضيح مرئي لتضمينات الكلمات
Visual illustration of word embeddings

The word embedding approach is able to capture multiple different degrees of similarity between words. Mikolov et al. (2013)[29] found that semantic and syntactic patterns can be reproduced using vector arithmetic. Patterns such as "Man is to Woman as Brother is to Sister" can be generated through algebraic operations on the vector representations of these words such that the vector representation of "Brother" - "Man" + "Woman" produces a result which is closest to the vector representation of "Sister" in the model. Such relationships can be generated for a range of semantic relations (such as Country–Capital) as well as syntactic relations (e.g. present tense–past tense).

This facet of word2vec has been exploited in a variety of other contexts. For example, word2vec has been used to map a vector space of words in one language to a vector space constructed from another language. Relationships between translated words in both spaces can be used to assist with machine translation of new words.[30]

Assessing the quality of a model

طوّر ميكولوف وآخرون (2013) [ 1 ] منهجًا لتقييم جودة نموذج word2vec، يعتمد على الأنماط الدلالية والنحوية المذكورة سابقًا. وقد طوّروا مجموعة من 8869 علاقة دلالية و10675 علاقة نحوية، يستخدمونها كمعيار لاختبار دقة النموذج. عند تقييم جودة نموذج متجهي، يمكن للمستخدم الاعتماد على اختبار الدقة هذا، المُطبّق في word2vec [ 31 ] ، أو تطوير مجموعة اختبار خاصة به تتناسب مع النصوص التي يتكون منها النموذج. يُقدّم هذا المنهج اختبارًا أكثر تحديًا من مجرد القول بأن الكلمات الأكثر تشابهًا مع كلمة اختبار مُعطاة منطقية. [ 1 ]

المعلمات وجودة النموذج

يؤثر استخدام معلمات نموذجية مختلفة وأحجام مجموعات بيانات مختلفة بشكل كبير على جودة نموذج word2vec. ويمكن تحسين الدقة بعدة طرق، منها اختيار بنية النموذج (CBOW أو Skip-Gram)، وزيادة مجموعة بيانات التدريب، وزيادة عدد أبعاد المتجه، وزيادة حجم نافذة الكلمات التي يأخذها الخوارزمية في الاعتبار. ويصاحب كل تحسين من هذه التحسينات زيادة في التعقيد الحسابي، وبالتالي زيادة في وقت توليد النموذج. [ 1 ]

في النماذج التي تستخدم مجموعات بيانات كبيرة وعددًا كبيرًا من الأبعاد، يُحقق نموذج skip-gram أعلى دقة إجمالية، ويُنتج باستمرار أعلى دقة في العلاقات الدلالية، بالإضافة إلى أعلى دقة نحوية في معظم الحالات. ومع ذلك، فإن نموذج CBOW أقل تكلفة حسابية ويُحقق نتائج دقة مماثلة. [ 1 ]

بشكل عام، تزداد الدقة مع زيادة عدد الكلمات المستخدمة وعدد الأبعاد. ويشير ميكولوف وآخرون [ 1 ] إلى أن مضاعفة كمية بيانات التدريب تؤدي إلى زيادة في التعقيد الحسابي تعادل مضاعفة عدد أبعاد المتجهات.

درس ألتزيلر وزملاؤه (2017) أداء Word2vec في اختبارين دلاليين لأحجام مختلفة من النصوص. [ 32 ] ووجدوا أن Word2vec يتميز بمنحنى تعلم حاد ، متفوقًا على تقنية أخرى لتضمين الكلمات، وهي التحليل الدلالي الكامن (LSA)، عند تدريبه على نصوص متوسطة إلى كبيرة الحجم (أكثر من 10 ملايين كلمة). مع ذلك، أظهر LSA أداءً أفضل مع نصوص تدريب صغيرة. بالإضافة إلى ذلك، أظهروا أن أفضل إعدادات المعلمات تعتمد على المهمة ونص التدريب. ومع ذلك، بالنسبة لنماذج skip-gram المدربة على نصوص متوسطة الحجم، ذات 50 بُعدًا، يبدو أن حجم نافذة 15 و10 عينات سلبية يُعد إعدادًا جيدًا للمعلمات.

انظر أيضاً

مراجع

  1. 1 2 3 4 5 6 7 8 9 10 11 12 ميكولوف، توماس؛ تشين، كاي؛ كورادو، جريج؛ دين، جيفري (16 يناير 2013). "التقدير الفعال لتمثيلات الكلمات في الفضاء المتجهي". arXiv : 1301.3781 [ cs.CL ].
  2. 1 2 3 ميكولوف، توماس؛ سوتسكيفر، إيليا؛ تشين، كاي؛ كورادو، جريج س.؛ دين، جيف (2013). التمثيلات الموزعة للكلمات والعبارات وتكوينها . التطورات في أنظمة معالجة المعلومات العصبية . arXiv : 1310.4546 . Bibcode : 2013arXiv1310.4546M .
  3. 1 2 3 "أرشيف جوجل كود - تخزين طويل الأمد لاستضافة مشاريع جوجل كود" . code.google.com . تم الاطلاع عليه بتاريخ 13 يونيو 2016 .
  4. 1 2 3 غولدبيرغ، يواف؛ ليفي، عمر (2014). "شرح word2vec: اشتقاق طريقة تضمين الكلمات بأخذ العينات السلبية لميكولوف وآخرون". arXiv : 1402.3722 [ cs.CL ].
  5. رونغ، شين (5 يونيو 2016)، شرح تعلم معلمات word2vec ، arXiv : 1411.2738
  6. هينتون، جيفري إي. "تعلم التمثيلات الموزعة للمفاهيم". وقائع الاجتماع السنوي لجمعية العلوم المعرفية . المجلد 8. 1986.
  7. روميلهارت، ديفيد إي.؛ ماكليلاند، جيمس إل. (أكتوبر 1985). حول تعلم الأزمنة الماضية للأفعال الإنجليزية (تقرير).
  8. إلمان، جيفري ل. (1 أبريل 1990). "إيجاد البنية في الزمن" . العلوم المعرفية . 14 (2): 179-211 . doi : 10.1016/0364-0213(90)90002-E . ISSN 0364-0213 . 
  9. ^ ميكولوف، توماس. كارافيات، مارتن؛ بورجيت، لوكاس؛ تشيرنوكي، يناير؛ خودانبور ، سانجيف (26 سبتمبر 2010). “نموذج اللغة المعتمد على الشبكة العصبية المتكررة”. كلام بين الكلام 2010 . إيسكا: إيسكا. الصفحات من 1045 إلى 1048. دوى : 10.21437/interspeech.2010-343 . 
  10. US 9037464 ، ميكولوف، توماس؛ تشين، كاي وكورادو ، غريغوري إس . وآخرون، "حساب التمثيلات العددية للكلمات في فضاء عالي الأبعاد"، نُشر في 19 مايو 2015، مُسند إلى شركة جوجل. 
  11. 1 2 ميكولوف، توماش (13 ديسمبر 2023). "حصلنا أمس على جائزة اختبار الزمن في مؤتمر NeurIPS عن بحث word2vec الذي نُشر قبل عشر سنوات" . فيسبوك .{{cite web}}: CS1 maint: deprecated archiveal service ( link )
  12. GloVe: Global Vectors for Word Represent (pdf) مؤرشف في 2020-09-03 في Wayback Machine "نستخدم رؤانا لبناء نموذج جديد لتمثيل الكلمات والذي نسميه GloVe، اختصارًا لـ Global Vectors، لأن إحصائيات المدونة العالمية يتم التقاطها مباشرة بواسطة النموذج."
  13. جولين، أرماند؛ غريف، إدوارد؛ بوجانوفسكي، بيوتر؛ ميكولوف، توماس (9 أغسطس 2016). "مجموعة من الحيل لتصنيف النصوص بكفاءة". arXiv : 1607.01759 [ cs.CL ].
  14. فون دير موزيل، جوليان؛ تراوتش، ألكسندر؛ هيربولد، ستيفن (2022). "حول صلاحية المحولات المدربة مسبقًا لمعالجة اللغة الطبيعية في مجال هندسة البرمجيات". معاملات IEEE في هندسة البرمجيات . 49 (4): 1487-1507 . arXiv : 2109.04738 . doi : 10.1109/TSE.2022.3178469 . ISSN 1939-3520 . S2CID 237485425 .  
  15. "المعامل (hs والسالب)" . مجموعات جوجل . تم الاسترجاع في 13 يونيو 2016 .
  16. "تصور البيانات باستخدام t-SNE" (ملف PDF) . مجلة أبحاث تعلم الآلة، 2008، المجلد 9، ص 2595. تم الاطلاع عليه بتاريخ 18 مارس 2017 .
  17. 1 2 لي، كوك؛ ميكولوف، توماس (مايو 2014). "التمثيلات الموزعة للجمل والوثائق". وقائع المؤتمر الدولي الحادي والثلاثين للتعلم الآلي . arXiv : 1405.4053 .
  18. ريهورك، راديم. "جينسيم" .
  19. ريولت، لودوفيك؛ كوكرين، كريستوفر (3 يوليو 2019). "تضمينات الكلمات لتحليل الموقع الأيديولوجي في المدونات البرلمانية" . التحليل السياسي . 28 (1).
  20. ناي، جون (21 ديسمبر 2017). "Gov2Vec: تعلم التمثيلات الموزعة للمؤسسات ونصوصها القانونية" . SSRN . arXiv : 1609.06616 . SSRN 3087278 . 
  21. 1 2 أنجيلوف، ديمو (أغسطس 2020). "Top2Vec: تمثيلات موزعة للمواضيع". arXiv : 2008.09470 [ cs.CL ].
  22. ^ أنجيلوف ، ديمو (11 نوفمبر 2022). "Top2Vec" . جيثب .
  23. كامبيلو، ريكاردو؛ مولافي، داوود؛ ساندر، يورغ (2013). "التجميع القائم على الكثافة بناءً على تقديرات الكثافة الهرمية" . التطورات في اكتشاف المعرفة واستخراج البيانات . سلسلة محاضرات في علوم الحاسوب. المجلد 7819. الصفحات 160-172 . doi : 10.1007/978-3-642-37456-2_14 . ISBN   978-3-642-37455-5.
  24. 1 2 أصغري، إحسان الدين؛ موفراد، محمد ر.ك. (2015). "التمثيل الموزع المستمر للتسلسلات البيولوجية لعلم البروتينات وعلم الجينوم العميق" . PLOS ONE . 10 (11) e0141287. arXiv : 1503.05140 . Bibcode : 2015PLoSO..1041287A . doi : 10.1371/journal.pone.0141287 . PMC 4640716. PMID 26555596 .  
  25. نغ، باتريك (2017). "dna2vec: تمثيلات متجهة متسقة لـ k-mers ذات الطول المتغير". arXiv : 1701.06279 [ q-bio.QM ].
  26. بانيرجي، إيمون؛ تشين، ماثيو سي؛ لونغرين، ماثيو بي؛ روبين، دانيال إل. (2018). "شرح تقارير الأشعة باستخدام تضمينات الكلمات الذكية: تطبيق على مجموعة متعددة المؤسسات من صور الأشعة المقطعية للصدر" . مجلة المعلوماتية الطبية الحيوية . 77 : 11-20 . doi : 10.1016/j.jbi.2017.11.012 . PMC 5771955. PMID 29175548 .  
  27. ليفي، عمر؛ غولدبيرغ، يواف؛ داغان، إيدو (2015). "تحسين التشابه التوزيعي من خلال الدروس المستفادة من تضمينات الكلمات" . معاملات رابطة اللغويات الحاسوبية . 3 : 211-225 . doi : 10.1162/tacl_a_00134 .
  28. أرورا، س. وآخرون (صيف 2016). "نهج نموذج المتغيرات الكامنة لتضمين الكلمات القائم على PMI" . معاملات رابطة اللغويات الحاسوبية . 4 : 385-399 . arXiv : 1502.03520 . doi : 10.1162/tacl_a_00106 عبر ACLWEB. 
  29. ^ ميكولوف، توماس. يه، وين تاو؛ زفايج ، جيفري (2013). “الانتظامات اللغوية في تمثيلات الكلمات في الفضاء المستمر”. HLT-Naacl : 746-751 .
  30. جانسن، ستيفان (9 مايو 2017). "ترجمة الكلمات والعبارات باستخدام word2vec". arXiv : 1705.03127 [ cs.CL ].
  31. "Gensim - التعلم العميق باستخدام word2vec" . تم الاطلاع عليه بتاريخ 10 يونيو 2016 .
  32. ألتزيلر، إي.؛ ريبيرو، إس.؛ سيغمان، إم.؛ فرنانديز سليزاك، دي. (2017). "تفسير معنى الأحلام: حل الغموض باستخدام التحليل الدلالي الكامن في مجموعة نصوص صغيرة". الوعي والإدراك . 56 : 178-187 . arXiv : 1610.01520 . doi : 10.1016/j.concog.2017.09.004 . PMID 28943127. S2CID 195347873 .  

التطبيقات