قائمة الكلمات

قائمة الكلمات هي قائمة بالكلمات في معجم ، تُرتّب عادةً حسب تكرار ورودها (إما بمستويات متدرجة ، أو كقائمة مُرتبة). تُجمع قائمة الكلمات من خلال تحليل التكرار المعجمي ضمن مجموعة نصوص معينة ، وتُستخدم في علم لغويات المدونات لدراسة أنساب اللغات والنصوص وتطورها. تُسمى الكلمة التي تظهر مرة واحدة فقط في مجموعة النصوص " كلمة نادرة ". في مجال التربية ، تُستخدم قوائم الكلمات في تصميم المناهج الدراسية لاكتساب المفردات . يوفر المعجم المُرتب حسب التكرار "أساسًا منطقيًا لضمان حصول المتعلمين على أفضل عائد لجهودهم في تعلم المفردات" ( نيشن، 1997 )، ولكنه مُخصص بشكل أساسي لواضعي المناهج الدراسية ، وليس للمتعلمين مباشرةً. تُعد قوائم التكرار أيضًا لأغراض معجمية، حيث تعمل كنوع من قائمة التحقق لضمان عدم إغفال الكلمات الشائعة. من أبرز عيوبها محتوى مجموعة النصوص، وأسلوبها ، وتعريف " الكلمة ". على الرغم من أن عد الكلمات يعود إلى ألف عام، مع استمرار التحليل الضخم الذي يتم يدويًا في منتصف القرن العشرين، إلا أن المعالجة الإلكترونية للغة الطبيعية للمجموعات الكبيرة مثل ترجمات الأفلام (دراسة SUBTLEX الضخمة) قد سرّعت مجال البحث.

في علم اللغة الحاسوبي ، قائمة التردد هي قائمة مرتبة من الكلمات (أنواع الكلمات) مع ترددها ، حيث يعني التردد هنا عادةً عدد مرات الظهور في مجموعة معينة ، والتي يمكن من خلالها اشتقاق الترتيب كموقع في القائمة.

الجدول 1: مثال على تحليل التردد المعجمي
يكتبالأحداثرتبة
ال3,789,654الأول
هو2,098,762الثاني
[...]
ملِك57,8971356
ولد56,9751357
[...]
سلاسل534,589
[...]
تحويل1123,567

المنهجية

عوامل

أشار نيشن ( نيشن، 1997 ) إلى المساعدة الهائلة التي توفرها القدرات الحاسوبية، مما يجعل تحليل النصوص أسهل بكثير. وذكر عدة قضايا رئيسية تؤثر على بناء قوائم التكرار:

  • تمثيلية المدونة
  • تكرار الكلمات ونطاقها
  • معالجة عائلات الكلمات
  • معالجة المصطلحات والعبارات الثابتة
  • نطاق المعلومات
  • معايير أخرى متنوعة

مجموعات

مجموعة النصوص المكتوبة التقليدية

تكرار استخدام الضمائر الشخصية في اللغة الصربية الكرواتية

تعتمد معظم الدراسات المتاحة حاليًا على مجموعات النصوص المكتوبة ، وهي أكثر سهولة في الوصول إليها وأسهل في معالجتها.

حركة ساب تليكس

مع ذلك، اقترح نيو وآخرون (2007) الاستفادة من العدد الكبير من الترجمات المتاحة عبر الإنترنت لتحليل كميات هائلة من الخطابات. وقدّم برايسبرت ونيو (2009) تقييمًا نقديًا معمقًا لمنهج تحليل النصوص التقليدي، ودعما التوجه نحو تحليل الخطابات وتحليل ترجمات الأفلام المتاحة عبر الإنترنت. وشهد البحث الأولي عددًا من الدراسات اللاحقة [ 1 ] ، والتي قدمت تحليلًا قيّمًا لعدد مرات التكرار في لغات مختلفة. تم إنتاج أبحاث SUBTLEX المتعمقة [ 2 ] حول الترجمات المفتوحة المنظفة للغة الفرنسية ( New et al. 2007 )، والإنجليزية الأمريكية ( Brysbaert & New 2009 ؛ Brysbaert, New & Keuleers 2012 )، والهولندية ( Keuleers & New 2010 )، والصينية ( Cai & Brysbaert 2010 )، والإسبانية ( Cuetos et al. 2011 )، اليونانية ( ديميتروبولو وآخرون. 2010 )، الفيتنامية ( فام، بولجر وباين 2011 )، الألمانية ( بريسبايرت وآخرون. 2011 خطأ harvnb: لا يوجد هدف: CITEREFBrysbaertBuchmeierConradJacobs,_Bölte_ & _Böhl2011 ( مساعدة ) ) والبرتغالية البرازيلية ( تانغ 2012 ) والبرتغالية البرتغالية ( سواريس ) وآخرون 2015 )، الألبانية ( [أفديلي وكويتوس 2013 ]، والبولندية ( مانديرا وآخرون 2014 )، والكتالونية (2019 [ 3 ] )، والويلزية (فان فيوهين وآخرون 2024 [ 4 ] )، والكورية. [ 5 ] يوفر برنامج SUBTLEX-IT (2015) البيانات الأولية فقط. [ 6 ]

الوحدة المعجمية

على أي حال، ينبغي تحديد وحدة "الكلمة" الأساسية. في الكتابة اللاتينية، تتكون الكلمات عادةً من حرف واحد أو عدة أحرف مفصولة إما بمسافات أو علامات ترقيم. لكن قد توجد استثناءات  : فكلمة "can't" الإنجليزية و" aujourd'hui " الفرنسية تتضمنان علامات ترقيم، بينما كلمة "chateau d'eau" الفرنسية تُعبّر عن مفهوم مختلف عن مجرد جمع مكوناتها، مع تضمينها مسافة. وقد يكون من الأفضل أيضًا تجميع كلمات عائلة الكلمات تحت تمثيل كلمتها الأساسية . وهكذا، فإن "possible" و"impossible" و"possibility" هي كلمات من نفس عائلة الكلمات، ممثلة بالكلمة الأساسية *possib* . ولأغراض إحصائية، تُجمع كل هذه الكلمات تحت صيغة الكلمة الأساسية *possib*، مما يسمح بترتيب المفهوم وتكرار الصيغة. علاوة على ذلك، قد تُشكّل لغات أخرى صعوبات خاصة. هذا هو الحال في اللغة الصينية، التي لا تستخدم مسافات بين الكلمات، حيث يمكن تفسير سلسلة محددة من عدة أحرف إما كعبارة من كلمات ذات حرف واحد، أو ككلمة متعددة الأحرف.

إحصائيات

يبدو أن قانون زيبف ينطبق على قوائم الترددات المستمدة من نصوص طويلة لأي لغة طبيعية. تُعدّ قوائم الترددات أداةً مفيدةً عند بناء قاموس إلكتروني، وهو شرط أساسي لمجموعة واسعة من التطبيقات في اللغويات الحاسوبية .

يحدد اللغويون الألمان Häufigkeitsklasse (فئة التردد)شمال{\displaystyle N}يُحسب تكرار عنصر في القائمة باستخدام اللوغاريتم الثنائي لنسبة تكراره إلى تكرار العنصر الأكثر تكرارًا. ينتمي العنصر الأكثر تكرارًا إلى فئة التكرار 0 (صفر)، بينما ينتمي أي عنصر يقل تكراره عن نصف تكرار العنصر الأكثر تكرارًا تقريبًا إلى الفئة 1. في المثال أعلاه، تبلغ نسبة تكرار كلمة " outragious" المكتوبة بشكل خاطئ 76/3789654، وبالتالي فهي تنتمي إلى الفئة 16.

شمال=0.5-سجل2(تكرار هذا العنصرتكرار العنصر الأكثر شيوعًا){\displaystyle N=\left\lfloor 0.5-\log _{2}\left({\frac {\text{تكرار هذا العنصر}}{\text{تكرار العنصر الأكثر شيوعًا}}}\right)\right\rfloor }

أين...{\displaystyle \lfloor \ldots \rfloor }هي دالة الأرضية .

تُستخدم قوائم التردد، جنبًا إلى جنب مع الشبكات الدلالية ، لتحديد المصطلحات الأقل شيوعًا والمتخصصة التي سيتم استبدالها بمرادفاتها في عملية الضغط الدلالي .

علم التربية

لا يُقصد بهذه القوائم أن تُقدّم مباشرةً للطلاب، بل أن تكون بمثابة دليل إرشادي للمعلمين ومؤلفي الكتب الدراسية ( نيشن، 1997 ). ويشجع ملخص بول نيشن لتدريس اللغات الحديثة على "الانتقال أولاً من المفردات عالية التردد والمفردات ذات الأغراض الخاصة [الموضوعية] إلى المفردات منخفضة التردد، ثم تعليم المتعلمين استراتيجيات للحفاظ على التوسع الذاتي في المفردات" ( نيشن، 2006 ).

تأثيرات تكرار الكلمات

من المعروف أن لتكرار الكلمات تأثيرات متنوعة ( Brysbaert et al. 2011 harvnb error: no target: CITEREFBrysbaertBuchmeierConradJacobs,_Bölte_ & _Böhl2011 ( help ) ; Rudell 1993 ). يتأثر الحفظ إيجابًا بتكرار الكلمات العالي، على الأرجح لأن المتعلم يتعرض لها بشكل أكبر ( Laufer 1997 ). كما يتأثر الوصول إلى المفردات إيجابًا بتكرار الكلمات العالي، وهي ظاهرة تُعرف بتأثير تكرار الكلمات ( Segui et al. ). ويرتبط تأثير تكرار الكلمات بتأثير سن اكتساب الكلمة ، أي السن الذي تعلمت فيه الكلمة.

اللغات

فيما يلي مراجعة للموارد المتاحة.

إنجليزي

يُعدّ إحصاء الكلمات مجالًا عريقًا، [ 7 ] إذ تعود مناقشاته المعروفة إلى العصر الهلنستي . في عام 1944، قام إدوارد ثورندايك وإرفين لورج وزملاؤهما [ 8 ] بإحصاء 18 مليون كلمة متتابعة يدويًا، ليُقدّموا أول قائمة تردد واسعة النطاق للغة الإنجليزية، قبل أن تُسهّل الحواسيب الحديثة مثل هذه المشاريع بشكل كبير ( نيشن 1997 ). وتعاني جميع أعمال القرن العشرين من آثار قدمها. فعلى وجه الخصوص، الكلمات المتعلقة بالتكنولوجيا، مثل كلمة "blog"، التي احتلت المرتبة 7665 من حيث التردد في عام 2014 [ 9 ] في مدونة اللغة الإنجليزية الأمريكية المعاصرة، [ 10 ] والتي وُثّقت لأول مرة في عام 1999، [ 11 ] [ 12 ] [ 13 ] ولا تظهر في أي من هذه القوائم الثلاث.

كتاب كلمات المعلمين الذي يحتوي على 30000 كلمة (ثورندايك ولورج، 1944)
يحتوي كتاب كلمات المعلم على 30,000 جذر لغوي أو ما يقارب 13,000 عائلة كلمات (جولدن، نيشن، وريد، 1990). وقد تم تحليل مدونة لغوية تضم 18 مليون كلمة مكتوبة يدويًا. زاد حجم المدونة المصدرية من فائدتها، لكن قدمها والتغيرات اللغوية قللت من قابليتها للتطبيق ( نيشن، 1997 ).
قائمة الخدمات العامة (ويست، 1953)
تحتوي قائمة الخدمة العامة على 2000 كلمة رئيسية مقسمة إلى مجموعتين، كل مجموعة تضم 1000 كلمة. وقد تم تحليل مدونة لغوية تضم 5 ملايين كلمة مكتوبة في أربعينيات القرن العشرين. وتُقدم القائمة نسبة تكرار الكلمة الرئيسية (%) لمختلف معانيها وأجزائها النحوية. وقد طُبقت معايير متنوعة، إلى جانب التكرار والنطاق، بدقة على المدونة. ولذلك، فعلى الرغم من قدمها، ووجود بعض الأخطاء فيها، وكونها مدونة لغوية مكتوبة بالكامل، إلا أنها لا تزال قاعدة بيانات ممتازة لتكرار الكلمات، وتكرار معانيها، وتقليل التشويش ( نيشن، 1997 ). وقد تم تحديث هذه القائمة في عام 2013 من قِبل الدكتور تشارلز براون، والدكتور برنت كوليجان، وجوزيف فيليبس تحت اسم قائمة الخدمة العامة الجديدة .
كتاب تردد الكلمات في التراث الأمريكي (كارول، ديفيز وريتشمان، 1971)
مجموعة بيانات تضم 5 ملايين كلمة متكررة، مأخوذة من نصوص مكتوبة مستخدمة في مدارس الولايات المتحدة (مختلف المراحل الدراسية، ومختلف المواد الدراسية). تكمن قيمتها في تركيزها على مواد التدريس المدرسية، وتصنيفها للكلمات حسب تكرار كل كلمة، في كل مرحلة دراسية، وفي كل مادة دراسية ( نيشن 1997 ).
مجموعة براون (فرانسيس وكوتشيرا، 1982) LOB والمجموعات ذات الصلة
تحتوي هذه المصادر الآن على مليون كلمة من مدونة مكتوبة تمثل لهجات مختلفة من اللغة الإنجليزية. وتُستخدم هذه المصادر لإنتاج قوائم التردد ( نيشن 1997 ).

فرنسي

مجموعات البيانات التقليدية

أجرى نيو وبالييه مراجعةً لهذا الموضوع . وقد بُذلت محاولة في خمسينيات وستينيات القرن العشرين باستخدام " الأساس اللغوي الفرنسي" . يتضمن هذا الأساس قائمة FF1 التي تضم 1500 كلمة عالية التردد، أُكملت لاحقًا بقائمة FF2 التي تضم 1700 كلمة متوسطة التردد، بالإضافة إلى قواعد النحو الأكثر استخدامًا. [ 14 ] يُزعم أن 70 كلمة نحوية تُشكل 50% من الجملة التواصلية، [ 15 ] [ 16 ] بينما تُغطي 3680 كلمة ما بين 95% و98% من الجملة. [ 17 ] كما تتوفر قائمة تضم 3000 كلمة شائعة الاستخدام. [ 18 ]

كما تُقدّم وزارة التعليم الفرنسية قائمة مُرتبة تضمّ 1500 من أكثر عائلات الكلمات شيوعًا ، والتي وضعها عالم المعاجم إتيان برونيه . [ 19 ] وقد أجرى جان بودو دراسةً على غرار دراسة براون الأمريكية، بعنوان "تكرار استخدام الكلمات في اللغة الفرنسية المكتوبة المعاصرة". [ 20 ]

في الآونة الأخيرة، يوفر مشروع Lexique3 142000 كلمة فرنسية، مع معلومات عن التهجئة ، والصوتيات ، والتقطيع المقطعي ، ونوع الكلمة ، والجنس ، وعدد مرات الظهور في مجموعة المصادر، وترتيب التردد، والمفردات المرتبطة بها ، وما إلى ذلك، وهي متاحة بموجب ترخيص مفتوح CC-by-sa-4.0 . [ 21 ]

سابتليكس

يُعدّ هذا المعجم (Lexique3) دراسةً مستمرةً انبثقت منها حركة Subtlex المذكورة أعلاه. وقد قدّم نيو وآخرون (2007) إحصاءاتٍ جديدةً تمامًا استنادًا إلى ترجمات الأفلام عبر الإنترنت.

الأسبانية

أُجريت العديد من الدراسات حول تواتر الكلمات الإسبانية ( كويتوس وآخرون، 2011 ). [ 22 ]

الصينية

لطالما دُرست المدونات الصينية من منظور قوائم التردد. وتعتمد الطريقة التاريخية لتعلم المفردات الصينية على تردد الأحرف ( ألانيتش، 2003 ). وقد أشار عالم الصينيات الأمريكي جون دي فرانسيس إلى أهمية ذلك في تعلم اللغة الصينية كلغة أجنبية وتدريسها في كتابه " لماذا لا يستطيع جوني قراءة الصينية" ( دي فرانسيس، 1966 ). وقدّم كلٌّ من دا ( دا، 1998 ) ووزارة التعليم التايوانية (وزارة التعليم التايوانية، 1997 ) قواعد بيانات ضخمة تتضمن تصنيفات تردد الأحرف والكلمات، وذلك كأداة لتحليل التردد. وتُعدّ قائمة HSK التي تضم 8848 كلمة عالية ومتوسطة التردد في جمهورية الصين الشعبية ، وقائمة TOP في جمهورية الصين (تايوان) التي تضم حوالي 8600 كلمة صينية تقليدية شائعة، مثالين آخرين على قوائم الكلمات والأحرف الصينية الشائعة. وفي أعقاب حركة SUBTLEX، أجرى كاي وبريسبرت (2010) دراسة معمقة حول ترددات الكلمات والأحرف الصينية.

آخر

يحتوي قاموس ويكشنري على قوائم الترددات بلغات أكثر. [ 23 ]

الكلمات الأكثر استخدامًا في مختلف اللغات بناءً على ويكيبيديا أو مجموعات النصوص المدمجة. [ 24 ]

انظر أيضاً

ملحوظات

  1. "Crr  » ترددات كلمات الترجمة الفرعية" . مؤرشف من الأصل بتاريخ 17-04-2021 . تم الاطلاع عليه بتاريخ 22-05-2012 .
  2. برايسبرت، مارك. "تكرار كلمات الترجمة الفرعية" . crr.ugent.be . مؤرشف من الأصل بتاريخ 15 أبريل 2023. تم الاطلاع عليه بتاريخ 11 أكتوبر 2025 .
  3. ^ بوادا ، روجر. جواش، مارك؛ هارو، خوان؛ ديميستر، جوزيب؛ فيري، بيلار (1 فبراير 2020). "SUBTLEX-CAT: ترددات كلمات الترجمة والتنوع السياقي للغة الكاتالانية" . طرق البحث السلوكي . 52 (1): 360-375 . دوى : 10.3758 / s13428-019-01233-1 . ردمك 1554-3528 . بميد 30895456 . S2CID 84843788 .   
  4. فان هوفن، والتر جيه بي؛ باين، جوشوا إس؛ جونز، مانون دبليو (مايو 2024). "سابتليكس-سي واي: قاعدة بيانات جديدة لتردد الكلمات في اللغة الويلزية" . المجلة الفصلية لعلم النفس التجريبي . 77 (5): 1052-1067 . doi : 10.1177/17470218231190315 . ISSN 1747-0218 . PMC 11032624. PMID 37649366 .   
  5. كيم، جين سيو؛ تشوي، آنا سيو غيونغ؛ تشو، سونغ هي (مايو 2024). "KoFREN: معايير شاملة لتكرار الكلمات الكورية مستمدة من مجموعات بيانات واسعة النطاق للكلام الحر" . ELRA: 9926–9931 . doi : 10.63317/4f55ejcfp5wh .{{cite journal}}يتطلب الاستشهاد بالمجلة ( مساعدة )|journal=
  6. ^ امنتا، سيمونا. مانديرا، باويل؛ كوليرز، إيمانويل؛ بريسبرت، مارك؛ كريبالدي ، دافيد (7 يناير 2022). "سوبتليكس-إيت" .
  7. بونتراغر، تيري (1 أبريل 1991). "تطور قوائم تردد الكلمات قبل قائمة ثورندايك-لورج لعام 1944" . علم نفس القراءة . 12 (2): 91-116 . doi : 10.1080/0270271910120201 . ISSN 0270-2711 . 
  8. كتاب كلمات المعلم الذي يحتوي على 30000 كلمة .
  9. "الكلمات والعبارات: التكرار، والأنواع، والمتلازمات، والتوافقات، والمترادفات، وWordNet" .
  10. "مجموعة اللغة الإنجليزية الأمريكية المعاصرة (COCA)" .
  11. "إنها الروابط يا غبي" . مجلة الإيكونوميست. 20 أبريل 2006. تم الاطلاع عليه بتاريخ 5 يونيو 2008 .
  12. ميرهولز، بيتر (1999). "Peterme.com" . أرشيف الإنترنت . مؤرشف من الأصل بتاريخ 13 أكتوبر 1999. تم الاطلاع عليه بتاريخ 5 يونيو 2008 .
  13. كوتكي، جيسون (26 أغسطس 2003). "kottke.org" . تم الاسترجاع في 5 يونيو 2008 .
  14. ^ "اللغة الفرنسية الأساسية" . مؤرشفة من الأصلي بتاريخ 2010-07-04.
  15. ^ Ouzoulias، André (2004)، Comprendre et aider les enfants en hardé scolaire: Le Vocabulaire fondamental، 70 mots essentiels (PDF) ، ريتز- نقلاً عن VAC Henmon (رابط معطل، لا توجد نسخة في أرشيف الإنترنت، 10 أغسطس 2023)
  16. قائمة "70 كلمة أساسية" ملخصة بواسطة VAC Henmon
  17. "التعميمات" .
  18. "ملف PDF يحتوي على 3000 كلمة فرنسية" .
  19. ^ "Maitrise de la langue à l'école: Vocabulaire" . وزارة التعليم الوطني.
  20. ^ Baudot، J. (1992)، ترددات استخدام الكلمات باللغة الفرنسية المعاصرة ، مطبعة الجامعة، ISBN 978-2-7606-1563-2
  21. "المعجم" .
  22. "قوائم تردد الكلمات الإسبانية" . Vocabularywiki.pbworks.com .
  23. ويكشنري: قوائم التردد ، 21 يوليو 2024
  24. الكلمات الأكثر استخدامًا في مختلف اللغات ، ezglot

مراجع

المفاهيم النظرية

قواعد بيانات تعتمد على النصوص المكتوبة

حركة ساب تليكس