التصنيف الإحصائي
عندما يتم إجراء التصنيف بواسطة جهاز كمبيوتر، تُستخدم الأساليب الإحصائية عادةً لتطوير الخوارزمية.
غالبًا ما تُحلل الملاحظات الفردية إلى مجموعة من الخصائص القابلة للقياس الكمي، والمعروفة بمتغيرات تفسيرية أو سمات . قد تكون هذه الخصائص تصنيفية (مثل "A" أو "B" أو "AB" أو "O" لفصيلة الدم )، أو ترتيبية (مثل "كبير" أو "متوسط" أو "صغير")، أو عددية صحيحة (مثل عدد مرات تكرار كلمة معينة في بريد إلكتروني )، أو حقيقية (مثل قياس ضغط الدم ). وتعمل مصنفات أخرى بمقارنة الملاحظات بالملاحظات السابقة باستخدام دالة تشابه أو مسافة .
تُعرف الخوارزمية التي تُنفذ التصنيف، وخاصة في تطبيق عملي، باسم المصنف . ويشير مصطلح "المصنف" أحيانًا إلى الدالة الرياضية التي تُنفذها خوارزمية التصنيف، والتي تربط بيانات الإدخال بفئة معينة.
تتنوع المصطلحات المستخدمة في مختلف المجالات. ففي الإحصاء ، حيث يُستخدم الانحدار اللوجستي أو ما شابهه في التصنيف، تُسمى خصائص المشاهدات بالمتغيرات التفسيرية (أو المتغيرات المستقلة ، أو المتغيرات المُفسِّرة، إلخ)، وتُعرف الفئات المراد التنبؤ بها بالنتائج، والتي تُعتبر قيمًا محتملة للمتغير التابع . أما في التعلّم الآلي ، فتُعرف المشاهدات عادةً بالحالات ، وتُسمى المتغيرات التفسيرية بالميزات (مُجمَّعة في متجه الميزات )، وتُسمى الفئات المحتملة المراد التنبؤ بها بالفئات . وقد تستخدم مجالات أخرى مصطلحات مختلفة، ففي علم البيئة المجتمعية مثلاً ، يشير مصطلح "التصنيف" عادةً إلى تحليل التجميع .
العلاقة بالمشاكل الأخرى
يُعدّ التصنيف والتجميع مثالين على مشكلة أعمّ تُعرف باسم التعرّف على الأنماط ، وهي إسناد قيمة مُخرَجة إلى قيمة مُدخَلة مُعطاة. ومن الأمثلة الأخرى: الانحدار ، الذي يُسند قيمة حقيقية مُخرَجة لكل مُدخَل؛ وتصنيف التسلسلات ، الذي يُسند فئة لكل عنصر من عناصر تسلسل القيم (على سبيل المثال، تحديد أجزاء الكلام ، الذي يُسند جزءًا من الكلام لكل كلمة في جملة مُدخَلة)؛ والتحليل النحوي ، الذي يُسند شجرة تحليل نحوي إلى جملة مُدخَلة، تصف بنيتها النحوية ؛ إلخ.
يُعدّ التصنيف الاحتمالي أحد فروع التصنيف الشائعة . تستخدم خوارزميات هذا النوع الاستدلال الإحصائي لإيجاد أفضل فئة لحالة معينة. على عكس الخوارزميات الأخرى التي تُخرج ببساطة فئة "أفضل"، تُخرج الخوارزميات الاحتمالية احتمال انتماء الحالة إلى كل فئة من الفئات الممكنة. وعادةً ما تُختار أفضل فئة بناءً على أعلى احتمال. مع ذلك، تتمتع هذه الخوارزمية بمزايا عديدة مقارنةً بالمصنفات غير الاحتمالية.
- يمكنه إخراج قيمة ثقة مرتبطة باختياره (بشكل عام، يُعرف المصنف الذي يمكنه القيام بذلك باسم المصنف المرجح بالثقة ).
- وبالمثل، يمكنها الامتناع عندما تكون ثقتها في اختيار أي ناتج معين منخفضة للغاية.
- بسبب الاحتمالات التي يتم توليدها، يمكن دمج المصنفات الاحتمالية بشكل أكثر فعالية في مهام التعلم الآلي الأكبر، بطريقة تتجنب جزئيًا أو كليًا مشكلة انتشار الخطأ .
إجراءات أخصائي الترددات
Early work on statistical classification was undertaken by Fisher,[1][2] in the context of two-group problems, leading to Fisher's linear discriminant function as the rule for assigning a group to a new observation.[3] This early work assumed that data-values within each of the two groups had a multivariate normal distribution. The extension of this same context to more than two groups has also been considered with a restriction imposed that the classification rule should be linear.[3][4] Later work for the multivariate normal distribution allowed the classifier to be nonlinear:[5] several classification rules can be derived based on different adjustments of the Mahalanobis distance, with a new observation being assigned to the group whose centre has the lowest adjusted distance from the observation.
Bayesian procedures
Unlike frequentist procedures, Bayesian classification procedures provide a natural way of taking into account any available information about the relative sizes of the different groups within the overall population.[6] Bayesian procedures tend to be computationally expensive and, in the days before Markov chain Monte Carlo computations were developed, approximations for Bayesian clustering rules were devised.[7]
Some Bayesian procedures involve the calculation of group-membership probabilities: these provide a more informative outcome than a simple attribution of a single group-label to each new observation.
Binary and multiclass classification
Classification can be thought of as two separate problems – binary classification and multiclass classification. In binary classification, a better understood task, only two classes are involved, whereas multiclass classification involves assigning an object to one of several classes.[8] Since many classification methods have been developed specifically for binary classification, multiclass classification often requires the combined use of multiple binary classifiers.
Feature vectors
تصف معظم الخوارزميات حالةً فرديةً يُراد التنبؤ بفئتها باستخدام متجه خصائص يتضمن سمات فردية قابلة للقياس لهذه الحالة. تُسمى كل سمة "ميزة" ، وتُعرف في الإحصاء أيضًا بالمتغير التفسيري (أو المتغير المستقل ، مع العلم أن الميزات قد تكون مستقلة إحصائيًا أو لا ). قد تكون الميزات ثنائية (مثل "تشغيل" أو "إيقاف")؛ أو تصنيفية (مثل "A" أو "B" أو "AB" أو "O" لفصيلة الدم )؛ أو ترتيبية (مثل "كبير" أو "متوسط" أو "صغير")؛ أو عددية صحيحة (مثل عدد مرات تكرار كلمة معينة في بريد إلكتروني)؛ أو عددية حقيقية (مثل قياس ضغط الدم). إذا كانت الحالة صورة، فقد تتوافق قيم الميزات مع وحدات البكسل في الصورة؛ وإذا كانت الحالة نصًا، فقد تكون قيم الميزات هي ترددات تكرار كلمات مختلفة. بعض الخوارزميات تعمل فقط من حيث البيانات المنفصلة وتتطلب تقسيم البيانات ذات القيم الحقيقية أو الصحيحة إلى مجموعات (على سبيل المثال أقل من 5، بين 5 و 10، أو أكبر من 10).
المصنفات الخطية
يمكن صياغة عدد كبير من خوارزميات التصنيف باستخدام دالة خطية تُخصص درجة لكل فئة ممكنة k ، وذلك بدمج متجه خصائص الحالة مع متجه الأوزان باستخدام الضرب النقطي . الفئة المتوقعة هي تلك التي حصلت على أعلى درجة. يُعرف هذا النوع من دوال التقييم بدالة التنبؤ الخطية ، وله الشكل العام التالي: حيث يمثل Xᵢ متجه الخصائص للمثال i ، و βᵏ متجه الأوزان المقابل للفئة k ، وscore( Xᵢ , k ) الدرجة المرتبطة بتخصيص المثال i للفئة k . في نظرية الاختيار المنفصل ، حيث تمثل الأمثلة الأشخاص وتمثل الفئات الخيارات، تُعتبر الدرجة هي المنفعة المرتبطة باختيار الشخص i للفئة k .
تُعرف الخوارزميات ذات هذا الإعداد الأساسي باسم المصنفات الخطية . ما يميزها هو إجراء تحديد (تدريب) الأوزان/المعاملات المثلى وطريقة تفسير النتيجة.
ومن أمثلة هذه الخوارزميات ما يلي:
- الانحدار اللوجستي – نموذج إحصائي لمتغير تابع ثنائي
- الانحدار اللوجستي متعدد الحدود – الانحدار لأكثر من نتيجتين منفصلتين
- انحدار بروبيت – انحدار إحصائي حيث لا يمكن للمتغير التابع إلا أن يأخذ قيمتين. صفحات تعرض أوصافًا مختصرة لأهداف إعادة التوجيه
- خوارزمية البيرسيبترون
- آلة المتجهات الداعمة – مجموعة من الأساليب للتعلم الإحصائي الخاضع للإشراف
- تحليل التمييز الخطي – طريقة تستخدم في الإحصاء، والتعرف على الأنماط، ومجالات أخرى
الخوارزميات
بما أنه لا يوجد شكل تصنيف واحد مناسب لجميع مجموعات البيانات، فقد تم تطوير مجموعة كبيرة من خوارزميات التصنيف. ومن أكثرها استخدامًا ما يلي: [ 9 ]
- الشبكات العصبية الاصطناعية – نموذج حسابي يُستخدم في التعلم الآلي. صفحات تعرض أوصافًا مختصرة لأهداف إعادة التوجيه.
- التعزيز (التعلم الآلي) – أسلوب التعلم الجماعي
- الغابة العشوائية – أساليب التعلم الآلي الجماعية القائمة على الأشجار
- البرمجة الجينية – تطوير برامج حاسوبية باستخدام تقنيات مماثلة للعمليات الجينية الطبيعية
- برمجة التعبير الجيني – الخوارزمية التطورية
- برمجة متعددة التعبيرات
- البرمجة الجينية الخطية
- تقدير النواة – مفهوم في الإحصاء صفحات تعرض أوصافًا موجزة لأهداف إعادة التوجيه
- خوارزمية أقرب جار k – طريقة تصنيف غير بارامترية. صفحات تعرض أوصافًا مختصرة لأهداف إعادة التوجيه.
- تعلم تكميم المتجهات
- المصنف الخطي – التصنيف الإحصائي في التعلم الآلي
- التمييز الخطي لفيشر – طريقة تُستخدم في الإحصاء، والتعرف على الأنماط، ومجالات أخرى. صفحات تعرض أوصافًا موجزة لأهداف إعادة التوجيه
- الانحدار اللوجستي – نموذج إحصائي لمتغير تابع ثنائي
- مصنف بايز الساذج – خوارزمية تصنيف احتمالية
- بيرسيبترون – خوارزمية للتعلم الخاضع للإشراف للمصنفات الثنائية
- المصنف التربيعي – مصنف إحصائي في مجال تعلم الآلة
- آلة المتجهات الداعمة – مجموعة من الأساليب للتعلم الإحصائي الخاضع للإشراف
غالباً ما يتم اختيار الخوارزميات المختلفة الممكنة بناءً على التقييم الكمي للدقة .
مجالات التطبيق
للتصنيف تطبيقات عديدة. في بعض هذه التطبيقات، يُستخدم كإجراء لاستخراج البيانات ، بينما في تطبيقات أخرى يتم إجراء نمذجة إحصائية أكثر تفصيلاً.
- التصنيف البيولوجي – علم تحديد ووصف وتعريف وتسمية مجموعات الكائنات الحية
- القياسات الحيوية – مقاييس متعلقة بالخصائص البشرية. صفحات تعرض أوصافًا موجزة لتحديد أهداف إعادة التوجيه.
- Computer vision – Computerized information extraction from images
- Medical image analysis and medical imaging – Technique and process of creating visual representations of the interior of a body
- Optical character recognition – Computer recognition of visual text
- Video tracking – Locating a moving object by analyzing frames of a video
- Credit scoring – Numerical expression representing a person's creditworthinessPages displaying short descriptions of redirect targets
- Document classification – Process of categorizing documents
- Drug discovery and development – Process of bringing a new pharmaceutical drug to the market
- Toxicogenomics
- Quantitative structure-activity relationship – Predictive chemical modelPages displaying short descriptions of redirect targets
- Geostatistics – Branch of statistics focusing on spatial data sets
- Handwriting recognition – Ability of a computer to receive and interpret intelligible handwritten input
- Internet search engines
- Micro-array classification
- Pattern recognition – Automated recognition of patterns and regularities in data
- Recommender system – System to predict users' preferences
- Speech recognition – Automatic conversion of spoken language into text
- Statistical natural language processing – Processing of natural language by a computerPages displaying short descriptions of redirect targets
See also
- Artificial intelligence – Intelligence of machines
- Binary classification – Dividing things between two categories
- Multiclass classification – Problem in machine learning and statistical classification
- Class membership probabilities – Machine learning problemPages displaying short descriptions of redirect targets
- Classification rule
- Compound term processing
- Confusion matrix – Table layout for visualizing performance; also called an error matrix
- Data mining – Process of analyzing large data sets
- Data warehouse – Centralized storage of knowledge
- Fuzzy logic – System for reasoning about vagueness
- Information retrieval – Finding information for an information need
- List of datasets for machine learning research
- Machine learning – Subset of artificial intelligence
- Recommender system – System to predict users' preferences
References
- ↑ فيشر، ر. أ. (1936). "استخدام القياسات المتعددة في المشكلات التصنيفية". حوليات علم تحسين النسل . 7 (2): 179-188 . doi : 10.1111/j.1469-1809.1936.tb02137.x . hdl : 2440/15227 .
- ↑ فيشر، ر. أ. (1938). "الاستخدام الإحصائي للقياسات المتعددة". حوليات علم تحسين النسل . 8 (4): 376-386 . doi : 10.1111/j.1469-1809.1938.tb02189.x . hdl : 2440/15232 .
- 1 2 غناناديسيكان، ر. (1977) طرق التحليل الإحصائي للبيانات متعددة المتغيرات ، وايلي. ISBN 0-471-30845-5(ص 83 – 86)
- ↑ راو، سي آر (1952) الأساليب الإحصائية المتقدمة في التحليل متعدد المتغيرات ، وايلي. (القسم 9ج)
- ↑ أندرسون، تي دبليو (1958) مقدمة في التحليل الإحصائي متعدد المتغيرات ، وايلي.
- ↑ بايندر، د.أ. (1978). "تحليل التجميع البايزي". بيومتريكا . 65 : 31-38 . doi : 10.1093/biomet/65.1.31 .
- ↑ بايندر، ديفيد أ. (1981). "تقريبات لقواعد التجميع البايزية". بيومتريكا . 68 : 275-285 . doi : 10.1093/biomet/68.1.275 .
- ↑ هار-بيليد، س. ، روث، د.، زيماك، د. (2003) "التصنيف المقيد للتصنيف والترتيب متعدد الفئات". في: بيكر، ب.، ثرون، س. ، أوبرماير، ك. (محررون) التطورات في أنظمة معالجة المعلومات العصبية 15: وقائع مؤتمر 2002 ، مطبعة معهد ماساتشوستس للتكنولوجيا. ISBN 0-262-02550-7
- ↑ "جولة في أفضل 10 خوارزميات للمبتدئين في مجال تعلم الآلة" . Built In . 2018-01-20 . تم الاطلاع عليه بتاريخ 2019-06-10 .
- التصنيف الإحصائي
- خوارزميات التصنيف
