معالجة البيانات
تُعرف عملية معالجة البيانات ، أو ما يُشار إليها أحيانًا بتنقيح البيانات ، بأنها عملية تحويل البيانات وتنسيقها من شكلها الخام إلى شكل آخر ، بهدف جعلها أكثر ملاءمة وقيمة لأغراض لاحقة متنوعة، مثل التحليلات. ويهدف هذا إلى ضمان جودة البيانات وفائدتها. ويقضي محللو البيانات عادةً معظم وقتهم في عملية معالجة البيانات مقارنةً بتحليلها الفعلي.
قد تشمل عملية معالجة البيانات المزيد من عمليات التنظيف ، وتصوير البيانات ، وتجميعها، وتدريب نموذج إحصائي ، بالإضافة إلى العديد من الاستخدامات المحتملة الأخرى. وتتبع معالجة البيانات عادةً مجموعة من الخطوات العامة التي تبدأ باستخراج البيانات بصيغتها الخام من مصدرها، ثم تنظيفها (مثل فرزها) أو تحليلها إلى هياكل بيانات محددة مسبقًا، وأخيرًا تخزين المحتوى الناتج في وجهة بيانات لاستخدامه لاحقًا. [ 1 ] وهي تتوافق بشكل وثيق مع عملية استخراج البيانات وتحويلها وتحميلها (ETL) .
خلفية
يُقال غالبًا أن مصطلح "مُعالج البيانات" غير التقني مُشتق من عمل برنامج البنية التحتية الرقمية الوطنية للمعلومات والحفظ (NDIIPP) التابع لمكتبة الكونغرس الأمريكية، وشريكه في البرنامج، شراكة MetaArchive التابعة لمكتبات جامعة إيموري . ويُشتق مصطلح "مُنج" من عملية " مونجينج " كما هو موضح في ملف المصطلحات . [ 2 ] كما اقتُرح مصطلح "مُعالج البيانات" كأفضل تشبيه لوصف شخص يعمل مع البيانات. [ 3 ]
كان دونالد كلاين من أوائل من أشاروا إلى معالجة البيانات في سياق علمي خلال تجربة ناسا/الإدارة الوطنية للمحيطات والغلاف الجوي (NOAA) حول عمليات الأراضي الباردة. [ 4 ] ذكر كلاين أن معالجي البيانات "ينسقون عملية جمع بيانات التجربة بأكملها". كما حدد كلاين المهام التي يتولاها عادةً مسؤول التخزين عند التعامل مع كميات كبيرة من البيانات . يحدث هذا في مجالات مثل المشاريع البحثية الكبرى وإنتاج الأفلام التي تتضمن كميات هائلة من الصور المعقدة المولدة بالحاسوب . في مجال البحث، يشمل ذلك نقل البيانات من أجهزة البحث إلى شبكة التخزين أو مرفق التخزين، بالإضافة إلى معالجة البيانات لإعادة تحليلها باستخدام أجهزة الحوسبة عالية الأداء أو الوصول إليها عبر المكتبات الرقمية القائمة على البنية التحتية الإلكترونية .
مع ظهور الذكاء الاصطناعي في علم البيانات، بات من الضروري وجود ضوابط صارمة لأتمتة معالجة البيانات، ولذلك لم تتم أتمتة عملية تنظيف البيانات باستخدام التعلم الآلي . تتطلب عملية تنظيف البيانات أكثر من مجرد حل آلي، فهي تتطلب معرفة المعلومات التي يجب حذفها، والذكاء الاصطناعي لم يصل بعد إلى مستوى فهم هذه الأمور. [ 5 ]
الصلة باستخراج البيانات
معالجة البيانات هي عملية شاملة لاستخراج البيانات ، وتتطلب عمليات تستخدمها بعض عمليات استخراج البيانات، ولكن ليس دائمًا. تهدف عملية استخراج البيانات إلى إيجاد أنماط ضمن مجموعات بيانات ضخمة، بينما تقوم معالجة البيانات بتحويل البيانات لاستخلاص رؤى قيّمة عنها. ورغم أن معالجة البيانات هي عملية شاملة لاستخراج البيانات، إلا أن ذلك لا يعني أن استخراج البيانات لا يستخدمها، بل هناك العديد من حالات استخدام معالجة البيانات في استخراج البيانات. يمكن لمعالجة البيانات أن تفيد استخراج البيانات من خلال إزالة البيانات التي لا تُفيد المجموعة ككل، أو التي لم يتم تنسيقها بشكل صحيح، مما يُحسّن نتائج عملية استخراج البيانات بشكل عام.
ومن الأمثلة على استخراج البيانات التي ترتبط ارتباطًا وثيقًا بمعالجة البيانات هو تجاهل البيانات من مجموعة غير مرتبطة بالهدف: لنفترض أن هناك مجموعة بيانات متعلقة بولاية تكساس والهدف هو الحصول على إحصائيات عن سكان هيوستن، فإن البيانات الموجودة في المجموعة والمتعلقة بسكان دالاس ليست مفيدة للمجموعة ككل ويمكن إزالتها قبل المعالجة لتحسين كفاءة عملية استخراج البيانات.
فوائد
يمكن أن توفر معالجة البيانات المصممة جيدًا الفوائد التالية في سير العمل التحليلي:
- الاستعداد للتحليل وتحسين جودة البيانات. من خلال تحويل مجموعات البيانات إلى هياكل متسقة ومنظمة، تقلل عملية معالجة البيانات من التلاعب المخصص وتجعل نمذجة البيانات وتصورها أسهل. [ 6 ]
- إمكانية التكرار والتدقيق. يُتيح تسجيل عمليات التحويل كنصوص برمجية أو دفاتر ملاحظات إنشاء سجل واضح لكيفية إنتاج النتائج؛ وتُنشئ الأنظمة التفاعلية مثل Wrangler سجلات قابلة للتعديل ونصوص تحويل قابلة للتدقيق، مما يقلل من التحرير اليدوي لمرة واحدة. [ 7 ] [ 8 ]
- الكفاءة وإعادة الاستخدام. يمكن لأدوات المبادرة المختلطة استنتاج التحويلات المرشحة ودعم إعادة استخدام نصوص التحويل المحفوظة عند تحديث البيانات، مما يحسن الإنتاجية. [ 7 ]
- التكامل والإثراء. تساعد أدوات معالجة البيانات في دمج المصادر غير المتجانسة وإثراء السجلات عبر التوفيق أو خدمات الويب. على سبيل المثال، يدعم OpenRefine التجميع والتحويل والتوفيق مع المصادر الخارجية. [ 9 ]
ملاحظة: تعتمد الفوائد على توثيق الخطوات واستخدام سير العمل الخاضع للتحكم في الإصدارات؛ وإلا، فقد تستغرق عملية المعالجة وقتاً طويلاً وتكون عرضة للأخطاء. [ 8 ]
الأفكار الأساسية

الخطوات الرئيسية في معالجة البيانات هي كما يلي:
يصف هذا المصطلح الشامل كيفية فهم بياناتك. هذه هي الخطوة الأولى للتعرف على بياناتك.
- الهيكلة
- الخطوة التالية هي تنظيم البيانات. عادةً ما تكون البيانات الأولية غير منظمة، وقد لا يكون جزء كبير منها مفيدًا للمنتج النهائي. هذه الخطوة مهمة لتسهيل الحساب والتحليل في الخطوات اللاحقة.
- تنظيف
- توجد أشكال عديدة لتنظيف البيانات، منها على سبيل المثال اكتشاف التواريخ ذات التنسيق المختلف، وإزالة القيم الشاذة التي قد تؤثر على النتائج، بالإضافة إلى تنسيق القيم الفارغة . تُعد هذه الخطوة بالغة الأهمية لضمان الجودة الشاملة للبيانات.
- إثراء
- في هذه الخطوة، حدد ما إذا كانت البيانات الإضافية ستفيد مجموعة البيانات التي يمكن إضافتها بسهولة أم لا.
- التحقق من الصحة
- تُشبه هذه الخطوة عملية تنظيم البيانات وتنظيفها. استخدم تسلسلات متكررة من قواعد التحقق لضمان اتساق البيانات وجودتها وأمانها. ومن أمثلة قواعد التحقق التأكد من دقة الحقول عبر التحقق المتبادل من البيانات.
- نشر
- قم بإعداد مجموعة البيانات لاستخدامها لاحقًا، بما في ذلك استخدامها من قِبل المستخدمين أو البرامج. تأكد من توثيق جميع الخطوات والمنطق أثناء معالجة البيانات.
تُمثل هذه الخطوات عملية تكرارية تُفضي إلى مجموعة بيانات نظيفة وقابلة للاستخدام، يُمكن توظيفها لاحقًا في التحليل. ورغم أن هذه العملية شاقة، إلا أنها مُجزية، إذ تُمكّن المحللين من استخلاص المعلومات التي يحتاجونها من مجموعة بيانات ضخمة كانت ستظل غير قابلة للقراءة لولاها.
| اسم | هاتف | تاريخ الميلاد | ولاية |
|---|---|---|---|
| جون سميث | 445-881-4478 | 12 أغسطس 1989 | ولاية مين |
| جينيفر تال | +1-189-456-4513 | 11/12/1965 | Tx |
| بيل غيتس | (876)546-8165 | 15 يونيو 1972 | كانساس |
| آلان فيتش | 5493156648 | 2-6-1985 | أوه |
| جاكوب آلان | 156-4896 | 3 يناير | ألاباما |
| اسم | هاتف | تاريخ الميلاد | ولاية |
|---|---|---|---|
| جون سميث | 445-881-4478 | 12-08-1989 | ولاية مين |
| جينيفر تال | 189-456-4513 | 1965-11-12 | تكساس |
| بيل غيتس | 876-546-8165 | 15-06-1972 | كانساس |
| آلان فيتش | 549-315-6648 | 1985-02-06 | أوهايو |
أظهرت نتائج تطبيق عملية معالجة البيانات على هذه المجموعة الصغيرة من البيانات سهولةً ملحوظةً في قراءة البيانات. فقد تم تنسيق جميع الأسماء بنفس الطريقة (الاسم الأول الاسم الأخير)، وكذلك أرقام الهواتف (رمز المنطقة-XXX-XXXX)، والتواريخ (السنة-الشهر-اليوم)، ولم تعد الولايات مختصرة. أما بيانات جاكوب آلان، فكانت ناقصة (رمز المنطقة مفقود في رقم الهاتف، وتاريخ الميلاد غير مذكور فيه السنة)، لذا تم استبعادها من مجموعة البيانات. والآن، بعد تنظيف مجموعة البيانات وجعلها قابلة للقراءة، أصبحت جاهزةً للاستخدام أو التقييم.
الاستخدام النموذجي
يتم تطبيق تحويلات البيانات عادةً على كيانات متميزة (مثل الحقول والصفوف والأعمدة وقيم البيانات وما إلى ذلك) داخل مجموعة البيانات، ويمكن أن تشمل إجراءات مثل الاستخراج والتحليل والربط والتوحيد والتوسيع والتنظيف والدمج والتصفية لإنشاء مخرجات معالجة البيانات المطلوبة التي يمكن الاستفادة منها في المراحل اللاحقة.
قد يكون المتلقون أفرادًا، مثل مهندسي البيانات أو علماء البيانات الذين سيقومون بدراسة البيانات بشكل أكبر، أو مستخدمي الأعمال الذين سيستهلكون البيانات مباشرة في التقارير، أو الأنظمة التي ستقوم بمعالجة البيانات بشكل أكبر وكتابتها في أهداف مثل مستودعات البيانات أو بحيرات البيانات أو التطبيقات النهائية.
أسلوب العمل
بحسب كمية البيانات الواردة وتنسيقها، جرت العادة على معالجة البيانات يدويًا (مثلًا باستخدام جداول البيانات كبرنامج Excel)، أو باستخدام أدوات مثل KNIME ، أو عبر برامج نصية بلغات مثل Python أو SQL . وتُستخدم لغة R ، الشائعة في استخراج البيانات وتحليلها الإحصائي، أحيانًا في معالجة البيانات أيضًا. [ 10 ] يمتلك معالجو البيانات عادةً مهارات في لغات مثل R أو Python، وSQL، وPHP، وScala، وغيرها من اللغات المستخدمة في تحليل البيانات.
طُوِّرت أنظمة معالجة البيانات المرئية لتسهيل عملية معالجة البيانات لغير المبرمجين، وتبسيطها للمبرمجين. تتضمن بعض هذه الأنظمة أيضًا أنظمة توصية مدمجة تعمل بالذكاء الاصطناعي ، وميزات البرمجة بالأمثلة لتوفير مساعدة للمستخدم، وتقنيات توليف البرامج لإنشاء شفرة تدفق بيانات قابلة للتوسع تلقائيًا. من بين النماذج الأولية لأدوات معالجة البيانات المرئية OpenRefine ونظام البحث Wrangler التابع لجامعتي ستانفورد وبيركلي ؛ [ 11 ] وقد تطور الأخير ليصبح Trifacta .
وقد تضمنت المصطلحات الأخرى لهذه العمليات امتياز البيانات، [ 12 ] وإعداد البيانات ، ومعالجة البيانات.
مثال
إذا كان لديك مجموعة بيانات تحتوي على معلومات عن المرضى، فإن هدفك هو إيجاد علاقة بين مرض معين وحالة صحية معينة. قبل البدء في تحليل البيانات، تأكد من فهمك للنتيجة، هل تبحث عن مرضى مصابين بالمرض؟ هل هناك أمراض أخرى قد تكون السبب؟ بمجرد فهم النتيجة، يمكنك البدء في معالجة البيانات.
ابدأ بتحديد بنية النتيجة، وما هو المهم لفهم تشخيص المرض.
بمجرد تحديد الهيكل النهائي، قم بتنظيف البيانات عن طريق إزالة أي نقاط بيانات غير مفيدة أو مشوهة، وقد يشمل ذلك المرضى الذين لم يتم تشخيص إصابتهم بأي مرض.
بعد تنظيف البيانات، ألقِ نظرة عليها مرة أخرى، هل هناك أي معلومات يمكن إضافتها إلى مجموعة البيانات المعروفة مسبقًا والتي من شأنها أن تفيدها؟ على سبيل المثال، يمكن الاطلاع على أكثر الأمراض شيوعًا في المنطقة، حيث تختلف أمريكا والهند اختلافًا كبيرًا فيما يتعلق بأكثر الأمراض شيوعًا.
والآن تأتي خطوة التحقق، وتحديد قواعد التحقق التي يجب التحقق من صحة نقاط البيانات الخاصة بها، وقد يشمل ذلك تاريخ الميلاد أو التحقق من أمراض معينة.
بعد خطوة التحقق، ينبغي تنظيم البيانات وإعدادها إما للتطبيق أو للتقييم. تُعدّ هذه العملية مفيدة لتحديد الارتباطات في تشخيص الأمراض، إذ تُقلّص كمية البيانات الهائلة إلى بيانات يسهل تحليلها للوصول إلى نتائج دقيقة.
انظر أيضاً
مراجع
- ↑ "ما هي عملية معالجة البيانات؟" . مؤرشف من الأصل بتاريخ 18-08-2013 . تم الاطلاع عليه بتاريخ 21-01-2022 .
- ↑ "مونغ" . مونغ . ملف المصطلحات . مؤرشف من الأصل بتاريخ 18-09-2012 . تم الاطلاع عليه بتاريخ 10-10-2012 .
- ↑ كما أن المبرمج يرمز إلى الكود، فإن X يرمز إلى البيانات. مؤرشف بتاريخ 15 أبريل 2021 في أرشيف الإنترنت ، منشور مدونة مؤسسة المعرفة المفتوحة
- ↑ بارسونز، إم إيه؛ برودزيك، إم جيه؛ راتر، إن جيه (2004). "إدارة البيانات لتجربة عمليات الأراضي الباردة: تحسين العلوم الهيدرولوجية" . العمليات الهيدرولوجية . 18 (18): 3637-3653 . Bibcode : 2004HyPr...18.3637P . doi : 10.1002/hyp.5801 . S2CID 129774847 .
- ↑ "إعادة التفكير في استراتيجية البيانات وتكاملها من أجل الذكاء الاصطناعي: المفاهيم والفرص والتحديات" .
- ↑ ويكهام، هادلي (2014). "البيانات المنظمة" . مجلة البرمجيات الإحصائية . 59 (10). doi : 10.18637/jss.v059.i10 .
- 1 2 كاندل، شون؛ بايبك، أندرياس؛ هيلرستين، جوزيف م.؛ هير، جيفري (2011). "Wrangler: مواصفات مرئية تفاعلية لنصوص تحويل البيانات" (ملف PDF) . وقائع مؤتمر SIGCHI حول العوامل البشرية في أنظمة الحوسبة . الصفحات 3363-3372 . doi : 10.1145/1978942.1979444 .
- 1 2 ساندفي، جير كجيتيل؛ نيكروتنكو، أنطون؛ تايلور، جيمس. هوفيج، إيفيند (2013). "عشر قواعد بسيطة للأبحاث الحسابية القابلة للتكرار" . PLOS علم الأحياء الحسابي . 9 (10) هـ1003285. بيب كود : 2013PLSCB...9E3285S . دوى : 10.1371/journal.pcbi.1003285 . بمك 3812051 .
- ↑ "وثائق OpenRefine" . OpenRefine . 29 ديسمبر 2022. تم الاطلاع عليه بتاريخ 15 أغسطس 2025 .
- ↑ ويكهام، هادلي؛ غروليموند، غاريت (2016). "الفصل 9: مقدمة في معالجة البيانات". لغة R لعلوم البيانات: استيراد البيانات، وتنظيمها، وتحويلها، وتصورها، ونمذجتها ( الطبعة الأولى). سيباستوبول، كاليفورنيا: أورايلي. ISBN 978-1-4919-1039-9أُرشف من المصدر الأصلي بتاريخ 11 أكتوبر 2021. تم الاطلاع عليه بتاريخ 12 يناير 2022 .
- ↑ كاندل، شون؛ بايبك، أندرياس (مايو 2011). "Wrangler: تحديد مرئي تفاعلي لنصوص تحويل البيانات". وقائع مؤتمر SIGCHI حول العوامل البشرية في أنظمة الحوسبة . الصفحات 3363-3372 . doi : 10.1145/1978942.1979444 . ISBN 978-1-4503-0228-9. S2CID 11133756 .
- ↑ ما هو امتياز البيانات؟ (2003 و2017 IRI ) مؤرشف بتاريخ 15 أبريل 2021 في أرشيف الإنترنت
روابط خارجية
- "ما هي معالجة البيانات؟ فوائدها وأدواتها ومهاراتها؟" . رحلتي كمؤثر . تم الاطلاع عليه بتاريخ 26 يناير 2022 .
- رسم خرائط البيانات
