تنظيف البيانات

تنظيف البيانات هو عملية تحديد وتصحيح (أو إزالة) السجلات التالفة أو غير الدقيقة أو غير ذات الصلة من مجموعة بيانات أو جدول أو قاعدة بيانات . وتشمل هذه العملية اكتشاف الأجزاء غير المكتملة أو غير الصحيحة أو غير الدقيقة من البيانات، ثم استبدالها أو تعديلها أو حذفها. [ 1 ] يمكن إجراء تنظيف البيانات بشكل تفاعلي باستخدام أدوات معالجة البيانات ، أو من خلال المعالجة الدفعية، غالبًا عبر البرامج النصية أو جدار حماية جودة البيانات .

بعد تنظيف البيانات ، ينبغي أن تكون متسقة مع مجموعات البيانات المماثلة الأخرى في النظام. قد تكون حالات عدم الاتساق التي تم اكتشافها أو إزالتها ناتجة في الأصل عن أخطاء في إدخال المستخدم، أو عن تلف في عملية النقل أو التخزين، أو عن اختلاف تعريفات قاموس البيانات للكيانات المتشابهة في قواعد البيانات المختلفة. يختلف تنظيف البيانات عن التحقق من صحتها في أن التحقق من الصحة يعني في الغالب رفض البيانات من النظام عند إدخالها، ويتم إجراؤه في وقت الإدخال نفسه، وليس على دفعات من البيانات.

قد تتضمن عملية تنظيف البيانات إزالة الأخطاء المطبعية أو التحقق من صحة القيم وتصحيحها بناءً على قائمة معروفة من الكيانات. قد يكون التحقق دقيقًا (مثل رفض أي عنوان لا يحتوي على رمز بريدي صحيح )، أو قد يكون تقريبيًا ( مثل تصحيح السجلات التي تتطابق جزئيًا مع سجلات موجودة ومعروفة). تقوم بعض حلول تنظيف البيانات بتنظيفها عن طريق التحقق المتبادل مع مجموعة بيانات مُدققة. من الممارسات الشائعة في تنظيف البيانات تحسينها، حيث تُصبح البيانات أكثر اكتمالًا بإضافة معلومات ذات صلة. على سبيل المثال، إضافة أرقام الهواتف المرتبطة بالعناوين. قد يشمل تنظيف البيانات أيضًا توحيدها (أو تطبيعها)، وهي عملية دمج بيانات ذات "تنسيقات ملفات واتفاقيات تسمية وأعمدة مختلفة" [ 2 ] وتحويلها إلى مجموعة بيانات متماسكة واحدة؛ ومن الأمثلة البسيطة على ذلك توسيع الاختصارات ("st, rd, etc." إلى "street, road, etcetera").

تحفيز

قد تؤدي البيانات غير الدقيقة أو المتضاربة إداريًا إلى استنتاجات خاطئة وتوجيه الاستثمارات بشكل مضلل في القطاعين العام والخاص. على سبيل المثال، قد ترغب الحكومة في تحليل بيانات التعداد السكاني لتحديد المناطق التي تحتاج إلى مزيد من الإنفاق والاستثمار في البنية التحتية والخدمات. في هذه الحالة، من المهم الحصول على بيانات موثوقة لتجنب القرارات المالية الخاطئة. أما في عالم الأعمال، فقد تكون البيانات غير الدقيقة مكلفة. تستخدم العديد من الشركات قواعد بيانات معلومات العملاء التي تسجل بيانات مثل معلومات الاتصال والعناوين والتفضيلات. على سبيل المثال، إذا كانت العناوين غير متطابقة، ستتكبد الشركة تكلفة إعادة إرسال البريد أو حتى خسارة العملاء.

جودة البيانات

يجب أن تستوفي البيانات عالية الجودة مجموعة من معايير الجودة، وتشمل هذه المعايير ما يلي:

  • الصلاحية : مدى توافق المقاييس مع قواعد العمل أو القيود المحددة. (انظر أيضًا الصلاحية (الإحصاء) ). عند استخدام تقنية قواعد البيانات الحديثة لتصميم أنظمة جمع البيانات، يصبح ضمان الصلاحية أمرًا سهلاً نسبيًا: تنشأ البيانات غير الصالحة بشكل رئيسي في الأنظمة القديمة (حيث لم تُطبَّق القيود في البرمجيات) أو عند استخدام تقنية جمع بيانات غير مناسبة (مثل جداول البيانات، حيث يصعب جدًا تقييد ما يختاره المستخدم لإدخاله في خلية ما، في حال عدم استخدام التحقق من صحة الخلية). تندرج قيود البيانات ضمن الفئات التالية:
    • قيود نوع البيانات : يجب أن تكون القيم في عمود معين من نوع بيانات معين، على سبيل المثال، منطقي، رقمي (عدد صحيح أو حقيقي)، تاريخ.
    • قيود النطاق: عادةً، يجب أن تقع الأرقام أو التواريخ ضمن نطاق معين. أي أن لها قيماً دنيا و/أو قصوى مسموح بها.
    • القيود الإلزامية: يجب ألا تكون بعض الأعمدة فارغة.
    • القيود الفريدة: يجب أن يكون الحقل، أو مجموعة الحقول، فريدًا عبر مجموعة البيانات. لا يجوز أن يكون لشخصين نفس رقم الضمان الاجتماعي (أو أي مُعرّف فريد آخر).
    • قيود عضوية المجموعة : تأتي قيم العمود من مجموعة من القيم أو الرموز المنفصلة. على سبيل المثال، قد يكون جنس الشخص أنثى أو ذكرًا أو غير ثنائي.
    • قيود المفتاح الخارجي : هذا هو الشكل الأكثر عمومية لعضوية المجموعة. تُعرَّف مجموعة القيم في عمود ما في عمود آخر من جدول يحتوي على قيم فريدة. على سبيل المثال، في قاعدة بيانات دافعي الضرائب في الولايات المتحدة، يُشترط أن ينتمي عمود "الولاية" إلى إحدى الولايات أو الأقاليم الأمريكية المُحدَّدة: تُسجَّل مجموعة الولايات والأقاليم المسموح بها في جدول منفصل. مصطلح " المفتاح الخارجي" مُستعار من مصطلحات قواعد البيانات العلائقية.
    • أنماط التعبيرات النمطية : في بعض الأحيان، يجب التحقق من صحة حقول النصوص بهذه الطريقة. على سبيل المثال، قد يُشترط أن تحتوي أرقام الهواتف في أمريكا الشمالية على النمط 999-999–9999.
    • التحقق من صحة البيانات عبر الحقول : يجب استيفاء شروط معينة عند استخدام حقول متعددة. على سبيل المثال، في الطب المخبري، يجب أن يساوي مجموع مكونات تعداد خلايا الدم البيضاء التفريقي 100 (لأنها جميعًا نسب مئوية). في قاعدة بيانات المستشفى، لا يمكن أن يكون تاريخ خروج المريض من المستشفى أقدم من تاريخ دخوله.
  • الدقة : هي درجة مطابقة القياس لمعيار أو قيمة حقيقية. (انظر أيضًا: الدقة والضبط ). يصعب تحقيق الدقة من خلال تنقية البيانات في الحالة العامة، لأنها تتطلب الوصول إلى مصدر بيانات خارجي يحتوي على القيمة الحقيقية، وغالبًا ما تكون هذه البيانات المرجعية غير متوفرة. وقد تحققت الدقة في بعض سياقات تنقية البيانات، لا سيما بيانات الاتصال بالعملاء، باستخدام قواعد بيانات خارجية تربط الرموز البريدية بالمواقع الجغرافية (المدينة والولاية)، وتساعد أيضًا في التحقق من وجود عناوين الشوارع داخل هذه الرموز البريدية.
  • الاكتمال : مدى معرفة جميع المقاييس المطلوبة. يكاد يكون من المستحيل معالجة النقص في البيانات باستخدام منهجية تنظيف البيانات: إذ لا يمكن استنتاج حقائق لم تُسجّل عند تسجيل البيانات المعنية في البداية. (في بعض السياقات، كبيانات المقابلات مثلاً، قد يكون من الممكن معالجة النقص بالرجوع إلى المصدر الأصلي للبيانات، أي إعادة مقابلة الشخص المعني، ولكن حتى هذا لا يضمن النجاح بسبب مشاكل التذكر - على سبيل المثال، في مقابلة لجمع بيانات عن استهلاك الطعام، من غير المرجح أن يتذكر أحد بالضبط ما تناوله قبل ستة أشهر. في حالة الأنظمة التي تشترط عدم فراغ أعمدة معينة، يمكن تجاوز المشكلة بتحديد قيمة تشير إلى "غير معروف" أو "مفقود"، ولكن إدخال القيم الافتراضية لا يعني اكتمال البيانات).
  • الاتساق : هو مدى تكافؤ مجموعة من المقاييس عبر الأنظمة المختلفة. (انظر أيضًا: الاتساق ). يحدث التناقض عندما يتعارض عنصران من عناصر البيانات في مجموعة البيانات: على سبيل المثال، يُسجّل عميل في نظامين مختلفين بعنوانين حاليين مختلفين، ولا يمكن أن يكون إلا أحدهما صحيحًا. لا يُمكن دائمًا معالجة التناقض، إذ يتطلب ذلك استراتيجيات متنوعة، مثل تحديد البيانات التي سُجّلت مؤخرًا، وتحديد مصدر البيانات الأكثر موثوقية (قد تكون هذه المعلومة خاصة بمؤسسة معينة)، أو ببساطة محاولة الوصول إلى الحقيقة من خلال اختبار كلا عنصري البيانات (مثل الاتصال بالعميل).
  • التوحيد : هو مدى تحديد مجموعة من مقاييس البيانات باستخدام نفس وحدات القياس في جميع الأنظمة. (انظر أيضًا وحدة القياس ). في مجموعات البيانات المجمعة من مواقع مختلفة، قد يتم تسجيل الوزن إما بالرطل أو الكيلوغرام، ويجب تحويله إلى وحدة قياس واحدة باستخدام تحويل حسابي.

يشمل مصطلح "السلامة" الدقة والاتساق وبعض جوانب التحقق (انظر أيضًا سلامة البيانات ولكنه نادرًا ما يُستخدم بمفرده في سياقات تنظيف البيانات لعدم كفايته في التحديد. (على سبيل المثال، يُستخدم مصطلح " السلامة المرجعية " للإشارة إلى تطبيق قيود المفتاح الخارجي المذكورة أعلاه).

عملية

  • تدقيق البيانات : تُدقق البيانات باستخدام الأساليب الإحصائية وقواعد البيانات للكشف عن الشذوذات والتناقضات، مما يُحدد خصائص هذه الشذوذات ومواقعها. تتيح لك العديد من حزم البرامج التجارية تحديد قيود متنوعة (باستخدام قواعد نحوية تتوافق مع لغة برمجة قياسية، مثل جافا سكريبت أو فيجوال بيسك )، ثم تُنشئ رمزًا برمجيًا يتحقق من البيانات للتأكد من عدم انتهاك هذه القيود. يُشار إلى هذه العملية أدناه في النقطتين "تحديد سير العمل" و"تنفيذ سير العمل". بالنسبة للمستخدمين الذين لا يملكون إمكانية الوصول إلى برامج تنظيف البيانات المتطورة، تتيح لهم حزم قواعد بيانات الحواسيب الصغيرة، مثل مايكروسوفت أكسس أو فايل ميكر برو، إجراء هذه الفحوصات، قيدًا قيدًا، بشكل تفاعلي، مع الحاجة إلى برمجة قليلة أو معدومة في كثير من الحالات.
  • تحديد سير العمل : يتم الكشف عن الحالات الشاذة وإزالتها من خلال سلسلة من العمليات على البيانات تُعرف بسير العمل. ويتم تحديده بعد عملية تدقيق البيانات، وهو أمر بالغ الأهمية للحصول على منتج نهائي من البيانات عالية الجودة. ولتحقيق سير عمل سليم، يجب دراسة أسباب الحالات الشاذة والأخطاء في البيانات بدقة.
  • تنفيذ سير العمل : في هذه المرحلة، يُنفَّذ سير العمل بعد اكتمال مواصفاته والتحقق من صحته. يجب أن يكون تنفيذ سير العمل فعالاً، حتى مع مجموعات البيانات الكبيرة، وهو ما يفرض حتماً مفاضلة، لأن تنفيذ عملية تنظيف البيانات قد يكون مكلفاً حسابياً.
  • المعالجة اللاحقة والتحقق : بعد تنفيذ عملية تنظيف البيانات، تُفحص النتائج للتأكد من صحتها. تُصحح البيانات التي لم يُمكن تصحيحها أثناء تنفيذ العملية يدويًا، إن أمكن. ينتج عن ذلك دورة جديدة في عملية تنظيف البيانات، حيث تُراجع البيانات مرة أخرى لتحديد مسار عمل إضافي لتنظيف البيانات بشكل أكبر من خلال المعالجة الآلية.

ترتبط جودة البيانات المصدرية ارتباطًا وثيقًا بثقافة جودة البيانات، ويجب أن تبدأ هذه الثقافة من أعلى مستويات المؤسسة. ولا يقتصر الأمر على تطبيق إجراءات تحقق قوية على شاشات الإدخال، لأنه مهما بلغت قوة هذه الإجراءات، فإنه غالبًا ما يمكن للمستخدمين تجاوزها. يوجد دليل من تسع خطوات للمؤسسات الراغبة في تحسين جودة البيانات: [ 3 ] [ 4 ]

  • أعلن عن التزام رفيع المستوى بثقافة جودة البيانات
  • قيادة إعادة هندسة العمليات على المستوى التنفيذي
  • أنفق المال لتحسين بيئة إدخال البيانات
  • أنفق المال لتحسين تكامل التطبيقات
  • أنفق المال لتغيير طريقة عمل العمليات
  • تعزيز الوعي الشامل للفريق
  • تعزيز التعاون بين الإدارات
  • الاحتفال علنًا بتميز جودة البيانات
  • قياس جودة البيانات وتحسينها باستمرار

ومن بينها:

  • التحليل النحوي : يُستخدم لاكتشاف أخطاء بناء الجملة. يحدد المحلل النحوي ما إذا كانت سلسلة البيانات مقبولة ضمن مواصفات البيانات المسموح بها. وهذا مشابه لطريقة عمل المحلل النحوي مع القواعد واللغات.
  • تحويل البيانات : يسمح تحويل البيانات بتحويل البيانات من تنسيقها الأصلي إلى التنسيق الذي يتوقعه التطبيق المناسب. ويشمل ذلك تحويل القيم أو وظائف الترجمة، بالإضافة إلى توحيد القيم العددية لتتوافق مع القيم الدنيا والقصوى.
  • إزالة البيانات المكررة : يتطلب اكتشاف البيانات المكررة خوارزمية لتحديد ما إذا كانت البيانات تحتوي على تمثيلات مكررة لنفس الكيان. عادةً ما يتم فرز البيانات باستخدام مفتاح يُقرّب الإدخالات المكررة من بعضها البعض لتسريع عملية التعرف عليها.
  • الأساليب الإحصائية : من خلال تحليل البيانات باستخدام قيم المتوسط ، والانحراف المعياري ، والمدى ، أو خوارزميات التجميع ، يُمكن للخبير اكتشاف قيم غير متوقعة، وبالتالي خاطئة. ورغم صعوبة تصحيح هذه البيانات لعدم معرفة القيمة الحقيقية، إلا أنه يُمكن حل المشكلة بتعيين القيم إلى متوسط ​​أو قيمة إحصائية أخرى. كما يُمكن استخدام الأساليب الإحصائية للتعامل مع القيم المفقودة، والتي يُمكن استبدالها بقيمة أو أكثر من القيم المعقولة، والتي عادةً ما يتم الحصول عليها من خلال خوارزميات تضخيم البيانات المتقدمة .

نظام

تتمثل المهمة الأساسية لهذا النظام في إيجاد توازن بين إصلاح البيانات غير الدقيقة والحفاظ على البيانات أقرب ما يمكن إلى البيانات الأصلية من نظام الإنتاج المصدر. ويُمثل هذا تحديًا لمهندس استخراج البيانات وتحويلها وتحميلها . ينبغي أن يوفر النظام بنية قادرة على تنظيف البيانات، وتسجيل أحداث الجودة، وقياس جودة البيانات في مستودع البيانات والتحكم بها . ومن الخطوات الجيدة البدء بإجراء تحليل شامل لخصائص البيانات ، مما يُساعد في تحديد مدى تعقيد نظام تنظيف البيانات المطلوب، ويُعطي فكرة عن جودة البيانات الحالية في النظام (الأنظمة) المصدر.

شاشات عالية الجودة

يتضمن نظام تنقية البيانات مجموعة من المرشحات التشخيصية المعروفة باسم شاشات الجودة. تُجري كل شاشة اختبارًا في تدفق البيانات، وفي حال فشله، يتم تسجيل خطأ في مخطط أحداث الخطأ. تُقسم شاشات الجودة إلى ثلاث فئات:

  • شاشات الأعمدة. اختبار العمود الفردي، على سبيل المثال بحثًا عن قيم غير متوقعة مثل القيم الفارغة ؛ والقيم غير الرقمية التي يجب أن تكون رقمية؛ والقيم الخارجة عن النطاق؛ وما إلى ذلك.
  • شاشات البنية. تُستخدم هذه الشاشات لاختبار سلامة العلاقات المختلفة بين الأعمدة (عادةً المفاتيح الخارجية/الأساسية) في نفس الجدول أو جداول مختلفة. كما تُستخدم لاختبار صحة مجموعة من الأعمدة وفقًا لتعريف بنيوي معين يجب أن تلتزم به.
  • شاشات قواعد العمل. تُعدّ هذه الاختبارات الأكثر تعقيدًا من بين الاختبارات الثلاثة. فهي تتحقق من مدى توافق البيانات، ربما عبر جداول متعددة، مع قواعد عمل محددة. على سبيل المثال، إذا صُنِّف عميل ما ضمن نوع معين من العملاء، فيجب الالتزام بقواعد العمل التي تُعرّف هذا النوع من العملاء.

عندما يسجل نظام مراقبة الجودة خطأً، يمكنه إما إيقاف عملية تدفق البيانات، أو إرسال البيانات المعيبة إلى مكان آخر غير النظام المستهدف، أو تصنيف البيانات. يُعتبر الخيار الأخير الحل الأمثل، لأن الخيار الأول يتطلب معالجة المشكلة يدويًا في كل مرة تحدث، بينما يشير الخيار الثاني إلى فقدان البيانات من النظام المستهدف ( مخاطر تتعلق بالسلامة )، وغالبًا ما يكون مصير هذه البيانات غير واضح.

انتقاد الأدوات والعمليات الحالية

معظم أدوات تنظيف البيانات تعاني من قيود في سهولة الاستخدام:

  • تكاليف المشروع : تتراوح التكاليف عادةً بمئات الآلاف من الدولارات
  • الوقت : إن إتقان برامج تنظيف البيانات واسعة النطاق يستغرق وقتاً طويلاً.
  • الأمان : يتطلب التحقق المتبادل مشاركة المعلومات، مما يمنح التطبيق إمكانية الوصول عبر الأنظمة، بما في ذلك الأنظمة القديمة الحساسة.

مخطط أحداث الخطأ

يحتوي مخطط أحداث الخطأ على سجلات لجميع أحداث الخطأ التي تُصدرها شاشات الجودة. ويتألف من جدول حقائق أحداث الخطأ، الذي يحتوي على مفاتيح خارجية تُشير إلى ثلاثة جداول أبعاد تُمثل التاريخ (متى)، ووظيفة الدُفعة (أين)، والشاشة (من أصدر الخطأ). كما يحتوي على معلومات حول وقت حدوث الخطأ بدقة، ودرجة خطورته. بالإضافة إلى ذلك، يوجد جدول حقائق تفاصيل أحداث الخطأ، الذي يحتوي على مفتاح خارجي يُشير إلى الجدول الرئيسي، ويتضمن معلومات تفصيلية حول الجدول والسجل والحقل الذي حدث فيه الخطأ، وحالة الخطأ.

انظر أيضاً

مراجع

  1. وو، س. (2013)، "مراجعة حول بيانات الضمان التقريبية وتحليلها" (ملف PDF) ، هندسة الموثوقية والأنظمة ، 114 : 1-11 ، doi : 10.1016/j.ress.2012.12.021
  2. "مقدمة في البيانات: ما هو توحيد البيانات؟" . داتوراما . ١٤ أبريل ٢٠١٧. مؤرشف من الأصل في ٢٤ أكتوبر ٢٠٢١. تم الاطلاع عليه في ١٤ أغسطس ٢٠١٩ .
  3. كيمبال، ر.، روس، م.، ثورنثويت، و.، موندي، ج.، بيكر، ب. مجموعة أدوات دورة حياة مستودع البيانات ، وايلي للنشر، 2008. ISBN 978-0-470-14977-5
  4. أولسون، جيه إي، "جودة البيانات: بُعد الدقة"، مورغان كوفمان ، 2002. ISBN 1-55860-891-5

للمزيد من القراءة

  • ماكيني، ويس (2017). "تنظيف البيانات وإعدادها". بايثون لتحليل البيانات (  الطبعة الثانية). أورايلي. الصفحات 195-224 . ISBN  978-1-4919-5766-0.
  • فان دير لو، مارك؛ دي يونغ، إدوين (2018). تنظيف البيانات الإحصائية مع تطبيقات في لغة البرمجة R. هوبوكين: وايلي. ISBN 978-1-118-89715-7.
  • شيكو د، أونيتو ​​ل، تافاتزي إي (ديسمبر 2022). "إحدى عشرة نصيحة سريعة لتنظيف البيانات وهندسة الميزات" . مجلة PLOS لعلم الأحياء الحاسوبي . 18 (12) e1010718. رمز Bibcode : 2022PLSCB..18E0718C . doi : 10.1371/ journal.pcbi.1010718 . PMC 9754225. PMID 36520712. S2CID 254733288 .   
  • تشو، إكس.؛ إلياس، آي إف؛ كريشنان، إس.؛ وانغ، جيه. (2016)، "تنظيف البيانات"، وقائع المؤتمر الدولي لإدارة البيانات لعام 2016 ، ACM، الصفحات 2201-2206 ، doi : 10.1145/2882903.2912574 ، ISBN  978-1-4503-3531-7
  • كوتيه، ب.-أ.؛ نيكانجام، أ.؛ أحمد، ن.؛ هومينيوك، د.؛ خوم، ف. (2024)، "تنظيف البيانات والتعلم الآلي: مراجعة منهجية للأدبيات"، هندسة البرمجيات الآلية ، 31 (2)، سبرينغر ساينس آند بيزنس ميديا، arXiv : 2310.01765 ، doi : 10.1007/s10515-024-00453-w
  • عالم الكمبيوتر: تنظيف البيانات (10 فبراير 2003)