خوارزمية Datafly

خوارزمية Datafly هي خوارزمية تُستخدم لإخفاء هوية البيانات الطبية. طُوّرت هذه الخوارزمية بواسطة لاتانيا أرفيت سويني في الفترة ما بين عامي 1997 و 1998. [ 1 ] [ 2 ] يتحقق إخفاء الهوية من خلال التعميم التلقائي للمعلومات واستبدالها وإدراجها وحذفها حسب الحاجة، دون فقدان الكثير من التفاصيل الموجودة في البيانات. يمكن استخدام هذه الطريقة بشكل فوري في أنظمة الأمان القائمة على الأدوار داخل المؤسسة، وفي وضع المعالجة الدفعية لتصدير البيانات منها. تقوم المؤسسات بنشر واستلام البيانات الطبية بعد إزالة جميع المعرّفات الصريحة - مثل الاسم - ظنًا منها خطأً أن سرية المريض محفوظة لأن البيانات الناتجة تبدو مجهولة الهوية. مع ذلك، يمكن استخدام البيانات المتبقية لإعادة تحديد هوية الأفراد من خلال ربط البيانات بقواعد بيانات أخرى أو مطابقتها معها، أو من خلال البحث عن خصائص فريدة موجودة في حقول وسجلات قاعدة البيانات نفسها .

تعرضت خوارزمية Datafly لانتقادات لمحاولتها تحقيق إخفاء الهوية من خلال التعميم المفرط. إذ تختار الخوارزمية السمة التي تحتوي على أكبر عدد من القيم المميزة لتكون أول ما يتم تعميمه. [ 3 ]

الخوارزمية الأساسية

يُعرض أدناه مخطط لخوارزمية Datafly. [ 4 ]

المدخلات : جدول خاصPT؛ مُعرِّف شبهي QI = ( A1 , ..., An قيد إخفاء الهوية k ؛ تسلسلات تعميم المجال DGH Ai ، حيث i = 1, ..., n مع الدوال المصاحبة fAi ، ودالة الخسارة، وهي حدٌّ لنسبة الصفوف التي يمكن إخفاؤها. PT[id] هي مجموعة المعرّفات أو المفاتيح الفريدة لكل صف.

الناتج : MGT هو تعميم لـ PT[QI] يفرضإخفاء الهوية من الدرجة k

يفترض ما يلي : |PT| ≤ k ، و loss * |PT| = k

خوارزمية Datafly :

// إنشاء قائمة ترددات تحتوي على تسلسلات فريدة من القيم عبر المعرف شبه المحدد في PT،

// بالإضافة إلى عدد مرات ظهور كل تسلسل.

1. ليكن freq متجهًا قابلًا للتوسيع والطي، ولا يحتوي على أي عناصر في البداية. كل عنصر فيه على الصورة (QI, frequency, SID)، حيث SID = { id i  : ∃ t [ id ] ∈ [ id ] ⇒ t [ id ] = id i }؛ و frequency = |SID|. بالتالي، يمكن الوصول إلى freq أيضًا كجدول على (QI, frequency, SID).
2. دع pos{\displaystyle \gets }0، المجموع{\displaystyle \gets }0
3. طالما أن المجموع ≠ |PT|
3.1 تردد[موضع]{\displaystyle \gets }( t [QI], occurs, SID ) حيث t [QI] ∈ [QI], ( t [ QI ],__, ___ ){\displaystyle \not \in }التكرار = |PT| - |PT[QI] – { t [QI]}|؛ و SID = { id i  : ∃ t [ id ]{\displaystyle \gets }PT[id] ⇒ t [ id ] = id i }
3.2 نقطة{\displaystyle \gets }الموضع + 1، المجموع{\displaystyle \gets }المجموع + يحدث
// قم بإيجاد حل من خلال تعميم السمة التي تحتوي على أكبر عدد من القيم المميزة
// وحذف ما لا يزيد عن العدد المسموح به من الصفوف.
4. دع أدناه{\displaystyle \gets }0
5. لـ pos{\displaystyle \gets }1 إلى |freq| do
5.1 ( __, count ){\displaystyle \gets }التردد[الموضع]
5.2 إذا كان العدد < فقم بما يلي:
5.2.1 أدناه{\displaystyle \gets }أسفل k + عدد
6. إذا كان أقل من k > فقم بما يلي: // ملاحظة: الخسارة * |PT| = k .
6.1 تردد{\displaystyle \gets }تعميم(التردد)
6.2 انتقل إلى الخطوة 4
7. وإلا فافعل
// تحقق: عدد الصفوف المراد حذفها في التردد ≤ الخسارة * |PT|
7.1 تردد{\displaystyle \gets }suppress(req, belowk )
7.2 مليون طن{\displaystyle \gets }إعادة بناء (التردد)
8. إعادة إدارة الشركة.

مراجع

  1. لاتانيا سويني. "داتا فلاي: نظام لتوفير إخفاء الهوية في البيانات الطبية" . تم الاطلاع عليه بتاريخ 19 يناير 2014 .
  2. ل. سويني، داتا فلاي: نظام لتوفير إخفاء الهوية في البيانات الطبية. أمن قواعد البيانات، الحادي عشر: الوضع الراهن والآفاق، تي. لين وإس. تشيان (محرران)، إلسيفير ساينس، أمستردام، 1998.
  3. شيونغ، لي . "إخفاء هوية البيانات - خوارزميات التعميم" (ملف PDF) . مؤرشف من الأصل (ملف PDF) بتاريخ 16 يناير 2014. تم الاطلاع عليه بتاريخ 19 يناير 2014 .
  4. لاتانيا سويني (2001). التحكم في الكشف الحاسوبي: مدخل إلى حماية خصوصية البيانات (أطروحة). معهد ماساتشوستس للتكنولوجيا. ص 113. hdl : 1721.1/8589 .