بيانات اصطناعية

البيانات الاصطناعية هي بيانات مُولَّدة اصطناعياً وليست ناتجة عن أحداث واقعية. وعادةً ما يتم إنشاؤها باستخدام خوارزميات، ويمكن استخدام البيانات الاصطناعية للتحقق من صحة النماذج الرياضية وتدريب نماذج التعلم الآلي . [ 1 ]

يمكن اعتبار البيانات المُولَّدة بواسطة محاكاة حاسوبية بيانات اصطناعية. ويشمل ذلك معظم تطبيقات النمذجة الفيزيائية، مثل مُركِّبات الموسيقى أو مُحاكيات الطيران. يُقارب ناتج هذه الأنظمة الواقع، ولكنه مُولَّد بالكامل بواسطة خوارزمية.

تُستخدم البيانات الاصطناعية في مجالات متنوعة كمرشح للمعلومات التي قد تُعرّض سرية جوانب معينة من البيانات للخطر. في العديد من التطبيقات الحساسة، توجد مجموعات البيانات نظريًا ولكن لا يمكن نشرها للعامة؛ [ 2 ] وتتجنب البيانات الاصطناعية مشكلات الخصوصية الناجمة عن استخدام معلومات المستهلكين الحقيقية دون إذن أو تعويض.

فائدة

تُولَّد البيانات الاصطناعية لتلبية احتياجات محددة أو شروط معينة قد لا توجد في البيانات الأصلية الحقيقية. ومن بين العقبات التي تواجه تطبيق أساليب التعلّم الآلي الحديثة في المهام العلمية المعقدة، ندرة البيانات المصنفة، وهي فجوة تُسدُّ بفعالية باستخدام البيانات الاصطناعية التي تحاكي البيانات التجريبية الحقيقية بدقة . [ 3 ] ويمكن أن يكون هذا مفيدًا عند تصميم العديد من الأنظمة، بدءًا من المحاكاة القائمة على القيمة النظرية، وصولًا إلى معالجات قواعد البيانات، وما إلى ذلك. ويساعد ذلك في اكتشاف المشكلات غير المتوقعة وحلها، مثل قيود معالجة المعلومات. غالبًا ما تُولَّد البيانات الاصطناعية لتمثيل البيانات الأصلية، مما يسمح بوضع خط أساس. [ 4 ] ومن فوائد البيانات الاصطناعية الأخرى حماية خصوصية وسرية البيانات الأصلية، مع السماح في الوقت نفسه باستخدامها في اختبار الأنظمة.

يزعم خبراء أمن الحاسوب أن البيانات الاصطناعية المُولَّدة "... تُمكّننا من إنشاء ملفات تعريف سلوكية واقعية للمستخدمين والمهاجمين. تُستخدم هذه البيانات لتدريب نظام كشف الاحتيال نفسه، مما يُتيح التكيف اللازم للنظام مع بيئة مُحددة." [ 4 ] في السياقات الدفاعية والعسكرية، تُعتبر البيانات الاصطناعية أداة قيّمة لتطوير وتحسين أنظمة الذكاء الاصطناعي المُعقدة، لا سيما في البيئات التي يندر فيها توفر بيانات واقعية عالية الجودة. [ 5 ] في الوقت نفسه، تُتيح البيانات الاصطناعية، إلى جانب منهجية الاختبار، إمكانية نمذجة سيناريوهات العالم الحقيقي.

تاريخ

للنمذجة العلمية للأنظمة الفيزيائية تاريخ طويل يمتد بالتوازي مع تاريخ الفيزياء . فعلى سبيل المثال، يمكن تتبع أبحاث توليف الصوت والكلام إلى ثلاثينيات القرن العشرين وما قبلها، مدفوعةً بتطورات الهاتف وتقنيات تسجيل الصوت. وقد أدى التحول الرقمي إلى ظهور برامج توليف الصوت بدءًا من سبعينيات القرن العشرين .

في سياق التحليل الإحصائي الذي يحافظ على الخصوصية، ابتكر دونالد روبين في عام 1993 فكرة البيانات التركيبية الأصلية بالكامل . [ 6 ] صمم روبين هذه الفكرة في الأصل لتجميع إجابات الاستبيانات المطولة للتعداد السكاني العشري للأسر التي تستخدم الاستبيانات المختصرة. ثم نشر عينات لا تتضمن أي سجلات فعلية من الاستبيانات المطولة، وبذلك حافظ على سرية هوية الأسر. [ 7 ] وفي وقت لاحق من ذلك العام، ابتكر ليتل فكرة البيانات التركيبية الأصلية جزئيًا. استخدم ليتل هذه الفكرة لتجميع القيم الحساسة في ملف الاستخدام العام. [ 8 ]

في دراسة نُشرت عام 1993 [ 9 تم تطبيق نموذج إحصائي على 60,000 رقم من مجموعة بيانات MNIST ، ثم استُخدم هذا النموذج لتوليد أكثر من مليون مثال. استُخدمت هذه الأمثلة لتدريب شبكة LeNet-4 لتحقيق أداء متميز. [ 10 ] : 173

في عام ١٩٩٤، قدّم ستيفن فينبرغ "التحسين الحرج"، حيث يُستخدم توزيع تنبؤي خلفي بارامتري (بدلاً من إعادة التوزيع العشوائي لبايز) لإجراء عملية أخذ العينات. [ ٧ ] لاحقًا، ساهم كلٌّ من تريفيلور راغوناثان ، وجيري رايتر ، ودونالد روبين ، وجون إم. أبوود ، وجيم وودكوك ، بشكلٍ هام في تطوير توليد البيانات الاصطناعية . وقد توصلوا مجتمعين إلى حلٍّ لكيفية التعامل مع البيانات الاصطناعية جزئيًا التي تحتوي على بيانات مفقودة. وبالمثل، طوّروا تقنية الإسناد المتعدد المتغيرات بالانحدار المتسلسل . [ ٧ ]

الحسابات

يختبر الباحثون الإطار على بيانات اصطناعية، والتي تعتبر "المصدر الوحيد للحقيقة الأساسية التي يمكنهم من خلالها تقييم أداء خوارزمياتهم بموضوعية " . [ 11 ]

يمكن توليد بيانات اصطناعية باستخدام خطوط عشوائية ذات اتجاهات ومواقع بداية مختلفة. [ 12 ] قد تصبح مجموعات البيانات معقدة للغاية. ويمكن توليد مجموعة بيانات أكثر تعقيدًا باستخدام برنامج توليد البيانات. لإنشاء برنامج توليد البيانات، تُستخدم البيانات الأصلية أولًا لإنشاء نموذج أو معادلة تُناسب البيانات على أفضل وجه. يُطلق على هذا النموذج أو المعادلة اسم برنامج توليد البيانات. ويمكن استخدام هذا البرنامج لتوليد المزيد من البيانات. [ 13 ]

يتضمن بناء نموذج توليف البيانات إنشاء نموذج إحصائي . في مثال خط الانحدار الخطي ، يمكن رسم البيانات الأصلية، ثم إنشاء خط انحدار خطي يمثل أفضل مطابقة لها. هذا الخط هو نموذج توليف تم إنشاؤه من البيانات الأصلية. تتمثل الخطوة التالية في توليد المزيد من البيانات الاصطناعية من نموذج التوليف أو من معادلة خط الانحدار الخطي. بهذه الطريقة، يمكن استخدام البيانات الجديدة في الدراسات والأبحاث، مع الحفاظ على سرية البيانات الأصلية. [ 13 ]

يشرح ديفيد جنسن من مختبر اكتشاف المعرفة كيفية توليد البيانات الاصطناعية: "يحتاج الباحثون غالبًا إلى استكشاف تأثير خصائص بيانات معينة على نموذج بياناتهم ." [ 13 ] وللمساعدة في بناء مجموعات بيانات تُظهر خصائص محددة، مثل الارتباط الذاتي أو تباين الدرجة، يمكن لتقنية التقارب توليد بيانات اصطناعية ذات بنية بيانية من عدة أنواع: رسوم بيانية عشوائية يتم توليدها بواسطة عملية عشوائية ؛ رسوم بيانية شبكية ذات بنية حلقية؛ رسوم بيانية شبكية ذات بنية شبكية، إلخ. [ 13 ] في جميع الحالات، تتبع عملية توليد البيانات نفس العملية:

  1. قم بإنشاء بنية الرسم البياني الفارغة .
  2. قم بإنشاء قيم السمات بناءً على الاحتمالات المسبقة التي يقدمها المستخدم.

بما أن قيم سمات كائن واحد قد تعتمد على قيم سمات الكائنات المرتبطة به، فإن عملية توليد السمات تُعيّن القيم بشكل جماعي. [ 13 ]

التطبيقات

أنظمة كشف الاحتيال والحفاظ على السرية

تُصمَّم أنظمة اختبار وتدريب أنظمة كشف الاحتيال والحفاظ على السرية باستخدام بيانات اصطناعية. تُصمَّم خوارزميات ومولدات خاصة لإنشاء بيانات واقعية، [ 14 ] مما يُساعد في تعليم النظام كيفية الاستجابة لمواقف أو معايير مُحدَّدة. على سبيل المثال، يُختبر برنامج كشف الاختراق باستخدام بيانات اصطناعية. تُمثِّل هذه البيانات البيانات الأصلية، وقد تتضمن حالات اختراق غير موجودة في البيانات الأصلية. تُمكِّن البيانات الاصطناعية البرنامج من التعرُّف على هذه المواقف والاستجابة لها وفقًا لذلك. في حال عدم استخدام البيانات الاصطناعية، سيقتصر تدريب البرنامج على الاستجابة للمواقف المُقدَّمة من البيانات الأصلية، وقد لا يتعرّف على أنواع أخرى من الاختراق. [ 4 ]

البحث العلمي

قد يقوم الباحثون الذين يجرون تجارب سريرية أو أي بحث آخر بتوليد بيانات اصطناعية للمساعدة في إنشاء خط أساس للدراسات والاختبارات المستقبلية.

قد تحتوي البيانات الحقيقية على معلومات قد لا يرغب الباحثون في نشرها، [ 15 ] لذا تُستخدم البيانات الاصطناعية أحيانًا لحماية خصوصية وسرية مجموعة البيانات. يقلل استخدام البيانات الاصطناعية من مشاكل السرية والخصوصية لأنها لا تحتوي على أي معلومات شخصية ولا يمكن ربطها بأي فرد.

إلى جانب حماية الخصوصية، يجري استكشاف البيانات الاصطناعية أيضًا من أجل الابتكار المنهجي في تطوير الأدوية. على سبيل المثال، يمكن استخدام البيانات الاصطناعية لإنشاء مجموعات تحكم اصطناعية كبديل لمجموعات التحكم الخارجية التقليدية القائمة على بيانات العالم الحقيقي أو التجارب المعشاة ذات الشواهد. ويبدو أن الهيئات التنظيمية، مثل إدارة الغذاء والدواء الأمريكية ووكالة الأدوية الأوروبية، في مراحل مختلفة من إدراك ودمج البيانات الاصطناعية المولدة بالذكاء الاصطناعي في منهجياتها. وبينما يتزايد الإجماع على إمكانات هذه البيانات في دعم تطوير النماذج ودورة حياة المنتجات الطبية بشكل عام، لم تتم الموافقة حتى الآن على أي دواء أو جهاز طبي باستخدام البيانات الاصطناعية فقط أو بشكل أساسي، وخاصةً كمجموعة مقارنة مُولدة بالكامل عبر خوارزميات تعتمد على البيانات. ومن المتوقع أن تبرز جودة البيانات الاصطناعية ومعالجتها الإحصائية بشكل أكبر في المناقشات التنظيمية المستقبلية، لا سيما في سياقات مثل النمذجة التنبؤية (مثل التوائم الرقمية)، حيث تمت الإشارة بالفعل إلى مناهج مبتكرة. [ 16 ]

التعلم الآلي

تُستخدم البيانات الاصطناعية بشكل متزايد في تطبيقات التعلّم الآلي : حيث يتم تدريب نموذج على مجموعة بيانات مُولّدة اصطناعياً بهدف نقل التعلّم إلى بيانات حقيقية. وقد بُذلت جهود لتمكين المزيد من تجارب علم البيانات من خلال إنشاء مولدات بيانات اصطناعية متعددة الأغراض، مثل Synthetic Data Vault. [ 17 ] وبشكل عام، تتمتع البيانات الاصطناعية بالعديد من المزايا الطبيعية:

  • بمجرد أن تصبح البيئة الاصطناعية جاهزة، يصبح إنتاج البيانات المطلوبة سريعًا وغير مكلف؛
  • يمكن أن تحتوي البيانات الاصطناعية على تصنيفات دقيقة تمامًا، بما في ذلك التصنيفات التي قد تكون مكلفة للغاية أو مستحيلة الحصول عليها يدويًا؛
  • يمكن تعديل البيئة الاصطناعية لتحسين النموذج والتدريب؛
  • يمكن استخدام البيانات الاصطناعية كبديل لبعض أجزاء البيانات الحقيقية التي تحتوي، على سبيل المثال، على معلومات حساسة.

تم اقتراح استخدام البيانات الاصطناعية لتطبيقات رؤية الكمبيوتر، وخاصة اكتشاف الكائنات ، حيث تكون البيئة الاصطناعية نموذجًا ثلاثي الأبعاد للكائن، [ 18 ] وتعلم التنقل في البيئات من خلال المعلومات المرئية.

في سياق تدريب نماذج اللغة الضخمة ، أصبح توليد البيانات الاصطناعية عنصرًا أساسيًا في عملية ما بعد التدريب. وقد مكّنت تقنيات مثل Self-Instruct، التي تستخدم مجموعة أولية صغيرة من 175 تعليمة مكتوبة يدويًا لتوليد 52000 مثال اصطناعي لتتبع التعليمات، وPersona Hub، التي تولد أكثر من مليار شخصية اصطناعية لتوليد تعليمات متنوعة، من إنشاء مجموعات بيانات تدريب واسعة النطاق بتكلفة أقل بكثير من تكلفة التعليق البشري. [ 19 ]

في الوقت نفسه، لا يزال التعلم بالنقل يمثل مشكلة معقدة، ولم تنتشر البيانات الاصطناعية على نطاق واسع بعد. تشير نتائج الأبحاث إلى أن إضافة كمية صغيرة من البيانات الحقيقية تُحسّن بشكل ملحوظ التعلم بالنقل باستخدام البيانات الاصطناعية. وقد أدت التطورات في الشبكات التوليدية التنافسية (GAN) إلى فكرة بديهية مفادها أنه يمكن إنتاج البيانات ثم استخدامها للتدريب. منذ عام 2016 على الأقل، استُخدم هذا النوع من التدريب التنافسي بنجاح لإنتاج بيانات اصطناعية بجودة كافية لتحقيق نتائج متقدمة في بعض المجالات، دون الحاجة حتى إلى إعادة دمج البيانات الحقيقية مع البيانات الاصطناعية المُولّدة. [ 20 ]

أمثلة

في عام 1987، استخدمت مركبة ذاتية القيادة تابعة لشركة نافلاب 1200 صورة اصطناعية للطرق كأحد أساليب التدريب. [ 21 ]

في عام 2021، أصدرت مايكروسوفت قاعدة بيانات تضم 100,000 وجه اصطناعي مبني على 500 وجه حقيقي، وتزعم أنها "تطابق البيانات الحقيقية في الدقة". [ 21 ] [ 22 ]

في عام 2023، نشرت مجلة Nature غلافًا لسلسلة Nature's 10 من تصميم كيم ألبريشت من مشروع "الرؤى العالمية الاصطناعية". [ 23 ] يتميز الغلاف برسم خريطة لأكثر من 18000 نقطة بيانات تم إنشاؤها بشكل اصطناعي من ChatGPT حول فئات المعرفة.

نشرت DataFramer مجموعات بيانات حول Hugging Face ، بما في ذلك ehr-multi-file-patient-samples ، وهي مجموعة بيانات اصطناعية لتاريخ المريض متعددة الملفات، [ 24 ] و INSURE-Dial ، وهي مجموعة بيانات حوارية للكشف عن مراحل مكالمات التأمين والتحقق من الامتثال. [ 25 ]

انظر أيضاً

مراجع

  1. "ما هي البيانات الاصطناعية؟ - تعريف من موقع WhatIs.com" . SearchCIO . تم الاطلاع عليه بتاريخ 8 سبتمبر 2022 .
  2. نيكولينكو، سيرجي إي. (2021). البيانات الاصطناعية للتعلم العميق . سبرينغر. التحسين وتطبيقاته. المجلد 174. doi : 10.1007/978-3-030-75178-4 . ISBN  978-3-030-75177-7. S2CID 202750227 . 
  3. زيفينكو، أوليكسي؛ والتون، نوح أ.و.؛ فريتش، ويليام؛ فوربس، جاكوب؛ لويس، أماندا م.؛ كلارك، آرون؛ براون، جيسي م.؛ سوبس، فلاديمير (2024-06-03). "التحقق من صحة التقييم الآلي للرنين باستخدام بيانات اصطناعية". arXiv : 2406.01754 [ physics.comp-ph ].
  4. 1 2 3 بارس، إي إل؛ كفارنستروم، إتش؛ جونسون، إي. (2003). توليف بيانات الاختبار لأنظمة كشف الاحتيال . وقائع المؤتمر السنوي التاسع عشر لتطبيقات أمن الحاسوب. معهد مهندسي الكهرباء والإلكترونيات. doi : 10.1109/CSAC.2003.1254343 .
  5. دينغ، هاري (30 نوفمبر 2023). "استكشاف البيانات الاصطناعية للذكاء الاصطناعي والأنظمة المستقلة: مدخل تمهيدي" . معهد الأمم المتحدة لبحوث نزع السلاح .
  6. "مناقشة: قيود الإفصاح الإحصائي". مجلة الإحصاءات الرسمية . 9 : 461-468 . 1993.
  7. 1 2 3 أبوود، جون م. "حماية سرية البيانات الجزئية في العلوم الاجتماعية: البيانات الاصطناعية والأساليب ذات الصلة. [ شرائح باوربوينت ] " . تم الاطلاع عليه بتاريخ 17 فبراير 2011 .
  8. "التحليل الإحصائي للبيانات المقنعة". مجلة الإحصاءات الرسمية . 9 : 407-426 . 1993.
  9. دراكر، هاريس؛ شابير، روبرت؛ سيمارد، باتريس (أغسطس 1993). "تحسين أداء الشبكات العصبية" . المجلة الدولية للتعرف على الأنماط والذكاء الاصطناعي . 7 (4): 705-719 . doi : 10.1142/S0218001493000352 . ISSN 0218-0014 . 
  10. فابنيك، فلاديمير (2008). طبيعة نظرية التعلم الإحصائي . الإحصاء للهندسة وعلوم المعلومات (الطبعة الثانية، الطبعة السادسة المطبوعة). نيويورك: سبرينغر. ISBN  978-0-387-98780-4.
  11. جاكسون، تشارلز؛ مورفي، روبرت ف.؛ كوفاسيفيتش، يلينا (سبتمبر 2009). "الاكتساب الذكي وتعلم نماذج بيانات مجهر الفلورة" ( ملف PDF) . معاملات IEEE في معالجة الصور . 18 (9): 2071-2084 . Bibcode : 2009ITIP...18.2071J . doi : 10.1109/TIP.2009.2024580 . PMID 19502128. S2CID 3718670 .  
  12. وانغ، آي تشي؛ تشيو، تيان شوانغ؛ شاو، لونغ تان (يوليو 2009). "طريقة بسيطة لتصحيح التشوه الشعاعي مع تقدير مركز التشوه". مجلة التصوير الرياضي والرؤية . 35 (3): 165-172 . Bibcode : 2009JMIV...35..165W . doi : 10.1007/s10851-009-0162-1 . S2CID 207175690 . 
  13. 1 2 3 4 5 ديفيد جنسن (2004). "6. استخدام البرامج النصية" . برنامج تعليمي لـ Proximity 4.3 .
  14. دينغ، روبرت هـ.؛ باو، فينغ؛ تشو، جيانينغ (ديسمبر 2002). أمن المعلومات والاتصالات . وقائع المؤتمر الدولي الرابع، ICICS 2002، سنغافورة. ISBN 9783540361596.
  15. أبوود، جون م.؛ لين، جوليا (9-11 يونيو 2004). مناهج جديدة لحماية السرية: البيانات الاصطناعية، والوصول عن بُعد، ومراكز بيانات البحث . الخصوصية في قواعد البيانات الإحصائية: المؤتمر الختامي لمشروع CASC، وقائع المؤتمر. برشلونة، إسبانيا. doi : 10.1007/978-3-540-25955-8_22 .
  16. ^ باسكولي، جوزيبي. فيرجولين، ماركو؛ مايلز، بوجا؛ فيدوفسكي، آنا؛ فيشر، تشارلز. بياسين، إليزابيتا؛ موربي، ميراندا. بابالاردو، فرانشيسكو؛ داميكو، سافيريو؛ تورشيا، ماريو. شيبيكين، الكسندر؛ كاربوني، فينسينزو؛ إميلي، لوكا؛ روشمار ، دانيال (2025/04/07). "البيانات الاصطناعية في مجال الرعاية الصحية وتطوير الأدوية: التعاريف والأطر التنظيمية والقضايا" . CPT: القياسات الدوائية وأنظمة الصيدلة . 14 (5): 840-852 . دوى : 10.1002/psp4.70021 . بمك 12072219 . بميد 40193292 .  
  17. باتكي، نيها؛ ويدج، روي؛ فيراماتشانيني، كاليان (2016). "مخزن البيانات الاصطناعية". المؤتمر الدولي لعلوم البيانات والتحليلات المتقدمة (DSAA) لعام 2016، معهد مهندسي الكهرباء والإلكترونيات. الصفحات 399-410 . doi : 10.1109/DSAA.2016.49 . ISBN  978-1-5090-5206-6.
  18. بينغ، شينغتشاو؛ صن، باوتشن؛ علي، كريم؛ ساينكو، كيت (2015). "تعلم كاشفات الأجسام العميقة من النماذج ثلاثية الأبعاد". arXiv : 1412.7122 [ cs.CV ].
  19. فون تشيفالفاي، كريس (2026). ما بعد التدريب: دليل عملي لمهندسي ومطوري الذكاء الاصطناعي . دار نشر نو ستارش . الصفحات 283-300 . ISBN  978-1-7185-0520-9.
  20. شريفاستافا، أشيش؛ فايستر، توماس؛ توزيل، أونجيل؛ ساسكيند، جوش؛ وانغ، ويندا؛ ويب، روس (2016). "التعلم من الصور المحاكاة وغير الخاضعة للإشراف من خلال التدريب التنافسي". arXiv : 1612.07828 [ cs.CV ].
  21. 1 2 "الشبكات العصبية تحتاج إلى بيانات للتعلم، حتى لو كانت مزيفة" . يونيو 2023. تم الاطلاع عليه في 17 يونيو 2023 .
  22. وود، إيرول؛ بالتروشايتيس، تاداس؛ هيويت، تشارلي؛ دزيادزيو، سيباستيان؛ كاشمان، توماس جيه؛ شوتون، جيمي (2021). "تظاهر حتى تتقن: تحليل الوجه في بيئات واقعية باستخدام البيانات الاصطناعية فقط" . المؤتمر الدولي IEEE/CVF للرؤية الحاسوبية (ICCV) لعام 2021. الصفحات 3681-3691 . arXiv : 2109.15102 . doi : 10.1109 /ICCV48922.2021.00366 . ISBN  978-1-6654-2812-5.
  23. ألبريشت، كيم. "وجهات نظر عالمية اصطناعية" . Artificial-worldviews.kimalbrecht.com . تم الاطلاع عليه بتاريخ 18 نوفمبر 2024 .
  24. "dataframer/ehr-multi-file-patient-samples" . Hugging Face . تم الاسترجاع بتاريخ 10-03-2026 .
  25. "dataframer/insure-dial" . Hugging Face . تم الاسترجاع بتاريخ 10-03-2026 .