استخراج البيانات من مواقع الويب

استخراج البيانات من مواقع الويب هو عملية تُستخدم لاستخراج البيانات من مواقع الويب . [ 1 ] يمكن لبرامج استخراج البيانات من مواقع الويب الوصول مباشرةً إلى شبكة الإنترنت العالمية باستخدام بروتوكول نقل النص التشعبي (HTTP) أو متصفح الويب. على الرغم من إمكانية استخراج البيانات يدويًا بواسطة مستخدم البرنامج، إلا أن المصطلح يشير عادةً إلى العمليات الآلية التي تُنفذ باستخدام روبوت أو برنامج زحف الويب . وهي شكل من أشكال النسخ حيث يتم جمع بيانات محددة ونسخها من الويب، عادةً إلى قاعدة بيانات محلية مركزية أو جدول بيانات ، لاسترجاعها أو تحليلها لاحقًا .

تتضمن عملية استخراج البيانات من صفحة ويب جلبها ثم استخراج البيانات منها. الجلب هو عملية تحميل الصفحة (التي يقوم بها المتصفح عند عرض المستخدم للصفحة). لذلك، يُعدّ الزحف على الويب مكونًا أساسيًا من مكونات استخراج البيانات من الويب، وذلك لجلب الصفحات لمعالجتها لاحقًا. بعد الجلب، تبدأ عملية الاستخراج. يمكن تحليل محتوى الصفحة ، والبحث فيه، وإعادة تنسيقه، ونسخ بياناته إلى جدول بيانات أو تحميلها في قاعدة بيانات. عادةً ما تستخدم برامج استخراج البيانات من الويب بيانات محددة من الصفحة، لاستخدامها في غرض آخر في مكان آخر. على سبيل المثال، يمكن العثور على الأسماء وأرقام الهواتف، أو الشركات وعناوين مواقعها الإلكترونية، أو عناوين البريد الإلكتروني ونسخها إلى قائمة (استخراج جهات الاتصال). مثال آخر هو جمع أسعار منتجات المنافسين لأغراض التسويق، والذي قد يشمل جمع مجموعات بيانات أسعار واسعة النطاق من مواقع التجارة الإلكترونية وتحليلها باستخدام تقنيات علم البيانات مثل تحليل الاتجاهات، والنمذجة التنبؤية، والمقارنة المعيارية التنافسية.

يُعد استخراج بيانات جهات الاتصال نوعًا من أنواع استخراج البيانات من الويب، ويُستخدم كمكون من مكونات التطبيقات المستخدمة في فهرسة الويب ، واستخراج البيانات من الويب ، واستخراج البيانات ، ومراقبة تغيرات الأسعار عبر الإنترنت ومقارنة الأسعار ، واستخراج مراجعات المنتجات (لمراقبة المنافسة)، وجمع قوائم العقارات، ومراقبة بيانات الطقس، والكشف عن تغييرات مواقع الويب ، والبحث، وتتبع الوجود والسمعة عبر الإنترنت، ودمج الويب ، وتكامل بيانات الويب .

تُبنى صفحات الويب باستخدام لغات ترميز نصية ( HTML و XHTML )، وغالبًا ما تحتوي على كم هائل من البيانات النصية. مع ذلك، تُصمَّم معظم صفحات الويب للمستخدمين البشريين وليس لتسهيل استخدامها آليًا. ونتيجةً لذلك، طُوِّرت أدوات وبرامج متخصصة لتسهيل استخراج البيانات من صفحات الويب. تشمل تطبيقات استخراج البيانات من الويب أبحاث السوق ، ومقارنة الأسعار، ومراقبة المحتوى، والذكاء الاصطناعي . وتعتمد الشركات على خدمات استخراج البيانات من الويب لجمع هذه البيانات واستخدامها بكفاءة.

تستخدم بعض المواقع الإلكترونية أساليبَ لمنع استخراج البيانات، مثل كشف ومنع برامج الروبوت من الزحف إلى صفحاتها (مشاهدتها). في المقابل، تستخدم أنظمة استخراج البيانات تقنياتٍ تشمل تحليل نموذج كائن المستند (DOM) ، ورؤية الحاسوب ، ومعالجة اللغة الطبيعية لمحاكاة التصفح البشري، ما يُمكّن من جمع محتوى صفحات الويب لتحليله لاحقًا دون اتصال بالإنترنت.

تاريخ

بعد ولادة شبكة الويب العالمية في عام 1989، تم إنشاء أول روبوت ويب، [ 2 ] World Wide Web Wanderer ، في يونيو 1993، والذي كان يهدف فقط إلى قياس حجم الويب.

في ديسمبر 1993، أُطلق محرك البحث JumpStation ، أول محرك بحث ويب يعتمد على برامج الزحف . ونظرًا لقلة عدد المواقع الإلكترونية المتاحة آنذاك، كانت محركات البحث تعتمد على مشرفين بشريين لجمع الروابط وتنسيقها. في المقابل، كان JumpStation أول محرك بحث على شبكة الويب العالمية يعتمد على روبوت ويب.

في عام 2000، تم إنشاء أول واجهة برمجة تطبيقات ويب (Web API ) وبرنامج زحف لواجهات برمجة التطبيقات . وفي العام نفسه، أطلقت شركتا Salesforce و eBay واجهات برمجة تطبيقات خاصة بهما، والتي مكّنت المبرمجين من الوصول إلى بعض البيانات المتاحة للجمهور وتنزيلها. [ 3 ] ومنذ ذلك الحين، توفر العديد من المواقع الإلكترونية واجهات برمجة تطبيقات ويب تتيح للمستخدمين الوصول إلى قواعد بياناتها العامة.

في منتصف العقد الثالث من القرن الحادي والعشرين، أصبحت برامج استخراج البيانات من مواقع الويب التابعة لموردي برامج إدارة التعلم مصدراً رئيسياً لحركة مرور الويب، حيث تستخدم هذه البرامج تقنية الزحف الموزع لتجنب الكشف عنها. [ 4 ] [ 5 ] [ 6 ]

التقنيات

تتراوح تقنيات استخراج البيانات بين الجمع اليدوي والأنظمة الآلية المتطورة. يمكن أن تكون أدوات استخراج البيانات من الويب برمجية أو لا برمجية. تستخدم الأدوات التجارية التي لا برمجية، مثل Octoparse وImport.io وParseHub وWebHarvy، واجهات مرئية لضبط عملية جمع البيانات. [ 7 ] تحلل الأساليب المتقدمة البنية الأساسية لصفحات الويب لتحويل المحتوى غير المهيكل إلى تنسيق قابل للقراءة آليًا . تستخدم هذه التقنيات معالجة النصوص أو الذكاء الاصطناعي ، بما يتماشى مع الأهداف التقنية للويب الدلالي .

النسخ واللصق البشري

أبسط أشكال استخراج البيانات من مواقع الويب هو النسخ اليدوي للبيانات ولصقها من صفحة ويب إلى ملف نصي أو جدول بيانات. لا تتطلب هذه الطريقة أي أدوات تقنية، ويمكن استخدامها عندما تكون قيود الموقع الإلكتروني تحظر الاستخراج الآلي للبيانات، أو عندما يكون التدخل البشري ضروريًا لتفسير المحتوى المعقد. مع ذلك، يُعدّ الاستخراج اليدوي للبيانات غير فعال للغاية مع مجموعات البيانات الكبيرة، فهو يستغرق وقتًا طويلاً، وعرضة للخطأ البشري، ومُرهِق ذهنيًا. لهذا السبب، يُعتبر عمومًا غير عملي مقارنةً بالأساليب الآلية، إلا في الحالات التي لا يكون فيها التشغيل الآلي ممكنًا.

مطابقة أنماط النصوص

تتمثل إحدى الطرق البسيطة لاستخراج المعلومات من صفحات الويب في استخدام أمر grep الخاص بنظام UNIX أو إمكانيات مطابقة التعبيرات النمطية للغات البرمجة (على سبيل المثال Perl أو Python )، وذلك للعثور على نص يطابق نمطًا محددًا.

برمجة HTTP

يمكن استرداد صفحات الويب الثابتة والديناميكية عن طريق إرسال طلبات HTTP إلى خادم الويب البعيد باستخدام برمجة المقابس .

تحليل HTML

تحتوي العديد من المواقع الإلكترونية على مجموعات كبيرة من الصفحات المُنشأة ديناميكيًا من مصدر بيانات مُهيكل، كقاعدة بيانات مثلاً. عادةً ما تُشفّر البيانات من نفس الفئة في صفحات متشابهة باستخدام نص برمجي أو قالب مشترك. في مجال استخراج البيانات، يُطلق على البرنامج الذي يكتشف هذه القوالب في مصدر معلومات معين، ويستخرج محتواه، ويُحوله إلى صيغة علائقية، اسم " المُغلِّف" . تفترض خوارزميات إنشاء المُغلِّفات أن صفحات الإدخال لنظام استقراء المُغلِّف تتوافق مع قالب مشترك، وأنه يُمكن تحديدها بسهولة من خلال مخطط عناوين URL مشترك. [ 8 ] علاوة على ذلك، يُمكن استخدام بعض لغات استعلام البيانات شبه المهيكلة ، مثل XQuery وHTQL، لتحليل صفحات HTML واسترجاع محتوى الصفحة وتحويله.

تحليل DOM

باستخدام برامج مثل Selenium أو Playwright ، يستطيع المطورون التحكم في متصفحات الويب مثل Chrome أو Firefox لتحميل البيانات من مواقع الويب والتنقل بينها واسترجاعها. تُعدّ هذه الطريقة مفيدةً للغاية لاستخراج البيانات من المواقع الديناميكية، حيث يقوم متصفح الويب بتحميل كل صفحة بالكامل. بمجرد تحميل الصفحة، يمكن للمطورين الوصول إلى نموذج كائن المستند (DOM) وتحليله باستخدام لغة تعبير مثل XPath .

التجميع الرأسي

طورت العديد من الشركات منصات متخصصة لجمع البيانات في قطاعات محددة. تقوم هذه المنصات بإنشاء ومراقبة عدد كبير من "البرامج الآلية" لقطاعات معينة دون تدخل بشري مباشر، ودون أي عمل مرتبط بموقع مستهدف محدد. تتضمن عملية الإعداد إنشاء قاعدة معرفية شاملة للقطاع، ثم تقوم المنصة بإنشاء البرامج الآلية تلقائيًا. تُقاس كفاءة المنصة بجودة المعلومات التي تسترجعها (عادةً عدد الحقول) وقابليتها للتوسع (سرعة استيعابها لمئات أو آلاف المواقع). تُستخدم هذه القابلية للتوسع بشكل أساسي لاستهداف المواقع المتخصصة التي يصعب على منصات تجميع البيانات الشائعة جمع محتواها أو تتطلب جهدًا كبيرًا.

التعرف على التعليقات الدلالية

قد تتضمن الصفحات التي يتم استخراج البيانات منها بيانات وصفية أو علامات دلالية وشروحًا، والتي يمكن استخدامها لتحديد أجزاء بيانات معينة. إذا كانت الشروح مضمنة في الصفحات، كما هو الحال في Microformat ، فيمكن اعتبار هذه التقنية حالة خاصة من تحليل DOM. في حالة أخرى، تُخزَّن الشروح، المنظمة في طبقة دلالية، [ 9 ] وتُدار بشكل منفصل عن صفحات الويب، بحيث يمكن لبرامج استخراج البيانات استرداد مخطط البيانات والتعليمات من هذه الطبقة قبل استخراج البيانات من الصفحات.

تحليل صفحات الويب باستخدام رؤية الحاسوب

هناك جهود تستخدم التعلم الآلي ورؤية الحاسوب لمحاولة تحديد واستخراج المعلومات من صفحات الويب من خلال تفسير الصفحات بصريًا كما يفعل الإنسان. [ 10 ]

تختلف شرعية استخراج البيانات من مواقع الويب حول العالم. عموماً، قد يُخالف استخراج البيانات من مواقع الويب شروط الخدمة لبعض المواقع، لكن مدى إمكانية تطبيق هذه الشروط غير واضح. [ 11 ]

الولايات المتحدة

في الولايات المتحدة، يمكن لأصحاب المواقع الإلكترونية اللجوء إلى ثلاثة دعاوى قانونية رئيسية لمنع استخراج البيانات غير المرغوب فيه من مواقعهم: (1) انتهاك حقوق النشر (التجميع)، (2) انتهاك قانون الاحتيال وإساءة استخدام الحاسوب (CFAA)، و(3) التعدي على الممتلكات المنقولة . [ 12 ] ومع ذلك، فإن فعالية هذه الدعاوى تعتمد على استيفاء معايير مختلفة، ولا يزال القانون القضائي في هذا الشأن قيد التطور. فعلى سبيل المثال، فيما يتعلق بحقوق النشر، في حين أن النسخ الصريح للتعبير الأصلي يُعد غير قانوني في كثير من الحالات، فقد قضت المحاكم الأمريكية في قضية Feist Publications ضد Rural Telephone Service بأن نسخ الحقائق جائز.

أقرت المحاكم الأمريكية بإمكانية تحميل مستخدمي برامج استخراج البيانات أو الروبوتات مسؤولية التعدي على الممتلكات المنقولة ، [ 13 ] [ 14 ] حيث يُعتبر نظام الحاسوب نفسه ملكية شخصية يتعدى عليها مستخدم برنامج استخراج البيانات. وأشهر هذه القضايا، قضية eBay ضد Bidder's Edge ، التي أسفرت عن أمر قضائي يُلزم Bidder's Edge بالتوقف عن الوصول إلى مزادات موقع eBay الإلكتروني وجمعها وفهرستها. وتضمنت هذه القضية تقديم عروض أسعار تلقائية، تُعرف باسم " اقتناص المزادات" . ومع ذلك، لكي ينجح المدعي في دعوى التعدي على الممتلكات المنقولة ، يجب عليه إثبات أن المدعى عليه قد تدخل عمدًا وبدون ترخيص في حق المدعي في حيازة نظام الحاسوب، وأن استخدام المدعى عليه غير المصرح به قد ألحق ضررًا بالمدعي. ولم تُعتبر جميع قضايا استخراج البيانات من مواقع الويب التي عُرضت على المحاكم تعديًا على الممتلكات المنقولة. [ 15 ]

كانت إحدى أولى التجارب الرئيسية لتقنية استخراج البيانات من الشاشة هي تلك التي أجرتها الخطوط الجوية الأمريكية (AA) وشركة تُدعى FareChase. [ 16 ] نجحت الخطوط الجوية الأمريكية في الحصول على أمر قضائي من محكمة ابتدائية في تكساس، يمنع FareChase من بيع برنامج يمكّن المستخدمين من مقارنة أسعار تذاكر الطيران عبر الإنترنت إذا كان البرنامج يبحث أيضًا في موقع الخطوط الجوية الأمريكية. زعمت الخطوط الجوية أن برنامج البحث على الإنترنت الخاص بـ FareChase قد انتهك خوادمها عند جمعه للبيانات المتاحة للجمهور. قدمت FareChase استئنافًا في مارس 2003. وبحلول يونيو، اتفقت FareChase والخطوط الجوية الأمريكية على تسوية وتم إسقاط الاستئناف. [ 17 ]

طعنت شركة طيران ساوث ويست في ممارسات استخراج البيانات من الشاشة، ورفعت دعوى قضائية ضد كل من شركة FareChase وشركة Outtask. اتهمت ساوث ويست شركة الطيران بأن استخراج البيانات من الشاشة غير قانوني لأنه يُعد مثالاً على "الاحتيال وإساءة استخدام الحاسوب"، وقد أدى إلى "ضرر وخسارة" و"وصول غير مصرح به" إلى موقعها الإلكتروني. كما أنه يشكل "تدخلاً في العلاقات التجارية" و"تعدياً" و"وصولاً ضاراً عبر الحاسوب". وادعت أيضاً أن استخراج البيانات من الشاشة يُعد ما يُعرف قانونياً بـ"الاختلاس والإثراء غير المشروع"، فضلاً عن كونه انتهاكاً لاتفاقية استخدام الموقع الإلكتروني. نفت شركة Outtask جميع هذه الادعاءات، مؤكدةً أن القانون الساري في هذه الحالة هو قانون حقوق النشر الأمريكي ، وأنه بموجب هذا القانون، فإن المعلومات التي يتم استخراجها لا تخضع لحماية حقوق النشر. على الرغم من أن القضايا لم تُحسم في المحكمة العليا للولايات المتحدة ، إلا أن شركة ياهو الأم أغلقت شركة FareChase في نهاية المطاف. واستحوذت شركة Concur، المتخصصة في إدارة نفقات السفر، على شركة Outtask. [ 18 ] في عام 2012، قامت شركة ناشئة تُدعى 3Taps بجمع إعلانات الإسكان المبوبة من موقع Craigslist. أرسل موقع Craigslist خطاب إنذار إلى 3Taps وحظر عناوين بروتوكول الإنترنت الخاصة بها، ثم رفع دعوى قضائية ضدها في قضية Craigslist ضد 3Taps . قضت المحكمة بأن خطاب الإنذار وحظر عناوين بروتوكول الإنترنت كانا كافيين لكي يدّعي موقع Craigslist بشكل صحيح أن 3Taps قد انتهكت قانون الاحتيال وإساءة استخدام الحاسوب (CFAA).

على الرغم من أن هذه قرارات مبكرة بشأن استخراج البيانات، وأن نظريات المسؤولية ليست موحدة، إلا أنه من الصعب تجاهل نمط ناشئ مفاده أن المحاكم مستعدة لحماية المحتوى المحمي بحقوق الملكية الفكرية على المواقع التجارية من الاستخدامات غير المرغوب فيها لأصحاب هذه المواقع. ومع ذلك، فإن درجة حماية هذا المحتوى غير محددة، وستعتمد على نوع الوصول الذي يقوم به برنامج استخراج البيانات، وكمية المعلومات التي يتم الوصول إليها ونسخها، ومدى تأثير هذا الوصول سلبًا على نظام مالك الموقع، وأنواع وأساليب الحظر المفروضة على هذا السلوك. [ 19 ]

مع ازدياد وضوح القانون في هذا المجال، ينبغي على الجهات التي تفكر في استخدام برامج استخراج البيانات للوصول إلى موقع ويب عام أن تتأكد من قانونية هذا الإجراء، وذلك بمراجعة شروط الاستخدام وغيرها من الشروط أو الإشعارات المنشورة على الموقع أو المتاحة من خلاله. في قضية Cvent Inc. ضد Eventbrite Inc. (2010)، قضت محكمة الولايات المتحدة للمنطقة الشرقية من ولاية فرجينيا بضرورة إطلاع المستخدمين على شروط الاستخدام لكي يكون عقد أو ترخيص التصفح نافذًا. [ 20 ] وفي قضية أخرى رُفعت عام 2014 أمام محكمة الولايات المتحدة للمنطقة الشرقية من ولاية بنسلفانيا ، [ 21 ] اعترض موقع التجارة الإلكترونية QVC على قيام منصة Resultly، وهي منصة تجميع تسوق شبيهة بـ Pinterest، باستخراج بيانات الأسعار من موقع QVC في الوقت الفعلي. تزعم شركة QVC أن برنامج Resultly قام بـ"زحف مفرط" لموقعها الإلكتروني (حيث يُزعم أنه كان يرسل ما بين 200 و300 طلب بحث إلى موقع QVC في الدقيقة، وأحيانًا يصل العدد إلى 36000 طلب في الدقيقة)، مما تسبب في تعطل موقع QVC لمدة يومين، وأدى إلى خسائر في المبيعات. [ 22 ] وتزعم شكوى QVC أن المدعى عليه أخفى عنوان IP الخاص ببرنامج الزحف الخاص به، مما حال دون تمكن QVC من إصلاح المشكلة بسرعة. وتُعد هذه القضية مثيرة للاهتمام بشكل خاص في مجال استخراج البيانات، لأن QVC تسعى للحصول على تعويضات عن تعطل موقعها الإلكتروني، والذي تدعي QVC أن برنامج Resultly هو السبب فيه.

خلال فترة هذه المحاكمة، كان رابط شروط الاستخدام في موقع المدعي الإلكتروني يظهر ضمن جميع روابط الموقع، أسفل الصفحة كما هو الحال في معظم مواقع الإنترنت. ويتعارض هذا الحكم مع الحكم الأيرلندي المذكور أدناه. كما رفضت المحكمة حجة المدعي بأن قيود التصفح قابلة للتنفيذ في ضوء تبني ولاية فرجينيا لقانون المعاملات الموحدة لمعلومات الحاسوب (UCITA)، وهو قانون موحد اعتقد كثيرون أنه يدعم ممارسات التعاقد الشائعة المتعلقة بالتصفح. [ 23 ]

في قضية فيسبوك ضد باور فنتشرز، قضت محكمة ابتدائية عام 2012 بأن باور فنتشرز لا يحق لها جمع بيانات صفحات فيسبوك نيابةً عن مستخدمي فيسبوك. ولا تزال القضية قيد الاستئناف، وقد قدمت مؤسسة الحدود الإلكترونية مذكرةً عام 2015 تطالب فيها بإلغاء الحكم. [ 24 ] [ 25 ] وفي قضية أسوشيتد برس ضد ميلتووتر يو إس هولدينغز، حمّلت محكمة أمريكية ميلتووتر مسؤولية جمع وإعادة نشر معلومات إخبارية من أسوشيتد برس، إلا أن محكمة بريطانية أيدت ميلتووتر.

أصدرت محكمة الاستئناف للدائرة التاسعة في عام 2019 حكمًا يقضي بأنّ استخراج البيانات من مواقع الويب لا يُعدّ انتهاكًا لقانون الاحتيال وإساءة استخدام الحاسوب (CFAA) في قضية hiQ Labs ضد LinkedIn . وقد رُفعت القضية إلى المحكمة العليا للولايات المتحدة ، التي أعادت القضية إلى محكمة الاستئناف للدائرة التاسعة لإعادة النظر فيها في ضوء قرار المحكمة العليا الصادر عام 2021 في قضية Van Buren ضد الولايات المتحدة، والذي ضيّق نطاق تطبيق قانون الاحتيال وإساءة استخدام الحاسوب. [ 26 ] وفي هذه المراجعة، أيّدت محكمة الاستئناف للدائرة التاسعة قرارها السابق. [ 27 ]

يقوم أرشيف الإنترنت بجمع وتوزيع عدد كبير من صفحات الويب المتاحة للجمهور دون أن يُعتبر ذلك انتهاكًا لقوانين حقوق النشر.

الاتحاد الأوروبي

في فبراير 2006، قضت المحكمة البحرية والتجارية الدنماركية (كوبنهاغن) بأن الزحف المنهجي والفهرسة والربط العميق من قبل موقع البوابة الإلكترونية ofir.dk لموقع العقارات Home.dk لا يتعارض مع القانون الدنماركي أو توجيهات قواعد البيانات للاتحاد الأوروبي. [ 28 ]

يدعم استخراج البيانات الأخلاقي التوريد من مصادر خارجية في مجال الأعمال، ولكنه يجب أن يلتزم باللائحة العامة لحماية البيانات (GDPR) لتجنب انتهاكات الخصوصية في جمع البيانات الآلي. [ 29 ]

في قضيةٍ عُقدت في فبراير 2010، تعقدت بسبب مسائل الاختصاص القضائي، أصدرت المحكمة العليا في أيرلندا حكمًا يُظهر حالة عدم اكتمال تطور السوابق القضائية. ففي قضية Ryanair Ltd ضد Billigfluege.de GmbH ، قضت المحكمة العليا في أيرلندا بأن اتفاقية " النقر للموافقة " الخاصة بشركة Ryanair ملزمة قانونًا. وخلافًا لما توصلت إليه محكمة المقاطعة الأمريكية للمنطقة الشرقية من ولاية فرجينيا، والمحكمة البحرية والتجارية الدنماركية، قضى القاضي مايكل حنا بأن الرابط التشعبي لشروط وأحكام Ryanair كان واضحًا للعيان، وأن إلزام المستخدم بالموافقة على الشروط والأحكام للوصول إلى الخدمات الإلكترونية يكفي لتكوين علاقة تعاقدية. [ 30 ] ويجري حاليًا استئناف هذا القرار أمام المحكمة العليا في أيرلندا. [ 31 ]

في 30 أبريل 2020، أصدرت الهيئة الوطنية الفرنسية لحماية البيانات (CNIL) توجيهات جديدة بشأن استخراج البيانات من مواقع الويب. [ 32 ] أوضحت توجيهات الهيئة أن البيانات المتاحة للجمهور تظل بيانات شخصية، ولا يجوز إعادة استخدامها لأغراض أخرى دون علم صاحبها. [ 33 ]

أستراليا

في أستراليا، يحظر قانون مكافحة البريد العشوائي لعام 2003 بعض أشكال جمع البيانات من الإنترنت، على الرغم من أن هذا ينطبق فقط على عناوين البريد الإلكتروني. [ 34 ] [ 35 ]

الهند

باستثناء بعض القضايا المتعلقة بانتهاك حقوق الملكية الفكرية، لم تُصدر المحاكم الهندية أحكامًا صريحة بشأن مشروعية استخراج البيانات من مواقع الويب. ومع ذلك، ونظرًا لأن جميع أشكال العقود الإلكترونية الشائعة قابلة للتنفيذ في الهند، فإن انتهاك شروط الاستخدام التي تحظر استخراج البيانات يُعدّ انتهاكًا لقانون العقود. كما يُعدّ انتهاكًا لقانون تكنولوجيا المعلومات لعام 2000 ، الذي يُعاقب على الوصول غير المصرح به إلى موارد الحاسوب أو استخراج البيانات منها.

طرق لمنع استخراج البيانات من مواقع الويب

يمكن لمدير الموقع الإلكتروني استخدام إجراءات متنوعة لإيقاف أو إبطاء الروبوتات. تتضمن بعض هذه الأساليب ما يلي:

  • حظر عنوان IP إما يدويًا أو بناءً على معايير مثل الموقع الجغرافي وقائمة حظر عناوين IP (DNSRBL) . سيؤدي هذا أيضًا إلى حظر جميع عمليات التصفح من ذلك العنوان، وهو غير فعال ضد برامج الزحف الموزعة على الويب. [ 5 ]
  • تعطيل أي واجهة برمجة تطبيقات لخدمة الويب قد يكشف عنها نظام الموقع الإلكتروني.
  • تُعلن بعض برامج الروبوت عن هويتها (باستخدام سلاسل وكيل المستخدم ) ويمكن حظرها بناءً على ذلك باستخدام ملف robots.txt ؛ و" googlebot " مثال على ذلك. بينما لا تُميّز برامج روبوت أخرى بينها وبين المستخدم البشري الذي يستخدم متصفحًا.
  • يمكن حظر البرامج الآلية عن طريق مراقبة حركة المرور الزائدة.
  • يمكن أحيانًا حظر برامج الروبوت باستخدام أدوات للتحقق من هوية المستخدم الحقيقي للموقع، مثل اختبار CAPTCHA . تُبرمج بعض برامج الروبوت خصيصًا لكسر أنماط CAPTCHA محددة، أو قد تستخدم خدمات خارجية تعتمد على جهد بشري لقراءة تحديات CAPTCHA والرد عليها في الوقت الفعلي. ويمكن تفعيل هذه البرامج في الحالات التالية: 1) إرسال عدد كبير جدًا من الطلبات في فترة زمنية قصيرة، 2) استخدام خوادم بروكسي ضعيفة، أو 3) عدم إخفاء بصمة برنامج استخراج البيانات بشكل صحيح. [ 36 ]
  • خدمات مكافحة البرامج الآلية التجارية: تقدم الشركات خدمات مكافحة البرامج الآلية وبرامج استخراج البيانات للمواقع الإلكترونية. كما أن بعض جدران الحماية لتطبيقات الويب تتمتع بقدرات محدودة على كشف البرامج الآلية. ومع ذلك، فإن العديد من هذه الحلول ليست فعالة للغاية. [ 37 ]
  • تحديد مواقع الروبوتات باستخدام مصيدة عسل أو طريقة أخرى لتحديد عناوين IP الخاصة ببرامج الزحف الآلية.
  • التمويه باستخدام صور CSS لعرض بيانات مثل أرقام الهواتف أو عناوين البريد الإلكتروني، على حساب إمكانية الوصول لمستخدمي قارئات الشاشة .
  • نظراً لاعتماد برامج الروبوت على اتساق كود الواجهة الأمامية للموقع المستهدف، فإن إضافة اختلافات طفيفة إلى أكواد HTML/CSS المحيطة بالبيانات المهمة وعناصر التنقل تتطلب تدخلاً بشرياً أكبر في الإعداد الأولي للروبوت، وإذا تم ذلك بفعالية، فقد يجعل استخراج البيانات من الموقع المستهدف أمراً بالغ الصعوبة نظراً لضعف القدرة على أتمتة عملية الاستخراج. [ 38 ]
  • يمكن للمواقع الإلكترونية أن تحدد ما إذا كان الزحف مسموحًا به أم لا في ملف robots.txt ، وأن تسمح بالوصول الجزئي، وتحد من معدل الزحف، وتحدد الوقت الأمثل للزحف، وغير ذلك.
  • يتمثل أحد أساليب هذه الطريقة في حصر برامج الروبوت في فخ ، وتزويدها ببيانات غير منطقية لتسميم قاعدة بياناتها . وتُعد هذه الطريقة فعالة بشكل خاص ضد برامج الروبوت التي تتجاهل ملفات robots.txt. [ 39 ]
  • بصمة بروتوكول أمان طبقة النقل (TLS): تحلل أنظمة الأمان الحديثة عملية المصافحة لبروتوكول أمان طبقة النقل (TLS) لتحديد تطبيق العميل. ترسل التطبيقات المختلفة (مثل متصفح جوجل كروم مقابل برنامج بايثون نصي ) تشفيرات وامتدادات بترتيبات فريدة. ينتج عن ذلك "بصمة" فريدة (مثل توقيع JA3) تسمح للخوادم باكتشاف البرامج النصية الآلية وحظرها بغض النظر عن عنوان IP الخاص بها . [ 40 ] [ 41 ]
  • تحدي إثبات العمل مثل أنوبيس (برنامج) .

انظر أيضاً

مراجع

  1. ^ ثابيلو ، تسون سوابو. ناموشي، مولاليتسا؛ ماتسيبي، أوديتسي؛ موتشيغوا، تشيامو؛ بوبابي ، ماري جين مورونجوا (2021/07/28). "SASSCAL WebSAPI: واجهة برمجة تطبيقات تجريف الويب لدعم الوصول إلى بيانات الطقس الخاصة بـ SASSCAL" . مجلة علوم البيانات . 20 24. دوى : 10.5334/dsj-2021-024 . ISSN 1683-1470 . S2CID 237719804 .  
  2. "Search Engine History.com" . تاريخ محركات البحث . تم الاطلاع عليه بتاريخ 26 نوفمبر 2019 .
  3. "إيباي، وواجهات برمجة التطبيقات، والويب المتصل" . تاريخ الويب . 3 سبتمبر 1995. تم الاطلاع عليه في 23 يونيو 2025 .
  4. صفحة، بيتر هالارف. "ستقوم كلاود فلير الآن، بشكل افتراضي، بحظر برامج الذكاء الاصطناعي من الزحف إلى مواقع عملائها الإلكترونية" . مجلة إم آي تي ​​للتكنولوجيا . تم الاطلاع عليه بتاريخ 23 يوليو 2026 .
  5. 1 2 "ما هي شبكة غراس، وما مقدار الرموز التي يمكنك ربحها فعليًا من خلال مشاركة النطاق الترددي للذكاء الاصطناعي؟" . تيرابايت تراينجل . 30 مايو 2026. تم الاطلاع عليه بتاريخ 23 يوليو 2026 .
  6. "برامج الماجستير في القانون وأنت: كيف تستخدم مختبرات الذكاء الاصطناعي شبكة غراس | مدونة غراس" . غراس آرمي . تم الاطلاع عليه بتاريخ 23 يوليو 2026 .
  7. باير، دانيال؛ ديكر، راينهولد؛ أسينوفا، يانا (12 مارس 2025). "جمع وتحليل المحتوى الذي ينشئه المستخدمون لدعم اتخاذ القرارات في إدارة التسويق: نظرة عامة على الأساليب وحالات الاستخدام" . مجلة شمالنباخ لأبحاث الأعمال . 77 : 419-455 . doi : 10.1007/s41471-025-00208-7 .
  8. سونغ، روي هوا؛ مايكروسوفت للأبحاث (14 سبتمبر 2007). "التحسين المشترك لتوليد الأغلفة واكتشاف القوالب" (ملف PDF) . وقائع المؤتمر الدولي الثالث عشر لجمعية ACM SIGKDD حول اكتشاف المعرفة واستخراج البيانات . ص 894. doi : 10.1145/1281192.1281287 . ISBN  9781595936097. S2CID 833565 . مؤرشف من الأصل (PDF) في 11 أكتوبر 2016. 
  9. استخراج البيانات من الويب باستخدام التعليقات الدلالية
  10. روش، ويد (25 يوليو 2012). "يستخدم Diffbot رؤية الحاسوب لإعادة ابتكار الويب الدلالي" . إكسكونومي . www.xconomy.com . تاريخ الاسترجاع: 15 مارس 2013 .
  11. "أسئلة وأجوبة حول الروابط - هل شروط استخدام الموقع الإلكتروني عقود ملزمة؟" . www.chillingeffects.org. 2007-08-20. مؤرشف من الأصل بتاريخ 2002-03-08 . تم الاطلاع عليه بتاريخ 2007-08-20 . 
  12. كينيث، هيرشي، جيفري (1 يناير 2014). "العلاقات التكافلية: القبول العملي لاستخراج البيانات" . مجلة بيركلي لقانون التكنولوجيا . 29 (4). doi : 10.15779/Z38B39B . ISSN 1086-3818 . {{cite journal}}: صيانة CS1: أسماء متعددة: قائمة المؤلفين ( رابط )
  13. "قانون الإنترنت، الفصل 6: التعدي على المنقولات" . www.tomwbell.com. 2007-08-20 . تاريخ الاسترجاع: 2007-08-20 .
  14. ما هي دعاوى "التعدي على الممتلكات المنقولة" التي رفعتها بعض الشركات أو أصحاب المواقع الإلكترونية؟ . www.chillingeffects.org. 2007-08-20. مؤرشف من الأصل بتاريخ 2002-03-08 . تم الاطلاع عليه بتاريخ 2007-08-20 .
  15. "شركة تيكيت ماستر ضد شركة تيكتس دوت كوم" . 2007-08-20 . تم الاطلاع عليه بتاريخ 2007-08-20 .
  16. "الخطوط الجوية الأمريكية ضد فير تشيس" (ملف PDF) . 20 أغسطس 2007. مؤرشف من الأصل (ملف PDF) بتاريخ 23 يوليو 2011. تم الاطلاع عليه بتاريخ 20 أغسطس 2007 .
  17. "الخطوط الجوية الأمريكية وشركة فير تشيس تُسوّيان دعوى قضائية" . المكتبة الحرة. 13 يونيو 2003. مؤرشف من الأصل في 5 مارس 2016. تم الاطلاع عليه في 26 فبراير 2012 .
  18. إمبيرفا (2011). كشف هجمات كشط المواقع الإلكترونية وحظرها . ورقة بيضاء من إمبيرفا.
  19. أدلر، كينيث أ. (29 يوليو 2003). "جدل يحيط ببرامج استخراج البيانات من الشاشة: برامج تساعد المستخدمين على الوصول إلى مواقع الويب، لكن أنشطة المنافسين تخضع للتدقيق" . مؤرشف من الأصل في 11 فبراير 2011. تم الاطلاع عليه في 27 أكتوبر 2010 .
  20. "CVENT, Inc. ضد Eventbrite, Inc. وآخرون" (ملف PDF) . 24-11-2014. مؤرشف من الأصل (ملف PDF) بتاريخ 21-09-2013 . تم الاطلاع عليه بتاريخ 05-11-2015 .
  21. "شركة كيو في سي ضد شركة ريزلتلي، رقم القضية 14-06714 (المحكمة الجزئية للمنطقة الشرقية من بنسلفانيا، تاريخ الإيداع 24 نوفمبر 2014)" . المحكمة الجزئية الأمريكية للمنطقة الشرقية من بنسلفانيا . تاريخ الاطلاع: 5 نوفمبر 2015 .
  22. نيوبورغر، جيفري د. (5 ديسمبر 2014). "شركة QVC تقاضي تطبيق تسوق بتهمة استخراج البيانات من مواقع الويب مما أدى إلى انقطاع الخدمة" . مجلة القانون الوطني . بروسكاور روز إل إل بي . تم الاطلاع عليه في 5 نوفمبر 2015 .
  23. "هل رفع إقبال/تومبلي معايير ادعاءات التصفح الآمن؟" (ملف PDF) . ١٧ سبتمبر ٢٠١٠. مؤرشف من الأصل (ملف PDF) بتاريخ ٢٣ يوليو ٢٠١١. تم الاطلاع عليه بتاريخ ٢٧ أكتوبر ٢٠١٠ .
  24. "هل يُمكن أن يُصبح استخراج المحتوى غير المُخالف انتهاكًا لحقوق النشر... بسبب طريقة عمل برامج الاستخراج؟ | Techdirt" . Techdirt . 10-06-2009 . تاريخ الاسترجاع: 24-05-2016 .
  25. "فيسبوك ضد باور فنتشرز" . مؤسسة الحدود الإلكترونية . يوليو 2011. تم الاطلاع عليه بتاريخ 24-05-2016 .
  26. تشونغ، أندرو (14 يونيو/حزيران 2021). "المحكمة العليا الأمريكية تُعيد إحياء دعوى لينكدإن لحماية البيانات الشخصية" . رويترز . تم الاطلاع عليه بتاريخ 14 يونيو/حزيران 2021 .
  27. ويتاكر، زاك (18 أبريل 2022). "الاستخلاص من مواقع الويب قانوني، محكمة الاستئناف الأمريكية تؤكد ذلك" . تيك كرانش .
  28. ^ “UDSKRIFT AF SØ- & HANDELSRETTENS DOMBOG” (PDF) (باللغة الدنماركية). bvhd.dk. 2006-02-24. مؤرشفة من الأصلي (PDF) بتاريخ 2007-10-12 . تم الاسترجاع 2007-05-30 .
  29. "قانون الذكاء الاصطناعي | تشكيل مستقبل أوروبا الرقمي" . digital-strategy.ec.europa.eu . 16-09-2025 . تاريخ الاطلاع: 28-09-2025 .
  30. "قرارات المحكمة العليا في أيرلندا >> Ryanair Ltd -v- Billigfluege.de GMBH 2010 IEHC 47 (26 فبراير 2010)" . معهد المعلومات القانونية البريطاني والأيرلندي. 2010-02-26 . تم الاطلاع عليه بتاريخ 2012-04-19 .
  31. ماثيوز، آين (يونيو 2010). "الملكية الفكرية: شروط استخدام الموقع الإلكتروني" . العدد 26: يونيو 2010. تحديثات شركة إل كيه شيلدز للمحاماة. ص 3. مؤرشف من الأصل بتاريخ 24 يونيو 2012. تم الاطلاع عليه بتاريخ 19 أبريل 2012 . 
  32. "إعادة استخدام البيانات المنشورة التي يمكن الوصول إليها عبر الإنترنت من خلال fins de démarchage Commercial | CNIL" . www.cnil.fr (بالفرنسية) . تم الاسترجاع 2020-07-05 .
  33. FindDataLab.com (2020-06-09). "هل لا يزال بإمكانك إجراء عمليات استخراج البيانات من مواقع الويب في ظل إرشادات CNIL الجديدة؟" . Medium . تم الاطلاع عليه بتاريخ 2020-07-05 .
  34. المكتب الوطني لاقتصاد المعلومات (فبراير 2004). "قانون مكافحة الرسائل الإلكترونية غير المرغوب فيها لعام 2003: نظرة عامة للشركات" . هيئة الاتصالات الأسترالية. ص 6. مؤرشف من الأصل بتاريخ 3 ديسمبر 2019. تم الاطلاع عليه بتاريخ 7 ديسمبر 2017 . 
  35. المكتب الوطني لاقتصاد المعلومات (فبراير 2004). "قانون مكافحة الرسائل الإلكترونية المزعجة لعام 2003: دليل عملي للشركات" (ملف PDF) . هيئة الاتصالات الأسترالية. ص 20. تاريخ الاطلاع: 7 ديسمبر 2017 . 
  36. "استخراج البيانات من مواقع الويب للمبتدئين: دليل 2024" . بروكسي واي . 31 أغسطس 2023. تاريخ الاسترجاع: 15 مارس 2024 .
  37. مايانك ديمان، حلول كشف الاحتيال والروبوتات، مؤتمر OWASP AppSec Cali' 2018، تم الاطلاع عليه في 10 فبراير 2018.
  38. "ما هو استخراج البيانات من مواقع الويب؟" . داتا دوم . 2022-03-06 . تم الاطلاع عليه بتاريخ 2025-12-16 .
  39. بيلانجر، آشلي (28 يناير 2025). "كارهو الذكاء الاصطناعي يبنون فخاخًا للإيقاع ببرامج استخراج البيانات التي تتجاهل ملف robots.txt وخداعها" . آرس تكنيكا .
  40. "JA3 - طريقة لتحليل عملاء SSL/TLS" . هندسة Salesforce . تم الاطلاع عليه بتاريخ 27-01-2026 .
  41. إرماكوفيتش، سيرجي. "ما هو استخراج البيانات من الويب؟" . هاس داتا . تم الاسترجاع في 27 يناير 2026 .