الزحف الشائع
مؤسسة Common Crawl ( Common Crawl ) هي منظمة غير ربحية (501(c)(3)) تقوم بفهرسة مواقع الويب وتوفير أرشيفاتها ومجموعات بياناتها مجانًا للجمهور. [ 1 ] [ 2 ] الوصول إلى البيانات مجاني على خدمات أمازون السحابية (AWS) ، ولكن قد يتحمل المستخدمون تكاليف التخزين والحوسبة. [ 3 ]
تأسست شركة Common Crawl على يد جيل إلباز . [ 1 ] [ 2 ]
استُخدمت البيانات في الغالب من قِبل الباحثين وبعض الشركات الناشئة حتى العقد الثالث من القرن الحادي والعشرين، حين بدأت شركات الذكاء الاصطناعي بتدريب نماذج لغوية ضخمة باستخدامها. [ 4 ] في نوفمبر 2025، كشف تحقيق أجرته مجلة "ذا أتلانتيك" أن شركة "كومون كرول" ضللت الناشرين عندما ادّعت احترامها لجدران الدفع في عملية جمع البيانات، وأنها لم تستجب لطلبات الناشرين بإزالة محتواهم من قواعد بياناتها. [ 4 ]
تاريخ
تأسست Common Crawl في عام 2007 في سان فرانسيسكو. [ 5 ] وبدأت بنشر عمليات الزحف الخاصة بها في عام 2011. [ 6 ]
بحلول عام 2013، كانت مواقع مثل TinEye تبني منتجاتها على Common Crawl. [ 7 ] [ 8 ] يقلل هذا الزحف من اعتماد الشركات والباحثين على جوجل، التي تمتلك أكبر قاعدة بيانات. [ 7 ] [ 8 ] صُمم Common Crawl ليحتوي على بيانات أكثر وأحدث، ما يجعله أكثر كفاءة في التحليل والاستخدام من Wayback Machine الذي أنشأه أرشيف الإنترنت . [ 8 ] [ 7 ]
بحلول عام 2015، بلغ عدد صفحات الويب المُفهرسة على قاعدة بيانات Common Crawl 1.8 مليار صفحة، والتي بدأت بفهرسة قائمة عناوين URL مُقدمة من محرك البحث Blekko . [ 9 ] تستخدم هذه القاعدة خدمات أمازون السحابية (AWS) ، التي تُقدم بعض خدماتها مجانًا، مما يسمح بخفض متوسط تكاليف الحوسبة إلى ما بين 2000 و4000 دولار أمريكي شهريًا. [ 9 ] وقد أدرج موقع Common Crawl الإلكتروني 30 دراسة تستند إلى بيانات Common Crawl. [ 9 ]
قبل عام 2023، لم يكن مشروع Common Crawl معروفًا على نطاق واسع خارج أوساط الباحثين الأكاديميين الذين يستخدمون بياناته. [ 5 ] تلقى Common Crawl أولى طلبات تنقيح المعلومات في عام 2023، وبدأ برنامج الزحف الخاص به، CCBot، يُحظر بشكل متزايد. [ 5 ] في عام 2023، بدأ المشروع بتلقي دعم مالي كبير من شركات الذكاء الاصطناعي، بما في ذلك Anthropic و OpenAI ، حيث تبرعت كل منهما بمبلغ 250,000 دولار أمريكي. [ 4 ] كما استُخدم المشروع لتدريب نموذج اللغة الضخم Gemini التابع لشركة Google DeepMind . [ 10 ] بحلول أبريل 2023، كان Common Crawl يلتقط بيانات 3.1 مليار صفحة ويب، مع تقدير أن 5% من الصفحات قبل عام 2021 تحتوي على خطاب كراهية أو عبارات مسيئة. [ 11 ]
بحلول عام 2024، تم الاستشهاد بمجموعة بيانات Common Crawl في أكثر من 10000 دراسة أكاديمية. [ 12 ] وبحلول عام 2024، كانت مجموعتا بيانات The Pile و Common Crawl هما مجموعتا البيانات الرئيسيتان المستخدمتان لتدريب نماذج الذكاء الاصطناعي. [ 13 ] [ 14 ]
في نوفمبر 2025، كشف تحقيقٌ أجراه الصحفي التقني أليكس رايزنر لصالح مجلة "ذا أتلانتيك" أن برنامج "كومون كرول" ضلّل الناشرين عندما ادّعى احترامه لجدران الدفع في عمليات استخراج البيانات، وعندما زعم أنه يستجيب لطلبات الناشرين بإزالة محتواهم من قواعد بياناته. [ 4 ] وقد تضمن البرنامج نتائج مضللة في وظيفة البحث العامة على موقعه الإلكتروني، حيث لم تُظهر أي نتائج للمواقع التي طلبت إزالة أرشيفاتها، بينما كانت هذه المواقع في الواقع لا تزال مُدرجة في عمليات استخراج البيانات التي تستخدمها شركات الذكاء الاصطناعي. [ 4 ] وبحلول عام 2025، وجد رايزنر أن برنامج "كومون كرول" كان أكثر برامج الروبوت حظرًا من قِبل أفضل 1000 موقع إلكتروني. [ 4 ]
ناقشت مقالة نُشرت عام 2026 على موقع LWN.net ميزةً لخدمات مثل Common Crawl، وهي قدرتها على الحد من تكاليف استخراج البيانات للمواقع الإلكترونية، وذلك من خلال السماح للشركات والباحثين بتنزيل البيانات من Common Crawl بدلاً من استخراجها بأنفسهم. [ 15 ]
في أبريل 2026، بدأ Common Crawl تجريبياً في توزيع بياناته من خلال Hugging Face Storage Bucket ، بالإضافة إلى تخزينه القياسي على Amazon S3 . [ 16 ]
منظمة
عمل بيتر نورفيج وجوي إيتو في المجلس الاستشاري. [ 8 ] ريتش سكرينتا هو المدير التنفيذي. [ 4 ]
وقد تلقت تمويلها بشكل شبه حصري من مؤسسة عائلة الباز الخيرية حتى عام 2023 عندما بدأت في تلقي تبرعات من صناعة الذكاء الاصطناعي. [ 4 ]
نسخ محسّنة
تقوم العديد من المنظمات بأخذ بيانات Common Crawl الخام وتنقيحها إلى مجموعات بيانات تستبعد المحتوى المثير للجدل أو تكون ذات جودة أعلى لأغراضها، مثل FineWeb وDCLM وC4. [ 4 ]
مجموعة ضخمة من الأرشيفات النظيفة التي تم الزحف إليها
تُعرف نسخة جوجل من قاعدة بيانات Common Crawl باسم Colossal Clean Crawled Corpus ، أو C4 اختصارًا. وقد أُنشئت لتدريب سلسلة نماذج اللغة T5 في عام 2019. [ 17 ] وبحلول عام 2023، ظهرت بعض المخاوف بشأن المحتوى المحمي بحقوق الطبع والنشر في C4، بالإضافة إلى المحتوى العنصري. [ 18 ] [ 17 ] ووجدت دراسة أجريت عام 2024 أن 45% من المحتوى محظور صراحةً بموجب شروط خدمة المواقع الإلكترونية، ولا يُسمح باستخدامه لأغراض مثل تدريب الذكاء الاصطناعي من قِبل الشركات الربحية. [ 12 ]
انظر أيضاً
مراجع
- ١ ٢ روزانا شيا (٥ فبراير ٢٠١٢). "رائد الأعمال التقني جيل إلباز يحقق نجاحًا كبيرًا في لوس أنجلوس" . صحيفة لوس أنجلوس تايمز . تم الاطلاع عليه في ٣١ يوليو ٢٠١٤.
تسعى مؤسسته غير الربحية "كومون كرول فاونديشن" إلى جعل نسخة من الإنترنت متاحة لعالم بيانات، أو لشركة ناشئة، أو لباحث، أو لمحلل يرغب فقط في تحسين العالم.
- 1 2 "جيل إلباز وكومون كرول" . أخبار إن بي سي . 4 أبريل 2013. مؤرشف من الأصل في 13 أبريل 2013. تم الاطلاع عليه في 31 يوليو 2014 .
- ↑ "نظرة عامة على Common Crawl" . commoncrawl.org . تم الاطلاع عليه بتاريخ 18-06-2026 .
- 1 2 3 4 5 6 7 8 9 رايزنر، أليكس (4 نوفمبر 2025). "الشركة تُمرر بهدوء مقالات مدفوعة الأجر إلى مطوري الذكاء الاصطناعي" . ذا أتلانتيك . تم الاطلاع عليه بتاريخ 14 نوفمبر 2025 .
- 1 2 3 نيبس، كيت (13 يونيو 2024). "الناشرون يستهدفون برنامج Common Crawl في معركة حول بيانات تدريب الذكاء الاصطناعي" . مجلة Wired . الرقم الدولي الموحد للدوريات 1059-1028 . تاريخ الاسترجاع: 10 ديسمبر 2025 .
- ↑ بوتس، جيسون؛ تورانس، أندرو؛ هارهوف، ديتمار؛ فون هيبل، إريك (مارس 2024). "الاستفادة من البيانات المشتركة: النظرية، والأدلة، والآثار الاستراتيجية" . مجلة علوم الاستراتيجية . 9 (1): 1-17 . doi : 10.1287/stsc.2021.0080 . ISSN 2333-2050 .
- 1 2 3 براندوم، راسل (1 مارس 2013). "الزحف المشترك: ملاحقة جوجل بميزانية غير ربحية" . ذا فيرج . تم الاسترجاع في 10 ديسمبر 2025 .
- ١ ٢ ٣ ٤ توم سيمونايت (٢٣ يناير ٢٠١٣). "قاعدة بيانات مجانية للويب بأكمله قد تُنشئ جوجل جديدة" . مجلة إم آي تي للتكنولوجيا. مؤرشف من الأصل في ٢٦ يونيو ٢٠١٤. تم الاطلاع عليه في ٣١ يوليو ٢٠١٤ .
- 1 2 3 هايز، برايان (2015). "علوم الحاسوب: الزحف نحو شبكة أكثر حكمة" . مجلة ساينتست الأمريكية . 103 (3): 184-187 . ISSN 0003-0996 .
- ^ كويستا ، ألبرت (15 نوفمبر 2025). "L'FBI، a la caça del web arxivat que incomoda els mitjans" . آرا (باللغة الكاتالونية). مؤرشفة من الأصلي في 17 نوفمبر 2025 . تم الاسترجاع في 2 مارس 2026 .
- ↑ سوس، كارلين؛ هاروتونيان، ليفون (2024). "حول مسألة التأليف في نماذج اللغة الكبيرة" . تنظيم المعرفة . 51 (2): 83-95 . doi : 10.5771/0943-7444-2024-2-83 . ISSN 0943-7444 .
- 1 2 روز، كيفن (19 يوليو 2024). "البيانات التي تدعم الذكاء الاصطناعي تتلاشى بسرعة" . نيويورك تايمز .
- ↑ جيلبرتسون، آني (16 يوليو 2024). "استخدمت آبل، إنفيديا، وأنثروبيك آلاف مقاطع الفيديو من يوتيوب لتدريب الذكاء الاصطناعي" . وايرد . ISSN 1059-1028 . تاريخ الاسترجاع: 29 يناير 2026 .
- ↑ أنتوني، أوبرا؛ شارما، لاكشمي؛ نور، إلينا (30 أبريل 2024). "النهوض بأجندة عالمية أكثر للذكاء الاصطناعي الجدير بالثقة" . مؤسسة كارنيغي للسلام الدولي . تاريخ الاسترجاع: 29 يناير 2026 .
- ↑ ألدن، داروك (12 فبراير 2026). "تسميم برامج استخراج البيانات باستخدام مادة الإيوكايين" . LWN.net . تم الاطلاع عليه بتاريخ 9 مايو 2026 .
- ↑ "مدونة Common Crawl - أبريل 2026: أرشيف الزحف متوفر الآن في سلة تخزين على شكل وجه محتضن" . commoncrawl.org . تم الاطلاع عليه بتاريخ 24-05-2026 .
- 1 2 كواتش، كاتيانا (2023-04-20). "بيانات تدريب التعلم الآلي C4 من جوجل مستمدة من موقع 4chan، ومصادر عنصرية" . ذا ريجستر . تم الاسترجاع في 2026-05-09 .
- ↑ هيرن، أليكس (2023-04-20). "مخاوف جديدة بشأن مصادر مواد التدريب لأنظمة الذكاء الاصطناعي" . صحيفة الغارديان . ISSN 0261-3077 . تاريخ الاسترجاع: 2023-04-21 .
روابط خارجية
- الموقع الرسمي
- مستودع Common Crawl على GitHub يحتوي على برنامج الزحف والمكتبات ونموذج التعليمات البرمجية
- صفحة ProPublica Nonprofit Explorer - تحتوي على ملفات 990
- المنظمات ذات الصلة بالإنترنت
- أرشفة الويب
- مبادرات أرشفة الويب
- الذكاء الاصطناعي مفتوح المصدر
