
Common Crawl
United States"إضفاء الطابع الديمقراطي على الوصول إلى بيانات الويب"
نبذة
Common Crawl هي منظمة غير ربحية 501(c)(3) تحتفظ بمستودع مفتوح لبيانات زحف الويب. منذ تأسيسها في عام 2008 على يد عالم الكمبيوتر جيل الباز، قامت المنظمة بشكل منهجي بالزحف على الإنترنت وجعلت بيتابايت من بيانات HTML الخام والبيانات الوصفية والنصوص المستخرجة متاحة مجانًا. يتم استضافة البيانات في مستودعات S3 العامة لخدمات أمازون ويب؛ يدفع المستخدمون فقط تكاليف الحوسبة والتخزين الخاصة بهم. تعد مجموعة بيانات Common Crawl أكبر مجموعة بيانات متاحة للويب بشكل مفتوح، ويستخدمها الباحثون والصحفيون والشركات الناشئة ومختبرات الذكاء الاصطناعي الكبرى. في عشرينيات القرن الحادي والعشرين، أصبحت المصدر التدريبي الأساسي لنماذج اللغات الكبيرة بما في ذلك GPT-3 و GPT-4 و LLaMA. فحص تحقيق أجرته The Markup و Wired في نوفمبر 2025 كيف تستخدم شركات الذكاء الاصطناعي البيانات، مما أثار نقاشات حول الموافقة وحقوق النشر.
الرسالة
تتمثل مهمة Common Crawl في إضفاء الطابع الديمقراطي على الوصول إلى بيانات الويب عن طريق الزحف على الإنترنت وتوفير المحتوى الناتج مجانًا لأي شخص. الهدف هو خفض الحواجز أمام تحليل البيانات على نطاق الويب، وتعزيز الابتكار، والحفاظ على سجل تاريخي مفتوح للويب.
التاريخ
بدأ جيل الباز في بناء الزاحف الأول في عام 2007، مدفوعًا بالاعتقاد بأن بيانات الويب المفتوحة كانت ضرورية لإنترنت صحي. تم إصدار أول مجموعة بيانات زحف عامة، تحتوي على حوالي 2 مليار صفحة، في عام 2008. اعتمدت البنية التحتية المبكرة على خوادم متبرع بها ومنح. في عام 2012، عقدت Common Crawl شراكة مع خدمات أمازون ويب لاستضافة البيانات في مستودعات S3 العامة، مما جعل الوصول مجانيًا وقابلاً للتطوير. تم إطلاق مجموعة بيانات News Crawl في عام 2015، مما يوفر تغذية محدثة باستمرار لمقالات الأخبار. بحلول عام 2017، نمت المجموعة إلى 3.5 مليار صفحة، وهي أكبر مجموعة بيانات ويب متاحة للجمهور في ذلك الوقت. أدى ازدهار الذكاء الاصطناعي في أوائل عشرينيات القرن الحادي والعشرين إلى زيادة الطلب بشكل كبير؛ أصبحت Common Crawl مجموعة بيانات التدريب الفعلية لنماذج اللغات الكبيرة. استجابةً لمخاوف حقوق النشر والموافقة التي أثيرت من خلال تحقيق عام 2025، أعلنت المنظمة عن خطط لتطوير نظام إلغاء الاشتراك وتتبع أفضل للمصدر.
أشخاص بارزون
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
مدير تنفيذي · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
محطات بارزة
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
الأقسام
معلومات المنظمة
- تأسس
- +2008
- المقر
- San Francisco, California, United States
- الدولة
- United States
- Executive Director
- Rich Skrenta
- النوع
- Non-profit
- النوع
- Non-profit
- تأسس
- +2008
- الدولة
- الولايات المتحدة
- المؤسس
- Gil Elbaz
- Annual Budget
- $1–2 million
- الموظفون
- 5–10
- Data Size
- Petabytes
البيانات المالية
- الإيرادات
- $0.0 billion
- الميزانية
- $1–2 million
- الموظفون
- 5–10
الموقع الرسمي
commoncrawl.org/
انضم إلى المجتمع
معجب يناقشون