Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "إضفاء الطابع الديمقراطي على الوصول إلى بيانات الويب"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta
    المجتمع

    نبذة

    Common Crawl هي منظمة غير ربحية 501(c)(3) تحتفظ بمستودع مفتوح لبيانات زحف الويب. منذ تأسيسها في عام 2008 على يد عالم الكمبيوتر جيل الباز، قامت المنظمة بشكل منهجي بالزحف على الإنترنت وجعلت بيتابايت من بيانات HTML الخام والبيانات الوصفية والنصوص المستخرجة متاحة مجانًا. يتم استضافة البيانات في مستودعات S3 العامة لخدمات أمازون ويب؛ يدفع المستخدمون فقط تكاليف الحوسبة والتخزين الخاصة بهم. تعد مجموعة بيانات Common Crawl أكبر مجموعة بيانات متاحة للويب بشكل مفتوح، ويستخدمها الباحثون والصحفيون والشركات الناشئة ومختبرات الذكاء الاصطناعي الكبرى. في عشرينيات القرن الحادي والعشرين، أصبحت المصدر التدريبي الأساسي لنماذج اللغات الكبيرة بما في ذلك GPT-3 و GPT-4 و LLaMA. فحص تحقيق أجرته The Markup و Wired في نوفمبر 2025 كيف تستخدم شركات الذكاء الاصطناعي البيانات، مما أثار نقاشات حول الموافقة وحقوق النشر.

    الرسالة

    تتمثل مهمة Common Crawl في إضفاء الطابع الديمقراطي على الوصول إلى بيانات الويب عن طريق الزحف على الإنترنت وتوفير المحتوى الناتج مجانًا لأي شخص. الهدف هو خفض الحواجز أمام تحليل البيانات على نطاق الويب، وتعزيز الابتكار، والحفاظ على سجل تاريخي مفتوح للويب.

    التاريخ

    بدأ جيل الباز في بناء الزاحف الأول في عام 2007، مدفوعًا بالاعتقاد بأن بيانات الويب المفتوحة كانت ضرورية لإنترنت صحي. تم إصدار أول مجموعة بيانات زحف عامة، تحتوي على حوالي 2 مليار صفحة، في عام 2008. اعتمدت البنية التحتية المبكرة على خوادم متبرع بها ومنح. في عام 2012، عقدت Common Crawl شراكة مع خدمات أمازون ويب لاستضافة البيانات في مستودعات S3 العامة، مما جعل الوصول مجانيًا وقابلاً للتطوير. تم إطلاق مجموعة بيانات News Crawl في عام 2015، مما يوفر تغذية محدثة باستمرار لمقالات الأخبار. بحلول عام 2017، نمت المجموعة إلى 3.5 مليار صفحة، وهي أكبر مجموعة بيانات ويب متاحة للجمهور في ذلك الوقت. أدى ازدهار الذكاء الاصطناعي في أوائل عشرينيات القرن الحادي والعشرين إلى زيادة الطلب بشكل كبير؛ أصبحت Common Crawl مجموعة بيانات التدريب الفعلية لنماذج اللغات الكبيرة. استجابةً لمخاوف حقوق النشر والموافقة التي أثيرت من خلال تحقيق عام 2025، أعلنت المنظمة عن خطط لتطوير نظام إلغاء الاشتراك وتتبع أفضل للمصدر.

    أشخاص بارزون

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    مدير تنفيذي · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    محطات بارزة

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    الأقسام

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    معلومات المنظمة

    تأسس
    +2008
    المقر
    San Francisco, California, United States
    الدولة
    United States
    Executive Director
    Rich Skrenta
    النوع
    Non-profit
    النوع
    Non-profit
    تأسس
    +2008
    الدولة
    الولايات المتحدة
    المؤسس
    Gil Elbaz
    Annual Budget
    $1–2 million
    الموظفون
    5–10
    Data Size
    Petabytes

    البيانات المالية

    الإيرادات
    $0.0 billion
    الميزانية
    $1–2 million
    الموظفون
    5–10

    الموقع الرسمي

    commoncrawl.org/

    انضم إلى المجتمع

    معجب يناقشون