El mapa de poder de la IA. #18: Common Crawl

La memoria abierta que alimentó la IA generativa

Por Javier Surasky

English version (EN)


Araña digital recorriendo una red global de páginas web, archivos y modelos de inteligencia artificial, con el texto “Common Crawl” y “la memoria abierta que alimentó la IA generativa”.

Common Crawl se integra al mapa de poder de la IA como una infraestructura abierta de datos web que, sin producir modelos propios ni ofrecer servicios comerciales de inteligencia artificial, se convirtió en una de las fuentes más importantes para entrenar sistemas de IA generativa.

Su poder está en la capacidad que tiene de transformar fragmentos de la web pública en un archivo reutilizable a escala planetaria: Common Crawl recopila, organiza y publica datos de la web que luego son descargados, filtrados, limpiados y recombinados por universidades, laboratorios, empresas tecnológicas y desarrolladores de modelos.

La organización, que se presenta como una entidad sin fines de lucro creada en 2007 dedicada a proveer gratuitamente archivos y datasets de la web al público, informa que mantiene datos recolectados desde 2008, con una base de datos que supera los 10 petabytes, publicando rastreos aproximadamente mensuales con más de dos mil millones de páginas por crawl.

Visto como parte del ecosistema de la IA expone que buena parte de la IA generativa se sostiene con innovación algorítmica, disponibilidad de GPUs y, también, accediendo a una “memoria previa de la web” que acabó por ser una condición material de posibilidad para el desarrollo de modelos como ChatGPT, Gemini, Claude, Llama

Fue precisamente el lanzamiento de GPT-3 lo que le dio visibilidad pública; sus datos de entrenamiento incluían una versión filtrada de Common Crawl con 410 mil millones de tokens, lo que representaba el 60% en la mezcla de entrenamiento (Brown et al.)

El papel de Brown et al atrajo la atención sobre el dataset y su lugar en el desarrollo de grandes modelos de lenguaje, y un informe de Mozilla Foundation sostiene que Common Crawl “sentó la base infraestructural” del auge de la IA generativa tras mostrar que al menos el 64% de 47 grandes modelos de lenguaje publicados entre 2019 y 2023 fueron entrenados con versiones filtradas de sus datos.

Esta posición permite definir a Common Crawl como un actor de poder infraestructural indirecto: no tiene decisión sobre los modelos que se crean ni sobre las prácticas de entrenamiento, pero provee una capa de disponibilidad masiva de datos sin la cual muchos actores no podrían acceder a datos web de escala comparable.

Su poder, entonces, reside en reducir barreras de entrada para algunos actores y, simultáneamente, alimentar la concentración de valor en otros.

La paradoja es clara: Common Crawl democratiza el acceso a datos web, pero esos datos pueden terminar incorporados en modelos cerrados, productos propietarios y servicios comerciales controlados por empresas que concentran cómputo, capital, talento técnico, canales de distribución y capacidad jurídica: una infraestructura abierta alimentando a un mercado cerrado.

Esta tensión es parte de un debate mayor sobre bienes comunes digitales, donde se acepta que el acceso abierto a recursos compartidos puede ampliar la investigación, la innovación y la rendición de cuentas, pero también puede facilitar nuevas formas de extracción a escala masiva cuando actores con capacidades desiguales aprovechan un bien común para capturar beneficios privados, algo que la IA ha amplificado.

Common Crawl afirma que su objetivo es democratizar los datos para que no solo grandes empresas puedan hacer investigación y análisis y que ofrece una copia de Internet sin costo para investigadores, empresas e individuos, datos que han sido utilizados, por ejemplo, para mejorar software de traducción, predecir tendencias y rastrear propagación de enfermedades.

Esa narrativa de apertura es fuerte: sin Common Crawl, buena parte de la investigación académica, independiente o de pequeña escala sobre temas como la web, el lenguaje, la seguridad o la desinformación, entre otros, dependería más de bases privadas o inaccesibles, lo que, a su vez, afectaría la transparencia.

El problema, por tanto, no es ubicarse a favor o en contra el Common Crawl, lo que además no tendría ningún sentido ni efecto práctico, sino bajo qué condiciones puede mantenerse una infraestructura abierta de datos web como Web Crawl cuando sus usos posteriores se integran a industrias de altísimo valor económico, fuerte opacidad técnica y creciente impacto social.

Las controversias sobre derecho de autor, minería de texto y datos, consentimiento, exclusión y compensación son otra arista: en una presentación generada como respuesta a una consulta del Reino Unido sobre copyright e IA, Common Crawl sostuvo que el “derecho a leer” debería incluir el “derecho a minar”, y que la mera lectura, escucha o análisis computacional de materiales no debería ser equiparada a una comunicación pública de obras protegidas. También afirmó que respeta robots.txt, no elude paywalls, no inicia sesión en sitios privados y rastrea a un ritmo medido para evitar sobrecargar servidores.

Del otro lado, editores, medios y titulares de derechos cuestionan que la disponibilidad pública de un contenido equivalga a autorización para su extracción, almacenamiento, redistribución técnica o incorporación en cadenas de entrenamiento de IA: en 2024, medios daneses agrupados a través de la Danish Rights Alliance exigieron que Common Crawl dejara de copiar sus contenidos y removiera artículos ya incluidos en datasets anteriores. Wired informó que Common Crawl aceptó cumplir el pedido y que su director ejecutivo sostuvo que la organización no estaba equipada para litigar contra grandes empresas de medios.

La controversia se profundizó con investigaciones periodísticas que acusaron a Common Crawl de facilitar a empresas de IA el acceso a artículos protegidos o paywalled: The Atlantic sostuvo en 2025 que Common Crawl habría abierto una vía para que compañías de IA entrenaran modelos con artículos de medios sin consentimiento, afirmación que Common Crawl negó públicamente.

Este desacuerdo revela una dimensión central del poder digital, que se expresa como la transformación de ecosistemas enteros de producción cultural, periodística y científica en materia prima computacional.

Su ubicación en AWS, la nube de Amazon, agrega otra capa al mapa de poder, ya que Common Crawl informa que sus datos están alojados en esa nube mediante el AWS Open Data Sponsorship Program, lo que refuerza la dimensión paradójica del caso.

En conclusión, Common Crawl es uno de los actores más importantes y menos visibles del mapa de poder de la IA porque organiza una condición previa del aprendizaje automático: la disponibilidad masiva de datos de la web. Su narrativa pública se apoya en apertura, investigación, innovación y democratización del acceso, pero sus críticos señalan extracción, opacidad, insuficiente consentimiento y afectación de modelos económicos basados en la producción de contenidos.

La base de poder de Open Crawl en el ecosistema de la IA está en esas ambivalencias.

 

Datos básicos

Common Crawl Foundation es una organización sin fines de lucro 501(c)(3) fundada en 2007 por Gil Elbaz, su actual Chairman of the Board. El cargo de Executive Director de la empresa lo ocupa, desde 2023, Rich Skrenta.

Su financiamiento principal proviene de la Elbaz Family Foundation, mientras que el alojamiento de sus datos es cubierto por Amazon Web Services a través del AWS Open Data Sponsorship Program. En los últimos años también recibió donaciones de organizaciones, incluidas algunas empresas de IA, para apoyar los costos de operación y mantenimiento de su archivo público.

Comenzó a recolectar datos de la web en 2008 y mantiene un repositorio abierto de datos web que supera los 10 petabytes.

Sus crawls se publican aproximadamente una vez por mes y suelen incluir más de dos mil millones de páginas. Su crawler se identifica como CCBot, y utiliza directivas robots.txt y publica datos en formatos como WARC, WAT y WET.

Su principal fortaleza es ofrecer acceso abierto a datos web de escala masiva, reduciendo barreras para investigación, procesamiento del lenguaje natural, análisis web, seguridad informática, preservación digital y desarrollo de modelos.

Su principal vulnerabilidad está en la disputa por copyright, consentimiento, opt-out, trazabilidad, representación desigual de la web, posible inclusión de contenidos protegidos y dependencia de infraestructuras cloud privadas para alojar y distribuir sus archivos.

El conflicto central que plantea Common Crawl es cómo preservar el valor público de una memoria abierta de la web sin convertirla en una vía de extracción ilimitada para sistemas comerciales de IA.


Referencias

Baack, S. (2024). Training data for the price of a sandwich: Common Crawl’s impact on generative AI. Mozilla Foundation. https://assets.mofoprod.net/network/documents/Common_Crawl_Mozilla_Foundation_2024.pdf

Baack, S. (2024). A critical analysis of the largest source for generative AI training data: Common Crawl. En Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency. Association for Computing Machinery. https://doi.org/10.1145/3630106.3659033

Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger, G., Henighan, T., Child, R., Ramesh, A., Ziegler, D. M., Wu, J., Winter, C., Hesse, C., Chen, M., Sigler, E., Litwin, M., Gray, S., Chess, B., Clark, J., Berner, C., McCandlish, S., Radford, A., Sutskever, I., & Amodei, D. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33, 1877–1901. https://doi.org/10.48550/arXiv.2005.14165

Common Crawl Foundation. (s. f.). About. Common Crawl. https://commoncrawl.org/about

Common Crawl Foundation. (s. f.). Frequently asked questions. Common Crawl. https://commoncrawl.org/faq

Common Crawl Foundation. (2025a, marzo 3). Submission to the UK’s Copyright and AI Consultation. Common Crawl. https://commoncrawl.org/blog/submission-to-the-uks-copyright-and-ai-consultation

Common Crawl Foundation. (2025b, septiembre 17). Common Crawl Foundation Opt-Out Registry. Common Crawl. https://commoncrawl.org/blog/common-crawl-foundation-opt-out-registry

Common Crawl Foundation. (2025c, noviembre 6). Setting the record straight: Common Crawl’s commitment to transparency, fair use, and the public good. Common Crawl. https://commoncrawl.org/blog/setting-the-record-straight-common-crawls-commitment-to-transparency-fair-use-and-the-public-good

Meaker, M. (2024, junio 13). Publishers target Common Crawl in fight over AI training data. Wired. https://www.wired.com/story/the-fight-against-ai-comes-to-a-foundational-data-set/

Reisner, A. (2025, noviembre 4). The company quietly funneling paywalled articles to AI developers. The Atlantic. https://www.theatlantic.com/technology/2025/11/common-crawl-ai-training-data/684567/