La memoria abierta que alimentó la IA generativa
Por Javier Surasky
Common Crawl se integra al mapa de poder de la IA como una infraestructura abierta de datos web que, sin producir modelos propios ni ofrecer servicios comerciales de inteligencia artificial, se convirtió en una de las fuentes más importantes para entrenar sistemas de IA generativa.
Su poder está en la capacidad que tiene de transformar
fragmentos de la web pública en un archivo reutilizable a escala planetaria: Common Crawl recopila, organiza y publica datos de la web que luego son descargados,
filtrados, limpiados y recombinados por universidades, laboratorios, empresas
tecnológicas y desarrolladores de modelos.
La organización, que se presenta como una entidad sin fines
de lucro creada en 2007 dedicada a proveer gratuitamente archivos y datasets de
la web al público, informa que mantiene datos recolectados desde 2008, con una
base de datos que supera los 10 petabytes, publicando rastreos aproximadamente
mensuales con más de dos mil millones de páginas por crawl.
Visto como parte del ecosistema de la IA expone que buena
parte de la IA generativa se sostiene con innovación algorítmica,
disponibilidad de GPUs y, también, accediendo a una “memoria previa de la web”
que acabó por ser una condición material de posibilidad para el desarrollo de
modelos como ChatGPT, Gemini, Claude, Llama
Fue precisamente el lanzamiento de GPT-3 lo que le dio
visibilidad pública; sus datos de entrenamiento incluían una versión filtrada de
Common Crawl con 410 mil millones de tokens, lo que representaba el 60% en la
mezcla de entrenamiento (Brown et al.)
El papel de Brown et al atrajo la atención sobre el dataset
y su lugar en el desarrollo de grandes modelos de lenguaje, y un informe de
Mozilla Foundation sostiene que Common Crawl “sentó la base infraestructural”
del auge de la IA generativa tras mostrar que al menos el 64% de 47 grandes
modelos de lenguaje publicados entre 2019 y 2023 fueron entrenados con
versiones filtradas de sus datos.
Esta posición permite definir a Common Crawl como un actor
de poder infraestructural indirecto: no tiene decisión sobre los modelos que se
crean ni sobre las prácticas de entrenamiento, pero provee una capa de disponibilidad masiva de datos sin la cual muchos actores no podrían acceder a datos web de escala comparable.
Su poder, entonces, reside en reducir barreras de entrada
para algunos actores y, simultáneamente, alimentar la concentración de valor en
otros.
La paradoja es clara: Common Crawl democratiza el acceso a
datos web, pero esos datos pueden terminar incorporados en modelos cerrados,
productos propietarios y servicios comerciales controlados por empresas que
concentran cómputo, capital, talento técnico, canales de distribución y
capacidad jurídica: una infraestructura abierta alimentando a un mercado
cerrado.
Esta tensión es parte de un debate mayor sobre bienes
comunes digitales, donde se acepta que el acceso abierto a recursos compartidos
puede ampliar la investigación, la innovación y la rendición de cuentas, pero
también puede facilitar nuevas formas de extracción a escala masiva cuando
actores con capacidades desiguales aprovechan un bien común para capturar
beneficios privados, algo que la IA ha amplificado.
Common Crawl afirma que su objetivo es democratizar los
datos para que no solo grandes empresas puedan hacer investigación y análisis y
que ofrece una copia de Internet sin costo para investigadores, empresas e
individuos, datos que han sido utilizados, por ejemplo, para mejorar software
de traducción, predecir tendencias y rastrear propagación de enfermedades.
Esa narrativa de apertura es fuerte: sin Common Crawl, buena
parte de la investigación académica, independiente o de pequeña escala sobre
temas como la web, el lenguaje, la seguridad o la desinformación, entre otros,
dependería más de bases privadas o inaccesibles, lo que, a su vez, afectaría la
transparencia.
El problema, por tanto, no es ubicarse a favor o en contra
el Common Crawl, lo que además no tendría ningún sentido ni efecto práctico,
sino bajo qué condiciones puede mantenerse una infraestructura abierta de datos
web como Web Crawl cuando sus usos posteriores se integran a industrias de
altísimo valor económico, fuerte opacidad técnica y creciente impacto social.
Las controversias sobre derecho de autor, minería de texto y
datos, consentimiento, exclusión y compensación son otra arista: en una presentación
generada como respuesta a una consulta del Reino Unido sobre copyright e IA, Common
Crawl sostuvo que el “derecho a leer” debería incluir el “derecho a minar”, y
que la mera lectura, escucha o análisis computacional de materiales no debería
ser equiparada a una comunicación pública de obras protegidas. También afirmó
que respeta robots.txt, no elude paywalls, no inicia sesión en sitios privados
y rastrea a un ritmo medido para evitar sobrecargar servidores.
Del otro lado, editores, medios y titulares de derechos
cuestionan que la disponibilidad pública de un contenido equivalga a
autorización para su extracción, almacenamiento, redistribución técnica o
incorporación en cadenas de entrenamiento de IA: en 2024, medios daneses
agrupados a través de la Danish Rights Alliance exigieron que Common Crawl
dejara de copiar sus contenidos y removiera artículos ya incluidos en datasets
anteriores. Wired informó que Common Crawl aceptó cumplir el pedido y que su
director ejecutivo sostuvo que la organización no estaba equipada para litigar
contra grandes empresas de medios.
La controversia se profundizó con investigaciones
periodísticas que acusaron a Common Crawl de facilitar a empresas de IA el
acceso a artículos protegidos o paywalled: The Atlantic sostuvo en 2025
que Common Crawl habría abierto una vía para que compañías de IA entrenaran
modelos con artículos de medios sin consentimiento, afirmación que Common Crawl
negó públicamente.
Este desacuerdo revela una dimensión central del poder
digital, que se expresa como la transformación de ecosistemas enteros de
producción cultural, periodística y científica en materia prima computacional.
Su ubicación en AWS, la nube de Amazon, agrega otra capa al
mapa de poder, ya que Common Crawl informa que sus datos están alojados en esa
nube mediante el AWS Open Data Sponsorship Program, lo que refuerza la
dimensión paradójica del caso.
En conclusión, Common Crawl es uno de los actores más
importantes y menos visibles del mapa de poder de la IA porque organiza una
condición previa del aprendizaje automático: la disponibilidad masiva de datos
de la web. Su narrativa pública se apoya en apertura, investigación, innovación
y democratización del acceso, pero sus críticos señalan extracción, opacidad,
insuficiente consentimiento y afectación de modelos económicos basados en la
producción de contenidos.
La base de poder de Open Crawl en el ecosistema de la IA
está en esas ambivalencias.
Datos básicos
Common Crawl Foundation es una organización sin fines de
lucro 501(c)(3) fundada en 2007 por Gil Elbaz, su actual Chairman of the Board.
El cargo de Executive Director de la empresa lo ocupa, desde 2023, Rich
Skrenta.
Su financiamiento principal proviene de la Elbaz Family
Foundation, mientras que el alojamiento de sus datos es cubierto por Amazon Web
Services a través del AWS Open Data Sponsorship Program. En los últimos años
también recibió donaciones de organizaciones, incluidas algunas empresas de IA,
para apoyar los costos de operación y mantenimiento de su archivo público.
Comenzó a recolectar datos de la web en 2008 y mantiene un
repositorio abierto de datos web que supera los 10 petabytes.
Sus crawls se publican aproximadamente una vez por mes y
suelen incluir más de dos mil millones de páginas. Su crawler se identifica
como CCBot, y utiliza directivas robots.txt y publica datos en formatos como
WARC, WAT y WET.
Su principal fortaleza es ofrecer acceso abierto a datos web
de escala masiva, reduciendo barreras para investigación, procesamiento del
lenguaje natural, análisis web, seguridad informática, preservación digital y
desarrollo de modelos.
Su principal vulnerabilidad está en la disputa por
copyright, consentimiento, opt-out, trazabilidad, representación desigual de la
web, posible inclusión de contenidos protegidos y dependencia de
infraestructuras cloud privadas para alojar y distribuir sus archivos.
El conflicto central que plantea Common Crawl es cómo
preservar el valor público de una memoria abierta de la web sin convertirla en
una vía de extracción ilimitada para sistemas comerciales de IA.
Referencias
Baack, S.
(2024). Training data for the price of a sandwich: Common Crawl’s impact on
generative AI. Mozilla Foundation. https://assets.mofoprod.net/network/documents/Common_Crawl_Mozilla_Foundation_2024.pdf
Baack, S.
(2024). A critical analysis of the largest source for generative AI training
data: Common Crawl. En Proceedings of the 2024 ACM Conference on Fairness,
Accountability, and Transparency. Association for Computing Machinery. https://doi.org/10.1145/3630106.3659033
Brown, T.
B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan,
A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger,
G., Henighan, T., Child, R., Ramesh, A., Ziegler, D. M., Wu, J., Winter, C.,
Hesse, C., Chen, M., Sigler, E., Litwin, M., Gray, S., Chess, B., Clark, J.,
Berner, C., McCandlish, S., Radford, A., Sutskever, I., & Amodei, D.
(2020). Language models are few-shot learners. Advances in Neural
Information Processing Systems, 33, 1877–1901. https://doi.org/10.48550/arXiv.2005.14165
Common
Crawl Foundation. (s. f.). About. Common Crawl. https://commoncrawl.org/about
Common
Crawl Foundation. (s. f.). Frequently asked questions. Common Crawl. https://commoncrawl.org/faq
Common
Crawl Foundation. (2025a, marzo 3). Submission to the UK’s Copyright and AI
Consultation. Common Crawl. https://commoncrawl.org/blog/submission-to-the-uks-copyright-and-ai-consultation
Common
Crawl Foundation. (2025b, septiembre 17). Common Crawl Foundation Opt-Out
Registry. Common Crawl. https://commoncrawl.org/blog/common-crawl-foundation-opt-out-registry
Common
Crawl Foundation. (2025c, noviembre 6). Setting the record straight: Common
Crawl’s commitment to transparency, fair use, and the public good. Common
Crawl. https://commoncrawl.org/blog/setting-the-record-straight-common-crawls-commitment-to-transparency-fair-use-and-the-public-good
Meaker, M.
(2024, junio 13). Publishers target Common Crawl in fight over AI training
data. Wired. https://www.wired.com/story/the-fight-against-ai-comes-to-a-foundational-data-set/
Reisner, A.
(2025, noviembre 4). The company quietly funneling paywalled articles to AI
developers. The Atlantic. https://www.theatlantic.com/technology/2025/11/common-crawl-ai-training-data/684567/
.png)