Durante 30 años, la World Wide Web ha funcionado bajo un contrato social sorprendentemente profundo: la mayoría de los sitios son de acceso gratuito para los motores de búsqueda, pero si utilizas su contenido, debes dar crédito enlazando a la fuente.
Recientemente, ese contrato social ha comenzado a desmoronarse. Las herramientas de inteligencia artificial (IA) rastrean sitios web no para crear enlaces a ellos, sino para entrenar modelos y generar respuestas (que pueden ser o no precisas).
Cuando realizas una búsqueda, la respuesta de ChatGPT o los resúmenes de IA de Google pueden incluir enlaces a las fuentes, pero estos son una especie de complemento opcional a la respuesta principal.
Esto ha generado una dinámica negativa para los propietarios de sitios web, el público e incluso las propias empresas de IA: a medida que los sitios web pierden tráfico (y, por ende, ingresos), muchos comienzan a bloquear las herramientas de extracción de datos de IA, lo que implica que los resultados de la IA dependen cada vez más de sitios web de baja calidad (muchos de los cuales también son generados por IA). En consecuencia, encontrar información de calidad puede ser más difícil que nunca.
Cómo llegamos aquí
En los inicios de la World Wide Web, los motores de búsqueda y los creadores de contenido llegaron a un acuerdo sobre el rastreo (la práctica de examinar tecnológicamente un sitio para indexarlo y que aparezca en los resultados de búsqueda). Los creadores de contenido ofrecían acceso gratuito a sus sitios e incluso permitían que los motores de búsqueda reprodujeran pequeños fragmentos de texto.
A cambio, los motores de búsqueda proporcionaban enlaces a los sitios web de los creadores de contenido, quienes se beneficiaban de ese tráfico web. Si a los creadores de contenido no les gustaba el acuerdo, podían impedir que los motores de búsqueda rastrearan su sitio mediante instrucciones en un archivo llamado robots.txt.
Pero si las herramientas de IA dejan de generar tráfico web, los creadores de contenido quedan excluidos del ciclo económico. Además, otros costes , por lo que el rastreo mediante IA puede suponer un gasto para los proveedores de sitios web sin generarles los ingresos publicitarios ni de otro tipo que obtendrían del tráfico humano. Los rastreadores de IA también rastrean con mayor profundidad e intensidad que los rastreadores web tradicionales, lo que incrementa aún más ese coste.
Este cambio en los patrones de tráfico no es un problema menor ni hipotético. Cloudflare, una empresa de alojamiento y servicios web que gestiona el 30 % o más de los 10 000 sitios web más importantes de internet, estima que más de la mitad del tráfico web actual proviene de bots de inteligencia artificial.
Parte de esto lo realizarán agentes de IA supervisados directamente por personas, pero la mayoría serán rastreadores. Los propietarios de sitios web pueden usar robots.txt para pedir a los rastreadores de IA que no accedan a sus sitios, pero algunas empresas de IA podrían ignorar esta solicitud.
Si las empresas de IA acceden a la solicitud, esto puede generar otro problema. Es mucho menos probable que los sitios que contienen información errónea prohíban los rastreadores de IA, por lo que las respuestas de la IA no se basarán en fuentes de alta calidad.
¿Qué está sucediendo a corto plazo?
Se vislumbra un evento denominado "Google Zero": el día en que el tráfico proveniente de Google se reduzca a cero. Si bien algunos usuarios veteranos (como uno de los autores de este artículo) aún podrían hacer clic para verificar las respuestas de la IA, este tráfico está disminuyendo rápidamente como consecuencia directa de los resúmenes generados por IA.
Un estudio de Wikipedia lo confirma, mostrando que el tráfico en la versión en inglés del sitio disminuyó rápidamente con el lanzamiento de los resúmenes con IA en Google en inglés, y que el mismo patrón se repitió en otros idiomas a medida que se implementaban dichos resúmenes. Si bien no tener que hacer clic para obtener una respuesta puede parecer ideal para quienes buscan información, la realidad es más compleja.
Muchos sitios web ahora bloquean por completo los rastreadores de IA. Los propietarios de sitios que deciden bloquear los rastreadores de IA tienen menos probabilidades de aparecer en las respuestas de AI Overviews, incluso cuando la herramienta de IA aún puede acceder al contenido para fundamentar sus respuestas (utilizando una técnica llamada generación aumentada por recuperación).
alternativos de "pago por indexación" como forma de compensar a los creadores de contenido, pero no han tenido éxito.
A partir del 15 de septiembre, los sitios web que utilizan Cloudflare bloquearán de forma predeterminada los rastreadores de IA en las páginas que contengan publicidad (y que, por lo tanto, generen ingresos para los creadores de contenido).
Esto significa que hasta el 30 % de los sitios web más importantes del mundo ya no aparecerán en los resúmenes de Google AI Overviews. También significa que gran parte del material con el que se entrena la IA será, a su vez, texto generado por la propia IA.
Lo que significa para ti
¿Qué implica esto a la hora de buscar información? Es probable que la calidad de los resúmenes generados por IA disminuya, al menos a corto plazo, mientras se definen las nuevas dinámicas económicas de internet.
Esto sucederá por dos razones. La primera es que es menos probable que el contenido de alta calidad se incluya en esos resúmenes de IA; un estudio reciente descubrió que, de hecho, alrededor de 1 de cada 6 fuentes utilizadas por las herramientas de búsqueda de IA es un sitio web generado por IA.
La segunda razón es que, a medida que los modelos de IA se entrenan con más texto de IA, su resultado puede degradarse (un fenómeno conocido como colapso del modelo).
Como resultado, los motores de búsqueda que dependen menos de la IA podrían volverse más fiables. El reto consiste en encontrar uno que no utilice un rastreador basado en IA. Existen: ZDNet recomienda Mojeek, PCMag recomienda Brave, y Ban the Bots enumera varios, incluyendo uno específico para contenido de "pequeños productores", como blogs.
Por ahora, independientemente del buscador que uses, lo mejor que puedes hacer es desplazarte hacia abajo y hacer clic en algunos resultados de búsqueda reales. Esto beneficia a los creadores de contenido y, además, es más probable que te proporcione información más precisa.
Dana McKay, Vicedecana de Interacción, Tecnología e Información, Universidad RMIT
Damiano Spina, Profesor Titular, Escuela de Tecnologías Informáticas, Universidad RMIT
Este artículo se republica de The Conversation bajo una licencia Creative Commons. Lea el artículo original.





