Rastreadores: definición y funcionamiento de los bots web

Un rastreador es un programa automatizado que visita sistemáticamente páginas web, sigue enlaces y almacena contenidos para su posterior análisis. El más conocido es el Googlebot, pero desde hace tiempo también existen rastreadores basados en inteligencia artificial que se utilizan con fines totalmente distintos. Quien quiera que se rastree una página debe comprender cómo funcionan técnicamente estos bots y de qué depende la frecuencia de sus visitas, ya que sin esta base, cualquier optimización posterior se quedará en lo superficial.

Cómo funciona un rastreador

Un rastreador suele empezar con una lista de URL conocidas y descarga su código fuente. A partir de este código, extrae nuevos enlaces y los añade a una lista de espera para la próxima visita, de modo que, con el tiempo, se crea un enorme mapa de la web en constante crecimiento. Este mapa constituye la base de prácticamente todos los pasos posteriores, desde el índice de búsqueda hasta herramientas de análisis específicas y servicios de monitorización.

Consejo: Un mapa del sitio en formato XML agiliza considerablemente este proceso, ya que proporciona al rastreador todas las URL importantes de un solo vistazo, en lugar de que este tenga que descubrirlas primero a través de enlaces individuales.

Este ciclo de carga, análisis y seguimiento se lleva a cabo las 24 horas del día y a una escala enorme, distribuido en la mayoría de los casos entre miles de servidores simultáneamente. De este modo, incluso las páginas web más pequeñas reciben visitas varias veces al día, a menudo sin que los administradores se den cuenta, siempre que no surjan problemas como una actualización repentina del algoritmo. Solo al consultar los registros del servidor se hace realmente visible este tráfico constante de bots, normalmente en una magnitud que sorprende a muchos administradores a primera vista.

  • Inicio a través de listas de URL conocidas
  • Se lee el código fuente
  • Los nuevos enlaces pasan a la lista de espera
  • El proceso se ejecuta de forma continua y en paralelo
Solicita un análisis gratuito del potencial de tu empresa
Solicitar información ahora

Tipos de rastreadores

Además de los rastreadores de los motores de búsqueda, existen rastreadores de herramientas de SEO que comprueban de forma específica si una página concreta contiene errores, así como bots de comparación de precios y de archivos. Cada tipo persigue un objetivo propio, aunque la técnica básica subyacente sea similar. A esto se suman ahora los rastreadores de IA, que recopilan contenidos para modelos de lenguaje en lugar de para un índice de búsqueda clásico, lo que difumina cada vez más los límites entre las categorías. Esto hace que a los operadores les resulte más difícil distinguir claramente cada tipo de bot.

  • Rastreadores de motores de búsqueda para la indexación
  • Herramientas de SEO para la detección de errores
  • Portales de precios y comparativas
  • Bots de archivo para la historia de la web

Dirigir y controlar los robots de rastreo

A través del archivo robots.txt se puede especificar a qué secciones puede acceder un rastreador. Muchas tiendas excluyen deliberadamente secciones importantes, como el sistema de carrito de la compra, para reducir la carga del servidor y evitar contenidos duplicados. El SEO técnico de una página también influye en la eficiencia con la que un rastreador encuentra las secciones importantes y en la cantidad de recursos que se desperdician en páginas sin importancia. Una estructura de enlaces internos bien planificada dirige además al rastreador de forma específica hacia las páginas que realmente importan, lo que constituye un elemento fundamental de cualquier optimización SEO on-page sólida.

  • El archivo robots.txt regula el acceso
  • El mapa del sitio lleva a las páginas importantes
  • Los bloqueos reducen la carga del servidor
  • Los registros del servidor muestran las visitas reales
Concertar una reunión estratégica con nuestro equipo
Solicitar información ahora

Errores habituales en el control de los rastreadores

A menudo, se bloquean por error directorios enteros a través del archivo robots.txt, por ejemplo, tras un relanzamiento o una nueva instalación de un CMS. Este tipo de errores suelen pasar desapercibidos durante mucho tiempo, ya que no se aprecian directamente en el aspecto de la página, sino que solo se detectan cuando disminuye el número de visitantes y aparecen informes vacíos en Search Console. Una breve comprobación inmediatamente después de cada cambio técnico importante suele detectar estos errores de inmediato, en lugar de tener que esperar semanas para darse cuenta de ellos.

  • No se han detectado bloqueos tras el relanzamiento
  • Rutas incorrectas en el archivo robots.txt
  • El mapa del sitio no se mantiene actualizado
  • Los errores no se detectan hasta más tarde

Entender el presupuesto de rastreo y utilizarlo de forma específica

Cada sitio web recibe de un rastreador solo una cantidad limitada de atención, lo que a menudo se denomina «presupuesto de rastreo». El número de páginas que se visitan y el tiempo que se dedica a ello dependen del tamaño del sitio web, de su rendimiento técnico y de la frecuencia con la que se publican contenidos nuevos. Si este presupuesto se desperdicia en páginas irrelevantes o duplicadas, los contenidos nuevos importantes permanecen sin ser detectados durante más tiempo del necesario.

Quien quiera gestionar el presupuesto de forma consciente debería eliminar sistemáticamente de la estructura de rastreo las secciones que no sean importantes y, en su lugar, crear una jerarquía clara a partir de páginas de categorías y de detalle. Una estructura clara, que permita llegar a la página más importante con pocos clics, resulta de gran ayuda, al igual que un mapa del sitio actualizado periódicamente, tal y como se describe en la sección «Conceptos básicos» de las Herramientas para webmasters.

Incluso los parámetros de URL aparentemente inofensivos, como los de ordenación o seguimiento, generan constantemente, desde el punto de vista de un rastreador, páginas nuevas e independientes desde el punto de vista técnico y, por lo tanto, consumen sin que nos demos cuenta una parte considerable del presupuesto disponible. Una etiqueta «canonical» aplicada de forma sistemática redirige la atención hacia la versión principal propiamente dicha y evita que los duplicados consuman recursos innecesariamente.

  • El presupuesto es, por naturaleza, limitado
  • Las páginas sin importancia desperdician capacidad
  • Una jerarquía clara de las páginas facilita la visión general
  • El mapa del sitio actualizado redirige de forma específica

Los registros del servidor como herramienta para el control de los rastreadores

Los registros del servidor muestran exactamente cuándo y qué rastreador ha visitado qué página, independientemente de lo que muestren posteriormente las herramientas de análisis del navegador. Estos datos brutos ofrecen, por tanto, una perspectiva que las herramientas clásicas de análisis web, por su propia naturaleza, no reflejan, ya que se centran en los visitantes humanos, tal y como describen los fundamentos del análisis en marketing.

Merece la pena revisar estos registros con regularidad, sobre todo tras cambios técnicos, como por ejemplo tras un relanzamiento, ya que en ellos se aprecia de inmediato si los rastreadores encuentran nuevas páginas con errores o si, de repente, las secciones importantes reciben menos visitas. Quien descuide esta comprobación, a menudo no se da cuenta de los problemas hasta semanas más tarde, cuando observa una disminución en el número de visitantes.

Quien quiera analizarlo con más detalle debería comprobar además si un supuesto bot procede realmente del proveedor indicado, ya que algunos programas maliciosos se hacen pasar falsamente por rastreadores conocidos para eludir los bloqueos. Una simple comparación de la dirección IP con los rangos oficiales del proveedor en cuestión permite aclarar rápidamente esta cuestión.

  • Las visitas de bots se pueden identificar con precisión en el registro
  • Complementa de forma útil el análisis web clásico
  • Es especialmente importante tras los cambios técnicos
  • Sistema de alerta temprana para problemas de rastreo

Sobre el autor Chefredaktion
Stephan M. Czaja

Unternehmer, Nerd und Coder mit Liebe für Marketing, Ads, Creatives und Kampagnen. Schreibe, seit ich denken kann — über alles, was zählt.