Theos Group

¿Cuán visible es su empresa para Google y para IA? Gratis, inmediatamente.

¿Prefiere el informe completo ahora? Escaneo completo — € 49 →

Base de conocimientos

¿Puede Google ver realmente su sitio web?

Un pequeño archivo técnico, robots.txt, determina si Google puede ver su sitio y renderizarlo, y un error en este archivo puede detener toda su visibilidad sin que usted se dé cuenta.

¿Qué es ese archivo exactamente?

Todo sitio web tiene, o debería tener, un archivo llamado robots.txt. Lo encontrará escribiendo /robots.txt después de su nombre de dominio, por ejemplo, suempresa.es/robots.txt. Este archivo es el primero que Google lee antes de visitar su sitio. Está en texto plano e indica a los motores de búsqueda qué partes del sitio pueden y no pueden visitar.

Puede compararlo con un cartel a la entrada de un edificio. Algunas puertas están abiertas, otras están cerradas con una simple nota. El problema es que las empresas a veces cuelgan accidentalmente la nota equivocada. En lugar de cerrar una puerta trasera, cierran todo el edificio para los visitantes, incluidas las salas más importantes.

Además de los caminos que pueden o no visitarse, también se trata de algo más sutil: los archivos que construyen la página. Piense en CSS, que proporciona el formato, y JavaScript, que proporciona movimiento e interacción en la página. Si robots.txt bloquea esos archivos, Google puede visitar la página, pero no verla correctamente. Ve una versión desnuda y rota de su sitio.

Esto está estrechamente relacionado con otro punto de control: si su contenido principal también es accesible sin JavaScript, como explicamos en el contenido principal es accesible sin JavaScript. Ambos puntos se refieren a la misma pregunta: ¿puede Google ver su página como la ve un visitante, u obtiene Google una imagen incompleta que puntúa mal?

Por qué esto es más que un detalle técnico

Google utiliza un proceso llamado renderización: el motor de búsqueda construye esencialmente su página, exactamente como lo hace un navegador, para ver lo que un visitante realmente ve. Esto solo es posible si Google puede acceder a todos los componentes necesarios. Si CSS o JavaScript están bloqueados, Google ve una página desnuda sin formato, sin menú, a veces sin el texto que se carga con scripts.

El resultado es que Google evalúa incorrectamente de qué trata su página. Una página que se ve bien para los visitantes puede parecer incomprensible o vacía para Google. No es una cuestión de puntuación solo un poco peor. Se trata de no ser incluido, aunque no haya hecho nada mal en el contenido en sí.

Hay una diferencia entre una página que no existe y una página que existe pero se ha hecho inaccesible. Esto también se relaciona con otros puntos en nuestra lista de verificación, como la pregunta de si una página eliminada devuelve correctamente un estado 404, como se explica en la página 404 en sí es útil. En ambos casos se trata de claridad: muestre a Google qué está destinado a ser encontrado y qué no.

Cómo verificar por su cuenta si todo está bien

Escriba su nombre de dominio seguido de /robots.txt en la barra de direcciones de su navegador. Aparecerá una lista simple de reglas, generalmente con palabras como 'Disallow' seguidas de una ruta. Disallow significa: esta ruta no debe visitarse. Compruebe si hay algo que no espera, como solo una barra diagonal, que significa que todo el sitio está cerrado.

Preste especial atención a las reglas que se refieren a carpetas con nombres como /wp-content/, /assets/, /css/ o /js/. Estas son a menudo exactamente las carpetas donde se almacenan el formato e interacción de su sitio. Si están bloqueadas, es probable que Google no pueda renderizar correctamente sus páginas, aunque el resto del archivo parezca inocente.

Google Search Console, un servicio gratuito de Google para propietarios de sitios web, tiene una prueba con la que puede verificar una página específica en busca de problemas de renderización. Allí verá un ejemplo de cómo Google percibe su página. Si se ve desnuda o rota mientras la página se ve bien en su navegador, eso es una señal clara de que algo sale mal al cargar CSS, JavaScript o imágenes.

¿Duda si una ruta determinada se ha excluido intencionadamente o por accidente? Consulte con quien construyó su sitio web. Algunos bloqueos son intencionales e inteligentes, como cerrar un resultado de búsqueda interno, algo que tratamos por separado en páginas de resultados de búsqueda interna con noindex. Otros bloqueos son simplemente errores de una configuración predeterminada que nunca se verificó.

Lo que cuesta si esto no está en orden

Si robots.txt bloquea rutas importantes, cierra sin darse cuenta partes de su sitio para Google. Pueden ser páginas de productos, artículos de blog, o incluso todo el sitio después de una migración a un nuevo sistema. Esto sucede más a menudo de lo que la gente piensa, especialmente después de una renovación de sitio web, donde una configuración destinada al entorno de prueba permanece accidentalmente en el sitio real.

Lo insidioso es que no se da cuenta en su uso diario del sitio. Las páginas simplemente se cargan, los visitantes que reciben el enlace directamente pueden seguir accediendo. Solo el tráfico de los motores de búsqueda se reduce lentamente, sin una razón clara. Muchos emprendedores buscan entonces la causa en el contenido o la competencia, cuando el problema está en un archivo técnico que nunca han abierto.

Cuando solo se bloquean CSS y JavaScript, el efecto es más sutil pero no menos dañino. Sus páginas siguen siendo detectables, pero Google las evalúa basándose en una imagen incompleta. El texto cargado por un script puede no contar. Una página que se ve bien para usted, Google la evalúa como pobre en contenido, con todas las consecuencias para su posición en los resultados de búsqueda.

La reparación no suele ser cuestión de meses de trabajo. A menudo se trata de ajustar unas pocas líneas en un archivo. El punto es que primero debe reconocer el problema. Sin verificación, un bloqueo a veces permanece desapercibido durante años, simplemente porque nadie lo revisó después de que el sitio se ajustó por última vez.

Lo que debe suceder para poner esto en orden

El punto de partida es simple: robots.txt solo puede bloquear rutas que desea excluir deliberadamente, como una página de inicio de sesión de administrador o un carrito de compras que nunca debería aparecer en los resultados de búsqueda. Todo lo que contribuya a cómo se ve o funciona la página debe permanecer accesible. Este es todo el principio detrás de este punto de control: no bloquear por precaución, sino cerrar deliberadamente donde sea necesario.

Haga que se revise este archivo como parte de una visión más amplia de qué debe y qué no debe indexarse. Esa visión, una matriz de indexación por tipo de página, identifica qué páginas deben ser visibles para Google y cuáles no, deliberadamente, como explicamos en una matriz de indexación por tipo de página. Robots.txt es entonces el instrumento con el que se ejecutan esas opciones, no el lugar donde se toman.

Verifique este archivo no solo cuando se construye el sitio, sino también después de cada cambio importante: una migración a otro sistema, un nuevo constructor de sitios web, o una reestructuración del sitio. Estos son precisamente los momentos en que las configuraciones se traen accidentalmente desde un entorno de prueba. Una breve verificación posterior evita que una configuración temporal se vuelva permanente.

También tenga en cuenta que robots.txt no está solo. Está estrechamente vinculado con otras señales que le da a Google, como la instrucción a nivel de página a través de una etiqueta noindex, sobre la que más en noindex vía meta robots o X-Robots-Tag. Ambas no deben contradecirse. Una página que desea mostrar no debe abrirse a través de un canal y luego bloquearse nuevamente a través del otro.

Preguntas frecuentes

¿Puedo modificar robots.txt yo mismo sin el constructor del sitio web?

Técnicamente es un archivo de texto simple que puede abrir y modificar usted mismo. En la práctica, la prudencia es recomendable: una línea incorrecta puede cerrar todo su sitio para Google. Haga que alguien que gestione su sitio revise cualquier cambio, o pruebe primero la modificación con la herramienta en Google Search Console antes de implementarlo definitivamente.

¿Significa un bloqueo en robots.txt que la página desaparece inmediatamente de Google?

No inmediatamente, ni siempre completamente. El efecto suele desarrollarse gradualmente a medida que Google encuentra el bloqueo más a menudo. A veces, una página sigue siendo visible sin descripción, porque Google conoce el título pero no puede ver el contenido. En cualquier caso, el resultado es una posición más débil que si la página fuera completamente accesible.

No tengo archivo robots.txt, ¿es eso un problema?

Sin este archivo, Google puede, en principio, acceder a cualquier lugar, así que en ese sentido no hay un bloqueo directo. Sin embargo, es recomendable tener uno, aunque sea solo para excluir conscientemente algunos directorios, como un sistema de búsqueda interno. Esto también se alinea con el punto de control 1.2, donde explicamos la configuración exacta del mismo, como se lee en el punto de control 1.2.

Lectura adicional

¿Cómo está su propio sitio web?

Dos cifras, en menos de un minuto, de forma gratuita — y no tiene que dejar nada.

¿Cuán visible es su empresa para Google y para IA? Gratis, inmediatamente.

¿Prefiere el informe completo ahora? Escaneo completo — € 49 →

¿Quiere saber cuál es la causa?

Este escaneo le da el estado. El informe le proporciona las causas y el orden en que las aborda.

  • Por cada hallazgo qué está mal y qué debe hacerseEl escaneo gratuito le proporciona el estado. El informe le proporciona la lista — en lenguaje sencillo, ordenada por su peso, sin que tenga que entender nada técnico.
  • Los cuatro asistentes de IA en lugar de unoEl resultado gratuito es una muestra de un asistente. El informe realiza ocho preguntas a los cuatro, para que sepa si el problema está en un asistente o en todos.
  • Qué empresas sí aparecen¿Quién consigue al cliente que usted pierde? Esos nombres están en el informe, con la frecuencia con la que aparecen donde usted falta.
  • Una medición más profunda de su sitio webEl escaneo gratuito analiza diez páginas. El informe continúa hasta cincuenta, incluyendo también las páginas donde sus clientes finalmente llegan.