Metodología y fuentes
Osprey no promete apariciones ni citas: comprueba condiciones. Esta página explica de dónde sale cada regla, qué grado de certeza tiene cada hallazgo y cómo se calcula la puntuación, para que cualquier afirmación del informe se pueda contrastar.
Las reglas se versionan con el código y se revisan cuando un proveedor publica cambios. Cada proveedor lleva la URL de su documentación oficial y la fecha en que se comprobó; si esa documentación no existe o no se puede leer, el proveedor figura como no verificable y no se analiza. Nunca se convierte un artículo, un vídeo o una opinión en un requisito del producto.
Tres clases de regla
- Requisito oficial
- Lo dice la documentación pública del proveedor.
- Práctica documentada
- Lo documenta un tercero fiable o el propio proveedor de forma indirecta.
- Convención emergente
- Existe y se usa, pero ningún proveedor la exige. Se trata como oportunidad.
- No verificable
- No hay fuente oficial legible. No se analiza ni se puntúa.
Tres grados de certeza en cada hallazgo
- confirmado
- Observado directamente: una regla, una cabecera, un elemento del HTML.
- probable
- Lo observado apunta a un riesgo, pero el efecto depende de algo que no se puede medir desde fuera.
- no verificable
- No hay fuente ni medida que lo sostenga; se dice para que conste y no puntúa.
Proveedores y agentes
Lo que Osprey sabe de cada proveedor viene de un registro declarativo con su fuente oficial y la fecha en que se revisó. Un proveedor sin fuente legible aparece como no verificable y no se puntúa.
ChatGPT Search OpenAI
OpenAI separa tres agentes: OAI-SearchBot «se usa para mostrar sitios en los resultados de las funciones de búsqueda de ChatGPT» y respeta robots.txt; GPTBot recopila contenido «que puede usarse para entrenar» sus modelos; ChatGPT-User atiende acciones que pide una persona y, según OpenAI, «las reglas de robots.txt pueden no aplicarse». OpenAI no documenta si estos agentes ejecutan JavaScript.
| Agente | Superficie | robots.txt | Renderiza JS | Se comprueba |
|---|---|---|---|---|
| OAI-SearchBot | búsqueda con cita | respeta robots.txt | no documentado | Puede entrar (robots.txt); Encuentra texto sin renderizar JavaScript |
| ChatGPT-User | navegación pedida por una persona | puede ignorar robots.txt (acceso pedido por una persona) | no documentado | Puede entrar (robots.txt) |
| GPTBot | entrenamiento | respeta robots.txt | no documentado | Puede entrar (robots.txt) |
Google Search y AI Overviews Google
Google afirma que «no hay requisitos adicionales para aparecer en AI Overviews o AI Mode» y que «no hace falta crear nuevos archivos legibles por máquinas, archivos de texto para IA ni marcado». La página tiene que estar indexada y ser elegible para snippet; los controles son los de siempre: noindex, nosnippet, max-snippet. Googlebot documenta que renderiza JavaScript en una fase diferida, así que el contenido que depende del cliente puede tardar más en indexarse.
| Agente | Superficie | robots.txt | Renderiza JS | Se comprueba |
|---|---|---|---|---|
| Googlebot | búsqueda e indexación | respeta robots.txt | documentado | Puede entrar (robots.txt); La página se puede indexar (sin noindex); Se puede mostrar un fragmento (sin nosnippet); Encuentra texto sin renderizar JavaScript |
Gemini y Vertex AI Google
Google-Extended es «un token de producto independiente que los editores pueden usar para gestionar si el contenido que Google rastrea puede usarse para entrenar futuras generaciones de modelos Gemini» y para grounding. «No tiene una cadena de user-agent HTTP propia»: el rastreo lo hacen los agentes de Google de siempre. «No afecta a la inclusión de un sitio en Google Search ni se usa como señal de ranking». Permitirlo o bloquearlo es una decisión editorial, no una condición de visibilidad.
| Agente | Superficie | robots.txt | Renderiza JS | Se comprueba |
|---|---|---|---|---|
| Google-Extended | entrenamiento | respeta robots.txt | documentado | Puede entrar (robots.txt) |
Perplexity Perplexity AI
PerplexityBot está «diseñado para mostrar y enlazar sitios web en los resultados de búsqueda de Perplexity» y Perplexity recomienda permitirlo en robots.txt. Perplexity-User «atiende acciones de los usuarios: cuando alguien pregunta, puede visitar una página» y «generalmente ignora las reglas de robots.txt» porque la petición la hizo una persona. Perplexity no documenta si ejecuta JavaScript.
| Agente | Superficie | robots.txt | Renderiza JS | Se comprueba |
|---|---|---|---|---|
| PerplexityBot | búsqueda con cita | respeta robots.txt | no documentado | Puede entrar (robots.txt); Encuentra texto sin renderizar JavaScript |
| Perplexity-User | navegación pedida por una persona | puede ignorar robots.txt (acceso pedido por una persona) | no documentado | Puede entrar (robots.txt) |
Claude Anthropic
Anthropic documenta tres agentes y un token de robots.txt para cada uno. ClaudeBot «recopila contenido web» para sus modelos; bloquearlo es una decisión editorial. Claude-SearchBot «navega la web para mejorar la calidad de los resultados de búsqueda»: bloquearlo «impide indexar tu contenido para búsqueda». Claude-User «accede a sitios cuando las personas preguntan a Claude». Anthropic pide bloquear por robots.txt y no por IP, y no documenta si ejecuta JavaScript.
| Agente | Superficie | robots.txt | Renderiza JS | Se comprueba |
|---|---|---|---|---|
| Claude-SearchBot | búsqueda e indexación | respeta robots.txt | no documentado | Puede entrar (robots.txt); Encuentra texto sin renderizar JavaScript |
| Claude-User | navegación pedida por una persona | respeta robots.txt | no documentado | Puede entrar (robots.txt) |
| ClaudeBot | entrenamiento | respeta robots.txt | no documentado | Puede entrar (robots.txt) |
Bing y Copilot Microsoft
En investigación: no se ha verificado ninguna regla de Bing ni de Copilot en una fuente oficial legible. No se analiza ni se puntúa hasta tenerla.
Áreas, pesos y puntuación
Puntuación osprey-score-v1. Cada área parte de su peso y pierde una fracción por cada hallazgo según su estado (crítico 100%, importante 65%, mejora 30%, oportunidad 12%; la información y lo correcto no restan). De 90 a 100 está bien; de 50 a 89, mejorable; por debajo, mal. Es una puntuación preliminar para comparar un sitio consigo mismo, no con otros.
| Área | Peso | Comprobaciones |
|---|---|---|
| Buscadores y asistentes de IA | 22 | ChatGPT Search, Google Search y AI Overviews, Gemini y Vertex AI, Perplexity, Claude |
| Acceso de crawlers y SEO técnico | 18 | Título, Descripción, Encabezado H1, Indexabilidad, robots.txt, Sitemap, Canonical, Certificado y HTTPS, Idioma, Contenido, Imágenes con alt, Open Graph |
| Contenido legible | 14 | Contenido sin JavaScript, Estructura semántica, llms.txt, Fechas legibles, Autoría |
| Entidad y confianza | 16 | Entidad declarada, Datos de contacto, Preguntas frecuentes, Nombre consistente, ai.txt |
| Datos estructurados | 10 | JSON-LD, Resultados enriquecidos, Organización, Migas de pan, Microdatos, RDFa |
| Accesibilidad e interacción agéntica | 10 | Regiones de la página, Enlaces descriptivos, Formularios con etiqueta, Botones con nombre, ARIA sin abusos, Barreras de seguridad, API documentada, Acciones para agentes, Cobertura de la medición |
| Rendimiento | 10 | Respuesta del servidor, Compresión y peso, Caché, HTTP/2 o HTTP/3, Redirecciones, Recursos bloqueantes, Imágenes, Cobertura de la medición |