Cómo medimos
Metodología
Si el valor de un dictamen está en su rigor, la metodología tiene que poder auditarse desde fuera. Esta página explica exactamente qué hacemos, con qué límites, y qué decisiones tomamos cuando los datos no alcanzan.
Última actualización: 21 de agosto de 2026
1. Qué motores consultamos
Medimos contra cinco motores mediante sus interfaces oficiales de programación. No se usa automatización de navegador ni extracción de las interfaces web: eso produciría resultados que dependen de la sesión, la ubicación y el historial de una cuenta concreta, y no serían reproducibles.
| Motor | Proveedor | Modelo exacto |
|---|---|---|
| ChatGPT | OpenAI | gpt-5 |
| Claude | Anthropic | claude-sonnet-5 |
| Perplexity | Perplexity | sonar |
| Gemini | gemini-3.1-flash-lite | |
| Grok | xAI | grok-4.3 |
Panel vigente desde el 29 de julio de 2026.
2. Cuántas veces preguntamos, y por qué importa
Cada pregunta se ejecuta tres veces en cada motor. No es un capricho: los modelos de lenguaje no responden igual dos veces seguidas aunque la pregunta y la configuración sean idénticas. Preguntar una sola vez daría una foto que podría no repetirse.
Límite que declaramos de frente
Tres muestras son una señal exploratoria, no una estimación estable. Sirven para detectar si una empresa aparece de forma consistente, ocasional o nunca. No sirven para afirmar que aparece “el 33% de las veces” como si fuera una constante del mundo.
Por eso guardamos la distribución completa de las tres respuestas, no solo la más frecuente. El resumen es un resumen; el dato está debajo y se puede consultar.
3. Aparecer y ser citado son cosas distintas
Es la confusión más común al hablar de visibilidad en IA, y las medimos por separado porque significan cosas diferentes.
- Aparición — si el motor menciona a la empresa en su respuesta, y con qué grado: nombrada de pasada, incluida en una lista, recomendada activamente o presentada como opción preferente.
- Citación — si el motor enlaza el sitio de la empresa como fuente de su respuesta.
Una empresa puede ser recomendada sin que se cite su sitio, y puede ser citada como fuente sin ser recomendada. Mezclar ambas en un solo número escondería justo la información útil.
4. Qué hacemos cuando una medición falla
Un motor puede no responder: una caída del servicio, un límite de uso alcanzado, un tiempo de espera agotado. Esa medición no existe, y así se trata.
Regla del denominador
Una consulta que falló se excluye del denominador. Nunca se cuenta como “la empresa no apareció”.
Contar un fallo técnico como una ausencia inflaría artificialmente el problema y haría ver peor a la empresa de lo que está. Es la diferencia entre medimos y no apareciste y no pudimos medir.
Como consecuencia, cada cifra del dictamen se publica con su numerador, su denominador y su cobertura: cuántas mediciones válidas hubo sobre cuántas se intentaron. Si la cobertura es baja, se ve; no se esconde detrás de un porcentaje redondo.
Así se presenta una métrica
Tasa de recomendación
8 de 36 respuestas válidas
22%
Nunca un velocímetro ni una nota de 0 a 100 sin explicar cómo se calculó.
5. Quién calcula: el código, no el modelo
Esta distinción es central y conviene entenderla bien.
- Los cálculos los hace código determinístico y versionado. Todo número —tasas, coberturas, prioridades— sale de una fórmula escrita, revisable y con pruebas automatizadas. La misma entrada produce siempre la misma salida.
- El modelo de lenguaje interpreta y redacta. Lee la evidencia, la ordena y la explica en español claro. No inventa cifras ni asigna puntajes.
Un puntaje generado por un modelo de lenguaje no sería reproducible ni auditable, y no podría defenderse ante nadie. Por eso no existe.
6. El Índice de Visibilidad, y de qué está hecho
Además de las métricas individuales, el dictamen muestra un número único de 0 a 100: el Índice de Visibilidad en IA. Existe porque una tabla de tasas y coberturas es honesta, pero no siempre da un “¿cómo estoy?” de un vistazo. El número nunca aparece solo — siempre va junto al desglose que lo compone, por la misma razón que el resto de esta página: una cifra sin fórmula no es información, es una promesa sin respaldo.
Cómo se calcula
Es un promedio ponderado de seis dimensiones, cada una calculada a partir de las métricas que ya se explicaron arriba — nunca asignadas por el modelo de lenguaje:
- Contenido citable (25%) — con más peso en ser citado como fuente (70%) que en solo aparecer nombrado (30%).
- Confianza (20%) — de las veces que te nombran, cuántas te recomiendan activamente y no solo te mencionan de pasada.
- Marca y entidad (20%) — presencia preferente, en cuántos motores apareces, y consistencia entre ellos.
- Técnica (15%) — velocidad de carga (PageSpeed) y si el contenido es visible sin depender de JavaScript.
- Datos estructurados (10%) — si el sitio declara JSON-LD, entidad y sitemap; antes no se medía, desde v1.1.0 sí.
- Búsqueda y agentes (10%) — mitad posición en primeros resultados y cobertura entre motores, mitad si los robots de IA tienen acceso al sitio.
Cuando falta una señal, no se inventa
Si una dimensión no tiene datos suficientes, no entra al promedio con un cero — quedaría penalizando algo que simplemente no se pudo medir. El cálculo se reparte solo entre las dimensiones que sí tienen señal, y la pantalla muestra qué porcentaje de la fórmula total pudo calcularse.
En el análisis gratuito, el índice se calcula con una sola muestra por motor — la misma limitación de la sección 2 aplica aquí: es una señal exploratoria, no una estimación estable. El Dictamen A1 mide con tres muestras.
Los pesos son metodología propietaria de Dictamenia, versionada (la versión exacta se muestra junto al número), no una escala validada científicamente por un tercero. Pueden ajustarse con el tiempo; cuando eso ocurra, quedará registrado como una versión nueva, nunca editado en silencio sobre dictámenes ya entregados.
7. GEO, AEO y GSO: por qué los separamos
En el mercado estos tres nombres —y también LLMO y AIO— se usan como sinónimos. No es una impresión: la literatura no ha fijado ninguna distinción formal entre ellos, y hay analistas que sostienen que la industria exagera las diferencias para justificar herramientas nuevas.
Presentarlos como tres mediciones distintas sería inflar. Los separamos por otra razón: responden preguntas distintas y se calculan sobre denominadores distintos, así que una misma empresa puede salir bien en uno y mal en otro. Si compartieran denominador y fuente de datos, sobraría separarlos.
GEO — Presencia generativa
¿Te nombran? Combina la tasa de mención (70 %) con la cobertura de motores (30 %), sobre el total de observaciones válidas. El segundo componente existe porque aparecer la mitad de las veces repartido entre los cinco motores no es lo mismo que aparecer la mitad concentrado en uno solo y ser invisible en los otros cuatro.
AEO — Autoridad de respuesta
Cuando apareces, ¿eres la respuesta o eres relleno? Se calcula solo sobre las veces en que apareciste, no sobre el total. Pondera el tipo de aparición —ser la opción preferente vale más que ser un nombre en una lista— y la posición dentro de la respuesta.
Si la empresa no aparece nunca, este índice queda sin medir, no en cero. No hay respuesta cuya calidad juzgar, y confundir «nunca apareció» con «apareció mal» llevaría a planes de acción opuestos.
GSO — Recuperabilidad desde la búsqueda
¿La búsqueda en vivo encuentra tus fuentes? Combina la tasa de citación con la presencia del dominio propio entre las fuentes que el motor declaró. Es el único de los tres que usa ese dato, y mide procedencia: de dónde salió lo que el motor respondió.
Lo que no cubrimos, y por qué
AEO en su sentido amplio incluye superficies clásicas de Google —AI Overviews, featured snippets, People Also Ask— que no exponen una API oficial. El método habitual del sector para medirlas es capturar la interfaz real, es decir, scraping. No lo hacemos: contradice el compromiso de medir solo con APIs oficiales y documentadas. Preferimos declarar el límite antes que ampliar el alcance con datos que no podemos respaldar.
8. Comparar periodos sin hacer trampa
Si cambia el panel de motores, el modelo de alguno de ellos, la ubicación o la configuración de la consulta, los resultados dejan de ser comparables con los anteriores.
Cuando eso ocurre, se marca una ruptura metodológicavisible en la serie histórica del cliente, con el motivo. La alternativa —comparar en silencio mediciones que no son comparables— produciría “mejoras” y “caídas” que solo reflejan que cambiamos el instrumento.
9. Compuertas automáticas antes de entregar
El dictamen se entrega de forma automática apenas termina de redactarse, sin espera. Antes de eso pasa por controles que no dependen de que alguien esté mirando en ese momento:
- Compuerta automática de contenido mínimo. Se cuenta el documento producido: si no alcanza el mínimo comprometido en los términos, no se entrega y queda marcado para corrección.
- Corte de presupuesto. Cada dictamen tiene un límite de gasto en consultas a los motores de IA; si se alcanza, la medición se detiene con lo recopilado hasta ese punto en vez de seguir gastando.
- Vigilancia de trabajos atascados. Un proceso automático revisa periódicamente si un dictamen lleva más del tiempo razonable sin terminar y lo marca como fallido en vez de dejarlo pendiente indefinidamente.
Estas compuertas —no una revisión persona por persona— son las que permiten que un dictamen se firme.
10. Lo que esta metodología no puede decir
Un método serio se define tanto por lo que mide como por lo que reconoce que no mide.
- No reproduce lo que usted ve en su cuenta. Las respuestas de un asistente dependen de su historial, su configuración y su ubicación. Medimos condiciones documentadas y reproducibles, que por definición no son las de una cuenta particular.
- No predice el futuro. Los modelos se actualizan sin avisar. Una medición describe una fecha.
- No establece causalidad. Si algo cambia después de aplicar una recomendación, lo reportamos como coincidencia temporal, no como efecto demostrado.
- No mide volumen de tráfico ni de ventas. Mide presencia en respuestas, que es otra cosa.
Sobre el lenguaje de los resultados
En los dictámenes no se leerá “la IA siempre recomienda X” ni “usted perdió tantos clientes”. Se leerá en las muestras analizadas, bajo la configuración documentada, aumenta la probabilidad de.
No es cautela retórica: es que lo primero no se puede sostener con los datos que produce esta metodología, y afirmarlo sería mentir con números.
11. Trazabilidad de cada medición
De cada consulta ejecutada queda registro del proveedor, el modelo exacto, la fecha y hora, la versión de la configuración y la versión del texto de la pregunta.
Esto permite responder la pregunta que importa cuando alguien discute un resultado: ¿de dónde salió exactamente este número?
