GVE Score: Metodología para medir la visibilidad de marcas en modelos de lenguaje
Generative Visibility Engine — Una métrica objetiva para auditar la presencia en ChatGPT, Gemini, Claude y Perplexity
📥 Descargar PDF (Guardar como PDF en impresión)Resumen ejecutivo
La creciente adopción de modelos de lenguaje de gran escala (LLMs) como ChatGPT, Google Gemini, Anthropic Claude y Perplexity como herramientas de búsqueda y recomendación ha creado una nueva necesidad: medir de forma objetiva si una marca aparece en las respuestas generadas por estos sistemas.
El GVE Score (Generative Visibility Engine) es una metodología desarrollada por OSEKO que permite auditar, cuantificar y monitorizar la visibilidad de cualquier marca en los principales buscadores de IA. Este whitepaper describe en detalle la fórmula, los criterios de evaluación, la interpretación de resultados y los casos de uso para empresas.
1. Introducción
Hasta 2024, la visibilidad online se medía casi exclusivamente mediante métricas SEO: posición en Google, tráfico orgánico, autoridad de dominio. Sin embargo, la irrupción de los buscadores generativos (AI Overviews de Google, ChatGPT Search, Gemini, Perplexity) ha cambiado radicalmente el panorama.
Un usuario ya no necesita hacer clic en un enlace para obtener una respuesta. El LLM genera una respuesta sintetizada que puede incluir o no una marca. Si la marca no es citada, es invisible para ese usuario, independientemente de su posición en Google.
Las métricas SEO tradicionales no sirven para medir este nuevo paradigma. El GVE Score nace para llenar ese vacío.
2. Definición del GVE Score
El GVE Score es un número entre 0 y 100 que cuantifica la visibilidad de una marca en los principales LLMs. Se calcula a partir de 20 preguntas estratégicas distribuidas en 4 categorías, lanzadas a 3 modelos de lenguaje (ChatGPT, Gemini, Claude) con 3 temperaturas cada uno, resultando en 180 evaluaciones individuales.
2.1 Categorías de evaluación
| Categoría | Descripción | # Prompts |
|---|---|---|
| Marca 🔵 | El usuario pregunta directamente por la marca: "¿Conoces OSEKO?", "¿Qué opinas de OSEKO?" | 5 |
| Producto 🟢 | El usuario busca el servicio sin mencionar marca: "Busco una agencia GEO", "Necesito contratar GEO" | 5 |
| Comparativo 🟡 | El usuario compara opciones: "Mejores agencias GEO", "OSEKO vs otras agencias" | 5 |
| Problema 🔴 | El usuario tiene un problema: "Cómo mejorar visibilidad en IA", "No aparezco en ChatGPT" | 5 |
2.2 Fórmula del GVE Score
| Componente | Peso | ¿Qué mide? |
|---|---|---|
| Menciones directas | 40 pts | % de prompts donde la marca es mencionada |
| Tasa de descubrimiento | 30 pts | % de prompts sin mención explícita de la marca donde aparece igualmente |
| Citas con URL | 20 pts | % de prompts donde la marca se menciona con enlace a su web |
| Cita directa | 10 pts | % de prompts donde la recomendación es directa (sin redirección tipo "visita su web") |
2.3 Escala de interpretación
| Rango | Etiqueta | Significado |
|---|---|---|
| 80-100 | 🏆 Excelente | La marca es una referencia en su sector para los LLMs |
| 60-79 | ✅ Buena | La marca aparece consistentemente con URL y recomendación directa |
| 40-59 | ⚠️ Media | La marca aparece en consultas directas pero no en discovery |
| 20-39 | 🔻 Baja | La marca aparece esporádicamente, sin URL ni recomendación |
| 0-19 | 🚨 Crítica | La marca es prácticamente invisible para los LLMs |
3. Metodología de ejecución
3.1 Selección de LLMs
El test se ejecuta sobre tres modelos principales:
- ChatGPT (OpenAI GPT-4o / GPT-4.1) — El más utilizado globalmente
- Gemini (Google Gemini 2.5 Pro) — Integrado en el ecosistema Google
- Claude (Anthropic Claude Sonnet 4) — Referente en análisis profundo
Opcionalmente se incluyen Perplexity y Copilot para una visión más completa.
3.2 Sistema de temperaturas
Cada prompt se ejecuta con 3 temperaturas (0.3, 0.7, 1.0) para capturar la variabilidad natural de los LLMs. Una marca debe aparecer consistentemente en las 3 temperaturas para considerarse "estable".
3.3 Sistema de puntuación por prompt
Cada respuesta se evalúa con los siguientes criterios:
- Score 1.0: La marca aparece con recomendación directa en un prompt de descubrimiento
- Score 0.8: La marca aparece con recomendación directa en un prompt de marca explícita
- Score 0.5: La marca aparece pero con redirección ("visita su web" en lugar de recomendación)
- Score 0.3: La marca se menciona tangencialmente sin contexto positivo
- Score 0.0: La marca no aparece
4. Factores que influyen en el GVE Score
Basándonos en más de 50 auditorías realizadas, identificamos los siguientes factores como determinantes del GVE Score:
4.1 Datos estructurados (JSON-LD)
Los LLMs y sus crawlers (GPTBot, ClaudeBot, Google-Extended) extraen información mediante esquemas Schema.org. Sin datos estructurados, una página web es semánticamente opaca para los modelos de lenguaje. Las implementaciones más relevantes son Organization, Article, FAQ, BreadcrumbList y Product.
4.2 Wikidata y Knowledge Graph
La presencia en Wikidata proporciona una entidad canónica que los LLMs pueden referenciar. Marcas sin entrada en Wikidata son significativamente menos citadas en respuestas de descubrimiento (categorías Producto y Problema).
4.3 Contenido entity-rich
Los artículos con alta densidad de entidades semánticas —conceptos, personas, organizaciones, lugares— conectados mediante enlaces internos y externos tienen mayor probabilidad de ser citados. El contenido plano, sin estructura semántica, rara vez aparece en respuestas de LLMs.
4.4 Autoridad externa
Las marcas citadas en Wikipedia, medios de comunicación, directorios sectoriales y publicaciones académicas reciben señales de autoridad que los LLMs incorporan en sus respuestas. Una marca que solo existe en su propia web tiene un techo bajo de GVE Score.
5. Plan de mejora recomendado
| Fase | Acciones | Impacto estimado | Plazo |
|---|---|---|---|
| Fase 1 Contenido y datos |
Implementar JSON-LD, crear 5+ artículos entity-rich, optimizar landing | +15 a +25 pts | 30-60 días |
| Fase 2 Autoridad externa |
Registrar Wikidata, perfiles LinkedIn/Crunchbase, Wikipedia si aplica | +10 a +20 pts | 60-90 días |
| Fase 3 Backlinks y medios |
Conseguir menciones en medios, backlinks de calidad, colaboraciones | +10 a +15 pts | 90-180 días |
| Fase 4 Monitorización continua |
Test mensual GVE, ajuste de estrategia, contenido continuo | +5 a +10 pts/mes | Mensual |
6. Casos de uso
6.1 Auditoría inicial
Una empresa contrata un GVE Score baseline para conocer su situación actual antes de iniciar una estrategia GEO.
6.2 Seguimiento mensual
La misma empresa realiza tests mensuales para medir el impacto de sus acciones de contenido y autoridad.
6.3 Benchmarking competitivo
Se comparan los GVE Scores de varios competidores para identificar quién domina la conversación en los LLMs y por qué.
7. Limitaciones y trabajo futuro
El GVE Score presenta las siguientes limitaciones conocidas:
- Variabilidad temporal: Los LLMs se actualizan constantemente, por lo que un score puede variar entre ciclos de actualización
- Cobertura de LLMs: La metodología actual cubre 3 modelos principales; la inclusión de más modelos (Perplexity, DeepSeek, Mistral) mejoraría la precisión
- Dependencia de API: Los tests dependen de la disponibilidad de las APIs de los LLMs
Las próximas versiones del GVE Score incorporarán: análisis semántico de la calidad de la mención (positiva/neutral/negativa), detección de entidades competidoras en la misma respuesta, e integración con Google Business Profile.
8. Referencias
- Aggarwal, P., Murahari, V., Rajpurohit, T. et al. (2024). "GEO: Generative Engine Optimization". arXiv:2311.09735.
- Wikipedia. "Generative engine optimization". https://en.wikipedia.org/wiki/Generative_engine_optimization
- OSEKO (2026). "GVE Score Methodology v1.0". https://oseko.eu/whitepaper/gve-score-metodologia
OSEKO — Generative Engine Optimization
oseko.eu · info@oseko.eu
Documento bajo licencia CC BY-NC 4.0. Se permite su reproducción citando la fuente.