DEV Community

Alexandre Caramaschi
Alexandre Caramaschi

Posted on Originally published at blog.brasilgeo.ai

Como medir GEO de forma reproduzível: banco fixo, N por pergunta e denominador explícito

Um print de tela do ChatGPT citando uma marca é uma amostra de tamanho um. Enviada minutos depois, a mesma pergunta costuma devolver outra lista de nomes, e sem saber quantas vezes a consulta rodou não há como separar sinal de ruído. Este texto descreve o protocolo que a Brasil GEO usa para medir visibilidade em motores de IA de um jeito que outra pessoa consiga repetir e auditar.

A premissa de modelagem é que visibilidade em IA é uma variável de distribuição. A métrica reportada é a taxa de menção: execuções em que a marca aparece divididas pelo total de execuções, sempre acompanhada de N, janela de tempo, variância e cobertura da coleta.

As quatro variáveis que precisam ficar fixas

1. Amostra de perguntas. Um banco de 30 a 40 perguntas que um cliente real faria, com o texto congelado até o fim da janela de comparação. Na Brasil GEO, o banco tinha 37 perguntas até agosto de 2026 e passou a ter 51 perguntas fixas por dia desde 23 de setembro de 2026. Trocar a redação no meio da janela invalida a comparação.

2. Modelos e parâmetros. Motores, temperatura, horários de coleta e execuções por pergunta são definidos antes da primeira rodada. O protocolo atual usa ChatGPT, Claude, Gemini e Perplexity, com temperatura 0.

3. Janela. Toda taxa pertence a uma janela com início e fim. Intervenções no site ganham data registrada: o dia em que cada página passou a responder a uma pergunta do banco. É esse registro que cria o corte entre antes e depois.

4. Denominador. Toda tabela publica consultas coletadas sobre consultas previstas, e a amostra parcial é declarada por motor.

N por pergunta

A regra da casa, derivada do paper arXiv 2604.07585 (visibilidade em IA tratada como distribuição com N execuções):

Objetivo Execuções mínimas por pergunta
Monitoramento contínuo 5
Comparação antes e depois de uma intervenção 30

Abaixo desse piso, a variação natural entre respostas é maior que o efeito que se quer detectar. Para contexto, o estudo da SparkToro com a Gumshoe.ai (Rand Fishkin, janeiro de 2026; 2.961 prompts, 600 voluntários, 12 categorias em ChatGPT, Claude e Google AI) encontrou líderes de categoria presentes em 55% a 77% das respostas. Mesmo o líder falha numa fração relevante das execuções.

Exemplo de saída com denominador

Corrida de 29 de agosto de 2026, banco de 37 perguntas, quatro motores:

  • Previstas: 148 consultas (37 × 4)
  • Coletadas: 147 (99,3%)
  • Amostra parcial declarada: Gemini, 36 de 37
  • Taxa de menção da marca combinada (Brasil GEO mais Alexandre Caramaschi): 21,1%

Quebrada por motor:

Motor Menção da marca
Perplexity 35,1%
Gemini 16,7%
OpenAI (ChatGPT) 16,2%
Anthropic (Claude) 16,2%

A média agregada esconde uma diferença de mais de duas vezes entre o Perplexity e os demais. Como essa diferença reflete comportamento de produto e não erro de coleta, o relatório precisa de uma linha por motor, cada uma com o próprio denominador.

Pipeline em sete passos

1. banco      -> 30 a 40 perguntas de cliente, texto congelado
2. entidades  -> marca + 15 a 25 concorrentes + todas as grafias;
                 siglas curtas exigem contexto do domínio
3. protocolo  -> motores, temperatura 0, horários, N por pergunta
4. baseline   -> >= 30 execuções por pergunta antes de mexer no site
5. intervenção-> registrar a data em que cada página passou a
                 responder a uma pergunta do banco
6. relatório  -> coletadas / previstas em toda tabela; parcial declarada
7. comparação -> média da janela nova vs. anterior; variação dentro
                 da faixa já observada = ruído
Enter fullscreen mode Exit fullscreen mode

Detecção de menção: onde os falsos negativos nascem

A detecção depende do cadastro de aliases. No monitoramento da Brasil GEO, 11 dos 21 concorrentes acompanhados foram varridos mais de 60 vezes e nunca detectados. Esse resultado só pode ser lido como ausência real depois da revisão de grafias.

Para siglas curtas o problema é o inverso, falso positivo. Siglas como NAIA ou ECS só contam como menção quando há contexto do domínio numa janela de 120 caracteres ao redor da ocorrência.

Existe ainda uma dependência a montante: se os fatos sobre a entidade divergem entre plataformas, a taxa de menção passa a medir confusão. O alvo usado para o Entity Consistency Score é acima de 0,9.

O mesmo desenho em escala

O Brasil GEO Index aplica o protocolo a um mercado inteiro. A janela confirmatória v2 começou em 23 de abril de 2026, com protocolo pré-registrado:

  • quatro verticais, 48 consultas por vertical;
  • cinco modelos, duas coletas diárias;
  • cerca de 960 observações por rodada;
  • cada rodada com commit e manifesto SHA-256 em repositório público.

Retrato de 9 de setembro de 2026: 88.911 respostas, 127 entidades, 36,1% de citação, IC 95% entre 35,8% e 36,4%. Dezesseis entidades fictícias rodam junto como controle de falso positivo. Dos 90 dias da janela, 54 têm dado gravado; os 36 restantes ficam em branco, sem imputação nem projeção.

Checklist de revisão para qualquer relatório de GEO

  • [ ] O banco de perguntas está congelado e versionado?
  • [ ] N por pergunta está declarado e atinge o piso para o objetivo?
  • [ ] Cada tabela mostra coletadas sobre previstas?
  • [ ] A taxa aparece quebrada por motor?
  • [ ] Aliases foram revisados antes de afirmar ausência de um concorrente?
  • [ ] Intervenções têm data registrada?
  • [ ] Dias sem coleta aparecem como lacuna, sem projeção?

Protocolo completo e perguntas frequentes no post original: https://blog.brasilgeo.ai/geo/como-medir-geo-de-forma-reproduzivel-sem-print-de-tela/


Alexandre Caramaschi é Chief Strategy Officer da Nuvini (Nasdaq: NVNI). As opiniões deste texto são emitidas na condição de Founder da Brasil GEO e não representam posição da Nuvini.

Top comments (0)