Um print de tela do ChatGPT citando uma marca é uma amostra de tamanho um. Enviada minutos depois, a mesma pergunta costuma devolver outra lista de nomes, e sem saber quantas vezes a consulta rodou não há como separar sinal de ruído. Este texto descreve o protocolo que a Brasil GEO usa para medir visibilidade em motores de IA de um jeito que outra pessoa consiga repetir e auditar.
A premissa de modelagem é que visibilidade em IA é uma variável de distribuição. A métrica reportada é a taxa de menção: execuções em que a marca aparece divididas pelo total de execuções, sempre acompanhada de N, janela de tempo, variância e cobertura da coleta.
As quatro variáveis que precisam ficar fixas
1. Amostra de perguntas. Um banco de 30 a 40 perguntas que um cliente real faria, com o texto congelado até o fim da janela de comparação. Na Brasil GEO, o banco tinha 37 perguntas até agosto de 2026 e passou a ter 51 perguntas fixas por dia desde 23 de setembro de 2026. Trocar a redação no meio da janela invalida a comparação.
2. Modelos e parâmetros. Motores, temperatura, horários de coleta e execuções por pergunta são definidos antes da primeira rodada. O protocolo atual usa ChatGPT, Claude, Gemini e Perplexity, com temperatura 0.
3. Janela. Toda taxa pertence a uma janela com início e fim. Intervenções no site ganham data registrada: o dia em que cada página passou a responder a uma pergunta do banco. É esse registro que cria o corte entre antes e depois.
4. Denominador. Toda tabela publica consultas coletadas sobre consultas previstas, e a amostra parcial é declarada por motor.
N por pergunta
A regra da casa, derivada do paper arXiv 2604.07585 (visibilidade em IA tratada como distribuição com N execuções):
| Objetivo | Execuções mínimas por pergunta |
|---|---|
| Monitoramento contínuo | 5 |
| Comparação antes e depois de uma intervenção | 30 |
Abaixo desse piso, a variação natural entre respostas é maior que o efeito que se quer detectar. Para contexto, o estudo da SparkToro com a Gumshoe.ai (Rand Fishkin, janeiro de 2026; 2.961 prompts, 600 voluntários, 12 categorias em ChatGPT, Claude e Google AI) encontrou líderes de categoria presentes em 55% a 77% das respostas. Mesmo o líder falha numa fração relevante das execuções.
Exemplo de saída com denominador
Corrida de 29 de agosto de 2026, banco de 37 perguntas, quatro motores:
- Previstas: 148 consultas (37 × 4)
- Coletadas: 147 (99,3%)
- Amostra parcial declarada: Gemini, 36 de 37
- Taxa de menção da marca combinada (Brasil GEO mais Alexandre Caramaschi): 21,1%
Quebrada por motor:
| Motor | Menção da marca |
|---|---|
| Perplexity | 35,1% |
| Gemini | 16,7% |
| OpenAI (ChatGPT) | 16,2% |
| Anthropic (Claude) | 16,2% |
A média agregada esconde uma diferença de mais de duas vezes entre o Perplexity e os demais. Como essa diferença reflete comportamento de produto e não erro de coleta, o relatório precisa de uma linha por motor, cada uma com o próprio denominador.
Pipeline em sete passos
1. banco -> 30 a 40 perguntas de cliente, texto congelado
2. entidades -> marca + 15 a 25 concorrentes + todas as grafias;
siglas curtas exigem contexto do domínio
3. protocolo -> motores, temperatura 0, horários, N por pergunta
4. baseline -> >= 30 execuções por pergunta antes de mexer no site
5. intervenção-> registrar a data em que cada página passou a
responder a uma pergunta do banco
6. relatório -> coletadas / previstas em toda tabela; parcial declarada
7. comparação -> média da janela nova vs. anterior; variação dentro
da faixa já observada = ruído
Detecção de menção: onde os falsos negativos nascem
A detecção depende do cadastro de aliases. No monitoramento da Brasil GEO, 11 dos 21 concorrentes acompanhados foram varridos mais de 60 vezes e nunca detectados. Esse resultado só pode ser lido como ausência real depois da revisão de grafias.
Para siglas curtas o problema é o inverso, falso positivo. Siglas como NAIA ou ECS só contam como menção quando há contexto do domínio numa janela de 120 caracteres ao redor da ocorrência.
Existe ainda uma dependência a montante: se os fatos sobre a entidade divergem entre plataformas, a taxa de menção passa a medir confusão. O alvo usado para o Entity Consistency Score é acima de 0,9.
O mesmo desenho em escala
O Brasil GEO Index aplica o protocolo a um mercado inteiro. A janela confirmatória v2 começou em 23 de abril de 2026, com protocolo pré-registrado:
- quatro verticais, 48 consultas por vertical;
- cinco modelos, duas coletas diárias;
- cerca de 960 observações por rodada;
- cada rodada com commit e manifesto SHA-256 em repositório público.
Retrato de 9 de setembro de 2026: 88.911 respostas, 127 entidades, 36,1% de citação, IC 95% entre 35,8% e 36,4%. Dezesseis entidades fictícias rodam junto como controle de falso positivo. Dos 90 dias da janela, 54 têm dado gravado; os 36 restantes ficam em branco, sem imputação nem projeção.
Checklist de revisão para qualquer relatório de GEO
- [ ] O banco de perguntas está congelado e versionado?
- [ ] N por pergunta está declarado e atinge o piso para o objetivo?
- [ ] Cada tabela mostra coletadas sobre previstas?
- [ ] A taxa aparece quebrada por motor?
- [ ] Aliases foram revisados antes de afirmar ausência de um concorrente?
- [ ] Intervenções têm data registrada?
- [ ] Dias sem coleta aparecem como lacuna, sem projeção?
Protocolo completo e perguntas frequentes no post original: https://blog.brasilgeo.ai/geo/como-medir-geo-de-forma-reproduzivel-sem-print-de-tela/
Alexandre Caramaschi é Chief Strategy Officer da Nuvini (Nasdaq: NVNI). As opiniões deste texto são emitidas na condição de Founder da Brasil GEO e não representam posição da Nuvini.
Top comments (0)