DEV Community

Matheus de Camargo Marques
Matheus de Camargo Marques

Posted on

Além da Busca Vetorial: Como Alinhar o Sistema 1 e o Sistema 2 na sua Arquitetura de RAG

Existe uma armadilha clássica no design de sistemas de RAG (Retrieval-Augmented Generation): ou você constrói uma busca vetorial extremamente rápida que responde em milissegundos mas erra em perguntas complexas, ou você projeta um loop de agentes pesados que raciocina por 30 segundos, queima milhares de tokens e estoura o orçamento de infraestrutura.

Em seu livro "Raciocínio: Rápido e Devagar", o prêmio Nobel Daniel Kahneman dividiu a cognição humana em dois módulos:

  • Sistema 1 (Intuitivo e Rápido): Opera de forma automática, instintiva, sem esforço perceptível.
  • Sistema 2 (Analítico e Deliberado): Aloca atenção às operações mentais trabalhosas, exigindo esforço consciente, lógica e tempo.

Se você analisar a pilha de IA sob essa ótica, perceberá que a maioria dos times de software comete um erro primário: tenta resolver problemas do Sistema 2 usando apenas a infraestrutura do Sistema 1, ou vice-versa.

O segredo para construir um RAG de nível enterprise não é escolher um dos dois lados, mas sim criar mecanismos de alinhamento e chaveamento entre eles.


1. Mapeando a Dualidade no RAG

Antes de alinhar, precisamos definir quem é quem no nosso pipeline de dados:

O Sistema 1 no RAG (A Intuição do Vetor)

  • Ferramentas: Busca por similaridade geométrica (HNSW, k-NN), índices estatísticos (BM25, TF-IDF) e a própria memória paramétrica do LLM.
  • Características: Responde em milissegundos, consome pouca CPU/GPU, opera por correspondência de padrões.
  • Limitação: Não entende relações de causa e efeito complexas, não detecta contradições sutis e é vulnerável a ruídos semânticos.

O Sistema 2 no RAG (A Razão do Agente)

  • Ferramentas: Loops de raciocínio (ReAct), decomposição de queries, navegação em Grafos de Conhecimento (GraphRAG), Cross-Encoders pesados e validação por auto-correção (Self-Correction).
  • Características: Alto poder de síntese, capacidade de resolver ambiguidades, navegação em múltiplas etapas (multi-hop reasoning).
  • Limitação: Latência elevada (segundos a minutos) e custo financeiro proporcional ao número de chamadas ao modelo.

2. A Camada de Metacognição: Como Alinhar os Dois Sistemas

Sistemas cognitivos eficientes não mantêm o Sistema 2 ligado o tempo todo — o cérebro humano morreria de exaustão metabólica. O segredo do alinhamento é a metacognição: a capacidade do sistema de avaliar a própria certeza antes de decidir gastar energia.

Aqui estão os 4 pilares de arquitetura para alinhar o Sistema 1 e o Sistema 2 na produção:

              ┌────────────────────────┐
              │ Query do Usuário       │
              └───────────┬────────────┘
                          │
                          ▼
              ┌────────────────────────┐
              │  SISTEMA 1 (Fast Path) │
              │  Vector Search + BM25  │
              └───────────┬────────────┘
                          │
                          ▼
              ┌────────────────────────┐
              │   Gating de Confiança  │
              │   (Score & Entropia)   │
              └──────┬───────────┬─────┘
                     │           │
 Confiança Alta      │           │  Confiança Baixa / Ruído
 (Atende no S1)      │           │  (Dispara o S2)
                     ▼           ▼
    ┌──────────────────┐       ┌──────────────────────────────┐
    │ Resposta Rápida  │       │ SISTEMA 2 (Slow Path)        │
    │ (Baixa Latência) │       │ Re-ranking / Graph / ReAct   │
    └──────────────────┘       └──────────────┬───────────────┘
                                              │
                                              ▼
                               ┌──────────────────────────────┐
                               │ Resposta Sintetizada         │
                               └──────────────────────────────┘
Enter fullscreen mode Exit fullscreen mode

Pillar 1: Gating de Confiança e Entropia (Confidence Gate)

Em vez de enviar todas as requisições para o mesmo pipeline, coloque um roteador estatístico logo após a busca do Sistema 1.

  • Se a busca vetorial retornar chunks com alto score de similaridade (ex: cosseno > 0.88) e baixa variação entre os resultados, o Sistema 1 entrega o contexto diretamente ao LLM.
  • Se os scores forem baixos, dispersos ou se houver alta entropia entre os fragmentos encontrados, o Gating redireciona a requisição para o Sistema 2, ativando a reescrita de query ou busca em grafos.

Pillar 2: O Funil Bi-Encoder → Cross-Encoder

O Bi-Encoder (Sistema 1) converte textos em vetores estáticos antes da consulta. Ele não sabe qual pergunta será feita. Por isso, ele é rápido, mas "superficial".

Para alinhar esse vetor com a razão, introduzimos o Cross-Encoder (Sistema 2) no final do funil. O Cross-Encoder processa a pergunta e o documento juntos, calculando a atenção token a token.

Regra de Ouro: O Sistema 1 reduz 1.000.000 de candidatos para 30 em 10 milissegundos. O Sistema 2 avalia esses 30 candidatos com atenção total em 150 milissegundos.

Pillar 3: Tokens de Reflexão e Self-RAG

Arquiteturas baseadas em Self-RAG introduzem uma verificação metacognitiva em tempo de inferência usando tokens especiais:

  • [IsREL] (Is Relevant): O contexto recuperado realmente responde à dúvida?
  • [IsSUP] (Is Supported): A afirmação gerada é sustentada pelas fontes ou é uma alucinação?

Se o filtro [IsREL] indica que o Sistema 1 falhou, o fluxo é interrompido imediatamente para que o Sistema 2 assuma o controle, reformule a estratégia e execute um novo rastreio.

Pillar 4: Consolidação Assíncrona (Dream Cycles)

O alinhamento não precisa acontecer apenas em tempo de execução (runtime). Você pode alinhar os dois sistemas em background.

Enquanto o Sistema 1 atende os usuários durante o dia, um worker assíncrono (Sistema 2) roda de madrugada consolidando a memória: agrupa vetores semelhantes, resume históricos de conversas longas, gera relações no Grafo de Conhecimento e expurga dados obsoletos.

Quando o sistema "acorda", a busca intuitiva do Sistema 1 passa a operar sobre dados que já foram organizados pela lógica do Sistema 2.


3. Tabela Comparativa de Impacto Arquitetural

Abordagem Latência Média Custo por Requisição Precisão Semântica Casos de Uso Ideais
Apenas Sistema 1 ~200ms Muito Baixo Média/Baixa Perguntas diretas, FAQs, busca factual exata
Apenas Sistema 2 5s - 30s Muito Alto Altíssima Análise contratual, diagnósticos complexos, relatórios
Sistemas Alinhados (Gated) ~300ms (P50) / 3s (P99) Otimizado (FinOps) Altíssima Sistemas corporativos em escala (Enterprise RAG)

Conclusão: Engenharia é sobre Trade-offs

Não tente fazer a sua busca vetorial agir como um filosofo, nem faça o seu agente re-avaliar o óbvio a cada clique do usuário.

A verdadeira maturidade na arquitetura de IA em produção está em construir a infraestrutura de transição: saber exatamente quando responder com a intuição do vetor e quando pausar para acionar o raciocínio deliberado.

Sistemas de RAG que dominam essa transição entregam o melhor dos dois mundos: respostas instantâneas para o simples, profundidade analítica para o complexo e custos de infraestrutura rigorosamente sob controle.

Top comments (0)