Introdução
No projeto de hoje vou demonstrar o uso do Guard Rail no contexto de IA.
O termo guardrail tem origem inglesa tendo surgido por volta de 1860, para designar trilhos adicionais instalados em ferrovias nas curvas mais acentuadas, afim de evitar o descarrilamento de trens.
No contexto da construção civil o conhecemos com guarda corpo em residências ou passarelas.
No contexto de IA o guard-rail (ou guardrail) pode funcionar como barreira à:
- geração de conteúdo inseguro
- falha de segurança
- alucinações
Inteligências artificiais generativas são probabilísticas.
Isso significa que ela calcula a probabilidade de cada próximo token com base no contexto e vai construindo a resposta a partir dessa probabilidade.
Entre a pergunta e a resposta existe um processo chamado tokenização, responsável por transformar texto puro em pequenas unidades chamadas tokens. Um token pode representar uma palavra inteira, partes de uma palavra, números ou símbolos.
Em seguida esses tokens são convertidos em representações numéricas, usadas pelos modelos para compreender o contexto.
Cada novo token gerado é usado para calcular a probabilidade dos próximos tokens.
Isso explica porque obtemos diferentes respostas para a mesma pergunta, por exemplo.
Arquitetura
A stack escolhida para este projeto é a seguinte:
Backend: c# / .net10
ORM: EF Core
Banco de dados: SQLite
Frontend: React 19 com TypeScript
LLM: Gemini 3.5-flash-lite
Para o backend c#/.net10 com EF orquestrando a persistência, é a escolha certa por fazerem parte do mesmo ecosistema.
SQLite foi o escolhido da vez porque não tem dependência externa (ele é self-contained), leve e de fácil configuração.
ReactJS+Typescript pela proximidade com c# resultando em menor curva de aprendizado.
Gemini 3.5-flash-lite por ser gratuito e rápido, além de não ser necessário fazer nenhuma configuração adicional. Apenas com uma conta Google já é possível criar uma apikey válida para uso.
Funcionamento
A aplicação foi projetada para enviar à LLM o prompt digitado pelo usuário para processamento, retornando uma resposta.
Podemos filtrar ou não o assunto para validar a aplicação do filtro.
A inclusão deliberada de palavras para filtrar fará com que o guardrail entre em ação, realizando uma segunda chamada à LLM usando-a agora como juiz (conceito de LLL-as-judge).
A escolha do modelo para ser gerador de conteúdo e juiz ao mesmo tempo foi proposital, por ser um projeto didático.
Recomendo fortemente que projetos reais usem modelos diferentes para geração de conteúdo e juiz, afim de mitigar o risco de falsos negativos.
Para fins de auditoria adicionei um histórico do que foi perguntado e se houve ou não bloqueio da resposta.
Screenshots
Prompt sem filtro.
Prompt com filtro
Histórico de perguntas e resultado
Repositório
O repositório é público e está acessível neste endereço:
Guard Rail IA
A didactic project that demonstrates, in practice, how a "guard" (guardrail) layer can prevent information leakage or misuse of generative AI tools inside a company.
The user types a question and, optionally, provides sensitive topics
(separated by ;) that shouldn't appear in the answer. The question is sent
to a free LLM (Gemini) with no content filtering applied by the provider
— this "raw" behavior is deliberate, to highlight the risk of using an AI
tool without controls. A separate layer of the application, the guard
analyzes the answer and, if it relates to any of the given topics, replaces
the content with "Conteúdo não permitido" ("Content not allowed").
The guard is not an LLM feature — it's an independent application layer exactly the pattern a company would apply on top of any third-party AI tool to enforce its own usage policies, without depending on…
Conclusão
🤖 A geração de conteúdo ganhou novos contornos com o uso massivo da IA, que tornou possível produzir resultados em uma velocidade sem precedentes.
⚠️ Entretanto, supervisionar tudo o que é produzido tornou-se uma tarefa hercúlea e, muitas vezes, impraticável.
🔍 Nesse cenário, estabelecer mecanismos capazes de avaliar e filtrar as respostas antes que cheguem ao usuário tornou-se essencial.
🛡️ Em essência, trata-se de garantir que a IA opere dentro de limites previamente estabelecidos, proporcionando maior segurança, controle e previsibilidade sobre o conteúdo gerado.
IMPORTANTE
🔒 Os modelos de IA geralmente possuem mecanismos de segurança próprios, capazes de identificar e restringir respostas a determinadas solicitações que envolvam conteúdos sensíveis ou que não sejam permitidos pelas políticas da plataforma ou pela legislação vigente em cada país.
Obrigado pela leitura.



Top comments (0)