guardrail · granite · governance
A empresa pode ser até pequena,
mas aqui o negócio nasce Grande.
O portão que toda resposta de IA atravessa antes de chegar ao humano. Se alucina, bloqueia. Se a citação não existe, sinaliza. Se o dado sigiloso tenta sair do perímetro, impede.
O guardrail
Toda resposta atravessa o portão antes de chegar ao humano.
Se a IA alucina, o guardrail bloqueia.
Uma resposta que inventa o que não existe não chega ao humano. O erro morre na porteira — vira faísca verde contra o granito.
Se a citação não existe, o guardrail sinaliza.
Citação sem fonte é fraude técnica, não deslize. O guardrail marca em âmbar antes de a resposta assinar embaixo.
Se o dado sigiloso tenta sair, o guardrail impede.
O perímetro segura o que é sigiloso. Nada atravessa a barreira sem passar pelo portão — o lacre verde fecha antes do humano.
Cinco rails, um portão
O guardrail roda em cada estágio da interação — não só na saída.
Input rail
Antes do modelo: jailbreak, prompt injection, PII no prompt, tópico fora de escopo, idioma.
Retrieval rail
Nos trechos recuperados (RAG): fonte não autorizada, dado sob sigilo, documento vencido.
Dialog rail
No fluxo: política por tenant, persona, escopo regulatório, recusa com justificativa.
Execution rail
Nas ferramentas/agentes: validação de argumentos, allowlist de ações, sem credencial no prompt.
Output rail
Depois do modelo: alucinação, citação inexistente, PII, toxicidade, viés, formato.
Detectores
O que o portão enxerga.
Groundedness & alucinação
Toda afirmação é cotejada com o contexto e o corpus (Planalto, LexML, BCB, ANVISA, RAGJur). Sem lastro, não passa.
Citação verificável
Lei, artigo, acórdão e número de processo conferidos contra a fonte oficial. Inexistente → bloqueio; divergente → alerta.
PII & sigilo
CPF, CNPJ, RG, CNS, e-mail, telefone, conta. Mascara, tokeniza ou bloqueia conforme a política e a base legal (LGPD art. 7/11).
Jailbreak & prompt injection
Heurística + classificador em português, inclusive injeção indireta em documentos e páginas recuperadas.
Governança & evidência
Confiança sem rastro não vale. Aqui, cada decisão deixa recibo.
Policy-as-code
Regras em repositório Git, revisadas por PR, com versão e changelog — o auditor lê a regra, não a promessa.
Recibo público
Cada decisão gera recibo imutável (WORM 7 anos) carimbado no Bitcoin via OpenTimestamps. Verificável sem login.
Observabilidade
Trace por requisição: rail acionado, score, latência, versão da regra. Painel por tenant, exportável para SIEM.
Red-team & avaliação contínua
Suíte de ataques em português (jailbreak, injeção, exfiltração) rodando a cada release; métricas públicas.
Motor open-weights · Hugging Face
Os pesos são públicos. Qualquer auditor baixa, roda e confere.
Granite Guardian 4.1 · 8B
Classificador de risco atual: harm, social bias, jailbreak, violence, profanity, sexual, unethical, PII, groundedness, relevance, function-call. Apache-2.0. Também em GGUF para llama.cpp.
Granite Guardian 3.2 · 5B / 3B-A800M
Variantes leves (MoE 800M ativos) para latência <50ms — o rail de entrada roda aqui. LoRAs de correção de harm e factualidade.
Granite Guardian HAP · 38M / 125M
Detector de hate/abuse/profanity minúsculo, roda inline em CPU dentro do proxy.
Granite Guardian · coleção
Todas as versões (3.0 → 4.1), GGUF, LoRAs e o detector de factualidade 3.2-8B, lado a lado.
Esquemas
O guardrail desenhado.
Verticais reguladas
Onde errar custa caro, o portão fica fechado.
Do blog
100 tópicos, 3 idiomas, resposta curta em cada um.
O que é um guardrail de IA
Um guardrail de IA é a camada que filtra toda resposta do modelo antes de chegar ao humano — bloqueando alucinação, PII e jailbreak.
O Recibo do guardrail
O recibo do g.cloud é público, imutável (WORM 7 anos) e carimbado no Bitcoin via OpenTimestamps — prova que a IA foi guardada.
Sigilo bancário e a LC 105
A Lei Complementar nº 105/2001 regula o sigilo bancário no Brasil, estabelecendo que ele é relativo e pode ser quebrado por autoridade judicial…
Recomendação OAB 001/2024
A Recomendação OAB 001/2024 é um ato normativo da Ordem dos Advogados do Brasil que orienta advogados sobre o uso ético, seguro e responsável de…
IBM Granite Guardian: o motor do guardrail
O IBM Granite Guardian é um *guardrail* técnico nativo do modelo IBM Granite, projetado para detectar e mitigar conteúdos de risco em tempo real — como…
Alucinação bloqueada antes do humano
“Alucinação bloqueada antes do humano” é um princípio de engenharia de guardrails que prioriza a detecção e supressão de saídas geradas por IA que contêm…
PII: mascaramento de CPF e CNPJ
O mascaramento de CPF e CNPJ é uma prática recomendada — e, em muitos casos, exigida — pela LGPD como medida de segurança para proteger dados pessoais…
Guardrail para hospital (CFM)
Hospitais no Brasil devem implementar guardrails éticos e técnicos para uso de IA em saúde conforme orientações do Conselho Federal de Medicina (CFM) e…
Manifesto
A empresa pode ser até pequena, mas aqui o negócio nasce Grande.
O guardrail não precisa ser grande para guardar tudo — precisa ser certo. E o que é certo cabe numa empresa pequena, porque proteger um paciente, um cliente, um processo não nasce do tamanho do time: nasce da teimosia de fazer certo quando ninguém está olhando.