Pular para o conteúdo
0%
0% da etapa
Conceito 2 min

Guardrails

Restrições duras implementadas em código, não no prompt.

Em uma frase

Restrições duras que o agente não pode violar, implementadas em código e não só no prompt: valores máximos, ações proibidas, dados que não pode acessar. É a implementação técnica das políticas de negócio.

Sem isto

A regra vive no prompt: o modelo pode ignorar — e um dia ignora.

Com isto

A regra vive no código: a violação passa de improvável a impossível.

Exemplo

No prompt está escrito "não cite o endereço da criança". No código está a função que varre a saída procurando padrão de endereço e recusa a entrega. Só a função é um guardrail; a frase no prompt é uma intenção, e a diferença aparece no dia em que o modelo é atualizado por baixo.

O erro comum

Confiar a regra ao prompt. O modelo pode atender ou não ao que está no prompt, enquanto o código impõe o limite. Toda regra cuja violação seria inaceitável precisa existir fora do modelo, porque o modelo é probabilístico e "quase sempre obedece" não serve como política de compliance.

Na prática

  • Pegue as regras cuja violação seria inaceitável e implemente em código.
  • Teste tentando violar. Sem esse teste, você só supõe que o guardrail funciona.
  • O guardrail devolve o motivo ao agente, porque um bloqueio mudo gera nova tentativa igual.

Como tangibilizar

As regras críticas implementadas como validação em código, fora do prompt.

Para discutir

Isso já está pronto na sua empresa? Compare com o critério:

Pronto quando: Quando violar a regra é impossível, e não apenas improvável.