Guardrails
Restrições duras implementadas em código, não no prompt.

Em uma frase
Restrições duras que o agente não pode violar, implementadas em código e não só no prompt: valores máximos, ações proibidas, dados que não pode acessar. É a implementação técnica das políticas de negócio.
Sem isto
A regra vive no prompt: o modelo pode ignorar — e um dia ignora.
Com isto
A regra vive no código: a violação passa de improvável a impossível.
Exemplo
No prompt está escrito "não cite o endereço da criança". No código está a função que varre a saída procurando padrão de endereço e recusa a entrega. Só a função é um guardrail; a frase no prompt é uma intenção, e a diferença aparece no dia em que o modelo é atualizado por baixo.
O erro comum
Confiar a regra ao prompt. O modelo pode atender ou não ao que está no prompt, enquanto o código impõe o limite. Toda regra cuja violação seria inaceitável precisa existir fora do modelo, porque o modelo é probabilístico e "quase sempre obedece" não serve como política de compliance.
Na prática
- Pegue as regras cuja violação seria inaceitável e implemente em código.
- Teste tentando violar. Sem esse teste, você só supõe que o guardrail funciona.
- O guardrail devolve o motivo ao agente, porque um bloqueio mudo gera nova tentativa igual.
Como tangibilizar
As regras críticas implementadas como validação em código, fora do prompt.
