Prompt é pedido, código é limite
A regra mais importante desta etapa: regra crítica não fica no prompt.
Escrever "não cite o endereço da criança" no prompt é um pedido. Quase sempre ele é atendido, e por isso a falha é perigosa: quando ela acontece, ninguém está mais olhando. Basta o fornecedor atualizar o modelo por baixo.
Guardrail é a mesma regra implementada como código que recusa a saída. Com o pedido, a violação fica improvável. Com o guardrail, fica impossível.
O mesmo raciocínio vale para acesso. Least privilege limita o estrago quando o agente é enganado, e ele vai ser enganado: prompt injection é um risco estrutural de qualquer agente que lê conteúdo externo, e nenhuma instrução no prompt resolve isso. O que resolve é o agente enganado não ter permissão para fazer nada demais.
