Golden Dataset
O gabarito da operação: exemplos com resposta correta conhecida, incluindo de propósito os casos difíceis.

Em uma frase
O conjunto de exemplos com resposta correta conhecida contra o qual os evals medem o sistema. É o gabarito oficial da operação.
Antes
Casos reais, inclusive os difíceis
O que ele faz
Gabarito com resposta correta conhecida
Depois
Os evals medem contra ele
Analogia
É o gabarito da prova. Sem ele, corrigir vira opinião, e opinião muda conforme quem está corrigindo e que horas são.
Exemplo
200 cartas dos últimos três anos que a coordenação aprovou sem ressalva, cada uma pareada com o relatório de campo que a originou.
Trinta delas foram escolhidas de propósito por serem difíceis: criança que mudou de cidade no meio do ano, relatório com informação contraditória, criança que saiu do programa, padrinho que escreve em espanhol, relatório digitalizado com letra ruim. São esses 30 casos que dão valor ao conjunto, já que 200 cartas fáceis medem quase nada.
O erro comum
Montar o golden dataset só com casos bonitos. O sistema passa em 100%, todo mundo comemora, e ele quebra na primeira exceção real, porque exceção é justamente o que não estava no gabarito.
O segundo erro é deixar o dataset congelado. Cada caso que dá errado em produção precisa entrar no dataset. É assim que o golden dataset faz o compound engineering funcionar: cada erro vira proteção permanente, e o sistema melhora a cada falha em vez de só voltar ao normal.
Na prática
- Pasta versionada com pares entrada / saída-esperada, mais uma linha explicando por que cada caso está ali.
- 30 a 50 casos bem escolhidos batem 500 aleatórios.
- Regra operacional: nenhum bug é considerado resolvido antes de virar caso no dataset.
- Quem decide o que é "resposta correta" precisa ter nome, porque essa decisão é do negócio, e não da engenharia.
Como tangibilizar
Uma pasta versionada com pares entrada/saída-esperada e uma linha explicando por que cada caso está ali.
