O bloco Evaluator usa um modelo para pontuar conteúdo com base em métricas que você define, devolvendo um número por métrica. Use-o para portões de qualidade, comparação de variações e controle de qualidade sobre saídas de IA.
Configuração
Evaluation Metrics
As métricas usadas na pontuação. Cada métrica tem um nome, uma descrição do que ela mede e um intervalo numérico:
Accuracy (1-5): How factually accurate is the content?
Clarity (1-5): How clear and understandable is it?
Relevance(1-5): How relevant is it to the original query?O modelo pontua o conteúdo em cada métrica e devolve os números. Métricas sem nome ou sem intervalo são ignoradas.
Content
O conteúdo a pontuar. Normalmente uma saída anterior, como <agent.content>. Dados estruturados são formatados como texto antes da pontuação; a avaliação é baseada em texto, então ela não pontua imagens ou áudio diretamente.
Model
O modelo que faz a pontuação, com padrão claude-sonnet-4-6. Modelos com raciocínio mais forte dão notas mais consistentes. Digite ou escolha qualquer modelo suportado. Temperature e um System Prompt ficam disponíveis em advanced, e no Studio hospedado a API key é fornecida para você.
Saídas
O Evaluator devolve um número para cada métrica, lido pelo nome da métrica em minúsculas:
| Saída | O que é |
|---|---|
<evaluator.accuracy> | A nota de uma métrica (uma saída por métrica que você definir) |
<evaluator.content> | O resumo da avaliação |
<evaluator.model> | O modelo que pontuou |
<evaluator.tokens> | Uso de tokens |
<evaluator.cost> | Custo estimado da chamada |
O block impõe um JSON Schema montado a partir das suas métricas, então o modelo devolve apenas as notas das métricas como números, sem texto extra.
Exemplos
Criar um portão com base em uma nota de qualidade
O Evaluator pontua o rascunho, e um Condition decide com base em <evaluator.accuracy> — liberando um rascunho forte ou devolvendo um fraco para revisão.
O mesmo formato cobre outros trabalhos de qualidade: pontue várias variações em Parallel e escolha a melhor, ou pontue todas as respostas de suporte e sinalize as fracas para revisão.
Boas práticas
- Escreva descrições específicas para as métricas. Uma definição clara do que cada métrica mede produz notas mais consistentes.
- Escolha um intervalo razoável. Granularidade suficiente para agir (1–5 ou 0–10), sem exagerar nos detalhes.
- Pontue a saída do Agent e volte atrás quando precisar. Combine um Evaluator com um Condition para criar um portão em um limite mínimo e devolver saídas fracas para outra passada.
- Mantenha as métricas consistentes. Para comparar variações, use as mesmas métricas em cada avaliação.