Evaluator

O bloco Evaluator usa um modelo para pontuar conteúdo com base em métricas que você define, devolvendo um número por métrica. Use-o para portões de qualidade, comparação de variações e controle de qualidade sobre saídas de IA.

Configuração

Evaluation Metrics

As métricas usadas na pontuação. Cada métrica tem um nome, uma descrição do que ela mede e um intervalo numérico:

Accuracy (1-5): How factually accurate is the content?
Clarity  (1-5): How clear and understandable is it?
Relevance(1-5): How relevant is it to the original query?

O modelo pontua o conteúdo em cada métrica e devolve os números. Métricas sem nome ou sem intervalo são ignoradas.

Content

O conteúdo a pontuar. Normalmente uma saída anterior, como <agent.content>. Dados estruturados são formatados como texto antes da pontuação; a avaliação é baseada em texto, então ela não pontua imagens ou áudio diretamente.

Model

O modelo que faz a pontuação, com padrão claude-sonnet-4-6. Modelos com raciocínio mais forte dão notas mais consistentes. Digite ou escolha qualquer modelo suportado. Temperature e um System Prompt ficam disponíveis em advanced, e no Studio hospedado a API key é fornecida para você.

Saídas

O Evaluator devolve um número para cada métrica, lido pelo nome da métrica em minúsculas:

SaídaO que é
<evaluator.accuracy>A nota de uma métrica (uma saída por métrica que você definir)
<evaluator.content>O resumo da avaliação
<evaluator.model>O modelo que pontuou
<evaluator.tokens>Uso de tokens
<evaluator.cost>Custo estimado da chamada

O block impõe um JSON Schema montado a partir das suas métricas, então o modelo devolve apenas as notas das métricas como números, sem texto extra.

Exemplos

Criar um portão com base em uma nota de qualidade

O Evaluator pontua o rascunho, e um Condition decide com base em <evaluator.accuracy> — liberando um rascunho forte ou devolvendo um fraco para revisão.

O mesmo formato cobre outros trabalhos de qualidade: pontue várias variações em Parallel e escolha a melhor, ou pontue todas as respostas de suporte e sinalize as fracas para revisão.

Boas práticas

  • Escreva descrições específicas para as métricas. Uma definição clara do que cada métrica mede produz notas mais consistentes.
  • Escolha um intervalo razoável. Granularidade suficiente para agir (1–5 ou 0–10), sem exagerar nos detalhes.
  • Pontue a saída do Agent e volte atrás quando precisar. Combine um Evaluator com um Condition para criar um portão em um limite mínimo e devolver saídas fracas para outra passada.
  • Mantenha as métricas consistentes. Para comparar variações, use as mesmas métricas em cada avaliação.

Common Questions

Um objeto JSON em que cada chave é o nome da métrica em minúsculas e o valor é a nota numérica dentro do intervalo que você definiu. Uma métrica chamada 'Accuracy' com intervalo 1-5 aparece como { "accuracy": 4 }, e é lida adiante como <evaluator.accuracy>.
Modelos com raciocínio forte dão as notas mais consistentes. O padrão é claude-sonnet-4-6; para métricas simples e bem distintas, um modelo mais rápido resolve.
O campo de conteúdo aceita qualquer string. JSON ou dados estruturados são detectados e formatados antes da pontuação, mas a avaliação é baseada em texto, então ela não pontua imagens ou áudio diretamente.
Métricas sem nome ou sem intervalo são ignoradas. O Evaluator só pontua métricas que têm nome e um intervalo mínimo/máximo definido.
Sim. Ele monta um JSON Schema a partir das suas métricas e aplica o modo estrito, então o modelo devolve apenas as notas esperadas como números, sem texto extra.
A partir do uso de tokens da chamada ao modelo por baixo. As saídas incluem a contagem de tokens e um detalhamento de custo para você acompanhar o gasto por avaliação.