Por que a Qualidade da Sinopse Importa em Escala
Quando um assinante entra na Netflix, enfrenta milhares de títulos. A sinopse — aquele texto curto abaixo da arte — é muitas vezes o fator decisivo entre dar play ou continuar rolando. Uma sinopse forte prende o interesse; uma fraca frustra e aumenta o abandono. Com centenas de milhares de sinopses, muitas com variantes personalizadas, escalar a validação de qualidade é um desafio imenso.
A solução da Netflix? Um sistema LLM-as-a-Judge que pontua sinopses em quatro dimensões de qualidade: precisão, clareza, tom e factualidade. O sistema atinge 85%+ de precisão binária contra escritores especialistas e, crucialmente, prevê o comportamento do assinante, como taxa de aceitação e abandono. Não é só pesquisa — está integrado ao fluxo de criação de sinopses.
Fonte: Netflix Tech Blog

A Arquitetura: Do Prompt à Produção
1. Pontuação Binária com Juízes Dedicados
A Netflix descobriu que um único prompt avaliando todos os critérios sobrecarrega o LLM. Em vez disso, usam juízes dedicados por critério, cada um com seu próprio prompt, metadados e diretrizes de qualidade. Todos os juízes geram uma explicação antes de dar uma nota binária (passa/falha).
2. Raciocínios em Camadas (Tiered Rationales)
Raciocínios mais longos melhoram a precisão, mas prejudicam a legibilidade. A solução: raciocínios em camadas — o LLM raciocina em qualquer extensão, depois produz um resumo conciso antes da nota final. Isso elevou a precisão do avaliador de tom de 86,55% para 87,85%.
# Exemplo simplificado de estrutura de prompt com raciocínio em camadas
prompt = f"""
Você está avaliando uma sinopse para {criterion}.
Diretrizes: {guidelines}
Sinopse: {synopsis}
Passo 1: Raciocine detalhadamente sobre a sinopse em cada ponto das diretrizes.
Passo 2: Escreva um resumo conciso do seu raciocínio.
Passo 3: Dê sua nota final: 1 (passa) ou 0 (falha).
"""
# A resposta do LLM inclui raciocínio longo, resumo e nota binária.
3. Pontuação por Consenso para Estabilidade
Amostrar múltiplas saídas (ex.: 5x) e calcular a média das notas binárias reduz a variância. Isso funciona melhor quando os raciocínios são longos, já que raciocínios curtos tendem a produzir notas idênticas. Para tom e clareza, o consenso 5x trouxe um claro ganho de precisão.
4. Agentes como Juízes para Factualidade
Erros de factualidade são diversos — enredo errado, metadados, elenco, prêmios. Cada um requer contexto diferente. A Netflix construiu agentes de factualidade: cada agente avalia um aspecto específico (ex.: factualidade do enredo) com seu próprio contexto. A nota final é o mínimo entre os agentes (qualquer falha = falha total). Todos os raciocínios são agregados por um LLM em uma explicação combinada.
# Pseudocódigo para agregação de agentes de factualidade
def nota_fact_final(notas_agentes):
# Cada agente retorna 0 ou 1
return min(notas_agentes) # qualquer falha = falha total
# Geração de raciocínio combinado
def combinar_raciocinios(raciocinios_agentes):
return llm_agregador(f"Agregue estes raciocínios: {raciocinios_agentes}")
5. Otimização de Prompt
Usando Otimização Automática de Prompt (APO) em um conjunto de desenvolvimento de ~300 amostras, a Netflix refinou os prompts iterativamente. O ajuste manual com assistência de LLM veio em seguida. O resultado: prompts que funcionam bem para alguns critérios (precisão), mas exigem truques extras de raciocínio para outros (clareza).

Limitações e Cuidados
- Custo vs. Benefício: Modelos de raciocínio (que geram longas trajetórias de pensamento) melhoraram a precisão, mas com custo de inferência significativamente maior. A Netflix optou por LLMs padrão com raciocínios em camadas.
- Teto de Concordância Humana: Mesmo após oito rodadas de calibração, a concordância entre escritores especialistas estagnou em ~80%. O LLM não pode superar o ruído nos rótulos humanos.
- Sensibilidade ao Contexto: Agentes de factualidade exigem contexto de referência confiável. Para erros de enredo, você precisa de um roteiro ou resumo detalhado — nem sempre disponível.
- Troca da Pontuação Binária: Notas binárias simplificam a avaliação, mas perdem granularidade. Uma sinopse que mal passa ainda pode ser ruim.
Próximos Passos para Seu Próprio Juiz LLM
- Comece com uma rubrica clara — defina o que é “bom” para seu domínio.
- Use juízes dedicados por critério, não um prompt monolítico.
- Experimente raciocínios em camadas — eles melhoram precisão e interpretabilidade.
- Valide contra o comportamento humano, não apenas opinião de especialistas.
- Considere decomposição em agentes para tarefas multifacetadas como factualidade.
Para mais sobre construção de sistemas de avaliação escaláveis, confira este guia sobre os anúncios da Microsoft no KubeCon Europe 2026 e um mergulho relacionado sobre otimização bayesiana da Meta para design de concreto.

Conclusão
O sistema LLM-as-a-Judge da Netflix é uma aula prática de avaliação de IA. Ao combinar pontuação binária, raciocínios em camadas, amostragem por consenso e agentes de factualidade, eles construíram um sistema que não só iguala escritores especialistas (85%+ de concordância), mas também prevê o comportamento real do assinante. O sistema está agora incorporado ao fluxo de criação de sinopses da Netflix, provando que juízes LLM podem sair do experimento de pesquisa para a necessidade de produção.
A lição principal? Avaliação automatizada de qualidade é difícil, mas com engenharia de prompt cuidadosa, decomposição em multi-agentes e validação comportamental, é alcançável em escala.