A proposta tentadora — e o furo estatístico escondido nela
Roda o teu teste A/B num modelo em vez de em usuários. Resultado em horas, não em semanas. Sem precisar alocar tráfego. Parece perfeito, né?
Mas a maioria das propostas de substituir humanos por LLMs em testes A/B pula silenciosamente a pergunta que torna um experimento válido: sob quais condições o experimento realmente identifica o efeito de tratamento que te interessa?
Experimentos randomizados são o padrão-ouro porque identificam o efeito causal por design. Troca as respostas reais dos usuários por previsões geradas por LLM e essa garantia evapora. A identificação passa a valer só por suposição.
O framework pra raciocinar sobre isso já existe — chama-se teoria de surrogate endpoint, emprestada da bioestatística. Em ensaios clínicos, biomarcadores de laboratório servem como proxies rápidos e baratos do desfecho clínico real. O detalhe: um surrogate só é válido se captura tudo sobre o tratamento que importa pro desfecho.
Em testes A/B digitais, previsões de LLM são o candidato da moda a surrogate. Se elas se qualificam é uma questão empírica, não de intuição.
TL;DR: Previsões de LLM podem substituir resultados humanos em testes A/B — mas só por suposição, não por design. As condições que fazem isso funcionar não podem ser verificadas pra tratamentos novos, e ficam menos plausíveis quanto mais o tratamento se afasta dos experimentos passados. A promessa é menos justificada justamente onde oferece mais benefício. O artigo estatístico completo está na engenharia original.

Previsões cruas de LLM são enviesadas — não só ruidosas
O time testou empiricamente a promessa usando o Upworthy Research Archive, o maior dataset aberto de testes A/B disponível hoje. Ele contém CTRs de variações de manchetes de notícias em milhares de experimentos.
Eles pediram pro gpt-4o-mini prever a CTR de um usuário típico pra cada manchete, separadamente pra tratamento e controle. Depois jogaram essas previsões cruas numa análise experimental padrão.
Resultado: recuperaram apenas 39% do efeito de tratamento humano observado.
Se você tratasse essas previsões como dados humanos, concluiria que os tratamentos são menos da metade tão eficazes quanto realmente são. Isso não é ruído aleatório — o viés é sistemático e direcional. Saídas de LLM atenuam efeitos de tratamento em direção ao zero, fazendo tratamentos parecerem mais fracos. Escala isso numa organização de produto e você toma decisões de ship erradas.
Duas condições que tornam saídas de LLM surrogates válidos
O paper formaliza exatamente duas condições sob as quais previsões de LLM podem identificar um efeito médio de tratamento humano:
- Surrogacy. A saída do LLM precisa mediar completamente o efeito do tratamento sobre o desfecho humano. Depois de condicionar na previsão do LLM e nas covariáveis de baseline, a atribuição de tratamento não te diz nada adicional sobre o que o usuário faria. Em português claro: o LLM captura tudo sobre o tratamento que importa pra resposta humana. Isso é assumido o tempo todo, raramente declarado e quase nunca validado.
- Comparabilidade. A função de calibração — o mapeamento de previsões de LLM pra desfechos humanos — precisa permanecer estável entre o novo experimento e os dados históricos usados pra ajustá-la. Se esse mapeamento muda quando o tratamento muda, a calibração quebra.
Quando ambas valem, calibrar saídas de LLM contra dados reais de testes A/B recupera o efeito humano. Quando qualquer uma falha, a estimativa é enviesada — e não por falta de dados. Mesmo com infinitas previsões de LLM, você recuperaria só o efeito sobre o LLM, não sobre usuários.

Calibração só funciona com o método certo
Nem todo método de calibração é igual. O time testou dois no Upworthy:
| Método | Resultado | Veredito |
|---|---|---|
| Calibração linear (OLS) | 3,8 erros-padrão do benchmark humano | ❌ Rígida demais — falhou no teste de falsificação |
| Random Forest / Gradient-Boosted Trees | Dentro do erro amostral do efeito humano | ✅ Flexível o bastante pra aprender o mapeamento não-linear |
A lição: calibração linear não captura a relação não-linear entre previsões de LLM e comportamento humano. Modelos ML baseados em árvores capturam.
O problema do ruído de temperatura
Uma única previsão de LLM é ruidosa por causa da temperatura de sampling — a aleatoriedade na geração de tokens. Ignorada, essa aleatoriedade enviesa a estimativa do efeito pro zero e infla a variância. A correção, tirada da teoria de erro de medição: gerar várias saídas de LLM por unidade experimental e tirar a média. O ruído se cancela, sobra o sinal.
A limitação real: intervenções futuras
Aqui está a parte desconfortável. Surrogacy e comparabilidade podem ser parcialmente avaliadas em dados históricos — mas nunca podem ser provadas pra um tratamento que você ainda não testou.
Isso cria um paradoxo brutal:
- Quanto mais um tratamento novo se afasta dos experimentos passados, mais fraca é a base pra confiar na saída do LLM.
- Pra intervenções genuinamente novas — um novo paradigma de UI, um novo modelo de precificação, uma feature diferente de tudo que já foi shipado — as suposições são inerentemente não-testáveis.
- O cenário onde o LLM oferece mais benefício é justamente onde ele tem menos chance de funcionar.
Experimentos humanos continuam indispensáveis pra inovação real de produto.
Por que o Upworthy é um caso quase ideal (e enganoso)
Upworthy é quase bom demais: desfecho binário (clique / não clique), tratamentos baseados em texto linguisticamente similares (variações de manchetes), e LLMs treinados em montanhas de texto sobre o que torna manchetes engajantes.
Pra tratamentos que mudam layout, algoritmo ou preço, as condições necessárias são muito mais difíceis de justificar. Não há evidência empírica de que as condições valem em geral — através do portfólio de inovações de uma empresa — como seria necessário pra usar testes A/B com LLM em escala.
Calibração precisa dos dados que você quer evitar coletar
O framework não elimina experimentos com usuários. Ele só mostra que você pode reduzir quantos precisa — e só quando os novos experimentos se parecem com os já rodados, deixando a extrapolação preencher a lacuna. O investimento inicial em respostas reais de usuários não é opcional; é o que torna testes A/B com LLM confiáveis.
Model drift quebra a calibração
Mais uma complicação: qualquer função de calibração é ajustada pra um modelo específico num momento específico. Provedores de LLM atualizam e substituem modelos o tempo todo. Uma calibração aprendida hoje pode ser inválida em seis meses — mesmo pro mesmo modelo. Avanços em previsão de LLM não são uma saída pra validação humana.

Palavra final: por design vs. por suposição
Experimentos com usuários funcionam por design. Experimentos baseados em LLM funcionam por suposição.
Como toda métrica proxy, surrogates de LLM funcionam até a relação entre proxy e desfecho mudar. O framework de surrogacy torna essa relação explícita, testável, e clara sobre as consequências quando falha. Ele não pode garantir que a relação vale pro experimento que você mais se importa — aquele que testa algo novo.
Dito isso, previsões de LLM podem melhorar experimentos humanos:
- Filtrar ideias fracas antes que consumam um slot de experimento.
- Servir como covariáveis pra redução de variância.
- Melhorar seleção e eficiência quando você tem histórico forte e o novo tratamento se parece com os passados.
Substituí-las por desfechos humanos é outra jogada. Troca identificação por design por identificação por suposição. Não abra mão disso.
Próximos passos
- Estuda teoria de surrogate endpoint em bioestatística — é o modelo mental mais limpo pra validade de métricas proxy.
- Aprofunda em teoria de erro de medição pra entender por que tirar média de várias amostras de LLM importa.
- Se você roda experimentos em escala, olha redução de variância via ajuste de covariáveis — é a forma de baixo risco de usar sinal de LLM sem abrir mão da identificação.