El pitch tentador — y el hoyo estadístico escondido

Corre tu prueba A/B en un modelo en vez de en usuarios. Resultados en horas, no en semanas. Sin asignar tráfico. Suena increíble, ¿no?

Pero la mayoría de las propuestas de reemplazar humanos con LLMs en pruebas A/B se saltan silenciosamente la pregunta que hace válido un experimento: ¿bajo qué condiciones el experimento realmente identifica el efecto de tratamiento que te interesa?

Los experimentos aleatorizados son el estándar de oro porque identifican el efecto causal por diseño. Cambia las respuestas reales de usuarios por predicciones generadas por LLM y esa garantía se evapora. La identificación pasa a valer solo por suposición.

El framework para razonar sobre esto ya existe — se llama teoría de surrogate endpoint, prestada de la bioestadística. En ensayos clínicos, biomarcadores de laboratorio sirven como proxies rápidos y baratos del desenlace clínico real. El detalle: un surrogate solo es válido si captura todo sobre el tratamiento que importa para el desenlace.

En pruebas A/B digitales, las predicciones de LLM son el candidato de moda a surrogate. Si califican o no es una pregunta empírica, no de intuición.

TL;DR: Las predicciones de LLM pueden sustituir resultados humanos en pruebas A/B — pero solo por suposición, no por diseño. Las condiciones que hacen que esto funcione no se pueden verificar para tratamientos nuevos, y se vuelven menos plausibles mientras más se aleja el tratamiento de experimentos pasados. La promesa está menos justificada justo donde ofrece más beneficio. El paper estadístico completo está en el artículo original de ingeniería.

Data analyst comparing LLM-predicted CTR against human A/B test results in a statistical dashboard Technical Structure Concept

Las predicciones crudas de LLM están sesgadas — no solo son ruidosas

El equipo probó empíricamente la promesa usando el Upworthy Research Archive, el dataset abierto más grande de pruebas A/B disponible hoy. Contiene CTRs de variantes de titulares de noticias en miles de experimentos.

Le pidieron a gpt-4o-mini predecir la CTR de un usuario típico para cada titular, por separado para tratamiento y control. Luego metieron esas predicciones crudas en un análisis experimental estándar.

Resultado: recuperaron solo el 39% del efecto de tratamiento humano observado.

Si trataras esas predicciones como datos humanos, concluirías que los tratamientos son menos de la mitad de efectivos de lo que realmente son. Esto no es ruido aleatorio — el sesgo es sistemático y direccional. Las salidas de LLM atenúan los efectos de tratamiento hacia el cero, haciendo que los tratamientos parezcan más débiles. Escala eso en una organización de producto y tomas decisiones de ship equivocadas.

Dos condiciones que hacen válidos a los surrogates de LLM

El paper formaliza exactamente dos condiciones bajo las cuales las predicciones de LLM pueden identificar un efecto promedio de tratamiento humano:

  1. Surrogacy. La salida del LLM debe mediar completamente el efecto del tratamiento sobre el desenlace humano. Después de condicionar en la predicción del LLM y en covariables de baseline, la asignación de tratamiento no te dice nada adicional sobre lo que haría el usuario. En español claro: el LLM captura todo sobre el tratamiento que importa para la respuesta humana. Esto se asume todo el tiempo, rara vez se declara y casi nunca se valida.
  2. Comparabilidad. La función de calibración — el mapeo de predicciones de LLM a desenlaces humanos — debe permanecer estable entre el nuevo experimento y los datos históricos usados para ajustarla. Si ese mapeo cambia cuando cambia el tratamiento, la calibración se rompe.

Cuando ambas se cumplen, calibrar salidas de LLM contra datos reales de pruebas A/B recupera el efecto humano. Cuando cualquiera falla, la estimación está sesgada — y no por falta de datos. Incluso con infinitas predicciones de LLM, solo recuperarías el efecto sobre el LLM, no sobre usuarios.

Developer prompting GPT-4o-mini to predict click-through rates for headline variants in an A/B testing pipeline Development Concept Image

La calibración solo funciona con el método correcto

No todos los métodos de calibración son iguales. El equipo probó dos en Upworthy:

MétodoResultadoVeredicto
Calibración lineal (OLS)3.8 errores estándar del benchmark humano❌ Demasiado rígida — falló el test de falsificación
Random Forest / Gradient-Boosted TreesDentro del error muestral del efecto humano✅ Suficientemente flexible para aprender el mapeo no lineal

La lección: la calibración lineal no captura la relación no lineal entre predicciones de LLM y comportamiento humano. Los modelos ML basados en árboles sí.

El problema del ruido por temperatura

Una sola predicción de LLM es ruidosa por la temperatura de sampling — la aleatoriedad en la generación de tokens. Si no la tomas en cuenta, esa aleatoriedad sesga la estimación del efecto hacia el cero e infla su varianza. La corrección, tomada de la teoría de error de medición: generar varias salidas del LLM por unidad experimental y promediarlas. El ruido se cancela, queda la señal.

La limitación real: intervenciones futuras

Aquí viene la parte incómoda. Surrogacy y comparabilidad pueden evaluarse parcialmente en datos históricos — pero nunca pueden probarse para un tratamiento que aún no has testeado.

Esto crea una paradoja brutal:

  • Mientras más se aleja un tratamiento nuevo de los experimentos pasados, más débil es la base para confiar en la salida del LLM.
  • Para intervenciones genuinamente nuevas — un nuevo paradigma de UI, un nuevo modelo de precios, una feature distinta a todo lo que has shipeado — las suposiciones son inherentemente no testeables.
  • El escenario donde el LLM ofrece más beneficio es justo donde tiene menos probabilidad de funcionar.

Los experimentos humanos siguen siendo indispensables para la verdadera innovación de producto.

Por qué Upworthy es un caso casi ideal (y engañoso)

Upworthy es casi demasiado favorable: desenlace binario (clic / no clic), tratamientos basados en texto lingüísticamente similares (variantes de titulares), y LLMs entrenados en montañas de texto sobre qué hace que un titular enganche.

Para tratamientos que cambian layout, algoritmo o precios, las condiciones necesarias son mucho más difíciles de justificar. No hay evidencia empírica de que las condiciones se cumplan en general — a través del portafolio de innovaciones de una empresa — como se necesitaría para usar pruebas A/B con LLM a escala.

La calibración necesita los datos que quieres evitar recolectar

El framework no elimina los experimentos con usuarios. Solo muestra que puedes reducir cuántos necesitas — y solo cuando los nuevos experimentos se parecen a los ya corridos, dejando que la extrapolación llene el hueco. La inversión inicial en respuestas reales de usuarios no es opcional; es lo que hace confiables a las pruebas A/B con LLM.

El model drift rompe la calibración

Otra complicación: cualquier función de calibración se ajusta a un modelo específico en un momento específico. Los proveedores de LLM actualizan y reemplazan modelos todo el tiempo. Una calibración aprendida hoy puede ser inválida en seis meses — incluso para el mismo modelo. Los avances en predicción de LLM no son una salida a la validación humana.

Server cluster running calibration models against the Upworthy Research Archive dataset for treatment effect estimation Algorithm Concept Visual

Palabra final: por diseño vs. por suposición

Los experimentos con usuarios funcionan por diseño. Los experimentos basados en LLM funcionan por suposición.

Como toda métrica proxy, los surrogates de LLM funcionan hasta que la relación entre proxy y desenlace cambia. El framework de surrogacy hace esa relación explícita, testeable, y clara sobre sus consecuencias cuando falla. No puede garantizar que la relación se cumpla para el experimento que más te importa — el que testea algo nuevo.

Dicho eso, las predicciones de LLM pueden mejorar los experimentos humanos:

  • Filtrar ideas débiles antes de que consuman un slot de experimento.
  • Servir como covariables para reducción de varianza.
  • Mejorar selección y eficiencia cuando tienes historial fuerte y el nuevo tratamiento se parece a los pasados.

Sustituirlas por desenlaces humanos es otra jugada. Cambia identificación por diseño por identificación por suposición. No regales eso.

Próximos pasos

  • Estudia teoría de surrogate endpoint en bioestadística — es el modelo mental más limpio para validez de métricas proxy.
  • Profundiza en teoría de error de medición para entender por qué promediar varias muestras de LLM importa.
  • Si corres experimentos a escala, checa reducción de varianza vía ajuste de covariables — es la forma de bajo riesgo de usar señal de LLM sin soltar la identificación.

Lee también

Este contenido fue redactado con la asistencia de herramientas de IA, basándose en fuentes confiables, y fue revisado por nuestro equipo editorial antes de su publicación. No reemplaza el asesoramiento de un profesional especializado.