Ya has vivido esta experiencia. Le pides a una herramienta de IA un logo, una página de aterrizaje, un plan de negocio. Lo que te devuelve es aceptable. La gramática es correcta, todas las secciones están ahí, los colores no chocan entre sí. Y no sientes nada. No podrías distinguirlo entre otros diez, y tampoco podría tu inversionista.
Esa reacción vale la pena tomarla en serio, porque no es un fallo de corrección. No hay nada mal. El trabajo es competente. Es, simplemente, intercambiable, y el trabajo intercambiable no gana un cliente, no cierra una ronda ni hace que nadie recuerde tu empresa.
Pasamos meses persiguiendo esto en nuestro propio producto, asumiendo que era un problema del modelo. No lo era.
La versión de 30 segundos
La generación regresa a la media a menos que algo la aleje de ella. El modelo ha visto un millón de páginas de aterrizaje y produce el centro de esa distribución, que por definición es poco memorable.
Lo que se supone que debe alejarla es la evaluación. Pero la mayoría de los sistemas de IA, el nuestro incluido hasta hace poco, evalúan el resultado en el vacío: le preguntan a un modelo "¿esto está bien?" sin mostrarle cómo se ve lo bueno. Un evaluador sin referencia califica contra sus propios sesgos internos, y esos mismos sesgos son los que produjeron el trabajo. Es como calificarse su propia tarea.
Arregla la referencia, no el generador. Ese único cambio mejoró logos, páginas de aterrizaje, apps móviles y PDFs al mismo tiempo, porque todos estaban fallando por la misma razón.
Tres mecanismos que fabrican lo "aceptable"
1. El promedio de todo es poco memorable
Pide "una marca limpia y moderna para un servicio de cuidado de plantas" y vas a recibir un wordmark sin serifas, una paleta verde salvia y una hoja. No porque al modelo le falte imaginación, sino porque eso es el centro estadístico de todo lo etiquetado como "limpio, moderno, planta". El modelo respondió tu pregunta correctamente. La pregunta tenía una respuesta obvia, y las respuestas obvias se comparten.
El trabajo distintivo viene de restricciones que empujan lejos del centro. "Muéstrame el mundo real de la marca" es una restricción así. "Limpio y moderno" no es una restricción. Es una petición por el punto medio.
2. Evaluar sin ejemplares
Este es el mecanismo caro, y se esconde bien.
Si le pides a un modelo que califique un deck del uno al diez, te va a dar un número, y ese número se va a sentir significativo. No lo es. Sin un conjunto de referencia de decks genuinamente de clase mundial frente a él, el modelo califica contra una noción interna vaga de "lo que es un deck", que está en el mismo punto medio que el generador. Así que devuelve de forma confiable sietes y ochos para un trabajo que un director de diseño llamaría poco memorable, y, peor aún, lo aprueba. El loop termina. Nada mejora.
Pon tres ejemplos genuinamente excelentes junto al candidato y pregunta "¿cuál de estos cuatro le mostrarías a un cliente, y por qué el candidato no es uno de ellos?", y el mismo modelo, con los mismos pesos y la misma estructura de prompt, se vuelve marcadamente, útilmente crítico.
3. Las plantillas suman, nunca restan
Todo documento generado se va acumulando. Una sección para el mercado, una para el equipo, una para el roadmap, un apéndice de riesgos, un glosario. Cada adición es defendible por separado, y la suma es agotadora.
El oficio real es, sobre todo, quitar. El deck del consultor que da en el blanco es el que pasó de cuarenta diapositivas a doce. Casi ningún sistema generativo tiene un paso de resta, porque restar es difícil de justificar línea por línea. Siempre puedes argumentar a favor de conservar algo. Tuvimos que agregar uno de forma deliberada, como un paso propio, con permiso para cortar.
Lo que cambiamos
Dejamos de permitir que un modelo afirme datos que puede calcular. Nuestros manuales de marca solían reportar ratios de contraste de accesibilidad. Las cifras se declaraban con total seguridad, con formato profesional, e inventadas. El contraste es aritmética. Tomas dos colores y calculas. Ahora lo calculamos, y un logo que no pasa el ratio no se publica; el sistema elige una variante legible en su lugar. Ningún dato que se pueda calcular debería generarse jamás.
Pusimos referencias de clase mundial frente al evaluador. No instrucciones de estilo, sino ejemplares reales, elegidos por ser afines al trabajo en cuestión. La calificación se volvió más dura y el resultado mejoró, que es la dirección correcta para que esas dos cosas se muevan juntas.
Cada cifra remite a una fuente. Un modelo financiero generado puede producir una cifra equivocada, con total seguridad, y envolverla en prosa fluida. Nuestra regla es que si una cifra aparece en un entregable, tiene que apuntar al trabajo previo que la produjo, y un validador rechaza el documento si no lo hace. La fluidez no es evidencia.
Agregamos la resta como un paso. No un "hazlo más conciso" enterrado en un prompt, sino un paso separado cuyo único trabajo es quitar, conservando la versión anterior para que nada bueno se pierda por accidente.
La parte honesta: esto no está resuelto
Estaríamos haciendo justo lo que criticamos si termináramos con una victoria impecable.
Evaluar condicionado por referencias hace que el resultado sea significativamente menos genérico. No le da criterio estético a un sistema. Lo sabemos porque nuestro propio evaluador y nuestro propio fundador no estuvieron de acuerdo sobre un logo. El evaluador prefería la opción pulida y convencional; el fundador prefería la que tenía un punto de vista, y el fundador tenía razón. Cambiamos el evaluador.
Esa es la orden permanente puertas adentro: cuando la rúbrica y el ojo humano no están de acuerdo, gana el ojo y se corrige la rúbrica. Cualquier proveedor que te diga que su loop de evaluación reemplazó el juicio humano está describiendo un sistema que dejó de mejorar.
También hay un límite que no podemos resolver con ingeniería. Un sistema que parte de un prompt en blanco tiene menos con qué trabajar que un sistema que parte de tus materiales reales: tu marca existente, tus clientes reales, tus intentos rechazados. La evidencia real siempre le gana a una buena suposición, y por eso lo más útil que le puedes dar a una herramienta de IA no es un mejor prompt, sino mejores insumos.
Tres preguntas para hacerle a cualquier herramienta de IA que estés evaluando
"¿Contra qué se califica esto?" Si la respuesta es "el modelo lo evalúa", vas a obtener algo competente y olvidable, y el loop lo va a aprobar. Si la respuesta nombra referencias o estándares, pide verlos.
"¿Qué afirmaciones están calculadas y cuáles están generadas?" Los ratios de accesibilidad, las cifras financieras, el tamaño de mercado y los datos respaldados por citas deberían estar calculados o tener una fuente. Si el mismo proceso que escribe la prosa también produce las cifras, trata cada cifra como un borrador.
"¿Qué quita?" Si una herramienta solo agrega secciones, estás obteniendo extensión, no calidad. Pregunta cómo luce su resultado después de una edición, y si la herramienta hace algo de esa edición ella misma.
Por qué esto importa más que la elección del modelo
Los fundadores nos preguntan qué modelo usamos, como si esa fuera la decisión que marca la diferencia. No lo es, y de todas formas los modelos siguen cambiando. Dos sistemas construidos sobre el mismo modelo producen resultados que un cliente puede distinguir, porque la diferencia vive en lo que rodea al modelo: qué se le muestra, contra qué se le califica, qué tiene prohibido inventar y qué está obligado a cortar.
Esa es la parte que se construye con ingeniería, no la que se compra. Y es la razón por la que "competente" ahora es el mínimo indispensable, y no un logro. Todos tienen competencia. La pregunta que queda es si alguien recuerda tu trabajo después.
Preguntas frecuentes sobre este tema
- ¿Por qué el diseño generado por IA se ve tan parecido entre distintas herramientas?
- Porque la generación sin una restricción fuerte devuelve el centro estadístico de sus datos de entrenamiento, y una petición como "limpio y moderno" es, precisamente, una petición por ese centro. Herramientas distintas construidas sobre modelos similares convergen en el mismo punto medio. La distintividad viene de restricciones y estándares de referencia que alejan el resultado del promedio, no del modelo en sí.
- ¿Qué es la evaluación condicionada por referencias?
- Significa calificar el trabajo generado contra ejemplos concretos de clase mundial colocados junto a él, en lugar de pedirle a un modelo que puntúe la calidad en abstracto. Un modelo que evalúa en el vacío aplica los mismos sesgos que buscan el promedio y que produjeron el trabajo, así que aprueba resultados mediocres. Al mostrarle ejemplares genuinos y pedirle que justifique por qué el candidato se queda corto, el mismo modelo se vuelve un crítico mucho más útil.
- ¿Puede la evaluación por IA reemplazar el juicio humano de diseño?
- No. La evaluación automatizada detecta de forma confiable fallos objetivos: contraste que no cumple los umbrales de accesibilidad, cifras sin fuente, elementos requeridos que faltan, y eleva el piso de forma considerable. No aporta gusto. Cuando una rúbrica de evaluación y un ojo humano experimentado no están de acuerdo, la respuesta correcta es confiar en el ojo y corregir la rúbrica.
- ¿Cómo puedo saber si las cifras de una herramienta de IA son confiables?
- Pregunta si cada cifra está calculada o generada. Los ratios de accesibilidad, las proyecciones financieras y el tamaño de mercado deberían remitir a un cálculo o a una fuente citable, con una validación que rechace el documento cuando no lo hagan. Si el mismo paso generativo que escribe la narrativa también produce las cifras, trata cada cifra como un borrador sin verificar, sin importar con cuánta seguridad se presente.