← Blog

· 6 min de lectura · Vibeboa

Cómo el Retrato dejó de cambiar la cara de las personas

La app devolvía a alguien parecido a usted, nunca usted. La culpa no era del prompt — eran tres decisiones de ingeniería, y la peor de ellas era mandar el modelo más débil al frente.

El Retrato hace una sola cosa: tú envías una foto, eliges una década o un estilo, y él devuelve la foto rehecha en ese lenguaje visual. Funcionaba — y devolvía siempre a alguien parecido a ti. Nunca a ti.

La sospecha obvia era el prompt. Pasé un buen tiempo escribiendo bloqueos de identidad cada vez más largos, enumerando rasgo por rasgo: formato del maxilar, distancia entre los ojos, color de la iris. Mejoró poco. La causa estaba en otro lugar.

Tres errores, ninguno de ellos en el texto

El primero: la fila de modelos comenzaba por el más débil. El flux-2-klein-4b es destilado con cuatro pasos fijos de inferencia — rápido y malo en preservar el rostro. El flux-2-dev acepta pasos y es el más fuerte del catálogo. Estaba pidiendo fidelidad al modelo que menos podía entregármela.

El segundo: la salida era 1024×1024 fijo. Una foto en retrato, 900×1200, era obligada a caber en un cuadrado. El modelo rediseña el rostro para encajar en el formato antes de que cualquier estilo entre. La semejanza moría allí, en la primera línea del pedido.

El tercero es el más interesante. El modelo acepta imagen de referencia de como máximo 512 px. Ese techo es duro y no se negocia. Pero él acepta CUATRO referencias — y yo mandaba una. Una foto de cuerpo entero reducida a 496 px entrega un rostro de tal vez noventa píxeles de lado. La información del rostro era descartada antes de salir del navegador.

Lo que cambió

Ahora va la escena entera en una referencia y un recorte cerrado de cada rostro en las otras, cada uno ocupando los 496 px solo, recortado de la foto en tamaño de trabajo y no de la versión reducida. Cuando el navegador tiene detector de rostro, son los rostos de verdad — y la foto con dos personas vuelve con las dos.

También saqué "two people" de la lista de negativos. Estaba borrando gente del cuadro.

El modelo más fuerte no venció

Con la fila invertida, el flux-2-dev se fue al frente. Y luego vino la medición que cambió la decisión de nuevo: se cobra POR PASO. A veinte pasos y un megapíxel, sale por alrededor de cuatro centavos de dólar por imagen — cerca de treinta veces el klein-4b. Y en prueba, dos veces, pasó de cuatro minutos sin responder.

modelotiempo mediocosto por imagen
flux-2-klein-9b3,6 sUS$ 0,0166
flux-2-dev (20 pasos)> 4 min sem resposta~US$ 0,041

El patrón se convirtió en el klein-9b, que es destilado en cuatro pasos, responde rápido y tiene calidad bien por encima del 4b. El dev se quedó atrás de un botón que dice "caprichar", con el costo escrito en la pantalla. Y cada modelo ganó plazo: modelo en nube no falla solo devolviendo error — a veces él simplemente no vuelve, y sin plazo la persona se queda mirando la pantalla por minutos para recibir nada.

La instrucción breve ganó a la larga

El último cambio fue deshacer mi propio trabajo. La receta detallada describía el medio con precisión de fotógrafo: película, lente, temperatura de color, defecto de emulsión. Cuanto más describía la imagen deseada, más el modelo entendía que tenía licencia para construir una imagen que cupiera en la descripción — y la persona es la primera cosa que reescribe para hacer que quepa.

La instrucción breve hace lo contrario: nombra el tema en una frase y gasta el resto del texto diciendo qué no puede cambiar. Es la forma que funciona en las herramientas de edición por conversación, y se ha convertido en el estándar. La instrucción detallada continúa en un botón, porque en cordel, azulejo y serigrafía la descripción del medio es justamente lo que salva.

La parte que el modelo no hace

Un modelo de difusión sabe imaginar una escena de 1987. No sabe reproducir lo que la química de una película, el tubo de una TV o la retícula de una impresión hacían con la señal de la imagen. Eso no es imaginación, es procesamiento de señal — y procesamiento de señal se hace con aritmética.

Entonces el trabajo se dividió. El modelo construye la escena; el navegador aplica el medio: curva, grano, halación, retícula de medio tono de verdad, línea de varredura, aberración cromática, error de registro entre chapas. Es lo que saca el resultado del territorio de "foto con filtro". Se puede desactivar y comparar sujetando un botón.

Medido en producción: 896×1184 de salida a partir de una foto 900×1200, tres referencias, 2,9 segundos. Antes era 1024×1024 forzado, una referencia, 35 segundos.