Baseline
PreciosEmpieza gratis

Optimiza un prompt a mano, una ronda honesta a la vez

Puedes mejorar de forma real un prompt sin comprar nada. Congela un conjunto de pruebas real, puntúa el prompt actual con un conjunto fijo de criterios y luego entrega el trabajo de revisión a un asistente de IA que ya usas: cambia una cosa, vuelve a puntuar y conserva el cambio solo cuando el total sube. Repite el proceso varias veces y la mayoría de los prompts mejora de forma notable en una tarde. El coste real es tu tiempo, y saber exactamente cuándo ese coste deja de valer la pena.

Qué es y por qué importa

La mayoría de la gente mejora un prompt a ojo: cambia una frase, mira un par de resultados, decide que se ve mejor y sigue adelante. El problema es que en realidad no puedes saberlo. Sin una forma fija de medir «mejor», cada cambio es una suposición disfrazada de decisión.

La solución no requiere ningún software especial. Congela un conjunto real de casos de prueba para que el terreno nunca cambie bajo tus pies, escribe los criterios con los que juzgas, cambia exactamente una cosa a la vez y puntúa el resultado con los mismos casos y los mismos criterios en cada ronda. Esa disciplina, por sí sola, convierte el ajuste manual en algo en lo que realmente puedes confiar.

Lo verdaderamente tedioso es repetir ese ciclo una y otra vez: puntuar, detectar el patrón, revisar, volver a puntuar, comparar. Eso es trabajo mecánico, y es justo lo que un asistente de chat puede hacer por ti en cuanto le das las instrucciones correctas. Esta guía recorre todo el proceso de principio a fin, incluido el prompt exacto que debes entregarle.

Míralo en Baseline, paso a paso

  1. Congela un conjunto de pruebas

    Elige de 10 a 20 entradas reales, del tipo que tu prompt realmente tiene que manejar, no casos límite inventados. Para cada una, anota la salida esperada o, cuando no hay una única respuesta correcta, una descripción sencilla de cómo es una buena respuesta. Mantén este conjunto exactamente igual en todas las rondas que siguen; un objetivo que se mueve hace que cualquier puntuación pierda sentido.

  2. Puntúa el prompt actual con criterios por escrito

    Antes de cambiar nada, ejecuta el prompt actual con cada caso y puntúa cada resultado según un conjunto de criterios fijo y por escrito, no según una sensación. Una hoja de cálculo con una fila por caso y una columna por criterio funciona de verdad: escribe una puntuación y una razón de una línea en cada celda. Si prefieres un lugar dedicado para guardar y repetir estas puntuaciones, plataformas como LangSmith y Braintrust hacen el mismo trabajo. En cualquier caso, anota las puntuaciones antes de tocar el prompt, para tener un número real que superar.

  3. Entrega el ciclo a un asistente de IA

    La parte repetitiva, seguir las mismas instrucciones ronda tras ronda, es justo lo que un asistente de chat hace bien. Claude, ChatGPT, Copilot y Codex funcionan más o menos igual para esto; usa el que ya tengas a mano. Pega el bloque de abajo en un chat nuevo y responde a sus preguntas sobre tu prompt, tus casos de prueba y tus criterios.

    Me estás ayudando a mejorar manualmente un prompt de IA mediante rondas estructuradas de prueba y revisión. Así es como vamos a trabajar juntos:
    
    1. Pídeme tres cosas si aún no te las he dado: mi prompt actual, un conjunto de casos de prueba (cada uno con una entrada, más una salida esperada o una descripción sencilla de cómo es una buena respuesta), y los criterios con los que voy a juzgar las respuestas. Si falta algo, ayúdame a construirlo antes de empezar.
    2. En cuanto tengas el prompt, los casos de prueba y los criterios, pasa de inmediato a puntuar. No pidas más casos de prueba, no pidas pesos numéricos, no pidas ejemplos concretos si te di descripciones abstractas. Trabaja exactamente con lo que te he dado. Trata los casos de prueba abstractos o de tipo patrón como entradas válidas; interprétalos con sensatez y puntúa directamente contra ellos.
    3. Ejecuta el prompt actual con cada caso de prueba. Para cada caso, razona qué produciría probablemente el prompt y puntúalo según los criterios. Anota todas las puntuaciones en una tabla para tener una línea base clara.
    4. Revisa todos los casos puntuados y nombra el único patrón de fallo que aparece con más frecuencia: el que más puntos cuesta en todo el conjunto. No cada problema pequeño, solo el dominante.
    5. Haz exactamente un cambio enfocado en el prompt que ataque ese patrón. No reescribas todo el prompt. No arregles varias cosas a la vez.
    6. Puntúa el prompt revisado con los mismos casos de prueba y los mismos criterios exactos. Anota las nuevas puntuaciones en una tabla.
    7. Compara el nuevo total con la ronda anterior. Si mejoró, conserva la revisión y vuelve al paso 4. Si no mejoró, vuelve al mejor prompt anterior e intenta un ángulo distinto sobre el mismo patrón de fallo.
    8. Repite los pasos 4 a 7. Detente después de 5 rondas, o después de 2 rondas consecutivas sin mejora, lo que ocurra primero.
    9. Cuando termines, entrega las tres cosas siguientes sin esperar a que te las pida:
       - El prompt final completo, listo para copiar
       - Una tabla con la puntuación antes y después de cada caso de prueba en todas las rondas
       - Un resumen breve y en lenguaje sencillo de qué cambió y por qué ayudó
    
    Dos reglas para toda la sesión: no cambies nunca los casos de prueba una vez que empecemos, y juzga cada cambio por lo que hace al conjunto completo, nunca por si arregla un caso favorito a costa de los demás.
  4. Deja que itere, y revisa el trabajo tú mismo

    El asistente puntuará, revisará, volverá a puntuar y te informará ronda tras ronda. Lee sus números de antes y después en lugar de dar por buena su palabra sobre una mejora, y revisa tú mismo unas cuantas respuestas concretas. Una advertencia honesta: cuando el mismo asistente reescribe el prompt y puntúa el resultado, su propia puntuación tiende a volverse generosa con el tiempo. Mantén los criterios fijos y revisa a mano unas pocas respuestas cada dos rondas para detectarlo a tiempo.

  5. Repite hasta que las mejoras se acaben, y conoce el coste real

    La mayoría de los prompts tienen un puñado de mejoras genuinas por delante, y luego las rondas siguientes dejan de mover la puntuación. Esa es la señal para parar, no un número fijo de intentos. Calcula el tiempo con honestidad: una ronda completa, puntuar, una revisión, volver a puntuar y revisar a mano, suele llevar de veinte minutos a una hora, así que cinco o seis rondas son una tarde entera, no un arreglo rápido.

Cómo lo hace Baseline

Instancias congeladas

Tus 10 a 20 casos de prueba se convierten en un conjunto de instancias que quedan fijas durante toda la ejecución, la misma disciplina que mantenías a mano, aplicada automáticamente cada vez.

Puntuación basada en rúbrica

Tus criterios por escrito se convierten en una rúbrica, así que cada intento se puntúa de la misma forma con el mismo estándar, sin que tengas que rellenar ninguna celda de una hoja de cálculo.

Una ejecución de optimización explora muchas versiones a la vez

En lugar de una revisión enfocada por ronda, una ejecución de optimización prueba muchas versiones del prompt en paralelo con la misma rúbrica y conserva solo las que puntúan más alto de forma medible.

Una tarde se convierte en minutos

Toda la búsqueda, revisar y puntuar, se ejecuta sin supervisión en segundo plano mientras tu equipo hace otra cosa, y te devuelve el prompt ganador junto con la prueba.

Descubre cómo Baseline automatiza este proceso

Lo que obtienes

  • Consigue un prompt mejor de forma medible esta semana, con herramientas que ya tienes.
  • Convierte una idea vaga de «mejor» en una puntuación por escrito que puedes defender.
  • Aprende exactamente cuándo dejar de ajustar a mano y dejar que una búsqueda se encargue.
  • Llega a una ejecución automatizada ya familiarizado con el proceso que va a ejecutar por ti.

Preguntas frecuentes

¿ChatGPT o Claude pueden mejorar de verdad un prompt?
Sí, en la parte mecánica. Un asistente capaz puede puntuar un conjunto de respuestas con criterios fijos, detectar el problema recurrente más importante y reescribir el prompt para corregirlo, ronda tras ronda. Lo que no hará por su cuenta es mantenerse honesto sobre su propia puntuación, por eso mantienes fijos los casos de prueba y los criterios, y revisas su trabajo tú mismo.
¿Cuántos casos de prueba necesito en realidad?
Pocos casos reales superan a muchos casos inventados. De 10 a 20 entradas sacadas de uso real, que cubran los casos que de verdad fallan, te dicen más que 100 ejemplos sintéticos creados para parecer exhaustivos. El realismo importa más que el volumen.
¿Cómo sé que el nuevo prompt es realmente mejor, y no solo distinto?
Puntúalo con los mismos casos de prueba y los mismos criterios exactos que el original, y anota ambos números. Si el total sube en una medición fija, la mejora es real. Si no puedes señalar esa comparación, en realidad todavía no lo sabes.
¿Cuándo deja de bastar la optimización manual?
Cuando repites el mismo proceso en muchos prompts, necesitas que ocurra en una programación en lugar de una tarde, o quieres probar más revisiones por ronda de las que puedes puntuar a mano. Ahí es cuando una ejecución de optimización en Baseline retoma exactamente el proceso anterior y lo ejecuta sin supervisión, a una escala que una hoja de cálculo no puede seguir.