Baseline
PreciosEmpieza gratis

Optimización de prompts sin conjeturas

La optimización de prompts es la forma de conseguir un prompt notablemente mejor sin pasar una semana retocando palabras y cruzando los dedos. Baseline la trata como una búsqueda. Genera y prueba variaciones de prompt, puntúa cada una según tu rúbrica y te devuelve la versión que gana de forma medible, con la prueba adjunta.

Qué es y por qué importa

La mayoría de los equipos mejoran los prompts a mano: cambian una frase, prueban unos ejemplos, deciden que suena mejor y lo lanzan. Es lento, no escala más allá de un par de prompts, y «suena mejor» es justo ese juicio sin medir que la evaluación existe para sustituir.

La optimización de prompts hace sistemática la mejora. El sistema explora muchos prompts candidatos, puntúa cada uno según los mismos criterios y se queda con lo que de verdad rinde. Convierte la ingeniería de prompts de la intuición de una persona en una búsqueda medida.

Una puntuación mejor vale más cuando puedes defenderla. Cuando un prompt nuevo supera la rúbrica que tu equipo acordó, puedes lanzarlo sabiendo que la mejora es real y enseñar ese número a quien lo pregunte.

Míralo en Baseline, paso a paso

  1. Apunta una ejecución a una rúbrica y un agente

    Elige la rúbrica que define el éxito, la conexión de agente cuyo prompt quieres mejorar y un presupuesto de pruebas. La ejecución congela de antemano un conjunto de instancias de entrada, así cada candidato se juzga sobre el mismo terreno.

  2. Baseline busca, puntúa y se queda con los ganadores

    La ejecución propone variantes del prompt y prueba cada una contra las entradas congeladas. El modo reflexivo lee los comentarios escritos del juez y reescribe con intención; el modo simple muestrea reescrituras y se queda con las que mejor puntúan.

  3. Lanza la mejora, con la prueba adjunta

    La ejecución informa de las puntuaciones antes y después frente a tu rúbrica y coloca el prompt optimizado junto al de partida para cada módulo. Cópialo cuando estés convencido.

    Una ejecución de optimización completada en Baseline que muestra una mejora de puntuación del 74 % al 86 % y el prompt de partida junto a la versión optimizada.

Cómo lo hace Baseline

Ejecuciones de optimización

Apunta una ejecución al prompt que quieres mejorar, fija un presupuesto y explorará candidatos mientras tu equipo hace otra cosa.

Dos modos

El modo simple muestrea reescrituras puntuadas y se queda con la mejor, ideal para tareas acotadas. El modo reflexivo aprende de los comentarios escritos del juez, pensado para rúbricas exigentes.

Mejora demostrada

Cada ejecución informa de las puntuaciones antes y después sobre la misma rúbrica con la que evalúas, así la mejora se mide antes de lanzarla.

Prompts que te llevas contigo

Los prompts ganadores quedan junto a sus versiones de partida, por módulo, con copia en un clic. Tu agente, tu prompt, tu decisión.

Lo que obtienes

  • Recupera las semanas de ingeniería dedicadas a ajustar prompts a mano.
  • Deja que los expertos del dominio impulsen la calidad de los prompts mediante la rúbrica de la que son dueños.
  • Lanza cambios de prompt con el número de antes y después adjunto.
  • Convierte una evaluación fallida directamente en un prompt mejor.

Preguntas frecuentes

¿En qué se diferencia de un playground de prompts?
Un playground te ayuda a probar prompts de uno en uno y juzgar a ojo. Una ejecución de optimización prueba muchos candidatos por ti y puntúa cada uno según tu rúbrica, así que el ganador es el que rinde de forma medible.
¿Cómo sé que el nuevo prompt es realmente mejor?
Cada ejecución informa de la puntuación antes y después sobre la misma rúbrica con la que evalúas, y muestra el prompt optimizado junto al de partida, así revisas exactamente qué cambió y qué ganó.
¿Qué es un módulo?
Un prompt con nombre dentro de tu agente que una ejecución puede mejorar por su cuenta. Una conexión de agente declara sus módulos; una ejecución optimiza uno a la vez e informa de cada prompt por separado.
¿Quién puede lanzar una optimización?
Cualquiera que sepa leer resultados. La persona experta dueña de la rúbrica inicia una ejecución y revisa la mejora demostrada, sin necesidad de experiencia en ingeniería de prompts.