Pruebas de agentes de IA que siguen el ritmo de un objetivo en movimiento
Un agente de IA no solo responde a una pregunta. Da pasos, llama a herramientas y toma decisiones. Eso lo hace potente y difícil de probar, porque lo que estás comprobando cambia sin parar a medida que ajustas prompts, cambias de modelo o añades herramientas. Baseline se conecta a tu agente, puntúa sus resultados reales según una rúbrica y repite esa comprobación con una programación para que detectes una regresión cuando todavía es barata de arreglar.
Qué es y por qué importa
Probar un agente con unos cuantos prompts manuales te dice que funcionó una vez, en los casos que se te ocurrió probar. Los agentes fallan en los casos que no probaste: una herramienta devuelve algo inesperado, un plan de varios pasos se tuerce, una actualización del modelo cambia un comportamiento del que dependías.
Probar de verdad un agente comprueba el comportamiento, no una sola instantánea. Conectas Baseline al agente en marcha, le envías un lote de entradas representativas y puntúas los resultados reales según los criterios que definiste. «¿Sigue haciendo su trabajo el agente?» se convierte en una medición que puedes repetir.
Los agentes se desvían a medida que todo a su alrededor cambia, así que una prueba puntual caduca rápido. Una comprobación programada sigue probando con la cadencia que elijas, así el día en que un cambio de herramienta o de modelo rompe algo, lo ves en un panel en lugar de oírlo de un usuario.
Míralo en Baseline, paso a paso
Conecta el agente que ejecutas de verdad
Una conexión de agente apunta Baseline a tu endpoint en producción: URL, cabecera de autenticación, una plantilla de petición y la ruta de la respuesta hasta la contestación. Las credenciales se cifran en reposo y se descifran solo en el servidor, en el momento en que Baseline llama a tu sistema.

Ponle nombre a la prueba y elige el estándar
El asistente de programaciones te guía por Básicos, Sistema, Entradas, Cadencia, Avisos y Revisión: elige la rúbrica que define el trabajo bien hecho y las entradas que Baseline envía a través del agente.

Deja que la cadencia detecte la deriva
En cada ciclo, Baseline invoca al agente con entradas representativas y puntúa los resultados reales. El historial de ejecuciones convierte los cambios de herramientas, de modelo y de prompt en movimientos visibles de la puntuación.

Cómo lo hace Baseline
Conexiones de agente
Una definición reutilizable de cómo Baseline llega a tu agente: endpoint, autenticación, plantilla de petición, ruta de la respuesta. Las pruebas se ejecutan contra lo real, en producción.
Credenciales gestionadas en el servidor
Los secretos de la conexión se cifran en reposo y en tránsito, y se descifran solo cuando Baseline llama a tu sistema.
Ejecuciones de prueba programadas
Una cadencia que eliges, de cada hora a mensual, con avisos de finalización y de fallo para los compañeros a los que les importa.
También fuentes de datos
Apunta una conexión de datos a PostHog o a una fuente propia y puntúa el tráfico que tu agente ya produjo, sin ninguna llamada en vivo.
Lo que obtienes
- Prueba el comportamiento real del agente con una cadencia, sin mover un dedo.
- Detecta en la siguiente ejecución las regresiones de un cambio de modelo, prompt o herramienta.
- Define «hacer el trabajo» una vez, en términos que todo el equipo acordó.
- Puntúa el tráfico histórico de producción tan fácilmente como las invocaciones en vivo.
Preguntas frecuentes
- ¿En qué se diferencia probar un agente de probar un solo prompt?
- Un agente da varios pasos y usa herramientas, así que el resultado depende de más de una respuesta. Baseline puntúa el resultado final real del agente según tu rúbrica, y una programación sigue probando a medida que el agente cambia.
- ¿Baseline ejecuta mi agente por mí?
- Se conecta a tu agente como una conexión de agente y le envía entradas representativas, y luego puntúa lo que devuelve. Mantienes tu agente donde está y Baseline lo mide.
- ¿Es seguro darle a Baseline las credenciales de la API de mi agente?
- Los secretos de la conexión se guardan cifrados, nunca se exponen al navegador y se descifran solo en el servidor, en el momento en que Baseline llama a tu endpoint. Puedes rotar o eliminar las credenciales de una conexión en cualquier momento.
- ¿Qué pasa cuando una prueba detecta una regresión?
- Ves la bajada en el panel, y la misma rúbrica puede impulsar una ejecución de optimización que busca mejores prompts y demuestra la recuperación frente a la misma puntuación.