Baseline
PreciosEmpieza gratis

Reduce las alucinaciones de IA antes de que lleguen a tus clientes

Una alucinación es una respuesta que tu IA da con seguridad y que simplemente no es cierta. No puedes impedir que un modelo cometa alguna, pero sí puedes medir con qué frecuencia ocurre, detectar las nuevas antes de lanzarlas y bajar la tasa de forma constante. Baseline te da la rúbrica, las comprobaciones programadas y el ciclo de optimización para hacer justo eso.

Qué es y por qué importa

Las alucinaciones son peligrosas porque son seguras. El modelo no marca la respuesta como una suposición, así que un precio equivocado, una política inventada o una cita falsa se leen exactamente igual que una respuesta correcta. Cuando un cliente se da cuenta, el daño ya está hecho.

Reduces las alucinaciones como arreglas cualquier problema de calidad que no puedes ver: lo haces medible. Define cómo es una respuesta fundamentada y exacta, puntúa resultados reales según esa definición, y «¿con qué frecuencia se inventa cosas nuestra IA?» se convierte en un número que puedes vigilar en lugar de una sensación que discutir.

Una vez medida la tasa, puedes actuar sobre ella. Las comprobaciones programadas detectan un nuevo repunte el día en que cambia un prompt o un modelo, y una pasada de optimización reescribe los prompts que producen más fallos. El número baja, y puedes demostrarlo.

Míralo en Baseline, paso a paso

  1. Redacta criterios que premien las respuestas fundamentadas

    Da a la exactitud el mayor peso y detalla los pasos de puntuación: comparar con la respuesta esperada, penalizar los hechos inventados. El contexto de referencia entrega al juez el material de consulta contra el que comprobar las afirmaciones.

    Una rúbrica centrada en la exactitud en Baseline con pasos de puntuación que penalizan los errores factuales y las omisiones.
  2. Puntúa un lote real y ve dónde se desvía

    Ejecuta una evaluación sobre resultados reales. El desglose por fila muestra qué respuestas fallaron, y el razonamiento del juez nombra la afirmación exacta que costó los puntos.

    Razonamiento del juez en una ejecución de evaluación de Baseline que señala un detalle suavizado en una respuesta de soporte por lo demás exacta.
  3. Pon la comprobación en una programación

    Una programación nocturna o cada hora vuelve a puntuar resultados frescos de tu sistema en producción, así un repunte de respuestas inventadas sale a la luz en la siguiente ejecución.

    Una programación nocturna de Baseline que puntúa un agente de soporte en producción, con ejecuciones completadas en su historial.
  4. Baja la tasa y demuéstralo

    El panel muestra la tendencia de exactitud. Cuando baja, una ejecución de optimización busca prompts que mantengan el listón e informa de la recuperación como un número.

    Una tendencia de exactitud al alza en el panel de Baseline tras corregir los prompts.

Cómo lo hace Baseline

Rúbricas centradas en la exactitud

Criterios que premian las respuestas fundamentadas y verificables, ponderados para que la exactitud domine la puntuación general.

Contexto de referencia

Adjunta el material de consulta contra el que el juez comprueba las afirmaciones, así «verdadero» significa fiel a tus propios documentos y políticas.

Una tasa medida

Cada ejecución convierte un lote en un número, y el razonamiento por fila nombra cada hecho inventado que encontró.

Comprobaciones que no se detienen

Las programaciones vuelven a puntuar resultados en producción con una cadencia; un cambio de modelo o de prompt que empieza a fallar aparece en la siguiente ejecución.

Lo que obtienes

  • Pon un número real a la frecuencia con que tu IA se inventa cosas.
  • Ve las afirmaciones exactas que fallaron, con el razonamiento del juez.
  • Detecta un repunte en una sola ejecución programada desde que empieza.
  • Muestra la mejora de exactitud como una tendencia, con las pruebas en la mano.

Preguntas frecuentes

¿De verdad se puede impedir que un LLM alucine?
No del todo, y quien promete cero está exagerando. Lo que sí puedes hacer es medir la tasa, detectar pronto las regresiones y bajarla con mejores prompts y fundamento. Baseline está pensado para ese ciclo.
¿Cómo se mide algo tan difuso como una alucinación?
Defines cómo es una respuesta fundamentada y exacta en forma de criterios de rúbrica, y luego puntúas los resultados según ella. La preocupación difusa se convierte en un número que puedes seguir en el tiempo.
¿Qué hace que una rúbrica sea buena detectando alucinaciones?
Tres cosas: un resultado esperado con el que el juez pueda comparar, un contexto de referencia que aporte el material de consulta verdadero y pasos de puntuación que penalicen explícitamente los hechos inventados. El recorrido de arriba prepara las tres.