Reduce las alucinaciones de IA antes de que lleguen a tus clientes
Una alucinación es una respuesta que tu IA da con seguridad y que simplemente no es cierta. No puedes impedir que un modelo cometa alguna, pero sí puedes medir con qué frecuencia ocurre, detectar las nuevas antes de lanzarlas y bajar la tasa de forma constante. Baseline te da la rúbrica, las comprobaciones programadas y el ciclo de optimización para hacer justo eso.
Qué es y por qué importa
Las alucinaciones son peligrosas porque son seguras. El modelo no marca la respuesta como una suposición, así que un precio equivocado, una política inventada o una cita falsa se leen exactamente igual que una respuesta correcta. Cuando un cliente se da cuenta, el daño ya está hecho.
Reduces las alucinaciones como arreglas cualquier problema de calidad que no puedes ver: lo haces medible. Define cómo es una respuesta fundamentada y exacta, puntúa resultados reales según esa definición, y «¿con qué frecuencia se inventa cosas nuestra IA?» se convierte en un número que puedes vigilar en lugar de una sensación que discutir.
Una vez medida la tasa, puedes actuar sobre ella. Las comprobaciones programadas detectan un nuevo repunte el día en que cambia un prompt o un modelo, y una pasada de optimización reescribe los prompts que producen más fallos. El número baja, y puedes demostrarlo.
Míralo en Baseline, paso a paso
Redacta criterios que premien las respuestas fundamentadas
Da a la exactitud el mayor peso y detalla los pasos de puntuación: comparar con la respuesta esperada, penalizar los hechos inventados. El contexto de referencia entrega al juez el material de consulta contra el que comprobar las afirmaciones.

Puntúa un lote real y ve dónde se desvía
Ejecuta una evaluación sobre resultados reales. El desglose por fila muestra qué respuestas fallaron, y el razonamiento del juez nombra la afirmación exacta que costó los puntos.

Pon la comprobación en una programación
Una programación nocturna o cada hora vuelve a puntuar resultados frescos de tu sistema en producción, así un repunte de respuestas inventadas sale a la luz en la siguiente ejecución.

Baja la tasa y demuéstralo
El panel muestra la tendencia de exactitud. Cuando baja, una ejecución de optimización busca prompts que mantengan el listón e informa de la recuperación como un número.

Cómo lo hace Baseline
Rúbricas centradas en la exactitud
Criterios que premian las respuestas fundamentadas y verificables, ponderados para que la exactitud domine la puntuación general.
Contexto de referencia
Adjunta el material de consulta contra el que el juez comprueba las afirmaciones, así «verdadero» significa fiel a tus propios documentos y políticas.
Una tasa medida
Cada ejecución convierte un lote en un número, y el razonamiento por fila nombra cada hecho inventado que encontró.
Comprobaciones que no se detienen
Las programaciones vuelven a puntuar resultados en producción con una cadencia; un cambio de modelo o de prompt que empieza a fallar aparece en la siguiente ejecución.
Lo que obtienes
- Pon un número real a la frecuencia con que tu IA se inventa cosas.
- Ve las afirmaciones exactas que fallaron, con el razonamiento del juez.
- Detecta un repunte en una sola ejecución programada desde que empieza.
- Muestra la mejora de exactitud como una tendencia, con las pruebas en la mano.
Preguntas frecuentes
- ¿De verdad se puede impedir que un LLM alucine?
- No del todo, y quien promete cero está exagerando. Lo que sí puedes hacer es medir la tasa, detectar pronto las regresiones y bajarla con mejores prompts y fundamento. Baseline está pensado para ese ciclo.
- ¿Cómo se mide algo tan difuso como una alucinación?
- Defines cómo es una respuesta fundamentada y exacta en forma de criterios de rúbrica, y luego puntúas los resultados según ella. La preocupación difusa se convierte en un número que puedes seguir en el tiempo.
- ¿Qué hace que una rúbrica sea buena detectando alucinaciones?
- Tres cosas: un resultado esperado con el que el juez pueda comparar, un contexto de referencia que aporte el material de consulta verdadero y pasos de puntuación que penalicen explícitamente los hechos inventados. El recorrido de arriba prepara las tres.