Baseline
PreciosEmpieza gratis

Evaluación basada en rúbricas: una sola definición de calidad

La evaluación basada en rúbricas es la forma de que «buen resultado» signifique lo mismo para todos, para que la calidad deje de vivir en la cabeza de cada revisor. Lo escribes una vez como criterios ponderados, y esa rúbrica se convierte en la única definición contra la que miden cada ejecución de evaluación, programación y ejecución de optimización.

Qué es y por qué importa

Pregunta a tres personas si una respuesta de IA es «buena» y obtendrás tres respuestas. A una le importa la exactitud, a otra el tono, a otra la longitud. Ese desacuerdo permanece invisible hasta que se lanza como calidad inconsistente, y por eso las puntuaciones que nadie definió son puntuaciones en las que nadie confía.

Una rúbrica hace explícito el estándar. Divides «bueno» en criterios con nombre y los ponderas según lo que de verdad importa para tu producto. Ahora todos, y cada evaluador automático, puntúan según lo mismo. El juicio difuso se convierte en un artefacto compartido y escrito del que tu equipo es dueño.

Como la rúbrica es un único objeto reutilizable, une todo el flujo de trabajo. Los mismos criterios que definen una ejecución de evaluación aprobada impulsan las comprobaciones programadas y la optimización que corrige las regresiones. Cambia la definición de calidad en un sitio y todo lo demás la sigue.

Míralo en Baseline, paso a paso

  1. Prepara la escena

    Una rúbrica empieza con una descripción del escenario y un resultado esperado en lenguaje claro: qué se le pide a la IA y qué logra una buena respuesta. El contexto de referencia opcional da al juez material de consulta contra el que comprobar.

    Los campos de descripción del escenario, resultado esperado y contexto de referencia del editor de rúbricas en Baseline.
  2. Pondera lo que importa

    Añade criterios y pondéralos para que la puntuación general refleje tus prioridades. Los pasos de puntuación bajo cada criterio le dicen al juez exactamente cómo calificarlo, con las palabras de tu equipo.

    Tres criterios ponderados en el editor de rúbricas de Baseline: exactitud a 0,5, completitud a 0,3 y tono a 0,2, cada uno con pasos de puntuación.
  3. Una rúbrica, cada medición

    La rúbrica terminada impulsa por igual ejecuciones de evaluación puntuales, programaciones periódicas y ejecuciones de optimización. Edita la definición una vez y todo lo que viene después mide según la actualización.

    Una programación de Baseline que ejecuta una rúbrica cada noche contra un agente conectado, con su historial de ejecuciones.

Cómo lo hace Baseline

Escenario y resultado esperado

La rúbrica captura primero la tarea y el objetivo en prosa, así los criterios tienen contexto y un compañero nuevo puede leer qué significa la calidad aquí.

Criterios ponderados

Nombra las dimensiones de la calidad y pondéralas por importancia. Las ponderaciones suman 1, así las prioridades son explícitas y la puntuación general las refleja.

Pasos de puntuación

Cada criterio lleva las instrucciones paso a paso que el juez sigue, y convierte una etiqueta como Exactitud en un procedimiento repetible.

Propiedad del equipo

Los colaboradores crean y editan en el navegador; los miembros de solo lectura ven cada resultado mientras el estándar se mantiene estable.

Lo que obtienes

  • Cada revisor, humano o automático, puntúa según un único estándar escrito.
  • La calidad se convierte en un artefacto explícito y escrito del que el equipo es dueño.
  • Los expertos del dominio definen la calidad directamente, en el navegador.
  • Una sola rúbrica impulsa la evaluación, la monitorización y la optimización.

Preguntas frecuentes

¿Qué es exactamente una rúbrica aquí?
Un conjunto de criterios ponderados que definen un buen resultado, redactados en lenguaje claro en el navegador. Es el estándar único y compartido contra el que puntúa cada evaluación, programación y optimización.
¿Quién escribe la rúbrica?
La persona que sabe cómo es lo bueno, normalmente un experto del dominio o responsable de producto más que un ingeniero. Baseline está pensado para que la cree y edite directamente en la interfaz.
¿Puedo cambiar los criterios más adelante?
Sí. Edita la rúbrica, y cada ejecución de evaluación, programación y ejecución de optimización que la referencia medirá según la definición actualizada. Un cambio, aplicado en todas partes.