Baseline
TarifsCommencer gratuitement

Un test d'agents IA qui suit une cible mouvante

Un agent IA ne se contente pas de répondre à une question. Il franchit des étapes, appelle des outils et prend des décisions. C'est ce qui le rend puissant et difficile à tester, car ce que vous vérifiez change sans cesse à mesure que vous ajustez des prompts, changez de modèle ou ajoutez des outils. Baseline se connecte à votre agent, note ses sorties réelles selon une rubrique et relance cette vérification avec une planification pour que vous repériez une régression tant qu'elle est encore peu coûteuse à corriger.

Ce que c’est, et pourquoi c’est important

Tester un agent avec quelques prompts manuels vous dit qu'il a marché une fois, sur les cas que vous avez pensé à essayer. Les agents échouent sur les cas que vous n'avez pas testés : un outil renvoie quelque chose d'inattendu, un plan en plusieurs étapes dérape, une mise à jour du modèle modifie un comportement dont vous dépendiez.

Tester vraiment un agent vérifie le comportement, pas un seul instantané. Vous connectez Baseline à l'agent en marche, vous lui envoyez un lot d'entrées représentatives et vous notez les sorties réelles selon les critères que vous avez définis. « L'agent fait-il toujours son travail ? » devient une mesure que vous pouvez répéter.

Les agents dérivent à mesure que tout change autour d'eux, si bien qu'un test ponctuel devient vite obsolète. Une vérification planifiée continue de tester à la cadence choisie, si bien que le jour où un changement d'outil ou de modèle casse quelque chose, vous le voyez sur un tableau de bord au lieu de l'apprendre d'un utilisateur.

Voyez-le dans Baseline, étape par étape

  1. Connectez l'agent que vous exploitez vraiment

    Une connexion d'agent pointe Baseline vers votre endpoint en production : URL, en-tête d'authentification, un modèle de requête et le chemin de réponse vers la réponse. Les identifiants sont chiffrés au repos et déchiffrés uniquement côté serveur, au moment où Baseline appelle votre système.

    La création d'une connexion d'agent en production dans l'assistant de planification de Baseline, avec l'URL de l'endpoint, l'en-tête d'authentification et le modèle de corps de requête.
  2. Nommez le test et choisissez le standard

    L'assistant de planification vous guide à travers Bases, Système, Entrées, Cadence, Notifier et Vérification : choisissez la rubrique qui définit le travail bien fait et les entrées que Baseline envoie à l'agent.

    La première étape de l'assistant de planification dans Baseline, nommant une vérification nocturne des réponses au support et sélectionnant une rubrique.
  3. Laissez la cadence repérer la dérive

    À chaque échéance, Baseline invoque l'agent avec des entrées représentatives et note les sorties réelles. L'historique des exécutions transforme les changements d'outils, de modèle et de prompt en mouvements de score visibles.

    L'historique des exécutions d'une planification Baseline pour un agent de support en production, avec le score de chaque exécution et l'heure de la prochaine.

Comment Baseline procède

Connexions d'agent

Une définition réutilisable de la façon dont Baseline atteint votre agent : endpoint, authentification, modèle de requête, chemin de réponse. Les tests s'exécutent contre le vrai système, en direct.

Des identifiants gérés côté serveur

Les secrets de connexion sont chiffrés au repos et en transit, et déchiffrés uniquement quand le worker appelle votre système.

Exécutions de test planifiées

Une cadence de votre choix, de l'horaire au mensuel, avec des notifications de fin et d'échec aux collègues concernés.

Des sources de données aussi

Pointez une connexion de données vers PostHog ou une source personnalisée et notez le trafic que votre agent a déjà produit, sans aucun appel en direct.

Ce que vous obtenez

  • Testez le comportement réel de l'agent à une cadence régulière, sans intervention.
  • Repérez dès l'exécution suivante les régressions dues à un changement de modèle, de prompt ou d'outil.
  • Définissez « faire le travail » une fois, dans des termes que toute l'équipe a approuvés.
  • Notez le trafic de production historique aussi facilement que des invocations en direct.

Questions fréquentes

En quoi tester un agent diffère-t-il de tester un seul prompt ?
Un agent franchit plusieurs étapes et utilise des outils, si bien que la sortie dépend de plus d'une réponse. Baseline note la sortie finale réelle de l'agent selon votre rubrique, et une planification continue de tester à mesure que l'agent change.
Baseline exécute-t-il mon agent à ma place ?
Il se connecte à votre agent comme une connexion d'agent et lui envoie des entrées représentatives, puis note ce qui revient. Vous gardez votre agent là où il est et Baseline le mesure.
Puis-je confier sans risque les identifiants d'API de mon agent à Baseline ?
Les secrets de connexion sont stockés chiffrés, jamais exposés au navigateur, et déchiffrés uniquement côté serveur au moment où Baseline appelle votre endpoint. Vous pouvez faire tourner ou supprimer les identifiants d'une connexion à tout moment.
Que se passe-t-il quand un test repère une régression ?
Vous voyez la baisse sur le tableau de bord, et la même rubrique peut piloter une exécution d'optimisation qui cherche de meilleurs prompts et prouve le rétablissement selon le même score.