L'optimisation des prompts sans devinettes
L'optimisation des prompts permet d'obtenir un prompt nettement meilleur sans passer une semaine à retoucher des formulations en espérant. Baseline la traite comme une recherche. Elle génère et teste des variantes de prompt, note chacune selon votre rubrique et vous renvoie la version qui gagne de façon mesurable, preuve à l'appui.
Ce que c’est, et pourquoi c’est important
La plupart des équipes améliorent les prompts à la main : elles changent une phrase, testent quelques exemples, décident que c'est mieux et le lancent. C'est lent, ça ne passe pas l'échelle au-delà de deux ou trois prompts, et « c'est mieux » est justement ce jugement non mesuré que l'évaluation existe pour remplacer.
L'optimisation des prompts rend l'amélioration systématique. Le système explore de nombreux prompts candidats, note chacun selon les mêmes critères et garde ce qui performe vraiment. Elle transforme l'ingénierie de prompts, devinette d'une seule personne, en une recherche mesurée.
Un meilleur score vaut davantage quand vous pouvez le défendre. Quand un nouveau prompt dépasse la rubrique approuvée par votre équipe, vous pouvez le lancer en sachant que le gain est réel et montrer ce nombre à qui le demande.
Voyez-le dans Baseline, étape par étape
Pointez une exécution vers une rubrique et un agent
Choisissez la rubrique qui définit le succès, la connexion d'agent dont vous voulez améliorer le prompt et un budget d'essais. L'exécution fige un ensemble d'instances d'entrée dès le départ, si bien que chaque candidat est jugé sur un terrain identique.
Baseline cherche, note et garde les gagnants
L'exécution propose des variantes de prompt et teste chacune sur les entrées figées. Le mode réflexif lit le retour écrit du juge et réécrit avec intention ; le mode simple échantillonne des réécritures et garde les meilleurs scores.
Lancez le gain, preuve à l'appui
L'exécution indique les scores avant et après selon votre rubrique et place le prompt optimisé à côté du prompt de départ pour chaque module. Copiez-le quand vous êtes convaincu.

Comment Baseline procède
Exécutions d'optimisation
Pointez une exécution vers le prompt à améliorer, fixez un budget, et elle explore des candidats pendant que votre équipe fait autre chose.
Deux modes
Le mode simple échantillonne des réécritures notées et garde la meilleure, adapté aux tâches ciblées. Le mode réflexif apprend du retour écrit du juge, conçu pour les rubriques exigeantes.
Un gain prouvé
Chaque exécution indique les scores avant et après selon la rubrique même de votre évaluation, si bien que le gain est mesuré avant le lancement.
Des prompts que vous emportez avec vous
Les prompts gagnants figurent à côté de leur prompt de départ, par module, avec copie en un clic. Votre agent, votre prompt, votre décision.
Ce que vous obtenez
- Récupérez les semaines d'ingénierie passées à régler les formulations à la main.
- Laissez les experts métier piloter la qualité des prompts via la rubrique dont ils sont propriétaires.
- Lancez des changements de prompt avec le chiffre avant-après à l'appui.
- Transformez une évaluation ratée directement en un meilleur prompt.
Questions fréquentes
- En quoi est-ce différent d'un playground de prompts ?
- Un playground vous laisse essayer les prompts un par un et juger à l'œil. Une exécution d'optimisation teste de nombreux candidats pour vous et note chacun selon votre rubrique, si bien que le gagnant est celui qui performe de façon mesurable.
- Comment savoir si le nouveau prompt est vraiment meilleur ?
- Chaque exécution indique le score avant et après selon la rubrique même de votre évaluation et montre le prompt optimisé côte à côte avec le prompt de départ, si bien que vous passez en revue exactement ce qui a changé et ce que cela a apporté.
- Qu'est-ce qu'un module ?
- Un prompt nommé au sein de votre agent qu'une exécution peut améliorer séparément. Une connexion d'agent déclare ses modules ; une exécution les optimise un par un et rend compte de chaque prompt séparément.
- Qui peut lancer une optimisation ?
- Quiconque sait lire des résultats. L'expert propriétaire de la rubrique lance une exécution et passe en revue le gain prouvé, sans aucune expérience en ingénierie de prompts.