Documentation

TuneAPrompt audite la qualité de vos prompts IA, identifie leurs faiblesses et vous propose une version améliorée — prête à déployer.

Comment ça marche en 3 étapes

1
Collez votre prompt dans l'éditeur (system prompt, user prompt, ou les deux).
2
Lancez un audit — rapide (3 crédits), complet (5), Chat (1) ou enrichi avec vos données production (10).
3
Consultez le rapport : score sur 100, faiblesses détaillées, recommandations priorisées, et le prompt réécrit prêt à l'emploi.
💡
Vous n'avez besoin d'aucune clé API. Les crédits couvrent le coût du moteur d'évaluation.

Crédits et plans

Chaque audit consomme des crédits selon son type. Les crédits sont inclus dans votre abonnement, sans limitation de durée pour le plan Free.

Type d'auditCréditsCe que vous obtenez
Audit Chat1Score sur 6 critères + prompt amélioré pour chatbots
Audit rapide3Score sur 12 critères + faiblesses + recommandations
Audit complet5Tout l'audit rapide + prompt réécrit par l'IA
Audit enrichi Pro+10Audit complet croisé avec vos logs production réels

Dotation par plan

  • Free — 15 crédits à consommer sans limitation de durée.
  • Pro — 100 crédits / mois. Accès à l'audit enrichi, aux preuves production et aux golden datasets.
  • Team — 280 crédits partagés / mois. Jusqu'à 5 utilisateurs sur les mêmes projets.
  • Enterprise — Crédits illimités, SSO, SLA dédié.

Projets et prompts

L'application organise votre travail en trois niveaux : projet → prompt → analyse.

Projets

Un projet regroupe les prompts d'une même application ou d'un même client. Créez un projet depuis le bouton + dans la barre latérale. Vous pouvez y ajouter un nom, une société, des commentaires et des dates.

Prompts et versions

Chaque prompt dans un projet peut avoir plusieurs versions. Lorsque vous modifiez un prompt et cliquez Sauvegarder, une nouvelle version est créée automatiquement (v1, v2, v3…). Les versions précédentes sont conservées.

Pour créer une nouvelle version : cliquez le bouton +1 à côté du prompt dans la barre latérale (fork).

Analyses

Chaque fois que vous lancez un audit sur un prompt sauvegardé, le résultat est enregistré comme analyse. Vous retrouvez l'historique de toutes les analyses d'un prompt dans l'onglet Historique.

Vous pouvez aussi auditer un prompt sans le sauvegarder. Dans ce cas, enregistrez-le après l'audit : le résultat sera automatiquement attaché.

Audit rapide 3 crédits

L'audit le plus rapide. Idéal pour diagnostiquer un prompt existant ou vérifier une régression avant déploiement.

Ce qu'il produit

  • Score global de 0 à 100
  • Verdict : À conserver, À améliorer ou Refonte requise
  • Score par dimension (Fiabilité, Sécurité, Efficacité, Maintenabilité)
  • Liste des faiblesses avec conseil actionnable pour chacune
  • Recommandations priorisées (de la plus impactante à la moins urgente)
  • Évaluation du modèle cible (est-il adapté à la tâche ?)

Ce qu'il ne produit pas

Le prompt réécrit n'est pas inclus. Passez à l'Audit complet si vous voulez une version améliorée prête à l'emploi.

Audit complet 5 crédits

Tout l'audit rapide, plus le prompt réécrit par l'IA. C'est le mode le plus utilisé en développement quotidien.

Ce qu'il produit en plus

  • System prompt amélioré (si vous avez un system prompt)
  • User prompt amélioré (si vous avez un user prompt)
  • Explication de chaque modification apportée
Le prompt amélioré est visible dans l'onglet Prompt amélioré. Un clic suffit pour le copier dans le presse-papier.

Audit Chat 1 crédit

Spécialisé pour les prompts conversationnels (ChatGPT, Claude, Gemini, Mistral). Si vous avez un prompt que vous tapez directement dans une interface de chat — pas un system prompt d'application — c'est le bon mode.

Paramètres spécifiques

  • Chat utilisé (optionnel) : précisez la plateforme cible pour des conseils adaptés à ses spécificités.
  • Modèle cible (optionnel) : filtre les recommandations sur le modèle précis.
  • Objectif (optionnel) : contexte métier du prompt (ex. : « obtenir un plan marketing en une page »).

Critères évalués

6 critères adaptés au chat : clarté de l'intention, contexte fourni, format et longueur, cadrage / rôle / ton, découpage de la tâche, critères de réussite. Chacun est noté de 1 à 5 (ou N/A si le critère ne s'applique pas).

Audit enrichi 10 crédits Pro+

Croise l'analyse statique du prompt avec vos vraies données de production. Résultat : vous savez si vos faiblesses théoriques se produisent réellement chez vos utilisateurs.

Prérequis

Avoir chargé un fichier de preuves production ou un golden dataset (onglet Preuves ou Golden dans l'éditeur).

Ce qu'il produit en plus

  • Score statique vs score révisé par critère — le score peut monter ou baisser selon ce que montrent vos données.
  • Niveau de confiance (basse / moyenne / élevée) : basse = aucun cas production ne touche ce critère ; élevée = 3 cas ou plus.
  • Observation production : ce que vos données révèlent concrètement sur chaque critère.
  • Cas cités en référence : les identifiants des cas (ex. G-A04) qui justifient chaque score révisé.
  • Impact des recommandations : « résout X cas sur Y observés ».
💡
Si votre échantillon ne contient pas de cas adversariaux, les critères de sécurité ne sont pas révisés — leur score statique est conservé. C'est normal et indiqué explicitement dans le rapport.

Les 12 critères d'évaluation

Les audits rapide, complet et enrichi évaluent le prompt sur 4 dimensions et 12 critères pondérés.

DimensionPoidsCritères
Fiabilité35 % Pertinence, Cohérence, Anti-hallucination, Conformité format
Sécurité25 % Robustesse aux injections, Filtrage de contenu, Confidentialité
Efficacité20 % Adéquation modèle, Concision, Optimisation du caching
Maintenabilité20 % Lisibilité, Documentation, Testabilité

Chaque critère est noté de 1 à 5. Les critères non pertinents pour votre prompt reçoivent la mention N/A et ne sont pas comptabilisés dans le score global.

Variables du template

Si votre prompt contient des données injectées dynamiquement (entrée utilisateur, résultat RAG, sortie d'un autre modèle…), déclarez-les comme variables. L'audit en tient compte pour évaluer les risques de sécurité.

Syntaxes détectées automatiquement

TuneAPrompt détecte les patterns {{variable}} et {VARIABLE} dans votre prompt et vous propose de les créer en un clic. Vous pouvez aussi les ajouter manuellement.

Informations à renseigner par variable

  • Nom — identifiant de la variable (ex. USER_MESSAGE).
  • Source — d'où vient la valeur :
    • Saisie utilisateur libre — risque élevé (injection possible)
    • Saisie validée — risque moyen
    • Interne / système — risque faible
    • Résultat RAG — risque moyen (contenu externe)
    • Sortie LLM — risque moyen à élevé
  • Type — format attendu (texte, JSON, enum…).
  • Exemple — valeur de démonstration.

Preuves production

Fonctionnalité Pro+

Importez des logs de votre système en production pour enrichir les audits avec de vraies observations. C'est la fonctionnalité qui transforme un diagnostic théorique en analyse basée sur des faits.

Format attendu

Un fichier .jsonl (une ligne JSON par cas). Chaque cas doit contenir au minimum l'entrée utilisateur et la sortie du modèle. Vous pouvez annoter chaque cas avec une catégorie (nominal, cas_limite, adversarial) et une sévérité (basse, moyenne, haute, critique).

Comment charger des preuves

1
Ouvrez l'onglet Preuves dans l'éditeur.
2
Sélectionnez le type : Production ou Résultats golden.
3
Glissez votre fichier JSONL ou cliquez pour le sélectionner. Vous pouvez charger plusieurs fichiers — ils sont fusionnés automatiquement.
4
Activez les preuves (badge vert en haut de l'onglet). Le bouton Audit enrichi apparaît dans l'éditeur.

Modifier les cas après import

Depuis l'onglet Cas, vous pouvez consulter chaque cas, ajouter un feedback (note, commentaire, sortie attendue) et corriger la catégorie ou la sévérité. Les modifications sont sauvegardées directement.

Golden dataset

Fonctionnalité Pro+

Un golden dataset est une suite de tests de référence : des cas d'entrée pour lesquels vous savez exactement quel comportement attendre. Activez-le pour savoir si votre prompt passe vos tests avant chaque déploiement.

Créer ou importer un dataset

Importez un fichier YAML avec vos cas de test, ou créez-les directement dans l'interface (onglet Golden). Chaque cas comporte un identifiant unique, une catégorie, une sévérité et le comportement attendu.

Lancer les tests et analyser les résultats

1
Activez le dataset depuis l'onglet Golden.
2
Exécutez votre prompt sur les cas du dataset dans votre environnement, puis exportez les résultats en JSONL.
3
Importez les résultats via l'onglet Preuves (type : Résultats golden). Le système associe chaque résultat à son cas par identifiant.
4
Consultez le taux de réussite global, par catégorie (nominal / cas limite / adversarial) et par sévérité des échecs.

Historisation des runs

Sauvegardez chaque run comme snapshot daté. Comparez les runs successifs pour mesurer si vos améliorations font progresser le taux de réussite.

Bonne pratique : avant de déployer une nouvelle version de prompt, lancez les tests golden. Si le taux de réussite baisse, ne déployez pas.

Comparer deux analyses

L'onglet Comparer affiche deux résultats d'audit côte à côte pour visualiser les progrès (ou régressions) entre deux versions d'un prompt.

Comment comparer

1
Ouvrez l'onglet Comparer.
2
Sélectionnez l'analyse A puis l'analyse B depuis vos sauvegardes.
3
Le tableau affiche les scores par critère avec les deltas en vert (progression) ou rouge (régression).

Vous voyez aussi les scores globaux (ex. A = 78/100, B = 85/100, delta = +7) et le graphique radar superposé des deux analyses.

Historique

L'onglet Historique liste toutes vos analyses passées, de la plus récente à la plus ancienne. Pour chaque analyse : date, score, type d'audit, modèle cible et crédits consommés.

Cliquez n'importe quelle ligne pour recharger cette analyse dans le rapport.

Prompt amélioré

Disponible uniquement après un Audit complet ou Audit enrichi. L'onglet Prompt amélioré affiche la version réécrite par l'IA, directement copiable.

  • Si vous avez un system prompt et un user prompt, les deux apparaissent séparément.
  • Un bouton Copier copie le texte dans le presse-papier en un clic.
  • Le texte est mis en forme : les variables sont surlignées, les commentaires colorés.
⚠️
La version améliorée est une suggestion. Relisez-la avant de déployer — adaptez-la à votre contexte si nécessaire.

API externe

Pro+

Intégrez TuneAPrompt dans vos pipelines CI/CD ou vos outils internes via l'API REST.

Authentification

Passez votre token dans le header Authorization: Bearer <TOKEN>. Le token est disponible dans votre espace compte.

Endpoint principal

POST https://app.tuneaprompt.fr/api/external/analyze

Corps de la requête

{
  "prompt": "Votre prompt à évaluer",
  "chat_platform": "Claude.ai",        // optionnel
  "chat_objectif": "...",              // optionnel
  "chat_model": "claude-haiku-4-5",   // optionnel
  "max_tokens": 8192,                  // optionnel, défaut 8192
  "evaluator_provider": "anthropic"    // "anthropic" (défaut) ou "mistral"
}

Réponse

{
  "success": true,
  "data": { /* résultat structuré identique à l'interface */ },
  "usage": {
    "input_tokens": 1842,
    "output_tokens": 743,
    "model": "claude-haiku-4-5-20251001"
  }
}

Paramètre evaluator_provider

  • anthropic (défaut) — utilise Claude Haiku via l'API Anthropic.
  • mistral — utilise Mistral Small via l'API Mistral directe.
💡
L'API ne persiste aucune donnée : elle retourne le résultat de l'analyse mais ne le sauvegarde pas dans votre compte.