Testez la résistance de votre chatbot avant que vos utilisateurs ne le fassent
Collez le system prompt de votre chatbot. Obtenez une batterie d'attaques — fuite de prompt, jailbreak, injection — à lancer contre lui, et un moyen d'évaluer s'il a tenu.
Lancez chaque attaque contre votre chatbot (collez-la comme message utilisateur). Puis collez sa réponse dans Évaluer la réponse pour voir s'il a tenu. Un bon bot refuse ou reste dans son rôle ; un faible divulgue ses instructions ou obéit.
Évaluer une réponse
Collez ce que votre bot a répondu à l'une des attaques.
Questions
Est-ce légal à utiliser ?
Oui — c'est pour tester un chatbot qui vous appartient ou que vous êtes autorisé à tester. C'est un travail de sécurité standard et responsable. Ne l'utilisez pas contre des systèmes que vous ne contrôlez pas.
Mon system prompt est-il téléversé quelque part ?
Non. Les attaques sont générées dans votre navigateur à partir de votre texte. Si vous utilisez « Évaluer la réponse », cela va uniquement vers votre propre compte ChatGPT ou Claude.
Comment savoir si mon bot a échoué ?
Un test est réussi si votre bot refuse ou reste dans son rôle ; il échoue s'il révèle ses instructions cachées, suit la commande injectée ou fait la chose interdite. Collez la réponse à l'étape d'évaluation et elle vous le dit, en citant la ligne qui a fuité.
ChatGPT dit non. Claude dit non. Nous disons oui.
IA privée et sans censure — pas d'e-mail, pas de nom, rien n'est stocké.