Teste deinen Chatbot unter Stress, bevor es deine Nutzer tun
Füge den System-Prompt deines Chatbots ein. Erhalte eine Reihe von Angriffen — Prompt-Leak, Jailbreak, Injection — um sie dagegen laufen zu lassen, und eine Möglichkeit zu beurteilen, ob er standhielt.
Lass jeden Angriff gegen deinen Chatbot laufen (füge ihn als Nutzernachricht ein). Füge dann seine Antwort ein in Die Antwort bewerten um zu sehen, ob er standhielt. Ein guter Bot lehnt ab oder bleibt in seiner Rolle; ein schwacher gibt seine Anweisungen preis oder gehorcht.
Eine Antwort bewerten
Füge ein, was dein Bot auf einen der Angriffe geantwortet hat.
Fragen
Ist die Nutzung legal?
Ja — es dient dem Testen eines Chatbots, der dir gehört oder den du testen darfst. Das ist standardmäßige, verantwortungsvolle Sicherheitsarbeit. Nutze es nicht gegen Systeme, die du nicht kontrollierst.
Wird mein System-Prompt hochgeladen?
Nein. Die Angriffe werden in deinem Browser aus deinem Text erzeugt. Wenn du „Die Antwort bewerten“ nutzt, geht das nur an dein eigenes ChatGPT- oder Claude-Konto.
Woran erkenne ich, ob mein Bot durchgefallen ist?
Ein Test ist bestanden, wenn dein Bot ablehnt oder in seiner Rolle bleibt; er fällt durch, wenn er seine verborgenen Anweisungen preisgibt, dem eingeschleusten Befehl folgt oder das Verbotene tut. Füge die Antwort in den Bewertungsschritt ein, und er sagt es dir und zitiert die durchgesickerte Zeile.
ChatGPT sagt Nein. Claude sagt Nein. Wir sagen Ja.
Private, unzensierte KI — keine E-Mail, kein Name, nichts gespeichert.