Teste o estresse do seu chatbot antes que os seus utilizadores o façam
Cole o system prompt do seu chatbot. Obtenha uma bateria de ataques — fuga de prompt, jailbreak, injeção — para correr contra ele e uma forma de avaliar se aguentou.
Corra cada ataque contra o seu chatbot (cole-o como mensagem de utilizador). Depois cole a resposta dele em Avaliar a resposta para ver se aguentou. Um bom bot recusa ou mantém o papel; um fraco revela as instruções ou obedece.
Avaliar uma resposta
Cole o que o seu bot respondeu a um dos ataques.
Perguntas
É legal usar isto?
Sim — destina-se a testar um chatbot que lhe pertence ou que está autorizado a testar. É trabalho de segurança padrão e responsável. Não o use contra sistemas que não controla.
O meu system prompt é carregado para algum lado?
Não. Os ataques são gerados no seu navegador a partir do seu texto. Se usar «Avaliar a resposta», isso vai apenas para a sua própria conta do ChatGPT ou do Claude.
Como sei se o meu bot falhou?
Um teste passa se o seu bot recusar ou manter o papel; falha se revelar as instruções ocultas, seguir o comando injetado ou fizer o que é proibido. Cole a resposta no passo de avaliação e ele dir-lhe-á, citando a linha que vazou.
O ChatGPT diz não. O Claude diz não. Nós dizemos sim.
IA privada e sem censura — sem e-mail, sem nome, nada guardado.