Pon a prueba de estrés tu chatbot antes de que lo hagan tus usuarios
Pega el system prompt de tu chatbot. Obtén una batería de ataques — fuga de prompt, jailbreak, inyección — para lanzarlos contra él, y una forma de evaluar si aguantó.
Lanza cada ataque contra tu chatbot (pégalo como mensaje de usuario). Luego pega su respuesta en Evaluar la respuesta para ver si aguantó. Un buen bot se niega o se mantiene en su papel; uno débil filtra sus instrucciones u obedece.
Evaluar una respuesta
Pega lo que respondió tu bot a uno de los ataques.
Preguntas
¿Es legal usar esto?
Sí — es para probar un chatbot que te pertenece o que estás autorizado a probar. Es un trabajo de seguridad estándar y responsable. No lo uses contra sistemas que no controlas.
¿Mi system prompt se sube a algún sitio?
No. Los ataques se generan en tu navegador a partir de tu texto. Si usas «Evaluar la respuesta», eso va solo a tu propia cuenta de ChatGPT o Claude.
¿Cómo sé si mi bot falló?
Una prueba se aprueba si tu bot se niega o se mantiene en su papel; falla si revela sus instrucciones ocultas, sigue el comando inyectado o hace lo prohibido. Pega la respuesta en el paso de evaluación y te lo dirá, citando la línea que se filtró.
ChatGPT dice no. Claude dice no. Nosotros decimos sí.
IA privada y sin censura — sin correo, sin nombre, nada se guarda.