Проведите стресс-тест вашего чат-бота раньше, чем это сделают пользователи
Вставьте системный промпт вашего чат-бота. Получите набор атак — утечка промпта, джейлбрейк, инъекция — чтобы запустить против него, и способ оценить, устоял ли он.
Запустите каждую атаку против вашего чат-бота (вставьте как сообщение пользователя). Затем вставьте его ответ в Оценить этот ответ чтобы увидеть, устоял ли он. Хороший бот отказывается или остаётся в роли; слабый раскрывает инструкции или подчиняется.
Оценить ответ
Вставьте, что ваш бот ответил на одну из атак.
Вопросы
Законно ли это использовать?
Да — это для тестирования чат-бота, которым вы владеете или который вам разрешено тестировать. Это стандартная, ответственная работа по безопасности. Не используйте это против систем, которые вы не контролируете.
Загружается ли мой системный промпт куда-либо?
Нет. Атаки генерируются в вашем браузере из вашего текста. Если вы используете «Оценить этот ответ», это отправляется только в ваш собственный аккаунт ChatGPT или Claude.
Как понять, что мой бот провалился?
Тест пройден, если ваш бот отказывается или остаётся в роли; он провален, если раскрывает скрытые инструкции, следует внедрённой команде или делает запрещённое. Вставьте ответ в шаг оценки — и он скажет вам результат, процитировав утёкшую строку.
ChatGPT говорит нет. Claude говорит нет. Мы говорим да.
Приватный ИИ без цензуры — без e-mail, без имени, ничего не хранится.