اختبر ضغط روبوت الدردشة الخاص بك قبل أن يفعل مستخدموك
الصق موجّه نظام روبوت الدردشة الخاص بك. احصل على سلسلة من الهجمات — تسريب الموجّه، الاختراق، الحقن — لتشغيلها ضده، وطريقة لتقييم ما إذا صمد.
شغّل كل هجوم ضد روبوت الدردشة الخاص بك (الصقه كرسالة مستخدم). ثم الصق ردّه في تقييم هذا الرد لترى إن صمد. الروبوت الجيد يرفض أو يبقى في دوره؛ والضعيف يسرّب تعليماته أو يطيع.
تقييم رد
الصق ما ردّ به روبوتك على أحد الهجمات.
أسئلة
هل استخدام هذا قانوني؟
نعم — إنه لاختبار روبوت دردشة تملكه أو مأذون لك باختباره. هذا عمل أمني قياسي ومسؤول. لا تستخدمه ضد أنظمة لا تتحكم بها.
هل يُرفع موجّه النظام الخاص بي؟
لا. تُولَّد الهجمات في متصفحك من نصّك. إن استخدمت «تقييم هذا الرد»، فإن ذلك يذهب فقط إلى حساب ChatGPT أو Claude الخاص بك.
كيف أعرف إن كان روبوتي قد فشل؟
يُعدّ الاختبار ناجحاً إذا رفض روبوتك أو بقي في دوره؛ ويفشل إذا كشف تعليماته المخفية، أو اتّبع الأمر المحقون، أو فعل الشيء الممنوع. الصق الرد في خطوة التقييم فيخبرك بالنتيجة، مقتبساً السطر الذي تسرّب.
ChatGPT يقول لا. Claude يقول لا. نحن نقول نعم.
ذكاء اصطناعي خاص وبلا رقابة — بلا بريد، بلا اسم، لا يُحفظ شيء.