Проверяли на размеченных наборах — около 3000 промптов по категориям атак и отдельный набор из 1000 промптов по персональным данным — с расчётом полноты, точности и доли ложных срабатываний, плюс калибровка порогов на валидационной выборке и регрессионные прогоны с наборами обходов перед релизами. По векторам:
- перефразирование закрывается тем, что работают семантические модели, а не списки фраз;
- multi-turn — тем, что проверяется вся история диалога, а не только последнее сообщение;
- base64, hex, rot13 и URL-кодирование декодируются перед проверкой, включая вложенные слои;
- невидимые символы, гомоглифы и смешение алфавитов — отдельной проверкой с выбором реакции;
- смешение языков — многоязычными моделями.