Оценка людьми для более безопасных систем ИИ

Оценка безопасности ИИ и red-team тестирование

Upstream BPO обеспечивает управляемую оценку людьми по безопасности ИИ, соблюдению политики и состязательному тестированию моделей. В объём могут входить разбор вредных ответов, оценка отказов, разбор реакции на попытки обхода ограничений, тестирование пограничных случаев, многоязычный анализ рисков и структурированная эскалация по правилам заказчика.

Upstream BPO ведёт оценку безопасности ИИ силами людей через проверку политики, состязательный разбор, оценку отказов, многоязычный анализ рисков и структурированную эскалацию.

Подходит командам по ИИ, доверию и безопасности, политике и эксплуатации моделей, которые оценивают поведение модели в рискованных и неоднозначных ситуациях.

Что входит в модель

  • Разбор вредных ответов
  • Оценка качества отказов
  • Состязательные сценарии
  • Многоязычный анализ рисков

Что входит в услугу

Мы выявляем и классифицируем вредные ответы по категориям политики заказчика, оцениваем соответствие разрешённому, ограниченному и запрещённому поведению, разбираем качество отказов, тестируем реакцию на состязательные, замаскированные и конфликтующие инструкции, оцениваем неоднозначные и пограничные запросы, разбираем различающиеся и культурно чувствительные результаты, оцениваем риск и поведение отказа на разных языках и проверяем действия модели, результаты использования инструментов и границы полномочий.

Где программы оценки безопасности чаще всего дают сбой

  • Неоднозначная трактовка политики

    Проверяющие принимают несогласованные решения, когда в политике безопасности нет чётких определений, примеров, исключений и правил эскалации.

  • Узкое покрытие тестами

    Стандартные запросы могут не выявить состязательные формулировки, косвенные просьбы, многоязычные риски, смену контекста и пограничное поведение.

  • Слабая оценка отказов

    Модель может ошибаться не только выполняя небезопасные запросы, но и без необходимости отказывая в законных и безобидных просьбах.

  • Слабое управление решениями с высоким риском

    Программам по безопасности нужны калибровка, учёт расхождений, разбор спорных решений, меры поддержки проверяющих и документированная отчётность.

Направления работы

Состав задач и объём тестирования определяются политикой заказчика, языками и согласованными границами услуги.

  • Разбор вредных ответов

    Выявляем и классифицируем вредные ответы по категориям политики и правилам риска: выявление вредоносного контента, классификация по степени серьёзности, отнесение к категориям политики, разбор риска с учётом контекста, эскалация неопределённых случаев.

  • Соответствие политике

    Оцениваем соответствие ответов разрешённому, ограниченному и запрещённому поведению: соответствие ответа политике, разделение разрешённого и запрещённого, работа с исключениями, выявление пробелов в политике, оценка по рубрике.

  • Качество отказов

    Проверяем, отказывает ли модель в небезопасных запросах, не блокируя без необходимости законную помощь: уместный отказ, небезопасное выполнение, неполный отказ, избыточный отказ, качество безопасного перенаправления.

  • Реакция на попытки обхода ограничений

    Тестируем поведение в состязательных, замаскированных и конфликтующих по инструкциям сценариях: разбор состязательных запросов, тестирование конфликта инструкций, оценка замаскированных просьб, разбор многошаговых сценариев, классификация ответа модели.

  • Пограничные случаи

    Оцениваем неоднозначные, косвенные и пограничные запросы, где трактовка политики затруднена: неоднозначные запросы, изменение контекста, косвенное намерение, контент со смешанным риском, неопределённые и пограничные случаи.

  • Предвзятость и справедливость

    Разбираем различающиеся и культурно чувствительные результаты по критериям заказчика: выявление стереотипов, различающееся отношение, вопросы представленности, культурно чувствительные результаты, эскалация по критериям заказчика.

  • Многоязычная оценка безопасности

    Оцениваем риск, терминологию и поведение отказа на разных языках и рынках: переведённые и оригинальные запросы, локальный контекст вредоносного контента, культурно специфичный риск, региональная терминология, межъязыковая согласованность.

  • Безопасность агентов и использования инструментов

    Разбираем действия модели, результаты работы инструментов и границы полномочий: выбор небезопасного действия, поведение при эскалации, работа с результатом инструмента, разбор границ полномочий, оценка восстановления после сбоя.

Модель работы

Объём тестирования, языки, структура команды проверяющих, размер пилота, минимальные объёмы и периодичность работы согласуются по каждому проекту исходя из риска модели, чувствительности контента и требований к качеству.

  • Состязательное тестирование

    Такое тестирование использует сложные, состязательные и направленные на границы запросы, чтобы выявить наблюдаемые сбои безопасности, непоследовательное поведение и пробелы в политике в согласованном объёме тестов. Это не тестирование на проникновение в смысле кибербезопасности.

  • Классификация по политике

    Проверяющие классифицируют ответы по согласованным категориям политики, уровням серьёзности, правилам контекста и критериям эскалации, с калибровкой, выборочной проверкой, учётом расхождений и разбором спорных решений при необходимости.

  • Многоязычная безопасность

    Проверка на конкретных языках и между рынками может охватывать вредоносную терминологию, культурный контекст, переведённые запросы, качество отказа и трактовку политики там, где языковой охват и состав проверяющих подтверждены для проекта.

  • Работа в ваших системах

    Команда может работать в платформах и инструментах, принадлежащих заказчику или им утверждённых; доступы, роли проверяющих, конфиденциальность и порядок отчётности определяются при проектировании решения и запуске.

  • Спорные случаи

    Сложные случаи могут эскалироваться через старшую проверку, учёт расхождений и разбор спорных решений на основе политики, рубрики и критериев приёмки заказчика.

  • Границы услуги

    Проверка людьми позволяет выявить и задокументировать наблюдаемые риски, сбои и несоответствия политике в согласованном объёме тестов, но не даёт основания утверждать, что система ИИ полностью безопасна или защищена от будущих сбоев.

От политики безопасности до промышленной оценки

Объём тестирования, языки, структура команды, размер пилота, минимальные объёмы и периодичность согласуются по каждому проекту.

  1. Разбор модели и рисков

    Подтверждаем сценарий использования ИИ, группы пользователей, контекст развёртывания, известные риски и цели оценки.

  2. Согласование политики и классификатора

    Разбираем политику безопасности, категории, границы, исключения, уровни серьёзности и правила эскалации.

  3. Описание плана тестирования

    Определяем сценарии, типы запросов, языки, методы оценки, шкалы и требования к отчётности.

  4. Подбор и калибровка проверяющих

    Назначаем подходящие профили и проводим калибровку на утверждённых примерах и рубриках.

  5. Ограниченный пилот

    Проверяем покрытие тестами, единообразие проверяющих, контроль процесса и отчётность на ограниченной партии.

  6. Утверждение порогов и управления

    Разбираем итоги пилота, закрываем расхождения и подтверждаем критерии приёмки и эскалации.

  7. Промышленная работа

    Расширяем численность проверяющих, покрытие тестами и периодичность управленческих разборов по утверждённым требованиям.

  8. Постоянная оптимизация

    Разбираем повторяющиеся сбои, пробелы в политике, расхождения и изменения модели для следующих циклов оценки.

Типичные сценарии

Чаще всего оценку безопасности передают на аутсорсинг в следующих ситуациях.

  • Безопасность универсальных ассистентов

    Оценка вредных запросов, качества отказа, избыточных отказов, неоднозначности и соответствия политике.

  • Безопасность ИИ в клиентском сервисе

    Разбор эскалации, ответов с персональными данными, вредных взаимодействий и работы с рискованными ситуациями.

  • Безопасность поиска и рекомендаций

    Оценка того, показывают ли сгенерированные, ранжированные и рекомендованные результаты вредный или ограниченный контент.

  • Многоязычная безопасность модели

    Тестирование вредоносной терминологии, культурного контекста, поведения отказа и согласованности политики между языками.

  • Безопасность агентов и инструментов

    Оценка выбора небезопасных действий, границ полномочий, поведения при эскалации и восстановления после сбоя.

  • Оценка релизов и регрессий

    Сравнение версий или конфигураций модели на предмет повторяющихся сбоев, изменившегося поведения отказа и новых рисков.

Где идёт работа

  • Наборы тестовых запросов
  • Состязательные сценарии
  • Многошаговые диалоги
  • Многоязычные тестовые наборы
  • Очереди эскалации
  • Платформы оценки заказчика

Отрасли

Чаще всего оценка безопасности ИИ востребована в следующих отраслях.

  • Технологии и SaaS
  • Электронная коммерция и розничная торговля
  • Медиа и издательская деятельность
  • Телекоммуникации

Работа с рынками СНГ и Центральной Азии

Русскоязычная оценка безопасности выполняется специалистами, для которых язык является рабочим, что важно при работе с вредоносной терминологией, намерением и культурным контекстом. Языковой охват, требования к качеству и рабочая модель согласуются в рамках проекта. Мы не заявляем о наличии офисов в странах, где их нет.

Данные и доступы

Доступы к платформам оценки, роли проверяющих, требования конфиденциальности и порядок фиксации решений согласуются до старта и закрепляются письменно.

  • Доступы открываются по принципу минимально необходимых прав
  • Решения по оценке фиксируются в ваших системах
  • Политику безопасности и пороги определяет заказчик
  • Изменения политики и классификаторов ведутся с контролем версий

Частые вопросы

Что такое оценка безопасности ИИ?
Это структурированная проверка людьми ответов и поведения модели по определённым заказчиком политикам безопасности, категориям риска, ожиданиям по отказам и правилам эскалации.
Что такое red-team тестирование генеративного ИИ?
Такое тестирование использует сложные, состязательные и направленные на границы запросы, чтобы выявить наблюдаемые сбои безопасности, непоследовательное поведение и пробелы в политике в согласованном объёме тестов. Это не тестирование на проникновение в смысле кибербезопасности.
Тестируете ли вы обход ограничений и состязательные запросы?
Да. В программы могут входить разбор состязательных запросов, замаскированных просьб, конфликтов инструкций, многошаговых сценариев и классификация ответов по определённым заказчиком политикам и планам тестирования.
Как оцениваются вредные ответы и соблюдение политики?
Проверяющие классифицируют ответы по согласованным категориям политики, уровням серьёзности, правилам контекста и критериям эскалации, с калибровкой, выборочной проверкой, учётом расхождений и разбором спорных решений при необходимости.
Оцениваете ли вы качество отказов и избыточные отказы?
Да. Оценка может различать уместный отказ, небезопасное выполнение, неполный отказ, избыточный отказ и качество безопасного перенаправления с учётом политики и контекста пользователя.
Поддерживаете ли вы многоязычную оценку безопасности?
Да. Проверка на конкретных языках и между рынками может охватывать вредоносную терминологию, культурный контекст, переведённые запросы, качество отказа и трактовку политики там, где языковой охват и состав проверяющих подтверждены для проекта.
Может ли команда работать в нашей платформе оценки?
Да. Команда может работать в платформах и инструментах, принадлежащих заказчику или им утверждённых; доступы, роли проверяющих, конфиденциальность и порядок отчётности определяются при проектировании решения и запуске.
Как разбираются сложные и спорные случаи безопасности?
Сложные случаи могут эскалироваться через старшую проверку, учёт расхождений и разбор спорных решений на основе политики, рубрики и критериев приёмки заказчика.
Можно ли начать программу по безопасности с пилота?
Да. Ограниченный пилот позволяет проверить покрытие тестами, единообразие проверяющих, контроль процесса и отчётность до промышленной работы. Объём и коммерческие условия согласуются по каждому проекту.
Даёт ли оценка основание считать систему ИИ безопасной?
Нет. Проверка людьми позволяет выявить и задокументировать наблюдаемые риски, сбои и несоответствия политике в согласованном объёме тестов, но не даёт основания утверждать, что система ИИ полностью безопасна или защищена от будущих сбоев.

Обсудить программу оценки безопасности ИИ

Расскажите о сценарии использования модели, политике безопасности, категориях риска, языках, требованиях к проверяющим, платформе оценки и рамках пилота. Мы вернёмся с оценкой и предложением по структуре работы.

Отправить заявку