Методы и оценка

Как оценивать мультимодальную AI-детекцию

На странице описаны полезные группы сигналов, метрики оценки и открытые эталонные датасеты. Универсальная точность не заявляется, поскольку результат зависит от модели, образца, языка, преобразований и порога.

  • Текст
  • Изображения
  • Код
  • Голос и аудио
  • Видео

Группы сигналов по типам контента

Это распространённые категории сигналов для интерпретации результата и построения репрезентативных тестов. Ни один отдельный сигнал не доказывает авторство.

Сгенерированный текст

Какие сигналы изучать

Оценка текста может сочетать статистические признаки, результат классификатора и тесты устойчивости после редактирования и перефразирования.

Проверки

  • Вариативность предложений
  • Стилометрические признаки
  • Проверки на новых семействах моделей
  • Устойчивость к перефразированию
Что публиковать
AUROC, FPR, FNR, калибровка
Полезные доказательства
Сигналы по предложениям и контекст уверенности.
Эталонные образцы
Открытые корпуса и отложенные образцы

Сгенерированный код

Какие сигналы изучать

При оценке кода важно отделять типовой шаблонный код от связанных с генератором признаков и проверять изменения после ручной правки.

Проверки

  • Структура и идентификаторы
  • Комментарии и документация
  • Базовые линии для каждого языка
  • Устойчивость к ручной правке
Что публиковать
AUROC, FPR, FNR, калибровка
Полезные доказательства
Сигналы по функциям с контекстом репозитория.
Эталонные образцы
Версионированные образцы кода людей и AI

Клонирование голоса и синтетическая речь

Какие сигналы изучать

Оценка аудио может учитывать спектральные, временные, просодические и канальные признаки на чистых, сжатых и перезаписанных образцах.

Проверки

  • Устойчивость к кодекам
  • Тесты с шумом и повторным воспроизведением
  • Согласованность голоса
  • Анализ длины записи
Что публиковать
EER, FPR, FNR, калибровка
Полезные доказательства
Спектральные и просодические сигналы с таймкодами.
Эталонные образцы
Открытые anti-spoof датасеты и отложенное аудио

Сгенерированная музыка

Какие сигналы изучать

При оценке музыки можно сравнивать спектральные повторы, тембр, структуру и метаданные с учётом мастеринга и изменений при публикации.

Проверки

  • Спектральная согласованность
  • Структура и повторяемость
  • Устойчивость к кодекам
  • Проверка метаданных источника
Что публиковать
AUROC, FPR, FNR, калибровка
Полезные доказательства
Сигналы по сегментам с контекстом источника.
Эталонные образцы
Версионированные образцы музыки людей и AI

Дипфейк и сгенерированное видео

Какие сигналы изучать

Оценка видео должна проверять покадровую, временную, лицевую и аудиовизуальную согласованность при разном разрешении и повторном сжатии.

Проверки

  • Временная согласованность
  • Проверка областей лица
  • Согласование аудио и видео
  • Устойчивость к пересжатию
Что публиковать
Clip AUC, Frame AUC, FPR, FNR
Полезные доказательства
Сигналы по кадрам и таймкодам.
Эталонные образцы
Открытые deepfake датасеты и отложенное видео

Открытые датасеты для оценки

Набор данныхДоменПримечанияМетрика(и)
HC3 / HC3+ТекстВысококачественный ChatGPT vs ЧеловекAUROC, FPR@TPR
RAIDТекстСостязательные атаки и доменыОценка устойчивости
AIGCodeSetКодЗадачи генерации PythonAUROC
ASVspoof 2019/21АудиоЛогический/Физический доступEER, min t-DCF
ADD 2022АудиоОбнаружение аудиодипфейковEER
DFDCВидео100k+ клипов, при поддержке FacebookVideo-AUC
FaceForensics++ВидеоРазличные методы манипуляцииFrame-AUC
Celeb-DFВидеоВысококачественные дипфейкиAUC

Это открытые ориентиры для построения оценки. Упоминание датасета не означает, что ZeroTrue опубликовал результат на нём.

Метрики оценки

Текст

AUROC

На всех порогах

Показывает разделение классов на разных порогах. Вместе с ним нужны ложные срабатывания и калибровка.

Код

AUROC

По языкам

Результаты нужно разделять по языку программирования, источнику и степени ручной правки.

Аудио

EER

Баланс ошибок

Equal Error Rate показывает баланс между ложным принятием и ложным отклонением.

Видео

Clip AUC

Кадр и клип

Поведение на уровне клипа и кадра нужно публиковать отдельно, включая пересжатые образцы.

Операционные диапазоны

Пример обозначений для оценки уверенности с учётом политики.

  • Низкая уверенность
  • Ручная проверка
  • Высокая уверенность

Приоритеты оценки

  1. Покрытие

    Новые генераторы и домены

    Тестировать новые семейства генераторов, языки, источники медиа и типы контента.

  2. Стойкость

    Устойчивость к преобразованиям

    Измерять поведение после сжатия, обрезки, перефразирования, правки, воспроизведения и перезаписи.

  3. Качество

    Калибровка и анализ ошибок

    Публиковать ложные срабатывания, пропуски, калибровку, версию модели и дату теста.