Методы и оценка

Как оценивать мультимодальную AI-детекцию

На странице описаны полезные группы сигналов, метрики оценки и открытые эталонные датасеты. Универсальная точность не заявляется, поскольку результат зависит от модели, образца, языка, преобразований и порога.

Текст
Изображения
Код
Голос и аудио
Видео

Группы сигналов по типам контента

Это распространённые категории сигналов для интерпретации результата и построения репрезентативных тестов. Ни один отдельный сигнал не доказывает авторство.

Сгенерированный текст

Какие сигналы изучать

Оценка текста может сочетать статистические признаки, результат классификатора и тесты устойчивости после редактирования и перефразирования.

Проверки

Вариативность предложенийСтилометрические признакиПроверки на новых семействах моделейУстойчивость к перефразированию
Что публиковатьAUROC, FPR, FNR, калибровка
Полезные доказательстваСигналы по предложениям и контекст уверенности.
Эталонные образцыОткрытые корпуса и отложенные образцы

Сгенерированный код

Какие сигналы изучать

При оценке кода важно отделять типовой шаблонный код от связанных с генератором признаков и проверять изменения после ручной правки.

Проверки

Структура и идентификаторыКомментарии и документацияБазовые линии для каждого языкаУстойчивость к ручной правке
Что публиковатьAUROC, FPR, FNR, калибровка
Полезные доказательстваСигналы по функциям с контекстом репозитория.
Эталонные образцыВерсионированные образцы кода людей и AI

Клонирование голоса и синтетическая речь

Какие сигналы изучать

Оценка аудио может учитывать спектральные, временные, просодические и канальные признаки на чистых, сжатых и перезаписанных образцах.

Проверки

Устойчивость к кодекамТесты с шумом и повторным воспроизведениемСогласованность голосаАнализ длины записи
Что публиковатьEER, FPR, FNR, калибровка
Полезные доказательстваСпектральные и просодические сигналы с таймкодами.
Эталонные образцыОткрытые anti-spoof датасеты и отложенное аудио

Сгенерированная музыка

Какие сигналы изучать

При оценке музыки можно сравнивать спектральные повторы, тембр, структуру и метаданные с учётом мастеринга и изменений при публикации.

Проверки

Спектральная согласованностьСтруктура и повторяемостьУстойчивость к кодекамПроверка метаданных источника
Что публиковатьAUROC, FPR, FNR, калибровка
Полезные доказательстваСигналы по сегментам с контекстом источника.
Эталонные образцыВерсионированные образцы музыки людей и AI

Дипфейк и сгенерированное видео

Какие сигналы изучать

Оценка видео должна проверять покадровую, временную, лицевую и аудиовизуальную согласованность при разном разрешении и повторном сжатии.

Проверки

Временная согласованностьПроверка областей лицаСогласование аудио и видеоУстойчивость к пересжатию
Что публиковатьClip AUC, Frame AUC, FPR, FNR
Полезные доказательстваСигналы по кадрам и таймкодам.
Эталонные образцыОткрытые deepfake датасеты и отложенное видео

Открытые датасеты для оценки

Набор данныхДоменПримечанияМетрика(и)
HC3 / HC3+ТекстВысококачественный ChatGPT vs ЧеловекAUROC, FPR@TPR
RAIDТекстСостязательные атаки и доменыОценка устойчивости
AIGCodeSetКодЗадачи генерации PythonAUROC
ASVspoof 2019/21АудиоЛогический/Физический доступEER, min t-DCF
ADD 2022АудиоОбнаружение аудиодипфейковEER
DFDCВидео100k+ клипов, при поддержке FacebookVideo-AUC
FaceForensics++ВидеоРазличные методы манипуляцииFrame-AUC
Celeb-DFВидеоВысококачественные дипфейкиAUC

Это открытые ориентиры для построения оценки. Упоминание датасета не означает, что ZeroTrue опубликовал результат на нём.

Метрики оценки

Текст
AUROC
На всех порогах
Код
AUROC
По языкам
Аудио
EER
Баланс ошибок
Видео
Clip AUC
Кадр и клип

Операционные диапазоны

Пример обозначений для оценки уверенности с учётом политики.

Низкая уверенность
Ручная проверка
Высокая уверенность

Приоритеты оценки

Покрытие

Новые генераторы и домены

Тестировать новые семейства генераторов, языки, источники медиа и типы контента.

Стойкость

Устойчивость к преобразованиям

Измерять поведение после сжатия, обрезки, перефразирования, правки, воспроизведения и перезаписи.

Качество

Калибровка и анализ ошибок

Публиковать ложные срабатывания, пропуски, калибровку, версию модели и дату теста.