Как оценивать мультимодальную AI-детекцию
На странице описаны полезные группы сигналов, метрики оценки и открытые эталонные датасеты. Универсальная точность не заявляется, поскольку результат зависит от модели, образца, языка, преобразований и порога.
Группы сигналов по типам контента
Это распространённые категории сигналов для интерпретации результата и построения репрезентативных тестов. Ни один отдельный сигнал не доказывает авторство.
Сгенерированный текст
Какие сигналы изучать
Оценка текста может сочетать статистические признаки, результат классификатора и тесты устойчивости после редактирования и перефразирования.
Проверки
Сгенерированный код
Какие сигналы изучать
При оценке кода важно отделять типовой шаблонный код от связанных с генератором признаков и проверять изменения после ручной правки.
Проверки
Клонирование голоса и синтетическая речь
Какие сигналы изучать
Оценка аудио может учитывать спектральные, временные, просодические и канальные признаки на чистых, сжатых и перезаписанных образцах.
Проверки
Сгенерированная музыка
Какие сигналы изучать
При оценке музыки можно сравнивать спектральные повторы, тембр, структуру и метаданные с учётом мастеринга и изменений при публикации.
Проверки
Дипфейк и сгенерированное видео
Какие сигналы изучать
Оценка видео должна проверять покадровую, временную, лицевую и аудиовизуальную согласованность при разном разрешении и повторном сжатии.
Проверки
Открытые датасеты для оценки
| Набор данных | Домен | Примечания | Метрика(и) |
|---|---|---|---|
| HC3 / HC3+ | Текст | Высококачественный ChatGPT vs Человек | AUROC, FPR@TPR |
| RAID | Текст | Состязательные атаки и домены | Оценка устойчивости |
| AIGCodeSet | Код | Задачи генерации Python | AUROC |
| ASVspoof 2019/21 | Аудио | Логический/Физический доступ | EER, min t-DCF |
| ADD 2022 | Аудио | Обнаружение аудиодипфейков | EER |
| DFDC | Видео | 100k+ клипов, при поддержке Facebook | Video-AUC |
| FaceForensics++ | Видео | Различные методы манипуляции | Frame-AUC |
| Celeb-DF | Видео | Высококачественные дипфейки | AUC |
Это открытые ориентиры для построения оценки. Упоминание датасета не означает, что ZeroTrue опубликовал результат на нём.
Метрики оценки
Операционные диапазоны
Пример обозначений для оценки уверенности с учётом политики.
Избранные ссылки
Приоритеты оценки
Новые генераторы и домены
Тестировать новые семейства генераторов, языки, источники медиа и типы контента.
Устойчивость к преобразованиям
Измерять поведение после сжатия, обрезки, перефразирования, правки, воспроизведения и перезаписи.
Калибровка и анализ ошибок
Публиковать ложные срабатывания, пропуски, калибровку, версию модели и дату теста.