●Методика оценки
Система оценки AI-детектора
Прозрачный подход к отчётности по типу контента, датасету, преобразованиям, версии модели и типам ошибок.
AUROC
Разделение классов
FPR
Ложные срабатывания
FNR
Пропущенные срабатывания
p50/p95
Распределение задержки
Статус публичных результатов
ZeroTrue не публикует на этой странице одно универсальное значение точности. Версионированные результаты должны быть разделены по типам контента и содержать описание датасета, порогов, ошибок и ограничений.
Методология
Минимальный набор данных для полезного бенчмарка детектора
Датасеты
- • Названные публичные датасеты
- • Репрезентативные отложенные образцы
- • Варианты сжатия и редактирования
- • Отдельные наборы по типам контента
Оценка
- • Зафиксированная версия модели
- • Пороги заданы до подсчёта
- • Воспроизводимые запуски
- • Неоднозначные образцы сохранены
Отчётность
- • AUROC, precision и recall
- • Ложные срабатывания и пропуски
- • Распределение задержки
- • Известные ошибки
Real-world генерализация
Robustness к компрессии
Тесты должны включать повторное сжатие и конвертацию из социальных сетей и мессенджеров.
Обработка новых генераторов
Новые семейства генераторов и версии моделей нужно добавлять в отложенные наборы до публикации общих заявлений.
Adversarial резильентность
Оценка должна включать уклонение, редактирование, перефразирование, шум и обфускацию.