How multimodal AI detection is evaluated
This page explains useful signal families, evaluation metrics, and public reference datasets. It does not publish a universal accuracy claim because performance changes by model, sample, language, transformation, and threshold.
Signal families by modality
These are common signal categories for interpreting detector output and designing representative evaluations. No individual signal proves authorship.
Generated text
Signals to examine
Text evaluation can combine statistical writing signals, classifier output, and robustness checks across editing and paraphrasing.
Evaluation checks
Generated code
Signals to examine
Code evaluation should separate common boilerplate from generator-associated patterns and test how results change after human edits.
Evaluation checks
Voice cloning and synthetic speech
Signals to examine
Audio evaluation can examine spectral, timing, prosody, and channel signals across clean, compressed, and re-recorded samples.
Evaluation checks
Generated music
Signals to examine
Music evaluation can compare spectral repetition, timbre, structure, and metadata while accounting for mastering and distribution changes.
Evaluation checks
Deepfake and generated video
Signals to examine
Video evaluation should test frame-level, temporal, face, and audio-video consistency across resolution and recompression changes.
Evaluation checks
Public datasets relevant to evaluation
| Dataset | Domain | Notes | Metric(s) |
|---|---|---|---|
| HC3 / HC3+ | Text | High-quality ChatGPT vs Human | AUROC, FPR@TPR |
| RAID | Text | Adversarial attacks & domains | Robustness Score |
| AIGCodeSet | Code | Python generation tasks | AUROC |
| ASVspoof 2019/21 | Audio | Logical/Physical Access | EER, min t-DCF |
| ADD 2022 | Audio | Audio Deepfake Detection | EER |
| DFDC | Video | 100k+ clips, Facebook backed | Video-AUC |
| FaceForensics++ | Video | Diverse manipulation methods | Frame-AUC |
| Celeb-DF | Video | High-quality Deepfakes | AUC |
These datasets are public references for designing evaluations. Listing a dataset does not claim a published ZeroTrue score on it.
Evaluation Metrics
Operational Bands
Illustrative labels for reading confidence with policy context.
Selected References
Evaluation priorities
Generator and domain shift
Test held-out generator families, languages, media sources, and content domains.
Transformation resistance
Measure behavior after compression, cropping, paraphrasing, editing, replay, and re-recording.
Calibration and error analysis
Publish false positives, false negatives, confidence calibration, model version, and test date.