生成文本
需要检查的信号
文本评估可以结合统计写作信号、分类器输出,以及编辑和改写后的鲁棒性检查。
评估检查
- 句子变化
- 文体模式
- 模型家族变化测试
- 改写鲁棒性
- 报告内容
- AUROC、FPR、FNR、校准
- 有用证据
- 句子级信号和置信度背景。
- 参考样本
- 公开语料库和留出样本
方法与评估
本页介绍有用的信号类别、评估指标和公开参考数据集。我们不宣称通用准确率,因为性能会随模型、样本、语言、转换方式和阈值而变化。
这些是解释检测结果和设计代表性评估时常用的信号类别。任何单一信号都不能证明作者身份。
文本评估可以结合统计写作信号、分类器输出,以及编辑和改写后的鲁棒性检查。
代码评估应区分常见样板代码和与生成器相关的模式,并测试人工修改后的变化。
音频评估可以在原始、压缩和重新录制的样本上检查频谱、时间、韵律和声道信号。
音乐评估可以比较频谱重复、音色、结构和元数据,同时考虑母带处理和发布过程中的变化。
视频评估应在不同分辨率和重新压缩条件下测试帧、时间、人脸和音视频一致性。
| 数据集 | 领域 | 备注 | 指标 |
|---|---|---|---|
| HC3 / HC3+ | 文本 | 高质量 ChatGPT vs 人类 | AUROC, FPR@TPR |
| RAID | 文本 | 对抗性攻击与领域 | 鲁棒性评分 |
| AIGCodeSet | 代码 | Python 生成任务 | AUROC |
| ASVspoof 2019/21 | 音频 | 逻辑/物理访问 | EER, 最小 t-DCF |
| ADD 2022 | 音频 | 音频深度伪造检测 | EER |
| DFDC | 视频 | 10万+ 片段,Facebook 支持 | 视频 AUC |
| FaceForensics++ | 视频 | 多样化篡改方法 | 帧 AUC |
| Celeb-DF | 视频 | 高质量深度伪造 | AUC |
这些数据集是设计评估时的公开参考。列出数据集并不表示 ZeroTrue 已在其上发布分数。
AUROC
跨阈值
衡量不同阈值下的类别区分能力,还应同时报告误报和校准。
AUROC
按语言
应按编程语言、来源和人工编辑程度分别报告结果。
EER
错误权衡
等错误率概括误接受和误拒绝之间的权衡。
片段 AUC
帧和片段
应分别报告片段级和帧级表现,包括重新压缩的样本。
结合策略背景理解置信度的示例标签。
测试留出的生成器家族、语言、媒体来源和内容领域。
测量压缩、裁剪、改写、编辑、重放和重新录制后的表现。
发布误报、漏报、置信度校准、模型版本和测试日期。