●评估方法
AI 检测器评估框架
按内容类型、数据集、转换、模型版本和错误类型报告性能的透明框架。
AUROC
分数区分能力
FPR
误报率
FNR
漏报率
p50/p95
延迟分布
当前公开结果状态
ZeroTrue 不在本页发布单一通用准确率。版本化结果应按内容类型报告,并包含数据集、阈值、误报、漏报和已知限制。
方法论
有效检测器基准所需的最低信息
数据集
- • 具名公开数据集
- • 具有代表性的留出样本
- • 压缩和编辑变体
- • 按内容类型拆分测试集
评估
- • 记录模型版本
- • 评分前固定阈值
- • 可重复的测试运行
- • 保留模糊样本
报告
- • AUROC、精确率和召回率
- • 误报和漏报
- • 延迟分布
- • 已知失败案例
真实世界泛化
压缩鲁棒性
测试应包含社交媒体和消息应用中常见的重新压缩与格式转换。
新型生成器处理
在发布广泛性能声明前,应将新生成器系列和模型版本加入留出测试集。
对抗弹性
评估应包含常见规避、编辑、改写、噪声和混淆转换。