评估方法

AI 检测器评估框架

按内容类型、数据集、转换、模型版本和错误类型报告性能的透明框架。

AUROC
分数区分能力
FPR
误报率
FNR
漏报率
p50/p95
延迟分布

当前公开结果状态

ZeroTrue 不在本页发布单一通用准确率。版本化结果应按内容类型报告,并包含数据集、阈值、误报、漏报和已知限制。

方法论

有效检测器基准所需的最低信息

数据集

  • 具名公开数据集
  • 具有代表性的留出样本
  • 压缩和编辑变体
  • 按内容类型拆分测试集

评估

  • 记录模型版本
  • 评分前固定阈值
  • 可重复的测试运行
  • 保留模糊样本

报告

  • AUROC、精确率和召回率
  • 误报和漏报
  • 延迟分布
  • 已知失败案例

真实世界泛化

压缩鲁棒性

测试应包含社交媒体和消息应用中常见的重新压缩与格式转换。

新型生成器处理

在发布广泛性能声明前,应将新生成器系列和模型版本加入留出测试集。

对抗弹性

评估应包含常见规避、编辑、改写、噪声和混淆转换。