Research
SafeAtlas-VL:以大规模数据和守卫模型超越二元多模态安全评估
SafeAtlas-VL 数据集包含 150 万个训练实例,在图像、请求和响应层面进行五级有序评分,并推出 SafeAtlas-Bench 基准。其 8B 模型在 F1 分数上比之前的 SOTA 高出约 4%。
阅读 Hugging Face Daily Papers 原文为什么重要
该研究超越了二元多模态安全评估,提供更细粒度的风险评分,有助于提升多模态模型的安全性和可靠性。
关键事实
事实 1
SafeAtlas-VL数据集包含150万个训练实例,并在图像、请求和响应层面进行五级有序评分。
来源与依据
a dataset of 1.5M training instances that places image-, request-, and response-level judgments on a five-level ordered scale
事实 2
SafeAtlas-Bench是一个包含5000个实例的留出集,用于评估五级预测和连续风险分数。
来源与依据
SafeAtlas-Bench, a held-out set of 5,000 instances for evaluating five-level predictions and continuous risk scores
事实 3
8B模型取得最佳整体性能,在F1分数上比之前的SOTA高出约4%。
来源与依据
our 8B model attains the overall best performance, outperforming the previous SOTA by approximately 4% in F1 score