为什么重要

该研究提出了一种检测视觉语言模型幻觉的新方法,有助于提高模型输出的可靠性和可信度,对减少AI生成错误信息具有实际应用价值。

关键事实

事实 1

SpanCalib-VLM 在 SHROOM-Visions 英语评估集上的 Pearson 校准相关性为 0.41。

来源与依据

单一来源

our ensemble achieves a Pearson calibration correlation of 0.41

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文

事实 2

SpanCalib-VLM 在 SHROOM-Visions 英语评估集上的总体 IoU 为 0.39。

来源与依据

单一来源

and an overall IoU of 0.39

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文

事实 3

SpanCalib-VLM 在 SHROOM-Visions 英语评估集上的干净响应 IoU 为 0.91。

来源与依据

单一来源

with a clean-response IoU of 0.91}

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文