Research · Models
诊断引导的后训练方案提升小模型对话游戏智能体表现
研究提出诊断引导的后训练方案,将小模型对话游戏智能体的公共clemscore从10.67提升到38.92,封闭域内得分从13.41提升到41.17,但域外得分仍较低。
阅读 Hugging Face Daily Papers 原文为什么重要
该方案展示了通过后训练显著提升小模型在特定任务上表现的可能性,为资源受限场景下的智能体开发提供了新思路。
关键事实
事实 1
该后训练方案将公共clemscore从10.67提升到38.92。
来源与依据
our submission improves public clemscore from 10.67 to 38.92
事实 2
该后训练方案将封闭域内得分从13.41提升到41.17。
来源与依据
and closed in-domain score from 13.41 to 41.17
事实 3
该模型在域外clemscore上表现较低,仅为7.88。
来源与依据
Out-of-domain clemscore remains low at 7.88