Research · Models
DRACO通过动态评分标准实现长时程智能体训练中的细粒度信用分配
DRACO通过动态评分标准实现长时程智能体训练中的细粒度信用分配,在AppWorld上比基础模型提升15.9个百分点,比使用稀疏真实奖励训练的GRPO提升5.3个百分点,代码已开源。
阅读 Hugging Face Daily Papers 原文为什么重要
该方法有效解决了长时程智能体训练中奖励稀疏和信用分配困难的问题,显著提升了智能体在复杂应用环境中的表现,对构建更可靠的自主智能体具有重要价值。
关键事实
事实 1
DRACO在AppWorld上比基础模型提升了15.9个百分点。
来源与依据
On AppWorld, DRACO gains 15.9 points over the base model
事实 2
DRACO在AppWorld上比使用稀疏真实奖励训练的GRPO提升了5.3个百分点。
来源与依据
and 5.3 points over GRPO trained with a sparse ground-truth reward
事实 3
DRACO的代码可在https://github.com/IBM/draco获取。
来源与依据
The code for DRACO is available at https://github.com/IBM/draco