为什么重要

该方法有效解决了长时程智能体训练中奖励稀疏和信用分配困难的问题,显著提升了智能体在复杂应用环境中的表现,对构建更可靠的自主智能体具有重要价值。

关键事实

事实 1

DRACO在AppWorld上比基础模型提升了15.9个百分点。

来源与依据

单一来源

On AppWorld, DRACO gains 15.9 points over the base model

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文

事实 2

DRACO在AppWorld上比使用稀疏真实奖励训练的GRPO提升了5.3个百分点。

来源与依据

单一来源

and 5.3 points over GRPO trained with a sparse ground-truth reward

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文

事实 3

DRACO的代码可在https://github.com/IBM/draco获取。

来源与依据

单一来源

The code for DRACO is available at https://github.com/IBM/draco

Hugging Face Daily Papers · 第一方证据 · 支持

查看 Hugging Face Daily Papers 原文