Research
TTPO:测试时策略优化
TTPO是一种测试时策略优化方法,使用非对称目标蒸馏一致的rollouts并惩罚不一致的rollouts,在五个竞赛级基准上匹配有标签监督的OPSD,并将Qwen3-1.7B在TTT中的表现从38.0%提升到45.2%。
阅读 arXiv 原文为什么重要
该方法在测试时优化策略,无需额外标签即可提升模型性能,对推理优化和模型部署具有实际意义。
关键事实
事实 1
TTPO 使用非对称目标,通过 OPSD 蒸馏一致的 rollouts,并用 Grouped RL 惩罚不一致的 rollouts。
来源与依据
we propose Test-Time Policy Optimization (TTPO), an asymmetric objective that distills agreeing rollouts via OPSD and penalizes disagreeing rollouts with Grouped RL
事实 2
TTPO 在五个竞赛级基准上匹配了有标签监督的 OPSD。
来源与依据
TTPO matches label-supervised OPSD on five competition-level benchmarks
事实 3
TTPO 将 Qwen3-1.7B 在 TTT 中的表现从 38.0% 提升到 45.2%。
来源与依据
raises Qwen3-1.7B from 38.0% to 45.2% in TTT