为什么重要

该方法在测试时优化策略,无需额外标签即可提升模型性能,对推理优化和模型部署具有实际意义。

关键事实

事实 1

TTPO 使用非对称目标,通过 OPSD 蒸馏一致的 rollouts,并用 Grouped RL 惩罚不一致的 rollouts。

来源与依据

单一来源

we propose Test-Time Policy Optimization (TTPO), an asymmetric objective that distills agreeing rollouts via OPSD and penalizes disagreeing rollouts with Grouped RL

arXiv · 第一方证据 · 支持

查看 arXiv 原文

事实 2

TTPO 在五个竞赛级基准上匹配了有标签监督的 OPSD。

来源与依据

单一来源

TTPO matches label-supervised OPSD on five competition-level benchmarks

arXiv · 第一方证据 · 支持

查看 arXiv 原文

事实 3

TTPO 将 Qwen3-1.7B 在 TTT 中的表现从 38.0% 提升到 45.2%。

来源与依据

单一来源

raises Qwen3-1.7B from 38.0% to 45.2% in TTT

arXiv · 第一方证据 · 支持

查看 arXiv 原文