Models · Policy and Safety
OpenAI的GPT-6 Astra幻觉减少但易受隐藏提示注入攻击
OpenAI的新模型GPT-6 Astra比前身GPT-5.6 Sol产生更少幻觉,对直接提示注入攻击的防御率接近99.99%,但在间接提示注入攻击中失败率仍为8.5%。
阅读 THE DECODER 原文为什么重要
该模型在安全性和可靠性上取得进步,但间接提示注入漏洞仍然存在,对AI代理的安全部署构成挑战。
关键事实
事实 1
OpenAI的新模型GPT-6 Astra比其前身GPT-5.6 Sol产生的幻觉更少。
来源与依据
OpenAI's new model, GPT-6 Astra, produces fewer hallucinations
事实 2
GPT-6 Astra对直接提示注入攻击的防御率接近99.99%。
来源与依据
Astra hits a near-perfect 99.99 percent defense rate
事实 3
在间接提示注入攻击中,GPT-6 Astra的失败率从27%降至8.5%。
来源与依据
Astra's failure rate dropped from 27 percent to 8.5 percent