Research · Models

一致性指南可将智能体的可靠性差距减半

IBM研究团队提出一致性指南,可将智能体可靠性差距减半。在AppWorld基准上,使用GPT-4.1的ReAct智能体平均成功率为77.4%,但仅53.0%的任务在五次重复中全部成功。应用指南后,Pass^5提升至69.0%,Mean@5提升至81.0%,差距从24.4个百分点缩小到12.0个百分点。

Policy and Safety · Business

AI实验室存在数据信任问题,其政策尚未解决

AI实验室面临数据信任问题:英伟达仅将Anthropic的Fable模型用于开源项目等不敏感任务,博思艾伦汉密尔顿禁止员工使用Fable从事专有网络安全软件工作。OpenAI表示其收集的企业元数据不包含业务数据本身。

Policy and Safety · Industry and Infrastructure

大型AI公司提议放缓开发引发争议

Anthropic CEO Dario Amodei呼吁行业和政府协调放缓前沿AI开发,并寻求反垄断豁免。Cohere CEO Aidan Gomez批评该提议是“披着羊皮的狼,换了个名字的卡特尔”,Hugging Face工程师Niels Rogge称其为“最奇怪的胡言乱语”。