Research · Models
一致性指南可将智能体的可靠性差距减半
IBM研究团队提出一致性指南,可将智能体可靠性差距减半。在AppWorld基准上,使用GPT-4.1的ReAct智能体平均成功率为77.4%,但仅53.0%的任务在五次重复中全部成功。应用指南后,Pass^5提升至69.0%,Mean@5提升至81.0%,差距从24.4个百分点缩小到12.0个百分点。
Daily Digest
本期 Digest 收录 8 条 AI 进展,按计划顺序包括:一致性指南可将智能体的可靠性差距减半;RunningHub启动全球AIGC长片创作大赛,刘慈欣担任顾问,总奖池550万元;黄仁勋在All-In大会上用可折叠手机接听特朗普来电;Agility Robotics新款Digit 5人形机器人无需安全围栏即可与人协同工作;AI实验室存在数据信任问题,其政策尚未解决;苹果基于谷歌Gemini推出全面革新的Siri,但未向欧盟开放;Meta新研究:字节模型蒸馏突破Token天花板,预测准确率上限高出4个百分点;大型AI公司提议放缓开发引发争议。
共 8 条已审核进展
Research · Models
IBM研究团队提出一致性指南,可将智能体可靠性差距减半。在AppWorld基准上,使用GPT-4.1的ReAct智能体平均成功率为77.4%,但仅53.0%的任务在五次重复中全部成功。应用指南后,Pass^5提升至69.0%,Mean@5提升至81.0%,差距从24.4个百分点缩小到12.0个百分点。
Applications · Community
RunningHub启动全球首个聚焦影视级长片创作的AIGC赛事,刘慈欣担任顾问,总奖池550万元,包括350万元现金和200万元创作算力。
Business · Policy and Safety
黄仁勋在All-In大会上用可折叠手机接听特朗普来电,特朗普称AI恐慌是“骗局”。英伟达股价过去一年上涨33%,但当天下跌几个百分点。
Products and Tools · Industry and Infrastructure
Agility Robotics发布新款Digit 5人形机器人,无需安全围栏即可与人协同工作,最大举重22.7公斤,比前代提升40%,电池充电9分钟可运行90分钟。
Policy and Safety · Business
AI实验室面临数据信任问题:英伟达仅将Anthropic的Fable模型用于开源项目等不敏感任务,博思艾伦汉密尔顿禁止员工使用Fable从事专有网络安全软件工作。OpenAI表示其收集的企业元数据不包含业务数据本身。
Products and Tools · Policy and Safety · Business
苹果发布基于谷歌Gemini模型的新版Siri测试版,目前仅支持英语,下月将增加法语、日语、韩语、葡萄牙语和西班牙语。该服务暂不在欧盟和中国推出。
Research · Models
Meta FAIR和华盛顿大学的研究提出字节模型蒸馏方法,突破Token天花板。以Llama 3-8B为教师模型,End-Of-Token蒸馏方案的下游平均准确率上限比传统Token蒸馏高出4个百分点。
Policy and Safety · Industry and Infrastructure
Anthropic CEO Dario Amodei呼吁行业和政府协调放缓前沿AI开发,并寻求反垄断豁免。Cohere CEO Aidan Gomez批评该提议是“披着羊皮的狼,换了个名字的卡特尔”,Hugging Face工程师Niels Rogge称其为“最奇怪的胡言乱语”。