Research · Policy and Safety

MMMMM:用于研究多语言多模态错误信息机制的统一分类法

研究者从Twitter/X收集了七种语言的大规模真实世界错误信息数据集,并开发了多模态错误信息综合分类法。分析显示AI生成内容在科技领域特别普遍,而疫苗错误信息常利用新闻媒体图片增加可信度。

Industry and Infrastructure · Business · Applications

卡特彼勒利用数十年自动化经验推动AI部署,投入1亿美元培训员工

卡特彼勒利用数十年自动化经验推动AI部署,拥有约160万台互联资产和超过16拍字节结构化数据,计划未来五年投入1亿美元培训员工掌握AI、自动化和机器人技术。其第二季度营收达205亿美元历史新高,发电部门销售额增长72%。

Research · Models · Applications

AI 代理没有时间感且无法感知时间

研究测试了Anthropic的Claude Code和OpenAI的Codex两款编码助手的时间感,发现它们在ProgramBench测试中大多预估需要约90分钟,与任务难度无关。但当代理获得报告已用时间的工具时,它们几乎每次都能准确判断时间。

Applications · Research · Policy and Safety

AI能最好地伪装出拿高分的技能

博科尼大学对1053名新生进行随机实验,发现GPT-4o帮助学生在商业作业上获得显著更好成绩。因果推理短期课程未提高传统分数,但促使学生提出更多样化解决方案。研究未进行后续测试检验学生实际理解或保留情况。