Research · Policy and Safety
MMMMM:用于研究多语言多模态错误信息机制的统一分类法
研究者从Twitter/X收集了七种语言的大规模真实世界错误信息数据集,并开发了多模态错误信息综合分类法。分析显示AI生成内容在科技领域特别普遍,而疫苗错误信息常利用新闻媒体图片增加可信度。
Daily Digest
本期 Digest 收录 9 条 AI 进展,按计划顺序包括:MMMMM:用于研究多语言多模态错误信息机制的统一分类法;文本到图像模型在情境变化下角色相关视觉属性的偏见持续性研究;SpanCalib-VLM:一种用于视觉语言模型中幻觉跨度检测的混合双系统,在 SHROOM-Visions 英语评估集上实现 Pearson 校准相关性 0.41、总体 IoU 0.39;卡特彼勒利用数十年自动化经验推动AI部署,投入1亿美元培训员工;AI 代理没有时间感且无法感知时间;美国员工对AI的看法日益负面:Glassdoor数据显示职场挫败感上升;Anthropic 调整 Claude Code 每周使用限额:表面上提高 25%,实际减少 17%;Sony和Warner起诉Anthropic,称其是“历史上最大规模且最公然的知识产权盗窃案之一”;AI能最好地伪装出拿高分的技能。
共 9 条已审核进展
Research · Policy and Safety
研究者从Twitter/X收集了七种语言的大规模真实世界错误信息数据集,并开发了多模态错误信息综合分类法。分析显示AI生成内容在科技领域特别普遍,而疫苗错误信息常利用新闻媒体图片增加可信度。
Research · Policy and Safety
研究通过ContextBench基准(92个角色、1,656个语义受控提示)评估四个先进文本到图像模型,发现将角色置于语义无关情境时跨角色属性集中度增加,表明偏见在情境变化下持续存在。
Research · Models
SpanCalib-VLM是一种用于视觉语言模型中幻觉跨度检测的混合双系统,在SHROOM-Visions英语评估集上实现Pearson校准相关性0.41、总体IoU 0.39,干净响应IoU达0.91。
Industry and Infrastructure · Business · Applications
卡特彼勒利用数十年自动化经验推动AI部署,拥有约160万台互联资产和超过16拍字节结构化数据,计划未来五年投入1亿美元培训员工掌握AI、自动化和机器人技术。其第二季度营收达205亿美元历史新高,发电部门销售额增长72%。
Research · Models · Applications
研究测试了Anthropic的Claude Code和OpenAI的Codex两款编码助手的时间感,发现它们在ProgramBench测试中大多预估需要约90分钟,与任务难度无关。但当代理获得报告已用时间的工具时,它们几乎每次都能准确判断时间。
Community · Business · Policy and Safety
Glassdoor分析显示,美国员工对AI的正面情绪从2019年的81%下降到2026年中期的43%,其中Gen Z女性对AI的正面评论仅占21%。2025年5月至2026年5月,美国评价中AI的提及率增长了240%。
Products and Tools · Business
Anthropic调整Claude Code每周使用限额,从9月14日起基准限额将比原始基准永久提高25%,但目前有临时50%提升正在生效,因此切换后用户可用容量实际减少17%。官方Claude账户已在X平台确认变更。
Policy and Safety · Business · Community
索尼音乐和华纳音乐等主要音乐出版商在加州北区联邦法院起诉Anthropic,指控其大规模盗版知识产权。诉状将CEO Dario Amodei和联合创始人Benjamin Mann列为个人被告。此前Anthropic已因使用盗版书籍训练AI支付15亿美元和解金。
Applications · Research · Policy and Safety
博科尼大学对1053名新生进行随机实验,发现GPT-4o帮助学生在商业作业上获得显著更好成绩。因果推理短期课程未提高传统分数,但促使学生提出更多样化解决方案。研究未进行后续测试检验学生实际理解或保留情况。