Models · Research
GGSS:用于生成式视觉语言模型推理时去偏的测地门控球面引导
GGSS 是一种用于生成式视觉语言模型推理时去偏的测地门控球面引导方法,在四个模型上实现了最低平均偏差,同时保持 MMStar 准确率与基线相差不超过 0.6 个百分点。
Daily Digest
本期 Digest 收录 12 条 AI 进展,按计划顺序包括:GGSS:用于生成式视觉语言模型推理时去偏的测地门控球面引导;TacForcing:一种在执行时融入触觉反馈的流式动作生成框架;游戏开发作为可验证轨迹数据引擎来扩展世界模型;Procedura框架实现程序化3D建模,在P3D-Bench与MechBench-36中优于现有方法;研究揭示大语言模型在不同语言下技能表现不一致;提出 Prefix Sliding 技术,可在推理中丢弃非前缀或近期窗口的中间 token,实现高效长时程测试时扩展;概念性中断与指称性中断在人类阅读和大语言模型处理中表现出不同的动态特征;提出一种自进化多智能体框架防御LLM越狱攻击;VISA:一种用于多模态指令跟随的智能体自进化数据合成框架;TraceML 通过版本级数据实证分析人类与智能体在机器学习开发中的规划差异;Zero-WAM:从人类视频中进行上下文世界-动作建模,实现开放式任务泛化;OpenAI高管离职潮:十几位高管出走,Brockman影响力上升。
共 12 条已审核进展
Models · Research
GGSS 是一种用于生成式视觉语言模型推理时去偏的测地门控球面引导方法,在四个模型上实现了最低平均偏差,同时保持 MMStar 准确率与基线相差不超过 0.6 个百分点。
Research · Applications
TacForcing 是一种在执行时融入触觉反馈的流式动作生成框架,在模拟和真实世界接触丰富操作任务中分别达到 65% 和 69% 的平均成功率,并引入执行感知触觉注意力机制。
Research · Models · Applications
论文提出将游戏开发作为可验证轨迹数据引擎来扩展世界模型,并引入 RLHEV 后训练范式,结合密集引擎信号与隐式人类接受反馈。
Models · Applications
Procedura 是一种 3D 建模智能体框架,将物体表示为参数化程序,在 P3D-Bench 和 MechBench-36 上优于现有方法,且输出可编辑的部件结构化程序。
Research · Models
研究构建了 TextArena 的多语言扩展版,评估三个开源模型在八种语言和六个游戏中的表现,发现语言影响决策过程的不同阶段,技能差异是开发多语言模型的重大障碍。
Models · Research
Prefix Sliding 技术通过丢弃推理中非前缀或近期窗口的中间 token,无需训练即可使现有模型速度提升 3 倍,并支持通过强化学习扩展到超过十万 token 的推理轨迹。
Research · Models
论文比较了概念性中断和指称性中断在人类阅读和大语言模型处理中的动态特征,发现两者在时间进程和表征位移上存在差异。
Policy and Safety · Models
论文提出一种自进化多智能体框架防御 LLM 越狱攻击,通过外部记忆和提示将攻击失败抽象为方法级规则,无需参数更新,适用于开源和黑盒模型。
Models · Research
VISA 是一种智能体自进化数据合成框架,用于多模态指令跟随,在 MM-IFEval 上一致提升性能,同时保持七个公开基准上的通用多模态能力。
Research · Community
TraceML 通过版本级数据实证分析人类与智能体在机器学习开发中的规划差异,包含 134 个竞赛中 4,465 条人类轨迹和 207 条智能体轨迹,并发布数据集。
Research · Applications
Zero-WAM 从人类视频中进行上下文世界-动作建模,在 RoboTwin 2.0 模拟器的七个未见任务上平均成功率达到 47.0%,比最强基线提升 29.5 个百分点,并构建了 HumanGen 数据集。
Business · Industry and Infrastructure
OpenAI 自年初以来已有超过十几位高管离职,包括首席运营官和首席营收官,数据中心负责人 Chris Malone 上周离职,基础设施和产品团队现向总裁 Greg Brockman 汇报。