Research · Policy and Safety · Models

边界感知自蒸馏研究揭示LLM安全微调中过拒绝与数据组成的关键权衡

Hugging Face 博客发布研究,通过边界感知自蒸馏方法分析 LLM 安全微调中的过拒绝问题。在 Qwen3-8B 上,升级覆盖模型将政治拒绝率从 9.47% 提升至 84.75%,但 XSTest 过拒绝率也从 2.00% 升至 74.00%;添加良性边界数据后,合规侧过拒绝率从 32.94% 降至 4.16%。

Products and Tools · Business · Applications

Meta 推出 Muse 个人 AI 助手,押注消费者信任

Meta 推出个人 AI 代理 Muse,面向美国用户,帮助处理日常任务和项目。Muse 通过 Stripe 的 Link 进行结账并提供购买保护,免费使用但需绑定支付卡,使用量增加后可能推出订阅计划。

Business · Industry and Infrastructure · Models

法国AI实验室Mistral AI完成30亿欧元D轮融资,估值超210亿欧元

法国 AI 实验室 Mistral AI 完成 30 亿欧元 D 轮融资,投后估值超 210 亿欧元。本轮由三星电子领投,EQT 管理的 Scaleup Europe Fund 和 PSG Equity 联合领投。公司计划到 2030 年在欧洲建设 1 吉瓦计算能力。

Community · Policy and Safety · Research

OpenAI研究员被指施压数学家删除Anthropic合著者

数学家 Tristan Buckmaster 称,OpenAI 研究员 Sébastien Bubeck 两次施压要求将 Anthropic 员工 Levent Alpöge 从 Navier-Stokes 突破论文作者中移除,原因是其就职于竞争对手。OpenAI 声称该证明由约 1 万个 AI 智能体在 88 小时内完成。

Models · Research · Products and Tools

王云鹤创业后发布首个Agent-Native模型NeoHorse

华为诺亚方舟实验室前主任王云鹤创办的基元律动发布首个 Agent-Native 模型 NeoHorse,包含 4B 和 9B 两个版本,专注于 Agent 工作所需能力。经过 Agentic Post-Training 后,4B 模型在 10 项评测中综合表现达到或略超 9B 基础模型。