找到 177 条 Story

Policy and Safety · Business

AI实验室存在数据信任问题,其政策尚未解决

AI实验室面临数据信任问题:英伟达仅将Anthropic的Fable模型用于开源项目等不敏感任务,博思艾伦汉密尔顿禁止员工使用Fable从事专有网络安全软件工作。OpenAI表示其收集的企业元数据不包含业务数据本身。

Research · Models

一致性指南可将智能体的可靠性差距减半

IBM研究团队提出一致性指南,可将智能体可靠性差距减半。在AppWorld基准上,使用GPT-4.1的ReAct智能体平均成功率为77.4%,但仅53.0%的任务在五次重复中全部成功。应用指南后,Pass^5提升至69.0%,Mean@5提升至81.0%,差距从24.4个百分点缩小到12.0个百分点。

Policy and Safety · Industry and Infrastructure

大型AI公司提议放缓开发引发争议

Anthropic CEO Dario Amodei呼吁行业和政府协调放缓前沿AI开发,并寻求反垄断豁免。Cohere CEO Aidan Gomez批评该提议是“披着羊皮的狼,换了个名字的卡特尔”,Hugging Face工程师Niels Rogge称其为“最奇怪的胡言乱语”。

Applications · Products and Tools

Instacart推出AI购物助手Clementine

Instacart推出AI购物助手Clementine,可将手写购物清单照片转化为购物车,目前在美国和加拿大可用。

Community · Policy and Safety · Research

OpenAI研究员被指施压数学家删除Anthropic合著者

数学家 Tristan Buckmaster 称,OpenAI 研究员 Sébastien Bubeck 两次施压要求将 Anthropic 员工 Levent Alpöge 从 Navier-Stokes 突破论文作者中移除,原因是其就职于竞争对手。OpenAI 声称该证明由约 1 万个 AI 智能体在 88 小时内完成。

Products and Tools · Business · Applications

Meta 推出 Muse 个人 AI 助手,押注消费者信任

Meta 推出个人 AI 代理 Muse,面向美国用户,帮助处理日常任务和项目。Muse 通过 Stripe 的 Link 进行结账并提供购买保护,免费使用但需绑定支付卡,使用量增加后可能推出订阅计划。

Research · Policy and Safety · Models

边界感知自蒸馏研究揭示LLM安全微调中过拒绝与数据组成的关键权衡

Hugging Face 博客发布研究,通过边界感知自蒸馏方法分析 LLM 安全微调中的过拒绝问题。在 Qwen3-8B 上,升级覆盖模型将政治拒绝率从 9.47% 提升至 84.75%,但 XSTest 过拒绝率也从 2.00% 升至 74.00%;添加良性边界数据后,合规侧过拒绝率从 32.94% 降至 4.16%。

Business · Industry and Infrastructure · Models

法国AI实验室Mistral AI完成30亿欧元D轮融资,估值超210亿欧元

法国 AI 实验室 Mistral AI 完成 30 亿欧元 D 轮融资,投后估值超 210 亿欧元。本轮由三星电子领投,EQT 管理的 Scaleup Europe Fund 和 PSG Equity 联合领投。公司计划到 2030 年在欧洲建设 1 吉瓦计算能力。

Models · Research · Products and Tools

王云鹤创业后发布首个Agent-Native模型NeoHorse

华为诺亚方舟实验室前主任王云鹤创办的基元律动发布首个 Agent-Native 模型 NeoHorse,包含 4B 和 9B 两个版本,专注于 Agent 工作所需能力。经过 Agentic Post-Training 后,4B 模型在 10 项评测中综合表现达到或略超 9B 基础模型。

Products and Tools · Research · Policy and Safety

OpenAI开发者称Astra大幅提升生产力,部分计划提前六个月

OpenAI开发者称内部工具Astra大幅提升生产力,部分计划提前六个月,并认为Astra是OpenAI“最大的竞争优势”。同时研究显示20/25名研究人员将AI研究自动化列为最大风险之一。

Research · Applications

开发用于多模态人机交互的人形机器人原型

arXiv论文介绍了一款用于多模态人机交互的人形机器人原型,具有12自由度双臂和2自由度头部,实验显示平均操作误差约1.83厘米,手势识别准确率达96%。

Products and Tools · Applications · Policy and Safety

Google 的 Gemini Spark 现可管理 Google Photos 图库

Google的个人代理Gemini Spark现在可以管理用户的Google Photos图库,新功能将在未来几周内向美国符合条件的Gemini AI Pro和Ultra订阅用户推出。

Products and Tools · Industry and Infrastructure · Applications

Nvidia希望你的家庭网络像迷你数据中心一样服务于本地AI

Nvidia的PAIR工具能自动将本地AI请求分发到家庭网络上的所有可用设备,支持GeForce RTX 20系列及以上显卡、RTX Pro工作站、DGX Spark和M4起的Apple芯片,三设备集群演示任务耗时不到9分钟,而单台笔记本电脑需18分钟。

Business · Industry and Infrastructure

Crusoe 筹集 30 亿美元,估值达 300 亿美元

Crusoe完成新一轮30亿美元融资,估值达300亿美元,并签署了价值130亿美元、为期五年的云合同,为量化交易公司Jane Street提供服务。

Policy and Safety · Business

Abliteration.ai 提供去除安全护栏的开源AI模型服务

Abliteration.ai提供去除安全护栏的开源AI模型服务,托管了去除护栏的Z.ai GLM-5.3模型,用户可通过浏览器或API查询,公司正与风投洽谈融资,但AI安全专家警告此类模型可能变得像反社会者一样服从任何指令。

Research · Products and Tools

通过训练编译:将自然语言规范转化为本地神经函数

研究提出通过训练编译的方法,将自然语言规范转化为本地神经函数,在FuzzyBench-Hard上达到83.6%的语义准确率,编译时间约为一分钟,并已部署在公开交互式服务中。

Research · Products and Tools

MaxKernel:用于TPU的智能体内核代码生成

MaxKernel是一个多智能体系统,实现了三种TPU内核开发范式,在包含50个多样化任务的JaxBench基准上进行了评估,并已开源。

Research · Models

量化破坏记忆:低精度时序推理中的循环状态写回

研究发现将连续状态传播替换为4比特状态存储后,τ1和τ2的估计误差分别增大约70倍和300倍,但误差反馈、残差记忆和方向记忆无需重新训练即可恢复精度,且在独立训练的LSTM中验证了细胞状态对干预更敏感。

Research · Models

模型过度编辑代码:最小修复的保真度研究

研究使用400个BigCodeBench问题构建评估框架,发现保留指令将平均超额Levenshtein距离从0.195降低到0.131,且强化学习在域外编辑保真度和性能保留权衡方面表现最佳。

Products and Tools · Applications

funes:为编码代理构建持久记忆层

Hugging Face推出funes,为Claude Code、Codex、pi和Hermes等编码代理构建持久记忆层,默认推理后端无ML运行时依赖,嵌入和重排序在本地进行,并支持发布私有Hugging Face数据集作为共享记忆。

Research · Applications

Scal3R:通过多相对位姿查询实现可扩展的在线3D重建

Scal3R通过多相对位姿查询实现可扩展的在线3D重建,使用约占参数1%的轻量级可学习token注入完全冻结的主干网络,在单个GPU上8小时内收敛,并在KITTI上将平均ATE降低超过60%。

Applications · Policy and Safety

亚马逊利用AI帮助客户辨别诈骗信息

亚马逊推出AI功能,帮助客户辨别收到的消息是否为诈骗,通过检查公司全球发送的数十亿条消息来验证通信真实性,并支持转发可疑邮件至verify@amazon.com。

Policy and Safety · Models · Industry and Infrastructure

美国军方将ChatGPT和Grok纳入AI平台GenAI.mil

五角大楼在其AI平台GenAI.mil中新增OpenAI的ChatGPT Mil和xAI的Grok for Government,该平台已有超过170万用户,但Anthropic的Claude仍未加入。

Business · Applications

Adobe收购印度营销智能初创公司Rilo

Adobe收购了印度营销智能初创公司Rilo,该公司由IIT校友于2025年创立,曾以1000万美元估值融资100万美元。

Industry and Infrastructure · Models · Business

Google Deepmind首席称前沿AI领导地位是唯一重要的事

Google DeepMind 首席 Koray Kavukcuoglu 表示前沿 AI 领导地位是唯一重要的事,承认当前模型略低于前沿水平,但相信团队和资源能缩小差距,并称 Gemini 4 进展顺利。

Applications · Business

亚马逊推出“有更新时通知我”功能

亚马逊在 Alexa 购物 AI 助手中推出“Update Me When”功能,可向消费者发送个性化通知,提醒可能促成购买的新事件或相关信息,并扩展了现有的价格追踪功能。

Models · Applications · Research

Runway推出Solaris:实时生成软件界面的AI系统

Runway 推出 Solaris,一个基于 Gen-4.5 视频模型的“界面世界模型”,可实时渲染用户界面并直接响应点击或语音,但目前文本渲染易出错且不支持屏幕阅读器,仍处于研究阶段。

Policy and Safety · Business · Industry and Infrastructure

苹果指控前员工窃取商业机密供OpenAI使用,并提交新证据

苹果指控前员工刘在 OpenAI 工作中使用保密的苹果电路原理图,并提交新证据,OpenAI 表示刘在离职后访问苹果文件是为了帮助前同事,超过 400 名苹果前员工目前在 OpenAI 工作。

Research · Models · Products and Tools

OntoAligner-Ensemble:通过投票融合异构本体对齐技术

OntoAligner-Ensemble是一个模块化且对齐器无关的框架,通过投票融合和选择策略结合异构本体对齐器的候选对应关系,评估显示其能改善精确率与召回率的平衡,并经常优于独立对齐器。

Policy and Safety · Applications · Community

Instagram承认用户经常无法区分AI资料与真人

Instagram将“AI创作者”标签替换为“AI生成资料”标签,未标注的资料将受到触达和推荐限制;同时,21%的YouTube Shorts已是AI生成内容。

Industry and Infrastructure · Business

中国CXMT首次生产HBM3E芯片,缩小AI内存差距

中国存储厂商CXMT首次小批量生产HBM3E芯片,阿里巴巴T-Head和寒武纪正在测试并计划2027年用于产品;CXMT在上海IPO筹资86亿美元,但招股书未指定资金用于HBM。

Products and Tools · Business · Applications

Circleback 推出免费层级以应对会议记录市场竞争

会议记录工具Circleback推出免费层级,允许无限会议转录但仅保留30天历史;付费计划起价每月15美元,提供全部集成、无限历史和完整API及MCP访问。

Applications · Industry and Infrastructure

滴滴自动驾驶新一代Robotaxi R2开启无人载客测试服务

滴滴自动驾驶与广汽埃安联合打造的Robotaxi R2在北京、广州部分示范区域开启无人载客测试服务,新车搭载33个传感器,在自动驾驶性能和座舱体验上全面升级。

Industry and Infrastructure · Business · Applications

卡特彼勒利用数十年自动化经验推动AI部署,投入1亿美元培训员工

卡特彼勒利用数十年自动化经验推动AI部署,拥有约160万台互联资产和超过16拍字节结构化数据,计划未来五年投入1亿美元培训员工掌握AI、自动化和机器人技术。其第二季度营收达205亿美元历史新高,发电部门销售额增长72%。

Research · Models · Applications

AI 代理没有时间感且无法感知时间

研究测试了Anthropic的Claude Code和OpenAI的Codex两款编码助手的时间感,发现它们在ProgramBench测试中大多预估需要约90分钟,与任务难度无关。但当代理获得报告已用时间的工具时,它们几乎每次都能准确判断时间。

Applications · Research · Policy and Safety

AI能最好地伪装出拿高分的技能

博科尼大学对1053名新生进行随机实验,发现GPT-4o帮助学生在商业作业上获得显著更好成绩。因果推理短期课程未提高传统分数,但促使学生提出更多样化解决方案。研究未进行后续测试检验学生实际理解或保留情况。

Research · Policy and Safety

MMMMM:用于研究多语言多模态错误信息机制的统一分类法

研究者从Twitter/X收集了七种语言的大规模真实世界错误信息数据集,并开发了多模态错误信息综合分类法。分析显示AI生成内容在科技领域特别普遍,而疫苗错误信息常利用新闻媒体图片增加可信度。

Community

OpenClaw:红过,爱过,散了

OpenClaw 是一个开源项目,上线约 100 天时 GitHub Star 数突破 25 万,超过 React;到 2026 年 8 月 Star 数已超过 38 万,Fork 数超过 8 万。其创始人 Peter Steinberger 于 2026 年 2 月加入 OpenAI,从事个人 AI Agent 相关工作。

Research

LAION发布包含1000万小时视频素材的大规模开放视频数据集

LAION 发布了 Big Video Dataset(BVD),这是用于 AI 研究的大型开放视频数据集之一,包含从 CommonCrawl 中 13 亿个视频 URL 下载的 8000 万个视频,总时长达 1000 万小时。在 BVD 上训练的模型在视频到文本基准上比 InternVid 训练的模型最多高出 2.1 个百分点。

Products and Tools

Anthropic 推出模型硬件标准(MHS),让 AI 智能体统一控制实体设备

Anthropic 推出模型硬件标准(MHS),这是一个统一接口,让 AI 智能体能够读取数据并控制实验室和工厂中的实体设备。MHS 可将实验室设备集成时间从数周或数月缩短至数小时或数分钟,在 QuEra 的测试中,Claude 使用 MHS 开发的激光控制程序成功率达 99.3%。

Research

QCell通过重组与对齐细胞查询实现重叠实例分割

QCell 提出一种实例重组模块,在潜在空间中分解并重组查询表示,用于重叠实例分割。在 ISBI2014 数据集上,QCell 实现了 +2.2 AP 和 +2.7 AJI 的提升,代码已开源。

Research

RLVR 主要在推理轨迹入口处收窄解题空间,而非下游推理内部

研究发现,强化学习与可验证奖励(RLVR)在 Countdown 任务中导致解题覆盖下降最多 67%,且首次算术运算前的每 token 似然偏移比下游推理大 11 至 16 倍。仅提供未选择的入口前缀即可将低入口族的完成率从 0.018 提升到 0.212。

Research · Applications

学习合成增强推断的规模-权重前沿

论文提出学习合成增强推断的规模-权重前沿框架,通过合成观测数量和权重刻画增强效果,在LLM增强意见调查数据实验中达到目标覆盖率并显著缩小置信区间。

Research · Models

从文本语料学习人类语言的形式限制

研究从信息论角度分析听者能否仅凭话语形式恢复说话者意图,推导出形式对意义不确定性的上界,并在人工语言、普通话零代词消解等任务上验证。

Research · Policy and Safety

大型语言模型个性化带来的隐性成本评估

研究提出PRISK框架评估大语言模型个性化带来的隐性成本,发现个性化会加剧偏好窄化(平均下降41.7%)和谄媚性偏见(平均下降61.7%),并导致无关个性化平均下降45.9%。

Research

SWE-Prime:更少轨迹,更好性能

SWE-Prime是一种多粒度、两阶段的SFT数据选择方法,通过轨迹级筛选和基于过程质量、结果质量及数据代表性的选择,使用10%的轨迹子集训练即可超越完整数据集,在SWE-Bench Pro和Verified上分别带来最高12.2%和24.2%的相对性能提升。

Research

TTPO:测试时策略优化

TTPO是一种测试时策略优化方法,使用非对称目标蒸馏一致的rollouts并惩罚不一致的rollouts,在五个竞赛级基准上匹配有标签监督的OPSD,并将Qwen3-1.7B在TTT中的表现从38.0%提升到45.2%。

Research

MMLVE-Agent:面向长视频多指令多镜头编辑的智能体推理框架

MMLVE-Agent是一个面向长视频多指令多镜头编辑的智能体推理框架,利用LLM和VLM协同实现镜头级视频解耦与精确指令解析,在消除编辑幻觉、保持跨镜头一致性和无缝时空过渡方面优于现有闭源方法Seedance 2.0。

Research

EditaLive:面向直播的统一角色视频编辑框架

EditaLive是一个面向直播的统一角色视频编辑框架,基于预训练图像动画模型Wan-Animate,使用CharEdit-50K数据集进行指令驱动的以人为中心的视频编辑。

Research · Models

研究揭示大语言模型在不同语言下技能表现不一致

研究构建了 TextArena 的多语言扩展版,评估三个开源模型在八种语言和六个游戏中的表现,发现语言影响决策过程的不同阶段,技能差异是开发多语言模型的重大障碍。

Products and Tools · Models · Policy and Safety

Anthropic 将最强模型 Claude Mythos 5 应用于网络防御

Anthropic 正在其安全扫描工具 Claude Security 上运行最强模型 Claude Mythos 5,该工具可扫描代码库漏洞并建议补丁,目前面向企业客户提供公开测试版。

Industry and Infrastructure · Policy and Safety · Community

数据中心反对率一年内从42%飙升至75%,调查发现

调查显示,75% 的美国人现在反对在自家附近建设数据中心,而一年前反对率仅为 42%。Heatmap News 记者称这一变化为“迅速、大规模转变”。

Policy and Safety · Industry and Infrastructure

美国拟施压伙伴国在中美人工智能竞赛中选边站

美国正在起草一封信,要求伙伴国家在华盛顿与北京之间的人工智能对峙中选择一方。哈萨克斯坦是目前唯一已知同时加入美国联盟和中国竞争框架的国家,中国驻华盛顿大使馆表示此类举动将减缓全球人工智能进步。

Products and Tools · Industry and Infrastructure · Business

Waymo自研芯片用于机器人出租车,减少对Nvidia的依赖

Waymo 为其机器人出租车开发了定制芯片,减少对 Nvidia 的依赖。该芯片由台积电采用 5 纳米工艺制造,性能超过 1000 TOPS,并将安装在与极氪合作生产的新型机器人出租车上。

Industry and Infrastructure

空芯光纤或将改变数据中心地理布局

Relativity Networks 获得 2200 万美元融资,押注空芯光纤将数据传输延迟较传统光纤降低约 30%,目标是重塑数据中心互联与选址。