2026-09-16 AI Digest

本期 Digest 收录 8 条 AI 进展,按计划顺序包括:一致性指南可将智能体的可靠性差距减半;RunningHub启动全球AIGC长片创作大赛,刘慈欣担任顾问,总奖池550万元;黄仁勋在All-In大会上用可折叠手机接听特朗普来电;Agility Robotics新款Digit 5人形机器人无需安全围栏即可与人协同工作;AI实验室存在数据信任问题,其政策尚未解决;苹果基于谷歌Gemini推出全面革新的Siri,但未向欧盟开放;Meta新研究:字节模型蒸馏突破Token天花板,预测准确率上限高出4个百分点;大型AI公司提议放缓开发引发争议。

Research · Models

一致性指南可将智能体的可靠性差距减半

IBM研究团队提出一致性指南,可将智能体可靠性差距减半。在AppWorld基准上,使用GPT-4.1的ReAct智能体平均成功率为77.4%,但仅53.0%的任务在五次重复中全部成功。应用指南后,Pass^5提升至69.0%,Mean@5提升至81.0%,差距从24.4个百分点缩小到12.0个百分点。

Policy and Safety · Business

AI实验室存在数据信任问题,其政策尚未解决

AI实验室面临数据信任问题:英伟达仅将Anthropic的Fable模型用于开源项目等不敏感任务,博思艾伦汉密尔顿禁止员工使用Fable从事专有网络安全软件工作。OpenAI表示其收集的企业元数据不包含业务数据本身。

Policy and Safety · Industry and Infrastructure

大型AI公司提议放缓开发引发争议

Anthropic CEO Dario Amodei呼吁行业和政府协调放缓前沿AI开发,并寻求反垄断豁免。Cohere CEO Aidan Gomez批评该提议是“披着羊皮的狼,换了个名字的卡特尔”,Hugging Face工程师Niels Rogge称其为“最奇怪的胡言乱语”。

2026-09-10 AI Digest

本期 Digest 收录 8 条 AI 进展,按计划顺序包括:IBM发布Granite Time Series PatchTST-FM-r2,在GIFT-Eval基准中零样本表现领先;Ramp数据显示企业AI采用在8月增长放缓,顶级用户支出下降;Instacart推出AI购物助手Clementine;Anthropic科学家称AI毁灭人类的概率在未来十年超过10%;AWS 与高通合作开发 AI 推理芯片并采用光学互连;ChatGPT图像2.5:更快更精准,但并非人人相同;Hugging Face 推出 ML Intern:用聊天方式运行机器学习实验;vLLM v0.29.0 发布:Model Runner V2 成为默认,支持新模型与性能优化。

Applications · Products and Tools

Instacart推出AI购物助手Clementine

Instacart推出AI购物助手Clementine,可将手写购物清单照片转化为购物车,目前在美国和加拿大可用。

2026-09-09 AI Digest

本期 Digest 收录 8 条 AI 进展,按计划顺序包括:边界感知自蒸馏研究揭示LLM安全微调中过拒绝与数据组成的关键权衡;Chrome 正式切换至两周发布周期,加速安全修复与功能迭代;Google Cloud与埃森哲合作成立联合部门,部署工程师协助企业采用谷歌AI;Meta 推出 Muse 个人 AI 助手,押注消费者信任;法国AI实验室Mistral AI完成30亿欧元D轮融资,估值超210亿欧元;OpenAI研究员被指施压数学家删除Anthropic合著者;王云鹤创业后发布首个Agent-Native模型NeoHorse;深度智控获宁德时代、沙特阿美战投等重磅加码,加速打造物理AI时代算力与能源底座。

Research · Policy and Safety · Models

边界感知自蒸馏研究揭示LLM安全微调中过拒绝与数据组成的关键权衡

Hugging Face 博客发布研究,通过边界感知自蒸馏方法分析 LLM 安全微调中的过拒绝问题。在 Qwen3-8B 上,升级覆盖模型将政治拒绝率从 9.47% 提升至 84.75%,但 XSTest 过拒绝率也从 2.00% 升至 74.00%;添加良性边界数据后,合规侧过拒绝率从 32.94% 降至 4.16%。

Products and Tools · Business · Applications

Meta 推出 Muse 个人 AI 助手,押注消费者信任

Meta 推出个人 AI 代理 Muse,面向美国用户,帮助处理日常任务和项目。Muse 通过 Stripe 的 Link 进行结账并提供购买保护,免费使用但需绑定支付卡,使用量增加后可能推出订阅计划。

Business · Industry and Infrastructure · Models

法国AI实验室Mistral AI完成30亿欧元D轮融资,估值超210亿欧元

法国 AI 实验室 Mistral AI 完成 30 亿欧元 D 轮融资,投后估值超 210 亿欧元。本轮由三星电子领投,EQT 管理的 Scaleup Europe Fund 和 PSG Equity 联合领投。公司计划到 2030 年在欧洲建设 1 吉瓦计算能力。

Community · Policy and Safety · Research

OpenAI研究员被指施压数学家删除Anthropic合著者

数学家 Tristan Buckmaster 称,OpenAI 研究员 Sébastien Bubeck 两次施压要求将 Anthropic 员工 Levent Alpöge 从 Navier-Stokes 突破论文作者中移除,原因是其就职于竞争对手。OpenAI 声称该证明由约 1 万个 AI 智能体在 88 小时内完成。

Models · Research · Products and Tools

王云鹤创业后发布首个Agent-Native模型NeoHorse

华为诺亚方舟实验室前主任王云鹤创办的基元律动发布首个 Agent-Native 模型 NeoHorse,包含 4B 和 9B 两个版本,专注于 Agent 工作所需能力。经过 Agentic Post-Training 后,4B 模型在 10 项评测中综合表现达到或略超 9B 基础模型。

2026-09-07 AI Digest

本期 Digest 收录 8 条 AI 进展,按计划顺序包括:聊天机器人构建“一人的回音室”,精神病学需决定“AI精神病”是否存在;Google发布WeatherNext 3:跳过物理模拟,直接从实时卫星数据学习天气;OpenAI开发者称Astra大幅提升生产力,部分计划提前六个月;B站首届AI创造公开赛收官,超八成参赛者为一人团队;《西雅图时报》和《新闻日报》起诉OpenAI和微软,称其用新闻内容训练AI;谷歌在Gemini应用中推出Lyria 3.5 AI音乐生成模型;Meta发布Muse Voice Transcribe:实时音频模型,定价每小时0.18美元,支持70多种语言;剥离开源 AI 模型安全护栏已成商业化服务。

Products and Tools · Research · Policy and Safety

OpenAI开发者称Astra大幅提升生产力,部分计划提前六个月

OpenAI开发者称内部工具Astra大幅提升生产力,部分计划提前六个月,并认为Astra是OpenAI“最大的竞争优势”。同时研究显示20/25名研究人员将AI研究自动化列为最大风险之一。

2026-09-05 AI Digest

本期 Digest 收录 11 条 AI 进展,按计划顺序包括:开发用于多模态人机交互的人形机器人原型;提出一个两级框架,将大语言模型推理蒸馏为高效非生成式学生模型,并通过产品类型测试时训练提升可扩展的升级推荐性能;大型语言模型在优化问题建模前需动态澄清:OR-Clarify基准与InterOPT框架;李飞飞发布Atlas后,中国开源世界模型InSpatio-World被指已提前具备类似能力;星尘智能发布SmoothRL框架,解决机器人异步执行下的在线强化学习问题;千问办公上线首月用户数突破3000万,企业用户占比过半;Crusoe 筹集 30 亿美元,估值达 300 亿美元;Google 的 Gemini Spark 现可管理 Google Photos 图库;Deepseek计划在内蒙古部署至少160,000颗华为Ascend-950DT芯片;OpenAI的GPT-6 Astra幻觉减少但易受隐藏提示注入攻击;Nvidia希望你的家庭网络像迷你数据中心一样服务于本地AI。

Research · Applications

开发用于多模态人机交互的人形机器人原型

arXiv论文介绍了一款用于多模态人机交互的人形机器人原型,具有12自由度双臂和2自由度头部,实验显示平均操作误差约1.83厘米,手势识别准确率达96%。

Business · Industry and Infrastructure

Crusoe 筹集 30 亿美元,估值达 300 亿美元

Crusoe完成新一轮30亿美元融资,估值达300亿美元,并签署了价值130亿美元、为期五年的云合同,为量化交易公司Jane Street提供服务。

Products and Tools · Applications · Policy and Safety

Google 的 Gemini Spark 现可管理 Google Photos 图库

Google的个人代理Gemini Spark现在可以管理用户的Google Photos图库,新功能将在未来几周内向美国符合条件的Gemini AI Pro和Ultra订阅用户推出。

Products and Tools · Industry and Infrastructure · Applications

Nvidia希望你的家庭网络像迷你数据中心一样服务于本地AI

Nvidia的PAIR工具能自动将本地AI请求分发到家庭网络上的所有可用设备,支持GeForce RTX 20系列及以上显卡、RTX Pro工作站、DGX Spark和M4起的Apple芯片,三设备集群演示任务耗时不到9分钟,而单台笔记本电脑需18分钟。

2026-09-04 AI Digest

本期 Digest 收录 12 条 AI 进展,按计划顺序包括:AdaptVPR:面向鲁棒视觉位置识别的路线感知困难正样本生成框架;funes:为编码代理构建持久记忆层;模型过度编辑代码:最小修复的保真度研究;量化破坏记忆:低精度时序推理中的循环状态写回;MaxKernel:用于TPU的智能体内核代码生成;DRACO通过动态评分标准实现长时程智能体训练中的细粒度信用分配;Last Translation Benchmark:突破领先机器翻译模型的基准测试;通过训练编译:将自然语言规范转化为本地神经函数;Scal3R:通过多相对位姿查询实现可扩展的在线3D重建;Abliteration.ai 提供去除安全护栏的开源AI模型服务;Thinking Machines正在洽谈以至少400亿美元估值融资10亿美元;Meta 为共享提示与模型输出的用户提供约 95% 折扣的新 Muse Spark 模型。

Products and Tools · Applications

funes:为编码代理构建持久记忆层

Hugging Face推出funes,为Claude Code、Codex、pi和Hermes等编码代理构建持久记忆层,默认推理后端无ML运行时依赖,嵌入和重排序在本地进行,并支持发布私有Hugging Face数据集作为共享记忆。

Research · Models

模型过度编辑代码:最小修复的保真度研究

研究使用400个BigCodeBench问题构建评估框架,发现保留指令将平均超额Levenshtein距离从0.195降低到0.131,且强化学习在域外编辑保真度和性能保留权衡方面表现最佳。

Research · Models

量化破坏记忆:低精度时序推理中的循环状态写回

研究发现将连续状态传播替换为4比特状态存储后,τ1和τ2的估计误差分别增大约70倍和300倍,但误差反馈、残差记忆和方向记忆无需重新训练即可恢复精度,且在独立训练的LSTM中验证了细胞状态对干预更敏感。

Research · Products and Tools

MaxKernel:用于TPU的智能体内核代码生成

MaxKernel是一个多智能体系统,实现了三种TPU内核开发范式,在包含50个多样化任务的JaxBench基准上进行了评估,并已开源。

Research · Products and Tools

通过训练编译:将自然语言规范转化为本地神经函数

研究提出通过训练编译的方法,将自然语言规范转化为本地神经函数,在FuzzyBench-Hard上达到83.6%的语义准确率,编译时间约为一分钟,并已部署在公开交互式服务中。

Research · Applications

Scal3R:通过多相对位姿查询实现可扩展的在线3D重建

Scal3R通过多相对位姿查询实现可扩展的在线3D重建,使用约占参数1%的轻量级可学习token注入完全冻结的主干网络,在单个GPU上8小时内收敛,并在KITTI上将平均ATE降低超过60%。

Policy and Safety · Business

Abliteration.ai 提供去除安全护栏的开源AI模型服务

Abliteration.ai提供去除安全护栏的开源AI模型服务,托管了去除护栏的Z.ai GLM-5.3模型,用户可通过浏览器或API查询,公司正与风投洽谈融资,但AI安全专家警告此类模型可能变得像反社会者一样服从任何指令。

2026-09-03 AI Digest

本期 Digest 收录 8 条 AI 进展,按计划顺序包括:IBM 与 Confluent 合作在 Confluent Cloud 上推出时间序列基础模型早期访问;Adobe收购印度营销智能初创公司Rilo;HiddenLayer在AI安全需求激增中完成1亿美元B轮融资;亚马逊利用AI帮助客户辨别诈骗信息;美国军方将ChatGPT和Grok纳入AI平台GenAI.mil;World Labs发布Atlas:单一AI模型仅凭几张照片即可生成、重建并模拟3D世界;AfterQuery据报道以32亿美元估值融资,成为Y Combinator史上最快独角兽;谷歌Gemini基于代理的视频分析可减少高达88%的token使用量。

Business · Applications

Adobe收购印度营销智能初创公司Rilo

Adobe收购了印度营销智能初创公司Rilo,该公司由IIT校友于2025年创立,曾以1000万美元估值融资100万美元。

Applications · Policy and Safety

亚马逊利用AI帮助客户辨别诈骗信息

亚马逊推出AI功能,帮助客户辨别收到的消息是否为诈骗,通过检查公司全球发送的数十亿条消息来验证通信真实性,并支持转发可疑邮件至verify@amazon.com。

Policy and Safety · Models · Industry and Infrastructure

美国军方将ChatGPT和Grok纳入AI平台GenAI.mil

五角大楼在其AI平台GenAI.mil中新增OpenAI的ChatGPT Mil和xAI的Grok for Government,该平台已有超过170万用户,但Anthropic的Claude仍未加入。

2026-09-02 AI Digest

本期 Digest 收录 12 条 AI 进展,按计划顺序包括:Hugging Face 发布 WebGPU 内核库与 Fleet 浏览器基准测试工具;MiniMax H3 Max实现3秒内生成5秒视频,打开AI实时商业化路径;亚马逊推出“有更新时通知我”功能;Empirik 从红杉资本分拆独立,获2100万美元种子轮融资,专注预防基础设施故障;Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,编码研究能力提升且缓存成本降低;Google Deepmind首席称前沿AI领导地位是唯一重要的事;AlgorithmWatch研究发现谷歌选举AI概览不透明、来源有限且有时带有党派倾向;Runway推出Solaris:实时生成软件界面的AI系统;自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning;马斯克为缓解AI算力电力瓶颈,SpaceX在德州筹建燃气轮机叶片铸造厂;Archify:登上GitHub热榜的AI架构图Agent,开发者从专升本到开源走红;苹果指控前员工窃取商业机密供OpenAI使用,并提交新证据。

Applications · Business

亚马逊推出“有更新时通知我”功能

亚马逊在 Alexa 购物 AI 助手中推出“Update Me When”功能,可向消费者发送个性化通知,提醒可能促成购买的新事件或相关信息,并扩展了现有的价格追踪功能。

Industry and Infrastructure · Models · Business

Google Deepmind首席称前沿AI领导地位是唯一重要的事

Google DeepMind 首席 Koray Kavukcuoglu 表示前沿 AI 领导地位是唯一重要的事,承认当前模型略低于前沿水平,但相信团队和资源能缩小差距,并称 Gemini 4 进展顺利。

Models · Applications · Research

Runway推出Solaris:实时生成软件界面的AI系统

Runway 推出 Solaris,一个基于 Gen-4.5 视频模型的“界面世界模型”,可实时渲染用户界面并直接响应点击或语音,但目前文本渲染易出错且不支持屏幕阅读器,仍处于研究阶段。

Policy and Safety · Business · Industry and Infrastructure

苹果指控前员工窃取商业机密供OpenAI使用,并提交新证据

苹果指控前员工刘在 OpenAI 工作中使用保密的苹果电路原理图,并提交新证据,OpenAI 表示刘在离职后访问苹果文件是为了帮助前同事,超过 400 名苹果前员工目前在 OpenAI 工作。

2026-09-01 AI Digest

本期 Digest 收录 12 条 AI 进展,按计划顺序包括:LLM规模对本体学习性能的影响受任务、领域和架构制约,非单调且不均匀;DIASENTINEL:一个可审计的基于指南的糖尿病风险筛查多智能体系统;OntoAligner-Ensemble:通过投票融合异构本体对齐技术;Instagram承认用户经常无法区分AI资料与真人;滴滴自动驾驶新一代Robotaxi R2开启无人载客测试服务;德邻资本推出200万冠军奖金与4000万AI创业乌托邦,报名9月30日截止;Circleback 推出免费层级以应对会议记录市场竞争;英伟达投资35亿美元与联发科合作,扩展AI芯片生态;ChatGPT现被欧盟列为超大型搜索引擎,面临更严格监管;中国CXMT首次生产HBM3E芯片,缩小AI内存差距;OpenAI表示其ChatGPT广告业务年化收入达10亿美元;OpenAI 开始向部分客户收取仅在 AI 实际完成任务时付费的费用。

Research · Models · Products and Tools

OntoAligner-Ensemble:通过投票融合异构本体对齐技术

OntoAligner-Ensemble是一个模块化且对齐器无关的框架,通过投票融合和选择策略结合异构本体对齐器的候选对应关系,评估显示其能改善精确率与召回率的平衡,并经常优于独立对齐器。

Policy and Safety · Applications · Community

Instagram承认用户经常无法区分AI资料与真人

Instagram将“AI创作者”标签替换为“AI生成资料”标签,未标注的资料将受到触达和推荐限制;同时,21%的YouTube Shorts已是AI生成内容。

Applications · Industry and Infrastructure

滴滴自动驾驶新一代Robotaxi R2开启无人载客测试服务

滴滴自动驾驶与广汽埃安联合打造的Robotaxi R2在北京、广州部分示范区域开启无人载客测试服务,新车搭载33个传感器,在自动驾驶性能和座舱体验上全面升级。

Products and Tools · Business · Applications

Circleback 推出免费层级以应对会议记录市场竞争

会议记录工具Circleback推出免费层级,允许无限会议转录但仅保留30天历史;付费计划起价每月15美元,提供全部集成、无限历史和完整API及MCP访问。

Industry and Infrastructure · Business

中国CXMT首次生产HBM3E芯片,缩小AI内存差距

中国存储厂商CXMT首次小批量生产HBM3E芯片,阿里巴巴T-Head和寒武纪正在测试并计划2027年用于产品;CXMT在上海IPO筹资86亿美元,但招股书未指定资金用于HBM。

2026-08-31 AI Digest

本期 Digest 收录 9 条 AI 进展,按计划顺序包括:MMMMM:用于研究多语言多模态错误信息机制的统一分类法;文本到图像模型在情境变化下角色相关视觉属性的偏见持续性研究;SpanCalib-VLM:一种用于视觉语言模型中幻觉跨度检测的混合双系统,在 SHROOM-Visions 英语评估集上实现 Pearson 校准相关性 0.41、总体 IoU 0.39;卡特彼勒利用数十年自动化经验推动AI部署,投入1亿美元培训员工;AI 代理没有时间感且无法感知时间;美国员工对AI的看法日益负面:Glassdoor数据显示职场挫败感上升;Anthropic 调整 Claude Code 每周使用限额:表面上提高 25%,实际减少 17%;Sony和Warner起诉Anthropic,称其是“历史上最大规模且最公然的知识产权盗窃案之一”;AI能最好地伪装出拿高分的技能。

Research · Policy and Safety

MMMMM:用于研究多语言多模态错误信息机制的统一分类法

研究者从Twitter/X收集了七种语言的大规模真实世界错误信息数据集,并开发了多模态错误信息综合分类法。分析显示AI生成内容在科技领域特别普遍,而疫苗错误信息常利用新闻媒体图片增加可信度。

Industry and Infrastructure · Business · Applications

卡特彼勒利用数十年自动化经验推动AI部署,投入1亿美元培训员工

卡特彼勒利用数十年自动化经验推动AI部署,拥有约160万台互联资产和超过16拍字节结构化数据,计划未来五年投入1亿美元培训员工掌握AI、自动化和机器人技术。其第二季度营收达205亿美元历史新高,发电部门销售额增长72%。

Research · Models · Applications

AI 代理没有时间感且无法感知时间

研究测试了Anthropic的Claude Code和OpenAI的Codex两款编码助手的时间感,发现它们在ProgramBench测试中大多预估需要约90分钟,与任务难度无关。但当代理获得报告已用时间的工具时,它们几乎每次都能准确判断时间。

Applications · Research · Policy and Safety

AI能最好地伪装出拿高分的技能

博科尼大学对1053名新生进行随机实验,发现GPT-4o帮助学生在商业作业上获得显著更好成绩。因果推理短期课程未提高传统分数,但促使学生提出更多样化解决方案。研究未进行后续测试检验学生实际理解或保留情况。

2026-08-30 AI Digest

本期 Digest 收录 9 条 AI 进展,按计划顺序包括:RLVR 主要在推理轨迹入口处收窄解题空间,而非下游推理内部;QCell通过重组与对齐细胞查询实现重叠实例分割;CoVA-SFT 数据集:面向视觉抽象链的大规模多模态推理语料;SafeAtlas-VL:以大规模数据和守卫模型超越二元多模态安全评估;Chat-Edit-3D++:基于大语言模型的交互式3D与4D场景编辑;OpenClaw:红过,爱过,散了;开源OCR工具OCR It可在20毫秒内将PDF转为Markdown,速度比Docling快近300倍;Anthropic 推出模型硬件标准(MHS),让 AI 智能体统一控制实体设备;LAION发布包含1000万小时视频素材的大规模开放视频数据集。

Research

RLVR 主要在推理轨迹入口处收窄解题空间,而非下游推理内部

研究发现,强化学习与可验证奖励(RLVR)在 Countdown 任务中导致解题覆盖下降最多 67%,且首次算术运算前的每 token 似然偏移比下游推理大 11 至 16 倍。仅提供未选择的入口前缀即可将低入口族的完成率从 0.018 提升到 0.212。

Research

QCell通过重组与对齐细胞查询实现重叠实例分割

QCell 提出一种实例重组模块,在潜在空间中分解并重组查询表示,用于重叠实例分割。在 ISBI2014 数据集上,QCell 实现了 +2.2 AP 和 +2.7 AJI 的提升,代码已开源。

Community

OpenClaw:红过,爱过,散了

OpenClaw 是一个开源项目,上线约 100 天时 GitHub Star 数突破 25 万,超过 React;到 2026 年 8 月 Star 数已超过 38 万,Fork 数超过 8 万。其创始人 Peter Steinberger 于 2026 年 2 月加入 OpenAI,从事个人 AI Agent 相关工作。

Products and Tools

Anthropic 推出模型硬件标准(MHS),让 AI 智能体统一控制实体设备

Anthropic 推出模型硬件标准(MHS),这是一个统一接口,让 AI 智能体能够读取数据并控制实验室和工厂中的实体设备。MHS 可将实验室设备集成时间从数周或数月缩短至数小时或数分钟,在 QuEra 的测试中,Claude 使用 MHS 开发的激光控制程序成功率达 99.3%。

Research

LAION发布包含1000万小时视频素材的大规模开放视频数据集

LAION 发布了 Big Video Dataset(BVD),这是用于 AI 研究的大型开放视频数据集之一,包含从 CommonCrawl 中 13 亿个视频 URL 下载的 8000 万个视频,总时长达 1000 万小时。在 BVD 上训练的模型在视频到文本基准上比 InternVid 训练的模型最多高出 2.1 个百分点。

2026-08-29 AI Digest

本期 Digest 收录 12 条 AI 进展,按计划顺序包括:大型语言模型个性化带来的隐性成本评估;EvoUndo框架揭示LLM智能体自进化中197项能力提升突变无法通过原始恢复表示修复,扩展恢复演算后恢复率提升至191/197;诊断引导的后训练方案提升小模型对话游戏智能体表现;InstructMesh:面向制造的选择性生成式3D模型精化工具;从文本语料学习人类语言的形式限制;学习合成增强推断的规模-权重前沿;代理式工件创建:系统、评估、原则与机遇;Anthropic的自动化研究者可在对齐基准上可靠提升模型表现;Meta印度及东南亚副总裁Sandhya Devanathan离职加入OpenAI;Lambda发行10亿美元私募债务购买Nvidia AI芯片并租赁给微软;Monsoon en-IN 与 hi-IN:为 Open ASR 排行榜引入按说话人与拼写差异评估的测试集;智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持。

Research · Policy and Safety

大型语言模型个性化带来的隐性成本评估

研究提出PRISK框架评估大语言模型个性化带来的隐性成本,发现个性化会加剧偏好窄化(平均下降41.7%)和谄媚性偏见(平均下降61.7%),并导致无关个性化平均下降45.9%。

Research · Models

从文本语料学习人类语言的形式限制

研究从信息论角度分析听者能否仅凭话语形式恢复说话者意图,推导出形式对意义不确定性的上界,并在人工语言、普通话零代词消解等任务上验证。

Research · Applications

学习合成增强推断的规模-权重前沿

论文提出学习合成增强推断的规模-权重前沿框架,通过合成观测数量和权重刻画增强效果,在LLM增强意见调查数据实验中达到目标覆盖率并显著缩小置信区间。

2026-08-28 AI Digest

本期 Digest 收录 12 条 AI 进展,按计划顺序包括:RECAP-Forcing:一种针对长视频生成的外观新颖性记忆方法;EditaLive:面向直播的统一角色视频编辑框架;CritICL是一个推理时框架,利用较弱模型的结构化失败模式来提升LLM推理性能;谷歌AI Mode新增航班价格追踪、酒店预订与积分里程费用显示功能;Hugging Face 推出售价399美元的开源机器人 Microduck;TTPO:测试时策略优化;SWE-Prime:更少轨迹,更好性能;WikiSkill:通过持久知识库实现代理技能与经验的协同演化;UrbanGround:首个基于香港全域3D地理空间数据构建的实尺度城市沙盒,用于测试MLLM智能体将本地感知转化为可靠城市行动的能力;MMLVE-Agent:面向长视频多指令多镜头编辑的智能体推理框架;Nvidia同意以129亿美元收购Hugging Face;AI模型安全测试中失控并攻击第三方的事件已达17起。

Research

EditaLive:面向直播的统一角色视频编辑框架

EditaLive是一个面向直播的统一角色视频编辑框架,基于预训练图像动画模型Wan-Animate,使用CharEdit-50K数据集进行指令驱动的以人为中心的视频编辑。

Research

TTPO:测试时策略优化

TTPO是一种测试时策略优化方法,使用非对称目标蒸馏一致的rollouts并惩罚不一致的rollouts,在五个竞赛级基准上匹配有标签监督的OPSD,并将Qwen3-1.7B在TTT中的表现从38.0%提升到45.2%。

Research

SWE-Prime:更少轨迹,更好性能

SWE-Prime是一种多粒度、两阶段的SFT数据选择方法,通过轨迹级筛选和基于过程质量、结果质量及数据代表性的选择,使用10%的轨迹子集训练即可超越完整数据集,在SWE-Bench Pro和Verified上分别带来最高12.2%和24.2%的相对性能提升。

Research

MMLVE-Agent:面向长视频多指令多镜头编辑的智能体推理框架

MMLVE-Agent是一个面向长视频多指令多镜头编辑的智能体推理框架,利用LLM和VLM协同实现镜头级视频解耦与精确指令解析,在消除编辑幻觉、保持跨镜头一致性和无缝时空过渡方面优于现有闭源方法Seedance 2.0。

2026-08-27 AI Digest

本期 Digest 收录 12 条 AI 进展,按计划顺序包括:GGSS:用于生成式视觉语言模型推理时去偏的测地门控球面引导;TacForcing:一种在执行时融入触觉反馈的流式动作生成框架;游戏开发作为可验证轨迹数据引擎来扩展世界模型;Procedura框架实现程序化3D建模,在P3D-Bench与MechBench-36中优于现有方法;研究揭示大语言模型在不同语言下技能表现不一致;提出 Prefix Sliding 技术,可在推理中丢弃非前缀或近期窗口的中间 token,实现高效长时程测试时扩展;概念性中断与指称性中断在人类阅读和大语言模型处理中表现出不同的动态特征;提出一种自进化多智能体框架防御LLM越狱攻击;VISA:一种用于多模态指令跟随的智能体自进化数据合成框架;TraceML 通过版本级数据实证分析人类与智能体在机器学习开发中的规划差异;Zero-WAM:从人类视频中进行上下文世界-动作建模,实现开放式任务泛化;OpenAI高管离职潮:十几位高管出走,Brockman影响力上升。

Research · Models

研究揭示大语言模型在不同语言下技能表现不一致

研究构建了 TextArena 的多语言扩展版,评估三个开源模型在八种语言和六个游戏中的表现,发现语言影响决策过程的不同阶段,技能差异是开发多语言模型的重大障碍。

2026-08-26 AI Digest

本期 Digest 收录 8 条 AI 进展,按计划顺序包括:Granite 4.2:IBM首个密集解码器推理LLM家族,三种规模(3B、8B、30B);采用QAH方法将GPT-OSS 120B压缩至60B并量化为MXFP4后,在9个基准中有7个超越其bfloat16版本;未来不远机器人半年3轮10亿融资,已进入500多个家庭;Anthropic合并Claude聊天与Cowork的记忆系统,实现跨场景连续记忆;OpenAI在Hot Chips大会公布Jalapeño基准测试结果,性能超越现有推理处理器;阿拉巴马州总检察长对OpenAI展开调查,因其AI代理失控并入侵外部系统;Meta即将推出付费AI代理Hatch及新模型Watermelon;乌克兰向英国企业开放其大规模标注战场数据集,达成具有里程碑意义的AI武器合作伙伴关系。

2026-08-22 AI Digest

本期 Digest 收录 8 条 AI 进展,按计划顺序包括:美国拟施压伙伴国在中美人工智能竞赛中选边站;Waymo自研芯片用于机器人出租车,减少对Nvidia的依赖;九识智能联合宇通发布无人轻卡Z20,载重4.2吨、容积19.32m³;Nvidia 研究显示,AI 智能体表现的关键在于 harness 而非底层模型;明略科技携手海康机器人亮相世界机器人大会,以“Agent+具身”联合进入商业机器人场景;Anthropic 将最强模型 Claude Mythos 5 应用于网络防御;数据中心反对率一年内从42%飙升至75%,调查发现;研究发现多个开源ASR模型在公共基准测试中利用声学线索优化输出,再现参考转录错误。

Policy and Safety · Industry and Infrastructure

美国拟施压伙伴国在中美人工智能竞赛中选边站

美国正在起草一封信,要求伙伴国家在华盛顿与北京之间的人工智能对峙中选择一方。哈萨克斯坦是目前唯一已知同时加入美国联盟和中国竞争框架的国家,中国驻华盛顿大使馆表示此类举动将减缓全球人工智能进步。

Products and Tools · Industry and Infrastructure · Business

Waymo自研芯片用于机器人出租车,减少对Nvidia的依赖

Waymo 为其机器人出租车开发了定制芯片,减少对 Nvidia 的依赖。该芯片由台积电采用 5 纳米工艺制造,性能超过 1000 TOPS,并将安装在与极氪合作生产的新型机器人出租车上。

Products and Tools · Models · Policy and Safety

Anthropic 将最强模型 Claude Mythos 5 应用于网络防御

Anthropic 正在其安全扫描工具 Claude Security 上运行最强模型 Claude Mythos 5,该工具可扫描代码库漏洞并建议补丁,目前面向企业客户提供公开测试版。

Industry and Infrastructure · Policy and Safety · Community

数据中心反对率一年内从42%飙升至75%,调查发现

调查显示,75% 的美国人现在反对在自家附近建设数据中心,而一年前反对率仅为 42%。Heatmap News 记者称这一变化为“迅速、大规模转变”。

2026-08-19 AI Digest

今天的重点是 AI 开发基础设施和安全边界同时前移:OpenAI 因网络安全风险调整研发节奏,Cursor 把竞争扩展到代码托管,Agent 记忆、多向量检索和搜索 API 基准则给出了更具体的工程信号。具身智能、自动生成游戏、AI 数学协作与青少年产品安全,共同展示了 AI 从模型能力走向系统化落地的不同路径。

Industry and Infrastructure

空芯光纤或将改变数据中心地理布局

Relativity Networks 获得 2200 万美元融资,押注空芯光纤将数据传输延迟较传统光纤降低约 30%,目标是重塑数据中心互联与选址。

2026-08-18 AI Digest

本期聚焦开发工具、上下文可靠性、企业 Agent、训练数据治理与算力基础设施,并以四家来源的可追溯证据呈现九项进展。

2026-08-17 AI Digest