Research
RLVR 主要在推理轨迹入口处收窄解题空间,而非下游推理内部
研究发现,强化学习与可验证奖励(RLVR)在 Countdown 任务中导致解题覆盖下降最多 67%,且首次算术运算前的每 token 似然偏移比下游推理大 11 至 16 倍。仅提供未选择的入口前缀即可将低入口族的完成率从 0.018 提升到 0.212。
Daily Digest
本期 Digest 收录 9 条 AI 进展,按计划顺序包括:RLVR 主要在推理轨迹入口处收窄解题空间,而非下游推理内部;QCell通过重组与对齐细胞查询实现重叠实例分割;CoVA-SFT 数据集:面向视觉抽象链的大规模多模态推理语料;SafeAtlas-VL:以大规模数据和守卫模型超越二元多模态安全评估;Chat-Edit-3D++:基于大语言模型的交互式3D与4D场景编辑;OpenClaw:红过,爱过,散了;开源OCR工具OCR It可在20毫秒内将PDF转为Markdown,速度比Docling快近300倍;Anthropic 推出模型硬件标准(MHS),让 AI 智能体统一控制实体设备;LAION发布包含1000万小时视频素材的大规模开放视频数据集。
共 9 条已审核进展
Research
研究发现,强化学习与可验证奖励(RLVR)在 Countdown 任务中导致解题覆盖下降最多 67%,且首次算术运算前的每 token 似然偏移比下游推理大 11 至 16 倍。仅提供未选择的入口前缀即可将低入口族的完成率从 0.018 提升到 0.212。
Research
QCell 提出一种实例重组模块,在潜在空间中分解并重组查询表示,用于重叠实例分割。在 ISBI2014 数据集上,QCell 实现了 +2.2 AP 和 +2.7 AJI 的提升,代码已开源。
Research
CoVA-SFT 是一个包含 51,900 个样本和超过 222,000 个多模态推理步骤的结构化语料库,并配套 CoVA-Bench 基准。在该语料上微调的模型在 CoVA-Bench 上平均比交错 CoT 基线高出 2 倍以上。
Research
SafeAtlas-VL 数据集包含 150 万个训练实例,在图像、请求和响应层面进行五级有序评分,并推出 SafeAtlas-Bench 基准。其 8B 模型在 F1 分数上比之前的 SOTA 高出约 4%。
Research
CE3D++ 是一种基于大语言模型的对话式 3D 场景编辑方法,通过创建轨迹数据集并微调,使较小的 LLM 能够准确调度多达 30 种不同的视觉工具。源代码和模型已开源。
Community
OpenClaw 是一个开源项目,上线约 100 天时 GitHub Star 数突破 25 万,超过 React;到 2026 年 8 月 Star 数已超过 38 万,Fork 数超过 8 万。其创始人 Peter Steinberger 于 2026 年 2 月加入 OpenAI,从事个人 AI Agent 相关工作。
Products and Tools
OCR It 是一款适用于 Chrome 和 Firefox 的免费浏览器插件,可在 20 毫秒内将不可复制的 PDF 文件内容提炼为 Markdown 格式。在处理质量与 Docling 相当的前提下,其速度比 Docling 快近 300 倍。
Products and Tools
Anthropic 推出模型硬件标准(MHS),这是一个统一接口,让 AI 智能体能够读取数据并控制实验室和工厂中的实体设备。MHS 可将实验室设备集成时间从数周或数月缩短至数小时或数分钟,在 QuEra 的测试中,Claude 使用 MHS 开发的激光控制程序成功率达 99.3%。
Research
LAION 发布了 Big Video Dataset(BVD),这是用于 AI 研究的大型开放视频数据集之一,包含从 CommonCrawl 中 13 亿个视频 URL 下载的 8000 万个视频,总时长达 1000 万小时。在 BVD 上训练的模型在视频到文本基准上比 InternVid 训练的模型最多高出 2.1 个百分点。