数据点
8 月 14 日晚 7 点 25 分(上海),小红书 dots 模型实验室把 dots3-note Preview 的权重丢到了 Hugging Face 和 GitHub。这是 dots3 系列的首个开源版本,也是国际数学奥林匹克(IMO)2026 上官方认证 42/42 满分金牌的同系列模型向社区开放的首批成果。280B 总参、16B 激活参、512K 上下文,三模态理解(文本、视觉、语音),Apache 2.0 协议,模型结构已提交 Transformers。
技术架构上,这次开源同时把三块东西一起放出来:dots3-note Preview 权重、配套的两个真实任务评测环境 VibeSearchBench 与 VibeLifeBench、以及训练框架 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。三件套是同一套思路的三个面:模型要解决长程任务,先得有评测基座,再得有训练范式。华为反应极快——发布当天宣布昇腾 Atlas 800 A3 / 900 A3 SuperPoD 已经完成 vLLM Ascend 引擎的 0-Day 全量适配,并通过 FlashComm 通信优化、FUSED_MC2 算子重构、MTP 投机解码三层叠加把 MoE 推理吞吐拉上去。
它解决了什么
大模型这两年在「数学题、编程题、工程题」这类有明确对错、闭环快的任务上跑得飞快。但旅行规划、装修筹备、婚礼组织这类真实生活任务有几个共同麻烦:没有唯一答案、可能要横跨数小时到数天、约束是逐步披露的、过程中还要应对价格变动和天气变化。小红书这次开源的目标很直白——把模型从「数学竞赛选手」逼成「长程生活任务的执行者」。
具体到方法论,TEMPO 用一个不依赖终局稀疏奖励的强化学习范式来训练长程任务:把整个任务切分为多个 macro-step,每个 macro-step 内部有多轮模型-环境交互;macro-step 结束时同一个 Agent 从 actor 切到 critic,用 test-time scaling 的推理估计当前预期剩余回报。这个范式让「评价比生成更简单」这件事在长程任务上真的成立。开源稿件给出的实证数字是:在 ARC-AGI-3 上,TEMPO 平均分比 baseline checkpoint 高 31.5%,比 GRPO 高 20.6%。
配套评测同样有数字底子。VibeSearchBench 覆盖 20 个领域 200 个任务,工具集是 search / visit / code;VibeLifeBench 覆盖 10 个领域 20 个跨阶段任务,每个任务跨 20-30 个阶段,配套 1,247 项 atomic checks——直接评估跨阶段状态一致性、工具执行结果与最终交付。这套评测和主流闭卷基准不同:当前最强的国内外模型在这套基准上的分数都未能跨过及格线。
它改变了什么
IMO 满分证明的是「推理能力的天花板」,dots3-note Preview 开源把竞争维度拉回了更接近落地的层面:当 70% 的 Codex 用户已经在让模型独立承担一小时以上的工作时,决定 Agent 能不能跨过「数小时到数天」这道门槛的核心能力,已经从单次推理移到「跨阶段自评 + 长程信用分配 + 真实世界约束处理」上。
对国产算力链来说,昇腾 0-Day 全量适配的意义被低估了。dots3-note 是「国产模型 + 国产算力」链路里少见的同代次同窗口适配——发布当天 vLLM Ascend 引擎就跟上来,不需要等几个月等社区断断续续打补丁。政企场景的「自主可控」账本上,这一条比多一个 SOTA 数字更重要。
下一步看点和风险:技术报告承诺一周内发布,到时候会披露具体训练数据量、训练算力消耗和正式逐项对标。当前稿件诚实承认的局限性包括强化学习训练尚不充分、幻觉抑制、文本与多模态能力平衡、稳定性——这些都对应着「真实生活任务要变成可靠真实体验还需要 harness、connector、数据源、安全与权限机制的共同完善」。
参考来源:小红书技术公众号 dots.llm、lifestyle.onebyfourstudio.com、aibase.com、ModelScope 魔搭社区
