小红书开源 dots3-note preview,主打真实生活长程 Agent 任务

小红书开源 dots3-note preview,主打真实生活长程 Agent 任务

N
News Editor
2026-08-14 03:15:40
小红书 dots 实验室宣布开源 dots3 系列首个模型 dots3-note preview。该模型总参数 280B、激活参数 16B,支持 512K 上下文,并具备文本、视觉与语音多模态理解能力。官方将其定位为面向旅行规划、婚礼筹备、家装与经营等长程开放任务的 Agent 模型,同时披露了 TEMPO、自我评价机制,以及 VibeSearchBench 和 VibeLifeBench 两套评测基准。

小红书 dots 模型实验室宣布开源 dots3-note preview。这是 dots3 系列首个开源版本,重点放在更贴近现实、也更难标准化评测的长程任务上。

上个月,小红书自研大模型「dots-note-3.0」在国际奥数竞赛中取得官方认证的满分 42 分。围绕这一系列模型,社区此后最关注的问题之一就是何时开源。此次发布的 dots3-note preview,属于同系列的开源版本。

参数规模与开放入口

从参数来看,dots3-note preview 总参数为 280B,其中激活参数为 16B,支持 512K 超长上下文窗口,并具备文本、视觉与语音多模态理解能力。官方称,该模型针对复杂推理、Agent 和多模态感知做了优化。

  • API 入口:https://dots.ai/platform/
  • Hugging Face:https://huggingface.co/dots-studio/dots3-note-prev
  • GitHub:https://github.com/studio-dots-ai/dots3-note-prev

IMO 满分更多验证了该系列模型在数学推理和证明上的能力,这次开源则把重点放到了另一类任务:旅行规划、婚礼筹备、开店经营等。此类问题往往没有唯一答案,持续时间也可能从数小时延伸到数天甚至更久。

瞄准长程任务,也贴近 Agent 当前演进方向

dots3-note preview 将重心放在长程任务上,对应的正是当前 Agent 发展中的一条主线:模型被要求独立承担更长、也更完整的工作流程。OpenAI 此前披露,今年 5 月,超过 70% 的用户让 Codex 处理需要人类一小时以上才能完成的工作;到 6 月,OpenAI 内部使用量最高的 1% 活跃用户每天产生超过 60 小时的 agent turns。

不过,不同任务场景之间的难度差异很快就会显现。数学、代码和工程等方向,Agent 的表现已经相对成熟;但真实生活环境更开放,需求描述也更模糊。dots3-note preview 选择在这类场景中测试自身能力,重点考验的是长程规划、判断和纠错。

按照官方披露的多项主流 benchmark 数据,在多项推理和智能体任务上,dots3-note preview 可以比肩,甚至超过参数规模数倍于自身的大模型;其视觉能力在同尺寸区间也表现突出。

小红书开源 dots3-note preview,主打真实生活长程 Agent 任务 3

补上 Agent 这块开源拼图

在此之前,小红书已陆续开源文本大模型 dots.llm1、多语言文档布局解析模型 dots.ocr,以及多模态视觉理解大模型 dots.vlm1。最新发布的 dots3-note preview,则补上了 Agent 这一块。

实测案例:从游戏到软件工程

官方在发布中给出了多组实测,用来展示 dots3-note preview 在信息零散、步骤繁多、环境持续变化的任务中,如何独立推进并交付结果。

接管《杀戮尖塔 II》

在《杀戮尖塔 II》的测试里,模型需要在路线选择、拿牌、是否挑战精英、金币使用,以及营地休息还是升级之间不断权衡。这些选择会影响几十个回合之后的生存概率,局部最优并不等于全局更优。

官方称,模型事先并未针对这款游戏进行专门训练,但它可以根据战斗反馈学习卡牌和敌人机制,同时管理生命、牌组、金币与药水,并在商店、营地和精英战之间反复取舍,最终一路打到 33 层。

从零破解 ARC-AGI 3

在 ARC-AGI 3 这类长程推理任务中,规则起初完全未知。模型需要先观察画面,再提出假设,并通过操作不断验证。

根据官方描述,dots3-note preview 逐步发现了两个方块上下同步、左右镜像等规律,并摸索出危险格、可移动标记、压力开关和闸门等机制。每当假设出错后,它会启动 Self-Critiquing 机制重新评估,并把修正后的规则写入 memory.md。这个文件相当于模型的记事本,用于持续保存对环境的动态理解。

小红书开源 dots3-note preview,主打真实生活长程 Agent 任务 4

最终,模型通过 320 步操作解开全部 6 关。

读图处理装修问题

在一个更贴近生活的测试里,用户同时上传户型图和两款冰箱的参数截图,并补充说明:厨房靠近书房一侧的墙面已经做了 1.5 米长的台面,现在想把冰箱放在这面墙上,判断是否还能放下。

这个问题的关键信息分散在多张图片和文字描述中。模型需要结合户型图、既有台面尺寸与两款冰箱规格,计算墙面剩余空间并给出适配结论。官方还提到,模型会主动提醒用户到现场复尺确认。

在沿用同一户型图的情况下,官方继续要求模型为书房设计几套实木风装修方案。模型保留此前识别出的尺寸和采光信息,搜索小红书相关笔记,整理出 4 套实木风方案并生成网页,连续完成读图、计算、检索和内容生成。

端到端完成 visionOS 应用开发

另一组测试要求 dots3-note preview「参考小红书的设计,开发一款 Apple Vision Pro 原生应用」。

接到任务后,模型没有直接进入写代码阶段,而是先理解产品需求,并参考 9 张界面图,自主确定开发方案,包括采用 SwiftUI + RealityKit 技术路线,规划窗口、沉浸式空间和 3D 商品展示等不同模块。方案确定后,它继续准备本地图片和 3D 模型素材,再逐步完成代码实现。

小红书开源 dots3-note preview,主打真实生活长程 Agent 任务 5

整个项目最终生成 12 个 Swift 文件、1876 行代码,实现了信息流、个人主页、私信、商品等界面,并接入 USDZ 3D 模型。随后,模型还自行生成 Xcode 工程,调用 xcodebuild 编译,并在 visionOS Simulator 中完成检查,最终显示「BUILD SUCCEEDED」。

按官方展示,从需求理解、技术选型到代码实现、编译和验证,这套开发流程被完整跑通。最终成品已经具备较完整的空间交互:信息流可以滚动,笔记能够进入详情页,个人主页和私信可以作为独立窗口展开,用户也可以在购物界面中直接查看并切换不同的 3D 商品。

核心方法:主动记忆、长轨迹强化学习与中途自评

从这些案例看,dots3-note preview 的一个突出特征,是在任务过程中边探索、边记住新信息,并在环境变化或判断失误后持续调整,直到交付结果。官方将这一能力拆解为两个关键点:学习并保留真正有用的信息,以及在判断偏差出现时及时发现并修正。

dots 实验室首先面对的问题是,模型在结束训练后,能否继续从环境和用户身上学习。为训练这类能力,实验室构建了数千个不依赖先验知识的超长程新颖环境,让 Agent 在此前未接触过的场景中持续探索,通过与环境交互学习新的规则和知识,并用于后续决策。

官方提到,当任务长度显著超过模型上下文窗口后,模型无法始终依赖上下文中已有的信息。经过强化学习训练后,模型会逐步学会如何保留对后续解题有帮助的信息。这项能力已在 ARC-AGI 3 上得到验证。

按披露数据,dots3-note preview 在 ARC-AGI-3 上以不到 500 美元的成本取得约 0.35 分。其绝对分数低于 Claude Opus 4.8 (high),但成本效率更高。

小红书开源 dots3-note preview,主打真实生活长程 Agent 任务 6

TEMPO:把长轨迹拆成 macro-step

在训练过程中,另一个难点来自探索成本。长程任务中,Agent 完成一次探索可能需要十几个小时。如果继续使用依赖终局奖励的 value-free 强化学习方法,往往要等整条轨迹结束后才能拿到训练信号,效率较低,也难以判断最终成功或失败究竟来自前面的哪一步。

PPO 等 actor-critic 方法可以缓解这一问题,但传统 critic 通常通过一次固定算力的前向计算来估计当前状态价值。面对复杂 Agent 任务,actor 可以反复推理、调用工具后再决定下一步,而 critic 难以做到同样程度,容易导致对当前进展判断不准。

为此,dots 实验室提出了 TEMPO,全称为 Test-time-scaled Value Estimation with Macro-step Policy Optimization。它把一条很长的轨迹切分成多个 macro-step,每个阶段包含多轮模型与环境交互。一个阶段结束后,模型会暂时从 actor 切换到 critic,通过推理、工具调用和 test-time scaling 来估计当前状态未来可能获得的回报,再把这个评价转化为尚未结束轨迹的训练信号。

在 TEMPO 的训练过程中,模型既学习如何行动,也学习如何评价自己当前做得怎样。官方称,借助这种自我评价,强化学习训练可以被放到更长的任务中,并持续优化长轨迹中的行为。

结果显示,TEMPO 的优势主要出现在任务进入后半程之后。随着交互轮次增加,GRPO 和 Base checkpoint 的得分逐渐停滞,TEMPO 仍能继续提升;从通关进度来看,三者也在任务后半程明显拉开差距。

Self-Critiquing 在训练和推理阶段同时发挥作用

在引入 Self-Critiquing 机制后,官方表示,dots3-note preview 的自我评价能力比最初预想更强。即便某个问题暂时还没有解出,模型也能从两个表面相似的中间状态中判断,哪个更有机会取得突破。

小红书开源 dots3-note preview,主打真实生活长程 Agent 任务 7

这类自我评价能力不仅被用于强化学习训练,也体现在推理阶段。官方提到,在此前 IMO 2026 参赛中,dots3-note preview 的同系列分支版本会一边生成证明,一边通过工具调用反复检查证明,并根据评价结果持续修改和优化,最终取得满分。

未来,dots 实验室计划在「开放任务」中继续探索 recursive self-critiquing,让模型在缺少清晰外部奖励的情况下,也能自己判断任务进展,并据此调整记忆和规划后续行动。

为什么把重点放在真实生活长程 Agent

对于小红书这类生活兴趣社区而言,真实生活任务本身就是高频场景。旅行、婚礼、家装、穿搭等问题,往往没有唯一答案,用户的偏好和约束条件也会不断补充,多模态信息密集,任务目标甚至在推进过程中还会继续变化。

官方认为,这类复杂长程需求正是小红书长期面对的内容,因此也自然成为 Agent 研究和应用的重要方向。相比之下,数学、代码等任务的目标更清晰,结果也更容易验证;现实生活中的任务则缺少随处可用的测试用例,约束条件也会随时间变化,这让长程 Agent 的短板暴露得更加明显。

开源两套评测基准:VibeSearchBench 与 VibeLifeBench

为更直观地呈现差距和不足,dots 实验室同时开源了两套评测基准。

第一套是 VibeSearchBench,用于评估当用户没有一次说清需求时,Agent 能否逐步理解用户真正想要什么。该基准覆盖 20 个领域、200 项任务,评测方式是模拟真实用户在多轮对话中逐步补充需求和限制条件,再观察模型能否准确理解目标。

小红书开源 dots3-note preview,主打真实生活长程 Agent 任务 8

第二套是 VibeLifeBench,重点放在时间和环境变化上,考察外部条件变化后,Agent 是否还能持续跟进。该基准覆盖 10 个领域、20 项任务,每项任务包含 20 到 30 个阶段,并设置了 1247 项 atomic checks,用于检查状态是否保持一致、工具是否正确执行,以及最终交付内容。

官方披露的结果显示,即便是 Claude Opus 5、GPT-5.5 这样的头部模型,在这两套评测基准中也没有达到设定的及格水平。

  • VibeSearchBench 主页:https://vibebench.github.io/VibeSearchBench.github.io/
  • VibeLifeBench 主页:https://vibebench.github.io/VibeLifeBench_homepage/

后续计划

小红书表示,dots3-note 是 dots3 系列中最轻量级的版本,目前开源的 preview 版在体验和细节上仍有继续优化空间。按照 dots 实验室披露的信息,dots3-note 正式版也将于近期开源。

未来,dots3 系列还将推出 jazz 和 aria,与 note 组成三个层级,覆盖不同任务复杂度、响应速度和计算成本的应用需求。

更多训练方法细节,官方给出了中文技术博客链接:https://studio.dots.ai/dots/dots3-zh.html

本文信息来自微信公众号「机器之心」(ID:almosthuman2014),作者为关注 Agent 的机器之心,编辑为杜伟、杨文。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1180

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。