9 月 30 日,StartLux 发布决策模型 StartLux-Decision。按团队基于公开评测工具、对照 2026 年 9 月 28 日 Decision Index 公开榜单快照完成的自测结果,这款完全开源的模型在 Decision Index 0.2.1 的 38 项基准测试中有 31 项成绩超过 Jev 1.13,27B 版本综合得分为 63.88,而 Jev 为 57.91。

实战对比中,StartLux 还给出了一组国际象棋结果。双方看到相同棋盘状态,不借助额外搜索,每一步都由模型直接选择。最终,StartLux-Decision-27B 在 36 局中赢下 35 局,并完成将死;团队称,该模型在平均损失、最佳着法命中率和失误次数等指标上也表现更好。
发布这款模型的是上海 AI 公司 StartLux(原点星辉)。文中提到,这已是这家成立不到 5 个月的公司第二次拿出引发关注的成果。此前,StartLux-27B 本地模型曾在工信部中国信通院测试中超过 284B 的 DeepSeek-V4-Flash,并以约 1/60 的参数量基本打平 DeepSeek-V4-Pro。
五档版本同步开源
这次 StartLux 一次推出 0.8B、2B、4B、9B 和 27B 五个版本,并提供支持本地部署的量化模型。
- GitHub:https://github.com/StartLuxLabs/Startlux-Decision
- Hugging Face 模型合集:https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493
按文中披露的数据,在独立的 Decision Index 0.2.1 中,StartLux-Decision-27B 得分 63.88;在 38 项基准里,有 31 项高于 Jev 最新版本 Jev 1.13。另一套七项测试来自上海 AI Lab Intern-Decision 团队的评测集,与 Decision Index 属于两套相互独立的口径;在这组测试中,StartLux-Decision-27B 平均准确率达到 91.82%。
文中也特别说明,上述成绩均为 StartLux 团队自测结果,使用的是公开评测工具,并对照 2026 年 9 月 28 日的 Decision Index 公开榜单快照完成。
Decision 模型在 Agent 中承担什么角色
报道将焦点放在一个问题上:为什么 Agent 需要一种专门负责判断的 Decision 模型。

按照 StartLux 展示的案例,这类模型并不以开放式内容生成为主,而是直接在已定义的候选项中做选择、是非判断或等级评分。与普通生成模型先输出自然语言、再由程序解析不同,Decision 模型把判断过程直接结构化。
在一个客服工单 Demo 中,系统收到的消息是「订单已经被重复扣款两次,但系统仍然显示未支付。」StartLux-Decision 在一次请求中同时完成三项判断:分流团队、处理时效和严重等级。
另一个购物 Demo 的任务是购买「最便宜、免运费的 8 节装 AA 电池,并寄到家庭地址」。系统会综合型号、数量、价格和配送条件;每轮由 StartLux-Decision 根据当前页面状态判断下一步操作以及任务是否完成,执行后再更新页面状态并继续判断,直到完成下单并通过任务条件检查。
在办公协作 Demo 中,任务是把指定成员邀请到 Design 团队,并设置为 Editor。模型需要依次选定团队、成员和角色,再判断邀请流程是否完成。
这些案例的共同点,是答案空间相对明确。浏览器控件、客服部门、工具列表都已预先定义。文中认为,这与大语言模型擅长的开放式生成任务不同;在很多 Agent 步骤里,需求往往只是 Yes/No、三选一、五级评分或工具选择。
报道据此回顾了一个演化过程:传统软件时代,大量业务规则由工程师预先写入系统;大语言模型出现后,许多显式逻辑被模型吸收,由同一个模型承担理解、分类、判断、规划和生成;进入 Agent 阶段后,AI 又开始重新分工——确定性流程交给代码,搜索交给 Embedding,复杂规划交给 Reasoning Model,高频选择则由 Decision Model 这样的专用模型承接。
速度和算力分配成为核心
StartLux 披露了一组速度测试数据。在单卡 H200、BF16、本地 HTTP 和短请求条件下,StartLux-Decision-4B 一次回答 3 个问题平均耗时 26 毫秒;0.8B 和 2B 分别为 12.2 毫秒和 15.5 毫秒。

团队称,模型使用了 CUDA Graph、快速线性注意力算子,并把多个问题合入一次前向计算,以降低重复计算和调用开销。
文章指出,当一次 Agent 任务包含几十个判断节点时,每一步需要多少计算,会直接影响整体响应速度和运行成本。也正因如此,Decision Model 在短时间内升温:它处理的事情看起来很小,比如选择工具、判断任务是否结束、检查信息进入哪条流程、决定页面下一步点击位置,但当 Agent 长时间、规模化运行时,这些小判断会变成调用最频繁的一层。
StartLux 的本地智能分层架构
文中援引今年 9 月对 StartLux 联合创始人兼 CTO 郭权玮的访谈,讨论其「本地 AI」定义。郭权玮给出的边界并不只是一款可离线运行的模型,而是包括模型、量化、推理系统、硬件适配,以及上层的 Agent Harness、工具、搜索和持续学习,目标是尽可能部署在用户本地设备上。
在这一框架下,一个长期运行的本地 Agent 需要处理显存与内存约束、模型精度选择、不同任务在 4B、9B、27B 之间的调度、长上下文管理、步骤中断后的恢复机制、Memory 的存取策略,以及高阶判断的开销平衡。
StartLux-Decision 被放在其中一个特定层级。按照 StartLux 的系统划分,StartLux-27B 承担通用能力层,Decision Model 聚焦高频决策,上层部署 Agent 与 Memory,底层则由量化、推理系统和硬件适配支撑。
这种设计来自本地计算资源的现实约束。与云端可以用 GPU 集群扩展不同,本地系统需要在有限显存、内存、带宽和功耗下长期运转。因此,单位算力如何分配,成为一个核心问题。

文中还回顾了 StartLux 在 27B 模型上的后训练实验。郭权玮把模型参数形容为一个高维空间,规模决定容量,训练则是在重构容量中的能力分布。实验结果显示,针对 Agent 能力后训练后,GPQA 从 83.33 升至 90.40,DeepSearchQA 从 47.04 升至 59.39,Tau3-Banking 也有所提升;与此同时,GAIA 从 57.57 降至 45.70,IFEval 同样出现下降。
文章借此指出,在固定参数量下,不同能力之间会发生资源重新分配。Decision Model 则把频繁调用且目标明确的任务,交给专用的轻量化模型处理。
量化规格和本地部署数据
StartLux 推出 0.8B、2B、4B、9B、27B 五种规格,也提供 BF16、Q8_0 和 Q4_K_M 三种 GGUF 量化文件,以覆盖不同设备与场景。
以 4B 规格为例,Q8_0 文件大小约 4.48GB。在团队公布的 231 道公开 JevBench 量化复测中,这一版本与原始权重的决策一致率达到 100%,均答对 204 题。压缩至约 2.71GB 的 Q4_K_M 版本后,决策一致率为 98.3%,答对 201 题。
文中认为,在实际本地 Agent 系统中,这种规格分化有明确的工程意义:低延迟判别可交给小型 Decision Model,复杂推理交给大模型,检索由专业模块承担,长期记忆依赖 Memory,跨应用操作则由 Agent Harness 协调,模型正在逐步演变为计算系统中的不同处理单元。
此外,StartLux-Decision 还可输出候选项的概率分布,让系统建立路由和分流策略。若模型在已知任务上的置信度达标,系统可直接执行后续逻辑;若多个候选项概率接近,则可以补充信息、转交更强模型,或触发人工确认。
不过,文中也写明,概率输出仍需要结合具体业务场景校准。对于支付、删除、权限修改等高风险操作,原有授权确认机制依然不可缺少。

3 天完成首轮研发与验证
另一个引发关注的数字是 3 天。按照团队公布的信息,从确定 Decision Model 方向到完成首轮模型研发与验证,大约用了 3 天。
报道将其归因于 StartLux 在 RSI 思路下长期搭建的 Auto Research 研发体系。文中写道,AI 已经进入数据构造、训练、评测和失败分析等研发环节,这一点在 StartLux 近期两次模型研发中连续得到验证。
在此前的专访中,郭权玮曾解释「70% 实验执行由 AI 参与」这一表述:若只统计配置生成、训练启动、Eval 运行和结果整理等机械性工程,自动化率已超过 95%;而 70% 指的是在核心研究与决策环节中,AI 模型参与的比例。
文中区分了两类难度:自动化启动训练已相对成熟,真正更难的是训练结束后的分析和决策,包括模型为何失败、应补什么数据、问题出在算法还是推理顺序、下一轮实验要调整什么变量,以及某条路线是否值得继续投入算力。StartLux 把这套高阶决策流程定义为 Auto Research。
报道举了一个金融任务的例子:当系统发现模型没有回查原始数据就直接计算时,失败样本会被送入研究系统;多个 AI 模型协同分析原因并提出假设,例如数据覆盖不足、推理链条缺陷或缺乏对应行为强化;系统随后评估方案价值,自动构造数据、启动训练、运行 Eval 并检测能力退化,最终把新结果反馈给下一轮迭代。
在这套流程里,AI 已开始承担传统意义上的科研决策职能。StartLux-Decision 被描述为这条管线在新模型品类上的一次落地:团队需要定义其接口规范,围绕动作选择、约束理解、结构化输出等能力构建数据集和评测体系;训练后的异常样本再回流进迭代循环,最终由实测数据决定保留哪些修改。

StartLux 对 RSI 的五级划分
文章提到,在基础模型快速更迭的背景下,单版权重的领先周期正在缩短,研发系统的迁移能力变得更关键。郭权玮表示,在 StartLux 的实践中,同系列基础模型切换时,积累的数据和训练经验大部分可直接复用,而 Pipeline、Eval 以及失败分析体系的迁移率更高。
因此,团队把长期积累的核心资产定义为数据有效性识别、失败样本处理机制、实验评估体系,以及下一轮实验的自动生成能力。
在此基础上,StartLux 提出了 Recursive Self-Improvement(RSI)的五级划分:
- Level 0:Self-correction,模型发现错误后重新尝试;
- Level 1:开始积累 Memory 和 Experience;
- Level 2:Automated Training,AI 可以生成数据、写代码、启动训练和运行 Eval;
- Level 3:Auto Research,AI 根据上一轮实验分析失败、提出新假设,并参与决定下一步研究方向;
- Level 4:完整 RSI,被改进后的 AI 连「改进 AI 的能力」本身也继续增强,形成递归反馈。
目前,StartLux 将自身定位在 Level 3 阶段。
报道认为,StartLux-Decision 一方面是 Auto Research 管线加速产出的成果,另一方面也可能成为该管线未来可调用的基础组件。因为自动化研究本身包含大量离散决策,例如哪些失败值得深入分析、下一步调用什么工具、多个实验方案如何排序优先级,以及在什么情况下终止当前路线。
对于这些候选集明确的任务,让 Decision Model 参与其中,是文中给出的一个合理设想;其具体收益,则仍需在后续实际研究流程中继续验证。
这也对应 StartLux 对 Auto Research 整体架构的判断:研究系统采用多模型异构协作模式,不同参数量、训练范式和功能的模型,包括预测、判别、算法等,会在流程中分工协作,最终再结合 Verifier 和算法决定实验存留。

行业热度升温,焦点转向系统整合
文章最后把 StartLux-Decision 放回更大的行业背景。自 9 月中旬 Jev 发布后,两周多时间里,OpenAI 在开发者日推出 Decisions API,Cloudflare 发布开源决策模型 Clef,再加上更早走红的 Laya 与持续升温的 Personal Agent,行业开始形成一项共识:智能体系统里调用最频繁的,正是那些高频、候选明确的小判断,它们值得由一层专用、低成本、毫秒级响应的智能承接,而不是每次都调用完整的大模型。
文中还指出,按照郭权玮此前接受机器之心专访时的说法,StartLux 所说的「本地」从来不是「做一个比较小、能够下载到电脑上的模型」,而是「一整套属于个人的 AI 系统」:底层是模型、量化与推理系统,中间是面向本地环境设计的 Agent Harness 与 Memory,上层才是用户看到的产品。StartLux-27B 与 StartLux-Decision 分别对应其中的通用能力层与高频决策层,而基础架构研究、量化方案和推理系统也在同步推进。
因此,文中将 StartLux-Decision 定义为一块按计划补上的架构拼图,而非一次追逐热点的孤立发布。
同样被放进这个坐标系里的,还有「3 天」这个数字。文章认为,它的意义不只是速度,而是验证了 StartLux 在 RSI 思路下,Auto Research 研发体系的迁移能力:当数据构造、评测和失败分析体系可以跨品类复用时,一个新模型品类从立项到首轮验证的周期,就会被系统性压缩。
不过,报道也提到,一套系统的价值最终不体现在架构图上,而在于能否长期、稳定地完成真实任务。郭权玮坦言,长任务稳定性、失败恢复和整体体验,比单纯把模型跑起来更难。按照规划,基于备案进度,StartLux 首个面向公众的本地智能体验版本有望在年内推出,届时这套设想将接受完整检验。
本文内容来自微信公众号「机器之心」(ID:almosthuman2014),作者署名为「关注AI的」。

