StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev

N
News Editor
2026-10-03 04:03:10
StartLux于9月30日发布完全开源的 StartLux-Decision,提供 0.8B、2B、4B、9B、27B 五档版本及本地部署量化模型。按团队基于公开工具对 2026 年 9 月 28 日榜单快照的自测,27B 版本在 Decision Index 0.2.1 的 38 项基准中有 31 项超过 Jev 1.13,综合得分 63.88,高于后者的 57.91;在另一套 7 项测试中平均准确率为 91.82%。团队还披露,该模型在 36 局不借助额外搜索的国际象棋对弈中赢下 Jev 35 局,并将其定位为本地 Agent 系统中的高频决策层组件。

9 月 30 日,StartLux 发布决策模型 StartLux-Decision。按团队基于公开评测工具、对照 2026 年 9 月 28 日 Decision Index 公开榜单快照完成的自测结果,这款完全开源的模型在 Decision Index 0.2.1 的 38 项基准测试中有 31 项成绩超过 Jev 1.13,27B 版本综合得分为 63.88,而 Jev 为 57.91。

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev 2

实战对比中,StartLux 还给出了一组国际象棋结果。双方看到相同棋盘状态,不借助额外搜索,每一步都由模型直接选择。最终,StartLux-Decision-27B 在 36 局中赢下 35 局,并完成将死;团队称,该模型在平均损失、最佳着法命中率和失误次数等指标上也表现更好。

发布这款模型的是上海 AI 公司 StartLux(原点星辉)。文中提到,这已是这家成立不到 5 个月的公司第二次拿出引发关注的成果。此前,StartLux-27B 本地模型曾在工信部中国信通院测试中超过 284B 的 DeepSeek-V4-Flash,并以约 1/60 的参数量基本打平 DeepSeek-V4-Pro。

五档版本同步开源

这次 StartLux 一次推出 0.8B、2B、4B、9B 和 27B 五个版本,并提供支持本地部署的量化模型。

  • GitHub:https://github.com/StartLuxLabs/Startlux-Decision
  • Hugging Face 模型合集:https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493

按文中披露的数据,在独立的 Decision Index 0.2.1 中,StartLux-Decision-27B 得分 63.88;在 38 项基准里,有 31 项高于 Jev 最新版本 Jev 1.13。另一套七项测试来自上海 AI Lab Intern-Decision 团队的评测集,与 Decision Index 属于两套相互独立的口径;在这组测试中,StartLux-Decision-27B 平均准确率达到 91.82%。

文中也特别说明,上述成绩均为 StartLux 团队自测结果,使用的是公开评测工具,并对照 2026 年 9 月 28 日的 Decision Index 公开榜单快照完成。

Decision 模型在 Agent 中承担什么角色

报道将焦点放在一个问题上:为什么 Agent 需要一种专门负责判断的 Decision 模型。

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev 3

按照 StartLux 展示的案例,这类模型并不以开放式内容生成为主,而是直接在已定义的候选项中做选择、是非判断或等级评分。与普通生成模型先输出自然语言、再由程序解析不同,Decision 模型把判断过程直接结构化。

在一个客服工单 Demo 中,系统收到的消息是「订单已经被重复扣款两次,但系统仍然显示未支付。」StartLux-Decision 在一次请求中同时完成三项判断:分流团队、处理时效和严重等级。

另一个购物 Demo 的任务是购买「最便宜、免运费的 8 节装 AA 电池,并寄到家庭地址」。系统会综合型号、数量、价格和配送条件;每轮由 StartLux-Decision 根据当前页面状态判断下一步操作以及任务是否完成,执行后再更新页面状态并继续判断,直到完成下单并通过任务条件检查。

在办公协作 Demo 中,任务是把指定成员邀请到 Design 团队,并设置为 Editor。模型需要依次选定团队、成员和角色,再判断邀请流程是否完成。

这些案例的共同点,是答案空间相对明确。浏览器控件、客服部门、工具列表都已预先定义。文中认为,这与大语言模型擅长的开放式生成任务不同;在很多 Agent 步骤里,需求往往只是 Yes/No、三选一、五级评分或工具选择。

报道据此回顾了一个演化过程:传统软件时代,大量业务规则由工程师预先写入系统;大语言模型出现后,许多显式逻辑被模型吸收,由同一个模型承担理解、分类、判断、规划和生成;进入 Agent 阶段后,AI 又开始重新分工——确定性流程交给代码,搜索交给 Embedding,复杂规划交给 Reasoning Model,高频选择则由 Decision Model 这样的专用模型承接。

速度和算力分配成为核心

StartLux 披露了一组速度测试数据。在单卡 H200、BF16、本地 HTTP 和短请求条件下,StartLux-Decision-4B 一次回答 3 个问题平均耗时 26 毫秒;0.8B 和 2B 分别为 12.2 毫秒和 15.5 毫秒。

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev 4

团队称,模型使用了 CUDA Graph、快速线性注意力算子,并把多个问题合入一次前向计算,以降低重复计算和调用开销。

文章指出,当一次 Agent 任务包含几十个判断节点时,每一步需要多少计算,会直接影响整体响应速度和运行成本。也正因如此,Decision Model 在短时间内升温:它处理的事情看起来很小,比如选择工具、判断任务是否结束、检查信息进入哪条流程、决定页面下一步点击位置,但当 Agent 长时间、规模化运行时,这些小判断会变成调用最频繁的一层。

StartLux 的本地智能分层架构

文中援引今年 9 月对 StartLux 联合创始人兼 CTO 郭权玮的访谈,讨论其「本地 AI」定义。郭权玮给出的边界并不只是一款可离线运行的模型,而是包括模型、量化、推理系统、硬件适配,以及上层的 Agent Harness、工具、搜索和持续学习,目标是尽可能部署在用户本地设备上。

在这一框架下,一个长期运行的本地 Agent 需要处理显存与内存约束、模型精度选择、不同任务在 4B、9B、27B 之间的调度、长上下文管理、步骤中断后的恢复机制、Memory 的存取策略,以及高阶判断的开销平衡。

StartLux-Decision 被放在其中一个特定层级。按照 StartLux 的系统划分,StartLux-27B 承担通用能力层,Decision Model 聚焦高频决策,上层部署 Agent 与 Memory,底层则由量化、推理系统和硬件适配支撑。

这种设计来自本地计算资源的现实约束。与云端可以用 GPU 集群扩展不同,本地系统需要在有限显存、内存、带宽和功耗下长期运转。因此,单位算力如何分配,成为一个核心问题。

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev 5

文中还回顾了 StartLux 在 27B 模型上的后训练实验。郭权玮把模型参数形容为一个高维空间,规模决定容量,训练则是在重构容量中的能力分布。实验结果显示,针对 Agent 能力后训练后,GPQA 从 83.33 升至 90.40,DeepSearchQA 从 47.04 升至 59.39,Tau3-Banking 也有所提升;与此同时,GAIA 从 57.57 降至 45.70,IFEval 同样出现下降。

文章借此指出,在固定参数量下,不同能力之间会发生资源重新分配。Decision Model 则把频繁调用且目标明确的任务,交给专用的轻量化模型处理。

量化规格和本地部署数据

StartLux 推出 0.8B、2B、4B、9B、27B 五种规格,也提供 BF16、Q8_0 和 Q4_K_M 三种 GGUF 量化文件,以覆盖不同设备与场景。

以 4B 规格为例,Q8_0 文件大小约 4.48GB。在团队公布的 231 道公开 JevBench 量化复测中,这一版本与原始权重的决策一致率达到 100%,均答对 204 题。压缩至约 2.71GB 的 Q4_K_M 版本后,决策一致率为 98.3%,答对 201 题。

文中认为,在实际本地 Agent 系统中,这种规格分化有明确的工程意义:低延迟判别可交给小型 Decision Model,复杂推理交给大模型,检索由专业模块承担,长期记忆依赖 Memory,跨应用操作则由 Agent Harness 协调,模型正在逐步演变为计算系统中的不同处理单元。

此外,StartLux-Decision 还可输出候选项的概率分布,让系统建立路由和分流策略。若模型在已知任务上的置信度达标,系统可直接执行后续逻辑;若多个候选项概率接近,则可以补充信息、转交更强模型,或触发人工确认。

不过,文中也写明,概率输出仍需要结合具体业务场景校准。对于支付、删除、权限修改等高风险操作,原有授权确认机制依然不可缺少。

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev 6

3 天完成首轮研发与验证

另一个引发关注的数字是 3 天。按照团队公布的信息,从确定 Decision Model 方向到完成首轮模型研发与验证,大约用了 3 天。

报道将其归因于 StartLux 在 RSI 思路下长期搭建的 Auto Research 研发体系。文中写道,AI 已经进入数据构造、训练、评测和失败分析等研发环节,这一点在 StartLux 近期两次模型研发中连续得到验证。

在此前的专访中,郭权玮曾解释「70% 实验执行由 AI 参与」这一表述:若只统计配置生成、训练启动、Eval 运行和结果整理等机械性工程,自动化率已超过 95%;而 70% 指的是在核心研究与决策环节中,AI 模型参与的比例。

文中区分了两类难度:自动化启动训练已相对成熟,真正更难的是训练结束后的分析和决策,包括模型为何失败、应补什么数据、问题出在算法还是推理顺序、下一轮实验要调整什么变量,以及某条路线是否值得继续投入算力。StartLux 把这套高阶决策流程定义为 Auto Research。

报道举了一个金融任务的例子:当系统发现模型没有回查原始数据就直接计算时,失败样本会被送入研究系统;多个 AI 模型协同分析原因并提出假设,例如数据覆盖不足、推理链条缺陷或缺乏对应行为强化;系统随后评估方案价值,自动构造数据、启动训练、运行 Eval 并检测能力退化,最终把新结果反馈给下一轮迭代。

在这套流程里,AI 已开始承担传统意义上的科研决策职能。StartLux-Decision 被描述为这条管线在新模型品类上的一次落地:团队需要定义其接口规范,围绕动作选择、约束理解、结构化输出等能力构建数据集和评测体系;训练后的异常样本再回流进迭代循环,最终由实测数据决定保留哪些修改。

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev 7

StartLux 对 RSI 的五级划分

文章提到,在基础模型快速更迭的背景下,单版权重的领先周期正在缩短,研发系统的迁移能力变得更关键。郭权玮表示,在 StartLux 的实践中,同系列基础模型切换时,积累的数据和训练经验大部分可直接复用,而 Pipeline、Eval 以及失败分析体系的迁移率更高。

因此,团队把长期积累的核心资产定义为数据有效性识别、失败样本处理机制、实验评估体系,以及下一轮实验的自动生成能力。

在此基础上,StartLux 提出了 Recursive Self-Improvement(RSI)的五级划分:

  1. Level 0:Self-correction,模型发现错误后重新尝试;
  2. Level 1:开始积累 Memory 和 Experience;
  3. Level 2:Automated Training,AI 可以生成数据、写代码、启动训练和运行 Eval;
  4. Level 3:Auto Research,AI 根据上一轮实验分析失败、提出新假设,并参与决定下一步研究方向;
  5. Level 4:完整 RSI,被改进后的 AI 连「改进 AI 的能力」本身也继续增强,形成递归反馈。

目前,StartLux 将自身定位在 Level 3 阶段。

报道认为,StartLux-Decision 一方面是 Auto Research 管线加速产出的成果,另一方面也可能成为该管线未来可调用的基础组件。因为自动化研究本身包含大量离散决策,例如哪些失败值得深入分析、下一步调用什么工具、多个实验方案如何排序优先级,以及在什么情况下终止当前路线。

对于这些候选集明确的任务,让 Decision Model 参与其中,是文中给出的一个合理设想;其具体收益,则仍需在后续实际研究流程中继续验证。

这也对应 StartLux 对 Auto Research 整体架构的判断:研究系统采用多模型异构协作模式,不同参数量、训练范式和功能的模型,包括预测、判别、算法等,会在流程中分工协作,最终再结合 Verifier 和算法决定实验存留。

StartLux开源决策模型登顶公开榜单,27B版本综合分超Jev 8

行业热度升温,焦点转向系统整合

文章最后把 StartLux-Decision 放回更大的行业背景。自 9 月中旬 Jev 发布后,两周多时间里,OpenAI 在开发者日推出 Decisions API,Cloudflare 发布开源决策模型 Clef,再加上更早走红的 Laya 与持续升温的 Personal Agent,行业开始形成一项共识:智能体系统里调用最频繁的,正是那些高频、候选明确的小判断,它们值得由一层专用、低成本、毫秒级响应的智能承接,而不是每次都调用完整的大模型。

文中还指出,按照郭权玮此前接受机器之心专访时的说法,StartLux 所说的「本地」从来不是「做一个比较小、能够下载到电脑上的模型」,而是「一整套属于个人的 AI 系统」:底层是模型、量化与推理系统,中间是面向本地环境设计的 Agent Harness 与 Memory,上层才是用户看到的产品。StartLux-27B 与 StartLux-Decision 分别对应其中的通用能力层与高频决策层,而基础架构研究、量化方案和推理系统也在同步推进。

因此,文中将 StartLux-Decision 定义为一块按计划补上的架构拼图,而非一次追逐热点的孤立发布。

同样被放进这个坐标系里的,还有「3 天」这个数字。文章认为,它的意义不只是速度,而是验证了 StartLux 在 RSI 思路下,Auto Research 研发体系的迁移能力:当数据构造、评测和失败分析体系可以跨品类复用时,一个新模型品类从立项到首轮验证的周期,就会被系统性压缩。

不过,报道也提到,一套系统的价值最终不体现在架构图上,而在于能否长期、稳定地完成真实任务。郭权玮坦言,长任务稳定性、失败恢复和整体体验,比单纯把模型跑起来更难。按照规划,基于备案进度,StartLux 首个面向公众的本地智能体验版本有望在年内推出,届时这套设想将接受完整检验。

本文内容来自微信公众号「机器之心」(ID:almosthuman2014),作者署名为「关注AI的」。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。