SGLang新增原生决策API,现成大模型无需微调即可直接做选择

SGLang新增原生决策API,现成大模型无需微调即可直接做选择

N
News Editor
2026-09-30 10:32:12
SGLang新增原生决策 API,可让 Qwen3.8-27B 这类现成大模型和多模态模型在不改权重、不重新微调的情况下直接完成选择、判断和打分。该方案直接读取候选答案的概率,不再先生成文本再解析。团队还用 Qwen3.8-27B 演示了《宝可梦 FireRed》决策流程,单次决策低于 100ms,并新增兼容 Jev TypeSafe SDK 的 /v1/systemone 接口。

大模型推理与部署框架 SGLang 新增原生决策 API,可让 Qwen3.8-27B 这类现成 LLM 和多模态模型在不改权重、也不重新微调的情况下,直接完成选择、判断和打分。

这项功能的做法,是由开发者提供当前情况和几个候选答案,模型随后直接返回每个选项的概率,不再先生成一段文字,再对生成结果做解析。

直接读取候选答案概率

按照 SGLang 的说明,这套方案利用的是大模型本来就会计算的「下一个 token 概率」。例如候选答案为 A、B、C 时,普通聊天模型通常会继续生成文字;SGLang 则直接读取模型对 A、B、C 的概率,以判断模型更倾向哪个答案。模型本身没有变化,变化的是结果读取方式。

《宝可梦 FireRed》演示低于 100ms

SGLang 使用 Qwen3.8-27B 做了一个《宝可梦 FireRed》演示。模型会根据实时游戏状态,判断是攻击、换精灵还是治疗,单次决策低于 100ms,并一次打通四天王和冠军。

由于 Qwen3.8-27B 本身支持图像输入,这套方法也可以处理多模态决策。

新增兼容 Jev SDK 的接口

除决策能力外,SGLang 还新增了 /v1/systemone 接口,兼容 Jev 使用的 TypeSafe SDK。已经使用这套 SDK 的应用,可以把服务地址改成自己的 SGLang 实例后继续调用。

目前,这项新功能已经进入 nightly 版本,计划随 v0.5.21 正式发布。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。