大模型推理与部署框架 SGLang 新增原生决策 API,可让 Qwen3.8-27B 这类现成 LLM 和多模态模型在不改权重、也不重新微调的情况下,直接完成选择、判断和打分。
这项功能的做法,是由开发者提供当前情况和几个候选答案,模型随后直接返回每个选项的概率,不再先生成一段文字,再对生成结果做解析。
直接读取候选答案概率
按照 SGLang 的说明,这套方案利用的是大模型本来就会计算的「下一个 token 概率」。例如候选答案为 A、B、C 时,普通聊天模型通常会继续生成文字;SGLang 则直接读取模型对 A、B、C 的概率,以判断模型更倾向哪个答案。模型本身没有变化,变化的是结果读取方式。
《宝可梦 FireRed》演示低于 100ms
SGLang 使用 Qwen3.8-27B 做了一个《宝可梦 FireRed》演示。模型会根据实时游戏状态,判断是攻击、换精灵还是治疗,单次决策低于 100ms,并一次打通四天王和冠军。
由于 Qwen3.8-27B 本身支持图像输入,这套方法也可以处理多模态决策。
新增兼容 Jev SDK 的接口
除决策能力外,SGLang 还新增了 /v1/systemone 接口,兼容 Jev 使用的 TypeSafe SDK。已经使用这套 SDK 的应用,可以把服务地址改成自己的 SGLang 实例后继续调用。
目前,这项新功能已经进入 nightly 版本,计划随 v0.5.21 正式发布。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

