36局赢了35局!国产开源决策模型StartLux-Decision,专治AI Agent的"选择困难症"

凯叔爱分享 2026-10-5 8 10/5

这模型到底是干嘛的

一句话定位:StartLux-Decision 是上海公司原点星辉(StartLux)2026 年 9 月 30 日开源的决策模型,专门解决 AI Agent 跑任务时最烧钱的环节——每一步"接下来干嘛"的判断。它不写一个字,只做判断,适合做 Agent 应用、本地智能助手和对数据隐私敏感的开发者。

StartLux-Decision 开源决策模型概念插画:国际象棋骑士棋子与AI决策节点

先说核心结论:据团队公布的数据,StartLux-Decision-27B 在 Decision Index 0.2.1 的 38 项基准测试里,有 31 项超过了当红的 Jev 1.13,综合得分 63.88 对 57.91。而且它完全开源,提供 5 档版本和量化模型,能本地部署——这正是闭源的 Jev 给后来者留下的空位。

要理解它,得先说清楚"决策模型"是个什么新物种。过去两年大模型都在卷深度推理,思考链越长越好。但 Agent 真正跑起来之后,密集发生的根本不是深度思考,而是一堆琐碎判断:这张工单分给哪个团队?页面上下一步点哪个按钮?任务到底完成没有?以前这些判断要么让大模型"顺便"做(生成一段文字再解析,又慢又贵),要么写死成规则(覆盖不了长尾)。决策模型就是把"判断"从"生成"里剥离出来,做成廉价、高频的基础设施。Jev 把这类模型叫"System One 模型",名字取自卡尼曼《思考,快与慢》里那个负责直觉反应的系统一,挺贴切。

举个具体例子就明白了。在 StartLux 展示的客服工单 Demo 里,系统收到"订单被重复扣款两次,但系统仍显示未支付"这样一条消息,传统做法是先生成一段分析再解析,而 StartLux-Decision 一次请求就同时完成三项判断:分流给哪个团队、处理时效定多紧、严重等级打几分。不废话,直接给带概率的结构化结果。

核心特点

  • 2026 年 9 月 30 日发布,完全开源,一口气推出 0.8B、2B、4B、9B、27B 五档版本,并提供支持本地部署的量化模型。
  • Decision Index 0.2.1 实测:27B 版本综合得分 63.88,38 项基准里 31 项高于 Jev 1.13(57.91)。注意这是团队基于公开评测工具、对照 9 月 28 日公开榜单快照完成的自测结果。
  • 另一套 7 项公开测试(上海 AI Lab Intern-Decision 团队评测集)中,27B 版本平均准确率 91.82%。
  • 演示环节:与 Jev 1.13 下国际象棋,不借助额外搜索、每一步直接选子,36 局赢下 35 局。不过下棋本来就不是决策模型的主战场,更像一个吸引眼球的演示。
  • 只回答带预设选项的问题:单选、打分或者是非判断,直接返回带概率的结构化结果,不生成自然语言。
  • 三个官方 Demo:客服工单一次请求完成三项判断;购物任务里逐轮判断下一步操作、直至完成下单并通过任务条件检查;团队管理任务里依次选对团队、成员、角色,并判断邀请流程是否完成。
  • 研发只用了 3 天:团队用自建的 Auto Research 方法完成研发与验证(据钛媒体报道),迭代速度相当夸张。
  • 公司背景:上海原点星辉科学技术有限公司(StartLux),据报道成立不到 5 个月,掌舵人是盛大网络联合创始人陈大年。此前它的 StartLux-27B 本地模型在中国信通院测试中超过了 284B 参数的 DeepSeek-V4-Flash。

为什么这个赛道两周就挤满了人

时间线拉出来看就知道这赛道有多烫。9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 发布 Jev:闭源,只能调它家的 API,定价每百万输入 token 0.042 美元、输出免费。Vercel 披露,Jev 上线 24 小时内,其 AI Gateway 上 13% 的付费用户就用上了,是此前任何模型发布热度的两倍。两周之内,OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源 Clef,亚马逊放出 Strands Decider,上海人工智能实验室也开源了多模态的 Intern-Decision(0.8B/2B/4B 三档,推理速度据称比 Jev 快 2 到 3 倍)。一个新品类两周内从首发走到群战,在大模型行业也不多见。(以上据 Marsbit 报道)

说白了,Jev 有个明显缺口:闭源、不能本地部署、只能走云端。对数据敏感、对跨境调用有顾虑的开发者来说,这本身就是一道门槛。中国团队几乎不约而同地选择了开源和本地化,正好补上这个空位。之前我写过 OpenAI Dots 那个永远在线的 AI 智能体,决策模型就是这类 Agent 的"直觉层"——大脑负责想,手负责做,中间这个"判"字,终于有人专门做了。

入口与出处

  • GitHub:https://github.com/StartLuxLabs/Startlux-Decision
  • Hugging Face 模型合集:https://huggingface.co/collections/startlux-models/startlux-decision-6abba92b301b573fa154d493
  • 信息核对日期:2026 年 10 月 5 日。下载只认官方入口,不提供来路不明的安装包。

常见问题

是否免费?
完全开源,权重和量化模型都可免费下载使用。开源协议的具体条款以 GitHub 仓库说明为准,商用前建议先看一眼 license 文件。

信息是最新的吗?
本文信息核对于 2026 年 10 月 5 日。这个赛道变化极快,一切以官方最新说明为准。

链接打不开怎么办?
先刷新或换个网络试试,GitHub 国内访问偶尔抽风。也欢迎在评论区留言,我会核对补档。

本站是官网吗?
不是。本站是独立介绍,部署和使用中遇到的问题请优先找官方渠道。

来源声明:本文根据项目 GitHub 仓库、Hugging Face 页面及钛媒体、Marsbit 等公开报道整理,本站与 StartLux 无官方隶属关系;功能、成绩与授权可能调整,请以官方最新说明为准。未亲自验证的内容不写"实测"。

- THE END -

凯叔爱分享

10月05日13:15

最后修改:2026年10月5日
0

非特殊说明,本博所有文章均为博主原创。

共有 0 条评论

您必须 或 后可评论