跳到主要内容

OpenThai-SystemOne

可在笔记本上运行的开源泰语与英语 System One 模型。它不写作,它做决策。

iapp/OpenThai-SystemOne · 0.8B 参数 · Apache 2.0

给它一个 state(任意文本或 JSON:客服工单、评论、文档、界面无障碍树)和一个或多个结构化 问题。它在一次前向计算中返回每个问题每个选项的校准概率,输出 token 为零。三种问题类型:choice(最多 255 个命名选项)、score(2 到 10 个有序等级)和 noul(是或否)。

开放权重,2026 年 9 月 20 日发布 · Apache 2.0

由 iApp Technology 与 OpenThai 社区共同构建。基础模型:Qwen3.5-0.8B 的文本塔(Apache 2.0),在约 50 亿泰语 token 上继续预训练。训练数据、脚本和配置随权重一同发布。

什么是 System One 模型

语言模型通过逐 token 生成文本来回答,可以说任何内容,包括你从未提供的选项。System One 模型直接回答结构化问题:语言模型头被替换为 256 路决策头,每个答案位置投影到你给出的选项上,softmax 给出分布。它不会输出无效选项。但它仍可能出错,因此每个答案都带有可用于分流的 confidence

该类别由 TypeSafe AI 于 2026 年 9 月 15 日以 Jev 开创。OpenThai-SystemOne 是五天后发布的面向泰语和英语的开源重新实现,架构、方案和数据全部开放。HTTP 接口与 POST /v1/systemone 一致,为该 API 编写的 SDK 代码无需修改即可指向本模型。

一次请求,三个决策

一条泰语客服工单,三个问题,一次调用。已发布检查点的实测输出:

问题类型答案置信度
哪个团队应处理?choice(billing、technical、sales)billing,96.3%0.83
客户有多沮丧?score(冷静、不满但礼貌、非常生气)1.95 / 20.82
是否明确要求退款?noulP(是) = 0.946

166 个输入 token,0 个输出 token,经网关往返 0.23 秒。完整请求与响应见 API 页面

应用场景

  • 将客服工单分流到正确的团队,同时评估紧急程度。
  • 审核评论:毒性为是/否,情感为选项。
  • 判断 LLM 的答案是否基于检索到的段落。
  • 从无障碍树中选择智能体下一步应操作的界面元素及操作方式。
  • 用一个问题对文档和字段进行最多 255 类的分类。
  • 按有序量表为评论打分,得到小数平均值而不只是标签。

每一项都是服务器 GPU 上几十毫秒内的一次请求。泰国企业每天要做数百万次这样的决策,无法为每一次都调用完整的 LLM。

性能

设置实测
服务器 GPU(H100),batch 1,3 个问题40 至 70 毫秒
笔记本 GPU(MacBook M3 Max,MPS)154 毫秒
网关往返,上述工单示例0.23 秒
输出 token0

基准测试

在 Bespoke Labs 公开的 13 子集 System One 基准上 macro 平均 61.9,对比 Bespoke-Nimble-9B 74.8、Jev 1.13.0 76.0、原始 Qwen3.5-0.8B 基座 45.4。 与 Bespoke 公布的基准使用相同的子集、划分、指令和采样器;其数字为 2026 年 9 月 18 日公布,我们的数字来自发布的评测脚本。加粗表示 0.8B 模型领先 9B 模型。

子集类型nOpenThai-SystemOne 0.8BNimble-9BJev 1.13.0
aegis2noul25058.081.280.4
boolqnoul30063.786.089.7
civil_commentsnoul30078.070.381.0
helpsteer2score25042.839.034.1
massive-de-DEchoice35064.683.486.9
massive-en-USchoice35075.786.987.4
multinlichoice29985.685.382.9
pawsnoul25067.282.889.2
pubmedqachoice25053.675.677.2
squad2noul29950.280.682.9
summeval-consistencyscore14484.075.781.2
summeval-relevancescore24013.849.235.0
vitaminc-devchoice59967.176.680.1
macro 平均61.974.876.0

如实解读:在 13 个子集中的 4 个领先 9B(NLI、摘要一致性、有用性评分、毒性),在阅读理解式是/否任务(squad2 接近随机、boolq、pubmedqa)和摘要相关性评分上明显落后,后者的评分头校准较差(ECE 0.79)。

泰语留出测试集,从未用于训练(ECE = 期望校准误差,越低越好):

测试集类型n准确率ECE
MASSIVE-th 意图(60 类)choice5,00786.40.048
Prachathai67k 主题choice3,50197.70.005
XNLI-thchoice2,49076.50.028
SIB-200 泰语主题(7 类),整个数据集留出choice20477.50.074
Wongnai 评论星级(1 至 5)score6,20363.30.010
xLAM 工具选择(英语)choice88499.40.007
Wisesight 情感(4 类),整个数据集留出choice2,67138.70.341
banking77 意图(77 类,英语),整个数据集留出choice3,07632.70.165

校准后,置信度在泰语测试集以及 NLI 和主题任务上可靠(ECE 不超过 0.05)。英语校准较弱(公开基准 ECE 中位数 0.15),因为训练混合有意偏重泰语。共享 H100 上单个 255 选项问题的 batch-1 延迟:44 毫秒。完整表格、Brier 分数和校准前后对比见模型卡

免费托管 API

api.iapp.co.th 上的端点在预览期内使用任意 iApp API key 免费(注册免费),每个 key 每天限 1,000 次决策。按决策计价的价格将于 2026 年 10 月公布。

端点POST https://api.iapp.co.th/v3/store/openthai/systemone
认证apikey 请求头
请求体{"state": ..., "questions": {...}}
文档与体验/docs/llm/openthai-systemone

自行运行

pip install "git+https://github.com/iapp-technology/openthai-systemone"
OPENTHAI_SYSTEMONE_MODEL=iapp/OpenThai-SystemOne uvicorn openthai_systemone.server:app --port 8000

然后用与托管 API 相同的请求体 POST http://localhost:8000/v1/systemone

架构

Qwen3.5-0.8B 的文本塔(去除视觉编码器),在约 50 亿泰语 token 上继续预训练。248K token 的语言模型头替换为 1024 到 256 的线性槽位头。选项由控制 token 引入;每个答案位置读出为 256 个 logit,超出选项数的槽位被屏蔽,第 255 号槽位为"均不适用"(abstain)。choice 取 argmax,score 为概率加权的等级索引,noul 为 P(是)。训练时打乱选项顺序,因此没有位置偏差。在公开的分类、NLI、问答和智能体数据集以及合成的泰语与英语决策任务上训练,然后进行校准。

限制,事先说明

  • 0.1 版。0.8B 模型,不是推理模型。
  • 不会输出无效选项,但仍可能选错。将 confidence 低的答案交给更大的模型或人工。
  • 仅支持文本。
  • 每个 choice 最多 255 个选项,每个 score 2 到 10 个等级,每次请求 64K token。
  • v0.1 已知弱项:泰语社交媒体情感(Wisesight 38.7)、细粒度 77 类英语意图(banking77 32.7)、抽取式问答风格的是/否(squad2 接近随机)以及摘要相关性评分。v0.2 增加合成泰语情感数据集和第二轮训练,以第一项为目标。
  • "System One" 是类别名称;这不是 TypeSafe AI 的产品。

赞助方

Siam AI Corporation

本模型的训练、评测和免费托管 API 均运行在 Siam AI Corporation 慷慨提供的 NVIDIA H100 GPU 上。感谢他们对开源泰语 AI 的支持。

链接