ChindaMT:遵循您规则的泰英翻译,研究成果发表于 AACL-IJCNLP 2026

今天,我们发布 ChindaMT。这是一个泰英翻译模型系列,能够遵循您给出的规则:使用哪个术语、采用何种语气,以及长度和格式。相关研究发表于 AACL-IJCNLP 2026(主会)。模型、训练数据、评测集和代码均以 Apache 2.0 许可开放,ChindaMT-4B 现已作为托管 API 提供。
试用:ChindaMT 翻译器 · API:文档与在线演示 · 论文:arxiv.org/abs/2609.34770 · 模型权重:huggingface.co/iapp/ChindaMT-4B
译文正确,却未必适合实际用途
以这句话为例:“The meeting has been moved to Friday because the boss is busy.”
标准译法是 การประชุมถูกเลื่อนไปเป็นวันศุกร์เนื่องจากเจ้านายยุ่ง。每个词都正确,但没有人会在群聊里这样打字。要求 ChindaMT “use a casual, friendly tone”(使用轻松 友好的语气),它会写出 ประชุมย้ายไปวันศุกร์แล้วนะ เพราะเจ้านายยุ่งมาก。
翻译很少只有一个标准答案。字幕需要角色的口吻,论文需要正式语体,品牌需要自己的风格,合同需要始终使用同一个术语。难点在于:越是要求模型严格遵循此类规则,其翻译质量往往下降越多。专门的翻译模型译得好,却会忽略指令;通用的指令遵循模型听从指令,翻译质量却不够好。此前还没有任何开源泰英模型弥合这一差距。
答案在数据中
我们采用一种称为 Reference-Grounded Data Curation(RGDC,基于参考译文的数据整理) 的方法构建训练数据。RGDC 不是让语言模型凭空编造规则、再寄希望于这些规则能被满足,而是从一份已经满足规则的优质参考译文中提取每一条规则。如果参考译文将 บาท 译为“THB”、保持为一句话且语气正式,这些就成为该样本的规则。由于已有真实译文满足它们,这些规则在构造上就必然可以实现。
该流程从十个公开语料库中的 1,785 万个英泰句对出发。第一阶段保留其中最难但仍可学习的 175 万个句对。第二阶段从每份参考译文中提取五类规则(内容、数字、风格、格式、语言),在这些规则下重新生成译文,并只保留通过全部规则的候选译文。最终得到 Grounded 数据集,共 197 万条记录,平均每条带有 3.7 条规则。