我们如何评测多语言转写模型

本地 Convert 模型为什么需要同时检查完全匹配、分语言结果、受保护片段、对照输入和实际运行时。

UUnimeType · 2 分钟阅读

一条转写结果可能读起来很流畅,却仍然不能使用。只要它改动了 OpenAI API、删掉 emoji、重写网址,或者在答案外面加了一段解释,就不能安全替换用户选中的原文。

所以我们测试的是“能否直接替换”,不只是“读者能否看懂”。

完全匹配衡量能否直接替换

严格分数只接受最终正文与一个允许答案完全相同的输出。额外说明、标点变化、英文改动和细小拼写差异都会被抓出来。

完全匹配是有意设置得很严格。阿拉伯语口语短句可能存在不止一种能看懂的拼写。因此,一条严格不匹配首先表示它需要复查,并不自动证明所有不匹配输出都毫无意义。

每种语言保留独立分数

当前冻结测试集有 127 条:

语言案例数未微调 Qwen3.5-4BLM Studio 中的微调 6-bit 模型
中文611539
日文22319
印地语22622
阿拉伯语22314
总计1272794

这些数字是同一 Convert 任务下的项目测试计数。测试集很小,不能证明广泛的生产准确率。阿拉伯语结果也说明,只看一个总分会隐藏问题。

受保护片段也是正确性的一部分

我们检查模型是否保留这些对象:

  • 英文单词和产品名;
  • 代码与命令;
  • 网址、邮箱、账号名和标签;
  • 数字、emoji、标点和换行。

测试里还有纯英文输入,以及已经使用目标文字的输入。转换器必须知道什么时候完全不改。

保留测试限制记忆训练答案

评测输入不能进入训练数据。我们保留一套长期比较用的冻结测试,另外维护困难混写、社交写法和方言案例。任何结果都会明确说明属于哪一套测试,不把它写成普遍准确率。

运行时也是被测对象的一部分

同一份模型文件在不同推理运行时里可能产生不同结果。公开 6-bit 模型的直接 MLX 计数和 LM Studio 计数并不完全相同。因此,描述桌面集成时使用 LM Studio 结果,直接运行结果则单独记录。

下一篇操作指南介绍如何在 LM Studio 运行 Transliteration-4B。产品处理文字范围的规则见文字范围策略

选择你的平台查看当前下载与测试选项。

查看下载下一篇: 怎样用英文键盘输入印地语:3 种方法