我们如何评测多语言转写模型
本地 Convert 模型为什么需要同时检查完全匹配、分语言结果、受保护片段、对照输入和实际运行时。

UUnimeType · 2 分钟阅读
一条转写结果可能读起来很流畅,却仍然不能使用。只要它改动了 OpenAI API、删掉 emoji、重写网址,或者在答案外面加了一段解释,就不能安全替换用户选中的原文。
所以我们测试的是“能否直接替换”,不只是“读者能否看懂”。
完全匹配衡量能否直接替换
严格分数只接受最终正文与一个允许答案完全相同的输出。额外说明、标点变化、英文改动和细小拼写差异都会被抓出来。
完全匹配是有意设置得很严格。阿拉伯语口语短句可能存在不止一种能看懂的拼写。因此,一条严格不匹配首先表示它需要复查,并不自动证明所有不匹配输出都毫无意义。
每种语言保留独立分数
当前冻结测试集有 127 条:
| 语言 | 案例数 | 未微调 Qwen3.5-4B | LM Studio 中的微调 6-bit 模型 |
|---|---|---|---|
| 中文 | 61 | 15 | 39 |
| 日文 | 22 | 3 | 19 |
| 印地语 | 22 | 6 | 22 |
| 阿拉伯语 | 22 | 3 | 14 |
| 总计 | 127 | 27 | 94 |
这些数字是同一 Convert 任务下的项目测试计数。测试集很小,不能证明广泛的生产准确率。阿拉伯语结果也说明,只看一个总分会隐藏问题。
受保护片段也是正确性的一部分
我们检查模型是否保留这些对象:
- 英文单词和产品名;
- 代码与命令;
- 网址、邮箱、账号名和标签;
- 数字、emoji、标点和换行。
测试里还有纯英文输入,以及已经使用目标文字的输入。转换器必须知道什么时候完全不改。
保留测试限制记忆训练答案
评测输入不能进入训练数据。我们保留一套长期比较用的冻结测试,另外维护困难混写、社交写法和方言案例。任何结果都会明确说明属于哪一套测试,不把它写成普遍准确率。
运行时也是被测对象的一部分
同一份模型文件在不同推理运行时里可能产生不同结果。公开 6-bit 模型的直接 MLX 计数和 LM Studio 计数并不完全相同。因此,描述桌面集成时使用 LM Studio 结果,直接运行结果则单独记录。
下一篇操作指南介绍如何在 LM Studio 运行 Transliteration-4B。产品处理文字范围的规则见文字范围策略。
选择你的平台查看当前下载与测试选项。