Qwen 和 Gemma 哪个更适合多语言转写?4B 实测

Qwen3.5-4B 与 Gemma 3 4B 哪个更适合中文、日文、印地语和阿拉伯语转写?查看同一套 127 条 Convert 评测结果,以及 UnimeType 选择 Qwen 的原因。

UUnimeType · 4 分钟阅读

第一个 UnimeType 转写模型选择 Qwen,是因为它在 Swift Convert 评测器中的结果更高,而且已经完成的 Qwen 训练路径产生了当前得分最高的测试模型。未经微调的 Qwen 得到 66/127,Gemma 得到 33/127,Transliteration-4B 得到 96/127。

这些结果来自同一套 127 条冻结测试和 Swift Convert 评测器。评测器会应用完整的分语言提示词、受保护片段处理、输出验证和本地确定性转换。由于测试模型使用不同的量化格式和 LM Studio 后端,这些结果可以支持产品选型,但不能证明 Qwen 在所有情况下都优于 Gemma。

Qwen 与 Gemma 模型卡能说明什么

Qwen3.5-4B 使用 Apache 2.0 许可证,模型卡称其语言及方言覆盖数为 201。Gemma 3 描述了超过 140 种语言的覆盖范围,并公开了包含印度语言基准在内的多语言评测。

这些信息说明两者都值得测试,但不能说明 ni jintian you kong ma 能否得到预期中文,也不能说明罗马字会变成哪一种日文书写,或者 Arabizi 旁边的用户名能否保持原样。语言数量和通用基准只能用于筛选候选,不能替代 Convert 测试。

Qwen 与 Gemma 的 127 条 Convert 测试结果

我们在 LM Studio 中运行两个未经微调的 4B 模型和当前选择的 Transliteration-4B,并使用同一个 Swift 产品评测器。只有恢复后的最终文字精确命中该案例的接受答案集合,并且路由符合案例约束时,才会通过。

测试模型中文日文印地语阿拉伯语总计
未微调 Qwen3.5-4B,GGUF Q4_K_M33/6114/2213/226/2266/127
未微调 Gemma 3 4B,MLX QAT 4-bit16/615/228/224/2233/127
Transliteration-4B,MLX 6-bit40/6119/2222/2215/2296/127

前两行是可安装产品候选的比较,不是纯架构实验:Qwen 使用 GGUF Q4_K_M,Gemma 使用 MLX QAT 4-bit。第三行记录当前选择的 Qwen 模型。由于训练、量化和运行后端同时发生变化,这张表不能把全部差异单独归因于微调,也不能证明训练后的 Qwen 总是优于训练后的 Gemma。

Exact match 也有意设置得很严格。一个可读的替代拼法,如果不在接受答案中,仍会判错。这套测试足以暴露具体问题,但规模还不足以代表所有场景的语言准确率。

分语言结果:Qwen 在四个测试切片中都更高

中文是 Swift 评测器中基础模型差异最明显的部分:未经微调的 Qwen 通过 33 条,Gemma 通过 16 条。Qwen 在日文、印地语和阿拉伯语测试中也更高。Transliteration-4B 在四个切片中均为最高,其中当前印地语测试为 22/22。

阿拉伯语仍是两个未经微调候选最弱的切片。Arabizi 中的方言词和借词可能有多种合理拼法,因此模型可能给出可以理解的阿拉伯语,却没有命中严格接受答案。Convert 的输出会直接替换文字,所以我们仍保留严格评分;但 6/22 和 4/22 需要逐条检查,不能扩展成广泛的阿拉伯语准确率结论。

当前冻结测试中的印度语言只有印地语。Gemma 公开的印度语言评测让它成为值得测试的候选,但对于当前产品目标,我们能确认的证据只来自这 22 条印地语测试,不能扩展成所有印度语言结论。

为什么 UnimeType 选择 Qwen 而不是 Gemma

我们选择 Qwen,是因为未经微调的 Qwen 在同一评测器中得到更高结果,而且完成训练后的 Qwen 模型在这次本地比较中得到最高结果:96/127。这些数字描述的是三个实际测试对象,不是只改变训练变量的受控实验。

Apache 2.0 也降低了公开衍生模型的分发复杂度。Gemma 使用 Gemma 使用条款,其中包含专门的通知和再分发要求。这个差异会影响打包和分发工作,但它不是语言能力结论。

Gemma 仍然是值得关注的候选,但我们还没有在匹配条件下训练 Gemma。因此,这次比较不能回答经过相近训练后,Gemma 是否能在满足相同运行和分发要求时缩小差距。

为什么 Phi-4-mini 没有进入第一轮测试

训练之前,我们先检查模型卡是否覆盖中文、日文、印地语和阿拉伯语。微软的 Phi-4-mini-instruct 模型卡把阿拉伯语、中文和日文列在支持语言中,但没有列出印地语,因此它在当前四语言版本中的优先级较低。这并不证明 Phi 的印地语表现差;我们还没有对它运行同一测试。

最终选择取决于三个结果:训练后的模型能否通过相同的 Convert 输入、保留受保护文字,并在目标本地环境中运行。

想实际运行最终选择的模型,可以阅读如何在 LM Studio 中运行 Transliteration-4B。模型大小的选择见1B、2B、4B 还是 27B,评分方法见我们如何评测多语言转写模型。产品支持的输入方式见输入语言

选择你的平台查看当前下载与测试选项。

查看下载下一篇: 不用翻译语料,如何构建日常转写训练数据