1B、2B、4B 还是 27B:转写模型应该选多大
为中文、日文、印地语和阿拉伯语本地转写选择模型大小,同时避免把参数量误当成任务准确率。

“Convert 需要多少参数”看起来像一个硬件问题,其实首先是产品问题:模型要改变哪些文字、必须保留哪些文字,以及结果能否在目标设备上快到适合打字时使用。
参数量只是这项决定的一个输入,不是准确率本身。
1B 是值得测试的最小候选,不是天然赢家
约 1B 参数的模型更容易控制文件大小和内存。风险在于容量:同一个模型要消除短拼音歧义、选择日文书写系统、处理 Hinglish 混写、理解 Arabizi,还要保留无关的拉丁字符片段。
这不等于 1B 一定失败。它只表示 1B 候选必须先通过同一套分语言测试和受保护片段测试,较小的文件才真正有价值。
2B 适合更窄的任务目标
2B 比 1B 有更多容量,同时仍明显小于 4B。如果以后使用较大的已训练模型提供示例,再把能力蒸馏到更小模型,2B 会是值得测试的目标。
但参数量不能替代结果。可观察的变量是:在未参与训练的中文、日文、印地语和阿拉伯语案例上,有多少输出被严格接受;随后还要测目标设备上的内存和延迟。
4B 是我们第一个可工作的平衡点
UnimeType 的第一个公开模型选择 4B 基座,因为它既能量化为桌面本地文件,也在任务微调后出现了明确提升。
在我们的 127 条冻结测试中,未经微调的 Qwen3.5-4B 基线有 27 条严格匹配;微调后的 6-bit 模型通过 LM Studio 得到 94 条。这个比较只说明同一项目测试下的一个基座和一个微调模型,不代表所有 4B 模型,也不是通用语言准确率。
27B 更适合教师或研究比较,不是默认 Convert 目标
27B 模型可能拥有更多通用能力,但模型文件和运行内存也会增加。Convert 并不需要大部分开放式聊天能力。只有当额外容量能解决足够多的失败案例时,设备成本才有意义。
对当前产品来说,27B 更适合作为对比或生成标签的候选,而不是第一个本地目标。这个建议的失败条件也很明确:如果较小模型在微调后仍无法达到接受输出和内容保护门槛,就重新讨论参数量。
最后需要三组测量
每一种大小都需要:
- 相同的 Convert 提示词和解码设置;
- 相同的保留语言与边缘案例测试集;
- 来自目标运行时和目标设备的文件大小、峰值内存与延迟。
完成这些测量之后,“更小”或“更大”才会成为产品结论。下一篇比较另一条轴:Qwen、Gemma 与其他小模型家族。评测方法见我们如何评测转写模型,动作边界见动作。
选择你的平台查看当前下载与测试选项。