拼音、Romaji、Hinglish 和 Arabizi 不是同一种任务

中文、日文、印地语和阿拉伯语都能从拉丁字母开始,但它们的歧义、混写方式、方言和目标文字完全不同。

UUnimeType · 2 分钟阅读

拼音、Romaji、Hinglish 和 Arabizi 都会用拉丁字符书写原本不用拉丁文字的语言。外表相似,却不代表任务相同。多语言 Convert 模型在四种语言里面对的是四套不同的判断。

拼音很短,而且歧义很高

没有声调时,shi 这样的短输入可能对应许多汉字。上下文决定用户说的是时间、人物、事实,还是别的意思。长短语可以减少歧义,但中英文混写又带来新的边界:mingtian sync yixia 里的 sync 不应该被改成中文。

Romaji 要跨越几种日文书写系统

日文输出可能需要汉字、平假名、片假名,或者三者混合。模型不只是在把读音换成字符,还要根据上下文选择常用词形和助词。人名与英文技术词也可能需要继续保留拉丁字符。

Hinglish 是语言混写,不是一套固定罗马化标准

很多印地语消息会自然混入英文。同一个印地语读音可能有几种拉丁字母拼法,而用户可能只想把印地语部分变成天城文。因此,“哪些词不改”是核心判断,不是最后补上的规则。

Arabizi 还包含方言和聊天数字

用拉丁字符写阿拉伯语时,不同地区和社群的写法差别很大。237 等数字可能代表阿拉伯语音,周围词汇又可能来自方言。短元音经常省略,同一条口语消息也可能存在多种合理的阿拉伯语拼法。

这会让严格完全匹配特别苛刻:模型可能输出了能看懂的阿拉伯语,拼写却与预期答案不同。因此,评测既要记录能否直接替换,也要记录剩余分歧属于哪一类。

一个模型仍然需要四个独立语言切片

总分会掩盖某一种语言的薄弱处。因此,我们分别保留中文、日文、印地语和阿拉伯语的结果,还会检查英文、人名、代码、链接、标点、多行文字和已经完成转换的对照输入。

下一篇会回答这个任务需要 1B、2B、4B,还是 27B 参数。产品支持的输入行为见输入语言

选择你的平台查看当前下载与测试选项。

查看下载下一篇: 怎样用英文键盘输入印地语:3 种方法