在大应用里学小语种的人,评论区里常常反映同一件事:内容读起来像机器翻译,或者教的语法和词汇本身就是错的。这些评论大多是针对别的语言,我们也不是在说某一门具体的乌兹别克语课程。但对任何小语种来说,这种风险都是真实存在的,而乌兹别克语又有几个特点,让不用心的文本连新手都能看出来。
Uzbekcha 是我们自己做的产品,目前尚未上线,只在文末提到一次。
要点
- 检验乌兹别克语,不需要你会乌兹别克语。文字、拼写、后缀变化和词序,都可以按规则来检查。
- 最快的几项检查:拉丁字母课程里没有西里尔字母,oʻ 和 gʻ 没有和 o、g 混淆,动词在句尾。
- 出一次错说明不了什么,用心做的产品也会出错。反复出现的规律,说明文本没有母语者校对过。
- 拿不准的时候,找第二个来源对比,或者直接问一个人。
为什么小语种风险更高
一款提供几十种语言的应用,通常是把课程写一遍,然后套用到每种语言上。大语种有很多编辑,也有很多用户会反馈错误。小语种的翻译可能是自动生成的,或者做得比较仓促,错误可能留存好几年,因为很少有学习者懂得足够多、能发现问题。乌兹别克语还多了两重难度:它在不久前才换过文字,而且大部分语法都藏在后缀里,机器翻译处理这个特别容易出错。
检查清单
1. 只用一种文字
拉丁字母是官方文字。一门教拉丁字母的课程,不应该出现西里尔字母,除非明确标注为参考。拉丁字母单词里混进西里尔字母,或者整行都是没有说明的西里尔字母,说明文本是从不同来源拼凑出来的。
2. oʻ 和 gʻ 这两个字母
Oʻ 和 gʻ 是独立的字母,不是 o 和 g 加了装饰。Ot 是马,oʻt 是火或者草。这门语言叫 oʻzbek,不是「ozbek」。如果课程漏掉了这个标记,教的就是不同的词。
按规范,这个标记是一个修饰字母(ʻ),而 san’at(艺术)、ma’no(意思)这类词里的 tutuq belgisi 是右单引号(’)。日常打字时两者都会变成一个直的撇号(o'、g'),大家也都能应付。所以单独一个直撇号本身不算错误。在教学产品里要看的是一致性:同一屏上出现三种不同的标记,或者标记时有时无,说明这些文本没有人校对过。
3. 土耳其语或哈萨克语的形式
乌兹别克语和土耳其语、哈萨克语是亲属语言,而这两种语言的材料更容易找到,所以它们的形式有时会混进来。两个信号:
- 后缀跟着变元音。 标准乌兹别克语基本已经失去了元音和谐,所以每个后缀只有一种形式。复数永远是 -lar:kitoblar(书,复数)。如果复数在两种形式之间切换,像土耳其语的 -lar 和 -ler 那样,就不是标准乌兹别克语。
- 常用词里出现土耳其语的元音。 土耳其语的 a 在乌兹别克语里常常是 o:土耳其语 baş(头)对应乌兹别克语 bosh。字母 ö、ü、ş、ç、ı 是土耳其语的。乌兹别克语写的是 oʻ、u、sh 和 ch。
4. 后缀的音变
正确的乌兹别克语会根据前面的音调整某些形式。有两处很容易检查:
- -ga(去、向)在 k 后面变成 -ka,在 q 后面变成 -qa:Samarqandga,但要写 eshikka(去门那里)和 qishloqqa(去村里)。口语里说错了别人也听得懂,但书面教学材料应该写对。
- 数字后面名词保持单数,数字本身加 -ta:ikkita non(两个馕)。Ikki nonlar 是错的。
一门把后缀直接粘上去、不管这些音变的课程,很可能是生成出来的,而不是人写的。
5. 词序
动词放在最后。「我喝茶」是 Men choy ichaman,字面意思是「我 茶 喝」,这和中文「我把茶喝了」是类似的语序,动词同样跟在宾语后面。疑问词留在原来的位置,谓语或动词仍然在句尾:Metro bekati qayerda?(地铁站在哪里?)乌兹别克语句子如果逐字照搬英语的词序,说明是逐词翻译出来的。
6. 后缀的顺序
名词上后缀的顺序是固定的:词根、复数、领属、格。Kitob-lar-im-da 是「在我的书里」。任何别的顺序都是错的。
7. 音频
英语式的口音、重音落在第一个音节(RAH-mat 而不是 rah-MAT),或者把 x 读成「ks」,都说明这是为别的语言做的合成语音。完整的检查方法见为什么有些乌兹别克语音频听起来不对。
一次错误说明不了什么
任何来源都会偶尔出错,我们自己也不例外。页面上一处奇怪的拼写说明不了太多问题;好几节课里反复出现同样的规律,才说明问题。要看规律来判断一门课程,重要的内容都要拿第二个来源核实一下。
发现问题该怎么办
- 拿一本教材、一位私教或一位母语者做第二个来源核实一下。
- 如果应用支持反馈,就报告给开发者。
- 如果错误频繁出现,就别再从这个来源学拼写和语法了。
Uzbekcha 适合放在哪里
Uzbekcha 是我们在塔什干开发的一款乌兹别克语 AI 家教应用,目前还没有上线,只能加入候补名单。大语言模型单靠自己处理乌兹别克语的词形变化并不可靠,所以 Uzbekcha 生成的乌兹别克语要经过一个词法校验器,检查后缀顺序、后缀交界处的音变,以及拉丁字母书写的一致性,并且以经过核实的语法和词典资料为依据。