臺灣本土語言台語、客語六腔與原住民族語的語音辨識與語音合成
調一調就能聽懂的。
臺灣的本土語言不是一個模型就能涵蓋的題目。我們的語音辨識模型採全自主架構訓練,不是調整市面通用模型的參數——這是能不能真的聽懂客語詔安腔或某一族族語的差別。
四縣、海陸、大埔、饒平、詔安、南四縣
涵蓋 16 族
一律轉為繁體中文
族群與語言數依原住民族委員會的族語分類,客語腔調依客家委員會的六腔分類——兩者都可以逐項查證。
哪個產品支援哪些語言
兩個產品的語言範圍不一樣,而且辨識與合成也不是同一件事。這張表把還沒推出的部分也標出來。
會議轉錄的五種語言一律轉為繁體中文逐字稿,並自動標點分段。標示為開發規劃中的項目不是現有可交付功能。
客語:六腔全數涵蓋
客語不是一種腔調。六腔之間的差異大到「用四縣腔訓練的模型去聽詔安腔」這件事並不成立,所以涵蓋幾腔是個要逐項確認的問題,不是一句「支援客語」可以帶過的。
這件事可以查證
客語的語音辨識與語音合成模型由本團隊研發,公開展示於 Gohakka —— 該平台的版權宣言載明「客語語音合成、語音識別技術由牧仁資訊研發」。你不需要相信我們自己說的,去那裡看就知道。
Gohakka 平台的機器翻譯與語言模型由平台方瞬息科技提供,不是我們的部分。客語的語料屬於客家委員會,其中一部分的整理工作由本團隊承擔。
台語:國台語夾雜才是真實情況
臺灣的會議與客服現場很少有人整段講純台語。實際的樣子是一句國語一句台語,中間夾幾個英文詞。針對「純台語音檔」調出來的模型,遇到這種講法就會掉。
原住民族語:16 族、42 種語言
42 種語言的語音辨識、語音合成與機器翻譯模型由本團隊研發,與意傳科技長期合作,落地於原住民族語言研究發展基金會的族語 AI 系統。語料屬於原住民族委員會,其中一部分的整理工作由本團隊承擔。模型公開於 Hugging Face,任何人都可以下載檢驗。
憑什麼相信這些
本土語言的能力很難從產品畫面上看出來,所以這裡列的是可以逐項查證的東西:競賽名次、同儕審查發表、以及公開下載得到的模型。
本土語言競賽名次
相關的同儕審查發表
我們的立場是:行銷數字沒有意義,可重現的數字才有。字元錯誤率、競品對照、測試方法論與原始音檔,將以符合學術規範的方式完整公開,並可依貴單位指定的公開基準或自備音檔另行評測。
常見問題
拿一段真正難聽懂的錄音給我們。
口音重、國台語夾雜、收音環境差的那一段最有參考價值。我們會提供方法論明確、可重現的評測報告,作為採購與技術審查的佐證。