Taiwan Languages

臺灣本土語言台語、客語六腔與原住民族語的語音辨識與語音合成

不是把中文模型
調一調就能聽懂的。

臺灣的本土語言不是一個模型就能涵蓋的題目。我們的語音辨識模型採全自主架構訓練,不是調整市面通用模型的參數——這是能不能真的聽懂客語詔安腔或某一族族語的差別。

Coverage
6
客語腔調全數涵蓋
四縣、海陸、大埔、饒平、詔安、南四縣
42
原住民族語言
涵蓋 16 族
5
會議轉錄內建語言
一律轉為繁體中文

族群與語言數依原住民族委員會的族語分類,客語腔調依客家委員會的六腔分類——兩者都可以逐項查證。

哪個產品支援哪些語言

Coverage

兩個產品的語言範圍不一樣,而且辨識與合成也不是同一件事。這張表把還沒推出的部分也標出來。

語言
會議轉錄 MosaMinutes
語音客服 MosaTalk
國語
支援
聽與說皆支援
台語
支援,國台語夾雜亦可
聽得懂;台語合成開發規劃中
客語(六腔)
支援
開發規劃中
原住民族語(16 族 42 語)
支援
尚未進入語音客服
英語
支援
聽與說皆支援

會議轉錄的五種語言一律轉為繁體中文逐字稿,並自動標點分段。標示為開發規劃中的項目不是現有可交付功能。

客語:六腔全數涵蓋

Hakka

客語不是一種腔調。六腔之間的差異大到「用四縣腔訓練的模型去聽詔安腔」這件事並不成立,所以涵蓋幾腔是個要逐項確認的問題,不是一句「支援客語」可以帶過的。

四縣腔
辨識 · 合成
海陸腔
辨識 · 合成
大埔腔
辨識 · 合成
饒平腔
辨識 · 合成
詔安腔
辨識 · 合成
南四縣腔
辨識 · 合成

這件事可以查證

客語的語音辨識與語音合成模型由本團隊研發,公開展示於 Gohakka —— 該平台的版權宣言載明「客語語音合成、語音識別技術由牧仁資訊研發」。你不需要相信我們自己說的,去那裡看就知道。

Gohakka 平台的機器翻譯與語言模型由平台方瞬息科技提供,不是我們的部分。客語的語料屬於客家委員會,其中一部分的整理工作由本團隊承擔。

台語:國台語夾雜才是真實情況

Taigi

臺灣的會議與客服現場很少有人整段講純台語。實際的樣子是一句國語一句台語,中間夾幾個英文詞。針對「純台語音檔」調出來的模型,遇到這種講法就會掉。

會議轉錄

台語與國台語夾雜的內容一律轉為繁體中文逐字稿,自動標點分段,並分辨誰在說話。

語音客服

辨識模型針對臺灣口音與台語最佳化,聽得懂客戶用台語講話。台語的語音合成還在開發規劃中,所以目前是聽得懂台語、以國語回答。

原住民族語:16 族、42 種語言

Formosan

42 種語言的語音辨識、語音合成與機器翻譯模型由本團隊研發,與意傳科技長期合作,落地於原住民族語言研究發展基金會的族語 AI 系統。語料屬於原住民族委員會,其中一部分的整理工作由本團隊承擔。模型公開於 Hugging Face,任何人都可以下載檢驗。

憑什麼相信這些

Evidence

本土語言的能力很難從產品畫面上看出來,所以這裡列的是可以逐項查證的東西:競賽名次、同儕審查發表、以及公開下載得到的模型。

本土語言競賽名次

2022
臺灣客語語音辨識競賽 FSR 2022 一般組第一名
2020
臺灣台語語音辨識競賽 FSR 2020 產業組第一名
2018
國語語音辨識競賽 FSR 2018 產業組第二名

相關的同儕審查發表

2026
低資源客語語音處理的方言感知與條件化方法(LREC)
2025
極低資源語言中資料量對辨識的影響(O-COCOSDA,技術類最佳論文獎)
2024
VoxHakka:多腔多語者的客語語音合成系統(O-COCOSDA)
2020
以台語劇集與中文字幕改善台語語音辨識(O-COCOSDA)
研究發表列表

我們的立場是:行銷數字沒有意義,可重現的數字才有。字元錯誤率、競品對照、測試方法論與原始音檔,將以符合學術規範的方式完整公開,並可依貴單位指定的公開基準或自備音檔另行評測。

常見問題

FAQ

台語錄音可以轉成文字嗎?

可以,而且國台語夾雜的錄音也可以。MosaMinutes 會把台語內容轉成繁體中文逐字稿、自動標點分段,並分辨誰在說話。整段處理都在貴單位自己的機器上完成。

客語逐字稿支援哪幾種腔?

四縣、海陸、大埔、饒平、詔安、南四縣,六腔全數涵蓋,辨識與合成都是。腔調分類依客家委員會的六腔分類,可以逐項查證。

原住民族語的逐字稿呢?

MosaMinutes 支援 16 族、42 種語言。這些模型由本團隊研發,與意傳科技長期合作,並公開在 Hugging Face 上讓任何人下載檢驗。語音客服目前還沒有族語。

跟直接用通用的語音辨識服務差在哪?

通用服務的本土語言能力通常是在既有模型上微調出來的,腔調與夾雜講法一多就會掉。我們的模型採全自主架構訓練,可以針對特定腔調、領域用語與收音環境做深度客製。另一個差別是部署形態:本土語言的錄音往往同時是最敏感的內容,而通用服務都在雲端。

辨識率有多少?

這一題我們不給行銷數字。本土語言的辨識率跟腔調、收音環境與夾雜程度高度相關,脫離測試集談一個百分比沒有意義。字元錯誤率、競品對照、測試方法論與原始音檔會完整公開;在那之前,最有意義的數字是拿貴單位自己的錄音實測出來的那一個。

拿一段真正難聽懂的錄音給我們。

口音重、國台語夾雜、收音環境差的那一段最有參考價值。我們會提供方法論明確、可重現的評測報告,作為採購與技術審查的佐證。

hazel@voxmosa.com 兩個工作日內回覆