On-Premise Voice AI

聽得懂臺灣的語音 AI,
跑在你自己的機房裡。

國語、台語、客語、原住民族語、英語,全部轉為繁體中文。語音辨識、語者分離、對話生成、語音合成——所有模型運行在貴單位自有的伺服器上,不呼叫任何雲端 AI 服務。

封閉網路可運行無按次 API 費用模型自行訓練
國台語夾雜
客語
英語
Sample
S1
彼个案子的預算,咱敢有確定落來?
S2
上禮拜董事會通過了,我等一下把會議紀錄寄給你。
S1
好,數字若有 update 你直接 tag 我就好。
S2
沒問題,摘要跟待辦我一起附上去。
0:17
示意畫面 · 實際語音樣本即將上線

三項產品,同一個原則

On-Premise

一個負責「即時對話」,一個負責「事後記錄」,一個負責「把錄音變成可查的資料」。三者都在你的機房裡跑完整條流程。

MosaTalk

即時語音 AI 對話系統
01

客戶打開網頁按下通話、或直撥既有客服專線,就能和 AI 自然對談——聽得懂臺灣口音、答得出你的業務問題,說完話到 AI 開口約一秒,而且可以隨時插話。

01網頁免安裝即通話,也可接入既有電話系統
02問答格式文件即可換知識庫,不需寫程式
03一段參考錄音即可複製專屬品牌聲音
04資料未涵蓋時不編造,引導留下聯絡方式
了解 MosaTalk

MosaMinutes

地端 AI 會議記錄平台
02

錄音或上傳檔案,系統自動產出逐字稿、分辨誰在說話、寫出摘要與待辦,並讓你在同一個畫面裡邊聽邊改到能直接發出去。

01五種語言全轉繁體中文,自動標點分段
02聲紋註冊一次,之後自動認出同一個人
03校對不會弄丟修改——四條獨立通道互不覆蓋
04匯出 Word、純文字、字幕,待辦成勾選清單
了解 MosaMinutes

MosaScore

效度驗證中
地端通話質檢與購買意圖分析
03

把過去只能抽查 1~3% 的客服與電銷錄音,變成每一通都被完整聽過、逐句轉成文字、標上情緒與意圖分數的可查資料。

了解 MosaScore
01雙軌分離,語者標籤天然 100% 正確
02每個產業一份領域字典,不需要改程式
03逐句情緒與 0–100 購買傾向分數,附變動原因
04逐句回放 + 逐軌字幕,每個判讀都能當場核對
可部署於 Linux GPU 機房主機;分數尚未經真實成交資料驗證,我們不提供準確率數字——驗證是導入的第一階段。

技術實力

Single GPU
≈1s
使用者說完話,到 AI 開口回答
10
單台 NVIDIA DGX Spark GB10 即時轉錄線數
5
產品內建支援語言,一律轉繁體中文;族語與客語的完整涵蓋見研究網絡
1
張 GPU 跑完整系統,含辨識與摘要

可重現的評測報告

即將公開

我們的立場是:行銷數字沒有意義,可重現的數字才有。字元錯誤率、競品對照、測試方法論與原始音檔,將以符合學術規範的方式完整公開,並可依貴單位指定的公開基準或自備音檔另行評測。

CER 對照表
競品比較
方法論說明
原始音檔下載

為什麼一定要地端

資料不出網

臺灣已經有能處理台語的語音服務,但它們全是雲端形態。能把臺灣的語言做好、又能整套跑在你自己機房裡的,這才是我們的位置。更完整的說明見地端 AI

雲端會議/語音服務
Voxmosa
錄音與逐字稿存放位置
上傳至服務商伺服器
完全留在貴單位機房
封閉網路可否使用
不可,必須連外
可,不需連外
台語/客語/族語
本土服務有,但皆為雲端
支援,且在地端執行
計費方式
按人數或時數訂閱,用越多越貴
一次建置,無按次 API 費用
模型可否為貴單位調整
不可,共用通用模型
可,模型由團隊自行訓練
供應鏈來源要求
難以掌握服務商的模型來源
可依採購規範指定模型來源
導入成本
低,開帳號即用
需伺服器與建置,我們可供應硬體並到場安裝

我們不追求適用於所有場景,而是專注於滿足最高規格的資安需求。對於沒有數據合規壓力或資安顧慮的單位,雲端訂閱服務無疑是更為經濟彈性的選擇。但若您的會議內容與核心數據絕不能離廠,我們便是為此而設計的私有化解決方案——這是一項專為資安合規所做的明確定位,而非盲目的全面優勢。

產業情境與合規

Compliance

對這些單位而言,情境就是合規。我們依產業的實際法規與內控要求,客製化存取控制、稽核紀錄與資料保存機制,而不是套用單一制式方案。

政府機關

公務會議、公聽會、委員會記錄。地端運行同時滿足資安規範與資料落地要求。
公文格式匯出 · 非紅供應鏈

金融業

董事會、法遵與風控會議,以及商品諮詢類的高重複性問答。
內控 · 稽核軌跡

醫療機構

院內會議、個案討論、衛教與掛號諮詢,資料全程留在院內伺服器。
病歷個資 · 敏感欄位遮罩

法律事務所

當事人會談、案件討論。保密義務使地端架構成為必要條件而非選項。
保密義務 · 記錄證據性

長照與教育研究

家屬諮詢、服務說明、訪談與教學記錄,以及地方語言的語音資料保存。
族語保存 · 訪談逐字稿

一般企業

例會、專案進度、客戶會議、客服專線分流——重視內容不外流的任何單位。
SSO · 保留期限設定
OIDC 單一登入
分層權限
稽核日誌
結果保留期限
容器化部署
封閉網路友善
非紅色供應鏈可調
重複請求保護

發展路線

開發規劃中

以下項目仍在開發規劃中,非現有可交付功能。我們選擇公開,因為方向本身就是說明我們在想什麼。

MosaTalk

從「答得正確」到「應對得體」
台語、客語雙聲道
辨識已聽得懂台語,合成即將推出
電話線路直接接入
客戶直撥市話或手機,成為 AI 客服專線
真人客服無痛轉接
自動轉接並同步交接對話摘要
聽得懂對自己的要求
「講慢一點」「用台語說」當場照辦並記住
從回答到完成任務
直接呼叫業務系統 API,把事情辦完
通話分析儀表板
熱門問題、知識缺口、情緒事件記錄

MosaMinutes

讓會議紀錄自己走到該去的地方
紀錄自動送達
Email、Teams/Mattermost/LINE、Webhook
敏感資料自動遮罩
遮罩/原始雙檢視,並記錄誰看過原文
專有名詞對照表
人名、單位、產品與術語自動修正
線上會議直接擷取
不派機器人,直接擷取電腦上的會議音訊
公文格式匯出
案由、決議、列席人員、承辦單位
跨會議語意搜尋
地端知識庫問答,附出處會議與時間點

團隊與研究

Research-led

核心研發團隊具有深厚的學術與開源社群血統,長期專注於臺灣多語言(台語、客語、族語、中英混合等)語音辨識技術。

團隊主導之開源語音專案 FormoSpeech(公開於 Hugging Face)已累積豐富的社群調用與技術驗證實績。我們的語音辨識模型採全自主架構訓練,非僅調整市面通用模型之參數——這代表我們能針對貴單位的特定領域用語、特殊收音環境與專業聲學情境進行深度客製與持續優化,是採用標準通用雲端 API 所無法達到的精準度與資料安全性。

研究筆記

籌備中

技術文章、評測方法論、臺灣語音資料的觀察。這一區會是我們把「學術精神」講清楚的地方。

即將發布
如何公正評測台語語音辨識
即將發布
單張 GPU 上的三模型顯存配置
即將發布
為什麼會議校對不該用「後蓋前」

研究網絡

Research Network

臺灣的本土語言不是一個模型就能涵蓋的題目。族語的語音辨識、語音合成與機器翻譯模型,以及客語的語音辨識與語音合成模型,都由本團隊研發;兩者的語料整理也有一部分由本團隊承擔,透過長期合作的單位落地與公開。

原住民族語

16 族 · 42 語

16 族、42 種語言的語音辨識、語音合成與機器翻譯模型由本團隊研發,與意傳科技長期合作,落地於原住民族語言研究發展基金會的族語 AI 系統。模型公開於 Hugging Face,任何人都可以下載檢驗。

客語

六腔

客語四縣、海陸、大埔、饒平、詔安、南四縣六腔全數涵蓋的語音辨識與語音合成,由本團隊研發,公開展示於 Gohakka —— 該平台的版權宣言載明「客語語音合成、語音識別技術由牧仁資訊研發」。

族群與語言數依原住民族委員會的族語分類,客語腔調依客家委員會的六腔分類——兩者都可以逐項查證。各語言的完整涵蓋範圍見臺灣本土語言

獲獎與榮譽

Awards
2025
技術類最佳論文獎
O-COCOSDA 2025,印尼日惹
2022
臺灣客語語音辨識競賽 FSR 2022 一般組第一名
Formosa Speech Recognition Challenge
2020
臺灣台語語音辨識競賽 FSR 2020 產業組第一名
Formosa Speech Recognition Challenge
2018
國語語音辨識競賽 FSR 2018 產業組第二名
Formosa Speech Recognition Challenge
2008
最佳學生論文獎
ISCSLP 2008,中國昆明

研究發表

Publications

核心團隊成員與語音相關之同儕審查發表,涵蓋 Interspeech、ICASSP、IEEE ASRU、SLT、TASLP 等領域主要會議與期刊。這裡列出的是與語音技術直接相關的部分。

2020
O-COCOSDA

Using Taigi dramas with Mandarin Chinese subtitles to improve Taigi speech recognition

2021
CSRC

The Academia Sinica system for the SLT 2021 children speech recognition challenge

2020
CHiME

The Academia Sinica systems of speech recognition and speaker diarization for the CHiME-6 challenge

2019
Interspeech

Exploring the encoder layers of discriminative autoencoders for LVCSR

2017
Interspeech

Discriminative autoencoders for acoustic modeling

2009
IEEE ASRU

Generalized likelihood ratio discriminant analysis

2007
IEEE ASRU

Training data selection for improving discriminative training of acoustic models

2017
IJCLCLP

A replay spoofing detection system based on discriminative autoencoders

2017
ICASSP

Discriminative autoencoders for speaker verification

2017
ROCLING

Speaker diarization based on i-vector PLDA scoring and using GMM-HMM forced alignment

2014
Interspeech

Clustering-based i-vector formulation for speaker recognition

2014
ICASSP

Speaker verification using kernel-based binary classifiers with binary operation derived features

2013
ICASSP

Subspace-based phonotactic language recognition using multivariate dynamic linear models

2012
Interspeech

Subspace-based feature representation and learning for language recognition

2019
O-COCOSDA

Mandarin mispronunciation detection and diagnosis feedback using articulatory attributes based multi-task learning

2019
APSIPA ASC

Multi-task learning for acoustic modeling using articulatory attributes

2016
Interspeech

Minimization of regression and ranking losses with shallow neural networks on automatic sincerity evaluation

2014
Interspeech

Ensemble of machine learning algorithms for cognitive and physical speaker load detection

常見問題

FAQ

採購與技術審查時最常被問到的幾件事。答案裡沒有我們還沒驗證過的數字。

AI 語音會議記錄可以完全在自己的機房裡跑嗎?

可以,而且這是 MosaMinutes 的預設形態,不是附加選項。錄音、逐字稿、語者分離、摘要與待辦全部在貴單位自己的伺服器上完成,不呼叫任何雲端 AI 服務。系統為容器化部署、單機即可運行,封閉網路不需連外也能使用。

地端的 AI 語音客服,聽得懂臺灣的口音和台語嗎?

MosaTalk 支援國語、台語與英語,國台語夾雜的對話也在設計範圍內。客戶可以在網頁上按下通話,也可以直撥貴單位既有的客服專線,經電話系統商介接後由 AI 接聽。客語與原住民族語目前涵蓋在 MosaMinutes 的會議轉錄,尚未進入語音客服。

一套地端語音 AI 要準備什麼硬體?

一張大顯存的 NVIDIA GPU 就能跑完整系統,含辨識與摘要。MosaMinutes 以一台 NVIDIA DGX Spark GB10 可支援 10 線即時轉錄,離線上傳走批次佇列、不受線數限制;MosaTalk 已在 46 GB 顯存的單卡環境驗證過。需求超出單機容量時可以擴充為多機配置。硬體我們可以一併供應並到場安裝。

AI 語音客服的回應有多快?

使用者說完話到 AI 開口回答約一秒,而且可以隨時插話打斷。

語音辨識的準確率是多少?

這一題我們不給行銷數字。字元錯誤率、競品對照、測試方法論與原始音檔,將以符合學術規範的方式完整公開,並可依貴單位指定的公開基準或自備音檔另行評測。在那之前,對貴單位最有意義的數字,是拿自己的錄音做一次概念驗證測出來的那一個。

跟雲端的語音會議或客服服務差在哪?

最直接的差別是錄音與逐字稿的存放位置:雲端服務會上傳到服務商的伺服器,我們的方案完全留在貴單位機房,封閉網路可用,也沒有按次的 API 費用。但我們不主張全面優勢 —— 沒有數據合規壓力或資安顧慮的單位,雲端訂閱通常是更經濟彈性的選擇。

支援哪些臺灣本土語言?

MosaMinutes 的會議轉錄內建國語、台語、客語、原住民族語與英語五種語言,一律轉為繁體中文。原住民族語為 16 族、42 種語言,客語為四縣、海陸、大埔、饒平、詔安、南四縣六腔全數涵蓋,辨識與合成模型都由本團隊研發、公開於 Hugging Face。MosaTalk 的即時語音對話目前為國語、台語與英語。

導入要怎麼開始?

用貴單位實際的會議錄音或客服對話做一次概念驗證,我們會提供方法論明確、可重現的評測報告,作為採購與技術審查的佐證。來信後兩個工作日內回覆。

先用你自己的音檔
驗證一次,再談導入。

我們可以用貴單位實際的會議錄音或客服對話做一次概念驗證,並提供方法論明確、可重現的評測報告,作為採購與技術審查的佐證。

hazel@voxmosa.com voxmosa.com
申請 PoC
兩個工作日內回覆
單位名稱
例:某某銀行
聯絡人
姓名
Email
you@example.com
需求類型
概念驗證
技術簡報
投資洽談
應徵
想解決的問題
例:每週十場委員會議,逐字稿外包成本過高,且不能上雲。
送出申請