On-Premises

地端語音 AI私有化部署的語音辨識、會議轉錄與語音客服

音檔不上傳,
逐字稿不離開你的機房。

語音辨識、語者分離、對話生成與語音合成,四個模型全部運行在貴單位自己的伺服器上,不呼叫任何雲端 AI 服務。容器化部署、單機即可運行,封閉網路不需連外也能使用。

Data Boundary
貴單位的機房
音檔 · 逐字稿 · 摘要 · 聲紋 · 領域字典 · 四個模型
邊界不需連外
外部網路
沒有任何一段音訊、逐字稿或提示詞送出去

MosaTalk 的邊緣分離模式另需一台小型雲端主機;單機模式僅需內網。

什麼情況下非地端不可

資料不出網

我們不追求適用於所有場景。沒有數據合規壓力或資安顧慮的單位,雲端訂閱通常是更經濟彈性的選擇。地端是為了下面這幾種情況而存在的。

內容本身就是機密

董事會決議、法遵討論、當事人會談、病歷個資。這些內容的價值不在於它有多長,而在於它絕不能離開單位。

網路本來就不通外面

封閉網路環境裡,任何需要連外的服務都不是選項。系統不需連外,所以在那裡跟在外面一樣可用。

採購規範要求指定來源

當採購文件對模型來源有要求時,雲端服務商的模型組成通常不在你掌握之中。地端可以依規範指定。

地端本身不是賣點,它是某些單位的前提。如果貴單位不在上面三種情況裡,我們會直接說雲端比較適合。

跟雲端語音服務差在哪

Cloud vs On-Prem

這張表只比跟語音有關的項目。通用的雲地比較網路上很多,這裡談的是音檔、逐字稿與聲紋這些東西實際存在哪裡。

雲端語音服務
地端 Voxmosa
音檔上傳到哪裡
服務商的伺服器
不上傳,留在原地
逐字稿與摘要存放位置
服務商的資料庫
貴單位的資料庫
聲紋與領域字典
通常無法帶走
存在貴單位,隨系統一起
封閉網路可否使用
不可,必須連外
可,不需連外
計費方式
按時數或人數,用越多越貴
一次建置,無按次 API 費用
模型可否為貴單位調整
不可,共用通用模型
可,模型由團隊自行訓練
導入成本
低,開帳號即用
需伺服器與建置,我們可供應硬體並到場安裝

一台機器跑得動嗎

Sizing

地端方案最常被問、也最少人願意寫清楚的一題。以下是我們實際驗證過的配置,不是估算值。

會議轉錄 MosaMinutes

DGX Spark GB10
10

一台 NVIDIA DGX Spark GB10(GB10 Grace Blackwell 超級晶片,128 GB 統一記憶體)可支援 10 線同時即時轉錄。離線上傳走批次佇列處理,不受線數限制。需求超出單機容量時可以規模化為多機配置。

語音客服 MosaTalk

單卡 46 GB 已驗證
1 張 GPU

Ubuntu Linux x86_64,一張大顯存的 NVIDIA GPU 即可跑完整條流程,已於 46 GB 顯存的單卡環境驗證。辨識、對話生成與語音合成三個模型共用同一張卡,使用者說完話到 AI 開口約一秒。

項目
會議轉錄
語音客服
作業系統
原廠 DGX OS(Ubuntu 基礎)
Ubuntu Linux x86_64
部署形態
容器化,單機即可運行
單機模式僅需內網
使用者端
任何現代瀏覽器,免安裝
支援 WebRTC 的瀏覽器,或市話直撥
硬體來源
可由我們供應並到場安裝
可由我們供應並到場安裝

實際併發量與硬體配置建議,我們會依貴單位的會議量與使用型態評估後提供。上面兩個數字是我們自己跑過的環境,不是型錄值。

部署之後的事

Operations

地端的難處不在裝起來,在於裝起來之後誰維護、怎麼符合內控、以及資料留多久。這些都在導入範圍內。

OIDC 單一登入
分層權限
稽核日誌
結果保留期限
容器化部署
封閉網路友善
非紅色供應鏈可調
重複請求保護

導入不只是交付軟體

場景客製化、產業合規調整、地端主機供應與到場安裝、系統維護與版本更新,以及合乎學術規範的評估測試報告。

合規是依單位調整,不是套模板

我們依產業的實際法規與內控要求,客製化存取控制、稽核紀錄與資料保存機制。政府、金融、醫療、法律事務所的要求並不相同。

常見問題

FAQ

還在開發規劃中的功能,答案裡會直說。

地端 AI 是什麼?跟私有雲、本地部署是同一件事嗎?

在臺灣的採購語境裡,地端、本地部署、私有化部署、內網部署講的通常是同一件事:模型與資料都放在貴單位自己掌控的機器上,而不是服務商的雲端。私有雲則是一個範圍更廣的說法,有時指自建機房,有時指租用的專屬雲端環境。我們的方案是前者——實體機器放在貴單位,不需連外。

封閉網路、完全不能連外的環境可以用嗎?

可以。系統是容器化部署、單機即可運行,不需要連外就能完成辨識、摘要與語音合成。MosaTalk 的邊緣分離模式是例外,那個模式另需一台小型雲端主機;單機模式則只需要內網。

地端一定比較貴嗎?

導入成本確實比較高——雲端開帳號就能用,地端需要伺服器與建置。差別在之後:雲端按人數或時數訂閱,用越多越貴;地端是一次建置,沒有按次的 API 費用。所以答案取決於用量與使用年限,而不是單看第一筆。我們可以依貴單位的實際會議量或通話量一起算。

模型可以為我們的專業術語調整嗎?

可以。我們的語音辨識模型是全自主架構訓練,不是調整市面通用模型的參數,所以能針對貴單位的特定領域用語、收音環境與聲學情境做深度客製。MosaScore 另外採用每個產業一份領域字典的做法,換字典即可,不需要改程式。

採購規範要求指定模型來源,做得到嗎?

可以依採購規範指定模型來源,供應鏈組成也可以配合調整。這是地端相對於雲端服務的結構性差別:雲端服務商的模型組成通常不在採購方的掌握之中。

辨識準確率有多少?

這一題我們不給行銷數字。字元錯誤率、競品對照、測試方法論與原始音檔,將以符合學術規範的方式完整公開,並可依貴單位指定的公開基準或自備音檔另行評測。在那之前,對貴單位最有意義的數字,是拿自己的錄音做一次概念驗證測出來的那一個。

先用你自己的音檔,在你自己的機器上驗證一次。

我們可以用貴單位實際的會議錄音或客服對話做一次概念驗證,並提供方法論明確、可重現的評測報告,作為採購與技術審查的佐證。

hazel@voxmosa.com 兩個工作日內回覆