Product 03 · On-Premise

MosaScore地端通話品質分析

通話錄音一直都在,
只是沒有人有時間聽。

地端通話質檢與購買意圖分析。把過去只能抽查 1~3% 的客服與電銷錄音,變成每一通都被完整聽過、逐句轉成文字、標上情緒與意圖分數的可查資料——錄音、逐字稿、分析結果全程不離開貴單位的網路。

通話分析 01:02
ASR
EMO
LLM
00:03
客服
您好,這裡是保健諮詢中心,想跟您介紹這次的體驗組
00:11
客戶
喔……我現在沒有在吃這個啦
22
00:17
客服
了解,那想請問您平常晚上睡得還好嗎?
00:24
客戶
睡不太好,都嘛翻來翻去
41
00:33
客服
很多客人跟您狀況一樣,芝麻明這款是針對……
00:47
客戶
那這个一組是幾罐?
63
01:02
客戶
如果我要買的話,是貨到付款嗎?
84
購買傾向分數
84
詢問付款方式,命中最高級距錨點
現況說明

MosaScore 已可部署於標準 Linux GPU 伺服器(亦支援 Apple Silicon 單機展示),但尚未於客戶環境正式上線;購買傾向分數尚未經真實成交資料驗證。本頁不提供任何準確率數字——原因與我們的驗證做法寫在「關於分數的效度」

從抽查 1~3%
到全部聽過

人工品質檢核的覆蓋率受限於人力,實務上通常只能抽查個位數百分比。真正出問題的那一通、以及成交關鍵在哪一句的那一通,出現在樣本裡是機率問題。自動化分析改變的不是「聽得多仔細」,而是「聽了幾通」——這是覆蓋率的量級差異,不是效率的百分比改善。

人工抽查
1~3%
的通話被聽過
MosaScore
100%
逐句轉錄、標記與存證

現有核心功能

已可展示
以下皆為系統現已具備、可當場操作的能力。
01
雙軌分離,客戶與客服各自成篇

雙聲道錄音兩軌各自獨立斷句,語者標籤天然 100% 正確——這是混音檔做不到的。可在畫面上指定客戶在左或右聲道,錄音反了不必重剪。

02
為臺灣客服情境調校的辨識

品牌名、產品名與專業術語作為熱詞提示辨識引擎。實測可把「體驗只」修正為「體驗組」、「吃麻明」修正為「芝麻明」——這類錯誤事後文字校正救不回來,只能在辨識階段解決。

03
十道文本後處理防護網

簡轉繁、幻覺過濾、跳針消除、贅字過濾、標點正規化、中文數字轉阿拉伯數字、同音錯字替換與拼音相似度模糊比對,逐層清洗辨識輸出。

04
每個產業一份領域字典

熱詞、同音字對照、量詞校正與情境規則集中於一份設定檔,新增一個客戶就是新增一份字典,不需要改任何程式碼。已內建保健食品、醫療、科技等情境。

05
逐句情緒與購買傾向分數

本地大型語言模型結合逐字稿、對話脈絡與聲學情緒,在客戶每說完一句話時輸出情緒、意圖、0–100 分數與變動原因。評分有五段級距錨點與範例句校準;分數僅隨客戶發言波動,不被客服話術干擾。

06
每一句都能當場核對

逐句音訊回放、逐軌 SRT 字幕輸出、完整分析記錄落地存檔,畫面上的狀態燈直接顯示目前實際載入的引擎——不會發生「以為在跑真實模型、其實跑的是示範資料」。

07

完全地端,且真的可以離線展示

辨識、情緒、評分三個模型全部在貴單位的伺服器上執行,不呼叫任何雲端服務。同一套系統可跑在 Linux GPU 機房主機,也可裝進一台 Apple Silicon 筆電帶去現場。前端也移除了所有外部資源依賴(圖表函式庫內嵌、字型改用系統原生),因此在完全沒有網路的會議室裡也能完整展示,包含折線圖。也因為沒有按次計費的 API,錄音量再大都不增加費用。

關於分數的效度

把話講清楚
目前這套系統證明的是「流程跑得通」,還沒有證明「分數預測得準」
現況
系統確實能穩定產出逐句分數,且分數會依語氣與用詞落在合理的級距上
但要證明「分數高的客戶真的比較會成交」,需要的是該通電話實際有沒有成交的資料——這份資料在貴單位的訂單系統裡,不在我們手上
因此我們不提供任何準確率數字。市面上任何未說明樣本來源與標籤定義的準確率宣稱,都應該被追問這兩件事
我們的做法:把驗證變成導入的第一階段

以貴單位自己的歷史錄音與真實成交結果做一次封閉驗證,產出方法論明確、可重現的評測報告——包含分數的排序能力、校準程度,以及提前量(系統平均在通話進行到幾成時就穩定判斷正確)。

這份報告的結論若是正面的,它比任何行銷數字都有說服力;若是負面的,貴單位也在投入前就知道了。

即使不看分數,這套系統仍有明確價值:全量的逐字稿、逐句情緒標記、可回放的證據鏈——這些是確定性的產出,不依賴任何預測是否準確。規劃中的法遵稽核記分卡走的正是這條不依賴預測效度的路線。

每一個預設值都有實測依據

含被推翻的假設

多數設計決定都來自實測後的修正,而非規格書上的想像。一套質檢系統的可信度,來自於它自己的開發過程也經得起質檢。

決定
依據
更換預設辨識引擎
短句延遲從約 2.5 秒降至約 0.5 秒,且領域術語辨識更準
淘汰另一個更快的引擎
它快一倍,但會產出「看起來像人話」的錯誤逐字稿——那比明顯的亂碼更危險
關閉模型的推理模式
生成的推理內容程式根本不會讀取,卻讓單次評分從數秒暴增至一百秒以上
不讓 AI 重寫逐字稿
實測它修好 1 個錯字,卻在另外 2 句出現多改字與刪除尾句
客服回合預設不評分
實測 6 通電話中,61% 的評分運算花在前端根本不顯示的內容上

與雲端通話分析服務的差異

我們不主張 MosaScore 適合所有人。若貴單位對錄音外流沒有顧慮、也沒有法規限制,雲端訂閱服務的導入門檻確實更低,功能完整度目前也領先。MosaScore 是為不能把錄音交出去、且需要針對自己的領域用語調整的單位而設計的。

雲端通話分析服務
MosaScore
錄音與逐字稿位置
上傳至服務商伺服器
完全留在貴單位機房
封閉網路可否使用
不可,必須連外
可,不需連外
計費方式
按時數或通話量訂閱
一次建置,無按次 API 費用
領域用語可否調整
多為共用通用模型
每個客戶一份專屬字典
判讀可否逐句核對
視服務商而定
逐句回放 + 逐軌字幕 + 完整記錄
供應鏈來源要求
難以掌握服務商的模型來源
可依採購規範指定模型來源
導入成本
低,開帳號即用
需伺服器與建置,可提供硬體與到場安裝
成熟度
商業服務,功能完整
核心分析流程已完備,企業管理功能見「即將推出」

適用場景

有大量通話錄音、且因法規或內部規範無法使用雲端分析服務的單位。
保健食品與消費品電話行銷
成效分析、話術對照、廣告用語的合規檢核。現有情境已完整調校。
金融與保險電話招攬
本來就被要求全程錄音並長期保存,法遵稽核的需求最明確。
客服中心品質檢核
從抽查改為全量,同時成為客訴預防與教育訓練素材的來源。
醫療與長照諮詢專線
資料全程留在院內伺服器,且需要明確的回答邊界檢核。
需另行評估

B2B 銷售:成交週期以月計,單通電話的「購買機率」框架不適用,需重新定義評分維度。

即將推出

開發規劃中

系統本身已可部署於客戶機房的 Linux GPU 伺服器,下一階段聚焦在把它變成完整的產品。以下項目尚未可交付。

法遵稽核記分卡

以規則檢核每一通電話有沒有講到該講的、有沒有踩到不該講的——七日解除權告知、誇大療效用語、必說事項與禁語清單,命中時附上逐字稿位置與可回放的音訊片段作為證據。對於本來就被強制全程錄音的產業,這是可稽核的證據鏈與抽樣僥倖之間的差別。

單聲道/混音錄音支援
導入語者分離技術,讓一般錄音系統輸出的混音檔也能使用
批次全量質檢
歷史錄音一次性大批回填,含佇列管理、進度回報與彙總報表
企業帳號、權限與稽核
單一登入、分層權限,以及「誰在何時聽了哪一通客戶錄音」的完整存取軌跡
敏感資料自動遮罩
姓名、電話、地址、付款資訊自動偵測並遮罩,提供遮罩與原始兩種檢視
分數的事件錨點

把曲線的轉折點錨定到具體語句——「這通是在報價那一句崩掉的」——並統計跨通話的常見流失原因

客服端的話術與專業度評分

以可稽核的客觀行為為依據(必說事項、禁語、靜音與插話等),而非對員工進行情緒推斷

台語辨識能力
臺灣電銷現場國台語夾雜是常態;團隊已有在生產環境服役的國台語模型,將評估導入
主管監控牆與即時警示
分數跌破門檻或命中禁語時主動通知
通話中的即時話術輔助長期方向

從「事後告訴主管客戶想不想買」到「當下告訴業務該說什麼」,需要與現行不同的串流架構

一條我們主動劃下的界線

對客服人員的評分屬於勞動監控,其中又以「情緒推斷」的爭議最大(歐盟已將工作場所的情緒推斷列為禁止用途)。我們的產品原則是:情緒推斷只用於客戶端;對客服的評分以可稽核的客觀行為為準,且不作為員工考核的單一依據。這條線我們在設計階段就劃好,不等客戶問起才補。

標準開放技術,不被綁定

系統建構於開源模型與標準相容介面,模型可依需求抽換升級。若貴單位(尤其是政府機關與金融業)需要符合非紅色供應鏈規範的模型組合,我們可依規範評估並替換為其他來源的開放權重模型後重新驗證品質。

系統需求

摘要
機房部署
單機展示
伺服器
Ubuntu Linux x86_64 + NVIDIA GPU

Apple Silicon M 系列,統一記憶體 16GB 以上,建議 24GB

使用者端
任何現代瀏覽器,無需安裝軟體
同左
網路
內網即可完整運作
模型權重首次下載需連外,之後快取於本機;分析全程可離線
音檔格式
雙聲道 .mp3 / .wav(單聲道/混音支援見「即將推出」)
同左

關於處理速度:目前每一句發言都完整執行一次辨識、情緒與評分推理,因此長通話的處理時間會超過音檔本身長度。這對批次質檢沒有影響(掃描是背景作業),但通話中的即時輔助需要不同的架構。實際處理量與硬體配置建議,依貴單位的通話量評估後提供。

客製化導入與維運服務

導入
效度驗證作為導入第一階段

以貴單位自己的錄音與真實成交結果做封閉驗證,產出方法論明確、可重現的評測報告,作為採購與技術審查的技術佐證——在擴大投入之前,先確認它對貴單位有效。

領域字典建置
協助整理品牌名、產品名、常見同音錯字與量詞習慣——這是辨識品質的關鍵資產
稽核規則設計
依貴單位的話術規範與適用法規,訂出必說事項、禁語與檢核順序
產業合規調整
依金融、保險、醫療的法規與內控要求,客製存取控制、稽核紀錄與保存機制
地端主機供應與安裝
可提供完整主機硬體,經測試驗證後協助完成安裝部署
系統維護與版本更新
模型升級與效能調校由團隊持續維護,貴單位不需自建 AI/MLOps 團隊

常見問題

FAQ

還在開發規劃中的功能,答案裡會直說。

通話品質分析可以做到什麼程度?

把過去只能抽查 1~3% 的客服與電銷錄音,變成每一通都被完整聽過、逐句轉成文字、標上情緒與 0–100 購買傾向分數的可查資料,而且每一次分數變動都附上原因。

這個分數準嗎?

分數尚未經真實成交資料驗證,我們不提供準確率數字。效度驗證是導入的第一階段——用貴單位自己的錄音與實際成交結果驗證一次,再談後續。

錄音需要上傳到雲端嗎?

不需要。系統部署在貴單位的 Linux GPU 機房主機上,錄音與逐字稿不離開機房——地端部署的完整說明在這裡

跟主管人工抽查差在哪?

抽查看到的是樣本,這裡是母體。而且每個判讀都能當場核對:逐句回放加上逐軌字幕,雙軌分離讓語者標籤天然正確,不需要靠演算法猜是誰在講話。

每個產業的用語不同,需要改程式嗎?

不需要。每個產業一份領域字典,換字典即可,不動程式。

先用你自己的錄音與成交結果,驗證一次。

導入的第一階段就是效度驗證:以貴單位的歷史通話與真實成交資料做一次封閉評測,報告的結論若是負面的,貴單位也在投入前就知道了。