Skip to main content

即時語音辨識概述

即時語音辨識 API 允許您將音訊串流即時傳送到「聽有 AI」服務,並接收即時的辨識結果。這項功能特別適用於客服系統、會議記錄、即時字幕等需要低延遲回應的應用場景。

核心優勢

超低延遲

< 200ms 的回應時間,提供流暢的即時體驗

串流處理

支援連續音訊串流,無需等待完整音檔

中間結果

提供即時的中間辨識結果,提升使用者體驗

自動斷句

智能偵測語音停頓,自動分段處理

WebSocket 連線

即時語音辨識使用 WebSocket 協定進行雙向通訊:

連線端點

連線參數

基本連線範例

使用 SDK 進行即時辨識

Node.js SDK

發送音訊資料

進階配置

完整配置選項

語音活動偵測

自動偵測語音開始和結束:

結果處理

結果格式

處理不同類型的結果

實際應用範例

1. 即時會議記錄

3. 即時字幕系統

效能優化

音訊緩衝管理

連線重連機制

錯誤處理

常見錯誤類型

最佳實踐

1. 音訊品質

  • 使用 16kHz 採樣率以獲得最佳效果
  • 確保音訊為單聲道
  • 實作噪音抑制和回音消除

2. 網路優化

  • 實作連線重連機制
  • 監控網路延遲和丟包
  • 使用適當的緩衝區大小

3. 使用者體驗

  • 顯示連線狀態指示器
  • 提供中間結果預覽
  • 實作語音活動視覺化

4. 資源管理

  • 適時關閉不需要的串流
  • 監控記憶體使用量
  • 實作音訊資料壓縮

需要即時語音辨識技術支援?請聯絡我們:support@skiesoft.com